v0.3.0
·
89 commits
to main
since this release
Immutable
release. Only release title and notes can be modified.
What's Changed
- fix(load): GGUFs with quantized MoE router gates failed to load by @asher in #33
- fix(apc): disk prompt-cache reuse works on every supported arch by @asher in #34
- perf(deepseek4): fused decode glue route, per-phase cb caps, dspark verify pack by @asher in #35
- fix(serve): short prompts prefilled under decode cb caps and could OOM the server by @asher in #36
- chore(deps): mlx-kquant floor 0.3.11 for moe prefill gather speedups, updated ds4 bench by @asher in #37
- fix(batch): deepseek-v4 serves concurrent requests (one-row prompt batches, CacheList promotion) by @asher in #38
- feat(serve): memory-headroom admission gate + GMLX_SERVE_MEMSTATS per-tick trace by @asher in #39
- feat(serve): adaptive decode/prefill pacing by default : incoming prompts no longer freeze in-flight replies by @asher in #40
- feat(chat): --server plain client mode, automatic when a configured server is up by @asher in #41
- fix(serve): --speculative no longer serializes concurrent requests by @asher in #45
- feat(mtp): preempt and resume speculation under continuous batching by @asher in #46
- fix(chat): stream rendering keeps pace with fast decode, live tok/s by @asher in #47
- feat(arch): muse-glimmer support with vision and dspark by @asher in #48
- release 0.3.0 by @asher in #42
Full Changelog: v0.2.2...v0.3.0