Skip to content

v0.3.0

Choose a tag to compare

@asher asher released this 11 Aug 03:45
· 89 commits to main since this release
Immutable release. Only release title and notes can be modified.
89e723d

What's Changed

  • fix(load): GGUFs with quantized MoE router gates failed to load by @asher in #33
  • fix(apc): disk prompt-cache reuse works on every supported arch by @asher in #34
  • perf(deepseek4): fused decode glue route, per-phase cb caps, dspark verify pack by @asher in #35
  • fix(serve): short prompts prefilled under decode cb caps and could OOM the server by @asher in #36
  • chore(deps): mlx-kquant floor 0.3.11 for moe prefill gather speedups, updated ds4 bench by @asher in #37
  • fix(batch): deepseek-v4 serves concurrent requests (one-row prompt batches, CacheList promotion) by @asher in #38
  • feat(serve): memory-headroom admission gate + GMLX_SERVE_MEMSTATS per-tick trace by @asher in #39
  • feat(serve): adaptive decode/prefill pacing by default : incoming prompts no longer freeze in-flight replies by @asher in #40
  • feat(chat): --server plain client mode, automatic when a configured server is up by @asher in #41
  • fix(serve): --speculative no longer serializes concurrent requests by @asher in #45
  • feat(mtp): preempt and resume speculation under continuous batching by @asher in #46
  • fix(chat): stream rendering keeps pace with fast decode, live tok/s by @asher in #47
  • feat(arch): muse-glimmer support with vision and dspark by @asher in #48
  • release 0.3.0 by @asher in #42

Full Changelog: v0.2.2...v0.3.0