Skip to content

v0.2.0

Choose a tag to compare

@asher asher released this 02 Aug 15:41
· 112 commits to main since this release
Immutable release. Only release title and notes can be modified.
7a3a4ff

What's Changed

  • dsv32: stock gather decode now on by default, mask path remains as opt-in by @asher in #11
  • feat(apc): hybrid checkpoint tier, preserve_reasoning support by @asher in #12
  • perf(gemma4): batched decode global attention in one ragged kernel call by @asher in #13
  • apc: evaluate layer-major shard arrays before they cross to the disk writer thread by @asher in #14
  • perf(serve): quantized-KV prefill and decode take the fused kq paths by @asher in #15
  • perf(serve): shared-prefix cascade decode for concurrent streams by @asher in #16
  • experimental(serve): opt-in sparse top-k page decode for dense-attention models by @asher in #17
  • config: improved model defaults and thinking control helpers by @asher in #18
  • fix(pull): download progress bar fix, improved cli help by @asher in #19
  • feat(mtp): DSpark speculative decoding for DeepSeek-V4-Flash 0731 by @asher in #21
  • fix(chat): enable combining --mtp with --stream-experts by @asher in #22
  • feat(kimi-k3): kimi-k3 support, expert streaming memory optimizations by @asher in #20
  • release 0.2 by @asher in #25

Full Changelog: v0.1.4...v0.2.0