v0.2.0
·
112 commits
to main
since this release
Immutable
release. Only release title and notes can be modified.
What's Changed
- dsv32: stock gather decode now on by default, mask path remains as opt-in by @asher in #11
- feat(apc): hybrid checkpoint tier, preserve_reasoning support by @asher in #12
- perf(gemma4): batched decode global attention in one ragged kernel call by @asher in #13
- apc: evaluate layer-major shard arrays before they cross to the disk writer thread by @asher in #14
- perf(serve): quantized-KV prefill and decode take the fused kq paths by @asher in #15
- perf(serve): shared-prefix cascade decode for concurrent streams by @asher in #16
- experimental(serve): opt-in sparse top-k page decode for dense-attention models by @asher in #17
- config: improved model defaults and thinking control helpers by @asher in #18
- fix(pull): download progress bar fix, improved cli help by @asher in #19
- feat(mtp): DSpark speculative decoding for DeepSeek-V4-Flash 0731 by @asher in #21
- fix(chat): enable combining --mtp with --stream-experts by @asher in #22
- feat(kimi-k3): kimi-k3 support, expert streaming memory optimizations by @asher in #20
- release 0.2 by @asher in #25
Full Changelog: v0.1.4...v0.2.0