xInfer v0.14.0
What's Changed
- Support CUDA 13.1, 13.2 and 13.3 by @guoqingbao in #429
- Fix metal Qwen3.5/3.6 nvfp4 models by @guoqingbao in #430
- Use optimized metal kernels by @guoqingbao in #433
- Improve gdn & flash decoding kernel paths by @guoqingbao in #434
- Fix precision issue of gdn GQA decoding by @guoqingbao in #437
- Apply guided decoding only for grammar requests by @guoqingbao in #443
- MTP graph capture fix & optimize fp8 model decoding by @guoqingbao in #441
- Fix MTP verify on Blackwell by @guoqingbao in #446
- Improve batch processing & Metal decode regression by @guoqingbao in #444
Full Changelog: v0.13.8...v0.14.0