xInfer v0.14.1
What's Changed
- Support new format AWQ/GPTQ MoE models by @guoqingbao in #451
- Fix MTP multirank issue on Blackwell & Logits projection sharding by @guoqingbao in #448
- Optimize safetensors model loading & fp8 model path by @guoqingbao in #453
- Improve native MLA kernel path & AWQ prefill precision by @guoqingbao in #454
- Add Metal AWQ MoE kernel path by @guoqingbao in #455
Full Changelog: v0.14.0...v0.14.1