1.2.0
- Support LagunaForCausalLM (and DFlashLagunaForCausalLM)
- Experimental CPU offloading support for expert layers
- Experimental dynamic draft window feature
- Improved safetensors loader (faster)
- More graph paths
- Performance tuning
- Removed compare_q.py, superseded by qbench.py
- Various bugfixes
Full Changelog: v1.1.0...v1.2.0