GPT-QModel v7.3.4
What's Changed
- fix(loader,eval): disable continuous-batching CUDA graphs for paged attention and require Evalution>=0.0.10 by @Qubitium in #2978
- fix(qqq): per-device Hessian partials for balanced multi-GPU calibration by @Qubitium in #2979
- fix(rotation): persist rotation config and apply online Hadamard for inference and calibration by @Qubitium in #2980
- fix(qqq): accumulate Hessian in-place per device to reduce memory by @Qubitium in #2981
- fix(qlinear): size GPTQ buffers by pack_factor and skip Laguna g_proj quantization by @Qubitium in #2983
- fix(qlinear): size pack_original qweight/qzeros by bits/32 for 3-bit GPTQ by @Qubitium in #2984
- fix(qlinear): size GPTQ buffers by bits/pack_dtype_bits by @Qubitium in #2985
- Fix the issue where WeightOnlyLooper did not support dynamic skipping. by @ZX-ModelCloud in #2986
- perf(quant): bypass pcre.match for exact dynamic config patterns by @Qubitium in #2987
- perf(marlin): cache scale permutation tensors and use index_select by @Qubitium in #2988
- perf(lazy_turtle): targeted ancestor+subtree map in materialize_submodule by @Qubitium in #2989
- fix(runtime): support vLLM 0.26 and SGLang 0.5.16 by @ZX-ModelCloud in #2991
- Fix the issue where WeightOnlyLooper did not support dynamic skipping. by @ZX-ModelCloud in #2990
- docs: fix FP8Config/EXL3Config imports in README examples by @latent-9 in #2993
- gptq: add planar (gptq_p) checkpoint format with 3/5/6/7-bit support by @Qubitium in #2996
- feat: Swordfish kernel for Blackwell (GPTQ/AWQ) by AlpinDale by @Qubitium in #2997
- docs(readme): add Swordfish kernel attribution and citation by @Qubitium in #2998
- fix(swordfish): apply post-review fixes from GPT-QModel-Ultra PR #183 by @Qubitium in #2999
- feat: axk2 (A.X-K2) model support by @Qubitium in #3000
- chore(deps): bump logbar to >=0.4.12 and Evalution to >=0.0.11 by @Qubitium in #3002
- Add lazy-load smoke testing skill by @Qubitium in #3004
- fix(looper): pass dotted layer names to cache_inputs for correct lazy materialization by @Qubitium in #3003
- fix(quantization): cap thread growth and add region telemetry by @Qubitium in #3005
- fix(telemetry): make env-gating consistent and caps configurable by @Qubitium in #3006
- fix(quantization): remove torch.compile wrappers from hessian_inverse by @Qubitium in #3007
- fix looper concurrency safety by @Qubitium in #3008
- harden free-threaded lock ownership by @Qubitium in #3009
- enable native MPS GPTQ quantization by @Qubitium in #3011
- fix test fakes drift and MoE subset hook-order flake by @Qubitium in #3012
- Optimize asymmetric 2-bit zero-point search by @Qubitium in #3013
- fix(eora): clamp covariance eigenvalues before inversion to avoid outlier adapters by @Qubitium in #3014
- fix(looper): pass the missing processor arg to the AWQ subset debug log by @Anai-Guo in #3016
- fix(cpp): add cross-process file lock for JIT kernel builds by @Ndgandhi23 in #3019
- fix(calibration): interpolate the item index in the unsupported-sequence error by @Anai-Guo in #3017
- feat(models): add Cohere Compass quantization support by @ZX-ModelCloud in #3018
New Contributors
- @latent-9 made their first contribution in #2993
- @Ndgandhi23 made their first contribution in #3019
Full Changelog: v7.3.2...v7.3.4