Skip to content

GPT-QModel v7.3.4

Choose a tag to compare

@Qubitium Qubitium released this 19 Aug 18:57
· 44 commits to main since this release
783a0fb

What's Changed

  • fix(loader,eval): disable continuous-batching CUDA graphs for paged attention and require Evalution>=0.0.10 by @Qubitium in #2978
  • fix(qqq): per-device Hessian partials for balanced multi-GPU calibration by @Qubitium in #2979
  • fix(rotation): persist rotation config and apply online Hadamard for inference and calibration by @Qubitium in #2980
  • fix(qqq): accumulate Hessian in-place per device to reduce memory by @Qubitium in #2981
  • fix(qlinear): size GPTQ buffers by pack_factor and skip Laguna g_proj quantization by @Qubitium in #2983
  • fix(qlinear): size pack_original qweight/qzeros by bits/32 for 3-bit GPTQ by @Qubitium in #2984
  • fix(qlinear): size GPTQ buffers by bits/pack_dtype_bits by @Qubitium in #2985
  • Fix the issue where WeightOnlyLooper did not support dynamic skipping. by @ZX-ModelCloud in #2986
  • perf(quant): bypass pcre.match for exact dynamic config patterns by @Qubitium in #2987
  • perf(marlin): cache scale permutation tensors and use index_select by @Qubitium in #2988
  • perf(lazy_turtle): targeted ancestor+subtree map in materialize_submodule by @Qubitium in #2989
  • fix(runtime): support vLLM 0.26 and SGLang 0.5.16 by @ZX-ModelCloud in #2991
  • Fix the issue where WeightOnlyLooper did not support dynamic skipping. by @ZX-ModelCloud in #2990
  • docs: fix FP8Config/EXL3Config imports in README examples by @latent-9 in #2993
  • gptq: add planar (gptq_p) checkpoint format with 3/5/6/7-bit support by @Qubitium in #2996
  • feat: Swordfish kernel for Blackwell (GPTQ/AWQ) by AlpinDale by @Qubitium in #2997
  • docs(readme): add Swordfish kernel attribution and citation by @Qubitium in #2998
  • fix(swordfish): apply post-review fixes from GPT-QModel-Ultra PR #183 by @Qubitium in #2999
  • feat: axk2 (A.X-K2) model support by @Qubitium in #3000
  • chore(deps): bump logbar to >=0.4.12 and Evalution to >=0.0.11 by @Qubitium in #3002
  • Add lazy-load smoke testing skill by @Qubitium in #3004
  • fix(looper): pass dotted layer names to cache_inputs for correct lazy materialization by @Qubitium in #3003
  • fix(quantization): cap thread growth and add region telemetry by @Qubitium in #3005
  • fix(telemetry): make env-gating consistent and caps configurable by @Qubitium in #3006
  • fix(quantization): remove torch.compile wrappers from hessian_inverse by @Qubitium in #3007
  • fix looper concurrency safety by @Qubitium in #3008
  • harden free-threaded lock ownership by @Qubitium in #3009
  • enable native MPS GPTQ quantization by @Qubitium in #3011
  • fix test fakes drift and MoE subset hook-order flake by @Qubitium in #3012
  • Optimize asymmetric 2-bit zero-point search by @Qubitium in #3013
  • fix(eora): clamp covariance eigenvalues before inversion to avoid outlier adapters by @Qubitium in #3014
  • fix(looper): pass the missing processor arg to the AWQ subset debug log by @Anai-Guo in #3016
  • fix(cpp): add cross-process file lock for JIT kernel builds by @Ndgandhi23 in #3019
  • fix(calibration): interpolate the item index in the unsupported-sequence error by @Anai-Guo in #3017
  • feat(models): add Cohere Compass quantization support by @ZX-ModelCloud in #3018

New Contributors

Full Changelog: v7.3.2...v7.3.4