Skip to content

v1.5.0

Latest

Choose a tag to compare

@Alberto-Codes Alberto-Codes released this 08 Apr 04:42
7b56dc9

1.5.0 (2026-04-08)

Features

  • kv-cache: bypass compression on full attention layers in sliding window models (#85) (86daf48), closes #77
  • kv-cache: per-layer head_dim support for heterogeneous architectures (#83) (795f904), closes #75

Bug Fixes

  • init: warn when transformers<5.5 — Gemma 3/4 require newer version (#80) (8c75ba6), closes #78
  • verify: per-layer head_dim in verification harness (#84) (e585680), closes #73
  • vllm: padded slot size for hybrid model page alignment (#81) (899f714), closes #76