Skip to content

Releases: LoomaFloat/freetoken

v0.1.3-looma25-v100.2 (Tesla V100, test)

Choose a tag to compare

@gihpee gihpee released this 08 Oct 16:18

Тестовая сборка под Tesla V100 (sm_70), вторая. Ветка looma/v100, разбор — LOOMA-V100.md.

Что изменилось с v100.1: на sm_70 вне бюджета кэшей остаётся не меньше 6 ГиБ (FREETOKEN_SM70_HEADROOM_GIB). На первом стенде (V100 32 ГБ, Qwen3-30B-A3B) модель поднялась, но первый запрос упал по памяти: ~3.2 ГиБ ушло мимо аллокатора torch и съело запас в 10%.

Kernel-cache не менялся — берётся из v0.1.3-looma25-v100.1:

https://download.pytorch.org/whl/cu126/torch-2.11.0%2Bcu126-cp312-cp312-manylinux_2_28_x86_64.whl
https://download.pytorch.org/whl/cu126/torchvision-0.26.0%2Bcu126-cp312-cp312-manylinux_2_28_x86_64.whl
freetoken @ https://github.com/LoomaFloat/freetoken/releases/download/v0.1.3-looma25-v100.2/freetoken-0.1.3%2Blooma25.v100.2-cp312-cp312-linux_x86_64.whl
https://github.com/LoomaFloat/freetoken/releases/download/v0.1.3-looma25-v100.1/freetoken_kernel_cache-0.1.3%2Bcu126.looma25.v100.1-py3-none-linux_x86_64.whl
ziglang==0.16.0

v0.1.3-looma25-v100.1 (Tesla V100, test)

Choose a tag to compare

@gihpee gihpee released this 08 Oct 15:51

Тестовая сборка под Tesla V100 (sm_70). Ветка looma/v100 от v0.1.3-looma25, разбор — LOOMA-V100.md. Основной релиз v0.1.3-looma25 не меняется.

  • torch 2.11.0+cu126 (последняя сборка 2.11 с sm_70), драйвер под CUDA 12.6+
  • kernel-cache с кодом под sm_70 (nvcc 12.6), .so рантайма пересобраны против cu126
  • без [accel]: внимание через triton

Ставить вместе с torch cu126 голыми ссылками на колёса (не torch @ ... — агент ставит такие строки из индекса cu128, где нет sm_70):

https://download.pytorch.org/whl/cu126/torch-2.11.0%2Bcu126-cp312-cp312-manylinux_2_28_x86_64.whl
https://download.pytorch.org/whl/cu126/torchvision-0.26.0%2Bcu126-cp312-cp312-manylinux_2_28_x86_64.whl
freetoken @ https://github.com/LoomaFloat/freetoken/releases/download/v0.1.3-looma25-v100.1/freetoken-0.1.3%2Blooma25.v100.1-cp312-cp312-linux_x86_64.whl
https://github.com/LoomaFloat/freetoken/releases/download/v0.1.3-looma25-v100.1/freetoken_kernel_cache-0.1.3%2Bcu126.looma25.v100.1-py3-none-linux_x86_64.whl
ziglang==0.16.0

Колёса cp310, cp311, cp313 догружаются отдельно.

v0.1.3-looma25

Choose a tag to compare

@gihpee gihpee released this 06 Oct 07:19

engine: --kv-reserve-min-tokens — запас KV-кэша с откатом; Looma поднимает контекст FreeToken до 64k.

v0.1.3-looma24

Choose a tag to compare

@gihpee gihpee released this 30 Sep 12:39

minimax_m2: читалка block-fp8 экспертов для MiniMaxAI/MiniMax-M2.7.

v0.1.3-looma23

Choose a tag to compare

@gihpee gihpee released this 29 Sep 15:03

glm5_next: NVFP4 в плотном MLP (nvidia/GLM-5.3-Flash-NVFP4 падала на KeyError weight_scale слоя 0).

v0.1.3-looma22

Choose a tag to compare

@gihpee gihpee released this 28 Sep 21:13

qwen4_exp: nvfp4-эксперты на стадии конвейера адресуются банком стадии (nvidia/Qwen3.8-Flash-Next-NVFP4 падала нулевым рангом: bank layer 24 is outside [0, 24)).

v0.1.3-looma21

Choose a tag to compare

@gihpee gihpee released this 28 Sep 19:10

GLM-4.5-Air-FP8: fp8-эксперты с масштабом на строку (Fp8ChannelMoEMethod, режим per_row_scale у block-fp8 GEMM); читалка GLM-4 различает fp8 и NVFP4 в плотных слоях и деквантует fp8-внимание до DF11.

v0.1.3-looma20

Choose a tag to compare

@gihpee gihpee released this 28 Sep 18:53

gpt_oss: стадия конвейера (модель, шов (x, residual), читалки весов и экспертов по стадии).

HybridSWAKVCache адресует слои стадии по глобальному номеру.

v0.1.3-looma19

Choose a tag to compare

@gihpee gihpee released this 28 Sep 17:37

qwen3_5_moe: fp8-эксперты на стадии конвейера адресуются банком стадии.

Qwen/Qwen3.8-Flash-Next-FP8 нулевым рангом конвейера падала на своём слое 0 (unexpected routed-expert layer): плотный префикс считался как num_layers - num_moe_layers, а на стадии второе — только её слои.

v0.1.3-looma18

Choose a tag to compare

@gihpee gihpee released this 28 Sep 16:54

glm4_moe: iter_expert_pieces экспортирован из пакета семейства.

Движок ищет хук на пакете; без экспорта GLM-4.5-Air уходила в общий bf16-путь и падала на assert iter_weights.