Repository navigation
Releases: LoomaFloat/freetoken
Release list
v0.1.3-looma25-v100.2 (Tesla V100, test)
Тестовая сборка под Tesla V100 (sm_70), вторая. Ветка looma/v100, разбор — LOOMA-V100.md.
Что изменилось с v100.1: на sm_70 вне бюджета кэшей остаётся не меньше 6 ГиБ (FREETOKEN_SM70_HEADROOM_GIB). На первом стенде (V100 32 ГБ, Qwen3-30B-A3B) модель поднялась, но первый запрос упал по памяти: ~3.2 ГиБ ушло мимо аллокатора torch и съело запас в 10%.
Kernel-cache не менялся — берётся из v0.1.3-looma25-v100.1:
https://download.pytorch.org/whl/cu126/torch-2.11.0%2Bcu126-cp312-cp312-manylinux_2_28_x86_64.whl
https://download.pytorch.org/whl/cu126/torchvision-0.26.0%2Bcu126-cp312-cp312-manylinux_2_28_x86_64.whl
freetoken @ https://github.com/LoomaFloat/freetoken/releases/download/v0.1.3-looma25-v100.2/freetoken-0.1.3%2Blooma25.v100.2-cp312-cp312-linux_x86_64.whl
https://github.com/LoomaFloat/freetoken/releases/download/v0.1.3-looma25-v100.1/freetoken_kernel_cache-0.1.3%2Bcu126.looma25.v100.1-py3-none-linux_x86_64.whl
ziglang==0.16.0
v0.1.3-looma25-v100.1 (Tesla V100, test)
Тестовая сборка под Tesla V100 (sm_70). Ветка looma/v100 от v0.1.3-looma25, разбор — LOOMA-V100.md. Основной релиз v0.1.3-looma25 не меняется.
- torch 2.11.0+cu126 (последняя сборка 2.11 с sm_70), драйвер под CUDA 12.6+
- kernel-cache с кодом под sm_70 (nvcc 12.6),
.soрантайма пересобраны против cu126 - без
[accel]: внимание через triton
Ставить вместе с torch cu126 голыми ссылками на колёса (не torch @ ... — агент ставит такие строки из индекса cu128, где нет sm_70):
https://download.pytorch.org/whl/cu126/torch-2.11.0%2Bcu126-cp312-cp312-manylinux_2_28_x86_64.whl
https://download.pytorch.org/whl/cu126/torchvision-0.26.0%2Bcu126-cp312-cp312-manylinux_2_28_x86_64.whl
freetoken @ https://github.com/LoomaFloat/freetoken/releases/download/v0.1.3-looma25-v100.1/freetoken-0.1.3%2Blooma25.v100.1-cp312-cp312-linux_x86_64.whl
https://github.com/LoomaFloat/freetoken/releases/download/v0.1.3-looma25-v100.1/freetoken_kernel_cache-0.1.3%2Bcu126.looma25.v100.1-py3-none-linux_x86_64.whl
ziglang==0.16.0
Колёса cp310, cp311, cp313 догружаются отдельно.
v0.1.3-looma25
engine: --kv-reserve-min-tokens — запас KV-кэша с откатом; Looma поднимает контекст FreeToken до 64k.
v0.1.3-looma24
minimax_m2: читалка block-fp8 экспертов для MiniMaxAI/MiniMax-M2.7.
v0.1.3-looma23
glm5_next: NVFP4 в плотном MLP (nvidia/GLM-5.3-Flash-NVFP4 падала на KeyError weight_scale слоя 0).
v0.1.3-looma22
qwen4_exp: nvfp4-эксперты на стадии конвейера адресуются банком стадии (nvidia/Qwen3.8-Flash-Next-NVFP4 падала нулевым рангом: bank layer 24 is outside [0, 24)).
v0.1.3-looma21
GLM-4.5-Air-FP8: fp8-эксперты с масштабом на строку (Fp8ChannelMoEMethod, режим per_row_scale у block-fp8 GEMM); читалка GLM-4 различает fp8 и NVFP4 в плотных слоях и деквантует fp8-внимание до DF11.
v0.1.3-looma20
gpt_oss: стадия конвейера (модель, шов (x, residual), читалки весов и экспертов по стадии).
HybridSWAKVCache адресует слои стадии по глобальному номеру.
v0.1.3-looma19
qwen3_5_moe: fp8-эксперты на стадии конвейера адресуются банком стадии.
Qwen/Qwen3.8-Flash-Next-FP8 нулевым рангом конвейера падала на своём слое 0 (unexpected routed-expert layer): плотный префикс считался как num_layers - num_moe_layers, а на стадии второе — только её слои.
v0.1.3-looma18
glm4_moe: iter_expert_pieces экспортирован из пакета семейства.
Движок ищет хук на пакете; без экспорта GLM-4.5-Air уходила в общий bf16-путь и падала на assert iter_weights.