Türkçe bir dil modelinde dikkat katmanlarının lineerleştirilmesi — bir sınır analizi, iki bozulma nedeninin ayrıştırılması ve çalışan bir hibrit model.
Bu depo, Erk-14B'nin softmax dikkat katmanlarının bir bölümünü subquadratic bir lineer-dikkat mekanizmasına (Gated DeltaNet) damıtarak elde ettiğimiz hibrit modelin kodunu ve ölçüm protokolünü içerir (model ağırlıkları Hugging Face'te). Her sonuç, oracle ile birebir aynı protokolde ölçülmüş ve güven aralığıyla verilmiştir.
Model: huggingface.co/ecloudtech/Erk-Linear · Teknik rapor: tarayıcıda aç (kaynak) · Temel model: Qwen3-14B
Dikkat katmanlarının %20'sini (40 katmanın 8'i) lineerleştiren hibrit, orijinal modelden iki bağımsız benchmark'ta (TurkishMMLU ve TurkMorfBench) istatistiksel olarak ayırt edilemedi; ayrıca kısa/orta-bağlam geri-çağırma kontrolünde oracle ile aynı (%100) ve perplexite maliyeti ×1,03'te kaldı. Çalışmanın kalıcı katkısı ise ölçülmüş bir haritadır: lineerleştirmenin nereye kadar mümkün olduğu, hangi mekanizmanın kaliteyi bozduğu ve kalite ile verimlilik arasındaki ödünleşim.
Oracle (tam softmax Erk) ile %20-hibrit, birebir aynı iç protokolde; farklar soru-bazlı paired bootstrap %95 güven aralığıyla.
| Değerlendirme | Erk (orijinal) | Erk-Linear | Fark | %95 GA |
|---|---|---|---|---|
| TurkishMMLU — held-out 750 ³ | %68,8 | %68,1 | −0,7 | [−2,9 ; +1,7] |
| TurkMorfBench (morfoloji üretimi) | %54,3 | %53,3 | −1,0 | [−3,9 ; +2,0] |
| NIAH geri-çağırma kontrolü (≤4K) | %100 | %100 | ±0 | — ¹ |
| Perplexity — ölçülü maliyet (@512/@2048) | 1,00× | 1,03× | +%3 | — ² |
İki benchmark'ta (TurkishMMLU, morfoloji) fark istatistiksel olarak anlamlı bulunmadı. Geri-çağırma kontrolü ≤4K'da tavana oturur (ayrıştırıcı değil); perplexite ölçülü bir maliyettir, tek başına kalite göstergesi değildir (bkz. rapor §4.2). Güven aralıkları ~2–4 puanlık farkları tek başına dışlayacak kadar dar değildir; iddiamız kesin eşitlik değil, bu örneklem gücünde ayırt-edilemezliktir.
¹ Her iki model de 45 denemede %100; fark tanımı gereği sıfır, GA dejeneredir — test bu uzunluklarda ayrıştırıcı değildir. ² Perplexity bir oran metriğidir; soru-bazlı GA uygulanmaz. ³ TurkishMMLU, ko-eğitim checkpoint seçiminde kullanılan 150 sorunun hariç tutulduğu held-out 750 üzerinde raporlanır (seçim sızıntısı yok). Seçim sorularını da içeren tam 900 üzerinde fark −0,3'tür; ham soru-bazlı tahminler results/raw_predictions.json altında ve held-out GA bunlardan yeniden üretilebilir.
- Kısa/orta bağlam prefill'inde kazanç yok, hatta ~%5 daha yavaş (flash-attention rejiminde GDN ek yükü). Beklenen bir sonuç.
- Uzun bağlamda KV-cache belleği azalır. 8 GDN katmanı, büyüyen KV yerine bağlamdan bağımsız sabit ~43 MB durum tutar; bu yüzden net tasarruf kısa bağlamda daha küçük, bağlam uzadıkça %20'ye yaklaşır (GDN sabit durumu dahil, doğrudan ölçüldü):
| Bağlam | Oracle KV | Erk-Linear | Tasarruf |
|---|---|---|---|
| 4K | 0,67 GB | 0,58 GB | −%13,6 (91 MB) |
| 16K | 2,68 GB | 2,19 GB | −%18,4 (494 MB) |
| 32K | 5,37 GB | 4,34 GB | −%19,2 (1,03 GB) |
| 64K | 10,74 GB | 8,63 GB | −%19,6 (2,10 GB) |
- Yerleşim, katman sayısından daha önemli. Lineer katmanları softmax "çıpaları" arasına yaymak, ardışık bir blokta kümelemekten çok daha az kalite kaybı verir — aradaki softmax katmanları residual akımı yeniden çıpalayarak katmanlar-arası birikmeyi kırar. Bu etki hem eğitimsiz perplexitede hem ko-eğitim sonrası TurkishMMLU'da doğrulandı (bitişik-8 −4,7 vs yayılmış-8 −0,7).
- Perplexity yanıltıcı olabilir. Erken bir hibrit sürüm perplexitede ×1,05 iken TurkishMMLU'da 10,7 puan düşmüştü. Bu yüzden model seçimini ve kalite iddiasını perplexiteye değil, görev-bazlı değerlendirmeye bağladık.
- Kayıpsıza-yakın sınır ~%22. En sağlam nokta %20; %22,5'te anlamlı bozulma saptanmadı (ama güç sınırlı), %25'te fark istatistiksel olarak anlamlı hale gelir (kapasite sınırıyla tutarlı). İki-mekanizma tanısı (girdi teacher-forcing + kosinüs analizi) kaybı katmanlar-arası birikme ve tek-katman kapasite açığına ayrıştırır.
Erk-Linear hibrit bir mimaridir; standart AutoModelForCausalLM / pipeline / vLLM tek başına çalışmaz — depodaki özel loader gerekir.
pip install -r requirements.txt # sabitlenmiş sürümler; torch cu118 için REPRODUCE.mdfrom modeling_erk_linear import load_erk_linear
model, tokenizer = load_erk_linear() # Erk-14B tabanını + GDN ağırlıklarını indirir, hibridi kurar
ids = tokenizer("Türkiye'nin başkenti", return_tensors="pt").to(model.device)
print(tokenizer.decode(model.generate(**ids, max_new_tokens=12)[0], skip_special_tokens=True))Loader (modeling_erk_linear.py) Erk-14B tabanını ve 8 katmanın Gated DeltaNet ağırlıklarını indirip hibridi kurar. GDN sarmalayıcısı, cache'li üretimde (use_cache=True) recurrent + convolution durumunu adımlar arası devreder; böylece model.generate() çıktısı tam-yeniden-hesaplamayla sayısal gürültüye kadar aynıdır. Model ağırlıkları: huggingface.co/ecloudtech/Erk-Linear.
Tüm ölçümler oracle ve hibrit için birebir aynı protokolde yapılmıştır. Kod scripts/ altında:
| Betik | İş |
|---|---|
02_linearization_sweep.py |
Lineerleştirme degradasyon eğrisi (PPL) |
03_diagnostics.py |
İki-mekanizma tanısı (kosinüs, girdi teacher-forcing, drift) |
04_placement.py |
Yerleşim taraması (bitişik vs yayılmış) |
05_cotrain_mmlu_probe.py |
KL-damıtma ko-eğitim, MMLU-probe ile seçim |
06_eval_mmlu_ci.py |
TurkishMMLU + held-out (150 seçim sorusu hariç) + paired bootstrap GA |
07_eval_niah_prefill.py |
NIAH (≤4K geri-çağırma) + prefill verimlilik |
08_eval_morphbench.py |
TurkMorfBench (morfolojik üretim) |
09_kvcache_memory.py |
KV-cache belleği (GDN sabit-durum dahil) |
Ortam: PyTorch 2.7.1 (cu118), flash-linear-attention 0.5.1, transformers 5.13, tek A100. Sabitlenmiş sürümler requirements.txt; ayrıntılı adımlar, veri manifestosu ve ham soru-bazlı tahminler REPRODUCE.md · results/raw_predictions.json.
- Muhafazakâr, bilinçli bir oran. %20 lineer; bu, kapasite duvarının (§ tavan) altında kalan ölçülmüş bir kalite-öncelikli tercihtir. Verimlilik kazanımı da bu oranla sınırlıdır.
- Değerlendirme genişletildi ama tam değildir. NIAH yalnızca ≤4K'da test edildi (ve tavana oturdu); çok-daha-uzun bağlam, açık-uçlu üretim kalitesi ve otoregresif decode hızı açık kalmıştır.
- Temel model. Erk, Qwen3-14B üzerine kuruludur; bu çalışma o model üzerinde bir mimari araştırmasıdır, sıfırdan bir mimari değildir.
- İstatistiksel titizlik. Ana karşılaştırmalar tek seed'lidir; güven aralıkları soru-bazlı bootstrap'tan gelir. TurkishMMLU checkpoint'i 150 sabit MMLU-probe sorusuyla seçildi; sonuç bu sorular hariç held-out 750'de raporlanır (seçim sızıntısı yok).
Kod: Apache-2.0 (bkz. LICENSE). Temel model Qwen3-14B'nin lisansına tabidir. Değerlendirme: TurkishMMLU (AYueksel).
eCloud Tech (2026). Erk-Linear: Türkçe bir dil modelinde dikkat katmanlarının
lineerleştirilmesi. github.com/ecloudtechnology/erk-linear
eCloud Tech · Türkçe Yapay Zekâ Araştırması. Ölçtük, doğruladık, açık kaynak yaptık.
