Türkçe bir dil modelinde dikkat katmanlarının lineerleştirilmesi — bir sınır analizi, iki bozulma nedeninin ayrıştırılması ve çalışan bir hibrit model.
Bu depo, Erk-14B'nin softmax dikkat katmanlarının bir bölümünü subquadratic bir lineer-dikkat mekanizmasına (Gated DeltaNet) damıtarak elde ettiğimiz hibrit modelin kodunu ve ölçüm protokolünü içerir (model ağırlıkları Hugging Face'te). Her sonuç, oracle ile birebir aynı protokolde ölçülmüş ve güven aralığıyla verilmiştir.
Model: huggingface.co/ecloudtech/Erk-Linear · Teknik rapor: tarayıcıda aç (kaynak) · Temel model: Qwen3-14B
What this is. A hybrid Turkish language model in which 8 of 40 (20%) softmax attention layers are distilled into a subquadratic linear-attention mechanism, Gated DeltaNet. The base is Erk-14B (a Turkish continued-pretrained model built on Qwen3-14B). The repository holds the code, the evaluation protocol and the raw per-question predictions; weights are on Hugging Face.
Quality — oracle (full softmax) vs. the 20% hybrid, identical internal protocol, question-level paired bootstrap 95% CI:
| Evaluation | Oracle | Erk-Linear | Δ | 95% CI |
|---|---|---|---|---|
| TurkishMMLU — held-out 750 ¹ | 68.8 | 68.1 | −0.7 | [−2.9, +1.7] |
| TurkMorfBench (morphological generation) | 54.3 | 53.3 | −1.0 | [−3.9, +2.0] |
| NIAH recall control (≤4K) | 100 | 100 | ±0 | — |
| Perplexity (@512/@2048) | 1.00× | 1.03× | +3% | — |
On both benchmarks the difference was not statistically significant. The claim is indistinguishability at this sample size, not exact equality — the intervals are not narrow enough to rule out a 2–4 point difference on their own.
¹ The 150 questions used for co-training checkpoint selection are excluded; the score is reported on the remaining held-out 750, so there is no selection leakage. Raw per-question predictions: results/raw_predictions.json.
Efficiency. No gain in short/medium-context prefill (~5% slower — GDN overhead under a flash-attention regime). In long context, KV-cache memory falls: the 8 GDN layers hold a constant ~43 MB state instead of a growing KV, so the net saving grows with context — −13.6% @4K → −19.6% @64K (measured with the GDN state included).
Findings.
- Placement matters more than count. Spreading linear layers between softmax "anchors" costs far less quality than clustering them in a contiguous block (−4.7 vs −0.7 MMLU at the same budget) — the interleaved softmax layers re-anchor the residual stream and break cross-layer error compounding.
- Perplexity alone can mislead. An early hybrid sat at ×1.05 perplexity while dropping 10.7 points on TurkishMMLU. Model selection and the quality claim were therefore tied to task-based evaluation, not perplexity.
- The near-lossless ceiling is ~22%. 20% is the robust point; at 22.5% no significant degradation was detected (power is limited); at 25% the difference becomes significant, consistent with a per-layer capacity wall.
Correct incremental decoding. The GDN wrapper carries recurrent + convolution state across steps under use_cache=True, so model.generate() matches full recomputation up to numerical noise (verified for oracle and hybrid).
Reproducibility. Pinned versions in requirements.txt; data manifest, per-experiment commands and the raw-output re-derivation snippet in REPRODUCE.md.
Open question we would genuinely like input on: is linearizing 20% of softmax layers a viable direction for long-context Turkish models — or does the capacity wall we measured make a different split (deeper anchors, more aggressive ratio + wider co-training) the better trade? Discussion welcome in issues.
Dikkat katmanlarının %20'sini (40 katmanın 8'i) lineerleştiren hibrit, orijinal modelden iki bağımsız benchmark'ta (TurkishMMLU ve TurkMorfBench) istatistiksel olarak ayırt edilemedi; ayrıca kısa/orta-bağlam geri-çağırma kontrolünde oracle ile aynı (%100) ve perplexite maliyeti ×1,03'te kaldı. Çalışmanın kalıcı katkısı ise ölçülmüş bir haritadır: lineerleştirmenin nereye kadar mümkün olduğu, hangi mekanizmanın kaliteyi bozduğu ve kalite ile verimlilik arasındaki ödünleşim.
Oracle (tam softmax Erk) ile %20-hibrit, birebir aynı iç protokolde; farklar soru-bazlı paired bootstrap %95 güven aralığıyla.
| Değerlendirme | Erk (orijinal) | Erk-Linear | Fark | %95 GA |
|---|---|---|---|---|
| TurkishMMLU — held-out 750 ³ | %68,8 | %68,1 | −0,7 | [−2,9 ; +1,7] |
| TurkMorfBench (morfoloji üretimi) | %54,3 | %53,3 | −1,0 | [−3,9 ; +2,0] |
| NIAH geri-çağırma kontrolü (≤4K) | %100 | %100 | ±0 | — ¹ |
| Perplexity — ölçülü maliyet (@512/@2048) | 1,00× | 1,03× | +%3 | — ² |
İki benchmark'ta (TurkishMMLU, morfoloji) fark istatistiksel olarak anlamlı bulunmadı. Geri-çağırma kontrolü ≤4K'da tavana oturur (ayrıştırıcı değil); perplexite ölçülü bir maliyettir, tek başına kalite göstergesi değildir (bkz. rapor §4.2). Güven aralıkları ~2–4 puanlık farkları tek başına dışlayacak kadar dar değildir; iddiamız kesin eşitlik değil, bu örneklem gücünde ayırt-edilemezliktir.
¹ Her iki model de 45 denemede %100; fark tanımı gereği sıfır, GA dejeneredir — test bu uzunluklarda ayrıştırıcı değildir. ² Perplexity bir oran metriğidir; soru-bazlı GA uygulanmaz. ³ TurkishMMLU, ko-eğitim checkpoint seçiminde kullanılan 150 sorunun hariç tutulduğu held-out 750 üzerinde raporlanır (seçim sızıntısı yok). Seçim sorularını da içeren tam 900 üzerinde fark −0,3'tür; ham soru-bazlı tahminler results/raw_predictions.json altında ve held-out GA bunlardan yeniden üretilebilir.
- Kısa/orta bağlam prefill'inde kazanç yok, hatta ~%5 daha yavaş (flash-attention rejiminde GDN ek yükü). Beklenen bir sonuç.
- Uzun bağlamda KV-cache belleği azalır. 8 GDN katmanı, büyüyen KV yerine bağlamdan bağımsız sabit ~43 MB durum tutar; bu yüzden net tasarruf kısa bağlamda daha küçük, bağlam uzadıkça %20'ye yaklaşır (GDN sabit durumu dahil, doğrudan ölçüldü):
| Bağlam | Oracle KV | Erk-Linear | Tasarruf |
|---|---|---|---|
| 4K | 0,67 GB | 0,58 GB | −%13,6 (91 MB) |
| 16K | 2,68 GB | 2,19 GB | −%18,4 (494 MB) |
| 32K | 5,37 GB | 4,34 GB | −%19,2 (1,03 GB) |
| 64K | 10,74 GB | 8,63 GB | −%19,6 (2,10 GB) |
- Yerleşim, katman sayısından daha önemli. Lineer katmanları softmax "çıpaları" arasına yaymak, ardışık bir blokta kümelemekten çok daha az kalite kaybı verir — aradaki softmax katmanları residual akımı yeniden çıpalayarak katmanlar-arası birikmeyi kırar. Bu etki hem eğitimsiz perplexitede hem ko-eğitim sonrası TurkishMMLU'da doğrulandı (bitişik-8 −4,7 vs yayılmış-8 −0,7).
- Perplexity yanıltıcı olabilir. Erken bir hibrit sürüm perplexitede ×1,05 iken TurkishMMLU'da 10,7 puan düşmüştü. Bu yüzden model seçimini ve kalite iddiasını perplexiteye değil, görev-bazlı değerlendirmeye bağladık.
- Kayıpsıza-yakın sınır ~%22. En sağlam nokta %20; %22,5'te anlamlı bozulma saptanmadı (ama güç sınırlı), %25'te fark istatistiksel olarak anlamlı hale gelir (kapasite sınırıyla tutarlı). İki-mekanizma tanısı (girdi teacher-forcing + kosinüs analizi) kaybı katmanlar-arası birikme ve tek-katman kapasite açığına ayrıştırır.
pip install -r requirements.txt # sabitlenmiş sürümler; torch cu118 için REPRODUCE.mdfrom transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("ecloudtech/Erk-Linear", trust_remote_code=True)
tok = AutoTokenizer.from_pretrained("ecloudtech/Erk-Linear")
ids = tok("Türkiye'nin başkenti", return_tensors="pt").to(model.device)
print(tok.decode(model.generate(**ids, max_new_tokens=12)[0], skip_special_tokens=True))Hibrit iki kaynaktan kurulur: gövde (32 softmax katmanı + gömme/LM başı) ecloudtech/Erk-14B deposundan, 8 GDN katmanı bu depodan (gdn_weights.safetensors). from_pretrained ikisini birleştirip çalışır bir nedensel dil modeli döndürür — .generate(), chat şablonu ve use_cache standart biçimde çalışır. trust_remote_code=True gereklidir çünkü mimari özel; flash-linear-attention ve bir CUDA GPU'su şarttır (Gated DeltaNet çekirdekleri Triton kullanır).
GDN sarmalayıcısı, cache'li üretimde recurrent + convolution durumunu adımlar arası devreder; böylece model.generate() çıktısı tam-yeniden-hesaplamayla sayısal gürültüye kadar aynıdır (oracle ve hibrit için doğrulandı). Sarmalayıcı tek-dizi referans kullanım içindir; eş zamanlı/batch-paylaşımlı serviste her dizi için ayrı durum yönetimi gerekir.
Model ağırlıkları: huggingface.co/ecloudtech/Erk-Linear.
Tüm ölçümler oracle ve hibrit için birebir aynı protokolde yapılmıştır. Kod scripts/ altında:
| Betik | İş |
|---|---|
02_linearization_sweep.py |
Lineerleştirme degradasyon eğrisi (PPL) |
03_diagnostics.py |
İki-mekanizma tanısı (kosinüs, girdi teacher-forcing, drift) |
04_placement.py |
Yerleşim taraması (bitişik vs yayılmış) |
05_cotrain_mmlu_probe.py |
KL-damıtma ko-eğitim, MMLU-probe ile seçim |
06_eval_mmlu_ci.py |
TurkishMMLU + held-out (150 seçim sorusu hariç) + paired bootstrap GA |
07_eval_niah_prefill.py |
NIAH (≤4K geri-çağırma) + prefill verimlilik |
08_eval_morphbench.py |
TurkMorfBench (morfolojik üretim) |
09_kvcache_memory.py |
KV-cache belleği (GDN sabit-durum dahil) |
Ortam: PyTorch 2.7.1 (cu118), flash-linear-attention 0.5.1, transformers 5.13, tek A100. Sabitlenmiş sürümler requirements.txt; ayrıntılı adımlar, veri manifestosu ve ham soru-bazlı tahminler REPRODUCE.md · results/raw_predictions.json.
- Muhafazakâr, bilinçli bir oran. %20 lineer; bu, kapasite duvarının (§ tavan) altında kalan ölçülmüş bir kalite-öncelikli tercihtir. Verimlilik kazanımı da bu oranla sınırlıdır.
- Değerlendirme genişletildi ama tam değildir. NIAH yalnızca ≤4K'da test edildi (ve tavana oturdu); çok-daha-uzun bağlam, açık-uçlu üretim kalitesi ve otoregresif decode hızı açık kalmıştır.
- Temel model. Erk, Qwen3-14B üzerine kuruludur; bu çalışma o model üzerinde bir mimari araştırmasıdır, sıfırdan bir mimari değildir.
- İstatistiksel titizlik. Ana karşılaştırmalar tek seed'lidir; güven aralıkları soru-bazlı bootstrap'tan gelir. TurkishMMLU checkpoint'i 150 sabit MMLU-probe sorusuyla seçildi; sonuç bu sorular hariç held-out 750'de raporlanır (seçim sızıntısı yok).
Kod: Apache-2.0 (bkz. LICENSE). Temel model Qwen3-14B'nin lisansına tabidir. Değerlendirme: TurkishMMLU (AYueksel).
eCloud Tech (2026). Erk-Linear: Türkçe bir dil modelinde dikkat katmanlarının
lineerleştirilmesi. github.com/ecloudtechnology/erk-linear
Erk-Linear'ın geliştirme ve değerlendirme süreçleri, AI EDIH Türkiye projesi kapsamında tahsis edilen kaynaklarla İstanbul Teknik Üniversitesi Ulusal Yüksek Başarımlı Hesaplama Merkezi (UHeM) altyapısında yürütülmüştür. Değerli destekleri için UHeM ekibine ve AI EDIH Türkiye konsorsiyumuna teşekkür ederiz.
eCloud Tech · Türkçe Yapay Zekâ Araştırması. Ölçtük, doğruladık, açık kaynak yaptık.
