Ternary Ağırlıklarla 27B LLM'i Laptopta Çalıştırma İmkanı

GPU sınırlı kullanıcılar artık 27 milyar parametreli büyük dil modellerini sıradan bir laptopta çalıştırabilecek. Yeni ternary (üçlü) ağırlık formatı, model boyutunu %90'ı kadar küçülterek %98,2 oranında FP16 zekâsını koruyor ve Apple M5 Max'te 47 token/sn hız sağlıyor.
Öne Çıkan Başlıklar
- 27B model, ternary ağırlıklarla %9,3 daha küçük bir boyuta (5,9 GB) indirildi.
- FP16 zekâsının %98,2'si korundu; 14 benchmark'ta ortalama 84,78 puan.
- Apple M5 Max'te 47 token/sn hızla çalışıyor, 262K token bağlamını destekliyor.
- İki GGUF paketi (PTQ1_0 ve PQ2_0) sayesinde CUDA ve Metal uyumlu özel çekirdekler kullanılıyor.
Reddit'in LocalLLaMA topluluğu, 27B sınıfı bir dil modelini ternary (1,0,-1) ağırlıklarla sıkıştırarak, standart bir laptop ya da tek bir GPU üzerinde çalıştırılabilir hâle getirdi. Model, FP16 formatındaki 54 GB'lık boyutundan %89,3 daha küçük, sadece 5,9 GB'lık bir dosya haline geldi. Bu sıkıştırma, sadece gömülü katmanlar, dikkat projeksiyonları, MLP ve LM başlığı gibi tüm ağırlıkları kapsayan uçtan uca bir ternary temsiliyle sağlanıyor; her ağırlık ortalama 1,72 bit.
Yeni format, iki farklı GGUF paketleme seçeneği sunuyor: PTQ1_0 (tritler sıkı paketlenmiş, 1,75 bit/ağırlık, 5,95 GB) ve PQ2_0 (her trit 2-bit yuvasında, 2,13 bit/ağırlık, 7,21 GB). Bu paketler, llama.cpp içinde CUDA ve Metal destekli özel ternary hibrit-dikkat çekirdekleriyle doğrudan kullanılabiliyor; ağırlıklar FP16'ya geri dönüştürülmeden işleniyor. Model, Qwen3.8-27B hibrit‑dikkat omurgası sayesinde %75 lineer dikkatle 262K token bağlamını cihazda tutabiliyor.
Performans açısından model, 14 farklı düşünme‑modu benchmark'ında ortalama 84,78 puan alarak, aynı sınıftaki IQ2_XXS (72,59) modelinden %12 daha yüksek bir skor elde etti ve UD‑Q4_K_XL modeline sadece 0,4 puan farkla yaklaştı. Matematik yeteneği %96,57, kodlama %89,42 ve araç çağırma (agentic tool calling) %74,92 oranlarında tam hassasiyetine çok yakın sonuçlar gösterdi. Apple M5 Max laptopta ise model 47 token/sn hızla çalışıyor, bu da düşük‑bit temsillerin pratik kullanımda hâlâ yüksek verimlilik sunabildiğini kanıtlıyor.
Bu gelişme, düşük‑bütçeli araştırmacılar ve geliştiriciler için büyük dil modellerine erişimi demokratikleştiriyor. Modelin düşük bellek gereksinimi, bulut tabanlı GPU kiralama maliyetlerini azaltırken, yerel cihazlarda gizlilik odaklı uygulamaların geliştirilmesine de olanak tanıyor.
Benchmark Sonuçları
| Model | Benchmark | Skor | Ayar |
|---|---|---|---|
| 27B ternary model | Ortalama düşünme-modu skoru | 84.78 puan | 14 thinking-mode benchmarks |
| 27B ternary model | Matematik doğruluğu | 96.57 puan | - |
| 27B ternary model | Kodlama yeteneği | 89.42 puan | - |
YZ Yorumu
Bu sıkıştırma yöntemi, yüksek performanslı LLM'leri düşük maliyetli donanımla çalıştırma olanağı sunarak geliştiricilerin prototip aşamasını hızlandıracak ve gizlilik odaklı yerel uygulamaların önünü açacaktır.
Yapay zekâ tarafından üretilmiştir.