102M'lik Recursive BitNet-v2 modelini sıfırdan eğittim: 64K bağlam, 5B'den az token

Bir geliştirici, sadece 100 € bütçeyle 102 M parametreli Recursive BitNet‑v2 modelini sıfırdan eğitti. Model, 64 K tokenlik bağlam uzunluğuna ve ternary ağırlıklara sahip olup, çeşitli akademik benchmarklarda ortalama %40.59 başarı elde etti.
Öne Çıkan Başlıklar
- Model, sadece 100 € bütçeyle 4,703 B token kullanılarak eğitildi.
- Ternary BitLinear ağırlıkları ve hashed n‑gram gömmeleri sayesinde hafıza verimliliği artırıldı.
- 64 K tokenlik bağlam uzunluğu ve iki kez paylaşılan transformer blokları ile 12 etkili katman sağlandı.
Illustrious-Fig-2280, Cosmo2 tokenizatörünü 49.152 kelime dağarcığıyla kullanarak 102,28 M benzersiz parametreli bir decoder‑only transformer geliştirdi. Model, 1.024 gizli boyutu, 16 sorgu başlığı ve 4 KV başlığıyla grup‑sorgu dikkat mekanizması ve kare‑ReLU besleme katmanları içeriyor. Altı transformer bloğu iki kez çalıştırılarak toplam on iki etkili katman sağlanıyor; bu iki geçiş aynı ağırlıkları paylaşırken, her derinlikte ayrı KV önbellekleri tutuluyor.
Modelin en dikkat çekici özelliği, ternary BitLinear projeksiyonları; ağırlıklar {-1,0,+1} değerlerinden ölçeklenerek ileri geçişte kullanılıyor ve FP32 master ağırlıkları ile BF16 aktivasyonları korunuyor. Ayrıca, 2‑, 3‑ ve 4‑gram token gömme tabanlı bir hash tablosu eklenerek giriş gömmelerine yaklaşık 1,6 M parametre daha ekleniyor. Eğitim iki aşamada gerçekleşti: ilk aşamada 4 × NVIDIA B300 GPU ile 2 K‑4 K bağlamda 3,487 B token işlenirken, ikinci aşamada aynı donanımda 64 K bağlamda 1,216 B token işlendi; toplamda 4,703 B token kullanıldı.
Benchmark testleri lm‑eval 0.4.12 ile zero‑shot, 2 048 tokenlik değerlendirme bağlamında yapıldı ve 20.465 soruya yanıt verildi. Elde edilen sonuçlar: ARC‑Easy %40.11, ARC‑Challenge %23.63, PIQA %57.62, WinoGrande %51.22, OpenBookQA %25.60, BoolQ %58.65 ve HellaSwag %27.27. Ağırlıkların ortalama başarı oranı %40.59 olarak belirlendi. Tekrarlayan geçiş sayısına göre yapılan ablasyon çalışması, tek geçiş %39.19, iki geçiş %40.59 ve üç geçiş %39.67 başarı oranları gösterdi.
Model, 409,14 MB FP32 master ağırlıkları ve 124,24 MB paketlenmiş bir dışa aktarım dosyası olarak sunuluyor; paketleme, bir bayta beş ternary değer sıkıştırması yapıyor. Açık kaynak topluluğu, bu deneysel ön izlemeyi inceleyerek geri bildirimde bulunabilir ve modelin daha büyük ölçekli sürümlerine temel oluşturabilir.
Benchmark Sonuçları
| Model | Benchmark | Skor | Ayar |
|---|---|---|---|
| Recursive BitNet N-Gram 102M | ARC-Easy | 40.11 % | zero-shot, 2,048-token context |
| Recursive BitNet N-Gram 102M | ARC-Challenge | 23.63 % | zero-shot, 2,048-token context |
| Recursive BitNet N-Gram 102M | PIQA | 57.62 % | zero-shot, 2,048-token context |
| Recursive BitNet N-Gram 102M | WinoGrande | 51.22 % | zero-shot, 2,048-token context |
| Recursive BitNet N-Gram 102M | OpenBookQA | 25.6 % | zero-shot, 2,048-token context |
| Recursive BitNet N-Gram 102M | BoolQ | 58.65 % | zero-shot, 2,048-token context |
YZ Yorumu
Bu model, düşük maliyetli donanım ve sınırlı veriyle uzun bağlamlı görevlerde rekabetçi performans elde edilebileceğini göstererek, araştırmacıların ve geliştiricilerin daha verimli mimariler denemesine ilham verecek.
Yapay zekâ tarafından üretilmiştir.