Topluluk TestiReddit LocalLLaMA (Topluluk & Benchmark)11 Ekim 2026

Qwen3.8-27B Megakernel RTX 3090'da 140 tok/s Hıza Ulaştı, Llama.cpp ile Karşılaştırıldı

Qwen3.8-27B modelini tek bir RTX 3090 üzerinde çalıştıran yeni CUDA megakernel, aynı donanımda Llama.cpp'dan %1.4‑1.9 daha hızlı token üretimi sağlıyor. Benchmark sonuçları kalite kaybı olmadan, KL divergence değerlerinin 0.0009 gibi düşük seviyelerde kaldığını gösteriyor. Bu güncelleme, büyük dil modellerinin tek GPU’da daha verimli kullanılabilmesi için önemli bir adım niteliğinde.

Öne Çıkan Başlıklar

  • Megakernel, aynı RTX 3090'da Llama.cpp'dan %1.4‑1.9 daha hızlı token üretimi sağlıyor.
  • Kalite ölçümleri (top‑token eşleşme, KL divergence, perplexity) neredeyse Llama.cpp ile aynı seviyede.
  • Spekülatif decoding mekanizması 4‑5 draft token ile çalışıyor, bu da performans artışını maliyet artışı olmadan getiriyor.
  • Quantizasyon desteği genişletildi; Q4_K_M yerel, diğer formatlar Llama.cpp üzerinden çalışıyor.

OpenJet ekibi, Qwen3.8-27B modeline özel olarak geliştirdiği CUDA megakernel'i halka sundu ve performansını Llama.cpp ile yan yana test etti. Megakernel, tek bir RTX 3090 kartında kod üretiminde 140 token/s, akıl yürütme modunda 78 token/s hızına ulaşırken, Llama.cpp sırasıyla 73 ve 51 token/s değerlerini verdi. Prefill (prompt işleme) aşamasında ise megakernel 1.600 token/s, Llama.cpp 1.100 token/s hızlarıyla farkı korudu.

Kalite açısından yapılan ölçümlerde, megakernel'in top‑token eşleşme oranı 1K bağlamda %99.08 iken Llama.cpp %98.68 olarak kaydedildi. Ortalama KL divergence değerleri ise megakernel için 0.0009, Llama.cpp için 0.0019 nats olarak ölçüldü; 30K ve 96K bağlamlarda da benzer düşük farklar gözlendi. Perplexity ölçümünde megakernel 2.4274, Llama.cpp 2.4283 puan alarak referans 2.4263'e çok yakın sonuçlar verdi.

Megakernel, spekülatif decoding (draft) mekanizmasını da destekliyor; 4‑5 draft token'ı bir turda kontrol ederek, tek bir token maliyetiyle aynı doğruluk seviyesini koruyor. Llama.cpp ise 2 draft ile çalışıyor. Bu sayede spekülatif decoding kapalıyken iki sistemin performansı neredeyse eşit (42.9 vs 40.4 tok/s) oluyor.

Proje, iki yeni PR ile model yükleyicisinin tensor tip kontrolü ve sunucu ısınma (warm‑up) sürecini ekledi. Quantizasyon desteği de genişletildi; Q4_K_M formatı megakernel için yerel, diğer formatlar ise Llama.cpp üzerinden çalışıyor. Tek GPU sınırı 24 GB ve üzeri RTX 30/40/50 serileriyle sınırlı; 147K bağlam uzunluğu 3090'da fp16 KV cache ile yaklaşık 80K, q8 ile çalıştırılabiliyor. Geliştiriciler, RTX 4090/5090 gibi kartlar ve farklı quantizasyonlar için optimizasyon katkısı bekliyor.

YZ Yorumu

Megakernel'in sunduğu hız artışı, tek kartlı sistemlerde büyük dil modellerinin daha geniş kullanım alanları bulmasını sağlayacak. Geliştiriciler, düşük KL divergence ve benzer perplexity değerleri sayesinde kaliteyi feda etmeden bu performansı projelerine entegre edebilecek.

Yapay zekâ tarafından üretilmiştir.

Benchmark Sonuçları

ModelBenchmarkSkorAyar
Qwen3.8-27B megakernelToken generation speed (code writing)140 tok/ssingle RTX 3090, CUDA megakernel