Topluluk TestiReddit LocalLLaMA (Topluluk & Benchmark)10 Ekim 2026

Yerel LLM'lerde 'Düşünme Bütçesi' Gerçekten İşe Yarıyor mu? AtCoder Üzerinde Kapsamlı Test

Yerel LLM'lerde 'Düşünme Bütçesi' Gerçekten İşe Yarıyor mu? AtCoder Üzerinde Kapsamlı Test

Reddit LocalLLaMA topluluğunda bir araştırmacı, tüketici sınıfı donanımda (RTX 5060 Ti 16GB) çalışan üç farklı açık kaynaklı modeli AtCoder'ın son 30 güne ait 14 problemi üzerinde test etti. Sonuçlar, düşünme eforunu (thinking effort) artırmanın başarıyı her zaman doğrusal şekilde artırmadığını, hatta token sınırına takılma riskini yükselttiğini ortaya koydu.

Öne Çıkan Başlıklar

  • Düşünme eforunun kademeli artırılması (low -> med -> xhigh) başarı oranında doğrusal bir artış sağlamadı.
  • Düşünme sürecini tamamen kapatmak ('none') başarımı dramatik şekilde düşürerek DNF ve syntax hatalarına yol açtı.
  • Flash Next IQ3_S modeli, medium düşünme eforunda 14 problemin 11'ini çözerek 27B modelini (10 çözüm) geride bıraktı.
  • Düşünme bütçesini aşırı yükseltmek çözüm oranını artırmak yerine %33-57 ek süre maliyeti getirdi ve 32k token tavanına takılmaları artırdı.

Yerel yapay zekâ topluluklarında modellerin akıl yürütme (reasoning/thinking) kabiliyetlerinin gerçek dünya senaryolarında nasıl ölçeklendiği tartışılmaya devam ediyor. Bağımsız bir geliştirici, günlük kullanım için en verimli modeli belirlemek amacıyla Swift 1.5, Flash Next ve 27B parametreli modelleri (GSQ-RCO kuantizasyonları ile) AtCoder'ın son 30 gün içinde yayınlanan 14 yeni problemi üzerinde karşılaştırdı. Modellerin eğitim verisinde bulunmayan güncel problemler seçilerek bilgi sızıntısı (data contamination) engellendi.

Testler AMD 7945HX işlemci, 64 GB DDR5 RAM ve 16 GB VRAM'li Nvidia RTX 5060 Ti donanımında Arch Linux altında llama.cpp ve Strata yazılımları kullanılarak yürütüldü. Düşünme eforu 'none' (yok), 'low' (düşük), 'medium' (orta) ve 'xhigh' (çok yüksek) olmak üzere 4 kademede ve 32k token üst sınırı ile sınırlandırıldı. Yaklaşık 11 saat süren test maratonunda, düşünme kanalı tamamen kapatıldığında modellerin ya kod üretmekte başarısız olduğu (DNF) ya da hatalı kod yazdığı (ERR) görüldü.

Ancak düşünme eforunun 'low' seviyesinden 'xhigh' seviyesine çıkarılması performansta beklenen orantılı artışı sağlamadı. Flash Next modeli en yüksek skoru 'medium' seviyesinde 11 çözülen problemle elde ederken, 27B modeli tüm seviyelerde 10 çözümde sabit kaldı. Düşünme süresinin artırılması çalışma süresini %33 ile %57 arasında uzatırken, harcanan ek tokenların genellikle zaten çözülemeyecek problemlerde 32k sınırına (CAP) takılarak boşa gittiği gözlemlendi.

Araştırmanın genel sonucunda, Flash Next IQ3_S modelinin hem hız hem de doğruluk dengesi bakımından 27B modeline kıyasla daha pratik bir alternatif sunduğu, günlük kullanımda 'medium' efor ayarının en optimum sonucu verdiği belirtildi.

YZ Yorumu

Bu bağımsız test, akıl yürütme yeteneğine sahip modellerde sınırsız düşünme bütçesinin her zaman daha iyi sonuç doğurmadığını somutlaştırıyor. Geliştiriciler ve yerel LLM kullanıcıları için çıkarılacak en temel ders; düşünme kanallarını kapatmamanın elzem olduğu ancak en yüksek efor yerine 'orta' seviyeyi tercih etmenin donanım kaynaklarını ve işlem sürelerini korumak adına en mantıklı dengeyi sağladığıdır.

Yapay zekâ tarafından üretilmiştir.

Benchmark Sonuçları

ModelBenchmarkSkorAyar
Flash Next (IQ3_S)AtCoder (Recent 14 Problems - Medium Effort)11 problemlerThinking effort: Medium, 32k token cap
27B (IQS_3)AtCoder (Recent 14 Problems)10 problemlerFlat across low, med, xhigh thinking efforts
Swift 1.5 (IQ2_XS)AtCoder (Recent 14 Problems - XHigh Effort)10 problemlerThinking effort: XHigh, 32k token cap