Topluluk TestiReddit LocalLLaMA (Topluluk & Benchmark)10 Ekim 2026

6GB VRAM ile 131K Bağlam: Qwen 3.6 35B A3B RTX 2060 Üzerinde Çalıştırıldı

6GB VRAM ile 131K Bağlam: Qwen 3.6 35B A3B RTX 2060 Üzerinde Çalıştırıldı

Açık kaynak yapay zekâ topluluğu, optimize edilmiş llama.cpp yapılandırmalarıyla donanım sınırlarını zorlamaya devam ediyor. Reddit kullanıcısı, yalnızca 6GB VRAM'e sahip eski nesil bir RTX 2060 ekran kartında Qwen 3.6 35B A3B modelini 131.072 bağlam boyutu ve görme yetenekleriyle başarıyla çalıştırdığını paylaştı.

Öne Çıkan Başlıklar

  • 6GB VRAM'e sahip RTX 2060 üzerinde 35B parametreli görme destekli model 131K bağlamla çalıştırıldı.
  • Görsel projektör CPU'ya aktarılarak (~1GB VRAM tasarrufu) bellek taşması (OOM) engellendi ve VRAM 5.2 GB'ta tutuldu.
  • MoE katmanları `--n-cpu-moe 39` ile CPU/RAM üzerine dağıtılarak 35B modelin sığması sağlandı.
  • Boş önbellekte 23 tok/s, 90K bağlam seviyesinde ise kararlı 15 tok/s decode üretim hızı ölçüldü.

LocalLLaMA topluluğunda paylaşılan dikkat çekici bir optimizasyon örneği, giriş seviyesi ve eski donanımlarda bile büyük çok modlu dil modellerinin çalıştırılabileceğini kanıtladı. 'Szadbaverem69' adlı kullanıcı; Intel Core i5-10400F işlemci, 32GB DDR4 RAM ve 6GB VRAM'e sahip NVIDIA GeForce RTX 2060 sisteminde HauhauCS/Qwen3.6-35B-A3B modelinin Q4_K_M kuantizasyon sürümünü başarıyla ayağa kaldırdı.

Sistemin bu kadar kısıtlı bir VRAM bütçesinde çalışabilmesini sağlayan temel etken, uzmanlar karışımı (MoE) mimarisinin sunduğu esneklik ve CPU offload teknikleri oldu. Kullanıcı, `--n-cpu-moe 39` parametresiyle MoE uzman katmanlarının büyük bölümünü ana sistem belleğine yönlendirirken, görme projektörünü de `--no-mmproj-offload` argümanıyla CPU üzerinde işletti. Bu hamle görüntü işleme süresini uzatsa da yaklaşık 1 GB kritik VRAM tasarrufu sağlayarak toplam GPU bellek kullanımını 5.2 GB seviyesinde tuttu.

Performans metriklerine bakıldığında, sistem boş önbellek durumunda 600 tok/s prefill ve 23 tok/s decode hızlarına ulaştı. Bağlam boyutu 90.000 token seviyesine çıktığında dahi performans yaklaşık 485 tok/s prefill ve 15 tok/s decode hızlarında kararlı kalmayı başardı. 131K tam bağlam penceresi ve Q8_0 KV önbellek yapılandırmasıyla elde edilen bu sonuçlar, düşük bütçeli yerel YZ kurulumları için çığır açıcı bir rehber niteliği taşıyor.

YZ Yorumu

MoE mimarisinin getirdiği seyrek aktivasyon avantajı ile CPU offload yeteneklerinin birleşimi, pahalı sunucu GPU'larına ihtiyaç duymadan devasa bağlam pencerelerini bireysel kullanıcılara ulaştırıyor. 15-23 tok/s gibi günlük kullanım için oldukça yeterli hızlar, yerel yapay zekânın alt uç donanımlarda bile artık uygulanabilir olduğunu gösteriyor.

Yapay zekâ tarafından üretilmiştir.

Benchmark Sonuçları

ModelBenchmarkSkorAyar
Qwen 3.6 35B A3B (Q4_K_M)Prefill Speed (Empty Cache)600 tokens/sllama.cpp, RTX 2060 6GB + 32GB RAM, boş KV cache
Qwen 3.6 35B A3B (Q4_K_M)Decode Speed (Empty Cache)23 tokens/sllama.cpp, RTX 2060 6GB + 32GB RAM, boş KV cache
Qwen 3.6 35B A3B (Q4_K_M)Prefill Speed (90k Context)485 tokens/sllama.cpp, RTX 2060 6GB + 32GB RAM, 90k context
Qwen 3.6 35B A3B (Q4_K_M)Decode Speed (90k Context)15 tokens/sllama.cpp, RTX 2060 6GB + 32GB RAM, 90k context