BC-250 kartlarıyla Next Flash IQ3_XXS ve Qwen 3.6 35B A3B modelleri 100‑250k bağlamda 70‑145 tok/s hızla çalıştırıldı

Yerel AI araştırmacısı, dört adet AMD BC‑250 kartını 2,5 GbE üzerinden birleştirerek Next Flash IQ3_XXS modelinde 100 k bağlamda 70 tok/s, Qwen 3.6 35B A3B modelinde ise iki örnekle 145 tok/s performans elde etti. Optimizasyonlar arasında spekülatif dekoding, Vulkan komut grafiği yeniden oynatma ve bağlam kontrol noktalarının kartlar arasında kopyalanması yer alıyor.
Öne Çıkan Başlıklar
- BC‑250 kartları 2,5 GbE üzerinden bağlanarak 4 kartlık bir küme oluşturuldu ve toplam maliyet $500 altında tutuldu.
- Spekülatif dekoding ve Vulkan komut grafiği yeniden oynatma sayesinde Next Flash IQ3_XXS modelinde 100 k bağlamda 70 tok/s, Qwen 3.6 35B‑A3B modelinde ise iki örnekle 145 tok/s performans sağlandı.
- Bağlam kontrol noktalarının kartlar arasında doğrudan kopyalanması gecikmeyi 665 ms'den 18 ms'ye düşürerek prompt hızını %60 artırdı.
- Güç tüketimi 600‑900 W arasında değişiyor; termal throttling'i önlemek için AIO soğutma ve 3D‑baskılı kasa kapağı planlanıyor.
Araştırmacı, dört BC‑250 kartını 2,5 GbE adaptörleriyle bir 2,5 GbE anahtara bağlayarak, Llama‑cpp ve Vulkan tabanlı RPC altyapısı üzerinden yerel AI çalıştırmaya başladı. Başlangıçta Flash‑Next IQ2 modelinde 30 tok/s, Qwen 3.6 35B modelinde 80 tok/s hızları elde ederken, Claude Code yardımıyla optimizasyonları uyguladı ve şu an Next Flash IQ3_XXS modelinde 60‑70 tok/s (yaklaşık 150 token/saniye) ve 100 k bağlamda sorunsuz çalıştırma sağladı.
Optimizasyonların temelini spekülatif dekoding ve modelin kendi MTP draft başlığı oluşturuyor. Bu yöntem, birden fazla taslak geçişiyle token doğrulamasını yaparak işlem süresini %10‑15 oranında kısaltıyor. Ayrıca, Vulkan komut grafikleri bir kez kaydedilip tekrar oynatılıyor; bu da host süresinde 3,7‑4,5 ms tasarruf ve %2 performans artışı sağlıyor. Bağlam kontrol noktaları koordinatör üzerinden değil doğrudan kartlar arasında kopyalanarak gecikme 665 ms'den 18 ms'ye düşürüldü ve prompt hızı %60 arttı.
Qwen 3.6 35B‑A3B modelinde ise iki kartta Q4_K_M (GGUF) quantizasyonu ve K/V önbelleği q8_0 kullanılarak 100 k‑250 k bağlamda 95‑116 tok/s arasında performans elde edildi. Uzun bağlamda (258 k token) spekülatif dekoding sayesinde 51‑54 tok/s hızına ulaşıldı; bu, saf dekodingde 36,4 tok/s olan değerin çok üzerindedir. Ayrıca, modelin başlatma süresi 105 s'den 32‑35 s'ye düşürülmüş ve oturumlar bitişik olarak kaydedilip geri yüklenebiliyor.
Güç tüketimi açısından, Next Flash modelinde 600‑700 W, iki Qwen 3.6 35B örneğinde ise 800‑900 W tüketiliyor. Araştırmacı, termal sınırlamaları aşmak için her kartta AIO soğutma çözümleri ve 3D‑baskılı bir kasa kapağı geliştirmeyi planlıyor.
Benchmark Sonuçları
| Model | Benchmark | Skor | Ayar |
|---|---|---|---|
| Next Flash IQ3_XXS | 100k bağlamda token/saniye hızı | 72.6 tok/s | 50,357 tokenlik tek tarayıcı üretimi |
| Next Flash IQ3_XXS | 5k token prompt sonrası hız | 68.3 tok/s | 5K-token prompt, sampled 512 tokens |
| Qwen 3.6 35B A3B (Q4_K_M) | Kısa promptta token/saniye hızı | 116 tok/s | first request short prompt |
YZ Yorumu
Bu sonuçlar, düşük maliyetli AMD BC‑250 kartlarıyla yüksek bağlamlı büyük dil modellerinin verimli bir şekilde çalıştırılabileceğini gösteriyor; geliştiriciler daha az bütçeyle yerel AI çözümleri sunabilir, kullanıcılar ise gecikmesiz ve uzun bağlamlı yanıtlar alabilir.
Yapay zekâ tarafından üretilmiştir.