Topluluk TestiReddit LocalLLaMA (Topluluk & Benchmark)10 Ekim 2026

Strata Çıkarım Motoru ve Qwen3.8 Flash Next ile Yerel Donanımda Yüksek Hızlı Başarım

Strata Çıkarım Motoru ve Qwen3.8 Flash Next ile Yerel Donanımda Yüksek Hızlı Başarım

LocalLLaMA topluluğunda paylaşılan yeni bir benchmark çalışması, Strata çıkarım arka ucunun Qwen3.8-Flash-Next modeli üzerinde vLLM motoruna kıyasla iki kat daha yüksek belirteç üretim hızlarına ulaştığını gösterdi. RTX PRO 6000 iş istasyonunda yapılan testler, özellikle kodlama ve akıl yürütme görevlerinde saniyede yaklaşık 300 token seviyelerine çıkılabildiğini kanıtlıyor.

Öne Çıkan Başlıklar

  • Strata motoru, tek kartlı RTX PRO 6000 (96GB) üzerinde Qwen3.8-Flash-Next modeliyle kodlama görevinde saniyede 298.9 token hızına ulaştı.
  • Aynı donanımda çalışan vLLM (NVFP4), Strata'ya kıyasla görev genelinde yaklaşık %46 ila %49 daha yavaş kaldı.
  • DGX Spark TP2 kümesinde koşan vLLM örneği ise tek kartlı Strata yapılandırmasından yaklaşık %77-%82 oranında daha düşük performans sergiledi.
  • Test kurulumunda INT8 256K KV cache ve MTP-4 spekülatif kod çözme teknikleri kullanılarak yüksek verimlilik elde edildi.

Yerel yapay zekâ ve açık kaynaklı model geliştiricileri için çıkarım motoru performansı büyük bir öneme sahipken, LocalLLaMA topluluğunda paylaşılan yeni bir test Strata adlı çıkarım arka ucunun dikkat çekici yeteneklerini gözler önüne serdi. Testi gerçekleştiren araştırmacı, 96 GB VRAM'e sahip tek bir Nvidia RTX PRO 6000 Workstation üzerinde Unsloth tarafından kuantize edilen Qwen3.8-Flash-Next UD-Q4_K_XL modelini Strata ve vLLM motorlarıyla karşılaştırdı. Yapılandırmada INT8 KV cache, 256K bağlam uzunluğu ve MTP-4 spekülatif kod çözme (speculative decoding) teknikleri kullanıldı.

Elde edilen sonuçlarda tek istekli kod çözme (Single-request decode / C1) senaryosunda Strata, vLLM altyapısına kıyasla neredeyse iki katı hız artışı sağladı. Kodlama görevinde vLLM aynı donanımda 162.6 t/s hız üretirken, Strata 298.9 t/s hızına ulaştı. Sayma ve akıl yürütme (reasoning) görevlerinde de benzer şekilde sırasıyla 320.4 t/s ve 289.1 t/s gibi oldukça yüksek değerler kaydedildi.

Karşılaştırmanın bir diğer dikkat çekici boyutu ise vLLM'in DGX Spark TP2 kümesindeki sonuçlarıyla kıyaslanması oldu. DGX Spark TP2 üzerinde vLLM kodlama görevinde yalnızca 60.1 t/s üretirken, tek kartlı RTX PRO 6000 üzerinde koşan Strata bu rakamı yaklaşık %80 oranında geride bıraktı. Testi yapan kullanıcı, vLLM örneklerinde Nvidia'nın NVFP4 kuantizasyonunun çalıştırıldığını, bu nedenle birebir doğrudan bir kıyaslama olmasa da Strata'nın sağladığı verimliliğin açıkça hissedildiğini belirtti.

Bu sonuçlar, model mimarilerinin yanı sıra optimize edilmiş spekülatif kod çözme mekanizmaları ile modern çıkarım motorlarının tek kartlı iş istasyonlarında dahi veri merkezi seviyesinde hızlara erişebileceğini somut şekilde ortaya koyuyor.

YZ Yorumu

Geliştiricilerin sadece model boyutuna değil, arka uç (inference engine) mimarisine odaklanmasının ne denli kritik olduğunu gösteren bir test. Spekülatif kod çözme (MTP) ve özelleşmiş kuantizasyonların Strata gibi yeni nesil motorlarla birleşmesi, yerel geliştirici ortamlarında API bağımlılığını azaltacak hız seviyelerini mümkün kılıyor.

Yapay zekâ tarafından üretilmiştir.

Benchmark Sonuçları

ModelBenchmarkSkorAyar
Qwen3.8-Flash-Next UD-Q4_K_XL (Strata)Single-request decode (Prose) - RTX PRO 6000185.8 tokens/secSingle-request decode (C1), INT8 KV cache, 256K context, MTP-4
Qwen3.8-Flash-Next (vLLM NVFP4)Single-request decode (Prose) - RTX PRO 600095.3 tokens/secSingle-request decode (C1), NVFP4
Qwen3.8-Flash-Next (vLLM NVFP4)Single-request decode (Prose) - DGX Spark TP238.2 tokens/secDGX Spark TP2, Single-request decode (C1), NVFP4
Qwen3.8-Flash-Next UD-Q4_K_XL (Strata)Single-request decode (Counting) - RTX PRO 6000320.4 tokens/secSingle-request decode (C1), INT8 KV cache, 256K context, MTP-4
Qwen3.8-Flash-Next (vLLM NVFP4)Single-request decode (Counting) - RTX PRO 6000171 tokens/secSingle-request decode (C1), NVFP4
Qwen3.8-Flash-Next (vLLM NVFP4)Single-request decode (Counting) - DGX Spark TP275.3 tokens/secDGX Spark TP2, Single-request decode (C1), NVFP4
Qwen3.8-Flash-Next UD-Q4_K_XL (Strata)Single-request decode (Coding) - RTX PRO 6000298.9 tokens/secSingle-request decode (C1), INT8 KV cache, 256K context, MTP-4
Qwen3.8-Flash-Next (vLLM NVFP4)Single-request decode (Coding) - RTX PRO 6000162.6 tokens/secSingle-request decode (C1), NVFP4
Qwen3.8-Flash-Next (vLLM NVFP4)Single-request decode (Coding) - DGX Spark TP260.1 tokens/secDGX Spark TP2, Single-request decode (C1), NVFP4
Qwen3.8-Flash-Next UD-Q4_K_XL (Strata)Single-request decode (Reasoning) - RTX PRO 6000289.1 tokens/secSingle-request decode (C1), INT8 KV cache, 256K context, MTP-4
Qwen3.8-Flash-Next (vLLM NVFP4)Single-request decode (Reasoning) - RTX PRO 6000149.6 tokens/secSingle-request decode (C1), NVFP4
Qwen3.8-Flash-Next (vLLM NVFP4)Single-request decode (Reasoning) - DGX Spark TP251.8 tokens/secDGX Spark TP2, Single-request decode (C1), NVFP4