48GB VRAM’da Hız ve Kalite: Qwen 3.8 27B Swift 1.5 W8A16 Quant Modeli

Reddit topluluğu üyesi TacGibs, 48 GB VRAM sınırını aşmadan yüksek hız ve kalite sunan yeni bir Qwen 3.8 27B Swift 1.5 quant modeli yayınladı. Model, 8‑bit AWQ+GPTQ karışık kuantizasyonu ve vLLM‑MTP entegrasyonu sayesinde iki RTX 3090’da yaklaşık 100 token/s dekodlama hızı sağlıyor.
Öne Çıkan Başlıklar
- 8‑bit AWQ + GPTQ karışık kuantizasyonu sayesinde yüksek kalite ve düşük bellek tüketimi
- vLLM ve MTP=5 ile iki RTX 3090’da yaklaşık 100 token/s dekodlama hızı
- Her kartta 21.6 GB VRAM kullanımı, toplam 48 GB VRAM sınırını aşmadan çalışabilme
- Model açık kaynak olarak HuggingFace’da yayınlandı ve topluluk tarafından erişilebilir
- 128 k bağlam uzunluğu ve FP16 KV cache desteği
Yapay zeka araştırmacıları ve geliştiricileri, büyük dil modellerini yüksek performanslı GPU’larda çalıştırırken hem bellek hem de hız dengesini sağlamakta zorlanıyor. Bu soruna yanıt olarak TacGibs, Qwen 3.8 27B modelinin Swift 1.5 sürümünü 8‑bit AWQ ve GPTQ tekniklerini birleştirerek kuantize etti ve "Swift-1.5-Qwen3.8-27B-W8A16" adıyla HuggingFace platformunda paylaştı.
Model, dört RTX 3090’da kuantizasyon sürecini tamamladıktan sonra, iki RTX 3090’da vLLM ve MTP (Multi‑Threaded Parallelism) ile çalıştırılıyor. 128 k bağlam uzunluğu ve FP16 KV cache kullanımıyla kart başına yaklaşık 21.6 GB VRAM tüketiyor ve toplam 48 GB VRAM sınırını rahatça karşılıyor. En dikkat çekici performans göstergesi, MTP=5 ayarıyla neredeyse 100 token/s dekodlama hızı elde edilmesi.
Bu yapı, orijinal Qwen 3.8 27B modeline göre daha az “overthinker” (gereksiz hesaplama) davranışı sergiliyor ve gerçek zamanlı uygulamalarda daha akıcı yanıtlar sunuyor. Modelin açık kaynak kodlu olması, topluluk üyelerinin kendi altyapılarına kolayca entegre etmelerini ve gerektiğinde özelleştirmeler yapmalarını mümkün kılıyor.
TacGibs, bu çalışmayı “love and precision” (sevgi ve hassasiyet) ile geliştirdiğini belirterek, benzer ihtiyaçları olan diğer araştırmacı ve geliştiricilerin de faydalanmasını umduğunu ifade etti. Modelin HuggingFace sayfası üzerinden indirilebilir ve belgeleri incelenebilir.
Benchmark Sonuçları
| Model | Benchmark | Skor | Ayar |
|---|---|---|---|
| Qwen 3.8 27B Swift 1.5 (W8A16) | Token generation speed (decode) | 100 tokens/s | MTP=5, vLLM, 2x RTX 3090, 128k context, FP16 KV cache |
YZ Yorumu
Bu kuantizasyon, yüksek bellek gereksinimi olan modelleri orta ölçekli GPU çiftlerinde çalıştırmak isteyen geliştiriciler için önemli bir adım. Açık kaynak yapısı, topluluk içinde hızlı iterasyon ve özelleştirme imkanı sunarak yapay zeka ekosisteminin çeşitliliğini artıracak.
Yapay zekâ tarafından üretilmiştir.