Gemini 3.8 Live ve 3.8 Live Extended Thinking Tanıtıldı: Google'dan Sesli Yapay Zekada Dev Atılım

Google DeepMind, sesli etkileşimleri daha doğal, akıcı ve akıllı hale getirmek amacıyla en gelişmiş canlı diyalog modelleri olan Gemini 3.8 Live ve 3.8 Live Extended Thinking'i duyurdu. Yeni modeller, karmaşık akıl yürütme, gerçek zamanlı görsel bağlam işleme ve arka planda görev yürütme yetenekleriyle hem geliştiriciler hem de son kullanıcılar için yapay zeka deneyimini önemli ölçüde ileri taşıyor. Bu yenilikler, Gemini API, Google Workspace ve Gemini uygulaması üzerinden kullanıma sunuldu.
Öne Çıkan Başlıklar
- Google DeepMind, gelişmiş canlı diyalog yeteneklerine sahip Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modellerini tanıttı.
- Gemini 3.8 Live Extended Thinking, Artificial Analysis'ın Konuşmadan Konuşmaya Kalite Endeksi'nde 82.6 puanla birincilik, τ-Voice'da %68.6 ve Big Bench Audio'da %97.7 skorlarıyla karmaşık akıl yürütmede öne çıkıyor.
- Gemini 3.8 Live, gerçek zamanlı görsel girdi işleme, 97 dil arası otomatik geçiş ve arka planda kesintisiz görev yürütme özellikleriyle akıcı ve maliyet etkin bir deneyim sunuyor.
- Modeller, Google Workspace (Docs Live, Gmail Live, Keep Live), Search Live ve Gemini uygulamasında entegre edilerek kullanıcıların sesli komutlarla karmaşık işleri halletmesini kolaylaştırıyor.
- Yapay zeka tarafından üretilen tüm sesler, şeffaflık ve yanlış bilginin önüne geçilmesi amacıyla SynthID filigranı ile işaretleniyor.
Google DeepMind, yapay zeka ile sesli etkileşimlerin geleceğine yönelik önemli bir adım atarak Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modellerini tanıttı. Bu modeller, bugüne kadarki en gelişmiş canlı diyalog yeteneklerini sunarak, kullanıcıların yapay zeka ile iş birliği yapmasını ve karmaşık görevleri sesli komutlarla yürütmesini daha sezgisel ve verimli hale getirmeyi hedefliyor. Gemini 3.8 Live, ölçeklenebilirlik ve maliyet etkinliği göz önünde bulundurularak tasarlanmış olup, akıcı diyalog ve görsel bağlamlandırmayı sohbet zekasıyla birleştirirken; Gemini 3.8 Live Extended Thinking ise yüksek karmaşıklıktaki görevler, artırılmış zeka ve çok adımlı akıl yürütme için optimize edildi.
Özellikle Gemini 3.8 Live Extended Thinking, kurumsal düzeyde görev tamamlama ve akıl yürütme yetenekleriyle dikkat çekiyor. Model, Artificial Analysis'ın Konuşmadan Konuşmaya Kalite Endeksi'nde 82.6 puanla genel birinciliği elde etti. Ayrıca, ajan yeteneğine dayalı görev tamamlama alanında τ-Voice benchmark'ında %68.6 ve Sierra'nın τ-Voice-banking benchmark'ında %35.1'lik oranlarla lider konumda bulunuyor. Model, karmaşık akıl yürütme kabiliyetlerini Big Bench Audio üzerinde %97.7'lik etkileyici bir skorla sergilerken, aynı zamanda diğer öncü modellere kıyasla rekabetçi bir fiyat noktası sunuyor. Bu model, “Let me check that…” gibi erken sözel ipuçlarıyla doğal etkileşimi sürdürürken, çok adımlı arka plan görevlerini canlı ilerleme anlatımıyla kullanıcılara aktarabiliyor.
Gemini 3.8 Live ise kullanıcılar arasında yüksek tercih oranıyla Speech Agent Arena'da ikincilik elde etti. Bu performansının yanı sıra, oldukça maliyet etkin bir yapıya sahip olması, geliştiricilere ve işletmelere ölçeklenebilir ve verimli bir model sunuyor. Model, yakın gerçek zamanlı görsel girdileri işleyerek konuşmaları bağlamsal olarak zenginleştiriyor ve daha yararlı yanıtlar sağlıyor. Sohbet sırasında 97 farklı dil arasında otomatik olarak geçiş yapabiliyor ve arka planda araçları ve API çağrılarını yürüterek, görevler tamamlanırken bile kesintisiz bir diyalog akışı sunuyor. ServiceNow'ın EVA-Bench'inde, modellerin doğruluk ile konuşma kalitesi arasında başarılı bir denge kurarak karmaşık iş akışları için Pareto Sınırı'nı ileri taşıdığı belirtiliyor.
Bu yeni modeller, Google Workspace, Search ve Gemini uygulamasında daha sezgisel ve işbirlikçi deneyimler sunuyor. Docs Live, Gmail Live ve Keep Live gibi Workspace entegrasyonları ile kullanıcılar, gerçek zamanlı sorun gidermeden iş planları oluşturmaya kadar çeşitli karmaşık görevleri sesli olarak halledebiliyor. Ayrıca, Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel ve Vision Agents gibi geliştirici platformları, Gemini Live API'sini kullanarak yüksek performanslı ses odaklı arayüzler oluşturabiliyor. Salesforce, Genspark ve Lumeris gibi şirketler de bu modellerin düşük gecikme süresi, akıcılığı ve araç çağırma yeteneklerinden etkilendiklerini belirtiyorlar.
Google, yapay zeka tarafından üretilen tüm seslerin SynthID ile filigranlandığını belirterek şeffaflık ve yanlış bilgi yayılımını önleme konusundaki taahhüdünü vurguluyor. Bu algılanamaz filigran, ses çıkışına doğrudan işlenerek, yapay zeka tarafından oluşturulan içeriğin tespit edilebilir kalmasını sağlıyor. Gemini 3.8 Live ve 3.8 Live Extended Thinking modelleri, geliştiriciler için Gemini API ve Google AI Studio'da, işletmeler için özel önizlemeyle Gemini Enterprise'da ve genel kullanıcılar için Search Live ve Gemini uygulaması gibi platformlarda kademeli olarak kullanıma sunuluyor.
Benchmark Sonuçları
| Model | Benchmark | Skor | Ayar |
|---|---|---|---|
| Gemini 3.8 Live Extended Thinking | Artificial Analysis' Speech to Speech Quality Index | 82.6 puan | - |
| Gemini 3.8 Live Extended Thinking | τ-Voice (agentic task completion) | 68.6 % | - |
| Gemini 3.8 Live Extended Thinking | Sierra’s τ-Voice-banking benchmark (agentic task completion) | 35.1 % | - |
| Gemini 3.8 Live Extended Thinking | Big Bench Audio (reasoning capabilities) | 97.7 % | - |
YZ Yorumu
Bu gelişme, sesli yapay zeka alanında Google'ın iddialı duruşunu güçlendiriyor ve sesli asistanların kapasitesini dramatik bir şekilde artırıyor. Geliştiriciler için daha zengin API'ler ve kurumsal çözümler sunarken, son kullanıcılar için de cihazlarıyla etkileşimlerini çok daha doğal ve verimli hale getirecek. Özellikle karmaşık görevlerdeki artan akıl yürütme yetenekleri, yapay zekanın sadece bilgi sağlayan değil, aynı zamanda aktif bir problem çözücü ve iş ortağı olabileceği yeni bir dönemin habercisidir.
Yapay zekâ tarafından üretilmiştir.