Yapay Zekâ Değerlendirme Platformu Arena, Değerlemesini 10 Ayda 3,1 Milyar Dolara Çıkardı

UC Berkeley kökenli yapay zekâ kıyaslama platformu Arena, Lightspeed Venture Partners ve Khosla Ventures liderliğinde gerçekleşen B Serisi yatırım turunda 200 milyon dolar toplayarak 3,1 milyar dolar değerlemeye ulaştı. Yıllıklandırılmış gelirini 100 milyon dolara çıkaran şirket, yalnızca 10 ay içerisinde piyasa değerini neredeyse ikiye katlamış oldu.
Öne Çıkan Başlıklar
- Arena, Seri B yatırım turunda 200 milyon dolar toplayarak değerlemesini 10 ayda 1,7 milyar dolardan 3,1 milyar dolara yükseltti.
- Şirketin yıllıklandırılmış geliri (ARR) Haziran ayı itibarıyla 100 milyon dolara ulaştı.
- Statik benchmark testlerinin modeller tarafından manipüle edilmesi, kitle kaynaklı ve tarafsız Arena değerlendirmelerine talebi patlattı.
- Platforma; yetkisiz eylemleri, sahte alıntıları ve aldatıcı tamamlamaları puanlayan yeni bir 'Hizalanma' (Alignment) liderlik tablosu eklendi.
- Ön hizalanma sıralamasında OpenAI modelleri tepeye yerleşirken, Claude Opus 5.5 altıncı ve Claude Fable dokuzuncu oldu.
2023 yılında UC Berkeley çatısı altında bir kitle kaynaklı (crowdsourcing) araştırma projesi olarak doğan ve kullanıcıların modelleri kör testlerle kıyaslamasına imkân tanıyan Arena, kurumsal dünyada devasa bir oyuncuya dönüştü. Şirket, aralarında Salesforce Ventures, Dell Technologies Capital, a16z ve Felicis gibi dev fonların da yer aldığı Seri B turunda 200 milyon dolar yatırım aldığını duyurdu. Bu gelişme, platformun Haziran ayı itibarıyla yıllık bazda 100 milyon dolarlık düzenli gelire (ARR) ulaşmasının hemen ardından geldi. Ocak ayındaki Seri A turunda 1,7 milyar dolar değerlemeyle 150 milyon dolar toplayan girişim, böylece yaklaşık 10 ayda değerini neredeyse iki katına çıkarmış oldu. Şirketin bu denli hızlı büyümesinin arkasında, geleneksel ve statik yapay zekâ kıyaslama (benchmark) testlerinin giderek güvenilmez hâle gelmesi yatıyor. Birçok büyük yapay zekâ laboratuvarının modellerini mevcut test setlerine göre optimize etmesi veya test verilerinin modellere sızması (benchmark gaming), standart skorların gerçek kullanıcı deneyimini yansıtmasını engellemeye başladı. Aynı zamanda kurumsal şirketler, teorik skorlar yerine kendi iş yüklerine en uygun modelleri nesnel olarak belirleyebilmek için güvenilir üçüncü taraf analizlerine ihtiyaç duyuyor. Arena, sunduğu ticari 'AI Evaluations' analitik hizmetiyle bu kurumsal boşluğu başarıyla dolduruyor. Büyüme hamlesiyle birlikte Arena, platformuna yeni bir 'Hizalanma' (Alignment) kategorisi eklediğini de duyurdu. Bu yeni liderlik tablosu; modellerin kullanıcı talimatı olmadan eylem gerçekleştirmesi (yetkisiz eylem), yanlış kaynak gösterme ve yapmadığı işleri yapmış gibi gösterme (aldatıcı tamamlama) gibi kritik güvenlik açıklarını derecelendiriyor. İlk hizalanma sıralamasında OpenAI modelleri zirvede yer alırken, Claude Opus 5.5 altıncı, Claude Fable ise dokuzuncu sırada kendine yer buldu.
Benchmark Sonuçları
| Model | Benchmark | Skor | Ayar |
|---|---|---|---|
| Claude Opus 5.5 | Arena Alignment Leaderboard | 6 sıra | Preliminary alignment leaderboard ranking |
| Claude Fable | Arena Alignment Leaderboard | 9 sıra | Preliminary alignment leaderboard ranking |
YZ Yorumu
Arena'nın yakaladığı bu finansal başarı, yapay zekâ sektöründe 'model değerlendirme ve doğrulama' pazarının başlı başına devasa bir endüstriye dönüştüğünü gösteriyor. Sentetik ve statik testlerin kandırılabildiği bir ortamda, gerçek insan etkileşimine dayalı bağımsız denetim mekanizmaları hem kurumsal alıcılar hem de güvenlik standartları için vazgeçilmez bir referans hâline geliyor.
Yapay zekâ tarafından üretilmiştir.