Resmi AçıklamaOpenAI23 Eylül 2026

MentalHealthBench Tanıtıldı: AI’nın Ruh Sağlığı Konuşmalarındaki Performansını Ölçen Yeni Açık Benchmark

MentalHealthBench Tanıtıldı: AI’nın Ruh Sağlığı Konuşmalarındaki Performansını Ölçen Yeni Açık Benchmark

OpenAI, dünya çapında 80'den fazla lisanslı ruh sağlığı uzmanı ile ortaklaşa geliştirdiği MentalHealthBench'i duyurdu. Bu açık benchmark, yapay zekâların gerçekçi ruh sağlığı diyaloglarındaki güvenlik, bağlam toplama, kullanıcı özerkliği ve eyleme geçirilebilir rehberlik gibi kritik davranışlarını ölçmeyi amaçlıyor.

Öne Çıkan Başlıklar

  • MentalHealthBench, 80+ lisanslı ruh sağlığı uzmanı tarafından ortaklaşa oluşturulmuş 22 ülkeden kapsamlı bir benchmark seti sunuyor.
  • Benchmark, düşük‑akut, yüksek‑akut ve acil durum senaryolarını kapsayarak modellerin bağlam toplama, kullanıcı özerkliği ve güvenli yönlendirme becerilerini ölçüyor.
  • Uzmanların belirlediği -10/+10 ağırlıklı rubrik kriterleriyle model yanıtları otomatik olarak GPT‑5.6 Sol tarafından puanlanıyor.
  • Kullanıcı araştırması, pratik adımlar ve tonun uzman odaklı değerlendirmelerden farklı olarak önemli olduğunu ortaya koydu.

OpenAI, haftada bir milyardan fazla kullanıcıya hizmet veren ChatGPT'nin, ilişki sorunları, günlük stres ve kriz durumları gibi çeşitli ruh sağlığı konularında daha duyarlı ve güvenli yanıtlar vermesini sağlamak için MentalHealthBench adlı yeni bir değerlendirme çerçevesi geliştirdi. Bu benchmark, acil durumların ötesinde, düşük- ve yüksek akutluk seviyelerindeki konuşmaları kapsayan geniş bir senaryo yelpazesi sunuyor; yetişkinler, ergenler, bakım verenler ve klinisyenler gibi farklı kullanıcı profilleri ve 19 dildeki kültürel bağlamlar da dahil edildi.

Senaryolar, gizlilik koruyucu tekniklerle oluşturulmuş sentetik diyaloglardan oluşuyor ve bazıları kullanıcıların aile kaybı gibi geçmiş bilgilerini içeriyor, böylece modellerin bu bağlamı ne kadar iyi kullandığı ölçülüyor. Her bir diyalog, en az üç uzman tarafından inceleniyor; uzmanlar, model yanıtlarını değerlendirmek için -10 ile +10 arasında ağırlıklı rubrik kriterleri belirliyor. Ortak bir yargıya varılan kriterler benchmarka dahil ediliyor ve yanıtlar, otomatik bir derecelendirici olan GPT‑5.6 Sol tarafından puanlanıyor.

OpenAI, farklı sağlayıcıların en yeni modellerini (Eylül 2026 itibarıyla) MentalHealthBench üzerinde test etti ve sonuçların model davranışlarının zaman içinde iyileştiğini gösterdi. Özellikle bağlam sorgulama yeteneği ve uygun kriz yönlendirmeleri gibi alanlarda ilerlemeler kaydedildi. Bununla birlikte, kullanıcı deneyimi araştırması da yapıldı; 44 yetişkin katılımcı, uzmanların yüksek puan verdiği yanıtların bazen soğuk algılanabileceğini ve pratik adımlar ile tonun kullanıcılar için daha değerli olduğunu belirtti.

MentalHealthBench'in açık olarak yayınlanması, araştırmacıların metodolojiyi incelemesini, kendi değerlendirmelerini yürütmesini ve eksik noktaları tespit ederek modelleri geliştirmesini hedefliyor. OpenAI ayrıca kriz hatları, Trusted Contact ve ChatGPT for Teens gibi destek mekanizmalarını güçlendirmeye devam ediyor, böylece yapay zekâların uzun vadeli refah ve güvenlik odaklı bir ekosisteme katkısı artırılıyor.

YZ Yorumu

MentalHealthBench, AI destekli ruh sağlığı hizmetlerinin kalitesini ölçmek için gerekli bir araç olarak sektöre yön veriyor; geliştiriciler bu benchmark sayesinde eksik yönlerini net bir şekilde görebilirken, kullanıcılar daha güvenli ve empatik yanıtlar bekleyebilecek.

Yapay zekâ tarafından üretilmiştir.