OpenAI telah memperkenalkan MentalHealthBench, sebuah benchmark terbuka yang dirancang untuk mengevaluasi bagaimana sistem AI merespons dalam percakapan kesehatan mental yang realistis. Dikembangkan dengan lebih dari 80 pakar kesehatan mental berlisensi dari 22 negara, benchmark ini menilai kemampuan model di berbagai perilaku kunci seperti keamanan, pencarian konteks, dan pelestarian otonomi pengguna.

  • Dataset mencakup percakapan sintetis yang mencakup skenario non-akut, akuitas tinggi, dan darurat untuk orang dewasa, remaja, pengasuh, dan klinisi.
  • Kriteria evaluasi ditetapkan oleh para pakar menggunakan sistem rubrik berbobot, dengan respons dinilai oleh GPT-5.6 Sol.
  • Analisis terpisah membandingkan panduan pakar dengan preferensi pengguna, mengungkapkan bahwa pengguna lebih menghargai langkah praktis dan nada daripada yang dilakukan pakar.
  • Benchmark ini memungkinkan pengukuran multifaset di sepuluh dimensi perilaku model untuk mengidentifikasi area spesifik yang perlu ditingkatkan.

MentalHealthBench menyediakan alat bersama bagi peneliti dan pengembang untuk memeriksa kesenjangan pada model yang ada dan berupaya menuju standar yang lebih tinggi untuk dukungan AI yang aman dan bermanfaat dalam konteks kesehatan mental.