OpenAI ha presentado MentalHealthBench, un benchmark abierto diseñado para evaluar cómo los sistemas de IA responden en conversaciones realistas sobre salud mental. Desarrollado con más de 80 expertos en salud mental licenciados de 22 países, el benchmark evalúa las capacidades del modelo en comportamientos clave como la seguridad, la búsqueda de contexto y la preservación de la agencia del usuario.

  • El conjunto de datos incluye conversaciones sintéticas que cubren escenarios no agudos, de alta agudeza y de emergencia para adultos, adolescentes, cuidadores y clínicos.
  • Los criterios de evaluación fueron establecidos por expertos utilizando un sistema de rúbrica ponderada, con respuestas calificadas por GPT-5.6 Sol.
  • Un análisis separado comparó las directrices de los expertos con las preferencias de los usuarios, revelando que los usuarios valoran más los próximos pasos prácticos y el tono que los expertos.
  • El benchmark permite una medición multifacética en diez dimensiones del comportamiento del modelo para identificar áreas específicas de mejora.

MentalHealthBench proporciona una herramienta compartida para que investigadores y desarrolladores examinen las lagunas en los modelos existentes y trabajen hacia estándares más altos para un apoyo de IA seguro y útil en contextos de salud mental.