OpenAI представила MentalHealthBench, открытый бенчмарк, предназначенный для оценки того, как системы ИИ реагируют в реалистичных разговорах о психическом здоровье. Разработанный при участии более 80 лицензированных специалистов по психическому здоровью из 22 стран, этот бенчмарк оценивает возможности моделей по ключевым аспектам, таким как безопасность, поиск контекста и сохранение автономии пользователя.

  • Набор данных включает синтетические разговоры, охватывающие сценарии неострой, высокой степени тяжести и экстренные ситуации для взрослых, подростков, опекунов и клиницистов.
  • Критерии оценки были установлены экспертами с использованием системы взвешенных рубрик, а ответы оценивались моделью GPT-5.6 Sol.
  • Отдельный анализ сравнил рекомендации экспертов с предпочтениями пользователей, выявив, что пользователи больше ценят практические следующие шаги и тон общения, чем эксперты.
  • Бенчмарк позволяет проводить многомерную оценку по десяти измерениям поведения модели для выявления конкретных областей для улучшения.

MentalHealthBench предоставляет общий инструмент для исследователей и разработчиков, чтобы изучать пробелы в существующих моделях и работать над более высокими стандартами безопасной и полезной ИИ-поддержки в контекстах психического здоровья.