OpenAI представила MentalHealthBench, открытый бенчмарк, предназначенный для оценки того, как системы ИИ реагируют в реалистичных разговорах о психическом здоровье. Разработанный при участии более 80 лицензированных специалистов по психическому здоровью из 22 стран, этот бенчмарк оценивает возможности моделей по ключевым аспектам, таким как безопасность, поиск контекста и сохранение автономии пользователя.
- Набор данных включает синтетические разговоры, охватывающие сценарии неострой, высокой степени тяжести и экстренные ситуации для взрослых, подростков, опекунов и клиницистов.
- Критерии оценки были установлены экспертами с использованием системы взвешенных рубрик, а ответы оценивались моделью GPT-5.6 Sol.
- Отдельный анализ сравнил рекомендации экспертов с предпочтениями пользователей, выявив, что пользователи больше ценят практические следующие шаги и тон общения, чем эксперты.
- Бенчмарк позволяет проводить многомерную оценку по десяти измерениям поведения модели для выявления конкретных областей для улучшения.
MentalHealthBench предоставляет общий инструмент для исследователей и разработчиков, чтобы изучать пробелы в существующих моделях и работать над более высокими стандартами безопасной и полезной ИИ-поддержки в контекстах психического здоровья.