OpenAI a présenté MentalHealthBench, un benchmark ouvert conçu pour évaluer la manière dont les systèmes d'IA répondent dans des conversations réalistes sur la santé mentale. Développé avec plus de 80 experts en santé mentale agréés provenant de 22 pays, ce benchmark évalue les capacités des modèles sur des comportements clés tels que la sécurité, la recherche de contexte et le maintien de l'autonomie de l'utilisateur.
- Le jeu de données inclut des conversations synthétiques couvrant des scénarios non aigus, à haute acuité et d'urgence pour les adultes, les adolescents, les aidants et les cliniciens.
- Les critères d'évaluation ont été établis par des experts à l'aide d'un système de grille pondérée, avec des réponses notées par GPT-5.6 Sol.
- Une analyse distincte a comparé les recommandations des experts aux préférences des utilisateurs, révélant que les utilisateurs accordent plus d'importance aux prochaines étapes pratiques et au ton qu'aux experts.
- Le benchmark permet une mesure multifacette sur dix dimensions du comportement des modèles afin d'identifier des domaines spécifiques à améliorer.
MentalHealthBench fournit un outil partagé pour les chercheurs et les développeurs afin d'examiner les lacunes des modèles existants et de travailler vers des normes plus élevées pour un soutien IA sûr et utile dans les contextes de santé mentale.