A OpenAI apresentou o MentalHealthBench, um benchmark aberto projetado para avaliar como os sistemas de IA respondem em conversas realistas sobre saúde mental. Desenvolvido com mais de 80 especialistas licenciados em saúde mental de 22 países, o benchmark avalia as capacidades dos modelos em comportamentos-chave, como segurança, busca de contexto e preservação da autonomia do usuário.

  • O conjunto de dados inclui conversas sintéticas cobrindo cenários não agudos, de alta gravidade e emergências para adultos, adolescentes, cuidadores e clínicos.
  • Os critérios de avaliação foram estabelecidos por especialistas usando um sistema de rubrica ponderada, com respostas classificadas pelo GPT-5.6 Sol.
  • Uma análise separada comparou as orientações dos especialistas com as preferências dos usuários, revelando que os usuários valorizam mais os próximos passos práticos e o tom do que os especialistas.
  • O benchmark permite uma medição multifacetada em dez dimensões do comportamento do modelo para identificar áreas específicas de melhoria.

O MentalHealthBench fornece uma ferramenta compartilhada para pesquisadores e desenvolvedores examinarem lacunas nos modelos existentes e trabalharem rumo a padrões mais elevados de suporte de IA seguro e útil em contextos de saúde mental.