OpenAIは、現実的なメンタルヘルス会話においてAIシステムがどのように対応するかを評価するために設計されたオープンベンチマークであるMentalHealthBenchを導入した。22カ国から80人以上の資格を持つメンタルヘルスの専門家が関与して開発されたこのベンチマークは、安全性、文脈の探求、ユーザーの自律性の維持といった重要な行動面におけるモデルの能力を評価する。
- データセットには、大人、ティーンエイジャー、介護者、臨床医を対象とした、非急性、高重症度、および緊急シナリオを含む合成会話が収録されている。
- 評価基準は専門家が加重ルーブリックシステムを用いて策定し、回答はGPT-5.6 Solによって採点された。
- 別の分析では、専門家のガイダンスとユーザーの好みを比較した結果、ユーザーは専門家よりも実践的な次のステップやトーンを重視していることが明らかになった。
- このベンチマークにより、モデル行動の10の次元にわたる多面的な測定が可能になり、改善すべき特定の領域を特定できる。
MentalHealthBenchは、研究者や開発者が既存のモデルのギャップを検証し、メンタルヘルスの文脈における安全で有用なAIサポートの高い基準に向けて取り組むための共有ツールを提供する。