OpenAI 推出了 MentalHealthBench,这是一个开放基准,旨在评估 AI 系统在真实心理健康对话中的表现。该基准由来自 22 个国家的 80 多名持证心理健康专家共同开发,评估模型在安全性、上下文寻求以及维护用户自主权等关键行为方面的能力。
- 数据集包含针对成人、青少年、护理人员和临床医生的非急性、高急性和紧急情况下的合成对话。
- 评估标准由专家使用加权评分系统制定,回应由 GPT-5.6 Sol 进行评分。
- 一项独立分析比较了专家指导与用户偏好,发现用户比专家更重视实用的下一步骤和语气。
- 该基准允许对模型行为的十个维度进行多方面测量,以识别具体的改进领域。
MentalHealthBench 为研究人员和开发者提供了一个共享工具,用于审视现有模型的不足,并致力于在心理健康背景下实现更高标准的安全、有用的 AI 支持。