أطلقت OpenAI منصة MentalHealthBench، وهي معيار مفتوح مصمم لتقييم كيفية استجابة أنظمة الذكاء الاصطناعي في محادثات الصحة النفسية الواقعية. تم تطوير المعيار بالتعاون مع أكثر من 80 خبيرًا مرخصًا في الصحة النفسية من 22 دولة، ويقيس قدرات النماذج عبر سلوكيات رئيسية مثل السلامة، والبحث عن السياق، والحفاظ على وكالة المستخدم.

  • تتضمن المجموعة بيانات محادثات اصطناعية تغطي حالات غير حادة، وحالات عالية الخطورة، وحالات طوارئ للبالغين والمراهقين ومقدمي الرعاية والأطباء.
  • تم وضع معايير التقييم من قبل الخبراء باستخدام نظام قائمة مرجحة ذات أوزان، وتم تقييم الاستجابات بواسطة GPT-5.6 Sol.
  • قارفت تحليل منفصل بين إرشادات الخبراء وتفضيلات المستخدمين، وكشف أن المستخدمين يقدّرون الخطوات العملية التالية والنبرة أكثر مما يفعله الخبراء.
  • يسمح المعيار بقياس متعدد الأبعاد عبر عشرة أبعاد لسلوك النموذج لتحديد مجالات محددة للتحسين.

توفر MentalHealthBench أداة مشتركة للباحثين والمطورين لفحص الفجوات في النماذج الحالية والعمل نحو معايير أعلى لدعم الذكاء الاصطناعي الآمن والمفيد في سياقات الصحة النفسية.