OpenAI ने MentalHealthBench पेश किया है, एक खुला बेंचमार्क जो इस बात का मूल्यांकन करने के लिए डिज़ाइन किया गया है कि AI सिस्टम यथार्थवादी मानसिक स्वास्थ्य संवादों में कैसे प्रतिक्रिया करते हैं। 22 देशों से 80 से अधिक लाइसेंस प्राप्त मानसिक स्वास्थ्य विशेषज्ञों के साथ विकसित, यह बेंचमार्क सुरक्षा, संदर्भ खोजने और उपयोगकर्ता की स्वतंत्रता बनाए रखने जैसे प्रमुख व्यवहारों में मॉडल क्षमताओं का आकलन करता है।

  • डेटासेट में वयस्कों, किशोरों, देखभालकर्ताओं और चिकित्सकों के लिए गैर-तत्काल, उच्च-गंभीर और आपातकालीन परिदृश्यों को कवर करने वाले संवाहिक संवाद शामिल हैं।
  • विशेषज्ञों द्वारा भारित रबरिक्स प्रणाली का उपयोग करके मूल्यांकन मानदंड स्थापित किए गए, जिसमें प्रतिक्रियाओं का ग्रेड GPT-5.6 Sol द्वारा दिया गया।
  • एक अलग विश्लेषण ने विशेषज्ञ मार्गदर्शन की तुलना उपयोगकर्ता प्राथमिकताओं से की, जिससे पता चला कि उपयोगकर्ता विशेषज्ञों की तुलना में व्यावहारिक अगले कदमों और लहजे को अधिक महत्व देते हैं।
  • बेंचमार्क विशिष्ट सुधार क्षेत्रों की पहचान करने के लिए मॉडल व्यवहार के दस आयामों में बहुआयामी मापन की अनुमति देता है।

MentalHealthBench शोधकर्ताओं और डेवलपर्स के लिए एक साझा उपकरण प्रदान करता है जो मौजूदा मॉडलों में अंतराल का निरीक्षण कर सकें और मानसिक स्वास्थ्य संदर्भों में सुरक्षित, उपयोगी AI सहायता के लिए उच्च मानकों की ओर काम कर सकें।