ChatGPT, Claude और Gemini की एक ऑडिट यह दर्शाती है कि API मूल्यांकन मानक तैनात चैटबॉट इंटरफ़ेस पर भरोसेमंदी से स्थानांतरित नहीं होते हैं। अध्ययन में एक "संदर्भ-वैधता अंतराल" की पहचान की गई है जहाँ API-आधारित माप वास्तविक उपयोग से व्यवस्थित रूप से भिन्न होते हैं।
- API मूल्यांकन सटीकता में इंटरफ़ेस मूल्यांकन से 3.4 प्रतिशत अंक अधिक स्कोर करते हैं।
- API एक्सेस के लिए टेस्ट-रीटेस्ट सहमति, इंटरफ़ेस एक्सेस की तुलना में 2.1 प्रतिशत अंक अधिक है।
- ChatGPT के लिए, इंटरफ़ेस पर स्विच करने से प्रदर्शन में गिरावट GPT 5.3 और GPT 5.4 के बीच के अंतर से अधिक है।
- API नियंत्रणों के माध्यम से सिस्टम प्रॉम्प्ट, सैंपलिंग पैरामीटर और तर्क सेटिंग्स को समायोजित करना इस प्रदर्शन अंतराल को भरोसेमंदी से समाप्त नहीं करता है।
ये निष्कर्ष तैनात प्रणालियों के लिए API मूल्यांकन को प्रतिस्थापन के रूप में उपयोग करने की जटिलता बढ़ाते हैं, यह संकेत देते हुए कि बेंचमार्क स्कोर वास्तविक उपयोगकर्ता-मुख्य क्षमताओं को अधिक आंकित कर सकते हैं।