يكشف تدقيق ChatGPT وClaude وGemini عن أن مقاييس تقييم واجهة برمجة التطبيقات لا تنتقل بشكل موثوق إلى واجهات روبوتات الدردشة المُنفذة. تحدد الدراسة "فجوة صحة السياق" حيث تختلف القياسات المستندة إلى واجهة برمجة التطبيقات بشكل منهجي عن الاستخدام الفعلي.
- تحقق تقييمات واجهة برمجة التطبيقات دقة أعلى بنسبة 3.4 نقطة مئوية من تقييمات الواجهة.
- يتوافق اختبار إعادة الاختبار بنسبة 2.1 نقطة مئوية أكثر للوصول إلى واجهة برمجة التطبيقات مقارنة بالوصول إلى الواجهة.
- بالنسبة لـ ChatGPT، فإن انخفاض الأداء عند التبديل إلى واجهة يتجاوز الفرق بين GPT 5.3 وGPT 5.4.
- لا يؤدي ضبط إرشادات النظام ومعلمات أخذ العينات وإعدادات الاستدلال عبر تحكمات واجهة برمجة التطبيقات إلى القضاء على هذه الفجوة في الأداء بشكل موثوق.
تُعقّد هذه النتائج استخدام تقييمات واجهة برمجة التطبيقات كبدائل للأنظمة المُنفذة، مما يشير إلى أن نتائج المعايير قد تُبالغ في تقدير القدرات الفعلية الموجهة للمستخدم.