Un audit de ChatGPT, Claude et Gemini révèle que les métriques d'évaluation par API ne se transfèrent pas de manière fiable vers les interfaces de chatbot déployées. L'étude identifie un "écart de validité contextuelle" où les mesures basées sur l'API diffèrent systématiquement de l'utilisation réelle.
- Les évaluations API marquent 3,4 points de pourcentage de plus en précision que les évaluations d'interface.
- L'accord test-retest est de 2,1 points de pourcentage supérieur pour l'accès API par rapport à l'accès interface.
- Pour ChatGPT, la baisse de performance lors du passage à une interface dépasse la différence entre GPT 5.3 et GPT 5.4.
- L'ajustement des prompts système, des paramètres d'échantillonnage et des réglages de raisonnement via les contrôles API n'élimine pas de manière fiable cet écart de performance.
Ces résultats compliquent l'utilisation des évaluations API comme substituts pour les systèmes déployés, indiquant que les scores de benchmark peuvent surestimer les capacités réelles面向 à l'utilisateur.