Аудит ChatGPT, Claude и Gemini показывает, что метрики оценки по API не переносятся надёжно на развернутые интерфейсы чат-ботов. Исследование выявляет «разрыв контекстной валидности», при котором измерения на основе API систематически отличаются от реального использования.

  • Оценки по API показывают точность на 3,4 процентных пункта выше, чем оценки интерфейсов.
  • Согласованность тест-ретест для доступа по API на 2,1 процентного пункта выше, чем для доступа через интерфейс.
  • Для ChatGPT падение производительности при переключении на интерфейс превышает разницу между GPT 5.3 и GPT 5.4.
  • Настройка системных промптов, параметров сэмплирования и настроек рассуждения через управление API не гарантирует устранение этого разрыва в производительности.

Эти результаты усложняют использование оценок API в качестве прокси для развернутых систем, указывая на то, что баллы бенчмарков могут завышать реальные возможности для конечных пользователей.