Uma auditoria do ChatGPT, Claude e Gemini revela que as métricas de avaliação por API não se transferem de forma confiável para interfaces de chatbots implantadas. O estudo identifica uma "lacada de validade contextual" onde as medições baseadas em API diferem sistematicamente do uso real.

  • As avaliações de API pontuam 3,4 pontos percentuais a mais em precisão do que as avaliações de interface.
  • A concordância teste-reteste é 2,1 pontos percentuais maior para acesso por API comparado ao acesso à interface.
  • Para o ChatGPT, a queda de desempenho ao mudar para uma interface excede a diferença entre GPT 5.3 e GPT 5.4.
  • Ajustar prompts do sistema, parâmetros de amostragem e configurações de raciocínio via controles de API não elimina confiavelmente essa lacuna de desempenho.

Essas descobertas complicam o uso de avaliações de API como proxies para sistemas implantados, indicando que as pontuações de benchmark podem superestimar as capacidades reais voltadas ao usuário.