Una auditoría de ChatGPT, Claude y Gemini revela que las métricas de evaluación por API no se transfieren de forma fiable a las interfaces de chatbots desplegadas. El estudio identifica una "brecha de validez contextual" donde las mediciones basadas en API difieren sistemáticamente del uso real.

  • Las evaluaciones de API obtienen un 3,4 puntos porcentuales más de precisión que las evaluaciones de interfaz.
  • La concordancia test-retest es un 2,1 puntos porcentuales mayor para el acceso por API en comparación con el acceso a la interfaz.
  • Para ChatGPT, la caída de rendimiento al cambiar a una interfaz supera la diferencia entre GPT 5.3 y GPT 5.4.
  • Ajustar los prompts del sistema, los parámetros de muestreo y los ajustes de razonamiento mediante controles de API no elimina fiablemente esta brecha de rendimiento.

Estos hallazgos complican el uso de evaluaciones de API como sustitutos de sistemas desplegados, indicando que las puntuaciones de benchmarks pueden sobreestimar las capacidades reales面向 al usuario.