Anthropic ha lanzado el modelo Claude Opus 5, lo que ha provocado un escrutinio de su rendimiento en métricas de codificación y capacidades generales, junto con un renovado debate sobre la evaluación de modelos de vanguardia.

  • Epoch AI informó de que Claude Opus 5 alcanza un ECI de 159, ligeramente por debajo del 161 de Fable 5, mientras iguala a Fable 5 con un SWE-ECI de 161 en benchmarks de ingeniería de software.
  • Los usuarios criticaron la puntuación ECI por subestimar las mejoras prácticas, señalando que es solo un punto superior a Opus 4.8 a pesar de las ganancias cualitativas percibidas.
  • Se observó una irregularidad en la evaluación donde Opus 5 obtuvo mejores resultados en FrontierCode con esfuerzo medio que con esfuerzo alto, lo que sugiere ganancias no monótonas derivadas del cómputo adicional en el tiempo de inferencia.
  • El CTO de Microsoft, Kevin Scott, informó de una victoria directa contra Fable utilizando muestreo "best-of-n", mientras que Nous Portal anunció el acceso al modelo con un descuento del 20%.

El lanzamiento pone de manifiesto la tensión entre las puntuaciones agregadas de los benchmarks y el rendimiento reportado por los usuarios en tareas agénticas como la automatización de navegadores.