Anthropic ha lanzado Claude Opus 5, un nuevo modelo de vanguardia que ha generado un debate significativo sobre las puntuaciones en benchmarks y el rendimiento práctico. Evaluaciones independientes de Epoch AI reportan un Índice de Capacidades Epoch (ECI) de 159 y un SWE-ECI de 161 para el nuevo modelo.
- Claude Opus 5 alcanza un ECI de 159, ligeramente por debajo de la puntuación de Fable 5, que es de 161.
- El modelo iguala a Fable 5 en los benchmarks de ingeniería de software con un SWE-ECI de 161.
- Los comentarios de la comunidad sugieren que la puntuación ECI subestima las mejoras prácticas de Opus 5 frente a Opus 4.8, que obtuvo una puntuación solo un punto inferior.
- Algunos evaluadores notaron un rendimiento no monótono en FrontierCode, donde las entradas de esfuerzo medio superaron a las de alto esfuerzo.
- Nous Portal ha puesto el modelo disponible con un descuento del 20% en todos los modelos.
El lanzamiento destaca los debates continuos sobre la sensibilidad de las métricas de evaluación actuales y la brecha entre las puntuaciones agregadas y las capacidades reales de los agentes de codificación.