Claude Opus 5 es sustancialmente más fuerte que Claude Opus 4.8 en todos los aspectos, con las mayores mejoras en codificación agéntica, uso de computadoras y trabajo de conocimiento a largo plazo. Establece un nuevo estado del arte en varios benchmarks de terceros y es comparable o superior a Claude Fable 5 y Claude Mythos 5 en muchas evaluaciones.

  • Opus 5 se presenta como igual o mejor que Fable 5 en tareas prácticas, mientras es más rápido y cuesta la mitad.
  • El modelo evitó deliberadamente el entrenamiento en tareas relacionadas con ciberseguridad, lo que significa que carece de la capacidad completa para ofensa cibernética compleja encontrada en modelos de clase Mythos.
  • En evaluaciones de virología, Opus 5 parece marginalmente mejor que Mythos 5, ya que estas tareas implican pasos individuales en lugar de requerir razonamiento a gran escala.
  • ArtificialAnalysis califica a Opus 5 con un nuevo máximo de 61, y la estimación puntual del ECI de Anthropic es 162.1, colocándolo en la línea de tendencia de Mythos.

El artículo sugiere que mantener el tamaño de Opus y evitar el entrenamiento cibernético proporciona tiempo a los defensores para acceder a herramientas superiores con clasificadores que se activan un 85% menos que las de Fable.