Claude Opus 5 est nettement plus performant que Claude Opus 4.8 dans tous les domaines, avec les gains les plus importants en codage agentique, utilisation d'ordinateur et travail de connaissance sur le long terme. Il établit un nouvel état de l'art sur plusieurs benchmarks tiers et est comparable ou supérieur à Claude Fable 5 et Claude Mythos 5 sur de nombreuses évaluations.

  • Opus 5 est présenté comme étant aussi bon ou meilleur que Fable 5 sur des tâches pratiques, tout en étant plus rapide et coûtant la moitié du prix.
  • Le modèle a délibérément évité l'entraînement sur des tâches liées au cyber, ce qui signifie qu'il manque de la capacité complète pour les attaques informatiques complexes trouvée dans les modèles de classe Mythos.
  • Sur les évaluations de virologie, Opus 5 semble légèrement meilleur que Mythos 5, car ces tâches impliquent des étapes individuelles plutôt que de nécessiter un raisonnement à grande échelle.
  • ArtificialAnalysis évalue Opus 5 à un nouveau record de 61, et l'estimation ponctuelle ECI d'Anthropic est de 162.1, le plaçant sur la courbe de tendance Mythos.

L'article suggère que rester de taille Opus et éviter l'entraînement cyber fournit du temps aux défenseurs pour accéder à des outils supérieurs avec des classificateurs qui se déclenchent 85 % moins souvent que ceux de Fable.