Anthropic a lancé le modèle Claude Opus 5, déclenchant un examen de ses performances sur les métriques de codage et de capacités générales ainsi qu'un regain de débat sur l'évaluation des modèles de pointe.

  • Epoch AI a signalé que Claude Opus 5 atteint un ECI de 159, légèrement inférieur à celui de Fable 5 (161), tout en égalant Fable 5 avec un SWE-ECI de 161 sur les benchmarks d'ingénierie logicielle.
  • Les utilisateurs ont critiqué le score ECI pour avoir minimisé les améliorations pratiques, notant qu'il n'est supérieur que d'un point à celui d'Opus 4.8 malgré des gains qualitatifs perçus.
  • Une irrégularité dans l'évaluation a été relevée : Opus 5 a obtenu de meilleurs résultats sur FrontierCode avec un effort moyen qu'avec un effort élevé, suggérant des gains non monotones liés au calcul supplémentaire au moment de l'inférence.
  • Le CTO de Microsoft, Kevin Scott, a signalé une victoire en duel direct contre Fable grâce à l'échantillonnage « best-of-n », tandis que Nous Portal a annoncé l'accès au modèle avec une remise de 20 %.

Le lancement met en lumière la tension entre les scores agrégés des benchmarks et les performances rapportées par les utilisateurs dans des tâches agentic telles que l'automatisation de navigateur.