Anthropic a publié Claude Opus 5, un nouveau modèle de pointe qui a suscité d'importants débats sur les scores aux benchmarks et les performances pratiques. Des évaluations indépendantes d'Epoch AI rapportent un Epoch Capabilities Index (ECI) de 159 et un SWE-ECI de 161 pour le nouveau modèle.

  • Claude Opus 5 atteint un ECI de 159, légèrement inférieur au score de 161 de Fable 5.
  • Le modèle égale Fable 5 sur les benchmarks d'ingénierie logicielle avec un SWE-ECI de 161.
  • Les retours de la communauté suggèrent que le score ECI sous-estime les améliorations pratiques d'Opus 5 par rapport à Opus 4.8, qui n'était qu'un point en dessous.
  • Certains évaluateurs ont noté des performances non monotones sur FrontierCode, où les entrées de moyenne difficulté ont surpassé celles de haute difficulté.
  • Nous Portal a rendu le modèle disponible avec une remise de 20 % sur tous les modèles.

Le lancement met en lumière les débats persistants sur la sensibilité des métriques d'évaluation actuelles et l'écart entre les scores agrégés et les capacités réelles des agents de codage.