Anthropic выпустила модель Claude Opus 5, что привело к пристальному вниманию к её производительности в задачах программирования и общих показателях, а также к возобновлению дискуссий об оценке моделей переднего края.

  • Epoch AI сообщила, что Claude Opus 5 достигает ECI 159, что немного ниже показателя Fable 5 (161), при этом она сопоставима с Fable 5 по SWE-ECI 161 на бенчмарках в области разработки программного обеспечения.
  • Пользователи раскритиковали показатель ECI за недооценку практических улучшений, отметив, что он всего на один балл лучше, чем у Opus 4.8, несмотря на воспринимаемые качественные улучшения.
  • Было отмечено нарушение в оценке: Opus 5 показала лучшие результаты на FrontierCode при среднем уровне усилий, чем при высоком, что указывает на немонотонный рост эффективности от дополнительного вычислительного ресурса во время вывода.
  • Технический директор Microsoft Кевин Скотт сообщил о победе в прямом сравнении с Fable с использованием выборки "best-of-n", а Nous Portal объявил о доступе к модели со скидкой 20%.

Запуск подчеркивает напряжение между агрегированными результатами бенчмарков и производительностью, сообщаемой пользователями, в агентных задачах, таких как автоматизация браузера.