Anthropic выпустила Claude Opus 5, новую модель переднего края, которая вызвала значительные дискуссии относительно результатов бенчмарков и практической производительности. Независимые оценки от Epoch AI сообщают о Индексе возможностей Epoch (ECI) 159 и SWE-ECI 161 для новой модели.

  • Claude Opus 5 достигает ECI 159, что немного ниже показателя Fable 5 в 161.
  • Модель демонстрирует результаты на уровне Fable 5 в бенчмарках по разработке программного обеспечения с SWE-ECI 161.
  • Отзывы сообщества указывают на то, что оценка ECI преуменьшает практические улучшения Opus 5 по сравнению с Opus 4.8, которая набрала всего на один балл меньше.
  • Некоторые оценщики отметили немонотонную производительность на FrontierCode, где входные данные со средней сложностью превзошли высокозатратные.
  • Nous Portal предоставила доступ к модели со скидкой 20% на все модели.

Запуск подчеркивает продолжающиеся дебаты о чувствительности текущих метрик оценки и разрыве между агрегированными баллами и реальными возможностями кодовых агентов.