Anthropic выпустила Claude Opus 5, новую модель переднего края, которая вызвала значительные дискуссии относительно результатов бенчмарков и практической производительности. Независимые оценки от Epoch AI сообщают о Индексе возможностей Epoch (ECI) 159 и SWE-ECI 161 для новой модели.
- Claude Opus 5 достигает ECI 159, что немного ниже показателя Fable 5 в 161.
- Модель демонстрирует результаты на уровне Fable 5 в бенчмарках по разработке программного обеспечения с SWE-ECI 161.
- Отзывы сообщества указывают на то, что оценка ECI преуменьшает практические улучшения Opus 5 по сравнению с Opus 4.8, которая набрала всего на один балл меньше.
- Некоторые оценщики отметили немонотонную производительность на FrontierCode, где входные данные со средней сложностью превзошли высокозатратные.
- Nous Portal предоставила доступ к модели со скидкой 20% на все модели.
Запуск подчеркивает продолжающиеся дебаты о чувствительности текущих метрик оценки и разрыве между агрегированными баллами и реальными возможностями кодовых агентов.