АртIFICИАЛЬНАЯ АНАЛИТИКА представила новую оценку агентов, которая оценивает способность больших языковых моделей планировать и выполнять задачи. Claude Fable и GLM 5.2 заняли лидирующие позиции в своих соответствующих группах, демонстрируя сильную производительность на этом неиспользованном бенчмарке.
Выпущена новая оценка агентов
Anthropic выпустила Claude Opus 5 как экономичную альтернативу Fable
Anthropic выпустила Claude Opus 5, модель, предназначенную для соответствия производительности Claude Fable 5 примерно за половину стоимости за токен, при этом предлагая более либеральные классификаторы контента. Она стала новой моделью по умолчанию в Claude Max и лучшим вариантом для пользователей Claude Pro.
Kimi K3 занимает тот же уровень, что и Opus в мышлении на Agent Arena
Согласно таблице лидеров Agent Arena, Kimi K3 демонстрирует уровень производительности, сопоставимый с Opus в задачах без анализа изображений. Хотя некоторые пользователи отмечают, что Opus может иметь преимущество в возможностях работы с изображениями, рейтинг указывает на равенство для других случаев использования.
SEA вводит сертификаты, действительные в любой момент, для самоэволюционирующих агентов
Авторы представляют SEA, архитектуру, которая ограничивает самоизменение управляющим адаптером и версионированным каркасом вокруг замороженной базовой модели, допуская изменения только через шлюз, действительный в любой момент, который выдает аудируемые сертификаты против фиксированного бюджета ошибок.
Anthropic выпустила Claude Opus 4.8 с адаптивным рассуждением и улучшенной честностью
Anthropic выпустила Claude Opus 4.8, обновление модели, которое возглавило Индекс интеллекта Artificial Analysis и вводит адаптивное мышление наряду с параллельными рабочими процессами подагентов. В релиз также вошли более быстрые режимы вывода и возможность обновления системных промптов во время диалога.
GLM-5.2 превосходит GPT-5.5 в оценке AA-Briefcase
Новая оценка агентных задач искусственного анализа, AA-Briefcase, показывает, что GLM-5.2 превосходит GPT-5.5 по производительности. Оценка оценивает выполнение реальных задач и способность к логическому мышлению в сценариях работы с знаниями.