АртIFICИАЛЬНАЯ АНАЛИТИКА представила новую оценку агентов, которая оценивает способность больших языковых моделей планировать и выполнять задачи. Claude Fable и GLM 5.2 заняли лидирующие позиции в своих соответствующих группах, демонстрируя сильную производительность на этом неиспользованном бенчмарке.
Выпущена новая оценка агентов
Anthropic обнаружила, что GLM-5.3 осуществляет полный перехват управления потоком при киберкрасной команде
Команда Frontier Red Team компании Anthropic оценивала китайскую модель GLM-5.3 на 100 задачах из внутреннего бенчмарка Binary Exploitation и обнаружила, что она способна разрабатывать полный перехват управления потоком в 4% испытаний.
Claude Opus 5.5 лидирует в SimpleBench с результатом 88,4% и выделяется качеством объясняющих видео
Вышла Claude Opus 5.5, занявшая первое место в SimpleBench с результатом 88,4% и привлекшая значительное внимание сообщества благодаря способности создавать высококачественные объясняющие видео.
TrueForge достигает той же точности, что и Claude Managed Agents, при стоимости на 75% ниже
Разработчики TrueForge, фреймворка для агентов с открытым исходным кодом, независимого от модели, провели его бенчмаркинг против Claude Managed Agents с использованием DevRev Enterprise-Bench. Сравнение показало, что TrueForge может сопоставить скорость решения задач с управляемыми платформами, значительно снизив потребление ресурсов.
Anthropic запускает Claude Fable и Mythos 5.1 с новыми SOTA бенчмарками
Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 в качестве своих новых флагманских моделей для программирования и интеллектуального труда, позиционируя их как самые передовые модели в мире для автономных многошаговых задач.
Z.ai доработала GLM-5.3 для повышения кибербезопасности
Z.ai выпустила GLM-5.3 — модель с 753 миллиардами параметров, которая улучшает возможности программирования и агентного взаимодействия за счёт дообучения, а не обучения с нуля. Обновление сравнялось по показателю в индексе интеллекта Artificial Analysis с лидером среди моделей с открытыми весами Kimi K3 и достигло высоких результатов на бенчмарках по кибербезопасности.