Команда Qwen выпустила модель Qwen3.8 27B, которая превосходит Opus 5 Medium в Индексе агентов Artificial Analysis.
- Модель Qwen3.8 27B демонстрирует более высокий результат, чем Opus 5 Medium, на бенчмарке Индекс агентов Artificial Analysis.
Команда Qwen выпустила модель Qwen3.8 27B, которая превосходит Opus 5 Medium в Индексе агентов Artificial Analysis.
Вышла Claude Opus 5.5, занявшая первое место в SimpleBench с результатом 88,4% и привлекшая значительное внимание сообщества благодаря способности создавать высококачественные объясняющие видео.
Исследователи представляют SkillGym — фреймворк, который преобразует написанные человеком навыки агентов в исполняемые, верифицируемые обучающие среды для агентов на основе больших языковых моделей. Система использует конвейер «навык-задача» для создания конкретных задач и проверки результатов с помощью кодовых чекеров.
Разработчики TrueForge, фреймворка для агентов с открытым исходным кодом, независимого от модели, провели его бенчмаркинг против Claude Managed Agents с использованием DevRev Enterprise-Bench. Сравнение показало, что TrueForge может сопоставить скорость решения задач с управляемыми платформами, значительно снизив потребление ресурсов.
Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 в качестве своих новых флагманских моделей для программирования и интеллектуального труда, позиционируя их как самые передовые модели в мире для автономных многошаговых задач.
Ouroboros — это платформа для саморазвивающихся агентов, где инструменты, промпты и основная реализация улучшаются через проверенные коммиты, которые становятся средой выполнения для последующей работы. Он работает посредством рекурсивной свободной эволюции или эволюции ядра, управляемой опытом, которая запускается из-за ошибок и неэффективности, обнаруженных в процессе использования.
Мы используем cookie для аналитики и улучшения сайта. Вы можете принять или отклонить аналитические cookie. Политика конфиденциальности