При увеличении каталога инструментов агентов предприятий от 10 до 110 агентов, точность маршрутизации снижается на 16--23 процентных пункта при запросах с недостаточным описанием. Анализ с использованием оракула выявляет разрывы в извлечении и путанице, при использовании базы векторных представлений для сокращения списка результатов восстанавливается +10--11pp F1. Изучение 1435 изъятий с участием человека подтверждает реальное восстановление +10--17pp, несмотря на более низкую абсолютную производительность.
Падение и восстановление точности маршрутизации в системах агентов предприятий
GPT-5 превосходит людей в формировании состояний веры через планирование
Новое исследование оценивает способность больших языковых моделей формировать конкретные состояния веры у других агентов посредством действий, а не диалога; эта способность называется Непрерывное планирование ToM (NCP-ToM). Используя фреймворк NCP-ExploreToM, исследователи протестировали шесть передовых моделей и участников-людей на 600 задачах, где агентам нужно было перемещать объекты или направлять персонажей для достижения целей веры.
Автоматическая оценка экзаменов по Linux/bash с помощью больших языковых моделей
В данном исследовании оценивается, могут ли четыре передовые большие языковые модели (GPT, Claude Opus, Gemini и GLM) приближаться к экспертной оценке при проверке коротких ответов на команды Linux/bash. Исследование показывает, что структурированные промпты значительно улучшают согласование с оценками людей, создавая основу для ИИ-ассистированной оценки в образовании по вычислительной технике.
OpenBioRQ: Бенчмарк для верности агентных исследований в биомедицине
OpenBioRQ вводит бенчмарк из 12 553 нерешённых вопросов в области биомедицинских исследований в 12 областях, разработанный для проверки верности и отказа агентных моделей. Он оценивает модели в условиях использования инструментов без ключей ответов, используя реальные доказательства последующих шагов, а не параметрические знания, и показывает значительное падение агентной способности на самые сложные вопросы, где инструменты больше не используются, несмотря на их критическую важность.
Большие языковые модели не могут точно переводить фонгбэ
Оценки показывают, что переводы фонгбэ имеют низкое качество (1,0–2,2/5), в отличие от приемлемого результата в случае хауса (4,0–4,5/5), при этом наблюдается постоянный разрыв в 3 раза по BLEU. Автоматические метрики, такие как BERTScore, показывают коллапс вложений и слабую корреляцию с человеческими оценками, особенно в случае хауса, в то время как Gemini превосходит другие модели при оценке фонгбэ, а GPT-4o — при оценке хауса в человеческих оценках. Для стабильного ранжирования моделей требуется минимальный объем образцов в 2500 предложений.
MacAgentBench запускает бенчмарк AI-агента для macOS
MacAgentBench представляет всесторонний бенчмарк, включающий 676 задач по 25 приложениям, 60% из которых включают взаимодействие как с графическим интерфейсом, так и с командной строкой. Используя детерминированные правилу-ориентированные оценки и оценку с использованием мелких контрольных точек, было установлено, что Claude Opus 4.6 на OpenClaw достигает 73,7% Pass@1, в основном благодаря своей библиотеке навыков, а не архитектуре платформы.