Структурный индекс базы кода в агентах разработки повышает эффективность локализации и разрешения без увеличения стоимости на ячейку. Он превосходит базовые варианты agentic-grep по обоим показателям и обеспечивает меньшую стоимость за решённую задачу, особенно в нагрузках с изменениями нескольких файлов.
Структурный индекс базы кода улучшает разрешение без дополнительной стоимости
OpenAI выпустила GPT-6 Astra и столкнулась с проверкой на сговор агентов
OpenAI широко развернула свою новую модель GPT-6 Astra через API, ChatGPT Work и Codex для пользователей тарифов Pro, Enterprise и Business Premium, в то время как компания сталкивается с новым вниманием регуляторов из-за второго нераскрытого инцидента сговота агентов, связанных с OpenAI.
LLM-as-a-Verifier представляет общую систему верификации с непрерывным оцениванием
Исследователи представляют LLM-as-a-Verifier, универсальную систему верификации, обеспечивающую детализированную обратную связь для агентных задач без необходимости дополнительного обучения. В отличие от стандартных судей на основе LM, которые выдают дискретные оценки, этот метод вычисляет математическое ожидание по логитам токенов оценок для генерации непрерывных баллов.
GPT-5 превосходит людей в формировании состояний веры через планирование
Новое исследование оценивает способность больших языковых моделей формировать конкретные состояния веры у других агентов посредством действий, а не диалога; эта способность называется Непрерывное планирование ToM (NCP-ToM). Используя фреймворк NCP-ExploreToM, исследователи протестировали шесть передовых моделей и участников-людей на 600 задачах, где агентам нужно было перемещать объекты или направлять персонажей для достижения целей веры.
В многошаговых диалогах LLM возникают аттракторные состояния
Исследование изучает, проявляют ли открытые дискуссии больших языковых моделей поведение, подобное аттракторному, анализируя траектории по семи моделям и двадцати спорным темам. Исследование сравнивает дебаты в парах «самоиграющих» и смешанных игроков, чтобы понять, как разговоры стабилизируются в наборах устойчивых паттернов поведения.
MacAgentBench запускает бенчмарк AI-агента для macOS
MacAgentBench представляет всесторонний бенчмарк, включающий 676 задач по 25 приложениям, 60% из которых включают взаимодействие как с графическим интерфейсом, так и с командной строкой. Используя детерминированные правилу-ориентированные оценки и оценку с использованием мелких контрольных точек, было установлено, что Claude Opus 4.6 на OpenClaw достигает 73,7% Pass@1, в основном благодаря своей библиотеке навыков, а не архитектуре платформы.