Исследование оценивает четыре системы анализа ИИ на шести моделях языков, в результате чего OpenAIReview с GPT-5.5 достигает точности 83,0% при сопоставлении качества научных статей с внешними сигналами и обнаруживает 71,6% введённых ошибок. Реальные отзывы пользователей показывают положительную оценку, с соотношением голосов 1,44 к 1, однако ошибочные положительные результаты и незначительные замечания остаются частыми.
Оценка агентных систем анализа для исследований с участием ИИ
GLM-5.2 превосходит GPT-5.5 в оценке AA-Briefcase
Новая оценка агентных задач искусственного анализа, AA-Briefcase, показывает, что GLM-5.2 превосходит GPT-5.5 по производительности. Оценка оценивает выполнение реальных задач и способность к логическому мышлению в сценариях работы с знаниями.
TutorMoments оценивает, знают ли ИИ-репетиторы, когда помогать, а когда воздерживаться
Исследователи представляют TutorMoments — фреймворк, предназначенный для измерения способности больших языковых моделей балансировать между педагогическим компромиссом предоставления поддержки и поощрения независимого мышления. Система, построенная на реальных стенограммах индивидуальных математических занятий с учениками, воспроизводит моменты принятия решений для оценки поведения модели по сравнению с аннотированными экспертами эталонными данными.
OpenAI выпустила GPT-5.6 с разделением моделей и агентным UX; Meta представила Muse Spark 1.1
OpenAI запустила GPT-5.6, представив новую модельную линейку Luna, Terra и Sol вместе с различными уровнями усилий для режимов Max и Ultra. Выпуск принес значительные изменения в интерфейсы ChatGPT Work и Codex, хотя изначально столкнулся с негативной реакцией пользователей из-за запутанной навигации и быстрого исчерпания квот.
EvoPolicyGym представляет бенчмарк для оценки автономной эволюции политик
Авторы представляют Автономную Эволюцию Политик, контролируемую среду оценки, где агент многократно редактирует исполняемую систему политики в рамках фиксированного бюджета взаимодействий, чтобы итеративно улучшать исследованные политики.
GPT-5 превосходит людей в формировании состояний веры через планирование
Новое исследование оценивает способность больших языковых моделей формировать конкретные состояния веры у других агентов посредством действий, а не диалога; эта способность называется Непрерывное планирование ToM (NCP-ToM). Используя фреймворк NCP-ExploreToM, исследователи протестировали шесть передовых моделей и участников-людей на 600 задачах, где агентам нужно было перемещать объекты или направлять персонажей для достижения целей веры.