Новое исследование разбивает память агента на четыре основных модуля и оценивает 12 систем по пяти бенчмаркам. Оно показывает, что ни одна архитектура не доминирует, производительность зависит от соответствия с узкими местами в задачах, и выявляет, что локальная поддержка более экономична, чем глобальная перестройка.
Готовы ли мы к агентно-ориентированной системе памяти?
Челлендж ICML 2026 Open Reproductions выявил: 23% рассмотренных статей содержат ложные утверждения
Челлендж ICML 2026 Open Reproductions, проходивший с 15 июля по 2 августа 2026 года, вовлек сообщество в воспроизведение принятых статей с использованием ИИ-агентов и человеческого контроля. Эта работа стала крупнейшим открытым аудитом утверждений по отдельности на конференции по машинному обучению на сегодняшний день.
PhoneBuddy: Обучение открытых моделей для агентного использования телефона
PhoneBuddy объединяет реальные и имитационные среды приложений для обучения открытых моделей для использования телефона. Он повышает показатели успешного выполнения задач с 36,67% до 45,33% на реальных телефонах и с 60,3% до 83,2% на AndroidWorld, что показывает, что обучение в имитационной среде дополняет, но не заменяет обучение в реальных приложениях на основе релей-обучения.
AgentCIBench оценивает риски приватности в агентах, использующих компьютер
AgentCIBench представляет бенчмарк для оценки рисков приватности в агентах, использующих компьютер. Он выявляет три ключевых режима сбоев — визуальная совместная локация, избыточное раскрытие при неясных задачах и несоответствие получателя — и показывает, что 11 из 15 оцененных агентов раскрывают персональные данные в более чем 50% сценариев, при среднем уровне утечки 67,9%.
LRE: Агентская память на несколько килобайт с нулевыми нейронными затратами
LRE — это система, работающая только на процессоре и не использующая языковую модель, которая обучается определять, какие единицы истории взаимодействия являются несущими. Она превосходит базовые решения по балансу точности и затрат, сокращая пиковый размер контекста на 52% и улучшая выполнение задач на 37% в некоторых случаях. LRE обеспечивает высокое качество ответов при использовании на 68% меньше токенов и не требует аннотаций или нейронных вычислений для обучения.
Beaver: агент-интерфейс для научной кураторской работы из мультимодальных источников
Beaver — это агент-интерфейс, который извлекает структурированную информацию из научных статей за счёт интеграции инструментов мультимодальной поддержки, структурирования задач и автономного поиска на основе артефактов. Он достигает 81,0 по показателю Gold-Referenced Attribute Score, превосходя передовые агенты на более чем 23 балла, с ключевыми достижениями по высокозначимым атрибутам, требующим мультимодального мышления.