PhoneBuddy объединяет реальные и имитационные среды приложений для обучения открытых моделей для использования телефона. Он повышает показатели успешного выполнения задач с 36,67% до 45,33% на реальных телефонах и с 60,3% до 83,2% на AndroidWorld, что показывает, что обучение в имитационной среде дополняет, но не заменяет обучение в реальных приложениях на основе релей-обучения.
PhoneBuddy: Обучение открытых моделей для агентного использования телефона
ThinkingBox оценивает надёжность агентов по оценке состояния бэкенда терминала и побочных эффектов
Microsoft и Hugging Face выпустили ThinkingBox, бенчмарк, который оценивает ИИ-агентов по их влиянию на изолированные состояния баз данных, а не только по вызовам инструментов или финальным ответам. В ходе исследования 507 состоящих из нескольких шагов бизнес-процессов, запущенных по 20 раз каждый против различных моделей LLM, было обнаружено, что, хотя многие агенты генерируют корректные вызовы инструментов, они часто оставляют неверные значения, непреднамеренные дополнительные эффекты или отсутствие требуемых эффектов в бэкенде.
Челлендж ICML 2026 Open Reproductions выявил: 23% рассмотренных статей содержат ложные утверждения
Челлендж ICML 2026 Open Reproductions, проходивший с 15 июля по 2 августа 2026 года, вовлек сообщество в воспроизведение принятых статей с использованием ИИ-агентов и человеческого контроля. Эта работа стала крупнейшим открытым аудитом утверждений по отдельности на конференции по машинному обучению на сегодняшний день.
Готовы ли мы к агентно-ориентированной системе памяти?
Новое исследование разбивает память агента на четыре основных модуля и оценивает 12 систем по пяти бенчмаркам. Оно показывает, что ни одна архитектура не доминирует, производительность зависит от соответствия с узкими местами в задачах, и выявляет, что локальная поддержка более экономична, чем глобальная перестройка.
AgentCIBench оценивает риски приватности в агентах, использующих компьютер
AgentCIBench представляет бенчмарк для оценки рисков приватности в агентах, использующих компьютер. Он выявляет три ключевых режима сбоев — визуальная совместная локация, избыточное раскрытие при неясных задачах и несоответствие получателя — и показывает, что 11 из 15 оцененных агентов раскрывают персональные данные в более чем 50% сценариев, при среднем уровне утечки 67,9%.
LRE: Агентская память на несколько килобайт с нулевыми нейронными затратами
LRE — это система, работающая только на процессоре и не использующая языковую модель, которая обучается определять, какие единицы истории взаимодействия являются несущими. Она превосходит базовые решения по балансу точности и затрат, сокращая пиковый размер контекста на 52% и улучшая выполнение задач на 37% в некоторых случаях. LRE обеспечивает высокое качество ответов при использовании на 68% меньше токенов и не требует аннотаций или нейронных вычислений для обучения.