Исследование демонстрирует, что наличие в памяти языковой модели неверных выводов более вредно, чем полное отсутствие памяти. Когда модели сохраняют устаревшие значения, отбрасывая при этом поддерживающие данные, они выдают уверенные, но ошибочные ответы, тогда как пустая память позволяет воздерживаться от ответов. Это явление, названное хрупкой памятью (brittle memory), наблюдалось в семи моделях, причем направление ошибки никогда не менялось независимо от задачи или disposition. Исследователи предложили оценку Reclaim для измерения исправляемости путем сжатия взаимодействий и проверки того, восстанавливаются ли коррекции до ground truth без использования judge. Результаты показывают, что исправляемость зависит от того, сохраняется ли исходная информация после сжатия, а не от возможностей модели. Политика source-first, которая сохраняет пересчитываемые источники и отбрасывает выводимые заключения, значительно лучше восстанавливает исправляемость по сравнению с контрольными группами, сопоставленными по длине. В циклах связанной памяти ошибки из-за потери источников необратимо искажают последующие шаги, тогда предлагаемое решение поддерживает ограниченные горизонты производительности. Выводы воспроизводятся в трех развернутых системах и реальных диалоговых данных, при этом hand-built oracle достигает идеальной точности.
Оценка Reclaim показывает, что потеряющая память хуже, чем отсутствие памяти
InternScience выпускает Agents-A1 — 35B MoE-модель с невероятными результатами на бенчмарках
Компания InternScience выпустила модель Agents-A1 на платформе Hugging Face, которая использует архитектуру Mixture of Experts (MoE) с 35 миллиардами параметров. В релиз входит технический отчет, доступный на arXiv, и он выделяется исключительными результатами на бенчмарках.
Стабилизация намерения инструмента в потоковом RAG
Исследование оценивает стабилизацию намерения инструмента в потоковом RAG, определяя момент, когда спекулятивные запросы на инструменты сходятся к правильным ответам. На бенчмарке CRAG 73,9% запросов позволяют значительное скрытие задержки, при этом ранняя стабилизация наблюдается в вопросах с прямым извлекаемым доказательством. Тип вопроса значительно предсказывает раннюю или позднюю стабилизацию, что позволяет определить, когда спекулятивные триггеры оказываются эффективными.
Техническая классификация протоколов коммуникации агентов на основе ЛЛМ
Новая классификация классифицирует протоколы коммуникации агентов на основе ЛЛМ по пяти измерениям: сопряжённый субъект, нагрузка, состояние взаимодействия, механизм обнаружения и гибкость схемы. Анализ показывает, что гибридные нагрузки, сохранение состояния сессии и переговоры о схеме во время выполнения являются распространенными, в то время как децентрализованное обнаружение остаётся редким. Исследование прогнозирует краткосрочную тенденцию к унификации протоколов агент-к-агенту и агент-к-контексту, и долгосрочное развитие в сторону распределённой, многоуровневой стека протоколов.
Запущена открытая таблица лидеров по TTS для масштабируемой многоязычной оценки
Открытая таблица лидеров по TTS была выпущена для решения проблем фрагментации и отсутствия стандартизации в оценке синтеза речи (TTS) за счёт использования объективных метрик вместо опоры исключительно на медленные результаты предпочтений людей, полученные методом арены. Она оценивает модели по понятности, скорости и сходству голоса с использованием Qwen3 ASR и эмбеддингов WavLM.
Rep2Act выравнивает представления VLM для улучшения отказа от ответов на новом бенчмарке VAD-R
Исследователи представляют Visual Answerability Diagnosis with Rationales (VAD-R), новый бенчмарк, предназначенный для оценки способности моделей «зрение-язык» воздерживаться от ответов на вопросы, не имеющие ответа, без использования упрощающих подсказок. Исследование показывает, что, хотя скрытые состояния могут различать наличие ответа, текущие модели не способны перевести это в явные решения.