EfficientRollout представляет самоспекулятивную декодирующую систему, которая снижает задержку рулл-оута и задержку в конце до 19,6% и 12,7% соответственно, не ухудшая итогальную качество модели. Она использует квантованный драфтер, полученный из целевой модели, и интегрирует системно-осознанную политику переключения, чтобы избежать режимов высокой вычислительной нагрузки, обеспечивая эффективную спекуляцию во время эволюции политики.
EfficientRollout: Системно-осознанная самоспекулятивная декодировка для RL-роллов
KVEraser: Эффективное локализованное удаление контекста в LLMs
KVEraser обеспечивает эффективное локализованное удаление контекста в больших языковых моделях, заменяя только состояния кэша KV для удаленного сегмента на обученные направляющие состояния. Он достигает почти полной переработки производительности на задачах в области знаний при длинах контекста от 1K до 32K, с ростом задержки только на 24%, и превосходит другие приближенные методы при работе с длинными документами в вопросах и ответах, обеспечивая скорость в 3-4 раза превышающую полную переработку.
Meta выпустила модель с открытыми весами Muse Glimmer 30B; Anthropic улучшила оценку для гипотезы Римана
Meta выпустила Muse Glimmer — плотную мультимодельную модель на 30B параметров, оптимизированную для локального развёртывания агентов под лицензией Apache 2.0, а также пообещала в будущем выпустить веса для Muse Spark 1.2.
Обновления Muse Spark 1.2 от Meta и GPT-5.6 Sol от OpenAI
Meta объявила, что её модель Muse Spark 1.2 показала золотой результат на пяти олимпиадах по STEM и вошла в топ-5 индекса Vals при стоимости $0.69 за тест, что, по сообщениям, в 3 раза дешевле Kimi. Meta объяснила эти достижения оркестровкой с участием нескольких агентов и параллельным мышлением, отметив идеальные результаты по теории на APhO и IPhO без использования внешних инструментов.
AutoPass: агенты на основе доказательств для настройки производительности компилятора
AutoPass использует доказательства из работы в реальном времени и компилятора для направления решений по оптимизации, генерируемых ЛЛМ, и превосходит экспертные эвристики и классические методы автоматической настройки. Он достигает геометрических средних ускорений в 1,043 раза на системах x86-64 и в 1,117 раза на системах ARM64 без предварительного обучения или тонкой настройки.
Контроль на основе LLM в многоконтролируемых играх
Характеристика иерархической системы, использующей предобученный LLM для выбора политик RL-навыков, превосходит плоскую RL в среде 2v2 King of the Hill. Она соответствует показателю эффективности, достигнутому при ручной разработке дерева поведения, и воспринимается как более человеческая на 60% пользователей, что подчеркивает эффективную координацию и адаптивность без ручного проектирования правил.