Новый метод, называемый probe-and-refine tuning, использует синтетические пробы исправления ошибок для итеративного улучшения файлов руководства репозитория с помощью одноразовых вызовов LLM, без циклов агентов или использования инструментов. На SWE-bench Verified он достигает среднего коэффициента разрешения 33,0% — на 14,5 процентных пункта выше начального статического базового знания — что свидетельствует о расширении охвата, а не точности исправлений. Метод позволяет агентам эффективно использовать большие бюджеты шагов, и производительность остается стабильной при различных моделях, при наличии достаточного диагностического вывода.
Метод probe-and-refine улучшает производительность код-агента
ExecCritic использует специфичное для роли обучение с подкреплением для улучшения кодогенерирующих агентов посредством ремонта, направляемого тестами
ExecCritic представляет собой фреймворк, который разделяет конструирование тестов и исправление исходного кода, чтобы предотвратить ложное доверие к кодогенерирующим агентам. Система использует Test agent и Repair agent, оба из которых поддерживаются моделью Qwen-3.5-35B-A3B и обучаются отдельно с помощью обучения с подкреплением.
Alibaba выпустила превью-веса Qwen3.8-Flash-Next на 176B для агентного программирования
Alibaba выпустила веса модели Qwen3.8-Flash-Next, служащие превью будущей архитектуры Qwen4 для экспериментов и оценки разработчиками.
Настраивание моделей VLA требует меньше слоев, чем думалось
Модели вид-язык-действие демонстрируют серьезную слоевую редуndancy, несмотря на большое количество параметров. Метод сжатия без обучения, использующий центрированное ядерное выравнивание, удаляет парные слои, снижая глубину модели до 50% и позволяя ускорить обучение на 40-50% и инференс на до 30% без потери производительности, что подтверждено на симуляционных и реальных роботизированных задачах.
SoftSkill: сжатие поведенческих навыков для адаптации в контексте
SoftSkill предлагает метод сжатия естественных языковых навыков в компактные скрытые предпосылки, что улучшает выполнение задач на SearchQA, LiveMath и DocVQA. Метод превосходит SkillOpt на 5,2–12,5 баллов по ключевым метрикам, при этом заменяя сотни или тысячи токенов Markdown на несколько виртуальных токенов.
AutoPass: агенты на основе доказательств для настройки производительности компилятора
AutoPass использует доказательства из работы в реальном времени и компилятора для направления решений по оптимизации, генерируемых ЛЛМ, и превосходит экспертные эвристики и классические методы автоматической настройки. Он достигает геометрических средних ускорений в 1,043 раза на системах x86-64 и в 1,117 раза на системах ARM64 без предварительного обучения или тонкой настройки.