SoftSkill предлагает метод сжатия естественных языковых навыков в компактные скрытые предпосылки, что улучшает выполнение задач на SearchQA, LiveMath и DocVQA. Метод превосходит SkillOpt на 5,2–12,5 баллов по ключевым метрикам, при этом заменяя сотни или тысячи токенов Markdown на несколько виртуальных токенов.
SoftSkill: сжатие поведенческих навыков для адаптации в контексте
Метод probe-and-refine улучшает производительность код-агента
Новый метод, называемый probe-and-refine tuning, использует синтетические пробы исправления ошибок для итеративного улучшения файлов руководства репозитория с помощью одноразовых вызовов LLM, без циклов агентов или использования инструментов. На SWE-bench Verified он достигает среднего коэффициента разрешения 33,0% — на 14,5 процентных пункта выше начального статического базового знания — что свидетельствует о расширении охвата, а не точности исправлений. Метод позволяет агентам эффективно использовать большие бюджеты шагов, и производительность остается стабильной при различных моделях, при наличии достаточного диагностического вывода.
AgentFinVQA: аудитируемый, локальный вопрос-ответ по финансовым графикам
AgentFinVQA представляет многоагентную систему для вопросов по финансовым графикам, обеспечивающую аудитируемость и возможность развертывания на локальной инфраструктуре без значительного снижения точности. Она превосходит базовые модели на +7,68 pp при использовании проприетарного ядра и на +4,84 pp с открытыми весами Qwen3.6-27B-FP8, при этом обеспечивая сигнал уверенности через вывод верификатора, что улучшает маршрутизацию ручного обзора.
ExecCritic использует специфичное для роли обучение с подкреплением для улучшения кодогенерирующих агентов посредством ремонта, направляемого тестами
ExecCritic представляет собой фреймворк, который разделяет конструирование тестов и исправление исходного кода, чтобы предотвратить ложное доверие к кодогенерирующим агентам. Система использует Test agent и Repair agent, оба из которых поддерживаются моделью Qwen-3.5-35B-A3B и обучаются отдельно с помощью обучения с подкреплением.
Alibaba выпустила превью-веса Qwen3.8-Flash-Next на 176B для агентного программирования
Alibaba выпустила веса модели Qwen3.8-Flash-Next, служащие превью будущей архитектуры Qwen4 для экспериментов и оценки разработчиками.
Релиз Qwen 3.8 Max: акцент на планировании, упрощении и экспериментальном дизайне
Полный релиз Qwen 3.8 Max подтверждает первоначальные впечатления о том, что модель работает исключительно быстро, высоко способна к планированию и искусно выявляет ненужную сложность в задачах.