Qwen представил модель Qwen-AgentWorld-35B-A3B, MoE на 35 миллиардов параметров, при этом у неё около 3 миллиардов активных параметров на токен. Модель обучена на имитации ответов от MCP, терминала, программирования, Android, веб-интерфейсов и графических интерфейсов операционных систем путем предсказания следующих наблюдений после действий агента, что позволяет эффективно обучать агентов и имитировать среду без выполнения реальных инструментов.
Qwen выпустил MoE на 35 миллиардов параметров для имитации среды агента
Qwen3.6-27b-mtp-q8 создает реализацию поиска пути A* через автономное тестирование
Модель Qwen3.6-27b-mtp-q8 успешно сгенерировала реализацию поиска пути A* для игры на Java, используя Claude Code локально. Процесс включал почти 12 часов итеративной разработки, в ходе которых модель автономно создавала и запускала набор тестов.
Qwen3.6-27B с использованием 3 критиков достигает уровня передовых моделей
Пользователь протестировал Qwen3.6-27B (8-bit) вместе с GLM5.2, используя инструмент для написания кода, который применяет трех критиков — проверку кода, проверку тестов и Playwright e2e — для оценки качества вывода.
ASCII Art позволяет текстовым LLM контролировать системы VLA
Текстовый большой языковой модель может быть адаптирован к контроллеру Vision--Language--Action с использованием ASCII-рендеренных визуальных наблюдений. Этот подход позволяет LLM интерпретировать визуальные состояния через текст, что позволяет им следовать инструкциям на естественном языке и генерировать исполняемые действия как в симуляции, так и на физических манипуляторах.
CORTIS: текстовое адаптация моделей речи
CORTIS позволяет голосовым агентам, ориентированным на задачи, генерировать структурированные речевые выходы путем тонкой настройки моделей речи с использованием только текстовой задачной поддержки. Он превосходит архитектуры ASR-LLM при ухудшении акустических характеристик, особенно в сохранении высокого уровня семантики задач, не требуя парных аннотаций речи и целей во время обучения.
Результаты и рекомендации по обновленному бенчмарку визуальных моделей
Обновленный бенчмарк локальных визуально-языковых моделей оценивает 23 модели по 30 изображениям с 3 тестами каждое, что в сумме составляет 2070 тестов и 60 до 70 часов инференса. Самой эффективной моделью является Qwen3.6 27B (nothink) на Q4 с оценкой 79.6, за ней следует Qwen3.5 4B (nothink) на Q4, а затем Qwen3-VL 8B на Q8. Ключевые выводы включают снижение производительности визуальных моделей при использовании режима мышления, низкую эффективность моделей с архитектурой MoE по сравнению с плотными моделями, а также отсутствие универсального улучшения результатов при квантовании на Q8.