Команда Qwen от Alibaba выпустила Qwen3.8-Flash-Next, мультимодельную модель Mixture-of-Experts с открытыми весами, предназначенную для демонстрации архитектуры будущей серии Qwen4. Чекпоинт сочетает в себе базовую модель на 125B параметров, таблицу N-граммных эмбеддингов на 51B и модуль многозадачного предсказания токенов на 4B, активируя лишь 6B параметров на каждый токен.

  • Архитектура: Использует гибридный подход с Gated DeltaNet (линейное внимание) для трёх из четырёх слоёв и Qwen Sparse Attention для четвёртого слоя, а также потоки Gated Residual и оптимизатор Muon.
  • Бенчмарки: Достигает 58.7 на DeepSWE 1.1, 62.5 на SWE-bench Pro, 91.9 на LiveCodeBench v6 и 95.7 на MathVision с интерпретатором кода.
  • Эффективность: Стоимость обучения составляет примерно одну девятую от стоимости Qwen3.7-Plus; при обслуживании наблюдается увеличение пропускной способности префиллинга до 10.2x при высоких показателях попадания в кэш префиксов.
  • Контекст и хранение: Поддерживает 262,144 токенов нативно (расширяемо до 1M с помощью YaRN); чекпоинт в формате FP8 занимает 172.78 GiB, что требует развёртывания на нескольких GPU.

Модель служит ранним архитектурным предпросмотром для Qwen4, предлагая значительное снижение затрат и ускорение при сохранении конкурентоспособной производительности на бенчмарках по программированию и рассуждению.