Z.ai выпустила GLM-5.3-Flash, мультимодальную MoE-модель с 320B параметров и 18B активных параметров, в то время как команда Alibaba Qwen выпустила Qwen3.8-Flash-Next, модель на 125B с 6B активных параметров. Несмотря на независимую разработку, обе команды приняли почти идентичные архитектурные конфигурации.

  • Обе модели используют гибридную комбинацию слоёв линейного и полного внимания в пропорции 3:1 для баланса между эффективностью и точностью.
  • Контекст сжимается в 4 раза благодаря обучаемому индексатору, который ограничивает бюджет разреженного внимания до 2048 токенов.
  • Единый остаточный поток заменён на четыре параллельных затворённых ветви для улучшения контроля потока и снижения накладных расходов памяти.
  • Обучение использует оптимизатор Muon со слитыми матрицами проекции, разделёнными на независимые преобразования перед ортогонализацией.
  • Команды расходятся во мнениях относительно позиционного кодирования: GLM отказывается от RoPE в пользу NoPE, тогда как Qwen сохранила RoPE после того, как варианты NoPE не смогли прекратить генерацию после обучения.

Эта конвергенция указывает на общее направление отрасли для эффективного моделирования длинного контекста, хотя MiniMax остаётся инакомыслящей, отвергая линейное внимание из-за дефицита рассуждений.