Компания MiniMax представила MiniMax-M1 — первую в мире крупномасштабную модель рассуждений с гибридным вниманием и открытыми весами. Построенная на базе предыдущей архитектуры MiniMax-Text-01, она сочетает структуру Mixture-of-Experts (MoE) с механизмом быстрого внимания для поддержки контекста длиной в 1 миллион токенов и эффективного масштабирования вычислений во время тестирования.
Модель имеет 456 миллиардов общих параметров, из которых на один токен активируется 45,9 миллиарда, потребляя лишь 25% FLOPs по сравнению с DeepSeek R1 при длине генерации в 100K. Обучение проводилось с использованием крупномасштабного обучения с подкреплением и двух новых версий с бюджетами на размышление в 40K и 80K токенов. Эксперименты показывают, что она превосходит такие модели, как DeepSeek-R1 и Qwen3-235B, в сложных задачах по программной инженерии, использованию инструментов и работе с длинным контекстом.
MiniMax-M1 служит основой для агентов языковых моделей следующего поколения, обеспечивая эффективное рассуждение над длинными входными данными и обширными процессами размышления.