A MiniMax apresentou o MiniMax-M1, o primeiro modelo de raciocínio em larga escala com atenção híbrida e pesos abertos do mundo. Construído sobre sua arquitetura anterior MiniMax-Text-01, ele combina um design Mixture-of-Experts (MoE) com um mecanismo de atenção relâmpago para suportar contexto de 1 milhão de tokens e escalonamento eficiente de computação no tempo de teste.

O modelo possui 456 bilhões de parâmetros totais, com 45,9 bilhões ativados por token, consumindo apenas 25% dos FLOPs do DeepSeek R1 em um comprimento de geração de 100K. Ele foi treinado usando aprendizado por reforço em larga escala e duas novas versões com orçamentos de raciocínio de 40K e 80K. Experimentos mostram que ele supera modelos como DeepSeek-R1 e Qwen3-235B em tarefas complexas de engenharia de software, uso de ferramentas e contexto longo.

O MiniMax-M1 serve como base para agentes de modelos de linguagem de próxima geração, permitindo raciocínio eficiente sobre entradas longas e processos extensos de pensamento.