MiniMax telah memperkenalkan MiniMax-M1, model penalaran hybrid-attention skala besar dengan bobot terbuka pertama di dunia. Dibangun di atas arsitektur MiniMax-Text-01 sebelumnya, model ini menggabungkan desain Mixture-of-Experts (MoE) dengan mekanisme perhatian kilat untuk mendukung konteks 1 juta token dan penskalaan komputasi efisien saat pengujian.

Model ini memiliki total 456 miliar parameter dengan 45,9 miliar parameter diaktifkan per token, mengonsumsi hanya 25% dari FLOPs DeepSeek R1 pada panjang generasi 100K. Model ini dilatih menggunakan pembelajaran penguatan skala besar dan dua versi baru dengan anggaran berpikir 40K dan 80K. Eksperimen menunjukkan model ini mengungguli model seperti DeepSeek-R1 dan Qwen3-235B dalam tugas teknik perangkat lunak kompleks, penggunaan alat, dan konteks panjang.

MiniMax-M1 berfungsi sebagai fondasi untuk agen model bahasa generasi berikutnya dengan memungkinkan penalaran efisien atas input panjang dan proses berpikir yang ekstensif.