MiniMaxは、世界初のオープンウェイト大規模ハイブリッドアテンション推論モデルであるMiniMax-M1を発表しました。以前のMiniMax-Text-01アーキテクチャに基づいて構築され、Mixture-of-Experts (MoE) 設計と高速アテンションメカニズムを組み合わせ、100万トークンのコンテキストと効率的なテスト時の計算スケーリングをサポートします。

このモデルは総パラメータ数が4560億個で、トークンごとに459億個が活性化され、100Kの生成長さにおいてDeepSeek R1のFLOPsのわずか25%しか消費しません。大規模強化学習と、思考予算が40Kおよび80Kの2つの新バージョンを使用してトレーニングされました。実験により、複雑なソフトウェアエンジニアリング、ツール使用、長文コンテキストのタスクにおいて、DeepSeek-R1やQwen3-235Bなどのモデルを上回る性能を示すことが確認されています。

MiniMax-M1は、長い入力と広範な思考プロセスにわたって効率的な推論を可能にすることで、次世代の言語モデルエージェントの基盤として機能します。