Solar Open 2 技術レポートは、長期の自律型タスク向けに設計された250B-A15B Mixture-of-Experts言語モデルであるSolar Open 2を紹介しています。ハイブリッド注意機構により1Mトークンのコンテキストウィンドウを実現し、Solar Open 1からの効率的な初期化と厳選された高価値データを用いて訓練されています。
- モデルは3つの線形注意層ごとに1つのsoftmax層を持つハイブリッド注意メカニズムを利用し、位置エンコーディングを使用せず、負の固有値に拡張されたゲート付きデルタルールを採用しています。
- 訓練効率性は、Solar Open 1の共有スケルトンから初期化し、品質と希少性を意識したキュレーションにより20Tのデータプールを10Tの混合データセットに絞り込むことで達成されます。
- エージェントスキルは、マルチティーチャーオンポリシー蒸留(MOPD)を用いて12のドメイン専門家から統合されています。
- Solar Open 2は、MMLU-Pro、LiveCodeBench、APEX-Agentsスイートにおいて同等サイズのオープンウェイトモデルをリードし、DeepSeek-V4-FlashやMiMo-V2.5と競合する性能を示しています。
- 韓国語ベンチマークでは、比較されたモデルの中で最高平均記録を達成し、そのサイズがDeepSeek-V4-Proの6分の1未満でありながら同等の競争力を持っています。
レポートは、Solar Open 2が英語および韓国語のベンチマークで高いパフォーマンスを維持しつつ、単一のコンテキスト内で完全なエージェント軌道保持能力を持つことを強調しています。