Solar Open 2 技术报告介绍了 Solar Open 2,这是一个专为长周期智能体任务设计的 250B-A15B Mixture-of-Experts 语言模型。它通过混合注意力堆栈实现了 1M-token 上下文窗口,并利用来自 Solar Open 1 的高效初始化和精心策划的高价值数据进行训练。
- 该模型采用混合注意力机制,在每三个线性注意力层中嵌入一个 softmax 层,不使用位置编码,并采用扩展至负特征值的门控 delta 规则。
- 通过从 Solar Open 1 的共享骨架进行初始化,并将 20T 数据池通过质量与稀有度感知的策划精炼为 10T 混合数据集,实现了训练效率。
- 智能体技能通过多教师在线策略蒸馏(MOPD)从十二个领域专家中整合而成。
- Solar Open 2 在 MMLU-Pro、LiveCodeBench 和 APEX-Agents 套件上领先于同等规模的开放权重模型,同时与 DeepSeek-V4-Flash 和 MiMo-V2.5 保持竞争力。
- 在韩国基准测试中,它在对比模型中录得最高平均分,且其规模不到 DeepSeek-V4-Pro 的六分之一,仍具竞争力。
报告强调了 Solar Open 2 能够在单个上下文中容纳整个智能体轨迹,同时在英语和韩国基准测试中保持高性能的能力。