Reflection 宣布推出 Beam,这是一款仅支持文本的混合专家(Mixture-of-Experts)模型,总参数量为 5010 亿,激活参数量为 230 亿,专为编码、智能体(agentic)和科学任务设计。该模型使用 23.8 万亿个预训练 token 从头开始训练,并计划在本月以 Apache 2.0 许可证发布完整权重。

  • Beam 在 10,000 台 GB300s 上进行了稳定的 RL/OPD 运行,完成了超过 1 亿次 rollout,覆盖约一百万个任务。
  • Reflection 声称其在 SWE-bench Verified 上得分达到 80.9,并报告其推理效率是 GLM 5.2 的三到四倍。
  • 训练数据包括一个处理数亿份 PDF 的 OCR 管道,预训练和 RL 各耗时约四周。
  • 独立分析表明,Beam 在其智能水平下是最具 token 效率的开源模型之一,尽管在某些基准测试中落后于 DeepSeek V4.1 Flash 等中国同类产品。

此次发布标志着 Reflection 作为功能性新实验室(neolab)的登场,并为美国训练的开源模型市场提供了更多选择。