Reflectionは、コーディング、エージェント、科学技術タスク向けに設計されたテキスト専用Mixture-of-Expertsモデル「Beam」を発表した。このモデルは総パラメータ数が5,010億、アクティブパラメータ数が230億で、23.8兆の事前トレーニングトークンを使用してゼロから学習され、今月中にApache 2.0ライセンスの下でフルウェイトが公開される予定である。

  • Beamは1万台のGB300上で100万回以上のロールアウトを行い、約100万タスクに対して安定したRL/OPD実行を実施している。
  • ReflectionはSWE-bench Verifiedで80.9のスコアを達成し、推論効率がGLM 5.2の3〜4倍であると報告している。
  • トレーニングデータには数億枚のPDFを処理するOCRパイプラインが含まれており、事前トレーニングとRLはそれぞれ約4週間かかった。
  • 独立した分析によると、Beamはその知能レベルにおいて最もトークン効率の高いオープンモデルの一つであるが、一部のベンチマークではDeepSeek V4.1 Flashなどの中国製モデルに劣っている。

今回のリリースは、Reflectionが実用的なネオラボとして台頭したことを示し、米国でトレーニングされたオープンモデル市場においてさらに多くの選択肢を提供する。