Reflection은 코딩, 에이전트 및 과학적 작업을 위해 설계된 텍스트 전용 Mixture-of-Experts 모델인 Beam을 발표했으며, 총 파라미터 수는 5010억 개, 활성 파라미터 수는 230억 개입니다. 이 모델은 23.8조 개의 사전 학습 토큰을 사용하여 처음부터 훈련되었으며, 이번 달 Apache 2.0 라이선스 하에 전체 가중치를 공개할 예정입니다.
- Beam은 약 100만 개의 작업에서 1억 번 이상의 롤아웃을 수행하는 10,000대의 GB300에서 안정적인 RL/OPD 실행을 활용합니다.
- Reflection은 SWE-bench Verified에서 80.9점을 기록했으며, GLM 5.2보다 세 배에서 네 배 빠른 추론 효율성을 보고했습니다.
- 훈련 데이터에는 수억 개의 PDF를 처리하는 OCR 파이프라인이 포함되었으며, 사전 학습과 RL 각각 약 네 주가 소요되었습니다.
- 독립적인 분석에 따르면 Beam은 그 지능 수준에서 가장 토큰 효율적인 오픈 모델 중 하나이지만, 일부 벤치마크에서는 DeepSeek V4.1 Flash와 같은 중국산 경쟁 모델에 뒤처집니다.
이번 출시로 Reflection은 기능적인 뉴랩(neolab)으로서의 입지를 다졌으며, 미국에서 훈련된 오픈 모델 시장에서 더 많은 옵션을 제공하게 되었습니다.