Reflection ha anunciado Beam, un modelo Mixture-of-Experts exclusivo para texto con 501 mil millones de parámetros totales y 23 mil millones de parámetros activos, diseñado para tareas de codificación, agentes y científicas. El modelo fue entrenado desde cero utilizando 23,8 billones de tokens de preentrenamiento y está programado para liberar los pesos completos bajo la licencia Apache 2.0 este mes.
- Beam utiliza una ejecución estable de RL/OPD en 10.000 GB300s con más de 100 millones de rollouts a lo largo de aproximadamente un millón de tareas.
- Reflection afirma obtener una puntuación de 80,9 en SWE-bench Verified e informa una eficiencia de inferencia tres a cuatro veces mayor que la de GLM 5.2.
- Los datos de entrenamiento incluyeron una pipeline de OCR que procesó cientos de millones de PDFs, con el preentrenamiento y el RL tomando cada uno aproximadamente cuatro semanas.
- El análisis independiente sugiere que Beam está entre los modelos abiertos más eficientes en tokens para su nivel de inteligencia, aunque queda atrás de algunos contrapartes chinas como DeepSeek V4.1 Flash en ciertos benchmarks.
El lanzamiento marca la llegada de Reflection como un neolab funcional y proporciona más opciones en el mercado de modelos abiertos entrenados en EE. UU.