A Reflection anunciou o Beam, um modelo Mixture-of-Experts apenas para texto com 501 bilhões de parâmetros totais e 23 bilhões de parâmetros ativos, projetado para tarefas de codificação, agentes autônomos e científicas. O modelo foi treinado do zero usando 23,8 trilhões de tokens de pré-treinamento e está programado para liberar os pesos completos sob a licença Apache 2.0 neste mês.
- O Beam utiliza uma execução estável de RL/OPD em 10.000 GB300s com mais de 100 milhões de rollouts em aproximadamente um milhão de tarefas.
- A Reflection afirma obter pontuação de 80,9 no SWE-bench Verified e relata eficiência de inferência três a quatro vezes maior que a do GLM 5.2.
- Os dados de treinamento incluíram um pipeline de OCR processando centenas de milhões de PDFs, com pré-treinamento e RL levando cada um cerca de quatro semanas.
- Análise independente sugere que o Beam está entre os modelos abertos mais eficientes em tokens para seu nível de inteligência, embora fique atrás de alguns concorrentes chineses como o DeepSeek V4.1 Flash em alguns benchmarks.
O lançamento marca a chegada da Reflection como um neolab funcional e oferece mais opções no mercado de modelos abertos treinados nos EUA.