Reflection a annoncé Beam, un modèle Mixture-of-Experts en texte seul avec 501 milliards de paramètres au total et 23 milliards de paramètres actifs, conçu pour le codage, les tâches agentic et scientifiques. Le modèle a été entraîné à partir de zéro en utilisant 23,8 billions de tokens de pré-entraînement et devrait publier ses poids complets sous la licence Apache 2.0 ce mois-ci.
- Beam utilise une exécution stable RL/OPD sur 10 000 GB300s avec plus de 100 millions de rollouts sur environ un million de tâches.
- Reflection revendique un score de 80,9 sur SWE-bench Verified et rapporte une efficacité d'inférence trois à quatre fois supérieure à celle de GLM 5.2.
- Les données d'entraînement comprenaient un pipeline OCR traitant des centaines de millions de PDFs, la pré-entraînement et le RL ayant chacun pris environ quatre semaines.
- Une analyse indépendante suggère que Beam est parmi les modèles ouverts les plus efficaces en tokens pour son niveau d'intelligence, bien qu'il soit quelque peu inférieur à certains concurrents chinois comme DeepSeek V4.1 Flash sur certains benchmarks.
Le lancement marque l'arrivée de Reflection en tant que neolab fonctionnel et offre plus d'options sur le marché des modèles ouverts entraînés aux États-Unis.