Reflection telah mengumumkan Beam, model Mixture-of-Experts hanya teks dengan total 501 miliar parameter dan 23 miliar parameter aktif, yang dirancang untuk tugas pemrograman, agentic, dan ilmiah. Model ini dilatih dari awal menggunakan 23,8 triliun token pra-pelatihan dan dijadwalkan merilis bobot penuh di bawah lisensi Apache 2.0 bulan ini.
- Beam memanfaatkan jalur RL/OPD stabil pada 10.000 GB300s dengan lebih dari 100 juta rollouts di sekitar satu juta tugas.
- Reflection mengklaim skor 80,9 pada SWE-bench Verified dan melaporkan efisiensi inferensi tiga hingga empat kali lipat dibandingkan GLM 5.2.
- Data pelatihan mencakup jalur OCR yang memproses ratusan juta PDF, dengan pra-pelatihan dan RL masing-masing memakan waktu sekitar empat minggu.
- Analisis independen menunjukkan Beam berada di antara model terbuka paling efisien token untuk tingkat kecerdasannya, meskipun tertinggal dari beberapa rekan Tiongkok seperti DeepSeek V4.1 Flash pada beberapa benchmark.
Rilis ini menandai kehadiran Reflection sebagai neolab fungsional dan memberikan lebih banyak pilihan di pasar model terbuka yang dilatih di AS.