Nanbeige4.2-3B adalah model agentic umum yang kompak dengan 3B parameter non-embedding, pra-dilatih dari awal pada 28T token menggunakan arsitektur Looped Transformer yang menggunakan kembali tumpukan lapisan untuk meningkatkan kapasitas tanpa menambahkan parameter.
Model ini menggunakan RLHF mode campuran atas respons Think dan Non-Think, reasoning RL terkontrol panjang, dan RL agentic dengan reward hasil dan proses untuk menstabilkan pelatihan. Model ini menunjukkan kinerja kuat dalam tugas code-agent, office-agent, dan penggunaan alat kompleks sambil mempertahankan kemampuan reasoning yang kompetitif dalam matematika, coding, dan sains.
Evaluasi ekstensif menunjukkan bahwa Nanbeige4.2-3B mengungguli model yang lebih besar, termasuk Qwen3.5-9B dan Gemma4-12B, di berbagai benchmark agentic. Kinerjanya dengan OpenClaw mendukung penggunaannya sebagai asisten pribadi lokal yang kompak.