Nanbeige4.2-3B est un modèle agentic général compact avec 3 milliards de paramètres non d'embedding, pré-entraîné à partir de zéro sur 28T de tokens en utilisant une architecture Looped Transformer qui réutilise des piles de couches pour augmenter la capacité sans ajouter de paramètres.
Le modèle utilise un RLHF mixte sur les réponses Think et Non-Think, un raisonnement RL contrôlé par longueur et un RL agentic avec des récompenses de résultat et de processus pour stabiliser l'entraînement. Il démontre de solides performances dans les tâches code-agent, office-agent et d'utilisation complexe d'outils tout en maintenant des capacités de raisonnement compétitives en mathématiques, codage et sciences.
Des évaluations extensives montrent que Nanbeige4.2-3B surpasse des modèles plus grands, y compris Qwen3.5-9B et Gemma4-12B, sur divers benchmarks agentic. Ses performances avec OpenClaw soutiennent son utilisation en tant qu'assistant personnel local compact.