Nanbeige4.2-3B es un modelo agénico general compacto con 3B de parámetros no de incrustación, preentrenado desde cero en 28T de tokens utilizando una arquitectura Looped Transformer que reutiliza pilas de capas para aumentar la capacidad sin añadir parámetros.

El modelo utiliza RLHF mixto sobre respuestas Think y Non-Think, razonamiento RL controlado por longitud y RL agénico con recompensas de resultado y proceso para estabilizar el entrenamiento. Demuestra un rendimiento sólido en tareas de code-agent, office-agent y uso complejo de herramientas, mientras mantiene capacidades competitivas de razonamiento en matemáticas, programación y ciencias.

Evaluaciones extensas muestran que Nanbeige4.2-3B supera a modelos más grandes, incluyendo Qwen3.5-9B y Gemma4-12B, en diversos benchmarks agénticos. Su rendimiento con OpenClaw respalda su uso como asistente personal local compacto.