Nanbeige4.2-3B — это компактная универсальная агентная модель с 3 млрд неэмбеддинговых параметров, обученная с нуля на 28 трлн токенов с использованием архитектуры Looped Transformer, которая повторно использует стеки слоев для увеличения емкости без добавления параметров.

Модель использует смешанное обучение RLHF над ответами Think и Non-Think, рассуждения с контролем длины по длине (length-controlled reasoning RL) и агентное обучение RL с наградами за результат и процесс для стабилизации обучения. Она демонстрирует высокую эффективность в задачах code-agent, office-agent и сложного использования инструментов, сохраняя конкурентоспособные способности к рассуждению в математике, программировании и науке.

Масштабные оценки показывают, что Nanbeige4.2-3B превосходит более крупные модели, включая Qwen3.5-9B и Gemma4-12B, по разнообразным агентным бенчмаркам. Ее работа с OpenClaw подтверждает ее пригодность в качестве компактного локального персонального ассистента.