Nanbeige4.2-3B は、30億の非埋め込みパラメータを持つコンパクトな汎用エージェントモデルで、層スタックを再利用してパラメータを追加せずに容量を増やす Looped Transformer アーキテクチャを使用して、28T トークンからスクラッチで事前学習されています。
このモデルは、Think と Non-Think の応答に対する混合モード RLHF、長さ制御された推論 RL、および結果とプロセス報酬を持つエージェント RL を使用してトレーニングを安定化させます。コードエージェント、オフィスエージェント、複雑なツール使用タスクで強力なパフォーマンスを示しつつ、数学、コーディング、科学における競争力のある推論能力を維持しています。
広範な評価により、Nanbeige4.2-3B が Qwen3.5-9B や Gemma4-12B を含むより大きなモデルを上回るパフォーマンスを多様なエージェントベンチマークで示すことがわかりました。OpenClaw でのそのパフォーマンスは、コンパクトなローカルパーソナルアシスタントとしての使用をサポートします。