Nanbeige4.2-3B는 30억 개의 비임베딩 매개변수를 가진 컴팩트한 일반 에이전트 모델로, 매개변수를 추가하지 않고 용량을 증가시키기 위해 레이어 스택을 재사용하는 Looped Transformer 아키텍처를 사용하여 28T 토큰으로 처음부터 사전 학습되었습니다.
이 모델은 Think 및 Non-Think 응답에 대한 혼합 모드 RLHF, 길이 제어 추론 RL, 결과 및 프로세스 보상을 가진 에이전트 RL을 사용하여 훈련을 안정화합니다. 코드 에이전트, 오피스 에이전트 및 복잡한 도구 사용 작업에서 강력한 성능을 보여주면서 수학, 코딩 및 과학에서 경쟁력 있는 추론 능력을 유지합니다.
광범위한 평가는 Nanbeige4.2-2-3B가 Qwen3.5-9B 및 Gemma4-12B를 포함한 더 큰 모델보다 다양한 에이전트 벤치마크에서 우수함을 보여줍니다. OpenClaw와의 성능은 컴팩트한 로컬 개인 비서로서의 사용을 지원합니다.