Nanbeige4.2-3B 是一个紧凑型通用智能体模型,拥有 30 亿非嵌入参数,使用 Looped Transformer 架构从头开始在 28T 个 token 上进行预训练,该架构通过重用层堆栈来增加容量而不增加参数。
该模型利用 Think 和 Non-Think 响应的混合模式 RLHF、长度控制的推理 RL 以及具有结果和过程奖励的智能体 RL 来稳定训练。它在 code-agent、office-agent 和复杂工具使用任务中表现出强大的性能,同时在数学、编码和科学领域保持有竞争力的推理能力。
广泛的评估表明,Nanbeige4.2-3B 在多种智能体基准测试中优于更大的模型,包括 Qwen3.5-9B 和 Gemma4-12B。它与 OpenClaw 配合使用的表现支持其作为紧凑型本地个人助手的用途。