Thinking Machines Lab 发布了 Inkling-Small,这是一个拥有 2760 亿总参数和 120 亿激活参数的开放权重混合专家(MoE)模型。该模型能够原生地对文本、图像和音频进行推理,具备 1M token 上下文窗口和可调节的思考力度。

  • 权重在 Hugging Face 上以 Apache 2.0 许可证提供,BF16 需要 600 GB VRAM,而 NVFP4 量化将需求降至 180 GB。
  • 架构使用 42 层解码器,每个 token 路由到 256 个专家中的 6 个以及 2 个共享专家,通过补丁处理图像,以 dMel 频谱图处理音频。
  • Inkling-Small 在 Humanity's Last Exam(31.6% vs 29.7%)和 SWE-bench Verified(80.2% vs 77.6%)等推理基准测试中超越了其更大的教师模型 Inkling。
  • 事实回忆能力显著下降,SimpleQA Verified 从 Inkling 的 43.9% 降至 20.6%,而多模态分数仍与较大模型接近。

此次发布使初创企业和企业能够在单卡或双卡 GPU 设置上自托管具备前沿能力的模型,支持编码代理、终端自动化和呼叫中心分析等工作负载。