NVIDIA发布了两个开源权重的模型d1-3B和d1-omni-600M,作为其新的d1决策模型系列的一部分。与生成token的生成式模型不同,这些模型在一次前向传递中生成答案,从而在从数据中心到边缘设备的NVIDIA全栈上实现极低延迟推理。

  • d1-3B在Decision Index v0.2.1公开分割集上得分48.57,优于所有参数量低于10B的模型,并以极小的体积匹配了Decider 35B-A3B的性能。
  • d1-omni-600M是一个实验性检查点,处理文本、图像和音频输入,在同一索引上得分为15.95。
  • d1-3B在NVIDIA GeForce RTX 4090上的推理延迟为8毫秒,在Jetson AGX Thor上为16毫秒,在Jetson AGX Orin上为26毫秒。
  • 这两个模型均支持day-one兼容llama.cpp,并可在Apple M5 Pro、AMD MI325X以及各种NVIDIA Jetson设备上运行。

这些开源权重模型允许用户下载、微调并部署针对多模态输入的快速结构化决策能力,且无任何限制。