对多跳检索基准的一项新审计显示,NVIDIA 的 Nemotron-3-Embed-8B 已在 MuSiQue 基准上弥合了商业许可嵌入模型与非商业 NV-Embed-v2 锚点之间的性能差距。该模型于 2026 年 7 月 16 日发布,是唯一一款在性能上与学术标准无异且可免费自托管的商业许可选项。

  • 该研究审计了四个领先的 MuSiQue 系统(HippoRAG-2、PropRAG、SAG、KET-RAG),指出其中三个在未披露的情况下依赖非商业 NV-Embed-v2。
  • 截至 2026 年中,表现最佳的商业许可嵌入模型落后于锚点 2.31 个 Recall@5 分数;而 Nemotron-3-Embed 现在与锚点持平,在 Recall@5 上仅存在 +0.24 的统计不显著差异。
  • 其他所有商业许可且可免费自托管的参与者均落后于锚点 5.2 至 14.6 分。
  • 审计突显了显著的成本差异:五个被审计系统中,有三个未披露索引成本,已发布的 GraphRAG 数据跨度达 11 倍(针对 5.64 MB 语料库,USD 2.30 对比 USD 24.94)。
  • extrapolated 至 1 TB,这种未披露的选择导致成本从约 USD 428K 到 $4.6M 不等,其中图构建成本远超嵌入和回答费用。

这些发现强调,买家在依赖已发布的基准数字之前,必须验证许可条款和索引成本,因为付费与免费的差距对部署可行性有重大影响。