ProvenanceGuard 是 Model Context Protocol (MCP) 代理的生成后验证层,通过确保声明归因于正确的证据来源来检测跨源混淆。该系统在不重新训练代理的情况下分析捕获的 MCP 跟踪记录,将答案分解为声明,并验证支持来源是否与输出中命名或暗示的来源匹配。

  • ProvenanceGuard 捕获了人类专家认为缺乏支持的 139 个声明中的 138 个,同时约 86% 的时间正确识别了正确的来源。
  • 在具有相似来源的测试中,其阻止决策的 F1 得分为 0.846,并在 50.3% 的案例中识别出确切来源。
  • 它成功检测到了所有 50 起错误归因实例,其中命名来源被互换但证据保持完整。
  • 该系统集成了 RARR 风格的修复循环,解决了所有被阻止的答案,尽管许多结果只是安全回退文本而非实质性重写。

这种方法通过逐声明使来源可见,从而解决了忠实度分数的局限性,这对于错误归因与错误事实同样具有破坏性的数据敏感场景至关重要。