ProvenanceGuardは、Model Context Protocol (MCP) エージェント向けの生成後検証レイヤーであり、主張が正しい証拠ソースに帰属されることを保証することで、クロスソースの混同を検出します。このシステムはエージェントのリトレーニングを行わずにキャプチャされたMCPトレースを分析し、回答を主張に分割して、サポートするソースが出力で明示または暗示されているものと一致することを確認します。
- ProvenanceGuardは、人間の専門家が支持されていないと判断した139件の主張のうち138件を検出し、正しいソースを約86%の確率で特定しました。
- 類似のソースを用いたテストでは、ブロック決定に対して0.846のF1スコアを獲得し、50.3%のケースで正確なソースを特定しました。
- ソースが入れ替わっているが証拠はそのまま残されているという50件の誤った帰属のすべてを正常に検出しました。
- システムはRARRスタイルの修復ループを統合しており、すべてのブロックされた回答を解決しましたが、多くの場合、実質的な書き換えではなく安全なフォールバックテキストになりました。
このアプローチは、プロベナンスを主張ごとに可視化することで忠実度スコアの限界に対処し、誤った帰属が誤った事実と同様に有害になりうるデータに敏感な環境において重要です。