ProvenanceGuard est une couche de vérification post-génération pour les agents du protocole Model Context Protocol (MCP) qui détecte la confusion inter-sources en s'assurant que les affirmations sont attribuées à la bonne source d'évidence. Le système analyse les traces MCP capturées sans réentraîner l'agent, décompose les réponses en affirmations et vérifie que la source de soutien correspond à celle nommée ou implicite dans la sortie.
- ProvenanceGuard a détecté 138 des 139 affirmations jugées non étayées par des experts humains tout en identifiant correctement la bonne source environ 86 % du temps.
- Lors d'un test avec des sources similaires, il a obtenu un score F1 de 0,846 pour les décisions de blocage et a identifié les sources exactes dans 50,3 % des cas.
- Il a détecté avec succès les 50 instances de mauvaise attribution où la source nommée a été échangée tandis que l'évidence restait intacte.
- Le système intègre une boucle de réparation de style RARR qui a résolu toutes les réponses bloquées, bien que beaucoup aient abouti à du texte de repli sûr plutôt qu'à des réécritures substantielles.
Cette approche comble la limite des scores de fidélité en rendant la provenance visible affirmation par affirmation, ce qui est critique dans les contextes sensibles aux données où une mauvaise attribution peut être aussi dommageable que des faits incorrects.