O ProvenanceGuard é uma camada de verificação pós-geração para agentes do Model Context Protocol (MCP) que detecta a confluência entre fontes distintas, garantindo que as afirmações sejam atribuídas à fonte de evidência correta. O sistema analisa os rastros MCP capturados sem retreinar o agente, dividindo as respostas em afirmações e verificando se a fonte de suporte corresponde àquela nomeada ou implícita na saída.

  • O ProvenanceGuard identificou 138 das 139 afirmações que especialistas humanos consideraram sem suporte, enquanto identificava corretamente a fonte certa cerca de 86% do tempo.
  • Em um teste com fontes semelhantes, obteve F1 de 0.846 para decisões de bloqueio e identificou as fontes exatas em 50,3% dos casos.
  • Detectou com sucesso todas as 50 instâncias de atribuição incorreta em que a fonte nomeada foi trocada enquanto a evidência permanecia intacta.
  • O sistema integra um loop de reparo estilo RARR que resolveu todas as respostas bloqueadas, embora muitos resultados tenham sido textos de fallback seguros em vez de reescritas substantivas.

Essa abordagem aborda a limitação das pontuações de fidelidade ao tornar a proveniência visível afirmação por afirmação, o que é crítico para ambientes sensíveis a dados, onde uma atribuição incorreta pode ser tão prejudicial quanto fatos errados.