ProvenanceGuard es una capa de verificación posterior a la generación para agentes del Protocolo de Contexto de Modelo (MCP) que detecta la confluencia entre fuentes al asegurar que las afirmaciones se atribuyan a la fuente de evidencia correcta. El sistema analiza los rastros MCP capturados sin volver a entrenar al agente, dividiendo las respuestas en afirmaciones y verificando que la fuente de apoyo coincida con la nombrada o implícita en la salida.

  • ProvenanceGuard detectó 138 de 139 afirmaciones que los expertos humanos consideraron sin apoyo, identificando correctamente la fuente adecuada aproximadamente el 86% de las veces.
  • En una prueba con fuentes similares, obtuvo un F1 de 0.846 para las decisiones de bloqueo e identificó las fuentes exactas en el 50.3% de los casos.
  • Detectó con éxito las 50 instancias de atribución incorrecta donde la fuente nombrada fue intercambiada mientras la evidencia permanecía intacta.
  • El sistema integra un bucle de reparación estilo RARR que resolvió todas las respuestas bloqueadas, aunque muchas resultaron en texto de respaldo seguro en lugar de reescrituras sustanciales.

Este enfoque aborda la limitación de las puntuaciones de fidelidad al hacer visible la procedencia afirmación por afirmación, lo cual es crítico para entornos sensibles a los datos donde una atribución incorrecta puede ser tan dañina como los hechos incorrectos.