ProvenanceGuard는 Model Context Protocol (MCP) 에이전트를 위한 생성 후 검증 계층으로, 주장이 올바른 증거 소스에 귀속되도록 보장하여 교차 소스 혼동을 감지합니다. 이 시스템은 에이전트의 재학습 없이 캡처된 MCP 추적을 분석하며, 답변을 주장으로 분할하고 지원되는 소스가 출력에서 명시되거나 암시된 소스와 일치하는지 검증합니다.

  • ProvenanceGuard는 전문가들이 근거 부족하다고 판단한 139개 주장 중 138개를 포착했으며, 약 86%의 확률로 올바른 소스를 정확히 식별했습니다.
  • 유사한 소스를 대상으로 한 테스트에서 차단 결정에 대해 0.846 F1 점수를 기록했으며, 50.3%의 경우 정확한 소스를 식별했습니다.
  • 명시된 소스가 교체되었으나 증거는 그대로 유지된 모든 50건의 잘못된 귀속 사례를 성공적으로 감지했습니다.
  • 이 시스템은 RARR 스타일의 수리 루프를 통합하여 차단된 모든 답변을 해결했으나, 많은 경우 실질적인 재작성보다는 안전한 대체 텍스트로 이어졌습니다.

이 접근 방식은 소스 추적 정보를 주장별로 가시화함으로써 신빙성 점수의 한계를 해소하며, 잘못된 귀속이 부정확한 사실만큼이나 해로울 수 있는 데이터 민감한 환경에서 중요합니다.