ProvenanceGuard adalah lapisan verifikasi pasca-pembuatan untuk agen Model Context Protocol (MCP) yang mendeteksi penggabungan lintas-sumber dengan memastikan klaim dikaitkan ke sumber bukti yang benar. Sistem ini menganalisis jejak MCP yang ditangkap tanpa melatih ulang agen, memecah jawaban menjadi klaim dan memverifikasi bahwa sumber pendukung cocok dengan yang dinamakan atau tersirat dalam output.
- ProvenanceGuard menangkap 138 dari 139 klaim yang dianggap tidak didukung oleh pakar manusia sambil secara benar mengidentifikasi sumber yang tepat sekitar 86% dari waktu.
- Dalam pengujian dengan sumber serupa, sistem ini mencetak F1 sebesar 0.846 untuk keputusan pemblokiran dan mengidentifikasi sumber tepat dalam 50.3% kasus.
- Sistem ini berhasil mendeteksi semua 50 contoh atribusi salah di mana sumber yang dinamakan ditukar sementara bukti tetap utuh.
- Sistem ini mengintegrasikan loop perbaikan bergaya RARR yang menyelesaikan semua jawaban yang diblokir, meskipun banyak di antaranya menghasilkan teks fallback aman daripada penulisan ulang substansial.
Pendekatan ini mengatasi keterbatasan skor kesetiaan dengan membuat provenance terlihat klaim demi klaim, yang sangat penting untuk pengaturan sensitif data di mana atribusi salah dapat sama merusaknya dengan fakta yang salah.