ProvenanceGuard — это слой постгенерационной верификации для агентов Model Context Protocol (MCP), который выявляет смешение источников, гарантируя, что утверждения атрибутируются правильному источнику доказательств. Система анализирует захваченные трассы MCP без переобучения агента, разбивая ответы на утверждения и проверяя, совпадает ли поддерживающий источник с тем, который назван или подразумевается в выводе.
- ProvenanceGuard выявил 138 из 139 утверждений, которые эксперты-люди сочли неподкреплёнными, при этом правильно определяя верный источник примерно в 86% случаев.
- В тесте с похожими источниками он показал F1 0.846 для решений о блокировке и точно определил источники в 50.3% случаев.
- Он успешно обнаружил все 50 случаев неверной атрибуции, когда названный источник был заменён, а доказательства остались нетронутыми.
- Система интегрирует цикл ремонта по типу RARR, который устранил все заблокированные ответы, хотя во многих случаях это привело к безопасному тексту по умолчанию вместо содержательных переписываний.
Этот подход решает ограничение показателей достоверности за счёт видимой атрибуции утверждений по одному, что критически важно для чувствительных к данным сценариев, где неверная атрибуция может быть столь же вредной, как и неправильные факты.