L'auteur a développé Epistemic Shield, un framework expérimental qui traite la réponse initiale d'un LLM comme une hypothèse provisoire plutôt que comme une sortie finale. Le système décompose les réponses en affirmations atomiques et les soumet à une auto-critique adversariale pour mesurer la cohérence à travers des évaluations stochastiques.
- Décompose les réponses en affirmations atomiques pour une analyse granulaire.
- Soumet chaque affirmation à une auto-critique adversariale.
- Mesure la cohérence à travers de multiples évaluations stochastiques.
- Intègre des preuves externes lorsqu'elles sont disponibles.
- Applique des pénalités asymétriques aux affirmations non étayées dans les domaines à haut risque.
- Permet l'abstention partielle au lieu de forcer le modèle à tout répondre.
L'auteur cherche des critiques techniques, des suggestions de benchmarks et des collaborateurs pour tester si cette architecture améliore la calibration ou la résistance aux hallucinations.