저자는 LLM의 초기 응답을 최종 출력이 아닌 가설로 간주하는 실험용 프레임워크인 Epistemic Shield를 개발했습니다. 이 시스템은 답변을 원자적 주장으로 분해하고 확률적 평가 전반에 걸쳐 일관성을 측정하기 위해 적대적 자기 비판에 부칩니다.
- 세밀한 분석을 위해 응답을 원자적 주장으로 분해합니다.
- 각 주장을 적대적 자기 비판에 부칩니다.
- 여러 확률적 평가 전반에 걸쳐 일관성을 측정합니다.
- 사용 가능한 경우 외부 증거를 통합합니다.
- 고위험 영역에서 지지되지 않는 주장에 비대칭 페널티를 적용합니다.
- 모델이 모든 것에 답변하도록 강요하는 대신 부분적 불응을 허용합니다.
저자는 이 아키텍처가 교정 또는 환각 저항성을 개선하는지 테스트하기 위해 기술적 비판, 벤치마크 제안 및 협력자를 찾고 있습니다.