본 기사는 exception chain collapse라고 불리는 최전방 대규모 언어 모델의 실패 클래스를 문서화하고 있으며, 여기서 모델은 중첩된 조건부 규칙을 잘못 평가합니다. 이를 해결하기 위해 저자들은 Aethis Eligibility Module을 제시하는데, 이는 LLM이 작성한 규칙과 결정론적 실행을 위한 SMT 기반 레이어를 결합한 신경-기호 아키텍처입니다.

  • 이 시스템은 모델 드리프트나 프롬프트 형식 변경에 관계없이 일관된 규칙 실행을 보장합니다.
  • 건설 보험에 대한 20개 시나리오 적대적 테스트에서 엔진은 20/20점을 기록하여 네 가지 최전방 구성 중 하나와만 일치했습니다.
  • LegalBench 작업에 대한 외부 검증은 엔진이 세 가지 최전방 모델보다 훨씬 더 정확함을 보여주었으며, Anthropic 모델 대비 최대 +41점의 마진을 보였습니다.

이 기여는 불확실성을 추론 경계에서 명세 경계로 이동시켜 규제된 워크플로우에서 의도적이고 감사 가능한 것으로 만듭니다.