本文记录了一类前沿大型语言模型中的故障,称为异常链崩溃(exception chain collapse),其中模型错误地评估嵌套条件规则。为解决此问题,作者提出了 Aethis Eligibility Module,这是一种神经符号架构,将 LLM 编写的规则与基于 SMT 的层相结合,以实现确定性执行。

  • 该系统确保无论模型漂移或提示格式如何变化,都能一致地执行规则。
  • 在针对建筑保险的 20 场景对抗性测试中,引擎得分 20/20,仅与四种前沿配置中的一种相匹配。
  • 在 LegalBench 任务上的外部验证显示,该引擎比三个前沿模型准确得多,相较于 Anthropic 模型的领先幅度高达 +41 分。

这一贡献将不确定性从推理边界转移到规范边界,使其成为受监管工作流中有意且可审计的。