本記事では、フロントティア大規模言語モデルにおける「例外チェーン崩壊(exception chain collapse)」と呼ばれる失敗クラスが文書化されています。これは、モデルがネストされた条件付きルールを誤って評価する現象です。これに対処するため、著者は Aethis Eligibility Module を提案します。これは LLM が作成したルールと SMT ベースのレイヤーを組み合わせた神経記号的アーキテクチャで、決定論的な実行を実現します。
- システムは、モデルのドリフトやプロンプト形式の変更に関係なく、一貫したルール実行を保証します。
- 建設保険に関する20シナリオの敵対的テストでは、エンジンが 20/20 のスコアを記録し、4つのフロントティア構成のうち1つと一致しました。
- LegalBench タスクでの外部検証により、エンジンが3つのフロントティアモデルよりも大幅に正確であることが示され、Anthropic モデルに対して最大 +41 ポイントの差をつけました。
この貢献は、不確実性を推論境界から仕様境界へ移行させ、規制されたワークフローにおいて意図的かつ監査可能なものにします。