L'article documente une classe de défaillance dans les grands modèles de langage de pointe appelée effondrement en chaîne d'exceptions, où les modèles évaluent incorrectement les règles conditionnelles imbriquées. Pour remédier à cela, les auteurs présentent le module d'éligibilité Aethis, une architecture neuro-symbolique qui combine des règles rédigées par un LLM avec une couche basée sur SMT pour une exécution déterministe.
- Le système garantit une exécution cohérente des règles indépendamment de la dérive du modèle ou des changements de format de prompt.
- Lors d'un test adversarial sur 20 scénarios concernant l'assurance construction, le moteur a obtenu 20/20, égalant seulement l'une des quatre configurations de pointe.
- La validation externe sur les tâches LegalBench a montré que le moteur était significativement plus précis que trois modèles de pointe, avec des marges allant jusqu'à +41 points contre les modèles d'Anthropic.
La contribution déplace l'incertitude de la frontière d'inférence vers la frontière de spécification, la rendant délibérée et auditable pour les flux de travail réglementés.