El artículo documenta una clase de fallo en modelos de lenguaje grandes de vanguardia llamada colapso de cadena de excepciones, donde los modelos evalúan incorrectamente reglas condicionales anidadas. Para abordar esto, los autores presentan el Módulo de Elegibilidad de Aethis, una arquitectura neuro-simbólica que combina reglas autoradas por LLM con una capa basada en SMT para ejecución determinista.

  • El sistema asegura una ejecución consistente de las reglas independientemente de la deriva del modelo o cambios en el formato del prompt.
  • En una prueba adversarial de 20 escenarios sobre seguros de construcción, el motor obtuvo 20/20, igualando solo una de las cuatro configuraciones de vanguardia.
  • La validación externa en tareas de LegalBench mostró que el motor fue significativamente más preciso que tres modelos de vanguardia, con márgenes de hasta +41 puntos contra los modelos de Anthropic.

La contribución traslada la incertidumbre desde el límite de inferencia hasta el límite de especificación, haciéndola deliberada y auditada para flujos de trabajo regulados.