Los investigadores han presentado ReasAlign, una solución a nivel de modelo diseñada para mejorar la alineación de seguridad en Modelos de Lenguaje Grande (LLM) frente a ataques de inyección indirecta de instrucciones. El enfoque incorpora pasos de razonamiento estructurados para analizar las consultas del usuario y detectar instrucciones conflictivas, asegurando la continuidad de las tareas pretendidas por el usuario.
- ReasAlign emplea un mecanismo de escalado en tiempo de prueba con un modelo juez optimizado por preferencias para puntuar los pasos de razonamiento y seleccionar la mejor trayectoria.
- En la benchmark CyberSecEval2, alcanza una utilidad del 94.6% y solo una tasa de éxito del ataque (ASR) del 3.6%.
- Este rendimiento supera ampliamente a Meta SecAlign, que registró una utilidad del 56.4% y una ASR del 74.4% en las mismas tareas.
Los autores afirman que ReasAlign establece una defensa robusta y práctica contra ataques de inyección de instrucciones en sistemas agénticos del mundo real al lograr la mejor compensación entre seguridad y utilidad.