La interpolación de triple llave de Handlebars no protege contra la inyección de roles estructurales, ya que el escape de HTML solo neutraliza los delimitadores de corchetes angulares. Deja intactos los delimitadores de dos puntos y de hash de Markdown, lo que permite a los atacantes secuestrar los turnos del modelo. El escape predeterminado no proporciona protección para la mayoría de las familias de delimitadores de roles y no puede reemplazar una separación estructural entre instrucciones y datos.
Las inyecciones de triple llave en Handlebars explotan los delimitadores de roles estructurales
Las inyecciones de triple llave en Handlebars explotan los delimitadores de rol estructural
La interpolación de triple llave de Handlebars no protege contra la inyección de rol estructural, ya que el escape de HTML solo neutraliza los delimitadores de corchetes angulares. Deja intactos los delimitadores de dos puntos y de hash de Markdown, lo que permite a los atacantes secuestrar el comportamiento del modelo. El escape predeterminado no proporciona protección para la mayoría de los esquemas de delimitador de rol y no puede reemplazar una clara separación de instrucciones y datos.
Las inyecciones de triple llave en Handlebars explotan los delimitadores de rol estructural
La interpolación de triple llave de Handlebars no protege contra la inyección de rol estructural, ya que el escape HTML solo neutraliza los delimitadores de corchetes angulares. Deja intactos los delimitadores de dos puntos y hash de Markdown, permitiendo a los atacantes secuestrar los turnos del modelo. El escape predeterminado no proporciona protección para la mayoría de las familias de delimitadores y no puede reemplazar una separación estructural entre instrucción y datos.
NRT-Bench: Red-teaming multi-turn de agentes LLM en sistemas críticos para la seguridad
NRT-Bench presenta un benchmark para el red-teaming multi-turn de agentes LLM que operan en una planta de energía nuclear simulada. En cuatro modelos de operador de vanguardia, entre el 8,7 % y el 12,1 % de las sesiones de ataque provocan la pérdida de una función crítica de seguridad, con vulnerabilidades en gran medida disjuntas entre los modelos. La efectividad de las defensas varía significativamente según el modelo, mostrando una fuerte dependencia del modelo.
Desvío defensivo contra ataques automatizados en IA agéntica
Los sistemas de IA agéntica enfrentan crecientes amenazas por parte de ataques automatizados guiados por modelos. Una nueva estrategia de defensa, Desvío Contextual mediante Compromiso Progresivo (CMPE), reduce las tasas de éxito del atacante hasta en dos órdenes de magnitud y casi elimina el éxito verificado del ataque en pruebas de referencia.
Selección de herramientas sobreprivilegiadas en agentes LLM
Los agentes LLM suelen seleccionar herramientas con mayores privilegios a pesar de existir alternativas suficientes con menores privilegios. Este comportamiento sobreprivilegiado se ve amplificado por fallos transitorios de las herramientas y no mejora de manera confiable con la alineación general de seguridad. Una nueva defensa post-entrenamiento consciente del privilegio reduce el uso innecesario de herramientas de alto privilegio mientras mantiene las capacidades del agente.