El Reglamento de IA de la UE requiere que todos los sistemas de IA que generen texto sintético incluyan marcas de agua legibles por máquina y detectables, utilizando soluciones técnicas robustas e interoperables con dos capas. Esto se aplica a todos los modelos de IA, incluidos los de código abierto, y se extiende a cualquier servicio accesible por ciudadanos de la UE, independientemente de su ubicación. El incumplimiento conlleva multas de hasta 35 millones de euros o un porcentaje de los ingresos anuales, y los proveedores de modelos de IA de 'riesgo sistémico' enfrentan una mayor responsabilidad.
El Reglamento de IA de la UE exige marcas de agua en textos generados por IA desde agosto de 2024
Cuando la utilidad supera la precaución causal: Supresión y recuperación dependientes del contexto en los LLM
Un estudio revela que los modelos de lenguaje grandes suprimen sistemáticamente la 'Precaución Causal'—la tendencia a abstenerse de emitir juicios causales sin evidencia suficiente—al pasar de contextos académicos a contextos de asesoramiento práctico. Esta supresión ocurre a pesar de que los modelos conservan la capacidad subyacente, como lo demuestra la habilidad de restaurar el razonamiento cauteloso mediante prompts específicos.
NRT-Bench: Red-teaming multi-turn de agentes LLM en sistemas críticos para la seguridad
NRT-Bench presenta un benchmark para el red-teaming multi-turn de agentes LLM que operan en una planta de energía nuclear simulada. En cuatro modelos de operador de vanguardia, entre el 8,7 % y el 12,1 % de las sesiones de ataque provocan la pérdida de una función crítica de seguridad, con vulnerabilidades en gran medida disjuntas entre los modelos. La efectividad de las defensas varía significativamente según el modelo, mostrando una fuerte dependencia del modelo.
Desvío defensivo contra ataques automatizados en IA agéntica
Los sistemas de IA agéntica enfrentan crecientes amenazas por parte de ataques automatizados guiados por modelos. Una nueva estrategia de defensa, Desvío Contextual mediante Compromiso Progresivo (CMPE), reduce las tasas de éxito del atacante hasta en dos órdenes de magnitud y casi elimina el éxito verificado del ataque en pruebas de referencia.
REDACT: Benchmark multilingüe de PII con control sistemático
REDACT introduce un benchmark multilingüe con control sistemático para la detección de información personalmente identificable, que incluye 51 tipos de entidades, 4.127 patrones de forma superficial y 25 idiomas. Evalúa cinco detectores en 1.000 registros, revelando que los modelos basados en reglas fallan en datos de alto riesgo, mientras que los LLMs tienen un mejor desempeño, especialmente en categorías de alta sensibilidad. Una evaluación de LLM sin referencia confirma que la asignación por nivel de sensibilidad es el eje de evaluación más desafiante.
Selección de herramientas sobreprivilegiadas en agentes LLM
Los agentes LLM suelen seleccionar herramientas con mayores privilegios a pesar de existir alternativas suficientes con menores privilegios. Este comportamiento sobreprivilegiado se ve amplificado por fallos transitorios de las herramientas y no mejora de manera confiable con la alineación general de seguridad. Una nueva defensa post-entrenamiento consciente del privilegio reduce el uso innecesario de herramientas de alto privilegio mientras mantiene las capacidades del agente.