REDACT introduce un benchmark multilingüe con control sistemático para la detección de información personalmente identificable, que incluye 51 tipos de entidades, 4.127 patrones de forma superficial y 25 idiomas. Evalúa cinco detectores en 1.000 registros, revelando que los modelos basados en reglas fallan en datos de alto riesgo, mientras que los LLMs tienen un mejor desempeño, especialmente en categorías de alta sensibilidad. Una evaluación de LLM sin referencia confirma que la asignación por nivel de sensibilidad es el eje de evaluación más desafiante.
REDACT: Benchmark multilingüe de PII con control sistemático
La evaluación zero-shot muestra que Gemini lidera a los LLM en la taxonomía de emociones de 13 clases
Un estudio evaluó tres modelos de lenguaje grandes comerciales: Claude (claude-sonnet-4-6), ChatGPT (GPT-5.4) y Gemini (gemini-2.5-flash) en una tarea de clasificación fina de emociones zero-shot utilizando una muestra estratificada de 1.000 oraciones del conjunto de datos boltuix/emotions.
Cuando la utilidad supera la precaución causal: Supresión y recuperación dependientes del contexto en los LLM
Un estudio revela que los modelos de lenguaje grandes suprimen sistemáticamente la 'Precaución Causal'—la tendencia a abstenerse de emitir juicios causales sin evidencia suficiente—al pasar de contextos académicos a contextos de asesoramiento práctico. Esta supresión ocurre a pesar de que los modelos conservan la capacidad subyacente, como lo demuestra la habilidad de restaurar el razonamiento cauteloso mediante prompts específicos.
El Reglamento de IA de la UE exige marcas de agua en textos generados por IA desde agosto de 2024
El Reglamento de IA de la UE requiere que todos los sistemas de IA que generen texto sintético incluyan marcas de agua legibles por máquina y detectables, utilizando soluciones técnicas robustas e interoperables con dos capas. Esto se aplica a todos los modelos de IA, incluidos los de código abierto, y se extiende a cualquier servicio accesible por ciudadanos de la UE, independientemente de su ubicación. El incumplimiento conlleva multas de hasta 35 millones de euros o un porcentaje de los ingresos anuales, y los proveedores de modelos de IA de 'riesgo sistémico' enfrentan una mayor responsabilidad.
NRT-Bench: Red-teaming multi-turn de agentes LLM en sistemas críticos para la seguridad
NRT-Bench presenta un benchmark para el red-teaming multi-turn de agentes LLM que operan en una planta de energía nuclear simulada. En cuatro modelos de operador de vanguardia, entre el 8,7 % y el 12,1 % de las sesiones de ataque provocan la pérdida de una función crítica de seguridad, con vulnerabilidades en gran medida disjuntas entre los modelos. La efectividad de las defensas varía significativamente según el modelo, mostrando una fuerte dependencia del modelo.
Desvío defensivo contra ataques automatizados en IA agéntica
Los sistemas de IA agéntica enfrentan crecientes amenazas por parte de ataques automatizados guiados por modelos. Una nueva estrategia de defensa, Desvío Contextual mediante Compromiso Progresivo (CMPE), reduce las tasas de éxito del atacante hasta en dos órdenes de magnitud y casi elimina el éxito verificado del ataque en pruebas de referencia.