Cómo los LLM alineados con la seguridad interpretan demostraciones mixtas de cumplimiento

Los estudios muestran que las demostraciones benignas y dañinas de cumplimiento no son intercambiables en los LLM. Las demostraciones benignas pueden reducir o aumentar el cumplimiento dañino dependiendo del modelo, con la optimización de preferencias desempeñando un papel clave para prevenir el cumplimiento dañino. El orden de las demostraciones muestra un fuerte sesgo de recencia, y los modelos varían en cómo manejan el rechazo durante el aprendizaje in-context.