Los investigadores han identificado una vulnerabilidad arquitectónica en la forma en que los principales proveedores de modelos de lenguaje grandes manejan las trazas de razonamiento paso a paso. Los proveedores devuelven estas trazas como bloques cifrados a los clientes, pero el estudio encuentra que estos bloques son completamente compatibles e intercambiables entre diferentes sesiones, usuarios y modelos dentro del ecosistema de un proveedor.
- Los investigadores desarrollaron una jailbreak de descifrado escalable inyectando una traza de razonamiento cifrada de un modelo capaz en un modelo más débil y menos protegido del mismo proveedor para forzar la salida en texto plano.
- Este método elude los mecanismos anti-distilación, permitiendo la extracción de trazas de razonamiento propietarias de Anthropic, OpenAI y Google.
- La vulnerabilidad permite la extracción a gran escala de datos privados; descifrar 315.320 bloques de razonamiento extraídos de repositorios públicos reveló 367 artefactos de PII y 182 credenciales.
- El fallo revela inadvertidamente información peligrosa oculta dentro del proceso de razonamiento, incluso cuando la salida final del modelo rechaza de forma segura una solicitud.
- Los atacantes pueden utilizar este fallo para ejecutar inyecciones de prompt invisibles incrustando cargas útiles maliciosas dentro de bloques cifrados para envenenar las implementaciones públicas de agentes.
Tras la divulgación responsable, los autores proponen mitigaciones criptográficas y a nivel de sistema concretas para asegurar el razonamiento del lado del cliente.