Los investigadores han identificado una vulnerabilidad en cómo los principales proveedores de modelos de lenguaje grandes manejan las trazas de razonamiento paso a paso, que se devuelven como bloques cifrados para uso del lado del cliente. Descubrieron que estos bloques cifrados son completamente compatibles e intercambiables entre diferentes sesiones, usuarios y modelos dentro del ecosistema del mismo proveedor.

  • El equipo desarrolló un jailbreak de descifrado escalable inyectando una traza de razonamiento cifrada de un modelo capaz en un modelo más débil y menos protegido para forzarlo a emitir la traza en texto plano.
  • Este método elude los mecanismos anti-distilación, permitiendo la extracción de trazas de razonamiento propietarias de proveedores como Anthropic, OpenAI y Google.
  • La vulnerabilidad permite la extracción a gran escala de datos privados; descifrar 315.320 bloques de razonamiento extraídos de repositorios públicos reveló 367 artefactos PII y 182 credenciales.
  • El fallo revela inadvertidamente información peligrosa oculta dentro del proceso de razonamiento, incluso cuando la salida final del modelo rechaza de forma segura una solicitud maliciosa.
  • Los atacantes pueden utilizar este fallo para ejecutar inyecciones de prompt invisibles incrustando cargas útiles maliciosas dentro de bloques cifrados para envenenar despliegues agénticos públicos.

Tras la divulgación responsable, los autores proponen mitigaciones concretas a nivel criptográfico y de sistema para asegurar el razonamiento del lado del cliente.