Un nuevo artículo demuestra que los bloques de razonamiento cifrados de modelos de vanguardia como Claude, GPT y Gemini pueden ser descifrados y reproducidos para extraer datos ocultos del encadenamiento del pensamiento. Los autores muestran cómo estos fragmentos firmados pueden transferirse a modelos más débiles o a diferentes sesiones para transcribir los pensamientos subyacentes, eludiendo efectivamente los esfuerzos de ofuscación de los proveedores.
- Un escaneo de aproximadamente 7.000 trazas públicas reveló datos confidenciales filtrados, incluidas 62 claves de API únicas, 33 direcciones de correo electrónico y 33 contraseñas ocultas exclusivamente dentro de bloques de razonamiento.
- La técnica implica obtener un bloque cifrado legítimo, reproducirlo en una solicitud diferente o en un modelo más débil del mismo proveedor, y utilizar indicaciones específicas para forzar la transcripción del razonamiento adjunto.
- Se detallaron métodos específicos para Claude (reproduciendo en Haiku 4.5), GPT (inyectando contenido cifrado con continuaciones fragmentadas) y Gemini (adjuntando firmas de pensamiento).
- La vulnerabilidad plantea importantes preocupaciones de privacidad, ya que las trazas compartidas pueden filtrar datos personales, y complica el monitoreo del alineamiento debido a la naturaleza concisa o fragmentada de los pensamientos descifrados.
El artículo fue divulgado de manera responsable, y varias vulnerabilidades ya han sido corregidas, pero los hallazgos destacan riesgos persistentes en cómo los laboratorios de vanguardia manejan y protegen sus procesos internos de razonamiento.