Un artículo demuestra que los bloques de cadena de pensamiento cifrados devueltos por Anthropic, OpenAI y Google pueden extraerse en texto plano. Los autores explotaron una vulnerabilidad donde los modelos dentro de la misma familia compartían claves de cifrado, permitiéndoles repetir trazos en modelos hermanos más débiles.

  • Al alimentar bloques de razonamiento cifrados de modelos más fuertes en modelos más débiles como Claude Haiku 4.5, los atacantes podían jailbreak del modelo para generar el contenido crudo y sin cifrar.
  • El ataque utilizó técnicas específicas de inyección de prompts, como instruir al modelo para transcribir el razonamiento adjunto literalmente dentro de etiquetas personalizadas.
  • Los modelos trataban sus propios trazos de razonamiento como sagrados, lo que los hacía altamente susceptibles a seguir instrucciones incrustadas en estos fragmentos repetidos.

El artículo destaca que este método revela tokens de razonamiento interno nunca destinados al consumo humano y descubre una variante novedosa de inyección de prompts. Sin embargo, los autores señalan que todos los proveedores de modelos reconocieron el informe y posteriormente parchearon la vulnerabilidad.