Un nouvel article démontre que les blocs de raisonnement chiffrés provenant de modèles de pointe tels que Claude, GPT et Gemini peuvent être déchiffrés et rejoués pour extraire des données de chaîne de pensée cachées. Les auteurs montrent comment ces blobs signés peuvent être transférés vers des modèles plus faibles ou différentes sessions afin de transcrire les pensées sous-jacentes, contournant ainsi efficacement les efforts d'obscurcissement des fournisseurs.

  • Un examen d'environ 7 000 traces publiques a révélé des données sensibles divulguées, notamment 62 clés API uniques, 33 adresses e-mail et 33 mots de passe cachés exclusivement dans les blocs de raisonnement.
  • La technique consiste à obtenir un bloc chiffré légitime, à le rejouer dans une requête différente ou vers un modèle plus faible du même fournisseur, et à utiliser des invites spécifiques pour forcer la transcription du raisonnement attaché.
  • Des méthodes spécifiques ont été détaillées pour Claude (rejeu vers Haiku 4.5), GPT (injection de contenu chiffré avec continuations par chunks) et Gemini (attachement de signatures de pensée).
  • La vulnérabilité soulève d'importantes préoccupations en matière de confidentialité, car les traces partagées peuvent divulguer des données personnelles, et complique la surveillance de l'alignement en raison du caractère concis ou fragmenté des pensées déchiffrées.

L'article a été divulgué de manière responsable, et plusieurs vulnérabilités ont déjà été corrigées, mais les résultats mettent en lumière les risques persistants liés à la manière dont les laboratoires de pointe gèrent et protègent leurs processus de raisonnement internes.