Un article démontre que les blocs de chaîne de pensée chiffrés renvoyés par Anthropic, OpenAI et Google peuvent être extraits en clair. Les auteurs ont exploité une vulnérabilité où les modèles d'une même famille partageaient des clés de chiffrement, leur permettant de rejouer les traces dans des modèles frères plus faibles.
- En alimentant des blocs de raisonnement chiffrés provenant de modèles plus puissants dans des modèles plus faibles comme Claude Haiku 4.5, les attaquants pouvaient contourner le modèle pour qu'il produise le contenu brut et non chiffré.
- L'attaque utilisait des techniques spécifiques d'injection de prompt, telles que l'instruction au modèle de transcrire verbatim le raisonnement joint entre des balises personnalisées.
- Les modèles considéraient leurs propres traces de raisonnement comme sacrées, ce qui les rendait très sensibles aux instructions intégrées dans ces blocs rejoués.
L'article souligne que cette méthode révèle des jetons de raisonnement internes jamais destinés à la consommation humaine et met au jour une variante nouvelle d'injection de prompt. Cependant, les auteurs notent que tous les fournisseurs de modèles ont reconnu le rapport et ont par conséquent corrigé la vulnérabilité.