Des chercheurs ont identifié une vulnérabilité dans la manière dont les principaux fournisseurs de grands modèles de langage gèrent les traces de raisonnement étape par étape, qui sont renvoyées sous forme de blocs chiffrés pour une utilisation côté client. Ils ont constaté que ces blocs chiffrés sont entièrement compatibles et interchangeables entre différentes sessions, utilisateurs et modèles au sein de l'écosystème d'un même fournisseur.
- L'équipe a développé un jailbreak de déchiffrement évolutif en injectant une trace de raisonnement chiffrée issue d'un modèle performant dans un modèle plus faible et moins protégé pour le forcer à restituer la trace en clair.
- Cette méthode contourne les mécanismes anti-distillation, permettant l'extraction de traces de raisonnement propriétaires auprès de fournisseurs tels qu'Anthropic, OpenAI et Google.
- La vulnérabilité permet l'extraction massive de données privées ; le décodage de 315 320 blocs de raisonnement extraits de dépôts publics a révélé 367 artefacts de PII et 182 identifiants.
- Le défaut révèle involontairement des informations dangereuses cachées au sein du processus de raisonnement, même lorsque la sortie finale du modèle rejette en toute sécurité une requête malveillante.
- Les attaquants peuvent exploiter cette faille pour exécuter des injections d'invite invisibles en intégrant des charges utiles malveillantes dans des blocs chiffrés afin de corrompre les déploiements publics d'agents.
Suite à une divulgation responsable, les auteurs proposent des atténuations cryptographiques et au niveau du système concrètes pour sécuriser le raisonnement côté client.