Des chercheurs de MATS Research, de l'ELLIS Institute Tübingen, du Max Planck Institute for Intelligent Systems, de Snyk et d'autres institutions démontrent que le raisonnement caché des modèles de pointe peut être reconstitué sans attaquer directement le modèle puissant. Des fournisseurs comme Anthropic, OpenAI et Google renvoient la chaîne de pensée du modèle au client sous forme de bloc chiffré, qui est renvoyé au serveur lorsque la conversation se poursuit. Ces blocs sont portables : ils peuvent être rejoués entre sessions, utilisateurs et modèles.
L'attaque ne requiert que deux appels d'API. Une trace de raisonnement produite par un modèle puissant — par exemple claude-opus-4-8 — est injectée dans un modèle frère plus faible comme claude-haiku-4-5-20251001. Ce dernier est ensuite soumis à un jailbreak lui demandant de transcrire le raisonnement joint mot pour mot, et il produit les pensées cachées du modèle fort en clair — sans jamais déclencher les protections ni les défenses anti-distillation du modèle fort.
La fidélité a été validée sur 120 problèmes Codeforces : le nombre de tokens du raisonnement décodé suit de près le nombre de tokens de pensée cachés rapporté par l'API. L'équipe a aussi appliqué son pipeline à grande échelle : à partir de 6 708 trajectoires d'agents publiquement disponibles collectées sur GitHub et Hugging Face, elle a reconstitué 315 320 blocs de raisonnement.
Ces traces contenaient de véritables secrets. En se limitant à des sessions utilisateurs réelles (hors benchmarks), l'équipe a récupéré 704 artefacts sensibles distincts, dont 62 clés d'API, 33 mots de passe, 24 jetons d'accès et 30 adresses e-mail personnelles, ainsi que des noms, adresses postales et URL internes. 64 de ces artefacts n'apparaissaient que dans les blocs de raisonnement et nulle part dans la session visible — les utilisateurs peuvent donc fuiter des données qu'ils ne voient jamais.
Autres résultats : pré-remplir le raisonnement de Kimi-K3 avec le premier pour cent des tokens de raisonnement d'Opus 4.8 rapproche ses réponses visibles de la formulation d'Opus. La technique permet aussi de récupérer des raisonnements dangereux lorsqu'un modèle réfléchit à du contenu nuisible tout en affichant une réponse bénigne. Enfin, les résumés de raisonnement fournis par l'API sont parfois infidèles : sur certains problèmes AIME, Opus 4.8 énonce la réponse avant de la dériver, alors que le résumé présente une dérivation propre.
Commentaires
Pas encore de commentaire — écris le premier.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
Rien reçu ? Vérifiez le dossier spam — et marquez le message « Non spam » pour qu'il arrive directement la prochaine fois.