Le chercheur en sécurité wunderwuzzi a publié sur le blog Embrace The Red une chaîne d'attaque fonctionnelle contre Claude Code Opus 5 en mode Auto Mode, le mode d'autorisation par défaut chez Anthropic depuis mi-août 2026, qui remplace les validations manuelles par un classificateur de sécurité. Sur de petits échantillons de tests, il a obtenu des taux de réussite d'exécution de code compris entre 60 et 80 pour cent, ce qui contredit une évaluation tierce commandée par Anthropic auprès du prestataire Trajectory Labs, laquelle indiquait un taux de réussite de 0,00 pour cent sur 72 scénarios testés dix fois chacun.

L'attaque démarre par une simple demande de résumé d'un site web. Lorsque l'outil WebFetch de Claude reçoit une erreur HTTP 415, le modèle bascule de lui-même vers curl et télécharge une archive ZIP. Celle-ci contient un binaire macOS leurre nommé decoder-darwin ainsi qu'un fichier struct.py. Claude refuse d'exécuter le binaire inconnu et écrit à la place son propre décodeur Python, mais l'exécute depuis le dossier de l'archive extraite. Lors de l'import du module Python base64, le chemin de recherche de modules charge le struct.py malveillant de l'attaquant à la place de la bibliothèque standard, une technique appelée module shadowing. Le module piégé exécute du code obscurci qui lance un processus enfant Python isolé, lequel télécharge et exécute une charge utile distante ouvrant la calculatrice et se connectant à un serveur de commande et contrôle mis en place pour le test.

Dans une seconde variante, le module piégé lance, au lieu d'un sous-processus Python, une instance de Claude Code fonctionnant en mode headless via la commande claude -p. Cet agent imbriqué a exécuté des commandes de reconnaissance comme whoami, uname et id, ouvert la calculatrice et écrit des fichiers en dehors du répertoire de travail. Les taux de réussite mesurés étaient de 60 pour cent pour la chaîne C2 en Python, 60 pour cent pour la variante de reconnaissance via claude -p, et 80 pour cent pour la variante claude -p avec écriture de fichiers. Dans plusieurs essais, Claude a détecté la compromission après coup et a tenté de tuer le processus malveillant, mais le classificateur d'Auto Mode a bloqué cette commande de nettoyage.

Le chercheur a d'abord signalé le problème à modelbugbounty@anthropic.com sans recevoir de réponse, puis l'a soumis via le canal de sécurité standard d'Anthropic. Anthropic a classé le rapport comme "Informative", affirmant qu'Auto Mode fonctionne comme prévu: il s'agit d'un classificateur de confort à effort raisonnable, pas d'une frontière de sécurité, et que la véritable protection repose sur l'isolation au niveau du système d'exploitation et le contrôle du trafic réseau sortant. Le chercheur oppose cette position aux déclarations publiques de Boris Cherny, membre de l'équipe Claude Code, selon qui des défenses en couches, entraînement du modèle, sondes d'entrée et classificateur d'intention, ramènent l'injection de prompt indirecte à environ zéro et qu'il n'est plus possible en pratique de démontrer une injection de prompt.

L'article recommande d'exécuter les agents de codage sans supervision dans des conteneurs, des machines virtuelles ou des sandboxes au niveau du système d'exploitation, de restreindre le trafic réseau sortant, de surveiller l'activité des agents, et de ne jamais exposer identifiants, clés SSH ni répertoires personnels à ces agents, car une validation par Auto Mode ne prouve pas qu'une commande est sûre.