La société de sécurité Adversa a révélé une attaque par injection de prompt contre Grok, le LLM de xAI, l'entreprise d'Elon Musk, qui permet d'exfiltrer des données utilisateur. Le chercheur Rony Utevsky a découvert que les filtres de sécurité pouvaient être contournés en chiffrant l'instruction malveillante au lieu de l'écrire en clair. L'attaquant héberge une page contenant le texte chiffré, la clé de déchiffrement et des instructions en clair pour le déchiffrer. Quand un utilisateur demande à Grok de résumer la page, le modèle suit la commande cachée sans avertissement ni confirmation.
L'instruction déchiffrée demande à Grok de construire ce qui ressemble à une clé de déchiffrement. En réalité, la valeur contient le nom de l'utilisateur, sa localisation et son historique de conversation. Grok l'ajoute comme paramètre à une URL pointant vers le serveur de l'attaquant et ouvre le lien. Les données atterrissent dans les journaux du serveur. Adversa a informé xAI en juin, mais au moment de la publication, l'assistant divulguait toujours les données.
L'hypothèse privilégiée pour expliquer le contournement est que les garde-fous de Grok inspectent le texte qui entre et sort du modèle, mais pas la sortie de sa propre exécution de code. Une demande de traitement d'un texte chiffré avec PBKDF2 et AES-256-GCM ressemble à une tâche ordinaire pour un classifieur statique, car savoir ce que le chiffré débloque exigerait d'exécuter réellement le déchiffrement. Une fois la charge utile déchiffrée dans son bac à sable, les instructions parviennent au modèle comme sa propre sortie d'outil et sont exécutées sans filtrage.
Adversa a appliqué une technique voisine à Gemini de Google sous forme de jailbreak. Là, le texte chiffré se déchiffrait en quelque chose ressemblant à un traceback Python, avec une règle ordonnant au modèle de lire le message d'erreur et d'agir en conséquence. Le prompt injecté a conduit Gemini à produire du contenu normalement bloqué, notamment des instructions pour fabriquer une arme incendiaire. Avec une charge modifiée, le même vecteur a reproduit les instructions système de Gemini. Adversa n'a pas signalé le comportement à Google, les jailbreaks sortant du périmètre de son programme de divulgation de vulnérabilités. Ces dernières semaines, Gemini est devenu de plus en plus résistant à l'attaque, sans que l'on sache si cela tient aux filtres ou au modèle.
Les chercheurs baptisent la technique cryptographic context injection et la rattachent à une classe d'attaques plus large qui manipule non seulement le prompt, mais tout le contexte qu'un LLM considère comme sien, comme les sorties d'outils et les résultats d'exécution. Cette divulgation suit une attaque similaire contre Microsoft 365 Copilot révélée quelques jours plus tôt, où une entrée secrète avait poussé l'assistant à exfiltrer un mot de passe depuis la boîte de réception d'un utilisateur.
Commentaires
Pas encore de commentaire — écris le premier.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
Rien reçu ? Vérifiez le dossier spam — et marquez le message « Non spam » pour qu'il arrive directement la prochaine fois.