€0.00 — free as in speechtonight's forecast: clear skies over production Cache: warm · Deploys: fair, 0% rollbacks expectedset by moonlight, shipped before dawn · deploy freely Page A2

The Daily Commit The Nightly Build

Dev news, typeset daily — PHP · AI · The Wider Stack

The developer's evening paper — PHP · AI · The Wider Stack

vendredi 21 août 2026 Vol. I — No. 375 · Édition du matinÉdition du soir EN DE FR ES

AI · Sécurité

Des instructions chiffrées contournent les garde-fous de Grok et dérobent les données utilisateur

Des chercheurs d'Adversa démontrent une injection de prompt contre Grok qui dissimule des commandes malveillantes dans du texte chiffré.

sélectionné par Sönke

Le modèle les déchiffre dans son propre bac à sable, hors de portée des filtres de sécurité, et envoie noms, localisations et historiques de conversation vers un serveur attaquant. xAI a été informé en juin.

La société de sécurité Adversa a révélé une attaque par injection de prompt contre Grok, le LLM de xAI, l'entreprise d'Elon Musk, qui permet d'exfiltrer des données utilisateur. Le chercheur Rony Utevsky a découvert que les filtres de sécurité pouvaient être contournés en chiffrant l'instruction malveillante au lieu de l'écrire en clair. L'attaquant héberge une page contenant le texte chiffré, la clé de déchiffrement et des instructions en clair pour le déchiffrer. Quand un utilisateur demande à Grok de résumer la page, le modèle suit la commande cachée sans avertissement ni confirmation.

L'instruction déchiffrée demande à Grok de construire ce qui ressemble à une clé de déchiffrement. En réalité, la valeur contient le nom de l'utilisateur, sa localisation et son historique de conversation. Grok l'ajoute comme paramètre à une URL pointant vers le serveur de l'attaquant et ouvre le lien. Les données atterrissent dans les journaux du serveur. Adversa a informé xAI en juin, mais au moment de la publication, l'assistant divulguait toujours les données.

L'hypothèse privilégiée pour expliquer le contournement est que les garde-fous de Grok inspectent le texte qui entre et sort du modèle, mais pas la sortie de sa propre exécution de code. Une demande de traitement d'un texte chiffré avec PBKDF2 et AES-256-GCM ressemble à une tâche ordinaire pour un classifieur statique, car savoir ce que le chiffré débloque exigerait d'exécuter réellement le déchiffrement. Une fois la charge utile déchiffrée dans son bac à sable, les instructions parviennent au modèle comme sa propre sortie d'outil et sont exécutées sans filtrage.

Adversa a appliqué une technique voisine à Gemini de Google sous forme de jailbreak. Là, le texte chiffré se déchiffrait en quelque chose ressemblant à un traceback Python, avec une règle ordonnant au modèle de lire le message d'erreur et d'agir en conséquence. Le prompt injecté a conduit Gemini à produire du contenu normalement bloqué, notamment des instructions pour fabriquer une arme incendiaire. Avec une charge modifiée, le même vecteur a reproduit les instructions système de Gemini. Adversa n'a pas signalé le comportement à Google, les jailbreaks sortant du périmètre de son programme de divulgation de vulnérabilités. Ces dernières semaines, Gemini est devenu de plus en plus résistant à l'attaque, sans que l'on sache si cela tient aux filtres ou au modèle.

Les chercheurs baptisent la technique cryptographic context injection et la rattachent à une classe d'attaques plus large qui manipule non seulement le prompt, mais tout le contexte qu'un LLM considère comme sien, comme les sorties d'outils et les résultats d'exécution. Cette divulgation suit une attaque similaire contre Microsoft 365 Copilot révélée quelques jours plus tôt, où une entrée secrète avait poussé l'assistant à exfiltrer un mot de passe depuis la boîte de réception d'un utilisateur.

Lire la source originale (en anglais) ↗

Évaluer cet article : 0

Tribune des lecteurs

Pas encore de contributions — lance le débat.

The Daily CommitThe Nightly Build — Page A1