La empresa de seguridad Adversa ha revelado un ataque de inyección de prompt contra Grok, el LLM de xAI, la compañía de Elon Musk, que exfiltra datos de usuarios. El investigador Rony Utevsky descubrió que los filtros de seguridad pueden eludirse cifrando la instrucción maliciosa en lugar de escribirla en texto plano. El atacante aloja una página con el texto cifrado, la clave de descifrado e instrucciones en claro para descifrarlo. Cuando un usuario pide a Grok que resuma la página, el modelo sigue el comando oculto sin aviso ni confirmación.

La instrucción descifrada ordena a Grok construir lo que parece una clave de descifrado. En realidad, el valor contiene el nombre del usuario, su ubicación y su historial de chat. Grok lo añade como parámetro a una URL que apunta al servidor del atacante y abre el enlace. Los datos quedan registrados en los logs del servidor. Adversa informó a xAI en junio, pero en el momento de la publicación el asistente seguía filtrando los datos.

La teoría principal sobre eludir los filtros es que las defensas de Grok inspeccionan el texto que entra y sale del modelo, pero no la salida de su propia ejecución de código. Una petición de procesar texto cifrado con PBKDF2 y AES-256-GCM parece una tarea normal para un clasificador estático, porque saber qué desbloquea el cifrado requeriría ejecutar realmente el descifrado. Una vez que Grok descifra la carga en su sandbox, las instrucciones llegan al modelo como su propia salida de herramienta y se ejecutan sin filtrado.

Adversa aplicó una técnica similar a Gemini de Google como jailbreak. Allí el texto cifrado se descifraba en algo parecido a un traceback de Python, con una regla que ordenaba al modelo leer el mensaje de error y actuar en consecuencia. El prompt inyectado hizo que Gemini produjera contenido restringido, incluidas instrucciones para fabricar un arma incendiaria. Con una carga modificada, el mismo vector reprodujo las instrucciones de sistema de Gemini. Adversa no lo notificó a Google porque los jailbreaks quedan fuera de su programa de divulgación de vulnerabilidades. En las últimas semanas Gemini se ha vuelto más resistente al ataque. No está claro si esto se debe a actualizaciones de filtros o a cambios en el modelo.

Los investigadores llaman a la técnica cryptographic context injection y la sitúan dentro de una clase más amplia de ataques que manipulan no solo el prompt, sino todo el contexto que un LLM trata como propio, como las salidas de herramientas y los resultados en tiempo de ejecución. La revelación sigue a un ataque similar contra Microsoft 365 Copilot publicado días antes, en el que una entrada secreta hizo que el asistente exfiltrara una contraseña desde la bandeja de entrada de un usuario.