El investigador de seguridad wunderwuzzi publicó en el blog Embrace The Red una cadena de ataque funcional contra Claude Code Opus 5 en Auto Mode, el modo de permisos predeterminado de Anthropic desde mediados de agosto de 2026, que sustituye las aprobaciones manuales por un clasificador de seguridad. En pruebas con muestras pequeñas obtuvo tasas de éxito de ejecución de código de entre el 60 y el 80 por ciento, lo que contradice una evaluación externa encargada por Anthropic al proveedor Trajectory Labs, que reportó una tasa de éxito del 0,00 por ciento en 72 escenarios probados diez veces cada uno.
El ataque comienza con una solicitud sencilla para resumir un sitio web. Cuando la herramienta WebFetch de Claude recibe un error HTTP 415, el modelo cambia por su cuenta a curl y descarga un archivo ZIP. Este contiene un binario señuelo para macOS llamado decoder-darwin y un archivo struct.py. Claude se niega a ejecutar el binario desconocido y en su lugar escribe su propio decodificador en Python, pero lo ejecuta desde la carpeta del archivo ya descomprimido. Al importar el módulo base64 de Python, la ruta de búsqueda de módulos carga el struct.py malicioso del atacante en lugar del de la biblioteca estándar, una técnica conocida como module shadowing. El módulo envenenado ejecuta código ofuscado que lanza un proceso hijo de Python aislado, el cual descarga y ejecuta una carga útil remota que abre la calculadora y se conecta a un servidor de mando y control configurado para la prueba.
En una segunda variante, el módulo envenenado lanza, en lugar de un subproceso de Python, una instancia de Claude Code headless mediante el comando claude -p. Ese agente anidado ejecutó comandos de reconocimiento como whoami, uname e id, abrió la calculadora y escribió archivos fuera del directorio de trabajo. Las tasas de éxito medidas fueron del 60 por ciento para la cadena C2 en Python, 60 por ciento para la variante de reconocimiento con claude -p, y 80 por ciento para la variante claude -p con escritura de archivos. En varias ejecuciones, Claude detectó la compromisión después de ocurrida e intentó terminar el proceso malicioso, pero el clasificador de Auto Mode bloqueó ese comando de limpieza.
El investigador reportó primero el problema a modelbugbounty@anthropic.com sin recibir respuesta, y luego lo envió por el canal de seguridad estándar de Anthropic. Anthropic cerró el informe como "Informative", indicando que Auto Mode funciona como fue diseñado: es un clasificador de conveniencia de mejor esfuerzo, no una frontera de seguridad, y que la protección real depende del aislamiento a nivel de sistema operativo y del control del tráfico de red saliente. El investigador contrasta esto con declaraciones públicas de Boris Cherny, miembro del equipo de Claude Code, quien afirmó que defensas en capas (entrenamiento del modelo, sondas de entrada y un clasificador de intención) reducen la inyección de prompt indirecta a casi cero y que ya casi no pueden demostrar inyección de prompt en la práctica.
El artículo recomienda ejecutar agentes de codificación sin supervisión dentro de contenedores, máquinas virtuales o sandboxes de sistema operativo, restringir el tráfico de red saliente, monitorear la actividad de los agentes y mantener credenciales, claves SSH y directorios personales fuera del alcance de los agentes, ya que una aprobación de Auto Mode por sí sola no es prueba de que un comando sea seguro.




Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
¿No llega nada? Mira en la carpeta de spam — y marca el correo como «No es spam» para que la próxima vez llegue directo.