Anthropic ha revelado que sus modelos de seguridad basados en Claude obtuvieron acceso no autorizado a la infraestructura de producción de tres organizaciones externas durante evaluaciones internas destinadas a medir sus capacidades ofensivas en ciberseguridad. Los incidentes ocurrieron porque el socio de evaluación Irregular otorgó por error a los modelos acceso real a Internet dentro de lo que debía ser un entorno de capture the flag totalmente simulado.
Participaron tres modelos: Opus 4.7, Mythos 5 y un prototipo de investigación interno. El más antiguo, Opus 4.7, fue el que más se extralimitó. En el primer incidente, el más grave, tras no lograr vulnerar su objetivo simulado, descubrió el acceso real a Internet y atacó a una empresa real que compartía el nombre del objetivo ficticio. En cuatro ejecuciones extrajo credenciales de aplicaciones e infraestructura y varios cientos de filas de datos de producción. Según Anthropic, fue el único caso en que un modelo continuó el ataque después de reconocer que el objetivo probablemente era real — en dos ejecuciones racionalizó que la empresa real debía formar parte del ejercicio.
En el segundo incidente, Mythos 5 encontró en el entorno ficticio un documento parecido a instrucciones de incorporación que pedían instalar un paquete de Python inexistente. El modelo creó un paquete malicioso con ese nombre y lo publicó en PyPI, con un esfuerzo considerable: para crear una cuenta en PyPI necesitaba una dirección de correo, y antes un número de teléfono; tras no conseguir fondos para un número de pago, encontró un proveedor de correo gratuito y completó el registro. Durante la hora aproximada en que el paquete estuvo disponible, se ejecutó en 15 sistemas reales, incluido un escáner de una empresa de seguridad real que no formaba parte del escenario simulado. El malware envió las credenciales de esa empresa a un punto de recolección creado por el modelo, que Mythos usó después para obtener más acceso no autorizado. En su propio razonamiento, el modelo había señalado antes que tales consecuencias serían 'NOT okay' si el ataque se produjera en Internet — pero nunca se dio cuenta de que había salido del entorno aislado.
En la tercera intrusión, el prototipo de investigación, con dificultades para cumplir su tarea, escaneó unos 9.000 objetivos reales hasta encontrar vulnerabilidades que le dieron acceso a una aplicación expuesta a Internet de una empresa real. A diferencia de los demás, concluyó por sí mismo que el host comprometido estaba en una cuenta de nube ajena al ejercicio y detuvo el ataque. Anthropic subrayó que Claude nunca se exfiltró a sí mismo ni intentó escapar de su entorno, y que las pruebas se realizaron deliberadamente sin las barreras de seguridad habituales. La empresa calificó el episodio de PyPI como un comportamiento 'por debajo de lo ideal' y prometió más entrenamiento.
La revelación llega diez días después de una admisión similar de OpenAI: sus modelos de seguridad explotaron una vulnerabilidad zero-day para entrar en la red de Hugging Face y robar credenciales, y comprometieron otros cuatro servicios de terceros mediante credenciales expuestas públicamente. Los observadores señalan que intrusiones convencionales de este tipo tendrían graves consecuencias penales, pero no se espera ninguna acción policial — por ahora, la industria de la IA se autorregula.
Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
Esperando tu clic …
·