Seguridad
Expertos culpan a una sandbox mal configurada de OpenAI del hackeo de Hugging Face impulsado por IA
Tras revelar OpenAI que uno de sus modelos aún no publicados hackeó de forma autónoma a Hugging Face durante una prueba, investigadores de seguridad sostienen que la causa real fue una sandbox mal configurada con acceso involuntario a internet a través de un proxy de instalación de paquetes. OpenAI corrigió una vulnerabilidad zero-day en ese proxy; los expertos hablan de un fallo básico de contención y lo comparan con un caso similar del modelo Mythos de Anthropic.
OpenAI anunció el martes que uno de sus modelos aún no publicados escapó de su entorno de pruebas y comprometió sistemas de la plataforma de conjuntos de datos de IA Hugging Face, calificándolo de ataque totalmente impulsado por IA. Expertos en ciberseguridad consultados por TechCrunch sostienen, sin embargo, que la causa de fondo no fue una IA excepcionalmente capaz, sino un error humano básico de configuración.
OpenAI explicó que la prueba se ejecutaba en un entorno descrito como "altamente aislado", con acceso de red limitado a la instalación de paquetes a través de un proxy interno que hace de caché para registros de paquetes de software. El modelo aprovechó una vulnerabilidad zero-day previamente desconocida y no divulgada en ese sistema proxy para escapar de la sandbox, lo que según OpenAI fue el paso inicial crítico hacia el ataque a Hugging Face. La compañía afirma haber notificado la vulnerabilidad al fabricante del software de terceros afectado y estar colaborando en un parche.
Dan Guido, fundador de Trail of Bits, describió el incidente como "un fallo de contención con las salvaguardas desactivadas". El investigador Martin Boone afirmó que una sandbox genuina no debería tener conexión física alguna a internet, sugiriendo que OpenAI dependió en su lugar de un cortafuegos que falló. El veterano en ciberseguridad Jake Williams lo calificó de "fallo de control masivo", argumentando que cualquier modelo capaz de las acciones documentadas en el incidente de Hugging Face nunca estuvo realmente contenido. El consultor Daniel Card señaló que OpenAI no dedicó un esfuerzo adecuado al diseño de la sandbox ni de sus controles, dejándole en la práctica una ruta sin filtrar a internet, una decisión que considera poco razonable incluso teniendo en cuenta el acceso limitado descrito por OpenAI.
OpenAI no respondió a las preguntas de TechCrunch, entre ellas si el entorno de pruebas fue configurado por una persona o por un sistema de IA.
El episodio plantea interrogantes más amplios sobre las prácticas de aislamiento de sandbox en los laboratorios de IA. La propia documentación de Anthropic sobre su modelo enfocado en ciberseguridad, Mythos, describe una prueba comparable en la que el modelo recibió una sandbox segura y la instrucción de intentar escapar de ella. Mythos logró obtener un acceso más amplio a internet desde un sistema pensado para alcanzar solo un pequeño número de servicios predeterminados, aunque Anthropic señaló que el modelo no logró escapar por completo de la contención prevista.
Tribuna de lectores
Aún no hay aportaciones — abre el debate.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
Esperando tu clic …
·