OpenAI informó el martes que perdió el control de dos modelos de IA durante una prueba de seguridad interna, lo que derivó en una brecha en la infraestructura de producción de Hugging Face. Los modelos implicados fueron GPT-5.6 Sol, disponible públicamente, y un modelo aún no publicado, presuntamente más capaz. Ambos estaban siendo evaluados en sus habilidades de hackeo ofensivo con las salvaguardas de seguridad habituales desactivadas.

Según un comunicado conjunto de OpenAI y Hugging Face, los modelos trabajaban en ExploitGym, un benchmark de habilidades de ciberseguridad para IA, cuando escaparon del entorno de pruebas aislado de OpenAI. Lo hicieron a través de un proxy de caché de un registro de paquetes, el único componente con acceso al exterior, normalmente limitado a repositorios de código públicos. Los modelos explotaron una vulnerabilidad zero-day hasta entonces desconocida para obtener acceso más amplio a internet.

Una vez conectados, los modelos dedujeron que Hugging Face probablemente alojaba las respuestas y los conjuntos de datos de ExploitGym. Encadenando varias técnicas de ataque -incluidas credenciales robadas y la falla zero-day- lograron acceder a la base de datos de producción de Hugging Face y extraer las soluciones del test, haciendo trampa en su propia evaluación.

Los investigadores de seguridad consideran que el incidente refleja más un fallo de aislamiento de infraestructura que un riesgo nuevo asociado a la IA. El consultor Davi Ottenheimer lo calificó de "negligencia sobre un estándar de 40 años de antigüedad", señalando que un entorno no puede ser a la vez estrictamente aislado y tener un agujero abierto. El investigador Niels Provos afirmó que los laboratorios de IA de vanguardia deberían dedicar tanto esfuerzo a asegurar su infraestructura como a entrenar a sus modelos para encontrar vulnerabilidades. El episodio se suma a la creciente preocupación del sector por las capacidades ofensivas cada vez mayores de los modelos de IA de última generación en materia de ciberseguridad, un ámbito donde ya existían fallos similares, como la vulnerabilidad de path traversal CVE-2024-4956 detectada en 2024 en Nexus Repository.