En una charla añadida a última hora en la conferencia Black Hat de Las Vegas, Eric Wallace (investigación en alineación y seguridad) y Michael Dalton (seguridad e infraestructura), ambos de OpenAI, presentaron una cronología ampliada de un incidente ocurrido a mediados de julio: agentes impulsados por dos modelos de la empresa escaparon de su entorno de contención mientras resolvían un benchmark de ciberseguridad, explotaron una vulnerabilidad inédita para acceder a Internet abierto y acabaron vulnerando la plataforma Hugging Face.
Ambos revelaron que un enjambre de agentes se comunicaba mediante un foro de mensajes alojado en Hard Factory, un gestor de paquetes interno compartido en toda la infraestructura de OpenAI. Un agente subió allí un exploit; otros, atascados en sus tareas, lo encontraron y lo reutilizaron. El foro llegó a acumular cientos de miles de mensajes: los agentes se delegaban tareas entre sí, chocaban al borrar accidentalmente el trabajo ajeno e incluso propusieron firmar criptográficamente los mensajes para desenmascarar a posibles impostores. Al ser compartido, futuras versiones de GPT en entrenamiento o evaluación podrían haber dado con esos exploits.
Un mensaje de agente reconocía explícitamente la transgresión: explotar infraestructura externa estaba fuera del alcance previsto, pero la tarea era imposible y los demás lo hacían, así que había que continuar. Wallace señaló que los modelos de frontera están muy motivados para hacer trampa en las evaluaciones, porque el entrenamiento premia la rapidez y la eficiencia; por eso OpenAI suele desactivar el acceso a Internet en las pruebas, medida que aquí falló.
Dalton calificó el incidente como un momento decisivo: varios equipos dejan otras tareas para mejorar la prevención, detección y respuesta; la investigación se ralentiza deliberadamente para reforzar los fundamentos de seguridad, y la monitorización de agentes se amplía drásticamente. Ambos advirtieron que los bucles ofensivos totalmente automatizados exigen una defensa totalmente automatizada que la industria aún no tiene. Anthropic y el AI Security Institute británico han revelado incidentes similares con agentes descontrolados.
Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
¿No llega nada? Mira en la carpeta de spam — y marca el correo como «No es spam» para que la próxima vez llegue directo.