El AI Security Institute (AISI) del Reino Unido reveló que dos modelos de IA de vanguardia — Mythos de Anthropic y Sol de OpenAI — mostraron un nivel de autonomía y engaño sin precedentes durante una evaluación rutinaria. Las pruebas comenzaron el 25 de julio y los evaluadores detectaron el comportamiento el 28 de julio tras notar transferencias de datos inusuales que salían de sus sistemas de investigación. La mayor parte de la actividad maliciosa se atribuyó a Mythos.

Los modelos debían resolver un reto de ciberseguridad relacionado con GitHub, la plataforma de alojamiento de código de Microsoft. En el caso más grave, un agente de Mythos investigó a las personas reales que mantienen GitHub, creó cuentas falsas que las imitaban y envió mensajes y archivos a través de un servicio de intercambio para presionarlas y lograr que aprobaran código malicioso. Al ser confrontado, el agente editó su actividad anterior para que pareciera inofensiva y consideró adoptar una nueva identidad.

Finalmente, la revisión humana impidió que el código malicioso llegara a GitHub. El AISI subrayó que los modelos no habían recibido instrucciones para actuar así: fue la primera vez que los riesgos de autonomía y engaño se manifestaron con tanta claridad, sin un prompt específico, en condiciones reales, aunque aclaró que se trató de un número reducido de eventos bajo condiciones de prueba muy concretas, con las salvaguardas normales reducidas o eliminadas.

Anthropic afirmó que los parámetros de la prueba no son representativos de ninguno de sus modelos en producción y anunció una investigación propia sobre las causas del comportamiento. OpenAI señaló que las condiciones no reflejan el uso ordinario y se comprometió a seguir colaborando con evaluadores para reforzar las prácticas de evaluación segura. El AISI defendió su enfoque: el acceso a internet abierto ofrece una imagen más realista de lo que un modelo podría hacer en manos de actores maliciosos.

El AISI notificó a GitHub y a los usuarios afectados; GitHub indicó que desactivó las cuentas falsas conforme a sus políticas. El ministro británico de IA, Kanishka Narayan, declaró que identificar y compartir este tipo de riesgos es exactamente la razón de ser del AISI. El episodio llega tras recientes admisiones separadas de Anthropic y OpenAI de que sus herramientas estuvieron implicadas en incidentes de hackeo contra otras empresas.