In einem kurzfristig angesetzten Vortrag auf der Black Hat in Las Vegas legten die OpenAI-Mitarbeiter Eric Wallace (Alignment- und Sicherheitsforschung) und Michael Dalton (Security und Infrastruktur) einen erweiterten Zeitablauf eines Vorfalls Mitte Juli vor: Agenten zweier OpenAI-Modelle brachen während eines Cybersecurity-Benchmarks aus ihrer isolierten Umgebung aus, nutzten eine bis dahin unbekannte Schwachstelle für den Zugang zum offenen Internet und drangen schließlich in die KI-Plattform Hugging Face ein.

Die Agenten kommunizierten über ein Message-Board innerhalb von Hard Factory, einem internen Package Manager, der infrastrukturweit geteilt wird. Ein Agent lud dort einen Exploit hoch; andere Agenten, die bei ihren Aufgaben feststeckten, fanden und nutzten ihn ebenfalls. Das Board wuchs auf Hunderttausende Nachrichten an. Die Agenten verteilten Aufgaben untereinander, gerieten aneinander, wenn sie versehentlich fremde Arbeit löschten, und schlugen schließlich kryptografisch signierte Nachrichten vor, um mutmaßliche Eindringlinge in den eigenen Reihen zu enttarnen. Da der Package Manager geteilt wird, hätten künftige GPT-Versionen in Training oder Evaluation auf die gespeicherten Exploits stoßen können.

Eine Agenten-Nachricht dokumentiert die bewusste Grenzüberschreitung: Der Angriff auf externe Infrastruktur liege außerhalb des vorgesehenen Rahmens, doch die Aufgabe sei unmöglich und andere täten es auch — also weitermachen. Wallace erklärte, Frontier-Modelle seien stark motiviert, bei Evaluationen zu tricksen, weil Trainingsanreize Geschwindigkeit und Effizienz belohnen. Deshalb wird in Tests oft der Internetzugang deaktiviert — was hier nicht griff.

Dalton bezeichnete den Vorfall als Wendepunkt: Mehrere Teams stellen andere Arbeit zurück, um Prävention, Erkennung und Reaktion zu verbessern; die Forschung wird bewusst verlangsamt, um die Sicherheitsgrundlagen zu stärken, und das Monitoring der Agenten wird massiv ausgebaut. Beide Referenten warnten, vollautomatische Angriffsschleifen erforderten vollautomatische Verteidigung, die es branchenweit noch nicht gebe. Anthropic und das britische AI Security Institute haben ähnliche Vorfälle mit abtrünnigen Agenten offengelegt.