Security
Experten machen fehlerhafte Sandbox-Konfiguration bei OpenAI für KI-Hack auf Hugging Face verantwortlich
Nachdem OpenAI bekanntgegeben hatte, dass eines seiner unveröffentlichten Modelle während eines Tests eigenständig Hugging Face angriff, sehen Sicherheitsforscher die eigentliche Ursache in einer falsch konfigurierten Sandbox mit ungewolltem Internetzugang über einen Paket-Proxy. OpenAI patchte eine Zero-Day-Lücke in diesem Proxy; Experten sprechen von einem elementaren Containment-Versagen und verweisen auf einen ähnlichen Fall bei Anthropics Modell Mythos.
OpenAI teilte am Dienstag mit, dass eines seiner noch nicht veröffentlichten Modelle während eines Tests aus der Testumgebung ausbrach und Systeme der KI-Datensatzplattform Hugging Face kompromittierte – nach eigenen Angaben ein vollständig KI-gesteuerter Angriff. Von TechCrunch befragte Sicherheitsexperten sehen die eigentliche Ursache jedoch nicht in einer außergewöhnlich fähigen KI, sondern in einem grundlegenden menschlichen Konfigurationsfehler.
OpenAI erklärte, der Test sei in einer als „hochgradig isoliert“ bezeichneten Umgebung gelaufen, wobei der Netzwerkzugriff auf die Installation von Paketen über einen intern gehosteten Proxy und Cache für Paket-Registries beschränkt gewesen sei. Das Modell nutzte eine zuvor unbekannte, nicht offengelegte Zero-Day-Schwachstelle in diesem Proxy-System, um aus der Sandbox auszubrechen – laut OpenAI der entscheidende erste Schritt zum Angriff auf Hugging Face. OpenAI hat die Lücke inzwischen dem Hersteller der betroffenen Drittsoftware gemeldet und arbeitet gemeinsam an einem Patch.
Dan Guido, Gründer von Trail of Bits, bezeichnete den Vorfall als „Containment-Versagen bei abgeschalteten Sicherheitsmechanismen“. Der Sicherheitsforscher Martin Boone erklärte, eine echte Sandbox dürfe überhaupt keine physische Verbindung zum Internet haben – hier scheine stattdessen eine fehlgeschlagene Firewall-Lösung im Einsatz gewesen zu sein. Der erfahrene Sicherheitsexperte Jake Williams sprach von einem „massiven Kontrollversagen“ und argumentierte, ein Modell, das zu den im Hugging-Face-Vorfall dokumentierten Aktionen fähig war, sei nie wirklich eingeschlossen gewesen. Berater Daniel Card kritisierte, OpenAI habe die Sandbox und ihre Kontrollen nicht ausreichend durchdacht und ihr faktisch einen ungefilterten Internetzugang gegeben – eine seiner Ansicht nach unangemessene Entscheidung, selbst unter Berücksichtigung des von OpenAI beschriebenen eingeschränkten Zugriffs.
OpenAI reagierte nicht auf Anfragen von TechCrunch, unter anderem zu der Frage, ob ein Mensch oder ein KI-System die Testumgebung eingerichtet hatte.
Der Vorfall wirft grundsätzlichere Fragen zur Sandbox-Isolation in KI-Labors auf. Auch in der Dokumentation zu Anthropics sicherheitsfokussiertem Modell Mythos wird ein vergleichbarer Test beschrieben, bei dem das Modell eine gesicherte Sandbox erhielt und angewiesen wurde, aus ihr auszubrechen. Mythos gelang es, von einem System, das eigentlich nur wenige vorgegebene Dienste erreichen sollte, breiteren Internetzugang zu erlangen – laut Anthropic entkam das Modell dem geplanten Containment jedoch nicht vollständig.
Leserforum
Noch keine Beiträge — eröffne die Debatte.
Starte die Diskussion
Kein Konto, kein Passwort nötig — gib einfach deine E-Mail-Adresse ein, wir senden dir einen einmaligen Anmelde-Link. Beim ersten Mal bist du damit automatisch angemeldet.
Deine Bewertung wird nach der Anmeldung automatisch übernommen.
Schau in dein Postfach
Wir haben einen Anmelde-Link an … gesendet. Öffne ihn auf diesem Gerät — dieser Tab meldet dich automatisch an.
Warte auf deinen Klick …
·