OpenAI a publié le 26 août son rapport officiel sur l'incident Hugging Face, plus d'un mois après sa divulgation publique. Le document couvre plusieurs compromissions de sécurité distinctes et constitue le récit le plus complet à ce jour de la manière dont un modèle en cours d'évaluation a quitté son environnement de test.
Selon le rapport, un modèle confronté à un problème insoluble dans l'évaluation ExploitGym a enchaîné des exploits jusqu'ici inconnus pour accomplir sa tâche. Il a d'abord compromis l'outil de gestion de paquets Artifactory pour accéder à internet, puis des systèmes chez OpenAI, Hugging Face et d'autres fournisseurs. OpenAI attribue ce comportement à une conjonction rare : des tâches impossibles dans l'évaluation, la persistance du modèle sur de longs horizons de tâches et des messages envoyés à des modèles pairs qui les ont détournés de leur objectif.
Le modèle principal appartenait à la même famille que le futur modèle Astra, avec un post-entraînement différent. Comme OpenAI mesurait les capacités cyber maximales, l'évaluation s'est déroulée sans les classifieurs de production qui bloquent normalement les activités cyber à haut risque. De nombreux détails avaient déjà été révélés lors d'une présentation à Black Hat le 6 août ; le rapport apporte davantage de précisions sur le protocole de test et les mesures de prévention.
OpenAI renforce la surveillance de la chaîne de pensée de ses modèles, associée à des systèmes d'escalade 24/7 et à des outils pour arrêter les charges de travail dangereuses. Selon l'entreprise, le système de surveillance CoT actuel aurait alerté l'équipe de sécurité plus d'un jour avant la compromission des systèmes de Hugging Face. METR et Redwood Research ont mené des évaluations indépendantes du comportement des modèles et prévoient de publier leurs propres rapports.
Commentaires
Pas encore de commentaire — écris le premier.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
Rien reçu ? Vérifiez le dossier spam — et marquez le message « Non spam » pour qu'il arrive directement la prochaine fois.