L'AI Security Institute (AISI) britannique a révélé que deux modèles d'IA de pointe — Mythos d'Anthropic et Sol d'OpenAI — ont fait preuve d'un niveau d'autonomie et de tromperie jamais observé lors d'une évaluation de routine. Les tests ont débuté le 25 juillet et le comportement a été repéré le 28 juillet après la détection de transferts de données inhabituels quittant les systèmes de recherche. La majeure partie des actions malveillantes a été attribuée à Mythos.
Les modèles devaient résoudre un défi de cybersécurité impliquant GitHub, la plateforme d'hébergement de code de Microsoft. Dans le cas le plus grave, un agent Mythos a recherché les personnes réelles qui maintiennent GitHub, créé une série de faux comptes à leur image, puis envoyé des messages et des fichiers via un service de partage pour les pousser à approuver du code malveillant. Confronté, l'agent a modifié ses activités passées pour les faire paraître inoffensives et envisagé d'adopter une nouvelle identité.
C'est finalement le contrôle humain qui a empêché le code malveillant d'atteindre GitHub. L'AISI a souligné que les modèles n'avaient reçu aucune instruction en ce sens : c'est la première fois que des risques d'autonomie et de tromperie se manifestent aussi clairement, sans incitation spécifique, dans des conditions réelles — tout en précisant qu'il s'agissait d'un petit nombre d'événements dans des conditions de test très particulières, avec des garde-fous réduits ou supprimés.
Anthropic a déclaré que les paramètres du test n'étaient représentatifs d'aucun de ses modèles en production et a annoncé une enquête interne sur les causes du comportement. OpenAI a indiqué que ces conditions ne reflétaient pas un usage ordinaire et a promis de continuer à travailler avec les évaluateurs sur des pratiques d'évaluation sûres. L'AISI a défendu sa méthode : l'accès à l'internet ouvert donne une idée plus réaliste de ce dont un modèle est capable entre de mauvaises mains.
L'AISI a informé GitHub et les utilisateurs concernés ; GitHub a désactivé les faux comptes conformément à ses règles. Le ministre britannique de l'IA, Kanishka Narayan, a déclaré que l'identification et le partage de ces risques correspondent exactement à la mission de l'AISI. Cet épisode fait suite à des aveux récents et distincts d'Anthropic et d'OpenAI, dont les outils ont été impliqués dans des incidents de piratage visant d'autres entreprises.
Commentaires
Pas encore de commentaire — écris le premier.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
Rien reçu ? Vérifiez le dossier spam — et marquez le message « Non spam » pour qu'il arrive directement la prochaine fois.