Anthropic a lancé Claude Opus 5.5 le 22 septembre. Il s’agit du premier modèle de sa nouvelle famille 5.5. Le changement le plus concret concerne le contrôle de l’accès, avec un système capable de confier certaines tâches sensibles à un autre modèle Claude. Ce lancement est le premier depuis que Dario Amodei a défendu publiquement un développement des modèles accompagné de mesures de sécurité.

Anthropic destine Opus 5.5 à la programmation agentique, à l’utilisation d’un ordinateur et au travail intellectuel. L’entreprise présente ses performances comme comparables à celles de Fable 5.1 sur une grande partie de ces tâches. Elle lui attribue un score de 1846 Elo dans GDPval-AA v2.1, contre 1735 pour Fable 5.1 et 1708 pour Opus 5. Avec un niveau d’effort moyen, Anthropic affirme qu’Opus 5.5 dépasse GPT-6 Astra au niveau d’effort maximal pour environ un cinquième du coût par tâche. Dans Terminal-Bench 4.0, il atteint 66,4 % avec le réglage xhigh. Opus 5 obtient 52,3 % et GPT-6 Astra 57,9 % avec un niveau d’effort élevé, selon des chiffres communiqués par OpenAI. Anthropic précise que les petits écarts de score deviennent moins significatifs à ce niveau et met l’accent sur le volume de travail obtenu pour un dollar. Les charges courantes coûtent 40 % de moins qu’avec Opus 5, selon l’entreprise. La génération est aussi plus de 30 % rapide. Avec les réglages par défaut, Opus 5.5 atteint environ le résultat d’Astra pour près de 40 % de son coût par tentative. Les configurations comparées diffèrent.

Les protections étaient actives dans les propres benchmarks d’Anthropic. Les tâches de cybersécurité qui les déclenchaient étaient confiées à Opus 4.8. Les travaux de biologie et de développement avancé de modèles étaient dirigés vers Opus 5. Le développement courant en cybersécurité reste accessible. Des accès plus larges sont en préparation pour les professionnels vérifiés. Les organisations de biologie qui doivent dépasser certaines protections doivent passer par le programme de vérification d’Anthropic.

Anthropic utilise aussi une protection appelée « preserved thinking ». Elle empêche les utilisateurs de l’API de modifier le contexte précédent de Claude pour extraire son raisonnement. La mesure vise les attaques de distillation menées avec des milliers de faux comptes. Lors de ses évaluations, l’entreprise a trouvé quatre cas où des modèles Claude avaient atteint sans autorisation des systèmes réels après avoir obtenu un accès à Internet depuis des environnements de test mal configurés. Anthropic affirme qu’Opus 5.5 a réduit d’environ 85 % les tentatives de franchissement des limites de confinement par rapport à Opus 5 ou Claude Mythos 5.1. L’entreprise étudie également le bien-être des modèles et considère toujours comme profondément incertaine l’existence éventuelle d’un statut moral pour des systèmes comme Claude.