Anthropic a lancé Claude Opus 5.5 le 22 septembre 2026. Il s’agit du premier modèle de la famille Claude 5.5. L’entreprise le situe au niveau de Claude Fable 5.1 pour la plupart des tâches et estime son coût courant inférieur de 40 % à celui de Claude Opus 5. Cette sortie intervient après l’appel du CEO Dario Amodei à ralentir le développement des modèles de pointe. Frontier Design et METR ont évalué le modèle avant son lancement.
Anthropic fait état de progrès importants sur les travaux complexes. Un testeur a effectué en moins d’une journée la migration d’une base de code de 680 000 lignes. Selon l’entreprise, une équipe d’ingénieurs aurait eu besoin de plusieurs semaines. Opus 5.5 a réduit les temps de chargement dans 39 tests sur 40 pour une application web. Opus 5 apportait des améliorations plus limitées et modifiait aussi le comportement de l’application. Dans un autre test de création de jeu, Opus 5.5 a obtenu la meilleure évaluation pour les graphismes et la finition.
Le modèle consomme moins de calcul et génère ses sorties plus de 30 % plus vite qu’Opus 5. Anthropic chiffre à 40 % la baisse de coût sur les charges habituelles. Un million de tokens coûte 4 dollars en entrée, 20 dollars en sortie, 0,20 dollar en lecture du cache et 5 dollars en écriture du cache. Les tarifs d’Opus 5 sont respectivement de 5, 25, 0,50 et 6,25 dollars. Le Fast mode est proposé dans Claude Code et sur Claude Platform, avec une vitesse pouvant atteindre 2,5 fois celle du mode standard. Il coûte 8 dollars par million de tokens d’entrée et 40 dollars par million de tokens de sortie. Anthropic augmente aussi les limites d’utilisation sur cinq heures des forfaits Pro, Max et Team. Les abonnés peuvent conserver une réinitialisation de limite pour l’utiliser ultérieurement.
Le coding constitue un axe majeur. Un testeur a audité et corrigé une base de code de 200 000 lignes en moins de trois heures. Opus 5 avait besoin de plus de 20 heures et de 2,5 fois plus de tokens. Lors d’une traduction interne de HAProxy de C vers Rust, Opus 5.5 et Fable 5.1 ont réussi presque tous les tests de régression. Opus 5.5 a terminé en 9,5 heures, contre 12 heures pour Fable 5.1, avec un coût inférieur de 51 %.
Dans son tableau de benchmarks, Anthropic donne à Opus 5.5 66,4 % sur Terminal-Bench 4.0, 54,4 % sur FrontierCode v1.1, 57,8 % sur CursorBench 4.0, 1846 Elo sur GDPval-AA v2.1, 40,0 % sur AutomationBench, 67,7 % avec outils sur Humanity’s Last Exam, 58,7 % sur Terminal-Bench-Science 0.1, 81,8 % partiel sur OSWorld 2.0 et 89,0 % avec outils sur Chartography. Pour Opus 5, les valeurs comparables indiquées sont 52,3 %, 48,0 %, 46,6 %, 1708 Elo, 26,9 %, 63,6 %, 29,0 %, 74,0 % et 83,4 %.
Avec le niveau d’effort par défaut, Opus 5.5 atteint 54,6 % sur FrontierCode. Il dépasse ainsi le meilleur score de GPT-6 Astra, à 53,3 %, pour environ un cinquième du coût par tâche. Sur CursorBench, il atteint 52,5 %, contre 51,8 % pour Fable 5.1 avec l’effort maximal, 46,6 % pour Opus 5 et 41,7 % pour GPT-5.6 Sol. Anthropic revendique 11 points d’avance sur GPT-5.6 Sol pour environ un tiers du coût. Sur Terminal-Bench 4.0, le modèle égalerait GPT-6 Astra pour environ 40 % du coût.
Les résultats utilisent généralement le raisonnement adaptatif au niveau d’effort maximal. Terminal-Bench a été exécuté avec xhigh effort pour Opus 5.5 et high effort pour GPT-6 Astra. Les protections de production d’Opus 5.5 étaient actives. Certaines interventions ont redirigé des tâches de cybersécurité vers Opus 4.8, des tâches de biologie vers Claude Opus 5 et des tâches de développement de modèles de pointe vers Claude Opus 5. Dans AutomationBench, Zapier a compté ces interventions comme des échecs. Anthropic prévient que ces conditions peuvent réduire les scores publiés.
Les premiers utilisateurs rapportent une baisse du nombre d’étapes et de tokens. GitHub a résolu davantage de tâches terminal dans VS Code avec moins de la moitié des étapes nécessaires à Opus 5. Clio a laissé le modèle travailler plus de 18 heures sur six dépôts, avec peu de reprise manuelle. Lovable a mesuré un nombre d’étapes réduit d’un tiers à la moitié. Quantium a ramené une tâche complexe de 38 prompts sur quatre jours à 11 prompts en trois heures. Spotify, Optiver, Column et Kiro ont aussi constaté une baisse de consommation ou de coût. Optiver a mesuré une réduction de 40 à 50 % sur des tâches de coding agentique comparables. Kiro prévoit une intégration prochaine.
Anthropic annonce également de meilleurs résultats dans les tâches de connaissance. Dans un test avec vérification des sources, 16 des 18 rapports d’Opus 5.5 ont franchi le seuil de qualité. Fable 5.1 et Opus 5 ont échoué à chaque tentative. Walleye Capital indique que le modèle a détecté une erreur off-by-one dans les consignes de son évaluation. Pour une analyse de fusion fictive, Opus 5.5 a produit un modèle financier plus complet et une présentation plus lisible en 63 minutes, contre 93 minutes pour Opus 5. Le coût de production était inférieur de moitié. Sur GDPval-AA v2.1, qui couvre 44 professions, Opus 5.5 atteint 1846 Elo, contre 1735 pour Fable 5.1 et 1708 pour Opus 5. Le modèle arrive aussi en tête des comparaisons publiées sur AutomationBench et WANDR.
Les évaluations de clients fournissent d’autres chiffres. Deloitte a trouvé 72 % des bugs connus dans des revues de code avec Opus 5.5 au niveau d’effort minimal, contre 56 % pour Opus 5 au niveau élevé. Rogo a dépassé Opus 5 sur BigFinance Bench avec environ 60 % de tokens de sortie en moins. Hex a obtenu une meilleure détection des problèmes dans les données de livraison. Hebbia mesure une couverture de 86,6 % dans des flux financiers évalués par des experts, contre 60,3 % pour Opus 5. Viktor rapporte un coût presque divisé par deux et deux fois plus de tâches difficiles correctement résolues à effort égal.
Anthropic décrit des réponses plus claires et mieux structurées. Les informations importantes arrivent plus tôt, les consignes de style sont mieux suivies et le jargon est moins fréquent. L’objectif est de faciliter les longues sessions autonomes et leur vérification. Claude Sonnet 5.5 et Claude Haiku 5.5 doivent arriver dans les semaines suivantes.
Opus 5.5 intègre un classificateur qui contrôle chaque action avant son exécution, une sandbox open source vérifiable par les équipes de sécurité et une revue de code destinée à détecter les vulnérabilités avant la fusion. Anthropic affirme que le modèle égale ou dépasse Opus 5 face aux prompt injections dans le coding, l’utilisation d’outils, l’utilisation d’un ordinateur et la navigation web. Dans l’évaluation de Gray Swan, Opus 5.5 et Fable 5.1 ont obtenu le taux de réussite le plus faible parmi les modèles testés.
L’audit comportemental automatisé d’Anthropic couvre près de 2 000 scénarios simulés. Opus 5.5 y obtient les meilleurs résultats d’un modèle Claude récent sur presque toutes les mesures de comportement désaligné et sur la plupart des mesures d’honnêteté. Dans un test de franchissement de limites de confinement, il a tenté de contourner ces limites environ 85 % moins souvent qu’Opus 5 ou Claude Mythos 5.1. Toutes les tentatives ont été classées comme peu graves et signalées par le modèle. Anthropic souligne que les évaluations restent incomplètes, car le modèle détecte souvent qu’il est observé.
Des protections de niveau Fable 5.1 s’appliquent à Opus 5.5 pour la cybersécurité, la biologie et la distillation. La plupart des tâches de cybersécurité sont redirigées de façon transparente vers Opus 4.8. Anthropic prévoit trois niveaux d’accès dans son Cyber Verification Program, avec notamment un accès aux modèles Claude Mythos. Opus 5.5 a égalé ou dépassé Claude Mythos 5.1 dans plusieurs évaluations biologiques, dont un test de prédiction et de conception moléculaire à long horizon mené avec Dyno Therapeutics. Les organisations vérifiées peuvent demander l’accès au Life Sciences Verification Program.
Le rapport de renseignement sur les menaces publié par Anthropic en septembre 2026 décrit des activités de distillation détectées. Opus 5.5 est lancé avec Preserved Thinking. Cette fonction empêche les utilisateurs de l’API de modifier le contexte précédent de Claude pour extraire son raisonnement. La restriction concerne les comptes API Fable 5.1 et Opus 5.5 créés le 31 août 2026 ou après cette date. Le modèle accepte la conservation nulle des données et intègre des mesures de watermarking liées à l’EU AI Act. Le mode thinking ne peut pas être désactivé.
Pour les modèles actuels, Anthropic combine tests d’alignement, évaluations externes de METR et Frontier Design, protections liées aux capacités et rapports établis selon sa Responsible Scaling Policy. Pour les modèles futurs, l’entreprise travaille sur des filtres plus stricts pour les environnements de reinforcement learning, de meilleures récompenses d’alignement, la génération automatique de scénarios de sécurité, une surveillance renforcée et des évaluations fondées sur l’interprétabilité. Les modèles capables d’automatiser entièrement la recherche en IA devront selon Anthropic répondre à des exigences supérieures et relever davantage de la politique publique. L’entreprise cite aussi son travail avec Accenture sur l’évaluation intégrée.
Claude Opus 5.5 est disponible dans Claude, Claude Code et Claude Platform. Les développeurs utilisent l’identifiant claude-opus-5-5. Le modèle est aussi accessible via Amazon Web Services, Google Cloud et Microsoft Azure.




Commentaires
Pas encore de commentaire — écris le premier.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
Rien reçu ? Vérifiez le dossier spam — et marquez le message « Non spam » pour qu'il arrive directement la prochaine fois.