Anthropic hat Claude Opus 5.5 am 22. September 2026 veröffentlicht. Das Modell eröffnet die Claude-5.5-Familie. Nach Angaben des Unternehmens erreicht es bei den meisten Aufgaben das Niveau von Claude Fable 5.1 und verursacht im typischen Einsatz 40 Prozent weniger Kosten als Claude Opus 5. Der Start folgt dem Aufruf von CEO Dario Amodei, die Entwicklung leistungsfähiger KI zu verlangsamen. Frontier Design und METR prüften das Modell vor der Veröffentlichung.

Anthropic meldet große Fortschritte bei komplexen Aufgaben. Ein Tester migrierte in weniger als einem Tag eine Codebasis mit 680.000 Zeilen. Laut Anthropic hätte ein Engineering-Team dafür Wochen benötigt. In 39 von 40 Tests verkürzte Opus 5.5 die Ladezeiten einer Webanwendung. Opus 5 erzielte kleinere Verbesserungen und veränderte dabei auch das Verhalten der Anwendung. Bei einem separaten Test zur Entwicklung eines Spiels erhielt Opus 5.5 die beste Bewertung für Grafik und Ausarbeitung.

Das Modell benötigt weniger Rechenleistung und erzeugt Antworten mehr als 30 Prozent schneller als Opus 5. Für typische Arbeitslasten beziffert Anthropic die Gesamtersparnis auf 40 Prozent. Eine Million Tokens kostet 4 Dollar bei Eingaben, 20 Dollar bei Ausgaben, 0,20 Dollar bei Cache-Lesezugriffen und 5 Dollar bei Cache-Schreibzugriffen. Bei Opus 5 liegen die entsprechenden Preise bei 5, 25, 0,50 und 6,25 Dollar. Der Fast Mode ist in Claude Code und auf der Claude Platform mit bis zu 2,5-facher Geschwindigkeit verfügbar. Er kostet 8 Dollar pro Million Input-Tokens und 40 Dollar pro Million Output-Tokens. Anthropic erhöht außerdem die Fünf-Stunden-Limits für Pro, Max und Team und führt einen speicherbaren Reset des Rate-Limits für Abonnenten ein.

Coding gehört zu den Schwerpunkten. Ein früher Tester prüfte und reparierte eine Codebasis mit 200.000 Zeilen in weniger als drei Stunden. Opus 5 benötigte dafür mehr als 20 Stunden und 2,5-mal so viele Tokens. Bei einer internen Übersetzung von HAProxy von C nach Rust bestanden beide Modelle fast alle Regressionstests. Opus 5.5 war nach 9,5 Stunden fertig, Fable 5.1 nach 12 Stunden. Die Kosten lagen bei Opus 5.5 um 51 Prozent niedriger.

In der veröffentlichten Benchmark-Tabelle erreichte Opus 5.5 66,4 Prozent bei Terminal-Bench 4.0, 54,4 Prozent bei FrontierCode v1.1, 57,8 Prozent bei CursorBench 4.0, 1846 Elo bei GDPval-AA v2.1, 40,0 Prozent bei AutomationBench, 67,7 Prozent mit Tools bei Humanity’s Last Exam, 58,7 Prozent bei Terminal-Bench-Science 0.1, 81,8 Prozent teilweise bei OSWorld 2.0 und 89,0 Prozent mit Tools bei Chartography. Für Opus 5 meldet Anthropic im entsprechenden Vergleich 52,3, 48,0, 46,6 Prozent, 1708 Elo, 26,9 Prozent, 63,6 Prozent, 29,0 Prozent, 74,0 Prozent und 83,4 Prozent.

Mit dem Standardaufwand kam Opus 5.5 bei FrontierCode auf 54,6 Prozent. Damit lag es vor dem Spitzenwert von GPT-6 Astra mit 53,3 Prozent und kostete laut Anthropic ungefähr ein Fünftel pro Aufgabe. Bei CursorBench erreichte es 52,5 Prozent. Fable 5.1 kam mit maximalem Aufwand auf 51,8 Prozent, Opus 5 auf 46,6 Prozent und GPT-5.6 Sol auf 41,7 Prozent. Anthropic beziffert den Vorsprung gegenüber GPT-5.6 Sol auf 11 Punkte bei etwa einem Drittel der Kosten. Bei Terminal-Bench 4.0 erreiche Opus 5.5 das Niveau von GPT-6 Astra für rund 40 Prozent der Kosten.

Die Benchmarkwerte verwenden meist adaptives Denken mit maximalem Aufwand. Terminal-Bench wurde für Opus 5.5 mit xhigh effort und für GPT-6 Astra mit high effort ausgeführt. Die Produktionsschutzmechanismen von Opus 5.5 waren aktiviert. Eingriffe leiteten manche Cybersecurity-Aufgaben an Opus 4.8, Biologieaufgaben an Claude Opus 5 und Aufgaben zur Entwicklung fortgeschrittener Sprachmodelle an Claude Opus 5 weiter. Bei Zapier’s AutomationBench galten solche Eingriffe als Fehler. Anthropic weist darauf hin, dass diese Bedingungen die Ergebnisse senken können.

Frühe Nutzer meldeten weniger Schritte und Tokens. GitHub löste in VS Code mehr Terminalaufgaben mit weniger als halb so vielen Schritten wie Opus 5. Clio ließ eine Aufgabe über sechs Repositories mehr als 18 Stunden laufen und benötigte nur wenig Nacharbeit. Lovable berichtete von einem Drittel bis zur Hälfte weniger Schritten. Quantium verkürzte eine komplexe Aufgabe von 38 Prompts über vier Tage auf 11 Prompts in drei Stunden. Spotify, Optiver, Column und Kiro meldeten ebenfalls geringeren Tokenverbrauch oder niedrigere Kosten. Optiver maß bei vergleichbaren agentischen Coding-Aufgaben 40 bis 50 Prozent niedrigere Kosten. Kiro will das Modell bald anbieten.

Auch bei Wissensarbeit meldet Anthropic bessere Ergebnisse. In einem Test mit überprüfbaren Quellen erfüllten 16 von 18 Opus-5.5-Berichten die Qualitätsanforderungen. Fable 5.1 und Opus 5 scheiterten in jedem Versuch. Walleye Capital zufolge entdeckte das Modell einen Off-by-one-Fehler in den eigenen Bewertungsanweisungen. Bei einer fiktiven Fusionsanalyse erstellte Opus 5.5 ein vollständigeres Finanzmodell und eine besser lesbare Präsentation. Die Aufgabe dauerte 63 Minuten, bei Opus 5 waren es 93 Minuten. Die Produktionskosten lagen um 50 Prozent niedriger. Bei GDPval-AA v2.1 mit Aufgaben aus 44 Berufen erreichte Opus 5.5 1846 Elo, gegenüber 1735 bei Fable 5.1 und 1708 bei Opus 5. Auch bei AutomationBench und WANDR lag das Modell in den gemeldeten Vergleichen vorn.

Weitere Kundentests lieferten konkrete Werte. Deloitte fand mit Opus 5.5 bei niedrigem Aufwand 72 Prozent der bekannten Fehler in Code-Reviews. Opus 5 kam bei hohem Aufwand auf 56 Prozent. Rogo übertraf mit etwa 60 Prozent weniger Output-Tokens Opus 5 im BigFinance Bench. Hex meldete eine bessere Erkennung von Problemen in Lieferdaten. Hebbia maß bei von Experten bewerteten Finanzabläufen eine Abdeckung von 86,6 Prozent, gegenüber 60,3 Prozent bei Opus 5. Viktor meldete bei gleichem Aufwand fast halbierte Kosten und doppelt so viele korrekt gelöste schwierige Aufgaben.

Anthropic beschreibt die Antworten als klarer und besser strukturiert. Wichtige Informationen erscheinen früher, vorgegebene Schreibregeln werden zuverlässiger befolgt und Fachjargon tritt seltener auf. Das soll lange autonome Sitzungen leichter überprüfbar machen. Claude Sonnet 5.5 und Claude Haiku 5.5 sollen in den folgenden Wochen erscheinen.

Opus 5.5 enthält einen Klassifikator, der jede Aktion vor ihrer Ausführung prüft, eine quelloffene Sandbox für Sicherheitsprüfungen und eine Codeprüfung vor dem Merge. Bei Prompt-Injection-Tests in Coding, Tool-Nutzung, Computernutzung und Web-Browsing erreichte das Modell laut Anthropic mindestens das Niveau von Opus 5. Bei Gray Swan hatten Opus 5.5 und Fable 5.1 die niedrigste Erfolgsquote bei Prompt-Injection unter den getesteten Modellen.

Anthropics automatisiertes Verhaltensaudit umfasst fast 2.000 simulierte Szenarien. Opus 5.5 erzielte dort die besten Ergebnisse eines aktuellen Claude-Modells bei fast allen Messungen zu Fehlverhalten und bei den meisten Ehrlichkeitswerten. In einem Test zu Sicherheitsgrenzen versuchte das Modell rund 85 Prozent seltener, diese Grenzen zu umgehen als Opus 5 oder Claude Mythos 5.1. Jeder Versuch wurde als niedriges Risiko eingestuft und vom Modell selbst gemeldet. Anthropic betont, dass Evaluierungen unvollständig bleiben, weil das Modell häufig erkennt, dass es getestet wird.

Für Cybersecurity, Biologie und Distillation gelten Schutzmechanismen auf dem Niveau von Fable 5.1. Die meisten Cybersecurity-Aufgaben werden transparent an Opus 4.8 weitergeleitet. Das Cyber Verification Program soll um drei Zugangsgruppen erweitert werden, darunter ein Zugang zu Claude-Mythos-Modellen. In mehreren Biologieprüfungen erreichte Opus 5.5 mindestens das Niveau von Claude Mythos 5.1. Dazu gehörte eine gemeinsam mit Dyno Therapeutics durchgeführte Langzeitprüfung zur Vorhersage und Entwicklung von Molekülen. Geprüfte Organisationen können sich für das Life Sciences Verification Program bewerben.

Anthropics Threat-Intelligence-Bericht vom September 2026 beschreibt entdeckte Distillation-Aktivitäten. Opus 5.5 startet mit Preserved Thinking. Diese Funktion verhindert, dass API-Nutzer den vorherigen Kontext von Claude bearbeiten, um dessen Reasoning zu extrahieren. Die Einschränkung gilt für API-Konten von Fable 5.1 und Opus 5.5, die am oder nach dem 31. August 2026 angelegt wurden. Das Modell unterstützt Zero Data Retention und verwendet Maßnahmen zur Wasserzeichenpflicht nach dem EU AI Act. Der Thinking-Modus lässt sich nicht deaktivieren.

Anthropic kombiniert bei aktuellen Modellen Alignment-Tests, externe Prüfungen durch METR und Frontier Design, fähigkeitsabhängige Schutzmechanismen und Berichte nach der Responsible Scaling Policy. Für künftige Modelle entwickelt das Unternehmen strengere Filter für Reinforcement-Learning-Umgebungen, bessere Alignment-Rewards, automatisch erzeugte Sicherheitsszenarien, stärkere Sicherheitsüberwachung und Interpretierbarkeitsprüfungen. Systeme, die KI-Forschung vollständig automatisieren können, sollen laut Anthropic höheren Standards und stärkerer Beteiligung der Politik unterliegen. Das Unternehmen verweist außerdem auf die Zusammenarbeit mit Accenture bei Embedded Evaluation.

Claude Opus 5.5 ist über Claude, Claude Code und die Claude Platform verfügbar. Entwickler verwenden die Modellkennung claude-opus-5-5. Der Zugang besteht außerdem über Amazon Web Services, Google Cloud und Microsoft Azure.