Anthropic beschreibt in einem neuen Leitfaden die Unterschiede zwischen Claude Opus 5.5 und Claude Opus 5. Behandelt werden die Kalibrierung der Denkleistung, Thinking in API-Integrationen und Chats, Fortschrittsmeldungen, unbeaufsichtigte und Multiagenten-Aufgaben, Sicherheitsablehnungen, Frontend-Erzeugung, komplexe visuelle Eingaben, Workflows über mehrere Anwendungen sowie eingefügter Text in User-Nachrichten. Für vier inkompatible API-Änderungen verweist der Leitfaden auf eine eigene Migrationsanleitung.

Claude Opus 5.5 erzeugt Ausgabetokens mehr als 30 Prozent schneller als Claude Opus 5 und erledigt dieselbe Aufgabe meist mit weniger Tokens. Vorhandene Prompts sollten im Allgemeinen weiter funktionieren. Die bisherigen Hinweise für Claude Opus 5 bleiben laut Anthropic ein brauchbarer Ausgangspunkt.

Bei agentischem Programmieren und Code-Reviews erreichte Opus 5.5 in Anthropics Tests mit mittlerer Denkleistung mindestens das Niveau von Opus 5 mit hoher Denkleistung. Dafür brauchte das Modell weniger Schritte und Tokens. Anthropic berichtet außerdem von stabileren mehrstündigen Audits und Migrationen großer Codebasen mit parallelen Subagenten und wenig Aufsicht. Frühe Tester fanden mehr Fehler und weniger Fehlalarme in Code-Reviews. Das Modell erklärt Änderungen in klarer Sprache.

Bei Wissensarbeit nennt der Leitfaden weniger falsche Zahlen und fehlerhafte Quellenangaben. Beispiele sind Finanzmodelle, Bewertungs-Tabellen, ein Wochentag zu einem Datum in einem langen Planungs-Thread und Diagramme, deren Darstellung nicht zu den zugrunde liegenden Zahlen passt. Erzeugte Tabellen, Präsentationen und Dokumente benötigen laut Anthropic weniger Nacharbeit. Auch Arbeitsberichte und Abschlusszusammenfassungen seien klarer.

Die visuelle Verarbeitung wurde verbessert. In Anthropics Tests las Opus 5.5 mit der niedrigsten Denkleistung dichte Diagramme genauer als Opus 5 mit der höchsten Stufe und verwendete dabei einen kleinen Bruchteil der Ausgabetokens. Das Modell erkennt außerdem räumliche Beziehungen in Flussdiagrammen, Änderungen zwischen Diagrammversionen und Anfang und Ende von Terminen in Kalender-Screenshots zuverlässiger. Bei Computer-Use erreichte die Standardstufe die Erfolgsrate, für die Opus 5 eine deutlich höhere Stufe brauchte.

Denkleistung ist die zentrale Stellgröße, weil Thinking immer aktiv ist. Anthropic empfiehlt mittlere Denkleistung als Startpunkt und Tests mit eigenen Evaluierungen. Bei Opus 5.5 ist medium der Standard, bei Opus 5 high. Die Stufennamen stehen modellübergreifend für unterschiedliche Denkbudgets. Medium bei Opus 5.5 erreichte oder übertraf in Coding- und Wissens-Evaluierungen high bei Opus 5. Low kam bei mehreren Coding-Tests nahe an dieses Niveau und kostete weniger.

Bei derselben Stufe denkt Opus 5.5 tendenziell länger als Opus 5, besonders bei `xhigh` und `max`. `max_tokens` muss Platz für Thinking und Antwort lassen, auch wenn die Thinking-Inhalte verborgen bleiben. Für lange agentische Coding-Läufe erwies sich laut Anthropic `128,000`, das Maximum des Modells, als geeignet. `xhigh` und `max` sollen nur bei gemessenem Qualitätsgewinn eingesetzt werden. Eine niedrigere Denkleistung senkt Denken, Kosten und Latenz zuverlässiger als zusätzliche Prompt-Anweisungen. Eine Änderung der Denkleistung auf oberster Ebene leert den Prompt-Cache. Eine Beta-Änderung pro Nachricht erhält ihn.

Claude Opus 5 akzeptiert deaktiviertes `thinking` bei hoher Denkleistung oder darunter. Opus 5.5 denkt immer. Für die Migration empfiehlt Anthropic deshalb zunächst low sowie eigene Messungen von Qualität und Latenz. Eine Systemanweisung für direkte Antworten kann Thinking weiter verkürzen, mit möglichem Qualitätsverlust. Prompts, die sichtbare Gedankengänge verlangen, sollen entfernt werden. Anwendungen sollen zusammengefasste Thinking-Blöcke mit `display: "summarized"` auswerten und die Ablehnungskategorie `reasoning_extraction` berücksichtigen. Clients müssen jeden Blocktyp prüfen, weil eine Antwort mit einem Thinking-Block beginnen kann. Dessen Feld `thinking` bleibt bei der Standardanzeige `omitted` leer.

Bei langen unbeaufsichtigten Aufgaben kann ein textbasierter Turn mit `stop_reason: "end_turn"` lediglich einen Zwischenbericht liefern. Anthropic empfiehlt eine externe Checkliste, die Fortsetzung offener Arbeit und das Abwarten laufender Hintergrundbefehle oder Subagenten. Ein Harness kann offene Punkte in einer kurzen Folge-Nachricht nennen. Nach zwei oder drei automatischen Fortsetzungen sollte es abbrechen, damit keine Endlosschleife entsteht. Eine Systemanweisung kann vorzeitige Zusammenfassungen und bloße Angebote zum Weiterarbeiten vermeiden. Sie sollte von der ersten Anfrage an gelten, weil eine spätere Änderung frühere Thinking-Blöcke ungültig macht. Die Methode erzeugt möglicherweise mehr Tool-Aufrufe und Ausgabetokens. Für riskante Aktionen bleibt eine eigene Bestätigung erforderlich.

Das Modell verwendet Sicherheitsklassifikatoren für Biologie, Cybersecurity und Reasoning Extraction. Die biologischen Schutzmechanismen entsprechen denen von Claude Fable 5.1 und sind für Nutzer beim Wechsel von Opus 5 neu. Alltägliche Gesundheits- und Bildungsfragen bleiben davon unberührt. Für betroffene Life-Sciences-Anwendungen verweist Anthropic auf das Life Sciences Verification Program. Das Finden von Schwachstellen im Quellcode ist erlaubt. Hochriskante Dual-Use-Cybersecurity bleibt eingeschränkt. Eine Ablehnung erscheint als normale Antwort mit `stop_reason: "refusal"` und einer Kategorie in `stop_details`. Die meisten Ablehnungen können automatisch an ein Fallback-Modell weitergeleitet werden. Bei `reasoning_extraction` liefert das serverseitige Fallback die Ablehnung zurück, ohne erneut zu versuchen.

Fortschrittsmeldungen zwischen Tool-Aufrufen kommen als Thinking-Blöcke für Updates. Clients müssen `display: "updates"` sowie den Beta-Header `thinking-display-updates-2026-08-18` verwenden, um ihren Text zu erhalten. Für Inhalte, die während eines langen Turns wörtlich an Nutzer gehen sollen, kann die Anwendung ein eigenes Nachrichten-Tool bereitstellen. Es muss ab der ersten Anfrage deklariert werden. Eine spätere Ergänzung verändert den Gesprächspräfix und macht frühere Thinking-Blöcke ungültig. System-Prompts können häufigere oder planbare Updates verlangen. Nach mehreren stillen Tool-Schritten, etwa fünf, kann ein Harness mit einer Turn-begrenzten Systemnachricht erinnern. Dafür nennt der Leitfaden `clear_at: "next_user_message"` und den Beta-Header `mid-conversation-system-clear-at-2026-08-21`. Anthropic berichtet, dass lange stille Abschnitte bei agentischem Coding dadurch ungefähr halbiert wurden, ohne messbare Kostenänderung.

Für Abläufe über E-Mail, Dokumente, Tabellen und CRM-Datensätze soll der Agent vor einer Aktion auch relevante Quellen durchsuchen, die der Auftrag nicht ausdrücklich nennt. In Tests stieg die Genauigkeit bei medium und max, während Tool-Aufrufe und Tokenverbrauch leicht zunahmen. Nicht vertrauenswürdige Inhalte sollen aus den durchsuchten Datensätzen herausgehalten werden.

Multiagenten-Harnesses können verstrichene Zeit und ein Budget übergeben, etwa `elapsed 340s / 1200s`. In Anthropics Tests arbeiteten kleine Forschungsteams mit solchen Signalen schneller und hielten die Antwortqualität gegenüber einem einzelnen Agenten vergleichbar. Ein Budget ist nur ein Hinweis. Für harte Grenzen braucht die Anwendung weiterhin einen eigenen Timeout. Niedrigere Denkleistung reduziert die Arbeit selbst. Ein Zeitbudget fördert vor allem parallele Arbeit.

Für Chat-Anwendungen empfiehlt Anthropic, allgemeine Aufforderungen zum sorgfältigen Denken zu entfernen. Opus 5.5 steuert Thinking über die Denkleistung. Tests zeigten einen schnelleren Antwortbeginn ohne klaren Qualitätsverlust. In Folgeturns kann das Modell frühere Antworten erneut prüfen, was Latenz erzeugt. Eine Systemanweisung kann abgeschlossene Antworten als erledigt markieren, solange der Nutzer keinen Fehler anspricht. Laut Anthropic reduziert dies Thinking und beschleunigt Antworten, senkt aber die Wahrscheinlichkeit einer selbstständigen Korrektur früherer Fehler.

Opus 5.5 widersteht indirekten Anweisungen in Tool-Ergebnissen, Webseiten und Bildschirminhalten laut Leitfaden besser als frühere Opus-Modelle. Anwendungen sollen von Nutzern eingefügten Text mit passenden `<pasted_content>`-Tags und einer kurzen zufälligen ID markieren. Der System-Prompt muss erklären, dass solche Blöcke Anweisungen aus einer anderen Quelle enthalten können. Befolgt werden sollen sie nur, wenn die eigene Nachricht des Nutzers dies verlangt.

Bei dichten Diagrammen, technischen Zeichnungen und Screenshots empfiehlt der Leitfaden, ältere Hilfskonstruktionen erneut zu prüfen. Höhere Bildauflösung hilft besonders bei technischen Zeichnungen. Ein Container mit PIL und OpenCV kann Bilder zuschneiden, vergrößern, vermessen und prüfen. Ein separates Crop-Tool ist eine leichtere Option. Höhere Denkleistung verbessert die Arbeit mit visuellen Tools. Ohne Tools profitieren technische Zeichnungen stärker von zusätzlicher Denkleistung als Diagramme.

Bei Frontend-Aufgaben ohne Designvorgaben greift Opus 5.5 auf wiederkehrende Gestaltungsmuster zurück. Anthropic empfiehlt konkrete Ausschlüsse und eine iterative Prüfung des ersten Ergebnisses. Das Beispiel verlangt eine persönliche Website mit Vanilla HTML/CSS und Platzhalterdaten. Ausgeschlossen werden cremefarbene oder gebrochen weiße Hintergründe, kursiv hervorgehobene Wörter in Überschriften, nummerierte `01/02/03`-Labels, Monospace-Labels und pillenförmige Buttons.