Google hat Gemini 4 Argon am 30. September 2026 angekündigt. Das Modell soll lang laufende Aufgaben in der Softwareentwicklung, bei Unternehmenswissen und in der defensiven Cybersicherheit bearbeiten. Koray Kavukcuoglu, SVP von Google DeepMind und Chief AI Architect bei Google, kündigte den ersten externen Einsatz für vertrauenswürdige Cyberabwehrteams im Fairwind-Programm an.

Google will den Zugang schrittweise erweitern und beteiligt sich an einem freiwilligen Verfahren der US-Regierung für den Vorabzugang zu Modellen. Rückmeldungen der ersten Tester sollen in die Sicherheitsvorkehrungen einfließen. Danach soll Argon für Entwickler, Unternehmen und Verbraucher geöffnet werden. Der anfängliche API-Preis beträgt $2 je Million Eingabe-Tokens und $10 je Million Ausgabe-Tokens. Zwischengespeicherte Eingabe-Tokens kosten 95 Prozent weniger. Nach der Einführungsphase gelten $4 je 1M Eingabe-Tokens und $20 je 1M Ausgabe-Tokens.

Tausende Googler verwenden Argon bereits für spezialisierte Programmieraufgaben, Recherche und Texte. Nach Angaben von Google half das Modell Forschern im Quantencomputing, den Raumzeitbedarf von Engpass-Subroutinen zu senken, gemessen als qubits × gates. Ein Ergebnis lag innerhalb weniger Minuten 40 Prozent über der veröffentlichten Referenz. Argon-Agenten werteten außerdem Flotten-Telemetrie zur Speicherbelegung aus und fanden Optimierungen, die nach dem Rollout mehr als 300 TiB Speicher in Google-Rechenzentren freisetzen sollen. Google erwartet insgesamt Einsparungen von 500 TiB bis 1 PiB.

Google setzt Argon-Agenten für die Migration von C/C++-Codebasen nach Rust ein. Die Projekte reichen von einigen zehntausend Zeilen in Kernbibliotheken wie re2 und libgav1 bis zu mehr als 800K Zeilen im Zircon-Kernel von Fuchsia OS. Vor dem Einsatz in der Produktion werden die Änderungen automatisiert und manuell geprüft, emuliert und begutachtet.

Bei libgav1 optimierten die Agenten einen bestehenden Rust-Port. Sie ersetzten 32K Zeilen SIMD-Code durch wiederholte profilgesteuerte Experimente, analysierten die Compiler-Ausgabe und erzeugten sicheren Rust-Code für automatische Vektorisierung. Laut Google läuft das Ergebnis 2,7-mal schneller als der Rust-Port. Die Videoausgabe bleibt identisch und nähert sich der optimierten C++-Implementierung an.

Das Ausgabelimit von Argon beträgt 1M Tokens. Zuvor lag es bei 64K Tokens. Google verbindet den größeren Spielraum mit längeren Denk- und Generierungsprozessen für mehrstufige Aufgaben.

Auf DeepSWE v1.1, einem Benchmark für realitätsnahe Softwareentwicklung über lange Abläufe, erreicht Argon 77,9 Prozent. Google meldet außerdem Spitzenwerte im Vals Index. Dieser misst den wirtschaftlichen Einfluss in Finanzwesen, Programmierung, Recht und Steuerarbeit, wobei die Bereiche nach ihrem Beitrag zum US-BIP gewichtet werden. Argon führt bei Vals Finance Agent v2 und beim Harvey’s Legal Agent Benchmark. Auf Zapier’s AutomationBench liegt das Modell mit 51,3 Prozent auf Platz eins.

Argon verarbeitet auch visuelle Informationen in Wissensarbeit. Google nennt die Analyse professioneller Diagramme, die Erkennung von Details in langen Videos und Aktionen auf Basis mehrerer Dokumente. Auf LVBench für das Verständnis langer Videos erreicht Argon 91,7 Prozent.

Google hat Argon für defensive Cybersicherheit trainiert. Das Modell kann kritische Software-Schwachstellen autonom finden, prüfen und beheben. Vertrauenswürdige Abwehrteams und interne Google-Teams erhalten Argon ohne Cyber-Schutzvorgaben. Wiz nutzt das Modell im Rahmen von Scan for Good. Die Initiative sucht und beseitigt kostenlos risikoreiche Sicherheitslücken in kritischer öffentlicher Infrastruktur. In einer frühen Demonstration fand Argon eine kritische Schwachstelle, durch die persönliche Informationen in weltweit von Krankenhäusern eingesetzter Gesundheitssoftware offengelegt wurden. Laut Google hatten frühere Frontier-Modelle das Problem übersehen.

Auf CWE-bench v1 teilt sich Argon mit 68 Prozent den ersten Platz. Google verweist dabei auf die vorherige Leistung von 3.8 Flash Cyber auf CWE-bench v0. Ein internes Google-Benchmark fand Schwachstellen in komplexen Codebasen aus 20 Programmiersprachen. In Wiz’ Black-Box-Benchmark für Penetrationstests war Argon 3.8 Flash Cyber beim Erkennen der Angriffsfläche, beim Finden von Lücken und bei überprüfbaren Proof-of-Concept-Nachweisen überlegen.

Vor einer breiten Veröffentlichung verstärkt Google die Schutzmaßnahmen in vier Bereichen. Argon soll schädliche Anfragen zu Cyberangriffen sowie chemischen, biologischen, radiologischen und nuklearen Gefahren ablehnen. Legitime Forschung mit doppeltem Verwendungszweck soll möglich bleiben. Google verbessert außerdem die Überwachung interner Aktivierungen, beschrieben in der arXiv-Publikation 2601.11516. Interne und externe Red Teams testeten die Maßnahmen mit manuellen und automatisierten Angriffen.

Google trainierte Argon auch gegen indirekte Prompt-Injection-Angriffe. Nach Unternehmensangaben ist es das bisher widerstandsfähigste Modell von Google in diesem Bereich und führt auf dem Indirect Prompt Injection Benchmark von Gray Swan. Maßnahmen gegen Fehlanpassung überwachen die Gedankenkette und die Aktionen des Modells. Bei Bedarf stoppen sie die Ausführung. Ein ähnliches System überwachte die Trainingsläufe und alarmierte ein eigenes Incident-Response-Team. Die dabei gewonnenen Erkenntnisse wurden nicht in das Training zurückgeführt, damit das Modell keine Strategien zum Umgehen der Überwachung lernt.

Für riskante Trainings- und Evaluationsläufe verstärkt Google seine Sandbox-Umgebungen. Sie werden vor Beginn isoliert und versiegelt, entsprechend der Roadmap zur Kontrolle von Agenten. Nach weiteren Tests und Rückmeldungen der vertrauenswürdigen Tester soll der breitere Start mit zahlenden API-Kunden und Google-AI-Ultra-Abonnenten beginnen. Google nennt Argon außerdem als Werkzeug für kreatives Schreiben sowie für Entwickler, Fachanwender und Unternehmen.