Google hat am 30. September 2026 ein neues Modell vorgestellt: Gemini 4 Argon. Der Konzern bezeichnet es als sein neues Frontier-Modell und stellt es unter das Motto einer „nächsten Ära“ der Frontier-Intelligenz. Der Start fällt allerdings ungewöhnlich kontrolliert aus. Zuerst bekommen vertrauenswürdige Cyber-Defender Zugang, erst danach sollen zahlende API-Kunden und Abonnenten von Google AI Ultra folgen. Wann Entwickler, Unternehmen und Verbraucher das Modell breit nutzen können, lässt Google offen und spricht lediglich von „so bald wie möglich“. Dieser Artikel ordnet ein, was Gemini 4 Argon nach Googles eigenen Angaben leistet, was es kostet, welche Teile noch geschlossen bleiben und was das für Teams bedeutet, die bereits mit Gemini arbeiten.
Grundlage ist der Beitrag von Koray Kavukcuoglu, SVP bei Google DeepMind und Chief AI Architect von Google, im Google-Blog unter dem Titel „Gemini 4 Argon: our next era of frontier intelligence“. Sämtliche Leistungsangaben stammen von Google selbst. Unabhängige Überprüfungen lagen zum Zeitpunkt der Ankündigung nicht vor, und wo Google keine Zahlen nennt, ergänzt dieser Text keine.
Was Gemini 4 Argon ist
Gemini 4 Argon ist der Name des neuen Modells innerhalb der Gemini-Familie. Google positioniert es als Spitzenmodell für anspruchsvolle, lang laufende Aufgaben. Genannt werden drei Schwerpunkte: Software Engineering, Enterprise-Wissensarbeit, vor allem in den Feldern Legal und Finance, sowie Cybersecurity-Defense. Im Schlussteil des Blogbeitrags kommen Creative Writing und sogenannte Long-Horizon-Workflows hinzu, also Arbeitsabläufe, die sich über viele Schritte und lange Zeiträume erstrecken.
Intern setzt Google das Modell nach eigenen Angaben bereits ein. Tausende Googlerinnen und Googler hätten spezialisierte Coding-Aufgaben, tiefere Recherche und die Schreibqualität als Stärken hervorgehoben. Das ist eine Selbstauskunft ohne Zahlenbasis, sie zeigt aber, in welche Richtung Google das Modell versteht: weniger als Chatpartner für kurze Fragen, mehr als Arbeitsmaschine für Aufgaben, die Stunden oder Tage an menschlicher Konzentration binden würden.
Ein technisches Detail unterstreicht diese Ausrichtung. Das Output-Limit liegt laut Google bei einer Million Tokens, zuvor waren es 64.000. Google nennt das branchenführend und spricht von Spielraum für Hunderttausende Tokens innerhalb einer einzelnen Trajektorie, also eines zusammenhängenden Arbeitslaufs eines Agenten. Wichtig ist die Abgrenzung: Die Angabe betrifft die Ausgabe. Aussagen über die Größe des Eingabe-Kontextfensters enthält die Ankündigung nicht, und dieser Text stellt dazu keine Behauptung auf.
Wer Gemini 4 Argon jetzt bekommt
Der erste Zugang läuft über das Fairwind Program, und er ist eng gefasst. Berechtigt sind vertrauenswürdige Cyber-Defender. Fairwind ist bereits aus dem Frühjahr dieses Jahres bekannt, als Google mit Flash Cyber und dem Fairwind-Programm einen ersten Defender-Zugang aufgebaut hatte. Argon ist allerdings ein anderes Modell und ein späterer, noch engerer Rollout für Verteidiger. Beide sollten nicht verwechselt werden: Flash Cyber ist die frühere Stufe, Argon die neue.
Dass die Verteilung so vorsichtig beginnt, begründet Google mit einem Prozess außerhalb des eigenen Hauses. Das Unternehmen nimmt am freiwilligen Verfahren der US-Regierung für den Pre-Release-Zugang zu Modellen teil. Der Zugang werde schrittweise erweitert. Parallel will Google Rückmeldungen früher Tester einarbeiten und die Guardrails nachschärfen, bevor Argon an Entwickler, Unternehmen und Verbraucher geht.
Für den breiteren Start nennt Google eine Reihenfolge: Er beginnt mit zahlenden API-Kunden und Abonnenten von Google AI Ultra. Ein Datum nennt der Blogbeitrag nicht. Wer Ultra bucht, sollte die Bedingungen der Stufen im Blick behalten; die Einordnung der Abo-Regeln findet sich im Beitrag zu den Regeln für Google AI Pro und Ultra. Einen Preis für Ultra nennt die Ankündigung nicht, und er wird hier deshalb nicht genannt.
Ebenfalls nicht belegt ist eine allgemeine Verfügbarkeit in einzelnen Produkten. Aus dem Blogbeitrag lässt sich nicht ableiten, dass Argon bereits in der Gemini App, in AI Studio, in Vertex oder in Workspace allgemein bereitsteht. Wer das Modell dort erwartet, muss weitere Ankündigungen abwarten.
Preise: Einführungsphase und danach
Beim Geld macht Google zwei Stufen auf. Für die Einführungsphase gelten 2 US-Dollar je Million Input-Tokens und 10 US-Dollar je Million Output-Tokens. Für Cached Input, also bereits zwischengespeicherte Eingaben, nennt Google einen Preis, der 95 Prozent unter dem Input-Token-Preis liegt. Diese Angabe steht ausdrücklich beim Einführungspreis.
Eine Fußnote im Blogbeitrag stellt die zweite Stufe klar: Nach Ende der Einführungsphase kostet die Million Input-Tokens 4 US-Dollar und die Million Output-Tokens 20 US-Dollar. Das ist jeweils das Doppelte der Einführungspreise. Zum Cache-Rabatt für die Zeit danach macht der Text keine Angabe; ob und in welcher Höhe er weiter gilt, ist offen und sollte nicht unterstellt werden.
Gemini 4 Argon: API-Preise laut Google
Eine redaktionelle Feststellung gehört dazu: Google nennt kein Enddatum für die Einführungsphase. Für die Budgetplanung ist das der heikelste Punkt der Ankündigung. Wer Argon in Agenten-Workflows mit langen Ausgaben einplant, rechnet am besten von Beginn an mit den höheren Preisen und betrachtet die Einführungskonditionen als vorübergehenden Vorteil. Das gilt umso mehr, weil das Output-Limit von einer Million Tokens zwar Spielraum schafft, aber bei Ausgabepreisen pro Million Tokens auch teuer werden kann, wenn Agenten lange Zwischenergebnisse produzieren.
Getrennte Preise für Vertex und AI Studio nennt die Ankündigung nicht. Die Zahlen gelten als allgemeine API-Preise laut Google. Zum Vergleich mit früheren Modellen genügt eine qualitative Einordnung: Frühere Flash-Modelle wurden öffentlich mit deutlich niedrigeren Tokenpreisen angekündigt, wie der Beitrag zu Gemini 3.7 Flash und KI-Agenten zeigt. Argon ist ein Frontier-Modell und damit in einer anderen Preisklasse angesiedelt.
Was Google intern mit dem Modell erreicht haben will
Der Blogbeitrag stützt sich nicht nur auf Benchmarks, sondern nennt auch Beispiele aus dem eigenen Betrieb. Sie sind als Herstellerangaben zu lesen, geben aber einen Eindruck davon, wofür Google Agenten einsetzt.
Das erste Beispiel stammt aus der Quantenforschung. Argon habe geholfen, die Spacetime-Ressourcen, also das Produkt aus Qubits und Gates, von Subroutinen zu optimieren, die wichtige Anwendungen ausbremsen. In einem Beispiel sei das Ergebnis 40 Prozent besser als die veröffentlichte Baseline gewesen, erreicht in wenigen Minuten. Wie viele Fälle es gab und wie repräsentativ dieses Beispiel ist, sagt Google nicht.
Das zweite Beispiel betrifft den Arbeitsspeicher. Argon-Agenten hätten flottenweite Profiling-Telemetrie analysiert und Speicheroptimierungen in Googles Rechenzentren umgesetzt. Nach dem Rollout seien über 300 TiB frei geworden. Insgesamt schätzt Google den Gewinn auf 500 TiB bis 1 PiB. Es handelt sich um eine Schätzung, keinen gemessenen Endwert, und das Unternehmen weist die Spanne selbst entsprechend aus.
Migrationen von C/C++ nach Rust
Das ausführlichste Praxisbeispiel betrifft die Umstellung von Code von C/C++ auf Rust, einer Sprache mit stärkeren Speichersicherheitsgarantien. Google beschreibt Migrationen in sehr unterschiedlichen Größenordnungen: von zehntausenden Zeilen in Bibliotheken wie re2 und libgav1 bis zu über 800.000 Zeilen für den Fuchsia-Zircon-Kernel. Weil es sich um kritischen Code handelt, seien automatisierte und manuelle Audits, Emulationstests und ein Review vor der Produktion vorgesehen gewesen. Das Modell arbeitet also nicht unbeaufsichtigt, sondern innerhalb eines Prüfrahmens.
Besonders detailliert ist der Fall libgav1, Googles Open-Source-Video-Decoder. Die Agenten nahmen einen bestehenden Rust-Port und ersetzten darin 32.000 Zeilen SIMD-Code. Das geschah über viele profilgeführte Experimentierrunden. Die Agenten studierten die Ausgabe des Compilers und schrieben sicheres Rust, sodass der Compiler automatisch vektorisieren kann. Das Ergebnis laut Google: ein speichersicherer Decoder, der 2,7-mal schneller ist als der Rust-Port, bei identischer Videoausgabe und näher an der Leistung des optimierten C++. Wichtig ist die Lesart: Verglichen wird mit dem früheren Rust-Port. Eine Aussage, der Decoder sei schneller als die C++-Variante, trifft Google nicht.
Benchmarks: Was Google nennt und was nicht
Dieses Bild wurde komplett mit KI generiertProviderhiggsfieldModellgpt_image_2PromptPhotorealistic documentary photograph, 16:9, two analysts, blurred abstract monitors, no text no logos, gpt_image_2Die Bewertungen des Modells stützen sich auf eine Reihe von Tests. Bei einigen nennt Google Zahlen, bei anderen nur eine Position. Beides lässt sich nur eingeschränkt vergleichen, und die Reihenfolge hier folgt dem, was der Blogbeitrag hergibt.
Auf DeepSWE v1.1 meldet Google einen neuen State of the Art von 77,9 Prozent. Laut Google geht es dabei um reale Software-Engineering-Aufgaben mit langem Horizont. Auf AutomationBench von Zapier, das End-to-End-Abläufe über Kernfunktionen eines Unternehmens prüft, belegt Argon Platz 1 mit 51,3 Prozent. Bei LVBench, das das Verstehen langer Videos misst, nennt Google 91,7 Prozent und ebenfalls einen State of the Art. Das Modell sei stark, wenn Wissensarbeit visuelles Verstehen verlangt, etwa bei der Analyse von Charts, bei Details aus langen Videos oder beim Handeln anhand einer Serie von Dokumenten. Weitere Scores nennt der Beitrag nicht.
Für den Enterprise-Bereich fehlen Zahlen ganz. Im Vals Index, der laut Google die wirtschaftliche Wirkung über Finance, Coding, Legal und Tax misst und nach dem Anteil am US-Bruttoinlandsprodukt gewichtet, sei Argon das führende Modell. Dasselbe gilt für den Vals Finance Agent v2, der mehrstufige Finanzrecherche prüft, und für Harveys Legal Agent Benchmark, der Legal Research und Drafting abdeckt. Zu allen dreien gibt es keine Punktzahl. Die Aussage „führend“ ist damit nachvollziehbar zitiert, aber nicht überprüfbar, bis die Betreiber der Tests oder unabhängige Stellen eigene Werte veröffentlichen.
Für Teams ist das eine konkrete Konsequenz: Benchmarks messen Aufgabenprofile, die selten genau dem eigenen Alltag entsprechen. Wer über einen Wechsel nachdenkt, sollte die Ergebnisse als Hinweis und nicht als Zusage behandeln und das Modell mit eigenen, repräsentativen Aufgaben prüfen, sobald der Zugang es erlaubt.
Cybersecurity: Der Kern des ersten Rollouts
Dass der Start bei Verteidigern liegt, ist keine Nebensache, sondern der inhaltliche Schwerpunkt. Google sagt, Argon sei für Defense trainiert und könne autonom kritische Software-Schwachstellen finden, validieren und patchen. Für vertrauenswürdige Verteidiger und interne Google-Teams stehe es ohne Cyber-Guardrails zur Verfügung, damit die vollen Frontier-Defense-Fähigkeiten nutzbar sind. Das ist eine Policy-Aussage: Die Beschränkungen, die für andere Nutzer gelten sollen, werden für geprüfte Verteidiger bewusst gelockert. Für alle übrigen Zielgruppen bleiben die Schutzmechanismen aktiv.
Als externes Beispiel führt Google das Sicherheitsunternehmen Wiz an. Wiz nutzt Argon über „Scan for Good“, ein Programm, das kritische öffentliche Infrastruktur kostenlos schützen soll, indem hochriskante Expositionen gefunden und behoben werden. In einer frühen Demonstration habe das Modell eine kritische Schwachstelle entdeckt, durch die sensible personenbezogene Daten in einer Healthcare-Software offenlagen, die weltweit in Krankenhäusern genutzt wird. Frühere Frontier-Modelle hätten das übersehen. Näheres zur Lücke nennt Google nicht, und dieser Artikel nennt sie ebenfalls nicht.
Daneben führt der Beitrag mehrere Tests an. Auf CWE-bench v1 teilt sich Argon mit 68 Prozent den ersten Platz; der Test baut auf 3.8 Flash Cyber auf CWE-bench v0 auf, einen Score für v0 nennt der Beitrag nicht. Ein interner Vulnerability-Benchmark von Google deckt ein breites Spektrum an Expositionen über komplexe Codebasen in 20 Programmiersprachen ab, ohne Prozentangabe. Im Black-Box-Benchmark von Wiz, der live laufende Websysteme ohne Zugriff auf den Quellcode prüft, übertrifft Argon laut Google das Modell 3.8 Flash Cyber beim Entdecken der Angriffsfläche, beim Identifizieren von Schwachstellen und beim Erzeugen von Nachweisen zur Validierung. Auch hier fehlen Prozentzahlen.
Safeguards: Vier Felder
Weil das Modell für Verteidiger weniger eingeschränkt läuft, gewinnt der Schutzrahmen Gewicht. Google gliedert ihn in vier Felder.
Erstens der Missbrauchsschutz. Das Modell soll schädliche Anfragen zu Cyber und zu chemischen, biologischen, radiologischen und nuklearen Themen ablehnen, legitime Dual-Use-Forschung aber gemäß dem Frontier Safety Framework weiterhin ermöglichen. Google verweist auf Red-Team-Tests, intern wie extern, manuell wie automatisiert. Ausgebaut werde außerdem die Überwachung interner Aktivierungen des Modells auf Missbrauch.
Zweitens Prompt Injection. Argon sei das bisher widerstandsfähigste Modell gegen indirekte Prompt Injections, also gegen Anweisungen, die in Inhalten wie Webseiten oder Dokumenten versteckt sind, die ein Agent verarbeitet. Im Benchmark für indirekte Prompt Injection von Gray Swan (IPI) liege es vorn. Eine Punktzahl nennt Google nicht. Für Agenten, die selbstständig Dokumente lesen und Aktionen ausführen, ist das ein zentraler Punkt, denn gerade dort entstehen die Angriffsflächen.
Drittens Misalignment, also das Risiko, dass ein Modell Ziele verfolgt, die von den vorgesehenen abweichen. Die Gegenmaßnahmen überwachen laut Google die Gedankenkette (Chain-of-Thought) und die Aktionen des Modells und stoppen die Ausführung bei Bedarf. Ein ähnliches System habe die Trainingsläufe überwacht und ein Incident-Response-Team alarmiert. Bemerkenswert ist eine Entscheidung dazu: Die Befunde flossen bewusst nicht ins Training zurück, damit das Reasoning nicht lernt, das Monitoring zu umgehen. Google verbindet das mit dem Appell, die Transparenz des Reasonings zu erhalten.
Viertens das Hardening der Umgebung. Sandboxes, in denen das Modell arbeitet, werden isoliert und versiegelt, bevor hochriskantes Training oder Evaluationen beginnen. Best Practices dazu will Google mit Partnern teilen. Wie weit diese Praxis reicht, lässt sich von außen nicht beurteilen; sie ist bisher eine Ankündigung.
Was das für Teams bedeutet, die schon Gemini nutzen
Für die Mehrheit der Gemini-Nutzer ändert sich am ersten Tag nichts. Argon ist für den Alltag in Unternehmen noch nicht verfügbar, die Produkte bleiben, wie sie sind. Bestehende Integrationen laufen weiter, und die Ankündigung enthält keinen Hinweis auf eine Abkündigung bisheriger Modelle. Handlungsdruck entsteht also vor allem an drei Stellen.
Erstens bei der Planung. Teams mit Gemini-API-Verträgen gehören zu denen, die im breiteren Start als Erste an der Reihe sind, sofern sie zahlende API-Kunden sind. Sinnvoll ist, jetzt geeignete Testaufgaben festzulegen: lange, mehrstufige Aufgaben, bei denen Ergebnisqualität messbar ist, etwa Refactoring, Recherche mit Quellenprüfung oder Vertragsentwürfe mit klaren Prüfkriterien. Auf dieser Basis lässt sich später entscheiden, ob sich der höhere Preis gegenüber leichteren Modellen lohnt.
Zweitens beim Budget. Der Unterschied zwischen Einführungs- und Folgepreis ist deutlich, und das Ende der Einführungsphase ist nicht datiert. Wer Prozesse auf Argon aufbaut, sollte Kostenrechnungen mit 4 und 20 US-Dollar je Million Tokens ansetzen und die Einführungspreise als Bonus verbuchen. Der genannte Rabatt von 95 Prozent auf Cached Input gilt nach Googles Angaben für die Einführungsphase. Eine Planung, die darauf dauerhaft setzt, wäre nicht gedeckt.
Drittens bei Sicherheit und Governance. Je autonomer Agenten arbeiten, desto wichtiger werden Berechtigungen, Protokolle und Freigaben. Googles Selbstbeschreibung der Safeguards ist hilfreich, ersetzt aber keine eigene Prüfung. Das gilt besonders für Szenarien, in denen Agenten externe Inhalte lesen und anschließend Aktionen auslösen. Dass Google selbst Review vor Produktion, Audits und Emulationstests bei den Rust-Migrationen betont, zeigt, welches Vorgehen das Unternehmen auch Kunden nahelegt.
Für Sicherheitsteams liegt der Fall anders. Wer zu den Defendern zählt, die Google über Fairwind erreicht, hat einen Zugang, der anderen vorerst fehlt. Alle übrigen können beobachten, wie sich der Zugang erweitert. Ein Anspruch auf Aufnahme folgt aus der Ankündigung nicht; Google beschreibt keine Aufnahmekriterien im Detail.
Offene Punkte
Bei aller Detailfülle bleibt mehr offen, als der Titel „nächste Ära“ vermuten lässt. Es gibt kein Datum für den breiten Start und keines für das Ende der Einführungspreise. Für mehrere Spitzenplätze, vom Vals Index über den Finance Agent bis zu Harveys Benchmark und dem IPI-Test von Gray Swan, fehlen Punktzahlen. Beim Cache-Rabatt ist unklar, was nach der Einführungsphase gilt. Und die Verfügbarkeit in einzelnen Produkten wie der Gemini App, AI Studio, Vertex oder Workspace ist nicht erklärt.
Hinzu kommt, dass die beeindruckendsten Beispiele aus Googles eigenem Betrieb stammen. Die 40 Prozent bei der Quantum-Optimierung, die über 300 TiB freien Speicher und der 2,7-fach schnellere Decoder sind Einzelfälle, die Google selbst ausgewählt hat. Sie zeigen, was das Modell unter günstigen Bedingungen leisten kann, aber nicht, wie zuverlässig es in fremden Codebasen und Prozessen arbeitet. Unabhängige Tests werden das klären müssen.
Parallel baut Google auch die Produktfläche um. Wie sich Gems durch Skills ersetzen lassen, beschreibt der Beitrag zu Gemini Skills statt Gems. Das ist ein anderes Thema als Argon, zeigt aber, dass Google gleichzeitig am Modell und an der Oberfläche arbeitet, über die es später genutzt werden soll.
Unter dem Strich ist Gemini 4 Argon vorerst ein Modell für wenige. Die Ankündigung liefert Preise, Benchmarks und ein ausführliches Sicherheitskonzept, aber keinen Termin für den breiten Zugang. Für Teams mit Gemini im Einsatz heißt das: beobachten, Testaufgaben vorbereiten, Kosten konservativ planen und die Leistungsversprechen erst übernehmen, wenn eigene Tests sie tragen.




