Siebenundzwanzig Tage. So lange hat Google gebraucht, um auf GPT-6 Astra zu antworten. Am 30. September 2026 hat Google DeepMind Gemini 4 Argon vorgestellt, das neue Frontier-Modell, mit dem Google zu OpenAI und Anthropic aufschließen will. Getestet hab ich es noch nicht, und das liegt nicht an mir: Zugriff hat derzeit nur eine kleine Gruppe von Cyber-Partnern.
Meine Einschätzung vorweg: Argon ist im Moment eine Ankündigung mit Preisschild, kein Werkzeug für deinen Alltag. Und die Zahl, die mich am meisten beschäftigt, steht in keinem Benchmark-Chart. Nach diesem Artikel weißt du, was Google konkret verspricht, welche Zahlen ausschließlich von Google selbst stammen, was das Modell kosten soll und worauf ich schaue, sobald ich es in die Finger bekomme. Ich bin seit 1989 in der Kommunikationsbranche und hab genug Produktankündigungen erlebt, um Launch-Post und Praxis auseinanderzuhalten. Also beginne ich bei dem, was gesichert ist.
- Frontier-Modell
- das jeweils leistungsfähigste Modell eines Anbieters, an der Grenze dessen, was technisch gerade machbar ist.
- Output-Token-Limit
- die maximale Textmenge, die ein Modell in einem einzigen Durchlauf erzeugen darf. Bei Reasoning-Modellen zählen je nach Anbieter auch die internen Denkschritte dazu.
- Fairwind Program
- Googles Zugangsprogramm, über das ausgewählte Behörden, Betreiber kritischer Infrastruktur und Software-Maintainer neue Modelle für die Cyberabwehr vorab bekommen.
Was hat Google mit Gemini 4 Argon angekündigt?
Den Launch-Post zu Gemini 4 Argon hat Koray Kavukcuoglu geschrieben, Senior Vice President bei Google DeepMind. Argon soll in drei Feldern Spitzenleistung bringen: Software-Engineering über lange Aufgabenketten, Wissensarbeit in Recht und Finanzen sowie Cyberabwehr. Ausgerollt wird zuerst über das Fairwind Program von Google DeepMind. Parallel nimmt Google am freiwilligen Verfahren der US-Regierung teil, das staatlichen Stellen vorab Zugang zu neuen Modellen gibt.
Laut The New Stack ersetzt Argon im Grunde Gemini 3.5 Pro, das Google auf der I/O im Mai angekündigt und nie ausgeliefert hat. Den Druck dahinter hab ich schon beim Dreiwochentakt der Gemini-Flash-Modelle beschrieben: Google hat monatelang kleinere Modelle nachgeschoben, während die Frage offen blieb, wo das große bleibt.
Warum ist das Output-Limit die eigentliche Nachricht?
Bei einem Modell, das bis zu eine Million Tokens am Stück erzeugen darf, zählt für mich der Preis pro erledigter Aufgabe mehr als der Preis pro Token. Genau diese Zahl veröffentlicht Google nicht.
Google hebt das Output-Limit von bisher 64.000 auf eine Million Tokens. Die Begründung im Launch-Post: Wenn das Modell Hunderttausende Tokens in einem einzigen Durchlauf erzeugen kann, löst es schwierige Probleme in einem Anlauf. Das klingt gut. Rechnen wir trotzdem.
Der Einführungspreis liegt bei 2 Dollar pro Million Input-Tokens und 10 Dollar pro Million Output-Tokens. Danach gelten 4 und 20 Dollar, wann die Einführungsphase endet, steht im Launch-Post nicht. Schöpft ein einzelner Durchlauf das Limit aus, kostet er allein beim Output 10 Dollar, später 20. Ein Agent, der das zehnmal am Tag macht, landet nach der Einführungsphase bei 200 Dollar täglich.
Zum Vergleich: GPT-6 Astra kostet in der API 10 Dollar Input und 50 Dollar Output pro Million Tokens. Pro Token verlangt Google also ein Fünftel. Das ist ein echter Preisangriff, und gecachte Input-Tokens werden sogar um 95 Prozent günstiger, was bei wiederkehrenden Systemprompts in Agenten spürbar ist.
Der Haken ist derselbe wie bei Gemini 3.8 Flash. Dort hat Google offen geschrieben, dass das Modell härter arbeitet und mehr Reasoning-Schritte macht. Gleicher Listenpreis, höherer Verbrauch. Argon bekommt für dieses Prinzip jetzt rund fünfzehnmal mehr Spielraum. Billig pro Token heißt deshalb nicht billig pro Ergebnis.
Wie belastbar sind die Benchmark-Zahlen von Gemini 4 Argon?
Die Zahlen, die Google nennt: 77,9 Prozent auf DeepSWE v1.1 für lange Software-Engineering-Aufgaben, Platz eins im Vals Index, der wirtschaftlich relevante Arbeit in Finanzen, Coding, Recht und Steuern misst, 51,3 Prozent auf Zapiers AutomationBench und ein geteilter erster Platz mit 68 Prozent auf CWE-bench v1, wo es ums Beheben von Sicherheitslücken geht. Gegen indirekte Prompt Injections soll Argon laut Google das robusteste Modell im Gray-Swan-Benchmark sein.
Dazu kommen interne Beispiele. Argon-Agenten migrieren bei Google C- und C++-Code nach Rust, bis zu 800.000 Zeilen im Zircon-Kernel von Fuchsia. Beim Videodecoder libgav1 soll die überarbeitete Rust-Version 2,7-mal schneller laufen als die bisherige Rust-Portierung.
Das sind Herstellerangaben, mit Ausnahme der Vals-Platzierung, die auch TechCrunch berichtet. Und es gibt eine Gegenstimme. Bloomberg berichtete vor dem Launch, dass Argon in Benchmarks gut abschneidet, Google-Mitarbeitende im echten Arbeitseinsatz aber weniger überzeugt waren. Ich kann das weder bestätigen noch widerlegen. Mein Eindruck ist aber, dass genau diese Lücke zwischen Tabelle und Arbeitsalltag die Frage ist, die über Argon entscheidet. Fairerweise: Laut VentureBeat behauptet Google gar nicht, jeden Benchmark zu gewinnen. Das ist ehrlicher als bei manchem Mitbewerber.
Was bedeutet der gestaffelte Start für Nutzer in Europa?
Wann Entwickler, Unternehmen und Privatnutzer Argon bekommen, sagt Google nicht. Als Nächstes sollen laut Launch-Post zahlende API-Kunden und Abonnenten von Google AI Ultra drankommen. Für Fairwind-Partner und Googles eigene Teams gibt es Argon ohne Cyber-Guardrails, damit sie die volle Abwehrleistung nutzen können.
Was mir fehlt, ist ein einziger Satz zur EU. Der Launch-Post nennt die US-Regierung, Europa kommt nicht vor. Dass das keine Formalität ist, hat der Fall Claude Fable 5 im Juni gezeigt: Drei Tage nach dem Launch musste Anthropic den Zugang weltweit aussetzen, um US-Exportkontrollen einzuhalten, erst am 1. Juli war das Modell wieder da. Ob bei Argon ähnliche Hürden kommen, weiß heute niemand.
Für KMU in Österreich hat das eine konkrete Folge. Bevor Argon mit Kundendaten arbeitet, braucht es Klarheit über Verarbeitungsort und Auftragsverarbeitung nach DSGVO, und dazu sagt Google bisher nichts. Ich bin zertifizierter KI-Beauftragter nach ISO 42001 und plane mit meinen Kunden deshalb nichts auf Basis einer Ankündigung.
Worauf schaue ich, sobald ich Zugang habe?
Ich teste neue Modelle mit meinem Arbeitsalltag statt mit Benchmark-Aufgaben. Bei Gemini 3.1 Pro hab ich das einen Monat lang gemacht, inklusive österreichischer Verwaltungssprache, an der sich jedes Modell eigens beweisen muss.
Bei Argon interessieren mich drei Dinge. Wie viele Tokens verbraucht eine typische Aufgabe wirklich, wenn das Modell eine Million darf? Hält die Qualität bei deutschen Texten mit Claude und GPT-6 Astra mit? Und hält die beworbene Robustheit gegen Prompt Injection in Agenten-Workflows, die ich selbst baue und kenne?
Bis dahin gilt für mich eine einfache Regel: Kein Workflow wird auf ein Modell umgebaut, das ich nicht aufrufen kann. Die Benchmark-Grafiken kannst du jetzt weiterteilen. Ich warte lieber auf die erste echte Rechnung.




