Titelbild: generierte redaktionelle Illustration einer Forschungsmaschine hinter einem kontrollierten Eingang. Sie veranschaulicht Zugangsbeschränkungen und zeigt keine gemessene Modellleistung.
Kurzfassung: Google stellte Gemini 4 Argon am 30. September mit einem Ausgabelimit von 1 Million Tokens und Einführungspreisen von 2 US-Dollar pro Million Eingabetokens sowie 10 US-Dollar pro Million Ausgabetokens vor.[1] Der erste Zugang erfolgt über das beschränkte Fairwind-Programm.[2] Käufer sollten Berechtigungen, die spätere Rechnung und tatsächlich abgenommene Arbeit prüfen, bevor sie eine Modellankündigung als verfügbare Produktionskapazität behandeln.
Die eigentliche Geschichte ist nicht die nächste Intelligenzkrone. Es ist der wachsende Abstand zwischen der Existenz eines Modells und der Möglichkeit einer Organisation, es tatsächlich einzusetzen. Argon macht diesen Abstand besonders sichtbar: Die Informationen reichen für eine erste Wirtschaftlichkeitsrechnung. Der Zugang bleibt eine eigene kaufmännische und betriebliche Frage.
Diese Analyse vom 3. Oktober untersucht die Ankündigung vom 30. September. Google will den breiteren Zugang zunächst für zahlende API-Kunden und Abonnenten von Google AI Ultra öffnen, nennt dafür aber kein Startdatum.[1] Eine Roadmap kann rechtfertigen, einen Test vorzubereiten. Sie rechtfertigt keine Kundenzusage, dass ein Arbeitsablauf nächste Woche verfügbar sein wird.
Warum das gerade wichtig ist
Der Einkauf muss drei verschiedene Fragen beantworten: Kann das Modell die Aufgabe lösen? Erhält diese Organisation die nötige Erlaubnis? Und rechtfertigt das fertige Ergebnis die Gesamtkosten? Bei Argon lässt sich die zweite Frage nicht mehr übergehen.
Die Zugangshürde: Ein API-Preis ist keine API-Berechtigung
Fairwind bevorzugt Regierungen, kritische Infrastruktur und grundlegende Technologieplattformen. Die Bedingungen verbieten den Weiterverkauf des Zugangs. Teilnehmende Organisationen müssen die Nutzung durch Beschäftigte kontrollieren und nachvollziehen können, einschließlich phishingresistenter Mehrfaktorauthentifizierung.[2]
Das verändert die unmittelbaren Möglichkeiten. Ein geeignetes Sicherheitsteam kann einen Antrag für Systeme vorbereiten, zu deren Schutz es berechtigt ist. Ein gewöhnliches Software-Startup sollte übertragbare Testaufgaben zusammenstellen und seinen bisherigen Produktionsanbieter weiter nutzen. Ein Verbraucherabo in Erwartung eines späteren Zugangs zu kaufen, ist eine andere Entscheidung als die Beschaffung eines produktiv einsetzbaren Dienstes.
Die strategische Raffinesse dieses Vertriebsansatzes liegt aus unserer Sicht darin, dass ein Anbieter mit kontrolliertem Zugang von anspruchsvollen Kunden lernen kann, bevor er dieselben Fähigkeiten einem größeren Markt anbietet. Der Kunde bekommt einen möglichen Vorsprung. Der Anbieter erhält Rückmeldungen aus Arbeitsabläufen, in denen ein korrektes Ergebnis klaren wirtschaftlichen Wert hat. Keine Seite erhält die Garantie, dass das spätere allgemeine Produkt identische Berechtigungen mitbringt.
Unsere Analyse zu Astras Zugang beschrieb ein verwandtes Problem bei Kontingenten und Kapazität. Argon ergänzt die grundsätzliche Zugangsberechtigung. Im Einkauf gehören diese Punkte in getrennte Felder, auch wenn der Markenname gleich bleibt.
Die Preisstaffel: Mit dem Tarif nach der Einführung rechnen
Google nennt für die Zeit nach der Einführungsphase 4 US-Dollar pro Million Eingabetokens und 20 US-Dollar pro Million Ausgabetokens. Ein Enddatum für die Einführungsphase enthält die Ankündigung nicht.[1]
Googles angekündigte Tokenpreise für Argon
US-Dollar pro Million Tokens. Die angekündigten Preise bestätigen keinen Zugang für ein bestimmtes Konto.
Zum Lesen aller Spalten seitlich scrollen.
| Abrechnung | Preis | Einordnung |
|---|---|---|
| Eingabe zum Start | 2 US-Dollar | Von Google angekündigter Einführungspreis. |
| Ausgabe zum Start | 10 US-Dollar | Von Google angekündigter Einführungspreis. |
| Eingabe danach | 4 US-Dollar | Von Google angekündigter Preis nach der Einführungsphase. |
| Ausgabe danach | 20 US-Dollar | Von Google angekündigter Preis nach der Einführungsphase. |
Quelle: Google, 30. September 2026. Angekündigte Tokenpreise, keine gemessenen Aufgabenkosten. Tools, Speicherung, Steuern und dienstspezifische Gebühren sind nicht enthalten.
Ein Rechenbeispiel: Eine Aufgabe benötigt 100.000 nicht zwischengespeicherte Eingabetokens und 20.000 abrechenbare Ausgabetokens. Multipliziert mit den angekündigten Preisen ergibt das zunächst 0,40 US-Dollar und später 0,80 US-Dollar. Das sind Rechenszenarien, keine gemessenen Argon-Arbeitslasten. Toolaufrufe, Wiederholungen und menschliche Prüfung bleiben außerhalb dieser Rechnung.
Eine Wirtschaftlichkeitsrechnung, die nur mit dem ersten Tarif funktioniert, hängt von einer Preisaktion ab. Beide Spalten gehören von Anfang an ins Budget. Auch verworfene Versuche zählen als Kosten: Produziert ein Agent dreimal einen plausiblen Patch, bevor einer die Prüfung besteht, entstehen drei Rechnungen und ein nutzbares Ergebnis.
Die sinnvolle Kennzahl sind die Ausgaben pro abgenommener Aufgabe. Der Tokenpreis fließt in diese Kennzahl ein, ersetzt sie aber nicht. Eine kleinere Rechnung für Arbeit, die wiederholt werden muss, ist kein Effizienzgewinn.
Das Millionenlimit: Mehr Ausgabe schafft zusätzlichen Prüfbedarf
Google bezeichnet die 1 Million ausdrücklich als Ausgabelimit, erhöht von zuvor 64.000 Tokens. Das ist keine Ankündigung eines neuen Eingabekontexts.[1]
Der Unterschied ist relevant: Mehr Material lesen und einen längeren Denkprozess fortsetzen lösen unterschiedliche Probleme. Wer größere Dokumentenmengen einlesen möchte, darf aus dieser Schlagzeile nicht ableiten, dass seine Anforderung erfüllt ist. Wer längere autonome Arbeit sucht, sollte fragen, was den Prozess beendet, sobald er unproduktiv wird.
Längere Ausführung kann bei Repository-Migrationen und Untersuchungen mit mehreren Hypothesen nützlich sein. Sie kann auch eine falsche Ausgangsannahme verstärken. Die praktische Antwort sind überprüfbare Zwischenergebnisse: ein reproduzierbarer Befund, ein fehlschlagender Test, ein geprüfter Patch, ein validierter Endzustand. Mehr Spielraum zum Fortsetzen hilft nur, wenn Fortschritt erkennbar bleibt.
Abgebrochene Aufgaben verdienen dieselbe Aufmerksamkeit wie abgeschlossene. Wer die längsten gescheiterten Läufe stillschweigend aus der Auswertung entfernt, lässt Zuverlässigkeit und Kosten besser aussehen, als sie im Produktionsbetrieb sind.
Die Benchmarkgrenze: Zum Ergebnis gehört die Ausführungsumgebung
CWE-bench v1 führt Argon mit Antigravity bei 68 Prozent programmatischem pass@1 und 62 Prozent pass@1 nach dem Urteil des Bewertungsgremiums. Der Evaluator verwendet 120 Aufgaben, vier Durchläufe je Aufgabe, eine hohe Reasoning-Einstellung und ein Zeitlimit von einer Stunde pro Durchlauf.[3] Das sind vom Evaluator gemeldete Ergebnisse eines bestimmten Systems, keine Prognose für jedes Repository.
Unterschiedliche Bewertungsverfahren beantworten unterschiedliche Fragen. Die Differenz zwischen diesen Werten ist ein Anlass, die Abnahmekriterien zu prüfen, statt den schöneren Wert auszuwählen. In einem eigenen Test sollten sowohl die Regressionstests als auch die Sicherheitsprüfung bestanden werden. Modellkennung, Ausführungsumgebung, Tools, Reasoning-Einstellung, Zeitlimit und Regeln für Wiederholungen gehören zum Ergebnis.
Auch eine Abweichung bei den Preisen sollte sichtbar bleiben. CWE-bench setzt für Argons zwischengespeicherte Eingaben 0,20 US-Dollar pro Million Tokens an. Googles angekündigter Eingaberabatt von 95 Prozent ergibt beim Einführungspreis dagegen 0,10 US-Dollar.[1][3] Bei der Diskussion von Evaluierungskosten darf die eine Grundlage nicht stillschweigend durch die andere ersetzt werden.
Vals liefert eine weitere wichtige Grenze: Der Index kombiniert Finanz-, Programmier-, Rechts- und Steueraufgaben anhand von Gewichten aus der US-Wirtschaft.[4] Das ist eine Entscheidung des Benchmarkdesigns. Die offenen Sicherheitsaufgaben eines Krankenhauses oder die Migrationsvorhaben eines europäischen Softwareunternehmens entsprechen diesem Mix nicht automatisch. Für die Kaufentscheidung braucht es eine Gewichtung nach den tatsächlichen Aufgaben.
Der Betrieb: Kontrollen gehören in die Wirtschaftlichkeitsrechnung
Googles Roadmap zur Agentenkontrolle verbindet Überwachung mit Prävention und Reaktion.[5] Das Frontier Safety Framework beschreibt zudem Sicherheitsbewertungen beim Erreichen relevanter Fähigkeitsschwellen.[6] Das sind die von Google beschriebenen Verfahren. Sie belegen nicht, dass der Kundeneinsatz denselben Schutz übernimmt.
Die betriebliche Konsequenz: Das umgebende System muss mitbudgetiert werden. Ein generierter Schwachstellenbericht benötigt Verantwortliche, Belege, einen Weg zur Reproduktion und eine Entscheidung über die Behebung. Wiz beschreibt bei Scan for Good die Validierung von Befunden vor der vertraulichen Weitergabe an betroffene Organisationen.[7] Diese Übergabe gehört zum Produktwert. Sie verschwindet nicht als bloße Verwaltungsarbeit, weil ein Modell das Problem gefunden hat.
Ebenso konkret muss die Datenverarbeitung betrachtet werden. Googles Dokumentation zufolge kann CodeMender während eines laufenden Scans verschlüsselte Sitzungsdaten bis zu sieben Tage aufbewahren. Davon getrennt beschreibt sie die Bedingungen für den Verzicht auf Datenspeicherung bei verwalteten Modellaufrufen.[8] Eine Zusicherung auf Modellebene beschreibt nicht jede Agentensitzung und jedes angebundene Tool.
Vor dem Anbietervergleich sollte der gesamte Weg vom ausgecheckten Repository bis zur abgenommenen Änderung aufgezeichnet werden. Wer kann Quellcode lesen? Wer verwaltet Zugangsdaten? Wo bleiben Zwischenprodukte gespeichert? Wer darf Schreibzugriffe freigeben? Diese Betrachtung legt die tatsächlichen Integrationskosten häufig früher offen als ein weiterer Benchmarklauf.
Die Kaufentscheidung: Den Test vorbereiten und Alternativen erhalten
Die unbequeme Wahrheit lautet: Ein beeindruckendes Modell mit beschränktem Zugang kann strategisch wichtig sein, ohne die nächste Abhängigkeit der eigenen Produktion zu werden. Ein berechtigtes Sicherheitsteam sollte einen klar abgegrenzten Aufgabenbestand bestimmen und den benötigten Zugang beantragen. Alle anderen können denselben Test vorbereiten, ohne ein Migrationsdatum zu versprechen.
Verwenden Sie repräsentative Aufgaben mit bekannten Abnahmekriterien. Halten Sie den Ausgangsstand des Repositorys, die erwarteten Prüfungen und den menschlichen Prüfaufwand fest. Nehmen Sie auch Aufgaben auf, die das bisherige System bereits günstig erledigt. Ein leistungsfähigeres Modell muss sich seinen Platz verdienen, statt automatisch die gesamte Warteschlange zu übernehmen.
Die fehlende Kennzahl ist abgenommene Arbeit
Weder ein veröffentlichter Preis noch ein Benchmarkwert verrät, wie viele prüfbare Ergebnisse Ihr Konto liefern kann. Zugang, Aufgabenabnahme, Gesamtausgaben und Anforderungen an die Datenaufbewahrung gehören in dieselbe Entscheidung.
Eines muss klar sein: Knappheit kann Zugang wie einen Gewinn erscheinen lassen. Der Einkauf sollte dieser Psychologie widerstehen. Die stärkste Position besteht aus einer funktionierenden Alternative, einer belastbaren Evaluierung und einem Budget, das die Einführungsphase übersteht. Das Modell verdient sich seine Aufgaben erst, wenn die Belege vorliegen.
Quellen: Primärbelege und Dokumentation
Für diese Analyse vom 3. Oktober geprüfte Primärquellen. Laufende Dokumentation kann sich ändern.
Zum Lesen aller Spalten seitlich scrollen.
| Nr. | Quelle | Herausgeber und Datum | Bedeutung |
|---|---|---|---|
| 1 | Ankündigung von Gemini 4 Argon | Google, 30.09.2026 | Vorstellung, angekündigte Preise und Ausgabelimit. |
| 2 | Fairwind-Programm | Google DeepMind, abgerufen am 03.10.2026 | Berechtigung und zulässiger Organisationszugang. |
| 3 | Methodik und Ergebnisse von CWE-bench v1 | Collinear AI, abgerufen am 03.10.2026 | Evaluierungsbedingungen und Kostenannahmen. |
| 4 | Methodik des Vals Index | Vals AI, abgerufen am 03.10.2026 | Wirtschaftsgewichte entsprechen nicht dem Aufgabenmix eines Kunden. |
| 5 | Die Zukunft von KI-Agenten absichern | Google DeepMind, 18.06.2026 | Architektur für Überwachung, Prävention und Reaktion. |
| 6 | Erweiterung des Frontier Safety Framework | Google DeepMind, aktualisiert am 17.04.2026 | Risikobewertung anhand von Fähigkeitsschwellen. |
| 7 | Scan for Good | Wiz, abgerufen am 03.10.2026 | Validierung und vertrauliche Weitergabe von Befunden. |
| 8 | Agent Platform und Verzicht auf Datenspeicherung | Google Cloud, aktualisiert am 01.10.2026 | Unterschiedliche Bedingungen für Modellaufrufe und Agentensitzungen. |
Zuletzt aktualisiert: 3. Oktober 2026




