Alle Artikel
Google

Gemini 4 Argon: Der Preis ist öffentlich, der Zugang nicht

LLM Rumors··8 Min. Lesezeit·...
GoogleGemini 4 ArgonKI-PreiseKI-ZugangCybersicherheitKI-AgentenUnternehmens-KIModellevaluierung

Deutsche Übersetzung: . Englisches Original

Generierte redaktionelle Illustration einer Forschungsmaschine hinter einem kontrollierten Eingang als Sinnbild für beschränkten Modellzugang.

Titelbild: generierte redaktionelle Illustration einer Forschungsmaschine hinter einem kontrollierten Eingang. Sie veranschaulicht Zugangsbeschränkungen und zeigt keine gemessene Modellleistung.

Kurzfassung: Google stellte Gemini 4 Argon am 30. September mit einem Ausgabelimit von 1 Million Tokens und Einführungspreisen von 2 US-Dollar pro Million Eingabetokens sowie 10 US-Dollar pro Million Ausgabetokens vor.[1] Der erste Zugang erfolgt über das beschränkte Fairwind-Programm.[2] Käufer sollten Berechtigungen, die spätere Rechnung und tatsächlich abgenommene Arbeit prüfen, bevor sie eine Modellankündigung als verfügbare Produktionskapazität behandeln.

Die eigentliche Geschichte ist nicht die nächste Intelligenzkrone. Es ist der wachsende Abstand zwischen der Existenz eines Modells und der Möglichkeit einer Organisation, es tatsächlich einzusetzen. Argon macht diesen Abstand besonders sichtbar: Die Informationen reichen für eine erste Wirtschaftlichkeitsrechnung. Der Zugang bleibt eine eigene kaufmännische und betriebliche Frage.

Diese Analyse vom 3. Oktober untersucht die Ankündigung vom 30. September. Google will den breiteren Zugang zunächst für zahlende API-Kunden und Abonnenten von Google AI Ultra öffnen, nennt dafür aber kein Startdatum.[1] Eine Roadmap kann rechtfertigen, einen Test vorzubereiten. Sie rechtfertigt keine Kundenzusage, dass ein Arbeitsablauf nächste Woche verfügbar sein wird.

HINWEIS

Warum das gerade wichtig ist

Der Einkauf muss drei verschiedene Fragen beantworten: Kann das Modell die Aufgabe lösen? Erhält diese Organisation die nötige Erlaubnis? Und rechtfertigt das fertige Ergebnis die Gesamtkosten? Bei Argon lässt sich die zweite Frage nicht mehr übergehen.

Die Zugangshürde: Ein API-Preis ist keine API-Berechtigung

Fairwind bevorzugt Regierungen, kritische Infrastruktur und grundlegende Technologieplattformen. Die Bedingungen verbieten den Weiterverkauf des Zugangs. Teilnehmende Organisationen müssen die Nutzung durch Beschäftigte kontrollieren und nachvollziehen können, einschließlich phishingresistenter Mehrfaktorauthentifizierung.[2]

Das verändert die unmittelbaren Möglichkeiten. Ein geeignetes Sicherheitsteam kann einen Antrag für Systeme vorbereiten, zu deren Schutz es berechtigt ist. Ein gewöhnliches Software-Startup sollte übertragbare Testaufgaben zusammenstellen und seinen bisherigen Produktionsanbieter weiter nutzen. Ein Verbraucherabo in Erwartung eines späteren Zugangs zu kaufen, ist eine andere Entscheidung als die Beschaffung eines produktiv einsetzbaren Dienstes.

Die strategische Raffinesse dieses Vertriebsansatzes liegt aus unserer Sicht darin, dass ein Anbieter mit kontrolliertem Zugang von anspruchsvollen Kunden lernen kann, bevor er dieselben Fähigkeiten einem größeren Markt anbietet. Der Kunde bekommt einen möglichen Vorsprung. Der Anbieter erhält Rückmeldungen aus Arbeitsabläufen, in denen ein korrektes Ergebnis klaren wirtschaftlichen Wert hat. Keine Seite erhält die Garantie, dass das spätere allgemeine Produkt identische Berechtigungen mitbringt.

Unsere Analyse zu Astras Zugang beschrieb ein verwandtes Problem bei Kontingenten und Kapazität. Argon ergänzt die grundsätzliche Zugangsberechtigung. Im Einkauf gehören diese Punkte in getrennte Felder, auch wenn der Markenname gleich bleibt.

Die Preisstaffel: Mit dem Tarif nach der Einführung rechnen

Google nennt für die Zeit nach der Einführungsphase 4 US-Dollar pro Million Eingabetokens und 20 US-Dollar pro Million Ausgabetokens. Ein Enddatum für die Einführungsphase enthält die Ankündigung nicht.[1]

Googles angekündigte Tokenpreise für Argon

US-Dollar pro Million Tokens. Die angekündigten Preise bestätigen keinen Zugang für ein bestimmtes Konto.

Zum Lesen aller Spalten seitlich scrollen.

AbrechnungPreisEinordnung
Eingabe zum Start2 US-DollarVon Google angekündigter Einführungspreis.
Ausgabe zum Start10 US-DollarVon Google angekündigter Einführungspreis.
Eingabe danach4 US-DollarVon Google angekündigter Preis nach der Einführungsphase.
Ausgabe danach20 US-DollarVon Google angekündigter Preis nach der Einführungsphase.

Quelle: Google, 30. September 2026. Angekündigte Tokenpreise, keine gemessenen Aufgabenkosten. Tools, Speicherung, Steuern und dienstspezifische Gebühren sind nicht enthalten.

Ein Rechenbeispiel: Eine Aufgabe benötigt 100.000 nicht zwischengespeicherte Eingabetokens und 20.000 abrechenbare Ausgabetokens. Multipliziert mit den angekündigten Preisen ergibt das zunächst 0,40 US-Dollar und später 0,80 US-Dollar. Das sind Rechenszenarien, keine gemessenen Argon-Arbeitslasten. Toolaufrufe, Wiederholungen und menschliche Prüfung bleiben außerhalb dieser Rechnung.

Eine Wirtschaftlichkeitsrechnung, die nur mit dem ersten Tarif funktioniert, hängt von einer Preisaktion ab. Beide Spalten gehören von Anfang an ins Budget. Auch verworfene Versuche zählen als Kosten: Produziert ein Agent dreimal einen plausiblen Patch, bevor einer die Prüfung besteht, entstehen drei Rechnungen und ein nutzbares Ergebnis.

Die sinnvolle Kennzahl sind die Ausgaben pro abgenommener Aufgabe. Der Tokenpreis fließt in diese Kennzahl ein, ersetzt sie aber nicht. Eine kleinere Rechnung für Arbeit, die wiederholt werden muss, ist kein Effizienzgewinn.

Das Millionenlimit: Mehr Ausgabe schafft zusätzlichen Prüfbedarf

Google bezeichnet die 1 Million ausdrücklich als Ausgabelimit, erhöht von zuvor 64.000 Tokens. Das ist keine Ankündigung eines neuen Eingabekontexts.[1]

Der Unterschied ist relevant: Mehr Material lesen und einen längeren Denkprozess fortsetzen lösen unterschiedliche Probleme. Wer größere Dokumentenmengen einlesen möchte, darf aus dieser Schlagzeile nicht ableiten, dass seine Anforderung erfüllt ist. Wer längere autonome Arbeit sucht, sollte fragen, was den Prozess beendet, sobald er unproduktiv wird.

Längere Ausführung kann bei Repository-Migrationen und Untersuchungen mit mehreren Hypothesen nützlich sein. Sie kann auch eine falsche Ausgangsannahme verstärken. Die praktische Antwort sind überprüfbare Zwischenergebnisse: ein reproduzierbarer Befund, ein fehlschlagender Test, ein geprüfter Patch, ein validierter Endzustand. Mehr Spielraum zum Fortsetzen hilft nur, wenn Fortschritt erkennbar bleibt.

Abgebrochene Aufgaben verdienen dieselbe Aufmerksamkeit wie abgeschlossene. Wer die längsten gescheiterten Läufe stillschweigend aus der Auswertung entfernt, lässt Zuverlässigkeit und Kosten besser aussehen, als sie im Produktionsbetrieb sind.

Die Benchmarkgrenze: Zum Ergebnis gehört die Ausführungsumgebung

CWE-bench v1 führt Argon mit Antigravity bei 68 Prozent programmatischem pass@1 und 62 Prozent pass@1 nach dem Urteil des Bewertungsgremiums. Der Evaluator verwendet 120 Aufgaben, vier Durchläufe je Aufgabe, eine hohe Reasoning-Einstellung und ein Zeitlimit von einer Stunde pro Durchlauf.[3] Das sind vom Evaluator gemeldete Ergebnisse eines bestimmten Systems, keine Prognose für jedes Repository.

Unterschiedliche Bewertungsverfahren beantworten unterschiedliche Fragen. Die Differenz zwischen diesen Werten ist ein Anlass, die Abnahmekriterien zu prüfen, statt den schöneren Wert auszuwählen. In einem eigenen Test sollten sowohl die Regressionstests als auch die Sicherheitsprüfung bestanden werden. Modellkennung, Ausführungsumgebung, Tools, Reasoning-Einstellung, Zeitlimit und Regeln für Wiederholungen gehören zum Ergebnis.

Auch eine Abweichung bei den Preisen sollte sichtbar bleiben. CWE-bench setzt für Argons zwischengespeicherte Eingaben 0,20 US-Dollar pro Million Tokens an. Googles angekündigter Eingaberabatt von 95 Prozent ergibt beim Einführungspreis dagegen 0,10 US-Dollar.[1][3] Bei der Diskussion von Evaluierungskosten darf die eine Grundlage nicht stillschweigend durch die andere ersetzt werden.

Vals liefert eine weitere wichtige Grenze: Der Index kombiniert Finanz-, Programmier-, Rechts- und Steueraufgaben anhand von Gewichten aus der US-Wirtschaft.[4] Das ist eine Entscheidung des Benchmarkdesigns. Die offenen Sicherheitsaufgaben eines Krankenhauses oder die Migrationsvorhaben eines europäischen Softwareunternehmens entsprechen diesem Mix nicht automatisch. Für die Kaufentscheidung braucht es eine Gewichtung nach den tatsächlichen Aufgaben.

Der Betrieb: Kontrollen gehören in die Wirtschaftlichkeitsrechnung

Googles Roadmap zur Agentenkontrolle verbindet Überwachung mit Prävention und Reaktion.[5] Das Frontier Safety Framework beschreibt zudem Sicherheitsbewertungen beim Erreichen relevanter Fähigkeitsschwellen.[6] Das sind die von Google beschriebenen Verfahren. Sie belegen nicht, dass der Kundeneinsatz denselben Schutz übernimmt.

Die betriebliche Konsequenz: Das umgebende System muss mitbudgetiert werden. Ein generierter Schwachstellenbericht benötigt Verantwortliche, Belege, einen Weg zur Reproduktion und eine Entscheidung über die Behebung. Wiz beschreibt bei Scan for Good die Validierung von Befunden vor der vertraulichen Weitergabe an betroffene Organisationen.[7] Diese Übergabe gehört zum Produktwert. Sie verschwindet nicht als bloße Verwaltungsarbeit, weil ein Modell das Problem gefunden hat.

Ebenso konkret muss die Datenverarbeitung betrachtet werden. Googles Dokumentation zufolge kann CodeMender während eines laufenden Scans verschlüsselte Sitzungsdaten bis zu sieben Tage aufbewahren. Davon getrennt beschreibt sie die Bedingungen für den Verzicht auf Datenspeicherung bei verwalteten Modellaufrufen.[8] Eine Zusicherung auf Modellebene beschreibt nicht jede Agentensitzung und jedes angebundene Tool.

Vor dem Anbietervergleich sollte der gesamte Weg vom ausgecheckten Repository bis zur abgenommenen Änderung aufgezeichnet werden. Wer kann Quellcode lesen? Wer verwaltet Zugangsdaten? Wo bleiben Zwischenprodukte gespeichert? Wer darf Schreibzugriffe freigeben? Diese Betrachtung legt die tatsächlichen Integrationskosten häufig früher offen als ein weiterer Benchmarklauf.

Die Kaufentscheidung: Den Test vorbereiten und Alternativen erhalten

Die unbequeme Wahrheit lautet: Ein beeindruckendes Modell mit beschränktem Zugang kann strategisch wichtig sein, ohne die nächste Abhängigkeit der eigenen Produktion zu werden. Ein berechtigtes Sicherheitsteam sollte einen klar abgegrenzten Aufgabenbestand bestimmen und den benötigten Zugang beantragen. Alle anderen können denselben Test vorbereiten, ohne ein Migrationsdatum zu versprechen.

Verwenden Sie repräsentative Aufgaben mit bekannten Abnahmekriterien. Halten Sie den Ausgangsstand des Repositorys, die erwarteten Prüfungen und den menschlichen Prüfaufwand fest. Nehmen Sie auch Aufgaben auf, die das bisherige System bereits günstig erledigt. Ein leistungsfähigeres Modell muss sich seinen Platz verdienen, statt automatisch die gesamte Warteschlange zu übernehmen.

ACHTUNG

Die fehlende Kennzahl ist abgenommene Arbeit

Weder ein veröffentlichter Preis noch ein Benchmarkwert verrät, wie viele prüfbare Ergebnisse Ihr Konto liefern kann. Zugang, Aufgabenabnahme, Gesamtausgaben und Anforderungen an die Datenaufbewahrung gehören in dieselbe Entscheidung.

Eines muss klar sein: Knappheit kann Zugang wie einen Gewinn erscheinen lassen. Der Einkauf sollte dieser Psychologie widerstehen. Die stärkste Position besteht aus einer funktionierenden Alternative, einer belastbaren Evaluierung und einem Budget, das die Einführungsphase übersteht. Das Modell verdient sich seine Aufgaben erst, wenn die Belege vorliegen.

Quellen: Primärbelege und Dokumentation

Für diese Analyse vom 3. Oktober geprüfte Primärquellen. Laufende Dokumentation kann sich ändern.

Zum Lesen aller Spalten seitlich scrollen.

Nr.QuelleHerausgeber und DatumBedeutung
1Ankündigung von Gemini 4 ArgonGoogle, 30.09.2026Vorstellung, angekündigte Preise und Ausgabelimit.
2Fairwind-ProgrammGoogle DeepMind, abgerufen am 03.10.2026Berechtigung und zulässiger Organisationszugang.
3Methodik und Ergebnisse von CWE-bench v1Collinear AI, abgerufen am 03.10.2026Evaluierungsbedingungen und Kostenannahmen.
4Methodik des Vals IndexVals AI, abgerufen am 03.10.2026Wirtschaftsgewichte entsprechen nicht dem Aufgabenmix eines Kunden.
5Die Zukunft von KI-Agenten absichernGoogle DeepMind, 18.06.2026Architektur für Überwachung, Prävention und Reaktion.
6Erweiterung des Frontier Safety FrameworkGoogle DeepMind, aktualisiert am 17.04.2026Risikobewertung anhand von Fähigkeitsschwellen.
7Scan for GoodWiz, abgerufen am 03.10.2026Validierung und vertrauliche Weitergabe von Befunden.
8Agent Platform und Verzicht auf DatenspeicherungGoogle Cloud, aktualisiert am 01.10.2026Unterschiedliche Bedingungen für Modellaufrufe und Agentensitzungen.

Zuletzt aktualisiert: 3. Oktober 2026