Alle Artikel
KI-Unternehmen

GPT-6 Sol und Luna: Was die Wahl des richtigen Modells kostet

LLM Rumors··8 Min. Lesezeit·...
GPT-6 SolGPT-6 LunaGPT-6 AstraOpenAIKI-PreiseModell-RoutingKI-AgentenEntwicklertools

Deutsche Übersetzung: . Englisches Original

Generierte redaktionelle Illustration: Eisenbahnpakete werden zu drei Werkstätten unterschiedlicher Größe geleitet. Sie zeigt nicht OpenAIs Architektur.

Kurzfassung: OpenAI hat GPT-6 Sol und Luna am 22. September veröffentlicht. Bei Standard-API-Anfragen mit höchstens 272.000 Eingabetokens kostet Sol 2 US-Dollar je Million Eingabe- und 10 US-Dollar je Million Ausgabetokens; Luna kostet 0,10 und 0,50 US-Dollar, Astra 10 und 50 US-Dollar.[1][2] Die Preisstufen betragen von Astra zu Sol 5 zu 1 und von Sol zu Luna 20 zu 1. Das sind keine gemessenen Qualitätsunterschiede. Entscheidend sind überprüfte Aufgabenergebnisse einschließlich Cache-Schreibvorgängen, Tools und Wiederholungen.

Titelbild: generierte redaktionelle Illustration. Eisenbahnpakete, die zu drei Werkstätten geleitet werden, veranschaulichen eine Routingentscheidung, weder OpenAIs Modellarchitektur noch ein gemessenes Leistungsergebnis.

Die eigentliche Geschichte ist nicht, dass OpenAI nun ein kleineres Modell verkauft. Die Veröffentlichung vom 22. September macht die Modellwahl zu einer sichtbaren Entscheidung über die Kosten je Arbeitseinheit. Sol und Luna nehmen Text und Bilder entgegen und erzeugen Text über die Responses API und Chat Completions. OpenAI positioniert Sol für komplexe Programmierung und Agentenabläufe, Luna für klar umrissene Aufgaben in großer Zahl und Astra für die schwierigsten Aufgaben von Anfang bis Ende.[1][5]

Es liegt nahe, das billigste Modell als Standard zu setzen und den Unterschied als Ersparnis zu verbuchen. Dabei fehlt die teure Frage: Besteht das Ergebnis die Prüfung? Eine Antwort, deren Tokens nur ein Zwanzigstel kosten, kann nach einem zweiten Versuch, einer Eskalation und menschlicher Nacharbeit am Ende teurer sein. Das sind Risiken, die geprüft werden müssen, keine Messwerte dieser Veröffentlichung.

HINWEIS

Warum das jetzt wichtig ist

Für alle drei GPT-6-Stufen gibt OpenAI ein Kontextfenster von 1.050.000 Tokens und maximal 128.000 Ausgabetokens an. Die Kontextgröße allein entscheidet also nicht über das Modell. Maßgeblich sind Schwierigkeit, tolerierbare Fehlerquote und die Rechnung für den ganzen Ablauf.[3][4][5]

Die Preisleiter: Fünffache und zwanzigfache Stufen

OpenAI nennt Standardpreise je Million Texttokens. Bei kurzen Kontexten kostet Astra 10 US-Dollar für Eingabe, 1 Dollar für zwischengespeicherte Eingabe, 12,50 Dollar für Cache-Schreibvorgänge und 50 Dollar für Ausgabe. Für Sol lauten die vier Preise 2, 0,20, 2,50 und 10 Dollar. Bei Luna sind es 0,10, 0,01, 0,125 und 0,50 Dollar.[2] Die Faktoren fünf und zwanzig gelten für diese Listenpreise. Sie belegen weder Korrektheit noch den erfolgreichen Abschluss einer Aufgabe.

Standard-API-Preise für Texttokens

10 $ / 50 $
Astra

Eingabe/Ausgabe je Million Tokens laut OpenAI.

2 $ / 10 $
Sol

Eingabe/Ausgabe je Million Tokens laut OpenAI.

0,10 $ / 0,50 $
Luna

Eingabe/Ausgabe je Million Tokens laut OpenAI.

OpenAI-Preise, geprüft am 26. September 2026. US-Dollar, Standardverarbeitung, höchstens 272.000 Eingabetokens. Ohne Toolgebühren, Cache-Schreibvorgänge, regionale Verarbeitung und Wiederholungen. API-Preise, keine Abo-Kontingente. Quelle [2].

Ein illustrativer Auftrag mit 100.000 nicht zwischengespeicherten Eingabe- und 10.000 abgerechneten Ausgabetokens kostet nach diesen Preisen 1,50 Dollar mit Astra, 0,30 Dollar mit Sol und 0,015 Dollar mit Luna. Die Rechnung hält die Tokenzahlen künstlich gleich und enthält keine Tools, Wiederholungen oder Regionalaufschläge. Sie sagt nicht voraus, dass alle drei Modelle gleich viele Reasoning-Tokens erzeugen, dieselbe Aufgabe abschließen oder dieselbe Qualität liefern. Der Tokenverbrauch kann sich mit Modell und Reasoning-Stufe ändern.

Oberhalb von 272.000 Eingabetokens verdoppelt die veröffentlichte Langkontext-Preisliste Eingabe- und Cachepreise und erhöht den Ausgabepreis für die gesamte Anfrage um 50 Prozent. Bei Standardverarbeitung stehen für Sol dann 4 Dollar Eingabe und 15 Dollar Ausgabe, für Luna 0,20 und 0,75 Dollar. Bei einer Anfrage mit 300.000 Eingabetokens werden die ersten 272.000 also nicht zum niedrigeren Tarif abgerechnet.[2]

Die Routingregel: Bei den Fehlerkosten anfangen

Eine brauchbare Aufteilung beginnt mit Luna für begrenzte Klassifikation, Extraktion, Verschlagwortung und kurze Umformungen, deren Fehler ein Schema oder eine menschliche Stichprobe erkennen kann. Sol kommt für Änderungen an Codebeständen, mehrstufige Analysen und Agenten infrage, die Tools auswählen und benutzen müssen. Astra lohnt sich für Aufgaben, bei denen eine falsche Zwischenentscheidung eine teure Kette entwerten würde, oder wenn eine repräsentative Evaluation einen relevanten Vorteil zeigt. Das ist ein redaktioneller Ausgangspunkt, keine Erfolgsgarantie von OpenAI.

Klar ist: Weder eine Modellbeschreibung noch eine Preistabelle ersetzt eine Evaluation. Stellt einen zurückgehaltenen Testsatz aus echter Arbeit zusammen, haltet Anweisungen und Toolzugriff vergleichbar und bewertet akzeptierte Ergebnisse. Erfasst gesamte Eingabe, Cache-Lese- und Schreibvorgänge, Ausgabe und Toolgebühren über sämtliche Versuche. Dazu gehören Dauer, p95-Latenz, Eskalationsquote und Minuten menschlicher Korrektur. OpenAI empfiehlt für die Prüfung von Agenten-Routing Traces, Bewerter und wiederholbare Datensätze.[8]

Ein Eskalationsauslöser sollte eng gefasst sein: ungültiges Schema, fehlgeschlagener Test, fehlender Beleg oder eine Klassifikation mit niedriger Konfidenz. Der Router muss den Grund protokollieren. Scheitert Luna und Sol erledigt die Aufgabe, gehören beide Aufrufe in die Kosten des akzeptierten Sol-Ergebnisses. Scheitert auch Sol, muss Astra am selben Akzeptanzkriterium gemessen werden. Sobald das Ergebnis besteht, ist Schluss; ein teures Modell sollte kein ritueller letzter Durchlauf sein.

Der Cache: Günstiges Lesen braucht einen bezahlten Schreibvorgang

Oft übersehen wird, dass der Preis für zwischengespeicherte Eingabe nicht die ganze Cache-Rechnung ist. OpenAI berechnet Schreibvorgänge mit dem 1,25-Fachen des regulären Eingabepreises und Lesevorgänge mit einem Zehntel. Bei Sol sind das 2,50 Dollar je Million geschriebener und 0,20 Dollar je Million gelesener Tokens, bei Luna 0,125 und 0,01 Dollar. Ein stabiler Präfix, der zweimal verwendet wird, kostet im Beispiel von OpenAI das 1,35-Fache eines regulären Eingabedurchlaufs statt des Zweifachen ohne Cache. Der Schreibpreis ersetzt für diese Tokens den regulären Preis; er kommt nicht zusätzlich dazu.[2][6]

Das begünstigt stabile Anweisungen, Schemata und Referenzen, die tatsächlich wiederverwendet werden. Für GPT-5.6 und spätere Modelle nennt OpenAI mindestens 1.024 Tokens für einen cachefähigen Prompt und standardmäßig eine Mindestlebensdauer von 30 Minuten seit dem letzten Schreiben oder Nutzen. Eine Sitzung garantiert keinen Cache-Treffer. Prüft die Nutzungsdaten, bevor ihr Einsparungen verbucht.[6]

Batchverarbeitung bietet einen weiteren bewussten Tausch: OpenAI nennt 50 Prozent Rabatt und ein Zeitfenster von bis zu 24 Stunden für asynchrone Aufträge. Das passt zu Klassifikation im Hintergrund oder morgigen Evaluationen, nicht zu einer jetzt fälligen interaktiven Antwort.[7] Die beispielhafte Luna-Anfrage für 0,015 Dollar läge unter identischen Tokenannahmen bei halbem Standard-Tokenpreis bei 0,0075 Dollar, vor weiteren Gebühren. Das ist eine Preisillustration, keine gemessene Batch-Rechnung.

Die API-Grenze: Billige Tokens machen noch keine billigen Agenten

Beide neuen Modelle unterstützen die Reasoning-Stufen none, low, medium, high, xhigh und max; medium ist laut Dokumentation die Voreinstellung. Für integrierte Tools und Reasoning mit Tools verweist OpenAI auf die Responses API. Function Calling mit Chat Completions funktioniert bei Sol und Luna nur mit reasoning_effort: "none".[3][4] Bei einer Agentenmigration kann ein bloßer Austausch der Modell-ID daher den beabsichtigten Toolvertrag verfehlen.

Toolaufrufe können getrennte Gebühren auslösen. Bei Websuche oder Computer Use kommen Gelegenheiten für Wiederholungen und zusätzlichen Kontext hinzu. Laut Preisliste kann regionale Verarbeitung 10 Prozent Aufschlag kosten; EU-Datenresidenz ist für Sol und Luna nur mit Standardverarbeitung verfügbar.[2][9] Die Kalkulation muss den tatsächlichen Endpunkt, Tarif und die Region berücksichtigen. Ein US-Dollar-API-Preis ist weder ein Abo-Kontingent noch ein Angebotspreis für europäische Kunden.

Für interaktive Codex-Nutzer behandelt unser Leitfaden zu Astras Nutzung die gesonderte Frage, wie man mit Abo-Kontingenten arbeitet. Die Hinweise zum Umgang mit wiederholtem Kontext helfen auch hier, doch diese API-Tokenpreise beschreiben kein Codex-Abo.

Der Geschäftstest: Für akzeptierte Arbeit bezahlen

Die unbequeme Wahrheit: Der Preisabstand von 100 zu 1 zwischen Astra und Luna bei Eingabe und Ausgabe ermöglicht zwei Fehler. Der eine ist ein Spitzenmodell für deterministische Routinearbeit. Der andere ist, billige Inferenz durch Aufgaben zu zwingen, die sie nicht zuverlässig erledigt. Ohne übereinstimmende Aufgabe, Tools und Abnahmetest kann kein Anbieterbenchmark das entscheiden.

Ein erster Routingversuch braucht drei Warteschlangen: einen prüfbaren Massen-Workflow, einen mehrstufigen Workflow und einen mit hohen Fehlerfolgen. Berichtet für jeden die Zahl akzeptierter Aufgaben je 1.000 Versuche, die Dollar je akzeptierter Aufgabe und die p95-Zeit bis zum Abschluss. Fehlversuche, die ein anderes Modell rettet, gehören gesondert ausgewiesen. So zeigt sich, ob aus einem geringeren Tokenpreis tatsächlich geringere Betriebskosten wurden. Und Teams erhalten eine Grundlage, den Router bei geänderten Modellen oder Preisen anzupassen.

ACHTUNG

Der Preis ist nicht das Ergebnis

Das Beispiel mit 1,50, 0,30 und 0,015 Dollar setzt identische Tokenzahlen voraus. Für diesen Artikel wurden weder Qualität noch Geschwindigkeit oder Einsparungen mit Sol, Luna oder Astra gemessen. Prüft Abschluss- und Korrekturkosten, bevor ihr einen günstigeren Workflow behauptet.

Sol und Luna machen GPT-6 für Softwareentwickler breiter nutzbar. Ob sie dauerhaft etwas verändern, hängt davon ab, ob Teams die Modellwahl als überprüfbare Produktentscheidung behandeln. Die beste Stufe erledigt die Arbeit zu den niedrigsten nachgewiesenen Gesamtkosten.

Quellen

Zum Lesen aller Spalten seitlich scrollen.

Nr.QuelleBeleg
[1]API-Changelog: Veröffentlichung vom 22. September, OpenAI, 22.09.2026Veröffentlichung, Eingabearten, Endpunkte und Einführungspreise.
[2]OpenAI API-Preise, abgerufen am 26.09.2026Standard-, Cache-, Langkontext-, Regional- und Verarbeitungstarife.
[3]GPT-6 Sol: Modellreferenz, abgerufen am 26.09.2026Positionierung, Reasoning-Stufen, Kontext und Tools.
[4]GPT-6 Luna: Modellreferenz, abgerufen am 26.09.2026Positionierung, Reasoning-Stufen, Kontext und Tools.
[5]OpenAI-Modellkatalog, abgerufen am 26.09.2026Vorgesehene Rollen von Astra, Sol und Luna laut Anbieter.
[6]Leitfaden für Prompt-Caching, abgerufen am 26.09.2026Kosten von Cache-Schreiben und -Lesen, Mindestlänge und Lebensdauer.
[7]Leitfaden zur Batch API, abgerufen am 26.09.202650 Prozent Rabatt und bis zu 24 Stunden für asynchrone Verarbeitung.
[8]Agentenabläufe evaluieren, abgerufen am 26.09.2026Traces, Bewerter und wiederholbare Datensätze für Routingprüfungen.
[9]GPT-6-Modellleitfaden, abgerufen am 26.09.2026Modellwahl, Tools über Responses und Beschränkung der EU-Verarbeitung.

Zuletzt aktualisiert: 26. September 2026