Kurzfassung: OpenAI hat GPT-6 Sol und Luna am 22. September veröffentlicht. Bei Standard-API-Anfragen mit höchstens 272.000 Eingabetokens kostet Sol 2 US-Dollar je Million Eingabe- und 10 US-Dollar je Million Ausgabetokens; Luna kostet 0,10 und 0,50 US-Dollar, Astra 10 und 50 US-Dollar.[1][2] Die Preisstufen betragen von Astra zu Sol 5 zu 1 und von Sol zu Luna 20 zu 1. Das sind keine gemessenen Qualitätsunterschiede. Entscheidend sind überprüfte Aufgabenergebnisse einschließlich Cache-Schreibvorgängen, Tools und Wiederholungen.
Titelbild: generierte redaktionelle Illustration. Eisenbahnpakete, die zu drei Werkstätten geleitet werden, veranschaulichen eine Routingentscheidung, weder OpenAIs Modellarchitektur noch ein gemessenes Leistungsergebnis.
Die eigentliche Geschichte ist nicht, dass OpenAI nun ein kleineres Modell verkauft. Die Veröffentlichung vom 22. September macht die Modellwahl zu einer sichtbaren Entscheidung über die Kosten je Arbeitseinheit. Sol und Luna nehmen Text und Bilder entgegen und erzeugen Text über die Responses API und Chat Completions. OpenAI positioniert Sol für komplexe Programmierung und Agentenabläufe, Luna für klar umrissene Aufgaben in großer Zahl und Astra für die schwierigsten Aufgaben von Anfang bis Ende.[1][5]
Es liegt nahe, das billigste Modell als Standard zu setzen und den Unterschied als Ersparnis zu verbuchen. Dabei fehlt die teure Frage: Besteht das Ergebnis die Prüfung? Eine Antwort, deren Tokens nur ein Zwanzigstel kosten, kann nach einem zweiten Versuch, einer Eskalation und menschlicher Nacharbeit am Ende teurer sein. Das sind Risiken, die geprüft werden müssen, keine Messwerte dieser Veröffentlichung.
Warum das jetzt wichtig ist
Die Preisleiter: Fünffache und zwanzigfache Stufen
OpenAI nennt Standardpreise je Million Texttokens. Bei kurzen Kontexten kostet Astra 10 US-Dollar für Eingabe, 1 Dollar für zwischengespeicherte Eingabe, 12,50 Dollar für Cache-Schreibvorgänge und 50 Dollar für Ausgabe. Für Sol lauten die vier Preise 2, 0,20, 2,50 und 10 Dollar. Bei Luna sind es 0,10, 0,01, 0,125 und 0,50 Dollar.[2] Die Faktoren fünf und zwanzig gelten für diese Listenpreise. Sie belegen weder Korrektheit noch den erfolgreichen Abschluss einer Aufgabe.
Standard-API-Preise für Texttokens
Eingabe/Ausgabe je Million Tokens laut OpenAI.
Eingabe/Ausgabe je Million Tokens laut OpenAI.
Eingabe/Ausgabe je Million Tokens laut OpenAI.
Ein illustrativer Auftrag mit 100.000 nicht zwischengespeicherten Eingabe- und 10.000 abgerechneten Ausgabetokens kostet nach diesen Preisen 1,50 Dollar mit Astra, 0,30 Dollar mit Sol und 0,015 Dollar mit Luna. Die Rechnung hält die Tokenzahlen künstlich gleich und enthält keine Tools, Wiederholungen oder Regionalaufschläge. Sie sagt nicht voraus, dass alle drei Modelle gleich viele Reasoning-Tokens erzeugen, dieselbe Aufgabe abschließen oder dieselbe Qualität liefern. Der Tokenverbrauch kann sich mit Modell und Reasoning-Stufe ändern.
Oberhalb von 272.000 Eingabetokens verdoppelt die veröffentlichte Langkontext-Preisliste Eingabe- und Cachepreise und erhöht den Ausgabepreis für die gesamte Anfrage um 50 Prozent. Bei Standardverarbeitung stehen für Sol dann 4 Dollar Eingabe und 15 Dollar Ausgabe, für Luna 0,20 und 0,75 Dollar. Bei einer Anfrage mit 300.000 Eingabetokens werden die ersten 272.000 also nicht zum niedrigeren Tarif abgerechnet.[2]
Die Routingregel: Bei den Fehlerkosten anfangen
Eine brauchbare Aufteilung beginnt mit Luna für begrenzte Klassifikation, Extraktion, Verschlagwortung und kurze Umformungen, deren Fehler ein Schema oder eine menschliche Stichprobe erkennen kann. Sol kommt für Änderungen an Codebeständen, mehrstufige Analysen und Agenten infrage, die Tools auswählen und benutzen müssen. Astra lohnt sich für Aufgaben, bei denen eine falsche Zwischenentscheidung eine teure Kette entwerten würde, oder wenn eine repräsentative Evaluation einen relevanten Vorteil zeigt. Das ist ein redaktioneller Ausgangspunkt, keine Erfolgsgarantie von OpenAI.
Klar ist: Weder eine Modellbeschreibung noch eine Preistabelle ersetzt eine Evaluation. Stellt einen zurückgehaltenen Testsatz aus echter Arbeit zusammen, haltet Anweisungen und Toolzugriff vergleichbar und bewertet akzeptierte Ergebnisse. Erfasst gesamte Eingabe, Cache-Lese- und Schreibvorgänge, Ausgabe und Toolgebühren über sämtliche Versuche. Dazu gehören Dauer, p95-Latenz, Eskalationsquote und Minuten menschlicher Korrektur. OpenAI empfiehlt für die Prüfung von Agenten-Routing Traces, Bewerter und wiederholbare Datensätze.[8]
Ein Eskalationsauslöser sollte eng gefasst sein: ungültiges Schema, fehlgeschlagener Test, fehlender Beleg oder eine Klassifikation mit niedriger Konfidenz. Der Router muss den Grund protokollieren. Scheitert Luna und Sol erledigt die Aufgabe, gehören beide Aufrufe in die Kosten des akzeptierten Sol-Ergebnisses. Scheitert auch Sol, muss Astra am selben Akzeptanzkriterium gemessen werden. Sobald das Ergebnis besteht, ist Schluss; ein teures Modell sollte kein ritueller letzter Durchlauf sein.
Der Cache: Günstiges Lesen braucht einen bezahlten Schreibvorgang
Oft übersehen wird, dass der Preis für zwischengespeicherte Eingabe nicht die ganze Cache-Rechnung ist. OpenAI berechnet Schreibvorgänge mit dem 1,25-Fachen des regulären Eingabepreises und Lesevorgänge mit einem Zehntel. Bei Sol sind das 2,50 Dollar je Million geschriebener und 0,20 Dollar je Million gelesener Tokens, bei Luna 0,125 und 0,01 Dollar. Ein stabiler Präfix, der zweimal verwendet wird, kostet im Beispiel von OpenAI das 1,35-Fache eines regulären Eingabedurchlaufs statt des Zweifachen ohne Cache. Der Schreibpreis ersetzt für diese Tokens den regulären Preis; er kommt nicht zusätzlich dazu.[2][6]
Das begünstigt stabile Anweisungen, Schemata und Referenzen, die tatsächlich wiederverwendet werden. Für GPT-5.6 und spätere Modelle nennt OpenAI mindestens 1.024 Tokens für einen cachefähigen Prompt und standardmäßig eine Mindestlebensdauer von 30 Minuten seit dem letzten Schreiben oder Nutzen. Eine Sitzung garantiert keinen Cache-Treffer. Prüft die Nutzungsdaten, bevor ihr Einsparungen verbucht.[6]
Batchverarbeitung bietet einen weiteren bewussten Tausch: OpenAI nennt 50 Prozent Rabatt und ein Zeitfenster von bis zu 24 Stunden für asynchrone Aufträge. Das passt zu Klassifikation im Hintergrund oder morgigen Evaluationen, nicht zu einer jetzt fälligen interaktiven Antwort.[7] Die beispielhafte Luna-Anfrage für 0,015 Dollar läge unter identischen Tokenannahmen bei halbem Standard-Tokenpreis bei 0,0075 Dollar, vor weiteren Gebühren. Das ist eine Preisillustration, keine gemessene Batch-Rechnung.
Die API-Grenze: Billige Tokens machen noch keine billigen Agenten
Beide neuen Modelle unterstützen die Reasoning-Stufen none, low, medium, high, xhigh und max; medium ist laut Dokumentation die Voreinstellung. Für integrierte Tools und Reasoning mit Tools verweist OpenAI auf die Responses API. Function Calling mit Chat Completions funktioniert bei Sol und Luna nur mit reasoning_effort: "none".[3][4] Bei einer Agentenmigration kann ein bloßer Austausch der Modell-ID daher den beabsichtigten Toolvertrag verfehlen.
Toolaufrufe können getrennte Gebühren auslösen. Bei Websuche oder Computer Use kommen Gelegenheiten für Wiederholungen und zusätzlichen Kontext hinzu. Laut Preisliste kann regionale Verarbeitung 10 Prozent Aufschlag kosten; EU-Datenresidenz ist für Sol und Luna nur mit Standardverarbeitung verfügbar.[2][9] Die Kalkulation muss den tatsächlichen Endpunkt, Tarif und die Region berücksichtigen. Ein US-Dollar-API-Preis ist weder ein Abo-Kontingent noch ein Angebotspreis für europäische Kunden.
Für interaktive Codex-Nutzer behandelt unser Leitfaden zu Astras Nutzung die gesonderte Frage, wie man mit Abo-Kontingenten arbeitet. Die Hinweise zum Umgang mit wiederholtem Kontext helfen auch hier, doch diese API-Tokenpreise beschreiben kein Codex-Abo.
Der Geschäftstest: Für akzeptierte Arbeit bezahlen
Die unbequeme Wahrheit: Der Preisabstand von 100 zu 1 zwischen Astra und Luna bei Eingabe und Ausgabe ermöglicht zwei Fehler. Der eine ist ein Spitzenmodell für deterministische Routinearbeit. Der andere ist, billige Inferenz durch Aufgaben zu zwingen, die sie nicht zuverlässig erledigt. Ohne übereinstimmende Aufgabe, Tools und Abnahmetest kann kein Anbieterbenchmark das entscheiden.
Ein erster Routingversuch braucht drei Warteschlangen: einen prüfbaren Massen-Workflow, einen mehrstufigen Workflow und einen mit hohen Fehlerfolgen. Berichtet für jeden die Zahl akzeptierter Aufgaben je 1.000 Versuche, die Dollar je akzeptierter Aufgabe und die p95-Zeit bis zum Abschluss. Fehlversuche, die ein anderes Modell rettet, gehören gesondert ausgewiesen. So zeigt sich, ob aus einem geringeren Tokenpreis tatsächlich geringere Betriebskosten wurden. Und Teams erhalten eine Grundlage, den Router bei geänderten Modellen oder Preisen anzupassen.
Der Preis ist nicht das Ergebnis
Sol und Luna machen GPT-6 für Softwareentwickler breiter nutzbar. Ob sie dauerhaft etwas verändern, hängt davon ab, ob Teams die Modellwahl als überprüfbare Produktentscheidung behandeln. Die beste Stufe erledigt die Arbeit zu den niedrigsten nachgewiesenen Gesamtkosten.
Quellen
Zum Lesen aller Spalten seitlich scrollen.
| Nr. | Quelle | Beleg |
|---|---|---|
| [1] | API-Changelog: Veröffentlichung vom 22. September, OpenAI, 22.09.2026 | Veröffentlichung, Eingabearten, Endpunkte und Einführungspreise. |
| [2] | OpenAI API-Preise, abgerufen am 26.09.2026 | Standard-, Cache-, Langkontext-, Regional- und Verarbeitungstarife. |
| [3] | GPT-6 Sol: Modellreferenz, abgerufen am 26.09.2026 | Positionierung, Reasoning-Stufen, Kontext und Tools. |
| [4] | GPT-6 Luna: Modellreferenz, abgerufen am 26.09.2026 | Positionierung, Reasoning-Stufen, Kontext und Tools. |
| [5] | OpenAI-Modellkatalog, abgerufen am 26.09.2026 | Vorgesehene Rollen von Astra, Sol und Luna laut Anbieter. |
| [6] | Leitfaden für Prompt-Caching, abgerufen am 26.09.2026 | Kosten von Cache-Schreiben und -Lesen, Mindestlänge und Lebensdauer. |
| [7] | Leitfaden zur Batch API, abgerufen am 26.09.2026 | 50 Prozent Rabatt und bis zu 24 Stunden für asynchrone Verarbeitung. |
| [8] | Agentenabläufe evaluieren, abgerufen am 26.09.2026 | Traces, Bewerter und wiederholbare Datensätze für Routingprüfungen. |
| [9] | GPT-6-Modellleitfaden, abgerufen am 26.09.2026 | Modellwahl, Tools über Responses und Beschränkung der EU-Verarbeitung. |
Zuletzt aktualisiert: 26. September 2026




