Alle Artikel
KI-Unternehmen

GPT-6.1 Sol: Das Upgrade ist günstig. Die Migration braucht einen Test.

LLM Rumors··8 Min. Lesezeit·...
GPT-6.1 SolOpenAIKI-AgentenAPI-PreisePrompt-CachingEntwicklertoolsModellevaluationCodex

Deutsche Übersetzung: . Englisches Original

Generierte redaktionelle Illustration einer Werkbank, auf der erledigte Aufgabenblätter gegen Buchhaltungsgewichte abgewogen werden. Sie veranschaulicht Agentenkosten, keine gemessene Modellleistung.

Kurzfassung: OpenAI veröffentlichte GPT-6.1 Sol am 29. September mit unveränderten Standardpreisen von 2/10 US-Dollar je Million Eingabe-/Ausgabetokens; zwischengespeicherte Eingabe kostet statt der 0,20 Dollar bei GPT-6 Sol jetzt 0,10 Dollar.[2][4] Tool-Aufrufe benötigen Responses, und weder none noch minimal werden als Reasoning-Stufe unterstützt. Das Upgrade braucht deshalb neben dem Kostenvergleich einen Integrationstest.[6]

OpenAIs Veröffentlichung vom 29. September stellt Teams, die Sol erst eine Woche zuvor eingeführt haben, vor eine neue Frage: Wie viel sollen sie ändern, bevor die erste Evaluation überhaupt belastbar ist? Das Unternehmen positioniert GPT-6.1 Sol bei komplexer Arbeit nahe an Astra. Im Einführungsbericht nennt es für AutomationBench bei mittlerem Reasoning einen Vorsprung von 4,8 Prozentpunkten gegenüber GPT-6 Sol.[1] Das ist ein guter Anlass für einen Test, keine Prognose für die eigene Aufgabenliste.

Die eigentliche Geschichte ist keine weitere Nachkommastelle im Modellnamen. OpenAI will anspruchsvollere Arbeit in eine bestehende Preisklasse verlagern. Damit wird die erledigte und geprüfte Aufgabe zur relevanten Einkaufseinheit. Eine günstige Antwort, die einen weiteren Durchlauf auslöst, eine Integration beschädigt oder manuelle Korrekturen verlangt, gehört auf dieselbe Rechnung wie die erfolgreiche Antwort.

Unsere ursprüngliche Analyse zu Sol und Luna behandelte die Preisstaffel vom 22. September. Diese Analyse vom 3. Oktober untersucht die neue Migrationsentscheidung: Was ändert sich mit 6.1, was bleibt gleich und wie lässt sich nachweisen, dass ein nominelles Upgrade den Betrieb wirtschaftlicher macht?

HINWEIS

Warum das jetzt wichtig ist

Ein Modellwechsel kann sowohl die API-Anbindung als auch den Umfang abrechenbarer Arbeit verändern. Prüft Kompatibilität, Cache-Wiederverwendung und Abnahmequote getrennt. Ein gutes Ergebnis in einem dieser Bereiche beweist nichts über die anderen.

Titelbild: Generierte redaktionelle Illustration zu erledigter Arbeit und Buchhaltung. Sie zeigt weder einen Benchmark noch OpenAI-Infrastruktur.

Die Preisliste: Günstigeres Cache-Lesen statt allgemeinem Rabatt

Die regulären Eingabe- und Ausgabepreise sind gegenüber GPT-6 Sol nicht gefallen. OpenAI nennt weiterhin 2 US-Dollar je Million gewöhnlicher Eingabetokens und 10 Dollar je Million Ausgabetokens. Direkt geändert hat sich der Preis zwischengespeicherter Eingabe: Er beträgt die Hälfte des bisherigen Sol-Tarifs.[3][4] Ein Ablauf, der Kontext nie wiederverwendet, spart dadurch nicht automatisch.

Die Standard-Tokenpreise von GPT-6.1 Sol

2 $
Gewöhnliche Eingabe

Je Million Tokens laut OpenAI.

0,10 $
Zwischengespeicherte Eingabe

Je Million Tokens laut OpenAI.

2,50 $
Cache-Schreibvorgänge

Je Million Tokens laut OpenAI.

10 $
Ausgabe

Je Million Tokens laut OpenAI.

Quelle: OpenAI-Modellreferenz [3], geprüft am 3. Oktober 2026. US-Dollar; Standardverarbeitung mit höchstens 272.000 Eingabetokens. Ohne Toolgebühren und Regionalaufschläge. Dies sind API-Preise, keine Abo-Kontingente.

Die Preisgrenze für lange Kontexte ist wichtiger als das beworbene große Kontextfenster. Oberhalb von 272.000 Eingabetokens berechnet OpenAI für die gesamte Anfrage je Million Tokens 4 Dollar für Eingabe, 0,20 Dollar für zwischengespeicherte Eingabe, 5 Dollar für Cache-Schreibvorgänge und 15 Dollar für Ausgabe.[5] Die ersten 272.000 Tokens behalten nicht den günstigeren Tarif. Prüft vor dem nächsten vollständigen Repository-Anhang, welche Informationen die Aufgabe tatsächlich benötigt.

Die Migration: Tool-Aufrufe gehören in Responses

GPT-6 Sol erlaubte Function Calling über Chat Completions mit reasoning_effort: "none".[4] Dieser Weg entfällt beim Nachfolger. GPT-6.1 Sol benötigt für Tools Responses; die niedrigste unterstützte Reasoning-Stufe ist low. Zur Auswahl stehen low, medium, high, xhigh und max; medium bleibt die Voreinstellung.[3]

OpenAIs Migrationsleitfaden verlangt für Reasoning außerdem das Entfernen nicht unterstützter Sampling- und Log-Wahrscheinlichkeitsparameter, darunter temperature und top_p.[6] Eine vorgeschaltete Bibliothek, die alte Optionen automatisch mitsendet, muss geprüft werden, bevor über Modellqualität gestritten wird.

Testet einen vollständigen Tool-Ablauf: Anfrage, Tool-Auswahl, Tool-Ergebnis und abschließende Antwort. Ein absichtlich fehlgeschlagener Tool-Aufruf sollte zeigen, ob die Anwendung sich erholt oder den Fehler korrekt meldet. Haltet den bisherigen Weg während der Evaluation verfügbar. Sonst erscheint ein Integrationsfehler als mangelnde Intelligenz, und ein scheinbar günstigerer Durchlauf war womöglich nur vorzeitig beendet.

Das Cache-Beispiel: Aus fünfzig Prozent werden neun Cent

Es folgt eine illustrative Kostenrechnung, kein gemessenes Modellergebnis. Angenommen werden zehn Anfragen mit jeweils demselben Präfix aus 100.000 Tokens, einem wechselnden Suffix aus 10.000 Tokens und 2.000 abgerechneten Ausgabetokens einschließlich Reasoning. Das Präfix wird einmal geschrieben und neunmal vollständig aus dem Cache gelesen; das Suffix wird nie in den Cache geschrieben. Jede Anfrage bleibt unter der Langkontextgrenze. Tools, Wiederholungen und Regionalaufschläge sind ausgeschlossen.

OpenAI berechnet Cache-Schreibvorgänge mit dem 1,25-Fachen des gewöhnlichen Eingabepreises. Spätere Lesevorgänge kosten bei GPT-6.1 Sol das 0,05-Fache, bei GPT-6 Sol das 0,1-Fache. Eine fortbestehende Sitzung garantiert diese Treffer nicht.[7]

Zum Lesen aller Spalten seitlich scrollen.

Angenommene abrechenbare Arbeit über zehn AnfragenGPT-6 SolGPT-6.1 Sol
Ein Schreibvorgang für das Präfix aus 100.000 Tokens0,25 $0,25 $
Neun Lesevorgänge für das Präfix aus 100.000 Tokens0,18 $0,09 $
Zehn nicht zwischengespeicherte Suffixe mit je 10.000 Tokens0,20 $0,20 $
Zehn Ausgaben mit je 2.000 abgerechneten Tokens0,20 $0,20 $
Gesamtkosten unter diesen Annahmen0,83 $0,74 $

Berechnung von LLM Rumors anhand der veröffentlichten Standardpreise von OpenAI [5, 7]. Tokenzahlen und Cache-Treffer werden als identisch angenommen. Die Tabelle misst weder Fähigkeiten noch tatsächlichen Verbrauch.

Der Cache-Lesepreis halbiert sich, die Gesamtkosten sinken aber nur um 0,09 Dollar, weil Schreibvorgänge, gewöhnliche Eingabe und Ausgabe weiterhin Geld kosten. Ergänzen wir eine hypothetische Abnahmeprüfung: Erledigt das alte Modell acht akzeptable Aufgaben, ergeben 0,83 Dollar geteilt durch acht genau 0,10375 Dollar je akzeptierter Aufgabe. Schafft das neue Modell nur sieben, ergeben 0,74 Dollar geteilt durch sieben, auf fünf Nachkommastellen gerundet, 0,10571 Dollar. Trotz der niedrigeren Rechnung ist die akzeptierte Aufgabe teurer. Bei neun akzeptierten Aufgaben ergibt dieselbe Rechnung für das neue Modell 0,08222 Dollar je Aufgabe.

Diese Abnahmezahlen sind erfundene Szenarien, keine Schätzungen für eines der Modelle. Sie zeigen, warum der Nenner zur Einkaufsentscheidung gehört. Im Betrieb verändern unterschiedliche Reasoning-Verbräuche und Wiederholungen zusätzlich den Zähler.

Die Belegprüfung: Anbieterfortschritt braucht eigene Vergleichstests

OpenAIs Vergleiche zur Einführung verdienen Beachtung, doch ihre Messbedingungen sind entscheidend. Das Unternehmen erklärt, dass seine Forschungs- oder API-Evaluationen wegen anderer Prompts, Tools und Reasoning-Stufen von ChatGPT im Produktivbetrieb abweichen können. Die schwierigen Prompts zur Faktenprüfung stammen aus von Nutzern gemeldeten Fehlerfällen und bilden nicht den üblichen Datenverkehr ab.[1] Eine Grafik zur Einführung verrät einem Supportteam nicht dessen künftige Korrekturquote.

Der Systemkarten-Nachtrag enthält einen weiteren leicht übersehenen Hinweis: Vergleichsergebnisse älterer Modelle können sich auf neuere Versionen als die bei deren Einführung getesteten beziehen.[8] Haltet deshalb die genauen Konfigurationen des eigenen Tests fest. Eine Tabelle aus alten Punktwerten und aktuellen Preisen kann eine präzise Antwort auf die falsche Frage liefern.

Nutzt einen zurückgehaltenen Testsatz aus echten Aufgaben und identische Abnahmeregeln. OpenAIs Evaluationsleitfaden unterstützt reproduzierbare Datensätze und die Bewertung von Ablaufprotokollen.[10] Wir empfehlen, akzeptierte Aufgaben, sämtliche abrechenbaren Tokenkategorien, Toolgebühren, Wiederholungen, Eskalationskosten, Laufzeit und menschliche Korrekturminuten zu erfassen. Prüft Fehlschläge manuell, bevor ein automatischer Bewerter zum letzten Schiedsrichter wird.

Abnahme muss mehr bedeuten als plausibler Text. Eine Repository-Änderung kann bestandene Tests und eine vom Reviewer akzeptierte Änderung verlangen. Bei Dokumenten können korrekte Zahlen und nachvollziehbare Belege entscheidend sein. Ordnet eine Eskalation an Astra der ursprünglichen Aufgabe zu, statt den fehlgeschlagenen Sol-Versuch in einem anderen Budget zu verstecken.

Die Einführung: Mehr brauchbare Arbeit einkaufen

Auch Verfügbarkeit verlangt eine genaue Bezeichnung. OpenAIs aktuelle Hilfeseite führt GPT-6.1 Sol in ChatGPT Work und Codex; der Zugang hängt von Tarif, Einführungsphase und Workspace-Einstellungen ab. In gewöhnlichen Chat-Unterhaltungen steht das Modell nicht zur Verfügung.[9] API-Dollar lassen sich nicht in eine garantierte Zahl von Abo-Aufgaben übersetzen.

Beginnt mit Arbeit, deren Abschluss klar erkennbar ist, und weitet den Einsatz erst aus, wenn Kompatibilitäts- und Abnahmeprüfungen bestanden sind. Dokumentiert weiterhin das ursprüngliche Modell, die Reasoning-Stufe, die Tool-Umgebung und den Verarbeitungstarif. So muss sich das nächste Update demselben Test stellen, statt die Diskussion mit Marketingtext neu zu beginnen.

ACHTUNG

Der Rabatt endet bei der Abnahmeprüfung

Das Beispiel mit 0,74 Dollar setzt zehn bestimmte Anfragen und neun Cache-Treffer voraus. LLM Rumors hat weder Qualität noch Geschwindigkeit oder Einsparungen von GPT-6.1 Sol im Produktivbetrieb gemessen. Eine niedrigere Tokenrechnung verbessert das Geschäft erst, wenn genügend brauchbare Arbeit die Prüfung besteht.

Die unbequeme Wahrheit lautet: Teams können weniger ausgeben und zugleich weniger erledigen. GPT-6.1 Sol verdient einen ernsthaften Test, weil sich Leistungsversprechen und Cache-Kosten innerhalb von Sols bestehender Eingabe-/Ausgabepreisklasse verändern. Die erfolgreiche Migration senkt die nachgewiesenen Kosten fertiggestellter Arbeit.

Quellen und Referenzen

Zum Lesen aller Spalten seitlich scrollen.

Nr.QuelleHerausgeber und DatumAussage
1Einführung von GPT-6.1 SolOpenAI, 29.09.2026Leistungsangaben des Anbieters und Grenzen der Evaluationen.
2API-Änderungsprotokoll: Veröffentlichung vom 29. SeptemberOpenAI, 29.09.2026Veröffentlichungsdatum, Einführungspreise und Tool-Endpunkt.
3Modellreferenz für GPT-6.1 SolOpenAI, abgerufen am 03.10.2026Aktuelle Reasoning-Stufen, Tools und Standard-Tokenpreise.
4Modellreferenz für GPT-6 SolOpenAI, abgerufen am 03.10.2026Preise und Chat-Completions-Verhalten des bisherigen Sol-Modells.
5OpenAI-API-PreislisteOpenAI, abgerufen am 03.10.2026Preise für kurze und lange Kontexte beider Modelle.
6Migrationsleitfaden für GPT-6OpenAI, abgerufen am 03.10.2026Änderungen an Reasoning und Parametern für die Migration.
7Leitfaden zum Prompt-CachingOpenAI, abgerufen am 03.10.2026Abrechnung von Lese- und Schreibvorgängen sowie Grenzen der Sitzungswiederverwendung.
8Systemkarten-Nachtrag zu GPT-6.1 SolOpenAI, 29.09.2026Vergleichsversionen können von den ursprünglichen Einführungsevaluationen abweichen.
9ChatGPT Work und CodexOpenAI, abgerufen am 03.10.2026Verfügbarkeit in Work/Codex und Ausschluss gewöhnlicher Chat-Unterhaltungen.
10Agentenabläufe evaluierenOpenAI, abgerufen am 03.10.2026Datensätze und Bewertung von Ablaufprotokollen für wiederholbare Evaluationen.

Zuletzt aktualisiert: 3. Oktober 2026