Alle Artikel
KI-Unternehmen

Claude Opus 5.5: 40% Kostenschätzung und 20% niedrigere Tokenpreise auseinanderhalten

LLM Rumors··7 Min. Lesezeit·...
Claude Opus 5.5AnthropicKI-PreiseClaude APIPrompt-CachingKI-AgentenModellmigrationEntwicklerwerkzeuge

Deutsche Übersetzung: . Englisches Original

Generierte redaktionelle Illustration einer antiken Rechenmaschine neben einem leeren Kontobuch und zwei Schalen mit Zählsteinen, mit zurückhaltenden karmesinroten Markierungen.

Kurzfassung: Anthropic veröffentlichte Claude Opus 5.5 am 22. September für 4 $ pro Million Input- und 20 $ pro Million Output-Token. Beide Preise liegen 20% unter Opus 5. Cache-Lesezugriffe sanken um 60%, von 0,50 $ auf 0,20 $ pro Million.[1] Anthropics Schätzung von rund 40% niedrigeren Kosten für typische Aufgaben setzt außerdem effizientere Token-Nutzung und einen bestimmten Arbeitslastmix voraus; sie ist kein allgemeiner Rechnungsrabatt. Änderungen bei Thinking, Tools und Antwortverarbeitung verlangen einen gestuften Migrationstest.[4]

Die eigentliche Geschichte ist nicht allein das Preisschild. Anthropic macht sein Spitzenmodell pro Token günstiger und verlagert zugleich einen größeren Teil des wirtschaftlichen Versprechens darauf, wie viel Arbeit ein Agent mit diesen Token erledigt. Für lange Coding-Sitzungen ist das attraktiv. Gerade deshalb sollten Einkaufsteams eine Messung pro erledigter Aufgabe verlangen, bevor sie 40% Ersparnis in eine Planung schreiben.

Das am 22. September veröffentlichte Modell ist inzwischen über die Claude API und große Cloud-Plattformen verfügbar; seine API-Modellkennung lautet claude-opus-5-5.[1][2] Diese Analyse vom 26. September behandelt eine vier Tage alte Veröffentlichung, keine Neuerscheinung von heute. Anthropic selbst sagt, Opus 5.5 erreiche bei den meisten Aufgaben das Niveau von Fable 5.1. Das ist eine Einordnung des Anbieters, kein unabhängig unter gleichen Bedingungen erhobenes Benchmark-Ergebnis.[1]

HINWEIS

Warum das jetzt wichtig ist

Der veröffentlichte Listenpreis und die geschätzten Kosten pro erledigter Aufgabe beantworten unterschiedliche Fragen. Eine Migration kann eine konkrete Rechnung senken, sie bei einer bestimmten Arbeitslast erhöhen oder schon an der Validierung von Anfragen scheitern. Prüfen Sie Wirtschaftlichkeit und Kompatibilität, bevor Produktivverkehr umgestellt wird.

Titelbild: generierte redaktionelle Illustration einer antiken Rechenmaschine, eines leeren Kontobuchs und zweier Schalen mit Zählsteinen. Sie ist eine Metapher für Abrechnung und Arbeitsabläufe, keine Darstellung von Anthropic-Hardware, kein gemessenes Kostendiagramm und kein Benchmark-Nachweis.

Die Preisliste: 20% sind die feste Tarifänderung

Anthropic nennt für Opus 5 einen Preis von 5 $ pro Million Input-Token und 25 $ pro Million Output-Token. Bei Opus 5.5 sind es 4 $ und 20 $. Das Schreiben in einen Cache mit fünf Minuten Laufzeit sinkt von 6,25 $ auf 5 $ pro Million; das Lesen aus dem Cache von 0,50 $ auf 0,20 $.[1][3] Input, Output und fünfminütige Cache-Schreibvorgänge werden damit exakt 20% günstiger, Cache-Lesezugriffe 60%. Dies sind Tokenpreise der Claude Platform vor plattformspezifischen Vereinbarungen, Guthaben, Steuern oder Zusatzfunktionen.

Zum Lesen aller Spalten seitlich scrollen.

Abrechnungsposten pro Million TokenOpus 5Opus 5.5Tarifänderung
Regulärer Input5,00 $4,00 $-20%
Output25,00 $20,00 $-20%
Cache-Schreibvorgang, fünf Minuten6,25 $5,00 $-20%
Cache-Lesezugriff0,50 $0,20 $-60%

Der strategische Kniff dieser Preise: Cache-Lesezugriffe werden deutlich billiger, während Agenten denselben umfangreichen Kontext immer wieder aufrufen. Der niedrigere Lesepreis hilft jedoch nur bei tatsächlichen Cache-Treffern. Anthropic dokumentiert Anforderungen an den unveränderten Präfix und die Laufzeit; eine Änderung am gespeicherten Präfix kann aus einem günstigen Lesezugriff einen Schreibvorgang oder regulär berechneten Input machen.[5] Entscheidend ist die Zahl der abgerechneten Cache-Lesezugriffe, nicht ein eingeschalteter Cache. Unser Leitfaden zu Prompt-Caching-Kosten erklärt die Gewinnschwelle bei wiederholt genutztem Kontext.

Die 40%-Aussage: Zusätzliche Ersparnis muss aus der Aufgabe kommen

Laut Anthropic kostet Opus 5.5 bei typischen, nach Token berechneten Arbeitslasten etwa 40% weniger als Opus 5. Als Erklärung nennt das Unternehmen niedrigere Tarife und weniger Token pro Aufgabe. Die Zahl stammt aus Tests des Anbieters und lässt sich nicht pauschal auf Prompts, Aufwandseinstellungen oder Cache-Verhalten jedes Kunden übertragen.[1] Bei unveränderten Tokenmengen ohne Cache beträgt die rechnerische Ersparnis nur 20%.

Ein redaktionelles Rechenbeispiel, keine gemessene Produktivnutzung: Eine abgeschlossene Aufgabe benötigt mit Opus 5 eine Million reguläre Input-Token und 100.000 Output-Token. Zu Listenpreisen sind das 5 $ + 2,50 $ = 7,50 $. Mit exakt denselben Tokenmengen kostet Opus 5.5 4 $ + 2 $ = 6,00 $, also 20% weniger. Für 4,50 $, somit 40% unter 7,50 $, müsste das neue Modell eine andere Tokenmenge benötigen: beispielsweise 750.000 reguläre Input- und 75.000 Output-Token, die 3 $ + 1,50 $ kosten. In diesem Beispiel sinken beide Mengen um 25%; Cache, Batch und Fast Mode bleiben außen vor. Es belegt die Rechnung, keine tatsächlich zu erwartende Einsparung.

Oft übersehen wird der Nenner. Agenten können Versuche wiederholen, Tools aufrufen, Unteragenten starten und Thinking-Token verbrauchen. Thinking-Token werden als Output berechnet, auch wenn ihr Text in der Antwort fehlt.[4] Messen Sie Kosten pro akzeptierter, abgeschlossener Aufgabe, einschließlich Fehlversuchen und Tool-Aufrufen, zusammen mit Qualität und Dauer. Eine günstigere Tokenrechnung kann mit höheren Kosten pro akzeptiertem Ergebnis einhergehen.

Migration: Vier Kompatibilitätsprüfungen vor dem Modellwechsel

Die neue Modellkennung benötigt eine Zeile; der Verhaltensvertrag reicht weiter. Laut Anthropics Migrationsleitfaden verwendet Opus 5.5 immer adaptives Thinking. Anfragen, die Thinking deaktivieren oder ein manuelles Thinking-Budget vorgeben, erhalten HTTP 400. Eine explizite effort-Einstellung ist sinnvoll, denn der Standard wechselt von high bei Opus 5 zu medium bei Opus 5.5; eine unveränderte Anfrage würde sonst unterschiedliche Denktiefen vergleichen.[4][7]

Zweitens werden erzwungene tool_choice-Werte any und ein benanntes tool abgewiesen. Verwenden Sie auto und prüfen Sie vorgeschriebene Ausgaben mit strikten Tools oder strukturierten Ausgaben. Drittens lesen Sie Antwortblöcke nach type, statt anzunehmen, dass content[0] Text enthält. Geben Sie signierte Thinking-Blöcke in Tool-Schleifen unverändert zurück und testen Sie Router, die mitten im Gespräch das Modell wechseln. Viertens müssen Integrationen auf der Claude API und Google Cloud, die computer_20251124 nutzen, auf computer_toolset_20260801 wechseln; laut Anthropic bleibt das ältere Tool bei Amazon Bedrock kompatibel.[4]

Ein praktikabler Rollout beginnt klein und messbar: Anfragen und Antwortparser erfassen, einen repräsentativen Testsatz mit expliziten Aufwandseinstellungen ausführen, Rechnungen pro akzeptierter Aufgabe vergleichen und dann einen kleinen Teil des Verkehrs mit Rückweg umstellen. Nehmen Sie eine lange Agentensitzung mit Cache, einen Ablauf mit erzwungener Tool-Wahl, eine gestreamte Antwort und gegebenenfalls Computer Use auf. Anthropic empfiehlt Entwicklungstests vor der Produktivumstellung.[4]

Tempo und Kapazität: Den tatsächlich genutzten Modus kalkulieren

Fast Mode ist eine eigene Entscheidung und befindet sich auf der Claude API in einer Research Preview mit Zugangsbeschränkung. Anthropic bewirbt eine bis zu 2,5-fache Ausgabe von Token pro Sekunde, berechnet für Opus 5.5 jedoch 8 $ pro Million Input- und 40 $ pro Million Output-Token, also das Doppelte der regulären Opus-5.5-Tarife.[1][8] Die Geschwindigkeitszahl stammt vom Anbieter und betrifft die Ausgaberate, nicht die Zeit bis zum ersten Token. Sie ist kein Latenzversprechen für einen bestimmten Prompt oder eine bestimmte Parallelität. Ebenso beschreiben das reguläre Kontextfenster von einer Million Token und maximal 128.000 Output-Token Kapazität, keine empfohlene Anfragegröße oder feste Kosten.[2]

Die unbequeme Wahrheit: Wer eine 40%-Schlagzeile direkt in den Finanzplan kopiert, kann sein Budget falsch ansetzen. Trennen Sie Standard- und Fast-Mode-Verkehr, Cache-Schreib- und Lesezugriffe sowie Wiederholungen. Anthropics Preisdokumentation nennt außerdem einen Rabatt von 50% auf Input und Output bei der Batch API. Das ist eine gesonderte Verarbeitungsoption und nicht Teil der 40%-Schätzung.[2][6]

ACHTUNG

Die zentrale Erkenntnis

20% sind der veröffentlichte Rückgang der regulären Input- und Output-Tarife. Rund 40% sind Anthropics Schätzung für typische Arbeitslasten. Ersetzen Sie sie durch eigene Messungen pro akzeptierter Aufgabe, bevor Sie Budgets oder das Standardrouting ändern.

Klar ist: Opus 5.5 bietet Käufern einen echten niedrigeren Stückpreis. Der größere wirtschaftliche Vorteil muss sich in einem konkreten Arbeitsablauf mit kompatiblen Anfragen und überprüften Ergebnissen erst beweisen. Dort fällt die Migrationsentscheidung.

Quellen

  1. Claude Opus 5.5 vorgestellt (englische Quelle). Veröffentlichung am 22. September, Kostenschätzung des Anbieters, Tarife und Fast Mode. Hervorgehoben.
  2. Opus-5.5-Überblick (englische Quelle). Modellkennung, Verfügbarkeit, Preise, Kapazität und Batch. Hervorgehoben.
  3. Opus-5-Überblick (englische Quelle). Input- und Output-Tarife des Vorgängers.
  4. Migration zu Opus 5.5 (englische Quelle). Inkompatible Anfrage- und Antwortänderungen, Plattformausnahmen und Rollout. Hervorgehoben.
  5. Prompt-Caching (englische Quelle). Cache-Laufzeit, Präfixabgleich und Abrechnung.
  6. Preise (englische Quelle). Vollständige Token-, Cache- und Batch-Tarife. Hervorgehoben.
  7. Effort (englische Quelle). Steuerung von Denktiefe, Kosten und Latenz.
  8. Fast Mode (englische Quelle). Gesonderte Verfügbarkeit und Preise.

Letzte Aktualisierung: 26. September 2026