Alle Artikel
KI-Unternehmen

Sonnet 5.5 braucht eine klare Definition von fertig

LLM Rumors··8 Min. Lesezeit·...
AnthropicClaude Sonnet 5.5Claude Opus 5.5KI-ArbeitsabläufeKI-AgentenEntwicklerWissensarbeitKI-Evaluierung

Deutsche Übersetzung: . Englisches Original

Generierte redaktionelle Illustration zweier Zeichentische, die ein roter Faden durch eine Prüfstelle verbindet.

Titelbild: generierte redaktionelle Illustration zweier Zeichentische, die über eine Prüfstelle verbunden sind. Sie veranschaulicht Delegation und Kontrolle, keine gemessene Modellleistung.

TL;DR: Claude Sonnet 5.5 erschien am 28. September. Eine Million Eingabe-Token kostet 2 US-Dollar, eine Million Ausgabe-Token 10 US-Dollar.[1] Seine fünf Effort-Stufen eröffnen eine praktische Wahl: klar definierte Agentenaufgaben bei medium beginnen, abgeschlossene Ergebnisse messen und schwierige Entscheidungen an Opus 5.5 weitergeben.[2] Die folgenden Abläufe sind vorgeschlagene Arbeitsrezepte, keine Ergebnisse eines Benchmarks von LLM Rumors.

Die eigentliche Geschichte ist nicht ein weiteres Modell, das Code und Präsentationen schreiben kann. Entscheidend ist, ob ein Team aus einer Anweisung ein geprüftes Arbeitsergebnis machen kann, ohne jeden Zwischenschritt zu beaufsichtigen. Sonnet 5.5 gibt dieser Frage einen neuen wirtschaftlichen Anreiz: günstigere Ausführung wird wertvoll, wenn das Ergebnis die Prüfung tatsächlich besteht.

Anthropic positioniert Sonnet als schnellere Ergänzung zu Opus und empfiehlt Opus besonders für komplexe, offene Aufgaben mit anspruchsvollen Entscheidungen. Die gemeldete Verbesserung der Ausgabegeschwindigkeit um 30%+ gegenüber Sonnet 5 ist eine Herstellerangabe, keine Prognose für die Latenz Ihrer Anwendung. Wir haben diese Abläufe nicht unabhängig getestet.[1] Zum wirtschaftlichen Wandel lesen Sie unsere Analyse zu Preisen und Migration bei Opus 5.5.

HINWEIS

Warum das jetzt wichtig ist

Die Modellveröffentlichungen dieser Woche erlauben es, Ausführung und Urteilsvermögen getrennt auszuwählen. Die sinnvolle Einheit ist eine abgeschlossene Fehlerkorrektur, eine belegte Entscheidungsvorlage oder eine abgestimmte Tabelle. Eine überzeugend formulierte Antwort erfüllt allein keinen dieser Aufträge.

Effort-Einstellungen: Den Ausgangspunkt ausdrücklich festlegen

Anthropics Claude-Apps und Claude Code verwenden bei Sonnet 5.5 standardmäßig Medium; die Claude Platform verwendet High.[1] Legen Sie die Stufe beim Vergleich verschiedener Umgebungen bewusst fest. Sonst wird dieselbe Aufgabe zum Vergleich unterschiedlicher Betriebseinstellungen, der wie ein Modellvergleich aussieht.

Der dokumentierte Betriebsrahmen

5
Effort-Stufen

low, medium, high, xhigh und max laut Anthropics Effort-Dokumentation.

1M
Kontextfenster

Anthropics dokumentierte Kapazität, keine Garantie vollständiger Erinnerung.

128K
Maximale Ausgabe

Anthropics reguläres Ausgabelimit; eine Obergrenze, kein empfohlenes Ausgabenbudget.

Quellen: Anthropics Effort- und Sonnet-5.5-Dokumentation. Kapazität ist keine gemessene Aufgabenzuverlässigkeit.

Anthropic empfiehlt medium für klar spezifizierte Agentenaufgaben, high für schwierigere Aufgaben und xhigh oder max erst bei nachgewiesenen Qualitätsgewinnen.[2] Die Modellseite dokumentiert ein Kontextfenster von 1M Token und maximal 128K Ausgabe-Token.[3] Hohe Grenzen geben einem Ablauf Spielraum. Sie sagen ihm nicht, wann er aufhören soll.

Unsere vorgeschlagene Auswahlregel ist einfach: Verwenden Sie die niedrigste Stufe, die Ihre Abnahmekriterien erfüllt. Bewahren Sie fehlgeschlagene Beispiele auf. Sie zeigen, ob fehlender Kontext, eine unklare Anweisung, ein defektes Werkzeug oder unzureichendes Schlussfolgern das Problem verursacht. Mehr Effort zu kaufen, bevor die Ursache klar ist, macht aus einem Integrationsproblem eine wiederkehrende Rechnung.

Fehlerkorrektur: Sonnet braucht Reproduktion und Ziel

Beginnen Sie mit einem konkreten Fehlverhalten, einem Befehl zur Reproduktion und den relevanten Repository-Anweisungen. Verlangen Sie eine begrenzte Korrektur statt einer allgemeinen Verbesserung. Anthropics Prompting-Leitfaden warnt, dass bei niedrigem Effort aussagekräftige Prüfungen ausfallen können. Die Definition von fertig sollte deshalb beobachtbare Kontrollen verlangen.[4]

Eine wiederverwendbare Aufgabenanweisung:

Behebe den Checkout-Fehler aus dem beigefügten Issue.
Reproduziere ihn mit dem angegebenen Befehl und prüfe den relevanten Code.
Begrenze die Änderung auf das betroffene Verhalten und bestehende Konventionen.
Führe die Prüfung für diesen Fehler und danach die relevanten Projektprüfungen aus.
Berichte Ursache, geänderte Dateien, Befehle, Ergebnisse und mögliche Blockaden.
Beende die Arbeit, sobald das verlangte Verhalten funktioniert und die Prüfungen bestehen.

Beginnen Sie diesen vorgeschlagenen Ablauf bei medium. Wechseln Sie zu high, wenn die Korrektur mehrere zusammenwirkende Module betrifft. Bitten Sie Opus um eine gezielte Diagnose, wenn konkurrierende Entwürfe oder ein hartnäckiger Fehler mit weiterhin unklarer Ursache offenbleiben. Das zweite Modell sollte Reproduktion, bisherigen Patch und echte Protokolle erhalten. Eine unbelegte Behauptung, das erste Modell sei verwirrt gewesen, reicht nicht.

Der wirtschaftliche Gewinn liegt darin, dass Prüfer weniger rekonstruieren müssen. Eine Korrektur mit beigefügten Belegen kann sofort in die Prüfung gehen. Eine selbstbewusste Fertigmeldung ohne ausgeführte Kontrolle schickt die nächste Person zurück an den Anfang.

Von Quellen zur Vorlage: Belege und Empfehlung trennen

Bereiten Sie für eine Produkt- oder Betriebsvorlage zuerst ein Quellenpaket vor. Es sollte Veröffentlichungsdaten, direkte URLs, den Berichtszeitraum und die zu unterstützende Entscheidung enthalten. Geben Sie dem Ablauf ein Suchwerkzeug, wenn aktuelle Informationen erforderlich sind. Sonnet hat einen Wissensstand bis Juni 2026. September-Fakten benötigen deshalb bereitgestelltes Material oder Recherche.[3]

Verwenden Sie diesen vorgeschlagenen Prompt:

Erstelle aus dem Quellenpaket eine zweiseitige Entscheidungsvorlage.
Ordne jeder wesentlichen Tatsachenbehauptung eine Quellen-URL und einen Berichtszeitraum zu.
Trenne beobachtete Ergebnisse, Aussagen der Unternehmensleitung und deine Analyse.
Kläre widersprüchliche Zahlen oder kennzeichne den Konflikt als ungelöst.
Schließe mit drei Optionen, ihren Annahmen und den fehlenden Belegen.
Liefere die Liste der Behauptungen und Belege zusammen mit der Vorlage.

Beginnen Sie die Zusammenführung widersprüchlicher Belege bei high; nutzen Sie medium zum Formatieren einer bereits geprüften Belegliste. Lassen Sie jede folgenreiche Aussage bis zur Quelle zurückverfolgen. Übergeben Sie die ungelöste Entscheidung mit demselben Quellenpaket und einer ausdrücklichen Frage an Opus. Bezahlen Sie keine vollständige Neufassung, wenn die eigentliche Unsicherheit eine einzige Annahme betrifft.

Oft wird die Informationsübergabe übersehen. Sonnet 5.5 und Opus 5.5 können die Thinking-Blöcke des jeweils anderen Modells in keiner Richtung lesen. Bewahren Sie den vollständigen API-Verlauf entsprechend der Dokumentation auf, geben Sie dem empfangenden Modell aber eine ausdrückliche Zusammenfassung der Fakten, Entscheidungen und offenen Punkte.[5] Eine Übergabe sollte Belege übertragen, die auch ein Mensch prüfen kann.

Tabellenextraktion: Ein gültiges Format ist nur die erste Prüfung

Ein dritter Ablauf überführt Rechnungen, Tabellen oder Betriebsdaten in strukturierte Datensätze. Anthropics strukturierte Ausgaben nutzen output_config.format; strikt geprüfte Werkzeugeingaben nutzen strict: true. Unterstützte Objektschemata verlangen additionalProperties: false.[6] Diese Vorgaben begrenzen das Format. Sie beweisen nicht, dass ein extrahierter Betrag zum richtigen Zeitraum gehört.

Definieren Sie Felder für Fundstelle, Währung, Zeitraum, Wert und ungeklärte Mehrdeutigkeit. Lassen Sie fehlende Werte fehlen. Berechnen Sie Summen mit Code erneut und vergleichen Sie sie mit dem Quelldokument. Geben Sie dem Agenten bei einer dichten visuellen Tabelle eine Möglichkeit, den relevanten Ausschnitt zu untersuchen, statt von einem einzigen Screenshot jedes Detail zu erwarten.

Ein vorgeschlagener Extraktionsprompt:

Extrahiere die beigefügte Tabelle in das vorgegebene Schema.
Speichere Währung und Berichtszeitraum bei jedem Wert.
Verwende null für fehlende Daten; leite niemals eine nicht berichtete Zahl ab.
Gib für jeden Datensatz die belegende Seite und Zeile an.
Kennzeichne widersprüchliche Summen vor dem Schreiben der endgültigen Arbeitsmappe zur Prüfung.

Beginnen Sie den Denkschritt mit adaptivem Thinking bei high. Prüfen Sie anschließend, ob eine günstigere Stufe dieselben Abstimmungskriterien erfüllt. Behandeln Sie max_tokens, refusal und model_context_window_exceeded in der Anwendung als unterschiedliche Ergebnisse, nicht als austauschbare leere Antworten.[7]

API-Einrichtung: Vor der Integration eine kleine Anfrage senden

Die Modell-ID der nativen Claude API lautet claude-sonnet-5-5. Adaptives Thinking ist standardmäßig aktiv; die niedrigste Thinking-Einstellung heißt between_tools. Das alte disabled wird abgelehnt. between_tools akzeptiert nur low, medium oder high. Lesen Sie Antworten anhand des Blocktyps und erhalten Sie Thinking-Blöcke in Werkzeugschleifen unverändert.[8]

Installieren Sie das Python-SDK mit pip install anthropic in Ihrer Projektumgebung und setzen Sie ANTHROPIC_API_KEY als Umgebungsvariable auf Ihren eigenen Schlüssel. Diese Anfrage ist aus der dokumentierten API-Struktur abgeleitet. Sie wurde nicht gegen einen kostenpflichtigen Endpunkt ausgeführt:

import anthropic

client = anthropic.Anthropic()
reply = client.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=[{"role": "user", "content": "Liste Abnahmekriterien für diesen Fehlerbericht auf."}],
)
print(reply.stop_reason)
for block in reply.content:
    if block.type == "text":
        print(block.text)

Halten Sie wiederholte Anweisungen beim Prompt-Caching stabil. Sonnet 5.5 verlangt mindestens 512 Token für einen cachefähigen Präfix.[9] Messen Sie Cache-Treffer, statt die Eignung wiederholter Texte vorauszusetzen. Für einen stärker integrierten Sonnet-zu-Opus-Ablauf bietet Anthropic das Advisor-Werkzeug als Beta an. Sonnet 5.5 mit Opus 5.5 liefert verschlüsselte Beratung statt eines im Client lesbaren Beratungstextes.[10] Eine gewöhnliche, ausdrückliche Übergabe lässt sich leichter prüfen, während Sie eine Ausgangsbasis ermitteln.

Abnahme zuerst: Eskalation muss sich an Belegen orientieren

Führen Sie vor dem Wechsel des Standardmodells eine kleine Evaluierung mit repräsentativer Arbeit durch. Erfassen Sie abgenommene Ergebnisse, Wiederholungen, manuelle Korrekturen, Gesamtausgaben und Zeit bis zur Abnahme. Halten Sie Aufgabenpaket, Werkzeuge und Prüfkriterien konstant. Vergleichen Sie zunächst Effort-Stufen innerhalb von Sonnet. Testen Sie danach Opus an den Fehlern, die trotz besserer Anweisungen und funktionierender Werkzeuge bestehen bleiben.

ACHTUNG

Die entscheidenden Kosten

Eine günstigere Antwort kann teure Prüfarbeit verursachen. Bewerten Sie einen Ablauf anhand des abgenommenen Ergebnisses und des Korrekturaufwands, nicht anhand des kürzesten Protokolls oder der eindrucksvollsten Demo.

Die unbequeme Wahrheit lautet: Arbeit zu delegieren verlangt eine klare Definition von fertig. Sonnet 5.5 macht die Ausführung attraktiv; Opus eröffnet einen Weg für schwierigere Entscheidungen. Der dauerhafte Vorteil gehört dem Team, das weiß, wann die Arbeit abgeschlossen ist.

Quellen: Dokumentation und ihre Grenzen

Die hervorgehobenen Quellen liefern die zentralen Release- und Betriebsvorgaben. Dokumentation abgerufen am 29. September 2026; Herstellerangaben wurden nicht unabhängig nachgemessen.

  1. 1
    Anthropic28.09.2026
    Veröffentlichung, Preise, Produktvorgaben und Geschwindigkeitsangabe des Herstellers.
  2. 2
    AnthropicAbruf 29.09.2026
    Fünf Stufen und empfohlene Ausgangspunkte nach Aufgabentyp.
  3. 3
    AnthropicAbruf 29.09.2026
    Kontext, Ausgabelimits, Modell-ID und Wissensstand.
  4. 4
    AnthropicAbruf 29.09.2026
    Umfang, Verifikation und Werkzeuge für visuelle Eingaben.
  5. 5
    AnthropicAbruf 29.09.2026
    Modellwechsel können nicht lesbare Thinking-Blöcke entfernen.
  6. 6
    AnthropicAbruf 29.09.2026
    JSON-Vorgaben und unterstützte Schemabeschränkungen.
  7. 7
    AnthropicAbruf 29.09.2026
    Abschluss und Abbruchzustände benötigen unterschiedliche Behandlung.
  8. 8
    AnthropicAbruf 29.09.2026
    Thinking-Modi und Behandlung der Antwortblöcke.
  9. 9
    AnthropicAbruf 29.09.2026
    Der minimale cachefähige Präfix umfasst 512 Token.
  10. 10
    AnthropicAbruf 29.09.2026
    Beta-Unterstützung und verschlüsselte Beratungsergebnisse für Sonnet 5.5.

Zuletzt aktualisiert: 29. September 2026