——— aus der werkstatt

Claude

Claude Sonnet 5.5 im ersten Test: Was die Zahlen belegen und wo Anthropic selbst bremst

// ki-zusammenfassung Diesen Artikel zusammenfassen mit:

Sechs Tage nach Opus 5.5 hat Anthropic am 28. September 2026 Claude Sonnet 5.5 nachgeschoben, und wieder ist meine Nacht kürzer geworden als geplant. Mein erster Test an zwei WordPress-Plugins verlief sehr zufriedenstellend, mehr sage ich erst nach längerer Nutzung. Die Benchmark-Tabelle liest sich allerdings so gut, dass ich sie zuerst auseinandernehme, so wie ich jede neue Claude-Version erst an eigenen Projekten prüfe, bevor ich den Zahlen traue. Meine These: Für den Alltag von EPU und KMU ist Sonnet 5.5 wahrscheinlich das interessantere Modell als Opus 5.5, aber nur, wenn du die Grenze kennst, die Anthropic selbst zieht. Du weißt danach, was belegt ist, was Marketing bleibt und was du diese Woche selbst prüfen solltest. Zuerst die Frage, was überhaupt neu ist.

Kurz erklärt

Effort-Level: Ein Regler, der bestimmt, wie lange das Modell nachdenkt. Niedrig heißt schneller und weniger Tokens, hoch heißt gründlicher und teurer.

Terminal-Bench 4.0: Ein Test für agentisches Coding, bei dem ein Modell mehrschrittige Profi-Aufgaben in der Kommandozeile lösen muss.

Distillation: Der Versuch, die Fähigkeiten eines Modells über tausende Fake-Accounts im industriellen Maßstab abzusaugen und damit ein eigenes Modell zu bauen.

Claude Sonnet 5.5 kostet pro Token genauso viel wie Sonnet 5, spart aber bis zu 30 Prozent pro Aufgabe, weil es weniger Tokens und weniger Tool-Calls braucht. Bei offener Arbeit, die viel Urteilsvermögen verlangt, bleibt Opus 5.5 laut Anthropic klar vorn.

Was kann Claude Sonnet 5.5 besser als sein Vorgänger?

Laut Anthropics Ankündigung zu Claude Sonnet 5.5 generiert das Modell Output mehr als 30 Prozent schneller als Sonnet 5 und kostet bis zu 30 Prozent weniger pro Aufgabe. Der API-Preis bleibt gleich: 2 Dollar pro Million Input-Tokens, 10 Dollar pro Million Output-Tokens. Opus 5.5 liegt bei 4 und 20 Dollar. Die Ersparnis ist also keine Preissenkung, sondern Effizienz, denn das Modell braucht weniger Tokens und weniger Tool-Calls, um ans Ziel zu kommen.

Einen Kundenwert zitiert Anthropic selbst: Balyasny Asset Management maß in einer eigenen Testreihe mit 2.441 Finanzaufgaben rund 121.000 Tokens pro Antwort, wo Sonnet 5 rund 497.000 verbrauchte. Ein einzelner Kunde ist kein neutraler Maßstab. Die Richtung passt aber zu Anthropics Angabe für Low und Medium Effort: Dort schlägt Sonnet 5.5 auf mehreren Benchmarks den Bestwert von Sonnet 5 für ungefähr ein Zehntel der Kosten pro Aufgabe.

Wie belastbar sind die Benchmarks?

Auf Terminal-Bench 4.0 erreicht Sonnet 5.5 70,6 Prozent, Sonnet 5 kam auf 10,3 Prozent, Opus 5.5 auf 66,4 Prozent. Bei einem Sprung von 10 auf 70 hab ich erst mal die Stirn gerunzelt. Zwei Details relativieren das Bild: Der Opus-Wert entstand laut Fußnote bei Xhigh Effort, also an seiner Obergrenze, und in der Tabelle steht für Sonnet 5.5 gar kein Effort-Level dabei. Ich bin mir nicht sicher, wie viel vom Sprung auf Setup und Einstellungen geht und wie viel auf das Modell selbst.

Auf FrontierCode 1.1 sieht es nüchterner aus. Sonnet 5.5 kommt dort auf 46,2 Prozent bei Max und 52,1 Prozent bei Xhigh, Opus 5.5 auf 54,4 Prozent. Bei GDPval-AA, einem Test über 44 Berufe, trennen die beiden Modelle zwei Punkte (1.844 zu 1.846). Gemessen hat Artificial Analysis auf einer Vorabversion mit einem inzwischen behobenen Bug bei strukturierten Ausgaben, der die Leistung laut Anthropic eher unterschätzt.

Genauigkeits-Kosten-Vergleichsdiagramm

Zwei Punkte Abstand sind Rauschen. Aber Anthropic schreibt selbst, dass Opus 5.5 bei komplexer, offener Arbeit mit anhaltendem Urteilsvermögen klar stärker bleibt. Das ist ein ungewöhnlich ehrlicher Satz für eine Ankündigung, und ich nehme ihn ernster als jede Tabellenzeile.

Was hat Sonnet 5.5 in meinen zwei WordPress-Plugins gefunden?

Ich hab Sonnet 5.5 über den Code von zwei WordPress-Plugins laufen lassen, beide von mir gebaut. Das erste ist jünger und entstand in einer Opus-Session. Sonnet 5.5 hat dort keine Fehler gefunden. Das zweite ist wesentlich älter, und ehrlicherweise hab ich damals vergessen, das Modell umzuschalten. Es stammt also von einer älteren Sonnet-Version. Dort ist der neuen Version eine kleine Sicherheitslücke aufgefallen. Nicht weltbewegend, aber immerhin.

Was heißt das? Weniger, als es klingt. Zwei Plugins sind keine Studie, und „keine Fehler gefunden“ heißt nicht „keine Fehler vorhanden“. Das Muster kenne ich aber schon aus dem Praxistest zu Opus 5.5: Ein neueres Modell liest Code und findet, was beim Schreiben durchgerutscht ist. Ein Vorbehalt bleibt, und den nehme ich ernst. Ein Modell, das den Code eines Vorgängers prüft, teilt womöglich dessen blinde Flecken. Bei Plugins, die auf einem Live-Server laufen, ersetzt das keinen echten Security-Check. Als zusätzliches Augenpaar taugt es, und ältere Plugins vom neuen Modell nachprüfen zu lassen, macht Sinn.

Ändert Sonnet 5.5 mein Routing?

Mein Routing habe ich im Beitrag über den Modellwechsel mitten im Chat beschrieben: Fable 5 für Strategie, Opus 5 für anspruchsvolle Umsetzung, Sonnet 5 für Entwürfe, Varianten und Formatierung, Haiku 4.5 für Stückzahlen. Ob Sonnet 5.5 nur den Platz seines Vorgängers übernimmt oder in die Opus-Zone hineinwächst, kann ich nach einer Nacht nicht beantworten. Meine Arbeitshypothese: Es übernimmt den Platz.

Die zwei Plugins sprechen bisher dafür: Beim Opus-Code fand Sonnet 5.5 nichts, beim älteren Sonnet-Code eine Lücke. Für mehr Aussagekraft brauche ich mehr Material. Für Strategie bleibt ohnehin Claude Fable 5 zuständig.

Zwei Fallstricke für alle, die Sonnet per API in Workflows hängen, etwa in n8n. Erstens: Die Claude-Apps und Claude Code laufen standardmäßig auf Medium Effort, die Claude Platform auf High. Ohne bewusste Einstellung bekommst du in der API also eine andere Rechnung als im Chat. Zweitens: Wer Sonnet bisher mit ausgeschaltetem Thinking betreibt, muss laut Anthropics Migration Guide vor dem Umstieg auf claude-sonnet-5-5 die neue Einstellung between_tools setzen. Lies das vorher, nicht nachher.

Was steckt im Kleingedruckten: Cyber-Fallback und Wasserzeichen?

Sonnet 5.5 ist das erste Sonnet, das mit Cyber-Schutzmechanismen startet, wie sie bisher den stärksten Modellen vorbehalten waren. Routinearbeit wie Bugs finden und beheben bleibt frei, riskantere Cybersecurity-Anfragen fallen sichtbar auf Sonnet 5 zurück. Dazu kommen Klassifikatoren gegen Distillation und ein erweitertes Preserved Thinking, das die Denkspur an den Account bindet. Wer Konversationen zwischen Accounts verschiebt, liest vorher die Doku.

Für alle, die wie ich mit dem EU AI Act arbeiten, gibt es einen zweiten Punkt. SiliconANGLE berichtet, dass Sonnet 5.5 ein unsichtbares Text-Wasserzeichen trägt, und heise schreibt, dass alle seit Anfang September neu erschienenen Claude-Modelle es von Beginn an tragen. Auf Anthropics Produktseite zu Sonnet 5.5 hab ich dazu nichts gefunden, verlässlicher ist Anthropics Erklärung zum Text-Watermark. Technisch ist es ein statistisches Muster in der Wortwahl, keine versteckten Zeichen.

Für mich heißt das: Auf der Seite KI-Transparenz lege ich offen, dass ich Claude für Struktur, Rechtschreibung und Stilglättung nutze. Vermutlich stecken deshalb auch in diesem Text Wasserzeichen. Das ist mir eigentlich egal. Ein Wasserzeichen ist kein Brandzeichen, das man vermeiden müsste, es sagt nur, dass ein Modell beteiligt war, und das sage ich ohnehin selbst. Gespannt bin ich, wie schnell Tools auftauchen, die es zu entfernen versuchen. Erste Ansätze gibt es laut Berichten schon, ob sie das statistische Muster im Text wirklich knacken, ist aber nicht belegt. Was das für deine Pflichten heißt, hab ich im Beitrag zum Wasserzeichen bei Claude aufgedröselt: Die Markierungspflicht nach Artikel 50 Absatz 2 trifft den Anbieter, nicht dich.

Fragen zu Claude Sonnet 5.5

Über die API 2 Dollar pro Million Input-Tokens und 10 Dollar pro Million Output-Tokens, Cache-Reads kosten 0,20 Dollar. Das ist derselbe Preis wie bei Sonnet 5. Die Ersparnis von bis zu 30 Prozent pro Aufgabe kommt aus dem geringeren Tokenverbrauch.

Nein, nicht durchgehend. Bei klar umrissenen Aufgaben liegt es nah dran, etwa bei GDPval-AA mit 1.844 zu 1.846 Punkten. Bei komplexer, offener Arbeit bleibt Opus 5.5 laut Anthropic klar stärker.

Anthropic nennt keinen Termin, nur die kommenden Wochen. Das Modell ist für hohe Stückzahlen und kostensensible Anwendungen gedacht.

Was du diese Woche selbst prüfen solltest

Nimm drei Aufgaben, die du heute an Opus gibst, und lass sie einmal mit Sonnet 5.5 auf Medium laufen. Gleichwertig? Dann hast du dein Routing verbilligt. Nicht gleichwertig? Dann weißt du genau, wofür du Opus bezahlst. Ich melde mich, sobald aus meiner einen Nacht mehr geworden ist.

Hinweis zur KI-Nutzung: Themen und Thesen stammen von mir, KI hilft bei Struktur und Rechtschreibung. Redaktionelle Verantwortung bleibt vollständig bei mir. Wie dieser Blog entsteht →

Bitte bewerte meinen Blog! Danke vielmals!

about.me
Alex Januschewsky – Zertifizierter KI-Beauftragter und Werbefachmann
Alex Januschewsky

Alex Januschewsky ist Werbefachmann, zertifizierter KI-Beauftragter (ISO 42001, EU AI Act-Konformität) und Microsoft MVP Alumni. Seit 1989 in Werbung und Design aktiv, spezialisiert auf den professionellen Einsatz von Generativer KI: kreativ, strategisch, praxisnah. Seit über 30 Jahren entwickle ich Kommunikation, die nicht auf Hype setzt, sondern auf echte Wirkung. Klar, klug und mit einem tiefen Verständnis für Technologie und Sprache. In diesem Blog teile ich Ideen, Impulse und erprobtes Wissen für Unternehmer, Entscheider und KI-Enthusiasten, die mehr wollen als Schlagwörter und bunte Versprechen.

LINKEDIN

LinkedIn Newsletter

Jeden Artikel direkt in deinem LinkedIn-Feed. Kein Extra-Abo, kein Spam. Einfach folgen und du bekommst neue Beiträge automatisch.

WHATSAPP

WhatsApp Channel

Was gerade wirklich in der KI passiert, bekommst du nicht im Feed, sondern im KI-Kompass. Ich kuratiere, teste, filtere. Du bekommst nur das, was es wert ist, gelesen zu werden.

Alex Januschewsky, Prompt Rocker, wohnhaft in Salzburg, tätig in Österreich
// let's talk

Lass uns reden.

Erstgespräch kostenlos. Immer.

Du weißt noch nicht genau, wo du anfangen sollst? Gut. Genau dafür ist das Erstgespräch da. Wir klären in 30 Minuten, ob und wie KI in deinem Betrieb wirklich Sinn macht.

Kein Pitch. Keine Agenda. Nur ein ehrliches Gespräch zwischen zwei Menschen, die wissen wollen, ob es passt.

Derzeit verfügbar für neue Projekte in Österreich & DACH

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

This site is protected by reCAPTCHA and the Google Privacy Policy and Terms of Service apply.

The reCAPTCHA verification period has expired. Please reload the page.

——— digitalhandwerk radio

——— aktuelle zahlen

——— Unterstütze mich

Dir gefällt digitalhandwerk?

Ich stecke sehr viel Zeit, Geld und Herzblut in meine Webseite. Wenn dir mein Blog weiterhilft, freue ich mich riesig über eine kurze Bewertung auf Google. Es dauert nur eine Minute und hilft mir sehr, mehr Menschen zu erreichen!

Jetzt auf Google bewerten