Eine generierte Titelkarte mit dem Text „Claude Haiku 5.5 ist live“, mit dem Release-Badge „GA 7. Okt. 2026“, zwei Faktenkarten mit den Texten „Eingabe $0,10 / 1M bis zu 100K Tokens“ und „Ausgabe $0,50 / 1M bis zu 100K Tokens“ sowie eine Fußzeile mit dem Text „Ein Headline-Cut, zwei Fußnoten: 90 Prozent unter dem Schwellenwert, 50 Prozent darüber, bei etwa 30 Prozent mehr Tokens.“ Das echte OrcaRouter-Logo ist unten rechts einmontiert.
Guides & Insights

Claude Haiku 5.5 ist live für 0,10 $ pro Million Tokens: Die 75%-Behauptung und ihre zwei Fußnoten

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Anthropic hat Claude Haiku 5.5 am 7. Oktober 2026 allgemein verfügbar gemacht – für 0,10 US-Dollar pro Million Input-Tokens und 0,50 US-Dollar pro Million Output-Tokens: dieselben zwei Zahlen, die OpenAI für GPT-6 Luna berechnet, und ein Fünftel dessen, was Claude Haiku 4.5 seit 2025 kostet, als es mit 1,00 und 5,00 US-Dollar auf den Markt kam. Die Schlagzeile in Anthropics Ankündigungsbeitrag lautet, dass das neue Modell im Durchschnitt „rund 75 % weniger im Betrieb kostet" als sein Vorgänger, und das ist die Zahl, die jede Zusammenfassung seither wiederholt hat. Mitgeliefert werden zwei Fußnoten, die die meisten dieser Zusammenfassungen weggelassen haben: Unter 100.000 Tokens beträgt die Senkung 90 %, darüber 50 %, und Claude Haiku 5.5 nutzt den neueren Tokenizer, den es mit Claude 4.7 und späteren teilt, sodass derselbe Text als rund 30 % mehr Tokens als bei Claude Haiku 4.5 zählt. Die 75 % sind also eine Aussage über eine Rechnung, nicht über eine Preisliste, und für alle, deren Prompts lang sind, sind das zwei verschiedene Dinge. Die Vergleichstabelle des Anbieters selbst führt außerdem GPT-6 Luna und Claude Sonnet 5.5 als Spalten daneben auf, was die Dokumentation zum Launch ungewöhnlich leicht angreifbar macht.

Die Arithmetik hinter „75 % weniger“

Nimm zuerst die Preisliste zur Hand, denn sie ist gestaffelt. Input kostet $0,10 pro Million bis 100.000 Tokens und $0,50 pro Million darüber – das Fünffache. Output kostet $0,50 und dann $2,50. Beim Caching gilt dieselbe Staffelung: Ein fünfminütiger Cache-Write kostet $0,125 pro Million unter der Grenze und $0,625 darüber, ein einstündiger Write kostet $0,20 und $1,00, und ein Cache-Read kostet $0,01 und $0,05. Die Message Batches API gewährt 50 % Rabatt auf beide Messgrößen, und auf dem Batch-Pfad unterstützt das Modell bis zu 300.000 Output-Tokens mit dem output-300k-2026-03-24 Beta-Header.

Jetzt setzen wir den Tokenizer obendrauf, denn dort wird die plakative Behauptung interessant. Ein Prompt, der auf dem Tokenizer von Claude Haiku 4.5 90.000 Token umfasste, umfasst auf dem neuen etwa 117.000. Er hat sich nicht in der Größe geändert, aber er hat die 100.000-Token-Grenze überschritten, also wird er mit 0,50 $ pro Million Eingabe statt mit 0,10 $ abgerechnet. Bei Claude Haiku 4.5 kostete derselbe Inhalt 0,09 $ an Eingabe (1,00 $ pro Million × 0,09 Millionen). Bei Claude Haiku 5.5 kostet er 0,0585 $. Das ist eine Kürzung um 35 % – real, und weit entfernt von 90 %. Die 90%-Zahl gilt für Anfragen, die unter der Grenze bleiben, nachdem der Tokenizer sie erweitert hat, und dort liegt ein Großteil des Traffics kurzer Aufrufe: Ein Klassifizierungsaufruf mit 20.000 Token wird zu 26.000 Token, bleibt in der ersten Stufe, und dort beträgt der Eingabepreis tatsächlich ein Zehntel des früheren.

Daraus folgen drei Dinge, und es lohnt sich, sie zu trennen statt sie zu mitteln:

• Kurze Aufrufe erhalten den vollen Rabatt. Extraktion, Routing, Klassifizierung, Zusammenfassung eines Dokuments, das unter die Grenze passt – für diese gelten die 90 % bei Eingabe und Ausgabe, abzüglich der Expansion durch den Tokenizer.

• Bei langen Calls gibt es etwa ein Drittel Rabatt, nicht drei Viertel. Eine Anfrage, die nach der Re-Tokenisierung über 100.000 Tokens landet, kostet 0,50 $ und 2,50 $ pro Million — immer noch die Hälfte der Tarife von Claude Haiku 4.5, aber die Stufe, in die sie fällt, ist fünfmal so hoch wie die Stufe, mit der das Preisschild wirbt.

• Die Angabe „75 % weniger im Durchschnitt“ ist eine nach Traffic gewichtete Zahl und sie stammt von Anthropic. Sie ist die eigene Beschreibung des Anbieters für seine eigene erwartete Zusammensetzung, und Anthropic sagt ausdrücklich, dass ein Prompt unterhalb der Schwelle rund 90 % der Anfragen an den vorherigen Haiku ausmachte. Wenn Ihre Zusammensetzung nicht wie diese Zusammensetzung aussieht, wird Ihr Durchschnitt nicht wie dieser Durchschnitt aussehen – und die einzige Möglichkeit, das herauszufinden, besteht darin, Tokens in Ihrem eigenen Traffic mit dem neuen Tokenizer zu zählen, bevor Sie ein Budget festlegen.

A generated one-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' with six rows reading 'Input: $0.10 / 1M up to 100K, then $0.50', 'Output: $0.50 / 1M up to 100K, then $2.50', 'Context: 1,000,000 tokens', 'Independent score: 43 at Max effort, rank 2 of 182', 'Cost per task: $0.21', and 'Throughput: 241.9 tokens per second', with a footer reading 'Independent figures per Artificial Analysis; pricing per Anthropic.' The real OrcaRouter logo is composited bottom-right.

Was wurde sonst noch damit ausgeliefert?

Bei dem Modell geht es nicht nur um den Preis. Mehrere Details zum Start ändern, wie man Code dafür schreibt, und eines davon wird einen bestehenden Client brechen.

• Adaptives Denken ist standardmäßig aktiviert, mit einem Aufwandsregler von Niedrig bis Max und einem Standardwert von Mittel. Dies ist das erste Modell der Haiku-Klasse mit einer einstellbaren Aufwandsstufe und der wichtigste Hebel sowohl für die Qualität als auch für die Kosten pro Antwort.

• Sampling-Parameter werden abgelehnt. Das Senden einer nicht standardmäßigen temperature, top_p oder top_k gibt einen 400 zurück. Jede Migration, die diese Argumente weitergereicht hat, schlägt beim ersten Request laut fehl, statt still schlechter zu werden – was zumindest ein ehrlicher Fehlermodus ist.

• 1M-Token-Kontext und bis zu 128.000 Ausgabe-Token in der synchronen Messages API, mit einem Wissensstand von Juni 2026 und einer Zusage zur Stilllegung nicht vor dem 7. Oktober 2027.

• Fünf Plattformen am ersten Tag: die Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry und Claude Platform on AWS. Das ist ein Rollout noch am selben Tag statt der schrittweisen Verfügbarkeit, die solche Starts oft mit sich bringen.

• Auch das Tooling hat sich weiterentwickelt. Die Python- und TypeScript-SDKs von Anthropic unterstützen jetzt Computer Use und Browser Use in der Beta-Phase, und das Unternehmen hat monatliche API-Guthaben für Abonnenten von Max 5x ($100), Max 20x ($200) und Team (bis zu $500 gepoolt) hinzugefügt.

• Die Sicherheitsausrichtung ist enger, als der Preis vermuten lässt. Anthropic sagt, dass die Cyber-Schutzmaßnahmen bei Claude Haiku 5.5 restriktiver sind als bei Claude Haiku 4.5, aber weniger restriktiv als bei jüngeren Modellen – eine breitere defensive Nutzung als Claude Sonnet 5.5 erlaubt, wobei Penetrationstests weiterhin blockiert werden – und dass die Biologie-Schutzmaßnahmen denen von Claude Sonnet 5, Claude Sonnet 5.5 und Claude Opus entsprechen. Die Alignment-Bewertungen verbesserten sich in Anthropics eigener Suite in breitem Umfang gegenüber dem Vorgänger.

Was in der Tabelle des Anbieters steht, und was das unabhängige Gremium sagt

Anthropic hat eine Benchmark-Tabelle mit drei Vergleichsspalten veröffentlicht, und es lohnt sich, sie als ein Dokument darüber zu lesen, wie Anbieter argumentieren. Jede Zahl im Folgenden ist eine Anbieterangabe, erzeugt auf Anthropics eigenen Test-Harnessen, und nichts davon wurde unabhängig reproduziert; wo GPT-6 Luna auftaucht, ist es Anthropic, die ihre eigenen Evaluierungen gegen das Modell eines Wettbewerbers laufen lässt.

• Wissensarbeit — GDPval-AA v2.1 bei 1620 für Claude Haiku 5.5, gegenüber 735 für Claude Haiku 4.5, 1437 für GPT-6 Luna und 1840 für Claude Sonnet 5.5. AA-Briefcase v1.1 bei 1578, 614, 1336 und 1824.

• Computernutzung — OSWorld 2.1 offline bei 72,4 % gegenüber 15,7 %, 48,9 % und 83,9 %.

• Schlussfolgerndes Denken — Humanity's Last Exam bei 45,9 % ohne Werkzeuge und 57,4 % mit ihnen, gegenüber 10,2 % und 18,7 % für Claude Haiku 4.5 und 56,9 % und 64,5 % für Claude Sonnet 5.5.

• Agentisches Coding — Terminal-Bench 4.0 bei 39,2 % gegenüber 0,0 %, 16,4 % und 70,6 %. FrontierCode 1.1 (Main) bei 46,4 % gegenüber 42,4 % für GPT-6 Luna und 52,1 % für Claude Sonnet 5.5.

• Chartlesen — Chartography bei 46,4 % ohne Hilfsmittel gegenüber 6,4 %, 29,1 % und 61,6 %.

In dieser Tabelle gewinnt Claude Haiku 5.5 jede Zeile gegen sowohl das vorherige Haiku als auch GPT-6 Luna und verliert die meisten davon gegen Claude Sonnet 5.5 – was die ehrliche Gestalt einer kleinen Stufe ist: ein großer Generationssprung und dennoch eine Stufe unter dem Mittelklassemodell bei der schwierigsten Arbeit. Anthropic sagt im Beitrag genau das und empfiehlt Claude Sonnet 5.5 und Claude Opus 5.5 für komplexes agentisches Coding, während es das Haiku für Kompaktierung, Zusammenfassung, Klassifizierung und Subagentenrollen positioniert.

Der unabhängige Befund ist differenzierter und verlangt mehr Aufmerksamkeit. Artificial Analysis misst Claude Haiku 5.5 bei maximalem Aufwand mit 43 auf seinem Intelligence Index v4.3.2 – Platz zwei von 182 Modellen – und 241,9 Ausgabe-Tokens pro Sekunde, also schnell, wie angekündigt. Gemessen werden außerdem Kosten von 0,21 US-Dollar pro abgeschlossener Index-Aufgabe, weil das Modell beim Durchlaufen der Suite 440 Millionen Ausgabe-Tokens erzeugte, gegenüber einem Median von 100 Millionen; der Evaluator beschreibt es als sehr wortreich. GPT-6 Luna kostet bei 38 auf demselben Index 0,07 US-Dollar pro Aufgabe. Gleicher Listenpreis, dreifache Rechnung. Das ist kein Widerspruch zur Aussage des Launches – es ist dasselbe Phänomen, um das es bei der Launch-Aussage geht, nur von der anderen Seite betrachtet: Die Preisliste sagt, was man pro Token zahlt, und der Betrag, den man tatsächlich zahlt, ist Preis mal Tokens, und Claude Haiku 5.5 verbraucht davon pro Antwort mehr als seine Rivalen. Der Aufwand ist der Hebel; der Standardwert des Modells ist medium, nicht Max, und ein Team, das ihn niedriger ansetzt, wird sowohl eine kleinere Rechnung als auch einen niedrigeren Score sehen.

Es von einer Stelle aus aufrufen

Die Migrationsfrage, die dieser Start aufwirft, lautet nicht „Ist es besser?“ sondern „Was kostet mein Traffic darauf?“, und diese Antwort hängt von Ihren Prompt-Längen, Ihrer Cache-Trefferrate und der Effort-Einstellung ab, die Sie wählen. Um dorthin zu gelangen, müssen Sie Ihr eigenes Prompt-Set durch beide Generationen laufen lassen – was hinter einem einzigen Endpunkt günstig und über zwei hinweg mühsam ist.

Claude Haiku 5.5 selbst ist noch nicht im Katalog von OrcaRouter, und das klar zu sagen ist nützlicher, als etwas anderes anzudeuten. Der Rest der Anthropic-Reihe – Claude Haiku 4.5, Claude Sonnet 5.5 und Claude Opus 5.5 – ist heute alle bei uns zum Listenpreis des Anbieters abrufbar, 0 % Aufschlag weitergegeben, sodass die „Vorher“-Etappe eines Migrationstests mit demselben Schlüssel läuft, den Sie anschließend behalten würden, und eine Senkung seitens des Anbieters auf dieser Etappe bei uns am selben Tag live ist. Die „Nachher“-Etappe ist Anthropics API, bis das neue Modell eine Runtime erreicht, die wir routen. Was Ihnen der gemeinsame Endpunkt in der Zwischenzeit bietet, ist ein automatisches Failover unterhalb des Aufrufs, sodass ein neues Modell Produktionsverkehr tragen kann, ohne dass der Pfad von ihm abhängt, und die Routing-DSL für den Fall, dass die Eskalation von Haiku zu Sonnet in die Route gehört und nicht in Ihren Anwendungscode.

A screenshot of OrcaRouter's model page for anthropic/claude-haiku-4.5, showing the model card and its list pricing of $1.00 per million input tokens and $5.00 per million output tokens, captured in English.

Zwei Kundenergebnisse aus der Markteinführung sollte man eher als Hinweise denn als Beweis weiterverfolgen. Asana meldet eine Latenzreduktion von über 30 % und bis zu 2,5-mal schnellere Inferenz pro Agent-Turn; HubSpot meldet 92,8 % im Durchschnitt über drei Läufe für seine CRM-Suite; AlphaSense meldet 0,84 gegenüber 0,76 bei 400 Abfragen. Das sind vom Anbieter ausgewählte Kundenzahlen in der eigenen Ankündigung des Anbieters, und ihr Wert liegt darin, Ihnen zu sagen, welche Workloads Sie zuerst testen sollten, nicht darin, Ihnen zu sagen, was Sie bekommen werden.

Was würde das Bild verändern?

Die 75%-Zahl wird auf dieselbe Weise geklärt werden, wie jede traffic-gewichtete Anbieterbehauptung geklärt wird: durch Ihre eigene Rechnung. Was auf der unabhängigen Seite wirklich offen ist, ist die Kosten-pro-Aufgabe-Zahl. Wenn sie sich hält, während mehr Durchläufe hinzukommen, lautet die ehrliche Zusammenfassung dieses Launches, dass Anthropic die Preisliste um 80 % gesenkt und ein Modell gebaut hat, das mehr Token pro Antwort verbraucht, sodass die effektive Ersparnis real, groß, arbeitslastabhängig und selten die Zahl auf dem Plakat ist. Wenn sie mit Effort-Einstellungen und Caching sinkt, sieht die Stufe noch besser aus. Wie auch immer, die Zahl, die vor einer Umstellung zu prüfen ist: Ihre eigenen Kosten pro Aufgabe unter dem neuen Tokenizer — das ist die eine Zahl, die der Launch-Beitrag Ihnen nicht geben kann.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert