Eine generierte Titelkarte mit dem Text „Claude Haiku 5.5: die 100K-Preisstufe“, die zwei Preiskarten zeigt — „Unter 100K Tokens: $0.10 in / $0.50 out“ und „Über 100K Tokens: $0.50 in / $2.50 out“ — mit einer nach oben weisenden Stufengrafik dazwischen und einer Fußzeile „Anthropic-Listenpreise, Oktober 2026.“ Das echte OrcaRouter-Logo ist unten rechts eingefügt.
Guides & Insights

Die eigentliche Geschichte von Claude Haiku 5.5 ist die 100K-Klippe: Was das neue Haiku jenseits von 100.000 Tokens berechnet

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Claude Haiku 5.5 erschien am 7. Oktober 2026 mit einem Schlagzeilenpreis von 0,10 US-Dollar pro Million Eingabe-Token und 0,50 US-Dollar pro Million Ausgabe-Token, und die Zahl, die überall wiederholt wurde, war die, die Anthropic selbst in der Ankündigung nannte: eine Senkung um 90 Prozent gegenüber dem Haiku-4.5-Tarif für dieselben beiden Posten. Die 90 Prozent sind echt. Sie gelten aber nur für eine Hälfte einer Dimension der Rechnung, und sobald eine Anfrage 100.000 Token überschreitet, passiert mit jedem darin enthaltenen Tarif etwas, das die Berichterstattung zum Marktstart größtenteils ausgelassen hat. In diesem Beitrag geht es um genau diese Grenze – was sie kostet, welche Workloads sie tatsächlich erreichen und warum „90 Prozent günstiger“ eine Aussage über einen Teil der Rechnung ist und nicht über Ihre Rechnung.

Die beiden Preise und wo sie wechseln

A​nthropic veröffentlicht zwei Spalten für das Modell, und die Umschaltung zwischen ihnen erfolgt anhand eines einzigen Schwellenwerts für die Größe der Anfrage und nicht anhand einer Modelleinstellung, die Sie wählen:

• Kurzstufe, bei oder unter 100.000 Tokens — 0,10 $ pro Million Eingabe-Tokens, 0,50 $ pro Million Ausgabe-Tokens (A​nthropic-Liste) • Langstufe, über 100.000 Tokens — 0,50 $ pro Million Eingabe-Tokens, 2,50 $ pro Million Ausgabe-Tokens (A​nthropic-Liste) • Cache-Lesevorgänge — 0,01 $ pro Million (Kurzstufe) und 0,05 $ pro Million (Langstufe) • Batch-API — 50 Prozent Rabatt auf beide Spalten, und eine maximale Ausgabelänge von 300.000 Tokens • Standard-Ausgabemaximum — 128.000 Tokens, mit einem Kontextfenster von 1 Million Tokens in beiden Stufen

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing Input price (under 100K): $0.10 per million, Output price (under 100K): $0.50 per million, Input price (over 100K): $0.50 per million, Output price (over 100K): $2.50 per million, Context window: 1,000,000 tokens, AA Index: 43.4, with the footer 'Anthropic list prices; AA Index per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.

Das sind die von A​nthropic selbst veröffentlichten Preise, keine gemessenen, und sie sind die aktuelle Liste: Die Preisgestaltung für ein so neues Modell hatte noch keine Zeit, sich zu ändern, obwohl A​nthropic nicht verpflichtet ist, sie beizubehalten.

Liest man diese vier Zahlen der Reihe nach, ist die Gestalt der Sache offensichtlich. Jeder Preis in der Langkontext-Stufe ist genau fünfmal so hoch wie der Kurzkontext-Preis, und der Schwellenwert ist für alle auf einmal derselbe: 100.000 Token. Es gibt keine allmähliche Kurve, keine Interpolation, kein Zwischenband – eine Anfrage mit 99.000 Token und eine Anfrage mit 101.000 Token unterscheiden sich bei jedem Token in der Rechnung um den Faktor fünf, nicht nur bei den 2.000 Token, die die Grenze überschritten haben. Das ist der Teil, der daraus eine Klippe statt einer Steigung macht, und es ist der Teil, den die Formulierung „90 Prozent günstiger“ nicht sehen kann.

A screenshot of Anthropic's Claude Platform Docs pricing page, showing the model pricing table and the per-model rate columns for the Claude line, captured in English.

Warum der Schnitt größer aussieht, als er ist

Gegenüber Haiku 4.5, dem von Anthropic angestellten Vergleich, ist die kurze Tarifstufe eine echte Reduzierung um 90 Prozent, sowohl beim Input als auch beim Output – Haiku 4.5 kostete 1,00 $ und 5,00 $ pro Million für dieselben beiden Spalten. Die lange Tarifstufe ist eine andere Geschichte: 0,50 $ und 2,50 $ gegenüber denselben 1,00 $ und 5,00 $ sind eine Kürzung um 50 Prozent, nicht um 90 Prozent. Die ehrliche Fassung der Aussage zur Markteinführung lautet also, dass Claude Haiku 5.5 unter 100.000 Tokens 90 Prozent günstiger als Haiku 4.5 ist und darüber 50 Prozent günstiger, was genau die Aufteilung ist, die Anthropics eigene Dokumentation angibt, sobald man beide Spalten statt nur einer liest. Die einzelne Prozentangabe ist nicht falsch; sie ist die Prozentangabe der kurzen Tarifstufe, präsentiert ohne ihre Bedingung.

Es gibt eine zweite Sache, die in die entgegengesetzte Richtung zieht, und sie ist die interessantere, weil sie leicht zu übersehen und schwer zu umgehen ist. Claude Haiku 5.5 kommt mit einem neuen Tokenizer, und Anthropics eigene Vorgaben setzen die Token-Anzahl für einen gegebenen Text etwa 30 Prozent höher an, als Haiku 4.5 sie für denselben Inhalt erzeugte. Was auch immer Sie pro Token zahlten, fiel, und was Sie pro Token *Ihres* Textes zahlen, stieg um etwa ein Drittel, relativ zur Abrechnung des alten Modells. Anthropics angegebene Nettozahl, dass das Modell im Durchschnitt etwa 75 Prozent günstiger zu betreiben ist, rechnet dies bereits ein – eine Listenpreissenkung um 90 Prozent abzüglich einer Token-Inflation von rund 30 Prozent landet bei Kurzkontext-Traffic in diesem Bereich –, aber die beiden Effekte sind trennbar und es lohnt sich, sie zu trennen. Die Preisbewegung ist eine Listenpreisänderung, die man von einer Seite ablesen kann; die Tokenizer-Änderung verändert, wie viele Einheiten dieses Preises Ihre bestehenden Prompts verbrauchen, und sie zeigt sich in Ihren eigenen Token-Zahlen, bevor sie irgendwo sonst auftaucht.

Für eine Arbeitslast, die bereits bequem unter 100.000 Tokens pro Aufruf lag, ist der praktische Effekt eine schlichte Senkung der Kosten pro Aufruf, die teilweise durch den Tokenizer ausgeglichen wird. Bei einer, bei der das nicht der Fall war, läuft die Rechnung auf der langen Hälfte zweimal in die andere Richtung.

Was lebt eigentlich oberhalb von 100.000 Tokens?

Der Reflex ist, Long-Context-Preisgestaltung unter „Agentic Coding und RAG, nicht wir“ abzulegen. Das ist zu voreilig, denn die 100.000-Token-Grenze ist eine Pro-Anfrage-Grenze, und die Größe pro Anfrage ist nicht dasselbe wie die Aufgabengröße. Ein paar Muster überschreiten sie routinemäßig:

• Ein Agent, der die Codebasis liest und einen großen Arbeitssatz über eine Sitzung hinweg im Kontext hält, statt ihn bei jedem Schritt erneut abzurufen

• Dokument- und Vertragsanalyse, bei der die Eingabe aus einem langen PDF plus eigenen Anweisungen und Few-Shot-Beispielen besteht – die Art von Prompt, die bereits 60.000 Token umfasste, bevor überhaupt jemand die Beispiele hinzufügte

• Ingestion-Pipelines, die viele kleine Elemente in einem einzigen Aufruf bündeln, um den Overhead pro Aufruf zu amortisieren, und dabei den gesamten Batch über die Schwelle treiben

• Chat-Produkte, die eine vollständige Gesprächshistorie inline beibehalten, statt sie zusammenzufassen, wobei die Anfrage monoton wächst, bis etwas sie abschneidet

• Audio- und Langvideo-Eingaben im Transkriptionsstil – also genau der Traffic, für den ein Fenster mit 1 Million Token beworben wird

Das Kontextfenster von 1 Million Tokens ist der Teil des Datenblatts, der die Klippe überhaupt erwähnenswert macht. A​nthropic verkauft die Fähigkeit, dem Modell eine sehr große Anfrage zu übergeben, und die Preisgestaltung ist so aufgebaut, dass die letzten 900.000 Tokens dieser Anfrage fünfmal so viel kosten wie die ersten 100.000. Beide Fakten sind bewusst so gesetzt; sie werden nur an unterschiedlichen Stellen bekannt gegeben. Wenn das Langkontextfenster überhaupt der Grund ist, warum Sie sich dieses Modell ansehen, dann ist die Langkontext-Spalte Ihre Spalte, und die Launch-Prozentzahl gehört jemand anderem.

Der Druck, den der Preis auf das Flash tier ausübt

Anthropics erklärtes Ziel hinter dem Modell ist es, das kostengünstige, auf hohen Durchsatz ausgelegte Ende des Stacks zu besetzen, und die Preisliste spiegelt diese Absicht deutlich wider. Bloombergs Berichterstattung über den Launch stellte es als eine Verteidigung von Anthropics günstigerer Position gegenüber billigeren Open-Weight-Konkurrenten dar, und die Darstellung von Anbieterseite ging noch weiter – dass das neue Haiku so bepreist ist, dass es seine direkten Rivalen um ein gutes Stück unterbietet.

Der Vergleich ist nur in der kurzen Tarifstufe eindeutig, wo 0,10 $ und 0,50 $ aggressiv niedrig sind. Oberhalb von 100.000 Tokens unterbieten die Tarife von 0,50 $ und 2,50 $ niemandes Kurzstufe mehr; es sind gewöhnliche Zahlen der mittleren Stufe. Die Behauptung des Anbieters von der „breiten Marge" ist eine Aussage über die erste Spalte der Preistabelle, und A​nthropic ist berechtigt, sie dort zu treffen – es ist eine zutreffende Lesart der Zahlen, die das Unternehmen veröffentlicht. Sie ist keine Aussage darüber, was eine Long-Context-Workload kostet, und sollte nicht als eine solche zitiert werden.

Der Rest des Modells, kurz gefasst

Claude Haiku 5.5 behält die Funktionen, die in der Sonnet- und Opus-Linie eingeführt wurden, anstatt sie für die Größenklasse zu beschneiden. Adaptives Denken mit einer standardmäßigen Aufwandsstufe Medium ist vorhanden, und es ist das erste Modell in der Haiku-Klasse mit einem verstellbaren Aufwandsregler, der von Low bis Max reicht. Der Knowledge-Cutoff ist Juni 2026 und die Modell-ID lautet claude-haiku-5-5. A​nthropic gibt ein Auslaufdatum nicht vor dem 7. Oktober 2027 an – dasselbe Datum wie die Veröffentlichung, ein Jahr später – und das Modell ist neben A​nthropics eigener API auf Amazon Bedrock, G​oogle Cloud und Microsoft Azure gelistet.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', with an Intelligence Index of 43.395, speed #10 of 182, and a cost comparison block showing $0.10 input.

Auf der Benchmark-Seite trägt alles im Launch-Post dieselbe Herkunftskennzeichnung und verdient sie auch: Es handelt sich um vom Anbieter gemeldete Zahlen, gemessen von dem Unternehmen, das das Modell verkauft, wobei zum Zeitpunkt des Verfassens keine unabhängige Reproduktion veröffentlicht wurde.

• GDPval-AA v2.1 — vom Anbieter gemeldet 1.620 für Claude Haiku 5.5, gegenüber 735 für Haiku 4.5 im selben Testaufbau

• AA-Briefcase v1.1 — laut Anbieter 1.578, gegenüber 614 für die vorherige Generation

• OSWorld 2.1 — vom Anbieter angegeben 72,4 Prozent, gegenüber 15,7 Prozent

• Terminal-Bench 4.0 — vom Anbieter angegeben 39,2, gegenüber 0,0

• Humanity's Last Exam — vom Anbieter angegeben 45,9 Prozent bzw. 57,4 Prozent bei Tool-Nutzung

Die Größe dieser Deltas ist der Grund, sie zu kennzeichnen statt sie zu zitieren. Ein Sprung von 15,7 auf 72,4 in einem OS-Agent-Benchmark, der vom eigenen Anbieter des Modells gemessen wurde, ist eine Zahl, die man mit Vorsicht behandeln sollte, bis ein Dritter denselben Harness ausführt. Artificial Analysis hat mit Stand Anfang Oktober 2026 einen eigenen Index für das Modell veröffentlicht – einen unabhängigen Wert von 43,395, mit 0,329 bei Terminal-Bench Hard und 0,444 bei HLE – und dieser Datensatz ist derjenige, den man anführen sollte, wenn die Behauptung einer Prüfung standhalten muss. Die Anbieterzahlen und die unabhängigen Zahlen stehen nicht im Widerspruch; sie stammen einfach aus unterschiedlichen Harnesses, und sie in einem Satz zu vermischen, führt dazu, dass ein Blogbeitrag am Ende behauptet, eine Anbieter-Evaluierung sei eine Tatsache.

Der Infrastrukturhinweis, da wir eine betreiben.

Anthropic verkauft Claude Haiku 5.5 über die eigene API sowie über Bedrock, Google Cloud und Azure. Wenn Sie entscheiden, welchen dieser Wege Sie ansprechen, oder wenn Sie es neben die anderen Modelle stellen, die bereits in Ihrem Stack sind, beachten Sie: Der Listenpreis des Anbieters ist überall derselbe, wo es verkauft wird, und OrcaRouter ist darauf ausgelegt, diesen Listenpreis ohne Aufschlag weiterzugeben — eine Anthropic-Preisänderung für dieses Modell ist bei uns also noch am selben Tag aktiv statt mit Verzögerung. Unser Katalog führt außerdem qwen/qwen3.8-flash zu $0.15 und $0.47 pro Million und z-ai/glm-5.3-flash zu $0.15 und $0.50 — das Paar, das am häufigsten in dem Platz neben einem Modell der Haiku-Klasse landet, mit demselben Schlüssel und derselben Abrechnung — das, was einen gemischten Stack einen Vertrag statt drei kosten lässt. Claude Haiku 5.5 selbst bieten wir nicht an; dafür wenden Sie sich direkt an Anthropic.

Eine praktische Konsequenz aus dieser Klippe, wenn Sie mehr als ein Modell routen: Die Grenze von 100.000 Token ist eine Stelle, an der eine Anfrage, die früher günstig war, teuer wird, ohne dass sich an der Anfrage irgendetwas Wesentliches ändert. Wenn Ihre Routing-Schicht ein Failover beherrscht, besteht die sinnvolle Ausgestaltung darin, Verkehr mit langem Kontext auf das Modell zu lenken, das oberhalb der Schwelle tatsächlich günstig ist, und Verkehr mit kurzem Kontext auf dasjenige fallen zu lassen, das unterhalb davon günstig ist – statt anzunehmen, der Listenpreis eines einzigen Modells gelte für beide.

Was man aus dem Launch mitnehmen kann

Die Preissenkung ist real und sie ist groß – unter 100.000 Tokens. Das Modell ist das erste Haiku mit einem vollständig ausgelieferten Funktionsumfang und einem Effort-Dial, was für den agentischen Einsatz mehr zählt als der Preis. Die Benchmark-Deltas stammen vom Anbieter und sollten bei jeder Wiederholung auch so gekennzeichnet werden. Und die Preisliste enthält bei 100.000 Tokens eine Stufe, die jede Rate mit einem Schlag verfünffacht – und genau das ist das Einzige an diesem Launch, das jemand, der Ihren Stack liest, statt die Pressemitteilung, am meisten wissen muss, bevor das Token-Budget des nächsten Sprints festgelegt wird.

Wenn Sie die Rechnung anhand Ihres eigenen Verkehrs prüfen möchten, sind die beiden Zahlen, die Sie heranziehen müssen, das 95. Perzentil Ihrer Anfragegröße und Ihr Ausgabenanteil für Anfragen über 100.000 Token. Wenn die erste unter der Grenze liegt, gelten die 90 Prozent für Sie, und die Berichterstattung zum Launch hatte mit Ihrer Situation recht. Wenn die zweite einen nennenswerten Teil der Rechnung ausmacht, ist die Zahl, die zählt, die 50, und es lohnt sich, die Kostenschätzung für dasjenige Modell im Stack, das Sie gewählt haben, unter der Annahme der 90 erneut durchzuführen.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert