
Claude Haiku 5.5 vs. Claude Haiku 4.5: Die 90-prozentige Preissenkung ist keine 90-prozentige Ersparnis
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Claude Haiku 5.5 kostet 0,10 $ pro Million Eingabe-Tokens und 0,50 $ pro Million Ausgabe-Tokens bei Prompts bis zu 100.000 Tokens. Claude Haiku 4.5 kostet pauschal 1 $ und 5 $ für das gesamte 200.000-Token-Fenster, das es schon immer hatte. Anthropic beziffert den Unterschied in einer Fußnote mit „90 % weniger" und im Satz darüber mit „etwa 75 % weniger Betriebsaufwand" – und die elf Monate, die zwischen den beiden Modellen liegen, sind genau der Abstand zwischen diesen beiden Zahlen.
Das ist kein Marketingtrick. Es ist die ehrliche Form einer Modellgeneration, die ihren Tokenizer, ihre Standard-Denkeinstellung und ihr Kontextfenster zugleich mit ihrem Preis geändert hat, und es bedeutet: Wer die Modell-ID austauscht und erwartet, dass die Rechnung um den Faktor zehn sinkt, wird eher von der Arithmetik als vom Produkt enttäuscht werden.
Beide Modelle, wie ausgeliefert
Alles Folgende gilt pro Million Tokens, in US-Dollar, und wurde, sofern nicht anders gekennzeichnet, der eigenen Preis- und Modelldokumentation von Anthropic vom 2026-10-08 entnommen.

• Eingabe — Claude Haiku 5.5 $0,10 bis zu 100.000 Token, darüber $0,50; Claude Haiku 4.5 $1,00 unabhängig von der Länge.
• Ausgabe — Claude Haiku 5.5: 0,50 $ bis zu 100.000 Tokens, 2,50 $ darüber; Claude Haiku 4.5: 5,00 $ unabhängig von der Länge.
• Cache-Lesevorgänge — Claude Haiku 5.5: 0,01 $ für bis zu 100.000 Tokens und 0,05 $ darüber; Claude Haiku 4.5: 0,10 $. Cache-Schreibvorgänge — 0,125 $ und 0,625 $ gegenüber 1,25 $.
• Kontext — 1 Mio. Tokens gegenüber 200.000. Maximale Ausgabe — 128.000 Tokens gegenüber 64.000.
• Denken — Claude Haiku 5.5 ist adaptiv und standardmäßig aktiviert, mit einem Effort-Regler, der standardmäßig auf medium steht; Claude Haiku 4.5 verwendet die ältere manuelle Form und hat überhaupt keinen Effort-Parameter.
• Unabhängige Bewertung – Artificial Analysis Intelligence Index v4.3.2 platziert Claude Haiku 5.5 (Max) mit 43,40 auf Platz zwei von 182 Modellen und Claude 4.5 Haiku mit 16,88 auf Platz dreißig von 61 – wobei der Evaluator den 4.5-Wert als geschätzt kennzeichnet.
• Geschwindigkeit — dieselbe Quelle misst 242 Ausgabe-Token pro Sekunde für Claude Haiku 5.5 gegenüber 89,7 für die 4.5-Generation, was der einzige Bereich ist, in dem das alte Modell noch komfortabel aussieht.
Wo die Geschichte vom Zehntelpreis zerbricht
Drei Dinge schmälern den Einschnitt, und nur das erste davon ist Anthropics eigene Warnung.
Der Tokenizer ist der große Punkt. Claude Haiku 5.5 verwendet den neueren Tokenizer, der mit Claude 4.7 eingeführt wurde, und Anthropics Dokumentation besagt, dass derselbe Text „ungefähr 30 % mehr Tokens zählt als bei Claude Haiku 4.5“. Sie zahlen nicht ein Zehntel des Tarifs für dieselbe Anzahl von Tokens; Sie zahlen ein Zehntel des Tarifs für ungefähr 1,3-mal so viele Tokens. Der eigene Migrationsleitfaden des Anbieters macht dies zum zweiten Punkt seiner Checkliste, noch vor jeder Codeänderung: Zählen Sie Ihre Prompts neu und sehen Sie sich dann max_tokens und Ihre Kostenschätzungen erneut an.
Thinking-Tokens werden als Ausgabe-Tokens abgerechnet, und Claude Haiku 5.5 denkt standardmäßig. Die Launch-Seite von Anthropic sagt ausdrücklich, dass das Modell in den Charts für sich genommen „sehr geschwätzig“ ist, und die unabhängige Messung untermauert das schärfer als der Anbieter selbst: Bei der Auswertung des Intelligence Index verzeichnete Artificial Analysis 440 Millionen Ausgabe-Tokens von Claude Haiku 5.5 gegenüber einem modellübergreifenden Median von 100 Millionen und stufte das Modell als sehr geschwätzig ein. Ein günstiger Input-Tarif hilft einer Workload nicht, bei der der Großteil der Rechnung auf Output entfällt.
Die 100.000-Token-Stufe ist die dritte. Darüber liegen die Tarife bei 0,50 $ und 2,50 $ — die Hälfte dessen, was Claude Haiku 4.5 für dieselbe Anfrage berechnete, was ein guter Deal ist und nicht der Deal, von dem die meisten Leser gelesen haben werden. Anthropic sagt, Prompts unterhalb der Schwelle hätten rund 90 % der Anfragen an das vorherige Haiku-Modell ausgemacht, was die Zahl ist, die den Einschnitt als Schlagzeile verkraftbar macht; es ist außerdem die eigene Traffic-Zusammensetzung des Anbieters, nicht Ihre.

Was dieselbe Frage die beiden Modelle kostet
Die Kosten pro abgeschlossener Aufgabe sind die Kennzahl, die alle drei oben genannten Effekte übersteht, weil sie dem Modell alles in Rechnung stellt, was es ausgegeben hat, nicht nur das, was Sie ihm geschickt haben.
Artificial Analysis gibt für Claude Haiku 5.5 (Max) 0,21 $ pro Aufgabe im Intelligence Index an — den Wert, den es zusammen mit einem Eingabe-Tarif von 0,10 $ und einem Ausgabe-Tarif von 0,50 $ veröffentlicht. Für die 4.5-Generation veröffentlicht es überhaupt keinen Kosten-pro-Aufgabe-Wert; die Kachel zeigt „unknown“, weil das Modell nie in einer Reasoning-Konfiguration auf dem Index ausgeführt wurde. Was die Seite jedoch veröffentlicht, ist eine reine Preisauszeichnung von 1,00 $ und 5,00 $ sowie ein abweichender, niedrigerer gemessener Score.
Der ehrliche Vergleich für einen Käufer ist also nicht das Zehnfache bei Tokens, sondern eher Folgendes: ein Zehntel der Input-Rate bei 30 % mehr Tokens, die Hälfte der Output-Rate, wenn Sie 100K überschreiten, und ein Modell, das pro Antwort mehr Output-Tokens verbraucht als sein Vorgänger – gegenüber einem Fähigkeitssprung von 16,88 auf 43,40 auf demselben unabhängigen Board. Die 75-%-Zahl, die Anthropic für durchschnittliche Arbeitslasten nennt, ist die vernünftige Planungsgröße. Sie ist außerdem eine gemischte Anbieterschätzung über einen Traffic-Mix, den Sie nicht kontrollieren.
Die Migration ist kein Modell-ID-Austausch
Anthropics Migrationsleitfaden umfasst zehn Punkte für alle, die von Claude Haiku 4.5 wechseln, und mehrere davon sind keine Ratschläge, sondern harte Fehler.
• Manuelles Denken funktioniert nicht mehr — thinking: {"type": "enabled", "budget_tokens": N} gibt einen Fehler zurück. Adaptives Denken ersetzt es, und thinking.display muss auf "summarized" gesetzt werden, wenn du den Denkprozess überhaupt sehen möchtest.
• Sampling-Parameter brechen — temperature, top_p und top_k müssen alle aus der Anfrage entfernt werden.
• Assistant-Prefill bricht ab — eine Konversation, die auf einen Assistant-Turn endet, gibt einen Fehler zurück; lassen Sie sie auf einen User-Turn enden.
• Änderungen der Blockreihenfolge — eine Antwort kann mit Thinking-Blöcken beginnen, daher muss Code, der den ersten Inhaltsblock als Antwort liest, stattdessen nach Typ auswählen.
• Ablehnungen sind neu — das Modell führt Sicherheitsklassifikatoren aus und kann stop_reason: "refusal" zurückgeben, und es gibt keinen serverseitigen Fallback.
• Replay ist eingeschränkt — Thinking-Blöcke funktionieren nur in dem Konto, das sie erzeugt hat, oder in einem damit verknüpften Konto.
• Priority Tier wird nicht übernommen – Organisationen mit einer Priority-Tier-Verpflichtung für Claude Haiku 4.5 müssen ihre Kapazität separat planen, da der Tier für Claude Haiku 5.5 nicht unterstützt wird.
Zwei davon verdienen mehr Aufmerksamkeit als der Rest. Der Stop-Grund „refusal“ ist eine Änderung des Kontrollflusses in jeder Schleife, die davon ausging, dass jede Antwort Inhalt hat, und die an das Konto gebundenen Thinking-Blöcke brechen jede Warteschlange, die Konversationen speichert und sie über einen Pool von Zugangsdaten erneut abspielt. Keines von beiden zeigt sich vor der Produktion.
Beide Stufen unter einem Schlüssel betreiben
Die praktische Frage für die meisten Teams ist nicht, welches dieser beiden Modelle besser ist, denn die Antwort hängt ganz davon ab, welchen Aufruf man gerade macht. Sie lautet, ob sich die kostengünstige Stufe einer Kaskade unabhängig von allem um sie herum aufrüsten lässt.
Claude Haiku 4.5 ist ab heute im OrcaRouter-Katalog zum Listenpreis von Anthropic ohne Aufschlag verfügbar, sodass der Tarif des Anbieters direkt weitergegeben wird und jede Änderung, die Anthropic daran vornimmt, am selben Tag bei uns sichtbar ist. Claude Sonnet 5.5 und Claude Opus 5.5 sind ebenfalls dort, was bedeutet, dass sich eine zweistufige Pipeline – kleines Modell für die routinemäßige Mehrheit, größeres Modell für die Eskalation – jetzt aufbauen lässt mit einem Schlüssel, einem SDK und automatischem Failover darunter, und der kleine Teil lässt sich später auf Claude Haiku 5.5 umstellen, als Änderung der Modell-ID statt als Neuschreibung.
Claude Haiku 5.5 ist noch nicht im Katalog, und es lohnt sich, das klar zu sagen, statt es nur implizit zu lassen. Eine Lücke am Starttag zwischen der Auslieferung eines Modells und der Möglichkeit, ein Modell zu routen, ist normal und kein Versprechen darüber, wann sie sich schließt; die Modelle, die heute Morgen von uns aus aufrufbar sind, sind die oben genannten.

Wer sollte wechseln, und welcher Anruf sollte zuerst umgeschaltet werden?
Wenn Ihr Haiku 4.5-Traffic aus Klassifizierung, Extraktion, Routing, Komprimierung oder Zusammenfassung mit Prompts unter 100.000 Tokens besteht, wechseln Sie – die Rate beträgt ein Zehntel, das Fenster ist fünfmal breiter, und der Effort-Regler gibt Ihnen einen Kostenhebel, den das alte Modell nie hatte. Planen Sie etwa 75 % weniger Budget ein und gleichen Sie dies nach einer Woche mit Ihren eigenen Token-Zählungen ab.
Wenn Ihre Prompts regelmäßig 100.000 Tokens überschreiten, erhalten Sie einen Nachlass von 50 % statt 90 %, und die zweite Stufe verändert den Vergleich so, dass sich ein Preisvergleich lohnt: Der Ausgabepreis von 2,50 $ für über 100K liegt über dem, was mehrere konkurrierende kleine Modelle für das gesamte Kontextfenster verlangen.
Und wenn Sie Haiku 4.5 verwenden, weil es die einzige günstige Option war, die in ein Dokument mit 200.000 Tokens passte, dann beachten Sie, was sich geändert hat. Das Fenster umfasst jetzt eine Million Tokens, was ein anderes Produkt ist, und der Grund für das alte Modell ist stillschweigend verschwunden – zusammen mit dem Grund, warum es günstig war.
