
Claude Haiku 5.5: Ein neues Token, und das Video, das Anthropic nicht gepostet hat
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Jemand tippte einen Satz in Claude Haiku 5.5 und bekam einen fertigen Launch-Film zurück. Der Prompt, der am Abend des 7. Oktober 2026 auf X gepostet wurde, lautet vollständig: „Mach ein zehnmal geileres Video für deinen Launch, das zeigt, wie gut du als Motion Designer bist.“ Die Bildunterschrift des Posts ist drei Wörter lang – „One shotted this video“ – und der Clip ist als Anhang dabei. Keine erneuten Versuche, kein Storyboard, kein Editor. Wenn das das ist, was das günstigste Modell der Claude-Reihe inzwischen leistet, ist diese Stufe kein Kompromiss mehr.
Das ist die interessante Hälfte des Launches. Die andere Hälfte ist Arithmetik, und dort steckt die eigentliche Neuigkeit: Claude Haiku 5.5kostet 0,10 $ pro Million Input-Tokens und 0,50 $ pro Million Output-Tokens für Prompts bis zu 100.000 Tokens, gegenüber Claude Haiku 4.5mit pauschal 1 $ und 5 $. Anthropos eigene Fußnote nennt das 90 % niedriger im Normalfall – und sagt dann, im selben Atemzug, dass die Zahl, mit der ein Käufer planen sollte, eher bei 75 % liegt. Beide Zahlen stimmen, und die Lücke zwischen ihnen ist das Wichtigste an dieser Veröffentlichung.
Was Anthropic am 7. Oktober zu Protokoll gab
Der Launch-Post des Anbieters und seine Preisdokumentation stimmen in der Ausgestaltung der Sache überein, und es ist ein größerer Schritt, als eine Preissenkung üblicherweise mit sich bringt.

• Preis — 0,10 $ pro Million Eingabe-Tokens und 0,50 $ pro Million Ausgabe-Tokens für Prompts mit bis zu 100.000 Tokens. Oberhalb dieser Schwelle wird dieselbe Anfrage mit 0,50 $ bzw. 2,50 $ abgerechnet. Cache-Lesevorgänge kosten 0,01 $ pro Million bis 100K und 0,05 $ darüber; Cache-Schreibvorgänge kosten 0,125 $ und 0,625 $.
• Kontext — 1 Mio. Token, bei einer maximalen Ausgabe von 128.000 Token. Das ist dasselbe Fenster und dieselbe Ausgabegrenze, die Claude Fable 5.1, Claude Opus 5.5 und Claude Sonnet 5.5 bieten – reproduziert in der günstigsten Stufe.
• Thinking — adaptives Denken mit dem Effort-Parameter, standardmäßig auf medium. Anthropic gibt an, dass dies das erste Modell der Haiku-Klasse mit einer einstellbaren Effort-Einstellung ist, was bedeutet, dass dieselbe Modell-ID kostengünstig oder sorgfältig ausgeführt werden kann, ohne irgendetwas anderes zu ändern.
• Tokenizer – der neuere Tokenizer, der auch in Claude 4.7 und späteren Versionen verwendet wird und „für denselben Text ungefähr 30 % mehr Token erzeugt“. Die Dokumentation von Anthropic besagt, dass der genaue Anstieg vom Inhalt und von der Form der Arbeitslast abhängt.
• Lebenszyklus — Wissensstichtag Juni 2026 und eine Stilllegungszusage von „frühestens am 7. Oktober 2027“.
• Verfügbarkeit — die Claude API, Amazon Web Services, Gooogle Cloud, Microsoft Azure und Claude Platform on AWS, alle gleichzeitig am ersten Tag.
Der 10x-Aufkleber und die 75%-Realität
Zehnmal günstiger ist die Zahl, die am weitesten reisen wird, und sie ist diejenige, die am ehesten an der falschen Stelle in jemandes Budgetmodell landet. Sie gilt für Prompts mit bis zu 100.000 Tokens. Haiku 5.5 hält diesen Satz nicht über das gesamte Fenster.
• Bis zu 100.000 Tokens — 0,10 $ für Eingabe und 0,50 $ für Ausgabe, gegenüber 1 $ und 5 $ bei Haiku 4.5. Das entspricht einer Senkung um 90 %, und Anthropic sagt, dass 90 % der Anfragen an das vorherige Haiku-Modell in diesen Bereich fielen.
• Über 100.000 Tokens — 0,50 $ Eingabe und 2,50 $ Ausgabe. Immer noch genau die Hälfte dessen, was Haiku 4.5 für dieselbe Anfrage berechnete, ohne Obergrenze, die erreicht werden könnte.
• Der Tokenizer – derselbe Text erzeugt etwa 30 % mehr Tokens als bei Haiku 4.5, weshalb sich die Preissenkung pro Token nicht eins zu eins in einer kleineren Rechnung niederschlägt.
• Der eigene Durchschnitt des Anbieters — Anthropic gibt die Kombination mit „rund 75 % weniger für den Betrieb“ an. Das ist dessen eigene Zahl, keine unabhängige Messung, und sie ist diejenige, die in eine Prognose gehört.
• Cache-Ökonomie — Cache-Lesevorgänge sind im üblichen Bereich von 0,10 $ auf 0,01 $ pro Million gefallen, was für jede Pipeline, die ein langes gemeinsames Präfix erneut sendet, wichtiger ist als der Eingabe-Tarif.
Die 75-%-Zahl erklärt auch etwas, das ein Leser sonst als Widerspruch lesen könnte. Die beiden Schlagzeilen-Zahlen stehen nicht im Konflikt; die eine ist eine Rate für eine Anfrageform, die andere eine gemischte Schätzung über einen realen Verkehrsmix, der die Über-100K-Minderheit und die zusätzlichen Tokens des Tokenizers einschließt. Wenn Sie Ausgaben modellieren, verwenden Sie 75 %, und prüfen Sie Ihre eigene Prompt-Längenverteilung, bevor Sie an ein besseres Ergebnis glauben.
Was die Behauptung des Videos ist und was sie nicht ist
Der Clip ist echt, der Prompt wird oben wörtlich zitiert, und der Zeitstempel – 19:49 UTC am 7. Oktober, ungefähr derselbe Tag, an dem das Modell live ging – ist überprüfbar. Die Zuordnung erfolgt zu einem einzelnen Nutzer, nicht zu Anthropic.
Diese Unterscheidung ist hier wichtig, denn Anthropics eigene Produktseite für Claude Haiku 5.5 enthält überhaupt kein eingebettetes Video: keinen Player, keine Mediendatei, nur einen Link zum YouTube-Kanal des Unternehmens. Wenn ein Launch-Film mit dem Modell erstellt wurde, hat der Anbieter das nicht gesagt. Die zutreffende Aussage ist also eng gefasst: Ein Nutzer berichtet, mit Claude Haiku 5.5 in einem Durchgang ein Launch-Video generiert und den Prompt veröffentlicht zu haben. Ob es ein einziger Durchgang war, was es gekostet hat und wie viel davon den Schnitt überlebt hat, sind alles Angaben aus einer einzigen Quelle. Behandeln Sie den Clip als Demonstration, nicht als Benchmark.
Der Grund, warum es trotzdem erwähnenswert ist, ist, dass die Videogenerierung nicht Teil der Spezifikation des Modells ist. Haiku 5.5 nimmt Text und Bilder entgegen und gibt Text zurück. Ein Motion-Design-Ergebnis in dieser Qualität deutet darauf hin, dass das Modell etwas anderes steuerte – einen codegenerierenden Pfad, eine Rendering-Pipeline, eine Tool-Schleife – statt selbst Frames zu erzeugen. Das ist eine Aussage über agentische Orchestrierung bei $0.10 Input, und das ist der eigentlich überraschende Teil.
Die Zahlen, die Anthropic veröffentlicht hat
Die Launch-Tabelle des Anbieters ist ein Vorher-Nachher-Vergleich gegen Haiku 4.5, mit GPT-6 Luna und Claude Sonnet 5.5 in denselben Spalten als Maßstab. Jede unten stehende Zahl ist ein von Anthropic selbst gemeldetes Evaluationsergebnis, ausgeführt auf dem Harness von Anthropic, und wird wiedergegeben, aber nicht unabhängig verifiziert.

• Wissensarbeit — GDPval-AA v2.1 bei 1620 gegenüber 735 von Haiku 4.5, 1437 von GPT-6 Luna und 1840 von Sonnet 5.5. AA-Briefcase v1.1 bei 1578 gegenüber 614, 1336 und 1824.
• Computernutzung — OSWorld 2.1 bei 72,4 % im Offline-Subset, gegenüber 15,7 % für Haiku 4.5, 48,9 % für GPT-6 Luna und 83,9 % für Sonnet 5.5.
• Multidisziplinäres Reasoning — Humanity's Last Exam bei 45,9 % ohne Tools und 57,4 % mit ihnen, gegenüber 10,2 % und 18,7 % für Haiku 4.5.
• Agentisches Coding — Terminal-Bench 4.0 bei 39,2 % gegenüber 0,0 %, 16,4 % und 70,6 %. FrontierCode 1.1 (Main) bei 46,4 % gegenüber 42,4 % für GPT-6 Luna und 52,1 % für Sonnet 5.5.
• Visuelles Schlussfolgern — Chartography bei 46,4 % ohne Werkzeuge, gegenüber 6,4 %, 29,1 % und 61,6 %.
Anthropic sagt auch ungewöhnlich direkt, wo die kleine Modellklasse nicht gewinnt. Im eigenen Kommentar zum Terminal-Bench-Diagramm heißt es, Sonnet 5.5 und Opus 5.5 „bleiben die bessere Wahl für komplexe agentische Coding-Aufgaben“, und Haiku 5.5 wird stattdessen für Kompaktierung, Zusammenfassung und Subagenten-Arbeit positioniert. Die Kundenstimmen im Beitrag weisen in dieselbe Richtung und enthalten denselben Vorbehalt – es sind Early-Access-Partner, die ihre eigenen Evals beschreiben, keine Audits: Asana meldet über 30 % geringere Latenz bei Aufgabenabschlüssen und bis zu 2,5-mal schnellere Inferenz pro Agenten-Turn; HubSpot meldet 92,8 % im Durchschnitt über drei Durchläufe auf einer CRM-Portal-Suite; AlphaSense meldet 0,84 gegenüber 0,76 über 400 Abfragen bei einer Workload mit etwa 8 Mio. Aufrufen pro Woche; Box meldet 11 Punkte mehr als Haiku 4.5 bei etwa halb so hoher Latenz; Rogo beschreibt einen Haiku-5.5-Subagenten, der eine Segmentumsatzzeile aus einem 10-K herauszieht; und Cognition meldet, dass Devin Fusion mit Haiku 5.5 als Sidekick einen FrontierCode-Score von 66,2 hält.
Was der unabhängige Vorstand sagt
Herstellertabellen sind Sache des Herstellers. Die erste externe Platzierung ist die nützlichere Zahl für alle, die entscheiden müssen, ob die Stufe weit genug vorangekommen ist, um eine Produktionspipeline zu ändern.

Artificial Analysis bewertet Claude Haiku 5.5 mit 43 auf seinem Intelligence Index v4.3.2 in der Max-Konfiguration des Modells; damit liegt es auf Platz zwei von 182 Modellen in dieser Rangliste und deutlich über dem Median der Rangliste von 13. Dieselbe Seite misst 242 Ausgabe-Tokens pro Sekunde – Platz neun von 182 – und Kosten von 0,21 $ pro Intelligence-Index-Aufgabe.
Zwei Dinge auf dieser Seite sind mehr wert als die Schlagzeile. Das erste ist die Geschwätzigkeit: Bei der Auswertung des Index verzeichnete Artificial Analysis 440 Millionen ausgegebene Tokens gegenüber einem Median von 100 Millionen und beschreibt das Modell als „sehr geschwätzig“. Ein Listenpreis wird pro Token berechnet, ein Modell, das ausführlich denkt, zahlt also dafür – weshalb die Kosten pro Aufgabe bei 0,21 $ liegen und nicht nahe null, und weshalb die 90-prozentige Kürzung der Eingabe nicht die ganze Geschichte ist. Das zweite ist die Effort-Leiter: Dieselbe Seite zeigt Konfigurationen von Max bis hinunter zu Low, und die von Anthropic ist medium, nicht max. Die 43 des Boards ist die Spitze dieser Leiter, nicht die Einstellung, die man bekommt, wenn man nichts tut.
Die Stufe unterhalb der Stufe ausführen, die Sie bereits aufrufen können
Claude Haiku 5.5 ist nicht im OrcaRouter-Katalog, und es wäre angebracht, das klar zu sagen, statt etwas anderes anzudeuten: Die Lücke am Starttag zwischen der Existenz eines Modells und der Möglichkeit, es zu routen, beträgt meist Tage, manchmal auch länger.
Was heute im Katalog von Anthropic steht, sind Claude Haiku 4.5, Claude Sonnet 5.5 und Claude Opus 5.5, jeweils zum Listenpreis des Anbieters, mit 0 % Aufschlag durchgereicht, sodass jede Senkung, die Anthropic vornimmt, bei uns am selben Tag ankommt, an dem sie bei ihnen ankommt. Das ist die praktische Brücke für alle, die das Subagenten-Muster jetzt ausprobieren wollen: eine Kaskade, die die Routineturns an Haiku 4.5 schickt und die schwierigen nach oben eskaliert, funktioniert schon heute unter einem Schlüssel und einem SDK, und den kleinen Teil später auf Haiku 5.5 umzustellen, ist eine Änderung der Modell-ID und keine Migration. Automatisches Failover sitzt unter den Pfaden, für die Sie sich entscheiden, sodass ein schlechter Nachmittag eines einzelnen Anbieters die Pipeline nicht mitreißt.
Wenn Sie lieber gar nicht warten möchten, ist dieselbe Input-Preisstufe von 0,10 $ bereits von GPT-6 Luna belegt,die wir tatsächlich routen und die diesen Preis bis 272.000 Tokens hält, bevor er ansteigt.
Wer sollte umziehen, und wer nicht?
Wenn Ihre Workload aus Klassifizierung, Routing, Verdichtung oder Zusammenfassung in großem Umfang besteht und Ihre Prompts unter 100.000 Token liegen, dann gilt: Die Rate ist ein Bruchteil dessen, was sie war, das Fenster ist fünfmal breiter, und mit dem Effort-Regler können Sie bei Bedarf in die andere Richtung steuern. Rechnen Sie mit etwa 75 % weniger, dann werden Sie nicht überrascht sein.
Wenn Ihre Prompts regelmäßig über 100.000 Token hinausgehen, bekommen Sie einen Nachlass von 50 % statt von 90 %, und ein Preisvergleich für tiefen Kontext ist immer noch einen Nachmittag wert — es gibt mehrere Modelle zum oder unterhalb des Über-100K-Preises dieser Stufe.
Und wenn deine Eval bei Terminal-Bench-förmiger Arbeit immer noch fehlschlägt, dann ist es nicht das Modell, das das behebt; Anthropic sagt das selbst, und die 39,2 % gegenüber den 70,6 % von Sonnet 5.5 sind der klarste Beleg im Beitrag. Die ehrliche Zusammenfassung des 7. Oktober lautet, dass die Untergrenze nützlicher Intelligenz weit gefallen ist und die Obergrenze sich überhaupt nicht bewegt hat.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
