
Claude Haiku 5.5 zielte auf Chinas Flash-Tier ab. Nur die Hälfte dieser Behauptung hält einer genaueren Prüfung stand.
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Ein auf Chinesisch schreibender Leser brachte diese Woche ein pointiertes Argument vor: Claude Haiku 5.5scheint darauf ausgelegt zu sein, den chinesischen Mittelklassemarkt zu erobern, weil esDeepSeek V4.1 Flash und GLM 5.3 Flash beim Preis unterbietet und bei Terminal Bench 4.0 sowie im Artificial Analysis Intelligence Index besser als GLM 5.3 Flash abschneidet. Das ist eine schärfere Analyse als die meisten Launch-Kommentare. Es sind außerdem zwei Behauptungen, die denselben Mantel tragen, und sie haben nicht denselben Wahrheitsgehalt.
Anthropic hat Claude Haiku 5.5 am 7. Oktober 2026 veröffentlicht – ein vollständiger öffentlicher Launch mit einer datierten Ankündigung, einer System Card und einer veröffentlichten Preisliste. Das verleiht der Behauptung etwas, was Marktkommentare aus zweiter Hand selten bekommen: Zahlen, die man überprüfen kann.
Das folgende Audit stellt fest, dass die eine Hälfte stärker ist, als der Leser sagte, und die andere Hälfte bei dem spezifischen Benchmark, den es zitiert, falsch liegt. Beide Befunde sind wissenswert, weil sie in entgegengesetzte Richtungen weisen.
Die Behauptung, präzise formuliert
In seine Bestandteile zerlegt, besteht das Argument aus drei Teilen.
• Preis — Claude Haiku 5.5 ist günstiger als DeepSeek V4.1 Flash und günstiger als GLM 5.3 Flash.
• Unabhängige Punktzahl — sie liegt im Artificial Analysis Intelligence Index etwa einen Punkt über GLM 5.3 Flash.
• Coding-Benchmark — zudem erzielt er einen Punkt mehr als GLM 5.3 Flash auf Terminal Bench 4.0.
Zwei davon sind anhand veröffentlichter Tabellen überprüfbar und halten stand, mit Anpassungen. Das dritte ist anhand derselben Tabelle überprüfbar und fällt anders aus als beschrieben.

Die Preishälfte: wahr, und in die eine Richtung untertrieben, in die andere übertrieben.
Die von Anthropic veröffentlichten Preise für Claude Haiku 5.5 betragen 0,10 $ pro Million Eingabe-Token und 0,50 $ pro Million Ausgabe-Token bei einem Prompt von bis zu 100.000 Token; oberhalb dieser Schwelle steigen sie auf 0,50 $ bzw. 2,50 $. Für gecachte Eingaben kostet das Lesen 0,01 $ und das Schreiben 0,125 $. Das Kontextfenster umfasst eine Million Token; die maximale Ausgabe beträgt 128.000.
GLM 5.3 Flash von Z.ai wird mit 0,15 $ und 0,50 $ gelistet, mit gecachter Eingabe bei 0,026 $. DeepSeek V4.1 Flash wird mit 0,30 $ und 1,20 $ gelistet, mit gecachter Eingabe bei 0,006 $.
Bei der beworbenen Rate hat der Leser recht. Eine Eingaberate von 0,10 $ liegt ein Drittel unter GLM 5.3 Flash und zwei Drittel unter DeepSeek V4.1 Flash, und eine Ausgaberate von 0,50 $ entspricht genau GLM 5.3 Flash, während sie deutlich unter der Hälfte von DeepSeeks Ausgaberate liegt. Das wirkt wie eine gezielte Positionierung: die Ausgaberate des günstigeren Rivalen treffen, ihn bei der Eingabe unterbieten und das Verhältnis für sich sprechen lassen.
Besser für die Behauptung sieht es bei den gemessenen Kosten pro abgeschlossener Aufgabe aus. Im Intelligence Index v4.3.2 von Artificial Analysis belaufen sich die Kosten für die gesamte Aufgabe auf $0,21 für Claude Haiku 5.5, $0,25 für GLM 5.3 Flash und $0,27 für DeepSeek V4.1 Flash. Laut Preisliste ist Claude Haiku 5.5 beim Input 1,5-mal günstiger als GLM 5.3 Flash; die Messung zeigt, dass die abgeschlossene Aufgabe etwa um ein Sechstel günstiger ist. Damit bleibt er der günstigste der drei — nur nicht mit dem Vorsprung, den das Preisschild nahelegt.
Der Grund ist der, den die meisten Preisvergleiche auslassen. Claude Haiku 5.5 ist weitschweifig. Artificial Analysis verzeichnete 162.164 Ausgabe-Tokens dafür, während der Index lief, gegenüber 68.673 für GLM 5.3 Flash und 88.574 für DeepSeek V4.1 Flash. Anthropics eigene Dokumentation nennt einen zweiten Effekt: Das Modell verwendet den neueren Tokenizer, den es sich mit Claude 4.7 und späteren Modellen teilt, sodass derselbe Text rund 30 % mehr Tokens ergibt als bei dem Modell, das es ersetzt. Ein günstigerer Satz, auf mehr Tokens angewendet, ist ein günstigerer Satz, auf mehr Tokens angewendet.
Eine Besonderheit, die nur bei einer gerouteten Rechnung auftaucht: Unser eigener Katalog führt DeepSeek V4.1 Flash mit 0,15 $ für Input und 0,60 $ für Output auf, wobei während zwei täglicher Zeitfenster, 01:00–04:00 und 06:00–10:00 UTC, ein 2×-Multiplikator angewendet wird. Achtzehn Stunden am Tag gilt der Basispreis; sechs Stunden am Tag beträgt der Output-Preis 1,20 $. Batch-Traffic, der außerhalb dieser Fenster eingeplant werden kann, erhält einen deutlich besseren DeepSeek-Preis, als es der vom Anbieter plakativ genannte Listenpreis nahelegt, und interaktiver Traffic nicht. Wenn Sie diesen Vergleich wirklich modellieren, ist der Kalender genauso wichtig wie die Preisliste.

Die Punktzahl-Hälfte: „etwa ein Punkt“ ist 1,6
Auf dem Artificial Analysis Intelligence Index v4.3.2 wird Claude Haiku 5.5 in seiner Max-Konfiguration mit 43,40 gemessen. GLM 5.3 Flash wird mit 41,81 gemessen. DeepSeek V4.1 Flash liegt bei 39,46.
Die Indexhälfte der Behauptung ist also tendenziell richtig und rundet nach unten: Die Lücke beträgt 1,59 Punkte, nicht einen. Das ist ein echter Vorsprung bei einem Index, der in die Sechziger reicht, und es ist die Zahl, die in jeder Zusammenfassung dieses Duells zitiert wird.
Was es nicht ist, ist eine Aussage über die darunterliegenden Benchmarks. Beide Anbieter veröffentlichen ihre eigenen Evaluationssets, und es sind nicht dieselben Sets – Anthropic meldet GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 und FrontierCode für Claude Haiku 5.5; Z.ai meldet die eigene Suite für GLM 5.3 Flash. Das unabhängige Board ist die einzige verfügbare Zeile für einen Äpfel-mit-Äpfeln-Vergleich, weshalb man sich so stark auf die Indexlücke stützt und warum der nächste Abschnitt wichtig ist.
Die Coding-Hälfte: Diese hier ist ein totes Rennen, kein Sieg.
Terminal Bench 4.0 weist bei der gemeinsamen unabhängigen Messung 0,32828 für Claude Haiku 5.5 und 0,32828 für GLM 5.3 Flash auf. Identisch bis auf fünf Dezimalstellen.
Das ist die mit Abstand zitierfähigste Zahl in dieser Gegenüberstellung, und die Behauptung dazu ist falsch. Die wahrscheinlichste Ursache für die Verwechslung ist die benachbarte Zeile: Das vollwertige GLM-5.3, das Nicht-Flash-Geschwistermodell, erzielt 0,4192 auf demselben Benchmark. Wenn Sie „GLM“ und „Terminal Bench“ in einem Satz neben einer Zahl gesehen haben, die einen Punkt über Claude Haiku 5.5 liegt, dann ist das das Geschwistermodell, nicht das Flash-Modell.
Die anderen drei Zeilen, die Artificial Analysis für beide Modelle veröffentlicht, sind interessanter als das Unentschieden, und sie weisen nicht in eine Richtung:
• SciCode — 0,5498 für Claude Haiku 5.5 gegenüber 0,5162 für GLM 5.3 Flash. Ein Vorsprung von 3,4 Punkten für Anthropic.
• Humanity's Last Exam — 0,4439 gegenüber 0,3985. Ein 4,5-Punkte-Vorsprung für Anthropic.
• AutomationBench, Teilwertung — 0,3541 gegenüber 0,6037. Ein Vorsprung von 25 Punkten für GLM 5.3 Flash und mit Abstand die größte Differenz im Set.
Die letzte Zeile ist die, die Beschaffungsteams am meisten interessieren wird, denn agentische Automatisierung ist der Bereich, in dem die Mid-Tier-Modelle tatsächlich eingesetzt werden. Bei einem Maß dafür, ob das Modell eine mehrstufige Aufgabe bis zum Abschluss bringen kann, gewinnt das kostengünstiger zu betreibende Open-Weights-Modell mit einem Vorsprung, der den Indexunterschied von 1,6 Punkten in die andere Richtung in den Schatten stellt.
Die Geschwindigkeit geht genauso auseinander wie der Preis, nur noch stärker. Artificial Analysis hat für Claude Haiku 5.5 424,6 Sekunden pro Index-Aufgabe gemessen, gegenüber 1035,4 Sekunden für GLM 5.3 Flash. Anthropics Modell braucht dafür weniger als die Hälfte der Wall-Clock-Zeit, was in einem Agent-Loop eine größere operative Kennzahl ist als die Token-Rate.
Was die Behauptung vollständig auslässt
Der Vergleich wird als eine Preis-und-Punktzahl-Geschichte gerahmt, die stillschweigend die Dimension auslässt, in der sich die beiden Modelle am wenigsten ähneln. GLM 5.3 Flash hat offene Gewichte, veröffentlicht unter MIT, mit 320 Milliarden Gesamtparametern und 18 Milliarden aktiven. DeepSeek V4.1 Flash hat ebenfalls offene Gewichte mit 552 Milliarden Gesamtparametern und 16 Milliarden aktiven. Claude Haiku 5.5 ist proprietär, nur über API zugänglich, ohne veröffentlichte Parameteranzahl und ohne Repository.
Das ist für viele Käufer keine Fußnote; es ist die erste Zeile des Anforderungsdokuments. Ein Team, das Inferenz in seiner eigenen Tenancy ausführen, Fine-Tuning betreiben oder eine Modellversion über Jahre hinweg unverändert halten muss, wählt nicht einmal anhand von Indexpunkten zwischen diesen dreien — zwei der drei sind disqualifiziert, bevor die Preisspalte überhaupt gelesen wird. Die Rahmung des Lesers ist eine Beobachtung zur Marktpositionierung, und sie ist berechtigt; es ist nur so, dass der strukturelle Unterschied gegen das Modell spricht, das mit dieser Rahmung verteidigt wird.
Den Vergleich selbst durchführen
GLM 5.3 Flash und DeepSeek V4.1 Flash sind beide im OrcaRouter-Katalog zum Listenpreis des Anbieters mit 0 % Aufschlag, was die chinesische Seite dieses Vergleichs zu etwas macht, das man heute aufrufen kann, statt es in einer Tabellenkalkulation zu modellieren. Weil der Tarif durchgereicht und nicht gemischt wird, schlägt eine Preisänderung des Anbieters bei uns am selben Tag durch wie bei ihm — und das oben beschriebene kalenderbasierte DeepSeek-Fenster ist im selben Preisblock sichtbar, gegen den Sie routen würden. Ein Schlüssel, ein SDK, automatisches Failover darunter, und die Routing-DSL, wenn Sie eine Kostenobergrenze lieber in der Route als im Anwendungscode ausdrücken möchten.
Claude Haiku 5.5 ist nicht in unserem Katalog. Es ist über Anthropics eigene API erreichbar, und es ist besser, das klar zu sagen, als es unausgesprochen zu lassen.

Was der Leser richtig verstanden hat und was man damit anfangen sollte
Der Instinkt ist richtig. Wenn man die Welle billiger, leistungsfähiger chinesischer Mittelklasse-Modelle teuer aussehen lassen wollte, ist das ungefähr die Karte, die man ausspielen würde: die Output-Rate des billigeren Rivalen erreichen, seine Input-Rate halbieren, 1,6 Indexpunkte vorne landen und die Zahl für den Preis pro abgeschlossener Aufgabe das Argument tragen lassen. Claude Haiku 5.5 macht das – und ist dabei mehr als doppelt so schnell pro Aufgabe wie das Modell, auf das es abzielt.
Was der Leser falsch verstanden hat, ist enger gefasst und interessanter. Terminal Bench 4.0 ist kein Sieg; es ist ein exaktes Unentschieden. Der Preisvorteil, wenn man den gesamten Auftrag statt das Token abrechnet, beträgt etwa ein Sechstel statt des 1,5-Fachen, das die Preisliste nahelegt. Und der eine Benchmark, bei dem die beiden Modelle am weitesten auseinanderliegen, ist der agentische, bei dem GLM 5.3 Flash mit 25 Punkten führt.
Die ehrliche Version der Sache ist also diese: Claude Haiku 5.5 zielt auf die chinesische Flash-Klasse, gewinnt diesen Vergleich beim zusammengesetzten Index, bei den Kosten pro abgeschlossener Aufgabe und bei der Latenz, gewinnt ihn aber nicht bei agentischer Automatisierung oder bei Offenheit, und der spezifische Vorsprung bei Coding-Benchmarks, der das Argument entscheidend wirken ließ, existiert nicht.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
