
Claude Haiku 5.5 vs. GLM 5.3 Flash: Gleichauf beim Benchmark, den beide Anbieter zitieren
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.
Auch das ist die falsche Zahl, nach der man entscheiden sollte. Die beiden Modelle unterscheiden sich überall sonst deutlich, und das Muster dieser Trennung ist ungewöhnlich genug, dass es ändern sollte, wie Sie die plakativen Behauptungen beider Anbieter lesen. Eines von ihnen gewinnt den Gesamtindex und die Kosten-pro-Aufgabe-Kennzahl. Das andere gewinnt fast alles, was nach einem tatsächlichen Einsatz aussieht.
Sie sind nicht nach Fähigkeit getrennt. Sie sind nach Form getrennt.
Beginne mit der einen Zahl, die aussagt: „Diese gehören zur selben Modellklasse.“
• SciCode — 0,5498 für Claude Haiku 5.5 gegenüber 0,5162 für GLM 5.3 Flash. Zwei Punkte für Anthropic, in einem Benchmark, in dem zwei Punkte Rauschen sind.
• Terminal Bench 4.0 — 0,32828 gegen 0,32828. Ein Unentschieden, exakt.
• Kontextfenster — eine Million Token für beide.
• Ausgabepreis, erste Stufe — 0,50 $ pro Million Tokens für beide.
Vier Zeilen, vier Beinahetreffer. Wenn Sie hier aufhören würden, würden Sie schlussfolgern, dass diese Modelle austauschbar sind und nach dem Preis auswählen. Diese Schlussfolgerung wäre falsch, und die nächsten Zeilen sind der Grund dafür.
Wo sie divergieren, ist die Richtung konsistent.
Die Zeilen, die sie tatsächlich trennen, sind nicht verstreut. Sie gruppieren sich zu zwei Gruppen, und jedes Modell besitzt eine Gruppe ganz für sich.
Die Agentic-Gruppe geht an GLM 5.3 Flash.Der AutomationBench-Teilwert liegt bei 0,6037 für GLM 5.3 Flash gegenüber 0,3541 für Claude Haiku 5.5 – eine Lücke von 25 Punkten, der größte Einzelunterschied zwischen diesen beiden Modellen bei einer gemeinsamen Messgröße. Tau-Bench Banking liegt bei 0,4722 für GLM 5.3 Flash; Claude Haiku 5.5 hat in dieser Zeile keine veröffentlichte Zahl. GPQA liegt bei 0,9121 für GLM 5.3 Flash; auch hier gibt es keine Anthropic-Zahl zum Vergleich. Bei den Messgrößen dafür, ob ein Modell eine mehrstufige Aufgabe zusammenhängend bewältigen und Werkzeuge zuverlässig innerhalb einer strukturierten Domäne einsetzen kann, liegt das Modell von Z.ai mit einem Vorsprung vorn, der den in die andere Richtung laufenden Unterschied beim zusammengesetzten Index winzig erscheinen lässt.
Die Composite-and-Cost-Gruppe gehört zu Claude Haiku 5.5.Der Artificial Analysis Intelligence Index v4.3.2 liegt bei 43,40 gegenüber 41,81 — 1,59 Punkte, und die Zahl, die jede Zusammenfassung dieses Duells zitiert. Die Kosten pro abgeschlossener Index-Aufgabe liegen bei 0,21 $ gegenüber 0,25 $. Die reale Laufzeit pro Index-Aufgabe liegt bei 424,6 Sekunden gegenüber 1.035,4 Sekunden: Das Modell von Anthropic ist in weniger als der Hälfte der Zeit fertig.
Das ist die Form der Entscheidung. Claude Haiku 5.5 ist schneller, günstiger pro abgeschlossener Aufgabe und liegt in der Gesamtwertung höher. GLM 5.3 Flash ist zuverlässiger bei genau der Art von Arbeit, für die günstige Modelle gekauft werden.

Welches ist das, dem man glauben kann?
Keines von beiden, für sich genommen – und die Uneinigkeit selbst ist die Information.
Ein Intelligence Index ist eine gewichtete Mischung über die Kategorien Reasoning, Science, Coding und Agentic. Er ist darauf ausgelegt, in einer einzigen Zahl zu beantworten, „wie leistungsfähig dieses Modell ungefähr ist“, und diese Aufgabe erfüllt er. Was er nicht kann, ist Ihnen zu sagen, ob ein Vorsprung von 1,59 Punkten aus den Kategorien stammt, in denen Ihre Arbeitslast lebt, oder aus denen, die sie nie berührt. Hier kommt der Vorsprung wesentlich aus Zeilen wie SciCode und Humanity's Last Exam — 0,5498 gegenüber 0,5162 und 0,4439 gegenüber 0,3985 —, während ein 25-Punkte-Defizit bei AutomationBench mit umgekehrtem Vorzeichen sitzt.
Ein Team, das einen Coding-Assistenten in einer Terminal-Schleife entwickelt, wird den SciCode-Vorsprung bemerken. Ein Team, das einen Agenten entwickelt, der einen Banking-Workflow von Anfang bis Ende abschließen muss, wird die AutomationBench-Lücke bemerken – und es wird sie jeden einzelnen Tag bemerken. Die beiden Teams betrachten denselben Index und sollten zu gegensätzlichen Schlussfolgerungen gelangen.
Der praktische Ansatz ist, den Composite als Filter statt als Ranking zu lesen. Wenn zwei Modelle innerhalb von etwa zwei Indexpunkten liegen, hat Ihnen der Composite mitgeteilt, dass sie im selben Bereich liegen, und Ihnen nichts darüber gesagt, welches Sie wählen sollten. Dann sind die einzigen Zeilen, die es sich zu lesen lohnt, diejenigen, die zu Ihrer Workload passen – und wenn ein Anbieter eine Zeile, die Sie brauchen, nicht veröffentlicht hat, ist das Fehlen selbst ein Datenpunkt, keine Lücke, die durch Annahmen gefüllt werden sollte.
Die Tokenizer-Zeile, die niemand in die Vergleichstabelle einträgt
Anthropics eigene Dokumentation enthält einen Satz, der jeden Preisvergleich mit Claude Haiku 5.5 verändert, und er lässt sich leicht überlesen. Das Modell verwendet den neueren Tokenizer, den es sich mit Claude 4.7 und späteren teilt, und zählt denselben Text als rund 30 % mehr Tokens als das Modell, das es ersetzt.
Vergleicht man das mit der Preisliste, fällt die Rechnung weniger schmeichelhaft aus, als es das Preisschild nahelegt. Der Eingabepreis von Claude Haiku 5.5 liegt bei 0,10 $ pro Million Token gegenüber 0,15 $ bei GLM 5.3 Flash – ein 1,5-facher Vorteil. Braucht derselbe Prompt 30 % mehr Token, verringert sich der effektive Vorteil bei identischem Text erheblich, verschwindet aber nicht. Die Ausgabepreise sind in der ersten Stufe mit 0,50 $ identisch, sodass der Tokenizer-Effekt dort wirkt, ohne dass ihm etwas entgegenwirkt.
Das gemessene Ergebnis ist die ehrliche Version der Behauptung: Nach der eigenen Abrechnung von Artificial Analysis erzeugte Claude Haiku 5.5 162.164 Output-Tokens pro Index-Aufgabe gegenüber 68.673 für GLM 5.3 Flash — 2,4-mal so viele — und landete dennoch bei 0,21 $ pro abgeschlossener Aufgabe gegenüber 0,25 $. Der Preisvorteil übersteht die Ausführlichkeit, und was davon übrig bleibt, ist kleiner, als die Preistabelle sagt.
Nur bei einem der beiden sind die Preise als einheitlich angegeben. Der Preis von Claude Haiku 5.5 steigt jenseits von 100.000 Prompt-Tokens auf $0,50 für die Eingabe und $2,50 für die Ausgabe; für GLM 5.3 Flash ist kein entsprechender Schwellenwert veröffentlicht. Für den meisten Chat- und Code-Assist-Verkehr greift dieser Schritt nie. Bei Agentenarbeit mit langen Dokumenten oder großem Kontext greift er ständig, und an diesem Punkt kehrt sich der Vergleich um – weit über alles hinaus, was die Zahlen der ersten Stufe vermuten lassen.

Die Linie, die es entscheidet, bevor es irgendeine der Zahlen tut.
Alles oben Gesagte setzt voraus, dass Sie frei zwischen diesen beiden Modellen wählen können. Ein großer Teil der Teams kann das nicht, und der Grund dafür ist eine einzige Zeile im Datenblatt, die in der Benchmark-Diskussion meist untergeht.
GLM 5.3 Flash verfügt über offene Gewichte und wurde unter der MIT-Lizenz veröffentlicht, mit insgesamt 320 Milliarden Parametern, davon 18 Milliarden aktiv. Es kann heruntergeladen, selbst gehostet, feinabgestimmt, quantisiert, an eine Version gebunden und innerhalb einer Mandantenumgebung ausgeführt werden, die Sie kontrollieren. Claude Haiku 5.5 ist proprietär und nur über eine API verfügbar, ohne veröffentlichte Parameteranzahl, ohne Lizenz und ohne Repository.
Wenn in Ihrem Anforderungsdokument steht, dass das Modell auf Ihrer eigenen Hardware laufen muss oder dass ein bestimmter Checkpoint in den nächsten drei Jahren weiterhin aufrufbar bleiben muss, ist dieser Vergleich entschieden, bevor die Preisspalte überhaupt gelesen wird. Das ist keine Formalität. Es ist der häufigste Grund, warum Teams überhaupt bei einem Mittelklasse-Modell mit offenen Gewichten landen, und es ist der Grund, warum ein Vorsprung von 25 Punkten bei AutomationBench nicht das Einzige ist, was in Richtung Z.ai zieht.
Es schneidet auch in die andere Richtung, und dieselbe Ehrlichkeit gilt. Anthropic veröffentlicht für Claude Haiku 5.5 eine Stilllegungszusage, wonach dies nicht vor Oktober 2027 geschieht, und führt das Modell über eine First-Party-API mit einer System Card und einem dokumentierten Evaluationsset. Ein Open-Weights-Release ist nicht automatisch langlebiger – Sie erben die Betriebslast zusammen mit den Gewichten, und eine Lizenzdatei ist kein Supportvertrag. Welche der beiden Sie wollen, ist eine Frage Ihres Teams, nicht der Modelle.
Beide Seiten auf einer Taste, wenn du es empirisch klären willst
GLM 5.3 Flash ist im OrcaRouter-Katalog zum Listenpreis von Z.ai mit 0 % Aufschlag verfügbar – durchgereicht statt vermischt, sodass der oben genannte Preis der Preis auf der Rechnung ist und jede Änderung, die Z.ai vornimmt, noch am selben Tag bei uns ankommt. Claude Haiku 5.5 ist nicht in unserem Katalog – es ist über Anthropics eigene API erreichbar – und es ist besser, das ausdrücklich zu sagen, als es nur anzudeuten.
Was der Katalog leicht macht, ist die Form des Tests, die dieser Vergleich tatsächlich verlangt. Die Diskrepanz zwischen dem zusammengesetzten Index und den agentischen Zeilen ist eine Hypothese über deine Workload, und die einzige Möglichkeit, sie aufzulösen, besteht darin, beide Modelle über denselben Trace laufen zu lassen. Mit GLM 5.3 Flash auf der Route und einem Anthropic-Arm auf der anderen Seite desselben Gateways wird daraus eine Konfigurationsänderung statt zweier Integrationen — eine API für über 200 Modelle, ein Schlüssel, automatisches Failover darunter, und die Routing-DSL, wenn du Traffic nach Aufgabenklasse aufteilen und die Kosten auf einer einzigen Rechnung ablesen willst.

Das Urteil, so formuliert, wie die Zahlen es stützen.
Wenn Ihre Arbeit darin besteht, Text rein und Text raus, Ihre Prompts innerhalb der ersten Preisstufe bleiben und Sie bei echtem Volumen pro Token bezahlen, ist Claude Haiku 5.5 hier das bessere Modell: höherer Composite-Wert, günstiger pro abgeschlossener Aufgabe und mehr als doppelt so schnell pro Aufgabe. Die Schlagzeile des Terminal-Benchmarks ist ein Patt und sollte nicht zur Entscheidung herangezogen werden.
Wenn Ihre Arbeit ein Agent ist, der einen mehrstufigen Workflow ohne Aufsicht abschließen muss, liegt GLM 5.3 Flash bei dem einen gemeinsamen Benchmark, der genau das misst, um 25 Punkte vorn, und es ist das günstigere der beiden, was Modifikationen angeht, weil Sie die Gewichte halten können.
Der Gleichstand bei 0,32828 ist das richtige Bild für dieses Paar, aber nicht, weil die Modelle gleich sind. Es ist die eine Zeile, in der zwei Modelle, die ansonsten fast nichts gemeinsam haben, zufällig auf derselben Ziffer landen – und diese Ziffer als Zusammenfassung des Vergleichs zu behandeln, ist die Art und Weise, wie eine Beschaffungsentscheidung anhand der am wenigsten aussagekräftigen Zahl in der Tabelle getroffen wird.
