Eine generierte Titelkarte für 'Claude Haiku 5.5 vs GLM-5.3-FlashX — 2,5-mal so viel für dieselben Gewichte zahlen', die die beiden Modellnamen zu beiden Seiten einer Trennlinie und die Bildunterschrift 'Zwei mittelpreisige Modelle, vier Tarifkarten, eine 100K-Schwelle' zeigt, mit der Fußzeile 'Listenpreise von Anthropic und Z.ai, Oktober 2026.' Das echte OrcaRouter-Logo ist unten rechts eingefügt.
Guides & Insights

Claude Haiku 5.5 vs. GLM-5.3-FlashX: Das 2,5-Fache für dieselben Gewichte zahlen – und ob es sich lohnt

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Nützlichste, was man über GLM-5.3-FlashX wissen sollte, bevor man es mit Claude Haiku 5.5 vergleicht, ist, dass es mit denselben Gewichten wie GLM-5.3-Flash läuft und pro Aufruf 2,5-mal so viel kostet. Z​.ai hat FlashX am 18. September 2026 auf seiner eigenen API gestartet, zu $0,37 pro Million Eingabe-Tokens und $1,25 pro Million Ausgabe-Tokens, gegenüber $0,15 und $0,50 für das Basismodell, von dem es abgeleitet ist. Am Modell selbst hat sich nichts geändert; geändert hat sich, wo es läuft und wie schnell es dort laufen soll. Diese Paarung zu verstehen, ist hier der springende Punkt, denn sie bedeutet, dass dies kein Vergleich zwischen zwei Fähigkeitsstufen ist – es ist ein Vergleich zwischen einer Preisstufe und einer Serving-Stufe, und Haiku 5.5 landet mitten in dieser Argumentation aus einer völlig anderen Richtung.

Zwei Modelle, vier Preise, eine Schwelle

Reihen Sie die vier relevanten Tarifkarten nebeneinander auf, und die Form der Entscheidung wird klarer als bei jedem einzelnen Paar:

• Claude Haiku 5.5, unter 100.000 Tokens — 0,10 $ pro Million für Eingabe, 0,50 $ für Ausgabe (Anthropic-Liste)

• Claude Haiku 5.5, über 100.000 Tokens — 0,50 $ Eingabe, 2,50 $ Ausgabe pro Million (Anthropic-Liste)

• GLM-5.3-Flash — 0,15 $ Eingabe, 0,50 $ Ausgabe pro Million (Z.ai-Liste)

• GLM-5.3-FlashX — 0,37 $ Eingabe, 1,25 $ Ausgabe pro Million (Z.ai-Liste)

• Kontext — 1 Million Tokens bei allen vier (vom Anbieter veröffentlicht)

• Offene Gewichte — GLM-5.3-Flash und FlashX übernehmen die MIT-lizenzierten Gewichte des Basismodells; Claude Haiku 5.5 ist geschlossen (vom Anbieter veröffentlicht)

• Unabhängige Bewertung — GLM-5.3-Flash mit einem Artificial Analysis Intelligence Index von 41.807 gemessen; Claude Haiku 5.5 mit 43.395 gemessen (Artificial Analysis)

Das erste, was auffällt, ist, dass der FlashX-Preis fast exakt auf der Langkontext-Stufe von Claude Haiku 5.5 liegt – 0,37 $ gegenüber 0,50 $ beim Input, 1,25 $ gegenüber 2,50 $ beim Output. Das ist kein Zufall des Marktes; es ist das, was eine Premium-Serving-Stufe kostet, wenn das zugrunde liegende Modell mittelschwer ist und der Anbieter für Durchsatz statt für Leistungsfähigkeit abrechnet. Das zweite ist, dass GLM-5.3-FlashX die teure Version eines Modells ist, von dem das neue Haiku von A​nthropic bei kurzem Kontext günstiger und bei langem Kontext vergleichbar ist. Das dritte ist, dass alle vier Zahlen innerhalb eines Faktors von fünf zueinander liegen, was ein viel engeres Band ist, als die Formulierung „günstiges Modell versus teures Modell“ nahelegt, die den meisten Head-to-Head-Vergleichen zugrunde liegt.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs GLM-5.3-FlashX — the scoreboard'. Left column Claude Haiku 5.5: input price (short) $0.10 per million, output price (short) $0.50 per million, input price (over 100K) $0.50 per million. Right column GLM-5.3-FlashX: input price $0.37 per million, output price $1.25 per million, and a serving-premium row. A footer labels the sources. The real OrcaRouter logo is composited bottom-right.

Was FlashX tatsächlich ist

GLM-5.3-FlashX ist kein neues Modell. Es ist GLM-5.3-Flash, betrieben auf Z​.ais eigener Infrastruktur, beworben mit bis zu 200 Ausgabe-Tokens pro Sekunde in der Spitze gegenüber der gemessenen Rate des Basismodells und bepreist mit dem 2,5-Fachen des Listenpreises des Basismodells. Z​.ais Angebot ist unkompliziert: dieselben Antworten, mehr davon pro Sekunde, und man zahlt für das Serving statt für die Gewichte. Für eine durchsatzgebundene Arbeitslast – Batch-Klassifizierung, Extraktion mit hohem Volumen, alles, wo Latenz die einschränkende Größe ist und nicht die Kosten – ist das etwas, das sich stimmig verkaufen und stimmig kaufen lässt.

Was es nicht ist, ist ein Upgrade der Fähigkeiten, und die Preisgestaltung spiegelt das ehrlich wider: Wäre FlashX ein besseres Modell, könnte Z​.ai nicht für die Gewichte des Basismodells separat Geld verlangen. Das 2,5-Fache ist ein Serving-Aufschlag. Ob es sich lohnt, dafür zu zahlen, ist eine Frage nach dem Engpass Ihrer Workload, und sie hat für eine latenzgebundene Pipeline eine andere Antwort als für eine kostenbegrenzte.

Artificial Analysis hat zum Zeitpunkt des Verfassens keine separate Seite für FlashX, was man klar sagen sollte, statt es zu beschönigen: Die unabhängige Zahl, die das Board für GLM-5.3-Flash veröffentlicht – 41,807 auf dem Intelligence Index, 52,14 gemessene Output-Tokens pro Sekunde, 0,328 bei Terminal-Bench Hard – ist eine Zahl für das Basismodell, nicht für die mit 2,5-facher Geschwindigkeit bereitgestellte Version. Die eigene Durchsatzangabe des Anbieters für FlashX ist ein Spitzenwert und vom Anbieter gemeldet. Keine unabhängige Stelle hat Durchsatzwerte für FlashX selbst veröffentlicht, sodass jeder Vergleich der gemessenen Geschwindigkeit von Haiku 5.5 mit der von FlashX ein Vergleich mit einer Zahl ist, die Z.ai über sein eigenes Serving angegeben hat.

Der 2,5-fache Multiplikator von Z​.ai ist nicht das Einzige, was FlashX gegenüber seiner Basis verteuert. Da die Basisgewichte MIT-lizenziert und bei Drittanbietern gehostet werden, kann eine Workload, die wirklich mehr Durchsatz benötigt, als der Endpunkt eines einzelnen Anbieters bereitstellt, diesen oft dadurch erhalten, dass sie auf mehrere Anbieter derselben Gewichte verteilt wird, die den Basispreis oder einen Preis nahe daran verlangen, statt die Premiumstufe eines Anbieters zu bezahlen. Das ist eine echte Alternative, gegen die die FlashX-Preisliste konkurriert, und Z​.ai weiß das – was vermutlich der Grund dafür ist, dass der Pitch auf Spitzendurchsatz statt auf Einzigartigkeit setzt.

A screenshot of Z.ai's documentation pricing page, showing the API pricing table for the GLM model line with per-million input and output rates, captured in English.

Wo sich die Wege von Haiku 5.5 und FlashX trennen

Stellt man die beiden anhand der Dimensionen gegenüber, die bei einer echten Workload den Ausschlag geben, ist der Unterschied eindeutig genug, um eine Wahl zu treffen:

• Preis unter 100K Kontext — Haiku 5.5 $0,10 / $0,50 vs. FlashX $0,37 / $1,25; Haiku gewinnt bei beiden

• Preis bei über 100K Kontext — Haiku 5.5 $0.50 / $2.50 vs. FlashX $0.37 / $1.25; FlashX gewinnt auf beiden Seiten

• Durchsatz — vom Anbieter angegebener Spitzenwert von 200 tok/s für FlashX im Vergleich zum von Anthropic veröffentlichten Serving für Haiku 5.5, das keinen derartigen Spitzenwert angibt

• Unabhängiger Index — Haiku 5.5 43.395 vs. GLM-5.3-Flash 41.807 (Artificial Analysis; kein unabhängiger Wert für FlashX selbst)

• Gewichte — FlashX übernimmt MIT-lizenzierte offene Gewichte; Haiku 5.5 ist geschlossen und nur per API verfügbar

• Selbsthosting — für FlashX über die offenen Gewichte möglich; für Haiku 5.5 nicht möglich

• Funktionsumfang für Tools/Agenten — einstellbarer Aufwandsregler bei Haiku 5.5, fehlt in der GLM-Flash-Reihe

Die interessante Zelle ist die zweite. Claude Haiku 5.5 ist bei kurzen Anfragen ein fünfmal günstigeres Modell als GLM-5.3-FlashX und bei langen Anfragen etwas teurer als dieses, weil die Haiku-Preisliste bei 100.000 Tokens um das Fünffache steigt, während FlashX einen Pauschalpreis verlangt. Wenn Ihr Traffic überwiegend kurz ist, ist Haiku allein aufgrund des Preises die naheliegende Wahl. Wenn er überwiegend lang ist, konkurriert FlashX überhaupt nicht mit dem Kurzstufen-Preis von Haiku – sondern mit der Langstufe von Haiku, und gewinnt diesen Vergleich um rund ein Drittel.

Der Fähigkeitsvergleich ist enger, als es beide Anbieter gern hätten. 41.807 gegen 43.395 auf demselben unabhängigen Index ist eine Lücke von unter vier Prozent, deutlich innerhalb des Rauschens der meisten Evaluierungen auf Anwendungsebene und viel zu klein, um allein eine Auswahl zu rechtfertigen. Keines der beiden Modelle dominiert das andere beim allgemeinen Schlussfolgern; die Entscheidung wird anhand der Preisliste und des Durchsatzes getroffen, nicht danach, welches intelligenter ist.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5, headlined 'Proprietary model — Released October 2026', showing an Intelligence Index of 43.395 and speed rank #10 of 182, with the cost comparison block reading $0.10 input.

Der Lizenzunterschied ist ein echter Unterschied.

Dass FlashX von Haus aus Open-Weight ist, zählt auf einer Achse mehr als der Preisunterschied: Es kann selbst gehostet werden, und es kann von jedem bereitgestellt werden. Claude Haiku 5.5 kann weder das eine noch das andere. Für ein Team mit einer Compliance-Anforderung, dass die Inferenz auf eigener Hardware erfolgt, oder mit genügend stetigem Volumen, dass das Amortisieren einer GPU günstiger ist als die Bezahlung pro Token, ist die G​LM-Reihe die einzige der beiden, die die Frage überhaupt beantwortet. Für alle anderen – die Mehrheit, die ein Modell hinter einer API möchte und lieber nicht die Serving-Schicht betreiben möchte – ist die Lizenz eine Fußnote und der Preis das Argument.

Es bedeutet außerdem, dass die beiden Modelle unterschiedliche Ausfallmodi haben, wenn ein Anbieter einen schlechten Tag hat. Ein geschlossenes Modell, das nur von seinem Hersteller und den Cloud-Partnern dieses Herstellers bereitgestellt wird, fällt aus, wenn diese ausfallen. Bei einem offenen Modell mit mehreren unabhängigen Hosts kann ein Failover zwischen ihnen durchgeführt werden, vorausgesetzt, etwas übernimmt das Failover. Das ist ein echter operativer Unterschied, und es ist die Art von Sache, die sich erst an dem Tag zeigt, an dem es wirklich darauf ankommt.

Beide weiterleiten, ohne einen zweiten Vertrag

Wenn die obige Entscheidung für Ihren Traffic nicht auf einen einzigen Gewinner hinausläuft — was meistens nicht der Fall ist, weil die beiden Modelle sich auf unterschiedlichen Hälften der Preisliste gegenseitig schlagen —, dann ist die praktische Frage, wie man beide betreiben kann, ohne zwei Integrationen pflegen zu müssen. OrcaRouter bietet z-ai/glm-5.3-flash zum Listenpreis des Anbieters für 0,15 $ und 0,50 $ pro Million an, zusammen mit qwen/qwen3.8-flash und dem Rest eines Katalogs von über 200 Modellen, mit einem Schlüssel und einer Rechnung. Eine Preisänderung von Anthropic bei Claude Haiku 5.5 oder von Z.ai in der Flash-Reihe wird noch am selben Tag ohne Aufschlag weitergegeben, statt hinter der eigenen Preiskarte eines Resellers zurückzubleiben, sodass die oben genannten Zahlen die Zahlen bleiben, die Sie tatsächlich zahlen.

Wir bieten Claude Haiku 5.5 nicht an, und wir bieten GLM-5.3-FlashX nicht an — keines von beiden ist in unserem Katalog; für diese wenden Sie sich direkt an A​nthropic und Z​.ai. Was wir anbieten, ist GLM-5.3-Flash, das Basismodell unter FlashX, das die richtige Wahl für die vielen Workloads ist, bei denen der 2.5x-Serving-Aufpreis Durchsatz erkauft, den niemand verlangt hat. Wo ein Produktionspfad tatsächlich von einem der beiden Modelle abhängt, die wir nicht hosten, ist unser Failover der Mechanismus, um es auszuprobieren, ohne den gesamten Pfad darauf zu verwetten: Richten Sie die Anfrage darauf, behalten Sie ein funktionierendes Modell als Fallback, und lassen Sie die Routing-Schicht entscheiden, welches antwortet.

Welches soll man wählen?

Unter 100.000 Tokens pro Anfrage gewinnt Claude Haiku 5.5 beim Preis und reicht bei der Leistungsfähigkeit nah genug an FlashX heran, dass die Entscheidung nicht knapp ausfällt. Über 100.000 Tokens ist GLM-5.3-FlashX günstiger als die Long-Context-Stufe von Haiku 5.5 und das Modell, zu dem man greifen sollte, wenn die Anfragegröße eine Eigenschaft der Aufgabe und nicht eine Entscheidung ist – obwohl das Basis-GLM-5.3-Flash noch günstiger ist und der einzige Grund, das 2,5-Fache zu zahlen, der ist, dass Sie speziell den beworbenen Durchsatz von FlashX benötigen.

Die Vorstellung, die es zu verwerfen gilt, ist, dass eines davon die Budget-Option und das andere die Performance-Option sei. Beide sind Modelle im mittleren Preissegment mit einheitlichen, gut veröffentlichten Preislisten, und die interessante Variable ist nicht, welches besser ist, sondern welches von beiden für welche Hälfte Ihres Traffics günstiger ist. Ermitteln Sie zuerst Ihre Verteilung der Anfragegrößen; der oben stehende zweispaltige Preisvergleich verrät Ihnen den Rest.

ein Katalog mit über 200 Modellen

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert