GLM-5.3-Flash vs DeepSeek V4 Flash — Welches Budget-Frontier-Modell sollten Sie aufrufen? Neu generierte Abbildung.
Guides & Insights

GLM-5.3-Flash vs DeepSeek V4 Flash: Welches preisgünstige Frontier-Modell sollten Sie aufrufen?

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Intelligenz auf Frontier-Niveau kostete früher ab fünf Dollar pro Million Input-Tokens; heute liefern zwei Modelle sie für Kleingeld, und sie liegen Seite an Seite in derselben Budget-Stufe. GLM-5.3-Flash, Zhipu AIs multimodales Modell mit 18B aktiven Parametern, das am 26. August als Open Source veröffentlicht wurde, und DeepSeek V4 Flash, der ~13B aktive agentische Coder, den DeepSeek Ende Juli in Produktion genommen hat, sind die beiden stärksten Argumente dafür, dass „Near-Frontier für ein paar Cent“ inzwischen eine echte Produktkategorie ist. Sie unterscheiden sich stärker, als ihre Preisschilder vermuten lassen: Das eine ist ein nativ multimodaler Generalist mit MIT-Gewichten, das andere ein bewährter Coding- und Agenten-Spezialist mit unabhängigen Benchmark-Ergebnissen im Rücken.

Die kurze Antwort für die meisten Teams: Wenn Sie ein günstiges, offenes, multimodales Modell zum Aufbauen möchten, nehmen Sie GLM-5.3-Flash; wenn Sie ein Codierungsmodell mit unabhängig gemessenen agentischen Kennzahlen möchten, das Sie in einer Besprechung verteidigen können, nehmen Sie DeepSeek V4 Flash. Der Rest dieser Seite enthält die Begründung, das Scoreboard pro Dimension und die Einschränkungen — beginnend mit der ehrlichen Tatsache, dass ein Teil der Behauptungen von GLM-5.3-Flash vom Anbieter angegeben wird, während die Kernwerte von DeepSeek V4 Flash unabhängig gemessen werden.

Das Aufeinandertreffen in einem Durchgang

Beide Modelle sind Mixture-of-Experts-Designs mit insgesamt rund 300B Parametern und unter 20B aktiven Parametern pro Token, beide unterstützen ein Kontextfenster von 1M Token, und beide haben offene Gewichte. Damit enden die Gemeinsamkeiten. GLM-5.3-Flash ist das erste native multimodale Modell in Zhipus GLM-5-Linie — Text, Bild und Video als Eingabe — und es wurde mit einer MIT-Lizenz veröffentlicht, was bedeutet, dass du es heute selbst hosten kannst. DeepSeek V4 Flash ist die Produktionsversion des Modells, an dem Deep​Seek seit April iteriert; seine Kernversion umfasst Text und Code, seine Architektur ist für agentische Werkzeugnutzung optimiert, und Vision wird separat in einem experimentellen Build statt nativ ausgeliefert. Beim Intelligenzindex gibt Zhipu für den Flash 57 an, gegenüber dem unabhängig gemessenen Wert von 50 für DeepSeek V4 Flash — eine bedeutende Lücke, falls sie sich bestätigt, und die Zahl, auf die man bei der Bestätigung durch Dritte achten sollte.

A generated two-column scoreboard titled 'GLM-5.3-Flash vs DeepSeek V4 Flash — the scoreboard'. Left column GLM-5.3-Flash: AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, Price ~$0.14/$0.44 (discount ~$0.07/$0.22). Right column DeepSeek V4 Flash: AA Index 50 (independent), Active params ~13B, Context 1M tokens, Modality text (vision in exp build), Open weights yes, Price $0.14/$0.28. Footer: GLM figures vendor-reported; DeepSeek figures independently measured where noted.

Intelligenz und Benchmarks

Dies ist der Abschnitt, in dem es auf die Disziplin bei der Quellenbeschaffung ankommt, denn die beiden Modelle haben sehr unterschiedliche Evidenzgrundlagen.

• AA Intelligence Index — GLM-5.3-Flash 57, laut Zhipus Startmaterialien (nicht reproduziert), gegenüber DeepSeek V4 Flash 50, unabhängig von Artificial Analysis gemessen. Zum Vergleich: Claude Opus 4.8 liegt bei etwa 57 und Kimi K3 bei 57 auf demselben Index.

• SWE-bench Verified — für GLM-5.3-Flash noch kein Wert veröffentlicht; DeepSeek V4 Flash: 79,0 % (unabhängig).

• LiveCodeBench — für GLM-5.3-Flash wurde noch kein Wert veröffentlicht, vs. DeepSeek V4 Flash 91,6 % (unabhängig).

• Agents' Last Exam — für GLM-5.3-Flash wurde noch kein Wert veröffentlicht, im Vergleich zu DeepSeek V4 Flash 25.2 (unabhängig).

• Paritätsanspruch beim Codieren — Zhipu gibt an, dass die Codierleistung von GLM-5.3-Flash auf seiner internen Z.ai Code Bench mit Claude Opus 4.8 vergleichbar ist (vom Anbieter gemeldet, nicht reproduziert).

• Familienkontext — GLM-5.3, das große Geschwister des Flash, erreicht unabhängig 60 auf dem AA-Index; bei Terminal-Bench 2.1 liegt Zhipus eigene GLM-5.3-Reihe bei Community-Läufen zwischen 83,1 und 88,2. DeepSeek V4 Flash erreicht beim Terminal-Bench 2.1 einen Wert von 82,7 (unabhängig).

Die Asymmetrie ist der Punkt: Die Coding- und Agentik-Werte von DeepSeek V4 Flash wurden seit seiner Veröffentlichung im Juli von Dritten reproduziert, während die von GLM-5.3-Flash Behauptungen des Anbieters vom ersten Tag sind. Die 57 des Flash liegt sieben Punkte höher als die 50 von Deep​Seek, wenn Zhipu recht hat, aber das Modell wurde vor dem Start weitgehend anonym getestet, daher sollten unabhängige Ergebnisse bald vorliegen.

Coding und Agents: die eigentliche Differenzierung

Wenn Sie ein Budget-Modell für agentische Codierungsworkloads kaufen, ist die Evidenzbasis wichtiger als der rohe Indexunterschied. DeepSeek V4 Flash wurde in seiner Produktionsversion speziell für agentische Fähigkeiten neu nachtrainiert, und seine unabhängig gemessenen Zahlen — 79.0 SWE-bench Verified, 91.6 LiveCodeBench, 82.7 Terminal-Bench 2.1 — sind diejenigen, an denen Konkurrenten im günstigen Segment jetzt gemessen werden. Zhipus Coding-Behauptung für GLM-5.3-Flash ist vergleichbar mit der Stärke von Claude Opus 4.8 in dessen eigenem internen Benchmark, was eine starke Aussage ist, aber noch keine unabhängige.

Es gibt auch einen Verhaltensunterschied, den es zu kennen lohnt. Community-Berichte über DeepSeek V4 Flash beschreiben ein vergleichsweise zurückhaltendes Denken – etwa 25–45 % der Ausgabetoken sind Denktoken, bei einem Ausgabe-Expansionsfaktor von rund 1,3–1,5x – was die Kosten pro Aufgabe niedrig hält. Zhipu hat für GLM-5.3-Flash keine vergleichbaren Daten zur Ausführlichkeit veröffentlicht, und genau diese Ausführlichkeit ist die Variable, die aus einer günstigen Preisliste eine teure Aufgabe macht. Solange die reale Token-Expansion des Flash nicht gemessen ist, ist die effektive Kostenlücke pro Aufgabe zwischen diesen beiden größer als die Lücke pro Token.

Multimodal, oder noch nicht

Das ist das klarste Unterscheidungsmerkmal. GLM-5.3-Flash akzeptiert nativ Bilder und Videos neben Text – als erstes GLM-5-Modell überhaupt – und Zhipu zufolge liegen die Serving-Kosten für lange Kontexte bei etwa einem Drittel der Kosten von GLM-5.3. Die Produktionsversion von DeepSeek V4 Flash ist auf Text und Code ausgerichtet; die multimodale Fähigkeit von Deep​Seek befindet sich in einem separaten experimentellen Vision-Build, was bedeutet, dass eine Vision-Workload auf der Deep​Seek-Seite einen anderen Model-Endpoint und eine andere Eval-Historie mit sich bringt. Wenn Ihre Pipeline heute Bild- oder Video-Verständnis von einem Budget-Modell benötigt, ist GLM-5.3-Flash das einzige der beiden, das dies nativ bietet.

Preis: die tatsächlichen Zahlen

Beide Modelle unterbieten alles andere in ihrer Leistungsklasse, allerdings zu unterschiedlichen Zeitpunkten.

• GLM-5.3-Flash — Zhipu bietet es zu einem Zehntel des Preises von GLM-5.3 (1,40 $ / 4,40 $ pro Million Token) an, was sich auf etwa 0,14 $ / 0,44 $ beläuft bzw. auf 0,07 $ / 0,22 $ während des zeitlich begrenzten Einführungsrabatts. Zhipu gibt außerdem rund 0,045 $ pro Aufgabe im AA Intelligence Index an. Die Dollarbeträge leiten sich aus den von Zhipu angegebenen Verhältnissen ab; das Verhältnis selbst ist eine aktuelle Tatsache.

• DeepSeek V4 Flash — 0,14 $ pro Million Eingabe-Tokens, 0,28 $ pro Million Ausgabe-Tokens, der von Deep​Seek veröffentlichte offizielle Preis, wobei Eingaben mit Cache-Treffern deutlich günstiger bepreist sind. Unabhängige Kosten-pro-Test-Schätzungen gehen von etwa 0,03 $ pro Benchmark-Test aus — das günstigste große Modell auf dem Markt.

Long-Context — GLM-5.3-Flash zu etwa einem Drittel der Long-Context-Kosten von GLM-5.3 (Herstellerangabe) im Vergleich zu DeepSeek V4 Flash mit 1M Kontext für 0,14 $ / 0,28 $ und einem maximalen Output von ~393K.

Auf dem Papier liegen die beiden Listenpreise nahe beieinander, und der Rabatt macht GLM-5.3-Flash derzeit pro Token günstiger. Der Haken ist, dass der Preis pro Token von DeepSeek V4 Flash stabil ist und seine Ausführlichkeit moderat ist, während der Preis des Flash ein vorübergehender Rabatt ist und seine Ausführlichkeit noch nicht — die ehrliche Vorhersage ist also, dass die effektive Kostendifferenz kleiner ist als die Preisdifferenz und sich sogar umkehren könnte, sobald beide an derselben Aufgabengruppe gemessen werden.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

Geschwindigkeit und Serverkosten

Zhipu sagt, GLM-5.3-Flash habe die geringste Attention-Rechenlast der verglichenen Budget-Modelle — GLM-5.3, DeepSeek V4 Flash und Kimi K3 — mit einer um das 3,0-fache reduzierten Attention-Rechenlast und einem um das 4,4-fache reduzierten KV-Cache gegenüber GLM-5.3, räumt jedoch ein, dass sein KV-Cache immer noch geringfügig größer ist als der von DeepSeek V4 Flash. Auf der Serving-Seite berichtet Zhipu von einer 3-fachen Verbesserung der End-to-End-Serving-Leistung auf einheimischen chinesischen Chips, bei Kosten pro Token, die laut Zhipu mit denen gängiger NVIDIA-GPUs vergleichbar sind. Alles Herstellerangaben. Die Serving-Ökonomie von DeepSeek V4 Flash ist dagegen etabliert: Es ist seit dem 31. Juli in Produktion, es gehört zu den günstigsten Modellen pro Test, und Drittanbieter betreiben es seit einem Monat in großem Umfang. Für einen Produktionspfad schlägt bewährtes Serving vielversprechendes Serving.

Welche sollten Sie anrufen?

Die Entscheidungshilfe, in einfachen Worten:

Du willst jetzt offene Multimodalität — GLM-5.3-Flash ist das einzige der beiden Modelle mit nativem Bild-/Video-Eingang, und seine MIT-Gewichte sind heute auf Hugging Face verfügbar.

• Du möchtest ein Coding-/Agentic-Modell mit unabhängigen Zahlen — DeepSeek V4 Flash erzielt 79,0 bei SWE-bench Verified und 82,7 bei Terminal-Bench 2.1, beide von Dritten verifiziert; die Coding-Behauptungen von GLM-5.3-Flash sind es noch nicht.

Sie wollen die absolute Untergrenze bei den Kosten pro Token — der Einführungsrabatt von Flash verschafft ihm derzeit einen Vorteil, aber behandeln Sie den Rabatt als vorübergehend.

• Sie legen Wert auf eine stabile Produktionsrate — die $0.14 / $0.28 von DeepSeek V4 Flash sind seit Juli stabil; die Preisliste des Flash ist erst wenige Tage alt.

• Sie sind unsicher und möchten beide ausprobieren, ohne einen zweiten Vertrag abzuschließen — DeepSeek V4 Flash ist heute auf OrcaRouter zum Listenpreis von Deep​Seek ohne Aufschlag verfügbar, und die GLM-Seite dieser Familie (GLM-5.3, das große Schwestermodell des Flash) ist ebenfalls dort verfügbar. Sobald der Flash selbst ins Programm aufgenommen wird, liegen beide Seiten dieser Paarung hinter einem einzigen Schlüssel. Bis dahin sind die MIT-Gewichte des Flash auf Hugging Face der günstigste Weg, es selbst zu testen, und ein automatisches Failover auf ein bewährtes Modell ist der Weg, das neue auszuprobieren, ohne einen Produktionspfad darauf zu setzen.

A screenshot of the OrcaRouter model page for DeepSeek V4 Flash showing the model id, a 1,000,000-token context window, the current per-1M input and output rates, and the tools, JSON and reasoning capability chips.

Das Fazit

GLM-5.3-Flash ist das interessantere Modell — nativ multimodal, MIT-lizenziert, ein behaupteter Index-Score, der mit deutlich teureren Modellen mithält — aber es ist auch das weniger bewährte, und seine besten Zahlen wurden zum Marktstart vom Hersteller gemeldet. DeepSeek V4 Flash ist die sicherere Budget-Wahl für Coding und agentische Arbeit: niedrigerer unabhängiger Intelligenz-Score, aber gemessen, reproduzierbar und stabil bei $0.14 / $0.28. Kaufen Sie den Flash für das, was er einzigartig bietet — offenes Multimodal zu diesem Preis — und DeepSeek V4 Flash für alles, wofür Sie die Benchmark-Belege benötigen. Die wirklich offene Frage, die die nächsten zwei Wochen beantworten werden, ist, ob die 57 des Flash unabhängigen Messungen standhält.

In diesem Artikel verglichen4

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube