Hero-Titelkarte: DeepSeek V4.1 Flash vs. GLM-5.2 — zwei MIT-Modelle, eine langweilige Antwort
Guides & Insights

DeepSeek V4.1 Flash vs. GLM-5.2: Zwei MIT-Modelle, eine langweilige Antwort

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

DeepSeek V4.1 Flash und GLM-5.2 sind die gleiche Art von Objekt, und genau das überspringen die meisten Vergleiche. Beide sind Mixture-of-Experts-Modelle, beide erscheinen unter MIT mit herunterladbaren Gewichten, beide verarbeiten eine Million Token Kontext, und beide sind über eine gehostete API von einem Anbieter verfügbar, der sie nicht trainiert hat. GLM-5.2 kam zuerst und war zum Zeitpunkt seiner Veröffentlichung mit 51 das am höchsten bewertete Open-Weight-Modell im Artificial Analysis Index. DeepSeek V4.1 Flash erschien am 10. September 2026 als das kleinere, neuere und günstigere Modell in DeepSeeks neuer Architekturfamilie. Der Vergleich, auf den es zwischen beiden ankommt, ist nicht, welches intelligenter ist. Sondern welches man ausführen kann, und zu welchen Kosten, für die Arbeit, die man tatsächlich hat.

Was sie gemeinsam haben, was den Großteil davon ausmacht

Beginne mit der Überschneidung, denn sie eliminiert die meisten der üblichen Entscheidungskriterien. Wenn du zwischen einem offenen und einem geschlossenen Modell wählst, wägst du Lock-in ab, wägst du die Möglichkeit des Fine-Tunings ab, wägst du ab, ob der Anbieter die Bedingungen dir gegenüber ändern kann. Nichts davon trifft hier zu. Sowohl DeepSeek V4.1 Flash als auch GLM-5.2 stehen unter MIT-Lizenz, mit Gewichten, die du selbst herunterladen und betreiben kannst. Beide nehmen 1M Token Eingabe entgegen. Beide sind MoE-Architekturen, was bedeutet, dass beide im Verhältnis zu ihrer Gesamtzahl an Parametern günstig zu betreiben sind, weil pro Token nur ein Bruchteil der Gewichte aktiviert wird.

Bei diesem Vergleich geht es also nicht um offen gegen geschlossen und auch nicht um langen Kontext gegen kurzen. Es geht um vier oder fünf Zahlen, und diese Zahlen weisen bei den Kosten in die eine und bei der Reife in die andere Richtung.

Wo sie tatsächlich voneinander abweichen

• Preis pro 1 Mio. Tokens — DeepSeek V4.1 Flash 0,15 $ Eingabe / 0,60 $ Ausgabe außerhalb der Stoßzeiten vs. GLM-5.2 1,40 $ Eingabe / 4,40 $ Ausgabe. Das ist etwas mehr als das 9-Fache des Eingabepreises und etwas mehr als das 7-Fache des Ausgabepreises.

• Zwischengespeicherte Eingabe — V4.1 Flash 0,003 $ pro 1 Mio. außerhalb der Spitzenzeiten vs. GLM-5.2 0,26 $ pro 1 Mio. Fast 90-mal, bei dem Posten, der die Abrechnung einer Agenten-Schleife dominiert.

• Parameter — V4.1 Flash 552B insgesamt mit 8B aktiv bei der Eingabe und 16B bei der Ausgabe vs. GLM-5.2 grob 745B insgesamt mit rund 40B aktiv. GLM-5.2 aktiviert etwa zweieinhalb Mal so viele Parameter pro Token.

• Maximale Ausgabe — V4.1 Flash 384K Token vs. GLM-5.2 128K Token. Dreimal die Obergrenze.

• Kontextfenster — jeweils 1 Mio. Token. Level.

• Unabhängige Indexbewertung — GLM-5.2 erzielt 51 im Artificial Analysis Index, der höchste Wert aller Open-Weight-Modelle zum Zeitpunkt seiner Veröffentlichung. DeepSeek V4.1 Flash hat noch keinen veröffentlichten Indexwert.

• Beobachtete Latenz bis zum ersten Token – V4.1 Flash 2,63 s bei p50 und 9,05 s bei p95 gegenüber GLM-5.2 2,36 s bei p50 und 10,00 s bei p95, basierend auf OrcaRouters eigener 7-Tage-Telemetrie. Die Mediane liegen gleichauf. Die Tails nicht.

Die Richtung des Preises und die Richtung der Reife sind entgegengesetzt. GLM-5.2 ist das Modell mit dem unabhängigen Score und der längeren Erfolgsbilanz. DeepSeek V4.1 Flash ist das Modell mit den günstigeren Tokens, einem Neuntel des Eingabepreises und der dreifachen Ausgabe-Obergrenze. Es gibt keine Lesart dieser Liste, bei der ein Modell einfach dominiert.

Two-column scoreboard: DeepSeek V4.1 Flash vs GLM-5.2 — price per 1M tokens $0.15 input and $0.60 output vs $1.40 and $4.40, cached input $0.003 vs $0.26, total parameters 552B vs about 745B, active parameters 8B input and 16B output vs about 40B, context window 1M tokens on both, max output 384K tokens vs 128K tokens, Artificial Analysis Index score not yet published vs 51, both MIT-licensed, and a p50 time to first token of 2.63 s vs 2.36 s

Der Schwanz ist die unterschätzte Linie.

Die meisten Vergleiche von Open-Weight-Modellen beginnen mit dem Index-Score. Stattdessen verdient die Latenz-Telemetrie Aufmerksamkeit, aber nicht aus dem Grund, den man erwarten würde: Die Mediane sind gleichauf. GLM-5.2s p50-Zeit bis zum ersten Token beträgt 2,36 s gegenüber 2,63 s bei V4.1 Flash, was keine Lücke ist, sondern Rauschen in einem gemeinsam genutzten Netzwerk. Wer einen Vorteil beim ersten Token für das günstigere Modell anführt, liest das falsche Perzentil.

Der p95-Wert ist der Punkt, an dem sich die beiden trennen, und die Richtung ist die umgekehrte dessen, was die Preisdifferenz nahelegen würde. Die Worst-Case-Wartezeit von GLM-5.2 beträgt 10,00 s; die von V4.1 Flash 9,05 s. Das zählt mehr als ein Median, denn die Anfragen, die einem Nutzer auffallen, sind die langsamen. Ein Tool, das normalerweise sofort reagiert und gelegentlich zehn Sekunden hängt, wirkt auf eine Weise unzuverlässig, wie es ein durchgängig drei Sekunden dauerndes Tool nicht tut, und in einer Agentenschleife, die pro Runde zehn Aufrufe auffächert, ist der p95-Wert die Zahl, die entscheidet, ob die Runde innerhalb der Geduld eines Menschen abgeschlossen wird. Der Tail von GLM-5.2 ist kein Defekt; er ist ein größeres Modell, das pro Token rund 40 Milliarden Parameter aktiviert, und es kostet, was es kostet. Aber es ist der Grund, warum das Modell besser zu asynchroner Arbeit passt – einer Warteschlange, einem Batch-Job, einem Hintergrundagenten, den niemand beobachtet – als zu einer Request-Response-Schnittstelle.

Keines der beiden Modelle veröffentlicht auf den für uns sichtbaren Seiten eine Durchsatzangabe, was man klar sagen sollte, statt sie zu ergänzen. Die Zeit bis zum ersten Token ist die einzige Latenzdimension, in der diese beiden auf gemeinsamer Datenbasis verglichen werden können, und in dieser Dimension ist die ehrliche Lesart, dass sie beim Median gleichauf und im Tail nahe beieinanderliegen.

Was ein Indexwert klärt – und was nicht

Die 51 von GLM-5.2 im Artificial Analysis Index ist eine echte, unabhängig ermittelte Zahl, und sie ist das stärkste einzelne Argument für das Modell. Sie ist zugleich ein zusammengesetzter Wert: eine einzelne Zahl, die mehrere Evaluationssets aggregiert, was sie zu einer guten Zusammenfassung der allgemeinen Leistungsfähigkeit und zu einem schlechten Prädiktor für die Leistung bei einer einzelnen konkreten Aufgabe macht. Ein Modell, das 51 erreicht, und ein Modell ohne veröffentlichte Punktzahl sind nicht dasselbe wie ein Modell, das 51 erreicht, und ein Modell, das 40 erreicht.

Die ehrliche Einschätzung zu DeepSeek V4.1 Flash ist, dass seine unabhängige Datenlage dünn ist, und der Grund dafür ist sein Alter. Es ist seit zwölf Tagen allgemein verfügbar. Die eine aktuelle Drittanbieter-Testreihe, in der es auftaucht – das am 21. September 2026 veröffentlichte Agentic-Coding-Board von Agents on Rails –, platzierte es bei maximalem Aufwand bei 17 %, im Mittelfeld, über GLM-5.3 Flash mit 15 % und unter Gemini 3.8 Flash mit 23 %. Das ist ein einzelnes Board, das eine einzige eng gefasste Sache misst, und es ist kein Ersatz für einen Index-Wert. Wer behauptet, V4.1 Flash schlage GLM-5.2 derzeit bei der Leistungsfähigkeit, extrapoliert aus Architektur und Preis und berichtet keine Messung.

Die Argumente für jedes, klar dargelegt.

DeepSeek V4.1 Flash ist das Modell der Wahl, wenn die Arbeitslast ein hohes Volumen, Latenzempfindlichkeit oder eine starke Ausgabelast mit sich bringt. Ein Neuntel des Eingabepreises und rund ein Neunzigstel des Cache-Lesepreises sind ein struktureller Vorteil in einer Agentenschleife, die den Kontext bei jedem Durchlauf erneut liest, und eine Ausgabeobergrenze von 384K ist eine andere Kategorie von Artefakt als 128K. Wenn Ihre Aufgabe Klassifikation, Extraktion, lange strukturierte Generierung oder die hochvolumige Ausführungseinheit innerhalb einer Agentenpipeline ist, ist der Kostenunterschied nicht marginal – er entscheidet darüber, ob eine Pipeline tragfähig ist oder nicht.

GLM-5.2 ist das Modell, zu dem man greift, wenn man eine veröffentlichte, unabhängig verifizierte Leistungskennzahl braucht, um eine Entscheidung zu rechtfertigen, oder wenn die Arbeit asynchron ist und eine Wartezeit von zehn Sekunden im schlimmsten Fall unsichtbar ist. Es ist die ausgereifte Wahl: Der Score existiert, das Verhalten ist dokumentiert, das Modell ist lange genug in Produktion, dass andere seine Grenzen gefunden haben. Darin liegt echter Wert, und der wird nicht durch eine Preisspalte erfasst.

Wo keines von beiden eindeutig richtig ist – ein Allzweckassistent, der gemischten Verkehr bewältigt –, besteht der sinnvolle Schritt nicht darin, sich zu entscheiden. Sondern darin, den Großteil des Verkehrs an das günstige Modell zu schicken und das teure für die Anfragen zurückzuhalten, die es benötigen.

Beide als ein System betreiben

Da beide Modelle Open-Weight sind und beide gehostet werden, ist das Split-and-Route-Muster hier ungewöhnlich günstig einzurichten, und genau hier verdient sich OrcaRouters Routing-Ebene ihren Platz, statt ein nachträglich angeflanschtes Verkaufsargument zu sein. Beide Modelle liegen hinter einem einzigen Schlüssel, sodass die Routing-Entscheidung Konfiguration ist und keine zweite Integration: Eine Regel, die kurze, hochfrequente Anfragen an DeepSeek V4.1 Flash und lange asynchrone Jobs an GLM-5.2 schickt, sind ein paar Zeilen statt einer Verzweigung in Ihrem Anwendungscode.

Zwei Eigenschaften der Plattform sind speziell für diese Paarung von Bedeutung. OrcaRouter gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, die oben genannten Zahlen sind also die eigenen Tarife der Anbieter, und der DeepSeek-Peak-Zeitplan gilt genau so, wie DeepSeek ihn definiert – Peak ist werktags von 01:00–04:00 und 06:00–10:00 UTC, Wochenenden liegen vollständig außerhalb der Peak-Zeiten, was bei einem so günstigen Modell eine Planungsentscheidung ist, die man bewusst treffen sollte. Und die Routing-DSL kann mehrere Modelle in einem einzigen Aufruf zusammenfassen, was der natürliche Weg ist, zwei Modelle mit offenen Gewichten zu nutzen, deren Stärken sich nicht überschneiden: Das günstige Modell erzeugt, das stärkere prüft, und der Aufrufer sieht eine einzige Antwort. Automatisches Failover steht hinter beiden Pfaden, was wichtig ist, wenn eines der beiden Modelle zwölf Tage alt ist und sein Verhalten mit Ihren Daten noch nicht bekannt ist.

Der Grund, warum dies die richtige Form und kein Kompromiss ist, ist, dass sich die beiden Modelle in Achsen unterscheiden, die nicht miteinander konkurrieren. Das eine ist schnell und günstig; das andere ist bewertet und langsam. Eine Pipeline, die beide nutzt, ist keine Absicherung, sondern sie passt Instrumente an Aufgaben an.

Screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model id, 1M-token context, 128K max output, text input and text output, $1.40 input and $4.40 output per 1M tokens, and observed time to first token of 2.36 s at p50 and 10.00 s at p95

Was zu sehen

• Ein veröffentlichter Wert des Artificial Analysis Index für DeepSeek V4.1 Flash. Solange es ihn nicht gibt, ist der Fähigkeitsvergleich zwischen diesen beiden Modellen ein Argument, keine Messung – und er ist der einzige Beweis, der die Sache entscheiden würde.

• Ob sich das Latenzprofil von GLM-5.2 verbessert. Sein p95 von 10,00 s ist der Wert, der sich am wahrscheinlichsten ändern wird, während Hosting-Anbieter optimieren, und er ist derzeit der größte einzelne gemessene Unterschied zwischen den beiden Modellen – eine Tail-Wartezeit, kein Preis.

• Ob sich der Spitzenzeiten-Zeitplan von DeepSeek ändert. Bei einem Modell mit 0,15 US-Dollar pro Million Eingabe-Tokens ist der Spitzenzeiten-Multiplikator die größte einzelne Variable im Kostenmodell.

Bis der erste davon erscheint, lautet die treffende Zusammenfassung: DeepSeek V4.1 Flash ist beim Input etwa neunmal günstiger und bei gecachtem Input fast neunzigmal günstiger als GLM-5.2 und hat die dreifache Output-Obergrenze; GLM-5.2 ist das Modell mit dem unabhängigen Score und der längeren Erfolgsbilanz, und sein First-Token-Median liegt auf Augenhöhe mit dem des günstigeren Modells, auch wenn sein Worst Case nicht mithält. Beide stehen unter MIT. Beide sind nur einen Schlüssel entfernt. Wähle nach Workload, nicht nach Sieger.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id with a Featured badge, 1M-token context, 384K max output, text and image input, $0.15 input and $0.60 output per 1M tokens, a cache read rate of $0.003, and a p50 time to first token of 2.63 s

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert