Hero-Titelkarte für „Ling-3.1-flash vs GLM-5.3-Flash“, mit dem Untertitel „Vierfacher Durchsatz gegenüber einem Punkt beim Index“. Zwei abgerundete Karten liegen nebeneinander, mit deutlichem Zwischenraum: Die linke, beschriftet mit „Ling-3.1-flash“, zeigt „Geschwindigkeit: 211 tok/s“, „AA-Index: 41“, „Lizenz: nicht veröffentlicht“; die rechte, beschriftet mit „GLM-5.3-Flash“, zeigt „Geschwindigkeit: 53 tok/s“, „AA-Index: 42“, „Lizenz: MIT“. Eine Fußzeile lautet „Durchsatz über die eigene API des jeweiligen Anbieters; Index laut Artificial Analysis.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Ling-3.1-flash vs. GLM-5.3-Flash: Vierfacher Durchsatz gegenüber einem Indexpunkt

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ling-3.1-flash und GLM-5.3-Flash liegen auf dem Artificial Analysis Intelligence Index einen Punkt auseinander — 41 gegenüber 42 —, was sie wie zweimal dieselbe Entscheidung aussehen lässt. Sie sind es nicht. GLM-5.3-Flash erzeugt Ausgaben mit 53,0 Tokens pro Sekunde über die eigene API von Z.ai; Ling-3.1-flash erzeugt sie mit 211,0 Tokens pro Sekunde über die von InclusionAI. Das ist ein vierfacher Unterschied beim Durchsatz, und er ist weit größer als alles, wodurch der Index sie trennt. Das eine Modell ist von den beiden auf nahezu jeder Qualitätsachse das leistungsfähigere und ist unter MIT offen. Das andere ist dasjenige, das zuerst fertig wird, geschlossen ist und weder einen veröffentlichten Preis noch eine Lizenz noch einen Checkpoint hat. Die Wahl zwischen ihnen ist eine Frage dessen, worauf Ihr Workload wartet.

Die Achse Ling-3.1-flash gewinnt klar.

Geschwindigkeit ist keine Randnotiz, wenn man zwischen Modellen auf demselben Leistungsniveau wählt, und hier ist sie das gesamte Argument für das Ant-Modell.

• Ausgabedurchsatz — Ling-3.1-flash 211,0 Tokens pro Sekunde auf der API von InclusionAI vs. GLM-5.3-Flash 53,0 Tokens pro Sekunde auf der von Z.ai. Vierfache Generierungsrate.

• Zeit bis zum ersten Token – Ling-3.1-flash 1,80 Sekunden gegenüber GLM-5.3-Flash 3,18 Sekunden. Das Ant-Modell beginnt zu antworten, während das Z.ai-Modell noch denkt, was bei interaktiver Nutzung und Streaming mehr zählt als der Durchsatz.

• Zeit pro Aufgabe des Intelligence Index — Ling-3.1-flash etwa 357 Sekunden gegenüber GLM-5.3-Flash etwa 979 Sekunden. Eine einzelne Evaluierungsaufgabe dauert bei GLM-5.3-Flash von Anfang bis Ende fast dreimal so lange, weil es sowohl pro Token langsamer ist als auch langsamer startet.

Für eine Agent-Schleife, die ein Dutzend aufeinanderfolgende Aufrufe tätigt, oder für ein Produkt, bei dem jemand dabei zusieht, wie Tokens eintreffen, ist das kein Zünglein an der Waage – es ist der eigentliche Grund, ein Modell einem anderen vorzuziehen. GLM-5.3-Flash ist auf dem Papier das bessere Modell und im Anfragepfad das langsamere.

Wo GLM-5.3-Flash einfach besser ist

Überall sonst, und die Liste ist lang genug, dass der Durchsatzvorteil sich seinen Platz erst verdienen muss.

• Wissenszuverlässigkeit — GLM-5.3-Flash erreicht +7,47 bei AA-Omniscience, der beste der drei Modelle der Flash-Klasse, mit einer Halluzinationsrate von 27,6 % bei beantworteten Fragen. Ling-3.1-flash erreicht +2,22 mit einer Halluzinationsrate von 37,9 %. Bei einem Maß, das Erfindung stärker bestraft als Verweigerung, ist die Lücke real und weist in dieselbe Richtung wie der Index.

• Wissenschaftliches Wissen — GLM-5.3-Flash erzielt 0,912 bei GPQA Diamond. Für Ling-3.1-flash ist keine GPQA-Diamond-Zeile veröffentlicht. Dasselbe gilt für DeepSeek V4.1 Flash (Max). Ein Modell mit 0,91 bei wissenschaftlichen Fragen auf Graduiertenniveau ist ein anderes Instrument als eines, das bei ihnen nicht gemessen wurde.

• Modalität — GLM-5.3-Flash verarbeitet Text, Bilder und Video. Ling-3.1-flash verarbeitet nur Text. Dies ist keine Leistungslücke, die sich durch einen Benchmark schließen lässt; es ist eine Fähigkeit, die fehlt.

• Gewichte und Lizenz — GLM-5.3-Flash ist Open Weights unter MIT, herunterladbar und selbst hostbar. Ling-3.1-flash hat weder einen Checkpoint noch einen Lizenztext veröffentlicht und wird als proprietär geführt.

• Agentische Wissensarbeit — GLM-5.3-Flash 1.453,73 Elo auf AA-Briefcase v1.1 gegenüber 1.400,35 von Ling-3.1-flash, in einem Benchmark, der speziell auf Wissensarbeitsaufgaben statt auf Terminal-Steuerung ausgelegt ist.

• Preis — GLM-5.3-Flash wird auf der API von Z.ai für $0,15 pro Million Input und $0,50 pro Million Output angeboten, gegenüber $0,30 und $0,90 bei Ling-3.1-flash. Der halbe Input-Tarif und ungefähr der halbe Output-Tarif – und das von einem Modell mit höherem Index-Score und offenen Gewichten.

A two-column generated scoreboard titled 'Ling-3.1-flash vs GLM-5.3-Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Speed: 211 tok/s', 'First token: 1.80 s', 'Omniscience: +2.22', 'Weights: closed', 'Price: $0.30 / $0.90'; the right column, 'GLM-5.3-Flash', reads 'AA Index: 42', 'Speed: 53 tok/s', 'First token: 3.18 s', 'Omniscience: +7.47', 'Weights: MIT', 'Price: $0.15 / $0.50'. A footer line reads 'Index and quality rows per Artificial Analysis; throughput per each vendor's own API.' The OrcaRouter logo is composited in the bottom-right corner.

Die Zeilen, in denen das Ant-Modell zurückantwortet

Ling-3.1-flash wird nicht in allen Bereichen geschlagen. Bei agentischer Terminal-Arbeit liegt es knapp vorn, und bei Coding-Science ist es gleichauf:

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs. GLM-5.3-Flash 0.328. Praktisch ein Gleichstand, und beide liegen unterhalb der Frontier-Stufe.

• SciCode — Ling-3.1-flash 0,541 vs. GLM-5.3-Flash 0,516. Ein knapper Sieg.

• AutomationBench-AA — 0,617 vs. 0,604. Ein weiterer knapper Sieg.

• GDPval-AA — Ling-3.1-flash 1.621,75 Elo vs. GLM-5.3-Flash 1.646,86. GLM holt sich diesen zurück.

Liest man die vier Zeilen zusammen, wird das Muster deutlich. Wo die beiden Modelle überhaupt getrennt werden können, liegt die Trennung im Rauschen eines einzelnen Evaluierungsdurchlaufs. Der Ein-Punkt-Unterschied im Index zwischen ihnen ist kein Ranking; er ist ein Münzwurf, der durch die Zuverlässigkeitszeilen leicht in Richtung GLM gewichtet wird. Was kein Münzwurf ist, ist der 4×-Durchsatzunterschied und der 2×-Preisunterschied, die beide in die andere Richtung weisen.

Es gibt außerdem ein Serving-Detail, das erwähnenswert ist, denn es verändert die Größe dieser Durchsatzlücke, je nachdem, wo man ein Modell aufruft. Die eigene API von Z.ai misst 53,0 Tokens pro Sekunde. Die Sieben-Tage-Messung unseres eigenen Katalogs für GLM-5.3-Flash auf unseren Routen zeigt 150,6 Tokens pro Sekunde Ausgabe bei einer medianen Latenz bis zum ersten Token von 4,2 Sekunden. Dieselben Gewichte, über ein anderes Deployment ausgeliefert, laufen fast dreimal so schnell. Durchsatzangaben von Anbietern sind eine Eigenschaft eines Anbieters, nicht eines Modells.

Spezifikation, Zeile für Zeile

Subjekt zuerst in jeder Zeile:

• Größe — Ling-3.1-flash 560B gesamt / 25B aktiv vs. GLM-5.3-Flash 320B gesamt / 18B aktiv.

• Angegebener Kontext — 1 Mio. Token bei beiden. Die Langkontext-Reasoning-Zeile von GLM-5.3-Flash misst 0,80 auf AA-LCR; die von Ling-3.1-flash 0,83. Beide liegen dicht bei den 0,84 von DeepSeek V4.1 Flash (Max), das heißt, Langkontext-Reasoning ist in dieser Leistungsklasse kein Unterscheidungsmerkmal mehr.

• Ausgabe-Obergrenze — GLM-5.3-Flash 128.000 Tokens in unserem Katalog vs. Ling-3.1-flash ohne veröffentlichtes Maximum. Eines davon lässt sich für lange Generierung dimensionieren, das andere nicht.

• Index — 41 vs. 42.

• Durchsatz — 211,0 Token pro Sekunde vs. 53,0 bei den Anbieter-APIs, 150,6 gemessen auf unseren Routen.

• Gewichte — proprietär ohne Lizenz vs. offen unter MIT.

• Modalität — nur Text vs. Text, Bild und Video als Eingabe.

• Preis — 0,30 $ / 0,90 $ pro Million Eingabe / Ausgabe vs. 0,15 $ / 0,50 $ bei der API von Z.ai.

Wie man diesen Vergleich tatsächlich durchführt

GLM-5.3-Flash ist jetzt im OrcaRouter-Katalog, gelistet mit 0,075 $ pro Million Input, 0,25 $ pro Million Output und 0,0173 $ pro Million Cache-Reads — lesen Sie die Live-Karte statt dieses Absatzes, denn die Serving-Raten ändern sich, und die Weitergaberegelung bedeutet, dass eine Preisänderung des Anbieters am selben Tag an uns weitergegeben wird. Der Wert dieser Regelung für diesen speziellen Vergleich liegt darin, dass die Offenheit und der Preisvorteil von GLM-5.3-Flash die beiden Dinge sind, die es zum vernünftigen Standard machen, und eine geschlossene Route mit 0 % Aufschlag ist der Weg, wie Sie Ling-3.1-flash weiterhin dagegen testen können, ohne eine Anbieterbeziehung hinzuzufügen.

Ling-3.1-flash ist nicht in unserem Katalog — eine Abfrage gegen unsere öffentliche Modell-API liefert not-found für das Modell unter InclusionAI, und dieser Artikel wird nicht andeuten, dass wir es anbieten. Es läuft über Ants eigene API und die Drittplattformen, die das Release führen, was dem ehrlichen Umfang seiner Verfügbarkeit entspricht.

Die produktive Form dieses Vergleichs ist nicht Entweder-oder. GLM-5.3-Flash ist offen, am günstigsten, multimodal, zuverlässiger bei Wissensfragen und über 23 Anbieter verfügbar — das ist ein Standardpfad. Ling-3.1-flash punktet mit Durchsatz und TTFT bei agentischen Schleifen, und der Preis dafür ist, dass es geschlossen, rein textbasiert, teurer und über weniger Türen erreichbar ist. Leite die interaktive und latenzempfindliche Arbeit zum schnellen Modell, behalte die Batch-, wissensintensive und multimodale Arbeit auf dem offenen und setze einen Fallback dazwischen, damit ein langsames Upstream nicht zu einem langsamen Produkt wird.

Welches soll man wählen?

Wenn Ihre Bewertungskriterien Leistungsfähigkeit, Kosten, Offenheit und Modalität sind, gewinnt GLM-5.3-Flash dieses Duell – und das nicht besonders knapp: ein höherer Indexwert, das beste Wissenszuverlässigkeitsprofil in dieser Klasse, ein GPQA Diamond von 0,912, MIT-Gewichte, Videoeingabe, der halbe Preis und 23 Anbieter dahinter. Wenn zu Ihren Kriterien gehört, wie lange ein Nutzer wartet oder wie viele sequenzielle Aufrufe eine Aufgabe durchführen kann, ist Ling-3.1-flash das Modell, das zum Abschluss kommt, und seine vierfache Generierungsrate ist kein Rundungsfehler in einem Agent-Loop.

Woran es sich entscheiden würde, ist ein Serving-Detail, das kein Anbieter in vergleichbarer Form veröffentlicht: der tatsächlich gelieferte Durchsatz für deine Workload, über deinen Anbieter. Beide Modelle bedienen dasselbe OpenAI-kompatible Chat-Completions-Format, was bedeutet, dass ein Wechsel zwischen ihnen eine Konfigurationsänderung statt einer Migration ist — und für zwei Modelle, die ein Indexpunkt und ein Faktor vier bei der Geschwindigkeit trennen, ist es eine bessere Nutzung eines Nachmittags, diese eine Zahl am eigenen Traffic zu messen, als eine weitere Benchmark-Zeile zu lesen.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash, in English, captured 2026-10-07. The header reads 'GLM 5.3 Flash', 'ctx 1M tokens', 'Max output 128K', inputs 'text + image + video' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-08-26. Four rounded stat tiles read '$0.07', '$0.25', '4.20 s' and '10.00 s' — the input and output rates rendered to two decimals, then the median first-token latency and another latency figure. The description states '320B total / 18B active parameters, 1M-token context, text + image + video in, text out.' The PRICING panel lists 'Input / 1M tokens $0.075', 'Output / 1M tokens $0.250' and 'Cache read / 1M $0.017'. A code sample shows base_url https://api.orcarouter.ai/v1 with model 'z-ai/glm-5.3-flash'.Screenshot of the Artificial Analysis model page for GLM 5.3 Flash, in English, captured 2026-10-07, marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 42, 53.0 output tokens per second, $0.25 cost per Intelligence Index task, 180M output tokens generated across the index, input $0.15 with an 83% cache discount and output $0.50 per 1M tokens, a 1M context window, text and image input, 320B total parameters with 18.8B active parameters, and a licence of MIT with weights on Hugging Face. The summary line calls the model 'notably slow (75)'.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert