Eine Hero-Titelkarte für GLM-5.2 vs. Kimi K3 mit dem Untertitel 'Günstiger und schneller oder größer und besser', drei abgerundeten Pill-Badges mit der Aufschrift '1M-Token-Kontext jeweils', 'AA-Index 34 vs. 44' und '$1,40 / $4,40 vs. $3,00 / $15,00', einer Fußzeile mit dem Text 'Anbieter-Preislisten und Artificial Analysis, 23.09.2026' sowie dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

GLM-5.2 vs. Kimi K3: Günstiger und schneller oder größer und besser?

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

GLM-5.2 und Kimi K3 erschienen Mitte 2026 im Abstand von einem Monat zueinander und kehren einander nahezu perfekt um. Kimi K3, veröffentlicht am 2026-07-16, mit offenen Gewichten nachgereicht am 2026-07-27, ist das größere und auf dem Papier bessere Modell: 2,8 Billionen Parameter, davon 104 Milliarden aktiv, und der höhere Wert in praktisch jedem Benchmark, gegen den die beiden getestet wurden. GLM-5.2 ist seit dem 2026-06-16 draußen, ist mit 753 Milliarden Parametern, davon 40 Milliarden aktiv, das kleinere der beiden und kostet pro Ausgabe-Token etwa ein Drittel, antwortet im Median schneller und erscheint unter MIT statt unter einer maßgeschneiderten Lizenz mit Umsatzschwellen.

Das ist die Entscheidung in einem Absatz. Was folgt, sind die Belege dahinter – die Preisrechnung für einen Auftrag, den Sie tatsächlich ausführen könnten, die Messungen, bei denen die beiden so nah beieinanderliegen, dass der Unterschied Rauschen ist, und eine gängige Zahl, die nicht mit der daneben gedruckten Zahl vergleichbar ist.

Wo die beiden stehen

Beide sind in der Regel über die eigenen APIs ihrer Anbieter verfügbar, beide lassen sich auf OrcaRouter routen, und beide haben herunterladbare Gewichte. Die Unterschiede, die zählen, bevor Sie auch nur in die Nähe eines Benchmarks kommen:

• Veröffentlicht — GLM-5.2 am 2026-06-16 vs. Kimi K3 am 2026-07-16 (Modellseiten von Artificial Analysis; OrcaRouters eigene Modellseite für Kimi K3 datiert es einen Tag früher, den 2026-07-15)

• Gewichte — GLM-5.2 offen unter MIT vs. Kimi K3 offen unter der Kimi K3 License, die eine separate Vereinbarung ab 20 Mio. USD Jahresumsatz mit Model-as-a-Service sowie eine prominente Namensnennung ab 100 Mio. monatlichen Nutzern vorschreibt (interne Forschung und Entwicklung ist ausgenommen)

• Größe — GLM-5.2 753B gesamt / 40B aktiv vs. Kimi K3 2,8T gesamt / 104B aktiv

• Kontext — GLM-5.2 1.000.000 Tokens vs. Kimi K3 1.048.576 Tokens

• Input — GLM-5.2: Text rein, Text raus vs. Kimi K3: Text und Bilder rein, Text raus

• Veröffentlichte maximale Ausgabe — GLM-5.2 128.000 Token vs. nicht veröffentlicht auf der OrcaRouter-Seite von Kimi K3

Bei OrcaRouter liegen beide hinter einem einzigen Schlüssel an einem einzigen OpenAI-kompatiblen Endpunkt unter https://api.orcarouter.ai/v1, und wir geben den Listenpreis des Anbieters unverändert weiter, ohne einen Aufschlag — jede unten genannte Zahl ist also die Zahl des Anbieters, nicht unsere.

Was eine Million Tokens kostet, bei einer Aufgabe, die etwas kostet

Zuerst die Preislisten der Anbieter, abgelesen von den eigenen Preisseiten der Anbieter am 23.09.2026. Z.ai führt GLM-5.2 mit 1,40 $ pro Million Eingabe-Token, 0,26 $ pro Million gecachte Eingabe-Token und 4,40 $ pro Million Ausgabe-Token. Moonshot führt Kimi K3 mit 3,00 $ Eingabe, 0,30 $ Cache-Lesen, 15,00 $ Ausgabe – plus eine Cache-Schreibgebühr von 3,00 $ pro Million für einen Fünf-Minuten-Cache und 6,00 $ pro Million für einen Ein-Stunden-Cache. Das sind veröffentlichte Preise, keine unabhängig geprüften, und jeder der beiden Anbieter kann sie ändern.

Setzen Sie sie für eine Aufgabe ein, die überwiegend aus Lesen besteht: eine Überprüfung einer Codebasis mit 600.000 Tokens mit einer schriftlichen Antwort von 8.000 Tokens. Bei GLM-5.2 sind das 0,6 × 1,40 $ = 0,84 $ für die Eingabe plus 0,008 × 4,40 $ = 0,035 $ für die Ausgabe, also etwa 0,88 $. Bei Kimi K3 sind es 0,6 × 3,00 $ = 1,80 $ plus 0,008 × 15,00 $ = 0,12 $, also etwa 1,92 $. Grob das 2,2-Fache der Kosten für dieselbe Aufgabe.

Führen Sie es jetzt erneut aus, wobei sich die Codebasis bereits im Cache des Anbieters befindet. Die Eingabezeile sinkt auf den Cache-Lese-Tarif, und die beiden Preise, die um den Faktor 2,1 auseinanderlagen, werden zu $0,26 gegenüber $0,30 pro Million – eine Lücke von 15 %. Dies ist die am wenigsten diskutierte Zahl im Vergleich und diejenige, die für einen Agenten am wichtigsten ist, der bei jedem Turn denselben Kontext erneut liest. Sie trägt außerdem ein Sternchen: Kimi K3 rechnet das Schreiben des Caches separat ab, und die Seite von GLM-5.2 nennt überhaupt keine Schreibgebühr, sodass ein Kaltstart auf Kimi K3 deutlich mehr kostet, als der Schlagzeilenpreis von $3,00 vermuten lässt.

• Ein 600k-Token-Lesevorgang mit einer 8k-Antwort — GLM-5.2 ca. 0,88 $ vs. Kimi K3 ca. 1,92 $

• Die gleiche gecachte Eingabezeile — GLM-5.2 $0,16 vs. Kimi K3 $0,18 pro 600k Token

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

Das unabhängige Modell stimmt bei der Richtung überein, aber nicht bei der Größenordnung. Artificial Analysis mischt Cache-Treffer-, Eingabe- und Ausgabe-Tokens in einem Verhältnis von 7:2:1 und addiert die Reasoning-Tokens, die ein Modell tatsächlich verbraucht; seine Zahlen für diese beiden – abgelesen am 23.09.2026 unter seinem Index v4.3.2 – setzen GLM-5.2 auf 0,902 US-Dollar pro Million gemischter Tokens gegenüber 2,31 US-Dollar für Kimi K3 und die Kosten für die Absolvierung einer seiner Evaluierungsaufgaben auf 0,96 US-Dollar gegenüber 2,00 US-Dollar. Ein einmaliger Durchlauf des vollständigen Intelligence Index kostet 1.559 US-Dollar mit GLM-5.2 und 3.658 US-Dollar mit Kimi K3.

In diesem Kostenmodell steckt ein kontraintuitives Detail. Kimi K3 verbraucht weniger Output-Tokens pro Aufgabe als GLM-5.2 – 48.000 gegenüber 64.000 – und auch weniger Reasoning-Tokens, 32.000 gegenüber 51.000. Es ist das sparsamere Modell pro Arbeitseinheit und kostet pro Aufgabe trotzdem rund doppelt so viel, weil sein Preis pro Token beim Input das 2,1-Fache und beim Output das 3,4-Fache beträgt. Günstig pro Aufgabe und günstig pro Token sind unterschiedliche Eigenschaften, und hier handelt es sich um eine Paarung, bei der sie in entgegengesetzte Richtungen weisen.

Das Kontextfenster und was tatsächlich hineinpasst

Die beiden liegen auf dem Papier innerhalb von 5 % beieinander: 1.000.000 Token gegenüber 1.048.576. Das als Sieg für Kimi K3 zu berichten, wäre albern. Beide sind Million-Token-Modelle, und das Kontextfenster ist kein Unterscheidungsmerkmal; die ehrliche Frage ist, was jedes von ihnen noch mit Text anfangen kann, der mitten darin vergraben ist.

Das ist es, was die Long-Context-Reasoning-Bewertung von Artificial Analysis misst, und es ist eine der größeren Lücken im Datensatz: Kimi K3 erzielt 89 % gegenüber den 78 % von GLM-5.2. Wenn es Ihre Aufgabe ist, ein großes Korpus zu laden und Fragen zu stellen, bei denen Fakten von den entgegengesetzten Enden daraus verknüpft werden müssen, sind die zusätzlichen 48.576 Token nicht der Grund, Kimi K3 zu wählen – der Elf-Punkte-Vorsprung bei langem Kontext ist es.

Die Untergrenze unter dem Fenster unterscheidet sich ebenfalls. GLM-5.2 gibt eine maximale Ausgabe von 128.000 Token an; die Seite von Kimi K3 gibt keine entsprechende Zahl an, also werden wir keine angeben. Wenn Sie lange Dokumente generieren statt sie zu lesen, sollten Sie diese Asymmetrie vor dem Kauf eines der beiden mit Ihrer eigenen Arbeitslast abgleichen.

Geschwindigkeit: die eine Achse, die GLM-5.2 klar für sich beansprucht

Zwei unabhängige Messungen weisen hier in dieselbe Richtung, was gerade deshalb erwähnenswert ist, weil sie nicht in allem übereinstimmen.

Unsere eigenen Routing-Daten aus den sieben Tagen bis zum 23.09.2026 zeigen, dass GLM-5.2 mit einem Median von 3,28 Sekunden bis zum ersten Token antwortet – gegenüber 8,09 Sekunden bei Kimi K3 – und 68,1 Token pro Sekunde streamt – gegenüber 43,4. Die p95-Zeit bis zum ersten Token liegt bei beiden Modellen exakt bei 10,00 Sekunden. Artificial Analysis misst in separater Messung für GLM-5.2 68,2 Ausgabe-Token pro Sekunde gegenüber 36,7 bei Kimi K3, 41,29 Sekunden Ende-zu-Ende gegenüber 72,13 sowie 33,95 Sekunden bis zur ersten Antwort gegenüber 58,52.

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

Die beiden Quellen weichen in einem Punkt voneinander ab, und das ist es wert, kenntlich gemacht statt glattgebügelt zu werden. Artificial Analysis sieht Kimi K3 bei der rohen Zeit bis zum ersten Token leicht vorn, 4,08 Sekunden gegenüber 4,62, während unser eigenes Routing GLM-5.2 bei p50 nahezu zweieinhalbmal so schnell macht. Unterschiedliche Endpunkte, unterschiedliche Upstream-Anbieter, unterschiedliche Zeitfenster. Betrachten Sie die Durchsatzrichtung – GLM-5.2 deutlich schneller – als belastbar, und jede einzelne Zeit-bis-zum-ersten-Token-Angabe, unsere wie ihre, als Eigenschaft einer bestimmten Woche.

Es gibt außerdem eine Zahl auf unserer GLM-5.2-Seite, die wir nicht stillschweigend auslassen werden: Über dieselben sieben Tage zeigt sie eine Fehlerrate von 9,2 % gegenüber 0,26 % bei Kimi K3. Ein so großer Abstand dürfte etwa ebenso gut auf eine schlechte Woche für die Upstream-Anbieter, die GLM-5.2 bedienen, zurückzuführen sein wie auf eine Eigenschaft des Modells, und sieben Tage sind kein ausreichend langes Fenster, um den Unterschied zu erkennen. Es ist genau die Art von Problem, zu deren Lösung es Routing gibt – wenn ein Anbieter bei einer von elf Anfragen ausfällt, verschiebt automatisches Failover den Traffic, ohne dass jemand den Bereitschaftsdienst alarmieren muss.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

Benchmarks: ein echter Rundumsieg, aber knapper als die Schlagzeile

Kimi K3 gewinnt fast alles, worauf beide Modelle getestet wurden. Dies sind Artificial-Analysis-Werte gemäß Indexrevision v4.3.2, beide Modelle in ihrer maximalen Reasoning-Konfiguration, abgelesen am 23.09.2026:

• Intelligenz-Index — Kimi K3 44 vs. GLM-5.2 34

• AA-Briefcase v1.1 — 1510 vs. 1233

• GDPval-AA v2.1 — 1524 vs. 1358

• AutomationBench-AA — 58 % vs. 28 %

• Terminal-Bench 4.0 — 13 % vs. 1 %

• SciCode — 59 % vs. 51 %

• Humanity's Last Exam — 47 % vs. 41 %

• GDP.pdf — 22 % vs. 10 %

• AA-LCR v1.1 — 89 % vs. 78 %

• CritPt — 23 % vs. 21 %

Zwei Vorbehalte, bevor irgendjemand einen Screenshot von dieser Liste macht.

Zuerst die Index-Revision. Die Berichterstattung zum Launch von Kimi K3 im Juli nannte es mit 57 im Intelligence Index, GLM-5.2 mit 51. Die heute live abrufbaren Seiten geben 44 und 34 an. Dabei handelt es sich nicht um dieselbe Messung — Artificial Analysis überarbeitet den Index und bewertet Modelle daran neu, und eine Juli-Zahl neben eine September-Zahl zu stellen, ist der leichteste Fehler, den man bei dieser Paarung machen kann. Die Richtung ist über jeden Snapshot hinweg stabil; die absoluten Zahlen sind über Revisionen hinweg nicht vergleichbar.

Zweitens: die Stufen. Terminal-Bench 4.0 mit 13 % und 1 % ist eine harte Bewertung, und auf dieser Höhe sagt das Verhältnis mehr als jede der beiden Zahlen. AA-Omniscience, das prüft, ob ein Modell die Grenzen seines eigenen Wissens kennt, führt GLM-5.2 mit 4 gegenüber den 20 von Kimi K3 – eine Untergrenze, über die man Bescheid wissen sollte, wenn man vorhat, eines der beiden unbeaufsichtigt laufen zu lassen.

Noch eine Sache, die Artificial Analysis zum GLM-5.2-Listing vermerkt: Es markiert die Konfiguration mit maximalem Reasoning als veraltet zugunsten des neueren GLM-5.3. Das ändert nichts an den obigen Zahlen, die eine Momentaufnahme von GLM-5.2 zum Zeitpunkt der Messung sind, aber es bedeutet, dass Z.ais Roadmap über dieses Modell hinausgegangen ist. Auf einem gerouteten Endpoint kostet das einen Model-String statt einer Migration – das ist das Hauptargument dafür, keinen dieser beiden Namen fest in deine Anwendung zu verdrahten.

Agenten und Tool-Nutzung: Wo die Kluft am größten ist

Wenn ein Block dieser Tabelle den Kauf entscheiden sollte, dann dieser. Agentische Arbeit mit langem Zeithorizont ist der Bereich, in dem der Vorsprung von Kimi K3 am größten und am beständigsten ist:

• AutomationBench-AA — 58 % vs. 28 %, eine Differenz von 30 Punkten

• GDPval-AA v2.1 — 1524 vs. 1358

• AA-Briefcase v1.1 — 1510 vs. 1233

• Terminal-Bench 4.0 — 13 % vs. 1 %

Moonshots eigenes Veröffentlichungsmaterial stützt sich auf dieselbe Geschichte – die Veröffentlichung der K3-Gewichte erfolgte zusammen mit einem technischen Bericht, der den Expert-Parallel-Trainingsstack des Anbieters und ein Agent-Environment-Harness abdeckt –, aber Anbietermaterial ist Anbietermaterial, und die oben genannten Zahlen sind die unabhängigen.

Der Drittanbieter-Aggregator LLM Stats, der über einen gemeinsamen Benchmark-Satz einen eigenen Composite berechnet, gelangt aus einer anderen Richtung zum selben Schluss: Von den elf Benchmarks, die er für beide Modelle bewertet, gewinnt Kimi K3 alle elf, und seine Kategorie-Werte sehen Kimi K3 bei Tool-Nutzung (30,8 vs. 19,6), Agenten (38,3 vs. 29,6) und Coding (42,3 vs. 34,8) vorn. Das sind die eigenen Composite-Werte von LLM Stats nach eigener Gewichtung, auf einem gemeinsamen Satz, der nicht groß ist; behandeln Sie sie daher als Bestätigung und nicht als Laborergebnis. Elf von elf ist immer noch keine knappe Sache.

Programmieren

Gleiche Richtung, kleinerer Abstand. Bei den Coding-Evaluierungen, die Artificial Analysis für beide bewertet, führt Kimi K3 bei SciCode mit 59 % zu 51 %; im gemeinsamen Set von LLM Stats gewinnt es DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench und Terminal-Bench 2.1. Die schmeichelhaften Zahlen von GLM-5.2 – 99,2 % bei AIME 2026, 94,4 % bei HMMT 2025, 91,2 % bei GPQA, wie von Drittanbieter-Aggregatoren übernommen – sind vom Anbieter gemeldet und nicht reproduziert, und die meisten davon messen Wettbewerbsmathematik statt Softwareentwicklung.

Die praktische Einschätzung: Für einen Coding-Agenten, der lange läuft, viele Dateien bearbeitet und sich von seinen eigenen Fehlern erholen muss, ist der Agentik-Vorsprung von Kimi K3 das relevantere Signal als die Mathe-Ergebnisse beider Modelle. Für einen schnellen, günstigen, weitgehend auf einzelne Anfragen ausgelegten Code-Assistenten wiegt der Durchsatzvorteil von GLM-5.2 schwerer als die Benchmark-Lücke.

Wo sie nah genug beieinanderliegen, dass es keine Rolle spielt

• Preis für gecachte Eingabe — 0,26 $ vs. 0,30 $ pro Million, eine Differenz von 15 % gegenüber einer Differenz von 3,4x bei der Ausgabe

• Kontextfenster — 1.000.000 vs. 1.048.576 Tokens

• p95 Zeit bis zum ersten Token — 10,00 s vs. 10,00 s bei unserem eigenen Routing

• CritPt — 23 % vs. 21 %

• Mathematik — LLM Stats setzt GLM-5.2 in seinem Mathematik-Gesamtwert knapp vorne (41,4 vs. 40,9), während Kimi K3 bei Mathematik mit Bildern führt; nach der vorliegenden Evidenz beherrscht keines der beiden Modelle die Arithmetik

Wer Ihnen erzählt, eines dieser Modelle sei dem anderen durchweg doppelt überlegen, liest nur eine einzige Zeile der Tabelle.

Wähle GLM-5.2, wenn…

Sie bezahlen die Rechnung, und die Rechnung ist die Begrenzung. GLM-5.2 kostet etwa ein Drittel des Ausgabepreises, ist auch bei der Cache-Zeile günstiger, MIT-lizenziert ohne Umsatzschwelle, gegen die man prüfen müsste, im Median schneller und beim Streaming deutlich schneller, und sein Million-Token-Fenster liegt nah genug an dem von Kimi K3, dass der Unterschied nie etwas entscheiden wird. Wenn es bei Ihrer Arbeitslast um Text rein und Text raus geht und sie überwiegend aus Lesen statt aus langen Ketten von Tool-Aufrufen besteht, dann sind die zusätzlichen Benchmark-Punkte bei Kimi K3 Punkte, die Ihre Anwendung nie einfahren wird.

Nimm Kimi K3, wenn …

Die Arbeit ist agentisch und lang. Die 30-Punkte-Lücke bei AutomationBench, die Vorsprünge bei GDPval und AA-Briefcase, der Elf-Punkte-Vorsprung beim Long-Context-Reasoning und der Durchmarsch im gemeinsamen Set von LLM Stats weisen alle in dieselbe Richtung: Kimi K3 ist das bessere Modell, dem man eine mehrstufige Aufgabe übergeben und dann weggehen kann. Es ist außerdem das einzige der beiden, das Bilder akzeptiert. Dafür zahlen Sie pro Aufgabe ungefähr doppelt so viel, und wenn Ihr Arbeitsset stark gecacht ist, zahlen Sie weniger als doppelt so viel — aber was dafür spricht, ist nicht der Preis und nicht die Geschwindigkeit.

Beide sind auf OrcaRouter mit einem einzigen Schlüssel gegen einen einzigen OpenAI-kompatiblen Endpunkt routbar, zu den Listenpreisen der Anbieter, ohne Aufschlag, und beide stehen hinter demselben automatischen Failover. Das ist der günstigste Weg, um herauszufinden, welche davon Ihre Workload tatsächlich möchte, denn der Wechsel zwischen ihnen ist ein Modell-String und kein Vertrag.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert