Une carte de titre principale pour GLM-5.2 vs Kimi K3, avec le sous-titre « Moins cher et plus rapide, ou plus grand et meilleur », trois badges arrondis en forme de pilule indiquant « 1M token context each », « AA Index 34 vs 44 » et « $1.40 / $4.40 vs $3.00 / $15.00 », une ligne de pied de page indiquant « Vendor rate cards and Artificial Analysis, 2026-09-23 », et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

GLM-5.2 vs Kimi K3 : moins cher et plus rapide, ou plus grand et meilleur

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

GLM-5.2 et Kimi K3 sont arrivés à un mois d'intervalle au milieu de 2026 et sont presque parfaitement l'inverse l'un de l'autre. Kimi K3, dont la sortie a eu lieu le 16 juillet 2026 et les poids ouverts le 27 juillet 2026, est le plus grand et, sur le papier, le meilleur modèle : 2,8 billions de paramètres, dont 104 milliards actifs, et le score le plus élevé sur pratiquement tous les benchmarks sur lesquels les deux ont été évalués. GLM-5.2 est disponible depuis le 16 juin 2026, est le plus petit des deux avec 753 milliards de paramètres, dont 40 milliards actifs, et coûte environ un tiers du prix par token de sortie, répond plus vite à la médiane, et est distribué sous licence MIT plutôt que sous une licence sur mesure avec des déclencheurs liés au chiffre d'affaires.

Voilà la décision en un paragraphe. Ce qui suit en constitue les preuves — l’arithmétique des prix sur une tâche que vous pourriez réellement exécuter, les mesures où les deux sont assez proches pour que la différence ne soit que du bruit, et un chiffre populaire qui n’est pas comparable au chiffre imprimé à côté.

Où en sont les deux

Les deux sont généralement disponibles via les API propres à leurs fournisseurs, les deux sont routables sur OrcaRouter, et les deux ont des poids téléchargeables. Les différences qui comptent avant même d’approcher un benchmark :

• Sortie — GLM-5.2 le 2026-06-16 vs Kimi K3 le 2026-07-16 (pages de modèles d'Artificial Analysis ; la propre page de modèle d'OrcaRouter pour Kimi K3 le date un jour plus tôt, 2026-07-15)

• Poids — GLM-5.2 ouvert sous licence MIT vs Kimi K3 ouvert sous la licence Kimi K3, qui exige un accord séparé au-delà de 20 M$ de revenus annuels de modèle en tant que service et une attribution bien en évidence au-delà de 100 millions d'utilisateurs mensuels (la R&D interne est exemptée)

• Taille — GLM-5.2 753B au total / 40B actifs vs Kimi K3 2,8T au total / 104B actifs

• Contexte — GLM-5.2 1 000 000 de jetons vs Kimi K3 1 048 576 jetons

• Entrée — GLM-5.2 : texte en entrée, texte en sortie vs Kimi K3 : texte et images en entrée, texte en sortie

• Sortie maximale publiée — GLM-5.2 128 000 tokens vs non publiée sur la page OrcaRouter de Kimi K3

Sur OrcaRouter, les deux se trouvent derrière une seule clé sur un point de terminaison compatible OpenAI à https://api.orcarouter.ai/v1, et nous répercutons directement le prix catalogue du fournisseur sans ajouter de marge — ainsi, chaque chiffre ci-dessous est celui du fournisseur, pas le nôtre.

Ce que coûte un million de jetons, pour un travail qui coûte quelque chose

Les tarifs des fournisseurs d'abord, relevés directement sur les pages de tarification des fournisseurs eux-mêmes le 23 septembre 2026. Z.ai affiche GLM-5.2 à 1,40 $ par million de jetons d'entrée, 0,26 $ par million de jetons d'entrée mis en cache et 4,40 $ par million de jetons de sortie. Moonshot affiche Kimi K3 à 3,00 $ en entrée, 0,30 $ en lecture de cache, 15,00 $ en sortie — auxquels s'ajoutent des frais d'écriture de cache de 3,00 $ par million pour un cache de cinq minutes et de 6,00 $ par million pour un cache d'une heure. Ce sont là des prix publiés, et non audités de manière indépendante, et chacun de ces fournisseurs peut les modifier.

Mettez-les sur une tâche qui consiste principalement à lire : une revue de base de code de 600 000 tokens avec une réponse écrite de 8 000 tokens. Sur GLM-5.2, cela représente 0,6 x 1,40 $ = 0,84 $ pour l’entrée, plus 0,008 x 4,40 $ = 0,035 $ pour la sortie, soit environ 0,88 $. Sur Kimi K3, cela représente 0,6 x 3,00 $ = 1,80 $, plus 0,008 x 15,00 $ = 0,12 $, soit environ 1,92 $. Environ 2,2 fois le coût pour la même tâche.

Maintenant, relancez-le avec la base de code déjà présente dans le cache du fournisseur. La ligne d’entrée tombe au tarif de lecture du cache, et les deux prix qui étaient séparés d’un facteur 2,1 deviennent 0,26 $ contre 0,30 $ par million — un écart de 15 %. C’est le chiffre le moins discuté de la comparaison et celui qui importe le plus à un agent qui relit le même contexte à chaque tour. Il comporte aussi un astérisque : Kimi K3 facture séparément l’écriture dans le cache et la page de GLM-5.2 ne mentionne aucun frais d’écriture, donc un démarrage à froid coûte sensiblement plus cher sur Kimi K3 que ne le suggère le tarif affiché de 3,00 $.

• Une lecture de 600k tokens avec une réponse de 8k — GLM-5.2 environ 0,88 $ contre Kimi K3 environ 1,92 $

• La même ligne d'entrée mise en cache — GLM-5.2 0,16 $ vs Kimi K3 0,18 $ par 600 k tokens

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

Le modèle indépendant s'accorde sur la direction mais pas sur l'ampleur. Artificial Analysis combine les tokens de cache-hit, d'entrée et de sortie selon un ratio 7:2:1 et ajoute les tokens de raisonnement qu'un modèle brûle réellement, et ses chiffres pour ces deux modèles — relevés le 2026-09-23 selon son indice v4.3.2 — placent GLM-5.2 à 0,902 $ par million de tokens combinés, contre 2,31 $ pour Kimi K3, et le coût d'accomplissement de l'une de ses tâches d'évaluation à 0,96 $, contre 2,00 $. Exécuter l'Intelligence Index complet une fois coûte 1 559 $ sur GLM-5.2 et 3 658 $ sur Kimi K3.

Il y a un détail contre-intuitif enfoui dans ce modèle de coûts. Kimi K3 utilise moins de jetons de sortie par tâche que GLM-5.2 — 48 000 contre 64 000 — et moins de jetons de raisonnement, 32 000 contre 51 000. C’est le modèle le plus économique par unité de travail et il coûte pourtant environ deux fois plus cher par tâche, parce que son prix par jeton est 2,1 fois supérieur en entrée et 3,4 fois en sortie. Économique par tâche et économique par jeton sont des propriétés différentes, et c’est un cas où elles pointent dans des directions opposées.

La fenêtre de contexte, et ce qui y tient réellement

Les deux sont à moins de 5 % l’un de l’autre sur le papier : 1 000 000 de tokens contre 1 048 576. Présenter cela comme une victoire de Kimi K3 serait ridicule. Tous deux sont des modèles à un million de tokens et la fenêtre n’est pas un facteur différenciant ; la question honnête est de savoir ce que chacun peut encore faire avec du texte enfoui au milieu de celle-ci.

C'est ce que mesure l'évaluation du raisonnement à long contexte d'Artificial Analysis, et c'est l'un des écarts les plus marqués de l'ensemble de données : Kimi K3 obtient 89 %, contre 78 % pour GLM-5.2. Si votre travail consiste à charger un vaste corpus et à poser des questions qui exigent de relier des faits situés aux deux extrémités de celui-ci, les 48 576 tokens supplémentaires ne sont pas la raison de choisir Kimi K3 — la marge de onze points en contexte long l'est.

Le plancher sous la fenêtre diffère également. GLM-5.2 annonce une sortie maximale de 128 000 jetons ; la page de Kimi K3 n’annonce pas de chiffre équivalent, nous n’allons donc pas en fournir un. Si vous générez de longs documents plutôt que de les lire, cette asymétrie mérite d’être comparée à votre propre charge de travail avant d’acheter l’un ou l’autre.

Vitesse : l'unique axe que GLM-5.2 maîtrise totalement

Deux mesures indépendantes vont ici dans le même sens, ce qu'il vaut la peine de souligner précisément parce qu'elles ne s'accordent pas sur tout.

Nos propres données de routage, sur les sept jours jusqu'au 2026-09-23, montrent que GLM-5.2 répond en un temps médian de 3,28 secondes jusqu'au premier token, contre 8,09 secondes pour Kimi K3, et diffuse 68,1 tokens par seconde contre 43,4. Le temps jusqu'au premier token au p95 des deux modèles est exactement de 10,00 secondes. Artificial Analysis, qui effectue ses mesures séparément, situe GLM-5.2 à 68,2 tokens de sortie par seconde contre 36,7 pour Kimi K3, à 41,29 secondes de bout en bout contre 72,13, et à 33,95 secondes jusqu'à la première réponse contre 58,52.

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

Les deux sources divergent sur un point, et il vaut la peine de le signaler plutôt que de le gommer. Artificial Analysis place Kimi K3 légèrement en tête sur le temps brut jusqu'au premier token, 4,08 secondes contre 4,62, tandis que notre propre routage donne GLM-5.2 presque deux fois et demie plus rapide au p50. Des points de terminaison différents, des fournisseurs en amont différents, des fenêtres différentes. Considérez la tendance en matière de débit — GLM-5.2 nettement plus rapide — comme solide, et considérez tout chiffre unique de temps jusqu'au premier token, le nôtre comme le leur, comme une propriété d'une semaine particulière.

Il y a aussi un chiffre sur notre page GLM-5.2 que nous n’allons pas passer sous silence : sur les mêmes sept jours, elle affiche un taux d’erreur de 9,2 %, contre 0,26 % pour Kimi K3. Un écart de cette taille a à peu près autant de chances de correspondre à une mauvaise semaine pour les fournisseurs en amont qui servent GLM-5.2 qu’à une caractéristique du modèle, et sept jours ne constituent pas une fenêtre suffisamment longue pour faire la différence. C’est le genre de problème que le routage existe pour résoudre — lorsqu’un fournisseur échoue sur une requête sur onze, le basculement automatique déplace le trafic sans que personne ne soit appelé en astreinte.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

Benchmarks : une véritable rafle, plus étroite que ne le laisse entendre le titre

Kimi K3 l’emporte sur presque tout ce sur quoi les deux modèles ont été évalués. Voici les chiffres d’Artificial Analysis selon la révision d’indice v4.3.2, les deux modèles étant dans leur configuration de raisonnement maximal, relevés le 2026-09-23 :

• Indice d'intelligence — Kimi K3 44 vs GLM-5.2 34

• AA-Briefcase v1.1 — 1510 contre 1233

• GDPval-AA v2.1 — 1524 contre 1358

• AutomationBench-AA — 58 % contre 28 %

• Terminal-Bench 4.0 — 13 % contre 1 %

• SciCode — 59 % contre 51 %

• Humanity's Last Exam — 47 % vs 41 %

• GDP.pdf — 22 % vs 10 %

• AA-LCR v1.1 — 89 % contre 78 %

• CritPt — 23 % vs 21 %

Deux mises en garde avant que quiconque ne fasse une capture d’écran de cette liste.

D'abord, la révision de l'indice. La couverture du lancement de Kimi K3 en juillet le citait à 57 sur l'Intelligence Index, avec GLM-5.2 à 51. Les pages en ligne aujourd'hui indiquent 44 et 34. Il ne s'agit pas de la même mesure — Artificial Analysis révise l'indice et réévalue les modèles par rapport à celui-ci, et mettre un chiffre de juillet à côté d'un chiffre de septembre est l'erreur la plus facile à commettre sur ce duo. La direction est stable d'un instantané à l'autre ; les chiffres absolus ne sont pas comparables d'une révision à l'autre.

Deuxièmement, les niveaux. Terminal-Bench 4.0 à 13 % et 1 % est une évaluation difficile, et à cette altitude, le ratio vous en dit plus que chacun de ces deux nombres pris séparément. AA-Omniscience, qui sonde si un modèle connaît les limites de ses propres connaissances, place GLM-5.2 à 4 contre 20 pour Kimi K3 — un plancher qu'il vaut la peine de connaître si vous prévoyez d'exécuter l'un ou l'autre sans supervision.

Une dernière chose qu’Artificial Analysis consigne à propos de la fiche GLM-5.2 : elle marque la configuration de raisonnement maximal comme dépréciée au profit de la plus récente GLM-5.3. Cela ne change aucun des chiffres ci-dessus, qui sont un instantané de GLM-5.2 tel qu’il a été mesuré, mais cela signifie bien que la feuille de route de Z.ai a dépassé ce modèle. Sur un point de terminaison routé, cela coûte une chaîne de modèle plutôt qu’une migration, ce qui est le principal argument pour ne coder en dur ni l’un ni l’autre de ces noms dans votre application.

Agents et utilisation d'outils : là où l'écart est le plus grand

Si un bloc de ce tableau devait décider de l’achat, c’est celui-ci. Le travail agentique à long horizon est le domaine où la marge de Kimi K3 est la plus large et la plus constante :

• AutomationBench-AA — 58 % contre 28 %, un écart de 30 points

• GDPval-AA v2.1 — 1524 contre 1358

• AA-Briefcase v1.1 — 1510 contre 1233

• Terminal-Bench 4.0 — 13 % contre 1 %

Les propres documents de communication de Moonshot s’appuient sur le même récit — la sortie des poids de K3 était accompagnée d’un rapport technique couvrant la pile d’entraînement en parallélisme d’experts du fournisseur et un harnais agent-environnement —, mais les documents d’un fournisseur restent des documents de fournisseur, et les chiffres ci-dessus sont, eux, indépendants.

L'agrégateur tiers LLM Stats, qui applique son propre composite à un ensemble de benchmarks partagé, arrive à la même conclusion par un autre chemin : sur les onze benchmarks qu'il évalue pour les deux modèles, Kimi K3 en remporte onze, et ses scores par catégorie placent Kimi K3 en tête pour l'utilisation d'outils (30,8 vs 19,6), les agents (38,3 vs 29,6) et le codage (42,3 vs 34,8). Il s'agit des composites propres à LLM Stats selon sa propre pondération, sur un ensemble partagé qui n'est pas vaste ; il faut donc les considérer comme une corroboration plutôt que comme un résultat de laboratoire. Onze sur onze, ce n'est toujours pas serré.

Codage

Même direction, marge plus faible. Dans les évaluations de codage, selon les scores d’Artificial Analysis pour les deux, Kimi K3 mène SciCode 59 % à 51 % ; sur l’ensemble partagé de LLM Stats, il s’adjuge DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench et Terminal-Bench 2.1. Les chiffres flatteurs de GLM-5.2 — 99,2 % sur AIME 2026, 94,4 % sur HMMT 2025, 91,2 % sur GPQA tels que relayés par des agrégateurs tiers — sont déclarés par le fournisseur et non reproduits, et la plupart mesurent des mathématiques de compétition plutôt que de l’ingénierie logicielle.

Lecture pratique : pour un agent de codage qui tourne longtemps, modifie de nombreux fichiers et doit se remettre de ses propres erreurs, la marge agentique de Kimi K3 est le signal le plus pertinent, plus que les scores en mathématiques de l’un ou l’autre modèle. Pour un assistant de code rapide, économique et fonctionnant largement en une seule passe, l’avantage de débit de GLM-5.2 vaut plus que le coût de l’écart de benchmark.

Là où ils sont suffisamment proches pour que cela n’ait pas d’importance

• Prix des entrées mises en cache — 0,26 $ vs 0,30 $ par million, un écart de 15 % face à un écart de 3,4x sur les sorties

• Fenêtre de contexte — 1 000 000 vs 1 048 576 tokens

• temps p95 jusqu'au premier token — 10,00 s vs 10,00 s sur notre propre routage

• CritPt — 23 % vs 21 %

• Mathématiques — LLM Stats place GLM-5.2 légèrement en tête sur son score composite en mathématiques (41,4 contre 40,9), tandis que Kimi K3 mène sur les mathématiques avec images ; d’après les éléments disponibles, aucun des deux modèles ne domine l’arithmétique

Quiconque vous dit que l’un de ces modèles vaut deux fois l’autre sur tous les plans ne lit qu’une seule ligne du tableau.

Choisissez GLM-5.2 si…

C’est vous qui payez la facture, et c’est la facture qui est la contrainte. GLM-5.2 coûte environ un tiers du prix de sortie, est également moins cher sur la ligne mise en cache, est sous licence MIT sans seuil de revenus à vérifier, plus rapide à la médiane et bien plus rapide en streaming, et sa fenêtre d’un million de tokens est suffisamment proche de celle de Kimi K3 pour que la différence ne tranche jamais quoi que ce soit. Si votre charge de travail se résume à du texte en entrée et du texte en sortie, et qu’elle consiste surtout à lire plutôt qu’à de longues chaînes d’appels d’outils, les points de benchmark supplémentaires de Kimi K3 sont des points que votre application ne récoltera jamais.

Choisissez Kimi K3 si…

Le travail est agentique et long. L'écart de 30 points sur AutomationBench, les avances sur GDPval et AA-Briefcase, la marge de onze points en raisonnement à long contexte et le balayage de l'ensemble partagé de LLM Stats pointent tous dans la même direction : Kimi K3 est le meilleur modèle à qui confier une tâche à plusieurs étapes et que l'on peut laisser travailler seul. C'est aussi le seul des deux à accepter les images. Vous paierez environ deux fois plus par tâche pour cela, et si votre ensemble de travail est fortement mis en cache, vous paierez moins du double — mais ce qui plaide en sa faveur n'est ni le prix, ni la vitesse.

Les deux sont routables sur OrcaRouter à partir d'une seule clé vers un point de terminaison compatible OpenAI, aux prix catalogue des fournisseurs, sans rien ajouté par-dessus, et tous deux se trouvent derrière le même basculement automatique. C'est la façon la moins chère de découvrir lequel votre charge de travail veut réellement, parce que passer de l'un à l'autre tient à une chaîne de modèle plutôt qu'à un contrat.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement