
GLM-5.3 vs Kimi K3 : Presser une base de 743B ou en construire une de 2.8T — Quel pari est payant ?
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0455Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0247Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0247Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0157Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2646Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligence75Code
- obsidianQwen3.8 27B2026-08-1541Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1251Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0547Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligence49Code
La course chinoise aux modèles à poids ouverts vient de se diviser en deux réponses à la même question. Moonshot AI a construit Kimi K3 de zéro — une base de mélange d’experts de 2,8 billions de paramètres, le plus grand modèle à poids ouverts jamais publié, annoncé le 16 juillet 2026, avec les poids publiés le 27 juillet. GLM-5.3 est le pari inverse : Z.ai a conservé exactement la base de 743 milliards de paramètres qui alimentait GLM-5.2 et a consacré tout le cycle de publication au post-entraînement, arguant que le plafond d’intelligence du modèle de base n’a jamais été le problème. Les deux sont des modèles phares à contexte 1M, axés sur le codage et les agents, et tous deux prétendent être le meilleur modèle de codage ouvert du marché. Ils ne peuvent pas tous deux être la meilleure façon de dépenser le même budget, et les benchmarks se partagent véritablement en deux — ce qui en fait moins une comparaison qu’un référendum sur la façon de construire le prochain modèle de frontière.
Deux paris sur la manière de construire un modèle de pointe.
Z.ai qualifie GLM-5.3 de « deep dig » plutôt que de mise à niveau générationnelle. La base est, à l’octet près, le même modèle de 743B que GLM-5.2 ; la différence réside entièrement dans le post-entraînement, exécuté via le framework open-source slime sur des tâches qui couvrent des sessions d’ingénierie complètes — diagnostiquer, corriger, vérifier et déployer sur de vrais clusters, systèmes de stockage et bases de code, certaines prenant plusieurs jours de travail d’un ingénieur senior. Les gains rapportés par le fournisseur sont importants : un bond de 50 % sur son propre Code Bench, Terminal-Bench 3.0 passant de 4,6 à 28,3, DeepSWE v1.1 de 46,2 à 66,9, et une capacité cyber qui a imposé une revue de sécurité avant que les poids ne soient publiés. Moonshot a pris le chemin inverse. Kimi K3 est une base entièrement nouvelle — 2,8T de paramètres au total avec environ 104B actifs par token (16 des 896 experts), une architecture Kimi Delta Attention, une entrée native d’images et de vidéos, un raisonnement permanent impossible à désactiver, et une fenêtre de contexte de 1M en entrée comme en sortie. Là où Z.ai parie que davantage du même modèle suffit, Moonshot parie que la base elle-même était le plafond.

La confrontation, avec provenance jointe.
Le seul endroit où les deux modèles apparaissent sur la même page est le tableau de lancement de Z.ai, c'est donc là que proviennent les chiffres côte à côte — présentés comme déclarés par le fournisseur, non vérifiés indépendamment. Les chiffres autonomes de Kimi K3 correspondent à ce que Moonshot a publié en juillet et à ce que mesure Artificial Analysis, mais aucun laboratoire neutre n'a encore testé les deux.
• Terminal-Bench 3.0 — GLM-5.3 à 28,3 contre Kimi K3 à 17,4 (tableau de Z.ai). Le plus grand écart de codage de cet affrontement, sur la version la plus récente et la plus difficile.
• Terminal-Bench 2.1 — GLM-5.3 à 88.2 contre Kimi K3 à 88.3. Un coude-à-coude.
• DeepSWE v1.1 — GLM-5.3 à 66,9 contre Kimi K3 à 67,5. Kimi gagne d'un cheveu.
• SWE-Marathon v1.1 — GLM-5.3 à 42.5 contre Kimi K3 à 48.1. La meilleure victoire de Kimi en codage.
• ExploitGym — GLM-5.3 à 105/130 contre Kimi K3 à 36/70. Un balayage quasi total pour GLM.
• GDPval-AA v2 (travail de la connaissance) — GLM-5.3 à 1,769 contre Kimi K3 à 1,682.
• Accès — GLM-5.3 : abonnement au plan Coding, poids verrouillés jusqu'à environ le 28 août. Kimi K3 : API disponible à 3 $ / 15 $, poids téléchargeables depuis le 27 juillet.

Le fossé de sécurité est la véritable séparation.
Une fois les benchmarks de codage écartés, la différence décisive est la cybersécurité. GLM-5.3 affiche 84,5 sur CyberGym contre 80,0 pour Kimi K3, et son score ExploitBench de 54,4 est presque le double de celui de Kimi K3 (32,2). Sur ExploitGym, l'écart n'est pas une différence, c'est une autre catégorie — 105 et 130 contre 36 et 70 sur les exécutions de 2 heures et de 6 heures. C'est pourquoi ces deux lancements semblent si différents en pratique : les poids de Kimi K3 sont rendus publics sous une licence MIT modifiée, tandis que ceux de GLM-5.3 sont retenus pour un durcissement de la sécurité, précisément parce que, selon Z.ai, le modèle est si doué pour trouver et exploiter des failles que publier les poids immédiatement semblait irresponsable. Si votre travail consiste à auditer le code d'autrui ou à défendre le vôtre contre la chasse automatisée aux vulnérabilités, c'est le point le plus pertinent de toute la comparaison — et c'est aussi le moins vérifié de manière indépendante.
Là où Kimi K3 riposte
Les victoires de Kimi K3 se concentrent là où GLM-5.3 est le plus faible : le travail de dépôt à long horizon. Il conserve l'avantage sur DeepSWE et SWE-Marathon, mène sur Toolathlon Verified, et sa fenêtre de sortie d'un million de jetons signifie qu'il peut écrire une base de code entière ou une longue trace d'agent en une seule passe. Son raisonnement en continu diffuse la trace complète à l'API, ce que les développeurs ont jugé bien plus utile pour déboguer les agents que des explications sommaires opaques — avec la contrepartie opérationnelle que vous devez renvoyer les champs de raisonnement textuellement entre les appels d'outils, et qu'il n'y a pas de préremplissage d'assistant. Sur l'indice d'intelligence d'Artificial Analysis, Kimi K3 se situe à 57, quatrième au classement général, avec un coût d'environ 0,94 $ par tâche mesuré sur son ensemble standard. C'est aussi le modèle le plus cher jamais publié par un laboratoire chinois : 3 $ par million de jetons d'entrée et 15 $ par million de sortie, un tarif de niveau Sonnet, alors que GLM-5.3 ne peut pas encore être tarifé par jeton car il n'existe que dans un plan d'abonnement.
La réalité de l'accès et du coût
Kimi K3 est sur OrcaRouter dès maintenant, au prix catalogue de Moonshot — 3 $ / 15 $ par million de jetons, 0,30 $ pour les lectures en cache, marge de 0 % — si bien que le travail d'agent avec contexte de 1M est appelable avec la même clé que le reste de votre pile, et les poids ouverts constituent l'option de sortie si vous voulez auto-héberger. GLM-5.3 est celui qui est difficile à obtenir : un abonnement mensuel de 18 $ à 168 $ avec un système de points qui dépense des crédits à 6,9x sur l'entrée et 24x sur la sortie, un tarif hors pointe qui réduit de moitié la consommation en dehors de 14:00–18:00 heure de la Chine, et pas d'API par jeton avant la fin de l'examen de sécurité. La couche de routage aplatit en réalité cette asymétrie pour la fenêtre de deux semaines : lorsque l'API de GLM-5.3 arrive sur la même clé, un appel de panneau peut exécuter les deux fleurons du codage ouvert sur vos propres tâches et laisser le juge les concilier — et si vous ne pouvez pas attendre, les poids déjà diffusés de Kimi K3 en font le seul des deux que vous pouvez emporter entièrement sur site dès aujourd'hui.

Quel pari est payant
Le verdict honnête après une semaine est que les deux paris portent leurs fruits, mais sur des charges de travail différentes. Si votre travail est axé sur le terminal, proche de la sécurité, et orchestré par des agents, GLM-5.3 est la direction la plus solide selon les preuves publiées par Z.ai — et l'écart en cybersécurité est suffisamment grand pour qu'il vaille la peine d'attendre deux semaines afin de vérifier les poids par vous-même. Si votre travail implique de longues sessions sur des dépôts, des entrées multimodales, ou tout ce où vous avez besoin des poids en main aujourd'hui, Kimi K3 est le seul des deux qui soit réellement disponible — et ses victoires en matière de dépôts profonds sont celles que vous pouvez vérifier dès maintenant via son API en direct. La seule chose à retenir : chaque chiffre de cette comparaison en tête-à-tête provient du propre tableau de Z.ai, alors traitez les écarts de codage comme directionnels jusqu'à ce qu'un laboratoire indépendant teste les deux. C'est exactement le genre de vérification que l'attente de deux semaines apportera.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
