Une carte hero générée intitulée « Qwen 4 Max vs Kimi K3 », avec pour sous-titre « La promesse des poids ouverts rencontre la livraison des poids ouverts » et trois badges en forme de pilule portant les mentions « Poids promis, non livrés », « Poids de K3 disponibles le 27 juillet 2026 » et « Licence MIT modifiée ». Une ligne de pied de page indique « Conférence Yunqi d'Alibaba, Hangzhou ». Style éditorial vectoriel plat sur fond blanc avec un dégradé bleu vers cyan et le logo OrcaRouter intégré en bas à droite.
Engineering & Research

Qwen 4 Max vs Kimi K3 : la promesse des poids ouverts rencontre la livraison des poids ouverts

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Moonshot AI a publié Kimi K3 le 16 juillet 2026, puis a fait ce dont la plupart des laboratoires ne font que parler : il a publié les poids. Le checkpoint de 2 800 milliards de paramètres est arrivé le 27 juillet 2026 sous une licence MIT modifiée, onze jours après le lancement. Pendant ce temps, la conférence Yunqi du 22 septembre 2026 a servi à annoncer Qwen 4 Max comme le produit phare d'une famille Qwen 4 à quatre niveaux, qui comprend un Qwen 4 27B à poids ouverts — un niveau promis, mais pas livré. Ces deux faits constituent la comparaison. Tout le reste concernant Qwen 4 Max est actuellement inconnu, et l'écart entre un niveau ouvert promis et un niveau livré est précisément là où cette confrontation a réellement quelque chose à dire.

Ce que Kimi K3 a mis sur la table en juillet

Kimi K3 est un mélange d'experts de 2,8 billions de paramètres qui active 16 experts sur 896 par token, ce qui mobilise environ 104 milliards de paramètres à chaque étape. Il dispose d'une fenêtre de contexte de 1 048 576 tokens en entrée comme en sortie et accepte en entrée du texte, des images et des vidéos, avec une sortie texte. Son API first-party est facturée à 3,00 $ par million de tokens en entrée, 15,00 $ par million de tokens en sortie et 0,30 $ par million de tokens en entrée mis en cache, et les tarifs tiers sont inférieurs.

L’architecture est la partie que l’aperçu d’Alibaba lui-même reprend en écho. Kimi K3 repose sur Kimi Delta Attention et Attention Residuals, dont Moonshot affirme qu’ils offrent une efficacité de mise à l’échelle environ 2,5 fois meilleure que celle de Kimi K2 et un décodage jusqu’à 6,3 fois plus rapide sur des contextes d’un million de tokens. C’est le même problème que le QSA de Qwen cherche à résoudre — rendre l’attention abordable à des longueurs extrêmes —, ce qui signifie que les deux familles ne rivalisent pas tant sur l’échelle que sur la question de savoir quelle conception d’attention éparse vieillit le mieux.

Les scores publiés par Moonshot lors du lancement, rapportés par le fournisseur et non reproduits à l’époque :

• Indice d'intelligence Artificial Analysis — 57, troisième à l'époque derrière Claude Fable 5 et GPT-5.6 Sol. Ce chiffre a été enregistré sous une révision antérieure de l'indice ; l'indice a depuis été reconstruit deux fois, il s'agit donc d'une lecture historique plutôt que d'une lecture actuelle

• Frontend Code Arena — première place à 1 679 Elo, devant les deux modèles qui l'ont surpassée sur l'indice général

• Terminal-Bench 2.1 — 88,3

• SWE-Marathon — 42, devant Opus 4.8 et GPT-5.6 Sol

• DeepSearchQA — 0,95, première place, et MATH-Vision 0,98, également en première position

• GPQA-Diamond — 0,94

Les propres supports de lancement de Moonshot admettent que K3 reste devancé par Claude Fable 5 et GPT-5.6 Sol en termes de capacités globales, ce qui est une phrase plus utile que toutes les revendications de première place ci-dessus. Ce qui est intéressant dans la forme des chiffres, c'est qu'un modèle classé troisième sur l'indice général termine premier sur le code frontend et premier sur la recherche à long horizon — un profil qui indique que l'indice agrégé cache un outil spécialisé plutôt qu'il ne décrit un outil généraliste.

A generated scoreboard titled 'Qwen 4 Max vs Kimi K3 - the scoreboard'. Left column 'Qwen 4 Max' reads announced not released, Qwen 4 27B promised, not published, not published, not published, not published. Right column 'Kimi K3' reads GA since July 16 2026, published July 27 2026, Modified MIT, $3.00 per 1M tokens, $15.00 per 1M tokens, 1,048,576 tokens. Footer reads 'Kimi K3 figures from Moonshot's launch material; Qwen 4 Max status per Alibaba's September 22 2026 Yunqi conference.'

Ce qu'Alibaba a promis, et ce que vaut une promesse

L’annonce de Qwen 4 a nommé quatre niveaux. Qwen 4 Max comme modèle phare, Qwen 4 Flash pour le débit, Qwen 4 Plus comme le juste milieu équilibré, et Qwen 4 27B comme le niveau local à poids ouverts. Liu Da Yiheng, responsable de Qwen LLM, a décrit la famille comme étant entraînée sur une architecture de nouvelle génération et a déclaré qu’elle arriverait bientôt. Il n’y a ni date, ni fiche de modèle, ni identifiant d’API, ni référence cloud, ni prix et aucun score publié pour l’un des quatre.

Deux éléments précis concernant cette annonce sont mal rapportés, et tous deux comptent pour quiconque cherche à planifier en fonction :

• Le chiffre de 5 000 à 10 000 milliards de paramètres associé à la couverture de Qwen 4 n’est pas une spécification de Qwen 4. Il appartient à la feuille de route Qwen 4.5 et Qwen 5. Aucun nombre de paramètres, quel qu’il soit, n’a été publié pour Qwen 4 Max

• Le fait que les noms de niveaux se poursuivent ne reporte pas les spécifications. La fenêtre de contexte, le prix et la licence de Qwen 4 Max sont inconnus ; les chiffres du Qwen3.8-Max déjà déployé — 1 000 000 de tokens à 2,00 $ et 6,00 $ le million — décrivent un modèle différent

La raison pour laquelle le palier 27B est le plus intéressant n'a rien à voir avec les benchmarks. C'est le seul palier de la gamme Qwen 4 qui a toujours été publié sous licence open weights, et la génération Qwen 3.8 a montré tout ce que cela permet : en quelques jours à peine après la mise à disposition des poids 27B, la communauté avait produit des conversions MLX, des quantifications NVFP4 et des fine-tunes de toutes sortes. Un 27B annoncé, c'est un engagement envers un écosystème en aval, et c'est la livraison la plus prévisible de la feuille de route.

Mais le prévisible n'est pas livré. Les poids de Kimi K3 sont un fichier que vous pouvez télécharger aujourd'hui. Les poids de Qwen 4 27B sont une ligne dans une conférence.

Les poids ouverts et les poids exécutables sont des affirmations différentes.

Il y a un piège à considérer Kimi K3 comme la réponse en matière de poids ouverts, et il vaut la peine de le dire clairement, car c’est l’affirmation excessive la plus courante dans la couverture des modèles de frontière chinois. Un mélange d’experts de 2,8 billions de paramètres est un artefact à l’échelle d’un centre de données. Des poids publiés signifient que vous êtes autorisé à l’exécuter, que vous pouvez l’inspecter, le fine-tuner et le quantifier. Ils ne signifient pas que vous pouvez l’exécuter sur une station de travail. Le service efficace d’un checkpoint de cette taille nécessite des dizaines d’accélérateurs, et le travail de quantification qui suit une publication ouverte — les variantes de type NVFP4 et REAP qui circulent en quelques semaines — vise autant à rendre le modèle exploitable en service qu’à le rendre plus petit.

Ainsi, l’interprétation honnête de la licence de Kimi K3 est plus restrictive, et pourtant toujours importante : il s’agit d’un modèle de pointe auditable, modifiable et auto-hébergeable, sous licence MIT modifiée, destiné aux organisations disposant du matériel nécessaire pour le servir. C’est un véritable atout stratégique, et une solution peu adaptée à quiconque a interprété « open weights » comme « tourne sur mon ordinateur portable ».

La même mise en garde s’appliquera à Qwen 4 27B si et quand il sortira — et elle s’applique avec moins d’acuité, car un palier à poids ouverts de 27B est véritablement à l’échelle locale, contrairement à un modèle phare de 2,8 T. C’est précisément pourquoi le palier Qwen 4 27B mérite plus d’attention que le palier Max dans cette comparaison, même si c’est le palier Max que l’annonce a mis en avant.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3), captured September 22 2026, showing the model name, the 1M token context, text and image input with text output, vision, tool and reasoning badges, and a p50 time-to-first-token figure.

La question commerciale sous-jacente à la question de la licence

Le tarif direct de Kimi K3, de 3,00 $ en entrée et 15,00 $ en sortie par million de jetons, relève d'un positionnement haut de gamme, et Moonshot a clairement indiqué qu'il est délibérément fixé au-dessus du segment bon marché du marché chinois. Par rapport à Qwen3.8-Max, à 2,00 $ et 6,00 $, cela représente une fois et demie le tarif d'entrée et deux fois et demie le tarif de sortie — un écart suffisamment important pour qu'une charge de travail doive tenir compte des atouts spécifiques de Kimi K3, notamment le code frontend et la recherche à long horizon, pour que le supplément en vaille la peine.

OrcaRouter route kimi/kimi-k3 aux côtés de la famille Qwen 3.8 sur un seul point de terminaison compatible OpenAI à 0 % de marge, ce qui signifie que c'est le tarif catalogue du fournisseur qui vous est facturé, et non un équivalent majoré. Dans une comparaison où l'écart de prix représente un facteur de 2,5 sur la sortie, l'absence de marge de plateforme n'est pas un détail d'arrondi — une couche de dix pour cent sur un tarif de sortie de 15,00 $ représente 1,50 $ par million de jetons, ce qui dépasse l'intégralité du coût d'entrée du modèle le moins cher dans cette confrontation. Le même point de terminaison prend en charge le basculement automatique ainsi qu'un DSL de routage permettant d'exprimer explicitement une politique, ce qui vous permet d'essayer un modèle présentant le profil de Kimi K3 sur une fraction du trafic de production sans miser tout un chemin sur un fournisseur que vous n'avez jamais utilisé auparavant.

Ce qu'OrcaRouter ne propose pas, c'est Qwen 4 Max ou tout autre modèle Qwen 4, car aucun d'entre eux n'existe encore en tant que produit.

A screenshot of the OrcaRouter models catalogue, captured September 22 2026, showing the filter sidebar (input modalities, context length, input price, status, series), the model card grid and a code sample posting to the OpenAI-compatible endpoint at api.orcarouter.ai.

Ce qu’il faut surveiller et ce qu’il faut ignorer

Trois signaux feraient bouger cette comparaison, et ils sont assez précis pour qu’on les surveille :

• Les poids de Qwen 4 27B. Pas le tableau de benchmarks du palier Max — le checkpoint 27B, sa licence et sa taille. C'est cette sortie qui vous dira si l'engagement d'Alibaba en faveur des poids ouverts dans cette génération est aussi réel que celui de la précédente

• La licence de Qwen 4 Max, le cas échéant. Si Alibaba publie les poids de son modèle phare comme elle l’a fait pour Qwen3.8-Max, l’argument des poids ouverts dans cette confrontation cesse d’être un avantage pour Kimi et devient une égalité

• Une nouvelle lecture indépendante de Kimi K3. Les scores de lancement de Moonshot étaient autodéclarés et l’indice Artificial Analysis a été refondu deux fois depuis, donc le 57 et l’Elo de Frontend Code Arena doivent tous deux être réétalonnés avant d’être comparés à quoi que ce soit d’actuel.

Ce qu'il faut ignorer, c'est tout tableau de spécifications du Qwen 4 Max qui apparaît avant qu'Alibaba ne publie une fiche de modèle, ainsi que toute affirmation selon laquelle les poids ouverts de Kimi K3 le rendent exécutable localement. Ces deux erreurs circulent déjà. En attendant, la comparaison sur laquelle vous pouvez agir oppose deux modèles qui existent : Kimi K3 à un tarif premium, avec des poids livrés et un profil de codage véritablement différencié, et Qwen3.8-Max à moins de la moitié du tarif de sortie, avec une fenêtre fixe d'un million de tokens et ses propres poids. C'est un vrai choix, avec un prix de part et d'autre, et il ne nécessite pas d'attendre qu'une diapositive de conférence devienne un produit.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement