
Qwen 3.8 contre Kimi K3 : deux géants chinois, et l'un est désormais moins cher
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 177 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Ce sont les deux modèles de pointe chinois les plus importants de 2026, et ils sont proches cousins : tous deux d'énormes systèmes à mélange d'experts parcimonieux, tous deux dotés d'un contexte d'un million de tokens, tous deux multimodaux, tous deux promettant des poids ouverts. Kimi K3 de Moonshot est en réalité le plus grand des deux avec 2,8 T de paramètres au total contre 2,4 T pour Qwen — un rappel utile que le nombre de paramètres n'est pas un classement.
Jusqu'au 3 août 2026, cette comparaison était déséquilibrée d'une manière précise : Kimi K3 disposait d'un indice d'intelligence Artificial Analysis audité de 57,1, d'un classement n°1 en code frontend sur LMArena, de tarifs publiés et de poids fournis, tandis que Qwen3.8-Max n'avait qu'un titre de 2,4 T et rien d'autre. La GA a changé radicalement la donne économique. Qwen publie désormais 2 $ / 6 $ par million de jetons contre 3 $ / 15 $ pour Kimi — ce qui rend le modèle plus grand et mieux éprouvé nettement plus cher.
Une note pour les développeurs — le moyen le plus rapide de trancher est d'exécuter les deux sur vos propres prompts. OrcaRouter regroupe plus de 200 modèles derrière un endpoint compatible OpenAI, vous permettant d'opposer Qwen 3.8 Max à Kimi K3 sur la même tâche sans avoir à connecter deux SDK.
Verdict en bref. Kimi K3 gagne toujours en matière de preuves : un AA Intelligence Index audité de 57,1 (#3), la première place du classement frontend-code de LMArena avec 1679, et des poids ouverts vraiment prêts. Qwen3.8-Max reste non noté par tous les évaluateurs indépendants. Mais GA a donné à Qwen deux véritables avantages. Côté prix, il est désormais nettement moins cher — 2 $ / 6 $ contre 3 $ / 15 $, soit 2,5× de moins en sortie. Et dans le seul test tiers en tête-à-tête qui existe, Qwen a perdu sur le score principal 80 à 83 tout en étant l'agent visiblement plus discipliné : 354 citations de dépôts contre 274, 22 requêtes de passerelle contre 53, et zéro appel d'outil échoué contre deux. Kimi pour la qualité auditée ; Qwen pour une exécution agentique moins chère et plus propre.
Points clés
• Kimi K3 est le plus grand modèle — 2.8T MoE contre 2.4T pour Qwen, soit environ 400B de plus — ce qui est un bon argument contre le fait de considérer le nombre de paramètres comme un indicateur de capacité.
• Qwen3.8-Max est GA depuis le 3 août 2026 à $2 / $6 par 1M forfaitaire, contre les $3 / $15 de Kimi K3 (AA mixte ~2,31 $). Qwen est désormais 2,5× moins cher en sortie.
• Kimi K3 détient le classement audité : AA Intelligence Index 57.1 (#3), derrière seulement Fable 5 et GPT-5.6 Sol, plus LMArena frontend-code #1 (1679). Qwen3.8-Max est toujours non noté.
• Dans le seul test direct (Trilogy AI), Kimi a devancé Qwen 83 à 80 au total — mais Qwen a fait plus de citations de dépôts (354 contre 274), moins de requêtes de passerelle (22 contre 53), et a enregistré zéro appel d’outil échoué (contre deux), avec une note d’utilisation des outils de 9/10 contre 8/10 pour Kimi.
• Qwen annonce désormais des chiffres d'agents et de codage : Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (contre 40,7 pour son prédécesseur) — le tout rapporté par Alibaba.
• Le calendrier d’ouverture favorise toujours Kimi : ses poids sont essentiellement prêts ; ceux de Qwen sont promis dans la semaine, sans licence ni dépôt pour l’instant.
Note de précision : tous les chiffres de qualité de Qwen3.8-Max sont rapportés par Alibaba et non vérifiés par des tiers. Les chiffres de Kimi K3 proviennent d'Artificial Analysis et de LMArena. La comparaison directe est un test unique réalisé par Trilogy AI et doit être considérée comme un simple point de données, et non comme un classement général. Les tarifs de Qwen correspondent à la grille tarifaire GA et remplacent la remise d'aperçu de juillet.
Les spécifications et le prix, côte à côte
Voici les données concrètes, chaque chiffre étant attribué à sa source.
• Fabricant / statut — Qwen3.8-Max : Alibaba ; GA (3 août 2026) ; Kimi K3 : Moonshot ; sortie open-weight
• Architecture — Qwen3.8-Max : ~2,4 T au total, MoE éparse (paramètres actifs encore non divulgués); Kimi K3 : 2,8 T MoE, vision native (Artificial Analysis)
• Fenêtre de contexte — Qwen3.8-Max : 1M de tokens (983 616 avec réflexion ; sortie max 131 072) ; Kimi K3 : 1M de tokens (Artificial Analysis)
• AA Intelligence Index — Qwen3.8-Max : Pas encore noté ; Kimi K3 : 57,1 — #3 (Artificial Analysis)
• Arène / classement — Qwen3.8-Max : pas de score public ; Kimi K3 : Frontend-code #1, 1679 (LMArena)
• Scores rapportés par le fournisseur — Qwen3.8-Max : Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (rapportés par Alibaba) ; Kimi K3 : classement mesuré par un tiers
• Tarification (entrée / sortie) — Qwen3.8-Max : $2.00 / $6.00 par 1M, fixe ; entrée en cache $0.25; Kimi K3 : $3 / $15 par 1M (AA mixte ~$2.31), accès au cache $0.30
• Poids ouverts — Qwen3.8-Max : Promis dans la semaine (pas encore de licence) ; Kimi K3 : Poids ouverts ; poids prêts
• Vitesse — Qwen3.8-Max : p50 TTFT 1,64 s (télémétrie OrcaRouter sur 7 jours) ; Kimi K3 : verbeux et lent (~34 s TTFT, selon AA)
Deux éléments encadrent cette comparaison, et l'un d'eux s'est complètement inversé le 3 août.
D'abord, la relation de prix s'est inversée. Jusqu'en juillet, Kimi K3 était le modèle avec un prix réel et Qwen était le modèle avec un coupon de réduction. Désormais, ils publient tous deux des tarifs, et le modèle mieux éprouvé et plus grand est le plus cher : 3 $ / 15 $ contre 2 $ / 6 $. En sortie — où le raisonnement et la génération de code dépensent leur argent — Kimi coûte 2,5× plus cher. Qwen facture également un tarif fixe sur l'ensemble de son contexte de 1M de tokens, et son entrée en cache à 0,25 $ est légèrement inférieure au taux de cache hit de Kimi à 0,30 $. Pour toute charge de travail à volume élevé, les tarifs de Qwen sont désormais nettement plus avantageux.
Deuxièmement, l'écart de preuve reste inchangé, et c'est la raison pour laquelle Kimi l'emporte toujours. L'indice d'intelligence de 57,1 de Kimi K3 le place en troisième position au classement général, derrière seulement Fable 5 et GPT-5.6 Sol — c'est le verdict d'un évaluateur neutre. Sa première place en frontend-code sur LMArena, avec 1679 points, est un résultat participatif issu de nombreuses comparaisons en aveugle. Les 86,6 de Qwen sur Terminal-Bench et 92,6 sur GPQA Diamond sont des chiffres réels, mais ce sont ceux d'Alibaba, sur un banc d'essai que personne d'autre n'a fait tourner. Un point de repère utile : le prédécesseur Qwen3.7-Max a obtenu 46 sur l'indice AA contre 57,1 pour Kimi, donc Qwen a besoin d'une avancée générationnelle considérable simplement pour revenir à égalité.
Il y a aussi un détail de latence intéressant, car il va à l'encontre du récit habituel. Artificial Analysis mesure Kimi K3 à environ 34 secondes de temps jusqu'au premier token — vraiment lent. La télémétrie GA d'OrcaRouter montre Qwen3.8-Max avec un TTFT p50 de 1,64 seconde. Ces mesures proviennent de sources différentes et ne constituent pas une comparaison contrôlée, mais elles compliquent l'hypothèse de l'ère de la preview selon laquelle Qwen était le plus lent des deux.

Le seul test tête-à-tête, à lire attentivement
C'est le seul affrontement de la série où un tiers a fait s'affronter les deux modèles sur la même tâche, ce qui mérite une lecture attentive plutôt qu'un simple résumé désignant un gagnant.
Trilogy AI a exécuté une tâche de compréhension d'architecture — comprendre un dépôt de code réel et parvenir à une conclusion architecturale correcte — et a évalué les résultats :
• Score global — Qwen3.8-Max : 80 / 100 ; Kimi K3 : 83 / 100
• Citations repo — Qwen3.8-Max : 354 ; Kimi K3 : 274
• Requêtes de passerelle — Qwen3.8-Max : 22; Kimi K3 : 53
• Appels d'outils échoués — Qwen3.8-Max : 0 ; Kimi K3 : 2
• Note d'utilisation d'outils — Qwen3.8-Max : 9 / 10; Kimi K3 : 8 / 10
• Taux de succès du cache — Qwen3.8-Max : >90 % ; Kimi K3 : >90 %
Kimi a remporté le titre par trois points. Mais regardez les colonnes de processus, car pour l'ingénierie agentique, elles comptent plus que le score. Qwen est arrivé à la même conclusion architecturale centrale en utilisant moins de la moitié des requêtes de passerelle tout en produisant 29% de citations d'ancrage supplémentaires et — le détail qui devrait intéresser quiconque construit des agents — zéro appel d'outil échoué contre deux pour Kimi.
Les appels d'outils échoués sont ce qui casse réellement les agents en production. Ils s'enchaînent : un appel malformé produit une erreur que le modèle doit interpréter, ce qui consomme des tours, ce qui risque d'entraîner d'autres erreurs. Un modèle qui effectue 22 requêtes propres là où un autre en fait 53 avec deux échecs est moins coûteux et plus prévisible à exploiter, même s'il obtient trois points de moins sur la réponse. Combiné au tarif de sortie 2,5× moins cher de Qwen, l'économie opérationnelle de cette exécution favorise nettement Qwen.
La prudence est de mise : c'est une seule tâche, un seul évaluateur, une seule exécution. Ce n'est pas une suite de benchmarks et cela ne se généralise pas. L'indice de 57.1 de Kimi et sa première place au classement frontend reposent sur bien plus d'éléments que ce seul test. La conclusion correcte est limitée : sur au moins une tâche agentique réaliste, Qwen a fait preuve de plus de discipline dans l'utilisation des outils, tout en étant légèrement moins bon sur la qualité des résultats.

Coût en pratique : les runs agentiques en volume
Prenez un agent d'analyse de dépôt : 250 000 jetons de contexte de code par exécution, 12 000 jetons de sortie.
• Qwen3.8-Max: 0.25M × $2 = $0.50, plus 0.012M × $6 = $0.072. ≈ $0.57 par exécution.
• Kimi K3 : 0,25M × 3 $ = 0,75 $, plus 0,012M × 15 $ = 0,18 $. ≈ 0,93 $ par exécution.
• À 1 500 exécutions/jour : Qwen ≈ $858/jour ; Kimi ≈ $1 395/jour — environ 16 000 $/mois d’écart.
• Avec la mise en cache sur un dépôt stable : l'entrée en cache de Qwen à $0.25/1M amène le coût de l'exécution à ≈ $0.14 ; le taux de succès du cache de Kimi à $0.30 l'amène à ≈ $0.26.
L'écart est réel aux deux extrémités, et le résultat Trilogy l'amplifie : si Qwen utilise réellement moins de la moitié des requêtes de passerelle pour terminer un travail comparable, la différence de coût effective sur les tâches agentiques est plus large que ce que le barème seul suggère.
Les deux modèles facturent les jetons de réflexion comme sortie, donc les configurations qui demandent beaucoup de raisonnement coûtent plus cher que l'estimation naïve des deux côtés — mais le tarif de 6 $ de Qwen rend cette pénalité 2,5 fois plus petite.
Ouverture : quasi-parité, calendrier différent
C'est sur cet axe que les deux se ressemblent le plus, et la différence est purement une question de disponibilité. Les poids de Kimi K3 sont ouverts et essentiellement prêts. Ceux de Qwen3.8-Max sont promis dans la semaine, sans texte de licence, fiche de modèle ni dépôt pour l'instant — et c'est la licence qui détermine si vous pouvez utiliser un modèle commercialement ou non.
En pratique, aucun de ces deux modèles phares n'est auto-hébergeable par une équipe normale. Qwen à 2,4T représente environ 1,2 To en 4 bits, contre environ 141 Go par H200 ; Kimi à 2,8T est encore plus gros. Les deux nécessitent huit accélérateurs haut de gamme ou plus, et le nombre de paramètres actifs non divulgué d'Alibaba signifie que vous ne pouvez même pas modéliser le débit de Qwen.
C'est pourquoi, annoncé simultanément, le Qwen3.8-27B compte ici. Également en open-weights et, d'après les rapports, fonctionnant dans environ 17 Go de VRAM, il donne à la famille Qwen un véritable argument on-premise que ni le fleuron 2.4T ni le 2.8T ne fournissent. Si les poids ouverts sont votre véritable raison de choisir entre ces deux-là, le 27B change la donne plus que l'un ou l'autre géant.
FAQ
Qwen 3.8 est-il meilleur que Kimi K3 ?
Pas sur la base de preuves auditées. Kimi K3 détient un indice d'intelligence AA indépendant de 57.1 (#3) et la première place de LMArena en frontend-code, tandis que Qwen3.8-Max n'a été noté par aucun évaluateur tiers. Dans l'unique test direct disponible, Kimi a gagné 83 à 80. Les avantages de Qwen sont le prix (sortie 2.5× moins chère) et, dans ce même test, une utilisation des outils plus propre.
Quel modèle est le plus grand ?
Kimi K3, avec 2,8T de paramètres au total contre 2,4T pour Qwen3.8-Max — soit environ 400B de plus. Cependant, aucun des deux ne divulgue suffisamment d'informations pour que cette différence soit significative : Alibaba n'a jamais publié le nombre de paramètres actifs de Qwen, alors que c'est ce chiffre qui détermine réellement le coût de service dans un modèle Mixture-of-Experts.
Lequel est moins cher ?
Qwen3.8-Max, clairement, depuis la GA. Il affiche 2 $ / 6 $ pour 1M contre 3 $ / 15 $ pour Kimi K3 — soit 33 % de moins en entrée et 2,5× de moins en sortie. Le tarif de Qwen est fixe sur tout le contexte de 1M, et son entrée en cache à 0,25 $ est légèrement inférieure au prix du cache-hit de 0,30 $ de Kimi.
Qu'a réellement montré le test comparatif ?
La tâche de compréhension d'architecture de Trilogy AI a attribué 83 à Kimi et 80 à Qwen. Mais Qwen a produit 354 citations de dépôts contre 274 pour Kimi, a utilisé 22 requêtes de passerelle contre 53, a enregistré zéro appel d'outil échoué contre deux, et a obtenu 9/10 sur l'utilisation d'outils contre 8/10 pour Kimi. Kimi a donné la meilleure réponse ; Qwen a été l'agent le plus discipliné. Ce n'est qu'une seule tâche, alors traitez-la comme un point de données plutôt que comme un classement.
Est-ce que Qwen 3.8 Max a quitté la version d’aperçu ?
Oui, le 3 août 2026, avec une grille tarifaire publiée et un endpoint compatible OpenAI et DashScope. La campagne de crédits Qoder de juillet ne décrit plus comment il est vendu.
Lequel est le plus rapide ?
Peut-être Qwen maintenant, ce qui inverse l'hypothèse de l'ère de l'aperçu. Artificial Analysis mesure Kimi K3 à environ 34 secondes de temps jusqu'au premier jeton ; la télémétrie GA sur 7 jours d'OrcaRouter montre Qwen3.8-Max à un TTFT médian de 1,64 seconde. Différentes sources et non une comparaison contrôlée, mais les deux modèles ont une réputation de verbosité, et le TTFT mesuré de Kimi est réellement lent.
Puis-je auto-héberger l'un ou l'autre ?
Pas réaliste à l'échelle des modèles phares — les modèles 2.4T et 2.8T nécessitent huit GPU ou plus de classe H200. Les poids de Kimi sont disponibles dès aujourd'hui ; ceux de Qwen sont promis d'ici la semaine, sans licence pour l'instant. Pour une véritable option sur site, le Qwen3.8-27B annoncé en parallèle (~17 Go de VRAM selon les rapports) est le choix pratique dans la famille Qwen.
En résumé
Qwen 3.8 contre Kimi K3 est le duel le plus serré de cette série, et la disponibilité générale l'a nettement divisé selon deux axes. Kimi K3 conserve la couronne de la qualité grâce à des résultats mesurés par un arbitre : 57,1 à l'Intelligence Index, troisième au classement général, et la première place de LMArena pour le code frontend. Ce ne sont pas des affirmations — ce sont des résultats, et Qwen n'a aucun équivalent.
Ce que Qwen a remporté le 3 août, c'est l'économie, et il l'a emporté de manière décisive : 2 $ / 6 $ contre 3 $ / 15 $, à plat sur un million de jetons, avec une mise en cache légèrement moins chère. Ajoutez la conclusion de Trilogy selon laquelle Qwen a accompli une tâche agentique comparable avec la moitié des requêtes de passerelle et aucun appel d'outil échoué, et Qwen ressemble au modèle le plus efficace sur le plan opérationnel, même là où il est le moins précis. Surveillez deux événements : le premier score indépendant de l'indice d'intelligence pour Qwen3.8-Max, et l'arrivée des poids avec une licence. Si Qwen obtient un score proche de celui de Kimi, 57,1, l'écart de prix rend très difficile de justifier Kimi pour un travail en volume. Jusqu'à ce moment-là, Kimi est le modèle en qui vous avez confiance et Qwen est celui que vous pouvez vous permettre de faire tourner — et la façon honnête de choisir est sur vos propres dépôts.

Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
