
GPT-6 Luna vs Kimi K3 : quatre fois plus de débit, un trentième du prix, une véritable exception
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Deux modèles, tous deux sortis au cours des trois derniers mois, tous deux positionnés comme l'échelon bon marché d'une famille de pointe, et tous deux se trompent sur ce que signifie « échelon bon marché » de la même manière — c'est-à-dire pas du tout. Kimi K3est le fer de lance à poids ouverts de Moonshot AI, public sous licence MIT modifiée depuis le 27 juillet 2026, au prix de 3,00 $ par million de jetons d'entrée et de 15,00 $ par million de jetons de sortie, les lectures de cache étant facturées 0,30 $. GPT-6 Lunaest l'échelon volume du fournisseur, disponible en général depuis le 22 septembre 2026 à 0,10 $ et 0,50 $, avec les lectures de cache à un centime. Trente fois sur l'entrée, trente fois sur la sortie, et une licence d'un côté que l'autre ne peut offrir à aucun prix.
Ce n’est pas la grille tarifaire qui décide de ce duo, cependant, car elle n’est pas assez proche pour qu’il faille trancher. Ce qui le décide, c’est un chiffre qu’aucun des deux fournisseurs ne met en avant : la vitesse de sortie mesurée. Kimi K3 génère 38,7 jetons par seconde. GPT-6 Luna en génère 153,9. C’est un écart d’un facteur quatre, et pour toute charge de travail où le modèle est un composant à l’intérieur d’une boucle plutôt qu’un point de terminaison auquel une personne s’adresse, une différence de débit d’un facteur quatre change l’architecture plutôt que la facture.
Ce que ces deux-là sont réellement
Kimi K3 est un modèle de mélange d’experts de 2,8 billions de paramètres, avec 104 milliards de paramètres actifs par token, une fenêtre de contexte de 1 048 576 tokens, un plafond de sortie de 1 048 576 tokens, et des poids publiés sur Hugging Face sous une licence MIT modifiée. C’est le modèle à poids ouverts le mieux noté du classement indépendant — premier parmi 112 modèles à poids ouverts — et il occupe la première place du classement WebDev de Code Arena avec 1 679 Elo. Moonshot annonce 88,3 % sur Terminal-Bench 2.0, un chiffre du fournisseur qui n’a pas été reproduit de manière indépendante.
GPT-6 Luna est le petit échelon de la génération GPT-6 d’OpenAI, situé sous GPT-6 Sol à 2,00 $/10,00 $ et bien en dessous du modèle phare GPT-6 Astra à 10,00 $/50,00 $. Entrée texte et image, sortie texte, une fenêtre de 1 050 000 tokens avec 922 000 tokens d’entrée maximum et un plafond de sortie de 128 000 tokens, et un effort de raisonnement sélectionnable de none à low, medium, high, xhigh et max, medium étant la valeur par défaut. Il est fermé, à identifiant unique, et accessible à toute personne disposant d’une clé API.
L’un est un téléchargement. L’autre est un point de terminaison. Les deux sont tarifés au volume. Telle est la forme de la comparaison.
Les cartes, ligne par ligne
Une ligne par dimension, les deux côtés sur chacune :
• Entrée pour 1 M — GPT-6 Luna 0,10 $ vs Kimi K3 3,00 $
• Sortie par 1M — GPT-6 Luna $0.50 vs Kimi K3 $15.00
• Entrée mise en cache par 1 M — GPT-6 Luna 0,01 $ contre Kimi K3 0,30 $, soit un dixième de son propre tarif d’entrée sur les deux cartes
• Clause de contexte long — GPT-6 Luna double l'entrée et le cache et augmente la sortie de 1,5× au-delà de 272 000 tokens d'entrée, appliquée à l'ensemble de la requête, contrairement à Kimi K3, pour lequel aucune clause équivalente n'est publiée sur sa fiche
• Fenêtre de contexte — GPT-6 Luna 1 050 000 tokens avec 922 000 entrées maximum contre Kimi K3 1 048 576 tokens
• Sortie maximale — GPT-6 Luna 128 000 tokens vs Kimi K3 1 048 576 tokens, huit fois le plafond
• Intelligence Index, indépendant — GPT-6 Luna 37 à effort maximal vs Kimi K3 44 à effort maximal, même révision de l'indice
• Score à l'effort par défaut — GPT-6 Luna 29 à son niveau moyen par défaut contre Kimi K3 mesuré à son réglage maximal
• Coût par tâche Index, indépendant — GPT-6 Luna environ 0,07 $ contre Kimi K3 2,00 $
• Tokens de sortie lors de l'exécution de l'index — GPT-6 Luna 150M vs Kimi K3 160M, contre une médiane du classement de 88M ; les deux sont bien plus verbeux que le modèle médian du classement
• Vitesse de sortie, indépendante — GPT-6 Luna 153,9 tokens/sec vs Kimi K3 38,7 tokens/sec
• Poids — GPT-6 Luna fermés, API uniquement vs Kimi K3 publics sur Hugging Face depuis le 27 juillet 2026
Licence — GPT-6 Luna : non applicable vs Kimi K3 Modified MIT, qui n'est pas le même instrument que MIT
• Nombre total de paramètres — GPT-6 Luna non divulgué vs Kimi K3 2 800 milliards, dont 104 milliards sont actifs par token
• Preuve marquante — appel d’outils et boucles agentiques de GPT-6 Luna à un dixième de cent par millier de jetons d’entrée mis en cache, contre Kimi K3, n°1 de Code Arena WebDev à 1 679 Elo, 88,3 % sur Terminal-Bench 2.0 selon le fournisseur, meilleur score parmi les modèles à poids ouverts sur le classement indépendant
• Sur OrcaRouter — GPT-6 Luna absent de notre catalogue vs Kimi K3 routable au prix catalogue de Moonshot

Le débit est la caractéristique dont personne ne fait la une
Un modèle à 38,7 tokens par seconde et un modèle à 153,9 tokens par seconde ne sont pas le même produit avec des étiquettes de prix différentes. Ce sont des produits différents.
Prenez une tâche où le modèle doit produire une réponse de 1 500 tokens — un résumé, une extraction structurée, un correctif de code avec son explication. À 153,9 tokens par seconde, cette réponse prend environ dix secondes. À 38,7, elle prend environ trente-neuf. Aucun de ces chiffres n’inclut le temps de raisonnement ni la latence réseau, donc l’écart réel est supérieur à un facteur quatre, proportionnellement, et non inférieur.
Maintenant, mettez-le dans une boucle. Un agent qui effectue trente appels au modèle pour accomplir une tâche — planifier, sélectionner un outil, lire le résultat, décider de l’étape suivante, répéter — produit peut-être 15 000 tokens de sortie sur l’ensemble de ces appels. GPT-6 Luna consacre environ 97 secondes à la génération. Kimi K3 y consacre environ 388 secondes. C’est la différence entre une tâche qu’un utilisateur attend et une tâche qu’un utilisateur programme, et aucune permissivité de licence ne change cela.
La verbosité aggrave le problème de vitesse plutôt que de le compenser. Kimi K3 a généré 160 millions de tokens de sortie pour achever l'index indépendant, contre 150 millions pour GPT-6 Luna — ainsi, dans cette évaluation, le modèle le plus lent produisait aussi légèrement plus de tokens, et non moins. Les deux modèles sont tout aussi verbeux l'un que l'autre ; ils ne sont simplement pas aussi rapides l'un que l'autre, et sur une carte facturée à la sortie, être verbeux coûte cher deux fois.
Il faut le dire clairement : ce n'est pas un défaut de Kimi K3. Un modèle à 2,8 billions de paramètres dont 104 milliards actifs effectue plus de travail par token qu'un modèle de gamme inférieure, et le chiffre de débit est une mesure de ce travail. La question pertinente est de savoir si votre charge de travail a besoin de ce travail. Si oui, 38,7 tokens par seconde est le prix de cette capacité. Si ce n'est pas le cas, vous payez pour une délibération que vous n'avez pas demandée, trente fois plus.
Où se trouvent les sept points de K3
Kimi K3 obtient 44 sur l’indice indépendant Intelligence Index à effort maximal. GPT-6 Luna obtient 37 au même réglage. Sept points, sur un composite où un point se situe dans le bruit d’une réexécution — et les deux sont séparés d’environ vingt-huit fois sur le coût par tâche accomplie, 2,00 $ contre environ 0,07 $.
Ces sept points ne sont pas répartis uniformément. La réputation de Kimi K3 se concentre sur le codage et sur le travail logiciel agentique, et c’est la raison d’être du modèle : le classement WebDev de Code Arena le place en tête avec 1 679 Elo, et le chiffre de 88,3 % de Terminal-Bench 2.0 annoncé par le fournisseur est une mesure d’agent de codage. La position de GPT-6 Luna en matière de codage est elle-même un pas en arrière plutôt qu’en avant — son Coding Agent Index se situe à 41, deux points en dessous du GPT-5.6 Luna qu’il remplace, les baisses étant concentrées sur SWE-Atlas-QnA et DeepSWE v1.1. Si votre travail consiste en un agent qui écrit du logiciel sur un dépôt réel, cela représente un écart de sept points dans l’indice et une régression générationnelle de deux points qui vont dans la même direction, et l’argument en faveur de l’offre à bas coût devient nettement plus faible.
Là où les sept points ne sont pas, c'est la classe de travail pour laquelle GPT-6 Luna est tarifé. Classification, extraction, routage, résumé en masse, la boucle interne d'un agent qui a besoin d'un oui ou non rapide — sur ces tâches, les deux modèles produiront la même sortie utilisable dans l'immense majorité des cas, et la différence ne survivra pas au contact de votre propre ensemble d'évaluation. L'indice mesure un composite qui pondère fortement le raisonnement à long horizon et le codage, et ni l'un ni l'autre n'est ce qu'exige une décision de routage.
Une mise en garde qu'il vaut la peine d'associer aux chiffres de l'indice des deux côtés : ce tableau est une évaluation glissante et sa révision compte. Des instantanés antérieurs du même classement plaçaient Kimi K3 nettement plus haut que le 44 que notre capture affiche aujourd'hui, parce que le composite, le harnais et l'ensemble de modèles évoluent tous. Toute comparaison qui s'appuie sur l'écart précis entre deux modèles dans un indice glissant s'appuie sur quelque chose qui ne restera pas stable. L'interprétation honnête est que ces deux modèles se situent dans des bandes de capacités adjacentes à leurs plafonds, et que l'indice ne peut pas vous dire lequel est meilleur pour votre tâche.
L’exception : ce que le MIT modifié vous apporte réellement
La licence de Kimi K3 est la seule dimension sur laquelle GPT-6 Luna n’a de réponse à aucun prix, et elle mérite plus de précision que n’en reçoit habituellement l’expression « poids ouverts ».
Les poids sont publics sur Hugging Face et la licence est Modified MIT, pas MIT. Cette distinction compte : une licence Modified MIT impose généralement des conditions — souvent l'obligation d'afficher une attribution lorsque le modèle est utilisé dans un produit au-delà d'une certaine échelle — et quiconque envisage de bâtir un produit commercial sur les poids devrait lire l'instrument réel plutôt que le nom de famille auquel il ressemble. Ce n'est pas une raison de l'éviter. C'est une raison de ne pas la décrire comme MIT dans un document d'approvisionnement.
Ce que le téléchargement achète est réel et limité. Il achète un plancher de coût, en ce sens qu'une empreinte GPU fixe peut battre une facture à l'usage à volume suffisant. Il achète l'indépendance vis-à-vis de la feuille de route d'un fournisseur — un modèle que vous hébergez ne peut pas être déprécié dans votre dos. Il achète la capacité de fine-tuner sur votre propre distribution. Et il achète l'option de garder les prompts à l'intérieur de votre propre périmètre, ce qui, pour certaines équipes, met fin à la comparaison avant même que le prix ne soit mentionné.
Le coût, c’est le matériel. Un modèle de mélange d’experts de 2 800 milliards de paramètres avec 104 milliards de paramètres actifs n’est pas un modèle qui tourne sur une station de travail. Le servir à un débit de production est un engagement à l’échelle d’un cluster, avec un coût d’investissement, un coût d’exploitation et un profil de latence que vous possédez plutôt que louez. Ce n’est pas un argument contre l’auto-hébergement de Kimi K3 — c’est un argument selon lequel la bonne comparaison n’est pas 15,00 $ par million de tokens de sortie contre 0,00 $, mais 15,00 $ par million de tokens de sortie contre un coût complet par token qui inclut le silicium et les personnes. Pour un petit nombre d’organisations, ce chiffre est inférieur. Pour la plupart, il ne l’est pas, et le point de bascule est plus éloigné que ne le laisse croire la licence.
Exécuter l'un d'eux, ou les deux
Kimi K3 est disponible sur OrcaRouter au prix catalogue de Moonshot, dans le cadre d'une tarification en pass-through, ce qui signifie qu'un changement de tarif d'un fournisseur est effectif de notre côté le jour même. Le basculement automatique est l'élément qui justifie sa place pour ce modèle en particulier : un point de terminaison Kimi K3 auto-hébergé ou tiers qui se dégrade est exactement le scénario où l'on veut que la route bascule sans déploiement, et un modèle à 38,7 jetons par seconde a moins de marge pour absorber un amont lent qu'un modèle rapide.
GPT-6 Luna ne figure pas dans notre catalogue à l'heure où nous écrivons ces lignes et est accessible via l'API propre d'OpenAI, de sorte qu'une équipe qui veut les deux utilise une clé pour Kimi K3 en plus de ce qu'elle utilise déjà pour OpenAI. C'est aussi l'appariement où le DSL de routage fait quelque chose qu'une répartition codée en dur ne peut pas faire : une règle qui envoie le travail de codage et à long horizon à Kimi K3 et tout ce qui est consommé par des programmes et de courte durée à GPT-6 Luna exprime une frontière qui bouge chaque fois que l'un ou l'autre fournisseur publie une nouveauté, et elle bouge sous forme de configuration plutôt que de chemin de code. La fusion de modèles est l'autre configuration qui mérite d'être nommée ici — un panel composé d'un modèle lent et minutieux et d'un modèle rapide et bon marché répondant ensemble, le membre bon marché absorbant le volume et le membre coûteux arbitrant les cas qui comptent, est une forme à laquelle ce couple de modèles s'adapte exceptionnellement bien, car l'asymétrie de coûts entre eux est suffisamment importante pour qu'il soit abordable de consacrer un appel à Kimi K3 à une petite fraction du trafic.

Lequel, et quand
Prenez GPT-6 Luna si votre charge de travail est à gros volume, consommée par des programmes et sensible à la latence. Classification, extraction, routage, synthèse en masse, la boucle interne d'un agent. À 0,10 $/0,50 $ avec une lecture en cache à un cent et un débit quatre fois supérieur à celui de Kimi K3, le calcul n'est pas serré et la différence de latence n'est pas marginale. Définissez explicitement le paramètre effort, car la valeur par défaut est medium et le chiffre phare 37 correspond à un effort maximal, et gardez les appels longs du bon côté de la limite des 272 000 tokens.
Choisissez Kimi K3 si vous avez besoin des poids, si votre travail consiste en du codage agentique contre un véritable dépôt où sa position WebDev et les 88,3 % rapportés par le fournisseur sur Terminal-Bench 2.0 sont les preuves qui comptent, si vous avez besoin d’un plafond de sortie supérieur à 128 000 tokens, ou si votre organisation ne peut pas envoyer d’invites à un point de terminaison fermé. Acceptez 38,7 tokens par seconde comme faisant partie du contrat, et lisez les conditions de la licence MIT modifiée plutôt que de les présumer.
L’erreur que cette comparaison invite à commettre est de considérer le taux trente fois supérieur comme la réponse à une question de capacité. Il est la réponse à une question sur les tokens. La question de la capacité se tranche selon que vous avez besoin des poids ou de la vitesse, et ces deux réponses pointent dans des directions opposées.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
