Carte de titre principale générée avec pour titre « GPT-6 Luna vs Kimi K3 » et pour sous-titre « Quatre fois le débit, un trentième du prix », un pied de page indiquant « Prix selon OpenAI et Moonshot AI ; chiffres d’indice selon Artificial Analysis. », et le logo OrcaRouter incrusté en bas à droite.
Guides & Insights

GPT-6 Luna vs Kimi K3 : quatre fois plus de débit, un trentième du prix, une véritable exception

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux modèles, tous deux sortis au cours des trois derniers mois, tous deux positionnés comme l'échelon bon marché d'une famille de pointe, et tous deux se trompent sur ce que signifie « échelon bon marché » de la même manière — c'est-à-dire pas du tout. Kimi K3est le fer de lance à poids ouverts de Moonshot AI, public sous licence MIT modifiée depuis le 27 juillet 2026, au prix de 3,00 $ par million de jetons d'entrée et de 15,00 $ par million de jetons de sortie, les lectures de cache étant facturées 0,30 $. GPT-6 Lunaest l'échelon volume du fournisseur, disponible en général depuis le 22 septembre 2026 à 0,10 $ et 0,50 $, avec les lectures de cache à un centime. Trente fois sur l'entrée, trente fois sur la sortie, et une licence d'un côté que l'autre ne peut offrir à aucun prix.

Ce n’est pas la grille tarifaire qui décide de ce duo, cependant, car elle n’est pas assez proche pour qu’il faille trancher. Ce qui le décide, c’est un chiffre qu’aucun des deux fournisseurs ne met en avant : la vitesse de sortie mesurée. Kimi K3 génère 38,7 jetons par seconde. GPT-6 Luna en génère 153,9. C’est un écart d’un facteur quatre, et pour toute charge de travail où le modèle est un composant à l’intérieur d’une boucle plutôt qu’un point de terminaison auquel une personne s’adresse, une différence de débit d’un facteur quatre change l’architecture plutôt que la facture.

Ce que ces deux-là sont réellement

Kimi K3 est un modèle de mélange d’experts de 2,8 billions de paramètres, avec 104 milliards de paramètres actifs par token, une fenêtre de contexte de 1 048 576 tokens, un plafond de sortie de 1 048 576 tokens, et des poids publiés sur Hugging Face sous une licence MIT modifiée. C’est le modèle à poids ouverts le mieux noté du classement indépendant — premier parmi 112 modèles à poids ouverts — et il occupe la première place du classement WebDev de Code Arena avec 1 679 Elo. Moonshot annonce 88,3 % sur Terminal-Bench 2.0, un chiffre du fournisseur qui n’a pas été reproduit de manière indépendante.

GPT-6 Luna est le petit échelon de la génération GPT-6 d’OpenAI, situé sous GPT-6 Sol à 2,00 $/10,00 $ et bien en dessous du modèle phare GPT-6 Astra à 10,00 $/50,00 $. Entrée texte et image, sortie texte, une fenêtre de 1 050 000 tokens avec 922 000 tokens d’entrée maximum et un plafond de sortie de 128 000 tokens, et un effort de raisonnement sélectionnable de none à low, medium, high, xhigh et max, medium étant la valeur par défaut. Il est fermé, à identifiant unique, et accessible à toute personne disposant d’une clé API.

L’un est un téléchargement. L’autre est un point de terminaison. Les deux sont tarifés au volume. Telle est la forme de la comparaison.

Les cartes, ligne par ligne

Une ligne par dimension, les deux côtés sur chacune :

• Entrée pour 1 M — GPT-6 Luna 0,10 $ vs Kimi K3 3,00 $

• Sortie par 1M — GPT-6 Luna $0.50 vs Kimi K3 $15.00

• Entrée mise en cache par 1 M — GPT-6 Luna 0,01 $ contre Kimi K3 0,30 $, soit un dixième de son propre tarif d’entrée sur les deux cartes

• Clause de contexte long — GPT-6 Luna double l'entrée et le cache et augmente la sortie de 1,5× au-delà de 272 000 tokens d'entrée, appliquée à l'ensemble de la requête, contrairement à Kimi K3, pour lequel aucune clause équivalente n'est publiée sur sa fiche

• Fenêtre de contexte — GPT-6 Luna 1 050 000 tokens avec 922 000 entrées maximum contre Kimi K3 1 048 576 tokens

• Sortie maximale — GPT-6 Luna 128 000 tokens vs Kimi K3 1 048 576 tokens, huit fois le plafond

• Intelligence Index, indépendant — GPT-6 Luna 37 à effort maximal vs Kimi K3 44 à effort maximal, même révision de l'indice

• Score à l'effort par défaut — GPT-6 Luna 29 à son niveau moyen par défaut contre Kimi K3 mesuré à son réglage maximal

• Coût par tâche Index, indépendant — GPT-6 Luna environ 0,07 $ contre Kimi K3 2,00 $

• Tokens de sortie lors de l'exécution de l'index — GPT-6 Luna 150M vs Kimi K3 160M, contre une médiane du classement de 88M ; les deux sont bien plus verbeux que le modèle médian du classement

• Vitesse de sortie, indépendante — GPT-6 Luna 153,9 tokens/sec vs Kimi K3 38,7 tokens/sec

• Poids — GPT-6 Luna fermés, API uniquement vs Kimi K3 publics sur Hugging Face depuis le 27 juillet 2026

Licence — GPT-6 Luna : non applicable vs Kimi K3 Modified MIT, qui n'est pas le même instrument que MIT

• Nombre total de paramètres — GPT-6 Luna non divulgué vs Kimi K3 2 800 milliards, dont 104 milliards sont actifs par token

• Preuve marquante — appel d’outils et boucles agentiques de GPT-6 Luna à un dixième de cent par millier de jetons d’entrée mis en cache, contre Kimi K3, n°1 de Code Arena WebDev à 1 679 Elo, 88,3 % sur Terminal-Bench 2.0 selon le fournisseur, meilleur score parmi les modèles à poids ouverts sur le classement indépendant

• Sur OrcaRouter — GPT-6 Luna absent de notre catalogue vs Kimi K3 routable au prix catalogue de Moonshot

Generated two-column scoreboard titled 'GPT-6 Luna vs Kimi K3 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index at max effort 37, Output speed 153.9 tok/s, Context 1,050,000, Weights closed. Right column Kimi K3 rows: Price in/out $3.00 / $15.00, Cached input $0.30, AA Index at max effort 44, Output speed 38.7 tok/s, Context 1,048,576, Weights Modified MIT. Footer: 'Prices per OpenAI and Moonshot AI; index and speed per Artificial Analysis.'

Le débit est la caractéristique dont personne ne fait la une

Un modèle à 38,7 tokens par seconde et un modèle à 153,9 tokens par seconde ne sont pas le même produit avec des étiquettes de prix différentes. Ce sont des produits différents.

Prenez une tâche où le modèle doit produire une réponse de 1 500 tokens — un résumé, une extraction structurée, un correctif de code avec son explication. À 153,9 tokens par seconde, cette réponse prend environ dix secondes. À 38,7, elle prend environ trente-neuf. Aucun de ces chiffres n’inclut le temps de raisonnement ni la latence réseau, donc l’écart réel est supérieur à un facteur quatre, proportionnellement, et non inférieur.

Maintenant, mettez-le dans une boucle. Un agent qui effectue trente appels au modèle pour accomplir une tâche — planifier, sélectionner un outil, lire le résultat, décider de l’étape suivante, répéter — produit peut-être 15 000 tokens de sortie sur l’ensemble de ces appels. GPT-6 Luna consacre environ 97 secondes à la génération. Kimi K3 y consacre environ 388 secondes. C’est la différence entre une tâche qu’un utilisateur attend et une tâche qu’un utilisateur programme, et aucune permissivité de licence ne change cela.

La verbosité aggrave le problème de vitesse plutôt que de le compenser. Kimi K3 a généré 160 millions de tokens de sortie pour achever l'index indépendant, contre 150 millions pour GPT-6 Luna — ainsi, dans cette évaluation, le modèle le plus lent produisait aussi légèrement plus de tokens, et non moins. Les deux modèles sont tout aussi verbeux l'un que l'autre ; ils ne sont simplement pas aussi rapides l'un que l'autre, et sur une carte facturée à la sortie, être verbeux coûte cher deux fois.

Il faut le dire clairement : ce n'est pas un défaut de Kimi K3. Un modèle à 2,8 billions de paramètres dont 104 milliards actifs effectue plus de travail par token qu'un modèle de gamme inférieure, et le chiffre de débit est une mesure de ce travail. La question pertinente est de savoir si votre charge de travail a besoin de ce travail. Si oui, 38,7 tokens par seconde est le prix de cette capacité. Si ce n'est pas le cas, vous payez pour une délibération que vous n'avez pas demandée, trente fois plus.

Où se trouvent les sept points de K3

Kimi K3 obtient 44 sur l’indice indépendant Intelligence Index à effort maximal. GPT-6 Luna obtient 37 au même réglage. Sept points, sur un composite où un point se situe dans le bruit d’une réexécution — et les deux sont séparés d’environ vingt-huit fois sur le coût par tâche accomplie, 2,00 $ contre environ 0,07 $.

Ces sept points ne sont pas répartis uniformément. La réputation de Kimi K3 se concentre sur le codage et sur le travail logiciel agentique, et c’est la raison d’être du modèle : le classement WebDev de Code Arena le place en tête avec 1 679 Elo, et le chiffre de 88,3 % de Terminal-Bench 2.0 annoncé par le fournisseur est une mesure d’agent de codage. La position de GPT-6 Luna en matière de codage est elle-même un pas en arrière plutôt qu’en avant — son Coding Agent Index se situe à 41, deux points en dessous du GPT-5.6 Luna qu’il remplace, les baisses étant concentrées sur SWE-Atlas-QnA et DeepSWE v1.1. Si votre travail consiste en un agent qui écrit du logiciel sur un dépôt réel, cela représente un écart de sept points dans l’indice et une régression générationnelle de deux points qui vont dans la même direction, et l’argument en faveur de l’offre à bas coût devient nettement plus faible.

Là où les sept points ne sont pas, c'est la classe de travail pour laquelle GPT-6 Luna est tarifé. Classification, extraction, routage, résumé en masse, la boucle interne d'un agent qui a besoin d'un oui ou non rapide — sur ces tâches, les deux modèles produiront la même sortie utilisable dans l'immense majorité des cas, et la différence ne survivra pas au contact de votre propre ensemble d'évaluation. L'indice mesure un composite qui pondère fortement le raisonnement à long horizon et le codage, et ni l'un ni l'autre n'est ce qu'exige une décision de routage.

Une mise en garde qu'il vaut la peine d'associer aux chiffres de l'indice des deux côtés : ce tableau est une évaluation glissante et sa révision compte. Des instantanés antérieurs du même classement plaçaient Kimi K3 nettement plus haut que le 44 que notre capture affiche aujourd'hui, parce que le composite, le harnais et l'ensemble de modèles évoluent tous. Toute comparaison qui s'appuie sur l'écart précis entre deux modèles dans un indice glissant s'appuie sur quelque chose qui ne restera pas stable. L'interprétation honnête est que ces deux modèles se situent dans des bandes de capacités adjacentes à leurs plafonds, et que l'indice ne peut pas vous dire lequel est meilleur pour votre tâche.

L’exception : ce que le MIT modifié vous apporte réellement

La licence de Kimi K3 est la seule dimension sur laquelle GPT-6 Luna n’a de réponse à aucun prix, et elle mérite plus de précision que n’en reçoit habituellement l’expression « poids ouverts ».

Les poids sont publics sur Hugging Face et la licence est Modified MIT, pas MIT. Cette distinction compte : une licence Modified MIT impose généralement des conditions — souvent l'obligation d'afficher une attribution lorsque le modèle est utilisé dans un produit au-delà d'une certaine échelle — et quiconque envisage de bâtir un produit commercial sur les poids devrait lire l'instrument réel plutôt que le nom de famille auquel il ressemble. Ce n'est pas une raison de l'éviter. C'est une raison de ne pas la décrire comme MIT dans un document d'approvisionnement.

Ce que le téléchargement achète est réel et limité. Il achète un plancher de coût, en ce sens qu'une empreinte GPU fixe peut battre une facture à l'usage à volume suffisant. Il achète l'indépendance vis-à-vis de la feuille de route d'un fournisseur — un modèle que vous hébergez ne peut pas être déprécié dans votre dos. Il achète la capacité de fine-tuner sur votre propre distribution. Et il achète l'option de garder les prompts à l'intérieur de votre propre périmètre, ce qui, pour certaines équipes, met fin à la comparaison avant même que le prix ne soit mentionné.

Le coût, c’est le matériel. Un modèle de mélange d’experts de 2 800 milliards de paramètres avec 104 milliards de paramètres actifs n’est pas un modèle qui tourne sur une station de travail. Le servir à un débit de production est un engagement à l’échelle d’un cluster, avec un coût d’investissement, un coût d’exploitation et un profil de latence que vous possédez plutôt que louez. Ce n’est pas un argument contre l’auto-hébergement de Kimi K3 — c’est un argument selon lequel la bonne comparaison n’est pas 15,00 $ par million de tokens de sortie contre 0,00 $, mais 15,00 $ par million de tokens de sortie contre un coût complet par token qui inclut le silicium et les personnes. Pour un petit nombre d’organisations, ce chiffre est inférieur. Pour la plupart, il ne l’est pas, et le point de bascule est plus éloigné que ne le laisse croire la licence.

Exécuter l'un d'eux, ou les deux

Kimi K3 est disponible sur OrcaRouter au prix catalogue de Moonshot, dans le cadre d'une tarification en pass-through, ce qui signifie qu'un changement de tarif d'un fournisseur est effectif de notre côté le jour même. Le basculement automatique est l'élément qui justifie sa place pour ce modèle en particulier : un point de terminaison Kimi K3 auto-hébergé ou tiers qui se dégrade est exactement le scénario où l'on veut que la route bascule sans déploiement, et un modèle à 38,7 jetons par seconde a moins de marge pour absorber un amont lent qu'un modèle rapide.

GPT-6 Luna ne figure pas dans notre catalogue à l'heure où nous écrivons ces lignes et est accessible via l'API propre d'OpenAI, de sorte qu'une équipe qui veut les deux utilise une clé pour Kimi K3 en plus de ce qu'elle utilise déjà pour OpenAI. C'est aussi l'appariement où le DSL de routage fait quelque chose qu'une répartition codée en dur ne peut pas faire : une règle qui envoie le travail de codage et à long horizon à Kimi K3 et tout ce qui est consommé par des programmes et de courte durée à GPT-6 Luna exprime une frontière qui bouge chaque fois que l'un ou l'autre fournisseur publie une nouveauté, et elle bouge sous forme de configuration plutôt que de chemin de code. La fusion de modèles est l'autre configuration qui mérite d'être nommée ici — un panel composé d'un modèle lent et minutieux et d'un modèle rapide et bon marché répondant ensemble, le membre bon marché absorbant le volume et le membre coûteux arbitrant les cas qui comptent, est une forme à laquelle ce couple de modèles s'adapte exceptionnellement bien, car l'asymétrie de coûts entre eux est suffisamment importante pour qu'il soit abordable de consacrer un appel à Kimi K3 à une petite fraction du trafic.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Lequel, et quand

Prenez GPT-6 Luna si votre charge de travail est à gros volume, consommée par des programmes et sensible à la latence. Classification, extraction, routage, synthèse en masse, la boucle interne d'un agent. À 0,10 $/0,50 $ avec une lecture en cache à un cent et un débit quatre fois supérieur à celui de Kimi K3, le calcul n'est pas serré et la différence de latence n'est pas marginale. Définissez explicitement le paramètre effort, car la valeur par défaut est medium et le chiffre phare 37 correspond à un effort maximal, et gardez les appels longs du bon côté de la limite des 272 000 tokens.

Choisissez Kimi K3 si vous avez besoin des poids, si votre travail consiste en du codage agentique contre un véritable dépôt où sa position WebDev et les 88,3 % rapportés par le fournisseur sur Terminal-Bench 2.0 sont les preuves qui comptent, si vous avez besoin d’un plafond de sortie supérieur à 128 000 tokens, ou si votre organisation ne peut pas envoyer d’invites à un point de terminaison fermé. Acceptez 38,7 tokens par seconde comme faisant partie du contrat, et lisez les conditions de la licence MIT modifiée plutôt que de les présumer.

L’erreur que cette comparaison invite à commettre est de considérer le taux trente fois supérieur comme la réponse à une question de capacité. Il est la réponse à une question sur les tokens. La question de la capacité se tranche selon que vous avez besoin des poids ou de la vitesse, et ces deux réponses pointent dans des directions opposées.

Screenshot of the OrcaRouter model page for Kimi K3 showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, a FEATURED badge, the model id kimi/kimi-k3, Vision, Tools, JSON and Reasoning chips, a MoonshotAI attribution dated 2026-07-15, the description of a 2.8-trillion-parameter mixture-of-experts model with a 1M-token context window, input pricing of $3.00 and output of $15.00 per 1M tokens, a p50 time to first token of 8.11s, a p95 of 10.00s, and traffic of 1163.7M tokens over seven days.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement