
Grok 4.7 vs Kimi K3 : moitié prix, moitié contexte, aucun des poids
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 219 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Prenez un mois de travail de codage agentique de 300 millions de tokens et faites-le passer dans les deux modèles à leurs tarifs catalogue, et le choix cesse de ressembler à une simple querelle de benchmarks. Grok 4.7, que SpaceXAI a publié le 21 septembre 2026, facture 2 $ par million de tokens d'entrée et 6 $ par million de tokens de sortie. Kimi K3, que Moonshot AI a publié le 16 juillet 2026, facture 3 $ et 15 $. Sur ce mois hypothétique — disons 200 M de tokens d'entrée et 100 M de sortie — Grok 4.7 revient à environ 1 000 $ et Kimi K3 à environ 2 100 $. L'écart n'est pas une différence d'arrondi ; c'est le budget d'un modèle supplémentaire. Face à cela, Kimi K3 vous offre une fenêtre de contexte de 1 000 000 de tokens au lieu de 500 000, une entrée vidéo native en plus des images, et des poids téléchargeables. Grok 4.7 vous offre un modèle fermé, plus rapide et moins cher, explicitement entraîné pour le travail en terminal à long horizon que Kimi K3 cible lui aussi. Les deux sont de classe frontière. Ce ne sont pas les mêmes achats.
Les deux modèles, brièvement
Grok 4.7 est le modèle de codage et de travail intellectuel de pointe de SpaceXAI, construit sur un modèle de base plus grand que Grok 4.6 et bénéficiant d’une session d’apprentissage par renforcement plus longue, destinée à des tâches pouvant durer des heures. Il est propriétaire — pas de poids, pas de téléchargement — offre une fenêtre de contexte de 500 000 tokens, accepte en entrée du texte et des images et renvoie du texte, et prend en charge des niveaux d’effort de raisonnement allant de low à xhigh. Son argument principal est la vitesse et le prix : SpaceXAI le positionne comme environ deux fois plus rapide que des modèles comparables pour environ la moitié du prix.
Kimi K3 est le modèle ouvert phare à mélange d'experts de Moonshot AI, le premier modèle ouvert de la classe des trois billions de paramètres : 2,8 billions de paramètres au total, dont 104 milliards actifs par token, fondé sur Kimi Delta Attention et des poids MXFP4 tenant compte de la quantification. Il accepte en entrée du texte, des images et de la vidéo, offre un contexte de 1 000 000 de tokens, exécute le raisonnement en permanence avec un effort configurable, et ses poids sont téléchargeables sous la licence Kimi K3 — utilisation commerciale autorisée, avec restrictions. C'est, par conception, le modèle que vous pouvez ramener chez vous.
C’est toute la différence structurelle entre eux. L’un est un point de terminaison fermé, bon marché et rapide. L’autre est un artefact ouvert, plus coûteux, plus lent, avec deux fois plus de contexte. Tout ce qui suit en découle.
Ce que les benchmarks comparent réellement
C’est là que la plupart des analyses comparant Grok 4.7 et Kimi K3 se trompent, alors il vaut la peine d’être direct : les chiffres publiés des deux modèles ne mesurent en grande partie pas les mêmes choses, et au moins une paire qui semble comparable ne l’est pas.
Commencez par la paire qui est réellement trompeuse. Les documents de lancement de Kimi K3 citent un score de 88,3 à Terminal-Bench 2.1. Ceux de Grok 4.7 citent Terminal-Bench 4.0 à 38,0 %. Il s'agit de versions différentes du benchmark, avec des ensembles de tâches et une notation différents, et les mettre côte à côte suggérerait que Kimi K3 est plus de deux fois supérieur en tant que modèle agentique. Ce n'est pas une lecture défendable, et personne ne devrait la répéter. Les deux chiffres sont aussi déclarés par le fournisseur — aucun n'a été reproduit indépendamment.
Ce qui peut être comparé, c'est le composite indépendant, et là, les deux sont proches. Sur l'actuel Artificial Analysis Intelligence Index, version v4.3.2, Kimi K3 obtient un score de 44 — deuxième sur 113 modèles, le meilleur classement de tout modèle à poids ouverts du classement. Grok 4.7 obtient 46, seizième sur 655. Deux points d'écart, le classement de Kimi K3 ayant été obtenu avec un effort de raisonnement maximal. Sur le composite mixte, ces modèles sont de même niveau.
• Composite indépendant — Grok 4.7 46 sur l'AA Intelligence Index v4.3.2 contre Kimi K3 44 sur la même version. Une égalité en pratique.
• Fenêtre de contexte — 500 000 jetons pour Grok 4.7 contre 1 000 000 jetons pour Kimi K3. Un avantage réel et absolu pour Kimi K3, et la seule différence de spécifications sans réserve aucune.
• Modalités d’entrée — Grok 4.7 texte et image vs Kimi K3 texte, image et vidéo. Kimi K3 est plus large, si votre charge de travail inclut de la vidéo.
• Poids — Grok 4.7 propriétaire, aucun téléchargement vs Kimi K3 à poids ouverts sous la licence Kimi K3. Pour une exigence sur site ou en environnement isolé du réseau, c’est la seule ligne qui compte.
• Prix par million de tokens — Grok 4.7 : 2 $ en entrée / 6 $ en sortie contre Kimi K3 : 3 $ en entrée / 15 $ en sortie, avec le tarif des entrées mises en cache de Kimi à 0,30 $ par million. Grok 4.7 est moins cher sur tous les axes, et nettement moins cher en sortie.
• Contrôle de l'effort de raisonnement — Grok 4.7 de low à xhigh vs Kimi K3 toujours actif avec un effort configurable. Fonctionnellement similaires ; la différence est que Grok 4.7 permet de réduire le raisonnement.
• Preuves agentiques rapportées par le fournisseur — Grok 4.7 Terminal-Bench 4.0 38,0 %, CursorBench 4.0 46,3 %, DeepSWE v1.1 71,0 % (toutes rapportées par le fournisseur) vs Kimi K3 Terminal-Bench 2.1 88,3 %, Frontend Code Arena première place avec 1 679 Elo (rapporté par le fournisseur au lancement). Non comparable — voir ci-dessus.


Où va réellement l'argent
La grille tarifaire sous-estime l’écart, car les deux modèles consomment les tokens différemment. Grok 4.7 est un raisonneur verbeux — Artificial Analysis a mesuré 240 millions de tokens de sortie générés lors de l’exécution de son Intelligence Index, contre une médiane de 92 millions tous modèles confondus. Kimi K3 relève du type opposé de coût élevé : c’est un grand modèle de raisonnement toujours actif, et à 15 $ par million de tokens de sortie, c’est la verbosité que vous achetez.
Ainsi, le modèle de coût honnête n’est pas « 2 $/6 $ contre 3 $/15 $ ». Il correspond aux jetons de sortie par tâche terminée, multipliés par le tarif de sortie, plus les jetons d’entrée, y compris chaque nouvelle tentative, multipliés par le tarif d’entrée. Un modèle qui résout une tâche en une seule longue passe à 6 $ par million peut surpasser un modèle qui nécessite trois tentatives à 15 $ par million, et il peut aussi être battu par lui si les passes du modèle bon marché sont suffisamment longues. C’est une mesure que vous effectuez sur votre propre dépôt, pas une mesure que quelqu’un publie pour vous.
Une asymétrie mérite d'être connue avant de le lancer : Grok 4.6, le prédécesseur de Grok 4.7, applique une falaise tarifaire à 200 000 tokens d'entrée, où une requête qui franchit le seuil voit l'intégralité de la requête refacturée au double du tarif. Le travail en contexte long du côté de Grok nécessite de vérifier ce point par rapport à la grille tarifaire actuelle du modèle que vous déployez, car une fenêtre de 500 000 tokens et une falaise à 200 000 tokens interagissent mal. La tarification de Kimi K3 est uniforme, ce qui est l'avantage le plus discret des deux.
Là où chacun se brise
Les deux modèles ont un mode de défaillance que les supports de lancement ne mettent pas en avant, et ce sont des défaillances différentes.
Du côté de Kimi K3, c’est la fiabilité sous charge soutenue qui pose problème. Les tests communautaires et indépendants au lancement ont rapporté que ses performances agentiques se dégradent à mesure que les exécutions se prolongent — des résultats solides en un seul essai, mais des taux de réussite soutenus plus faibles — et que sa vitesse de sortie se situe autour de 37 à 38 jetons par seconde, ce qui est lent pour le codage interactif. Moonshot a également dû suspendre les nouveaux abonnements pour particuliers peu après le lancement, car la demande a dépassé la capacité, ce qui en dit long sur la marge de capacité de service côté hébergement.
Celui de Grok 4.7 a la forme opposée : il est rapide, bon marché et fermé, ce qui signifie que vous ne pouvez pas l’inspecter, ni l’exécuter vous-même, ni vous prémunir contre une dépréciation. SpaceXAI a déjà publiquement enchaîné Grok 4.8, Grok 4.9 et Grok 5 derrière cette version, et Grok 4.6 n’a duré qu’environ cinq semaines avant d’être remplacé. Tout ce que vous construisez sur Grok 4.7 devrait être conçu de sorte que l’identifiant du modèle soit une valeur de configuration, et non une supposition.
Il existe une troisième considération, qui ne constitue l’échec ni de l’un ni de l’autre modèle : aucun des deux n’est la bonne réponse pour une exécution autonome de deux semaines, et les deux fournisseurs ont démontré exactement cela. Les démonstrations publiées de codage autonome de 16 jours et de 48 heures sont réalisées par les fournisseurs, sur des tâches choisies par les fournisseurs, sans reproduction indépendante. Il vaut la peine de les connaître, mais pas de planifier en fonction d’elles.

Exécuter les deux, et pourquoi c'est la vraie réponse
L’écart de coût et l’écart de contexte pointent dans des directions opposées, ce qui plaide pour ne pas en choisir un seul. Kimi K3 justifie son prix sur les travaux à l’échelle d’un dépôt, où une fenêtre de 1M signifie que vous ne découpez pas l’entrée, et sur tout ce qui doit être auto-hébergé. Grok 4.7 justifie son prix sur le volume — boucles d’agents à grand nombre de tours, pipelines à forte densité d’appels d’outils et longues sessions de terminal où la vitesse et le coût de sortie dominent.
Kimi K3 est disponible sur OrcaRouter, ce qui fait de cette séparation une décision de routage plutôt qu'un choix d'approvisionnement. Il figure au catalogue au prix public de Moonshot, et comme OrcaRouter répercute la tarification publique des fournisseurs avec 0 % de marge, une baisse de prix d'un fournisseur est effective ici le jour même de son annonce, plutôt qu'à la prochaine renégociation de contrat. Pour les charges de travail où une passe à long contexte et une passe d'exécution doivent collaborer plutôt que rivaliser — un modèle gardant l'ensemble du dépôt sous les yeux, un autre agissant dessus — le DSL de routage compose plusieurs modèles en un seul appel, et la fusion de modèles permet à un panel de modèles de répondre ensemble lorsque la tâche justifie la dépense supplémentaire. Une seule clé API couvre Kimi K3 ainsi que plus de 200 autres modèles, de sorte que la moitié « exécution » de cette répartition peut provenir du modèle le moins cher et le plus rapide pour la tâche, plutôt que de celui qui se trouve détenir le contexte.
Une chose doit être claire : les poids ouverts de Kimi K3 sont téléchargeables, mais c'est le point de terminaison hébergé vers lequel OrcaRouter effectue le routage. Si votre besoin est véritablement une inférence sur site, il s'agit d'un projet d'auto-hébergement sur votre propre matériel, et non d'une décision de routage — et c'est le seul scénario où cette comparaison a une seule réponse correcte.
Le verdict, et le seul chiffre à retenir
Si vous choisissez en fonction du coût et de la vitesse, Grok 4.7 l’emporte, et de loin : moitié prix en entrée, moins de la moitié du prix en sortie, un service plus rapide et un réglage de raisonnement que vous pouvez baisser. Si vous choisissez en fonction du contexte, de l’étendue des modalités ou de la possibilité de posséder le modèle, Kimi K3 l’emporte tout autant. Si vous choisissez uniquement en fonction des capacités, le composite indépendant indique qu’ils sont à deux points d’écart, et vous devriez vous décider d’après votre propre évaluation plutôt que d’après le graphique de lancement de l’un ou l’autre fournisseur.
Le nombre à retenir est celui du haut : 2 $/6 $ contre 3 $/15 $. Tout le reste dans cette comparaison est négociable, et ce ratio ne l’est pas.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
