Carte de titre principale pour une comparaison de GPT-6 et Kimi K3. Le titre principal indique « GPT-6 vs Kimi K3 ». Une puce indique « Kimi K3 : 1 048 576 de contexte, 3,00 $ / 15,00 $, sorti le 2026-07-15 ». Une puce indique « GPT-6 Sol : 1 050 000 de contexte, 2,00 $ / 10,00 $, GA 2026-09-22 ». Un pied de page indique « Les deux acceptent du texte et des images en entrée ; leurs tarifs et leurs scores diffèrent. »
Guides & Insights

GPT-6 vs Kimi K3 : deux modèles à deux millions de tokens qui se spécialisent différemment

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

GPT-6 Sol et Kimi K3 sont les deux modèles les plus susceptibles d’être présélectionnés pour le même usage : une fenêtre de contexte d’un million de tokens, une entrée d’images et un prix qui rend les longs documents abordables. Ils y sont parvenus par des chemins opposés. Kimi K3 est le spécialiste du contexte long de MoonshotAI, sorti le 15 juillet 2026, et sa fiche technique est axée sur le rappel — il obtient 88,7 % au test de rappel en contexte long d’Artificial Analysis, devant tous les modèles du fournisseur auxquels nous pouvons le comparer. GPT-6 Sol est le généraliste de milieu de gamme du fournisseur, livré le 22 septembre 2026 à 2,00 $ par million de tokens en entrée et 10,00 $ par million de tokens en sortie, et son atout est l’étendue : une fenêtre légèrement plus grande, un score composite de raisonnement général plus élevé et un token de sortie moins cher.

Donc, la formulation honnête n’est pas une question de meilleur ou de pire. C’est une question de rappel contre raisonnement, et elle est déterminée par ce que vous faites avec le million de tokens une fois que vous les avez chargés.

Les fenêtres ont la même taille sur le papier

Les deux fiches annoncent environ un million de tokens, et la différence est cosmétique. La fenêtre de Kimi K3 est de 1 048 576 tokens — exactement 2^20, le million binaire que cite tout modèle à long contexte. Celle de GPT-6 Sol est de 1 050 000, un nombre décimal rond, soit environ 1 400 tokens de plus. Pour toute charge de travail que vous pouvez réellement faire tenir, c'est la même fenêtre. Ne choisissez pas sur ce critère.

Ce qui diffère, c’est le reste de l’enveloppe, et c’est une liste courte.

• Contexte : Kimi K3 1 048 576 jetons, GPT-6 Sol 1 050 000 — pratiquement au même niveau
• Modalité d'entrée : Kimi K3 accepte le texte et les images ; GPT-6 Sol accepte le texte, les images et les fichiers
• Plafond de sortie : GPT-6 Sol 128 000 jetons en une seule réponse ; la fiche de Kimi K3 ne publie pas de chiffre maximal de sortie
• Tarif standard : Kimi K3 3,00 $ en entrée / 15,00 $ en sortie par million, GPT-6 Sol 2,00 $ en entrée / 10,00 $ en sortie
• Entrée mise en cache : Kimi K3 0,30 $ par million, GPT-6 Sol 0,20 $ par million
• Tarification pour contexte long : Kimi K3 indique un tarif unique sans palier documenté ; GPT-6 Sol applique un nouveau tarif à toute la requête au-delà de 272 000 jetons d'entrée, soit 4,00 $ en entrée / 15,00 $ en sortie
• Contrôles de raisonnement : GPT-6 Sol expose un paramètre configurable reasoning.effort ; Kimi K3 expose les paramètres reasoning et reasoning-effort via la même surface compatible avec OpenAI

Le plafond de sortie manquant sur Kimi K3 mérite d'être signalé plutôt que passé sous silence : MoonshotAI publie une valeur de contexte et aucune valeur de sortie maximale, si bien qu'un système qui dépend d'un plafond de sortie strict pour sa budgétisation ne peut en lire aucun sur la fiche. Le palier de contexte long est l'autre asymétrie, et il joue dans une direction contre-intuitive — le tarif affiché de GPT-6 Sol est plus bas, mais sa re-tarification de la requête entière au-delà de 272K signifie qu'un appel de 300 000 tokens est facturé à $4.00 / $15.00 dès le premier token, tandis que le tarif unique de $3.00 / $15.00 de Kimi K3 n'est pas documenté comme passant à un palier supérieur. Pour un document très long, Kimi K3 peut s'avérer le moins cher des deux en entrée, malgré le tarif affiché plus élevé.

Recall est le produit de Kimi K3

La raison de choisir Kimi K3 n'est pas qu'il dispose d'une grande fenêtre — plusieurs modèles en ont une. C'est qu'il retient ce qui s'y trouve. Dans l'évaluation de rappel en contexte long d'Artificial Analysis, figurant dans le catalogue de modèles, Kimi K3 obtient 88,7 % contre 83,7 % pour GPT-6 Sol. C'est un écart de cinq points sur le test même qui mesure si un modèle peut trouver et utiliser un détail enfoui dans une entrée longue, et c'est le genre d'écart qui se traduit par de véritables défaillances en production — le résumeur qui omet la clause de la page 400, le réviseur de contrats qui rate la section d'indemnisation.

Kimi K3 est également en tête sur le codage, et avec une marge plus large que ne le suggère l'indice composite. Sur l'indice de codage, il se situe à 76,2 avec un rang dans les dix premiers des modèles évalués, et il obtient 85,0 % sur terminal-bench v2.1 — le benchmark agentique en ligne de commande dont dépend l'utilité d'un agent de codage. Son score GPQA Diamond, 93,5 %, se situe dans la bande supérieure du classement.

Là où GPT-6 Sol réplique, c’est sur les composites et sur le code scientifique. Son indice d’intelligence générale, 47,6, devance de quatre points celui de Kimi K3, 43,6, et frôle le décile supérieur ; les deux sont à égalité sur SciCode, à 57,6 % et 59,5 % respectivement, ce qui tient dans le bruit d’une seule exécution ; et sur Humanity’s Last Exam, les 47,9 % de GPT-6 Sol devancent de peu les 46,9 % de Kimi K3. Aucune de ces différences sur un seul benchmark n’est assez importante pour choisir sur cette seule base.

Screenshot of the OrcaRouter model page for Kimi K3, showing the MoonshotAI Kimi K3 card with a 1,048,576-token context window, text and image input, and a flat rate of $3.00 per million input tokens and $15.00 per million output tokens with a $0.30 cached-input rate.

Un coût basé sur la charge de travail, pas sur une grille tarifaire.

Les grilles tarifaires induisent en erreur, car le rapport entre les tokens d'entrée et de sortie diffère pour chaque tâche, et ces deux modèles ne s'accordent pas sur le côté de l'échange qui est le moins cher. Kimi K3 est moins cher si l'on suppose que votre travail est principalement constitué d'entrée — de longs documents en entrée, des réponses courtes en sortie. GPT-6 Sol est moins cher si l'on suppose que votre travail est équilibré ou à forte composante de sortie, car son tarif de sortie est inférieur d'un tiers.

• Profil « lire un livre et le résumer » (900 K en entrée, 4 K en sortie) : Kimi K3 ≈ 2,76 $, GPT-6 Sol ≈ 3,64 $ avant l’application de la nouvelle tarification à 272 K ; avec cette nouvelle tarification, l’appel complet de GPT-6 Sol passe au palier supérieur et l’écart se creuse
• Profil agentique équilibré (60 K en entrée, 20 K en sortie) : Kimi K3 ≈ 0,48 $, GPT-6 Sol ≈ 0,32 $
• Profil de génération de code (30 K en entrée, 60 K en sortie) : Kimi K3 ≈ 0,99 $, GPT-6 Sol ≈ 0,66 $

Ce sont des calculs bruts de tokens sur les tarifs publiés de chaque fournisseur, et ils excluent l’entrée mise en cache, ce qui avantage le modèle pour lequel vous utilisez le plus le cache. La forme de la réponse est ce qui compte : pour le pur travail de rappel sur de longues entrées, le tarif forfaitaire de Kimi K3 l’emporte, et pour tout ce qui écrit beaucoup en retour, le tarif de sortie plus bas de GPT-6 Sol l’emporte. Aucun des deux n’est universellement moins cher, et une comparaison qui désigne un gagnant sur le prix sans indiquer le ratio de tokens ne mesure rien.

La provenance fait partie de la décision

Kimi K3 est conçu par MoonshotAI, un laboratoire chinois, et GPT-6 Sol par OpenAI. Cette différence n’est pas un benchmark et elle n’apparaît pas sur une grille tarifaire, mais pour les charges de travail réglementées, elle décide de la liste restreinte avant même que le prix ne soit discuté. La fiche de MoonshotAI dans le catalogue ne publie pas de champ de licence, donc rien ici ne doit être lu comme une affirmation sur la disponibilité des poids, dans un sens ou dans l’autre — si les poids ouverts importent pour votre déploiement, vérifiez-le à la source plutôt que de le supposer d’après le nom de la famille.

Pour les équipes qui ont besoin des deux — un modèle de laboratoire chinois pour une partie d’un pipeline et un modèle OpenAI pour une autre, avec la gestion du routage, de la facturation et de la résidence des données au même endroit — c’est la raison pour laquelle une passerelle unique vaut mieux que deux jeux d’identifiants. Sur OrcaRouter, tant kimi/kimi-k3 que GPT-6 Sol sont des routes actives dans le même catalogue, au prix catalogue du fournisseur, avec 0 % de marge, de sorte qu’un changement de tarif de MoonshotAI ou d’OpenAI est répercuté le jour même. Le basculement automatique signifie qu’une route dégradée chez l’un ou l’autre fournisseur ne met pas le pipeline hors service, et le DSL de routage vous permet d’envoyer le travail à forte composante de rappel vers Kimi K3 et le travail à forte composante de génération vers GPT-6 Sol selon des règles plutôt que par estimation.

A six-row comparison card titled 'GPT-6 Sol vs Kimi K3'. Rows read 'Context: 1,050,000 vs 1,048,576'; 'Input: $2.00 vs $3.00'; 'Output: $10.00 vs $15.00'; 'AA Intelligence: 47.6 vs 43.6'; 'Long-context recall: 83.7% vs 88.7%'; 'Coding index: top-decile on both'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; GPT-6 Sol output ceiling is 128K, Kimi K3 publishes no maximum output.'

Lequel mettre dans le pipeline

Choisissez Kimi K3 lorsque la tâche consiste à récupérer et à retenir des entrées très longues — révision de documents juridiques et médicaux, compréhension de code sur un dépôt complet, analyse de transcriptions sur des centaines de documents — et lorsque vos prompts sont suffisamment chargés en entrée pour que le tarif fixe de 3,00 $ soit plus avantageux que la nouvelle tarification de GPT-6 Sol. Son avance en matière de rappel et son classement parmi les dix premiers en codage sont les deux chiffres qui justifient ce choix.

Choisissez GPT-6 Sol lorsque la tâche consiste en un assistant généraliste adossé à une fenêtre d'un million de tokens : raisonnement mixte, sérialisation en JSON, boucles agentiques qui écrivent beaucoup en retour, et tout flux de travail où un plafond de sortie de 128 000 tokens est un atout plutôt qu'une contrainte. Il est moins cher en sortie, il expose un contrôle explicite de l'effort de raisonnement, et son indice composite est le signal généraliste le plus solide. Lorsqu'un pipeline fait véritablement les deux, la réponse honnête est d'acheminer plutôt que de choisir — ce qui est une observation sur la forme de votre trafic, et non sur l'un ou l'autre des modèles.

Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement