Carte de titre principale pour un article comparant GPT-6 Sol à Kimi K3, portant la mention « GPT-6 Sol vs Kimi K3 » avec le sous-titre « Trois hypothèses sur les poids ouverts, testées face à une seule facture », présentant GPT-6 Sol comme fermé à $2.00/$10.00 avec un Index de 48 et Kimi K3 comme modèle à poids ouverts à $3.00/$15.00 avec un Index de 44.
Guides & Insights

GPT-6 Sol contre Kimi K3 : trois hypothèses sur les poids ouverts, testées à l'aune d'une seule facture

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Acheter des poids ouverts est généralement un pari sur trois choses : qu'ils seront moins chers, qu'ils vous donnent le contrôle et qu'ils constituent une assurance contre un fournisseur qui change d'avis. Kimi K3, le modèle à 2,8 billions de paramètres que Moonshot AI a publié sous licence de poids ouverts le 27 juillet 2026, et GPT-6 Sol, le modèle fermé commercialisé le 22 septembre 2026, forment un cas de test idéal pour ces trois points, car les deux modèles sont suffisamment proches dans le classement neutre pour que les hypothèses doivent porter l'argumentation à elles seules.

Voici comment ils s’en sortent. K3 n’est pas moins cher par tâche — il est environ deux fois plus cher, à 3,00 $ et 15,00 $ par million de tokens, contre 2,00 $ et 10,00 $ pour Sol. Le contrôle est réel, mais il a un plancher matériel que la plupart des équipes ne franchiront pas. Et l’assurance est la seule hypothèse qui tient parfaitement, ce qui en fait la seule qui vaille la peine d’être payée. Ce qui suit est l’arithmétique derrière chacun d’eux.

Les deux modèles, brièvement

Kimi K3 est un modèle à mélange d’experts clairsemé totalisant 2,8 billions de paramètres et environ 104 milliards — soit environ 3,7 % — actifs par jeton, publié sous licence MIT modifiée avec une fenêtre de contexte de 1 048 576 jetons. Les affirmations architecturales de Moonshot sont précises : Kimi Delta Attention, un schéma d’attention linéaire hybride que l’entreprise présente comme jusqu’à 6,3 fois plus rapide lors du décodage en contexte long, ainsi qu’Attention Residuals et un framework Stable LatentMoE. Il prend en entrée du texte et des images et renvoie du texte. Le modèle non distillé dépasse 1 To en taille, et un déploiement en production est décrit en termes de plancher de 64 accélérateurs.

GPT-6 Sol est un modèle fermé, à identifiant unique, facturé à un tarif fixe de 2,00 $ et 10,00 $, avec une lecture en cache à 0,20 $ et des écritures en cache à 2,50 $, le tarif de l'ensemble de la requête étant porté à 4,00 $ et 15,00 $ au-delà de 272 000 jetons d'entrée. Il accepte en entrée du texte et des images et produit du texte en sortie, avec une fenêtre de 1 050 000 jetons, une entrée maximale de 922 000 jetons, un plafond de sortie de 128 000 jetons et une date de coupure des connaissances au 20 avril 2026.

Les fenêtres de contexte sont, en pratique, identiques — une différence de 0,1 %. Cela supprime la raison la plus courante de préférer l’une à l’autre, et cela signifie que la décision repose entièrement sur les trois hypothèses.

Première hypothèse : les poids ouverts sont moins chers. Ils ne le sont pas.

• Entrée — GPT-6 Sol 2,00 $ par million de tokens vs Kimi K3 3,00 $ par million de tokens

• Sortie — GPT-6 Sol 10,00 $ par million de tokens vs Kimi K3 15,00 $ par million de tokens

• Entrée mise en cache — GPT-6 Sol 0,20 $ par million de tokens contre Kimi K3 0,30 $ par million de tokens ; les deux représentent un dixième du tarif d'entrée non mise en cache

• Indice d'intelligence, indépendant — GPT-6 Sol 48 à effort maximal contre Kimi K3 44 à effort maximal

• Coût par tâche Index, indépendant — GPT-6 Sol 1,06 $ vs Kimi K3 2,00 $

• Tokens de sortie pour l'exécution d'index — GPT-6 Sol 77M vs Kimi K3 160M

• Fenêtre de contexte — GPT-6 Sol 1 050 000 jetons vs Kimi K3 1 048 576 jetons

• Poids — GPT-6 Sol à poids fermés vs Kimi K3 à poids ouverts, téléchargeable et auto-hébergeable

• Licence — GPT-6 Sol non applicable vs Kimi K3 Modified MIT

• Nombre total de paramètres — GPT-6 Sol non divulgué contre Kimi K3 2 800 milliards, dont 104 milliards sont actifs par token

Sol est moins cher sur chaque ligne de la grille tarifaire, et l’écart est le plus large exactement là où les charges de travail agentiques dépensent leur argent. Le comité indépendant s’accorde sur l’orientation et à peu près sur l’ampleur : Sol coûte environ deux fois moins par tâche accomplie, à quatre points d’indice de plus. K3 a généré un peu plus de deux fois plus de tokens de sortie pour exécuter le même indice.

Une nuance empêche qu’il s’agisse d’une déroute. Moonshot affirme que K3 émet 21 % de jetons de sortie de moins que son prédécesseur, et le travail architectural — le schéma d’attention, la conception résiduelle — cible directement le coût de décodage en contexte long. Sur une charge de travail dominée par des entrées très longues, les caractéristiques d’efficacité de K3 pourraient combler une partie de l’écart que révèle l’exécution de l’index. Personne n’a publié cette mesure sur un banc d’essai comparable, alors considérez-la comme une affirmation de fournisseur assortie d’un mécanisme plausible, et non comme un résultat.

A six-row scoreboard card titled 'GPT-6 Sol vs Kimi K3 - the scoreboard', comparing the two models on input price, output price, Intelligence Index, cost per task, weight availability and context window. The left column lists GPT-6 Sol at $2.00 input and $10.00 output, an Index of 48, $1.06 per task, closed weights and a 1,050,000-token context; the right column lists Kimi K3 at $3.00 and $15.00, an Index of 44, $2.00 per task, open weights under Modified MIT and a 1,048,576-token context. A footer reads 'Vendor list prices; Index per Artificial Analysis.'Screenshot of the Artificial Analysis model page for Kimi K3 (max), captured 23 September 2026, showing an Intelligence Index score of 44 in the open-weights class, list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a cost of $2.00 per Intelligence Index task, 160 million output tokens generated during the index run, a 1M-token context window, 2.8 trillion total parameters with 104 billion active, and open model weights under the Kimi K3 license.

Deuxième hypothèse : les poids ouverts vous donnent le contrôle. Jusqu'à un plancher matériel.

Le contrôle est réel et mérite d’être énoncé précisément, car « open weights » est souvent employé de façon vague. Une licence MIT modifiée sur un checkpoint téléchargeable signifie que vous pouvez exécuter le modèle sur votre propre matériel, le fine-tuner, épingler une révision spécifique et garder l’inférence à l’intérieur d’un périmètre que vous contrôlez. Rien de tout cela n’est disponible avec GPT-6 Sol, à aucun prix.

Ce que cela ne signifie pas, c'est que l'auto-hébergement constitue un substitut à l'API en termes de coût. Les chiffres publiés situent le point de contrôle en pleine précision à environ 4,9 To, ou autour de 397 Go en quantification à 1 bit, avec un plancher de déploiement dans la plage des 410 Go de mémoire combinée et des déploiements en production décrits en termes de 64 accélérateurs. Une équipe qui exploite déjà ce type de cluster dispose ici d'une véritable option. Une équipe qui ne le fait pas compare une facture d'API à un achat d'immobilisation, et la facture d'API l'emporte largement.

La version honnête de l’argument du contrôle est plus étroite qu’on ne le présente habituellement : les poids ouverts vous donnent la capacité de partir, pas celle de faire tourner le modèle à peu de frais. Ce sont deux choses différentes, et une seule d’entre elles est à la portée de la plupart des équipes.

Hypothèse trois : les poids ouverts sont une assurance. Celle-ci tient.

La troisième hypothèse résiste à tous les chiffres ci-dessus, et c’est la raison pour laquelle K3 a un marché tout court. Moonshot peut être rachetée, peut changer sa licence pour les versions futures, peut rendre K3 obsolète, peut augmenter son prix, peut suspendre les abonnements — et elle a bel et bien suspendu les nouveaux abonnements dans les 48 heures suivant sa sortie afin de préserver la qualité de service pour les clients payants existants, ce qui démontre concrètement que l’accès à l’API est une décision de politique commerciale plutôt qu’une propriété.

Si K3 est déprécié, les poids que vous avez téléchargés fonctionnent toujours. Si Moonshot triple le prix de l'API, votre déploiement auto-hébergé n'est pas affecté. Si vous devez démontrer à un auditeur que votre pile d'inférence est figée à une révision connue, un checkpoint vous le permet, contrairement à une API. Rien de tout cela n'apparaît dans un tableau de coût par tâche, et tout cela est bien réel.

La question est de savoir ce que cela vaut. D’après les chiffres ci-dessus, vous payez environ le double par tâche accomplie pour cette assurance, plus quatre points d’indice de capacité. Pour une charge de travail où une dépréciation d’API constitue une interruption d’activité, c’est bon marché. Pour une charge de travail où vous changereriez simplement de modèle, c’est une prime pour une couverture que vous n’exercerez jamais.

Les deux sont sur une seule touche si vous le souhaitez.

Screenshot of OrcaRouter's model page for Kimi K3, captured 23 September 2026, showing the model id kimi/kimi-k3 from provider MoonshotAI, a 1,048,576-token context window, text and image input with text output, vision, tool, JSON and reasoning support, list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a p50 time to first token of 8.11 seconds and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses.

Kimi K3 figure au catalogue d'OrcaRouter au prix catalogue de Moonshot, selon le modèle de répercussion directe qui rend effective une modification des tarifs de Moonshot de notre côté le jour même plutôt qu'après qu'un revendeur ait renégocié. GPT-6 Sol n'est pas dans notre catalogue à l'heure où nous écrivons et est accessible via l'API propre à OpenAI.

Cette combinaison vaut plus qu’il n’y paraît pour cette décision précise, car les deux modèles relèvent de modes de défaillance différents. La raison d’exécuter K3 n’est pas qu’il est moins cher — ce n’est pas le cas — mais qu’il constitue une couverture, et une couverture que l’on ne peut pas activer rapidement n’est pas vraiment une couverture. Garder K3 derrière le même point de terminaison que tout le reste, avec basculement automatique et une règle de routage modifiable dans la configuration, c’est ce qui transforme « nous avons une solution de repli à poids ouverts » d’une diapositive dans une présentation en quelque chose qui fonctionne à 3 h du matin.

À quoi sert chacun en réalité

• Si vous voulez le coût le plus bas par tâche accomplie pour du travail général — GPT-6 Sol, et l'écart est d'environ 2×.

• Si vous voulez la capacité la plus élevée sur le classement neutre des deux — GPT-6 Sol, avec quatre points d’avance.

• Si vous exploitez déjà un cluster dans la classe mémoire de 400 Go et plus et que vous avez besoin d’inférence à l’intérieur de votre propre périmètre — K3, et le calcul change entièrement, car le coût marginal des poids n’est pas le même que le coût du matériel.

• Si votre véritable exigence est que votre modèle ne puisse pas vous être retiré — K3, et c’est le seul argument de la comparaison auquel Sol ne peut pas répondre.

• Si vous choisissez en fonction du prix par token parce que K3 semble être le modèle chinois le moins cher — vérifiez d’abord le nombre de tokens. Avec 160 millions de tokens de sortie pour l’exécution d’indexation, contre 77 millions pour Sol, le tarif moins cher revient à acheter plus de tokens, pas à obtenir une facture plus petite.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement