
GPT-6.1 Sol vs Kimi K3 : Le téléchargement existe, et ce n'est toujours pas l'option bon marché
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Kimi K3 est le contre-exemple qui tranche généralement ce genre de débat. Moonshoot AI a livré le modèle à 2,8 billions de paramètres en juillet 2026 et publié les poids — moonshotai/Kimi-K3 est sur Hugging Face, sans restriction, avec plus d'un million de téléchargements et une dernière révision en septembre. Il n'y a donc pas d'astérisque « ouvert en principe, retenu pour renforcement de la sécurité », ni de délai de deux semaines à attendre. GPT-6.1 Sol, qu'OpenAI a publié le 29 septembre 2026, est fermé et uniquement accessible par API, et le restera toujours. Et dans le classement indépendant, le modèle téléchargeable obtient 43,6 contre 51,8 pour le modèle fermé, tout en coûtant 2,00 $ par tâche d'index terminée, contre 0,72 $. Les poids ouverts sont censés être la solution de repli bon marché ; dans cette comparaison, ils sont le côté coûteux de l'échange, et la raison n'est pas la licence.
Ce qu'est chaque modèle
Kimi K3 est un modèle à mélange d'experts clairsemé, avec 2 800 milliards de paramètres au total et environ 104 milliards — soit près de 3,7 % — actifs par token. Il dispose d'une fenêtre de contexte de 1 048 576 tokens, prend en entrée du texte et des images, et renvoie du texte. Le checkpoint publié est un artefact FP8 et il s'agit d'un téléchargement véritablement volumineux ; un déploiement en production sur votre propre matériel relève d'une décision de cluster plutôt que de station de travail. La revendication architecturale de Moonshoot est un schéma hybride d'attention linéaire qui, selon elle, est nettement plus rapide pour le décodage en contexte long, plus le travail sur les résidus et le routage qui a permis de mettre en service, tout court, un modèle de 2 800 milliards de paramètres.
GPT-6.1 Sol est la mise à jour de milieu de gamme d'OpenAI — en dessous de GPT-6 Astra, au-dessus de GPT-6 Luna — avec une fenêtre de 1 050 000 tokens, un plafond de sortie de 128 000 tokens, une entrée texte, image et fichier, et une date de coupure des connaissances au 30 avril 2026. Le raisonnement va de low à max avec medium comme valeur par défaut ; le niveau none que le précédent GPT-6 Sol acceptait est purement et simplement rejeté, et la note de migration d'OpenAI indique aux développeurs d'utiliser low à la place. Il est facturé 2,00 $ et 10,00 $ par million de tokens, avec l'entrée mise en cache à 0,10 $.
Une ligne par dimension, les deux côtés sur chacune :
• Entrée — GPT-6.1 Sol 2,00 $ par million vs Kimi K3 3,00 $ par million
• Sortie — GPT-6.1 Sol 10,00 $ par million vs Kimi K3 15,00 $ par million
• Entrée mise en cache — GPT-6.1 Sol 0,10 $ par million vs Kimi K3 0,30 $ par million
• Fenêtre de contexte — 1 050 000 jetons vs 1 048 576 jetons ; une différence de 0,1 %, sans importance
• Sortie maximale — 128 000 jetons sur les deux
• Paramètres totaux et actifs — non divulgués vs 2 800 milliards au total, 104 milliards actifs par jeton
• Modalité — texte, image et fichier en entrée, texte en sortie vs texte et image en entrée, texte en sortie
• Poids — fermé, API uniquement vs ouvert, sans restriction, plus d’un million de téléchargements
• Clause de contexte long — applique un nouveau tarif à toute la requête au-delà de 272 000 jetons d’entrée, à 2× l’entrée et le cache et à 1,5× la sortie vs aucune clause équivalente sur la fiche publiée
• Indice d’intelligence, indépendant, effort maximal — 51,8 vs 43,6
• Coût par tâche de l’indice, indépendant — 0,72 $ vs 2,00 $
• Jetons de sortie lors de l’exécution de l’indice — 67 millions vs 160 millions, contre une médiane du classement de 140 millions pour sa classe de comparaison
La seule évaluation que K3 remporte, et pourquoi c'est important
Avant l’arithmétique, l’exception, parce qu’elle est réelle. Évalué évaluation par évaluation à effort maximal sur Artificial Analysis v4.3.2, GPT-6.1 Sol mène dans sept cas sur dix et ne fait aucun match nul, mais le modèle qui remporte l’évaluation de raisonnement à contexte long est K3 :
• AA-LCR v1.1 — Kimi K3 0,887 contre GPT-6.1 Sol 0,830. Une avance de six points sur l'évaluation conçue spécifiquement pour le raisonnement sur des entrées longues.
• SciCode — Kimi K3 0,595 contre GPT-6.1 Sol 0,542. K3 est également en tête sur la programmation scientifique.
• Terminal-Bench 4.0 — Kimi K3 0,126 contre GPT-6.1 Sol 0,561. Un écart de 43 points dans l'autre direction, et de loin la plus grande divergence de l'appariement.
• Humanity's Last Exam — Kimi K3 0,469 contre GPT-6.1 Sol 0,529.
• AA-Omniscience — Kimi K3 19,7 contre GPT-6.1 Sol 41,5 ; en matière de fiabilité factuelle, les deux ne sont pas de la même classe de modèle.
• GDPval-AA v2.1 — Kimi K3 Elo 1536,5 contre GPT-6.1 Sol Elo 1575,1.
• MMMU-Pro — Kimi K3 0,805 contre GPT-6.1 Sol 0,860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0,583, 0,22 et 0,234 ; Sol 0,649, 0,310 et 0,317.
Le résultat AA-LCR est celui qui mérite d’être pris au sérieux, car c’est le seul chiffre qui contredit l’histoire du coût par tâche, et il pointe vers une charge de travail où la réponse d’apparence bon marché est fausse dans les deux sens. Si votre trafic se compose d’entrées très longues, d’une réponse générée modeste et d’une forte réutilisation d’un préfixe stable — la configuration où la verbosité ne peut jamais mordre — la combinaison chez K3 d’un score de contexte long de premier ordre, d’une entrée d’image et d’un point de contrôle téléchargeable convient mieux que celle de Sol, et le chiffre de coût par tâche de l’exécution d’index ne s’applique pas à vous. C’est la version honnête de « les poids ouverts valent un supplément » : parfois, le modèle ouvert est simplement le meilleur modèle pour la tâche, et ici, il l’est sur un axe.
Il vaut également la peine de nommer ce que ces deux victoires ont en commun. K3 est fort là où une tâche peut être résolue en un seul long acte de lecture ou de raisonnement, et faible là où elle doit être exécutée en de nombreuses petites étapes et vérifiée. L'écart de 43 points au Terminal-Bench et l'écart de 22 points en omniscience sont les mêmes, vus sous deux angles : l'exécution agentique soutenue n'est pas ce qu'était ce checkpoint.
L’arithmétique, qui est ce qui décide réellement
La grille tarifaire de K3 est de 1,5× celle de Sol sur chaque ligne, et son coût mesuré par tâche d’index terminée est de 2,8×, et l’écart entre 1,5 et 2,8 s’explique entièrement par le volume de tokens. La mesure du conseil lui-même est de 160 millions de tokens de sortie pour K3 contre 67 millions pour Sol sur la même suite de dix évaluations. K3 produit 2,4 fois plus de sortie à 1,5 fois le prix, et 2,4 × 1,5 font 3,6 — le chiffre du conseil, 2,00 $ contre 0,72 $, est un peu plus favorable que le ratio pur parce que les contributions des entrées et du cache le compensent légèrement, mais le sens ne fait pas débat.
Le marketing de Moonshoot lui-même va à l’encontre de cela d’une manière qui mérite une lecture attentive. L’entreprise affirme que K3 émet moins de tokens de sortie que son prédécesseur, et le travail architectural — le schéma d’attention, la conception résiduelle — vise directement le coût de décodage en contexte long. Ces deux éléments peuvent être vrais alors même que le modèle reste deux fois plus verbeux que la médiane d’un benchmark sur une suite générale. Les deux affirmations portent sur des choses différentes : l’efficacité par rapport à un Kimi précédent, et l’efficacité par rapport au reste du domaine. Seule la seconde est celle sur laquelle vous êtes facturé, et c’est celle que mesure le comité indépendant.
La mise en cache l’atténue. Les deux tarifs d’entrée en cache représentent un dixième du tarif d’entrée hors cache de leur modèle — 0,30 $ pour K3, 0,10 $ pour Sol — donc la ligne de cache ne modifie pas l’ordre, mais elle signifie qu’une charge de travail riche en requêtes et pauvre en réponses réduit l’écart à peu près au ratio de la grille tarifaire plutôt qu’au ratio mesuré pour la tâche. Et la clause de contexte long de Sol joue en sens inverse : au-delà de 272 000 jetons d’entrée, elle refacture toute la requête à 4,00 $ et 15,00 $, avec le cache à 0,20 $, ce qui est la seule tranche où la grille forfaitaire de K3 l’emporte nettement. Cela vaut la peine de le savoir pour deux raisons, car c’est aussi la tranche où le score de contexte long de K3 est le meilleur chiffre de cette comparaison.

Ce que les poids ouverts valent réellement ici
Trois choses, et il vaut la peine de les distinguer, car « open weights » est généralement utilisé comme un seul argument alors qu’il en recouvre trois.
Le premier, c'est que vous pouvez partir. Si Moonshoot est racheté, modifie la licence des versions futures, abandonne K3 ou augmente le prix de son API, un checkpoint que vous avez déjà téléchargé continue de fonctionner. Ce n'est pas hypothétique pour ce laboratoire : Moonshoot a suspendu les nouveaux abonnements dans les 48 heures suivant une version antérieure afin de préserver la qualité de service pour les clients payants existants, ce qui démontre concrètement que l'accès à l'API relève d'une décision politique et non d'une propriété. Rien de tout cela n'apparaît dans un tableau de coût par tâche, et tout cela est bien réel.
La seconde, c'est que vous le pouvez. Une révision figée, affinée, exécutée à l'intérieur d'un périmètre que vous contrôlez, est une chose que l'on peut montrer à un auditeur, et qu'une API ne peut pas fournir. Pour du trafic réglementé, cela vaut plus qu'une grille tarifaire.
La troisième — celle que l’on suppose généralement — est qu’il sera moins cher. Ce n’est pas le cas. Le checkpoint est un artefact FP8 de 2,8 billions de paramètres, et les recommandations de déploiement publiées sont structurées autour de configurations multi-accélérateurs plutôt que d’un seul nœud. Une équipe qui exploite déjà ce type de cluster dispose ici d’une véritable option, et le calcul change du tout au tout, car le coût marginal d’un token devient l’électricité. Une équipe qui n’en dispose pas compare une facture d’API à un investissement en capital, et la facture d’API l’emporte largement. Le résumé honnête est que des poids ouverts vous donnent ici la possibilité de partir, pas celle de faire tourner à moindre coût.
Les deux sur une seule touche, et c'est là ce qui rend l'échange utile
Kimi K3 est disponible sur OrcaRouter au prix catalogue de Moonshoot lui-même — 3,00 $ et 15,00 $ par million de jetons, avec une lecture du cache à 0,30 $, inchangés par rapport à la fiche tarifaire du fournisseur — et GPT-6.1 Sol est arrivé sur nos routes au prix d'OpenAI le jour de sa sortie, à 2,00 $ et 10,00 $, avec l'entrée en cache à 0,10 $, et le palier de 272 000 jetons est répercuté exactement comme indiqué. Rien n'est ajouté à l'un ou à l'autre. La plateforme répercute le prix catalogue du fournisseur plutôt que de le majorer, de sorte qu'une modification tarifaire de Moonshoot et une modification tarifaire d'OpenAI apparaissent toutes deux de notre côté le jour même où elles apparaissent chez le fournisseur, sans second contrat ni revendeur intermédiaire.

La raison pour laquelle cet argument compte davantage pour ce duo que pour la plupart des autres, c'est que les deux modèles relèvent de modes de défaillance différents. GPT-6.1 Sol est le modèle que l'on exécute pour une exécution soutenue, des boucles d'outils et une fiabilité factuelle ; Kimi K3 est le modèle que l'on exécute pour des entrées très longues, lorsque l'on veut le meilleur score en contexte long et que l'on veut un point de contrôle comme parade à la décision commerciale d'un tiers. Ce ne sont pas des choix concurrents, ce sont deux itinéraires sur le même trafic. Garder les deux derrière un seul endpoint, avec un basculement automatique entre eux et une règle qui aiguille le travail à entrée longue vers K3 et le travail d'exécution vers Sol, voilà ce qui transforme « nous avons un repli à poids ouverts » d'une ligne dans un document de conception en quelque chose qui fonctionne à trois heures du matin sur un appel qui échoue.

Où chacun a sa place
• Agents de terminal, codage à l’échelle d’un dépôt, exécution en plusieurs étapes — GPT-6.1 Sol, sur un écart de 43 points à Terminal-Bench 4.0. Ce n’est pas serré.
• Des réponses là où une hallucination coûte cher — GPT-6.1 Sol, sur un écart de 22 points à AA-Omniscience.
• Des entrées très longues avec une réponse générée courte — Kimi K3. Meilleur score de raisonnement à long contexte de cette comparaison, entrée d’image, et une verbosité qui n’a jamais l’occasion de s’appliquer.
• Auto-hébergement ou une pile d’inférence que vous devez pouvoir figer — Kimi K3, et uniquement si vous exploitez déjà le matériel. Le checkpoint est le livrable ; les considérations économiques liées à son exécution sont distinctes.
• Une couverture contre un fournisseur qui modifie ses conditions — Kimi K3, et c’est le seul argument auquel GPT-6.1 Sol ne peut répondre à aucun prix.
• Choisir sur la grille tarifaire — ni K3 ni Sol n’est l’option bon marché dans cette comparaison, et aucun des deux n’est l’option bon marché dans la gamme GPT-6. Si la facture est le facteur décisif, le modèle qu’il vous faut est plus bas dans la grille tarifaire, pas dans ce tableau.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
