
Claude Fable 5.1 vs Kimi K3 : le plafond du raisonnement vs le plafond que vous pouvez posséder
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Claude Fable 5.1 et Kimi K3 visent le même acheteur — des équipes qui exécutent de longs agents utilisant des outils sur de vastes bases de code et ensembles de documents — et ils arrivent depuis les deux extrémités du marché. Claude Fable 5.1 est le flagship fermé d'Anthropic, sorti le 1er septembre 2026, au prix de 10,00 $ par million de tokens d'entrée et de 50,00 $ par million de tokens de sortie, et mesuré par Artificial Analysis à 53 sur son indice d'intelligence actuel : premier des 201 modèles suivis par cet indice. Kimi K3, le modèle mixte d'experts de 2,8 billions de paramètres de Moonshot AI, a ouvert ses poids le 27 juillet et se situe à 44 sur le même indice — deuxième des 112 modèles à poids ouverts de sa catégorie. La lecture évidente est un écart d'intelligence de neuf points contre un écart de prix d'environ trois fois. La lecture plus utile est que les deux modèles ont des maximums différents, et qu'un seul de ces maximums peut être augmenté par la personne qui l'utilise.
Concernant les sources : Artificial Analysis a révisé son indice d'intelligence en septembre ; les scores, classements, vitesses et coûts par tâche présentés ici proviennent donc de la version actuelle, capturée le 10 septembre 2026, et ne sont pas comparables aux chiffres publiés lors du lancement de l'un ou l'autre modèle. Les résultats de benchmark de Moonshot et ceux d'Anthropic sont clairement identifiés là où ils apparaissent, et aucun n'a été reproduit par l'autre laboratoire. Claude Fable 5.1 n'a que neuf jours, si bien que les affirmations de son fournisseur n'ont quasiment pas été testées en externe ; Kimi K3 en a bénéficié pendant six semaines.
Même fenêtre, maximums différents
Les deux modèles offrent une fenêtre de contexte de 1 048 576 jetons, et aucun ne facture de supplément pour la remplir — Moonshot tarife Kimi K3 à prix fixe à 3,00 $ / 0,30 $ en cache / 15,00 $ par million, et Claude Fable 5.1 propose sa fenêtre à prix fixe à 10,00 $ / 0,25 $ en cache / 50,00 $. Cette fenêtre commune est précisément la raison pour laquelle ces deux modèles sont comparés : ils sont conçus pour le même type de travail, où une seule tâche accumule un dépôt de code, une data room ou une semaine de sorties d'outils.
La différence se situe à l'autre extrémité du pipeline. Kimi K3 peut émettre jusqu'à 1 048 576 tokens en une seule réponse — les fournisseurs la règlent généralement par défaut sur 131 072, mais le plafond est d'un million complet, vanté par Moonshot comme « un seul appel peut émettre une base de code ». Claude Fable 5.1 plafonne une réponse à 128K tokens de sortie. Pour un tour de conversation, cette limite est sans importance. Pour la génération d'un dépôt entier, une migration en masse ou un long ensemble de documents, c'est la différence entre un seul appel et une boucle d'agent que vous devez construire, superviser et payer tour par tour.
Les nombres, dimension par dimension
• Prix par 1M de tokens — Claude Fable 5.1 10,00 $ en entrée / 50,00 $ en sortie vs Kimi K3 3,00 $ en entrée / 15,00 $ en sortie.
• Entrée en cache — Claude Fable 5.1 à 0,25 $ par 1M contre Kimi K3 à 0,30 $, ce qu'Artificial Analysis convertit en une remise de cache effective de 98 % contre 90 %.
• Score, vitesse et coût indépendants — Claude Fable 5.1 se situe à 53 sur l’Intelligence Index actuel (#1 sur 201) à 67,2 jetons de sortie par seconde et 7,63 $ par tâche d’indice ; Kimi K3 se situe à 44 (#2 sur 112 modèles à poids ouverts) à 35,5 jetons par seconde et 2,00 $ par tâche, et l’indice le note comme notablement lent et quelque peu verbeux — 160 M de jetons de sortie par exécution d’indice contre 190 M pour le modèle Claude.
• Plafond de contexte et de sortie — 1M de jetons en entrée et jusqu'à 128K en sortie, contre 1M de jetons en entrée et jusqu'à 1M en sortie.
• Poids — fermés, API uniquement, vs ouverts et auto-hébergeables, publiés par Moonshot sous la licence Kimi K3, une variante de la licence MIT modifiée avec des conditions commerciales pour les très grands revendeurs, avec les poids sur Hugging Face.
• Vision — Claude Fable 5.1 accepte du texte, des images et des fichiers via l'API ; Kimi K3 accepte du texte et des images via l'API, mais la vision native est une fonctionnalité de la couche de service et ne fait pas partie des poids publiés.
• Visibilité du raisonnement — Kimi K3 diffuse ses traces de raisonnement dans l'API ; Claude Fable 5.1 renvoie des blocs de réflexion dont vous choisissez l'affichage, résumé ou omis, la chaîne de pensée brute n'étant jamais exposée.
• Architecture — Le nombre de paramètres de Claude Fable 5.1 n'est pas divulgué ; Kimi K3 est un mélange d'experts épars avec 2,8 billions de paramètres au total et environ 104 milliards de paramètres actifs.
• Sortie — Claude Fable 5.1 le 1er septembre 2026 ; l'API de Kimi K3 le 16 juillet 2026, avec des poids ouverts le 27 juillet.

Ce qu'est l'écart de neuf points, et ce qu'il n'est pas
Sur l’indice actuel, Claude Fable 5.1 mène avec 53 et Kimi K3 est deuxième, devant le reste du peloton des modèles open-weights, avec 44. Neuf points, c’est un écart réel, et ce n’est pas du bruit, mais l’indice est composite — travail agentique, codage, raisonnement scientifique et capacité générale, pondérés — et un chiffre unique masque les domaines où le modèle open est réellement solide. Lors de mesures indépendantes début septembre, Kimi K3 se situait en tête ou presque du palmarès open sur les tâches agentiques à long horizon : premier sur AutomationBench, deuxième sur la suite agentique Briefcase d’Artificial Analysis et troisième sur GDPval-AA v2 parmi les modèles testés. Les données indépendantes d’arène évaluent ses compétences en développement web à environ 1 679 Elo sur le tableau Web Dev de Code Arena, près du sommet de ce classement jusqu’au début septembre. Ce sont là des charges de travail où le modèle open n’accuse pas neuf points de retard.
Là où Claude Fable 5.1 creuse l’écart, c’est dans le plafond du raisonnement exigeant. Anthropic annonce 52,6 % sur Terminal-Bench-Science 0.1, soit plus du double des 24,7 % de la génération précédente de Claude, plus 55,8 % sur Terminal-Bench 4.0 — des chiffres fournis par le vendeur et non reproduits. Ce sont ces chiffres qui sous-tendent l’affirmation selon laquelle la sortie de septembre a relevé le niveau d’exigence pour les travaux scientifiques et à long horizon. Le résumé honnête est que Kimi K3 est compétitif en matière d’étendue agentique et de développement web, tandis que le modèle fermé est en tête là où le raisonnement est le plus profond ; un écart de neuf points sur un indice résume ces deux faits en une seule ligne.
Un point de données mérite une mention particulière car il est inhabituel : le score Terminal-Bench 2.1 de Moonshot pour Kimi K3 est de {{1}}88.3%{{/1}}, contre une lecture indépendante de {{2}}85.0%{{/2}}. Il est rare que des chiffres de fournisseur survivent presque intacts à une mesure neutre, et un écart aussi faible, en faveur du fournisseur, en dit plus sur le modèle que n'importe quel score d'indice.

Le fork de propriété, chiffré honnêtement
Les poids ouverts sont la raison de préférer Kimi K3, et c'est aussi la raison de lire les petits caractères. Kimi K3 est un mélange d'experts sparse de 2,8 billions de paramètres ; l'exécuter soi-même est une affaire de cluster GPU multi-nœuds, pas un après-midi de station de travail, et la licence Kimi K3 comporte une barrière commerciale visant les très grands revendeurs. Ce que vous achetez avec cette infrastructure est bien réel : pas de limites de débit, pas de comptage par jeton, un fine-tuning sur vos propres données, une auditabilité complète, et des prompts qui ne quittent jamais votre réseau — les exigences qui rendent une API fermée inenvisageable pour les travaux réglementés et liés à la défense.
Deux mises en garde s'imposent. L'auto-hébergement renonce à la vision native de l'API, car l'entrée d'images est une fonctionnalité de la couche de service plutôt que quelque chose dans les poids publiés ; et le modèle est lent, mesuré à 35,5 jetons de sortie par seconde sur l'index actuel — la conséquence naturelle d'un mélange d'experts de 2,8 billions de paramètres avec un raisonnement toujours actif. Pour une génération de 20 000 jetons, cela représente des minutes de génération, et sur votre propre cluster, ce sont des minutes de vos propres GPU.
Les versions louées sont plus proches que ne le laisse entendre la question de la propriété. Kimi K3 sur l'API de Moonshot est à 3,00 $ / 15,00 $ avec une entrée en cache à 0,30 $, soit environ un tiers des tarifs par token de Claude Fable 5.1, tandis que le côté Claude a réduit son prix de lecture du cache de 75 % en septembre — à 0,25 $ par million, en dessous de celui de Kimi — ce qui compte précisément pour les longues sessions agentiques que visent les deux modèles, où la même sortie d'un outil est relue des dizaines de fois. Sur la mesure indépendante du coût par tâche, l'écart s'établit à 2,00 $ pour Kimi K3 contre 7,63 $ pour Claude Fable 5.1 : un facteur de près de quatre, et non de trois comme le suggèrent les prix des tokens, car le modèle d'Anthropic écrit environ 190 millions de tokens contre 160 millions pour Kimi pour le même travail d'indexation.
Un raisonnement que vous pouvez suivre
Il existe une différence d'expérience développeur qui n'apparaît dans aucun tableau comparatif. Kimi K3 diffuse en continu ses traces de raisonnement via l'API, ce qui transforme une étape d'agent échouée en quelque chose que l'on peut lire plutôt qu'en quelque chose que l'on doit déduire. Claude Fable 5.1 adopte l'approche inverse : la réflexion est toujours active, la chaîne de pensée brute n'est jamais renvoyée, et le paramètre d'affichage détermine si vous recevez un résumé lisible ou rien du tout. Les résumés suffisent pour la plupart des journaux de production ; les traces sont plus adaptées pour déboguer un agent qui ne cesse de prendre la mauvaise branche. Si vous construisez une infrastructure d'agents plutôt que de la consommer, cette différence se fait sentir en quelques heures.
La note de bas de page sur les achats.
Pour les entreprises américaines, une variable non technique s'attache à cette confrontation. Moonshot AI est un laboratoire dont le siège est à Pékin et qui a fait l'objet d'un examen minutieux de la part du gouvernement américain : le secrétaire au Trésor a publiquement menacé d'ajouter l'entreprise à une liste noire commerciale, des responsables américains ont allégué qu'elle avait distillé des capacités à partir de modèles américains — une allégation que Moonshot dément — et des reportages de presse décrivent des discussions préliminaires avec Microsoft, Amazon et Google pour héberger Kimi K3 dans le cadre d'accords de partage des revenus, parallèlement à un dépôt de dossier confidentiel pour une introduction en bourse à Hong Kong début septembre. Rien de tout cela ne change la comparaison technique, et un déploiement open-weights hébergé aux États-Unis au sein de votre propre infrastructure est matériellement différent de l'acheminement de requêtes vers une API offshore. Cela signifie néanmoins qu'une décision d'approvisionnement concernant Kimi K3 est une décision qui comporte une dimension politique, et qu'elle devrait être prise par des personnes conscientes de cet enjeu.
Faire la comparaison au lieu de se disputer.
Les deux modèles sont accessibles sur OrcaRouter aux prix catalogue de leurs fournisseurs avec une marge nulle, ce qui en fait une comparaison que vous pouvez trancher avec vos propres données plutôt qu'avec un tableau de benchmarks : Kimi K3 chez Moonshot à 3,00 $ / 15,00 $, Claude Fable 5.1 chez Anthropic à 10,00 $ / 50,00 $, avec une seule clé et une seule facture, sans second contrat à signer ni modification de code pour basculer. Pointez le même harnais de test sur les deux, mesurez le coût par tâche accomplie sur vos charges de travail réelles, et laissez le basculement automatique maintenir le chemin de production pendant qu'un modèle candidat est encore en cours d'évaluation. Si la charge de travail relève du raisonnement profond ou vit dans Claude Code, le modèle phare fermé gagne généralement ; s'il s'agit de génération à haut volume où une sortie d'un million de tokens ou un déploiement auto-hébergé change l'économie, Kimi K3 est le seul des deux qui puisse être possédé, et la couche de routage est l'endroit où vous gardez les deux options ouvertes.

{{1}}Ce qu'il faut surveiller ensuite est symétrique. Anthropic publie à un rythme à peu près mensuel et a désormais démontré qu'il réduira les prix du cache sans toucher aux tarifs affichés, si bien que le volet coût de cette confrontation peut évoluer sans nouveau modèle.{{/1}} {{2}}L'avenir même de Moonshot est désormais lié à son introduction en Bourse et à ces pourparlers avec le cloud américain, l'un ou l'autre pouvant modifier comment — et où — Kimi K3 est servi.{{/2}} {{3}}Ni l'une ni l'autre n'est une raison d'attendre : les deux modèles font aujourd'hui ce que les chiffres ci-dessus indiquent, et la décision qui vieillit le mieux est celle qui conserve l'ID du modèle comme valeur de configuration plutôt qu'une réécriture.{{/3}}
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
