
Dots vs Kimi K3 : L'un lit toute la bibliothèque, l'autre va la chercher
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 349 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 210 tok/s
- OrcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- xAISpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Il existe un type de travail bien précis que seul l’un de ces deux peut accomplir, et il vaut la peine de le nommer avant toute autre chose. Kimi K3, publié par Moonshot AI le 15 juillet 2026, est un modèle à mélange d’experts de 2,8 billions de paramètres avec une fenêtre de contexte de 1 048 576 jetons, qui accepte du texte et des images et renvoie du texte, au prix de 3,00 $ par million de jetons en entrée et de 15,00 $ par million de jetons en sortie, avec des lectures en cache à 0,30 $. Dots est l’agent toujours actif de l’entreprise, annoncé au DevDay le 29 septembre 2026, avec son propre ordinateur cloud et son propre navigateur, des connecteurs vers plus de 4 000 applications et une place dans ChatGPT, Slack et Teams, fonctionnant sur GPT-6 Astra et inclus avec Pro et Business Premium. K3 peut contenir une archive entière dans une seule requête et répondre à des questions à son sujet. Un dot peut aller chercher le prochain document auquel vous n’avez pas encore pensé. Lire et récupérer sont deux tâches différentes, et choisir la mauvaise est l’erreur coûteuse.
Le nombre que Kimi K3 détient en propre
Le rappel en contexte long est la mesure qui sépare le marketing de la capacité réelle, car une grande fenêtre de contexte est facile à revendiquer et difficile à exploiter. K3 y obtient 88,7 — le chiffre le plus élevé de tous les modèles que nous répertorions, au-dessus des 84 de GPT-5.6 Sol, des 83 de MiniMax M3 et des 82 de Gemini 3.1 Pro. Il affiche également 93,5 sur GPQA Diamond et 59,5 sur SciCode, et porte un Artificial Analysis Coding Index de 76,2, ce qui le place neuvième sur 138 modèles mesurés, ainsi qu'un Intelligence Index de 43,6, au dix-neuvième rang sur 145. Ce sont tous des chiffres de tiers, repris dans notre catalogue avec leurs sources jointes plutôt que répétés depuis une annonce de lancement.
Ce que cela vous apporte, c'est une catégorie de tâches qui ne se décompose tout simplement pas : lire l'intégralité d'une base de code avant de répondre à une question à son sujet, comparer une année de contrats à un nouveau modèle, ou tenir une longue session agentique sans que le milieu de celle-ci ne disparaisse de la mémoire. K3 est conçu exactement pour cela — Moonshot le positionne pour les agents de programmation et le travail de connaissance à long horizon — et il est inhabituel en cela qu'il refuse entièrement les paramètres d'échantillonnage. Il n'y a pas de temperature, pas de top_p, pas de seed ; la profondeur de raisonnement est un unique réglage appelé reasoning_effort. C'est un compromis délibéré : moins de réglages, plus de cohérence sur une longue session.

À quoi sert un point, formulé sans le marketing
Un dot est un travailleur doté d’un calendrier. Ses entrées sont banales — vos messages, les données de votre application, une tâche que vous avez décrite en une phrase — et sa sortie est un changement ailleurs : un fichier déplacé, un ticket mis à jour, un message rédigé puis envoyé après votre approbation, une page ouverte dans son propre navigateur. Les documents de lancement d’OpenAI décrivent un dot qui fait avancer plusieurs projets à la fois et apprend des retours, et l’interprétation honnête est que vous achetez le liant, pas l’intelligence.
Le tissu conjonctif est la partie coûteuse à construire. Un navigateur qui se comporte comme celui d'une personne, des connecteurs maintenus par les fournisseurs d'applications, une vue d'activité, des portes d'approbation, l'isolement par rapport à votre propre machine — rien de tout cela n'est difficile en principe, et tout cela est fastidieux en pratique. C'est ce que l'abonnement paie. Ce qu'il ne paie pas, c'est la mesurabilité.
• Coût — inclus avec Pro ou Business Premium, quota non publié (Dots) contre 3,00 $ par million de jetons d’entrée et 15,00 $ par million de jetons de sortie, lectures mises en cache 0,30 $ (Kimi K3)
• Plafond sur une requête — non documenté pour un point, face à 1 048 576 tokens de contexte et un 88,7 adapté au mobile en rappel de contexte long (Kimi K3)
• Entrée et sortie — messages et données d’applications connectées en entrée, modifications dans d’autres logiciels en sortie (Dots), face à texte et image en entrée, texte en sortie (Kimi K3)
• Contrôle de l’échantillonnage — aucun publié (Dots) face à l’absence de temperature, de top_p et de seed, avec la profondeur de raisonnement définie par reasoning_effort seul (Kimi K3)
• Vitesse à laquelle vous devez vous attendre — non documentée pour un point, par rapport à un temps médian de 8,82 secondes jusqu’au premier token et à environ 39 tokens de sortie par seconde dans notre propre mesure sur sept jours (Kimi K3)
• Preuves indépendantes — démos de fournisseurs et déclarations de capacités, aucun benchmark (Dots) face à l’AA Coding Index 76,2 à la neuvième place sur 138, GPQA Diamond 93,5, rappel en contexte long 88,7 (Kimi K3)
Ce que personne ne mentionne à propos de l'achat d'un agent
Un abonnement dont l’allocation n’est pas publiée possède une propriété que n’a pas une grille tarifaire : on ne peut pas distinguer une tâche qui a coûté peu cher d’une tâche qui a coûté cher. Chaque tâche coûte la même chose — rien de marginal — jusqu’au moment précis où ce n’est plus le cas, et la réponse arrive alors sous forme de limite plutôt que de facture. Pour une équipe dont le travail est exploratoire, c’est un atout. Pour une équipe qui doit imputer les coûts à un projet, c’est un trou dans la comptabilité.
Il existe aussi un effet de second ordre. Lorsque le coût marginal d'un appel est invisible, on cesse de se demander si l'appel était nécessaire, et l'optimisation la plus économique de tout pipeline — ne pas émettre la requête — vous devient inaccessible. Un modèle facturé à l'usage impose cette question chaque fois que quelqu'un consulte la grille tarifaire.

En les composant sans prétendre qu'il s'agit d'alternatives
La forme qui fonctionne, c’est un point qui remarque et un modèle à long contexte qui lit. Le travail arrive — un document dans un lecteur partagé, un message dans un fil — et le point décide si cela compte. Si oui, le document part vers Kimi K3 avec tout ce dont il pourrait avoir besoin en pièce jointe, en une seule requête, et la réponse revient entièrement ancrée dans la source plutôt que dans un résumé de la source. Le point gère les relances et la logistique ennuyeuse ; le modèle gère la lecture, à un volume qu’aucune boucle de petits appels n’aurait assemblé correctement.
Kimi K3 est routé sur OrcaRouter en tant que kimi/kimi-k3 au prix catalogue de Moonshot, sans marge ajoutée, dans le même catalogue que plus de 200 autres modèles derrière une seule clé, avec basculement automatique entre les fournisseurs en amont lorsque l’un d’eux se dégrade et un DSL de routage permettant de composer plusieurs modèles en un seul appel. C’est la moitié facturée à l’usage du pipeline, et rien de plus : les dots ne figurent pas dans le catalogue, il n’existe aucun point de terminaison pour l’un d’eux, et aucun identifiant n’existe pour y adresser une requête. Si la couche de lecture est la partie que vous devez contrôler — et pour tout ce que vous comptez faire tourner pendant un an, c’est généralement le cas — c’est cette couche qu’il faut s’approprier.
Quel achat gaspille de l'argent
Acheter un dot pour lire un grand corpus est un gaspillage, car le dot ira chercher et résumer plutôt que de contenir l’ensemble, et c’est dans le résumé que meurt le détail dont vous aviez besoin. Acheter Kimi K3 pour suivre un projet sur cinq applications est un gaspillage pour la raison exactement inverse : un modèle qui répond lorsqu’on l’appelle ne vous appelle pas.
Si le travail relève de la récupération et de la logistique, louez le travailleur. Si le travail relève de la compréhension à grande échelle, achetez le compteur et donnez-lui tout en une seule fois. Les deux se recoupent bien moins que ne le suggère le mot « agentic », et ce recoupement n'est pas là où l'un ou l'autre est bon.

Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
