Une carte hero générée intitulée « Dots vs Kimi K3 », avec pour sous-titre « L'un lit toute la bibliothèque, l'autre va la chercher ». Un filet vertical sépare la carte : le panneau de gauche, étiqueté « Dots », affiche « agit sur plus de 4 000 applications - allocation non publiée » ; celui de droite, étiqueté « Kimi K3 », affiche « contexte de 1 M - rappel en contexte long 88,7 - 3,00 $ / 15,00 $ ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Dots vs Kimi K3 : L'un lit toute la bibliothèque, l'autre va la chercher

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il existe un type de travail bien précis que seul l’un de ces deux peut accomplir, et il vaut la peine de le nommer avant toute autre chose. Kimi K3, publié par Moonshot AI le 15 juillet 2026, est un modèle à mélange d’experts de 2,8 billions de paramètres avec une fenêtre de contexte de 1 048 576 jetons, qui accepte du texte et des images et renvoie du texte, au prix de 3,00 $ par million de jetons en entrée et de 15,00 $ par million de jetons en sortie, avec des lectures en cache à 0,30 $. Dots est l’agent toujours actif de l’entreprise, annoncé au DevDay le 29 septembre 2026, avec son propre ordinateur cloud et son propre navigateur, des connecteurs vers plus de 4 000 applications et une place dans ChatGPT, Slack et Teams, fonctionnant sur GPT-6 Astra et inclus avec Pro et Business Premium. K3 peut contenir une archive entière dans une seule requête et répondre à des questions à son sujet. Un dot peut aller chercher le prochain document auquel vous n’avez pas encore pensé. Lire et récupérer sont deux tâches différentes, et choisir la mauvaise est l’erreur coûteuse.

Le nombre que Kimi K3 détient en propre

Le rappel en contexte long est la mesure qui sépare le marketing de la capacité réelle, car une grande fenêtre de contexte est facile à revendiquer et difficile à exploiter. K3 y obtient 88,7 — le chiffre le plus élevé de tous les modèles que nous répertorions, au-dessus des 84 de GPT-5.6 Sol, des 83 de MiniMax M3 et des 82 de Gemini 3.1 Pro. Il affiche également 93,5 sur GPQA Diamond et 59,5 sur SciCode, et porte un Artificial Analysis Coding Index de 76,2, ce qui le place neuvième sur 138 modèles mesurés, ainsi qu'un Intelligence Index de 43,6, au dix-neuvième rang sur 145. Ce sont tous des chiffres de tiers, repris dans notre catalogue avec leurs sources jointes plutôt que répétés depuis une annonce de lancement.

Ce que cela vous apporte, c'est une catégorie de tâches qui ne se décompose tout simplement pas : lire l'intégralité d'une base de code avant de répondre à une question à son sujet, comparer une année de contrats à un nouveau modèle, ou tenir une longue session agentique sans que le milieu de celle-ci ne disparaisse de la mémoire. K3 est conçu exactement pour cela — Moonshot le positionne pour les agents de programmation et le travail de connaissance à long horizon — et il est inhabituel en cela qu'il refuse entièrement les paramètres d'échantillonnage. Il n'y a pas de temperature, pas de top_p, pas de seed ; la profondeur de raisonnement est un unique réglage appelé reasoning_effort. C'est un compromis délibéré : moins de réglages, plus de cohérence sur une longue session.

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier 'kimi/kimi-k3' with Vision, Tools, JSON and Reasoning badges, a publication date of 2026-07-15, a description of it as Moonshot AI's flagship 2.8-trillion-parameter MoE with a 1M-token context window and native visual understanding, a side panel reading 1M tokens of context over text and image input, and a price strip reading $3.00 and $15.00 with a p50 time to first token of 8.82 seconds and a seven-day traffic figure of 831.3M tokens.

À quoi sert un point, formulé sans le marketing

Un dot est un travailleur doté d’un calendrier. Ses entrées sont banales — vos messages, les données de votre application, une tâche que vous avez décrite en une phrase — et sa sortie est un changement ailleurs : un fichier déplacé, un ticket mis à jour, un message rédigé puis envoyé après votre approbation, une page ouverte dans son propre navigateur. Les documents de lancement d’OpenAI décrivent un dot qui fait avancer plusieurs projets à la fois et apprend des retours, et l’interprétation honnête est que vous achetez le liant, pas l’intelligence.

Le tissu conjonctif est la partie coûteuse à construire. Un navigateur qui se comporte comme celui d'une personne, des connecteurs maintenus par les fournisseurs d'applications, une vue d'activité, des portes d'approbation, l'isolement par rapport à votre propre machine — rien de tout cela n'est difficile en principe, et tout cela est fastidieux en pratique. C'est ce que l'abonnement paie. Ce qu'il ne paie pas, c'est la mesurabilité.

• Coût — inclus avec Pro ou Business Premium, quota non publié (Dots) contre 3,00 $ par million de jetons d’entrée et 15,00 $ par million de jetons de sortie, lectures mises en cache 0,30 $ (Kimi K3)

• Plafond sur une requête — non documenté pour un point, face à 1 048 576 tokens de contexte et un 88,7 adapté au mobile en rappel de contexte long (Kimi K3)

• Entrée et sortie — messages et données d’applications connectées en entrée, modifications dans d’autres logiciels en sortie (Dots), face à texte et image en entrée, texte en sortie (Kimi K3)

• Contrôle de l’échantillonnage — aucun publié (Dots) face à l’absence de temperature, de top_p et de seed, avec la profondeur de raisonnement définie par reasoning_effort seul (Kimi K3)

• Vitesse à laquelle vous devez vous attendre — non documentée pour un point, par rapport à un temps médian de 8,82 secondes jusqu’au premier token et à environ 39 tokens de sortie par seconde dans notre propre mesure sur sept jours (Kimi K3)

• Preuves indépendantes — démos de fournisseurs et déclarations de capacités, aucun benchmark (Dots) face à l’AA Coding Index 76,2 à la neuvième place sur 138, GPQA Diamond 93,5, rappel en contexte long 88,7 (Kimi K3)

Ce que personne ne mentionne à propos de l'achat d'un agent

Un abonnement dont l’allocation n’est pas publiée possède une propriété que n’a pas une grille tarifaire : on ne peut pas distinguer une tâche qui a coûté peu cher d’une tâche qui a coûté cher. Chaque tâche coûte la même chose — rien de marginal — jusqu’au moment précis où ce n’est plus le cas, et la réponse arrive alors sous forme de limite plutôt que de facture. Pour une équipe dont le travail est exploratoire, c’est un atout. Pour une équipe qui doit imputer les coûts à un projet, c’est un trou dans la comptabilité.

Il existe aussi un effet de second ordre. Lorsque le coût marginal d'un appel est invisible, on cesse de se demander si l'appel était nécessaire, et l'optimisation la plus économique de tout pipeline — ne pas émettre la requête — vous devient inaccessible. Un modèle facturé à l'usage impose cette question chaque fois que quelqu'un consulte la grille tarifaire.

A generated scoreboard titled 'Dots vs Kimi K3 - what each one measures', with two columns. The left column, 'Dots', lists: price included with Pro or Business Premium; allowance not published; cost per task not published; model GPT-6 Astra (vendor-stated); computer its own cloud computer and browser; independent benchmark none. The right column, 'Kimi K3', lists: context 1,048,576 tokens; input text and image; price $3.00 in / $15.00 out per 1M; cached reads $0.30 per 1M; architecture 2.8T total MoE; long-context recall 88.7. A footer reads 'Dots details vendor-stated from OpenAI's DevDay launch; Kimi K3 figures from independent listings as carried in the OrcaRouter catalogue.'

En les composant sans prétendre qu'il s'agit d'alternatives

La forme qui fonctionne, c’est un point qui remarque et un modèle à long contexte qui lit. Le travail arrive — un document dans un lecteur partagé, un message dans un fil — et le point décide si cela compte. Si oui, le document part vers Kimi K3 avec tout ce dont il pourrait avoir besoin en pièce jointe, en une seule requête, et la réponse revient entièrement ancrée dans la source plutôt que dans un résumé de la source. Le point gère les relances et la logistique ennuyeuse ; le modèle gère la lecture, à un volume qu’aucune boucle de petits appels n’aurait assemblé correctement.

Kimi K3 est routé sur OrcaRouter en tant que kimi/kimi-k3 au prix catalogue de Moonshot, sans marge ajoutée, dans le même catalogue que plus de 200 autres modèles derrière une seule clé, avec basculement automatique entre les fournisseurs en amont lorsque l’un d’eux se dégrade et un DSL de routage permettant de composer plusieurs modèles en un seul appel. C’est la moitié facturée à l’usage du pipeline, et rien de plus : les dots ne figurent pas dans le catalogue, il n’existe aucun point de terminaison pour l’un d’eux, et aucun identifiant n’existe pour y adresser une requête. Si la couche de lecture est la partie que vous devez contrôler — et pour tout ce que vous comptez faire tourner pendant un an, c’est généralement le cas — c’est cette couche qu’il faut s’approprier.

Quel achat gaspille de l'argent

Acheter un dot pour lire un grand corpus est un gaspillage, car le dot ira chercher et résumer plutôt que de contenir l’ensemble, et c’est dans le résumé que meurt le détail dont vous aviez besoin. Acheter Kimi K3 pour suivre un projet sur cinq applications est un gaspillage pour la raison exactement inverse : un modèle qui répond lorsqu’on l’appelle ne vous appelle pas.

Si le travail relève de la récupération et de la logistique, louez le travailleur. Si le travail relève de la compréhension à grande échelle, achetez le compteur et donnez-lui tout en une seule fois. Les deux se recoupent bien moins que ne le suggère le mot « agentic », et ce recoupement n'est pas là où l'un ou l'autre est bon.

A screenshot of the OrcaRouter model catalogue page headed 'Models', showing the line '206 models · 16 providers · one API key, one bill' above filter controls for input modalities, context length, input price, status and supported parameters, with a grid of model cards visible beneath.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement