
Fugu Ultra v2 vs Kimi K3 : deux routeurs, deux altitudes
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Ces deux systèmes sont des routeurs, et c'est la première chose que la plupart des analyses oublient. Kimi K3 est un modèle Mixture-of-Experts de 2,8 billions de paramètres qui active environ 104 milliards de paramètres par token — ce qui signifie que sur chaque token qu'il génère, il prend une décision de routage, sélectionnant 16 de ses 896 experts pour faire le travail. Fugu Ultra v2, annoncé par Sakana AI le 11 septembre 2026, est un routeur à un tout autre niveau : il prend une tâche entrante, la découpe et répartit les morceaux à travers un ensemble de modèles distincts. L'un route à l'intérieur d'une passe avant ; l'autre route à travers une flotte. Comprendre qu'il s'agit de la même idée à deux échelles est le moyen le plus rapide de voir pourquoi leurs tarifs diffèrent d'un facteur 2× en entrée et 5× en sortie.
Les deux routeurs, côte à côte
• Kimi K3 — le modèle phare de Moonshot AI, sorti à la mi-juillet 2026, dont les poids ouverts ont été publiés le 27 juillet 2026. L'architecture est inhabituelle, même selon les standards de 2026 : 69 couches Kimi Delta Attention entrelacées avec 24 couches Gated MLA, des Attention Residuals, une conception « Stable LatentMoE » et un encodeur visuel MoonViT-V2 de 401 M de paramètres. Les poids sont fournis en MXFP4 avec des activations MXFP8 dans le cadre d'un entraînement sensible à la quantification. Son API hébergée expose l'effort de raisonnement avec exactement une valeur prise en charge — max.
• Fugu Ultra v2 — le palier d'orchestration de plus haute capacité de Sakana AI, et non un modèle de fondation au sens habituel. Il s'agit d'un point de terminaison unique compatible avec OpenAI qui décompose les tâches et les répartit sur un ensemble de modèles à poids ouverts et spécialisés. Sakana indique que Claude Fable 5, Claude Fable 5.1 et GPT-6 Astra sont exclus de cet ensemble, et mentionne une date limite d'entraînement de 20260828. Aucun nombre de paramètres n'est publié, car il n'y a pas de paramètres à compter comme on le ferait pour K3 — la capacité réside dans la politique d'ordonnancement.
La conséquence, c’est que K3 est un composant et Fugu Ultra v2 est un assemblage. Cela rend cette comparaison inhabituelle : ces deux-là ne sont pas seulement des concurrents, ce sont des ingrédients potentiels. Un modèle comme K3 est exactement le genre de système à poids ouverts, à contexte long et à appel d’outils qu’un orchestrateur serait susceptible de louer. Sakana ne publie pas la composition du pool, donc on ignore si K3 fait partie de Fugu Ultra v2 — mais si c’est le cas, une partie de ce que vous payez au tarif de Fugu correspond à des tokens de K3 avec une marge.
Ce qu’est réellement l’écart de prix
• Entrée — Fugu Ultra v2 à un tarif signalé de 5,00 $ par million (annonces de tiers ; la page d'annonce de Sakana ne publie pas ses propres tarifs) face à Kimi K3 à 3,00 $ par million, avec des hits de cache à 0,30 $.
• Sortie — Fugu Ultra v2 à un prix annoncé de 30,00 $ par 1 M contre Kimi K3 à 15,00 $ par 1 M. Moitié prix, pour un modèle que vous pouvez aussi télécharger.
• Entrée mise en cache — Fugu Ultra v2 à 0,50 $ par 1 M contre Kimi K3 à 0,30 $ par 1 M lors d'un accès au cache. Dans une longue boucle d'agent avec un prompt système stable, cet écart se cumule à chaque tour.
• Paliers de contexte — Kimi K3 reste à tarif constant sur toute sa fenêtre de 1 048 576 tokens, sans pénalité de contexte long. Le palier annoncé pour Fugu Ultra v2 au-delà d'environ 272 000 tokens d'entrée fait passer l'ensemble de la requête à environ 10,00 $ / 45,00 $.
Cette dernière ligne est celle qui détermine les factures réelles. Une exécution d’agent à long horizon passe la majeure partie de sa vie au-delà de 272K tokens, ce qui est précisément là où le tarif fixe de K3 reste constant et où celui de Fugu Ultra v2 double. Si votre charge de travail ressemble à cela, l’écart effectif du côté des entrées est plus proche de 3,3× que de 1,7×.

Le seul nombre qu'ils ont en commun
Les deux fournisseurs rapportent des scores sur DeepSWE, et la comparaison est moins flatteuse pour Fugu que ne le suggère le cadrage de son lancement. Sakana indique Fugu Ultra v2 à 74,3. Moonshot indique Kimi K3 à 67,5 — rapporté par le fournisseur, d’après la fiche du modèle. Cela fait un écart de 6,8 points sur un benchmark d’agents de codage, ce qui est réel, mais il s’agit d’un test parmi un ensemble publié bien plus vaste, et c’est le même test sur lequel Sakana devance GPT-5.6 Sol de 1,6 point. Un benchmark où trois fournisseurs différents se regroupent tous à moins de sept points d’écart mesure quelque chose de réel, mais ne permet pas de les départager de manière décisive.
Au-delà de ça, les deux publient sur des rayons complètement différents. Les chiffres du K3 de Moonshot comprennent Terminal-Bench 2.1 à 88,3, GPQA Diamond à 93,5, HLE-Full à 43,5 (56,0 avec outils), SWE-Marathon à 42,0, OSWorld-Verified à 84,8 et MCPMark-Verified à 94,5 — tous rapportés par le fournisseur, tous sur la fiche du modèle. Les huit de Sakana pour Fugu Ultra v2 incluent deux benchmarks internes, SWEFish et Toolathon, que personne en dehors de Sakana ne peut reproduire.
Indépendamment, un seul d'entre eux a été mesuré, ne serait-ce que de façon minimale. Kimi K3 obtient 44 à l'Artificial Analysis Intelligence Index v4.3 — deuxième parmi les modèles à poids ouverts, derrière GLM-5.3 à 45 — et 93,40 % sur SWE-bench Verified avec le harnais agentique standardisé de Vals AI, derrière Claude Opus 5 et DeepSeek V4 Pro, mais de près. Il est aussi en tête du Frontend Code Arena avec 1679 Elo, devant Fable 5 à 1631 et GPT-5.6 Sol à 1618. Si vous avez vu K3 cité à 57 ou 60, il s'agit de l'échelle d'indice supplantée, et elle ne doit pas être répétée.
Fugu Ultra v2 n'a aucun score indépendant, quel qu'il soit. Il a été annoncé le 11 septembre 2026 et personne en dehors de Sakana ne l'a exécuté.
Vitesse : l'une mesurée, l'autre pas
Kimi K3 est lent, et c’est mesuré plutôt qu’affirmé : Artificial Analysis enregistre 37,9 tokens par seconde avec un temps jusqu’au premier token de 3,80 secondes, et le signale comme particulièrement verbeux. Pour un modèle conçu autour du codage agentique à long horizon, le débit est une contrainte réelle — un modèle lent dans une longue boucle coûte du temps réel, pas seulement de l’argent.
Sakana ne publie absolument aucun chiffre de latence ou de débit pour Fugu Ultra v2. Pour un orchestrateur, c'est sans doute de l'honnêteté plutôt que de l'esquive, car le temps de réponse dépend entièrement des modèles qu'il décide d'appeler et du nombre de passes qu'il effectue. Mais cela signifie aussi que vous ne pouvez pas modéliser le coût en temps écoulé d'un passage à ce système sans le mesurer vous-même. Pour le précédent Fugu Ultra, des testeurs ont publiquement rapporté des exécutions approchant les 30 minutes ; il s'agit du modèle de juin 2026 et non d'une preuve concernant la v2, mais c'est le chiffre à battre lorsque vous faites un benchmark.

Poids ouverts, avec un bémol qui mérite d'être lu
Les poids de Kimi K3 sont téléchargeables, ce qui constitue une véritable différence par rapport au modèle uniquement hébergé de Fugu Ultra v2 — mais la licence est plus restrictive que ne le suggère habituellement l’expression « poids ouverts ». K3 est distribué sous la Kimi K3 License, et non sous une licence MIT ou Apache approuvée par l’OSI, et l’affirmation largement répétée selon laquelle il s’agit d’une « MIT modifiée » est contestée. Les conditions exigent un accord distinct avec Moonshot pour les entreprises de modèle en tant que service dont le chiffre d’affaires dépasse 20 M$ sur toute période de douze mois consécutifs, ainsi qu’une attribution pour les produits dépassant 100 M d’utilisateurs mensuels ou 20 M$ de revenus mensuels. L’utilisation interne est exemptée.
Donc, pour être honnête : K3 vous donne des poids que vous pouvez conserver, inspecter, affiner et héberger vous-même, sous réserve d’une condition commerciale subordonnée à un seuil de chiffre d’affaires. Fugu Ultra v2 ne vous donne rien de tout cela — pas de poids, pas de pool inspectable, pas d’auto-hébergement — mais n’impose non plus aucune condition de chiffre d’affaires, puisqu’il n’y a rien à licencier. Laquelle de ces solutions est la plus permissive dépend entièrement de si vous êtes le type d’entreprise que la licence K3 vise.
Une mise en garde pratique si l’auto-hébergement est envisagé : le checkpoint de K3 fait environ 1,5 téraoctets et le fournisseur recommande 64 accélérateurs ou plus. « Poids ouverts » signifie ici une décision de cluster d’inférence, pas une décision de portable. Pour la plupart des équipes, l’API est de toute façon la voie sensée — c’est pourquoi la prise en charge de vLLM et SGLang dès le jour 0 compte plus que le téléchargement.
Ce que dit notre propre trafic
Une donnée que ni l'un ni l'autre des fournisseurs ne publie, et qui vaut bien plus qu'elle n'en a l'air : sur la passerelle OrcaRouter, Kimi K3 est de loin le modèle le plus utilisé parmi tous ceux évoqués dans cet article, avec environ 3,27 milliards de tokens traités au cours des sept derniers jours.
Ce n'est pas un benchmark et cela ne permet pas de conclure quoi que ce soit sur la qualité. Mais il s'agit d'un large échantillon de ce que les développeurs choisissent réellement lorsque la décision ne leur coûte rien d'autre que le prix des tokens, et il indique que la combinaison proposée par K3 — une fenêtre de 1M à tarif forfaitaire, des poids ouverts et un solide positionnement sur coding-arena — a déjà conquis une part substantielle du travail agentique réel à long contexte. Fugu Ultra v2 n'a pas de signal comparable, car il a été lancé aujourd'hui.

Se rendre à chacun d'entre eux
Kimi K3 est disponible sur OrcaRouter au tarif appliqué par Moonshot lui-même — 3,00 $ par million de tokens en entrée, 0,30 $ en cas de cache hit, 15,00 $ par million de tokens en sortie — répercuté sans marge, de sorte qu'un changement de tarif du fournisseur arrive ici le jour même plutôt que selon un calendrier de migration. Il est compatible avec OpenAI sur la même URL de base que le reste du catalogue, et comme il se trouve derrière la même passerelle que tout le reste, vous pouvez l'intégrer à une chaîne de basculement ou y router conditionnellement, plutôt que de coder en dur un seul fournisseur dans un chemin de production. Cela compte plus que d'habitude ici : un modèle de 2,8 T de paramètres servi à 37,9 tokens par seconde est exactement le type de dépendance derrière laquelle il vaut la peine d'avoir une solution de repli.
Fugu Ultra v2 n'est pas routé par nous. Il est disponible via l'API compatible OpenAI de Sakana AI, et l'entreprise affirme que les intégrations Fugu existantes basculent vers lui avec une simple modification de paramètre. Les deux modèles utilisent le même format de requête, donc une évaluation qui les place derrière un même indicateur n'est qu'un remplacement d'URL de base plutôt qu'une réécriture.
Lequel choisir
Kimi K3 est l'achat le plus défendable pour presque toutes les charges de travail. Il coûte la moitié du prix de Fugu Ultra v2, en entrée comme en sortie, à tarif uniforme sur une fenêtre de 1M sans falaise liée au contexte long, noté indépendamment à 44 sur l'indice Artificial Analysis actuel, auto-hébergeable sous une licence conditionnée au chiffre d'affaires, et déjà, et de loin, le modèle le plus utilisé de cette comparaison. Ses inconvénients sont la vitesse et la verbosité : 37,9 tokens par seconde, c'est franchement lent pour les boucles d'agents, et la licence a des dents si vous êtes une grande entreprise de modèles en tant que service.
Fugu Ultra v2 est l'achat à faire si vous voulez la propriété spécifique que Sakana vend — un palier de capacités qui décompose le travail difficile à plusieurs étapes sur un pool qui exclut structurellement les fournisseurs de pointe, de sorte qu'aucun modèle amont ne puisse être révoqué, re-tarifé ou coupé sous vos pieds. Son avantage DeepSWE sur K3 est réel et rapporté par le fournisseur ; son classement dans les deux premiers sur sept des huit benchmarks est lui aussi rapporté par le fournisseur, et sur des tests qui, en partie, n'existent nulle part ailleurs.
Ce qu'il faut remarquer, c'est que ces deux choses sont des décisions de routage, et l'on vous demande de choisir une altitude. K3 achemine les tokens vers des experts à l'intérieur d'un modèle que vous pouvez télécharger et contrôler. Fugu Ultra v2 achemine les tâches vers des modèles que vous ne pouvez pas voir. La seconde est une idée plus grande, plus puissante. C'est aussi celle que vous ne pouvez accepter que sur la foi — et il en coûte cinq fois plus cher par token d'avoir cette foi.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
