Une carte de titre principale indiquant « Fugu Max vs Kimi K3 », avec pour sous-titre « Sakana a choisi ce critère de référence », trois badges en forme de pilule indiquant « 6,00 $ vs 15,00 $ en sortie », « 60 % de moins, en sortie » et « 1 M fixe vs fenêtre non publiée », une ligne de pied de page indiquant « Sakana AI, septembre 2026 vs Moonshot AI, juillet 2026 », et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Fugu Max vs Kimi K3 : Sakana a choisi ce mètre-étalon, alors lisons-le

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La sortie de Fugu Max par Sakana AI nomme exactement trois modèles pour justifier son prix, et Kimi K3 de Moonshot AI est l'un d'eux. L'affirmation est que le tarif de sortie de Fugu Max est 40 à 60 % inférieur à celui de ces trois modèles, ce qui fait de Kimi K3 — et non de Grok 4.6, et non de Qwen3.8-Max — la référence que Sakana a elle-même choisie en matière de valeur. C'est là une chose inhabituellement généreuse de la part d'un fournisseur : il vous tend une règle et vous dit où la tenir. Alors cette page fait ce qui s'impose et la tient. Fugu Max est sorti le 11 septembre 2026 à $2.00 par million de jetons d'entrée et $6.00 par million de jetons de sortie. Kimi K3 est affiché à $3.00 et $15.00. L'affirmation des 60 % sur la sortie est arithmétiquement correcte. Ce que la phrase ne mentionne pas, c'est que le modèle qu'elle casse en prix publie un relevé complet de résultats mesurés indépendamment, tandis que le modèle qui casse les prix n'en publie aucun.

La phrase « 40 à 60 pour cent », examinée

• Entrée — Fugu Max 2,00 $ par million de tokens contre Kimi K3 3,00 $ par million de tokens, soit une économie de 33 pour cent plutôt que les 40 à 60 pour cent que met en avant le communiqué

• Sortie — Fugu Max 6,00 $ par million de tokens contre Kimi K3 15,00 $ par million de tokens, soit 60 % de moins que le haut de la fourchette annoncée par Sakana

• Entrée mise en cache — Fugu Max 0,25 $ par million de tokens contre Kimi K3 0,30 $ par million de tokens, un écart suffisamment faible pour que les boucles gourmandes en cache ne s’en aperçoivent pas

• Fenêtre de contexte — Fugu Max : aucun chiffre publié dans la version, contrairement à Kimi K3 avec 1 048 576 tokens

• Nouvelle tarification des prompts longs — Fugu Max : aucun palier indiqué, contre Kimi K3 : tarif unique sur toute la fenêtre, sans surcharge quelle que soit la longueur

• Déploiement — API du fournisseur Fugu Max uniquement, appartenance au pool non divulguée vs poids téléchargeables de Kimi K3 sous la licence Kimi K3

• Évaluation indépendante — Fugu Max : aucune, et aucune page Artificial Analysis n'existe pour aucun modèle Fugu, contre Kimi K3 avec un indice d'intelligence Artificial Analysis de 44 et un score standardisé de 93,40 % sur SWE-bench Verified de Vals AI

Remarquez la forme de cette première ligne. La fourchette mise en avant, 40 à 60 %, est la fourchette couvrant trois concurrents nommés, et Kimi K3 est celui qui produit le 60. Sur la seule entrée, la comparaison est de 33 %, ce qui reste une économie réelle, mais une phrase différente. Ce n'est pas une critique de la tarification — 2,00 $ et 6,00 $ sont des chiffres vraiment bas pour un système qui revendique des résultats proches de la frontière. C'est une remarque sur le nombre du communiqué qui fait le travail de persuasion, et sur la façon dont le paragraphe est agencé autour de lui.

Kimi K3 figure dans notre catalogue au tarif de Moonshot lui-même — 3,00 $ par million de tokens en entrée, 0,30 $ sur un cache hit, 15,00 $ par million de tokens en sortie — répercuté avec 0 % de marge, donc si Moonshot modifie ses tarifs le nouveau tarif est actif sur la même clé le jour même plutôt que sur un cycle de migration. Cela compte ici plus que d'habitude, car une baisse de prix en amont est précisément ce qui érode ou élargit l'écart de 60 pour cent sur lequel repose toute cette confrontation.

Ce que publie le mètre étalon

Le bilan de Kimi K3 est tout sauf clairsemé. La fiche de modèle de Moonshot elle-même rapporte Terminal-Bench 2.1 à 88,3, GPQA Diamond à 93,5, HLE-Full à 43,5 passant à 56,0 avec des outils, SWE-Marathon à 42,0, OSWorld-Verified à 84,8, MCPMark-Verified à 94,5 et DeepSWE à 67,5. Le tout rapporté par le fournisseur, et il y en a beaucoup.

La couche indépendante existe aussi, et c’est elle qui compte pour cette comparaison. Artificial Analysis attribue à Kimi K3 un score de 44 sur l’Intelligence Index v4.3 — deuxième parmi les modèles à poids ouverts, derrière GLM-5.3 à 45 — avec un débit enregistré de 37,9 jetons de sortie par seconde et un temps jusqu’au premier jeton de 3,80 secondes. Le harnais agentique standardisé de Vals AI le place à 93,40 % sur SWE-bench Verified, derrière Claude Opus 5 et DeepSeek V4 Pro, mais de près. Il est également en tête du Frontend Code Arena avec 1679 Elo, devant Claude Fable 5 à 1631 et GPT-5.6 Sol à 1618. Une mise en garde : si vous avez vu Kimi K3 cité à 57 ou 60 sur l’Intelligence Index, il s’agit de chiffres d’avant retraitement, datant d’avant qu’Artificial Analysis ne recalibre l’échelle en septembre 2026, et ils ne doivent pas être répétés avec les chiffres actuels.

Il y a aussi un signal d’usage, et il vient de notre propre passerelle plutôt que du marketing de qui que ce soit : Kimi K3 a fait transiter environ 3,27 milliards de tokens via OrcaRouter au cours des sept derniers jours, soit le trafic le plus élevé de tous les modèles de cette comparaison. Ce n’est pas une mesure de qualité. C’est un large échantillon de ce vers quoi les développeurs se tournent lorsque le seul coût du choix est le prix des tokens, et cela indique que la fenêtre de 1 M à tarif fixe et les poids ouverts ont déjà conquis une part substantielle du travail réel à long horizon.

A two-column scoreboard titled 'Fugu Max vs Kimi K3 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Kimi K3: output price $15.00 per 1M, input price $3.00 per 1M, cached input $0.30 per 1M, context 1M flat with no surcharge, benchmarks Terminal-Bench 2.1 at 88.3, evidence Artificial Analysis Index 44 and SWE-bench Verified 93.40%. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Kimi K3 rows Moonshot-reported and per Artificial Analysis and Vals AI.' OrcaRouter logo bottom-right.

Le tableau des scores sans chiffres

Sakana rapporte que Fugu Max obtient le meilleur score global sur six benchmarks : Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench et SWEFish. Il indique aussi que Max repousse la frontière de Pareto coût-performance sur sept des dix benchmarks. Ces deux affirmations portent sur un rang dans un graphique. Aucune des deux n'est accompagnée d'une valeur, d'un écart ou du chiffre d'un concurrent.

Les deux listes ne se recoupent quasiment pas, et c’est là le problème pratique. Kimi K3 annonce un score de 88,3 à Terminal-Bench 2.1 ; Sakana affirme que Fugu Max obtient le meilleur résultat global à Terminal Bench 2.1 et ne publie aucun chiffre auquel le comparer. Cette seule ligne est l’illustration la plus claire de tout le duel : les deux fournisseurs nomment le même test, l’un publie un chiffre, et l’autre publie le mot « best ». Tant que Sakana ne publie pas ce chiffre, aucune preuve publiée ne permet de répondre à la question de savoir si Fugu Max bat Kimi K3 sur le benchmark que Sakana a choisi de mettre en avant.

Il existe une lecture équitable de l'annonce qui mérite d'être formulée. Fugu Max est l'offre axée sur le coût — lancé le même jour que Fugu Ultra v2, qui est la montée en capacités à 5,00 $ en entrée et 30,00 $ en sortie — et son argument s'appuie sur un diagramme de Pareto où c'est le score par dollar, et non le score, qui est mis en avant. Dans ce cadre, un chiffre de benchmark brut serait une statistique moins honnête. Le problème est que l'annonce omet également le dénominateur : la communication de Sakana elle-même reconnaît que changer de modèle en cours de tâche peut réduire la réutilisation du cache de contexte et générer des jetons d'orchestration supplémentaires, et confirme que l'entreprise n'a pas divulgué le taux de succès du cache de Max ni son coût total en jetons par tâche. Ainsi, la seule mesure qui permettrait de trancher un argument sur le niveau de coût est celle qui n'est pas fournie.

Des poids que vous pouvez tenir, ou un pool que vous ne pouvez pas voir

C’est ici que les deux produits ne sont plus du tout comparables.

Kimi K3 est livré avec des poids téléchargeables, ce qui constitue une véritable échappatoire : si les tarifs ou les conditions changent, le modèle peut être servi depuis votre propre infrastructure. La licence est plus restrictive que ce que « poids ouverts » implique habituellement. Il s'agit de la licence Kimi K3 plutôt que d'une autorisation approuvée par l'OSI, et la description souvent répétée d'une licence MIT modifiée est contestée. Les conditions exigent un accord séparé avec Moonshot pour les activités de modèle en tant que service dépassant 20 millions de dollars de chiffre d'affaires sur une période quelconque de douze mois consécutifs, ainsi qu'une attribution pour les produits dépassant 100 millions d'utilisateurs mensuels ou 20 millions de dollars de chiffre d'affaires mensuel, l'usage interne étant exempté. Et l'échelle pratique est bien réelle : le checkpoint fait environ 1,5 téraoctet et Moonshot recommande 64 accélérateurs ou plus, de sorte que l'auto-hébergement est une décision de grappe d'inférence plutôt qu'une affaire d'ordinateur portable.

Fugu Max n’offre rien de tout cela — pas de poids, pas de pool inspectable, aucune option d’auto-hébergement — et en échange, n’impose aucune condition de licence, car il n’y a rien à concéder sous licence. L’avantage annoncé par Sakana est l’inverse du contrôle : un pool qui couvre des modèles à poids ouverts et des modèles spécialisés, élargi pour Max avec la famille NVIDIA Nemotron, signifie qu’aucun abandon ni changement de tarif d’un seul fournisseur en amont ne peut faire tomber votre produit. C’est une véritable couverture. Elle est aussi invérifiable de l’extérieur, car la liste des membres n’est délibérément pas publiée, et cela signifie qu’un résultat de Fugu Max porte une date d’expiration qu’un résultat de Kimi K3 n’a pas.

Des poids ouverts et un pool non divulgué sont deux réponses différentes à la même peur. L'une dit que vous pouvez partir. L'autre dit qu'il n'y a rien à quitter.

Là où la fenêtre plate décide

Le contexte de 1 048 576 tokens de Kimi K3 est uniforme — pas de palier long contexte, pas de surcoût quelle que soit la longueur. La publication de Fugu Max n'indique aucune fenêtre du tout, si bien qu'il n'y a rien à quoi la comparer et rien sur quoi fonder une planification. Pour le codage agentique à long horizon auquel les deux produits s'adressent, où les sessions passent l'essentiel de leur vie au plus profond du contexte, cette asymétrie compte davantage que la grille tarifaire.

La vitesse est l'image miroir du même problème. Les 37,9 jetons par seconde de Kimi K3, avec un temps jusqu'au premier jeton de 3,80 secondes, sont mesurés, et c'est lent — véritablement une contrainte pour un modèle conçu autour de longues boucles, et Artificial Analysis le signale comme particulièrement verbeux. Sakana ne publie aucun chiffre de latence ou de débit pour Fugu Max, ce qui, pour un orchestrateur, est sans doute honnête plutôt qu'évasif : le temps de réponse dépend des modèles qu'il choisit et du nombre de passes qu'il effectue. Mais cela signifie que vous ne pouvez pas modéliser le coût de basculement en temps réel sans le mesurer vous-même. Pour le précédent Fugu Ultra, des utilisateurs ont rapporté publiquement des exécutions s'étirant vers 30 minutes. C'est le modèle de juin 2026 et non une preuve concernant Max, mais c'est le chiffre à battre lorsque vous faites des benchmarks.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the opening argument about the two-dimensional frontier of capability against cost and the statement that Fugu Max expands the Pareto efficiency frontier by orchestrating Sakana's largest pool of open and specialized models to date.

Le verdict, dans les propres termes de Sakana

Sakana a choisi Kimi K3 comme l'un des trois modèles par rapport auxquels Fugu Max est moins cher, et sur le tarif de sortie, l'affirmation tient : 6,00 $ contre 15,00 $, soit 60 % de moins, exactement le haut de la fourchette annoncée. Si l'on prend le communiqué au mot, Fugu Max est le produit le moins cher.

Appliquez maintenant le mètre étalon que la publication a évité. Kimi K3 coûte 33 % de plus en entrée et 150 % de plus en sortie — et pour ce prix, il vous offre une fenêtre de 1 M de tokens sans falaise de retarification, un checkpoint téléchargeable sous une licence conditionnée au chiffre d’affaires, une 44e place au classement indépendant Intelligence Index, un score standardisé de 93,40 % à SWE-bench Verified, la première place sur Frontend Code Arena, et le trafic réel le plus important de tous les modèles de cette comparaison. Fugu Max vous offre un tarif inférieur des deux côtés du token, six victoires non quantifiées sur des benchmarks, un tarif de cache moitié moindre que celui de K3, sans taux de succès publié, et un pool que vous ne pouvez pas inspecter.

La conclusion honnête est que Sakana a choisi une unité de mesure qui la flatte sur le prix et ne vous donne rien à vérifier sur les capacités. Si votre charge de travail est volumineuse et que vos tâches sont du type qu’un coordinateur peut décomposer de manière fiable, l’écart de tarif représente de l’argent réel et Fugu Max mérite un pilote à périmètre défini, avec la comptabilisation des jetons activée dès la première requête. Si vous avez besoin d’une décision de production que vous pouvez défendre ce trimestre — une fenêtre sur laquelle planifier, un score que vous pouvez citer, et un modèle que vous pourriez encore exécuter si le fournisseur disparaissait — Kimi K3 est la réponse, et il est disponible sur OrcaRouter au prix catalogue de Moonshot, avec le tarif du fournisseur répercuté sans modification.

A screenshot of the OrcaRouter model page for Kimi K3 (English UI, captured September 11, 2026), showing the Featured badge, the identifier kimi/kimi-k3, by MoonshotAI dated 2026-07-15, vision, tools, JSON and reasoning capability tags, a 2.8-trillion-parameter Mixture-of-Experts description, a 1M-token context window with text and image input, list pricing of $3.00 per 1M input tokens and $15.00 per 1M output tokens, traffic of 3,274.3 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.