Une carte de titre principale affichant « Fugu Max vs Grok 4.6 » avec le sous-titre « Grilles tarifaires identiques, un seul score publié », trois badges en forme de pilule affichant « 2,00 $ vs 2,00 $ en entrée », « 6,00 $ vs 6,00 $ en sortie » et « Six victoires, zéro chiffre », une ligne de pied de page indiquant « Sakana AI, septembre 2026 vs SpaceXAI, août 2026 », et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Fugu Max vs Grok 4.6 : grilles tarifaires identiques, un seul score publié

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Fugu Max et Grok 4.6 coûtent exactement le même prix. Sakana AI a lancé Fugu Max le 11 septembre 2026, à 2,00 $ par million de tokens en entrée et 6,00 $ par million de tokens en sortie — et c'est mot pour mot la grille tarifaire que SpaceXAI facture pour Grok 4.6 depuis son lancement le 12 août. Cette coïncidence est le fait le plus utile dans cette confrontation, car elle élimine le prix du débat. Quand deux produits sont facturés à l'identique, la seule question qui reste est ce que l'on obtient pour son argent, et sur ce point, les deux divergent complètement. Grok 4.6 est un modèle unique que vous pouvez épingler par version, pour lequel vous pouvez consulter un tableau de benchmarks et que vous pouvez vérifier par rapport à un indice indépendant. Fugu Max est un coordinateur entraîné qui répartit chaque tâche vers le modèle le moins cher de son vivier, et l'annonce de Sakana affirme qu'il obtient le meilleur score global sur six benchmarks sans publier le moindre chiffre pour aucun d'entre eux. L'un de ces achats est mesurable avant de le faire. L'autre ne l'est pas.

Deux produits, une grille tarifaire

• Entrée — Fugu Max 2,00 $ par million de jetons vs Grok 4.6 2,00 $ par million de jetons

• Sortie — Fugu Max 6,00 $ par million de jetons vs Grok 4.6 6,00 $ par million de jetons

• Entrée mise en cache — Fugu Max 0,25 $ par million de tokens contre Grok 4.6 0,50 $ par million de tokens, la seule ligne où les deux prix présentent la moindre différence

• Fenêtre de contexte — Fugu Max non publiée par le fournisseur, contre 500 000 tokens pour Grok 4.6, inchangé par rapport à Grok 4.5

• Repricing des prompts longs — Fugu Max : aucun palier indiqué dans la publication, tandis que Grok 4.6 double à 4,00 $ / 12,00 $ dès qu’une seule requête dépasse 200 000 tokens, appliqué à l’ensemble de la requête plutôt qu’au seul dépassement

• Contrôle du raisonnement — Fugu Max non exposé vs Grok 4.6, quatre niveaux d'effort, de low à xhigh, par défaut sur high et non désactivable

• Architecture — Fugu Max, un coordinateur entraîné sur un ensemble non divulgué qui comprend des modèles à poids ouverts et spécialisés, étendu pour Max avec la famille NVIDIA Nemotron grâce à une collaboration avec NVIDIA, face à Grok 4.6, un seul modèle à une seule version

• Évaluation indépendante — Fugu Max : aucune n'a été publiée, et aucune page Artificial Analysis n'existe pour aucun modèle Fugu vs Grok 4.6, un Artificial Analysis Intelligence Index en direct de 44, classé n°20 sur 200

La colonne bon marché est celle que l’on ne peut pas prévoir.

Regardez où Fugu Max gagne réellement sur le prix : la lecture du cache, à la moitié de celle de Grok 4.6. C’est un véritable avantage, et c’est exactement le mauvais endroit pour construire un modèle de coûts, car la tarification du cache ne rapporte qu’à proportion de votre taux de succès du cache — et Sakana n’en publie pas pour Fugu Max. La publication ne précise pas non plus de fenêtre de contexte, ni de palier de contexte long, ni de plafond de sortie. Ainsi, la seule colonne où Fugu Max est moins cher que Grok 4.6 est une remise d’une ampleur inconnue appliquée à une part inconnue de vos tokens.

Les faiblesses de Grok 4.6 sont au moins visibles. Son seuil de 200 000 jetons est agressif — il refacture l’intégralité de la requête, de sorte qu’une invite de 250 000 jetons est facturée au double du tarif dès le premier jeton, et non à partir du 200 001e jeton. Mais vous pouvez voir la falaise, mesurer vos invites par rapport à elle et décider si vous devez les découper. C’est là la différence de nature : un système publie un barème tarifaire dont la forme vous permet de planifier, et l’autre publie un tarif affiché sans aucun barème associé.

Six victoires et pas un seul point

Les benchmarks que cite Sakana sont Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench et SWEFish. Cinq d’entre eux sont des évaluations publiques reconnues. Le sixième, SWEFish, est le benchmark de codage propre à Sakana, ce qui signifie que l’une des six victoires revendiquées est évaluée sur un test que l’éditeur a écrit et n’a pas publié. Pour les cinq autres, le communiqué indique que Fugu Max obtient le meilleur score global et s’arrête là — aucun score, aucune marge, aucun chiffre de concurrent à mettre en regard.

Comparez cela au tableau que SpaceXAI a publié pour Grok 4.6, qui est rapporté par le fournisseur de bout en bout mais qui reste au moins un tableau : GDPVal-AA v2 à 1 753, AA-Briefcase à 1 577, DeepSWE v1.1 à 65,9 %, CursorBench v3.2 à 69,9 % et GPQA Diamond à 94,9 %. Les documents de lancement rapportent également environ 53 tours et près d'un demi-milliard de tokens d'entrée pour résoudre des tâches à long horizon sur AA-Briefcase, contre environ 103 tours et deux milliards de tokens pour un modèle de frontière concurrent — un argument, là encore rapporté par le fournisseur, selon lequel Grok revient bon marché par tâche accomplie, même à un tarif modeste par token.

Deux de ces chiffres Grok doivent être traités avant que vous ne les citiez. Le premier est que son score phare de 94,9 % au GPQA Diamond provient d’un benchmark qu’Artificial Analysis a depuis retiré car saturé, de sorte qu’il ne distingue plus les modèles de frontière comme il le faisait autrefois. Le second est le chiffre que vous verrez dans les articles plus anciens : un Artificial Analysis Intelligence Index de 61 pour Grok 4.6. C’était l’échelle d’avant le retraitement. Artificial Analysis a recalibré l’indice en septembre 2026, et la valeur actuelle est de 44, au 20e rang sur 200, pour un coût de 1,86 $ par tâche de l’Intelligence Index. Quiconque classe Grok 4.6 face à Claude Fable 5 ou GPT-5.6 Sol sur un 61 compare des lectures issues de deux instruments différents.

A two-column scoreboard titled 'Fugu Max vs Grok 4.6 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Grok 4.6: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.50 per 1M, context 500K with a 200K repricing cliff, benchmarks GDPVal 1,753 and DeepSWE 65.9%, evidence Artificial Analysis Index 44 ranked #20 of 200. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Grok 4.6 rows SpaceXAI-reported and per Artificial Analysis. No independent Fugu Max evaluation exists.' OrcaRouter logo bottom-right.

Ce que le prix du jeton d’un orchestrateur n’inclut pas

La propre couverture de Sakana sur la sortie concède le problème structurel. Parce que Fugu Max bascule entre les modèles au sein d'une même tâche, il « peut réduire la réutilisation du cache de contexte et aussi générer des jetons d'orchestration supplémentaires » — et l'entreprise n'a pas divulgué le taux de réussite du cache qui en résulte ni un coût total en jetons par tâche. Chaque agent que le coordinateur génère écrit du raisonnement et du texte de sortie, et tout cela est facturé à 6,00 $ par million. Le tarif est identique à celui de Grok 4.6. Le volume ne l'est pas, et le volume est la variable qu'une page de tarification ne peut pas vous montrer.

Les deux fournisseurs vous poussent vers la même correction — cessez de comparer les tarifs, commencez à comparer le coût par tâche terminée — mais un seul d’entre eux vous donne un chiffre de départ. Grok 4.6 arrive avec un profil publié de tours et de jetons. Fugu Max arrive avec une instruction : mesurez-le vous-même.

Il existe une lecture équitable du silence de Fugu Max, et elle mérite d’être formulée. Max est l’échelon optimisé en coûts de la gamme Fugu, livré le même jour que Fugu Ultra v2, qui constitue la montée en capacités à $5.00 en entrée et $30.00 en sortie. L’argument visuel de Sakana pour Max est un graphique de Pareto — la capacité en fonction du coût — et sur un graphique de Pareto, un score brut de benchmark est hors sujet ; le score par dollar est toute la revendication. Si c’est là l’argument, imprimer six scores gagnants sans leurs coûts serait le graphique trompeur, pas celui qui manque. Ce que la publication doit encore à un acheteur, c’est un dénominateur, et elle n’en fournit pas.

Où Grok 4.6 est réellement exposé

Le travail sur terminal est la surface publiée la plus faible de Grok 4.6. Son score à Terminal-Bench v3.0 s’établit à 26 %, loin derrière le peloton de tête. Attention au chiffre voisin : le même modèle obtient 88,4 % à Terminal-Bench v2.1, et il s’agit de tests différents. Vous verrez les deux confondus dans la couverture, et ce mélange flatte considérablement Grok.

La deuxième exposition est que le raisonnement ne peut pas être désactivé. Les tokens de réflexion sont facturés à chaque requête, de sorte que le coût de sortie effectif de Grok 4.6 dépend de l’effort que le modèle décide de consacrer à votre prompt. Le réglage d’effort vous donne le contrôle dans les valeurs basses, mais il n’existe aucun réglage à zéro.

En face, Grok 4.6 possède quelque chose que Fugu Max ne peut actuellement offrir à aucun prix : un chiffre. Chaque ligne ci-dessus peut être vérifiée par un tiers, et l'entrée dans Artificial Analysis signifie qu'une telle vérification a déjà eu lieu. Les six victoires de Fugu Max ont été publiées le jour même de la sortie du modèle, par l'entreprise qui l'a conçu, et au moment d'écrire ces lignes, personne en dehors de Sakana ne l'a testé.

Appeler l’un, piloter l’autre

Grok 4.6 est disponible sur OrcaRouter au tarif public de SpaceXAI — 2,00 $ par million de jetons en entrée, 0,50 $ en cas de succès du cache, 6,00 $ par million de jetons en sortie — répercuté avec 0 % de marge, donc un changement de tarif du fournisseur atteint notre passerelle le jour même plutôt que selon un calendrier de migration. Il est compatible avec OpenAI sur la même URL de base que le reste du catalogue, ce qui signifie que vous pouvez l'intégrer à une chaîne de basculement ou derrière une règle de routage conditionnelle au lieu de coder en dur un fournisseur dans un chemin de production, et vous pouvez le tester en A/B face à un autre modèle sans second contrat. Il a fait transiter 46,6 millions de jetons par la passerelle au cours des sept derniers jours.

Fugu Max ne figure pas dans notre catalogue. Il vous parvient via l'API compatible OpenAI de Sakana et plusieurs plateformes tierces, et l'entreprise affirme qu'une intégration Fugu existante peut être mise à niveau vers lui avec un seul changement de paramètre. Comme les deux parlent le même format de requête, une évaluation qui les place derrière un même flag se résume à un remplacement de base-URL plutôt qu'à une réécriture — ce qui est la bonne façon de trancher ce point précis, puisque le débat porte sur les tokens par tâche terminée et que seule votre propre charge de travail peut produire ce chiffre.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the introductory argument that a system deploying a multi-trillion-parameter model for a simple lookup is wasteful, and a cost-versus-performance chart placing Fugu Max on a frontier formed by Fugu models above the frontier formed by single models.

Lequel acheter

Grok 4.6 est le choix par défaut défendable. Avec une grille tarifaire identique à celle de Fugu Max, il vous offre une fenêtre de contexte de 500 K sur laquelle vous pouvez planifier, une version que vous pouvez épingler, quatre niveaux de contrôle du raisonnement, un positionnement indépendant dans l’index à 44, avec un chiffre de coût par tâche à côté, et des mois de mesures par des tiers. Ses coûts sont précis et connus : la falaise de re-tarification à 200 K, un raisonnement toujours facturé et un profil de travail en terminal qui est à la traîne du secteur.

Fugu Max est le pari le plus intéressant et, au vu des éléments disponibles, le moins inspectable. L’argument de conception tient la route : si un coordinateur choisit de manière fiable le modèle le moins cher capable de mener votre tâche à bien, votre coût médian par tâche achevée baisse, même si votre grille tarifaire ne baisse pas. Mais à 2,00 $ / 6,00 $, le tarif par token n’est pas là où réside l’avantage de Fugu Max ; ce tarif est exactement celui de Grok 4.6. L’avantage doit venir d’une consommation moindre de tokens, et Sakana n’a pas publié la mesure qui montrerait que c’est bien le cas.

Alors, faites la comparaison comme les deux fournisseurs vous demandent de le faire. Placez Grok 4.6 sur votre passerelle, appelez Fugu Max derrière un feature flag, et comptez les tokens de sortie par tâche terminée sur un travail qui ressemble au vôtre. Si Fugu Max termine en moins de tokens qu’un modèle unique au même tarif, la remise de cache et la coordination représentent de l’argent réel et la bascule est justifiée. Si ce n’est pas le cas, vous payez des tarifs identiques pour un système dont la composition peut changer sous vos pieds sans que son numéro de version ne bouge.

Pour tout ce que vous pouvez décider ce trimestre sans cette mesure, commencez par le modèle qui dispose d'un tableau des scores.

A screenshot of the OrcaRouter model page for Grok 4.6 (English UI, captured September 11, 2026), showing the NEW and Featured badges, the identifier grok/grok-4.6, by SpaceXAI dated 2026-08-12, vision, tools, JSON and reasoning capability tags, a 500K-token context window with text, image and file input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, traffic of 46.6 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement