Carte hero pour la confrontation Fugu Ultra v2 contre Grok 4.6, opposant un système d'orchestration à un seul modèle de raisonnement à grand contexte.
Guides & Insights

Fugu Ultra v2 vs Grok 4.6 : Cinq fois le prix de sortie, un benchmark commun

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il existe exactement un benchmark sur lequel Fugu Ultra v2 et Grok 4.6 publient tous deux un chiffre, et c'est DeepSWE : Sakana AI annonce 74,3 pour Fugu Ultra v2 dans son annonce du 11 septembre 2026, tandis que le matériel de lancement de xAI pour Grok 4.6 fixe son propre score DeepSWE v1.1 à 65,9 %. Cela représente un écart de 8,4 points, et c'est la seule comparaison propre que les deux entreprises offrent. Tout le reste que vous pourriez aligner — Chartography et SWEFish de Sakana face à GPQA Diamond et CursorBench de Grok — est mesuré sur des instruments différents par des laboratoires différents. Donc la question honnête n'est pas « lequel est le plus intelligent ». C'est de savoir si l'avantage revendiqué de Fugu Ultra v2 vaut la peine de payer 30 $ par million de jetons de sortie, quand Grok 4.6 facture 6 $.

Deux réponses différentes au même problème

Grok 4.6 est un modèle unique, et il est le fleuron actuel de la gamme Grok — répertorié comme « Latest » dans la documentation développeur du fournisseur lui-même, succédant à Grok 4.5 avec la même fenêtre de contexte de 500 000 tokens, la même surface d'entrée texte/image/fichier et la même tarification de base. Sa date limite de connaissances est fixée au 1er février 2026 et il expose un effort de raisonnement selon les niveaux low, medium, high et xhigh, high étant la valeur par défaut. Un détail qui surprend les gens : le raisonnement ne peut pas être désactivé. Les tokens de réflexion sont facturés à chaque requête, ce qui fait que le coût réel de sortie de Grok 4.6 dépend de l'intensité avec laquelle il décide de réfléchir.

Fugu Ultra v2 n'est pas du tout un modèle au sens habituel. Il s'agit du niveau de capacité de pointe de la gamme d'orchestration de Sakana AI — un point de terminaison unique compatible OpenAI qui décompose une tâche et la répartit sur un ensemble d'autres modèles, certains à poids ouverts, d'autres spécialisés. La présentation de Sakana est qu'il atteint une sortie de niveau frontière « sans la dépendance indispensable aux modèles de frontière qu'il orchestre », et il indique clairement que Claude Fable 5, Claude Fable 5.1 et GPT-6 Astra sont exclus de cet ensemble. Vous payez pour la couche d'ordonnancement, et pour chaque token que consomment les sous-agents.

Cette distinction n’est pas cosmétique. C’est la raison même pour laquelle l’écart de prix existe, et c’est la seule chose qui rend cet écart défendable.

Les cartes de tarifs, y compris la partie qui se répète

Entrée — Fugu Ultra v2 à 5,00 $ par million contre Grok 4.6 à 2,00 $ par million. Fugu est 2,5× plus cher avant même le moindre sous-appel.

Sortie — Fugu Ultra v2 à 30,00 $ par million contre Grok 4.6 à 6,00 $ par million. Un écart de 5×, et celui qui détermine la plupart des factures.

Entrée mise en cache — 0,50 $ par million pour les deux. Identiques. Deux fournisseurs qui n'ont rien d'autre en commun en sont arrivés au même prix de lecture du cache, ce qui fait des boucles d'agents gourmandes en cache la seule charge de travail où les deux sont véritablement comparables ligne pour ligne.

Réévaluation tarifaire des contextes longs — Grok 4.6 double à 4,00 $ / 12,00 $ dès qu’une invite dépasse 200 000 jetons, et la réévaluation s’applique à la requête entière, pas seulement au dépassement. Le palier annoncé de Fugu Ultra v2 au-dessus d’environ 272 000 jetons d’entrée passe à environ 10,00 $ / 45,00 $, également sur la requête entière. Les deux pénalisent les invites longues ; Grok commence à pénaliser 72K jetons plus tôt.

Fenêtre de contexte — Grok 4.6 500K jetons contre Fugu Ultra v2 1M, d'après les fiches produit de tiers. La page d'annonce de Sakana n'indique aucune valeur de contexte, il convient donc de considérer son 1M comme non confirmé par l'éditeur.

La question du contexte long comporte des arguments dans les deux sens, et il vaut la peine de faire le calcul. Un prompt de 300 K tokens vous coûte 4,00 $ par million de tokens en entrée sur Grok 4.6 et environ 10,00 $ sur Fugu Ultra v2. Un prompt de 150 K tokens coûte 2,00 $ sur Grok et 5,00 $ sur Fugu. Le modèle de Sakana est plus cher pour toute longueur de prompt — la seule question est de savoir à quelle fréquence il doit être appelé.

Two-column comparison scoreboard for Fugu Ultra v2 and Grok 4.6 covering type, release date, input price ($5.00 vs $2.00 per million tokens), output price ($30.00 vs $6.00), cached input ($0.50 on both) and context window (1M reported vs 500K).

L'argument en faveur de payer 5× sur la production

L’argument en faveur d’un orchestrateur n’est pas qu’il coûte moins cher par token. C’est qu’il nécessite moins de tentatives, et que les tokens qu’il consacre à la coordination sont moins chers que les tokens que vous dépenseriez à échouer.

C'est un véritable argument, et Sakana le formule explicitement : Fugu Ultra v2 vise les travaux complexes à étapes multiples — recherche autonome, développement full-stack — où le mode de défaillance d'un modèle unique consiste à dérailler en cours de route lors d'une longue exécution. Si un tarif de sortie de 30 $ vous permet d'obtenir une tâche terminée du premier coup plutôt qu'à la troisième tentative, le supplément par token n'a aucune importance.

Il existe des éléments à l’appui provenant du camp du fournisseur lui-même, bien qu’ils soient favorables au fournisseur et qu’il faille les lire comme tels. Les documents de lancement de xAI pour Grok 4.6 citent environ 53 tours et près de 0,5 milliard de jetons d’entrée pour résoudre des tâches à long horizon, contre environ 103 tours et 2,0 milliards de jetons d’entrée pour un modèle de frontière concurrent — un argument selon lequel Grok lui-même est économique par tâche, même à un prix par jeton bas. Les deux entreprises font le même mouvement : vous détourner de la grille tarifaire et vous orienter vers le coût par travail terminé.

Ce qui signifie que le chiffre décisif est celui qu'aucun des deux fournisseurs ne publie, et que vous devez mesurer vous-même : les tokens consommés, du début à la fin, sur une tâche qui ressemble à la vôtre.

Là où chacun est véritablement faible

Le point faible documenté de Grok 4.6, c’est le travail en terminal. Son score à Terminal-Bench v3.0 s’établit à 26 %, bien loin derrière le sommet du domaine, même si le même modèle obtient un bien meilleur score de 88,4 % sur l’ancien Terminal-Bench v2.1 — il s’agit de tests différents, et les confondre est une erreur que l’on retrouve dans de nombreuses couvertures. Il détient aussi le meilleur score GPQA Diamond de sa cohorte, à 94,9 %, mais GPQA Diamond a depuis été retiré de l’indice Artificial Analysis car saturé, si bien qu’un score élevé n’y permet plus de distinguer les modèles de pointe comme c’était le cas il y a un an.

Du côté indépendant, Artificial Analysis attribue à Grok 4.6 une note de 44 sur son Intelligence Index v4.3, le classant 20e sur 200, pour un coût par tâche de 1,86 $. Le chiffre souvent relayé de 61 provient d’une échelle d’indice obsolète et ne devrait pas être cité sans préciser quelle version l’a produit.

Le point faible de Fugu Ultra v2, c'est la vérification. À la date de publication, rien de ce que Sakana a affirmé à son sujet — les cinq résultats meilleurs ou ex æquo, le score Chartography de 48,3 contre 27,3 pour Opus 5 et 29,5 pour Fable 5, le 74,3 DeepSWE — n'a été reproduit indépendamment. Il n'existe pas non plus de chiffre publié de latence ou de débit, ce qui compte davantage pour un orchestrateur que pour un modèle unique, car son temps de réponse dépend entièrement de ce qu'il décide d'appeler. Pour le précédent Fugu Ultra, des testeurs ont rapporté publiquement des exécutions allant jusqu'à environ 30 minutes ; il s'agit du modèle de juin 2026, pas de la v2, mais c'est le mode de défaillance à tester avant de vous engager sur un chemin de production.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

Une note sur le nom du fournisseur

Une subtilité à connaître avant de chercher Grok 4.6 dans une console de développeur : le modèle est systématiquement appelé Grok 4.6, mais l'image de marque du fournisseur qui l'entoure est en pleine mutation. La documentation d'x​AI elle-même porte désormais le nom SpaceXAI, un changement que la plupart des articles consacrés au lancement n'ont pas encore intégré. Les identifiants du modèle et la surface d'API sont inchangés — Grok 4.6 est un modèle Ope​nAI Responses à part entière et s'intègre aux boucles d'appel d'outils existantes sans couche de traduction — mais si vous cherchez une fiche de modèle et que l'image de marque semble erronée, ce n'est pas votre erreur.

Appeler l’un ou l’autre de ces éléments en pratique

Grok 4.6 est disponible sur OrcaRouter au tarif propre du fournisseur — 2,00 $ par million de jetons en entrée et 6,00 $ par million de jetons en sortie, répercutés sans aucune marge, de sorte qu'un changement de prix du fournisseur arrive ici le jour même plutôt que selon un calendrier de migration. Il est compatible avec OpenAI sur la même URL de base que tout le reste du catalogue, ce qui signifie que vous pouvez le placer derrière une chaîne de repli ou une règle de routage au lieu de le coder en dur, et le comparer en A/B à un autre modèle sans second contrat ni modification du code.

Fugu Ultra v2 n'est pas routé par nous. Il est disponible via l'API compatible OpenAI propre à Sakana AI, et l'entreprise affirme qu'une intégration Fugu existante migre vers lui avec un seul changement de paramètre. Si vous voulez comparer les deux sur votre charge de travail, l'arrangement le moins coûteux consiste à laisser Grok 4.6 sur votre passerelle et à appeler Fugu Ultra v2 directement depuis Sakana derrière un indicateur de fonctionnalité — les deux parlent le même format de requête, donc le même harnais de test fonctionne sur les deux.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the grok/grok-4.6 identifier, a 500K token context window, and pricing of $2.00 per million input tokens and $6.00 per million output tokens.

Le verdict

Grok 4.6 est le choix par défaut rationnel pour la plupart des équipes, et l’écart de prix est loin d’être mince. À 2,00 $ / 6,00 $, avec une lecture de cache à 0,50 $ et une fenêtre de 500 K, il gère le raisonnement sur des documents longs, les agents de codage et le travail sur fichiers multimodaux à un cinquième du tarif de sortie de Fugu Ultra v2, et il est évalué et benchmarké de manière indépendante. Ses points de vulnérabilité sont la longueur des prompts — le seuil des 200 K double la requête entière — et les boucles d’agents très orientées terminal, où ses scores publiés ne sont pas compétitifs.

Fugu Ultra v2 ne justifie son prix premium que si vous avez un type de charge de travail bien précis : des tâches longues, à étapes multiples, à forte autonomie, où un modèle unique tend à dérailler, et où vous voulez aussi la propriété architecturale que vend Sakana — un palier de capacités qui ne dépend pas de la présence continue ni du maintien à bas prix d'un quelconque fournisseur de pointe. C'est une chose qu'il est légitime de vouloir. Mais c'est une affirmation, pas encore une mesure, et l'écart DeepSWE qui la rend crédible n'est qu'un seul benchmark, d'un seul fournisseur, le jour de la sortie.

Si vous ne pouvez pas dire laquelle de vos tâches échoue actuellement à la deuxième ou à la troisième tentative, vous n’avez pas encore le chiffre qui justifierait la différence de prix. Mesurez cela d’abord. Les grilles tarifaires vous disent déjà tout le reste.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement