Une carte de titre principale portant « Fugu Ultra v2 vs Qwen3.8-Max » avec le sous-titre « Pourquoi l’étiquette de prix est le mauvais chiffre », trois badges en forme de pilule indiquant « Sortie : 30,00 $ vs 6,00 $ », « Au-dessus de 272 K : le tarif double » et « Score Fugu indépendant : aucun », une ligne de pied de page indiquant « Sakana AI, 11 septembre 2026 vs Alibaba, août 2026 », et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Fugu Ultra v2 vs Qwen3.8-Max : pourquoi le prix affiché est le mauvais chiffre

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Fugu Ultra v2 coûte 30,00 $ par million de jetons de sortie. Qwen3.8-Max coûte 6,00 $. C'est un écart de cinq pour un, et si vous choisissez entre ces deux systèmes agentiques sur ce ratio, vous vous tromperez — car aucun des deux n'est réellement facturé comme sa grille tarifaire le laisse entendre. Selon les propres mesures d'Artificial Analysis, Qwen3.8-Max a généré 180 millions de jetons de sortie pour terminer l'Intelligence Index, plus du double des 89 millions du modèle médian, pour un coût de 2,67 $ par tâche. C'est un modèle économe en jetons et prodigue en réponses. Fugu Ultra v2 de Sakana AI, lancé le 11 septembre 2026, a la forme inverse : un ensemble non divulgué de modèles d'autres laboratoires qu'il instancie et coordonne à chaque requête, facturé à un tarif unique combiné qui, selon Sakana, ne se multiplie pas à mesure que des agents sont ajoutés. L'un est un modèle unique de 2 400 milliards de paramètres qui réfléchit à voix haute pendant longtemps. L'autre est un petit coordinateur qui embauche de l'aide. Comparer leurs prix par jeton ne vous dit presque rien sur celui qui coûte le moins cher à exécuter.

Deux façons opposées d'être cher

Commencez par le mécanisme, car il explique toutes les autres différences dans cette comparaison.

Qwen3.8-Max est un modèle sparse mixture-of-experts — 2,4 billions de paramètres au total, environ 95 milliards actifs par token — qui atteint des résultats proches de la frontière en travaillant plus longtemps plutôt qu'en étant plus grand. Artificial Analysis l'a mesuré à 37,8 tokens de sortie par seconde, le classant 154e sur 200 modèles en termes de vitesse, avec 180 millions de tokens de sortie émis sur l'Intelligence Index (70e sur 200 en verbosité). Son coût par tâche de l'Intelligence Index s'élève à 2,67 $, et sa remise de cache est inhabituellement profonde, à 88 %, ce qui est le levier qui contrôle réellement la facture ici : une longue exécution d'agent qui ne cesse de relire le même contexte coûte peu cher, tandis qu'une exécution qui ne cesse de générer du texte nouveau ne l'est pas.

Fugu Ultra v2 aborde le même problème par l'autre bout. C'est un orchestrateur — un petit coordinateur entraîné, annoncé à environ 7 milliards de paramètres, qui lit une requête, assemble une équipe d'agents selon les rôles Penseur, Travailleur et Vérificateur issus des travaux TRINITY de Sakana, puis synthétise une réponse. Sa facture de tokens est la somme de ce que produisent ses sous-agents plus le texte de synthèse du coordinateur lui-même. Sakana s'engage dans sa FAQ tarifaire à ce que vous soyez facturé à un tarif mixte unique indexé sur le modèle haut de gamme concerné et à ce que l'ajout d'agents ne multiplie pas la facture, ce qui élimine l'explosion classique des multi-agents où le fan-out multiplie le coût. Ce que cela ne supprime pas, c'est le volume. À 30,00 $ par million de tokens de sortie, le chiffre qui compte est combien d'agents ont été exécutés et combien ils ont écrit, et c'est un chiffre que ni vous ni Sakana ne pouvez prédire à partir de la page de tarification.

C’est là la formulation honnête de l’écart de prix : c’est un taux, pas un total. Un taux cinq fois plus élevé appliqué à une charge de travail dont vous ne pouvez pas prévoir le volume de sortie n’est pas cinq fois le coût — c’est un multiple non borné avec un plancher prévisible.

A two-column scoreboard titled 'Fugu Ultra v2 vs Qwen3.8-Max Scoreboard' contrasting six dimensions. Fugu Ultra v2: price $5.00/$30.00 per 1M, context 1M tokens, above 272K input doubles to $10, AA Index none published, speed not measured, weights closed with pool undisclosed. Qwen3.8-Max: price $2.00/$6.00 per 1M, context 1M tokens, above 272K no surcharge, AA Index 40 ranked #30 of 200, speed 37.8 tokens/sec, weights open checkpoint published. Footer reads 'Fugu Ultra v2 figures vendor-reported; no independent evaluation. Qwen3.8-Max figures per Artificial Analysis, recalibrated scale.' OrcaRouter logo bottom-right.

La fiche technique, et la seule ligne qui décide de tout

• Prix — Fugu Ultra v2 : 5,00 $ en entrée / 30,00 $ en sortie pour 1 M de tokens, contre Qwen3.8-Max : 2,00 $ en entrée / 6,00 $ en sortie

• Entrée mise en cache — Fugu Ultra v2 0,50 $ par million contre Qwen3.8-Max 0,25 $ par million en lecture, et une remise de 88 % sur le cache mesurée par Artificial Analysis

• Supplément pour contexte long — l'entrée de Fugu Ultra v2 double à 10,00 $ et la sortie à 45,00 $ au-delà de 272 K tokens, contre Qwen3.8-Max, sans supplément pour les prompts longs et à tarif uniforme jusqu'à la fenêtre

• Fenêtre de contexte — Fugu Ultra v2 1 M de jetons vs Qwen3.8-Max 1 M de jetons

Plafond de sortie — Fugu Ultra v2 non publié sous forme de chiffre unique, contre environ 128K tokens pour Qwen3.8-Max

• Modalité d'entrée — texte Fugu Ultra v2, avec les capacités propres du pool derrière, face à Qwen3.8-Max texte, image, vidéo et PDF

• Poids — Fugu Ultra v2 fermé, appartenance au pool non divulguée par choix délibéré, contre les poids ouverts de Qwen3.8-Max publiés pour le checkpoint de classe Max sous une licence personnalisée

• Disponibilité régionale — Fugu Ultra v2 non commercialisé dans l'UE/EEE, contre Qwen3.8-Max disponible sans restriction régionale

• Évaluation indépendante — Fugu Ultra v2 : aucune publiée, et aucune page Artificial Analysis n'existe pour aucun modèle Fugu ; par rapport à Qwen3.8-Max, une fiche Artificial Analysis active avec des chiffres publiés sur la vitesse, la verbosité et le coût par tâche

Lisez les deux dernières lignes ensemble et la comparaison se précise. Qwen3.8-Max est un modèle que vous pouvez épingler par version, dont vous pouvez lire la licence, télécharger un checkpoint et vérifier les performances sur le tableau de scores d'un tiers. Fugu Ultra v2 est un système que vous ne pouvez pas inspecter, que vous ne pouvez pas auto-héberger, que vous ne pouvez pas acheter en Europe et que vous ne pouvez vérifier auprès de personne en dehors de Sakana. Le surcoût de 272K aggrave la situation : au-delà de ce seuil, le tarif d'entrée de Fugu Ultra v2 double et son tarif de sortie augmente de moitié, tandis que celui de Qwen3.8-Max ne bouge pas. Pour le travail de longue haleine sur documents et dépôts pour lequel les deux systèmes sont conçus, le tarif affiché le moins cher est aussi le plus stable.

Le chiffre de Qwen3.8-Max que tout le monde cite n'est plus à jour

Si vous avez lu quoi que ce soit sur ce modèle au cours des deux dernières semaines, vous avez probablement vu un Artificial Analysis Intelligence Index de 58, ou 58,1, ou 58,4. Ces chiffres étaient réels et ils ne sont plus d'actualité. Artificial Analysis a recalibré son indice en v4.3 le 7 septembre 2026, en comprimant les scores de manière générale, et la page en direct de Qwen3.8-Max affiche désormais 40, ce qui le place au 30e rang sur 200 modèles — avec le badge « Mis à jour » qui signale un score révisé. Les articles plus anciens portaient aussi la taxe d'effort mesurée sur l'échelle précédente : 64 tours par tâche contre 14 pour la génération Qw​en précédente, et environ 1,14 $ par tâche de l'Intelligence Index. La page actuelle indique 2,67 $ par tâche, 37,8 jetons de sortie par seconde, et 180 millions de jetons de sortie sur l'indice.

Deux choses s'ensuivent. Premièrement, sur l'échelle recalibrée, Qwen3.8-Max se situe dans la même bande que le reste du deuxième échelon de la frontière, plutôt qu'à son niveau, et toute comparaison que vous lirez qui le classe face à Claude Opus 5 ou Kimi K3 sur un 58 compare des instantanés issus d'échelles différentes. Deuxièmement, et c'est plus utile pour cette confrontation, la correction est unidirectionnelle : Qwen3.8-Max possède un chiffre qui peut être erroné puis corrigé. Fugu Ultra v2 n'a pas de chiffre. Chaque valeur concernant Fugu dans cet article provient des propres évaluations de Sakana, et au 11 septembre, il n'existe aucune page Artificial Analysis pour Fugu Ultra v2 ni pour aucun autre modèle Fugu — l'URL renvoie une 404. Quand un fournisseur publie un tableau de scores et qu'aucun tiers indépendant n'a fait tourner le modèle, ce tableau constitue l'intégralité du dossier.

Là où ils se chevauchent réellement, et là où ils ne se chevauchent pas

Sakana rapporte que Fugu Ultra v2 est le meilleur ou à égalité au premier rang sur cinq des huit benchmarks — GDP.pdf, Chartography, SWEFish, DeepSWE et Toolathon — et parmi les deux premiers sur sept des huit. Les deux chiffres concrets du communiqué sont Chartography à 48,3, contre 27,3 pour Claude Opus 5 et 29,5 pour Claude Fable 5 dans le même tableau, et DeepSWE à 74,3. Parmi les propres lignes publiées par Ali​baba pour Qwen3.8-Max figurent Terminal-Bench 2.1 à 86,6, OSWorld-Verified à 86,1, GPQA Diamond à 92,6 et SWE-bench Pro à 67,7.

Remarquez ce que ces deux listes ont en commun : rien. Aucun benchmark n'apparaît dans les deux tableaux des fournisseurs. Il n'existe aucune ligne où l'on peut mettre côte à côte un chiffre de Sakana et un chiffre d'Ali​baba et en déduire un vainqueur, ce qui signifie que la réponse honnête à « lequel est le meilleur pour les agents de codage » est qu'aucune preuve publiée n'y répond. Ce qui existe, c'est un système avec huit lignes choisies par le fournisseur et aucune vérification externe, et un autre système avec des lignes de fournisseur plus une entrée indépendante qui mesure le coût et la vitesse plutôt que la capacité en comparaison directe. C'est une lacune dans les preuves, pas une lacune dans les modèles, et cela devrait changer votre façon d'acheter : vous ne pouvez pas choisir entre eux sur la base des benchmarks, alors choisissez en fonction des propriétés que vous pouvez réellement vérifier.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, with the opening paragraphs arguing that the frontier which matters is two-dimensional — capability against cost — and stating that Fugu Ultra v2 pushes peak performance higher without indispensable reliance on the frontier models it orchestrates.

Poids ouverts contre un ensemble non divulgué

C'est ici que l'argument habituel du verrouillage s'inverse, et c'est ce qu'il y a de plus intéressant dans cette association.

L’argumentaire de Sakana pour Fugu Ultra v2 est la souveraineté. Un vivier interchangeable de modèles ouverts et spécialisés signifie qu’aucune décision tarifaire, aucun calendrier de dépréciation ni aucun changement de politique d’un seul fournisseur ne peut faire tomber votre produit, et cette sortie met explicitement ce point en avant en indiquant que la composition du vivier a changé dans la v2. La société déclare également sans détour que les scores de Fugu Ultra v2 ont été obtenus sans Claude Fable 5, Claude Fable 5.1 ni GPT-6 Astra dans le vivier d’agents — en revendiquant des victoires sur les trois modèles les plus puissants disponibles tout en confirmant qu’elle ne fait appel à aucun d’entre eux. Quoi que contienne le vivier, il n’est pas au sommet du marché selon les propres calculs de Sakana.

Mais cette couverture a un coût qui ne figure pas sur la liste de prix. Vous ne pouvez pas voir le pool, vous ne pouvez pas inscrire ou retirer un membre du palier Ultra, vous ne pouvez pas héberger vous-même tout ou partie de l’ensemble, et vous ne pouvez pas l’exécuter dans l’UE/EEE du tout — une orchestration basée à Singapour sur les poids d’autres laboratoires constitue un profil de risque différent de celui de posséder les poids. Qwen3.8-Max inverse exactement cela. C’est le modèle d’un seul fournisseur et donc exposé aux décisions d’un seul fournisseur, mais Alibaba a publié des poids ouverts pour le checkpoint Qwen3.8-2.4T-A95B de classe Max sous une licence personnalisée, ce qui signifie que l’échappatoire est réelle plutôt que rhétorique : si les tarifs ou les conditions changent, le modèle peut être servi depuis votre propre infrastructure. Pour une équipe dont la véritable crainte est qu’un fournisseur lui tire le tapis sous les pieds, un checkpoint téléchargeable est une garantie plus solide qu’une promesse concernant un pool que vous n’êtes pas autorisé à inspecter.

Il existe un point de second ordre pour quiconque exécute des agents sur les deux. Qwen3.8-Max figure dans notre catalogue à 2,00 $ en entrée et 6,00 $ en sortie, qui est le prix catalogue d'Alibaba avec 0 % de marge répercutée — un changement de tarif du fournisseur se répercute sur la même clé le jour même, et le basculement automatique couvre un chemin de fournisseur limité en débit ou dégradé. Fugu Ultra v2 ne figure pas sur OrcaRouter. Il vous parvient via l'API compatible OpenAI de Sakana et plusieurs plateformes tierces, et passer d'un Fugu antérieur ne nécessite qu'un changement de paramètre sur une seule ligne. Un routeur ne remplace pas un coordinateur, et un coordinateur ne remplace pas la capacité de basculer ; si vous voulez les deux propriétés, vous exécutez les systèmes de deux fournisseurs et devez prévoir deux factures.

Lequel vous devriez choisir

Choisissez Qwen3.8-Max si vous avez besoin d’un modèle que vous pouvez prévoir, vérifier et dont vous pouvez vous échapper. Son tarif de sortie catalogue équivaut à un tiers de celui de Fugu Ultra v2, il n’a pas de falaise de contexte long, il accepte les images, la vidéo et les PDF, là où la modalité du pool Fugu dépend de ce que les agents sous-jacents prennent en charge, il publie un checkpoint sur lequel vous pouvez vous replier, il se vend partout, et il dispose d’une entrée indépendante et en direct qui mesure ce qui détermine réellement votre facture — 37,8 jetons par seconde et un chiffre de coût par tâche que vous pouvez modéliser avant de vous engager. Ses faiblesses sont tout aussi précises et méritent d’être citées : il est lent, classé 154e sur 200 en vitesse, il est extrêmement verbeux, à 180 millions de jetons sur l’index, et Artificial Analysis a mesuré séparément son taux d’hallucination, qui passe de 23 % à 40 % par rapport à la génération précédente, ce qui est une préoccupation sérieuse précisément pour le travail autonome en plusieurs étapes auquel il est destiné. Prévoyez un vérificateur dans votre budget et exploitez agressivement la remise sur le cache profond.

Choisissez Fugu Ultra v2 si votre travail est à long horizon et vérifiable, si votre budget est exploratoire plutôt que de production, et si vous êtes en dehors de l'UE/EEE. L'argument structurel en faveur d'un coordinateur est réel, et les exemples du fournisseur lui-même le confirment systématiquement — une campagne de recherche automatisée de 123 expériences sur quatorze heures sur un seul H100, un solveur de Rubik's cube en Python pur qui a terminé les 300 cubes mélangés alors que deux références de pointe anonymisées ont planté purement et simplement. Ce sont des exemples sélectionnés par le fournisseur, avec des références anonymisées, et ils prouvent moins qu'ils n'en ont l'air, mais le schéma est cohérent : sur les tâches où l'exactitude est vérifiable et où le plus difficile est la persistance, lancer un vérificateur vaut mieux que de demander plus d'efforts à un seul modèle. Ce que vous achetez, c'est cette persistance, à un tarif cinq fois supérieur à celui de Qwen3.8-Max, dans un système dont vous ne pouvez pas auditer la qualité et dont vous ne pouvez pas épingler le pool. Pilotez-le sur un périmètre bien délimité, instrumentez les tokens de sortie par tâche terminée plutôt que par token, et fixez un plafond avant la première exécution.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the model title, the 'Featured' badge, the identifier qwen/qwen3.8-max, vision, tools, JSON and reasoning capability tags, a 1M-token context window, text and image and video input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, and an OpenAI-compatible base URL with Python and cURL code samples.

La raison pour laquelle l’étiquette de prix affiche le mauvais chiffre, c’est que ces deux produits ont éloigné le coût d’une réponse du coût d’un token. Fugu Ultra v2 y parvient en se ramifiant vers des modèles qu’il ne nommera pas. Qwen3.8-Max y parvient en réfléchissant pendant 180 millions de tokens. Si vous connaissez déjà votre volume de tokens par tâche, l’arithmétique est triviale et vous devriez la faire. La plupart des équipes ne connaissent pas ce chiffre, et pour elles la décision se réduit à quelque chose de plus simple : Qwen3.8-Max est le choix que vous pouvez auditer, chiffrer et abandonner, et Fugu Ultra v2 est le choix qui parie que la coordination l’emporte sur la capacité. Les deux sont défendables. Un seul des deux vient avec les justificatifs.