Une carte de titre principale portant « Fugu Max vs Qwen3.8-Max », avec le sous-titre « Même prix, même benchmark, un seul chiffre », trois badges en forme de pilule affichant « 2,00 $ / 6,00 $ pour les deux », « Terminal Bench 2.1 : 86,6 vs non indiqué » et « Score indépendant : néant vs 40 », une ligne de pied de page indiquant « Sakana AI, septembre 2026 vs Alibaba, août 2026 », et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Fugu Max vs Qwen3.8-Max : même prix, même benchmark, un seul chiffre publié

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Fugu Max et Qwen3.8-Max figurent au même tarif : 2,00 $ par million de tokens en entrée et 6,00 $ par million de tokens en sortie. Sakana AI a commercialisé Fugu Max le 11 septembre 2026 et Alibaba propose Qwen3.8-Max depuis début août, et les deux fournisseurs sont arrivés à une grille tarifaire identique par des voies opposées — l'un facturant une politique de routage, l'autre facturant un modèle à 2,4 billions de paramètres. Cette égalité exclut totalement le prix de la décision, ce qui est inhabituellement net. Il ne reste que les preuves, et c'est là que les deux camps divergent plus que partout ailleurs. Les deux tableaux des fournisseurs mentionnent Terminal Bench 2.1. Alibaba affiche 86,6 pour Qwen3.8-Max. Sakana déclare que Fugu Max obtient le meilleur score global sur Terminal Bench 2.1 et n'affiche aucun chiffre du tout — ni pour ce test ni pour les cinq autres qu'il prétend remporter.

Le seul benchmark que les deux camps citent

C'est tout le match comprimé en une seule ligne, il vaut donc la peine d'être précis à ce sujet.

La publication de Sakana liste six benchmarks sur lesquels Fugu Max obtient le meilleur score global : Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench et SWEFish. Cinq sont des évaluations publiques reconnues et le sixième, SWEFish, est le propre benchmark de codage de Sakana. Pour aucun des six, la publication n'indique une valeur, une marge ou un chiffre de concurrent à mettre en regard. L'affirmation parallèle — selon laquelle Fugu Max étend la frontière de Pareto coût-performance sur sept des dix benchmarks — est également une déclaration sur une position sur un graphique plutôt qu'un point sur un axe.

Les lignes publiées par Alibaba pour Qwen3.8-Max incluent Terminal-Bench 2.1 à 86,6, OSWorld-Verified à 86,1, GPQA Diamond à 92,6 et SWE-bench Pro à 67,7. Toutes rapportées par le fournisseur, toutes des chiffres. Ainsi, sur le seul test que les deux entreprises ont choisi de citer, l’une a publié un chiffre et l’autre a publié un rang. Vous ne pouvez pas en conclure quel système est meilleur — le « meilleur global » de Sakana pourrait signifier 91 ou 87. Ce que vous pouvez en conclure, c’est qu’au moment de la publication, aucune preuve publique ne répond à la question, et que le fournisseur qui avance la revendication la plus forte est celui qui refuse de la quantifier.

Prix identiques, construction opposée

• Entrée — Fugu Max 2,00 $ par million de tokens vs Qwen3.8-Max 2,00 $ par million de tokens

• Sortie — Fugu Max 6,00 $ par million de tokens vs Qwen3.8-Max 6,00 $ par million de tokens

• Entrée mise en cache — Fugu Max 0,25 $ par million de tokens contre Qwen3.8-Max 0,25 $ par million de tokens, et Artificial Analysis mesure indépendamment une remise de 88 % sur le cache du côté de Qw​en

• Supplément pour prompt long — Fugu Max : aucun palier indiqué dans les notes de version, contre Qwen3.8-Max à tarif uniforme jusqu'à la fenêtre de contexte, sans supplément

• Contexte et sortie — Fugu Max : ni l’une ni l’autre de ces valeurs n’est publiée, contrairement à Qwen3.8-Max, qui dispose d’une fenêtre de 1M de tokens avec un plafond de sortie d’environ 128K

• Modalité d'entrée — texte Fugu Max, avec les capacités propres du pool à l'appui, contre Qwen3.8-Max texte, image, vidéo et PDF

• Architecture — Fugu Max, un coordinateur entraîné sur un pool non divulgué, étendu pour Max avec des modèles à poids ouverts et spécialisés, notamment la famille NVIDIA Nemotron grâce à une collaboration avec NVIDIA, face à Qwen3.8-Max, un modèle à mélange d’experts creux d’environ 2,4 billions de paramètres totaux et environ 95 milliards actifs par token

• Poids — Fugu Max fermé, appartenance au pool non divulguée par conception vs Qwen3.8-Max, poids ouverts publiés pour le checkpoint de classe Max sous une licence personnalisée

• Évaluation indépendante — pour Fugu Max, aucune évaluation publiée, et il n’existe aucune page Artificial Analysis pour un quelconque modèle Fugu, contrairement à Qwen3.8-Max, qui dispose d’une entrée Artificial Analysis active avec des chiffres publiés de vitesse, de verbosité et de coût par tâche.

Quatre de ces lignes affichent « non publié » du côté de Fugu et un chiffre du côté de Qwen. Lorsque les tarifs sont identiques, toute la comparaison tient là : la même somme achète un système que vous pouvez décrire et un autre que vous ne pouvez pas.

A two-column scoreboard titled 'Fugu Max vs Qwen3.8-Max - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, Terminal Bench 2.1 best with no figure, evidence vendor-reported only. Qwen3.8-Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context 1M with a 128K output ceiling, Terminal Bench 2.1 at 86.6, evidence Artificial Analysis Index 40 and $2.67 per task. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Qwen3.8-Max rows Alibaba-reported and per Artificial Analysis.' OrcaRouter logo bottom-right.

Une colonne a un tiers derrière elle.

Artificial Analysis attribue à Qwen3.8-Max un score de 40 sur l'Intelligence Index v4.3 recalculé, classé n° 30 sur 200, avec un coût de 2,67 $ par tâche de l'Intelligence Index et 37,8 jetons de sortie par seconde — assez lent pour se classer n° 154 sur 200 en vitesse. La même entrée enregistre 180 millions de jetons de sortie générés sur l'ensemble de l'indice, plus de deux fois les 89 millions du modèle médian, et une remise de cache de 88 %.

Deux corrections s’appliquent avant que tout cela ne soit cité. La première est que le chiffre largement diffusé de 58 — ou 58,1, ou 58,4 — pour Qwen3.8-Max date d’avant la recalibration de l’indice par Artificial Analysis en septembre 2026, et la page en ligne porte le badge « Updated », qui signale un score révisé. Les anciens articles portaient aussi une taxe d’effort différente, celle de l’échelle précédente : 64 tours par tâche, contre 14 pour la génération Qwen précédente, à environ 1,14 $ par tâche de l’Intelligence Index ; la page actuelle affiche 2,67 $. La seconde est un véritable avertissement plutôt qu’un artefact d’échelle : Artificial Analysis a mesuré séparément que le taux d’hallucination de Qwen3.8-Max passait de 23 % à 40 % par rapport à la génération précédente. Pour un modèle vanté pour le travail autonome en plusieurs étapes, c’est un coût qu’il faut budgéter dans les vérificateurs, pas une note de bas de page.

Fugu Max n’a aucune entrée indépendante, quelle qu’elle soit. Chaque chiffre qui lui est rattaché provient de Sakana, et à l’heure où j’écris, aucune page Artificial Analysis n’existe pour Fugu Max ni pour aucun de ses frères et sœurs. Ce n’est pas une accusation — un modèle publié il y a quelques heures n’aura pas de couverture tierce — mais cela signifie que les deux colonnes ne sont pas également vérifiables, et il en restera ainsi jusqu’à ce que quelqu’un extérieur à Sakana l’exécute.

Deux façons de trop dépenser

Ces deux systèmes ont dissocié le coût d’une réponse de celui d’un token, et ils le font dans des directions opposées. Qwen3.8-Max est économe en tokens et prodigue en réponses : 180 millions de tokens de sortie sur l’Intelligence Index, soit le double de la médiane, à 2,67 $ par tâche. Il travaille longtemps plutôt que d’être grand, et la remise de 88 % sur le cache est le levier qui contrôle la facture — une longue exécution d’agent qui ne cesse de relire le même contexte reste bon marché, une qui ne cesse de générer du texte inédit ne l’est pas.

Fugu Max est cher au token et imprévisible dans ses réponses. Son coordinateur engendre des sous-agents, chacun rédigeant du raisonnement et du texte de sortie facturés à 6,00 $ par million, auxquels s'ajoute la synthèse du coordinateur lui-même. Sakana s'engage à ce que les exécutions multi-agents soient facturées à un tarif mixte unique indexé sur le modèle participant le plus haut de gamme et à ce que l'ajout d'agents ne multiplie pas la facture, ce qui élimine l'explosion du fan-out dans le pire des cas qui rend les systèmes multi-agents naïfs inabordables. Cela n'élimine pas le volume. Et sur la question du volume, le communiqué reste muet d'une manière qui compte : les propres informations de Sakana indiquent que changer de modèle en cours de tâche peut réduire la réutilisation du cache de contexte et générer des tokens d'orchestration supplémentaires, et confirment que l'entreprise n'a pas divulgué le taux de réussite du cache de Max ni son coût total en tokens par tâche.

Ainsi, le même tarif de 2,00 $ / 6,00 $ est un nombre prévisible d’un côté et un multiple non borné avec un plancher de l’autre. La verbosité de Qwen3.8-Max est mesurable avant de vous engager ; celle de Fugu Max ne l’est pas.

Le test de la porte de sortie

C'est ici que l'argument habituel de l'enfermement (lock-in) s'inverse, et c'est l'élément le plus utile de ce duo.

L'argument de Sakana en faveur de Fugu Max, c'est la résilience. Un pool qui couvre à la fois des modèles à poids ouverts et des modèles spécialisés, élargi pour Max avec la famille NVIDIA Nemotron, signifie qu'aucun abandon, changement de tarif ou retrait régional d'un seul fournisseur de pointe ne peut faire tomber votre produit — une véritable protection, que l'entreprise revendique ouvertement vendre. Mais cette protection est invérifiable de l'extérieur. Vous ne pouvez pas voir le pool, ni y inclure ou en exclure un membre, ni auto-héberger quoi que ce soit de celui-ci, ni l'exécuter dans l'UE/EEE. Une promesse concernant un pool que vous n'êtes pas autorisé à inspecter est une garantie plus faible qu'elle n'en a l'air.

Qwen3.8-Max défend l’argument inverse. C’est le modèle d’un seul fournisseur et donc exposé aux décisions d’un seul fournisseur — mais Alibaba a publié des poids ouverts pour le checkpoint Qwen3.8-2.4T-A95B de classe Max sous une licence personnalisée, ce qui signifie que l’échappatoire est réelle plutôt que rhétorique : si les tarifs ou les conditions changent, le modèle peut être servi depuis votre propre infrastructure. Pour une équipe dont la véritable crainte est qu’un fournisseur lui tire le tapis sous les pieds, un checkpoint téléchargeable vaut mieux qu’une description d’un pool.

Appeler l’un ou l’autre

Qwen3.8-Max figure dans notre catalogue à 2,00 $ en entrée et 6,00 $ en sortie par million de tokens, qui correspond au prix catalogue d'Ali baba avec 0 % de marge répercutée, de sorte qu'un changement de prix du fournisseur arrive sur la même clé le jour même plutôt que selon un calendrier de migration. Il est compatible OpenAI sur la même URL de base que le reste du catalogue, ce qui signifie que vous pouvez le placer derrière une règle de routage conditionnel, une chaîne de basculement ou un panneau de fusion de modèles sans second contrat ni modification de code — et le basculement automatique couvre un chemin de fournisseur limité en débit ou dégradé. Il a fait transiter 127,7 millions de tokens par la passerelle au cours des sept derniers jours.

Fugu Max n’est pas sur OrcaRouter. Il vous parvient via l’API compatible OpenAI de Sakana elle-même et plusieurs plateformes tierces, et l’entreprise affirme qu’une intégration Fugu existante se met à niveau avec une modification d’un seul paramètre. Comme les deux parlent le même format de requête, le moyen le moins coûteux de trancher l’écart de benchmark est de cesser d’attendre que Sakana le publie : exécutez les deux derrière un même flag sur votre propre charge de travail et comptez les jetons de sortie par tâche terminée. C’est la mesure qu’aucun des deux fournisseurs n’a fournie.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the argument that the industry has raced along a single axis of bigger and more expensive foundation models while the frontier that matters is two-dimensional, capability on one axis and cost on the other.

Lequel, et quand

Qwen3.8-Max est le choix que vous pouvez auditer, chiffrer et abandonner. À grille tarifaire identique, il vous offre une fenêtre de 1 M de tokens sans surcoût pour prompt long, une entrée image, vidéo et PDF, un checkpoint téléchargeable de classe Max, une entrée indépendante en direct qui mesure les éléments qui déterminent votre facture, et 88 % de réduction sur l’entrée mise en cache. Ses coûts sont tout aussi précis : il est lent à 37,8 tokens par seconde, classé près du bas du peloton en matière de vitesse, il est extrêmement verbeux avec 180 millions de tokens sur l’index, et son taux d’hallucination mesuré a environ doublé par rapport à la génération précédente — ce qui est un sujet de préoccupation sérieux précisément pour le travail autonome pour lequel il est vendu. Exploitez à fond la réduction sur le cache et prévoyez un budget pour un vérificateur.

Fugu Max est le pari que la coordination l'emporte sur la capacité. Si votre travail est à long horizon et vérifiable, et qu'un coordinateur qui lance un vérificateur termine des tâches qu'un modèle unique échoue deux fois à accomplir, alors les tokens d'orchestration coûtent moins cher que les reprises, et la grille tarifaire identique n'est pas du tout une égalité. Ce que vous achetez, c'est de la persistance, dans un système dont vous ne pouvez pas épingler le pool, dont la fenêtre de contexte n'est pas publiée, et dont les six victoires aux benchmarks n'ont aucune valeur associée — auprès d'un fournisseur qui a choisi de nommer le test et de taire le chiffre.

Les deux produits coûtent le même prix par token. Un seul d’entre eux vous dit ce que vous obtenez pour ce prix.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the Featured badge, the identifier qwen/qwen3.8-max, by Qwen dated 2026-08-03, vision, tools, JSON and reasoning capability tags, a 1M-token context window with text, image and video input, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 TTFT of 10.00 seconds, traffic of 127.7 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement