
Sakana Fugu Max : l'orchestrateur à 2 $/6 $ qui choisit le modèle le moins cher qui fonctionne
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
La plupart des modèles rivalisent sur ce qu'ils savent faire. Sakana Fugu Max rivalise sur le peu qu'il peut se permettre de faire. Sakana AI a publié Sakana Fugu Max le 11 septembre 2026, aux côtés de Sakana Fugu Ultra v2 — deux réglages d'une même architecture d'orchestration orientés vers les extrémités opposées de la courbe coût-performance. Fugu Max ne répond pas lui-même à votre requête. Il lit la tâche, choisit le modèle le moins cher de son vivier capable de la traiter de manière plausible, l'y achemine et renvoie une seule réponse. Sakana le facture à 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie.
Ce qui est intéressant, c’est à quoi ce prix est comparé. Sakana affirme que le tarif de sortie de Fugu Max est inférieur de 40 à 60 % à celui de Claude Sonnet 5, GPT-5.6 Terra et Kimi K3. Cette affirmation est vérifiable et, fait inhabituel pour un benchmark du jour du lancement, l’arithmétique tient : face aux prix catalogue actuels des trois modèles nommés par Sakana, 6 $ par million de tokens de sortie tombe presque exactement au milieu de la fourchette indiquée. Ce qui est bien plus difficile à vérifier, c’est le volet performance, car Sakana a publié les résultats de Fugu Max sous forme de nuages de points plutôt que de chiffres.
Ce qu’est réellement Fugu Max
Fugu Max n’est pas un checkpoint. Il n’y a pas de fichier de poids, pas de nombre de paramètres, et rien à télécharger. Sakana le décrit comme « une architecture, pas un modèle unique » — le même moteur d’orchestration central que Fugu Ultra v2, optimisé pour une question différente. Ultra v2 demande quelle est la capacité la plus élevée disponible. Fugu Max demande quelle est la meilleure sortie au coût le plus faible.
Cette distinction compte sur le plan opérationnel. Vous ne pouvez pas fine-tuner Fugu Max, ni l'héberger vous-même, ni examiner pourquoi il a choisi un modèle plutôt qu'un autre. Vous ne pouvez pas non plus voir la liste complète des modèles sur lesquels il route — Sakana affirme que le pool s'élargit à « notre plus grand pool de modèles ouverts et spécialisés à ce jour » et nomme explicitement la famille Nemotron de NVIDIA, ajoutée grâce au partenariat NVIDIA que Sakana a annoncé en août. Le reste du pool n'est pas nommé, et Sakana ne publie pas de trace de routage par requête.
Ce que vous voyez, c’est la forme de la chose. Le diagramme du fournisseur lui-même montre Fugu Max au sommet d’un fan-out : un orchestrateur, une rangée d’emplacements de modèles interchangeables derrière lui, et Sakana Namazu ainsi que Fugu Max lui-même parmi les cibles. Le pool est décrit comme interchangeable par conception, et la motivation déclarée est autant politique qu’économique — Sakana présente l’orchestration comme une protection contre l’enfermement propriétaire, les révocations d’API et les contrôles des exportations, au motif qu’un système capable de changer de fournisseurs ne peut être coupé par aucun d’entre eux.
Sakana Fugu n'est pas nouveau en soi. Il est devenu disponible en version générale le 22 juin 2026, et la feuille de route de l'éditeur s'étend d'avril (bêta), juin (GA plus Fugu Ultra v1), juillet (Fugu-Cyber et une interface Claude Code), août (Sakana Chat plus le partenariat NVIDIA), et maintenant septembre. Fugu Max est la cinquième étape mensuelle, pas une première — et toute personne utilisant déjà Fugu peut y passer avec une modification d'un seul paramètre sur le même point de terminaison compatible OpenAI, sans migration.
{{1}}L'affirmation sur les prix{{/1}} {{2}}survit{{/2}} au contact des {{KEEP}}list prices{{/KEEP}}{{3}}{{/3}}
Le chiffre de 2 $ en entrée / 6 $ en sortie de Sakana est clairement indiqué sur la page de lancement. La couverture secondaire ajoute un tarif d’entrée en cache de 0,25 $ par million de tokens, que la page de lancement elle-même n’indique pas — considérez ce tarif comme rapporté plutôt que confirmé. À titre de comparaison, Fugu Ultra v2 est à 5 $ en entrée, 30 $ en sortie, avec 0,50 $ pour l’entrée en cache.
Maintenant, l’affirmation des 40–60 %. Les trois comparateurs nommés se situent actuellement à :
• GPT-5.6 Terra — 2 $ en entrée / 12 $ en sortie, après la baisse du 30 juillet d’OpenAI qui a fait passer le prix de sortie de 15 $ à 12 $.
• Claude Sonnet 5 — 10 $ en sortie au tarif promotionnel de lancement, 15 $ au tarif standard. Les sources divergent quant à savoir si l'augmentation prévue en septembre a été abandonnée ou simplement reportée, ce qui explique l'ampleur de la fourchette.
• Kimi K3 — 3 $ en entrée / 15 $ en sortie, avec l'entrée mise en cache à 0,30 $.
Par comparaison, un tarif de sortie de 6 $ se situe 50 % en dessous de Terra, 40 % en dessous du tarif promotionnel de Sonnet 5, 60 % en dessous du tarif standard de Sonnet 5 et 60 % en dessous de Kimi K3. L’affirmation se vérifie, et elle se vérifie par rapport aux prix catalogue publiés plutôt qu’à un modèle de coûts interne — ce qu’on ne peut pas dire de tous les pourcentages annoncés le jour du lancement.
Un chiffre de la même section ne résiste pas au même traitement. Sakana affirme également que Fugu Max offre « des performances à portée des modèles d’élite, pour un coût deux à six fois inférieur ». Pour les trois modèles cités à l’appui du chiffre de 40–60 %, l’écart brut entre les prix de sortie est plutôt de l’ordre de 1,7× à 2,5×. Le multiplicateur plus large est vraisemblablement mesuré sur toute la frontière — y compris des modèles qui coûtent bien plus de 12 $ — plutôt que par rapport aux trois modèles mentionnés dans la phrase. C’est une affirmation défendable à propos de la courbe de Pareto et indéfendable à propos des rivaux nommés, et la page de lancement ne fait pas la distinction entre les deux.
C’est là qu’une couche de routage justifie son utilité côté tarification. OrcaRouter répercute les prix catalogue des fournisseurs sans marge, donc quand un fournisseur modifie son prix catalogue, le chiffre que vous voyez change le jour même — pertinent ici parce que toute la prémisse de Fugu Max est qu’un modèle moins cher existe quelque part dans le pool et que vous devriez l’atteindre sans y penser. Nous n’hébergeons pas Fugu Max ; il tourne sur l’API propre de Sakana. Mais le principe de répercussion est celui-là même qui fait qu’un tarif de sortie de 6 $ mérite d’être comparé à un tarif en place de 12 $ plutôt que de faire aveuglément confiance à l’un ou l’autre de ces chiffres.
Ce que Sakana affirme battre, et ce qu’elle ne vous montrera pas

La section des benchmarks du fournisseur avance trois affirmations spécifiques pour Fugu Max : le meilleur score global sur six benchmarks — Terminal Bench 2.1, GPQA-D, AA-LCR, GDP.pdf, AutomationBench et SWEFish — une extension de la frontière de Pareto coût-performance sur sept des dix benchmarks, et une performance « à portée de tir des modèles d’élite » pour une fraction des tokens dépensés.
Trois choses au sujet de ces éléments de preuve méritent d’être gardées en tête avant que vous n’en citiez le moindre extrait.
Le premier point, c'est que Sakana n'a publié aucun chiffre. Les résultats de Fugu Max apparaissent sous la forme de dix nuages de points — le score sur l'axe vertical, le prix de sortie en dollars par million de tokens sur l'axe horizontal — avec Fugu Max représenté par un point rouge au nord-ouest du nuage gris. On voit qu'il se situe en haut et à gauche. Impossible d'y lire un score. Terminal Bench 2.1, GPQA-D et AA-LCR disposent tous de classements publics où un chiffre serait directement comparable, et aucun n'a été fourni.
Le deuxième point, c’est que l’un des six benchmarks est celui de Sakana. SWEFish est décrit sur la page de lancement comme « notre benchmark interne reflétant les propres défis et cas d’usage de codage de Sakana AI ». C’est une manière légitime de mesurer l’adéquation à votre propre produit, et ce n’est pas une façon de se comparer à un rival — un score obtenu sur un benchmark conçu par le fournisseur, sur des tâches choisies par le fournisseur, ne constitue pas une preuve concernant le modèle de quelqu’un d’autre.
Le troisième point est que les chiffres les plus solides de la page appartiennent à l’autre modèle. Fugu Ultra v2 obtient des chiffres là où Fugu Max obtient des graphiques : Chartography 48,3 contre Opus 5 à 27,3 et Fable 5 à 29,5, DeepSWE 74,3, meilleur ou ex æquo sur cinq des huit benchmarks et parmi les deux premiers sur sept des huit. Ultra v2 affiche également une date limite d’entraînement déclarée au 28/08/2026 — un peu plus de deux semaines avant le lancement — et, détail révélateur, une note explicite indiquant que Fable 5, Fable 5.1 et GPT-6 Astra ne font pas partie de son pool. Sakana affirme y parvenir sans louer ces modèles précis, ce qui résume tout l’argument de souveraineté en une note de bas de page.
Rien de tout cela ne rend fausses les affirmations de Fugu Max. Cela les rend non vérifiées, et cela fait que le titre concernant les six benchmarks ne peut être répété sans risque qu’avec l’étiquette attachée. L’évaluation indépendante d’un tout nouveau point de terminaison d’orchestration est rare, et rien n’a encore été publié.
Fugu Max vs Fugu Ultra v2 : lequel vous voulez vraiment

Ce ne sont pas des produits concurrents, et le choix entre eux n’est pas serré une fois que l’on voit les chiffres côte à côte. Fugu Max est le moins cher : 2 $ en entrée, 6 $ en sortie, conçu pour éviter les modèles coûteux chaque fois qu’un modèle moins cher peut faire l’affaire. Fugu Ultra v2 est le plus puissant : 5 $ en entrée, 30 $ en sortie, 0,50 $ en cache, conçu pour privilégier la capacité sur les travaux complexes en plusieurs étapes, même lorsque cela coûte plus cher.
La distinction pratique se fait selon la forme de la tâche, non selon le budget. Si votre trafic consiste principalement en recherches, extraction, classification, générations courtes et appels d'outils simples, tout le design de Fugu Max vise à le détecter et à dépenser le moins possible — et l'affirmation de Sakana selon laquelle il repousse la frontière sur sept benchmarks sur dix va au moins dans ce sens. Si votre trafic comprend de longues exécutions agentiques, des refactorisations multi-fichiers ou des tâches de recherche dont l'échec coûte cher lorsqu'une étape se passe mal, le tarif de sortie de 30 $ d'Ultra v2 achète quelque chose de réel : la place parmi les deux premiers sur sept benchmarks sur huit est l'élément de la page de lancement qui ressemble le plus à une affirmation de capacité plutôt qu'à une affirmation de coût.
Tous deux sont disponibles sur la même API compatible OpenAI via la console de Sakana, et le passage depuis Fugu existant se fait par un simple changement de paramètre. Deux réserves de disponibilité s’appliquent. Fugu a été signalé comme indisponible dans l’UE et l’EEE dans l’attente des travaux sur le RGPD, ce qui, si c’est toujours le cas, limite les lieux où l’un ou l’autre modèle peut être déployé. Et tous deux sont des systèmes fermés : vous achetez un point de terminaison, et le fournisseur choisit les modèles qui se trouvent derrière — y compris, pour Fugu Max, une liste qu’il ne divulgue pas entièrement.
Le hic : un orchestrateur qui loue encore sa frontière
La critique la plus acérée de Fugu est celle que Sakana attire en le présentant comme une infrastructure de souveraineté. Une couche d’orchestration qui effectue le routage entre des API tierces n’empêche pas ces API d’être révoquées. Elle transforme un point de défaillance unique en un point de défaillance diversifié, ce qui constitue une réelle amélioration, mais les modèles sous-jacents appartiennent toujours à quelqu’un d’autre, restent exposés aux mêmes contrôles à l’exportation et demeurent soumis aux mêmes coupures de service soudaines. Le partenariat avec NVIDIA conclu en août et les ajouts de Nemotron sont la réponse la plus concrète à ce jour — les modèles à poids ouverts dans le pool sont des modèles que personne ne peut désactiver — mais Sakana ne dit pas quelle part du trafic de Fugu Max est réellement dirigée vers eux.
Il existe un second compromis, plus discret. Les décisions de routage ajoutent de la latence et suppriment le déterminisme. Une requête qui atterrit sur un petit modèle aujourd’hui pourrait atterrir sur un autre demain si le pool ou les pondérations de coût changent, ce qui rend le comportement plus difficile à tester en régression et plus difficile à expliquer à quiconque audite le système. La réponse de Sakana est que l’orchestration est interne et que l’API se comporte comme un modèle unique. C’est vrai à l’interface, mais pas en dessous, et les équipes ayant des exigences strictes de reproductibilité devraient le tester soigneusement avant que cela ne devienne structurant.
Si vous voulez le gain de coût sans faire du pool votre unique dépendance, le même schéma est disponible à composer vous-même. Notre DSL de routage vous permet de définir un panel de modèles derrière un seul endpoint et de décider lequel traite quelle classe de requête, et la fusion de modèles exécute plusieurs modèles sur le même prompt et réconcilie les réponses là où l'accord compte plus que le prix. Le basculement entre fournisseurs signifie que lorsqu'un fournisseur se dégrade — ou disparaît — le trafic est redirigé vers un modèle en lequel vous avez déjà confiance, sans modification de code. C'est la version plus conservatrice du pari que Sakana vous demande de faire en bloc.

Il vaut la peine d’être précis sur ce que nous proposons et ne proposons pas ici. Sakana Fugu Max ne figure pas dans notre catalogue — ce n’est pas un modèle routable de notre côté, et il fonctionne sur l’API et la console propres à Sakana. Notre catalogue, c’est 196 modèles chez 15 fournisseurs avec une seule clé et une seule facture, avec les tarifs par token imprimés sur chaque fiche et aucune marge ajoutée par-dessus. Le recoupement pertinent avec Fugu Max, c’est l’idée, pas l’inventaire : tous deux constituent des arguments selon lesquels la bonne réponse à « quel modèle devrait s’en charger » n’est généralement pas le plus gros.
Qui doit bouger, et qui doit attendre
Fugu Max est l'une des sorties les plus intéressantes du mois, précisément parce qu'il ne s'agit pas d'un modèle. Si vous utilisez déjà Sakana Fugu, la mise à niveau se fait en modifiant une seule ligne, à un prix inférieur, et il n'y a aucune raison d'hésiter. Si vous faites tourner un trafic à fort volume et faible complexité sur un modèle de milieu de gamme et que vous payez 10 à 15 $ par million de tokens de sortie, le calcul que propose Sakana mérite que vous fassiez votre propre benchmark — prenez une semaine de requêtes réelles, faites-les passer par Fugu Max, et comparez la qualité à celle de votre modèle actuel plutôt qu'aux nuages de points.
Si vous avez besoin de chiffres de référence publiés avant de vous engager, attendez. Il n'existe encore rien d'indépendant sur Fugu Max, les preuves du fournisseur lui-même prennent la forme d'un graphique plutôt que d'un tableau, et l'un des six benchmarks phares appartient à Sakana. Ce n'est pas une raison pour le rejeter — c'est une raison pour le tester sur votre propre trafic, le seul benchmark qui était le seul à pouvoir prédire vos résultats. Et si votre charge de travail est agentique, à long horizon et qu'une erreur coûte cher, le modèle à examiner dans ce duo est Fugu Ultra v2, pas Fugu Max : c'est celui qui a des chiffres à l'appui.
Notre DSL de routagevous permet de définir un panel de modèles derrière un point de terminaison unique et de décider lequel traite quelle classe de requête, et la fusion de modèles exécute plusieurs modèles sur le même prompt et réconcilie les réponses là où l'accord compte plus que le prix.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
