Une carte de titre principale pour Fugu Ultra v2 intitulée « Fugu Ultra v2 » avec le sous-titre « Le pool a rétréci et le score a grimpé », des badges en forme de pilule portant « Chartography 48.3 », « DeepSWE 74.3 » et « 5 $ / 30 $ par 1 M », une ligne de pied de page « Sakana AI - sortie le 11 septembre 2026 », et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Sakana Fugu Ultra v2, expliqué : le pool a rétréci et le score a augmenté

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Fugu Ultra v2 est une drôle de mise à niveau : Sakana AI l'a mis en ligne le 11 septembre 2026 avec un pool de modèles qui ne contient plus Claude Fable 5, Claude Fable 5.1 ni GPT-6 Astra — trois des systèmes les plus puissants actuellement commercialisés — et affirme toujours surpasser les trois. Le nouveau fer de lance de la gamme qualité du laboratoire tokyoïte, sorti le même jour qu'un petit frère moins cher appelé Fugu Max, est meilleur ou ex æquo sur cinq des huit benchmarks de l'évaluation maison de Sakana, notamment 48,3 sur Chartography contre 27,3 pour Claude Opus 5 et 29,5 pour Claude Fable 5, ainsi que 74,3 sur DeepSWE. Aucun de ces chiffres n'a été reproduit indépendamment, et il n'existe toujours aucune page Artificial Analysis pour un modèle Fugu, quel qu'il soit. C'est cet écart qui est révélateur : ce qu'on vous propose d'acheter, c'est une couche de coordination dont tout l'argumentaire repose sur le fait qu'elle n'a pas besoin des meilleurs modèles pour produire les meilleures réponses.

Sakana AI a été fondée en 2023 par Llion Jones, co-auteur de l’article Transformer, et David Ha. La gamme Fugu a été lancée en juin 2026 en tant que système multi-agent livré sous la forme d’un modèle unique : vous appelez un seul point de terminaison compatible OpenAI, et derrière celui-ci, un coordinateur entraîné décompose la requête, crée des agents et synthétise le résultat. La recherche est réelle et publiée — TRINITY (arXiv 2512.04695) a fait évoluer un coordinateur léger qui attribue les rôles de Thinker, Worker et Verifier ; Conductor (arXiv 2512.04388) a appris la coordination en langage naturel entre agents ; le rapport technique de Fugu se trouve à arXiv 2606.21228. Ce que Sakana n’a jamais publié, c’est ce que tout le monde veut réellement : l’identité des modèles du pool et les décisions de routage par tâche.

Qu’est-ce qui a réellement changé par rapport au Fugu Ultra de juin ?

La version 2.0 est une mise à jour ponctuelle environ onze semaines après la version originale, et non une nouvelle architecture. La présentation du fournisseur lui-même est que Fugu Ultra v2 et Fugu Max sont « la même architecture d'orchestration centrale », optimisée pour deux missions différentes : Max pousse la frontière coût-performance vers le bas, Ultra pousse la capacité de pointe vers le haut. L'identifiant du modèle est fugu-ultra-v2.0, et Sakana affirme que migrer depuis un Fugu antérieur ne nécessite qu'un changement de paramètre sur une seule ligne, sans migration du SDK — ce qui est l'élément le plus convivial de cette version pour le consommateur.

Les changements de fond sont les deux éléments qui encadrent le reste. Premièrement, la date limite des données d'entraînement est passée au 20260828, si bien que le coordinateur a été réajusté par rapport à la génération actuelle de modèles de pointe. Deuxièmement, et c'est bien plus intéressant, la composition du pool a changé d'une manière que Sakana a choisi de mettre en avant : Claude Fable 5, Claude Fable 5.1 et GPT-6 Astra sont explicitement exclus. L'argument de Sakana est que cela prouve que les scores ne dépendent pas d'un seul modèle de pointe propriétaire, ce qui compte si vous vous préoccupez du verrouillage propriétaire, des révocations d'API ou de la disparition d'un modèle derrière des contrôles à l'exportation.

Il y a une conséquence de second ordre sur laquelle Sakana ne s'attarde pas. Si le pool exclut les trois modèles disponibles les plus puissants, alors les comparaisons de benchmark avec Fable 5 et Fable 5.1 sont effectuées par rapport à des systèmes que l'orchestrateur ne pourrait pas appeler, même s'il le voulait. La comparaison est légitime — c'est une affirmation sur l'architecture, pas sur l'accès — mais ce n'est pas un test à conditions égales pour déterminer qui a le meilleur modèle. C'est un test pour savoir si la coordination l'emporte sur la capacité brute. C'est une question vraiment intéressante. Ce n'est simplement pas la question que le tableau des scores laisse entendre au premier coup d'œil.

A single-column scoreboard for Fugu Ultra v2 titled 'Fugu Ultra v2 - the scoreboard' listing Best or joint-best 5 of 8 benchmarks, Chartography 48.3, DeepSWE 74.3, Agent pool excludes Fable 5, Fable 5.1, GPT-6 Astra, Price $5.00 / $30.00 per 1M, and Independent evaluation none published, with a footer 'All figures vendor-reported by Sakana AI, September 2026; no independent evaluation.' and the OrcaRouter logo in the bottom-right corner.

Les chiffres, et qui les a produits

Tous les chiffres de cette section sont déclarés par le fournisseur. Sakana n'a publié ni harnais d'évaluation, ni grille de scores par tâche, ni recette de reproduction, et la conception de l'orchestration rend la réplication indépendante plus difficile plutôt que plus facile : reproduire un score exige l'accès à chaque modèle du pool dans les mêmes versions avec la même topologie, et, par conception, la topologie varie d'une requête à l'autre.

• Chartography (raisonnement visuel sur des graphiques et des documents structurés) — Fugu Ultra v2 48,3, Claude Opus 5 27,3, Claude Fable 5 29,5 — selon le fournisseur

• DeepSWE (ingénierie logicielle en conditions réelles) — Fugu Ultra v2 74,3 — selon le fournisseur, surpasserait des modèles coûtant trois à cinq fois plus par token

• Meilleur classement, ou classement ex æquo au premier rang — cinq des huit benchmarks : GDP.pdf, Chartography, SWEFish, DeepSWE et Toolathon — selon le fournisseur

• Classement dans les deux premiers — sept benchmarks sur huit — rapporté par le fournisseur

• Fugu Ultra précédent (juin 2026, à titre de comparaison) — LiveCodeBench 93,2, GPQA-Diamond 95,5, TerminalBench 82,1, SWE-Bench Pro 73,7 — rapporté par le fournisseur

La ligne Chartography mérite l’attention qu’on lui accorde, car c’est la seule catégorie où l’écart avec un modèle phare actuel et nommé n’est pas marginal. Un écart de 21 points par rapport à Claude Opus 5 dans un benchmark de raisonnement visuel est le genre de chiffre qui apparaît généralement sur un classement indépendant en quelques jours. À l’heure où ces lignes sont écrites, aucun n’est apparu. Traitez cette ligne comme une hypothèse assortie d’un montant en dollars, et non comme un résultat établi.

Tarification : inchangée depuis juin, et franchement coûteuse en sortie

Fugu Ultra v2 coûte 5 $ par million de jetons d’entrée, 30 $ par million de jetons de sortie et 0,50 $ par million de jetons d’entrée mis en cache. Au-delà de 272 000 jetons de contexte, ces tarifs passent à 10 $, 45 $ et 1,00 $ respectivement. Fugu Max est d’une tout autre forme : 2 $ en entrée, 6 $ en sortie, 0,25 $ en cache, à tarif fixe quelle que soit la longueur du contexte, plus 0,007 $ par recherche web ou appel de récupération.

Deux points de ce tableau tarifaire méritent d'être lus attentivement. Le premier, c'est que la sortie coûte six fois l'entrée — un ratio agressif qui tarife la verbosité du modèle, et l'orchestration est une activité verbeuse. Un coordinateur qui lance des agents et synthétise leurs réponses émet beaucoup de tokens, et vous payez pour chacun d'eux à 30 $ le million. L'affirmation d'efficacité de Sakana concerne le pool sous-jacent, et non la quantité de texte que le système produit pour votre compte, et ce sont deux chiffres différents. Établissez votre budget en fonction des nombres de tokens observés, et non du tarif affiché.

Le deuxième est la falaise des 272K. Doubler le tarif par token au-delà d’un seuil est une façon légitime de facturer le travail à contexte long, mais cela signifie que le coût effectif d’une exécution d’agent à contexte long n’est pas le chiffre indiqué sur la page de tarification. Si votre charge de travail se situe près de la limite, l’arithmétique change sensiblement de part et d’autre de celle-ci.

Les niveaux d'abonnement de Fugu — Standard à 20 $, Pro à 100 $, Max à 200 $ par mois, avec des allocations de 10x et 20x — incluent tous l'accès à Fugu, Fugu Ultra et Fugu Max. Sakana facture aussi le modèle Fugu de base en fonction du niveau le plus élevé présent dans le pool pour une requête donnée, et indique clairement que l'ajout de davantage d'agents ne multiplie pas la facture. C'est une vraie différence par rapport au modèle de coûts en fan-out que vous obtiendriez en appelant vous-même plusieurs modèles de pointe.

Ce que Sakana ne vous dira pas

Demandez quels modèles ont répondu à votre question, et la FAQ est sans détour : « ces informations de routage ne sont pas exposées par conception. » Les pools Ultra et Max sont fixes, vous ne pouvez donc pas exclure un fournisseur ; seul le modèle Fugu de base prend en charge les exclusions par modèle dans les paramètres de la console. Les clients Enterprise peuvent négocier des configurations personnalisées.

Cette opacité est le nœud du problème des critiques que la gamme Fugu suscite depuis juin, et il s'agit d'une critique juste plutôt qu'hostile. Lorsqu'un orchestrateur obtient un bon score en combinant les modèles d'autres laboratoires, le score revient au système — ce qui est une chose réelle et défendable à vendre — mais il ne se transfère à aucun modèle pris isolément, et il ne peut pas être audité. Les évaluateurs l'ont dit sans détour : Fugu n'a pas battu le modèle phare, il l'a recruté. Sur des tâches vérifiables dotées d'un vérificateur peu coûteux, comme un benchmark de programmation avec une suite de tests, un comité peut réellement surpasser son meilleur membre. Sur des tâches qui n'en ont pas, un panel qui échantillonne plusieurs modèles de pointe et rapporte le meilleur résultat rapporte en partie de la chance. Les choix de catégories de Sakana lui-même — Chartography, DeepSWE, Toolathon — penchent vers le pôle vérifiable, ce qui est le bon endroit pour formuler cette affirmation et aussi la raison pour laquelle celle-ci ne peut pas être généralisée gratuitement.

Des testeurs indépendants ont également signalé la variance de latence comme le coût pratique de l’orchestration : sur les tâches difficiles, le coordinateur délibère, et sur les tâches faciles, cette délibération est un pur surcoût. La tâche de shader d’un chercheur aurait pris environ trente minutes, avec une qualité jugée seulement acceptable.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, the 'Start Using Sakana Fugu' and 'Contact Us' buttons, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Où vous pouvez réellement l’obtenir

Fugu Ultra v2 est désormais disponible via l'API compatible OpenAI de Sakana — il suffit de pointer un client existant vers le point de terminaison avec une clé API et de modifier une seule ligne — ainsi que via plusieurs plateformes tierces. OrcaRouter ne propose pas les modèles Fugu ; si vous voulez appeler Fugu Ultra v2, l'API propre au fournisseur est la voie directe.

Ce qu'il convient de noter, c'est l'alternative avec laquelle Sakana est implicitement en concurrence. Le vivier qui fait fonctionner Fugu Ultra v2 est constitué de modèles qui sont aujourd'hui appelables individuellement, et les adversaires auxquels il est comparé sont ceux que les équipes utilisent déjà. Claude Opus 5, DeepSeek V4 Pro et Gem​ini 3.1 Pro sont tous sur OrcaRouter aux prix catalogue de leurs fournisseurs, avec 0 % de majoration, ce qui signifie qu'une baisse de prix de l'un de ces fournisseurs est effective de notre côté le jour même où elle est annoncée. Si la raison pour laquelle vous envisagez un orchestrateur est la résilience — ne pas vouloir qu'un chemin de production dépende de la disponibilité d'un seul fournisseur ou de la politique d'un seul fournisseur — alors une couche de routage avec basculement automatique entre fournisseurs résout une partie de ce problème au niveau du modèle, et Fugu Ultra v2 en résout une autre partie au niveau du raisonnement. Une API unique pour plus de 200 modèles avec basculement ne remplace pas un coordinateur entraîné, et un coordinateur entraîné ne remplace pas le fait de ne pas dépendre d'un seul fournisseur. Certaines équipes voudront les deux.

Le piège de la conformité

Fugu n'est pas disponible dans l'Union européenne ni dans l'Espace économique européen. La formulation du fournisseur est explicite : pas encore disponible dans l'UE/EEE tant qu'il n'a pas atteint la conformité avec le RGPD et les réglementations propres à l'UE, et ailleurs, l'accès peut être limité par les conditions réseau ou les règles locales. Si votre organisation compte des entités de l'UE dans son périmètre, cela écarte la ligne Fugu de toute considération, indépendamment des performances aux benchmarks, ce qu'il vaut mieux savoir avant l'évaluation plutôt qu'après.

A screenshot of the OrcaRouter models catalogue page (captured September 11, 2026, English UI), showing the OrcaRouter navigation with Models, Leaderboard, Offers and Developers entries, the search field, and the 'Get API key' button over the browsable model catalogue.

Que regarder

Trois choses feraient passer Fugu Ultra v2 d’une affirmation intéressante à un choix structurant. Une évaluation indépendante — une entrée dans Artificial Analysis, un classement dans LMArena, n’importe quel dispositif adossé à un harnais d’évaluation — réglerait la question Chartography en une semaine. Des chiffres reproduits par un tiers sur les benchmarks de codage vérifiables confirmeraient le gain au niveau système que l’architecture prédit. Et un pool divulgué, ou même partiel, permettrait aux acheteurs de raisonner précisément sur les points de défaillance uniques qu’ils acceptent lorsqu’ils acheminent le trafic de production à travers un coordinateur qu’ils ne peuvent pas inspecter.

D’ici là, la position honnête est la suivante. Fugu Ultra v2 est la tentative la plus sérieuse à ce jour de vendre l’orchestration comme un produit plutôt que comme une démo de recherche, de la part d’un laboratoire qui a des travaux publiés derrière lui, à un prix qui rend le supplément d’orchestration explicite plutôt que dissimulé. Si votre charge de travail est à long horizon, vérifiable et limitée à une région où Sakana peut vous servir, cela vaut la peine de mener un pilote à périmètre défini avec la comptabilisation des tokens activée. Si ce n’est pas le cas, les modèles auxquels Fugu Ultra v2 est comparé sont accessibles en un seul appel d’API, au prix catalogue, avec des preuves de ce dont ils sont capables.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement