
Fugu Ultra v2 vs Gemini 3.1 Pro : l'adversaire qui se trouve peut-être déjà à l'intérieur de la machine
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il existe une version de la comparaison entre Fugu Ultra v2 et Gemini 3.1 Pro dans laquelle Gemini gagne quelle que soit l’issue du benchmark — car il pourrait effectuer une partie du travail. Le système d’orchestration de Sakana AI, publié le 11 septembre 2026, ne divulgue pas quels modèles il coordonne ; le pool rapporté du Fugu Ultra de juin incluait Gemini 3.1 Pro, entre autres, et la version 2.0 ne nous dit que ce qu’elle a retiré, citant Claude Fable 5, Claude Fable 5.1 et GPT-6 Astra comme exclus. Le Gemini 3.1 Pro de Google est un seul modèle multimodal de frontière avec un contexte de 1 M de tokens qui prend en charge le texte, les images, les PDF, l’audio et la vidéo, en disponibilité générale depuis mai 2026 à 2,00 $ par million de tokens en entrée et 12,00 $ par million de tokens en sortie. L’un d’eux est un modèle que vous pouvez inspecter. L’autre est un système dont les victoires aux benchmarks peuvent transiter par le premier, et aucun des deux fournisseurs ne vous dira si c’est le cas.
Ce qu’est réellement chaque système
Gemini 3.1 Pro est lisible d'une manière devenue rare parmi les sorties de pointe. Il s'agit d'un transformeur à mélange d'experts clairsemé de Google DeepMind, livré pour la première fois en aperçu le 19 février 2026, une source datant la disponibilité générale de mai 2026 — notre propre fiche le référence sous l'identifiant de modèle d'aperçu. Il dispose d'une fenêtre d'entrée de 1 M de jetons et d'un plafond de sortie de 65 K jetons, accepte le texte, les images, les PDF, l'audio, la vidéo et le code, et expose un contrôle de raisonnement à trois niveaux — faible, moyen ou élevé — le niveau élevé étant la valeur par défaut de l'API. Google annonce 77,1 % sur ARC-AGI-2, soit plus du double des 31,1 % de la génération précédente ; 94,3 % sur GPQA Diamond ; 80,6 % sur SWE-bench Verified ; 68,5 % sur Terminal-Bench 2.0 ; 85,9 % sur BrowseComp ; et 44,4 % sur Humanity's Last Exam sans outils, pour atteindre 51,4 % avec la recherche et l'exécution de code. Ce sont des chiffres du fournisseur. Sa date limite de connaissances est janvier 2025, ce qu'il vaut la peine de signaler si votre travail dépend d'événements récents.
Fugu Ultra v2 est un coordinateur. C'est un modèle entraîné, annoncé à environ 7 milliards de paramètres, qui lit une requête, assemble une équipe d'agents avec les rôles Thinker, Worker et Verifier issus des recherches TRINITY de Sakana, et synthétise une réponse derrière un point de terminaison compatible OpenAI. Il n'a pas de liste de modalités publiée qui lui soit propre — tout ce qu'il peut voir, il le voit parce qu'un modèle de son pool peut le voir. Son contexte est de 1 M de tokens, avec une nette hausse tarifaire à 272K, où les tarifs doublent pour atteindre 10 $ en entrée et 45 $ en sortie. Son plafond de sortie n'est pas publié. Son pool n'est pas divulgué, ses décisions de routage ne sont « pas exposées par conception », et pour l'offre Ultra, le pool est fixe, de sorte que vous ne pouvez pas exclure un fournisseur.
Cette asymétrie constitue toute la confrontation. Gemini 3.1 Pro est un composant que l’on peut acheter directement et sur lequel on peut raisonner. Fugu Ultra v2 est un assemblage dont on ne peut pas voir les pièces et dont les revendications de benchmark les plus fortes peuvent être, en partie, les propres résultats de Gemini combinés à ceux de quelqu’un d’autre.

La comparaison où les deux se recoupent
Très peu des éléments publiés permettent de placer les deux systèmes sur la même ligne. Les chiffres ci-dessous de Gemini 3.1 Pro sont ceux de Google ; ceux de Fugu Ultra v2 sont ceux de Sakana ; lorsqu’un agrégateur tiers a publié une ligne commune, celle-ci est signalée et accompagnée d’une mise en garde précisant qu’elle est indicative plutôt que décisive.
• Raisonnement multimodal (CharXiv, ligne partagée) — Fugu Ultra v2 86,6 % vs Gemini 3.1 Pro 80,2 %, selon BenchLM, qui qualifie la catégorie de directionnelle et refuse de nommer un gagnant
• TerminalBench 2.1 — aucun chiffre pour Fugu Ultra v2 v2.0 face à Gemini 3.1 Pro ; aucun chiffre comparable publié ; le Fugu Ultra de juin rapportait 82,1 % contre 70,3 % pour Gemini 3.1 Pro dans une agrégation tierce
• SWE-Bench Pro — aucun chiffre pour Fugu Ultra v2 v2.0 face à Gemini 3.1 Pro ; aucune donnée publiée comparable ; le Fugu Ultra de juin a rapporté 73,7 % contre 54,2 % pour Gemini 3.1 Pro
• ARC-AGI-2 — pas de chiffre pour Fugu Ultra v2, contre 77,1 % pour Gemini 3.1 Pro, chiffre rapporté par le fournisseur
• Humanity's Last Exam — aucun chiffre pour Fugu Ultra v2 v2.0 par rapport à Gemini 3.1 Pro, 44,4 % sans outils, 51,4 % avec, selon le fournisseur
• Couverture des modalités — Fugu Ultra v2 hérite de tout ce que son pool prend en charge, non divulguée, contrairement à Gemini 3.1 Pro, pour lequel texte, image, PDF, audio, vidéo et code sont documentés
• Prix d'entrée / de sortie — Fugu Ultra v2 5,00 $ / 30,00 $ par million, doublant au-delà de 272 K contre Gemini 3.1 Pro 2,00 $ / 12,00 $ par million jusqu'à 200 K, 4,00 $ / 18,00 $ au-delà, entrée mise en cache 0,20 $ / 0,40 $
• Contexte et sortie — Fugu Ultra v2 : contexte de 1M, plafond de sortie non publié vs Gemini 3.1 Pro : 1M en entrée, 65K en sortie
• Poids et accès — Fugu Ultra v2 fermé, hors UE/EEE vs Gemini 3.1 Pro propriétaire mais largement disponible sur l'ensemble des surfaces Google
La ligne multimodale est celle à traiter avec prudence, car c’est la plus citée et la moins solide. L’agrégation CharXiv de BenchLM place Fugu Ultra v2 en tête avec 6,4 points normalisés d’avance — et la même page indique clairement que les lignes directionnelles ne reçoivent jamais de vainqueur, que Gemini n’avait aucun résultat mesuré dans les catégories agentique, codage, connaissances ou multilingue, et que Fugu n’en avait aucun en mathématiques ni en multilingue. Une catégorie où un seul côté a été mesuré dans la plupart des lignes ne peut pas produire de verdict. Si vous ne retenez qu’une seule chose de cette comparaison, retenez ceci : en ce qui concerne spécifiquement le travail multimodal, les preuves publiées ne permettent pas de conclure dans un sens ou dans l’autre, et la seule ligne qui existe n’est explicitement pas un résultat établi.
La possibilité qui change le cadre
Sakana ne dira pas ce qui se trouve dans le pool. Il s’agit d’un choix de conception documenté, et non d’un oubli — la FAQ indique que les informations de routage ne sont pas exposées par conception, et il n’existe aucun mécanisme pour les inspecter. Ce que nous savons de la génération de juin, c’est que les membres du pool signalés comprenaient Gemini 3.1 Pro aux côtés d’autres modèles de pointe. La version 2.0 a modifié le pool, et Sakana n’a décrit ce changement que par soustraction : Claude Fable 5, Claude Fable 5.1 et GPT-6 Astra sont exclus. Rien dans la publication n’indique que Gemini en fait encore partie.
Si Gemini 3.1 Pro fait partie du pool, trois conséquences en découlent, et toutes trois sont pratiques plutôt que philosophiques. Premièrement, une part de la performance multimodale de Fugu Ultra v2 est la performance de Gemini, combinée à celle d'autres modèles — ce qui signifie que vous payez une prime de coordination en plus d'un tarif par token que vous pourriez payer directement. Deuxièmement, Fugu Ultra v2 à 30 $ de sortie par million contre Gemini 3.1 Pro à 12 $ représente une prime d'assemblage, pas de capacité brute ; si votre tâche est une seule question multimodale, Gemini y répond à moindre coût et vous pouvez voir exactement quel modèle a répondu. Troisièmement, et c'est le plus utile, le benchmark honnête d'un orchestrateur n'est pas « bat-il ses composants ? » mais « bat-il son meilleur composant lorsque vous l'utilisez seul ? » L'architecture de Sakana repose sur l'affirmation qu'il le fait, sur des tâches vérifiables. Cette affirmation mérite d'être testée sur votre propre charge de travail avant que vous ne l'acceptiez sur un benchmark de lecture de graphiques.
Il existe une version où la réponse est non et où l'orchestrateur mérite quand même sa place. Si Gemini fait partie du pool et que le score de Chartography de Fugu Ultra v2, 48,3 contre 27,3 pour Claude Opus 5, se confirme, alors ce que Sakana a construit est une couche de coordination qui tire de manière fiable davantage du même modèle que ce que vous obtenez en l'appelant une seule fois. C'est un vrai produit, et la seule question ouverte est de savoir si la marge couvre le prix. Personne n'a publié l'expérience.

Là où se trouvent les bords honnêtes
Les avantages de Gemini 3.1 Pro sont concrets. Il coûte environ deux cinquièmes du prix de Fugu Ultra v2 en entrée et en sortie, et contrairement à Fugu, ses tarifs ne doublent pas au-delà d'un seuil de contexte — le palier à 200K est plus doux que la falaise à 272K. Il documente ses modalités au lieu d'en hériter, ce qui signifie que le traitement de l'audio et de la vidéo est une fonctionnalité prise en charge plutôt qu'un espoir. Il a un plafond de sortie publié. Il est disponible via les interfaces propres de Google et, comme les autres modèles auxquels Fugu Ultra v2 est comparé, il est appelable sur OrcaRouter — sous google/gemini-3.1-pro-preview, au prix catalogue de Google avec 0 % de majoration, de sorte qu'une modification des prix de Google est répercutée sur la même clé le jour même de son annonce.
Les avantages de Fugu Ultra v2 sont plus étroits et bien réels. Il s'attaque à un problème difficile plus d'une fois, avec un rôle de Verifier qui vérifie le travail, ce qui explique pourquoi ses affirmations les plus fortes reposent sur des benchmarks où l'exactitude est vérifiable — Chartography, DeepSWE, Toolathon — plutôt que sur le rappel de connaissances. Les études de cas publiées par Sakana vont dans le même sens : un iris de CAO mécanique qui s'ouvre et se ferme correctement là où d'autres modèles laissaient des lacunes et des liaisons faibles ; un solveur de Rubik's cube en pur Python qui termine les 300 cubes mélangés là où deux baselines frontières anonymisées ont complètement planté. Ces baselines sont anonymisées et choisies par le fournisseur, il faut donc les considérer comme une illustration plutôt qu'une preuve. Mais le schéma est cohérent dans toute la version, et il décrit une capacité authentique qu'un simple appel de modèle ne possède pas : la persévérance sur un problème jusqu'à ce que la réponse passe une vérification.
Pesez aussi les contraintes. Fugu Ultra v2 n'est pas vendu dans l'UE ni dans l'EEE, et Sakana indique clairement qu'elle travaille à se conformer au RGPD. Gemini 3.1 Pro n'a pas une telle restriction et bénéficie d'un historique bien plus long d'évaluations indépendantes.

Le verdict
Pour la plupart des travaux multimodaux, Gemini 3.1 Pro est le bon choix, et de loin. Il est moins cher par token, moins cher par document, documenté pour l’audio et la vidéo, plafonné à un seuil de contexte qui ne double pas votre facture en cours d’exécution, et — le point le plus important ici — vous pouvez voir ce qui vous a répondu. Si vous avez besoin d’un seul modèle pour lire un PDF, regarder un clip et répondre à une question, rien ne justifie de faire transiter cela par un pool non divulgué à deux fois et demie le prix de sortie.
Fugu Ultra v2 est le bon choix pour une forme de travail spécifique et bien plus étroite : des tâches à long horizon avec une réponse vérifiable, où essayer un problème de trois façons et vérifier le résultat vaut mieux que de l’essayer une seule fois, et où le point marginal de qualité justifie le multiple. C’est totalement à exclure si vous avez des utilisateurs de l’UE ou de l’EEE dans votre périmètre.
La question inconfortable que cette confrontation laisse ouverte est celle que personne n’a mesurée. Si Gemini 3.1 Pro fait partie du pool — et la seule réponse honnête aujourd’hui est que Sakana n’a pas dit le contraire — alors une partie de ce que vous achetez avec Fugu Ultra v2 est Gemini 3.1 Pro avec une couche de coordination par-dessus, à un prix qui implique que cette couche vaut environ deux fois et demie le modèle. Cela peut très bien être vrai. L’architecture de Sakana a été conçue pour rendre cela vrai. Mais c’est une hypothèse qui s’appuie sur le tableau de scores d’un fournisseur et sur aucun test indépendant, et tant que personne ne la teste, le modèle que vous pouvez voir est celui que vous pouvez défendre.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
