Carte de titre principale pour Fugu Ultra v2 vs Claude Opus 5 avec le sous-titre « Même prix d'entrée, deux paris différents », des badges en forme de pilule affichant « 5,00 $ en entrée pour les deux », « Chartography 48,3 vs 27,3 » et « contexte de 1 M », une ligne de pied de page « Sakana AI vs Anthropic - septembre 2026 », et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Fugu Ultra v2 vs Claude Opus 5 : même prix d’entrée, deux paris différents

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anth​ropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.

La coïncidence qui façonne tout

Commencez par ce sur quoi les deux produits s'accordent, car c'est plus que le prix affiché.

• Prix en entrée — Fugu Ultra v2 5,00 $ par 1M de jetons vs Claude Opus 5 5,00 $ par 1M de jetons

• Prix de sortie — Fugu Ultra v2 30,00 $ par 1 M de tokens vs Claude Opus 5 25,00 $ par 1 M de tokens

• Entrée mise en cache — Fugu Ultra v2 : 0,50 $ par million au-dessus du tarif de base, contre Claude Opus 5, qui facture la mise en cache comme une remise pouvant atteindre 90 % sur l’entrée mise en cache

• Contexte — Fugu Ultra v2 1 M de tokens, avec des tarifs qui doublent au-delà de 272 K, contre Claude Opus 5 1 M de tokens, à tarif constant

• Plafond de sortie — Fugu Ultra v2 non publié sous forme de chiffre unique vs Claude Opus 5 128K tokens

Disponibilité — Fugu Ultra v2 non commercialisé dans l’UE/EEE, tandis que Claude Opus 5 est généralement disponible selon les conditions standard de l’API

• Preuves — benchmarks rapportés par le fournisseur pour Fugu Ultra v2, aucune évaluation indépendante à ce jour, face aux benchmarks fournisseur de Claude Opus 5, plus des mois de positions dans des classements tiers

Cette dernière ligne est là où la comparaison bascule réellement. À prix d'entrée identique, vous choisissez entre un système dont vous devez accepter les scores sur parole et un modèle dont d'autres ont reproduit les scores. La falaise des 272K aggrave la chose : au-delà de ce seuil, le tarif d'entrée de Fugu Ultra v2 double pour atteindre 10 $ et celui de sortie passe à 45 $, tandis que le tarif de Claude Opus 5 ne bouge pas. Pour les exécutions d'agents à contexte long — précisément la charge de travail pour laquelle Fugu Ultra v2 est conçu — l'avantage tarifaire du prix affiché disparaît exactement là où le système est censé briller.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Ce que chacun est réellement

Claude Opus 5 is Anth​ropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anth​ropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.

Fugu Ultra v2 n'est pas cela, et la différence n'est pas cosmétique. C'est un coordinateur — un petit modèle entraîné, rapporté à environ 7 milliards de paramètres, qui lit votre requête, assemble une équipe d'agents, attribue les rôles de Thinker, Worker et Verifier à partir des travaux TRINITY de Sakana, et synthétise une réponse finale. Les modèles sous-jacents ne sont pas divulgués, les décisions de routage ne sont pas exposées par conception, et pour le niveau Ultra, le pool est fixe : vous ne pouvez pas exclure un fournisseur. La propre formulation de Sakana de la version 2 est que la date limite d'entraînement a été déplacée au 28 août 2026 et que la composition du pool a changé — spécifiquement pour exclure Claude Fable 5, Claude Fable 5.1 et GPT-6 Astra.

Cette exclusion est le détail le plus révélateur du communiqué. Fugu Ultra v2 revendique des victoires aux benchmarks face aux trois modèles les plus puissants disponibles, tout en confirmant qu'il ne fait appel à aucun d'entre eux. Quoi que contienne ce pool, il ne représente pas le sommet du marché selon le propre décompte de Sakana. L'argument de vente est que la coordination bat la capacité. C'est une vraie thèse, et sur des tâches vérifiables avec un vérificateur peu coûteux, c'est une thèse étayée par des preuves. Ce n'est pas la même affirmation que « ce système est plus intelligent que Claude Opus 5 », et le tableau des scores est agencé de manière à ce que les deux soient faciles à confondre.

Le tableau de score que Sakana a choisi

Chaque chiffre ci-dessous provient de l’évaluation de Fugu Ultra v2 réalisée par Sakana elle-même. Les chiffres de Claude Opus 5 sont ceux mesurés par Sakana dans la même comparaison, sauf indication contraire. Aucun tiers indépendant n’a reproduit la colonne Fugu, et à l’heure où nous écrivons, il n’existe aucune entrée Artificial Analysis pour un quelconque modèle Fugu.

• Chartography — Fugu Ultra v2 48,3 vs Claude Opus 5 27,3 — déclaré par le fournisseur, un écart de 21 points

• DeepSWE — Fugu Ultra v2 74,3 contre aucune donnée publiée de Claude Opus 5 dans le même tableau — rapporté par le fournisseur

• Classement dans les benchmarks — Fugu Ultra v2 meilleur ou à égalité au premier rang sur cinq des huit, dans les deux premiers sur sept des huit — déclaré par le fournisseur

• SWE-bench Verified — aucun chiffre pour Fugu Ultra v2 vs Claude Opus 5 96,0 % — rapporté par Anthropic

• SWE-bench Pro — aucun chiffre pour Fugu Ultra v2 face aux 79,2 % de Claude Opus 5 — rapporté par Anthropic

• ARC-AGI 3 — aucun chiffre pour Fugu Ultra v2 contre Claude Opus 5 ~30,2 % — rapporté par Anthropic

Interprétez cela comme une configuration plutôt qu’un classement. Sakana a publié un tableau de huit benchmarks où son système en remporte cinq, et les résultats publiquement documentés les plus solides de Claude Opus 5 — les lignes SWE-bench, ARC-AGI 3 — n’y figurent tout simplement pas. Ce n’est pas une accusation de mauvaise foi ; c’est à quoi ressemble un tableau de scores de fournisseur, y compris celui de chaque fournisseur. Mais cela signifie que vous ne pouvez pas conclure, à partir de cette publication, que Fugu Ultra v2 bat Claude Opus 5 en ingénierie logicielle, car les deux systèmes n’ont pas été mesurés sur les mêmes lignes assez souvent pour l’affirmer. Sur la seule ligne où les deux apparaissent et où les deux chiffres sont publics — Chartography — Fugu Ultra v2 revendique une large victoire. Sur les lignes de raisonnement et de codage les plus générales, un seul camp a publié.

A two-column scoreboard for Fugu Ultra v2 vs Claude Opus 5 titled 'Fugu Ultra v2 vs Claude Opus 5 - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Chartography 48.3, Evidence vendor-reported only, Weights closed, pool undisclosed, Context 1M, doubles past 272K. Right column Claude Opus 5: Input price $5.00 / 1M, Output price $25.00 / 1M, Chartography 27.3, Evidence independent evals, Weights closed, single model, Context 1M, flat. Footer 'Fugu figures vendor-reported by Sakana; Opus 5 rows as measured by Sakana, plus Anthropic-reported evals.', with the OrcaRouter logo bottom-right.

Coût par tâche, et non coût par jeton

La facture de tokens d'un orchestrateur n'est pas son tarif par token. Fugu Ultra v2 lance des agents, chacun apportant des tokens de raisonnement et de sortie, et le coordinateur lui-même produit du texte de synthèse. La FAQ tarifaire de Sakana prend ici un engagement réellement utile — vous êtes facturé à un tarif unique mixte basé sur le modèle haut de gamme impliqué, et l'ajout d'agents ne multiplie pas la facture — ce qui élimine la multiplication en éventail dans le pire des cas qui rend les configurations multi-agents naïves coûteuses. Mais cela ne supprime pas le volume. La quantité de tokens de sortie facturés reste fonction du nombre d'agents exécutés et de la quantité de texte qu'ils ont écrite, et à 30 $ par million, ce volume est la variable que vous ne pouvez pas prédire depuis la page de tarification.

La structure de coûts de Claude Opus 5 est l'inverse. Un appel, un modèle, un réglage d'effort que vous contrôlez, et un tarif de sortie de 25 $ avec traitement par lots disponible à 50 % de réduction pour les tâches non temps réel. Vous pouvez le prévoir. Pour une charge de travail que vous exécutez dix mille fois par jour, la prévisibilité vaut bien plus qu'une marge de benchmark sur une tâche de lecture de graphiques.

This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anth​ropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.

Là où Fugu Ultra v2 l'emporte véritablement

Rendez au système ce qui lui revient. Le résultat de Chartography, s'il tient, relève du type de victoire qu'il est difficile pour les modèles isolés de simuler : le raisonnement visuel sur des documents structurés récompense le fait d'essayer une lecture, de la confronter au document, puis de réessayer — ce qui est exactement le rôle d'un Verifier. La même logique s'applique à Toolathon et DeepSWE, où la réponse peut être testée plutôt que discutée. Les études de cas publiées par Sakana vont dans le même sens : une exécution AutoResearch de 123 expériences sur quatorze heures sur un seul H100, un solveur de cube Rubik's en pur Python qui a terminé les 300 cubes mélangés là où deux baselines frontier anonymisées ont complètement planté, un iris de CAO mécanique qui s'ouvre et se ferme réellement. Ce sont des exemples choisis par le fournisseur, avec des baselines anonymisées, donc ils prouvent moins qu'ils n'en ont l'air. Mais le schéma est constant, et il désigne une catégorie bien réelle : les tâches dont l'exactitude est vérifiable et dont la difficulté réside dans la persévérance.

Il existe également un argument structurel qui n’a rien à voir avec les benchmarks. Claude Opus 5 est le modèle d’un seul fournisseur, soumis aux décisions de tarification, au calendrier de dépréciation et à la politique d’un seul fournisseur. Fugu Ultra v2 est conçu pour survivre à l’évolution de l’un quelconque de ces éléments, et Sakana affirme explicitement que c’est là tout l’enjeu : l’enfermement propriétaire, les révocations d’API, les contrôles à l’exportation. Dans un marché où des modèles ont été retirés de certaines régions avec peu de préavis, cela n’a rien d’hypothétique. C’est une couverture, et les couvertures coûtent de l’argent : 5 $ de plus par million de jetons de sortie, c’est à peu près le prix de cette couverture.

Le verdict

Claude Opus 5 remporte la décision que la plupart des équipes prennent en réalité. Il bénéficie de mois d’évaluation indépendante, d’une fenêtre de 1 M de tokens dont le prix ne double pas au milieu de votre document, d’un plafond de sortie de 128 K, d’un prix publié que vous pouvez prévoir, d’un réglage d’effort qui vous permet de n’acheter du raisonnement que lorsque la tâche le mérite, et de résultats tiers sur les benchmarks exacts — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — qui importent le plus aux équipes d’agents et de codage. Fugu Ultra v2 remporte une question plus étroite et plus intéressante : un coordinateur disposant d’un vivier plus restreint peut-il surpasser un modèle phare sur des tâches dont la réponse peut être vérifiée. Le propre tableau de bord de Sakana répond oui sur cinq des huit lignes, et l’exclusion du vivier indique que la victoire a été obtenue sans les trois meilleurs modèles du monde.

If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anth​ropic's list price with the provider's rate passed through untouched.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the endpoint list for /v1/chat/completions and /v1/messages, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the capability tags Vision, Tools, JSON and Reasoning, the 1M token context and 128K max output, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement