Een hero-titelkaart voor Fugu Ultra v2 vs Claude Opus 5 met de ondertitel 'Dezelfde invoerprijs, twee verschillende weddenschappen', pill-badges met de tekst '$5,00 invoer voor beide', 'Chartography 48,3 vs 27,3' en '1M-context', een voettekstregel 'Sakana AI vs Anthropic - September 2026', en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Fugu Ultra v2 vs Claude Opus 5: dezelfde invoerprijs, twee verschillende weddenschappen

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anth​ropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.

Het toeval dat alles vormt

Begin met waar de twee producten het over eens zijn, want dat is meer dan de geadverteerde prijs.

• Invoerprijs — Fugu Ultra v2 $5,00 per 1 mln. tokens vs Claude Opus 5 $5,00 per 1 mln. tokens

• Uitvoerprijs — Fugu Ultra v2 $30,00 per 1 mln tokens vs. Claude Opus 5 $25,00 per 1 mln tokens

• Gecachte invoer — Fugu Ultra v2 $0,50 per 1 miljoen boven het basistarief versus Claude Opus 5, dat caching prijst als een korting van maximaal 90% op gecachte invoer

• Context — Fugu Ultra v2 1M tokens, met tarieven die boven 272K verdubbelen, tegenover Claude Opus 5 1M tokens, vast

• Outputplafond — Fugu Ultra v2 niet als één enkel getal gepubliceerd vs. Claude Opus 5 128K tokens

• Beschikbaarheid — Fugu Ultra v2 niet verkocht in de EU/EER vs Claude Opus 5 algemeen beschikbaar onder standaard API-voorwaarden

• Bewijs — door de leverancier gerapporteerde benchmarks voor Fugu Ultra v2, nog geen onafhankelijke evaluatie, tegenover leveranciersbenchmarks voor Claude Opus 5 plus maanden aan posities op leaderboards van derden.

Die laatste rij is waar de vergelijking pas echt kantelt. Bij dezelfde invoerprijs kies je tussen een systeem waarvan je de scores op goed vertrouwen moet aannemen en een model waarvan anderen de scores hebben gereproduceerd. De 272K-cliff verergert dat nog: voorbij die drempel verdubbelt het invoertarief van Fugu Ultra v2 naar $10 en het uitvoertarief naar $45, terwijl het tarief van Claude Opus 5 niet verandert. Voor agent-runs met een lange context — precies de workload waarvoor Fugu Ultra v2 is gebouwd — verdwijnt het prijsvoordeel van de lagere headline-prijs precies daar waar het systeem zou moeten uitblinken.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Wat elk daadwerkelijk is

Claude Opus 5 is Anth​ropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anth​ropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.

Fugu Ultra v2 is dat niet, en het verschil is niet cosmetisch. Het is een coördinator — een klein getraind model, naar verluidt rond de 7B parameters, dat je verzoek leest, een agententeam samenstelt, de rollen Thinker, Worker en Verifier toewijst op basis van Sakana's TRINITY-werk, en een eindantwoord synthetiseert. De onderliggende modellen worden niet bekendgemaakt, de routeringsbeslissingen worden bewust niet blootgelegd, en voor de Ultra-tier ligt de pool vast: je kunt een leverancier niet uitsluiten. Sakana's eigen framing van versie 2 is dat de trainingsafsluitdatum is opgeschoven naar 28 augustus 2026 en dat de samenstelling van de pool is gewijzigd — specifiek om Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra uit te sluiten.

Die uitsluiting is het meest onthullende detail in de release. Fugu Ultra v2 claimt benchmarkoverwinningen op de drie sterkste beschikbare modellen, terwijl het bevestigt dat het geen van hen aanroept. Wat de pool ook bevat, volgens Sakana's eigen berekening is het niet de top van de markt. De propositie is dat coördinatie capaciteit verslaat. Dat is een echte these, en bij verifieerbare taken met een goedkope checker is het een these met bewijs erachter. Het is niet dezelfde bewering als "dit systeem is slimmer dan Claude Opus 5", en het scorebord is zo ingericht dat de twee makkelijk te verwarren zijn.

Het scorebord dat Sakana koos

Elk getal hieronder is afkomstig uit Sakana's eigen evaluatie van Fugu Ultra v2. De cijfers van Claude Opus 5 zijn zoals gemeten door Sakana in dezelfde vergelijking, tenzij anders vermeld. Geen enkele onafhankelijke partij heeft de Fugu-kolom gereproduceerd, en op het moment van schrijven bestaat er geen Artificial Analysis-vermelding voor welk Fugu-model dan ook.

• Chartography — Fugu Ultra v2 48,3 versus Claude Opus 5 27,3 — volgens opgave van de leverancier, een verschil van 21 punten

• DeepSWE — Fugu Ultra v2 74,3 vs. geen gepubliceerd cijfer voor Claude Opus 5 in dezelfde tabel — door de leverancier gerapporteerd

• Benchmarkpositie — Fugu Ultra v2 het beste of gedeeld beste op vijf van de acht, in de top twee op zeven van de acht — volgens opgave van de leverancier

• SWE-bench Verified — geen cijfer voor Fugu Ultra v2 vs. Claude Opus 5 96,0% — door Anthropic gerapporteerd

• SWE-bench Pro — geen cijfer voor Fugu Ultra v2 vs. Claude Opus 5 79,2% — door Anthropic gerapporteerd

• ARC-AGI 3 — geen cijfer voor Fugu Ultra v2 vs. Claude Opus 5 ~30,2% — door Anthropic gerapporteerd

Lees dat als een vorm, niet als een rangschikking. Sakana heeft een scorebord met acht benchmarks gepubliceerd waarop het vijf keer wint, en de sterkste openbaar gedocumenteerde resultaten van Claude Opus 5 — de SWE-bench-rijen, ARC-AGI 3 — staan er simpelweg niet op. Dat is geen beschuldiging van kwade trouw; zo ziet een leveranciersscorebord eruit, ook dat van elke leverancier. Maar het betekent dat je uit de release niet kunt concluderen dat Fugu Ultra v2 Claude Opus 5 verslaat op software-engineering, omdat de twee systemen niet vaak genoeg op dezelfde rijen zijn gemeten om dat te kunnen zeggen. Op de ene rij waar beide op voorkomen en beide cijfers openbaar zijn — Chartography — claimt Fugu Ultra v2 een grote overwinning. Op de breedste rijen voor redeneren en coderen heeft slechts één kant gepubliceerd.

A two-column scoreboard for Fugu Ultra v2 vs Claude Opus 5 titled 'Fugu Ultra v2 vs Claude Opus 5 - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Chartography 48.3, Evidence vendor-reported only, Weights closed, pool undisclosed, Context 1M, doubles past 272K. Right column Claude Opus 5: Input price $5.00 / 1M, Output price $25.00 / 1M, Chartography 27.3, Evidence independent evals, Weights closed, single model, Context 1M, flat. Footer 'Fugu figures vendor-reported by Sakana; Opus 5 rows as measured by Sakana, plus Anthropic-reported evals.', with the OrcaRouter logo bottom-right.

Kosten per taak, niet per token

De tokenrekening van een orchestrator is niet zijn tarief per token. Fugu Ultra v2 start agents, die elk redeneer- en uitvoertokens bijdragen, en de coördinator zelf produceert synthesetekst. Sakana's FAQ over prijsstelling doet hier een oprecht nuttige toezegging — je betaalt één gemengd tarief op basis van het betrokken topmodel, en het toevoegen van agents vermenigvuldigt de rekening niet — wat de vermenigvuldiging bij fan-out in het slechtste geval wegneemt die naïeve multi-agentopstellingen duur maakt. Maar het neemt het volume niet weg. De hoeveelheid gefactureerde uitvoertokens is nog steeds een functie van hoeveel agents er draaiden en hoeveel ze schreven, en bij $30 per miljoen is dat volume de variabele die je niet kunt voorspellen op basis van de prijspagina.

De kostenstructuur van Claude Opus 5 is het omgekeerde. Eén aanroep, één model, een effort-dial die je zelf bepaalt, en een outputtarief van $25, met batchverwerking beschikbaar tegen 50% korting voor niet-realtime werk. Je kunt het voorspellen. Voor een workload die je tienduizend keer per dag draait, is voorspelbaarheid veel meer waard dan een benchmarkmarge bij een grafiekleestaak.

This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anth​ropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.

Waar Fugu Ultra v2 echt wint

Geef het systeem de eer die het toekomt. Het Chartography-resultaat, als het standhoudt, is het soort overwinning dat individuele modellen moeilijk kunnen faken: visueel redeneren over gestructureerde documenten beloont het proberen van een interpretatie, die tegen het document controleren en het opnieuw proberen — precies waar een Verifier-rol voor bedoeld is. Dezelfde logica geldt voor Toolathon en DeepSWE, waar het antwoord kan worden getest in plaats van bediscussieerd. Sakana's gepubliceerde casestudies wijzen dezelfde kant op: een AutoResearch-run van 123 experimenten gedurende veertien uur op één H100, een Rubik's kubusoplosser in pure Python die alle 300 door elkaar geschudde kubussen oploste, terwijl twee geanonimiseerde frontier-baselines volledig crashten, en een mechanische CAD-iris die daadwerkelijk opent en sluit. Dit zijn door de leverancier geselecteerde voorbeelden met geanonimiseerde baselines, dus ze bewijzen minder dan ze doen voorkomen. Maar het patroon is consistent, en het wijst op een echte categorie: taken waarbij correctheid controleerbaar is en het moeilijke deel volharding is.

Er is ook een structureel argument dat niets met benchmarks te maken heeft. Claude Opus 5 is het model van één leverancier, onderworpen aan de prijsbeslissingen, het uitfaseringsschema en het beleid van die ene leverancier. Fugu Ultra v2 is ontworpen om te overleven dat een van die zaken verandert, en Sakana zegt expliciet dat dit het punt is: vendor lock-in, API-intrekkingen, exportcontroles. In een markt waar modellen met weinig voorafgaande kennisgeving uit regio's zijn teruggetrokken, is dat geen hypothetisch scenario. Het is een hedge, en hedges kosten geld: $5 meer per miljoen outputtokens is ongeveer de prijs van deze hedge.

Het vonnis

Claude Opus 5 wint de beslissing die de meeste teams feitelijk nemen. Het heeft maanden van onafhankelijke evaluatie achter zich, een venster van 1M tokens dat niet halverwege je document in prijs verdubbelt, een uitvoerplafond van 128K, een gepubliceerde prijs die je kunt voorspellen, een inspanningsknop waarmee je alleen redeneervermogen koopt wanneer de taak het verdient, en resultaten van derden op precies de benchmarks — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — die agentische en codeerteams het belangrijkst vinden. Fugu Ultra v2 wint een nauwere en interessantere vraag: of een coördinator met een kleinere pool een vlaggenschipmodel kan overtreffen bij taken waarop het antwoord te controleren valt. Sakana's eigen scorebord zegt ja op vijf van de acht rijen, en de uitsluiting van de pool zegt dat de overwinning werd behaald zonder de drie beste modellen ter wereld.

If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anth​ropic's list price with the provider's rate passed through untouched.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the endpoint list for /v1/chat/completions and /v1/messages, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the capability tags Vision, Tools, JSON and Reasoning, the 1M token context and 128K max output, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt