Ett hero-titelkort för Fugu Ultra v2 mot Claude Opus 5 med underrubriken "Samma indatapris, två olika satsningar", pillerformade etiketter med texten "$5.00 indata båda", "Chartography 48.3 vs 27.3" och "1M kontext", en sidfotsrad "Sakana AI vs Anthropic – september 2026", samt OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

Fugu Ultra v2 vs Claude Opus 5: samma indatapris, två olika satsningar

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anth​ropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.

Sammanträffandet som formar allt

Börja med vad de två produkterna är överens om, för det är mer än rubrikpriset.

• Indatapris — Fugu Ultra v2 $5.00 per 1 miljon tokens jämfört med Claude Opus 5 $5.00 per 1 miljon tokens

• Pris för utdata — Fugu Ultra v2 $30.00 per 1 miljon tokens jämfört med Claude Opus 5 $25.00 per 1 miljon tokens

• Cachad indata — Fugu Ultra v2 0,50 $ per 1M utöver baspriset jämfört med Claude Opus 5, som prissätter cachning som en rabatt på upp till 90 % på cachad indata

• Kontext — Fugu Ultra v2 1M tokens, med priser som fördubblas över 272K, jämfört med Claude Opus 5 1M tokens, som är oförändrade

• Utdatatak — Fugu Ultra v2 publiceras inte som en enskild siffra jämfört med Claude Opus 5 128K tokens

• Tillgänglighet — Fugu Ultra v2 säljs inte i EU/EES jämfört med Claude Opus 5 som är allmänt tillgänglig enligt standardvillkoren för API:et

• Underlag — Fugu Ultra v2:s leverantörsrapporterade benchmarks, ingen oberoende utvärdering ännu, jämfört med Claude Opus 5:s benchmarks från leverantören plus månader av tredjepartsplaceringar på leaderboards

Den sista raden är där matchningen faktiskt vänder. Vid samma indatapris väljer du mellan ett system vars resultat du måste ta på tro och en modell vars resultat andra har reproducerat. 272K-klippan förvärrar det: bortom den tröskeln fördubblas Fugu Ultra v2:s indatapris till $10 och utdatapriset till $45, medan Claude Opus 5:s pris inte rör sig. För agentkörningar med lång kontext – den exakta arbetsbelastning som Fugu Ultra v2 är byggd för – försvinner prisfördelen med det billigare rubrikpriset precis där systemet är tänkt att glänsa.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Vad var och en faktiskt är

Claude Opus 5 is Anth​ropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anth​ropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.

Fugu Ultra v2 är inte det, och skillnaden är inte kosmetisk. Det är en koordinator – en liten tränad modell, som uppges ha omkring 7B parametrar, som läser din begäran, sätter samman ett agentteam, tilldelar rollerna Thinker, Worker och Verifier från Sakanas TRINITY-arbete och syntetiserar ett slutligt svar. De underliggande modellerna avslöjas inte, routningsbesluten exponeras inte av design, och för Ultra-nivån är poolen fast: du kan inte välja bort en leverantör. Sakanas egen beskrivning av version 2 är att träningsavskärningen flyttades till den 28 augusti 2026 och att poolens sammansättning ändrades – specifikt för att utesluta Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra.

Den uteslutningen är den mest avslöjande detaljen i lanseringen. Fugu Ultra v2 hävdar benchmarksegrar över de tre starkaste tillgängliga modellerna samtidigt som man bekräftar att man inte anropar någon av dem. Vad poolen än innehåller är den inte marknadens topp enligt Sakanas egen redovisning. Pitchen är att samordning slår förmåga. Det är en verklig tes, och på verifierbara uppgifter med en billig kontrollmekanism är det en tes med bevis bakom sig. Det är inte samma påstående som "det här systemet är smartare än Claude Opus 5", och resultattavlan är upplagd så att de två lätt förväxlas.

Resultattavlan som Sakana valde

Alla siffror nedan kommer från Sakanas egen utvärdering av Fugu Ultra v2. Claude Opus 5:s siffror är mätta av Sakana i samma jämförelse, utom där annat anges. Ingen oberoende part har reproducerat Fugu-kolumnen, och i skrivande stund finns det ingen Artificial Analysis-post för någon Fugu-modell.

• Chartography — Fugu Ultra v2 48,3 mot Claude Opus 5 27,3 — enligt leverantören, en skillnad på 21 punkter

• DeepSWE – Fugu Ultra v2 74,3 mot ingen publicerad siffra för Claude Opus 5 i samma tabell – enligt leverantören

• Benchmarkplacering — Fugu Ultra v2 bäst eller delat bäst på fem av åtta, bland de två bästa på sju av åtta — enligt leverantören

• SWE-bench Verified — ingen siffra för Fugu Ultra v2 mot Claude Opus 5 96,0 % — rapporterat av Anthropic

• SWE-bench Pro — ingen siffra för Fugu Ultra v2 jämfört med Claude Opus 5:s 79,2 % — enligt Anthropic

• ARC-AGI 3 — ingen siffra för Fugu Ultra v2 mot Claude Opus 5 ~30,2 % — rapporterat av Anthropic

Läs det som en form snarare än en rangordning. Sakana publicerade en resultattavla med åtta benchmarks där den vinner fem, och Claude Opus 5:s starkaste offentligt dokumenterade resultat – SWE-bench-raderna, ARC-AGI 3 – finns helt enkelt inte med på den. Det är inte en anklagelse om ond tro; det är så en leverantörs resultattavla ser ut, inklusive varje leverantörs. Men det betyder att du inte kan dra slutsatsen från lanseringen att Fugu Ultra v2 slår Claude Opus 5 inom programvaruteknik, eftersom de två systemen inte mättes på samma rader tillräckligt ofta för att man ska kunna säga det. På den enda rad där båda förekommer och båda siffrorna är offentliga – Chartography – hävdar Fugu Ultra v2 en stor vinst. På de bredaste raderna för resonemang och kodning har bara en sida publicerat.

A two-column scoreboard for Fugu Ultra v2 vs Claude Opus 5 titled 'Fugu Ultra v2 vs Claude Opus 5 - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Chartography 48.3, Evidence vendor-reported only, Weights closed, pool undisclosed, Context 1M, doubles past 272K. Right column Claude Opus 5: Input price $5.00 / 1M, Output price $25.00 / 1M, Chartography 27.3, Evidence independent evals, Weights closed, single model, Context 1M, flat. Footer 'Fugu figures vendor-reported by Sakana; Opus 5 rows as measured by Sakana, plus Anthropic-reported evals.', with the OrcaRouter logo bottom-right.

Kostnad per uppgift, inte kostnad per token

En orkestrators tokenräkning är inte dess pris per token. Fugu Ultra v2 startar agenter, som var och en bidrar med resonemangs- och utdatatokens, och koordinatorn själv producerar syntestext. Sakanas pris-FAQ gör ett genuint användbart åtagande här – du debiteras en sammanvägd taxa baserad på den toppmodell som ingår, och att lägga till agenter multiplicerar inte räkningen – vilket tar bort den värsta fan-out-multipliceringen som gör naiva multiagent-uppsättningar dyra. Men det tar inte bort volymen. Mängden fakturerade utdatatokens är fortfarande en funktion av hur många agenter som kördes och hur mycket de skrev, och vid $30 per miljon är den volymen variabeln du inte kan förutsäga från prissidan.

Claude Opus 5:s kostnadsprofil är den omvända. Ett anrop, en modell, en ratt för ansträngning som du styr, och en utdatakostnad på $25 med batchbearbetning tillgänglig med 50 % rabatt för arbete som inte sker i realtid. Du kan prognostisera den. För en arbetsbelastning som du kör tio tusen gånger om dagen är prognostiserbarhet värt mycket mer än en benchmarkmarginal på en diagramläsningsuppgift.

This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anth​ropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.

Där Fugu Ultra v2 verkligen vinner

Ge systemet vad det förtjänar. Chartography-resultatet, om det håller, är den typ av vinst som enskilda modeller har svårt att fejka: visuellt resonemang över strukturerade dokument belönar att prova en tolkning, kontrollera den mot dokumentet och försöka igen – vilket är precis vad en Verifier-roll är till för. Samma logik gäller Toolathon och DeepSWE, där svaret kan testas i stället för att argumentera om det. Sakanas publicerade fallstudier pekar i samma riktning: en AutoResearch-körning med 123 experiment under fjorton timmar på en H100, en Rubiks-kubslösare i ren Python som löste alla 300 blandade kuber där två anonymiserade frontier-baslinjer kraschade helt, en mekanisk CAD-iris som faktiskt öppnas och stängs. Dessa är leverantörsvalda exempel med anonymiserade baslinjer, så de bevisar mindre än de verkar göra. Men mönstret är konsekvent, och det pekar på en verklig kategori: uppgifter där korrekthet är kontrollerbar och det svåra är uthållighet.

Det finns också ett strukturellt argument som inte har något med benchmarks att göra. Claude Opus 5 är en enda leverantörs modell och lyder under samma leverantörs prissättningsbeslut, utfasningsschema och policy. Fugu Ultra v2 är utformad för att överleva förändringar i vilken som helst av dessa, och Sakana är tydlig med att det är själva poängen – leverantörsinlåsning, API-återkallanden, exportkontroller. På en marknad där modeller har dragits tillbaka från regioner med kort varsel är det inte en hypotetisk fråga. Det är en säkring, och säkringar kostar pengar: $5 mer per miljon utdatatoken är ungefär vad den här säkringen prissätts till.

Domen

Claude Opus 5 vinner det beslut som de flesta team faktiskt fattar. Bakom sig har den månader av oberoende utvärdering, ett 1M-token-fönster som inte fördubblas i pris en bit in i ditt dokument, ett utdatatak på 128K, ett publicerat pris du kan förutse, en ratt för ansträngningsnivå som låter dig köpa resonemang bara när uppgiften förtjänar det, och tredjepartsresultat på exakt de benchmarks – SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 – som agentiska och kodande team bryr sig mest om. Fugu Ultra v2 vinner en snävare och mer intressant fråga: huruvida en koordinator med en mindre pool kan överträffa en flaggskeppsmodell på uppgifter där svaret kan kontrolleras. Sakanas egen resultattavla säger ja på fem av åtta rader, och pooluteslutningen säger att vinsten kom utan de tre bästa modellerna i världen.

If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anth​ropic's list price with the provider's rate passed through untouched.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the endpoint list for /v1/chat/completions and /v1/messages, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the capability tags Vision, Tools, JSON and Reasoning, the 1M token context and 128K max output, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen