
Fugu Ultra v2 vs Claude Opus 5: samma indatapris, två olika satsningar
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anthropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.
Sammanträffandet som formar allt
Börja med vad de två produkterna är överens om, för det är mer än rubrikpriset.
• Indatapris — Fugu Ultra v2 $5.00 per 1 miljon tokens jämfört med Claude Opus 5 $5.00 per 1 miljon tokens
• Pris för utdata — Fugu Ultra v2 $30.00 per 1 miljon tokens jämfört med Claude Opus 5 $25.00 per 1 miljon tokens
• Cachad indata — Fugu Ultra v2 0,50 $ per 1M utöver baspriset jämfört med Claude Opus 5, som prissätter cachning som en rabatt på upp till 90 % på cachad indata
• Kontext — Fugu Ultra v2 1M tokens, med priser som fördubblas över 272K, jämfört med Claude Opus 5 1M tokens, som är oförändrade
• Utdatatak — Fugu Ultra v2 publiceras inte som en enskild siffra jämfört med Claude Opus 5 128K tokens
• Tillgänglighet — Fugu Ultra v2 säljs inte i EU/EES jämfört med Claude Opus 5 som är allmänt tillgänglig enligt standardvillkoren för API:et
• Underlag — Fugu Ultra v2:s leverantörsrapporterade benchmarks, ingen oberoende utvärdering ännu, jämfört med Claude Opus 5:s benchmarks från leverantören plus månader av tredjepartsplaceringar på leaderboards
Den sista raden är där matchningen faktiskt vänder. Vid samma indatapris väljer du mellan ett system vars resultat du måste ta på tro och en modell vars resultat andra har reproducerat. 272K-klippan förvärrar det: bortom den tröskeln fördubblas Fugu Ultra v2:s indatapris till $10 och utdatapriset till $45, medan Claude Opus 5:s pris inte rör sig. För agentkörningar med lång kontext – den exakta arbetsbelastning som Fugu Ultra v2 är byggd för – försvinner prisfördelen med det billigare rubrikpriset precis där systemet är tänkt att glänsa.

Vad var och en faktiskt är
Claude Opus 5 is Anthropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anthropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.
Fugu Ultra v2 är inte det, och skillnaden är inte kosmetisk. Det är en koordinator – en liten tränad modell, som uppges ha omkring 7B parametrar, som läser din begäran, sätter samman ett agentteam, tilldelar rollerna Thinker, Worker och Verifier från Sakanas TRINITY-arbete och syntetiserar ett slutligt svar. De underliggande modellerna avslöjas inte, routningsbesluten exponeras inte av design, och för Ultra-nivån är poolen fast: du kan inte välja bort en leverantör. Sakanas egen beskrivning av version 2 är att träningsavskärningen flyttades till den 28 augusti 2026 och att poolens sammansättning ändrades – specifikt för att utesluta Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra.
Den uteslutningen är den mest avslöjande detaljen i lanseringen. Fugu Ultra v2 hävdar benchmarksegrar över de tre starkaste tillgängliga modellerna samtidigt som man bekräftar att man inte anropar någon av dem. Vad poolen än innehåller är den inte marknadens topp enligt Sakanas egen redovisning. Pitchen är att samordning slår förmåga. Det är en verklig tes, och på verifierbara uppgifter med en billig kontrollmekanism är det en tes med bevis bakom sig. Det är inte samma påstående som "det här systemet är smartare än Claude Opus 5", och resultattavlan är upplagd så att de två lätt förväxlas.
Resultattavlan som Sakana valde
Alla siffror nedan kommer från Sakanas egen utvärdering av Fugu Ultra v2. Claude Opus 5:s siffror är mätta av Sakana i samma jämförelse, utom där annat anges. Ingen oberoende part har reproducerat Fugu-kolumnen, och i skrivande stund finns det ingen Artificial Analysis-post för någon Fugu-modell.
• Chartography — Fugu Ultra v2 48,3 mot Claude Opus 5 27,3 — enligt leverantören, en skillnad på 21 punkter
• DeepSWE – Fugu Ultra v2 74,3 mot ingen publicerad siffra för Claude Opus 5 i samma tabell – enligt leverantören
• Benchmarkplacering — Fugu Ultra v2 bäst eller delat bäst på fem av åtta, bland de två bästa på sju av åtta — enligt leverantören
• SWE-bench Verified — ingen siffra för Fugu Ultra v2 mot Claude Opus 5 96,0 % — rapporterat av Anthropic
• SWE-bench Pro — ingen siffra för Fugu Ultra v2 jämfört med Claude Opus 5:s 79,2 % — enligt Anthropic
• ARC-AGI 3 — ingen siffra för Fugu Ultra v2 mot Claude Opus 5 ~30,2 % — rapporterat av Anthropic
Läs det som en form snarare än en rangordning. Sakana publicerade en resultattavla med åtta benchmarks där den vinner fem, och Claude Opus 5:s starkaste offentligt dokumenterade resultat – SWE-bench-raderna, ARC-AGI 3 – finns helt enkelt inte med på den. Det är inte en anklagelse om ond tro; det är så en leverantörs resultattavla ser ut, inklusive varje leverantörs. Men det betyder att du inte kan dra slutsatsen från lanseringen att Fugu Ultra v2 slår Claude Opus 5 inom programvaruteknik, eftersom de två systemen inte mättes på samma rader tillräckligt ofta för att man ska kunna säga det. På den enda rad där båda förekommer och båda siffrorna är offentliga – Chartography – hävdar Fugu Ultra v2 en stor vinst. På de bredaste raderna för resonemang och kodning har bara en sida publicerat.

Kostnad per uppgift, inte kostnad per token
En orkestrators tokenräkning är inte dess pris per token. Fugu Ultra v2 startar agenter, som var och en bidrar med resonemangs- och utdatatokens, och koordinatorn själv producerar syntestext. Sakanas pris-FAQ gör ett genuint användbart åtagande här – du debiteras en sammanvägd taxa baserad på den toppmodell som ingår, och att lägga till agenter multiplicerar inte räkningen – vilket tar bort den värsta fan-out-multipliceringen som gör naiva multiagent-uppsättningar dyra. Men det tar inte bort volymen. Mängden fakturerade utdatatokens är fortfarande en funktion av hur många agenter som kördes och hur mycket de skrev, och vid $30 per miljon är den volymen variabeln du inte kan förutsäga från prissidan.
Claude Opus 5:s kostnadsprofil är den omvända. Ett anrop, en modell, en ratt för ansträngning som du styr, och en utdatakostnad på $25 med batchbearbetning tillgänglig med 50 % rabatt för arbete som inte sker i realtid. Du kan prognostisera den. För en arbetsbelastning som du kör tio tusen gånger om dagen är prognostiserbarhet värt mycket mer än en benchmarkmarginal på en diagramläsningsuppgift.
This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anthropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.
Där Fugu Ultra v2 verkligen vinner
Ge systemet vad det förtjänar. Chartography-resultatet, om det håller, är den typ av vinst som enskilda modeller har svårt att fejka: visuellt resonemang över strukturerade dokument belönar att prova en tolkning, kontrollera den mot dokumentet och försöka igen – vilket är precis vad en Verifier-roll är till för. Samma logik gäller Toolathon och DeepSWE, där svaret kan testas i stället för att argumentera om det. Sakanas publicerade fallstudier pekar i samma riktning: en AutoResearch-körning med 123 experiment under fjorton timmar på en H100, en Rubiks-kubslösare i ren Python som löste alla 300 blandade kuber där två anonymiserade frontier-baslinjer kraschade helt, en mekanisk CAD-iris som faktiskt öppnas och stängs. Dessa är leverantörsvalda exempel med anonymiserade baslinjer, så de bevisar mindre än de verkar göra. Men mönstret är konsekvent, och det pekar på en verklig kategori: uppgifter där korrekthet är kontrollerbar och det svåra är uthållighet.
Det finns också ett strukturellt argument som inte har något med benchmarks att göra. Claude Opus 5 är en enda leverantörs modell och lyder under samma leverantörs prissättningsbeslut, utfasningsschema och policy. Fugu Ultra v2 är utformad för att överleva förändringar i vilken som helst av dessa, och Sakana är tydlig med att det är själva poängen – leverantörsinlåsning, API-återkallanden, exportkontroller. På en marknad där modeller har dragits tillbaka från regioner med kort varsel är det inte en hypotetisk fråga. Det är en säkring, och säkringar kostar pengar: $5 mer per miljon utdatatoken är ungefär vad den här säkringen prissätts till.
Domen
Claude Opus 5 vinner det beslut som de flesta team faktiskt fattar. Bakom sig har den månader av oberoende utvärdering, ett 1M-token-fönster som inte fördubblas i pris en bit in i ditt dokument, ett utdatatak på 128K, ett publicerat pris du kan förutse, en ratt för ansträngningsnivå som låter dig köpa resonemang bara när uppgiften förtjänar det, och tredjepartsresultat på exakt de benchmarks – SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 – som agentiska och kodande team bryr sig mest om. Fugu Ultra v2 vinner en snävare och mer intressant fråga: huruvida en koordinator med en mindre pool kan överträffa en flaggskeppsmodell på uppgifter där svaret kan kontrolleras. Sakanas egen resultattavla säger ja på fem av åtta rader, och pooluteslutningen säger att vinsten kom utan de tre bästa modellerna i världen.
If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anthropic's list price with the provider's rate passed through untouched.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
