
Fugu Ultra v2 vs DeepSeek V4 Pro: frågan om 34x-priset för output
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Fugu Ultra v2 debiterar ungefär trettiofyra gånger listpriset för DeepSeek V4 Pro för texten den skriver. Det är inte ett stavfel och det är inte en avrundningsartefakt: Sakana AI:s nya orkestrator har ett listpris på 30,00 dollar per miljon utdatatokens, DeepSeek uppger 0,87 dollar per miljon, och på det enda benchmark där båda leverantörerna publicerar en siffra är prestandagapet inte i närheten av trettiofyra gånger. Sakana hävdar 74,3 på DeepSWE för Fugu Ultra v2, som släpptes den 11 september 2026; DeepSeek uppger 62,7 för DeepSeek V4 Pro, den modell med öppna vikter som DeepSeek släppte i augusti. Ett leverantörsrapporterat försprång på 11,6 punkter för ett utpris som är 34 gånger högre är hela jämförelsen i en enda rad — och den ärliga frågan är inte huruvida Fugu Ultra v2 är bättre, utan huruvida den är nitton dollar per miljon tokens bättre, och för vem.
Två svar på samma problem, byggda från motsatta ändar
DeepSeek V4 Pro och Fugu Ultra v2 är båda svar på samma oro – beroendet av en enda sluten leverantör i framkant – och de kunde knappast vara mer olika i metod.
DeepSeek V4 Pro är en modell. Lanseringsbevakningen daterar den officiella versionens API-utrullning – bygget DeepSeek-V4-Pro-0813 – till omkring 12–13 augusti 2026, och ersätter förhandsversionen från 24 april. Det är ett mixture-of-experts-system som uppges ha 1,5 till 1,6 biljoner parametrar totalt, varav cirka 49 miljarder aktiveras per token, med ett kontextfönster på 1M tokens och en maximal utdata på 384K tokens. Det resonerar i tänkande och icke-tänkande lägen med tre ansträngningsnivåer, talar både OpenAI- och Anthropic-API-protokollen och har lagt till ett inbyggt Responses-API som riktar sig direkt mot Codex-liknande agentramverk. Avgörande är att vikterna publicerades under MIT, vilket innebär att argumentet om motståndskraft avgörs genom innehav: ingen kan återkalla din kopia.
Fugu Ultra v2 är inte en modell. Det är en tränad koordinator, uppges ha omkring 7B parametrar, som delar upp en förfrågan över en pool av hemlighetshållna modeller, tilldelar rollerna Tänkare, Arbetare och Verifierare samt syntetiserar ett svar bakom en OpenAI-kompatibel endpoint. Dess resiliensargument är arkitektoniskt snarare än juridiskt: eftersom poolen är utbytbar kan systemet överleva att vilken enskild leverantör som helst ändrar villkoren. Version 2.0, som släpptes tillsammans med Fugu Max, flyttade träningsavskärningen till den 28 augusti 2026 och — noterbart — tog bort Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra helt från poolen samtidigt som man fortfarande hävdade segrar över dem.
Så jämförelsen är innehav kontra samordning. DeepSeek ger dig en modell som du kan ladda ner, granska, finjustera och köra själv till vilken marginal din egen hårdvara tillåter. Sakana ger dig ett system som bestämmer hur varje problem ska angripas, till ett pris som finansierar att köra flera frontiermodeller åt dig.

Vad 34x faktiskt köper
Benchmarks först, med källhänvisningen i fokus. Varje DeepSeek-siffra nedan är leverantörens egen och är från före den revidering av prissättningen för hög- och lågtrafik som DeepSeek aviserade för mitten av augusti, vars slutliga siffror källorna fortfarande inte är överens om — en rapport anger topputmatning till nära ¥27 per miljon, en annan till nära ¥12, mot en bas på ¥6. Verifiera mot DeepSeeks publicerade prislista innan du tar fram en budgetmodell. Varje Fugu-siffra är Sakanas egen, och ingen oberoende part har reproducerat någon av dem; det finns fortfarande ingen Artificial Analysis-post för en Fugu-modell.
• DeepSWE — Fugu Ultra v2 74,3 (enligt leverantören) vs DeepSeek V4 Pro 62,7 (enligt leverantören)
• Terminal Bench 2.1 — ingen siffra för Fugu Ultra v2 publicerad av Sakana jämfört med DeepSeek V4 Pro 87,9 (enligt leverantören)
• SWE-bench (Vals) — ingen siffra för Fugu Ultra v2 mot DeepSeek V4 Pro 96.4 (leverantörsuppgiven)
• Humanity's Last Exam — ingen siffra för Fugu Ultra v2 v2.0 jämfört med DeepSeek V4 Pro 42,7 utan verktyg, 60,0 med verktyg (enligt leverantören)
• GPQA Diamond — ingen siffra för Fugu Ultra v2 v2.0 mot DeepSeek V4 Pro 92.8 (enligt leverantören)
• Pris för utdata — Fugu Ultra v2 $30.00 per 1M, stiger till $45.00 över 272K kontext jämfört med DeepSeek V4 Pro cirka $0.87 per 1M i listpris, med en mätbaserad taxa som har legat högre
Två förbehåll om den prisraden, eftersom hela jämförelsen vilar på den. För det första är DeepSeeks siffra listpriset som rapporterades i lanseringsbevakningen och upprepades i vår egen modellbeskrivning, men den uppmätta taxan i vår listning har legat på $2.18 per miljon output och $0.73 per miljon input – cachebeteende och mix förskjuter det effektiva talet, så den ärliga multipeln ligger någonstans mellan ungefär 14x och ungefär 34x beroende på hur mycket av din input som cachas. Även vid den nedre gränsen av det intervallet kostar output mer än tolv gånger så mycket. För det andra har DeepSeek redan aviserat en översyn av prissättningen för högtrafik/lågtrafik, där källor fortfarande är oense om de slutliga siffrorna – en rapport anger output under högtrafik till nära ¥27 per miljon, en annan till nära ¥12, mot en bas på ¥6. Verifiera mot den publicerade prislistan innan du modellerar en budget.
• Inpris — Fugu Ultra v2 $5.00 per 1M, fördubblas över 272K jämfört med DeepSeek V4 Pro cirka $0.435 per 1M vid cachemiss, ungefär 120x billigare vid cacheträff
• Vikter — Fugu Ultra v2 stängd, pool ej offentliggjord, routing inte avsiktligt exponerad vs DeepSeek V4 Pro öppen under MIT, självhostbar
• Kontext och utdata – Fugu Ultra v2 1M kontext, utdatatak ej offentliggjort jämfört med DeepSeek V4 Pro 1M kontext, 384K utdatatak
Överlappningsproblemet är uppenbart: de två systemen förekommer knappt på samma rader. Sakana publicerar fem vinster av åtta benchmarks som det valt ut; DeepSeek publicerar en bredare resultattavla som inkluderar djupgående agentisk täckning — MCP Atlas 73,6, Toolathlon-Verified 74,1, CyberGym 83,3, NL2Repo 61,5, CorpusQA 62,0 på lång kontext — där Fugu Ultra v2 inte har något publicerat nummer alls. Den enda rad du kan matcha, DeepSWE, är den där Fugu hävdar sin största mjukvarutekniska fördel. En läsare som jämför de två utgåvorna jämför två olika prov.
Utförlighetsmultiplikatorn
Utdatapriset är inte en linjär skatt på orkestrering; det är en multiplikator på en kvantitet som orkestrering ökar. Fugu Ultra v2 skapar agenter, som var och en producerar resonemangs- och utdatatokens, innan en koordinator syntetiserar dem. Sakanas pris-FAQ ger ett genuint konsumentvänligt åtagande – du betalar en enda blandad taxa baserad på toppmodellen i poolen, och att lägga till agenter multiplicerar inte räkningen – vilket sätter ett tak för det värsta fallet. Det sätter inte ett tak för volymen. Vid $30 per miljon utdatatokens kostar en multiagentkörning som avger fyra gånger så mycket text som ett anrop med en enda modell fyra gånger så mycket, och multiplikatorn förstärks av en utdatahastighet som är 34 gånger högre.
Kostnadsprofilen för DeepSeek V4 Pro belönar motsatt beteende. En cacheträff på indata är ungefär två storleksordningar billigare än en miss, vilket gör upprepat långkontextarbete – samma kodarkiv, samma dokumentuppsättning, samma systemprompt – dramatiskt mycket billigare än vad listpriset antyder. För en agentloop som läser samma kontext varje tur är det där den effektiva kostnaden hamnar, och det är en strukturell fördel som ingen orkestrator kan kringgå.
Lägger man ihop de två blir beslutet konkret. Om Fugu Ultra v2 ger en DeepSWE-fördel på 11,6 punkter och avger tre gånger så många utdatatokener som ett enda anrop, betalar du ungefär hundra gånger mer per slutförd uppgift för en ökning på tio till femton punkter på ett enda benchmark. Den avvägningen är försvarbar för forskning och irreducerbart svåra ingenjörsproblem där den marginella poängen är hela spelet, och oförsvarbar för en pipeline som körs hundra tusen gånger om dagen.

Vem var och en faktiskt är till för
Välj DeepSeek V4 Pro om något av följande stämmer: din arbetsbelastning är högvolym och kostnadskänslig; du behöver utdata längre än det tak en orchestrator ger dig; du behöver ett system som du kan granska, finjustera eller serva på din egen hårdvara av skäl som rör dataplacering; eller du behöver att priset är en siffra du kan beräkna snarare än en siffra du observerar. Den öppna MIT-licensen är inte en marknadsföringsfunktion – den är den starkaste formen av resiliensargument som något av systemen framför, eftersom den inte är beroende av någon leverantörs fortsatta välvilja. Den är dessutom, på ungefär 0,87 USD per miljon utdata, billig nog att experimenterande inte kostar något.
Välj Fugu Ultra v2 om marginalpoängen är värd en multipel, arbetet har lång horisont och korrektheten är kontrollerbar — kodning med en testsvit, strukturerat dokumentresonemang, flerstegsanalys där en Verifier-roll kan fånga ett fel som ett enda pass skulle ha skickat ut. Sakanas egna fallstudier pekar på exakt detta: en fjorton timmar lång autonom forskningskörning, en Rubiks-kublösare som klarade alla 300 blandningar där två anonymiserade baslinjer kraschade fullständigt. Ha i åtanke att dessa baslinjer är anonymiserade och utvalda av leverantören, vilket försvagar dem som bevis och inte gör dem falska. Tänk också på begränsningen som avslutar diskussionen för vissa team: Fugu Ultra v2 säljs inte i EU eller EES, och Sakana säger det rakt ut.
En praktisk notering om du tänker köra någon av dem. Fugu Ultra v2 finns inte på OrcaRouter – den kommer via Sakanas eget OpenAI-kompatibla API och flera tredjepartsplattformar, och att uppgradera från en tidigare Fugu är en parameterändring på en enda rad. DeepSeek V4 Pro finns på OrcaRouter till leverantörens listpris med 0 % påslag, vilket spelar större roll här än vanligt: DeepSeek har redan aviserat en prisändring den här cykeln, och på en pass-through-router träder en leverantörsprisändring i kraft på samma nyckel samma dag i stället för efter en omförhandling. Om du vill benchmarka båda mot din egen arbetsbelastning innan du binder dig, är den billigare sidan av jämförelsen den du kan anropa till listpris med automatisk failover bakom den.

Domen
Detta är inte en jämn matchning ekonomiskt och inte en avgörande kapacitetsmässigt. DeepSeek V4 Pro är det bättre standardvalet med bred marginal: öppna vikter du kan hålla i, ett tak på 384K utdata, en kontext på 1M, publicerade resultat för lång kontext och ett pris som är ungefär en trettiofjärdedel av Fugu Ultra v2:s för utdata. Fugu Ultra v2 är det bättre instrumentet för en snäv klass av dyra problem, och Sakanas påstående – att en fast pool som utesluter de tre starkaste modellerna fortfarande kan slå dem på verifierbart arbete – är det mest intressanta arkitektoniska argumentet inom fältet just nu, och det med minst oberoende bevisning bakom sig.
Den praktiska lösningen är inte att välja. Kör DeepSeek V4 Pro som standard eftersom den är billig, öppen och snabb, och håll Fugu Ultra v2 i reserv för de uppgifter där en hundrafaldig kostnadsökning ändå är mindre än kostnaden för att ha fel. Vad du inte bör göra är att läsa Sakanas tavla med åtta benchmarkar som bevis för att den dyra orkestratorn har ersatt den billiga öppna modellen. På den enda rad de delar ligger den 11,6 punkter före för 34 gånger utdatapriset. Huruvida det är ett kap eller en fälla beror helt och hållet på vilket problem du riktar det mot.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
