
Fugu Max vs DeepSeek V4 Pro: den kostnadsoptimerade är den dyra
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Fugu Max är byggd för att vara det billiga alternativet, och DeepSeek V4 Pro slår den ändå på pris. Sakana AI släppte Fugu Max den 11 september 2026 till $2.00 per miljon indatatokens och $6.00 per miljon utdatatokens, och positionerade den som en koordinator som expanderar kostnads-prestanda-fronten genom att dirigera varje uppgift till den mest resurssnåla modellen i sin pool. DeepSeek V4 Pro, listad sedan april 2026, ligger på $0.73 för indata och $2.18 för utdata per miljon enligt OrcaRouters mätaravgift — ungefär en tredjedel av vad Fugu Max tar på båda axlarna, från en enda mixture-of-experts-modell med öppna vikter, 384K i utdatatak och inget orkestreringslager alls. Den inversionen är hela jämförelsen. Allt annat med det här paret är en fråga om vad orkestrering ger dig när baslinjen du försöker underbjuda redan är billigare än du.
Två sätt att sänka en räkning, och ett av dem är redan lägre
Sakanas argument för Fugu Max är att en koordinator kan minska utgifterna genom att inte betala frontierpriser för uppgifter som inte kräver frontierkapacitet. Det är ett välgrundat argument. Problemet är modellen som argumentet riktas mot. DeepSeek V4 Pro är en mixture-of-experts-modell med 1,6 biljoner parametrar och 49 miljarder aktiva parametrar per token, vilket är samma kostnadsreducerande idé utförd en nivå ned — du betalar för de parametrar en token faktiskt aktiverar, inte för nätverkets storlek. Båda produkterna är svar på frågan "hur slutar vi betala för kapacitet vi inte använder". En av dem tar 2,18 dollar per miljon utdatatokens för privilegiet.
• Indatapris — Fugu Max $2.00 per 1 miljon tokens mot DeepSeek V4 Pro $0.73 per 1 miljon tokens, mätarbaserat
• Pris för utdata — Fugu Max $6,00 per 1 miljon tokens mot DeepSeek V4 Pro $2,18 per 1 miljon tokens, mätbaserat
• Cachad indata — Fugu Max 0,25 USD per 1 miljon tokens mot DeepSeek V4 Pro:s indata vid cacheträff, prissatt långt under dess baspris, med leverantörens publicerade listpris som ligger under 1,00 USD per 1 miljon
• Kontext — Fugu Max inte publicerad jämfört med DeepSeek V4 Pro 1M tokens
• Tak för utdata — Fugu Max ej publicerat vs DeepSeek V4 Pro 384K tokens
• Modalitet — Fugu Max inte publicerad jämfört med DeepSeek V4 Pro endast text, med verktygsanvändning, JSON-läge och resonemang
• Arkitektur — Fugu Max, en tränad koordinator över en icke avslöjad pool, kontra DeepSeek V4 Pro, en enskild MoE-modell med härstamning från öppna vikter
• Benchmark-siffror — Fugu Max sex vinster hävdas utan poäng mot DeepSeek V4 Pro:s leverantörsrapporterade 87,9 på Terminal Bench 2.1, 92,8 på GPQA Diamond, 96,4 på SWE-bench Vals
Ett nummer i den listan förtjänar att plockas ut. DeepSeek rapporterar 87,9 på Terminal Bench 2.1. Fugu Max hävdar "bästa totalresultat" på Terminal Bench 2.1. Samma benchmark, samma lanseringsfönster, ena sidan publicerar en siffra och den andra publicerar ordet "bäst." Det är den enskilt tydligaste illustrationen av bevisasymmetrin i detta par, och det är inte en detalj – det är hela anledningen till att prisskillnaden inte är slutet på argumentet.

Vad orkestrering ger när baslinjen redan är billig
Argumentet för att betala mer för Fugu Max måste vila på arbete som en enskild modell hanterar dåligt, och det finns en verklig kategori av sådant. Uppgifter med lång tidshorisont där ett felsteg förvärras — refaktoreringar över flera filer, förändringar i repositoriskala, allt där en verifierare som kontrollerar arbetarens utdata är värd mer än en starkare arbetare — är precis vad ett Thinker/Worker/Verifier-upplägg är till för. Sakanas egen formulering för Fugu-serien är att det är billigare att fånga ett misstag i en andra omgång än att få det rätt första gången. På sådana uppgifter kan ett utdata-pris på $6.00 som blir klart i ett försök slå ett pris på $2.18 som kräver tre.
Det argumentet har en testbar form och Sakana har inte kört det offentligt. Jämförelsen du skulle vilja ha är kostnad per slutförd uppgift i ett benchmark som båda systemen försöker sig på — Terminal Bench 2.1 finns ju där, det är agentiskt och terminalbaserat till sin konstruktion, och bara en av de två leverantörerna har publicerat en siffra för det. Tills den luckan stängs är den ärliga hållningen att Fugu Maxs kostnadsfördel hävdas på tokennivå och är obevisad på uppgiftsnivå, medan DeepSeek V4 Pros är enkel: själva tokens kostar en tredjedel så mycket.
Det finns en poäng av andra ordningen om poolens sammansättning som är viktigare för den här matchen än för de flesta. Poolen hos Fugu Max utökades i den här utgåvan till att omfatta öppna vikter och specialiserade modeller, med NVIDIA Nemotron-familjen namngiven genom ett samarbete med NVIDIA. Öppna vikter i poolen innebär att det billigaste steget på Sakanas stege inte är utsatt för ett annat labs prissättningsbeslut. DeepSeek V4 Pro, som själv har öppna vikter, är inte utsatt för någon annans prissättningsbeslut än DeepSeeks – och det är steget. Resiliensargumentet som Sakana för fram för orkestrering gäller DeepSeek direkt och det underliggande utbudet hos Fugu Max bara indirekt.
Cachning är där agentarbetsbelastningar faktiskt blir dyra
Ingen av leverantörernas baspriser är det pris som en agentloop betalar. Långa agentkörningar skickar om ett stort, mestadels oföränderligt prefix vid varje tur, och cachens träfffrekvens är det som avgör den verkliga räkningen. Fugu Max anger cachad indata till 0,25 USD per miljon, vilket är en äkta och aggressiv siffra – en åttondel av dess eget baspris för indata. DeepSeek V4 Pro prissätter cacheträffad indata långt under sin publicerade basnivå, och dess utdatapris är satt till ungefär tre gånger indata i stället för det fyra- till femfaldiga förhållande som de flesta leverantörer använder, vilket särskilt pressar kostnaden för genereringstunga loopar.
Det du inte kan göra idag är att beräkna jämförelsen på ett tillförlitligt sätt utifrån någon av leverantörernas prislistor, eftersom Fugu Maxs cachade taxa gäller ett antal tokens som du inte kan förutse. En orkestrator avgör hur många agenter som körs; varje agents kontext bidrar; koordinatorn lägger till sin egen. Sakanas prisåtagande för Fugu-linjen – en sammanslagen taxa baserad på den deltagande modellen på högsta nivån, där agenter inte staplar kostnaden – tar bort värsta scenariot, vilket är en verklig eftergift och värd att erkänna. Det gör inte volymen förutsägbar i förväg. DeepSeek V4 Pro:s faktura är en funktion av tokens du skickar och tokens du tar emot, och inget annat.
Den förutsägbarheten är lika mycket en routningsegenskap som en modellegenskap. DeepSeek V4 Pro finns på OrcaRouter till leverantörens listpris med 0 % påslag, så en prisändring från DeepSeek når din befintliga nyckel samma dag i stället för vid din nästa avtalsförnyelse, och automatisk failover skyddar dig när en leverantörsväg är hastighetsbegränsad. Den sista delen väger ovanligt tungt just för den här modellen: DeepSeek har redan ändrat sin prissättning en gång under den här cykeln, med topp- och lågtrafiknivåer vars slutliga siffror varierar mellan källor. När en leverantörs prislista ändras är routern skillnaden mellan att absorbera förändringen och att upptäcka den på en faktura.

Vad vi inte kunde verifiera
Tre saker i Fugu Max-versionen kunde inte kontrolleras mot något utanför Sakanas egna material, och de tas upp här i stället för att slätas över. För det första: de sex benchmark-vinsterna saknar siffror — Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench och SWEFish anges som vinster utan att några poäng bifogas, och SWEFish är Sakanas interna benchmark. För det andra: Fugu Max kontextfönster, utmatningstak och stödda modaliteter är inte publicerade, så raderna ovan för modalitet och tak jämför en levererad specifikation mot tystnad. För det tredje: det finns ingen oberoende utvärdering av någon Fugu-modell, och det finns ingen Artificial Analysis-post för Fugu Max.
För DeepSeek V4 Pro är situationen den omvända. Leverantören rapporterar en lång lista med siffror – Terminal Bench 2.1 87,9, GPQA Diamond 92,8, SWE-bench Vals 96,4, HLE 42,7 och 60,0 i två konfigurationer, MCP Atlas 73,6, Toolathlon-Verified 74,1, CyberGym 83,3 – och alla är också leverantörsrapporterade. Skillnaden är inte att den ena leverantören är mer trovärdig. Den är att när båda sidor publicerar siffror är oenighet möjlig, och en oenighet kan undersökas. Ett påstående utan siffra kan inte kontrolleras, bara accepteras eller ignoreras.
Ett ytterligare förbehåll om DeepSeek-prissättningen ovan: vår egen modellsida anger två siffror, en mätbaserad avgift på $0.73 för input och $2.18 för output per miljon i prisrutorna och en äldre beskrivning av $0.44 för input och $0.87 för output per miljon. DeepSeek har också annonserat hög- och lågtrafiknivåer där källorna inte är eniga om de slutliga priserna. Betrakta $0.73 och $2.18 som den avgift du faktiskt kommer att faktureras via oss i dag och bekräfta mot den publicerade prislistan innan du bygger en budget på det.
Slutsats
DeepSeek V4 Pro vinner den här jämförelsen på de villkor som Fugu Max valde. Den är billigare för indata och utdata, har ett publicerat kontextfönster och ett tak på 384K för utdata, rapporterar ett verkligt tal på det benchmark som Fugu Max påstår sig leda, och dess härkomst är open-weights, vilket är den starkaste tillgängliga formen av argumentet för leverantörsoberoende som Sakana säljer. Om din arbetsbelastning är tokenintensiv och din prioritet är den lägsta försvarbara kostnaden per token från en modell som du kan låsa, är detta inte ens nära.
Fugu Max vinner på en snävare fråga som DeepSeek V4 Pro inte alls besvarar: huruvida en koordinator som sätter samman sitt eget agentteam kan slutföra svårt arbete med lång tidshorisont i färre försök än en enskild modell. Det är värt att pilottesta om du har kontrollerbart, feltolerant arbete och befinner dig utanför EU/EES. Kostnadsberäkna det utifrån tokens per slutförd uppgift, sätt ett tak först och jämför det med DeepSeek V4 Pro-slutpunkten på OrcaRouter till leverantörens listpris — en nyckel, 0 % påslag, och en taxa som följer leverantörens egen.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
