Ett hero-titelkort för "Fugu Max vs DeepSeek V4 Pro" med underrubriken "Den kostnadsoptimerade är den dyra", tre pillerformade märken med texterna "$6.00 vs $2.18 utdata", "1.6T MoE, 49B aktiva", "384K utdatatak", en sidfotsrad med texten "Sakana AI vs DeepSeek - September 2026", och OrcaRouter-logotypen i det nedre högra hörnet.
Engineering & Research

Fugu Max vs DeepSeek V4 Pro: den kostnadsoptimerade är den dyra

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Fugu Max är byggd för att vara det billiga alternativet, och DeepSeek V4 Pro slår den ändå på pris. Sakana AI släppte Fugu Max den 11 september 2026 till $2.00 per miljon indatatokens och $6.00 per miljon utdatatokens, och positionerade den som en koordinator som expanderar kostnads-prestanda-fronten genom att dirigera varje uppgift till den mest resurssnåla modellen i sin pool. DeepSeek V4 Pro, listad sedan april 2026, ligger på $0.73 för indata och $2.18 för utdata per miljon enligt OrcaRouters mätaravgift — ungefär en tredjedel av vad Fugu Max tar på båda axlarna, från en enda mixture-of-experts-modell med öppna vikter, 384K i utdatatak och inget orkestreringslager alls. Den inversionen är hela jämförelsen. Allt annat med det här paret är en fråga om vad orkestrering ger dig när baslinjen du försöker underbjuda redan är billigare än du.

Två sätt att sänka en räkning, och ett av dem är redan lägre

Sakanas argument för Fugu Max är att en koordinator kan minska utgifterna genom att inte betala frontierpriser för uppgifter som inte kräver frontierkapacitet. Det är ett välgrundat argument. Problemet är modellen som argumentet riktas mot. DeepSeek V4 Pro är en mixture-of-experts-modell med 1,6 biljoner parametrar och 49 miljarder aktiva parametrar per token, vilket är samma kostnadsreducerande idé utförd en nivå ned — du betalar för de parametrar en token faktiskt aktiverar, inte för nätverkets storlek. Båda produkterna är svar på frågan "hur slutar vi betala för kapacitet vi inte använder". En av dem tar 2,18 dollar per miljon utdatatokens för privilegiet.

• Indatapris — Fugu Max $2.00 per 1 miljon tokens mot DeepSeek V4 Pro $0.73 per 1 miljon tokens, mätarbaserat

• Pris för utdata — Fugu Max $6,00 per 1 miljon tokens mot DeepSeek V4 Pro $2,18 per 1 miljon tokens, mätbaserat

• Cachad indata — Fugu Max 0,25 USD per 1 miljon tokens mot DeepSeek V4 Pro:s indata vid cacheträff, prissatt långt under dess baspris, med leverantörens publicerade listpris som ligger under 1,00 USD per 1 miljon

• Kontext — Fugu Max inte publicerad jämfört med DeepSeek V4 Pro 1M tokens

• Tak för utdata — Fugu Max ej publicerat vs DeepSeek V4 Pro 384K tokens

• Modalitet — Fugu Max inte publicerad jämfört med DeepSeek V4 Pro endast text, med verktygsanvändning, JSON-läge och resonemang

• Arkitektur — Fugu Max, en tränad koordinator över en icke avslöjad pool, kontra DeepSeek V4 Pro, en enskild MoE-modell med härstamning från öppna vikter

• Benchmark-siffror — Fugu Max sex vinster hävdas utan poäng mot DeepSeek V4 Pro:s leverantörsrapporterade 87,9 på Terminal Bench 2.1, 92,8 på GPQA Diamond, 96,4 på SWE-bench Vals

Ett nummer i den listan förtjänar att plockas ut. Deep​Seek rapporterar 87,9 på Terminal Bench 2.1. Fugu Max hävdar "bästa totalresultat" på Terminal Bench 2.1. Samma benchmark, samma lanseringsfönster, ena sidan publicerar en siffra och den andra publicerar ordet "bäst." Det är den enskilt tydligaste illustrationen av bevisasymmetrin i detta par, och det är inte en detalj – det är hela anledningen till att prisskillnaden inte är slutet på argumentet.

A two-column scoreboard titled "Fugu Max vs DeepSeek V4 Pro - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Cached input $0.25 / 1M, Context not published, Terminal Bench 2.1 best overall with no figure, Weights closed and pool undisclosed. Right column DeepSeek V4 Pro: Output price $2.18 / 1M, Input price $0.73 / 1M, Cached input below base rate, Context 1M tokens, Terminal Bench 2.1 87.9, Weights open-weights lineage. Footer reading "Fugu Max rows vendor-reported by Sakana AI with no scores published; DeepSeek rows vendor-reported, metered rate on OrcaRouter.", with the OrcaRouter logo bottom-right.

Vad orkestrering ger när baslinjen redan är billig

Argumentet för att betala mer för Fugu Max måste vila på arbete som en enskild modell hanterar dåligt, och det finns en verklig kategori av sådant. Uppgifter med lång tidshorisont där ett felsteg förvärras — refaktoreringar över flera filer, förändringar i repositoriskala, allt där en verifierare som kontrollerar arbetarens utdata är värd mer än en starkare arbetare — är precis vad ett Thinker/Worker/Verifier-upplägg är till för. Sakanas egen formulering för Fugu-serien är att det är billigare att fånga ett misstag i en andra omgång än att få det rätt första gången. På sådana uppgifter kan ett utdata-pris på $6.00 som blir klart i ett försök slå ett pris på $2.18 som kräver tre.

Det argumentet har en testbar form och Sakana har inte kört det offentligt. Jämförelsen du skulle vilja ha är kostnad per slutförd uppgift i ett benchmark som båda systemen försöker sig på — Terminal Bench 2.1 finns ju där, det är agentiskt och terminalbaserat till sin konstruktion, och bara en av de två leverantörerna har publicerat en siffra för det. Tills den luckan stängs är den ärliga hållningen att Fugu Maxs kostnadsfördel hävdas på tokennivå och är obevisad på uppgiftsnivå, medan DeepSeek V4 Pros är enkel: själva tokens kostar en tredjedel så mycket.

Det finns en poäng av andra ordningen om poolens sammansättning som är viktigare för den här matchen än för de flesta. Poolen hos Fugu Max utökades i den här utgåvan till att omfatta öppna vikter och specialiserade modeller, med NVIDIA Nemotron-familjen namngiven genom ett samarbete med NVIDIA. Öppna vikter i poolen innebär att det billigaste steget på Sakanas stege inte är utsatt för ett annat labs prissättningsbeslut. DeepSeek V4 Pro, som själv har öppna vikter, är inte utsatt för någon annans prissättningsbeslut än DeepSeeks – och det är steget. Resiliensargumentet som Sakana för fram för orkestrering gäller DeepSeek direkt och det underliggande utbudet hos Fugu Max bara indirekt.

Cachning är där agentarbetsbelastningar faktiskt blir dyra

Ingen av leverantörernas baspriser är det pris som en agentloop betalar. Långa agentkörningar skickar om ett stort, mestadels oföränderligt prefix vid varje tur, och cachens träfffrekvens är det som avgör den verkliga räkningen. Fugu Max anger cachad indata till 0,25 USD per miljon, vilket är en äkta och aggressiv siffra – en åttondel av dess eget baspris för indata. DeepSeek V4 Pro prissätter cacheträffad indata långt under sin publicerade basnivå, och dess utdatapris är satt till ungefär tre gånger indata i stället för det fyra- till femfaldiga förhållande som de flesta leverantörer använder, vilket särskilt pressar kostnaden för genereringstunga loopar.

Det du inte kan göra idag är att beräkna jämförelsen på ett tillförlitligt sätt utifrån någon av leverantörernas prislistor, eftersom Fugu Maxs cachade taxa gäller ett antal tokens som du inte kan förutse. En orkestrator avgör hur många agenter som körs; varje agents kontext bidrar; koordinatorn lägger till sin egen. Sakanas prisåtagande för Fugu-linjen – en sammanslagen taxa baserad på den deltagande modellen på högsta nivån, där agenter inte staplar kostnaden – tar bort värsta scenariot, vilket är en verklig eftergift och värd att erkänna. Det gör inte volymen förutsägbar i förväg. DeepSeek V4 Pro:s faktura är en funktion av tokens du skickar och tokens du tar emot, och inget annat.

Den förutsägbarheten är lika mycket en routningsegenskap som en modellegenskap. DeepSeek V4 Pro finns på OrcaRouter till leverantörens listpris med 0 % påslag, så en prisändring från Deep​Seek når din befintliga nyckel samma dag i stället för vid din nästa avtalsförnyelse, och automatisk failover skyddar dig när en leverantörsväg är hastighetsbegränsad. Den sista delen väger ovanligt tungt just för den här modellen: Deep​Seek har redan ändrat sin prissättning en gång under den här cykeln, med topp- och lågtrafiknivåer vars slutliga siffror varierar mellan källor. När en leverantörs prislista ändras är routern skillnaden mellan att absorbera förändringen och att upptäcka den på en faktura.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Vad vi inte kunde verifiera

Tre saker i Fugu Max-versionen kunde inte kontrolleras mot något utanför Sakanas egna material, och de tas upp här i stället för att slätas över. För det första: de sex benchmark-vinsterna saknar siffror — Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench och SWEFish anges som vinster utan att några poäng bifogas, och SWEFish är Sakanas interna benchmark. För det andra: Fugu Max kontextfönster, utmatningstak och stödda modaliteter är inte publicerade, så raderna ovan för modalitet och tak jämför en levererad specifikation mot tystnad. För det tredje: det finns ingen oberoende utvärdering av någon Fugu-modell, och det finns ingen Artificial Analysis-post för Fugu Max.

För DeepSeek V4 Pro är situationen den omvända. Leverantören rapporterar en lång lista med siffror – Terminal Bench 2.1 87,9, GPQA Diamond 92,8, SWE-bench Vals 96,4, HLE 42,7 och 60,0 i två konfigurationer, MCP Atlas 73,6, Toolathlon-Verified 74,1, CyberGym 83,3 – och alla är också leverantörsrapporterade. Skillnaden är inte att den ena leverantören är mer trovärdig. Den är att när båda sidor publicerar siffror är oenighet möjlig, och en oenighet kan undersökas. Ett påstående utan siffra kan inte kontrolleras, bara accepteras eller ignoreras.

Ett ytterligare förbehåll om Deep​Seek-prissättningen ovan: vår egen modellsida anger två siffror, en mätbaserad avgift på $0.73 för input och $2.18 för output per miljon i prisrutorna och en äldre beskrivning av $0.44 för input och $0.87 för output per miljon. Deep​Seek har också annonserat hög- och lågtrafiknivåer där källorna inte är eniga om de slutliga priserna. Betrakta $0.73 och $2.18 som den avgift du faktiskt kommer att faktureras via oss i dag och bekräfta mot den publicerade prislistan innan du bygger en budget på det.

Slutsats

DeepSeek V4 Pro vinner den här jämförelsen på de villkor som Fugu Max valde. Den är billigare för indata och utdata, har ett publicerat kontextfönster och ett tak på 384K för utdata, rapporterar ett verkligt tal på det benchmark som Fugu Max påstår sig leda, och dess härkomst är open-weights, vilket är den starkaste tillgängliga formen av argumentet för leverantörsoberoende som Sakana säljer. Om din arbetsbelastning är tokenintensiv och din prioritet är den lägsta försvarbara kostnaden per token från en modell som du kan låsa, är detta inte ens nära.

Fugu Max vinner på en snävare fråga som DeepSeek V4 Pro inte alls besvarar: huruvida en koordinator som sätter samman sitt eget agentteam kan slutföra svårt arbete med lång tidshorisont i färre försök än en enskild modell. Det är värt att pilottesta om du har kontrollerbart, feltolerant arbete och befinner dig utanför EU/EES. Kostnadsberäkna det utifrån tokens per slutförd uppgift, sätt ett tak först och jämför det med DeepSeek V4 Pro-slutpunkten på OrcaRouter till leverantörens listpris — en nyckel, 0 % påslag, och en taxa som följer leverantörens egen.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, captured September 11, 2026, English UI), showing the FLAGSHIP and Featured badges, the deepseek/deepseek-v4-pro model ID, the Tools, JSON and Reasoning tags, the listing date 2026-04-24, the /v1/chat/completions and /v1/responses endpoints, the pricing tiles reading INPUT $0.73 and OUTPUT $2.18 per 1M tokens with p50 TTFT 919ms and 6,313.7M tokens of 7-day traffic, the 1M token context with 384K max output and text-only input, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen