
Sakana Fugu Max: $2/$6-orkestreraren som väljer den billigaste modellen som fungerar
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
De flesta modeller tävlar om hur mycket de kan göra. Sakana Fugu Max tävlar om hur lite den kan komma undan med att göra. Sakana AI lanserade Sakana Fugu Max den 11 september 2026, tillsammans med Sakana Fugu Ultra v2 – två varianter av en och samma orkestreringsarkitektur, inriktade mot motsatta ändar av kostnads-prestandakurvan. Fugu Max svarar inte själv på din förfrågan. Den läser uppgiften, väljer den billigaste modellen i sin pool som rimligen kan hantera den, dirigerar dit och returnerar ett svar. Sakana prissätter den till $2 per miljon indatatoken och $6 per miljon utdatatoken.
Det intressanta är vad det priset mäts mot. Sakana hävdar att Fugu Max utdatapris ligger 40–60 % under Claude Sonnet 5, GPT-5.6 Terra och Kimi K3. Det påståendet går att kontrollera, och ovanligt nog för ett benchmark på lanseringsdagen håller aritmetiken: mot de aktuella listpriserna för de tre modeller som Sakana nämner hamnar $6 per miljon utdata nästan exakt i mitten av det angivna intervallet. Det som är mycket svårare att kontrollera är prestandasidan, eftersom Sakana publicerade Fugu Max resultat som spridningsdiagram i stället för siffror.
Vad Fugu Max faktiskt är
Fugu Max är inte en checkpoint. Det finns ingen viktsfil, inget parameterantal och inget att ladda ner. Sakana beskriver det som "en arkitektur, inte en enskild modell" — samma centrala orkestreringsmotor som Fugu Ultra v2, inställd för en annan fråga. Ultra v2 frågar vad den högsta tillgängliga kapaciteten är. Fugu Max frågar vad det bästa resultatet är till lägsta kostnad.
Den distinktionen har operativ betydelse. Du kan inte finjustera Fugu Max, hosta det själv eller undersöka varför det valde en modell framför en annan. Du kan inte heller se hela den uppsättning modeller som det routar över – Sakana säger att poolen utökas till "vår största pool av öppna och specialiserade modeller hittills" och nämner uttryckligen NVIDIAs Nemotron-familj, som lades till genom det NVIDIA-partnerskap som Sakana tillkännagav i augusti. De övriga modellerna i poolen är inte namngivna, och Sakana publicerar inte något routningsspår per förfrågan.
Det du kan se är sakens form. Leverantörens eget diagram visar Fugu Max högst upp i en fan-out: en orkestrerare, en rad utbytbara modellplatser bakom den, och Sakana Namazu och Fugu Max själv bland målen. Poolen beskrivs som utbytbar till sin konstruktion, och den angivna motivationen är lika mycket politisk som ekonomisk – Sakana framställer orkestrering som ett skydd mot leverantörsinlåsning, API-återkallningar och exportkontroller, med argumentet att ett system som kan byta ut sina leverantörer inte kan bli avskuret av någon enskild av dem.
Sakana Fugu i sig är inte nytt. Det blev allmänt tillgängligt den 22 juni 2026, och leverantörens egen tidslinje sträcker sig från april (beta), juni (GA plus Fugu Ultra v1), juli (Fugu-Cyber och ett Claude Code-gränssnitt), augusti (Sakana Chat plus NVIDIA-partnerskapet) och nu september. Fugu Max är det femte månatliga steget, inte en debut – och alla som redan kör Fugu uppgraderar till det med en enradig parameterändring mot samma OpenAI-kompatibla slutpunkt, ingen migrering.
Prispåståendet håller vid kontakt med listpriserna
Sakanas siffra på 2 dollar för indata / 6 dollar för utdata anges uttryckligen på lanseringssidan. Sekundär bevakning tillägger en cachad indata-kostnad på 0,25 dollar per miljon token, vilket lanseringssidan själv inte anger — behandla den som rapporterad snarare än bekräftad. Som jämförelse är Fugu Ultra v2 5 dollar för indata, 30 dollar för utdata, med 0,50 dollar för cachad indata.
Nu till påståendet om 40–60 %. De tre namngivna jämförelseobjekten ligger för närvarande på:
• GPT-5.6 Terra — $2 input / $12 output, efter att OpenAIs prissänkning den 30 juli sänkte outputpriset från $15.
• Claude Sonnet 5 — $10 för utdata till lanseringspriset, $15 till standardpriset. Källor är oeniga om huruvida den planerade septemberhöjningen skrotades eller bara sköts upp, vilket förklarar varför intervallet är brett.
• Kimi K3 — 3 USD för indata / 15 USD för utdata, med cachad indata för 0,30 USD.
Jämfört med dessa ligger $6 för utdata 50 % under Terra, 40 % under Sonnet 5:s kampanjpris, 60 % under Sonnet 5:s standardpris och 60 % under Kimi K3. Påståendet stämmer, och det stämmer mot publicerade listpriser snarare än en intern kostnadsmodell – vilket man inte kan säga om alla procentsatser som presenteras på lanseringsdagen.
Ett tal i samma avsnitt överlever inte samma behandling. Sakana säger också att Fugu Max levererar "prestanda inom räckhåll för elitmodeller till två till sex gånger lägre kostnad." Jämfört med de tre modeller den nämner för siffran 40–60 % ligger det råa gapet i utdatapris närmare 1,7× till 2,5×. Den bredare multiplikatorn mäts förmodligen över hela fronten – inklusive modeller som kostar långt mer än $12 – snarare än mot de tre i meningen. Det är ett försvarbart påstående om Pareto-kurvan och ett oförsvarbart om de namngivna rivalerna, och lanseringssidan skiljer inte mellan de två.
Det är här ett routningslager gör nytta på prissidan. OrcaRouter för vidare leverantörernas listpriser utan påslag, så när en leverantör ändrar listpriset ändras siffran du ser samma dag – relevant här eftersom hela premissen för Fugu Max är att en billigare modell finns någonstans i poolen och att du ska kunna nå den utan att tänka på det. Vi hostar inte Fugu Max; det körs på Sakanas eget API. Men principen med vidarebefordran är samma princip som gör att ett output-pris på $6 är värt att jämföra mot en etablerad leverantörs $12 i stället för att okritiskt lita på endera siffran.
Vad Sakana säger att det slår, och vad det inte visar dig

Leverantörens benchmarkavsnitt framför tre specifika påståenden för Fugu Max: bästa totalpoäng på sex benchmarks — Terminal Bench 2.1, GPQA-D, AA-LCR, GDP.pdf, AutomationBench och SWEFish — en utvidgning av Paretofronten för kostnad-prestanda på sju av tio benchmarks, och prestanda "inom räckhåll för elitmodeller" till en bråkdel av tokenkostnaden.
Tre saker om den bevisningen är värda att hålla fast vid innan du citerar något av den.
Det första är att Sakana inte publicerade några siffror. Fugu Max-resultaten visas som tio spridningsdiagram – poäng på den vertikala axeln, pris för utdata i dollar per miljon tokens på den horisontella – med Fugu Max ritad som en röd punkt nordväst om det grå fältet. Man kan se att den ligger uppe till vänster. Man kan inte utläsa någon poäng från den. Terminal Bench 2.1, GPQA-D och AA-LCR har alla offentliga resultattavlor där en siffra skulle vara direkt jämförbar, och ingen angavs.
Det andra är att ett av de sex riktmärkena är Sakanas eget. SWEFish beskrivs på lanseringssidan som "vårt interna riktmärke som speglar Sakana AI:s egna kodningsutmaningar och användningsfall." Det är ett legitimt sätt att mäta lämplighet för sin egen produkt, och det är inte ett sätt att jämföra sig mot en konkurrent – en poäng på ett riktmärke som leverantören har utformat, på uppgifter som leverantören har valt, är inte bevis om någon annans modell.
Det tredje är att de starkaste siffrorna på sidan tillhör den andra modellen. Fugu Ultra v2 får siffror där Fugu Max får diagram: Chartography 48,3 mot Opus 5 på 27,3 och Fable 5 på 29,5, DeepSWE 74,3, bäst eller delat bäst på fem av åtta benchmarks och topp två på sju av åtta. Ultra v2 har också en angiven träningsgräns på 2026-08-28 – drygt två veckor före lansering – och, med eftertryck, en explicit notering om att Fable 5, Fable 5.1 och GPT-6 Astra inte ingår i dess pool. Sakana hävdar att man kommer dit utan att hyra just dessa specifika modeller, vilket är hela suveränitetsargumentet i en enda fotnot.
Inget av detta gör påståendena om Fugu Max falska. Det gör dem overifierade, och det gör rubriken om de sex benchmarkarna säker att upprepa endast med etiketten bifogad. Oberoende utvärdering av en helt ny orkestreringsslutpunkt är sällsynt, och inget har publicerats ännu.
Fugu Max vs Fugu Ultra v2: vilken du faktiskt vill ha

Det här är inte konkurrerande produkter, och valet mellan dem är inte nära när man ser siffrorna sida vid sida. Fugu Max är den billiga: $2 in, $6 ut, byggd för att dirigera bort från dyra modeller när en billigare kan göra jobbet. Fugu Ultra v2 är den starka: $5 in, $30 ut, $0,50 cachad, byggd för att dirigera mot kapacitet vid komplexa flerstegsarbeten även när det kostar mer.
Den praktiska uppdelningen sker efter uppgiftens form, inte efter budget. Om din trafik mest består av uppslagningar, extraktion, klassificering, korta genereringar och enkla verktygsanrop, är hela Fugu Max konstruktion att lägga märke till det och spendera så lite som möjligt – och Sakanas påstående att den flyttar fram frontlinjen på sju av tio benchmarks handlar åtminstone i riktning om det. Om din trafik innehåller långa agentiska körningar, refaktoreringar över flera filer eller forskningsuppgifter som misslyckas dyrt när ett steg går fel, köper utdatapriset på $30 för Ultra v2 något verkligt: placeringen bland de två bästa på sju av åtta benchmarks är den del av lanseringssidan som mest liknar ett påstående om förmåga snarare än om kostnad.
Båda finns tillgängliga på samma OpenAI-kompatibla API via Sakanas konsol, och uppgraderingsvägen från befintlig Fugu är en parameterändring. Två tillgänglighetsförbehåll gäller. Fugu har rapporterats vara otillgänglig i EU och EES i väntan på GDPR-arbete, vilket, om det fortfarande gäller, begränsar var endera modellen kan driftsättas. Och båda är slutna system: du köper en endpoint, och leverantören väljer vilka modeller som ligger bakom den – inklusive, för Fugu Max, en förteckning som den inte fullt ut redovisar.
Haken: en orkestrerare som fortfarande hyr sin spjutspets
Den skarpaste kritiken av Fugu är den som Sakana bjuder in till genom att rama in det som suveränitetsinfrastruktur. Ett orkestreringslager som dirigerar trafik över tredjeparts-API:er hindrar inte att dessa API:er återkallas. Det omvandlar en enskild felpunkt till en diversifierad sådan, vilket är en verklig förbättring, men de underliggande modellerna tillhör fortfarande någon annan, nås fortfarande av samma exportkontroller och är fortfarande föremål för samma plötsliga tjänsteavbrott. NVIDIA-partnerskapet i augusti och Nemotron-tilläggen är det mest konkreta svaret på detta hittills – modeller med öppna vikter i poolen är modeller som ingen kan stänga av – men Sakana säger inte hur mycket av Fugu Max trafik som faktiskt landar på dem.
Det finns en andra, tystare avvägning. Routningsbeslut lägger till latens och tar bort determinism. En begäran som landar på en liten modell i dag kan landa på en annan i morgon om poolen eller kostnadsvikterna ändras, vilket gör beteendet svårare att regressionstesta och svårare att förklara för den som granskar systemet. Sakanas svar är att orkestreringen är intern och att API:et beter sig som en enda modell. Det är sant i gränssnittet men inte sant under ytan, och team med hårda krav på reproducerbarhet bör testa detta noggrant innan det blir bärande.
Om du vill få kostnadsvinsten utan att göra poolen till ditt enda beroende finns samma mönster tillgängligt för dig att sätta ihop själv. Vårt routing-DSL låter dig definiera en panel av modeller bakom en enda endpoint och bestämma vilken som hanterar vilken klass av förfrågningar, och modellfusion kör flera modeller på samma prompt och sammanjämkar svaren där samstämmighet är viktigare än pris. Failover mellan leverantörer innebär att när en leverantör försämras — eller försvinner — flyttas trafiken till en modell du redan litar på utan kodändring. Det är den mer konservativa versionen av vadet som Sakana ber dig att göra i sin helhet.

Det är värt att vara precis om vad vi erbjuder och inte erbjuder här. Sakana Fugu Max finns inte i vår katalog – det är inte en routbar modell hos oss, och den körs på Sakanas eget API och konsol. Vår katalog är 196 modeller från 15 leverantörer på en nyckel och en faktura, med priserna per token tryckta på varje kort och inget påslag ovanpå dem. Den relevanta överlappningen med Fugu Max är idén, inte sortimentet: båda är argument för att det rätta svaret på "vilken modell bör hantera detta" vanligtvis inte är den största.
Vem ska flytta, och vem ska vänta
Fugu Max är en av månadens mer intressanta lanseringar just för att den inte är en modell. Om du redan använder Sakana Fugu är uppgraderingen en ändring på en rad till ett lägre pris, och det finns ingen anledning att tveka. Om du kör högvolymtrafik med låg komplexitet på en mellanklassmodell och betalar $10–$15 per miljon output-tokens för den, är räkneexemplet Sakana erbjuder värt en egen benchmark — ta en vecka med riktiga förfrågningar, kör dem genom Fugu Max och jämför kvaliteten mot din nuvarande modell i stället för mot spridningsdiagrammen.
Om du behöver publicerade benchmarksiffror innan du bestämmer dig, vänta. Det finns ännu inget oberoende om Fugu Max, leverantörens eget underlag är ett diagram snarare än en tabell, och en av de sex främsta benchmarkarna är Sakanas. Det är inte ett skäl att avfärda den – det är ett skäl att testa den på din egen trafik, vilket är den enda benchmark som någonsin skulle kunna förutsäga dina resultat. Och om din arbetsbelastning är agentisk, långsiktig och dyr att få fel, är modellen att titta på i detta par Fugu Ultra v2, inte Fugu Max: det är den som har siffror kopplade till sig.
Vårt routing DSL låter dig definiera en panel av modeller bakom en slutpunkt och bestämma vilken som hanterar vilken klass av förfrågan, och modellfusion kör flera modeller på samma prompt och sammanjämkar svaren där samstämmighet är viktigare än pris.
