Een hero-titelkaart voor "Fugu Max vs DeepSeek V4 Pro" met de ondertitel "De kosten-geoptimaliseerde is de dure", drie pill-badges met de tekst "$6.00 vs $2.18 output", "1.6T MoE, 49B actief", "384K output-plafond", een voettekst met "Sakana AI vs DeepSeek - september 2026", en het OrcaRouter-logo in de rechteronderhoek.
Engineering & Research

Fugu Max vs DeepSeek V4 Pro: de op kosten geoptimaliseerde is de dure

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Fugu Max is gebouwd om de goedkope optie te zijn, en DeepSeek V4 Pro verslaat het toch op prijs. Sakana AI bracht Fugu Max uit op 11 september 2026 voor $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens, en positioneert het als een coördinator die de kosten-prestatiegrens verlegt door elke taak naar het zuinigste model in zijn pool te routeren. DeepSeek V4 Pro, dat sinds april 2026 op de lijst staat, zit op $0,73 input en $2,18 output per miljoen tegen het gemeten tarief van OrcaRouter — ongeveer een derde van wat Fugu Max op beide assen in rekening brengt, vanuit één enkel open-weights mixture-of-experts-model met een outputplafond van 384K en helemaal geen orchestratielaag. Die omkering is de hele vergelijking. Al het andere aan dit paar is een vraag over wat orchestratie je oplevert wanneer de baseline die je probeert te onderbieden al goedkoper is dan jij.

Twee manieren om een rekening te verlagen, en één ervan is al lager.

Het argument van Sakana voor Fugu Max is dat een coördinator kosten kan verlagen door geen frontier-prijzen te betalen voor taken die geen frontier-capaciteit nodig hebben. Het is een degelijk argument. Het probleem is het model waartegen het wordt gemaakt. DeepSeek V4 Pro is een mixture-of-experts met 1,6 biljoen parameters, waarvan per token 49 miljard parameters actief zijn — hetzelfde kostenbesparingsidee, maar dan één niveau lager uitgevoerd: je betaalt voor de parameters die een token daadwerkelijk activeert, niet voor de omvang van het netwerk. Beide producten zijn antwoorden op de vraag: "hoe stoppen we met betalen voor capaciteit die we niet gebruiken?" Een van beide rekent $2,18 per miljoen outputtokens voor dat voorrecht.

• Invoerprijs — Fugu Max $2,00 per 1 miljoen tokens versus DeepSeek V4 Pro $0,73 per 1 miljoen tokens, gemeten

• Uitvoerprijs — Fugu Max $6,00 per 1 mln tokens vs DeepSeek V4 Pro $2,18 per 1 mln tokens, afgerekend naar verbruik

• Gecachte invoer — Fugu Max $0,25 per 1 miljoen tokens vs. de cache-hit-invoer van DeepSeek V4 Pro, die ver onder zijn basistarief ligt, terwijl het gepubliceerde lijsttarief van de leverancier onder $1,00 per 1 miljoen ligt

• Context — Fugu Max niet gepubliceerd vs DeepSeek V4 Pro 1M tokens

• Uitvoerplafond — Fugu Max niet gepubliceerd vs DeepSeek V4 Pro 384K tokens

• Modaliteit — Fugu Max niet gepubliceerd vs DeepSeek V4 Pro alleen tekst, met toolgebruik, JSON-modus en redenering

• Architectuur — Fugu Max, een getrainde coördinator over een niet bekendgemaakte pool, tegenover DeepSeek V4 Pro, één enkel MoE-model, open-weights-afstamming

• Benchmarkcijfers — Fugu Max: zes overwinningen geclaimd zonder scores, tegenover DeepSeek V4 Pro met door de leverancier gerapporteerde 87,9 op Terminal Bench 2.1, 92,8 op GPQA Diamond en 96,4 op SWE-bench Vals

Eén getal in die lijst verdient het om eruit gelicht te worden. Deep​Seek rapporteert 87,9 op Terminal Bench 2.1. Fugu Max claimt "beste algehele score" op Terminal Bench 2.1. Dezelfde benchmark, hetzelfde releasevenster, de ene kant publiceert een cijfer en de andere publiceert het woord "beste." Dat is de zuiverste illustratie van de bewijasymmetrie in dit paar, en het is geen detail — het is de hele reden dat het prijsverschil niet het einde van het argument is.

A two-column scoreboard titled "Fugu Max vs DeepSeek V4 Pro - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Cached input $0.25 / 1M, Context not published, Terminal Bench 2.1 best overall with no figure, Weights closed and pool undisclosed. Right column DeepSeek V4 Pro: Output price $2.18 / 1M, Input price $0.73 / 1M, Cached input below base rate, Context 1M tokens, Terminal Bench 2.1 87.9, Weights open-weights lineage. Footer reading "Fugu Max rows vendor-reported by Sakana AI with no scores published; DeepSeek rows vendor-reported, metered rate on OrcaRouter.", with the OrcaRouter logo bottom-right.

Wat orkestratie oplevert wanneer de baseline al goedkoop is

Het pleidooi voor meer betalen voor Fugu Max moet berusten op werk dat één enkel model slecht aankan, en die categorie bestaat echt. Langetermijntaken waarbij één verkeerde zet zich opstapelt — refactors over meerdere bestanden, wijzigingen op repositoryschaal, alles waarbij een verifier die de output van de worker controleert meer waard is dan een sterkere worker — zijn precies waarvoor een Thinker/Worker/Verifier-opstelling bedoeld is. Sakana's eigen positionering voor de Fugu-lijn is dat een fout in een tweede doorgang opsporen goedkoper is dan het de eerste keer goed doen. Bij dat soort taken kan een outputtarief van $6,00 dat in één poging klaar is, beter zijn dan een tarief van $2,18 dat drie pogingen nodig heeft.

Dat argument heeft een toetsbare vorm en Sakana heeft het niet in het openbaar uitgevoerd. De vergelijking die je zou willen is kosten per voltooide taak op een benchmark die beide systemen proberen — Terminal Bench 2.1 ligt binnen handbereik, het is agentisch en door zijn opzet terminalgebaseerd, en slechts één van de twee leveranciers heeft er een cijfer voor gepubliceerd. Totdat die kloof wordt gedicht, is de eerlijke positie dat het kostenvoordeel van Fugu Max op tokenniveau wordt beweerd en op taakniveau onbewezen is, terwijl die van DeepSeek V4 Pro voor zich spreekt: de tokens zelf kosten maar een derde zoveel.

Er is een secundair punt over de samenstelling van de pool dat voor deze matchup meer van belang is dan voor de meeste. De pool van Fugu Max is in deze release uitgebreid met open-weights en gespecialiseerde modellen, waarbij de NVIDIA Nemotron-familie via een NVIDIA-samenwerking wordt genoemd. Open weights in de pool betekenen dat de goedkoopste trede van Sakana's ladder niet blootstaat aan de prijsbeslissingen van een ander lab. DeepSeek V4 Pro, zelf open-weights, staat wat prijsbeslissingen betreft aan niemand anders bloot dan aan DeepSeek — en het is de trede. Het veerkrachtargument dat Sakana voor orkestratie aanvoert, geldt direct voor DeepSeek en slechts indirect voor Fugu Max' onderliggende toelevering.

Caching is waar agent-workloads pas echt duur worden.

Het basistarief van geen van beide leveranciers is het tarief dat een agent-loop betaalt. Langdurige agent-runs sturen bij elke beurt een grote, grotendeels onveranderlijke prefix opnieuw, en het cache-hitpercentage bepaalt de werkelijke rekening. Fugu Max vermeldt gecachte input tegen $0,25 per miljoen, een reëel en agressief cijfer — een achtste van zijn eigen basistarief voor input. DeepSeek V4 Pro prijst input bij cache-hit ver onder zijn gepubliceerde basistarief, en het outputtarief is vastgesteld op ongeveer drie keer het inputtarief in plaats van de vier- tot vijfvoudige verhouding die de meeste leveranciers hanteren, wat specifiek de kosten van generatie-intensieve loops drukt.

Wat je vandaag niet kunt doen, is de vergelijking betrouwbaar berekenen op basis van de tariefkaart van geen van beide leveranciers, omdat het cachetarief van Fugu Max van toepassing is op een tokenaantal dat je niet kunt voorspellen. Een orchestrator bepaalt hoeveel agents draaien; de context van elke agent draagt bij; de coördinator voegt de zijne toe. Sakana's prijsafspraak voor de Fugu-lijn — één gemengd tarief op basis van het deelnemende model in de hoogste categorie, waarbij agents de rekening niet opstapelen — haalt het slechtste geval weg, wat een echte concessie is en waardering verdient. Het maakt het volume niet vooraf kenbaar. De rekening van DeepSeek V4 Pro is een functie van de tokens die je verstuurt en de tokens die je ontvangt, en van niets anders.

Die voorspelbaarheid is net zoveel een eigenschap van de routering als van het model. DeepSeek V4 Pro staat op OrcaRouter tegen de lijstprijs van de provider met 0% opslag, zodat een tariefwijziging van DeepSeek je bestaande sleutel dezelfde dag bereikt in plaats van bij je volgende contractverlenging, en automatische failover je opvangt wanneer een van de providerpaden met een snelheidslimiet te maken krijgt. Dat laatste weegt voor dit specifieke model ongewoon zwaar: DeepSeek heeft zijn prijzen deze cyclus al eens herzien, met piek- en dalstaffels waarvan de uiteindelijke cijfers per bron verschillen. Wanneer de tariefkaart van een leverancier verandert, is de router het verschil tussen het absorberen van de wijziging en die op een factuur ontdekken.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Wat we niet konden verifiëren

Drie dingen in de Fugu Max-release konden niet worden gecontroleerd aan de hand van iets buiten Sakana's eigen materialen, en ze worden hier vermeld in plaats van verdoezeld. Ten eerste bevatten de zes benchmarkoverwinningen geen cijfers — Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench en SWEFish worden als overwinningen genoemd zonder bijbehorende scores, en SWEFish is Sakana's interne benchmark. Ten tweede zijn het contextvenster, het uitvoerplafond en de ondersteunde modaliteiten van Fugu Max niet gepubliceerd, dus de rijen voor modaliteit en plafond hierboven vergelijken een geleverde specificatie met stilte. Ten derde bestaat er geen onafhankelijke evaluatie van welk Fugu-model dan ook, en er is geen Artificial Analysis-vermelding voor Fugu Max.

Voor DeepSeek V4 Pro is de situatie omgekeerd. De leverancier meldt een lange lijst met cijfers — Terminal Bench 2.1 87,9, GPQA Diamond 92,8, SWE-bench Vals 96,4, HLE 42,7 en 60,0 in twee configuraties, MCP Atlas 73,6, Toolathlon-Verified 74,1, CyberGym 83,3 — en allemaal zijn ze ook door de leverancier gerapporteerd. Het verschil is niet dat de ene leverancier betrouwbaarder is. Het is dat wanneer beide partijen cijfers publiceren, onenigheid mogelijk is, en een onenigheid kan worden onderzocht. Een bewering zonder cijfer kan niet worden gecontroleerd, alleen geaccepteerd of genegeerd.

Nog één voorbehoud bij de bovenstaande DeepSeek-prijzen: onze eigen modelpagina bevat twee cijfers, een verbruikstarief van $0,73 voor input en $2,18 voor output per miljoen in de prijstegels en een oudere beschrijving van $0,44 voor input en $0,87 voor output per miljoen. DeepSeek heeft ook piek- en dalurentarieven aangekondigd waarover bronnen het oneens zijn wat de definitieve tarieven betreft. Beschouw $0,73 en $2,18 als het tarief dat je vandaag via ons daadwerkelijk in rekening wordt gebracht, en controleer dit aan de hand van de gepubliceerde tariefkaart voordat je er een budget op baseert.

Kortom

DeepSeek V4 Pro wint deze vergelijking op de voorwaarden die Fugu Max heeft gekozen. Het is goedkoper op input en output, het heeft een gepubliceerd contextvenster en een uitvoerplafond van 384K, het rapporteert een echt getal op de benchmark waarvan Fugu Max beweert dat hij die leidt, en zijn afkomst is open-weights, wat de sterkste beschikbare vorm is van het argument voor leveranciersonafhankelijkheid dat Sakana verkoopt. Als je workload tokenzwaar is en je prioriteit de laagst verdedigbare kosten per token zijn van een model dat je kunt vastpinnen, dan is dit niet nipt.

Fugu Max wint een smallere vraag die DeepSeek V4 Pro helemaal niet beantwoordt: of een coördinator die zijn eigen agentteam samenstelt, moeilijk, langdurig werk in minder pogingen kan afronden dan één enkel model. Dat is de moeite waard om te piloten als je controleerbaar, fouttolerant werk hebt en je buiten de EU/EER zit. Bereken de kosten op basis van tokens per voltooide taak, stel eerst een plafond in en vergelijk het met het DeepSeek V4 Pro-endpoint op OrcaRouter tegen de lijstprijs van de provider — één sleutel, 0% opslag, en een tarief dat gelijkloopt met dat van de leverancier zelf.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro, captured September 11, 2026, English UI), showing the FLAGSHIP and Featured badges, the deepseek/deepseek-v4-pro model ID, the Tools, JSON and Reasoning tags, the listing date 2026-04-24, the /v1/chat/completions and /v1/responses endpoints, the pricing tiles reading INPUT $0.73 and OUTPUT $2.18 per 1M tokens with p50 TTFT 919ms and 6,313.7M tokens of 7-day traffic, the 1M token context with 384K max output and text-only input, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt