
Fugu Ultra v2 vs DeepSeek V4 Pro: de vraag over de 34x outputprijs
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Fugu Ultra v2 rekent ongeveer vierendertig keer de catalogusprijs van DeepSeek V4 Pro voor de tekst die het schrijft. Dat is geen typfout en geen afrondingsartefact: Sakana AI's nieuwe orchestrator staat genoteerd op $30,00 per miljoen outputtokens, DeepSeek meldt $0,87 per miljoen, en op de enige benchmark waarvoor beide leveranciers een cijfer publiceren, is het prestatieverschil allesbehalve vierendertig keer. Sakana claimt 74,3 op DeepSWE voor Fugu Ultra v2, uitgebracht op 11 september 2026; DeepSeek meldt 62,7 voor DeepSeek V4 Pro, het open-weightmodel dat het in augustus uitbracht. Een door de leverancier gerapporteerde voorsprong van 11,6 punt voor een 34x outputprijs is de hele vergelijking in één regel — en de eerlijke vraag is niet of Fugu Ultra v2 beter is, maar of het negentien dollar per miljoen tokens beter is, en voor wie.
Twee antwoorden op hetzelfde probleem, opgebouwd vanuit tegenovergestelde uiteinden
DeepSeek V4 Pro en Fugu Ultra v2 zijn beide reacties op dezelfde angst — afhankelijkheid van één enkele gesloten frontier-leverancier — en qua methode kunnen ze haast niet meer van elkaar verschillen.
DeepSeek V4 Pro is een model. Berichtgeving over de lancering dateert de API-uitrol van de officiële versie — de DeepSeek-V4-Pro-0813-build — op ongeveer 12 tot 13 augustus 2026, als opvolger van de preview van 24 april. Het is een mixture-of-experts-systeem met naar verluidt 1,5 tot 1,6 biljoen totale parameters, waarbij ongeveer 49 miljard per token worden geactiveerd, met een contextvenster van 1M tokens en een maximale uitvoer van 384K tokens. Het redeneert in denk- en niet-denkenmodi met drie inspanningsniveaus, spreekt zowel de OpenAI- als de Anthropic-API-protocollen en voegde een native Responses-API toe die rechtstreeks is gericht op Codex-achtige agent-harnassen. Cruciaal: de gewichten zijn onder MIT gepubliceerd, wat betekent dat het veerkrachtargument is beslecht door bezit: niemand kan jouw kopie intrekken.
Fugu Ultra v2 is geen model. Het is een getrainde coördinator, naar verluidt rond 7B parameters, die een verzoek opsplitst over een pool van niet-bekendgemaakte modellen, Thinker-, Worker- en Verifier-rollen toewijst en een antwoord synthetiseert achter één OpenAI-compatibel endpoint. Het veerkrachtargument is architecturaal in plaats van juridisch: omdat de pool verwisselbaar is, kan het systeem het overleven als één enkele leverancier de voorwaarden wijzigt. Versie 2.0, uitgebracht naast Fugu Max, verschoof de trainingsafsluitdatum naar 28 augustus 2026 en — opvallend — verwijderde Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra volledig uit de pool, terwijl er nog steeds overwinningen op hen werden geclaimd.
Dus de vergelijking is bezit versus coördinatie. DeepSeek geeft je een model dat je kunt downloaden, auditen, fine-tunen en zelf kunt aanbieden tegen welke marge je eigen hardware ook toelaat. Sakana geeft je een systeem dat bepaalt hoe elk probleem wordt aangepakt, tegen een tarief dat het draaien van meerdere frontier-modellen namens jou financiert.

Wat 34x daadwerkelijk oplevert
Eerst de benchmarks, met de bronvermelding vooraan en in het middelpunt. Elk DeepSeek-cijfer hieronder is van de leverancier zelf en dateert van vóór de herziening van de piek-/dalprijsstelling die DeepSeek voor medio augustus aankondigde, waarover bronnen het nog steeds oneens zijn wat de definitieve cijfers betreft — het ene rapport zet de piek-output op bijna ¥27 per miljoen, een ander op bijna ¥12, tegen een basis van ¥6. Verifieer dit aan de hand van de gepubliceerde tariefkaart van DeepSeek voordat je een budget modelleert. Elk Fugu-cijfer is van Sakana zelf, en geen enkele onafhankelijke partij heeft er ook maar één gereproduceerd; er is nog steeds geen Artificial Analysis-vermelding voor een Fugu-model.
• DeepSWE — Fugu Ultra v2 74,3 (door de leverancier gerapporteerd) vs DeepSeek V4 Pro 62,7 (door de leverancier gerapporteerd)
• Terminal Bench 2.1 — geen door Sakana gepubliceerd cijfer voor Fugu Ultra v2 vs DeepSeek V4 Pro 87,9 (volgens opgave van de leverancier)
• SWE-bench (Vals) — geen cijfer voor Fugu Ultra v2 vs. DeepSeek V4 Pro 96,4 (volgens opgave van de leverancier)
• Humanity's Last Exam — geen score voor Fugu Ultra v2 v2.0 vs. DeepSeek V4 Pro 42,7 zonder tools, 60,0 met tools (door leverancier gerapporteerd)
• GPQA Diamond — geen cijfer voor Fugu Ultra v2 v2.0 vs. DeepSeek V4 Pro 92,8 (volgens leverancier)
• Prijs van output — Fugu Ultra v2 $30,00 per 1 miljoen, oplopend tot $45,00 boven 272K context versus DeepSeek V4 Pro ongeveer $0,87 per 1 miljoen als lijstprijs, met een verbruikstarief dat hoger is uitgevallen
Twee kanttekeningen bij die rij met prijzen, want de hele vergelijking berust daarop. Ten eerste: het cijfer van DeepSeek is het lijsttarief dat in de berichtgeving rond de lancering werd genoemd en in onze eigen modelbeschrijving wordt herhaald, maar het verbruikstarief op onze listing is uitgekomen op $2,18 per miljoen output en $0,73 per miljoen input — cachegedrag en mix beïnvloeden het effectieve getal, dus de eerlijke factor ligt ergens tussen ruwweg 14x en ruwweg 34x, afhankelijk van hoeveel van je input in de cache zit. Zelfs aan de onderkant van die bandbreedte kost output meer dan een dozijn keer zoveel. Ten tweede: DeepSeek heeft al een herziening van de piek-/dalprijsstelling aangekondigd waarover bronnen het nog steeds oneens zijn wat de definitieve cijfers betreft — het ene rapport stelt de piekoutput op bijna ¥27 per miljoen, het andere op bijna ¥12, tegenover een basis van ¥6. Controleer aan de hand van de gepubliceerde tariefkaart voordat je een budget modelleert.
• Invoerprijs — Fugu Ultra v2 $5,00 per 1M, verdubbelt boven 272K vs DeepSeek V4 Pro ongeveer $0,435 per 1M bij een cachemiss, ruwweg 120x goedkoper bij een cachehit
• Gewichten — Fugu Ultra v2 gesloten, pool niet bekendgemaakt, routering wordt bewust niet blootgesteld vs DeepSeek V4 Pro open onder MIT, zelf te hosten
• Context en uitvoer — Fugu Ultra v2 1M context, uitvoerplafond niet gepubliceerd vs DeepSeek V4 Pro 1M context, 384K uitvoerplafond
Het overlapprobleem is duidelijk: de twee systemen komen nauwelijks in dezelfde rijen voor. Sakana publiceert vijf overwinningen op de acht benchmarks die het selecteerde; DeepSeek publiceert een breder scorebord dat diepgaande agentische dekking omvat — MCP Atlas 73,6, Toolathlon-Verified 74,1, CyberGym 83,3, NL2Repo 61,5, CorpusQA 62,0 op lange context — waar Fugu Ultra v2 helemaal geen gepubliceerd cijfer heeft. De enige rij die je kunt vergelijken, DeepSWE, is de rij waarin Fugu zijn grootste voorsprong op het gebied van software-engineering claimt. Een lezer die de twee releases vergelijkt, vergelijkt twee verschillende examens.
De uitvoerigheidsvermenvuldiger
De outputprijs is geen lineaire belasting op orkestratie; het is een vermenigvuldiger op een hoeveelheid die orkestratie doet toenemen. Fugu Ultra v2 start agents op, die elk redeneer- en outputtokens produceren, voordat een coördinator ze synthetiseert. De pricing-FAQ van Sakana doet een oprecht consumentvriendelijke toezegging — je betaalt één gemengd tarief op basis van het topmodel in de pool, en het toevoegen van agents vermenigvuldigt de rekening niet — wat het slechtste geval beperkt. Het beperkt het volume niet. Bij $30 per miljoen outputtokens kost een multi-agentrun die vier keer zoveel tekst uitstuurt als een aanroep met één model vier keer zoveel, en de vermenigvuldiger wordt nog versterkt door een outputtarief dat 34 keer hoger ligt.
De kostenstructuur van DeepSeek V4 Pro beloont het tegenovergestelde gedrag. Een cachehit op input is ongeveer twee ordes van grootte goedkoper dan een miss, waardoor herhaald werk met een lange context — dezelfde repository, dezelfde documentenset, dezelfde systeemprompt — dramatisch goedkoper wordt dan het gepubliceerde tarief doet vermoeden. Voor een agent-loop die bij elke beurt dezelfde context opnieuw leest, komen de effectieve kosten daar terecht, en het is een structureel voordeel dat geen enkele orchestrator kan omzeilen.
Als je die twee combineert, wordt de beslissing concreet. Als Fugu Ultra v2 een DeepSWE-voordeel van 11,6 punt oplevert en drie keer zoveel outputtokens uitstuurt als een enkele aanroep, betaal je per voltooide taak ongeveer honderd keer meer voor een winst van tien tot vijftien punten op één benchmark. Die afweging is verdedigbaar voor onderzoek en onherleidbaar moeilijke technische problemen waar het marginale punt allesbepalend is, en onverdedigbaar voor een pijplijn die honderdduizend keer per dag draait.

Voor wie elk ervan eigenlijk is
Kies DeepSeek V4 Pro als een van de volgende situaties van toepassing is: je workload heeft een hoog volume en is kostengevoelig; je hebt output nodig die langer is dan het plafond dat een orchestrator je zal geven; je hebt een systeem nodig dat je kunt auditen, fine-tunen of op je eigen hardware kunt draaien om redenen van datalocalisatie; of je hebt een prijs nodig die een getal is dat je kunt berekenen in plaats van een getal dat je waarneemt. De open MIT-licentie is geen marketingkenmerk — het is de sterkste vorm van het veerkrachtargument dat beide systemen aanvoeren, omdat het niet afhankelijk is van de blijvende goodwill van een leverancier. Bovendien is het met ongeveer $0,87 per miljoen output goedkoop genoeg dat experimenteren niets kost.
Kies Fugu Ultra v2 als het marginale punt een veelvoud waard is, het werk een lange horizon heeft, en correctheid controleerbaar is — coderen met een testsuite, gestructureerd redeneren over documenten, meerstapsanalyse waarbij een Verifier-rol een fout kan vangen die een enkele doorgang zou opleveren. Sakana's eigen casestudies wijzen precies hierop: een veertien uur durende autonome onderzoeksrun, een Rubik's Cube-oplosser die alle 300 scrambles voltooide, terwijl twee geanonimiseerde baselines volledig crashten. Houd er rekening mee dat die baselines geanonimiseerd en door de leverancier geselecteerd zijn, wat ze als bewijs verzwakt en ze niet onwaar maakt. Houd ook rekening met de beperking die de discussie voor sommige teams beëindigt: Fugu Ultra v2 wordt niet verkocht in de EU of de EER, en Sakana zegt dat ronduit.
Eén praktische opmerking als u van plan bent een van beide te draaien. Fugu Ultra v2 staat niet op OrcaRouter — het komt via Sakana's eigen OpenAI-compatibele API en verschillende platforms van derden, en upgraden vanaf een eerdere Fugu is een wijziging van één regel in de parameters. DeepSeek V4 Pro staat op OrcaRouter tegen de lijstprijs van de provider met 0% opslag, wat hier meer dan anders van belang is: DeepSeek heeft deze cyclus al één prijsherziening aangekondigd, en bij een pass-through-router is een prijswijziging van een leverancier dezelfde dag live op dezelfde sleutel in plaats van pas na een heronderhandeling. Als u beide wilt benchmarken tegen uw eigen workload voordat u zich vastlegt, is de goedkoopste kant van de vergelijking degene die u tegen lijstprijs kunt aanroepen, met automatische failover erachter.

Het vonnis
Dit is geen nek-aan-nekrace op economisch vlak en geen beslissende op capaciteit. DeepSeek V4 Pro is met grote marge de betere standaardkeuze: open gewichten die je zelf kunt beheren, een uitvoerplafond van 384K, een context van 1M, gepubliceerde scores voor lange contexten, en een prijs die ongeveer een vierendertigste is van die van Fugu Ultra v2 voor uitvoer. Fugu Ultra v2 is het betere instrument voor een smalle klasse van dure problemen, en Sakanas claim — dat een vaste pool die de drie sterkste modellen uitsluit hen nog steeds kan verslaan op verifieerbaar werk — is het interessantste architectuurargument in het veld op dit moment, en het argument met het minste onafhankelijke bewijs erachter.
De praktische oplossing is niet om te kiezen. Gebruik DeepSeek V4 Pro als standaard omdat het goedkoop, open en snel is, en houd Fugu Ultra v2 achter de hand voor de taken waar een honderdvoudige kostenstijging nog steeds kleiner is dan de kosten van een fout. Wat je niet moet doen, is Sakana's scorebord van acht benchmarks lezen als bewijs dat de dure orchestrator het goedkope open model heeft vervangen. Op de enige rij die ze delen, staat het 11,6 punten voor tegen 34 keer de outputprijs. Of dat een koopje of een valstrik is, hangt volledig af van het probleem waarop je het richt.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
