
Fugu Max vs Qwen3.8-Max: dezelfde prijs, dezelfde benchmark, één gepubliceerd cijfer
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Fugu Max en Qwen3.8-Max staan tegen hetzelfde tarief: $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens. Sakana AI bracht Fugu Max uit op 11 september 2026 en Alibaba levert Qwen3.8-Max sinds begin augustus, en de twee leveranciers kwamen vanuit tegenovergestelde richtingen op een identieke tariefkaart uit — de een prijst een routeringsbeleid, de ander een model met 2,4 biljoen parameters. De gelijke stand haalt de prijs volledig uit de beslissing, wat ongewoon zuiver is. Wat overblijft is bewijsmateriaal, en daarin verschillen de twee partijen meer dan waar dan ook. Beide leverancierstabellen noemen Terminal Bench 2.1. Alibaba vermeldt 86,6 voor Qwen3.8-Max. Sakana zegt dat Fugu Max de beste algemene score op Terminal Bench 2.1 behaalt en noemt helemaal geen cijfer — voor die test noch voor de andere vijf die het zegt te winnen.
De enige benchmark die beide partijen noemen
Dit is de hele matchup samengeperst in één enkele rij, dus het is de moeite waard om er precies over te zijn.
De release van Sakana somt zes benchmarks op waarop Fugu Max de beste totaalscore behaalt: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench en SWEFish. Vijf daarvan zijn erkende openbare evaluaties en de zesde, SWEFish, is Sakana's eigen codingbenchmark. Voor geen van de zes noemt de release een waarde, een marge of het cijfer van een concurrent om ernaast te zetten. De parallelle bewering — dat Fugu Max de kosten-prestatie-paretofrontier uitbreidt op zeven van de tien benchmarks — is eveneens een uitspraak over de positie op een grafiek in plaats van over een punt op een as.
De door Alibaba gepubliceerde rijen voor Qwen3.8-Max omvatten Terminal-Bench 2.1 op 86,6, OSWorld-Verified op 86,1, GPQA Diamond op 92,6 en SWE-bench Pro op 67,7. Allemaal door de leverancier gerapporteerd, allemaal cijfers. Dus op de enige test die beide bedrijven kozen te noemen, heeft de één een cijfer gepubliceerd en de ander een rang. Daaruit kun je niet concluderen welk systeem beter is — Sakana's "best overall" zou 91 of 87 kunnen betekenen. Wat je wel kunt concluderen, is dat er op het moment van publicatie geen openbaar bewijs is dat de vraag beantwoordt, en dat de leverancier die de grotere claim maakt degene is die weigert die te kwantificeren.
Identieke prijzen, tegengestelde constructie
• Invoer — Fugu Max $2,00 per 1 miljoen tokens vs. Qwen3.8-Max $2,00 per 1 miljoen tokens
• Uitvoer — Fugu Max $ 6,00 per 1 miljoen tokens vs. Qwen3.8-Max $ 6,00 per 1 miljoen tokens
• Gecachte invoer — Fugu Max $0,25 per 1 mln tokens vs Qwen3.8-Max $0,25 per 1 mln tokens, en Artificial Analysis meet onafhankelijk een cachekorting van 88 procent aan de Qwen-kant
• Toeslag voor lange prompts — Fugu Max: geen tier vermeld in de release, tegenover Qwen3.8-Max met een vlak tarief tot het venster en zonder toeslag
• Context en output — Fugu Max: geen van beide cijfers gepubliceerd vs Qwen3.8-Max: een 1M-token venster met een uitvoerplafond van ongeveer 128K
• Invoermodaliteit — Fugu Max tekst, met de eigen mogelijkheden van de pool erachter, vs. Qwen3.8-Max tekst, afbeelding, video en PDF
• Architectuur — Fugu Max: een getrainde coördinator over een niet nader bekendgemaakte pool, uitgebreid voor Max met open-weights- en gespecialiseerde modellen, waaronder de NVIDIA Nemotron-familie via een samenwerking met NVIDIA, tegenover Qwen3.8-Max: één sparse mixture-of-experts-model met ongeveer 2,4 biljoen totale parameters en ongeveer 95 miljard actieve per token.
• Gewichten — Fugu Max gesloten, lidmaatschap van de pool bewust niet bekendgemaakt versus Qwen3.8-Max open gewichten gepubliceerd voor het checkpoint van de Max-klasse onder een aangepaste licentie
• Onafhankelijke evaluatie — voor Fugu Max is niets gepubliceerd, en er bestaat geen Artificial Analysis-pagina voor enig Fugu-model, tegenover Qwen3.8-Max, een live Artificial Analysis-vermelding met gepubliceerde cijfers voor snelheid, uitgebreidheid en kosten per taak
Vier van die rijen zeggen "niet gepubliceerd" aan de Fugu-kant en bevatten een cijfer aan de Qwen-kant. Wanneer de tarieven identiek zijn, is dat de hele vergelijking: hetzelfde geld koopt één systeem dat je kunt beschrijven en één dat je niet kunt.

Achter één kolom zit een derde partij.
Artificial Analysis geeft Qwen3.8-Max een score van 40 op de herziene v4.3 Intelligence Index, op plaats 30 van 200, met een kostprijs van $2,67 per Intelligence Index-taak en 37,8 outputtokens per seconde — traag genoeg om op snelheid plaats 154 van 200 te behalen. Dezelfde vermelding registreert 180 miljoen outputtokens die in de index zijn gegenereerd, meer dan het dubbele van de 89 miljoen van het mediane model, en een cachekorting van 88 procent.
Er gelden twee correcties voordat iets hiervan wordt geciteerd. De eerste is dat het breed verspreide cijfer 58 — of 58,1, of 58,4 — voor Qwen3.8-Max stamt van voordat Artificial Analysis de index in september 2026 herkalibreerde, en de livepagina draagt de badge "Updated" die een herziene score markeert. De oudere artikelen hanteerden ook een andere inspanningslast die bij de vorige schaal hoorde: 64 beurten per taak tegenover 14 voor de eerdere Qwen-generatie, tegen ongeveer $1,14 per Intelligence Index-taak; de huidige pagina toont $2,67. De tweede is een echte waarschuwing en geen schaalartefact: Artificial Analysis heeft afzonderlijk gemeten dat het hallucinatiepercentage van Qwen3.8-Max steeg van 23 procent naar 40 procent ten opzichte van de vorige generatie. Voor een model dat op de markt wordt gebracht voor autonoom werk in meerdere stappen, is dat een kostenpost die je in je verifiers begroot, niet een voetnoot.
Fugu Max heeft geen enkele onafhankelijke vermelding, van welke aard dan ook. Elk cijfer dat eraan wordt gekoppeld, is afkomstig van Sakana, en op het moment van schrijven bestaat er geen Artificial Analysis-pagina voor Fugu Max of voor een van zijn zustermodellen. Dat is geen beschuldiging — een model dat een paar uur geleden is uitgebracht, zal geen dekking door derden hebben — maar het betekent wel dat de twee kolommen niet even goed controleerbaar zijn, en dat zal zo blijven totdat iemand buiten Sakana het ding draait.
Twee manieren om te veel uit te geven
Beide systemen hebben de kosten van een antwoord losgekoppeld van de kosten van een token, en ze doen dat in tegengestelde richtingen. Qwen3.8-Max is zuinig per token en kwistig per antwoord: 180 miljoen outputtokens op de Intelligence Index, twee keer de mediaan, tegen $2,67 per taak. Het werkt lang in plaats van groot te zijn, en de cachekorting van 88 procent is de hefboom die de rekening beheerst — een lange agentrun die steeds dezelfde context opnieuw leest, blijft goedkoop; een die steeds nieuwe tekst blijft genereren, niet.
Fugu Max is duur per token en onvoorspelbaar per antwoord. De coördinator ervan start subagenten, die elk redeneer- en uitvoertekst schrijven die wordt gefactureerd tegen $6,00 per miljoen, plus de eigen synthese van de coördinator. Sakana belooft dat multi-agent-runs worden gefactureerd tegen één gemengd tarief dat gekoppeld is aan het topmodel onder de deelnemende modellen, en dat het toevoegen van agenten de rekening niet vermenigvuldigt, wat de worstcase-fan-outexplosie wegneemt die naïeve multi-agentsystemen onbetaalbaar maakt. Het neemt het volume niet weg. En over de volumekwestie zwijgt de release op een manier die ertoe doet: Sakana's eigen berichtgeving stelt dat het wisselen van model halverwege een taak het hergebruik van de contextcache kan verminderen en extra orkestratietokens kan genereren, en bevestigt dat het bedrijf de cache-hitratio van Max of de totale tokenkosten per taak niet heeft bekendgemaakt.
Dus hetzelfde tarief van $2.00 / $6.00 is aan de ene kant een voorspelbaar getal en aan de andere kant een onbegrensd veelvoud met een ondergrens. De breedsprakigheid van Qwen3.8-Max is meetbaar voordat je je vastlegt; die van Fugu Max niet.
De ontsnappingsluiktest
Dit is waar het gebruikelijke lock-in-argument zich omkeert, en het is het nuttigste element van de combinatie.
Sakana's pleidooi voor Fugu Max is veerkracht. Een pool die open-weightmodellen en gespecialiseerde modellen omvat, voor Max uitgebreid met de NVIDIA Nemotron-familie, betekent dat het stopzetten, het herprijzen of het zich regionaal terugtrekken van één enkele frontier-leverancier je product niet onderuit kan halen — een echte hedge, en een die het bedrijf expliciet verkoopt. Maar de hedge is van buitenaf niet te verifiëren. Je kunt de pool niet zien, geen lid in- of uitschakelen, niets ervan zelf hosten en hem helemaal niet in de EU/EER draaien. Een belofte over een pool die je niet mag inspecteren, is een zwakkere garantie dan ze klinkt.
Qwen3.8-Max draait het argument de andere kant op. Het is het model van één leverancier en is dus blootgesteld aan de beslissingen van die ene leverancier — maar Alibaba heeft open gewichten gepubliceerd voor het Qwen3.8-2.4T-A95B-checkpoint uit de Max-klasse onder een aangepaste licentie, wat betekent dat de ontsnappingsroute echt is in plaats van retorisch: als de prijsstelling of de voorwaarden veranderen, kan het model op je eigen infrastructuur worden gedraaid. Voor een team dat in werkelijkheid bang is dat een leverancier de grond onder zijn voeten wegtrekt, weegt een downloadbaar checkpoint zwaarder dan een beschrijving van een pool.
Een van beide bellen
Qwen3.8-Max staat in onze catalogus voor $2,00 in en $6,00 uit per miljoen tokens, de lijstprijs van Alibaba met 0% markup die wordt doorgegeven, zodat een prijswijziging van een leverancier dezelfde dag op dezelfde key terechtkomt in plaats van volgens een migratieschema. Het is OpenAI-compatibel op dezelfde base-URL als de rest van de catalogus, wat betekent dat je het achter een voorwaardelijke routeringsregel, een failover-keten of een model-fusiepaneel kunt plaatsen zonder een tweede contract of een codewijziging — en automatische failover dekt een rate-limited of verslechterd providerpad. De afgelopen zeven dagen ging er 127,7 miljoen tokens via de gateway.
Fugu Max staat niet op OrcaRouter. Het bereikt je via Sakana's eigen OpenAI-compatibele API en verschillende platforms van derden, en het bedrijf zegt dat een bestaande Fugu-integratie upgradet met een parameterwijziging van één regel. Omdat beide hetzelfde aanvraagformaat spreken, is de goedkoopste manier om de benchmarkkloof te beslechten: stop met wachten tot Sakana die publiceert: laat beide achter één flag op je eigen workload draaien en tel outputtokens per voltooide taak. Dat is de meting die geen van beide leveranciers heeft geleverd.

Welke, en wanneer?
Qwen3.8-Max is de keuze die je kunt auditen, prijzen en laten vallen. Tegen exact dezelfde tariefkaart krijg je een venster van 1M tokens zonder toeslag voor lange prompts, invoer van afbeeldingen, video en pdf, een downloadbaar checkpoint van Max-klasse, een live onafhankelijke vermelding die de dingen meet die je rekening bepalen, en 88 procent korting op gecachte invoer. De kosten zijn al even specifiek: het is traag met 37,8 tokens per seconde, staat op snelheid bijna onderaan het veld, het is enorm wijdlopig met 180 miljoen tokens op de index, en het gemeten hallucinatiepercentage is ongeveer verdubbeld ten opzichte van de vorige generatie — wat een ernstige zorg is voor precies het autonome werk waarvoor het wordt verkocht. Benut de cachekorting maximaal en neem een verificateur op in je budget.
Fugu Max is de gok dat coördinatie het wint van capaciteit. Als je werk langdurig en controleerbaar is, en een coördinator die een verificateur voortbrengt taken afmaakt die een enkel model twee keer niet haalt, dan zijn de orkestratietokens goedkoper dan de herhaalpogingen en is de identieke tariefkaart helemaal geen gelijkspel. Wat je koopt is persistentie, in een systeem waarvan je de pool niet kunt vastpinnen, waarvan het contextvenster niet gepubliceerd is, en waarvan de zes benchmarkoverwinningen geen waarden hebben — van een leverancier die ervoor koos de test te noemen en het getal achter te houden.
Beide producten kosten hetzelfde per token. Slechts één van hen vertelt je wat je ervoor krijgt.

