Een hero-titelkaart met de tekst 'Fugu Ultra v2 vs Qwen3.8-Max' en als ondertitel 'Waarom het prijskaartje het verkeerde getal is', drie pill-badges met de tekst 'Output: $30,00 vs $6,00', 'Boven 272K: tarief verdubbelt' en 'Onafhankelijke Fugu-score: geen', een voettekst met 'Sakana AI, 11 september 2026 vs Alibaba, augustus 2026', en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Fugu Ultra v2 vs Qwen3.8-Max: waarom het prijskaartje het verkeerde getal is

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Fugu Ultra v2 kost $30,00 per miljoen outputtokens. Qwen3.8-Max kost $6,00. Dat is een verschil van vijf tegen één, en als je op basis van die verhouding tussen deze twee agentische systemen kiest, kies je verkeerd — want geen van beide wordt daadwerkelijk gefactureerd zoals de eigen prijslijst suggereert. Volgens de eigen meting van Artificial Analysis genereerde Qwen3.8-Max 180 miljoen outputtokens om de Intelligence Index te voltooien, meer dan het dubbele van de 89 miljoen van het mediane model, tegen een kostprijs van $2,67 per taak. Het is een zuinig model per token en een kwistig model per antwoord. Fugu Ultra v2 van Sakana AI, uitgebracht op 11 september 2026, heeft de tegenovergestelde vorm: een niet-bekendgemaakte pool van modellen van andere labs die het per verzoek aanmaakt en coördineert, gefactureerd tegen één samengesteld tarief waarvan Sakana zegt dat het niet vermenigvuldigt naarmate er agenten worden toegevoegd. De ene is een enkel model met 2,4 biljoen parameters dat langdurig hardop nadenkt. De andere is een kleine coördinator die hulp inhuurt. Het vergelijken van hun tokenprijzen zegt bijna niets over welke goedkoper is om te draaien.

Twee tegengestelde manieren om duur te zijn

Begin met het mechanisme, want het verklaart elk ander verschil in deze vergelijking.

Qwen3.8-Max is een sparse mixture-of-experts-model — 2,4 biljoen totale parameters, ongeveer 95 miljard actief per token — dat frontier-adjacent resultaten bereikt door langer te werken in plaats van groter te zijn. Artificial Analysis mat het op 37,8 outputtokens per seconde, waarmee het #154 van 200 modellen qua snelheid is, met 180 miljoen outputtokens gegenereerd over de Intelligence Index (#70 van 200 qua verboseheid). De kosten per Intelligence Index-taak bedragen $2,67, en de cachekorting is ongewoon diep op 88%, wat de hefboom is die hier daadwerkelijk de rekening bepaalt: een lange agent-run die dezelfde context blijft herlezen is goedkoop, en een die steeds nieuwe tekst blijft genereren niet.

Fugu Ultra v2 benadert hetzelfde probleem vanaf de andere kant. Het is een orchestrator — een kleine getrainde coördinator, naar verluidt rond de 7 miljard parameters, die een verzoek leest, een agententeam samenstelt langs de rollen Thinker, Worker en Verifier uit Sakana's TRINITY-werk, en vervolgens een antwoord synthetiseert. De tokenrekening is de som van wat de subagenten produceren plus de synthesetekst van de coördinator zelf. Sakana zegt in zijn FAQ over prijsstelling toe dat je één gemengd tarief in rekening wordt gebracht dat gekoppeld is aan het betrokken topmodel en dat het toevoegen van agenten de rekening niet vermenigvuldigt, wat de klassieke multi-agent-kostenexplosie wegneemt waarbij fan-out de kosten vermenigvuldigt. Wat het niet wegneemt, is volume. Bij $30,00 per miljoen outputtokens is het getal dat ertoe doet hoeveel agenten er draaiden en hoeveel ze schreven, en dat is een getal dat noch jij noch Sakana vanaf de prijspagina kan voorspellen.

Dat is de eerlijke manier om het prijsverschil te duiden: het is een tarief, geen totaal. Een vijf keer zo hoog tarief toegepast op een werklast waarvan je het uitvoervolume niet kunt voorspellen, is geen vijf keer de kosten — het is een onbegrensde veelvoud met een voorspelbare ondergrens.

A two-column scoreboard titled 'Fugu Ultra v2 vs Qwen3.8-Max Scoreboard' contrasting six dimensions. Fugu Ultra v2: price $5.00/$30.00 per 1M, context 1M tokens, above 272K input doubles to $10, AA Index none published, speed not measured, weights closed with pool undisclosed. Qwen3.8-Max: price $2.00/$6.00 per 1M, context 1M tokens, above 272K no surcharge, AA Index 40 ranked #30 of 200, speed 37.8 tokens/sec, weights open checkpoint published. Footer reads 'Fugu Ultra v2 figures vendor-reported; no independent evaluation. Qwen3.8-Max figures per Artificial Analysis, recalibrated scale.' OrcaRouter logo bottom-right.

Het specificatieblad, en de ene rij die de doorslag geeft

• Prijs — Fugu Ultra v2 $5,00 in / $30,00 uit per 1 miljoen tokens vs Qwen3.8-Max $2,00 in / $6,00 uit

Gecachte invoer — Fugu Ultra v2 $0,50 per 1 miljoen versus Qwen3.8-Max $0,25 per 1 miljoen gelezen, en een cachekorting van 88% gemeten door Artificial Analysis

• Toeslag voor lange context — Fugu Ultra v2 input verdubbelt naar $10,00 en output naar $45,00 boven 272K tokens, tegenover Qwen3.8-Max zonder toeslag voor lange prompts, constant tot aan het venster

• Contextvenster — Fugu Ultra v2 1M tokens vs. Qwen3.8-Max 1M tokens

• Uitvoerplafond — Fugu Ultra v2 niet gepubliceerd als één enkel cijfer vs. Qwen3.8-Max, ongeveer 128K tokens

• Invoermodaliteit — Fugu Ultra v2 tekst, met de eigen capaciteiten van de pool erachter vs Qwen3.8-Max tekst, afbeelding, video en pdf

• Gewichten — Fugu Ultra v2 gesloten, lidmaatschap van de pool bewust niet bekendgemaakt vs. Qwen3.8-Max open gewichten gepubliceerd voor het Max-class checkpoint onder een aangepaste licentie

• Regionale beschikbaarheid — Fugu Ultra v2 wordt niet verkocht in de EU/EER, terwijl Qwen3.8-Max beschikbaar is zonder regionale beperking

• Onafhankelijke evaluatie — voor Fugu Ultra v2 is niets gepubliceerd, en er bestaat geen Artificial Analysis-pagina voor enig Fugu-model, tegenover Qwen3.8-Max, een live Artificial Analysis-vermelding met gepubliceerde cijfers voor snelheid, uitgebreidheid en kosten per taak

Lees de laatste twee rijen samen en de vergelijking wordt scherper. Qwen3.8-Max is een model dat je aan een versie kunt vastpinnen, waarvoor je een licentie kunt lezen, waarvan je een checkpoint kunt downloaden, en dat je kunt toetsen aan het scorebord van een derde partij. Fugu Ultra v2 is een systeem dat je niet kunt inspecteren, niet zelf kunt hosten, niet in Europa kunt kopen en niet kunt verifiëren bij iemand buiten Sakana. De 272K-toeslag verergert dat: voorbij die drempel verdubbelt het invoertarief van Fugu Ultra v2 en stijgt het uitvoertarief met de helft, terwijl het tarief van Qwen3.8-Max niet beweegt. Voor het langetermijnwerk aan documenten en repositories waarvoor beide systemen zijn gebouwd, is het goedkopere tarief ook het vlakkere.

Het Qwen3.8-Max-getal dat iedereen citeert, is verouderd

Als je de afgelopen twee weken ergens over dit model hebt gelezen, heb je waarschijnlijk een Artificial Analysis Intelligence Index van 58, of 58,1, of 58,4 gezien. Die cijfers waren echt en ze zijn niet meer actueel. Artificial Analysis heeft zijn index op 7 september 2026 opnieuw gekalibreerd naar v4.3, waardoor de scores over de hele linie werden samengedrukt, en de live Qwen3.8-Max-pagina vermeldt nu 40, waarmee het op #30 van 200 modellen staat — met de badge 'Bijgewerkt' die een herziene score markeert. De oudere artikelen bevatten ook de effort tax die op de vorige schaal werd gemeten: 64 beurten per taak tegenover 14 voor de eerdere Qwen-generatie, en ongeveer $1,14 per Intelligence Index-taak. De huidige pagina toont $2,67 per taak, 37,8 outputtokens per seconde en 180 miljoen outputtokens op de index.

Hieruit volgen twee dingen. Ten eerste zit Qwen3.8-Max op de geherkalibreerde schaal in dezelfde band als de rest van de tweede laag van de frontier, in plaats van op gelijke hoogte ermee, en elke vergelijking die je leest waarin het tegen Claude Opus 5 of Kimi K3 op een 58 wordt gerangschikt, vergelijkt snapshots van verschillende schalen. Ten tweede, en nuttiger voor deze confrontatie, is de correctie eenrichtingsverkeer: Qwen3.8-Max heeft een getal dat fout kan zijn en dan gecorrigeerd kan worden. Fugu Ultra v2 heeft geen getal. Elk Fugu-cijfer in dit artikel komt uit Sakana's eigen evaluatie, en met ingang van 11 september bestaat er geen Artificial Analysis-pagina voor Fugu Ultra v2 of enig ander Fugu-model — de URL geeft een 404. Wanneer een leverancier een scorebord publiceert en geen enkele onafhankelijke partij het model heeft gedraaid, is het scorebord het volledige verslag.

Waar ze daadwerkelijk overlappen, en waar ze dat niet doen

Sakana meldt Fugu Ultra v2 als beste of gedeeld beste op vijf van de acht benchmarks — GDP.pdf, Chartography, SWEFish, DeepSWE en Toolathon — en in de top twee op zeven van de acht. De twee concrete cijfers in het persbericht zijn Chartography met 48,3, tegenover 27,3 voor Claude Opus 5 en 29,5 voor Claude Fable 5 in dezelfde tabel, en DeepSWE met 74,3. De eigen gepubliceerde resultaten van Alibaba voor Qwen3.8-Max omvatten Terminal-Bench 2.1 met 86,6, OSWorld-Verified met 86,1, GPQA Diamond met 92,6 en SWE-bench Pro met 67,7.

Merk op wat die twee lijsten gemeen hebben: niets. Geen enkele benchmark komt in beide leverancierstabellen voor. Er is geen rij waarin je een Sakana-cijfer en een Ali​baba-cijfer naast elkaar kunt leggen en een winnaar kunt aflezen, wat betekent dat het eerlijke antwoord op "welke is beter in codeeragenten" is dat geen enkel gepubliceerd bewijs die vraag beantwoordt. Wat bestaat, is één systeem met acht door de leverancier gekozen rijen en geen externe verificatie, en één systeem met leveranciersrijen plus een onafhankelijke vermelding die kosten en snelheid meet in plaats van capaciteiten rechtstreeks met elkaar te vergelijken. Dat is een gat in het bewijs, niet een gat in de modellen, en het zou moeten veranderen hoe je koopt: je kunt op basis van benchmarks niet tussen deze kiezen, dus kies op basis van de eigenschappen die je daadwerkelijk kunt verifiëren.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, with the opening paragraphs arguing that the frontier which matters is two-dimensional — capability against cost — and stating that Fugu Ultra v2 pushes peak performance higher without indispensable reliance on the frontier models it orchestrates.

Open weights versus een niet-bekendgemaakte pool

Dit is waar het gebruikelijke lock-in-argument zich omkeert, en het is het meest interessante aan de koppeling.

Sakana's pitch voor Fugu Ultra v2 is soevereiniteit. Een uitwisselbare pool van open en gespecialiseerde modellen betekent dat geen enkele leverancier met zijn prijsbeslissingen, zijn uitfaseringsschema of een beleidswijziging je product ten val kan brengen, en de release maakt dit punt expliciet door op te merken dat de samenstelling van de pool in v2 is veranderd. Het bedrijf stelt ook ronduit dat de scores van Fugu Ultra v2 zijn behaald zonder Claude Fable 5, Claude Fable 5.1 of GPT-6 Astra in de agentpool — en claimt zo overwinningen op de drie sterkste beschikbare modellen terwijl het bevestigt dat het geen van hen aanroept. Wat de pool ook bevat, het is volgens Sakana's eigen telling niet de top van de markt.

Maar de hedge heeft een kostenpost die niet op de prijslijst staat. Je kunt de pool niet zien, je kunt een lid niet wel of niet aan de Ultra-tier laten deelnemen, je kunt niets ervan zelf hosten, en je kunt het helemaal niet in de EU/EER draaien — orchestration vanuit Singapore over de weights van andere labs is een ander risicoprofiel dan het bezitten van de weights. Qwen3.8-Max keert dat precies om. Het is het model van één leverancier en dus blootgesteld aan de beslissingen van één leverancier, maar Ali​baba heeft open weights gepubliceerd voor het Qwen3.8-2.4T-A95B-checkpoint in de Max-klasse onder een eigen licentie, wat betekent dat de ontsnappingsroute echt is in plaats van retorisch: als de prijs of de voorwaarden veranderen, kan het model vanaf je eigen infrastructuur worden geserveerd. Voor een team waarvan de werkelijke angst is dat een leverancier de stekker eruit trekt, is een downloadbaar checkpoint een sterkere garantie dan een belofte over een pool die je niet mag inspecteren.

Er is een secundair punt voor iedereen die agents op beide draait. Qwen3.8-Max staat in onze catalogus tegen $2,00 input en $6,00 output, wat Alibaba's listprijs is met 0% opslag doorberekend — een prijswijziging van een leverancier komt dezelfde dag op dezelfde key terecht, en automatische failover dekt een rate-limited of verslechterd providerpad. Fugu Ultra v2 staat niet op OrcaRouter. Het bereikt je via Sakana's eigen OpenAI-compatibele API en diverse platforms van derden, en overstappen van een eerdere Fugu is een wijziging van één regel in de parameters. Een router is geen vervanging voor een coördinator, en een coördinator is geen vervanging voor de mogelijkheid om te failoveren; als je beide eigenschappen wilt, draai je de systemen van twee leveranciers en moet je op twee facturen rekenen.

Welke je zou moeten kiezen

Kies Qwen3.8-Max als je een model nodig hebt dat je kunt voorspellen, verifiëren en waaruit je kunt ontsnappen. Het is tegen listprijs een derde van de outputsnelheid van Fugu Ultra v2, het heeft geen long-context-cliff, het accepteert afbeeldingen, video en pdf's, terwijl de modaliteit van de Fugu pool is wat de onderliggende agents toevallig ondersteunen, het publiceert een checkpoint waarop je kunt terugvallen, het wordt overal verkocht, en het heeft een live, onafhankelijke vermelding die de dingen meet die daadwerkelijk je factuur bepalen — 37,8 tokens per seconde en een kosten-per-taakcijfer dat je kunt modelleren voordat je je vastlegt. De zwakke punten zijn even specifiek en het benoemen waard: het is traag, staat op #154 van 200 qua snelheid, het is enorm verbose met 180 miljoen tokens op de index, en Artificial Analysis heeft afzonderlijk gemeten dat het hallucinatiepercentage steeg van 23% naar 40% ten opzichte van de vorige generatie, wat een ernstige zorg is voor precies het autonome werk in meerdere stappen waarvoor het op de markt wordt gebracht. Neem een verifier op in je budget, en benut de deep-cachekorting agressief.

Kies Fugu Ultra v2 als je werk een lange horizon heeft en controleerbaar is, je budget verkennend is in plaats van productie, en je buiten de EU/EER zit. Het structurele argument voor een coördinator is reëel en de voorbeelden van de leverancier zelf wijzen er consistent op — een geautomatiseerde onderzoeksrun van 123 experimenten over veertien uur op één H100, een Rubik's kubus-oplosser in pure Python die alle 300 door elkaar gehaalde kubussen oploste, terwijl twee geanonimiseerde frontier-baselines er ronduit uit klapten. Dat zijn door de leverancier geselecteerde voorbeelden met geanonimiseerde baselines, en ze bewijzen minder dan ze lijken te doen, maar het patroon is coherent: bij taken waar correctheid controleerbaar is en het moeilijke deel persistentie is, verslaat het spawnen van een verifier het vragen van één model om harder zijn best te doen. Wat je koopt is die persistentie, tegen een tarief dat vijf keer hoger is dan dat van Qwen3.8-Max, in een systeem waarvan je de kwaliteit niet kunt auditen en waarvan je de pool niet kunt vastzetten. Pilot het met een afgebakende scope, instrumenteer outputtokens per voltooide taak in plaats van per token, en stel een plafond in vóór de eerste run.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the model title, the 'Featured' badge, the identifier qwen/qwen3.8-max, vision, tools, JSON and reasoning capability tags, a 1M-token context window, text and image and video input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, and an OpenAI-compatible base URL with Python and cURL code samples.

De reden dat het prijskaartje het verkeerde getal aangeeft, is dat beide producten de kosten van een antwoord hebben losgekoppeld van de kosten van een token. Fugu Ultra v2 doet dat door uit te waaieren naar modellen die het niet bij naam noemt. Qwen3.8-Max doet dat door 180 miljoen tokens lang te denken. Als je je tokenvolume per taak al kent, is de rekensom triviaal en moet je die maken. De meeste teams kennen dat getal niet, en voor hen komt de beslissing neer op iets eenvoudigers: Qwen3.8-Max is de keuze die je kunt auditen, beprijzen en laten varen, en Fugu Ultra v2 is de keuze die erop gokt dat coördinatie het wint van capaciteit. Beide zijn verdedigbaar. Slechts één ervan komt met de bewijsstukken.