
Fugu Max vs Grok 4.6: Identieke tariefkaarten, één gepubliceerde score
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Fugu Max en Grok 4.6 kosten exact hetzelfde. Sakana AI bracht Fugu Max uit op 11 september 2026, met een prijs van $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens — en dat is exact de tariefkaart die SpaceXAI Grok 4.6 in rekening brengt sinds die op 12 augustus werd gelanceerd. De toevalligheid is het nuttigste feit in deze vergelijking, want ze haalt de prijs uit de discussie. Wanneer twee producten dezelfde prijs rekenen, is de enige overgebleven vraag wat je voor dat geld krijgt, en daarin lopen ze volledig uiteen. Grok 4.6 is één model dat je op versie kunt vastzetten, waarvoor je een benchmarktabel kunt raadplegen en dat je tegen een onafhankelijke index kunt toetsen. Fugu Max is een getrainde coördinator die elke taak naar het goedkoopste model in zijn pool stuurt, en Sakanas aankondiging beweert dat het de beste totaalscore behaalt op zes benchmarks zonder ook maar één cijfer uit een van die benchmarks te noemen. Een van deze aankopen is meetbaar voordat je hem doet. De andere niet.
Twee producten, één tariefkaart
• Invoer — Fugu Max $2,00 per 1 miljoen tokens vs Grok 4.6 $2,00 per 1 miljoen tokens
• Uitvoer — Fugu Max $6,00 per 1 mln. tokens vs Grok 4.6 $6,00 per 1 mln. tokens
• Gecachte invoer — Fugu Max $0,25 per 1M tokens vs Grok 4.6 $0,50 per 1M tokens, de enige regel waar de twee prijzen überhaupt van elkaar verschillen
• Contextvenster — Fugu Max niet gepubliceerd door de leverancier versus Grok 4.6: 500.000 tokens, ongewijzigd ten opzichte van Grok 4.5
• Prijsherziening voor lange prompts — Fugu Max: geen tier vermeld in de release, tegenover Grok 4.6 dat verdubbelt naar $4,00 / $12,00 zodra één enkele aanvraag meer dan 200.000 tokens telt, toegepast op de hele aanvraag in plaats van op het overschreden deel
• Redeneercontrole — Fugu Max niet beschikbaar vs Grok 4.6 vier inspanningsniveaus, van laag tot xhigh, standaard op hoog en niet uit te schakelen
• Architectuur — Fugu Max, een getrainde coördinator over een niet bekendgemaakte pool die open-weight- en gespecialiseerde modellen bevat, voor Max uitgebreid met de NVIDIA Nemotron-familie via een samenwerking met NVIDIA, tegenover Grok 4.6: één model in één versie
• Onafhankelijke evaluatie — voor Fugu Max is niets gepubliceerd, en er bestaat geen Artificial Analysis-pagina voor welk Fugu-model dan ook, tegenover Grok 4.6 met een live Artificial Analysis Intelligence Index van 44, gerangschikt als #20 van de 200
De goedkope kolom is de onvoorspelbare
Kijk waar Fugu Max qua prijs echt wint: de cache-read, tegen de helft van die van Grok 4.6. Het is een echt voordeel, en het is precies de verkeerde plek om een kostenmodel op te bouwen, want cacheprijzen lonen alleen in verhouding tot je cachehitratio — en Sakana publiceert er geen voor Fugu Max. De release vermeldt ook geen contextvenster, geen long-contextniveau en geen outputplafond. Dus de enige kolom waarin Fugu Max Grok 4.6 onderbiedt, is een korting van onbekende grootte op een onbekend deel van je tokens.
De zwakke punten van Grok 4.6 zijn tenminste zichtbaar. De 200.000-tokendrempel is agressief: de hele aanvraag wordt opnieuw geprijsd, dus een prompt van 250.000 tokens wordt vanaf de eerste token tegen het dubbele tarief gefactureerd, niet vanaf de 200.001e token. Maar je kunt de klif zien, je prompts ertegen afmeten en beslissen of je ze moet opdelen. Dat is hier het verschil in soort: het ene systeem publiceert een prijsschema met een vorm waarmee je kunt plannen, en het andere publiceert een headline-tarief zonder dat er een schema aan vastzit.
Zes overwinningen en niet één keer gescoord
De benchmarks die Sakana noemt zijn Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench en SWEFish. Vijf daarvan zijn erkende publieke evaluaties. De zesde, SWEFish, is Sakanas eigen codebenchmark, wat betekent dat een van de zes geclaimde overwinningen wordt gescoord op een test die de leverancier zelf heeft geschreven en niet heeft vrijgegeven. Voor de andere vijf zegt de release dat Fugu Max de beste algemene score behaalt, en daar blijft het bij — geen score, geen marge, geen cijfer van een concurrent om ernaast te leggen.
Zet dat af tegen de tabel die SpaceXAI voor Grok 4.6 heeft gepubliceerd, die door de leverancier wordt gerapporteerd maar tenminste een tabel is: GDPVal-AA v2 op 1.753, AA-Briefcase op 1.577, DeepSWE v1.1 op 65,9%, CursorBench v3.2 op 69,9% en GPQA Diamond op 94,9%. Het lanceringsmateriaal meldt ook ongeveer 53 beurten en ongeveer een half miljard inputtokens om langetermijntaken op AA-Briefcase op te lossen, tegenover ongeveer 103 beurten en twee miljard tokens voor een concurrerend frontiermodel — een argument, wederom door de leverancier gerapporteerd, dat Grok goedkoop is per voltooide taak, zelfs bij een bescheiden tarief per token.
Twee van die Grok-cijfers moeten worden behandeld voordat je ze citeert. Het eerste is dat de opvallende GPQA Diamond-score van 94,9% afkomstig is van een benchmark die Artificial Analysis inmiddels als verzadigd heeft afgeschaft, waardoor die frontier-modellen niet meer scheidt zoals vroeger. Het tweede is het cijfer dat je in oudere berichtgeving zult tegenkomen: een Artificial Analysis Intelligence Index van 61 voor Grok 4.6. Dat was de schaal vóór de herziening. Artificial Analysis heeft de index in september 2026 opnieuw gekalibreerd, en het actuele cijfer is 44 op #20 van 200, met een kostenpost van $1,86 per Intelligence Index-taak. Wie Grok 4.6 op basis van een 61 tegenover Claude Fable 5 of GPT-5.6 Sol rangschikt, vergelijkt meetwaarden van twee verschillende instrumenten.

Wat de tokenprijs van een orchestrator niet omvat
Sakana's eigen berichtgeving over de release erkent het structurele probleem. Omdat Fugu Max binnen één enkele taak tussen modellen wisselt, kan het "hergebruik van de contextcache verminderen en ook extra orchestratietokens genereren" — en het bedrijf maakte noch de resulterende cache-hitratio, noch de totale tokenkosten per taak bekend. Elke agent die de coördinator aanmaakt, schrijft redeneer- en uitvoertekst, en dat alles wordt gefactureerd tegen $6,00 per miljoen. Het tarief is identiek aan dat van Grok 4.6. Het volume niet, en volume is de variabele die een prijzenpagina je niet kan tonen.
Beide leveranciers sturen je richting dezelfde correctie — stop met het vergelijken van tarieven, begin met het vergelijken van kosten per afgeronde opdracht — maar slechts één van hen geeft je een getal om mee te beginnen. Grok 4.6 komt met een gepubliceerd profiel van turns en tokens. Fugu Max komt met de instructie om het zelf te meten.
Er bestaat een redelijke lezing van Fugu Max' stilte, en die verdient het om te worden uitgesproken. Max is de op kosten geoptimaliseerde tier van de Fugu-lijn, op dezelfde dag uitgebracht als Fugu Ultra v2, de capaciteitspush tegen $5,00 input en $30,00 output. Sakana's visuele argument voor Max is een Pareto-grafiek — capaciteit tegenover kosten — en op een Pareto-grafiek doet een ruwe benchmarkscore er niet toe; score-per-dollar is de hele claim. Als dat het argument is, dan zou het afdrukken van zes winnende scores zonder hun kosten de misleidende grafiek zijn, niet de ontbrekende. Wat de release een koper nog steeds schuldig is, is een noemer, en die levert hij niet.
Waar Grok 4.6 echt wordt blootgesteld
Terminalwerk is het zwakste gepubliceerde gebied van Grok 4.6. De score op Terminal-Bench v3.0 staat op 26%, ver achter de voorhoede. Wees voorzichtig met het naburige cijfer: hetzelfde model scoort 88,4% op Terminal-Bench v2.1, en dat zijn verschillende tests. Je zult zien dat de twee in de berichtgeving door elkaar worden gehaald, en die vermenging stelt Grok aanzienlijk gunstiger voor.
De tweede blootstelling is dat redeneren niet kan worden uitgeschakeld. Denk-tokens worden bij elk verzoek in rekening gebracht, dus de effectieve uitvoerkosten van Grok 4.6 hangen af van hoe hard het model besluit na te denken over je prompt. De inspanningsknop geeft je aan de onderkant controle, maar er is geen nulstand.
Daar staat tegenover dat Grok 4.6 iets heeft wat Fugu Max momenteel tegen geen enkele prijs kan bieden: een getal. Elke rij hierboven kan door een derde partij worden gecontroleerd, en de vermelding in Artificial Analysis betekent dat er al één is gecontroleerd. De zes overwinningen van Fugu Max werden op dezelfde dag als het model gepubliceerd, door het bedrijf dat het heeft gebouwd, en op het moment van schrijven heeft niemand buiten Sakana het gedraaid.
De een oproepen, de ander besturen
Grok 4.6 staat op OrcaRouter tegen de lijstprijs van SpaceXAI — $2,00 per miljoen input, $0,50 bij een cache-hit, $6,00 per miljoen output — doorgegeven met 0% opslag, dus een prijswijziging van de leverancier bereikt onze gateway dezelfde dag in plaats van volgens een migratieschema. Het is OpenAI-compatibel op dezelfde basis-URL als de rest van de catalogus, wat betekent dat je het in een failover-keten kunt opnemen of achter een voorwaardelijke routeringsregel kunt plaatsen in plaats van een provider hard te coderen in een productiepad, en je kunt het A/B-testen tegen een ander model zonder een tweede contract. Het verwerkte in de afgelopen zeven dagen 46,6 miljoen tokens via de gateway.
Fugu Max staat niet in onze catalogus. Het bereikt je via Sakana's eigen OpenAI-compatibele API en verschillende platforms van derden, en het bedrijf zegt dat een bestaande Fugu-integratie met één parameterwijziging naar dit model upgradet. Omdat beide hetzelfde aanvraagformaat spreken, is een evaluatie die ze achter één flag plaatst een kwestie van de base-URL verwisselen in plaats van herschrijven — wat de juiste manier is om dit specifieke meningsverschil te beslechten, aangezien het meningsverschil gaat over tokens per afgeronde taak en alleen jouw eigen workload dat aantal kan opleveren.

Welke moet ik kopen
Grok 4.6 is de verdedigbare standaardkeuze. Tegen een tariefkaart die identiek is aan die van Fugu Max, geeft het je een contextvenster van 500K waarop je kunt plannen, een versie die je kunt vastpinnen, vier niveaus van redeneercontrole, een onafhankelijke indexpositie op 44 met daarnaast een kosten-per-taakcijfer, en maanden van metingen door derden. De kosten zijn specifiek en bekend: de herprijzingsklif van 200K, redeneren dat altijd wordt gefactureerd, en een terminalwerkprofiel dat achterblijft bij de rest.
Fugu Max is de interessantere gok en, op basis van het beschikbare bewijs, de minder goed te inspecteren optie. De argumentatie voor het ontwerp is solide — als een coördinator betrouwbaar het goedkoopste model kiest dat je taak kan afronden, dalen je mediane kosten per voltooide opdracht, zelfs als je tariefkaart dat niet doet. Maar bij $2,00 / $6,00 zit het voordeel van Fugu Max niet in het tokentarief; dat tarief is precies dat van Grok 4.6. Het voordeel moet voortkomen uit het verbruiken van minder tokens, en Sakana heeft niet de meting gepubliceerd die zou aantonen dat dat het geval is.
Dus voer de vergelijking uit zoals beide leveranciers je vragen. Zet Grok 4.6 op je gateway, roep Fugu Max aan achter een feature flag, en tel de outputtokens per afgeronde taak bij werk dat op het jouwe lijkt. Als Fugu Max met minder tokens klaar is dan een enkel model tegen hetzelfde tarief, dan zijn de cachekorting en de coördinatie echt geld en is de overstap gerechtvaardigd. Als dat niet zo is, betaal je identieke tarieven voor een systeem waarvan de samenstelling onder je vandaan kan veranderen zonder dat het versienummer beweegt.
Voor alles wat je dit kwartaal zonder die meting kunt beslissen, begin met het model dat een scorebord heeft.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
