Hero-kaart voor de confrontatie Fugu Ultra v2 versus Grok 4.6, waarin een orkestratiesysteem tegenover één enkel redeneermodel met grote context wordt geplaatst.
Guides & Insights

Fugu Ultra v2 vs Grok 4.6: vijf keer zo hoge outputprijs, één gedeelde benchmark

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Er is precies één benchmark waarop Fugu Ultra v2 en Grok 4.6 beide een cijfer publiceren, en dat is DeepSWE: Sakana AI rapporteert 74,3 voor Fugu Ultra v2 in zijn aankondiging van 11 september 2026, terwijl het lanceermateriaal van xAI voor Grok 4.6 zijn eigen DeepSWE v1.1-score op 65,9% stelt. Dat is een verschil van 8,4 punten, en het is de enige zuivere vergelijking die de twee bedrijven bieden. Al het andere dat je naast elkaar zou kunnen zetten — Sakana's Chartography en SWEFish tegenover Grok's GPQA Diamond en CursorBench — wordt met verschillende instrumenten door verschillende laboratoria gemeten. Dus de eerlijke vraag is niet "wie is slimmer". Het is de vraag of de beweerde voorsprong van Fugu Ultra v2 het waard is om $30 per miljoen outputtokens voor te betalen, terwijl Grok 4.6 $6 rekent.

Twee verschillende antwoorden op hetzelfde probleem

Grok 4.6 is één enkel model en het huidige vlaggenschip van de Grok-lijn — vermeld als "Latest" in de eigen ontwikkelaarsdocumentatie van de leverancier, als opvolger van Grok 4.5 met hetzelfde contextvenster van 500.000 tokens, dezelfde invoermogelijkheden voor tekst, afbeeldingen en bestanden en dezelfde basisprijs. Het heeft een kennisafsluitdatum van 1 februari 2026 en biedt reasoning effort op de niveaus low, medium, high en xhigh, waarbij high de standaard is. Eén detail dat mensen verrast: redeneren kan niet worden uitgeschakeld. Denktokens worden bij elk verzoek gefactureerd, waardoor de werkelijke uitvoerkosten van Grok 4.6 afhangen van hoe hard het besluit na te denken.

Fugu Ultra v2 is niet echt een model in de gebruikelijke zin. Het is het hoogste capaciteitsniveau van Sakana AI's orchestratielijn — één OpenAI-compatibel endpoint dat een taak opsplitst en over een pool van andere modellen verdeelt, sommige open-weights, sommige gespecialiseerd. Sakana's framing is dat het frontier-niveau output bereikt "zonder de onmisbare afhankelijkheid van de frontiermodellen die het orkestreert," en het stelt ronduit dat Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra van die pool zijn uitgesloten. Je betaalt voor de planningslaag, en voor elke token die de subagenten verbruiken.

Dat onderscheid is niet cosmetisch. Het is de hele reden dat het prijsverschil bestaat, en het is het enige dat het verschil verdedigbaar maakt.

De tariefkaarten, inclusief het deel dat zich herhaalt

Invoer — Fugu Ultra v2 $5,00 per 1 mln vs Grok 4.6 $2,00 per 1 mln. Fugu is 2,5× voordat er subaanroepen plaatsvinden.

Output — Fugu Ultra v2 $30,00 per 1M tegenover Grok 4.6 $6,00 per 1M. Een verschil van 5×, en dat is wat de meeste rekeningen bepaalt.

Gecachte invoer — $0,50 per 1M bij beide. Identiek. Twee aanbieders die verder niets gemeen hebben, kwamen uit op dezelfde prijs voor het lezen van de cache, waardoor cache-intensieve agent-loops de enige workload zijn waarin de twee echt regel voor regel vergelijkbaar zijn.

Prijsherziening voor lange contexten — Grok 4.6 verdubbelt naar $4,00 / $12,00 zodra een prompt de 200.000 tokens overschrijdt, en de prijsherziening geldt voor het hele verzoek, niet alleen voor het overschot. De gerapporteerde tier van Fugu Ultra v2 boven ongeveer 272.000 invoertokens gaat naar ongeveer $10,00 / $45,00, ook voor het hele verzoek. Beide bestraffen lange prompts; Grok begint 72K tokens eerder te bestraffen.

Contextvenster — Grok 4.6 500K tokens vs Fugu Ultra v2 1M zoals vermeld in externe listings. Op de aankondigingspagina van Sakana wordt helemaal geen contextwaarde vermeld, dus beschouw de 1M als niet door de leverancier bevestigd.

De discussie over lange context snijdt aan twee kanten en het loont de moeite om de rekensom te maken. Een prompt van 300K tokens kost je $4,00 per miljoen input op Grok 4.6 en ongeveer $10,00 op Fugu Ultra v2. Een prompt van 150K tokens kost $2,00 op Grok en $5,00 op Fugu. Het model van Sakana is bij elke promptlengte duurder — de enige vraag is hoe vaak het moet worden aangeroepen.

Two-column comparison scoreboard for Fugu Ultra v2 and Grok 4.6 covering type, release date, input price ($5.00 vs $2.00 per million tokens), output price ($30.00 vs $6.00), cached input ($0.50 on both) and context window (1M reported vs 500K).

Het argument om 5× te betalen voor output

Het argument voor een orchestrator is niet dat hij per token goedkoper is. Het is dat hij minder pogingen nodig heeft, en dat de tokens die hij aan coördinatie besteedt goedkoper zijn dan de tokens die je zou besteden aan mislukken.

Dat is een reëel argument, en Sakana brengt het expliciet naar voren: Fugu Ultra v2 is gericht op complex werk in meerdere stappen — autonoom onderzoek, full-stackontwikkeling — waarbij het faalpatroon van één enkel model is dat het halverwege een lange run ontspoort. Als een outputtarief van $30 je een taak oplevert die bij de eerste poging wordt afgerond in plaats van bij de derde, is de premie per token irrelevant.

Er is ondersteunend bewijs van de leverancier zelf, hoewel het in het voordeel van de leverancier is en als zodanig moet worden gelezen. Het lanceringsmateriaal van xAI voor Grok 4.6 noemt ongeveer 53 beurten en circa 0,5 miljard inputtokens om langetermijntaken op te lossen, tegenover ongeveer 103 beurten en 2,0 miljard inputtokens voor een concurrerend frontiermodel — een argument dat Grok zelf per taak voordelig is, zelfs bij een lage prijs per token. Beide bedrijven maken dezelfde beweging: ze duwen je weg van de tariefkaart en naar kosten per afgeronde taak.

Wat betekent dat het beslissende getal er een is dat geen van beide leveranciers publiceert, en dat je het zelf moet meten: verbruikte tokens, van begin tot eind, bij een taak die op de jouwe lijkt.

Waar elk van hen echt zwak is

De gepubliceerde zwakke plek van Grok 4.6 is werk in de terminal. De Terminal-Bench v3.0-score ligt op 26%, ver achter de top van het veld, ook al behaalt hetzelfde model een veel sterkere 88,4% op de oudere Terminal-Bench v2.1 — dat zijn verschillende tests, en ze door elkaar halen is een fout die je in veel berichtgeving zult zien. Het heeft ook de hoogste GPQA Diamond-score van zijn cohort, met 94,9%, maar GPQA Diamond is sindsdien omdat het verzadigd is uit de Artificial Analysis-index verwijderd, dus een hoge score daar maakt niet langer onderscheid tussen frontier-modellen zoals een jaar geleden.

Aan de onafhankelijke kant geeft Artificial Analysis Grok 4.6 een score van 44 op zijn Intelligence Index v4.3, gerangschikt als #20 van de 200, tegen een kostprijs per taak van $1,86. Het vaak gecirculeerde cijfer van 61 komt van een achterhaalde indexschaal en mag niet worden geciteerd zonder te vermelden welke versie het heeft voortgebracht.

Het zwakke punt van Fugu Ultra v2 is verificatie. Op het moment van publicatie is niets van wat Sakana erover heeft beweerd — de vijf beste of gedeeld beste resultaten, de Chartography-score van 48,3 tegen de 27,3 van Opus 5 en de 29,5 van Fable 5, de DeepSWE van 74,3 — onafhankelijk gereproduceerd. Er is ook geen gepubliceerd cijfer voor latentie of doorvoer, wat voor een orchestrator meer van belang is dan voor een enkel model, omdat de responstijd volledig afhangt van wat het besluit aan te roepen. Voor de vorige Fugu Ultra meldden testers publiekelijk runs die konden oplopen tot ongeveer 30 minuten; dat is het model van juni 2026, niet v2, maar het is het faalpatroon waarop je moet testen voordat je een productiepad vastlegt.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

Een opmerking over de naam van de leverancier

Eén eigenaardigheid die je moet weten voordat je in een ontwikkelaarsconsole naar Grok 4.6 gaat zoeken: het model wordt consequent Grok 4.6 genoemd, maar de branding van de leverancier eromheen is in beweging. De documentatie van x​AI zelf vermeldt nu de naam SpaceXAI, een wijziging die de meeste berichtgeving over de lancering nog niet heeft opgepikt. De model-ID's en het API-oppervlak zijn ongewijzigd — Grok 4.6 is een eersteklas Ope​nAI Responses-model en past zonder vertaallaag in bestaande tool-calling-loops — maar als je naar een modelkaart zoekt en de branding ziet er verkeerd uit, dan is dat niet jouw fout.

Een van beide in de praktijk aanroepen

Grok 4.6 staat op OrcaRouter tegen het eigen tarief van de provider — $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens, doorgegeven zonder enige markup, zodat een prijswijziging van de leverancier hier dezelfde dag doorkomt in plaats van volgens een migratieschema. Het is OpenAI-compatibel op dezelfde basis-URL als al het andere in de catalogus, wat betekent dat je het achter een fallback-keten of routeringsregel kunt plaatsen in plaats van het hard te coderen, en je kunt het A/B-testen tegen een ander model zonder een tweede contract of een codewijziging.

Fugu Ultra v2 wordt niet door ons gerouteerd. Het is beschikbaar via de eigen OpenAI-compatibele API van Sakana AI, en het bedrijf zegt dat een bestaande Fugu-integratie met één parameterwijziging daarop overstapt. Als je de twee op je werklast wilt vergelijken, is de goedkoopste opzet om Grok 4.6 op je gateway te laten staan en Fugu Ultra v2 rechtstreeks vanaf Sakana aan te roepen achter een feature flag — beide gebruiken hetzelfde aanvraagformaat, dus dezelfde testharness werkt voor beide.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the grok/grok-4.6 identifier, a 500K token context window, and pricing of $2.00 per million input tokens and $6.00 per million output tokens.

Het vonnis

Grok 4.6 is de rationele standaardkeuze voor de meeste teams, en qua prijs is het geen wedstrijd. Voor $2,00 / $6,00 met een cacheread van $0,50 en een venster van 500K verwerkt het redeneren over lange documenten, coding-agents en multimodaal bestandswerk tegen een vijfde van het outputtarief van Fugu Ultra v2, en het wordt onafhankelijk gescoord en onafhankelijk gebenchmarkt. De blootstelling ervan is promptlengte — de 200K-kloof verdubbelt het hele verzoek — en agent-loops met veel terminalgebruik, waar de gepubliceerde scores niet concurrerend zijn.

Fugu Ultra v2 is alleen zijn premium waard als je een specifiek soort workload hebt: lange, uit meerdere stappen bestaande taken met veel autonomie, waarbij één model de neiging heeft te ontsporen, en waarbij je ook de architecturale eigenschap wilt die Sakana verkoopt — een capaciteitsniveau dat er niet van afhankelijk is of een frontier-leverancier beschikbaar blijft of goedkoop blijft. Dat is iets wat je echt kunt willen. Maar het is een claim, nog geen meting, en de DeepSWE-kloof die het geloofwaardig doet lijken, is één benchmark van één leverancier op de dag van release.

Als je niet kunt zeggen welke van je taken momenteel bij de tweede of derde poging mislukt, heb je nog niet het getal dat het prijsverschil zou rechtvaardigen. Meet dat eerst. De tariefkaarten vertellen je al al het andere.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt