Ett framträdande titelkort med texten 'Fugu Max vs Grok 4.6' och underrubriken 'Identiska prislistor, en publicerad poäng', tre pillerformade märken med texten '$2.00 vs $2.00 input', '$6.00 vs $6.00 output' och 'Sex vinster, noll siffror', en sidfotsrad med texten 'Sakana AI, september 2026 vs SpaceXAI, augusti 2026', samt OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Fugu Max vs Grok 4.6: Identiska prislistor, en publicerad poäng

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Fugu Max och Grok 4.6 kostar exakt lika mycket. Sakana AI släppte Fugu Max den 11 september 2026, prissatt till 2,00 dollar per miljon indatatoken och 6,00 dollar per miljon utdatatoken – och det är rad för rad samma prislista som SpaceXAI har tagit för Grok 4.6 sedan lanseringen den 12 augusti. Sammanfallet är det mest användbara faktumet i den här jämförelsen, eftersom det raderar priset ur argumentationen. När två produkter faktureras identiskt är den enda fråga som återstår vad man får för pengarna, och där skiljs de två helt och hållet åt. Grok 4.6 är en enda modell som du kan låsa till en specifik version, läsa en benchmarktabell för och kontrollera mot ett oberoende index. Fugu Max är en tränad koordinator som skickar varje uppgift till den billigaste modellen i sin pool, och Sakanas tillkännagivande hävdar att den tar bästa totalpoäng på sex benchmarks utan att publicera en enda siffra från någon av dem. Ett av dessa köp går att mäta innan du gör det. Det andra gör det inte.

Två produkter, en prislista

• Indata — Fugu Max $2.00 per 1 miljon tokens vs Grok 4.6 $2.00 per 1 miljon tokens

• Utdata — Fugu Max $6,00 per 1 miljon tokens vs Grok 4.6 $6,00 per 1 miljon tokens

• Cachad indata — Fugu Max $0,25 per 1 miljon tokens mot Grok 4.6 $0,50 per 1 miljon tokens, den enda raden där de två priserna överhuvudtaget skiljer sig

• Kontextfönster – Fugu Max inte publicerat av leverantören vs Grok 4.6 500 000 tokens, oförändrat från Grok 4.5

• Omprissättning för långa prompter – Fugu Max har ingen nivå angiven i releasen, medan Grok 4.6 fördubblas till 4,00 $ / 12,00 $ när en enskild begäran passerar 200 000 token, vilket tillämpas på hela begäran i stället för på den överskjutande delen

• Resonemangskontroll — Fugu Max exponeras inte jämfört med Grok 4.6:s fyra ansträngningsnivåer, från low till xhigh, med high som standard och som inte går att stänga av

• Arkitektur — Fugu Max en tränad koordinator över en icke avslöjad pool som inkluderar öppna vikter och specialiserade modeller, utökad för Max med NVIDIA Nemotron-familjen genom ett samarbete med NVIDIA vs Grok 4.6 en modell i en version

• Oberoende utvärdering — ingen har publicerats för Fugu Max, och det finns ingen Artificial Analysis-sida för någon Fugu-modell jämfört med Grok 4.6, som har ett aktuellt Artificial Analysis Intelligence Index på 44, rankat #20 av 200

Den billiga kolumnen är den oförutsägbara

Titta på var Fugu Max faktiskt vinner på pris: cacheläsningen, till hälften av Grok 4.6:s. Det är en verklig fördel, och det är precis fel ställe att bygga en kostnadsmodell på, eftersom cacheprissättning bara lönar sig i proportion till din cacheträfffrekvens — och Sakana publicerar ingen sådan för Fugu Max. Släppet anger inte heller något kontextfönster, ingen nivå för lång kontext och inget tak för utdata. Så den enda kolumnen där Fugu Max underbjuder Grok 4.6 är en rabatt av okänd storlek som tillämpas på en okänd andel av dina tokens.

Grok 4.6:s svagheter är åtminstone synliga. Dess tröskel på 200 000 token är aggressiv – den räknar om priset för hela begäran, så en prompt på 250 000 token faktureras till dubbel taxa från första token, inte den 200 001:a. Men du kan se stupet, mäta dina prompter mot det och avgöra om du ska dela upp dem. Det är skillnaden i art här: ett system publicerar ett prisschema med en form du kan planera efter, och det andra publicerar en annonserad taxa utan något tillhörande schema.

Sex segrar och inte ett enda mål

De benchmarks som Sakana nämner är Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench och SWEFish. Fem av dem är erkända offentliga utvärderingar. Den sjätte, SWEFish, är Sakanas egen kodningsbenchmark, vilket innebär att en av de sex påstådda segrarna har poängsatts i ett test som leverantören har skrivit och inte har släppt. För de övriga fem sägs det i uttalandet att Fugu Max uppnår bästa totalpoäng och sedan inget mer – ingen poäng, ingen marginal, inget konkurrentresultat att ställa bredvid.

Ställ det mot tabellen som SpaceXAI publicerade för Grok 4.6, vilken genomgående bygger på leverantörens egna uppgifter men åtminstone är en tabell: GDPVal-AA v2 på 1 753, AA-Briefcase på 1 577, DeepSWE v1.1 på 65,9 %, CursorBench v3.2 på 69,9 % och GPQA Diamond på 94,9 %. Lanseringsmaterialet rapporterar också ungefär 53 turer och omkring en halv miljard indatatoken för att lösa uppgifter med lång tidshorisont på AA-Briefcase, mot ungefär 103 turer och två miljarder token för en konkurrerande frontmodell – ett argument, återigen baserat på leverantörens egna uppgifter, för att Grok är billig per slutfört jobb även vid en blygsam kostnad per token.

Två av de där Grok-siffrorna behöver hanteras innan du citerar dem. Den första är att dess huvudsakliga GPQA Diamond-poäng på 94,9 % kommer från ett benchmark som Artificial Analysis sedan dess har tagit ur bruk som mättat, så det skiljer inte längre ut frontier-modeller på samma sätt som det en gång gjorde. Den andra är siffran du kommer att se i äldre bevakning: ett Artificial Analysis Intelligence Index på 61 för Grok 4.6. Det var skalan före omräkningen. Artificial Analysis kalibrerade om indexet i september 2026, och den aktuella siffran är 44 på #20 av 200, med en kostnad på 1,86 USD per Intelligence Index-uppgift. Den som rankar Grok 4.6 mot Claude Fable 5 eller GPT-5.6 Sol utifrån en 61:a jämför mätvärden från två olika instrument.

A two-column scoreboard titled 'Fugu Max vs Grok 4.6 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Grok 4.6: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.50 per 1M, context 500K with a 200K repricing cliff, benchmarks GDPVal 1,753 and DeepSWE 65.9%, evidence Artificial Analysis Index 44 ranked #20 of 200. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Grok 4.6 rows SpaceXAI-reported and per Artificial Analysis. No independent Fugu Max evaluation exists.' OrcaRouter logo bottom-right.

Vad en orkestrators tokenpris inte inkluderar

Sakanas egen bevakning av lanseringen medger det strukturella problemet. Eftersom Fugu Max växlar mellan modeller inom en och samma uppgift kan det "minska återanvändningen av kontextcache och även generera extra orkestreringstoken" — och företaget redovisade inte den resulterande träffrekvensen i cachen eller en total tokenkostnad per uppgift. Varje agent som koordinatorn startar skriver resonemangstext och utdatatext, och allt debiteras med $6,00 per miljon. Taxan är identisk med Grok 4.6:s. Volymen är inte det, och volymen är den variabel som en prissida inte kan visa dig.

Båda leverantörerna knuffar dig mot samma korrigering — sluta jämföra priser, börja jämföra kostnad per färdigt jobb — men bara en av dem ger dig en siffra att utgå från. Grok 4.6 kommer med en publicerad profil för turer och tokens. Fugu Max kommer med en instruktion om att mäta det själv.

Det finns en rimlig tolkning av tystnaden från Fugu Max, och den förtjänar att sägas. Max är den kostnadsoptimerade nivån i Fugu-serien och släpptes samma dag som Fugu Ultra v2, som är förmågesatsningen med $5.00 i input och $30.00 i output. Sakanas visuella argument för Max är ett Pareto-diagram – förmåga mot kostnad – och i ett Pareto-diagram är en rå benchmark-poäng irrelevant; poäng per dollar är hela påståendet. Om det är argumentet skulle att trycka sex vinnande poäng utan deras kostnader vara det vilseledande diagrammet, inte det saknade. Vad lanseringen fortfarande är skyldig en köpare är en nämnare, och den tillhandahåller ingen.

Där Grok 4.6 verkligen är exponerad

Terminalarbete är Grok 4.6:s svagaste offentliggjorda område. Dess poäng på Terminal-Bench v3.0 ligger på 26 %, långt efter täten. Var försiktig med siffran intill: samma modell uppnår 88,4 % på Terminal-Bench v2.1, och det är olika tester. Du kommer att se de två sammanblandas i bevakningen, och sammanblandningen smickrar Grok avsevärt.

Den andra exponeringen är att resonemang inte kan stängas av. Tänkande tokens faktureras vid varje begäran, så Grok 4.6:s effektiva utdatakostnad beror på hur hårt modellen väljer att tänka kring din prompt. Ansträngningsratten ger dig kontroll i den nedre änden, men det finns ingen nollinställning.

Mot det har Grok 4.6 något som Fugu Max för närvarande inte kan erbjuda till något pris: ett nummer. Varje rad ovan kan kontrolleras av en tredje part, och posten hos Artificial Analysis innebär att en redan har gjort det. Fugu Max sex segrar publicerades samma dag som modellen, av företaget som byggde den, och i skrivande stund har ingen utanför Sakana kört den.

Anropar en, piloterar den andra

Grok 4.6 finns på OrcaRouter till SpaceXAI:s listpris – 2,00 USD per miljon indata, 0,50 USD vid cacheträff, 6,00 USD per miljon utdata – vidarebefordras med 0 % påslag, så en prisförändring från leverantören når vår gateway samma dag i stället för enligt ett migreringsschema. Den är OpenAI-kompatibel på samma bas-URL som resten av katalogen, vilket innebär att du kan lägga in den i en failover-kedja eller bakom en villkorlig routningsregel i stället för att hårdkoda en leverantör i en produktionsväg, och du kan A/B-testa den mot en annan modell utan ett andra avtal. Den flyttade 46,6 miljoner tokens genom gatewayen under de senaste sju dagarna.

Fugu Max finns inte i vår katalog. Det nås via Sakanas eget OpenAI-kompatibla API och flera tredjepartsplattformar, och företaget säger att en befintlig Fugu-integration uppgraderas till det med en enda parameterändring. Eftersom båda talar samma begärandeformat är en utvärdering som ställer dem bakom en gemensam flagga ett byte av bas-URL snarare än en omskrivning — vilket är rätt sätt att avgöra just den här diskussionen, eftersom diskussionen handlar om tokens per slutförd uppgift och bara din egen arbetsbelastning kan ta fram den siffran.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the introductory argument that a system deploying a multi-trillion-parameter model for a simple lookup is wasteful, and a cost-versus-performance chart placing Fugu Max on a frontier formed by Fugu models above the frontier formed by single models.

Vilken ska man köpa

Grok 4.6 är det försvarbara standardvalet. Med en prislista identisk med Fugu Max:s ger den dig ett 500K-kontextfönster som du kan planera utifrån, en version som du kan låsa, fyra nivåer av resonemangskontroll, en oberoende indexplacering på 44 med en kostnad-per-uppgift-siffra bredvid, och månader av tredjepartsmätning. Dess kostnader är specifika och kända: 200K-omprissättningsklippan, resonemang som alltid faktureras, och en terminalarbetsprofil som ligger efter fältet.

Fugu Max är den mer intressanta satsningen och, utifrån den bevisning som finns, den mindre inspekterbara. Designmotiveringen är sund – om en koordinator pålitligt väljer den billigaste modellen som kan slutföra din uppgift, sjunker din mediankostnad per slutfört jobb även när din prislista inte gör det. Men vid $2,00 / $6,00 är tokenpriset inte där fördelen med Fugu Max ligger; den prisnivån är exakt Grok 4.6:s. Fördelen måste komma från att förbruka färre tokens, och Sakana har inte publicerat den mätning som skulle visa att så är fallet.

Så kör jämförelsen på det sätt som båda leverantörerna ber dig att göra. Sätt Grok 4.6 på din gateway, anropa Fugu Max bakom en funktionsflagga och räkna utdata-tokens per slutförd uppgift för arbete som liknar ditt. Om Fugu Max blir klar med färre tokens än en enskild modell till samma pris är cacherabatten och koordineringen riktiga pengar, och bytet är motiverat. Om den inte gör det betalar du identiska priser för ett system vars sammansättning kan förändras under dina fötter utan att dess versionsnummer ändras.

För allt du kan besluta det här kvartalet utan den mätningen, börja med modellen som har en resultattavla.

A screenshot of the OrcaRouter model page for Grok 4.6 (English UI, captured September 11, 2026), showing the NEW and Featured badges, the identifier grok/grok-4.6, by SpaceXAI dated 2026-08-12, vision, tools, JSON and reasoning capability tags, a 500K-token context window with text, image and file input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, traffic of 46.6 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen