Hero-kort för matchningen Fugu Ultra v2 mot Grok 4.6, som kontrasterar ett orkestreringssystem med en enda resonemangsmodell med stor kontext.
Guides & Insights

Fugu Ultra v2 vs Grok 4.6: Fem gånger högre utdatapris, ett gemensamt benchmark

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det finns exakt ett riktmärke som Fugu Ultra v2 och Grok 4.6 båda publicerar en siffra för, och det är DeepSWE: Sakana AI rapporterar 74,3 för Fugu Ultra v2 i sitt tillkännagivande den 11 september 2026, medan xAIs lanseringsmaterial för Grok 4.6 anger dess egen DeepSWE v1.1-poäng till 65,9 %. Det är en skillnad på 8,4 punkter, och det är den enda rena jämförelse de två företagen erbjuder. Allt annat man skulle kunna ställa upp — Sakanas Chartography och SWEFish mot Groks GPQA Diamond och CursorBench — mäts med olika instrument av olika laboratorier. Så den ärliga frågan är inte ”vilken som är smartast”. Den är om Fugu Ultra v2:s påstådda försprång är värt att betala 30 dollar per miljon utdatatoken för, när Grok 4.6 tar 6 dollar.

Två olika svar på samma problem

Grok 4.6 är en enda modell, och den är den nuvarande flaggskeppsmodellen i Grok-serien – listad som "Latest" i leverantörens egen utvecklardokumentation, och efterträder Grok 4.5 med samma kontextfönster på 500 000 token, samma indata för text/bild/fil och samma baspris. Den har en kunskapsavgränsning den 1 februari 2026 och exponerar resonemangsansträngning på nivåerna low, medium, high och xhigh, där high är standard. En detalj som överraskar många: resonemanget kan inte stängas av. Tänkande tokens debiteras vid varje förfrågan, vilket gör att Grok 4.6:s verkliga utdatakostnad beror på hur hårt den bestämmer sig för att tänka.

Fugu Ultra v2 är inte alls en modell i vanlig bemärkelse. Det är den högsta kapacitetsnivån i Sakana AI:s orkestreringslinje – en enda OpenAI-kompatibel slutpunkt som delar upp en uppgift och skickar ut den över en pool av andra modeller, vissa med öppna vikter, vissa specialiserade. Sakanas formulering är att den når output på frontier-nivå "utan det oumbärliga beroendet av de frontlinjemodeller den orkestrerar", och man säger rakt ut att Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra är uteslutna från den poolen. Du betalar för schemaläggningslagret och för varje token som underagenterna förbrukar.

Den distinktionen är inte kosmetisk. Den är hela anledningen till att prisgapet finns, och den är det enda som gör gapet försvarbart.

Prislistorna, inklusive den del som upprepas

Indata — Fugu Ultra v2 $5.00 per 1M mot Grok 4.6 $2.00 per 1M. Fugu är 2,5× innan några underanrop sker.

Utdata — Fugu Ultra v2 $30,00 per 1 miljon mot Grok 4.6 $6,00 per 1 miljon. En 5× skillnad, och den som avgör de flesta räkningarna.

Cachad indata — $0.50 per 1M hos båda. Identiska. Två leverantörer som inte har något annat gemensamt hamnade på samma pris för cacheläsning, vilket gör cache-tunga agentloopar till den enda arbetsbelastning där de två verkligen är jämförbara rad för rad.

Omprissättning för lång kontext — Grok 4.6 fördubblar priset till $4.00 / $12.00 när en prompt överstiger 200 000 tokens, och omprissättningen gäller för hela begäran, inte bara den överskjutande delen. Fugu Ultra v2:s rapporterade nivå över ungefär 272 000 indatatokens flyttas till omkring $10.00 / $45.00, även den för hela begäran. Båda straffar långa prompter; Grok börjar straffa 72K tokens tidigare.

Kontextfönster — Grok 4.6 500K tokens vs Fugu Ultra v2 1M enligt tredjepartslistningar. Sakanas tillkännagivandesida anger ingen kontextsiffra alls, så betrakta dess 1M som obekräftad av leverantören.

Långkontextdebatten har två sidor och är värd att räkna på. En prompt på 300K tokens kostar dig $4.00 per miljon input på Grok 4.6 och omkring $10.00 på Fugu Ultra v2. En prompt på 150K tokens kostar $2.00 på Grok och $5.00 på Fugu. Sakanas modell är dyrare vid varje promptlängd – den enda frågan är hur ofta den behöver anropas.

Two-column comparison scoreboard for Fugu Ultra v2 and Grok 4.6 covering type, release date, input price ($5.00 vs $2.00 per million tokens), output price ($30.00 vs $6.00), cached input ($0.50 on both) and context window (1M reported vs 500K).

Argumentet för att betala 5× för output

Argumentet för en orkestrerare är inte att den är billigare per token. Det är att den behöver färre försök, och att de tokens den lägger på koordinering är billigare än de tokens du skulle lägga på att misslyckas.

Det är ett verkligt argument, och Sakana framför det uttryckligen: Fugu Ultra v2 riktar sig mot komplext arbete i flera steg – autonom forskning, fullstackutveckling – där en enskild modells felmod är att spåra ur halvvägs genom en lång körning. Om en outputkostnad på 30 dollar ger dig en uppgift slutförd vid första försöket i stället för det tredje, är tokenpremien irrelevant.

Det finns stödjande bevis från leverantörens egen sida, även om de är leverantörsvänliga och bör läsas med det i åtanke. xAI:s lanseringsmaterial för Grok 4.6 anger ungefär 53 turer och omkring 0,5 miljarder indatatoken för att lösa långsiktiga uppgifter, mot cirka 103 turer och 2,0 miljarder indatatoken för en konkurrerande frontmodell – ett argument för att Grok i sig är ekonomiskt per uppgift även vid ett lågt pris per token. Båda företagen gör samma sak: de knuffar dig bort från prislistan och mot kostnad per slutfört jobb.

Vilket innebär att det avgörande talet är ett som ingen av leverantörerna publicerar, och som du måste mäta själv: tokens som förbrukas, från början till slut, på en uppgift som liknar din.

Där var och en är genuint svag

Grok 4.6:s publicerade svaga punkt är terminalarbete. Poängen på Terminal-Bench v3.0 ligger på 26 %, långt efter toppen i fältet, även om samma modell uppnår en mycket starkare 88,4 % på det äldre Terminal-Bench v2.1 – det är olika tester, och att sammanblanda dem är ett misstag som man ser i mycket av bevakningen. Den har också den högsta GPQA Diamond-poängen i sin grupp på 94,9 %, men GPQA Diamond har sedan dess tagits bort från Artificial Analysis-indexet eftersom det anses vara mättat, så en hög poäng där skiljer inte längre mellan frontier-modeller på samma sätt som den gjorde för ett år sedan.

På oberoende håll bedömer Artificial Analysis Grok 4.6 till 44 i sitt Intelligence Index v4.3, rankad som #20 av 200, med en kostnad per uppgift på 1,86 USD. Den ofta cirkulerade siffran 61 kommer från en ersatt indexskala och bör inte citeras utan att man anger vilken version som producerade den.

Fugu Ultra v2:s svaga punkt är verifiering. Vid publiceringstillfället har inget av det Sakana har hävdat om den – de fem bäst-eller-delat-bästa resultaten, Chartography-poängen 48,3 mot Opus 5:s 27,3 och Fable 5:s 29,5, DeepSWE-poängen 74,3 – oberoende reproducerats. Det finns heller ingen publicerad siffra för latens eller genomströmning, vilket spelar större roll för en orkestrator än för en enskild modell, eftersom dess svarstid helt beror på vad den beslutar sig för att anropa. För den tidigare Fugu Ultra rapporterade testare offentligt körningar som sträckte sig upp till omkring 30 minuter; det är modellen från juni 2026, inte v2, men det är felmoden man bör testa för innan man satsar på en produktionsväg.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

En not om leverantörsnamnet

En sak som är värd att känna till innan du börjar leta efter Grok 4.6 i en utvecklarkonsol: modellen kallas konsekvent Grok 4.6, men leverantörens varumärke kring den är i förändring. xAI:s egen dokumentation bär nu namnet SpaceXAI, en förändring som de flesta rapporter om lanseringen ännu inte har hunnit ikapp. Modellidentifierarna och API-ytan är oförändrade — Grok 4.6 är en förstklassig OpenAI Responses-modell och passar in i befintliga verktygsanropsloopar utan ett översättningslager — men om du söker efter ett modellkort och varumärket ser fel ut, är det inte ditt fel.

Att anropa någon av dessa i praktiken

Grok 4.6 finns på OrcaRouter till leverantörens egen taxa — $2.00 per miljon input och $6.00 per miljon output, vidarebefordrat utan påslag, så en prisändring från leverantören når hit samma dag i stället för enligt ett migreringsschema. Det är OpenAI-kompatibelt på samma bas-URL som allt annat i katalogen, vilket innebär att du kan sätta det bakom en reservkedja eller en routningsregel i stället för att hårdkoda det, och du kan A/B-testa det mot en annan modell utan ett andra avtal eller en kodändring.

Fugu Ultra v2 routas inte av oss. Den finns tillgänglig via Sakana AI:s eget OpenAI-kompatibla API, och företaget säger att en befintlig Fugu-integration flyttas över till den med en enda parameterändring. Om du vill jämföra de två på din arbetsbelastning är det billigaste upplägget att låta Grok 4.6 ligga kvar på din gateway och anropa Fugu Ultra v2 direkt från Sakana bakom en funktionsflagga — båda talar samma förfrågningsformat, så samma testrigg fungerar på båda.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the grok/grok-4.6 identifier, a 500K token context window, and pricing of $2.00 per million input tokens and $6.00 per million output tokens.

Domen

Grok 4.6 är det rationella standardvalet för de flesta team, och prismässigt är det inte ens nära. Med $2.00 / $6.00, en cacheläsning på $0.50 och ett 500K-fönster hanterar det långdokumentresonemang, kodningsagenter och multimodalt filarbete till en femtedel av Fugu Ultra v2:s outputpris, och det är oberoende poängsatt och oberoende benchmarkat. Dess svaghet är promptlängd — 200K-klippan fördubblar hela förfrågan — och terminaltunga agentloopar, där dess publicerade poäng inte är konkurrenskraftiga.

Fugu Ultra v2är bara värt sitt premiumpris om du har en specifik typ av arbetsbelastning: långa, flerstegs- och autonomitunga uppgifter där en enskild modell tenderar att spåra ur, och där du dessutom vill ha den arkitektoniska egenskap som Sakana säljer — en kapabilitetsnivå som inte är beroende av att någon frontier-leverantör förblir tillgänglig eller förblir billig. Det är en verklig sak att vilja ha. Men det är ett påstående, ännu inte en mätning, och DeepSWE-gapet som får det att verka trovärdigt är ett enda benchmark från en enda leverantör på releasedagen.

Om du inte kan säga vilken av dina uppgifter som för närvarande misslyckas vid andra eller tredje försöket, har du ännu inte den siffra som skulle motivera prisskillnaden. Mät det först. Prislistorna säger dig redan allt annat.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen