
Sakana Fugu Ultra v2, förklarat: poolen blev mindre och poängen gick upp
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Fugu Ultra v2 är en märklig sorts uppgradering: Sakana AI lanserade den 11 september 2026 med en modellpool som inte längre innehåller Claude Fable 5, Claude Fable 5.1 eller GPT-6 Astra – tre av de starkaste systemen som nu finns på marknaden – och hävdar fortfarande att den slår alla tre. Tokyolabbets nya flaggskepp i kvalitetssegmentet, som släpptes samma dag som ett billigare syskon som heter Fugu Max, är bäst eller delar förstaplatsen i fem av åtta benchmarks i Sakanas egen utvärdering, inklusive 48,3 på Chartography mot Claude Opus 5 på 27,3 och Claude Fable 5 på 29,5, och 74,3 på DeepSWE. Inget av dessa värden har oberoende reproducerats, och det finns fortfarande ingen Artificial Analysis-sida för någon Fugu-modell. Det gapet är hela historien: det du ombeds köpa är ett koordineringslager vars hela säljargument är att det inte behöver de bästa modellerna för att producera de bästa svaren.
Sakana AI grundades 2023 av Llion Jones, medförfattare till Transformer-artikeln, och David Ha. Fugu-serien lanserades i juni 2026 som ett multiagentsystem som levereras som en enda modell: du anropar en OpenAI-kompatibel slutpunkt, och bakom den delar en tränad koordinator upp begäran, startar agenter och syntetiserar resultatet. Forskningen är verklig och publicerad – TRINITY (arXiv 2512.04695) evolverade fram en lättviktskoordinator som tilldelar rollerna Thinker, Worker och Verifier; Conductor (arXiv 2512.04388) lärde sig att koordinera mellan agenter på naturligt språk; Fugu:s tekniska rapport finns på arXiv 2606.21228. Det Sakana aldrig har publicerat är det som alla faktiskt vill ha: identiteten på modellerna i poolen och routningsbesluten per uppgift.
Vad förändrades egentligen jämfört med Fugu Ultra från juni?
Version 2.0 är en punktuppdatering ungefär elva veckor efter originalet, inte en ny arkitektur. Leverantörens egen formulering är att Fugu Ultra v2 och Fugu Max är "samma kärnarkitektur för orkestrering" inställda för två olika uppdrag: Max driver kostnads-prestanda-gränsen nedåt, Ultra driver toppkapaciteten uppåt. Modell-ID:t är fugu-ultra-v2.0, och Sakana säger att migrering från en tidigare Fugu är en parameterändring på en rad utan SDK-migrering — vilket är det mest konsumentvänliga med lanseringen.
De väsentliga förändringarna är de två bokstöden. För det första flyttades träningsavskärningen till 20260828, så koordinatorn har återjusterats mot den nuvarande generationen av frontier-modeller. För det andra, och mycket mer intressant, förändrades poolens sammansättning på ett sätt som Sakana valde att göra reklam för: Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra är uttryckligen uteslutna. Sakanas argument är att detta bevisar att poängen inte beror på en enda proprietär frontier-modell, vilket spelar roll om din oro är leverantörsinlåsning, API-återkallelser eller att en modell försvinner bakom exportkontroller.
Det finns en andra ordningens konsekvens som Sakana inte uppehåller sig vid. Om urvalsgruppen utesluter de tre starkaste tillgängliga modellerna, görs benchmarkjämförelserna mot Fable 5 och Fable 5.1 mot system som orkestreraren inte skulle kunna anropa ens om den ville. Jämförelsen är legitim – den är ett påstående om arkitekturen, inte om åtkomst – men det är inte ett likvärdigt test av vem som har den bättre modellen. Det är ett test av huruvida koordinering slår rå kapacitet. Det är en genuint intressant fråga. Det är helt enkelt inte den fråga som resultattavlan antyder vid en snabb blick.

Siffrorna, och vem som tog fram dem
Alla siffror i det här avsnittet är leverantörsrapporterade. Sakana har inte släppt någon utvärderingsrigg, inget poängrutnät per uppgift och inget reproduktionsrecept, och orkestreringsdesignen gör oberoende replikering svårare snarare än enklare: att reproducera en poäng kräver åtkomst till varje modell i poolen i samma versioner med samma topologi, och enligt utformningen varierar topologin per begäran.
• Chartography (visuellt resonemang över diagram och strukturerade dokument) — Fugu Ultra v2 48,3, Claude Opus 5 27,3, Claude Fable 5 29,5 — enligt leverantörens uppgifter
• DeepSWE (programvaruutveckling i verkligheten) — Fugu Ultra v2 74,3 — enligt leverantören, uppges slå modeller som kostar tre till fem gånger mer per token
• Bästa eller delad bästa placering — fem av åtta benchmarks: GDP.pdf, Chartography, SWEFish, DeepSWE och Toolathon — enligt leverantören
• Placering bland de två främsta — sju av åtta benchmarks — enligt leverantören
• Tidigare Fugu Ultra (juni 2026, för jämförelse) — LiveCodeBench 93,2, GPQA-Diamond 95,5, TerminalBench 82,1, SWE-Bench Pro 73,7 — leverantörsrapporterade
Chartography-raden förtjänar den betoning den får, eftersom det är den enda kategorin där gapet till ett namngivet, aktuellt flaggskepp inte är marginellt. Ett gap på 21 poäng gentemot Claude Opus 5 i ett benchmark för visuellt resonemang är den typ av siffra som vanligtvis dyker upp på en oberoende resultattavla inom några dagar. Vid tidpunkten för detta skrivande har ingen sådan dykt upp. Behandla raden som en hypotes med en dollariffra kopplad till, inte som ett fastställt resultat.
Prissättning: oförändrad sedan juni, och rent ut sagt dyrt på utdata
Fugu Ultra v2 kostar 5 USD per miljon indatatoken, 30 USD per miljon utdatatoken och 0,50 USD per miljon cachad indata. Över 272 000 tokens kontext blir dessa 10, 45 respektive 1,00 USD. Fugu Max har en helt annan form: 2 USD för indata, 6 USD för utdata, 0,25 USD för cachad indata, oförändrat oavsett kontextlängd, plus 0,007 USD per webbsökning eller hämtningsanrop.
Två saker i den pristabellen är värda att läsa noga. Det första är att utdata är sex gånger indata – ett aggressivt förhållande som prissätter modellens mångordighet, och orkestrering är en mångordig verksamhet. En koordinator som startar agenter och syntetiserar deras svar avger en massa tokens, och du betalar för alla dem till 30 dollar per miljon. Sakanas effektivitetsanspråk handlar om den underliggande poolen, inte om hur mycket text systemet producerar för din räkning, och det är olika siffror. Budgetera mot observerade tokenantal, inte mot den annonserade prissatsen.
Den andra är 272K-klippan. Att dubbla priset per token över en tröskel är ett legitimt sätt att prissätta långkontextarbete, men det innebär att den effektiva kostnaden för en körning av en långkontextagent inte är siffran på prissidan. Om din arbetsbelastning ligger nära gränsen förändras matematiken avsevärt på båda sidor om den.
Fugus prenumerationsnivåer – Standard för 20 USD, Pro för 100 USD och Max för 200 USD per månad, med 10x- och 20x-kvoter – ger alla tillgång till Fugu, Fugu Ultra och Fugu Max. Sakana prissätter också basmodellen Fugu utifrån den högsta nivå som finns i poolen för en given begäran, och anger tydligt att fler agenter inte multiplicerar notan. Det är en verklig skillnad från den fan-out-kostnadsmodell du skulle få genom att själv anropa flera frontier-modeller.
Vad Sakana inte kommer att berätta för dig
Fråga vilka modeller som svarade på din fråga, och FAQ:n är tydlig: ”denna routningsinformation exponeras inte medvetet.” Ultra- och Max-pooler är fasta, så du kan inte välja bort en leverantör; endast basmodellen Fugu stöder bortval per modell i konsolinställningarna. Enterprise-kunder kan förhandla fram anpassade konfigurationer.
Den bristande insynen är kärnan i den kritik som Fugu-serien har dragit på sig sedan juni, och det är en rättvis kritik snarare än en fientlig sådan. När en orkestrerare får bra resultat genom att kombinera andra labbs modeller tillhör resultatet systemet – vilket är en reell och försvarbar sak att sälja – men det överförs inte till någon enskild modell, och det kan inte granskas. Granskare har påpekat det rakt ut: Fugu slog inte flaggskeppet, det anlitade flaggskeppet. På verifierbara uppgifter med en billig kontrollmekanism, som ett programmeringsbenchmark med en testsvit, kan en kommitté verkligen överträffa sin bästa medlem. På uppgifter utan en sådan innebär en panel som samplar flera frontier-modeller och redovisar det bästa resultatet delvis att rapportera tur. Sakanas egna kategorival – Chartography, DeepSWE, Toolathon – lutar mot den verifierbara änden, vilket är den rätta platsen att framföra påståendet på och också anledningen till att påståendet inte kan generaliseras på köpet.
Oberoende testare har också flaggat latensvariation som den praktiska kostnaden för orkestrering: på svåra uppgifter överlägger koordinatorn, och på enkla uppgifter är den överläggningen ren overhead. En forskares shader-uppgift uppges ha tagit omkring trettio minuter, med kvalitet som bara bedömdes som godtagbar.

Var du faktiskt kan få tag på det
Fugu Ultra v2 är nu live via Sakanas eget OpenAI-kompatibla API – peka en befintlig klient mot slutpunkten med en API-nyckel och ändra en rad – och via flera tredjepartsplattformar. OrcaRouter har inte Fugu-modellerna; om du vill anropa Fugu Ultra v2 är leverantörens eget API den direkta vägen.
Vad som är värt att notera är det alternativ som Sakana implicit konkurrerar med. Den pool som får Fugu Ultra v2 att fungera är sammansatt av modeller som i dag kan anropas var för sig, och de motståndare som den mäts mot är de som team redan kör. Claude Opus 5, DeepSeek V4 Pro och Gemini 3.1 Pro finns alla på OrcaRouter till sina leverantörers listpriser med 0 % påslag, vilket innebär att en prissänkning från någon av dessa leverantörer är aktiv hos oss samma dag som den tillkännages. Om anledningen till att du överväger en orkestrerare är motståndskraft — att inte vilja att en produktionsväg är beroende av en leverantörs drifttid eller en leverantörs policy — så löser ett routningslager med automatisk redundans över leverantörer en del av problemet på modellnivå, och Fugu Ultra v2 löser en annan del på resonemangsnivå. Ett API för 200+ modeller med redundans är inte en ersättning för en tränad koordinator, och en tränad koordinator är inte en ersättning för att inte vara beroende av en enda leverantör. Vissa team kommer att vilja ha båda.
Compliance-haken
Fugu är inte tillgängligt i Europeiska unionen eller Europeiska ekonomiska samarbetsområdet. Leverantörens formulering är tydlig: ännu inte tillgängligt i EU/EES medan man arbetar för efterlevnad av GDPR och EU-specifika regler, och på andra håll kan åtkomsten begränsas av nätverksförhållanden eller lokala regler. Om din organisation har EU-enheter inom tillämpningsområdet tar detta bort Fugu-linjen från övervägande oavsett prestanda i benchmark-tester, vilket är värt att veta före utvärderingen snarare än efter.

Vad du ska titta på
Tre saker skulle flytta Fugu Ultra v2 från ett intressant påstående till ett bärande val. En oberoende utvärdering — en Artificial Analysis-post, en placering i LMArena, vad som helst med ett testramverk bakom sig — skulle avgöra Chartography-frågan inom en vecka. Reproducerade siffror från en tredje part på de verifierbara kodningsbenchmarkarna skulle bekräfta den systemnivåvinst som arkitekturen förutspår. Och en redovisad pool, eller till och med en partiell sådan, skulle låta köpare resonera kring exakt vilka enskilda felpunkter de accepterar när de dirigerar produktionstrafik genom en koordinator de inte kan inspektera.
Fram till dess är den ärliga hållningen denna. Fugu Ultra v2 är det hittills mest seriösa försöket att sälja orkestrering som en produkt snarare än en forskningsdemo, från ett labb med publicerat arbete bakom sig, till ett pris som gör orkestreringspremien explicit i stället för dold. Om din arbetsbelastning har en lång horisont, är verifierbar och begränsad till en region där Sakana kan betjäna dig, är den värd ett avgränsat pilotprojekt med tokenredovisning påslagen. Om inte finns de modeller som Fugu Ultra v2 mäts mot bara ett API-anrop bort, till listpris, med bevisen som visar vad de kan.
Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
