
Fugu Ultra v2 vs Kimi K3: Två routrar, två höjder
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Båda dessa system är routrar, och det är det första som de flesta rapporteringar missar. Kimi K3 är en Mixture-of-Experts-modell med 2,8 biljoner parametrar som aktiverar ungefär 104 miljarder parametrar per token – vilket innebär att den vid varje enskild token som den genererar fattar ett routingbeslut och väljer 16 av sina 896 experter att utföra arbetet. Fugu Ultra v2, som tillkännagavs av Sakana AI den 11 september 2026, är en router på en helt annan nivå: den tar en inkommande uppgift, delar upp den och skickar ut delarna till en pool av separata modeller. Den ena routar inuti en framåtpassning; den andra routar över en flotta. Att förstå att de är samma idé på två skalor är det snabbaste sättet att se varför deras prislappar skiljer sig med 2× på indata och 5× på utdata.
De två routrarna, sida vid sida
• Kimi K3 — Moonshot AI:s flaggskepp, släppt i mitten av juli 2026 med öppna vikter publicerade den 27 juli 2026. Arkitekturen är ovanlig även med 2026 års mått: 69 Kimi Delta Attention-lager varvat med 24 Gated MLA-lager, Attention Residuals, en "Stable LatentMoE"-design och en MoonViT-V2-visionskodare med 401M parametrar. Vikter levereras i MXFP4 med MXFP8-aktiveringar under kvantiseringsmedveten träning. Dess hostade API exponerar resonemangsansträngning med exakt ett stött värde — max.
• Fugu Ultra v2 — Sakana AI:s orkestreringsnivå med högsta kapacitet, och inte en grundmodell i vanlig mening. Det är en enda OpenAI-kompatibel slutpunkt som delar upp uppgifter och skickar ut dem över en pool av modeller med öppna vikter och specialiserade modeller. Sakana uppger att Claude Fable 5, Claude Fable 5.1 och GPT-6 Astra är uteslutna från den poolen, och anger ett träningscutoff på 20260828. Det finns ingen publicerad parameterräkning, eftersom det inte finns några parametrar att räkna på samma sätt som för K3 — kapaciteten ligger i schemaläggningspolicyn.
Konsekvensen är att K3 är en komponent och Fugu Ultra v2 är en sammansättning. Det gör jämförelsen ovanlig: dessa två är inte bara konkurrenter, de är potentiella ingredienser. En modell som K3 är precis den typ av system med öppna vikter, lång kontext och verktygsanrop som en orkestrerare rimligen skulle kunna hyra. Sakana publicerar inte poolens medlemslista, så huruvida K3 ingår i Fugu Ultra v2 är okänt — men om så är fallet är en del av det du betalar Fugu-priset för K3:s tokens med ett påslag.
Vad prisskillnaden faktiskt är
• Indata — Fugu Ultra v2 till ett rapporterat pris på 5,00 USD per 1M (tredjepartslistor; Sakanas tillkännagivandesida publicerar inte sina egna priser) mot Kimi K3 till 3,00 USD per 1M, med cacheträffar på 0,30 USD.
• Output — Fugu Ultra v2 till ett uppgivet pris på 30,00 $ per 1M mot Kimi K3 på 15,00 $ per 1M. Halva priset, för en modell som du dessutom kan ladda ner.
• Cachad indata — Fugu Ultra v2 $0,50 per 1M mot Kimi K3 $0,30 per 1M vid en cacheträff. I en lång agentloop med en stabil systemprompt ackumuleras den skillnaden för varje tur.
• Kontextnivåer — Kimi K3 är platt över hela sitt fönster på 1 048 576 tokens utan någon straffavgift för lång kontext. Fugu Ultra v2:s rapporterade nivå över ungefär 272 000 indatatokens flyttar hela förfrågan till cirka 10,00 $ / 45,00 $.
Den sista raden är den som avgör de verkliga räkningarna. En agentkörning med lång horisont tillbringar större delen av sitt liv bortom 272K tokens, vilket är precis där K3:s platta taxa förblir platt och Fugu Ultra v2:s fördubblas. Om din arbetsbelastning ser ut så är den effektiva skillnaden på inputsidan närmare 3,3× än 1,7×.

Det enda numret de delar
Båda leverantörerna rapporterar DeepSWE, och jämförelsen är mindre smickrande för Fugu än vad lanseringens inramning antyder. Sakana listar Fugu Ultra v2 på 74,3. Moonshot listar Kimi K3 på 67,5 — leverantörsrapporterat, från modellkortet. Det är en skillnad på 6,8 punkter på ett benchmark för kodningsagenter, vilket är verkligt, men det är ett test av en mycket större publicerad uppsättning, och det är samma test som Sakana leder med 1,6 punkter mot GPT-5.6 Sol. Ett benchmark där tre olika leverantörer alla ligger inom sju punkter mäter något verkligt men skiljer dem inte avgörande.
Utöver det publicerar de två på helt olika hyllor. Moonshots K3-siffror inkluderar Terminal-Bench 2.1 på 88,3, GPQA Diamond på 93,5, HLE-Full på 43,5 (56,0 med verktyg), SWE-Marathon på 42,0, OSWorld-Verified på 84,8 och MCPMark-Verified på 94,5 — alla rapporterade av leverantören, alla på modellkortet. Sakanas åtta för Fugu Ultra v2 inkluderar två interna benchmarks, SWEFish och Toolathon, som ingen utanför Sakana kan reproducera.
Oberoende av varandra har bara en av dem mätts överhuvudtaget. Kimi K3 får 44 på Artificial Analysis Intelligence Index v4.3 – tvåa bland modeller med öppna vikter, efter GLM-5.3 på 45 – och 93,40 % på SWE-bench Verified under Vals AI:s standardiserade agentiska testramverk, efter Claude Opus 5 och DeepSeek V4 Pro men nära. Den leder också Frontend Code Arena med 1679 Elo, före Fable 5 på 1631 och GPT-5.6 Sol på 1618. Om du har sett K3 anges som 57 eller 60, är det den ersatta indexskalan och den bör inte upprepas.
Fugu Ultra v2 har inget oberoende resultat av något slag. Den tillkännagavs den 11 september 2026 och ingen utanför Sakana har kört den.
Hastighet: en uppmätt, en inte
Kimi K3 är långsam, och detta är uppmätt snarare än påstått: Artificial Analysis registrerar 37,9 tokens per sekund med en tid till första token på 3,80 sekunder, och flaggar den som noterbart mångordig. För en modell byggd kring långsiktig agentisk kodning är genomströmning en verklig begränsning – en långsam modell i en lång loop kostar väggklockstid, inte bara pengar.
Sakana publicerar överhuvudtaget ingen latens- eller genomströmningssiffra för Fugu Ultra v2. För en orchestrator är det möjligen ärligt snarare än undvikande, eftersom svarstiden helt beror på vilka modeller den väljer att anropa och hur många passager den gör. Men det innebär också att du inte kan modellera den reella tidskostnaden för att byta till den utan att själv mäta den. För den tidigare Fugu Ultra rapporterade testare offentligt körningar som sträckte sig mot 30 minuter; det är modellen från juni 2026 och inte bevis för v2, men det är siffran att slå när du benchmarkar.

Öppna vikter, med en hake värd att läsa
Kimi K3:s vikter är nedladdningsbara, vilket är en verklig skillnad från Fugu Ultra v2:s endast värdbaserade modell – men licensen är snävare än vad frasen "öppna vikter" vanligtvis antyder. K3 distribueras under Kimi K3 License, inte under en OSI-godkänd MIT- eller Apache-licens, och det ofta upprepade påståendet att den är "modifierad MIT" är omtvistat. Villkoren kräver ett separat avtal med Moonshot för model-as-a-service-verksamheter med intäkter över 20 miljoner USD under valfri period av tolv sammanhängande månader, plus attribuering för produkter med över 100 miljoner månatliga användare eller 20 miljoner USD i månatliga intäkter. Intern användning är undantagen.
Så den ärliga formuleringen är: K3 ger dig vikter som du kan hålla i, granska, finjustera och självhosta, med förbehåll för ett intäktsgränsat kommersiellt villkor. Fugu Ultra v2 ger dig inget av detta – inga vikter, ingen granskningsbar pool, ingen självhosting – men ställer inte heller något intäktsvillkor, eftersom det inte finns något att licensiera. Vilket av dessa som är mer tillåtande beror helt och hållet på om du är den typ av företag som K3-licensen riktar sig till.
En praktisk varning om egen hosting är planen: K3:s checkpoint är ungefär 1,5 terabyte och leverantören rekommenderar 64 eller fler acceleratorer. "Öppna vikter" innebär här ett beslut om ett inferenskluster, inte om en laptop. För de flesta team är API:et den förnuftiga vägen oavsett — vilket är anledningen till att stödet för vLLM och SGLang från dag 0 är viktigare än nedladdningen.
Vad vår egen trafik säger
En datapunkt som ingen av leverantörerna publicerar, och som är värd mer än den ser ut: i OrcaRouter-gatewayen är Kimi K3 den mest använda modellen av alla som diskuteras i den här artikeln, med bred marginal, och flyttade ungefär 3,27 miljarder token under de senaste sju dagarna.
Det är inte ett benchmark, och det avgör ingenting om kvaliteten. Men det är ett stort urval av vad utvecklare faktiskt väljer när beslutet inte kostar dem något annat än tokenpriset, och det säger att K3:s kombination av ett 1M fönster med fast pris, öppna vikter och en stark placering i coding-arena redan har vunnit en betydande andel av verkligt långkontextuellt agentiskt arbete. Fugu Ultra v2 har ingen jämförbar signal, eftersom den lanserades idag.

Att ta sig till var och en av dem
Kimi K3 finns på OrcaRouter till Moonshots eget pris — 3,00 USD per miljon input, 0,30 USD vid en cacheträff, 15,00 USD per miljon output — förs vidare utan påslag, så en leverantörsprisändring landar här samma dag i stället för enligt ett migreringsschema. Den är OpenAI-kompatibel på samma bas-URL som resten av katalogen, och eftersom den ligger bakom samma gateway som allt annat kan du lägga in den i en failover-kedja eller routa till den villkorligt i stället för att hårdkoda en enda leverantör i en produktionsväg. Det spelar större roll än vanligt här: en modell med 2,8 T parametrar som körs med 37,9 tokens per sekund är precis den typ av beroende som är värt att ha en fallback bakom.
Fugu Ultra v2 routas inte av oss. Den finns tillgänglig via Sakana AI:s egen OpenAI-kompatibla API, och företaget säger att befintliga Fugu-integrationer flyttar till den med en enda parameterändring. Båda modellerna använder samma förfrågningsformat, så en utvärdering som placerar dem bakom en och samma flagga är ett byte av bas-URL snarare än en omskrivning.
Vilken ska man välja?
Kimi K3 är det mer försvarbara köpet för nästan alla arbetsbelastningar. Det kostar hälften av Fugu Ultra v2 för både input och output, med samma pris över ett 1M-fönster utan någon brant nedgång vid lång kontext, oberoende poängsatt till 44 på det aktuella Artificial Analysis-indexet, möjligt att självhosta under en intäktsvillkorad licens, och redan den mest trafikerade modellen i denna jämförelse med bred marginal. Dess kostnader är hastighet och mångordighet: 37,9 tokens per sekund är genuint långsamt för agentiska loopar, och licensen biter om du är en stor model-as-a-service-verksamhet.
Fugu Ultra v2 är köpet om du vill ha den specifika egenskap som Sakana säljer – en kapabilitetsnivå som bryter ner svårt arbete i flera steg över en pool som strukturellt utesluter frontier-leverantörerna, så att ingen enskild uppströmsmodell kan återkallas, omprissättas eller kopplas bort under dig. Dess DeepSWE-försprång gentemot K3 är verkligt och rapporterat av leverantören; dess topptvå-placering på sju av åtta benchmarks är också rapporterad av leverantören, och på tester som delvis inte finns någon annanstans.
Det man bör lägga märke till är att båda dessa är routningsbeslut, och du ombeds välja en höjd. K3 dirigerar tokens till experter inuti en modell som du kan ladda ner och styra. Fugu Ultra v2 dirigerar uppgifter till modeller som du inte kan se. Den andra är en större och kraftfullare idé. Det är också den du bara kan ta på tro — och det kostar fem gånger så mycket per token att göra det.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
