Ett hero-titelkort med texten "Fugu Max vs Kimi K3" och underrubriken "Sakana valde denna måttstock", tre pillerformade märken med texten "utdata $6.00 vs $15.00", "60 % lägre, för utdata" och "1M fast pris vs fönster ej publicerat", en sidfotsrad med texten "Sakana AI, september 2026 vs Moonshot AI, juli 2026", samt OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Fugu Max vs Kimi K3: Sakana valde den här måttstocken, så låt oss läsa den

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Sakana AI:s lansering av Fugu Max namnger exakt tre modeller för att motivera sin prissättning, och Moonshot AI:s Kimi K3 är en av dem. Påståendet är att Fugu Max utdatapris ligger 40 till 60 procent under de tre, vilket gör Kimi K3 — inte Grok 4.6, inte Qwen3.8-Max — till det riktmärke som Sakana själva valde för värde. Det är en ovanligt generös sak för en leverantör att göra: den räcker dig en måttstock och talar om var du ska hålla den. Så den här sidan gör det uppenbara och håller den. Fugu Max släpptes den 11 september 2026 för $2,00 per miljon indatatoken och $6,00 per miljon utdatatoken. Kimi K3 listas till $3,00 och $15,00. Påståendet om 60 procent för utdata är aritmetiskt korrekt. Vad meningen inte nämner är att modellen som den underbjuder publicerar en fullständig redovisning av oberoende uppmätta resultat, och modellen som står för underbjudandet inte publicerar någon.

Meningen om 40 till 60 procent, granskad

• Indata — Fugu Max 2,00 USD per 1 miljon tokens mot Kimi K3 3,00 USD per 1 miljon tokens, en besparing på 33 procent i stället för de 40 till 60 procent som uttalandet inleder med

Utdata — Fugu Max 6,00 USD per 1 miljon tokens jämfört med Kimi K3 15,00 USD per 1 miljon tokens, vilket är 60 procent lägre än den övre gränsen för Sakanas angivna intervall

• Cachad indata — Fugu Max $0,25 per 1 miljon tokens mot Kimi K3 $0,30 per 1 miljon tokens, en så liten skillnad att cache-tunga loopar inte märker den

• Kontextfönster — Fugu Max: ingen siffra publicerad i släppet jämfört med Kimi K3 1 048 576 tokens

• Omprissättning för långa prompter — Fugu Max: ingen nivå angiven, jämfört med Kimi K3 som är platt över hela fönstret utan tillägg oavsett längd

• Driftsättning – endast Fugu Max leverantörs-API, poolmedlemskap ej avslöjat jämfört med Kimi K3:s nedladdningsbara vikter under Kimi K3 License

• Oberoende utvärdering – Fugu Max: ingen, och ingen Artificial Analysis-sida finns för någon Fugu-modell jämfört med Kimi K3: ett Artificial Analysis Intelligence Index på 44 och ett standardiserat 93,40 % på SWE-bench Verified från Vals AI

Notera formen på den första raden. Intervallet i rubriken, 40 till 60 procent, är intervallet över tre namngivna konkurrenter, och Kimi K3 är den som står för 60. Om man bara ser till input är jämförelsen 33 procent, vilket fortfarande är en verklig besparing men ett annat påstående. Det är inte en kritik av prissättningen – $2,00 och $6,00 är verkligen låga siffror för ett system som gör anspråk på resultat nära forskningsfronten. Det är en anmärkning om vilken siffra i utskicket som gör övertalningsjobbet, och om hur stycket är uppbyggt kring den.

Kimi K3 finns i vår katalog till Moonshots egen taxa — $3.00 per miljon input, $0.30 vid en cacheträff, $15.00 per miljon output — förmedlas vidare med 0 % påslag, så om Moonshot ändrar sin prissättning är den nya taxan aktiv på samma nyckel samma dag i stället för under en migreringscykel. Det spelar större roll här än vanligt, eftersom en prissänkning uppströms är precis det som urholkar eller vidgar det 60-procentiga gap som hela den här jämförelsen vilar på.

Vad måttstocken publicerar

Kimi K3:s resultatlista är motsatsen till gles. Moonshots eget modellkort rapporterar Terminal-Bench 2.1 på 88,3, GPQA Diamond på 93,5, HLE-Full på 43,5 som stiger till 56,0 med verktyg, SWE-Marathon på 42,0, OSWorld-Verified på 84,8, MCPMark-Verified på 94,5 och DeepSWE på 67,5. Allt leverantörsrapporterat, och det är mycket.

Det oberoende lagret finns också, vilket är den del som spelar roll för den här jämförelsen. Artificial Analysis ger Kimi K3 44 på v4.3 Intelligence Index – näst bäst bland modeller med öppna vikter, efter GLM-5.3 på 45 – med uppmätt genomströmning på 37,9 utdata-token per sekund och en tid till första token på 3,80 sekunder. Vals AI:s standardiserade agentiska ramverk placerar den på 93,40 % på SWE-bench Verified, efter Claude Opus 5 och DeepSeek V4 Pro men nära. Den leder också Frontend Code Arena med 1679 Elo, före Claude Fable 5 på 1631 och GPT-5.6 Sol på 1618. En varning: om du har sett Kimi K3 anges till 57 eller 60 på Intelligence Index är det siffror före omräkning, från innan Artificial Analysis kalibrerade om skalan i september 2026, och de bör inte upprepas tillsammans med aktuella siffror.

Det finns också en användningssignal, och den kommer från vår egen gateway snarare än någons marknadsföring: Kimi K3 flyttade ungefär 3,27 miljarder tokens genom OrcaRouter under de senaste sju dagarna, den högsta trafiken av alla modeller i den här jämförelsen. Det är inte ett kvalitetsmått. Det är ett stort urval av vad utvecklare griper efter när den enda kostnaden för att välja är tokenpriset, och det säger att det platta 1M-fönstret och de öppna vikterna redan har vunnit en betydande andel av verkligt långsiktigt arbete.

A two-column scoreboard titled 'Fugu Max vs Kimi K3 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Kimi K3: output price $15.00 per 1M, input price $3.00 per 1M, cached input $0.30 per 1M, context 1M flat with no surcharge, benchmarks Terminal-Bench 2.1 at 88.3, evidence Artificial Analysis Index 44 and SWE-bench Verified 93.40%. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Kimi K3 rows Moonshot-reported and per Artificial Analysis and Vals AI.' OrcaRouter logo bottom-right.

Resultattavlan utan några siffror på sig

Sakana rapporterar att Fugu Max tar bästa totalpoäng på sex benchmarks: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench och SWEFish. Det står också att Max utökar Paretofronten för kostnadsprestanda på sju av tio benchmarks. Båda är påståenden om rangordning i ett diagram. Inget av dem kommer med ett värde, en marginal eller en konkurrents siffra bredvid sig.

De två listorna tangerar knappt varandra, vilket är det praktiska problemet. Kimi K3 rapporterar 88,3 för Terminal-Bench 2.1; Sakana säger att Fugu Max tar bästa totalresultatet på Terminal Bench 2.1 och publicerar inget att jämföra mot. Den där enda raden är den tydligaste illustrationen av hela duellen: båda leverantörerna namnger samma test, den ena anger en siffra och den andra anger ordet ”best”. Så länge Sakana inte publicerar siffran finns det inga publicerade bevis som besvarar huruvida Fugu Max slår Kimi K3 i det benchmark som Sakana valde att lyfta fram först.

Det finns en rimlig tolkning av släppet som är värd att nämna. Fugu Max är kostnadsnivån – lanserades samma dag som Fugu Ultra v2, som är kapacitetssatsningen vid $5.00 input och $30.00 output – och dess argument bygger på ett Pareto-diagram där det som hävdas är poäng per dollar, inte poäng. Med den inramningen skulle ett rent benchmark-tal vara den mindre ärliga statistiken. Problemet är att släppet också utelämnar nämnaren: Sakanas egen redogörelse medger att byte av modell mitt i en uppgift kan minska återanvändningen av kontextcache och generera extra orkestreringstoken, och bekräftar att företaget inte offentliggjorde Max cacheträfffrekvens eller dess totala tokenkostnad per uppgift. Så det enda mått som skulle avgöra ett argument om kostnadsnivån är det som inte har angetts.

Vikter du kan hålla, eller en pool du inte kan se

Det är här de två produkterna slutar vara jämförbara överhuvudtaget.

Kimi K3 levereras med nedladdningsbara vikter, vilket är en äkta nödutgång: om prissättning eller villkor ändras kan modellen köras från din egen infrastruktur. Licensen är snävare än vad "öppna vikter" vanligtvis antyder. Det är Kimi K3-licensen snarare än en OSI-godkänd licens, och den ofta upprepade beskrivningen av den som modifierad MIT är omtvistad. Villkoren kräver ett separat avtal med Moonshot för verksamheter med modell-som-tjänst som omsätter över 20 miljoner USD under valfri tolvmånadersperiod, plus kreditering för produkter med över 100 miljoner månatliga användare eller 20 miljoner USD i månatliga intäkter, med undantag för intern användning. Och den praktiska skalan är verklig: checkpointen är ungefär 1,5 terabyte och Moonshot rekommenderar 64 eller fler acceleratorer, så självhostning är ett beslut om inferenskluster snarare än ett laptopbeslut.

Fugu Max erbjuder inget av det – inga vikter, ingen inspekterbar pool, inget självhostningsalternativ – och i gengäld inför inga licensvillkor, eftersom det inte finns något att licensiera. Sakanas uttalade fördel är motsatsen till kontroll: en pool som spänner över modeller med öppna vikter och specialiserade modeller, utökad för Max med NVIDIA Nemotron-familjen, innebär att ingen enskild uppströmsleverantörs utfasning eller prisändring kan slå ut din produkt. Det är en verklig säkring. Den är också omöjlig att verifiera utifrån, eftersom medlemskapet medvetet inte publiceras, och det innebär att ett resultat från Fugu Max har ett utgångsdatum som ett resultat från Kimi K3 inte har.

Öppna vikter och en hemlighållen pool är två olika svar på samma rädsla. Det ena säger att du kan lämna. Det andra säger att det inte finns något att lämna.

Där det platta fönstret avgör det

Kimi K3:s kontext på 1 048 576 token är enhetlig – ingen långkontextnivå, ingen tilläggsavgift oavsett längd. Fugu Max lansering uppger inget kontextfönster alls, så det finns inget att jämföra det med och inget att planera utifrån. För den långsiktiga agentiska kodning som båda produkterna riktar sig mot, där sessioner tillbringar större delen av sin livstid djupt i kontexten, har den asymmetrin större betydelse än prislistan.

Hastigheten är spegelbilden av samma problem. Kimi K3:s 37,9 tokens per sekund med 3,80 sekunder till första token är uppmätt, och det är långsamt – verkligen en begränsning för en modell byggd kring långa loopar, och Artificial Analysis flaggar det som anmärkningsvärt ordrikt. Sakana publicerar ingen siffra för latens eller genomströmning för Fugu Max, vilket för en orkestrerare möjligen är ärligt snarare än undvikande: svarstiden beror på vilka modeller den väljer och hur många pass den gör. Men det innebär att du inte kan modellera kostnaden i verklig tid för att byta utan att mäta den själv. För den tidigare Fugu Ultra rapporterade användare offentligt körningar som sträckte sig mot 30 minuter. Det är modellen från juni 2026 och inte bevis om Max, men det är siffran att slå när du benchmarkar.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the opening argument about the two-dimensional frontier of capability against cost and the statement that Fugu Max expands the Pareto efficiency frontier by orchestrating Sakana's largest pool of open and specialized models to date.

Domen, i Sakanas egna termer

Sakana valde Kimi K3 som en av de tre modellerna som Fugu Max underbjuder, och vad gäller output-priset håller påståendet: $6.00 mot $15.00 är 60 procent lägre, exakt i den övre änden av det angivna intervallet. Om man tar releasen på orden är Fugu Max den billigare produkten.

Tillämpa nu den måttstock som releasen undvek. Kimi K3 är 33 procent dyrare på input och 150 procent dyrare på output — och för de pengarna ger den dig ett fönster på 1M tokens utan någon omprissättningströskel, en nedladdningsbar checkpoint under en licens med intäktströskel, en oberoende placering på 44 i Intelligence Index, ett standardiserat resultat på 93,40 % i SWE-bench Verified, första plats i Frontend Code Arena och den största verkliga trafiken av alla modeller i den här jämförelsen. Fugu Max ger dig en lägre taxa på båda sidor av token, sex okvantifierade benchmarkvinster, en cachefrekvens som är hälften av K3:s, utan någon publicerad träfffrekvens, och en pool som du inte kan inspektera.

Den ärliga slutsatsen är att Sakana valde en måttstock som smickrar det på priset och inte gav dig något att kontrollera när det gäller kapacitet. Om din arbetsbelastning är av hög volym och dina uppgifter är av det slag som en koordinator tillförlitligt kan dela upp, är prisskillnaden riktiga pengar, och Fugu Max förtjänar en avgränsad pilot med tokenredovisning påslagen redan från första begäran. Om du behöver ett produktionsbeslut som du kan försvara det här kvartalet — ett fönster du kan planera mot, en poäng du kan peka på och en modell du fortfarande skulle kunna köra om leverantören försvann — är Kimi K3 svaret, och den finns på OrcaRouter till Moonshots listpris, med leverantörens taxa vidarebefordrad oförändrad.

A screenshot of the OrcaRouter model page for Kimi K3 (English UI, captured September 11, 2026), showing the Featured badge, the identifier kimi/kimi-k3, by MoonshotAI dated 2026-07-15, vision, tools, JSON and reasoning capability tags, a 2.8-trillion-parameter Mixture-of-Experts description, a 1M-token context window with text and image input, list pricing of $3.00 per 1M input tokens and $15.00 per 1M output tokens, traffic of 3,274.3 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.