
Fugu Max vs Kimi K3: Sakana koos deze maatstaf, dus laten we die lezen
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
De release van Sakana AI voor Fugu Max noemt precies drie modellen om de prijsstelling te rechtvaardigen, en Moonshot AI's Kimi K3 is er daar één van. De bewering is dat het outputtarief van Fugu Max 40 tot 60 procent onder dat van die drie ligt, wat Kimi K3 — niet Grok 4.6, niet Qwen3.8-Max — tot de benchmark maakt die Sakana zelf heeft gekozen voor waar voor je geld. Dat is een ongewoon royaal gebaar voor een leverancier: hij geeft je een meetlat en vertelt je waar je hem moet vasthouden. Dus deze pagina doet het voor de hand liggende en houdt hem vast. Fugu Max kwam uit op 11 september 2026 voor $2,00 per miljoen input- en $6,00 per miljoen outputtokens. Kimi K3 heeft een listprijs van $3,00 en $15,00. De bewering van 60 procent over de output is rekenkundig correct. Wat de zin niet vermeldt, is dat het model dat het onderbiedt een volledig overzicht publiceert van onafhankelijk gemeten resultaten, en dat het model dat onderbiedt er geen enkele publiceert.
De zin over 40 tot 60 procent, nader bekeken
Invoer — Fugu Max $2,00 per 1 miljoen tokens versus Kimi K3 $3,00 per 1 miljoen tokens, een besparing van 33 procent in plaats van de 40 tot 60 procent waarmee de release opent
• Uitvoer — Fugu Max $ 6,00 per 1 miljoen tokens versus Kimi K3 $ 15,00 per 1 miljoen tokens, wat 60 procent onder de bovengrens van het door Sakana opgegeven bereik ligt
• Gecachte invoer — Fugu Max $0,25 per 1 mln tokens vs Kimi K3 $0,30 per 1 mln tokens, een verschil dat klein genoeg is dat cache-intensieve loops het niet zullen merken
• Contextvenster — voor Fugu Max is geen cijfer gepubliceerd in de release, tegenover 1.048.576 tokens voor Kimi K3
• Prijsherziening voor lange prompts — Fugu Max: geen niveau vermeld, versus Kimi K3: vast tarief over het hele venster, zonder toeslag bij welke lengte dan ook
• Implementatie — alleen de leveranciers-API van Fugu Max, pool-lidmaatschap niet bekendgemaakt vs. downloadbare gewichten van Kimi K3 onder de Kimi K3-licentie
• Onafhankelijke evaluatie — Fugu Max: geen, en er bestaat geen Artificial Analysis-pagina voor enig Fugu-model, tegenover Kimi K3 met een Artificial Analysis Intelligence Index van 44 en een gestandaardiseerde 93,40% op SWE-bench Verified van Vals AI
Let op de vorm van die eerste rij. Het in de kop genoemde bereik, 40 tot 60 procent, is de bandbreedte over drie bij naam genoemde concurrenten, en Kimi K3 is degene die de 60 oplevert. Alleen op input bekeken komt de vergelijking uit op 33 procent, wat nog steeds een echte besparing is, maar een andere zin. Dat is geen kritiek op de prijsstelling — $2,00 en $6,00 zijn werkelijk lage bedragen voor een systeem dat claimt resultaten te leveren die aan de frontier grenzen. Het is een opmerking over welk getal in de release het overtuigingswerk doet, en over hoe de alinea eromheen is opgebouwd.
Kimi K3 staat in onze catalogus tegen het eigen tarief van Moonshot — $3,00 per miljoen input, $0,30 bij een cachehit, $15,00 per miljoen output — doorgegeven met 0% opslag, dus als Moonshot zijn prijsstelling wijzigt is het nieuwe tarief dezelfde dag live op dezelfde key in plaats van op een migratiecyclus. Dat is hier belangrijker dan gewoonlijk, want een prijsverlaging upstream is precies wat de 60 procent-kloof waarop deze hele vergelijking stoelt, uitholt of verbreedt.
Wat de meetlat publiceert
De resultaten van Kimi K3 zijn allesbehalve karig. In Moonshot's eigen modelkaart staat Terminal-Bench 2.1 op 88,3, GPQA Diamond op 93,5, HLE-Full op 43,5, oplopend tot 56,0 met tools, SWE-Marathon op 42,0, OSWorld-Verified op 84,8, MCPMark-Verified op 94,5 en DeepSWE op 67,5. Allemaal door de leverancier gerapporteerd, en het is nog veel ook.
De onafhankelijke laag bestaat ook, en dat is het onderdeel dat voor deze vergelijking relevant is. Artificial Analysis geeft Kimi K3 een score van 44 op de v4.3 Intelligence Index — tweede onder open-weightmodellen, achter GLM-5.3 met 45 — met een geregistreerde doorvoer van 37,9 outputtokens per seconde en een tijd tot eerste token van 3,80 seconden. De gestandaardiseerde agentische harness van Vals AI plaatst het op 93,40% op SWE-bench Verified, achter Claude Opus 5 en DeepSeek V4 Pro, maar dichtbij. Het leidt ook de Frontend Code Arena met 1679 Elo, vóór Claude Fable 5 met 1631 en GPT-5.6 Sol met 1618. Eén waarschuwing: als je Kimi K3 hebt zien vermeld met 57 of 60 op de Intelligence Index, dan zijn dat cijfers van vóór de herziening, van voordat Artificial Analysis de schaal in september 2026 opnieuw kalibreerde, en die mogen niet samen met de huidige cijfers worden herhaald.
Er is ook een gebruikssignaal, en het komt van onze eigen gateway in plaats van de marketing van wie dan ook: Kimi K3 verwerkte de afgelopen zeven dagen ruwweg 3,27 miljard tokens via OrcaRouter, het zwaarste verkeer van alle modellen in deze vergelijking. Dat is geen kwaliteitsmeting. Het is een grote steekproef van waar ontwikkelaars naar grijpen wanneer de enige kosten van de keuze de tokenprijs zijn, en het zegt dat het vaste 1M-venster en de open weights al een substantieel aandeel van echt werk met een lange horizon hebben veroverd.

Het scorebord waar geen cijfers op staan
Sakana meldt dat Fugu Max de beste totaalscore behaalt op zes benchmarks: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench en SWEFish. Er staat ook dat Max de Paretofrontier voor kosten-prestaties verlegt op zeven van de tien benchmarks. Beide zijn uitspraken over de rangorde in een grafiek. Geen van beide gaat vergezeld van een waarde, een marge of een cijfer van een concurrent ernaast.
De twee lijsten raken elkaar nauwelijks, wat het praktische probleem is. Kimi K3 rapporteert 88,3 voor Terminal-Bench 2.1; Sakana zegt dat Fugu Max overall het beste is op Terminal Bench 2.1 en drukt niets af om daarmee te vergelijken. Die ene rij is de zuiverste illustratie van de hele onderlinge vergelijking: beide leveranciers noemen dezelfde test, de een drukt een getal af, de ander drukt het woord "best" af. Totdat Sakana het cijfer publiceert, geeft geen enkel gepubliceerd bewijs antwoord op de vraag of Fugu Max Kimi K3 verslaat op de benchmark die Sakana als speerpunt koos.
Er is een redelijke lezing van de release die het vermelden waard is. Fugu Max is de kostenvariant — dezelfde dag uitgebracht als Fugu Ultra v2, de capaciteitsvariant tegen $5,00 input en $30,00 output — en het argument ervan stoelt op een Pareto-grafiek waarin score-per-dollar, niet score, de claim is. Binnen die framing zou een kaal benchmarkcijfer het minder eerlijke cijfer zijn. Het probleem is dat de release ook de noemer weglaat: Sakana's eigen berichtgeving geeft toe dat het tijdens een taak wisselen van model het hergebruik van de contextcache kan verminderen en extra orkestratietokens kan genereren, en bevestigt dat het bedrijf de cache-hitratio van Max of de totale tokenkosten per taak niet heeft bekendgemaakt. Dus de enige meting die een argument voor een kostenvariant zou beslechten, is degene die niet is geleverd.
Gewichten die je kunt vasthouden, of een pool die je niet kunt zien
Dit is het punt waarop de twee producten helemaal niet meer te vergelijken zijn.
Kimi K3 wordt geleverd met downloadbare gewichten, wat een echt ontsnappingsluik is: als de prijsstelling of voorwaarden veranderen, kan het model vanaf uw eigen infrastructuur worden aangeboden. De licentie is beperkter dan "open weights" doorgaans impliceert. Het is de Kimi K3-licentie in plaats van een OSI-goedgekeurde toekenning, en de vaak herhaalde beschrijving ervan als aangepaste MIT wordt betwist. De voorwaarden vereisen een afzonderlijke overeenkomst met Moonshot voor model-as-a-service-bedrijven met een omzet van meer dan $20M over welke twaalf opeenvolgende maanden dan ook, plus naamsvermelding voor producten met meer dan 100M maandelijkse gebruikers of $20M maandelijkse omzet, waarbij intern gebruik is vrijgesteld. En de praktische schaal is reëel: het checkpoint is ongeveer 1,5 terabyte en Moonshot adviseert 64 of meer acceleratoren, dus self-hosting is een beslissing voor een inference-cluster, niet voor een laptop.
Fugu Max biedt niets van dat alles — geen gewichten, geen inspecteerbare pool, geen self-hostingoptie — en legt in ruil daarvoor geen licentievoorwaarde op, want er valt niets te licentiëren. Het door Sakana genoemde voordeel is het omgekeerde van controle: een pool die open-weights en gespecialiseerde modellen omspant, voor Max uitgebreid met de NVIDIA Nemotron-familie, betekent dat geen enkele deprecatie of prijsherziening van één upstream-leverancier je product ten val kan brengen. Dat is een echte hedge. Het is van buitenaf ook niet verifieerbaar, omdat het lidmaatschap met opzet niet wordt gepubliceerd, en het betekent dat een Fugu Max-resultaat een vervaldatum draagt die een Kimi K3-resultaat niet heeft.
Open gewichten en een niet-bekendgemaakte pool zijn twee verschillende antwoorden op dezelfde angst. De een zegt dat je kunt weggaan. De ander zegt dat er niets is om te verlaten.
Waar het vlakke raam het beslist
De context van 1.048.576 tokens van Kimi K3 is vlak — geen long-contextniveau, geen toeslag bij welke lengte dan ook. De release van Fugu Max vermeldt helemaal geen contextvenster, dus er is niets om het mee te vergelijken en niets om op te plannen. Voor de langetermijn-agentische codering waarop beide producten zijn gericht, waarbij sessies het grootste deel van hun bestaan diep in de context doorbrengen, weegt die asymmetrie zwaarder dan de tariefkaart.
Snelheid is het spiegelbeeld van hetzelfde probleem. De 37,9 tokens per seconde van Kimi K3 bij een tijd tot het eerste token van 3,80 seconden is gemeten, en het is traag — echt een beperking voor een model dat rond lange loops is gebouwd, en Artificial Analysis bestempelt het als opvallend breedsprakig. Sakana publiceert geen latentie- of doorvoercijfer voor Fugu Max, wat voor een orchestrator misschien eerder eerlijk dan ontwijkend is: de reactietijd hangt af van welke modellen hij kiest en hoeveel passes hij maakt. Maar het betekent dat je de kosten in kloktijd van het overstappen niet kunt modelleren zonder het zelf te meten. Voor de eerdere Fugu Ultra meldden gebruikers publiekelijk runs die richting de 30 minuten uitliepen. Dat is het model van juni 2026 en geen bewijs over Max, maar het is het getal dat je moet verslaan wanneer je benchmarkt.

Het oordeel, in Sakana's eigen bewoordingen
Sakana koos Kimi K3 als een van de drie modellen die Fugu Max onderbiedt, en wat het outputtarief betreft houdt de bewering stand: $6,00 tegenover $15,00 is 60 procent lager, precies de bovengrens van de opgegeven bandbreedte. Neem de release op haar woord en Fugu Max is het goedkopere product.
Pas nu de maatstaf toe die de release vermeed. Kimi K3 is 33 procent duurder voor input en 150 procent duurder voor output — en voor dat geld krijg je een 1M-tokenvenster zonder herprijzingsklif, een downloadbaar checkpoint onder een licentie met omzetdrempel, een onafhankelijke positie van 44 in de Intelligence Index, een gestandaardiseerde SWE-bench Verified-score van 93,40%, de eerste plaats in de Frontend Code Arena, en het zwaarste reële verkeer van alle modellen in deze vergelijking. Fugu Max geeft je een lager tarief aan beide kanten van de token, zes niet-gekwantificeerde benchmarkoverwinningen, een cachetarief dat half zo hoog is als dat van K3, zonder gepubliceerd hitpercentage, en een pool die je niet kunt inspecteren.
De eerlijke conclusie is dat Sakana een meetlat heeft gekozen die het op prijs gunstig uitkomt en je niets heeft gegeven om de capaciteiten aan te toetsen. Als je workload een hoog volume heeft en je taken van het soort zijn dat een coördinator betrouwbaar kan opdelen, is het tariefverschil echt geld en verdient Fugu Max een afgebakende pilot met tokenadministratie die vanaf het eerste verzoek is ingeschakeld. Als je een productiebeslissing nodig hebt die je dit kwartaal kunt verdedigen — een venster waarop je kunt plannen, een score waarnaar je kunt wijzen, en een model dat je nog steeds zou kunnen draaien als de leverancier verdween — dan is Kimi K3 het antwoord, en het staat op OrcaRouter tegen Moonshot's lijstprijs, waarbij het tarief van de provider ongewijzigd wordt doorgegeven.

