
Fugu Ultra v2 vs Kimi K3: Twee routers, twee hoogtes
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Beide systemen zijn routers, en dat is het eerste dat de meeste berichtgeving mist. Kimi K3 is een Mixture-of-Experts-model met 2,8 biljoen parameters dat ongeveer 104 miljard parameters per token activeert — wat betekent dat het bij elke afzonderlijke token die het genereert een routeringsbeslissing neemt en 16 van zijn 896 experts selecteert om het werk te doen. Fugu Ultra v2, aangekondigd door Sakana AI op 11 september 2026, is een router op een heel ander niveau: het neemt een binnenkomende taak, splitst die op en verdeelt de stukken over een pool van afzonderlijke modellen. De ene routeert binnen één forward pass; de andere routeert over een vloot. Begrijpen dat ze hetzelfde idee op twee schalen zijn, is de snelste manier om te zien waarom hun prijskaartjes 2× verschillen bij input en 5× bij output.
De twee routers, naast elkaar
• Kimi K3 — het vlaggenschip van Moonshot AI, uitgebracht medio juli 2026 met open gewichten gepubliceerd op 27 juli 2026. De architectuur is ongebruikelijk, zelfs naar de maatstaven van 2026: 69 Kimi Delta Attention-lagen afgewisseld met 24 Gated MLA-lagen, Attention Residuals, een "Stable LatentMoE"-ontwerp en een MoonViT-V2 vision-encoder met 401M parameters. De gewichten worden geleverd in MXFP4 met MXFP8-activaties onder kwantisatiebewuste training. De gehoste API biedt reasoning effort met precies één ondersteunde waarde — max.
• Fugu Ultra v2 — de orchestratielaag met maximale capaciteit van Sakana AI, en geen foundationmodel in de gebruikelijke zin. Het is één OpenAI-compatibel eindpunt dat taken opsplitst en ze verdeelt over een pool van open-weights- en gespecialiseerde modellen. Sakana stelt dat Claude Fable 5, Claude Fable 5.1 en GPT-6 Astra van die pool zijn uitgesloten, en noemt een trainingsafsluitdatum van 20260828. Er is geen gepubliceerd parameteraantal, omdat er geen parameters zijn om te tellen zoals je bij K3 zou doen — het vermogen schuilt in het planningsbeleid.
Het gevolg is dat K3 een component is en Fugu Ultra v2 een assemblage. Dat maakt deze vergelijking ongebruikelijk: deze twee zijn niet alleen concurrenten, ze zijn potentiële ingrediënten. Een model als K3 is precies het soort open-weights-, long-context- en tool-calling-systeem dat een orchestrator waarschijnlijk zou huren. Sakana publiceert de samenstelling van de pool niet, dus of K3 in Fugu Ultra v2 zit, is onbekend — maar als dat zo is, is een deel van wat je voor Fugu's tarief betaalt, K3's tokens met een opslag.
Wat het prijsverschil eigenlijk is
• Invoer — Fugu Ultra v2 tegen een gerapporteerde $5,00 per 1M (vermeldingen van derden; de aankondigingspagina van Sakana publiceert geen eigen tarieven) versus Kimi K3 tegen $3,00 per 1M, met cachehits tegen $0,30.
• Uitvoer — Fugu Ultra v2 voor een gerapporteerde $30,00 per 1M tegenover Kimi K3 voor $15,00 per 1M. De helft van de prijs, voor een model dat je ook kunt downloaden.
• Gecachte invoer — Fugu Ultra v2 $0,50 per 1M versus Kimi K3 $0,30 per 1M bij een cache-hit. In een lange agent-loop met een stabiele systeemprompt loopt dat verschil bij elke beurt verder op.
• Contextstaffeling — Kimi K3 is vlak over het volledige venster van 1.048.576 tokens, zonder enige penalty voor lange context. De gerapporteerde staffel van Fugu Ultra v2 boven ongeveer 272.000 inputtokens brengt het hele verzoek op ongeveer $10,00 / $45,00.
Die laatste rij is degene die de echte rekeningen bepaalt. Een langetermijn-agent-run brengt het grootste deel van zijn leven door voorbij 272K tokens, precies waar het vaste tarief van K3 vlak blijft en dat van Fugu Ultra v2 verdubbelt. Als je workload er zo uitziet, ligt het effectieve verschil aan de inputzijde dichter bij 3,3× dan bij 1,7×.

Het enige getal dat ze gemeen hebben
Beide leveranciers rapporteren DeepSWE, en de vergelijking valt minder flatteus uit voor Fugu dan de presentatie bij de lancering doet vermoeden. Sakana vermeldt Fugu Ultra v2 op 74,3. Moonshot vermeldt Kimi K3 op 67,5 — door de leverancier gerapporteerd, afkomstig uit de modelkaart. Dat is een verschil van 6,8 punten op een benchmark voor coding-agents, wat reëel is, maar het is één test uit een veel grotere gepubliceerde set, en het is dezelfde test waarin Sakana met 1,6 punten voorloopt op GPT-5.6 Sol. Een benchmark waarin drie verschillende leveranciers allemaal binnen zeven punten van elkaar clusteren, meet iets reëels, maar onderscheidt hen niet doorslaggevend.
Daarbuiten publiceren de twee op totaal verschillende schappen. De K3-cijfers van Moonshot omvatten Terminal-Bench 2.1 met 88,3, GPQA Diamond met 93,5, HLE-Full met 43,5 (56,0 met tools), SWE-Marathon met 42,0, OSWorld-Verified met 84,8 en MCPMark-Verified met 94,5 — allemaal door de leverancier gerapporteerd, allemaal op de modelkaart. De acht van Sakana voor Fugu Ultra v2 omvatten twee interne benchmarks, SWEFish en Toolathon, die niemand buiten Sakana kan reproduceren.
Onafhankelijk is slechts één ervan überhaupt gemeten. Kimi K3 scoort 44 op de Artificial Analysis Intelligence Index v4.3 — tweede onder open-weightmodellen, achter GLM-5.3 met 45 — en 93,40% op SWE-bench Verified onder de gestandaardiseerde agentische harness van Vals AI, achter Claude Opus 5 en DeepSeek V4 Pro, maar dichtbij. Het voert ook de Frontend Code Arena aan met 1679 Elo, vóór Fable 5 met 1631 en GPT-5.6 Sol met 1618. Als je K3 met 57 of 60 hebt zien vermeld, is dat de achterhaalde indexschaal en die moet niet worden herhaald.
Fugu Ultra v2 heeft geen enkele onafhankelijke score. Het werd aangekondigd op 11 september 2026 en niemand buiten Sakana heeft het uitgevoerd.
Snelheid: de ene gemeten, de andere niet
Kimi K3 is traag, en dit is gemeten in plaats van beweerd: Artificial Analysis registreert 37,9 tokens per seconde met een tijd-tot-eerste-token van 3,80 seconden, en bestempelt het als opmerkelijk breedsprakig. Voor een model dat is gebouwd rond agentische codering met een lange horizon, is doorvoer een echte beperking — een traag model in een lange lus kost kloktijd, niet alleen geld.
Sakana publiceert helemaal geen latentie- of doorvoercijfer voor Fugu Ultra v2. Voor een orchestrator is dat misschien eerder eerlijk dan ontwijkend, want de responstijd hangt volledig af van welke modellen hij besluit aan te roepen en hoeveel doorgangen hij maakt. Maar het betekent ook dat je de kosten in kloktijd van een overstap ernaartoe niet kunt modelleren zonder het zelf te meten. Voor de vorige Fugu Ultra meldden testers openbaar runs die richting de 30 minuten liepen; dat is het model van juni 2026 en geen bewijs over v2, maar het is het getal dat je moet verslaan wanneer je benchmarkt.

Open weights, met een addertje onder het gras dat het lezen waard is
De gewichten van Kimi K3 zijn downloadbaar, wat een wezenlijk verschil is met het alleen gehoste model van Fugu Ultra v2 — maar de licentie is beperkter dan de uitdrukking "open weights" gewoonlijk impliceert. K3 wordt uitgebracht onder de Kimi K3-licentie, niet onder een door OSI goedgekeurde MIT- of Apache-verlening, en de wijdverspreide bewering dat het "aangepaste MIT" is, wordt betwist. De voorwaarden vereisen een aparte overeenkomst met Moonshot voor model-as-a-service-bedrijven met een omzet van meer dan $20M over twaalf opeenvolgende maanden, plus naamsvermelding voor producten met meer dan 100M maandelijkse gebruikers of $20M maandelijkse omzet. Intern gebruik is vrijgesteld.
De eerlijke formulering is dus: K3 geeft je gewichten die je kunt vasthouden, inspecteren, fine-tunen en zelf hosten, onderworpen aan een commerciële voorwaarde met een omzetdrempel. Fugu Ultra v2 geeft je niets daarvan — geen gewichten, geen inspecteerbare pool, geen selfhosting — maar legt ook geen omzetvoorwaarde op, omdat er niets te licentiëren valt. Welke van de twee permissiever is, hangt volledig af van of je het soort bedrijf bent waarop de K3-licentie is gericht.
Een praktische kanttekening als zelfhosting het plan is: de checkpoint van K3 is ongeveer 1,5 terabyte en de leverancier raadt 64 of meer accelerators aan. "Open gewichten" betekent hier een beslissing over een inference-cluster, niet over een laptop. Voor de meeste teams is de API hoe dan ook het verstandige pad — daarom is de day-0-ondersteuning voor vLLM en SGLang belangrijker dan de download.
Wat ons eigen verkeer zegt
Eén datapunt dat geen van beide leveranciers publiceert, en dat meer waard is dan het lijkt: via de OrcaRouter-gateway is Kimi K3 met grote afstand het meest gebruikte model van alle modellen die in dit artikel worden besproken, goed voor ongeveer 3,27 miljard tokens in de afgelopen zeven dagen.
Dat is geen benchmark en het beslecht niets over de kwaliteit. Maar het is een grote steekproef van wat ontwikkelaars daadwerkelijk kiezen wanneer de beslissing hen niets kost dan de tokenprijs, en het zegt dat K3's combinatie van een 1M-venster met vast tarief, open gewichten en een sterke positie in de codingarena al een aanzienlijk deel van het echte agentische werk met lange context heeft veroverd. Fugu Ultra v2 heeft geen vergelijkbaar signaal, omdat het vandaag is gelanceerd.

Elk van hen bereiken
Kimi K3 staat op OrcaRouter tegen Moonshots eigen tarief — $3,00 per miljoen input, $0,30 bij een cache-hit, $15,00 per miljoen output — doorgegeven zonder enige markup, zodat een prijswijziging van de leverancier hier dezelfde dag aankomt in plaats van volgens een migratieschema. Het is OpenAI-compatibel op dezelfde basis-URL als de rest van de catalogus, en omdat het achter dezelfde gateway zit als al het andere, kun je het in een failoverketen opnemen of er voorwaardelijk naartoe routeren in plaats van één enkele provider hard te coderen in een productiepad. Dat is hier meer dan anders van belang: een model met 2,8 biljoen parameters dat 37,9 tokens per seconde serveert, is precies het soort afhankelijkheid waar je een fallback achter wilt hebben.
Fugu Ultra v2 wordt niet door ons gerouteerd. Het is beschikbaar via de eigen OpenAI-compatibele API van Sakana AI, en het bedrijf zegt dat bestaande Fugu-integraties met één parameterwijziging daarop overstappen. Beide modellen gebruiken hetzelfde aanvraagformaat, dus een evaluatie die ze achter één flag plaatst, is een kwestie van de base-URL omwisselen in plaats van herschrijven.
Welke te kiezen?
Kimi K3 is voor vrijwel elke workload de meer verdedigbare aankoop. Het is half zo duur als Fugu Ultra v2, zowel voor input als output, blijft vlak over een venster van 1M zonder terugval bij lange context, is onafhankelijk beoordeeld met een score van 44 op de huidige Artificial Analysis-index, is zelf te hosten onder een licentie met omzetdrempel, en is al met ruime marge het model met het hoogste verkeer in deze vergelijking. De keerzijde is snelheid en breedsprakigheid: 37,9 tokens per seconde is echt traag voor agentische loops, en de licentie heeft tanden als je een groot model-as-a-servicebedrijf bent.
Fugu Ultra v2 is de aankoop als je de specifieke eigenschap wilt die Sakana verkoopt — een capaciteitsniveau dat moeilijk meerstapswerk verdeelt over een pool die de frontier-leveranciers structureel uitsluit, zodat geen enkel upstream-model onder je vandaan kan worden ingetrokken, opnieuw geprijsd of afgesneden. De DeepSWE-voorsprong op K3 is echt en door de leverancier gerapporteerd; de top-twee-plaatsing op zeven van de acht benchmarks is ook door de leverancier gerapporteerd, en op tests die deels nergens anders bestaan.
Wat opvalt, is dat beide routeringsbeslissingen zijn, en je wordt gevraagd een niveau te kiezen. K3 routeert tokens naar experts in een model dat je kunt downloaden en beheren. Fugu Ultra v2 routeert taken naar modellen die je niet kunt zien. Het tweede is een groter, krachtiger idee. Het is ook het idee dat je alleen op goed vertrouwen kunt aannemen — en het kost vijf keer zoveel per token om dat vertrouwen op te brengen.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
