
Qwen 3.8 vs Kimi K3: Twee Chinese reuzen, en nu is er één goedkoper
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 177 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Dit zijn de twee belangrijkste Chinese frontiermodellen van 2026, en ze zijn nauwe verwanten: beide enorme sparse Mixture-of-Experts-systemen, beide met een context van 1M tokens, beide multimodaal, beide met de belofte van open gewichten.Kimi K3 van Moonshot is eigenlijk de grotere van de twee met 2.8T totale parameters tegenover Qwen's 2.4T — een nuttige herinnering dat het aantal parameters geen rangschikking is.
Tot 3 augustus 2026 was deze vergelijking op een specifieke manier scheef: Kimi K3 had een geauditeerde Artificial Analysis Intelligence Index van 57,1, een #1 LMArena frontend-code-ranglijst, gepubliceerde prijzen en uitgebrachte gewichten, terwijl Qwen3.8-Max had een 2,4T-headline en verder niets. GA veranderde de economische verhoudingen beslissend. Qwen publiceert nu $2 / $6 per miljoen tokens tegenover Kimi's $3 / $15 — wat het grotere, beter bewezen model met een ruime marge duurder maakt.
Een opmerking voor bouwers — de snelste manier om dit op te lossen is om beide op je eigen prompts te draaien. OrcaRouter plaatst 200+ modellen achter één OpenAI-compatibel eindpunt, zodat je Qwen 3.8 Max tegen Kimi K3 kunt laten strijden op dezelfde taak zonder twee SDK's aan te sluiten.
TL;DR-oordeel. Kimi K3 wint nog steeds op bewijs: een gecontroleerde AA Intelligence Index van 57.1 (#3), de nummer 1-positie voor frontend-code van LMArena op 1679, en open gewichten die daadwerkelijk klaar zijn. Qwen3.8-Max wordt nog steeds door geen enkele onafhankelijke evaluator gescoord. Maar GA gaf Qwen twee echte voordelen. Qua prijs is het nu aanzienlijk goedkoper — $2 / $6 tegen $3 / $15, wat neerkomt op 2,5× minder output. En in de enige head-to-head-test van een derde partij die bestaat, verloor Qwen de headline-score met 80 tegen 83 en was daarbij de zichtbaar beter gedragende agent: 354 repo-citaties tegen 274, 22 gateway-verzoeken tegen 53, en nul mislukte toolcalls tegen twee. Kimi voor gecontroleerde kwaliteit; Qwen voor goedkopere, schonere agentische uitvoering.
Belangrijkste conclusies
• Kimi K3 is het grotere model — 2.8T MoE tegenover Qwen's 2.4T, ongeveer 400B meer — wat een goed argument is tegen het beschouwen van het aantal parameters als een proxy voor capaciteit.
• Qwen3.8-Max is sinds 3 augustus 2026 GA tegen $2 / $6 per 1M flat, tegenover Kimi K3's $3 / $15 (AA blended ~$2.31). Qwen is nu 2.5× goedkoper op output.
• Kimi K3 heeft de geauditeerde positie: AA Intelligence Index 57.1 (#3), alleen achter Fable 5 en GPT-5.6 Sol, plus LMArena frontend-code #1 (1679). Qwen3.8-Max is nog steeds niet gescoord.
• In de enige directe test (Trilogy AI) versloeg Kimi Qwen nipt met 83 tegen 80 overall — maar Qwen maakte meer repo-citaties (354 tegen 274), minder gateway-verzoeken (22 tegen 53), en had nul mislukte toolcalls (tegen twee), met een 9/10 voor toolgebruik tegenover Kimi's 8/10.
• Qwen rapporteert nu agentische en codeerscores: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (tegenover 40,7 van een voorganger) — allemaal door Alibaba gerapporteerd.
• De timing van openheid is nog steeds in het voordeel van Kimi: de gewichten zijn in wezen klaar; die van Qwen worden binnen de week beloofd, nog zonder licentie of repository.
Noot over nauwkeurigheid: alle kwaliteitscijfers van Qwen3.8-Max zijn door Alibaba gerapporteerd en niet door derden geverifieerd. De cijfers van Kimi K3 zijn afkomstig van Artificial Analysis en LMArena. De rechtstreekse vergelijking is een enkele test van Trilogy AI en moet worden opgevat als één datapunt, niet als een algemene rangschikking. De Qwen-prijzen zijn de GA-prijslijst en vervangen de previewkorting van juli.
De specificaties en prijs, naast elkaar
Hier zijn de harde gegevens, elk cijfer met vermelding van de bron.
• Maker / status — Qwen3.8-Max: Alibaba; GA (3 augustus 2026); Kimi K3: Moonshot; open-gewicht release
• Architectuur — Qwen3.8-Max: ~2.4T in totaal, sparse MoE (actieve parameters nog niet bekendgemaakt); Kimi K3: 2.8T MoE, native vision (Artificial Analysis)
• Contextvenster — Qwen3.8-Max: 1M tokens (983.616 met denken; max. output 131.072); Kimi K3: 1M tokens (Artificial Analysis)
• AA Intelligence Index — Qwen3.8-Max: Nog niet gescoord; Kimi K3: 57.1 — #3 (Artificial Analysis)
• Arena / leaderboard — Qwen3.8-Max: niet openbaar gescoord; Kimi K3: Frontend-code #1, 1679 (LMArena)
• Leveranciersgerapporteerde scores — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (door Alibaba gerapporteerd); Kimi K3: de stand is door derden gemeten
• Prijzen (invoer / uitvoer) — Qwen3.8-Max: $2.00 / $6.00 per 1M, vast; gecachete invoer $0.25; Kimi K3: $3 / $15 per 1M (AA blended ~$2.31), cachehits $0.30
• Open gewichten — Qwen3.8-Max: Toegezegd binnen de week (nog geen licentie); Kimi K3: Open gewicht; gewichten gereed
• Snelheid — Qwen3.8-Max: p50 TTFT 1,64s (OrcaRouter 7-daagse telemetrie); Kimi K3: langdradig en traag (~34s TTFT, per AA)
Twee dingen bepalen deze vergelijking, en één daarvan keerde op 3 augustus volledig om.
Ten eerste, keerde de prijsverhouding om. Tot en met juli was Kimi K3 het model met een reële prijs en Qwen het model met een kortingscoupon. Nu publiceren beide hun tarieven, en het beter bewezen, grotere model is het duurdere: $3 / $15 tegenover $2 / $6. Bij output — waar het geld wordt besteed aan redeneren en codegeneratie — kost Kimi 2,5× meer. Qwen rekent ook een vast tarief over de volledige context van 1M tokens, en de gecachte invoer van $0,25 ligt iets lager dan Kimi's tarief voor cache-hits van $0,30. Voor elke workload met hoge volumes is de kostenstructuur van Qwen nu duidelijk beter.
Ten tweede, het bewijsverschil is ongewijzigd, en dat is de reden waarom Kimi nog steeds wint. Kimi K3's 57.1 Intelligence Index plaatst het op de derde plaats overall, alleen achter Fable 5 en GPT-5.6 Sol — dat is het oordeel van een neutrale beoordelaar. Zijn LMArena frontend-code #1 op 1679 is een crowd-sourced resultaat van vele blinde vergelijkingen. Qwen's Terminal-Bench 86.6 en GPQA Diamond 92.6 zijn echte cijfers, maar ze zijn van Alibaba zelf, op een testopstelling die niemand anders heeft gedraaid. Een nuttig anker: de voorganger Qwen3.7-Max scoorde 46 op de AA index tegen Kimi's 57.1, dus Qwen heeft een grote generatiesprong nodig om alleen maar gelijk te komen.
Er valt ook iets op te merken over de latentie, omdat het indruist tegen het gangbare verhaal. Artificial Analysis meet voor Kimi K3 een time-to-first-token van ongeveer 34 seconden — echt traag. OrcaRouter's GA-telemetrie toont Qwen3.8-Max met een p50 TTFT van 1,64 seconden. Die metingen komen uit verschillende bronnen en zijn geen gecontroleerde vergelijking, maar ze bemoeilijken de aanname uit het preview-tijdperk dat Qwen de langzaamste van de twee is.

De enige head-to-head-test, lees aandachtig.
Dit is de enige confrontatie in de serie waarbij een derde partij beide modellen op dezelfde taak tegen elkaar heeft laten draaien, waardoor het de moeite waard is om het aandachtig te lezen in plaats van het tot een winnaar te reduceren.
Trilogy AI voerde een architectuurbegrip-taak uit — een echte repository begrijpen en tot een correcte architectuurconclusie komen — en beoordeelde de resultaten:
• Totaalscore — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100
• Repo-citaten — Qwen3.8-Max: 354; Kimi K3: 274
• Gateway-verzoeken — Qwen3.8-Max: 22; Kimi K3: 53
• Mislukte toolaanroepen — Qwen3.8-Max: 0; Kimi K3: 2
• Beoordeling van toolgebruik — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10
• Cache-hitpercentage — Qwen3.8-Max: >90%; Kimi K3: >90%
Kimi won de headline met drie punten. Maar kijk naar de proceskolommen, want voor agentische engineering tellen ze meer dan de score. Qwen bereikte dezelfde kernarchitecturale conclusie met minder dan de helft van de gateway-verzoeken terwijl het zorgde voor 29% meer grounding-citaties en — het detail dat iedereen die agents bouwt zou moeten interesseren — nul mislukte tool-aanroepen tegenover Kimi's twee.
Mislukte toolaanroepen zijn wat productieagenten daadwerkelijk breekt. Ze cascaderen: een misvormde aanroep produceert een fout die het model moet interpreteren, wat beurten verbruikt, wat verdere fouten riskeert. Een model dat 22 schone verzoeken doet waar een ander er 53 doet met twee mislukkingen, is goedkoper en voorspelbaarder om te exploiteren, zelfs als het drie punten lager scoort op het antwoord. Gecombineerd met Qwen's 2,5× goedkopere uitvoertarief, pleit de operationele kosten-batenverhouding van die run aanzienlijk in het voordeel van Qwen.
De kanttekening is dat dit één taak, één evaluator, één run is. Het is geen benchmarksuite en het generaliseert niet. Kimi's 57.1-index en #1-frontendranking steunen op veel meer bewijs dan deze ene test. De juiste conclusie is beperkt: bij ten minste één realistische agentische taak was Qwen de meer gedisciplineerde toolgebruiker, terwijl het licht inboette op outputkwaliteit.

Kosten in de praktijk: agentische runs op volume
Neem een repository-analyseagent: 250.000 tokens aan codecontext per run, 12.000 tokens aan output.
• Qwen3.8-Max: 0,25M × $2 = $0,50, plus 0,012M × $6 = $0,072. ≈ $0,57 per run.
• Kimi K3: 0,25M × $3 = $0,75, plus 0,012M × $15 = $0,18. ≈ $0,93 per run.
• Bij 1.500 runs/dag: Qwen ≈ $858/dag; Kimi ≈ $1.395/dag — grofweg $16.000 per maand verschil.
• Met caching op een stabiele repo: Qwen's gecachte invoer van $0.25/1M brengt de run op ≈ $0.14; Kimi's cache-hitrate van $0.30 brengt het op ≈ $0.26.
De kloof is aan beide kanten reëel, en het Trilogy-resultaat versterkt dit nog: als Qwen daadwerkelijk minder dan de helft van de gateway-verzoeken gebruikt om vergelijkbaar werk af te ronden, is het effectieve kostenverschil bij agentische taken groter dan de tariefkaart alleen doet vermoeden.
Beide modellen factureren denktokens als output, dus configuraties met veel redeneren kosten meer dan de naieve schatting aan beide kanten — maar Qwen's tarief van $6 maakt die boete 2,5× kleiner.
Openheid: bijna-pariteit, andere timing
Dit is de as waarop de twee het meest op elkaar lijken en het verschil is puur een kwestie van gereedheid. De gewichten van Kimi K3 zijn open en in wezen klaar. Die van Qwen3.8-Max worden binnen de week beloofd, zonder licentietekst, modelkaart of repository — en een licentie bepaalt of je een model überhaupt commercieel mag gebruiken.
Praktisch gezien is geen van beide vlaggenschipmodellen zelf te hosten door een normaal team. Qwen met 2,4T is grofweg 1,2TB in 4-bit, tegen ongeveer 141GB per H200; Kimi met 2,8T is nog groter. Beide hebben acht of meer topaccelerators nodig, en het niet bekendgemaakte aantal actieve parameters van Alibaba betekent dat je de doorvoer van Qwen niet eens kunt modelleren.
Dit is waarom de gelijktijdig aangekondigde Qwen3.8-27B hier van belang is. Ook met open-weights en naar verluidt draaiend in ongeveer 17GB VRAM, geeft het de Qwen-familie een echt on-premise verhaal dat noch het 2.4T- noch het 2.8T-vlaggenschip biedt. Als open-weights je daadwerkelijke reden is om tussen deze twee te kiezen, verandert de 27B de calculus meer dan beide giganten.
Veelgestelde vragen
Is Qwen 3.8 beter dan Kimi K3?
Niet op basis van gecontroleerd bewijs. Kimi K3 heeft een onafhankelijke AA Intelligence Index van 57,1 (#3) en de nummer 1-positie voor frontend-code bij LMArena, terwijl Qwen3.8-Max bij geen enkele externe evaluator een score heeft gekregen. In de enige beschikbare directe test won Kimi met 83 tegen 80. De voordelen van Qwen zijn de prijs (2,5× goedkopere output) en, in diezelfde test, schoner toolgebruik.
Welk model is groter?
Kimi K3, met 2,8T totale parameters tegenover de 2,4T van Qwen3.8-Max — ruwweg 400B meer. Maar geen van beide maakt genoeg bekend om dat betekenisvol te laten zijn: Alibaba heeft nooit het aantal actieve parameters van Qwen gepubliceerd, terwijl dat juist het cijfer is dat de servingkosten in een Mixture-of-Experts-model bepaalt.
Welke is goedkoper?
Qwen3.8-Max, duidelijk, sinds GA. Het vermeldt $2 / $6 per 1M tegen Kimi K3's $3 / $15 — 33% minder op invoer en 2,5× minder op uitvoer. Qwen's tarief is vlak over de hele 1M-context, en de gecachte invoer van $0,25 ligt iets lager dan Kimi's cache-hit-tarief van $0,30.
Wat liet de onderlinge test eigenlijk zien?
Op de architectuur-begripstaak van Trilogy AI scoorde Kimi 83 en Qwen 80. Maar Qwen produceerde 354 repository-citaties tegenover 274 van Kimi, gebruikte 22 gateway-verzoeken tegenover 53, registreerde nul mislukte toolcalls tegenover twee, en behaalde 9/10 voor toolgebruik tegenover 8/10 van Kimi. Kimi gaf het betere antwoord; Qwen was de meer gedisciplineerde agent. Het is één taak, dus behandel het als een datapunt in plaats van een rangschikking.
Is Qwen 3.8 Max uit preview gegaan?
Ja, op 3 augustus 2026, met een gepubliceerde prijslijst en een endpoint dat compatibel is met OpenAI en DashScope. De Qoder-creditcampagne van juli beschrijft niet langer hoe het wordt verkocht.
Welke is sneller?
Mogelijk nu Qwen, wat de aanname uit het preview-tijdperk omkeert. Artificial Analysis meet Kimi K3 op ongeveer 34 seconden time-to-first-token; de 7-daagse GA-telemetrie van OrcaRouter toont Qwen3.8-Max op een p50-TTFT van 1,64 seconden. Verschillende bronnen en geen gecontroleerde vergelijking, maar beide modellen staan bekend om hun breedsprakigheid, en de gemeten TTFT van Kimi is daadwerkelijk traag.
Kan ik een van beide zelf hosten?
Niet realistisch op vlaggenschipschaal — 2.4T- en 2.8T-modellen hebben acht of meer H200-klasse GPU's nodig. Kimi's gewichten zijn vandaag klaar; die van Qwen worden binnen deze week beloofd, maar zonder licentie. Voor een echte on-premise optie is de gelijktijdig aangekondigde Qwen3.8-27B (naar verluidt ~17GB VRAM) de praktische keuze in de Qwen-familie.
Kortom
Qwen 3.8 vs Kimi K3 is de spannendste vergelijking in deze serie, en de algemene beschikbaarheid verdeelt het netjes langs twee assen. Kimi K3 houdt de kwaliteitskroon op basis van wat een scheidsrechter heeft gemeten: 57.1 op de Intelligence Index, derde overall, en LMArena's hoogste positie voor frontend-code. Dat zijn geen beweringen — het zijn resultaten, en Qwen heeft daar geen equivalent van.
Wat Qwen op 3 augustus won, is de economie, en het won die overtuigend: $2 / $6 tegenover $3 / $15, vlak over een miljoen tokens, met iets goedkopere caching. Voeg daarbij de bevinding van Trilogy dat Qwen een vergelijkbare agentische taak voltooide met de helft van de gateway-aanvragen en nul mislukte toolcalls, en Qwen ziet eruit als het operationeel efficiëntere model, zelfs waar het het minder nauwkeurige model is. Let op twee gebeurtenissen: de eerste onafhankelijke Intelligence Index-score voor Qwen3.8-Max, en de gewichten die met een licentie beschikbaar komen. Als Qwen ergens in de buurt van Kimi's 57.1 scoort, maakt de prijskloof het zeer moeilijk om Kimi voor volumewerk te rechtvaardigen. Tot die tijd is Kimi het model dat je vertrouwt en Qwen het model dat je je kunt veroorloven om te draaien — en de eerlijke manier om te kiezen is op je eigen repositories.

Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
