
Qwen 3.8 vs Kimi K3: Två kinesiska jättar, och nu är en billigare
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 177 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
Dessa är de två mest betydelsefulla kinesiska framkantsmodellerna 2026, och de är nära kusiner: båda enorma system av typen sparse Mixture-of-Experts, båda med 1M-token kontext, båda multimodala, båda med lovande öppna vikter. Kimi K3 från Moonshot är faktiskt den större av de två, med 2,8T totala parametrar mot Qwens 2,4T — en nyttig påminnelse om att parameterantal inte är en ranking.
Fram till den 3 augusti 2026 var denna jämförelse skev på ett specifikt sätt: Kimi K3 hade ett granskat Artificial Analysis Intelligence Index på 57,1, en #1 LMArena frontend-kodranking, publicerade priser och släppta vikter, medan Qwen3.8-Max hade en 2,4T-rubrik och inget annat. GA förändrade ekonomin i grunden. Qwen publicerar nu $2 / $6 per miljon tokens mot Kimis $3 / $15 — vilket gör den större, bättre beprövade modellen till den dyrare med bred marginal.
En notis till byggare — det snabbaste sättet att avgöra detta är att köra båda på dina egna prompts. OrcaRouter frontar över 200 modeller bakom en OpenAI-kompatibel endpoint, så du kan ställa Qwen 3.8 Max mot Kimi K3 på samma uppgift utan att koppla ihop två SDK:er.
TL;DR-slutsats. Kimi K3 vinner fortfarande på bevis: ett granskat AA Intelligence Index of 57.1 (#3), LMArena frontend-code #1-platsen på 1679, och öppna vikter som faktiskt är redo. Qwen3.8-Max är fortfarande inte betygsatt av någon oberoende utvärderare. Men GA gav Qwen två verkliga fördelar. På priset är det nu avsevärt billigare — $2 / $6 mot $3 / $15, vilket innebär 2.5× mindre på utdata. Och i det enda head-to-head-testet från tredje part som finns, förlorade Qwen toppresultatet 80 mot 83 samtidigt som den var den tydligt bättre uppträdande agenten: 354 repo-citeringar mot 274, 22 gateway-begäranden mot 53 och noll misslyckade verktygsanrop mot två. Kimi för granskad kvalitet; Qwen för billigare, renare agentisk exekvering.
Viktiga slutsatser
• Kimi K3 är den större modellen — 2.8T MoE jämfört med Qwens 2.4T, ungefär 400B mer — vilket är ett bra argument mot att behandla parameterantal som en proxy för kapacitet.
• Qwen3.8-Max är GA sedan 3 augusti 2026 till $2 / $6 per 1M flat, jämfört med Kimi K3:s $3 / $15 (AA blended ~$2,31). Qwen är nu 2,5× billigare på output.
• Kimi K3 har den granskade ställningen: AA Intelligence Index 57.1 (#3), endast bakom Fable 5 och GPT-5.6 Sol, plus LMArena frontend-code #1 (1679). Qwen3.8-Max är fortfarande inte poängsatt.
• I det enda direkta testet (Trilogy AI) slog Kimi Qwen med 83 till 80 totalt — men Qwen gjorde fler repo-citeringar (354 mot 274), färre gateway-förfrågningar (22 mot 53), och hade noll misslyckade verktygsanrop (mot två), med betyget 9/10 för verktygsanvändning mot Kimis 8/10.
• Qwen rapporterar nu agentiska och kodningssiffror: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (från en föregångares 40.7) — alla rapporterade av Alibaba.
• Tidpunkten för öppenhet gynnar fortfarande Kimi: dess vikter är i princip redo; Qwens utlovas inom en vecka, utan licens eller repository ännu.
Anmärkning om korrekthet: alla kvalitetssiffror för Qwen3.8-Max är rapporterade av Alibaba och inte verifierade av tredje part. Kimi K3-siffror kommer från Artificial Analysis och LMArena. Direktjämförelsen är ett enda test av Trilogy AI och bör läsas som en enskild datapunkt, inte som en allmän rangordning. Qwens prissättning är GA-prislistan och ersätter julens förhandsrabatt.
Specarna och priset, sida vid sida
Här är de hårda uppgifterna, varje siffra med angiven källa.
• Tillverkare / status — Qwen3.8-Max: Alibaba; GA (3 augusti 2026); Kimi K3: Moonshot; open-weight-utgåva
• Arkitektur — Qwen3.8-Max: ~2,4T totalt, gles MoE (aktiva parametrar fortfarande ej offentliggjorda); Kimi K3: 2,8T MoE, inbyggd vision (Artificial Analysis)
• Kontextfönster — Qwen3.8-Max: 1M tokens (983,616 med tänkande; max utdata 131,072); Kimi K3: 1M tokens (Artificial Analysis)
• AA Intelligence Index — Qwen3.8-Max: Ännu inte poängsatt; Kimi K3: 57.1 — #3 (Artificial Analysis)
• Arena / topplista — Qwen3.8-Max: Inte offentligt poängsatt; Kimi K3: Frontend-code #1, 1679 (LMArena)
• Leverantörsrapporterade poäng — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (Alibaba-rapporterade); Kimi K3: ställningen är mätt av tredje part
• Pris (in / ut) — Qwen3.8-Max: $2.00 / $6.00 per 1M, fast; cachad input $0.25; Kimi K3: $3 / $15 per 1M (AA blandat ~$2.31), cacheträffar $0.30
• Öppna vikter — Qwen3.8-Max: Utlovat inom veckan (ingen licens ännu); Kimi K3: Öppna vikter; vikterna redo
• Hastighet — Qwen3.8-Max: p50 TTFT 1.64s (OrcaRouter 7-dagars telemetri); Kimi K3: mångordig och långsam (~34s TTFT, per AA)
Två saker ramar in denna jämförelse, och en av dem vände helt den 3 augusti.
Först vände prisrelationen. Under juli var Kimi K3 modellen med ett faktiskt pris och Qwen modellen med en rabattkupong. Nu publicerar båda sina priser, och den bättre beprövade, större modellen är den dyrare: $3 / $15 mot $2 / $6. På output – där resonerande och kodgenerering står för kostnaderna – kostar Kimi 2,5× mer. Qwen tar ut ett fast pris för hela sin 1M-token-kontext, och dess cachade indata på $0,25 ligger något under Kimis $0,30 för cacheträffar. För alla högvolymarbetsbelastningar är Qwens kostnadsbild nu klart bättre.
För det andra, bevisgapet är oförändrat, och det är anledningen till att Kimi fortfarande vinner. Kimi K3:s 57.1 Intelligence Index placerar den på tredje plats totalt, bakom endast Fable 5 och GPT-5.6 Sol — det är ett neutralt utvärderarutlåtande. Dess LMArena frontend-code #1 på 1679 är ett crowdsourcat resultat från många blinda jämförelser. Qwens Terminal-Bench 86.6 och GPQA Diamond 92.6 är reella siffror men Alibabas egna, på en testmiljö som ingen annan har kört. En användbar referenspunkt: föregångaren Qwen3.7-Max fick 46 på AA-indexet mot Kimis 57.1, så Qwen behöver ett stort generationshopp bara för att komma ikapp.
Det finns också en latensaspekt värd att notera, eftersom den går emot den vanliga bilden. Artificial Analysis mäter Kimi K3 till ungefär 34 sekunder till första token — verkligt långsamt. OrcaRouters GA-telemetri visar Qwen3.8-Max med en p50-TTFT på 1,64 sekunder. Dessa mätningar kommer från olika källor och är inte en kontrollerad jämförelse, men de komplicerar antagandet från förhandsversionen att Qwen är den tröga av de två.

Det enda head-to-head-testet, läs noggrant.
Detta är den enda jämförelsen i serien där en tredje part har kört båda modellerna mot varandra på samma uppgift, vilket gör den värd att läsa noggrant snarare än att sammanfatta till en vinnare.
Trilogy AI genomförde en arkitekturförståelseuppgift — att förstå ett verkligt repository och dra en korrekt arkitektonisk slutsats — och betygsatte resultaten:
• Totalpoäng — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100
• Repo-citeringar — Qwen3.8-Max: 354; Kimi K3: 274
• Gateway-förfrågningar — Qwen3.8-Max: 22; Kimi K3: 53
• Misslyckade verktygsanrop — Qwen3.8-Max: 0; Kimi K3: 2
• Verktygsanvändningsbetyg — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10
• Cacheträffsgrad — Qwen3.8-Max: >90%; Kimi K3: >90%
Kimi vann rubriken med tre poäng. Men titta på processkolumnerna, för inom agentisk ingenjörskonst betyder de mer än poängen. Qwen nådde samma grundläggande arkitektoniska slutsats med färre än hälften av gateway-förfrågningarna medan den producerade 29% fler förankringscitat och — detaljen som borde intressera alla som bygger agenter — noll misslyckade verktygsanrop mot Kimis två.
Misslyckade verktygsanrop är det som faktiskt bryter produktionsagenter. De kaskaderar: ett felformaterat anrop ger ett fel som modellen måste tolka, vilket förbrukar turer, vilket riskerar ytterligare fel. En modell som gör 22 rena förfrågningar där en annan gör 53 med två misslyckanden är billigare och mer förutsägbar att driva, även om den får tre poäng lägre på svaret. Kombinerat med Qwens 2,5× billigare utdatatakt gynnar de operativa ekonomiska förhållandena i den körningen Qwen avsevärt.
Förbehållet är att detta är en uppgift, en utvärderare, en körning. Det är inte en benchmarksvit och det generaliserar inte. Kimis 57,1-index och #1-frontendrankning vilar på långt fler bevis än detta enda test gör. Den korrekta slutsatsen är snäv: i minst en realistisk agentisk uppgift var Qwen den mer disciplinerade verktygsanvändaren samtidigt som den tappade något i utdatakvalitet.

Kostnad i praktiken: agentiska körningar i stor skala
Ta en repository-analysagent: 250 000 tokens kodkontext per körning, 12 000 tokens utdata.
• Qwen3.8-Max: 0.25M × $2 = $0.50, plus 0.012M × $6 = $0.072. ≈ $0.57 per körning.
• Kimi K3: 0,25M × $3 = $0,75, plus 0,012M × $15 = $0,18. ≈ $0,93 per körning.
• Vid 1 500 körningar/dag: Qwen ≈ $858/dag; Kimi ≈ $1 395/dag — ungefär $16 000/månad i skillnad.
• Med cachning på ett stabilt repo: Qwens cachade input till $0.25/1M tar körningen till ≈ $0.14; Kimis cacheträfffrekvens på $0.30 tar den till ≈ $0.26.
Klyftan är verklig i båda ändar, och Trilogy-resultatet förvärrar den: om Qwen verkligen använder mindre än hälften av gateway-förfrågningarna för att slutföra jämförbart arbete, så är den faktiska kostnadsskillnaden för agentiska uppgifter större än vad prislistan ensam antyder.
Båda modellerna fakturerar tanketokens som utdata, så resoneringstunga konfigurationer kostar mer än den naiva uppskattningen på båda sidor – men Qwens $6-pris gör att det straffet blir 2,5× mindre.
Öppenhet: nära paritet, annan tajming
Detta är den axel där de två är mest lika och skillnaden handlar enbart om hur redo de är. Kimi K3:s vikter är öppna och i princip redo. Qwen3.8-Max:s utlovas inom veckan, utan licenstext, modellkort eller repository ännu — och en licens är det som avgör om du över huvud taget kan använda en modell kommersiellt.
I praktiken kan inget av flaggskeppen självhostas av ett normalt team. Qwen på 2.4T är ungefär 1.2TB i 4-bit mot cirka 141GB per H200; Kimi på 2.8T är ännu större. Båda kräver åtta eller fler toppacceleratorer, och Alibabas icke offentliggjorda antal aktiva parametrar innebär att du inte ens kan modellera Qwens genomströmning.
Det är därför den samtidigt tillkännagivna Qwen3.8-27B spelar roll här. Den har också öppna vikter och rapporteras köra på ungefär 17 GB VRAM, det ger Qwen-familjen en genuin on-premise-historia som varken 2.4T eller 2.8T-flaggskeppet erbjuder. Om öppna vikter är din faktiska anledning till att välja mellan dessa två, förändrar 27B:en beräkningen mer än någon av jättarna gör.
Vanliga frågor
Är Qwen 3.8 bättre än Kimi K3?
Inte enligt granskade bevis. Kimi K3 innehar ett oberoende AA Intelligence Index på 57,1 (#3) och LMArenas #1-plats för frontend-kod, medan Qwen3.8-Max inte har poängsatts av någon tredjepartsutvärderare. I det enda direkta test som finns tillgängligt vann Kimi med 83 mot 80. Qwens fördelar är priset (2,5× billigare utdata) och, i samma test, renare verktygsanvändning.
Vilken modell är större?
Kimi K3, med 2,8 biljoner parametrar totalt mot Qwen3.8-Max:s 2,4 biljoner — ungefär 400 miljarder fler. Men ingen av dem offentliggör tillräckligt för att det ska vara meningsfullt: Alibaba har aldrig publicerat Qwens antal aktiva parametrar, vilket är den siffra som faktiskt avgör driftkostnaden i en Mixture-of-Experts-modell.
Vilket är billigare?
Qwen3.8-Max, helt klart, sedan GA. Den listar $2 / $6 per 1M jämfört med Kimi K3:s $3 / $15 — 33% mindre på input och 2,5× mindre på output. Qwens pris är fast över hela 1M-kontexten, och dess cachade input på $0,25 ligger något under Kimis $0,30 för cache-träffar.
Vad visade det direkta jämförelsetestet egentligen?
Trilogy AI:s uppgift om arkitekturförståelse gav Kimi 83 och Qwen 80. Men Qwen producerade 354 repo-hänvisningar mot Kimis 274, använde 22 gateway-begäranden mot 53, loggade noll misslyckade verktygsanrop mot två, och fick 9/10 på verktygsanvändning mot Kimis 8/10. Kimi gav det bättre svaret; Qwen var den mer disciplinerade agenten. Det är en enda uppgift, så betrakta det som en datapunkt snarare än en rankning.
Har Qwen 3.8 Max lämnat förhandsversionen?
Ja, den 3 augusti 2026, med en publicerad prislista och en OpenAI- och DashScope-kompatibel endpoint. Julys Qoder-kreditkampanj beskriver inte längre hur tjänsten säljs.
Vilken är snabbast?
Möjligen Qwen nu, vilket vänder på antagandet från förhandsvisningseran. Artificial Analysis mäter Kimi K3 till ungefär 34 sekunders time-to-first-token; OrcaRouters 7-dagars GA-telemetri visar Qwen3.8-Max med en p50-TTFT på 1,64 sekunder. Olika källor och ingen kontrollerad jämförelse, men båda modellerna har rykte om sig att vara mångordiga, och Kimis uppmätta TTFT är genuint långsam.
Kan jag self-host någon av dem?
Inte realistiskt i flaggskeppsskala — 2.4T- och 2.8T-modeller behöver åtta eller fler H200-klassade GPU:er. Kimis vikter är redo idag; Qwens utlovas inom veckan, dock utan licens ännu. För ett äkta on-premise-alternativ är den samtidigt tillkännagivna Qwen3.8-27B (enligt uppgift ~17GB VRAM) det praktiska valet i Qwen-familjen.
Slutsats
Qwen 3.8 vs Kimi K3 är den jämnaste uppgörelsen i den här serien, och allmän tillgänglighet delade upp den tydligt längs två axlar. Kimi K3 behåller kvalitetskronan tack vare det en domare mätte: 57,1 på Intelligence Index, trea totalt, och LMArenas topplats för frontend-kod. Det är inte påståenden — det är resultat, och Qwen har inget motsvarande.
Det Qwen vann den 3 augusti är ekonomin, och den vann den avgjort: $2 / $6 mot $3 / $15, platt över en miljon tokens, med något billigare cachning. Lägg till Trilogy-resultatet att Qwen slutförde en jämförbar agentisk uppgift med hälften så många gateway-anrop och noll misslyckade verktygsanrop, och Qwen framstår som den mer operationellt effektiva modellen även där den är den mindre exakta. Håll koll på två händelser: det första oberoende Intelligence Index-resultatet för Qwen3.8-Max, och att vikterna släpps med en licens. Om Qwen får ett resultat i närheten av Kimis 57,1 gör prisskillnaden det mycket svårt att motivera Kimi för volymarbete. Tills dess är Kimi modellen du litar på och Qwen den du har råd att köra — och det ärliga sättet att välja är på dina egna repositories.

Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
