
Qwen 4 Max vs Kimi K3: löftet om öppna vikter möter leveransen av öppna vikter
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
Moonshot AI släppte Kimi K3 den 16 juli 2026 och gjorde sedan det som de flesta labb bara pratar om: man publicerade vikterna. Checkpointen med 2,8 biljoner parametrar landade den 27 juli 2026 under en Modified MIT-licens, elva dagar efter lanseringen. Samtidigt användes Yunqi-konferensen den 22 september 2026 för att tillkännage Qwen 4 Max som flaggskeppet i en Qwen 4-familj i fyra nivåer som inkluderar en Qwen 4 27B med öppna vikter – en nivå som är utlovad, inte levererad. Dessa två fakta är jämförelsen. Allt annat om Qwen 4 Max är för närvarande okänt, och gapet mellan en utlovad öppen nivå och en levererad är där den här jämförelsen faktiskt har något att säga.
Vad Kimi K3 lade på bordet i juli
Kimi K3 är en mixture-of-experts-modell med 2,8 biljoner parametrar som aktiverar 16 av 896 experter per token, vilket sätter ungefär 104 miljarder parametrar i arbete vid varje givet steg. Den har ett kontextfönster på 1 048 576 token på både in- och utdatasidan och tar emot text-, bild- och videoinmatning med textutmatning. Dess förstaparts-API listas till 3,00 USD per miljon indata-token, 15,00 USD per miljon utdata-token och 0,30 USD per miljon cachade indata-token, och tredjepartspriser ligger under det.
Arkitekturen är den del som Alibabas egen förhandsvisning återspeglar. Kimi K3 är byggd på Kimi Delta Attention och Attention Residuals, vilka Moonshot hävdar ger ungefär 2,5 gånger bättre skalningseffektivitet än Kimi K2 och upp till 6,3 gånger snabbare avkodning vid kontexter på miljontals token. Det är samma problem som Qwens QSA riktar in sig på – att göra attention överkomligt vid extrema längder – vilket innebär att de två familjerna inte tävlar om skala så mycket som om vems sparse-attention-design som åldras bäst.
Poängen som Moonshot publicerade vid lanseringen, leverantörsrapporterade och inte reproducerade vid den tidpunkten:
• Artificial Analysis Intelligence Index — 57, vid det tillfället tredjeplats bakom Claude Fable 5 och GPT-5.6 Sol. Den siffran registrerades enligt en tidigare version av indexet; indexet har sedan dess byggts om två gånger, så det är en historisk mätning snarare än en aktuell.
• Frontend Code Arena — första plats vid 1 679 Elo, före båda de modeller som fick högre poäng än den på det allmänna indexet
• Terminal-Bench 2.1 — 88,3
• SWE-Marathon — 42, före Opus 4.8 och GPT-5.6 Sol
• DeepSearchQA — 0,95, första plats, och MATH-Vision 0,98, också första
• GPQA-Diamond — 0,94
Moonshots eget lanseringsmaterial medger att K3 fortfarande ligger efter Claude Fable 5 och GPT-5.6 Sol vad gäller övergripande förmåga, vilket är en mer användbar mening än något av förstaplatsanspråken ovanför den. Det intressanta mönstret i siffrorna är att en modell som ligger trea på det allmänna indexet kom etta i frontend-kod och etta i långsiktig sökning – en profil som säger att det sammanvägda indexet döljer ett specialiserat verktyg snarare än att beskriva ett generellt.

Vad Alibaba har lovat, och vad ett löfte är värt
Tillkännagivandet av Qwen 4 namngav fyra nivåer. Qwen 4 Max som flaggskepp, Qwen 4 Flash för genomströmning, Qwen 4 Plus som den balanserade mellannivån och Qwen 4 27B som den lokala nivån med öppna vikter. Qwen LLM-chefen Liu Da Yiheng beskrev familjen som tränad på en ny generationens arkitektur och sade att den skulle komma snart. Det finns inget datum, inget modellkort, ingen API-identifierare, ingen molnlistning, inget pris och ingen publicerad poäng för någon av de fyra.
Två specifika saker om det tillkännagivandet rapporteras fel, och båda är viktiga för alla som försöker planera utifrån det:
• Siffran på 5 till 10 biljoner parametrar som kopplas till bevakningen av Qwen 4 är inte en specifikation för Qwen 4. Den tillhör färdplanen för Qwen 4.5 och Qwen 5. Inget antal parametrar av något slag har publicerats för Qwen 4 Max
• Att nivånamnen fortsätter innebär inte att specifikationerna förs vidare. Qwen 4 Max kontextfönster, pris och licens är okända; siffrorna för den levererade Qwen3.8-Max – 1 000 000 tokens till $2,00 och $6,00 per miljon – beskriver en annan modell
Anledningen till att 27B-nivån är den intressanta har ingenting med benchmarks att göra. Det är den enda nivån i Qwen 4-serien som historiskt har släppts med öppna vikter, och Qwen 3.8-generationen visade vad det möjliggör: inom dagar efter att 27B-vikterna hade landat hade communityn producerat MLX-konverteringar, NVFP4-kvantiseringar och finjusteringar av alla slag. En annonserad 27B är ett åtagande gentemot ett nedströms ekosystem, och det är den mest förutsägbara leveransen på färdplanen.
Men det förutsägbara levereras inte. Kimi K3:s vikter är en fil du kan ladda ner idag. Qwen 4 27B:s vikter är en rad i ett konferensföredrag.
Öppna vikter och körbara vikter är olika påståenden
Det finns en fälla i att betrakta Kimi K3 som svaret med öppna vikter, och det är värt att säga rakt ut eftersom det är den vanligaste överdriften i bevakningen av kinesiska frontlinjemodeller. En mixture-of-experts-modell med 2,8 biljoner parametrar är en artefakt i datacenterklass. Publicerade vikter innebär att du får köra den, kan granska den, kan finjustera den och kan kvantisera den. De innebär inte att du kan köra den på en arbetsstation. Effektiv servering av en checkpoint av den storleken kräver tiotals acceleratorer, och det kvantiseringsarbete som följer på en öppen lansering – NVFP4- och REAP-liknande varianter som cirkulerar inom några veckor – handlar lika mycket om att göra modellen serverbar som om att göra den mindre.
Så en ärlig tolkning av Kimi K3:s licens är snävare och fortfarande betydelsefull: den är en granskningsbar, modifierbar och självhostbar frontiermodell, under en Modified MIT-licens, för organisationer med hårdvaran som krävs för att serva den. Det är en verklig strategisk tillgång och passar dåligt för alla som läste "open weights" som "körs på min laptop".
Samma förbehåll kommer att gälla för Qwen 4 27B om och när den släpps – och det gäller i mindre skarp grad, eftersom en öppen viktklass på 27B verkligen är av lokal skala på ett sätt som ett 2,8T flaggskepp inte är. Det är just därför som Qwen 4 27B-nivån förtjänar mer uppmärksamhet än Max-nivån i den här jämförelsen, trots att det var Max-nivån som tillkännagivandet inledde med.

Den kommersiella frågan bakom licensfrågan
Kimi K3:s förstapartspris på 3,00 USD för indata och 15,00 USD för utdata per miljon tokens är en premiumposition, och Moonshot har varit tydliga med att det medvetet är prissatt över den billiga änden av den kinesiska marknaden. Jämfört med Qwen3.8-Max på 2,00 USD och 6,00 USD är det en och en halv gånger indatapriset och två och en halv gånger utdatapriset – en klyfta så stor att en arbetsbelastning måste bry sig om Kimi K3:s specifika styrkor, däribland frontendkod och långsiktig sökning, för att premien ska vara värd att betala.
OrcaRouter routar kimi/kimi-k3 tillsammans med Qwen 3.8-familjen på en och samma OpenAI-kompatibla endpoint med 0 % påslag, vilket innebär att det är leverantörens listpris du faktureras för, snarare än en uppräknad motsvarighet. I en jämförelse där prisskillnaden är en faktor 2,5 på utdata är avsaknaden av en plattformsmarginal inte en avrundningsdetalj – ett påslag på tio procent på ett utpris på 15,00 USD är 1,50 USD per miljon token, vilket är mer än hela indatakostnaden för den billigare modellen i den här jämförelsen. Samma endpoint har automatisk redundansväxling och en routnings-DSL för att uttrycka policy explicit, vilket är hur du testar en modell med Kimi K3:s profil på en andel av produktionstrafiken utan att satsa en hel väg på en leverantör som du inte har kört tidigare.
Det som OrcaRouter inte erbjuder är Qwen 4 Max eller någon Qwen 4-nivå, eftersom ingen av dem finns som produkt ännu.

Vad man bör uppmärksamma, och vad man bör ignorera
Tre signaler skulle förändra den här jämförelsen, och de är tillräckligt specifika för att hålla utkik efter:
• Qwen 4 27B-vikterna. Inte Max-nivåns benchmarktabell – utan 27B-checkpointen, dess licens och dess storlek. Det är släppet som kommer att visa dig huruvida Alibabas åtagande att släppa öppna vikter i den här generationen är lika verkligt som i den förra
• Qwen 4 Max:s licens, om någon. Om Alibaba publicerar vikterna för sin flaggskeppsmodell på samma sätt som man gjorde för Qwen3.8-Max, upphör argumentet för öppna vikter i den här matchen att vara Kimis fördel och blir ett oavgjort resultat.
• En färsk oberoende bedömning av Kimi K3. Moonshots lanseringspoäng var självrapporterade och Artificial Analysis-indexet har byggts om två gånger sedan dess, så både 57:an och Frontend Code Arena Elo behöver baseras om innan de jämförs med något aktuellt
Det man bör ignorera är varje specifikationstabell för Qwen 4 Max som dyker upp innan Alibaba publicerar ett modellkort, och varje påstående att Kimi K3:s öppna vikter gör den lokalt körbar. Båda felen cirkulerar redan. Under tiden är den jämförelse du kan agera utifrån mellan två modeller som finns: Kimi K3 till ett premiumpris med levererade vikter och en genuint särpräglad kodningsprofil, och Qwen3.8-Max till mindre än halva priset för utdata med ett fast fönster på en miljon token och egna vikter. Det är ett verkligt val, prissatt på båda sidor, och det kräver inte att man väntar på att en konferensslide ska bli en produkt.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
