Een gegenereerde hero-kaart met de titel 'Qwen 4 Max vs Kimi K3', met de ondertitel 'De open-weights-belofte ontmoet de open-weights-levering' en drie pill-badges met de tekst 'Weights beloofd, niet verzonden', 'K3-weights beschikbaar vanaf 27 juli 2026' en 'Aangepaste MIT-licentie'. Een voetregel luidt 'Alibaba Yunqi-conferentie, Hangzhou'. Platte redactionele vectorstijl op een witte achtergrond met een blauw-naar-cyaan gradiëntwas en het OrcaRouter-logo rechtsonder gecompositeerd.
Engineering & Research

Qwen 4 Max vs Kimi K3: de open-weightsbelofte wordt waargemaakt in de open-weightslevering

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Moonshot AI bracht Kimi K3 op 16 juli 2026 uit en deed daarna hetgeen waar de meeste labs alleen maar over praten: het publiceerde de gewichten. De checkpoint met 2,8 biljoen parameters verscheen op 27 juli 2026 onder een Modified MIT-licentie, elf dagen na de lancering. Ondertussen werd de Yunqi-conferentie op 22 september 2026 gebruikt om Qwen 4 Max aan te kondigen als het vlaggenschip van een Qwen 4-familie met vier niveaus, waaronder een Qwen 4 27B met open gewichten — een niveau dat is toegezegd, maar niet uitgebracht. Die twee feiten vormen de vergelijking. Al het overige over Qwen 4 Max is momenteel onbekend, en de kloof tussen een beloofd open niveau en een geleverd niveau is waar deze confrontatie daadwerkelijk iets te zeggen heeft.

Wat Kimi K3 in juli op tafel legde

Kimi K3 is een mixture-of-experts met 2,8 biljoen parameters die per token 16 van de 896 experts activeert, waardoor er bij elke stap ongeveer 104 miljard parameters aan het werk worden gezet. Het heeft een contextvenster van 1.048.576 tokens aan zowel de invoer- als de uitvoerzijde en accepteert tekst-, beeld- en video-invoer met tekstuitvoer. De first-party-API kost $3,00 per miljoen invoertokens, $15,00 per miljoen uitvoertokens en $0,30 per miljoen gecachte invoertokens, en tarieven van derden liggen daaronder.

De architectuur is het onderdeel dat Alibaba's eigen preview weerspiegelt. Kimi K3 is gebouwd op Kimi Delta Attention en Attention Residuals, waarvan Moonshot beweert dat ze ongeveer 2,5 keer betere scaling-efficiëntie dan Kimi K2 opleveren en tot 6,3 keer snellere decodering bij contexten van een miljoen tokens. Dat is hetzelfde probleem waar Qwen's QSA op is gericht — attention betaalbaar maken bij extreme lengte — wat betekent dat de twee families niet zozeer op schaal concurreren als wel op wiens sparse-attentionontwerp beter veroudert.

De scores die Moonshot bij de lancering publiceerde, door de leverancier gerapporteerd en destijds niet gereproduceerd:

• Artificial Analysis Intelligence Index — 57, destijds derde, achter Claude Fable 5 en GPT-5.6 Sol. Dat cijfer werd geregistreerd onder een eerdere versie van de index; de index is sindsdien tweemaal herbouwd, dus het is een historische meting en geen actuele.

• Frontend Code Arena — eerste plaats met 1.679 Elo, vóór beide modellen die het op de algemene index overtroffen

• Terminal-Bench 2.1 — 88,3

• SWE-Marathon — 42, vóór Opus 4.8 en GPT-5.6 Sol

• DeepSearchQA — 0,95, eerste plaats, en MATH-Vision 0,98, ook eerste

• GPQA-Diamond — 0,94

Moonshots eigen lanceringsmateriaal geeft toe dat K3 op het gebied van algehele capaciteit nog steeds achterloopt op Claude Fable 5 en GPT-5.6 Sol, wat een nuttiger zin is dan welke bewering over een eerste plaats dan ook die erboven staat. De interessante vorm van de cijfers is dat een model dat derde staat op de algemene index als eerste eindigde op frontendcode en als eerste op zoekopdrachten met een lange horizon — een profiel dat zegt dat de geaggregeerde index een gespecialiseerde tool verbergt in plaats van een algemene te beschrijven.

A generated scoreboard titled 'Qwen 4 Max vs Kimi K3 - the scoreboard'. Left column 'Qwen 4 Max' reads announced not released, Qwen 4 27B promised, not published, not published, not published, not published. Right column 'Kimi K3' reads GA since July 16 2026, published July 27 2026, Modified MIT, $3.00 per 1M tokens, $15.00 per 1M tokens, 1,048,576 tokens. Footer reads 'Kimi K3 figures from Moonshot's launch material; Qwen 4 Max status per Alibaba's September 22 2026 Yunqi conference.'

Wat Alibaba heeft beloofd, en wat een belofte waard is

De aankondiging van Qwen 4 noemde vier niveaus. Qwen 4 Max als vlaggenschip, Qwen 4 Flash voor doorvoer, Qwen 4 Plus als het gebalanceerde midden, en Qwen 4 27B als het open-weight lokale niveau. Qwen-LLM-leider Liu Da Yiheng beschreef de familie als getraind op een architectuur van een nieuwe generatie en zei dat die binnenkort zou komen. Voor geen van de vier is er een datum, modelkaart, API-identifier, cloudvermelding, prijs of gepubliceerde score.

Twee specifieke dingen over die aankondiging worden verkeerd gerapporteerd, en beide zijn van belang voor iedereen die zijn plannen erop wil afstemmen:

• Het getal van 5 biljoen tot 10 biljoen parameters dat aan de berichtgeving over Qwen 4 wordt gekoppeld, is geen specificatie van Qwen 4. Het hoort bij de roadmap voor Qwen 4.5 en Qwen 5. Voor Qwen 4 Max is geen enkel parameteraantal van welke aard dan ook gepubliceerd.

• Dat de tiernamen doorlopen, betekent niet dat de specificaties worden overgedragen. Het contextvenster, de prijs en de licentie van Qwen 4 Max zijn onbekend; de cijfers van de uitgeleverde Qwen3.8-Max — 1.000.000 tokens tegen $2,00 en $6,00 per miljoen — beschrijven een ander model

De reden dat de 27B-klasse interessant is, heeft niets met benchmarks te maken. Het is de enige klasse in de Qwen 4-lijn die historisch gezien onder open gewichten is uitgebracht, en de Qwen 3.8-generatie liet zien wat dat mogelijk maakt: binnen dagen na het verschijnen van de 27B-gewichten had de community MLX-conversies, NVFP4-kwantisaties en fine-tunes van allerlei aard geproduceerd. Een aangekondigde 27B is een toezegging aan een downstream-ecosysteem, en het is de meest voorspelbare levering op de roadmap.

Maar voorspelbaarheid wordt niet geleverd. De gewichten van Kimi K3 zijn een bestand dat je vandaag kunt downloaden. De gewichten van Qwen 4 27B zijn een regel in een conferentietoespraak.

Open gewichten en uitvoerbare gewichten zijn verschillende beweringen

Er schuilt een valkuil in het behandelen van Kimi K3 als het open-weights-antwoord, en het is de moeite waard om dat ronduit te zeggen, want het is de meest voorkomende overclaim in de berichtgeving over Chinese frontiermodellen. Een mixture-of-experts met 2,8 biljoen parameters is een artefact op datacenterschaal. Gepubliceerde weights betekenen dat je het mag draaien, kunt inspecteren, kunt fine-tunen en kunt kwantiseren. Ze betekenen niet dat je het op een workstation kunt draaien. Efficiënt serveren van een checkpoint van die omvang vereist tientallen accelerators, en het kwantisatiewerk dat op een open release volgt — de NVFP4- en REAP-achtige varianten die binnen weken de ronde doen — gaat net zozeer over het model serveerbaar maken als over het kleiner maken ervan.

Een eerlijke lezing van de licentie van Kimi K3 is dus nauwer en nog steeds significant: het is een auditbaar, aanpasbaar, zelf te hosten frontiermodel, onder een Modified MIT-licentie, voor organisaties met de hardware om het te serveren. Dat is een echte strategische troef en een slechte match voor iedereen die "open weights" las als "draait op mijn laptop".

Dezelfde kanttekening zal gelden voor Qwen 4 27B als en wanneer die wordt uitgebracht — en ze geldt in mindere mate, omdat een open-weight-tier van 27B echt op lokale schaal is op een manier waarop een 2,8T-flagship dat niet is. Dat is precies waarom de Qwen 4 27B-tier in deze vergelijking meer aandacht verdient dan de Max-tier, ook al is het de Max-tier die de aankondiging vooropstelde.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3), captured September 22 2026, showing the model name, the 1M token context, text and image input with text output, vision, tool and reasoning badges, and a p50 time-to-first-token figure.

De commerciële kwestie onder de licentiekwestie

Het first-partytarief van Kimi K3 van $3,00 voor input en $15,00 voor output per miljoen tokens is een premiumpositie, en Moonshot heeft duidelijk gemaakt dat het bewust boven het goedkope segment van de Chinese markt is geprijsd. Tegenover Qwen3.8-Max à $2,00 en $6,00 is dat anderhalf keer het inputtarief en tweeënhalf keer het outputtarief — een kloof die groot genoeg is dat een workload belang moet hechten aan de specifieke sterke punten van Kimi K3, waaronder frontendcode en zoeken over een lange horizon, wil de meerprijs het waard zijn om te betalen.

OrcaRouter routeert kimi/kimi-k3 naast de Qwen 3.8-familie op één OpenAI-compatibel endpoint met 0% opslag, wat betekent dat de listprijs van de leverancier is wat je gefactureerd krijgt in plaats van een equivalent met opslag. In een vergelijking waar het prijsverschil een factor 2,5 is op de output, is de afwezigheid van een platformmarge geen afrondingsdetail — een laag van tien procent op een outputtarief van $15,00 is $1,50 per miljoen tokens, wat meer is dan de volledige inputkosten van het goedkopere model in deze vergelijking. Dezelfde endpoint biedt automatische failover en een routing-DSL om beleid expliciet uit te drukken, wat de manier is waarop je een model met het profiel van Kimi K3 kunt uitproberen op een deel van het productieverkeer zonder een heel pad in te zetten op een leverancier die je nog niet eerder hebt gebruikt.

Wat OrcaRouter niet aanbiedt, is Qwen 4 Max of welke Qwen 4-tier dan ook, omdat die nog niet als product bestaan.

A screenshot of the OrcaRouter models catalogue, captured September 22 2026, showing the filter sidebar (input modalities, context length, input price, status, series), the model card grid and a code sample posting to the OpenAI-compatible endpoint at api.orcarouter.ai.

Waar je op moet letten, en wat je moet negeren

Drie signalen zouden deze vergelijking veranderen, en ze zijn specifiek genoeg om op te letten:

• De Qwen 4 27B-gewichten. Niet de benchmarktabel van de Max-tier — het 27B-checkpoint, de licentie en de omvang ervan. Dat is de release die duidelijk maakt of de open-weighttoezegging van Alibaba in deze generatie net zo echt is als in de vorige.

• De licentie van Qwen 4 Max, als die er is. Als Alibaba de gewichten voor zijn vlaggenschip publiceert op dezelfde manier als voor Qwen3.8-Max, dan is het open-weightsargument in deze confrontatie niet langer een voordeel van Kimi, maar een gelijkspel

• Een frisse, onafhankelijke kijk op Kimi K3. De lanceringsscores van Moonshot waren zelfgerapporteerd en de Artificial Analysis-index is sindsdien twee keer herbouwd, dus zowel de 57 als de Frontend Code Arena Elo moeten opnieuw worden geherbaseerd voordat ze met iets actueels worden vergeleken

Wat je moet negeren, is elke specificatietabel voor Qwen 4 Max die verschijnt voordat Alibaba een modelkaart publiceert, en elke bewering dat de open gewichten van Kimi K3 het lokaal uitvoerbaar maken. Beide fouten doen al de ronde. Ondertussen is de vergelijking waarop je kunt handelen die tussen twee modellen die bestaan: Kimi K3 tegen een premiumtarief met geleverde gewichten en een werkelijk onderscheidend coderingsprofiel, en Qwen3.8-Max tegen minder dan de helft van het outputtarief met een vast venster van een miljoen tokens en eigen gewichten. Dat is een echte keuze, aan beide kanten geprijsd, en het vereist niet dat je wacht tot een conferentiedia een product wordt.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt