
Qwen3.8-27B Open Weights: De Max is uitgekomen, de 27B niet — Wat we nu weten
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 36 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 181 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Op 13 augustus 2026 viel de open-weights-week die Alibaba voor zijn Qwen3.8-generatie had beloofd in tweeën. De gewichten van het Max-vlaggenschip — Qwen3.8-2.4T-A95B, een sparse mixture-of-experts-model met 2,4 biljoen parameters en de eerste Max-level Qwen-release die ooit downloadbaar is gemaakt — werden daadwerkelijk uitgebracht op Hugging Face en ModelScope, laat op de vorige avond aangekondigd via de ModelScope-community. Het kleinere model waar deze pagina over gaat, Qwen3.8-27B, deed dat niet: beloofd voor dezelfde week van 10 augustus, heeft het nog steeds geen officiële repository, modelkaart, licentiebestand of eigen benchmark, en trackers van derden omschrijven de release inmiddels als vertraagd zonder dat er een nieuwe datum is gegeven. De vraag die deze 'wat-we-tot-nu-toe-weten'-pagina moest beantwoorden — "wanneer verschijnt de 27B nu echt?" — is uitgegroeid tot twee vragen: waarom werden de gewichten van de Max eerst uitgebracht, en wat is er met de 27B gebeurd?
Dit blijft een stuk over wat we tot nu toe weten, geen recensie. Qwen3.8-Max, het API-vlaggenschip, is sinds 3 augustus live tegen $2/$6 per miljoen tokens; het onderliggende open-gewichtenbasismodel, Qwen3.8-2.4T-A95B, is op 13 augustus downloadbaar geworden; en de Qwen3.8-27B-gewichten zijn nog steeds niet gepubliceerd. Elke bewering hieronder is dienovereenkomstig gelabeld als bevestigd, door de leverancier gerapporteerd of door de community geschat.
Het signaal, en wat de week daadwerkelijk opleverde
Het vroege signaal was een post op X van @kimmonismus, die "volgende week" aanwees als de week om in de gaten te houden: "Qwen-3.8 27b - Grok 4.6," met Astra opvallend afwezig op de lijst. De Grok-helft van die week werd op 12 augustus uitgebracht. De Qwen-helft splitste zich in tweeën. Wat de post vastlegde, was de stemming onder mensen die modelreleases beroepshalve volgen — de Qwen3.8 open-weights-release was het evenement op de kalender, en de week begon terwijl de details nog niet vaststonden. Een week later zijn de details gedeeltelijk opgehelderd: een van de twee beloofde open-weights-releases is verschenen, en het was niet degene die de post noemde.
Wat is er bevestigd?
• De familie is echt en officieel aangekondigd.Alibaba onthulde op 3 augustus 2026 de Qwen3.8-basismodelfamilie, na een previewversie medio juli.
• Qwen3.8-Max verscheen dezelfde dag. Het API-vlaggenschip — een mixture-of-experts-model met 2,4 biljoen parameters, ongeveer 95 miljard actieve parameters, een contextvenster van 1 miljoen tokens en invoer van tekst, beeld en video — ging live op de Qwen API voor $2/$6 per miljoen tokens. Het is ook beschikbaar via OrcaRouter tegen dezelfde lijstprijs, zonder opslag.
• De open-weights van de Max zijn op 13 augustus uitgebracht. Qwen3.8-2.4T-A95B — het basismodel waarop de Qwen3.8-Max API is gebouwd — werd downloadbaar via Hugging Face en ModelScope, met een FP8-gekwantiseerde versie erbij. Dit is de allereerste open-weights-release van een Qwen op Max-niveau. Het downloadbare model is tekst-only, met de denkmodus geforceerd ingeschakeld, heeft een native context van 256K tokens, uitbreidbaar tot ongeveer 1M, en draait op SGLang, vLLM en TokenSpeed.
• Qwen3.8-27B is het kleinere open-weight model van de familie — nog niet uitgebracht. Alibaba positioneerde het als de realistische route voor lokale en on-premise implementatie en zegde de gewichten toe aan Hugging Face en ModelScope, naast die van de Max. Per 13 augustus is er nog steeds geen officiële Qwen3.8-27B-repository. De toezegging was reëel; de levering is echter nog niet gebeurd.
• De eerste onafhankelijke score voor de generatie bestaat. Artificial Analysis plaatst Qwen3.8-Max op een Intelligence Index van 56 voor ongeveer $1,14 per taak — oprecht goed, met de kanttekeningen die bij elk vlaggenschip van enkele dagen oud horen.
Wat we eigenlijk weten over de 27B
De eerlijke samenvatting is dat "Qwen3.8-27B" nog steeds vooral een naam en een parameteraantal is. De bevestigde feiten zijn dat het een model is met ongeveer 27 miljard parameters, dat het de open-weights variant van de Qwen3.8-generatie is, en dat het is afgestemd op werk met een enkele GPU en on-premise, in plaats van een cluster met honderden GPU’s. Unsloth’s Daniel Han meldt dat het bij release in ongeveer 17 GB VRAM zou moeten passen — een enkele prosumerkaart.
Al het overige is onbevestigd. Alibaba heeft niet gepubliceerd of de 27B een dense model of een mixture-of-experts is, wat het contextvenster is, welke modaliteiten het accepteert, of eigen benchmarkscores. Wat deze week veranderde, is de timing: de Max en de 27B waren voor dezelfde week beloofd, en alleen de Max is gearriveerd. Trackers van derden melden nu dat de 27B is vertraagd zonder nieuwe datum — een interpretatie van de community, geen officiële verklaring van Alibaba, en het is mogelijk dat de repo nog verschijnt vóórdat de beloofde week volledig voorbij is. Maar op het moment van schrijven vermeldt de officiële Qwen-organisatie op Hugging Face geen Qwen3.8-27B, en de handvol "Qwen3.8-27B-FP8", "-GGUF" en "-MLX" repositories die in zoekresultaten opduiken, zijn community-placeholderkaarten met eencijferige downloadaantallen, niet de officiële release.
Het nuttige referentiepunt is nog steeds de 27B van de vorige generatie: Qwen3.5-27B, een open-weight dense model met een contextvenster van 32K. Het is een redelijke ondergrens voor wat de Qwen3.8-27B moet overtreffen, en een herinnering dat Qwen-modellen uit de 27B-klasse historisch zijn gebouwd om te draaien op hardware die een ontwikkelaar daadwerkelijk bezit.
De Max is het referentiepunt voor wat de 27B zou kunnen erven.

De 27B zal de ruwe piek van de Max niet evenaren, maar de cijfers van de Max — nu gepubliceerd in een echte modelkaart — bepalen de verwachtingen voor wat de verbeteringen van deze generatie inhouden. In Alibaba's eigen evaluaties van het open-weights model scoort Qwen3.8-2.4T-A95B 93.0 op PaperBench, 86.1 op OSworld-Verified, 91.5 op parametrische CAD, 67.7 op SWE-bench Pro en 86.6 op Terminal-Bench 2.1, waarbij de leverancier pariteit claimt met Claude Opus 4.8, Claude Fable 5, GPT-5.6 Sol en Gemini 3.1 Pro. Dit zijn door de leverancier gerapporteerde cijfers, gepubliceerd in het releasemateriaal en nog niet gereproduceerd door een onafhankelijk laboratorium. De agentische winst die de API-lancering claimde — FrontierSWE die in één generatie van 40.7 naar 73.5 springt — staat in hetzelfde releasemateriaal. Als zelfs maar een deel van die verbetering doorsijpelt naar een 27B, zou dat herdefiniëren wat 'goed lokaal codeermodel' betekent in zijn klasse.
Eén nuance om vast te houden: de downloadbare Max is niet identiek aan de API-Max. Qwen3.8-2.4T-A95B is text-only met denkmodus geforceerd ingeschakeld, terwijl de Qwen3.8-Max API visuele invoer, een niet-denkmodus en een standaard context van 1M tokens toevoegt. Die kloof is precies het soort ding dat een 27B waarschijnlijk zal erven — en de moeite waard om te onthouden wanneer je "Qwen3.8" benchmarkkoppen leest zonder te controleren welke variant ze beschrijven.
Prijs is waar de Max het meest verdedigbaar is: $2/$6 per miljoen tokens over de volledige 1M-token context op de API, zonder toeslag voor lange prompts. Dat is agressief voor een frontier-API, en het telt mee voor de routeringsberekening — bij die cijfers wordt de 3.8-generatie een optie voor workloads die vroeger standaard naar duurdere vlaggenschepen gingen.
Wat kan het daadwerkelijk draaien?

Voor de 27B heeft Alibaba nog steeds geen hardwarevereisten gepubliceerd, dus de cijfers die in omloop zijn, blijven communityprojecties op basis van de Qwen 3.6-27B quant-tabel — schattingen, geen specificaties. De werkbereiken waar de meeste mensen vanuit gaan, zijn ongewijzigd:
• Q4_K_M kwantisering, ~16 GB VRAM — een RTX 4090 of gelijkwaardig, het ideale punt dat de meeste lokale ontwikkelaars zullen nastreven.
• Q3_K_M quant, ~13GB VRAM — past op een 12GB-kaart zoals de RTX 3060 met verminderde kwaliteit.
• Q6_K quant, ~21GB VRAM — nagenoeg verliesvrij op 24GB-kaarten.
• FP8 serving, ~27GB VRAM — een enkele L40S, volgens de eerdere projectie, voor productieklare inferentie.
• Volledige precisie, H100 80GB — het pad van benchmarkkwaliteit, en niet iets dat de meeste teams zullen draaien.
De nieuwe twist is dat 'je de Qwen3.8-generatie nu zelf kunt hosten' waar is, maar niet voor het model waar mensen op hadden gerekend. De open gewichten van de Max zijn een heel andere hardwareklasse: het full-precision BF16-model is ruwweg 4,9 TB, en de 1-bit gelaagde selectieve kwantisering van Unsloth brengt het op ongeveer 397 GB — draaibaar, maar alleen met 410 GB of meer aan gecombineerd RAM en VRAM. Dat is serieuze infrastructuur, geen prosumer-kaart. Het is precies de kloof die de 27B moet opvullen, wat maakt dat het aanhoudende uitblijven van de 27B de reden is dat het lokale pad met één GPU voor deze generatie nog niet bestaat.
De licentievraag: de Max heeft zojuist het precedent geschapen.
De licentie-vraag voor de 27B is nog steeds onbeantwoord, maar "hoe het eruit zou zien" is geen gok meer. De open weights van de Max werden uitgebracht onder een aangepaste licentie met het label "qwen3.8-max" — niet Apache 2.0. Zoals gerapporteerd op de modelkaart, is het over het algemeen gratis voor commercieel gebruik en hosting, maar het activeert extra vereisten op schaal: producten met meer dan 100 miljoen maandelijkse actieve gebruikers of meer dan $20 miljoen aan maandelijkse omzet moeten de modelnaam tonen, en bedrijven met meer dan $50 miljoen aan jaarlijkse omzet die model-as-a-service of AI-werkassistentdiensten aanbieden, hebben een aparte licentie nodig. Een rondgaande bewering dat de licentie gebruik in de VS, EU, VK en Korea verbiedt, is onjuist — de licentie bevat geen territoriale beperkingen.
Voor de 27B in het bijzonder is nog geen licentie genoemd. Maar de Max is uitgebracht onder een aangepaste Qwen-licentie in plaats van Apache 2.0, waardoor Apache 2.0 ook voor het zustermodel een slechte aanname is. De oude Tongyi Qianwen-licentie — met de clausule van 100 miljoen MAU — is niet wat de Max heeft gekregen; die van de Max is een nieuwe, naar schaal gelaagde licentie. Lees het LICENSE-bestand in de daadwerkelijke repository voordat je er je plannen op baseert, en verwacht dat die van de 27B pas wordt beslist wanneer de repository ervan uitkomt.
Toolchain-timing: ondersteuning vanaf dag één is zojuist bewezen
De serving-engines gingen net zo snel als verwacht — voor het model dat uitkwam. Qwen3.8-2.4T-A95B werd gelanceerd met werkende ondersteuning in SGLang, vLLM en TokenSpeed; zo ziet 'vrijwel direct via API serveerbaar' eruit voor een grote open-weights-release. Voor de 27B zullen dezelfde engines naar verwachting als eerste ondersteuning bieden zodra de repo verschijnt, en omdat Max vanaf dag één werd ondersteund, is het redelijk om te verwachten dat de 27B die ondersteuning erft. Community-kwantisaties in GGUF en AWQ lopen doorgaans nog één tot twee weken achter, dus de Ollama-achtige 'pull and run'-ervaring zal er op de releasedag van de 27B waarschijnlijk nog steeds niet zijn — een handmatige vLLM- of llama.cpp-setup is in eerste instantie de meest waarschijnlijke lokale route.
Wat is er nog onbekend?
Een eerlijk lekstuk stopt bij wat daadwerkelijk openbaar is, en de grens is in de ene richting breder dan een week geleden en in de andere smaller: de vragen van Max werden beantwoord, die van de 27B's niet.
• De nieuwe releasedatum. "De week van 10 augustus" was de toezegging; de week is bijna voorbij en de repo is niet verschenen. Trackers van derden melden een vertraging zonder nieuwe datum, maar Alibaba heeft geen officiële verklaring afgelegd.
• Architectuur. Dense of MoE voor de 27B, en indien MoE, het aantal actieve parameters.
• Het specificatieblad. Contextvenster, modaliteiten, outputlimieten, redeneermodus.
• Benchmarks. De 27B heeft geen officiële scores en geen onafhankelijke evaluatie.
• De licentie. Nog onbeslist totdat de repository van de 27B uitkomt; de aangepaste licentie van de Max is het precedent om tegen te waken.
• Mirrorrisico. Het placeholderprobleem is nu zichtbaar in het wild — communitykaarten "Qwen3.8-27B-FP8", "-GGUF" en "-MLX" bestaan met nul officiële bestanden. Totdat de officiële Qwen-organisatie de repo publiceert, download je alleen van de officiële organisatiepagina.
Wat het voor bouwers betekent
De praktische verdeling voor de Qwen3.8-generatie is nu een driedeling in plaats van een tweedeling. Als je vandaag de frontier-API wilt, is Qwen3.8-Max live via OrcaRouter tegen de adviesprijs van $2/$6 van de provider, zonder opslag doorberekend — de prijs die je ziet, is de prijs die Alibaba heeft bepaald. Wil je het Max-klasse model zelf hosten, dan zijn de open gewichten nu downloadbaar, maar heb je hardware nodig voor een model met volledige precisie van ongeveer 4,9 TB of een gekwantiseerd model van ongeveer 397 GB. En wil je de lokale implementatie op één GPU die deze generatie zou moeten bieden, dan wacht je nog steeds op Qwen3.8-27B, die nog niet is verschenen. Eén OpenAI-compatibele sleutel dekt vandaag de API-kant, en zodra de hosting van de 27B geregeld is, kan dezelfde sleutel ernaartoe routeren.

Dat laatste is het algemenere punt, en het is precies dat waar een onbewezen, vertraagde open-weight release de testcase voor vormt. Een model dat nog niet eens is uitgebracht, heeft geen track record, geen onafhankelijke benchmarksuite en geen incidentgeschiedenis — en wanneer het uiteindelijk uitkomt, zal het gloednieuw zijn. Routing is hoe je het uitprobeert zonder er een klantgerichte route op te verwedden: stuur er het verkeer naartoe dat verrassingen kan tolereren, schakel automatisch over naar een bewezen model wanneer het zich misdraagt, en verplaats de volledige workload zodra het vertrouwen heeft verdiend. De routinglaag is ook wat de prijsberekening eerlijk maakt — wanneer Alibaba de prijs verlaagt van een model dat je via één endpoint aanroept, is de wijziging dezelfde dag live, omdat de lijstprijs rechtstreeks wordt doorgegeven.
Wat te kijken
• Of de repo van de 27B überhaupt verschijnt. Een vermelding onder de officiële Qwen-organisatie op Hugging Face of ModelScope is de gebeurtenis die een einde maakt aan de vertraging — en de week van 10 augustus is bijna voorbij zonder dat er een is.
• Het licentiebestand van de 27B. De Max werd geleverd met een aangepaste licentie met schaalniveaus, niet Apache 2.0. Of de 27B dat precedent volgt, is de allerbelangrijkste zin van de uiteindelijke aankondiging.
• Architectuur en contextlengte. Dense-vs-MoE en het contextvenster bepalen waar de 27B voor dient.
• De eerste onafhankelijke benchmark. De 56 van de Max op de Artificial Analysis Intelligence Index zette de lat; de eerste externe evaluatie van de 27B zal je vertellen hoeveel van de winst van de generatie overleeft bij consumentenformaat.
• Toolchain-dekking.Of de 27B de dag-één-ondersteuning van de Max voor SGLang/vLLM/TokenSpeed erft, en hoe snel de community-kwantificaties volgen.
Veelgestelde vragen
Is Qwen3.8-27B al uitgebracht?
Nee. Alibaba kondigde het aan op 3 augustus 2026 en verplichtte zich om de gewichten in de week van 10 augustus beschikbaar te stellen op Hugging Face en ModelScope, maar per 13 augustus is er nog geen officiële Qwen3.8-27B-repository, modelkaart of licentie. De Max-class open gewichten — Qwen3.8-2.4T-A95B — werden op 13 augustus uitgebracht; de 27B niet, en trackers van derden melden dat het is vertraagd zonder nieuwe datum.
Welke hardware heb ik nodig om Qwen3.8-27B te draaien?
Onbevestigd, maar projecties van de community op basis van de Qwen 3.6-27B-quantisatietabel plaatsen een Q4_K_M-quant op ongeveer 16GB VRAM (een RTX 4090), een Q3_K_M-quant op ongeveer 13GB (12GB-kaarten), een Q6_K-quant op ongeveer 21GB (24GB-kaarten), en FP8-serving op ongeveer 27GB (een enkele L40S). Unsloth's Daniel Han meldt ongeveer 17GB bij release. Beschouw deze als schattingen totdat de officiële modelkaart hardwarerichtlijnen publiceert.
Is Qwen3.8-27B beschikbaar via OrcaRouter?
Nog niet. Qwen3.8-27B is een open-gewicht, zelf te hosten model en staat vandaag niet op het platform. Het vlaggenschip van dezelfde familie — Qwen3.8-Max — is nu beschikbaar via OrcaRouter tegen de lijstprijs van $2/$6 per miljoen tokens van de provider, met 0% opslag, en zodra de hosting van de 27B geregeld is, kan die aan dezelfde OpenAI-compatibele sleutel worden toegevoegd.
Moet ik wachten op Qwen3.8-27B of vandaag Qwen3.8-Max gebruiken?
Het hangt af van waar de workload draait. Als je nu een frontier-API nodig hebt, is Qwen3.8-Max live en agressief geprijsd op $2/$6 per miljoen tokens. Als je de Max-klasse vandaag zelf wilt hosten, is Qwen3.8-2.4T-A95B nu downloadbaar, maar het vereist serieuze hardware — ruwweg een 4.9TB-model met volledige precisie, of ongeveer 397GB gekwantiseerd, met 410GB+ aan gecombineerd RAM en VRAM. Als je een lokaal of on-premise model op een enkele consumentenkaart nodig hebt, is Qwen3.8-27B nog steeds degene om op te wachten — het is het realistische self-host-pad in deze generatie, en de uitgave is nu de open vraag in plaats van een vaste datum.
De beloofde week is bijna verstreken, en de helft ervan is niet aangekomen. Qwen3.8-2.4T-A95B is downloadbaar, gelicentieerd en serveerbaar; Qwen3.8-27B is bevestigd te bestaan, nog steeds toegewijd aan open gewichten, en nog steeds zonder repository, licentie, benchmark of nieuwe datum. Let op of de repo van de 27B landt voordat de beloofde week volledig voorbij is, wat het licentiebestand naast dat van de Max zegt, en hoe de eerste onafhankelijke evaluaties het scoren. Die drie signalen vertellen je of dit een routinematige tweestapsrelease met open gewichten is, waarbij het kleinere model nog moet komen, of een vertraging waar je rekening mee moet houden.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
