
Qwen3.8-27B: Het compacte multimodale model in Alibaba's Qwen3.8 line-up
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 316 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 196 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Qwen3.8-27B is het dense, single-node lid van de Qwen3.8-generatie van Alibaba: een native visie-taalmodel met 27 miljard parameters, gepubliceerd op Hugging Face onder Apache 2.0, dat tekst, afbeeldingen en video accepteert en tekst retourneert met een contextvenster van 262.144 tokens. Dit is de referentiepagina voor dat model — de canonieke uiteenzetting van wat het is, wat een aanroep kost en wat het kan — en het is de moeite waard om vooraf te zeggen waarom er een pagina bestaat voor een model waarvan de gewichten voor het eerst verschenen in augustus 2026 in plaats van in de afgelopen zeven dagen. We rapporteren geen lancering. We beantwoorden een blijvende vraag: lezers bereiken ons voor de naam "Qwen3.8-27B" duizenden keren per maand, en tot nu toe was er geen enkele pagina van ons die dat antwoord bezat. De release van het model zelf, gedateerd op de kaart van Qwen en geregistreerd als 2026-08-14 door Artificial Analysis, is een feit dat deze pagina gebruikt om het model te dateren, niet een gebeurtenis die deze pagina rapporteert.
Lees dat als de uitzondering die het is: bij een strikte lezing van zeven dagen is een model van medio augustus 2026 niet recent, en dit item zou als nieuws worden overgeslagen. De rechtvaardiging hier is anders. Het is een referentiepagina waarvan de cijfers zijn geverifieerd aan de hand van de eigen modelkaart van Qwen, het licentiebestand van de repository, de Qwen Cloud-tariefkaart en Artificial Analysis op 2026-09-28, en waarvan de reden van bestaan de zoekvraag is die we op dezelfde dag first-party hebben gemeten. Het is geen tweede aankondiging, en niemand zou het als zodanig moeten lezen.
Waar 27B staat in de Qwen3.8 line-up
De Qwen3.8-generatie is niet één model, en het grootte-achtervoegsel is het hele punt van de naam. De eigen repositorynotities van Qwen binnen de familie maken de splitsing expliciet:
• Qwen3.8-27B — 27B dense parameters, native beeld- en video-invoer, Apache 2.0. De implementatievriendelijke variant: een model dat zo is opgezet dat het op één GPU of een klein knooppunt kan draaien, en het onderwerp van deze pagina.
• Qwen3.8-Max, gebouwd op Qwen3.8-2.4T-A95B — 2,4 biljoen totale parameters met 95B actief, het model uit de Qwen-Max-klasse dat Alibaba in deze generatie voor het eerst heeft vrijgegeven. De repository heeft een op maat gemaakte qwen3.8-max licentie in plaats van Apache 2.0.
• Qwen3.8-Flash-Next — de experimentele architectuurpreview waarvan Qwen zegt dat die de basis zal vormen voor Qwen4, vrijgegeven onder de qwen-community-1.0-licentie. De gehoste Qwen3.8-Flash is erop gebouwd.
Dus "27B" is geen uitvoering van het Max-model; het is de grootteklasse die één team daadwerkelijk kan serveren. Wat Alibaba beweert dat het erft, is het trainingsrecept: de kaart beschrijft Qwen3.8-27B als een model dat de vooruitgang van deze generatie op het gebied van coderen, professioneel werk, onderzoek en agentische taken met een lange horizon overneemt en in een dense checkpoint comprimeert.

De architectuur die Qwen publiceert
Elke figuur hieronder is afkomstig van de modelkaart op Qwen/Qwen3.8-27B, de eigen documentatie van de leverancier:
• Parameters — 27B zoals geadverteerd. De safetensors-metadata van de repository zelf telt 27.781.427.952 parameters in BF16, verdeeld over 18 shards, dus ruwweg 27,8B als de visiontoren wordt meegeteld. Er is hier geen mixture-of-experts: alle parameters zijn actief bij elke token.
• Vorm — 64 lagen, verborgen dimensie 5.120, feed-forward tussendimensie 17.408, token-embedding en LM-uitvoer 248.320 (opgevuld).
• Hybride attention — de lay-out die Qwen afdrukt is 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): drie linear-attention-blokken voor elk full-attention-blok, een verhouding van 3:1. Gated DeltaNet draait 48 linear-attention-heads voor V en 16 voor QK met head-dimensie 128; Gated Attention draait 24 query-heads tegen 4 KV-heads met head-dimensie 256, met een rotatiedimensie van 64. Die verhouding is wat een 262K-venster betaalbaar maakt op een 27B-model, en het is dezelfde lineage die Qwen3.8-Flash-Next uitbreidt met sparse attention.
• Multi-tokenvoorspelling — de kaart vermeldt dat het model is getraind met MTP over meerdere stappen, de drafting-truc die de generatie versnelt in MTP-bewuste serving-stacks.
• Denkbesturing — de denkmodus staat standaard aan en kan per verzoek worden uitgeschakeld. reasoning_effort accepteert xhigh (de standaard), medium of low, en preserve_thinking staat standaard aan, zodat redeneringssporen over gespreksbeurten heen behouden blijven in plaats van opnieuw te worden gegenereerd.
Contextvenster en outputplafond
De kaart vermeldt native 262.144 tokens, uitbreidbaar tot 1.000.000 met RoPE-scaling (YaRN). Het eigen serving-advies van Qwen voor lange agentische runs, binnen die 1M-envelop, is om tot 262.144 tokens toe te staan voor redeneerinhoud en tot 131.072 tokens voor het definitieve antwoord — het plafond is een servingconfiguratie, geen vaste eigenschap van de checkpoint.
Twee vensters kun je beter uit elkaar houden, want ze zijn makkelijk te verwarren. De open gewichten draaien native op 262.144; de gehoste versie op Qwen Cloud, die op de modelkaart wordt beschreven als nog te komen ("de service komt binnenkort"), staat op de modelpagina van Qwen Cloud vermeld met een context van 1M, een maximale input van 991K, een maximale output van 131K en een maximaal redeneerbudget van 262K. Het specificatieblad van het gehoste product is niet het specificatieblad van het checkpoint.
Modaliteiten: wat erin gaat en wat eruit komt
Invoer is tekst, afbeelding en video; uitvoer is alleen tekst. De kaart noemt Qwen3.8-27B 'een native vision-language model dat afbeeldingen en video's begrijpt' en de voorbeeldcode ervan geeft alle drie de invoertypen door. Er is geen audio-invoer, geen beeldgeneratie en geen spraakuitvoer. Het modelrecord van Artificial Analysis voor dezelfde checkpoint komt overeen wat de afbakening betreft — afbeelding, video en tekst in, tekst uit — wat een nuttige tweede lezing is omdat het niet de eigen pagina van Alibaba is.
Wat de Apache 2.0-release daadwerkelijk toestaat
De licentie is geen samenvatting in een blogpost; de repository bevat de tekst van de Apache License, Version 2.0 zelf, en de metadata van de kaart vermeldt license: apache-2.0. Wat dat toekent, gelezen uit de licentietekst: een eeuwigdurende, wereldwijde, royaltyvrije auteursrechtelijke licentie om het werk en zijn afgeleiden te reproduceren, er afgeleide werken van te maken, ze openbaar te tonen, in sublicentie te geven en te distribueren, en een octrooilicentie van bijdragers — waarbij commercieel gebruik een van de toegestane doeleinden is, zonder beperking qua toepassingsgebied, zonder drempel voor het aantal gebruikers en zonder afzonderlijke commerciële overeenkomst. Apache 2.0 is ook permissief in de zin die ertoe doet voor het op de markt brengen van producten: afgeleide gewichten mogen onder andere voorwaarden worden herverdeeld, mits je de licentie- en naamsvermeldingskennisgevingen behoudt en aangeeft wat je hebt gewijzigd (Secties 4a–4c). Sectie 6 verleent geen rechten op de naam Qwen of op handelsmerken, dus een Apache-2.0-fork kan zichzelf niet als Qwen op de markt brengen.
De vergelijking binnen de familie is leerzaam, en die blijkt uit de repositories in plaats van uit de berichtgeving: het 2.4T-A95B-checkpoint noemt zichzelf other met een qwen3.8-max-licentie, en Qwen3.8-Flash-Next gebruikt qwen-community-1.0. De 27B is degene van de drie die onder gewone Apache 2.0 uitkomt.
De onafhankelijke benchmarkpositie
Artificial Analysis heeft het model getest, en de resultaten daarvan zijn het waard om los te zien van Alibaba's eigen tabel, omdat de twee verschillende vragen beantwoorden. De onafhankelijke index, gemeten op de xhigh configuratie:
• Intelligence Index 33.7 — de opgeslagen waarde van Artificial Analysis, die de modelpagina ervan afgerond op 34 weergeeft. Er worden twee rangen gepubliceerd en ze meten verschillende groepen: de eigen samenvattingstegel van die pagina zet het model op de 1e plaats van de 142 modellen in zijn grootteklasse, in de vergelijking binnen dezelfde klasse die de tooltip van de pagina beschrijft, terwijl de rij in onze catalogus die van Artificial Analysis afkomstig is, 45e van 145 vermeldt, ongeveer het 67e percentiel. Geen van beide is een rang ten opzichte van hetzelfde deelnemersveld als de andere, dus lees ze niet als één getal in twee formaten.
• Coding Index 68,1 — opgenomen in onze catalogus met artificialanalysis.ai als de vermelde bron, gerangschikt als 35e van 138 in de pool van die index. Het model scoort hoger op coderen dan op algemene intelligentie, wat overeenkomt met de vorm van de eigen tabel van de leverancier.
• Inspanningsladder, hetzelfde testharnas — het verlagen van de redeneerinspanning verplaatst de index een heel eind: 33,7 bij xhigh, 27,6 bij medium, 26,2 bij low, en 20,2 met redeneren volledig uitgeschakeld. Dat is een gemeten spreiding van 13,5 punten, en het is het meest concrete argument om de inspanning per workload af te stemmen in plaats van per model.
• Waar de twee bronnen overeenkomen en van elkaar afwijken — op GPQA Diamond rapporteert de kaart van Alibaba 89,2 en meet Artificial Analysis 90,5. Op Humanity's Last Exam rapporteert de kaart 30,8 en Artificial Analysis 33,9. Dichtbij, maar niet hetzelfde getal, en dat is normaal: verschillende harnesses, verschillende runs. Eén voorbehoud hoort in het artikel, niet in een voetnoot — geen enkele derde partij heeft een head-to-head gepubliceerd tussen Qwen3.8-27B en om het even welk model uit de vergelijkingstabel van Alibaba dat met gelijke inspanning op een gelijke harness is gedraaid, dus elke vergelijking tussen modellen op deze pagina is een vergelijking van afzonderlijke metingen, niet een resultaat.

Wat Qwen rapporteert, en hoe je het leest
De modelkaart bevat ongeveer twee dozijn scores met vergelijkingskolommen voor Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B en Opus4.6 Max. Het is allemaal door de leverancier gerapporteerd en niet gereproduceerd — Alibaba's eigen evaluatie, afgedrukt door Alibaba — en verschillende rijen gebruiken een Claude Code-harnas dat wordt beoordeeld door een GPT-5.4-build, wat de voetnoten van de kaart vermelden. De belangrijkste leverancierscijfers, op die basis:
• Agentisch coderen in de terminal — Terminal Bench 2.1 (Terminus) 73,0, tegenover 63,4 voor de Qwen3.6-27B die het vervangt, met Opus4.6 Max aan kop van de rij met 78,2.
• Agentisch coderen — SWE-bench Pro 61.7, QwenSWEBench 79.0, DeepSWE 1.1 42.2, NL2Repo-Bench 42.3, LiveCodeBench v6 90.3.
• Agenten en kantoorwerk — CoWorkBench 70,7, JobBench 33,4, Agents' Last Exam 42,9 qua score (Pass@1 20,4).
• Algemeen redeneren — GPQA Diamond 89,2, HLE 30,8, IFBench 79,5. Opus4.6 Max voert beide redeneerrijen aan in de eigen tabel van de leverancier, met 91,3 en 40,0.
• Visie en computergebruik — OSWorld-Verified 84.3, AndroidWorld 81.9, WebArena-Verified 64.8, OmniDocBench 1.5 91.1, RealWorldQA 85.9.
De eerlijke samenvatting van die tabel is beperkter dan de tabel doet vermoeden. Vergeleken met zijn directe voorganger zijn de winsten groot en consistent — QwenSWEBench 79,0 tegenover 49,3, DeepSWE 42,2 tegenover 13,3 — en dat is een bewering over één generatie van receptwijziging. Tegenover de frontiermodellen in de aangrenzende kolommen scoort het op sommige rijen beter en op andere slechter, volgens Alibaba's eigen cijfers, door Alibaba's eigen keuze van evaluatieharnas.
Het uitvoeren
De gewichten zijn 18 BF16-shards in het Transformers-formaat, en de kaart vermeldt Hugging Face Transformers, vLLM, SGLang en TokenSpeed als ondersteunde stacks. We hebben de lokale-implementatie- en kwantisatiepaden afzonderlijk beschreven en dat zijn de juiste plekken voor dat detail: Qwen3.8-27B op Ollama voor een lokale daemon, en de doorloop van de benchmarks voor de volledige scorecard, inclusief wat er is veranderd ten opzichte van Qwen3.6-27B. Deze pagina blijft bij het model zelf.
Qwen3.8-27B in onze catalogus
Er staan vandaag twee kaarten live op OrcaRouter, naast elkaar, en beide zijn op 2026-09-28 opnieuw gelezen voordat deze alinea werd geschreven. qwen/qwen3.8-27b staat voor $0,33 per miljoen inputtokens en $2,40 per miljoen outputtokens, met het volledige venster van 262.144 tokens, tekst-, afbeeldings- en video-invoer, en de oppervlakken voor reasoning, tools, gestructureerde output en JSON die als parameters beschikbaar zijn. Het zusje obsidian/Qwen3.8-27B — dezelfde gewichten, geserveerd in block-FP8 met de vision-toren op volledige precisie, en, in de woorden van de kaart zelf, "ontworpen om directe, volledige antwoorden te geven op een breed scala aan prompts" — staat voor $0,40 in en $4,21 uit. Beide zijn aanspreekbaar via chat completions en de Responses API, zodat een taak voor documentparsing of screenshots naar beide modellen kan worden gericht onder één sleutel en één endpoint, zonder een tweede contract en zonder codewijziging.
Om een idee van de schaal te geven: onze eigen playground heeft de afgelopen zeven dagen 105,1 miljoen tokens door qwen/qwen3.8-27b laten gaan, met een mediane time-to-first-byte van 3,8 seconden en een foutpercentage van 3,3% over dezelfde periode. Dat zijn onze servicecijfers, geen oordeel over het model.

De zoekopdrachten die hierheen leiden
De vraag achter deze pagina is dun verspreid en zit net buiten de klik. In de 28 dagen tot 2026-09-25 kreeg ons domein 8.931 vertoningen en 273 klikken over 69 verschillende exacte spellingen van de naam van het model — "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" en nog tientallen andere manieren om dezelfde drie tokens te schrijven. Onze beste positie op de grootste spellingen liep van 9,0 tot 10,6. Dat zijn posities die we per ongeluk innamen dankzij andere pagina's, en dat is precies het probleem dat een canonieke pagina oplost: op de negende plaats sta je wel op de pagina, maar klikt niemand. De enige plek waar het verkeer converteert, is niet-Engelstalig — een Russischtalige spelling van de naam staat bij ons op positie 1,8 en converteert met 14,4%.
Niets daarvan is bewijs over het model. Het is bewijs over wat mensen typen, en daarom bestaat de pagina.
Waar het op neerkomt: een 27B dense checkpoint met een werkelijk ongebruikelijke attention-layout, een permissieve licentie, native videobegrip, Apache-2.0-voorwaarden waarmee je een afgeleide mag uitbrengen, een onafhankelijke coding-rank in het bovenste kwart van wat Artificial Analysis meet, en een leverancierstabel die sterk is tegenover zijn voorganger en gemengd tegenover de frontier. De open vraag is degene die niemand buiten Alibaba nog kan beantwoorden — hoe het gehoste 1M-tokenpad zich in productie gedraagt, en of de Flash-Next-architectuur in een model van deze omvang belandt.
De 2.4T-A95B-core achter Qwen3.8-Max staat live in dezelfde catalogus: qwen/qwen3.8-max voor $2,00 / $6,00 per miljoen tokens, als de 27B niet de grootte is die je nodig hebt.
