Hero-titelkaart voor de Qwen3.8-27B-review, met als titel 'Qwen3.8-27B Review' en als ondertitel 'De open-weight 27B die de Opus thuis is — getest tegen de hype', met een open-weights-badge, een Apache 2.0-badge en een pictogrammenset voor GPU en server op een strakke witte achtergrond met zachte blauwe gradiëntaccenten.
Guides & Insights

Qwen3.8-27B Review: de open-weight 27B die "Opus at home" is — getest tegen de hype

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Qwen3.8 27B is op dit moment de beste open-weights 27B die je zelf kunt hosten, en het komt er niet eens in de buurt. De gewichten zijn op 14 augustus 2026 uitgebracht onder Apache 2.0: een dense 27B (28B inclusief de vision-encoder) met 262K native context, native beeld- en video-invoer, en door de leverancier gerapporteerde agentic-coding-scores die op of boven Cla​ude Opus 4.6 Max liggen — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. De hoofdprijs is nul: download 55,6 GB en draai het. De kanttekeningen zijn ook reëel — onafhankelijke tests tonen aan dat het ongeveer drie keer langzamer is en meer tokens verbruikt dan zijn voorganger, elke benchmark op de modelkaart is nog steeds door Ali​baba gerapporteerd, en de 1M-context is een functie die alleen beschikbaar is in de gehoste versie. Oordeel: als je een 24 GB+ GPU hebt en capaciteiten wilt die dicht bij de frontier liggen zonder een verbruiksafhankelijke factuur, host het dan zelf — maar ga erin wetende waar de cijfers precies zwak liggen.

Eerst het oordeel: moet je Qwen3.8 27B gebruiken?

Kort antwoord — ja voor lokale en private workloads; wacht op cijfers van derden voordat u een aankoopbeslissing neemt. Qwen3.8 27B is het zeldzame model waar de open gewichten het product zijn en de API het gemak. Omdat de licentie Apache 2.0 is, is de prijs per token permanent nul zodra u de hardware heeft, en niets wat u erop bouwt kan achteraf opnieuw worden gelicentieerd of in rekening worden gebracht. Wat u opgeeft is snelheid, verificatie en gemak.

Als je al Qwen3.6-27B draait en er tevreden mee bent, is de upgrade reëel, maar kost wel tijd. Als je hier via de lancering van Qwen3.8-Max bent gekomen, is dit het kleinere, zelf-hostbare lid van dezelfde generatie — een andere tool voor een andere klus.

De snelle feiten, gecontroleerd op 15 augustus 2026

Uitgebracht — de gewichten gingen live op 14 augustus 2026 bij Qwen/Qwen3.8-27B op Hugging Face, gespiegeld op ModelScope; tijdzone-afhankelijke berichtgeving noemt ook 13 augustus, en de release verscheen ongeveer een week nadat de Qwen3.8-generatie was aangekondigd.

Licentie — Apache 2.0: downloaden, wijzigen, herdistribueren, commercieel gebruik, met een expliciete patentverlening. Permanent.

Parameters — 27B dense (28B inclusief de vision-encoder), 64 lagen, verborgen grootte 5.120, vocabulaire 248.320.

Architectuur — hybride attention: 48 Gated DeltaNet linear-attention-lagen tegenover 16 volledige Gated Attention-lagen (een 3:1-verdeling). Dit is waarom een 27B dense model 262K tokens aan native context kan dragen.

Context — 262.144 tokens standaard; uitbreidbaar tot 1.000.000 via YaRN op de gehoste versie.

Invoer — native afbeeldingen en video naast tekst; retourneert tekst. De vision-encoder is de reden waarom het aantal parameters 28B bedraagt.

Thinking — redeneringsmodus standaard ingeschakeld en per verzoek uitschakelbaar; reasoning_effort (laag/gemiddeld/hoog) en preserve_thinking voor lange agentruns.

Gewichten — 55,6 GB aan BF16-safetensors in 18 shards; FP8 en community-GGUFs worden ook meegeleverd.

De bovenstaande specificaties komen uit de Hugging Face-modelkaart en -config voor Qwen3.8 27B, vandaag gelezen. De benchmarkclaims zijn afkomstig van Ali​baba; tot op heden heeft geen onafhankelijk laboratorium ze kunnen reproduceren.

Waar Qwen3.8 27B werkelijk goed in is

Het sterkste argument is agentische software-engineering. Ali​baba rapporteert een sprong van 3x op DeepSWE 1.1 ten opzichte van de vorige 27B (42.2 vs 13.3) en een score die hoger ligt dan die van Cla​ude Opus 4.6 Max op SWE-bench Pro (61.7 vs 53.4). Dat zijn de cijfers die het de bijnaam "Opus voor thuis" opleverden — een dense 27B die codeerwerk levert dat het topniveau benadert, op hardware die iemand daadwerkelijk kan bezitten.

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

Drie dingen naast de ruwe cijfers maken het een verdedigbare koop:

Native multimodaal. Beeld en video in, tekst uit — een document met diagrammen of een videodoorloop is geen apart model. De visuele-redeneringsscores (85.6 met de chain-of-thought-functie ingeschakeld, 94.6 visuele wiskunde, beide door de leverancier gerapporteerd) zijn waar de visie-encoder zijn bestaansrecht bewijst.

262K native context. Agenttaken met een lange horizon, grote codebases en transcripten van meerdere uren passen in één venster. Het hybride linear-attention-ontwerp houdt de KV-kosten van die context lager dan een puur full-attention-model van dezelfde grootte.

Gratis, permanente gewichten. Dit is het hele punt van de categorie: een gesloten API-model wordt gehuurd; Qwen3.8 27B is eigendom. Op 4-bit draait het op een 24 GB-kaart (RTX 3090/4090-klasse), en AMD leverde Day-0-ondersteuning (tot 24,5 tokens/s op een Ryzen AI Max+ 395 en 51,8 tokens/s op een Radeon AI PRO R9700, volgens AMD's eigen blog).

Waar de review lelijk wordt: snelheid, tokens en verificatie

Onafhankelijk testen is tot nu toe een testopstelling van één tester, geen laboratorium — maar het is het beste signaal dat we hebben. Bij het draaien van Qwen3.8 27B tegen Qwen3.6-27B op tien praktijktaken (beoordeeld door GPT-5.5 via de llmcompare-harness), won de 3.8 negen van de tien en scoorde gemiddeld 8.838 versus 6.862 — "een van de indrukwekkendere intelligentiesprongen" die de tester had gezien. Het gebruikte ook bijna drie keer zoveel tokens en was aanzienlijk langzamer; één taak duurde ruwweg 600% langer. Dus de kwaliteitssprong is echt, en dat geldt ook voor de prijs in kloktijd.

Nog vier dingen om tegen te gebruiken:

Nog geen benchmarks van derden. Elk belangrijk cijfer in dit artikel is door Alibaba gerapporteerd per 15 augustus. De leverancierskaart is gedetailleerd, maar reproductie door een onafhankelijk lab heeft niet plaatsgevonden. Als uw beslissing afhangt van geverifieerde cijfers, wacht daar dan op — de gewichten zullen er nog steeds zijn.

De VRAM-ondergrens is reëel. BF16 vereist een GPU in de 80 GB-klasse. Om op een kaart van 24 GB te passen moet je 4-bit draaien, en community-rapporten (dev.to-commentaarthread, dagen na release) zeggen dat gekwantiseerde builds "de focus verliezen na een lange context." Officiële gewichten als je over het VRAM beschikt; gekwantiseerd als je dat niet doet.

1M context is alleen beschikbaar in de cloud. De open weights zijn gemaximeerd op 262K. Het tot 1M uitbreidbare getal is een Qwen Cloud-gehoste functie, niet iets dat een lokale kopie standaard doet.

"Beats Opus" behoeft nuancering. Agentische benchmarks belonen harness-specifiek gedrag, en een topreactie op het dev.to-lanceringsbericht verwoordde het ronduit: "in de praktijk verslaan ze opus niet." Beschouw de scorebordstand als een bovengrens op een goede dag, niet als een belofte.

Hoe het past in de Qwe​n 3.8-familie

versus Qwen3.6-27B — dezelfde hardwareklasse en 262K context, maar een grote sprong in capaciteiten ten koste van snelheid en token-efficiëntie. Als je al 3.6 draait en doorvoergebonden bent, is blijven verdedigbaar.

vs Qwen3-Coder-30B-A3B — de Coder is een MoE met ruwweg 3,3B actieve parameters die veel sneller draait (~90–110 tokens/s). De dense 27B is langzamer per token, maar erft de agentische winst van de generatie; als de software-engineering scores van de 27B standhouden bij onafhankelijke tests, krimpt de rol van de Coder-30B.

vs Qwen3.8-Max — het 2.4T MoE-vlaggenschip is een datacentermodel (alleen via API, ongeveer $2/$6 per miljoen tokens volgens gepubliceerde berichten) met 1M context en video. De 27B is het model dat je zelf kunt draaien. Ze beantwoorden verschillende vragen.

Kosten: de lokale-versus-API-vraag, beslecht.

Voor een gesloten model vergelijk je prijzen per token. Voor Qwen3.8 27B kost het marginale token niets op je eigen hardware — de echte prijs is de initiële GPU en je tijd. In 4-bit is dat een 24 GB-kaart; in BF16 is dat een machine uit de 80 GB-klasse. Als je het model alleen hoeft te evalueren, of als je de hardware niet hebt, is er de gehoste route: OrcaRouter vermeldt nu Qwen3.8 27B met een gratis, snelheidsbeperkte laag die $0 rekent en boven de limiet HTTP 429 retourneert, plus een betaalde laag van $0,33 per miljoen invoertokens en $2,40 per miljoen uitvoertokens (gecontroleerd op 15 augustus). De gehoste versie van Qwen Cloud, met de 1M-context, wordt gemarkeerd als "binnenkort beschikbaar."

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

De eerlijke insteek: voor een model met open gewichten is een provider een gemak, geen afhankelijkheid. De gratis laag is de goedkoopst mogelijke manier om te beslissen of een download van 55,6 GB de moeite waard is. Maar zodra je hebt besloten, zijn de gewichten het belangrijkste — en die zijn gratis.

Hoe je het daadwerkelijk kunt proberen

Snelste evaluatie — probeer de gratis gehoste laag met snelheidslimiet; als die antwoord geeft op wat je nodig hebt, ben je klaar en kost het niets.

Echte test op je hardware — download een community-GGUF (de Q4_K_M-build is ongeveer 17 GB en past op een 24 GB-kaart) en draai het in llama.cpp of Ollama. Geef de Jinja-chattemplate door, anders antwoordt het model je in thought-tags. Voor vision vanuit een GGUF heb je ook het aparte mmproj-bestand nodig. Ons runbook over het lokaal draaien van Qwen3.8 27B leidt je erdoorheen.

Volledige precisie — huggingface-cli download Qwen/Qwen3.8-27B op een GPU van de 80 GB-klasse.

Controleer wat je hebt gedownloadcontroleer of de uitgever de Qwen-organisatie is en valideer shards tegen crc32.txt; er verschenen lookalike-repo's vóór de release.

Wanneer deze review ernaast zit (en wie Qwen3.8 27B over zou moeten slaan)

Je hebt geen GPU en zult er ook geen huren. De gratis laag heeft een snelheidslimiet en de betaalde laag kost $0.33/$2.40 per miljoen — een klein API-model kan je goedkoper en betrouwbaarder bedienen. Dit model is voor mensen die de inferentie zelf willen bezitten.

Je hebt een SLA nodig. De hosted tier is pas een paar dagen oud; de OrcaRouter-modelpagina, vandaag gelezen, toont een foutpercentage van 33,3% over de afgelopen zeven dagen en een p50 first-token-latentie van 225 ms. Dat is een gloednieuw model onder vroege belasting, geen productiecontract. Zelf-hosters zouden hun downloadcommit moeten vastpinnen en een fallback moeten aanhouden.

U heeft geverifieerde benchmarks nodig voor een aankoopbeslissing.Cijfers die door de leverancier worden gerapporteerd, zijn nuttig als richting, maar niet van inkoopkwaliteit. Wacht op onafhankelijke reproductie.

262K open-weights context is niet genoeg. De 1M-extensie is vandaag alleen beschikbaar in de gehoste versie.

Doorvoer is je knelpunt. Bulksgewijs samenvatten of grote batches gebruiken werkt averechts: dit is een dense 27B die ook ruwweg 3x zoveel tokens verbruikt als zijn voorganger. Voor goedkoop bulkwerk wint een kleiner of sneller model.

Je zit op een 12 GB-kaart. 2-bit GGUFs passen er net in met zichtbaar kwaliteitsverlies; dit is niet het model voor jou.

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

De bottom line

Qwen3.8 27B is de sterkste 27B met open gewichten die vandaag beschikbaar is, en het is voor altijd gratis onder Apache 2.0. Als je een 24 GB+ GPU hebt en je wilt agentische codering, 262K context en native beeld/video-invoer zonder een verbruiksgebaseerde rekening, dan is dit de juiste keuze. De redenen om te wachten zijn net zo concreet: je hebt onafhankelijke benchmarkbevestiging nodig, een SLA, meer dan 262K context met open gewichten, of een hogere doorvoer dan een dense 27B je geeft. Het model is uit, de gewichten zijn echt, en de getallen zijn goed — onthoud alleen van wie die getallen zijn.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube