Hero-card met de tekst 'Qwen3.8-27B for Coding' en de ondertitel 'Wat je kunt verwachten voordat de gewichten vrijkomen', chips voor 'ongeveer 27B open gewichten', 'Agentisch coderen' en 'Aangekondigd 3 aug 2026', met het OrcaRouter-logo in de hoek.
Engineering & Research

Qwen3.8-27B voor programmeren: wat je kunt verwachten voordat de gewichten vrijkomen

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Als je lokale modellen draait voor het coderen, is het getal dat er het meest toe doet van Alibaba's lancering van Qwe​n3.8 op 3 augustus 2026 niet de headline van Qwen3.8-Max over 2,4 biljoen parameters — het is de FrontierSWE-score die sprong van 40,7 in de vorige generatie naar 73,5 in deze. Die sprong vond plaats in het vlaggenschip. Het model dat daar een deel van naar je eigen hardware zou kunnen brengen, is Qwen3.8-27B, het lid van de Qwe​n3.8-generatie met open gewichten en ruwweg 27 miljard parameters, dat dezelfde dag werd aangekondigd en op het moment van schrijven nog niet te downloaden is. Dit is een wat-we-tot-nu-toe-weten-stuk, geen recensie: niemand buiten Alibaba's lab heeft Qwen3.8-27B nog gedraaid, er is geen officiële modelkaart, en elke download die op dit moment beweert het te zijn, is een placeholder of een upload van een derde partij.

Hier is het eerlijke uitgangspunt voor iedereen die een lokale codeeropstelling rond de 27B wil opzetten: de winst van het vlaggenschip is alleen door de leverancier gerapporteerd totdat onafhankelijke runs verschijnen, de specificaties van de 27B zelf zijn onbevestigd, en het enige dat we vandaag kunnen meten is zijn voorganger Qwen3.6-27B — die al een van de beste lokale codeermodellen van 2026 was. Dat is de basislijn die deze generatie moet verslaan, en het is een hoge.

Waarom de 27B het model is waar coders daadwerkelijk om geven

Qwen3.8-Max is een datacenter-model: {{1}}een mixture-of-experts met 2,4 biljoen parameters en ongeveer 95 miljard actieve parameters, een context van 1M tokens en geen consumentenpad om het lokaal te draaien{{/1}}. Qwen3.8-27B is de tegenovergestelde gok — {{2}}een open-weight model van de ~27B-klasse, geschikt voor een enkele GPU, gepositioneerd als de zelf-hostbare release van de generatie{{/2}}. {{3}}Voor ontwikkelaars is de 27B het product. De Max is het bewijs dat de training van de generatie iets teweeg heeft gebracht.{{/3}}

Wat dat 'iets' is, volgens Alibaba's eigen evaluaties: Terminal-Bench 2.1 op 86,6 (gestegen van 74,5 voor Qwen 3.7 Max), SWE-bench Pro op 67,7, PaperBench op 93,0, en de FrontierSWE-sprong van 40,7 naar 73,5 die een stapverandering in langetermijn, agentische codering signaleert — het model dat zelfstandig door meerstaps-repositorytaken heen werkt in plaats van losse prompts te beantwoorden. Onafhankelijke trackers hebben Qwen3.8-Max op een Artificial Analysis Coding-index van 71,8 en een Intelligence-index van 58,1, dus de generatie is echt, zelfs als je Alibaba's marketing eraf haalt. Geen van die cijfers is rechtstreeks van toepassing op de 27B. Maar ze zijn de reden dat de 27B de meest verwachte lokale coder van de tweede helft van 2026 is: een kleiner model dat zelfs een fractie van die agentische verbetering erft, zou herdefiniëren wat 'goed lokaal coderen' betekent op 27B-schaal.

Scoreboard titled 'Qwen3.8-27B for coding - what is known' listing: status announced, weights not yet downloadable; class approx 27B, successor to Qwen3.6-27B; 4-bit VRAM 16-24 GB projected; Terminal-Bench 2.1 (Max) 86.6 vendor-reported; FrontierSWE (Max) 73.5 up from 40.7; independent coding score none yet.

De voorganger zette de lat: Qwen3.6-27B

Qwen3.6-27B is het model waarop elke projectie voor de 3.8 27B is gebaseerd, omdat het dezelfde klasse en dezelfde fysica deelt. Het is een 27B-dicht model met een native context van 262K, zowel denk- als niet-denkmodi, native tekst-/beeld-/video-invoer en een Apache 2.0-licentie. Het verdiende zijn reputatie als lokale coder niet door elke benchmark te winnen, maar door het grootste model te zijn dat nog op een consumenten-GPU paste met bruikbare kwaliteit — het punt op de grootte/kwaliteitscurve waar je stopt met het inruilen van capaciteit voor hardware.

Dat is het contextvenster van de 3.8-27B: het moet minstens zo goed zijn als de 3.6-27B tegen dezelfde hardwarekosten, en idealiter beter in agentisch werk, want dat is de enige eerlijke reden om over te stappen. Als het de 3.6 evenaart op het gebied van puur coderen en de agentische verbeteringen van deze generatie toevoegt, wordt het de standaard lokale keuze. Als het louter dezelfde scores herhaalt, is de upgrade marginaal.

Hardware-realiteit: 16 GB is de verkeerde vraag.

Omdat er geen officiële specificaties bestaan, komen de VRAM-prognoses van Qwen3.6-27B-metingen, en de eerlijke samenvatting is dat 4-bit kwantisering een 24 GB-spel is, geen 16 GB-spel. Bij Q4_K_M zijn de gewichten ruwweg 16–17 GB, wat klinkt alsof een 16 GB-kaart het past — totdat de KV-cache en de overhead van het model de werkelijke vereiste op ongeveer 20–24 GB brengen. De praktische richtlijn uit Alibaba Cloud's eigen documentatie is bot: Q4_K_M past niet op een 16 GB GPU in echt gebruik. Community-cijfers clusteren rond:

• Q3_K_M — ~13 GB aan gewichten, past op 12–16 GB kaarten met verminderde kwaliteit

{{1}}Q4_K_M{{/1}} — ~16–17 GB aan gewichten, realistisch 20–24 GB met context — de {{2}}RTX 3090/4090{{/2}} sweet spot

• Q6_K — ~21–22 GB, nagenoeg verliesloos op kaarten van 24 GB

• Q8_0 — ~28,6 GB, vereist 32 GB

• BF16 volledige precisie — ~54–56 GB, buiten bereik van elke consumenten-GPU

Unsloth toonde een preview van een 4-bit-build die op ongeveer 17 GB draait, wat consistent is met een ~27B-model op 4-bit — behandel dat als de ondergrens voor een workload zonder context en in afgeslankte vorm, niet als je productiegetal. Als je hardware plant, plan dan rond een kaart van 24 GB.

Toolchain: wat er op dag één versus week twee verschijnt

Wanneer de gewichten vrijkomen, komt de ondersteuning niet in één keer beschikbaar. Serving-engines vLLM en SGLang voegen doorgaans binnen enkele dagen na een Alibaba-release ondersteuning toe, waardoor self-hosters snel een OpenAI-compatibel eindpunt krijgen. Community-GGUF- en AWQ-kwantizaties lopen één tot twee weken achter, wat betekent dat de "pull and run"-ervaring via op llama.cpp gebaseerde tools (Ollama, LM Studio) achterblijft bij de ruwe gewichten — en als de 27B een echt nieuwe architectuur deelt met de Max in plaats van de 3.6-layout te hergebruiken, verwacht dan dat de tooling langer op zich laat wachten. Voor de eerste week of twee is de snelste route vLLM op de niet-gekwantiseerde gewichten, niet een 'one-command pull'.

Screenshot of the official Qwen Studio blog post 'Qwen3.8-Max: A New Bar for Coding and Cowork', dated 2026/08/03, announcing the Qwen3.8 generation.

Wat een 27B daadwerkelijk kan doen voor agentisch werk

Stel de verwachtingen correct: de 16-daagse autonome demo — Alibaba's Qwen3.8 die een zelf-evoluerend agent-harness bouwt over honderden commits zonder menselijke tussenkomst — is een vlaggenschipshowcase. Een 27B zal dat niet doen. Wat een 27B-klasse lokale coder aantoonbaar goed doet, op basis van community-ervaring met Qwen3.6-27B en Qwen3-Coder-30B-A3B:

• Tickets groomen en triëren, hoofdoorzaken identificeren, en de basis leggen zodat een sterker model het kan afronden

Verwerk refactors op repository-schaal en tool-aanroeplussen op interactieve snelheid

Voer je dagelijkse codeerwerk lokaal uit — gegevens blijven op je machine, de kosten zijn vast

• Zorg voor een ~50/50 slagingspercentage bij het volledig oplossen van een werkelijk complexe bug — goed genoeg om nuttig te zijn, niet betrouwbaar genoeg om je enige agent te zijn.

De 27B is een volumemodel met een beoordelingsstaart. Het zal uitstekend zijn in het high-volume midden van je workload en fout op de moeilijkste tien procent. Dat is geen gebrek; het is het ontwerp.

Bouw eromheen: splits het verkeer.

De aanpak waar de meeste teams op uitkomen is een splitsing: de lokale 27B handelt het volume af — routinegeneratie, boilerplate, refactors, lint-achtige fixes — en een gehost frontiermodel handelt de moeilijke staart af, waar een paar extra kwaliteitspunten de API-kosten rechtvaardigen. De nette manier om die splitsing te laten werken is via een router, omdat de twee kanten verschillende faalpercentages hebben en je niet wilt dat je agent-pipeline vastloopt op een lokale bottleneck of een hapering van de provider.

Dat is de workflow waar OrcaRouter voor is gebouwd. Qwen3.8-Max is daar live tegen de lijstprijs van de provider — $2 per miljoen invoertokens, $6 per miljoen uitvoertokens — doorgegeven zonder opslag, dus wanneer Alibaba het tarief verlaagt, wordt uw factuur dezelfde dag lager. U wijst één OpenAI-compatibel eindpunt naar de splitsing, routeert de lastige staart naar Qwen3.8-Max, houdt de lokale 27B voor het volume zodra de gewichten beschikbaar zijn, en laat automatische failover een trage of falende provider opvangen zonder codeaanpassing. U evalueert de 27B op uw eigen hardware terwijl uw productiepad actief blijft — het model dat nog niet bewezen is, wordt nooit een single point of failure.

Screenshot of the OrcaRouter model page for Qwen3.8 Max showing model ID qwen/qwen3.8-max, $2.00 per 1M input tokens, p50 TTFT 4.84 s, and a code sample.

Wat te controleren op de dag dat de gewichten dalen

Wanneer de officiële repository op Hugging Face of ModelScope verschijnt, controleer deze voordat je er iets op bouwt:

• De repo staat in de officiële Qwen-organisatie — geen mirror of namesquatter

• Het LICENSE-bestand is daadwerkelijk aanwezig en komt overeen met de licentie die in de release notes wordt vermeld.

• De modelkaart vermeldt het contextvenster, de architectuur (dense of MoE) en de denkmodi.

De eerste onafhankelijke runs verschijnen op Terminal-Bench of Artificial Analysis — leveranciersclaims blijven leveranciersclaims tot die tijd.

• GGUF-ondersteuning komt naar llama.cpp en je favoriete lokale runtime

Over dat laatste punt geldt de discipline van eerder: totdat een onafhankelijke run de codeerwinsten bevestigt, behandel de van FrontierSWE overgenomen belofte als reden om te testen, niet als reden om te verzenden.

De verwachting, eerlijk gezegd: Qwen3.8-27B is op papier de meest veelbelovende lokale coding-release van 2026 — een bewezen 27B-baseline plus een generatie aan agentische trainingswinsten, tegen hardwarekosten die de community al weet te betalen. Of het waarmaakt wat het belooft, hangt af van wat de gewichten daadwerkelijk bevatten. Houd de officiële repo in de gaten, lees de licentie en laat de eerste onafhankelijke benchmark beslissen. Tot die tijd houdt Qwen3.6-27B de plek warm, en een gerouteerd gehost vlaggenschip neemt de zware staart voor zijn rekening.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube