
Qwen3.8-27B Benchmarks: De volledige tabel, met de bijbehorende kanttekeningen
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 219 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Qwen/Qwen3.8-27B scoort 73,0 op Terminal-Bench 2.1, 61,7 op SWE-bench Pro, 90,3 op LiveCodeBench v6 en 84,3 op OSWorld-Verified — en al die cijfers zijn afkomstig van Alibaba zelf. Het open-weights-model met 27 miljard parameters verscheen op 14 augustus 2026 op Hugging Face onder Apache 2.0, en binnen de eerste twee weken verzamelde het drie onafhankelijke resultaten van derden: de #1-positie bij open-weights-modellen op Harvey's Legal Agent-benchmark, in een onderzoek uitgevoerd door legal-AI-bedrijf Harvey en geheugentechnologiebedrijf Engram; een #9-klassering overall op Code Arena's WebDev-ranglijst, het enige model in zijn grootteklasse binnen de top 10, volgens Alibaba's aankondiging van 25 augustus; en, aangekondigd op 26 augustus, de #1-positie bij open-weights-modellen op Arena.ai's Image-to-WebDev-ranglijst, op #7 overall gerangschikt met een gerapporteerde score van 1.574. Deze pagina is het complete, met bronnen onderbouwde overzicht: alle 25 officiële benchmarks uit de modelkaart, wat er is veranderd ten opzichte van zijn voorganger Qwen3.6-27B, wat een onafhankelijke AMD-doorvoertest heeft gemeten, die legal-agent- en webdev-arena-resultaten, en welke beweringen je nog als voorlopig moet beschouwen.
Een leesgids vóór de cijfers: "officieel" betekent hier Alibaba's evaluatie afgedrukt op de modelkaart bij Qwen/Qwen3.8-27B. Het is door de leverancier gerapporteerd en niet onafhankelijk gereproduceerd. "Onafhankelijk" betekent dat iemand buiten het lab het heeft gemeten — tot nu toe omvat dat een hardware-doorvoertest, een onderzoek naar een agent in het juridische domein, en plaatsingen op twee van Arena.ai's webontwikkelings-ranglijsten, Code Arena's WebDev en de Image-to-WebDev-arena. Benchmarks waarvan de testopstelling ertoe doet, worden inline gemarkeerd.
Het model, één regel per specificatie
• 27B dense parameters (28B inclusief de vision-encoder), 64 lagen, hidden size 5120.
• Hybride attention — 48 Gated DeltaNet lineaire attention-lagen plus 16 volledige attention-lagen, een verhouding van 3:1 — wat het betaalbaar maakt om een venster van 262K tokens te draaien.
262.144 tokens native context, uitbreidbaar tot 1.000.000 met YaRN-schaling.
• Native afbeelding- en video-invoer (tekstuitvoer), Apache 2.0-gewichten, ongeveer 55,6 GB in BF16.
De korte versie: dit is het model dat bedoeld is om wat Alibaba heeft geleerd bij het bouwen van de Qwen3.8-Max met 2,4 biljoen parameters te comprimeren tot iets dat een enkele GPU kan draaien.
De scorekaart: elke benchmark op de modelkaart
Alle onderstaande scores zijn door Alibaba gerapporteerd in de modelkaart van 14 augustus, met de score van Qwen3.6-27B, het model dat wordt vervangen, tussen haakjes.
Coderen. Terminal-Bench 2.1 (agentische terminalcodering) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). De SWE-bench Pro- en QwenSWEBench-runs gebruikten de Claude Code-harness, volgens een voetnoot in de modelkaart — het is goed om in gedachten te houden voordat je ze vergelijkt met een model dat op een andere harness is gescoord.
Langetermijnagenten en kantoorwerk. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / score 42.9 (10.6 / 27.3).
Redeneren en kennis. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instructie-opvolging 79.5 (69.1). HLE wordt beoordeeld door GPT-4o, volgens de kaart.
Visie en computergebruik. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 met CI / 90.0 zonder (85.1); BabyVision 85.6 met CI / 65.7 zonder (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" is Alibaba's verbetering tijdens de inferentie; het verschil tussen de aan- en uit-status is het meest informatieve getal op de kaart over hoeveel score je kunt kopen met extra inferentie-rekenkracht.

Wat is er daadwerkelijk veranderd ten opzichte van Qwen3.6-27B
Elke benchmark op de kaart ging omhoog, maar de verschillen zijn niet uniform — en de vorm van de verbetering is het verhaal. De winsten clusteren in agentisch coderen en computergebruik, niet in het ophalen van kennis:
• DeepSWE 1.1 (agentic coding) 13.3 → 42.2, ruwweg een sprong van 3x
• QwenSWEBench 49.3 → 79.0
• Agents' Last Exam-score 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 en AndroidWorld 70.3 → 81.9
• BabyVision (met CI) 28.9 → 85.6 — de grootste relatieve stijging op de kaart
Ondertussen ging GPQA Diamond van 87.8 naar 89.2 en RealWorldQA van 84.1 naar 85.9: echt, maar klein. Dit is geen “slimmer in alles”-release. Het is een release die rechtstreeks is gericht op agents die schermen lezen, tools gebruiken en code schrijven over veel stappen.

Het eerste onafhankelijke resultaat: #1 open-weight op Harvey's Legal Agent benchmark.
Sinds deze pagina online ging, is de belangrijkste ontwikkeling juridisch, niet technisch. Alibaba kondigde aan dat Qwen3.8-27B het #1 open-weight model is op Harvey's Legal Agent-benchmark — een rangschikkingsclaim van de verkoper zelf, dus beschouw het als een bewering van Alibaba. Het resultaat daarachter is een onderzoek dat niet van Alibaba is: Harvey, het legal-AI-bedrijf, en Engram, een AI-geheugenstartup, bouwden een synthetisch advocatenkantoor genaamd Calderwood & Harkness uit 100M+ tokens verspreid over ruwweg 10.000 documenten en 266 zaken, en pasten vervolgens Qwen3.8-27B erop aan met parametrisch geheugen, gecomprimeerde notities en een retrievaltool.
Bij 250 juridische taken scoorde de aangepaste 27B gemiddeld 67%, beter dan elk model dat de studie testte — waaronder Claude Opus 4.8 — en bij strikte alles-of-niets-correctheid versloeg het Opus 4.8 met 30% tegen 25%, tegen ruwweg $0,13 per query versus $1,32 voor Opus 4.8. Die cijfers zijn afkomstig van Harvey/Engram en zijn nog niet onafhankelijk gereproduceerd. Vóór de training op de eigen documenten van het bedrijf scoorde hetzelfde model slechts 4,7% op bedrijfsspecifieke vragen; na bestudering daarvan 72,6%.
Lees de {{1}}#1{{/1}} met één belangrijke kanttekening: het model dat de benchmark aanvoerde had de testcorpus van tevoren bestudeerd en was aangepast op de 100M tokens van het bedrijf voordat het werd geëvalueerd. Dat maakt dit een demonstratie van wat de {{2}}27B{{/2}} kan opnemen met domeinspecifieke afstemming, en geen score voor de standaard {{3}}Apache-2.0{{/3}}-gewichten op een neutrale testopstelling — en het bestrijkt één domein, recht, niet de algemene kwaliteit. Wat het wel ondersteunt, is de pitch achter de tweet: een {{4}}27B{{/4}} die klein genoeg is om op een lokale machine te draaien, is sterk genoeg voor professioneel werk zodra hij de juiste kennis heeft.
Het tweede onafhankelijke resultaat: #9 algeheel op Code Arena's WebDev
Het tweede onafhankelijke resultaat is een codeerresultaat, en dat is waarom deze pagina op 25 augustus is veranderd. Code Arena is de webontwikkelingsranglijst van Arena.ai — het project voorheen bekend als WebDev Arena, op de site voorheen bekend als LMArena — waar gebruikers echte apps bouwen met geanonimiseerde modelparen en stemmen op welke output ze liever zouden uitbrengen. Op die openbare ranglijst staat Qwen3.8-27B op de 9e plaats overall met een score van 1595, het enige model in zijn grootteklasse in de top 10.
De plaatsing is het onafhankelijke feit — die staat op een ranglijst van een derde partij die iedereen kan openen. Het verhaal eromheen is afkomstig van Alibaba: de formulering "het enige kleine model in de top 10" en de bijbehorende posities komen uit de aankondiging van Qwen van 25 augustus. Het is de moeite waard om ze met dat label te herhalen. De 27B staat zes plaatsen lager dan de veel grotere Qwen3.8-Max (die de aankondiging op #3 overall plaatst), en ver voor op de qua omvang vergelijkbare Gemma 4-31B (die dezelfde aankondiging op #80 plaatst). Het punt is niet dat een 27B-model de frontier-modellen verslaat bij het bouwen van webapps; het is dat een model dat klein genoeg is om op één GPU te draaien, in de top tien staat van een blinde codeerarena waarvan de andere deelnemers veel grotere modellen zijn.
Het derde onafhankelijke resultaat: #1 open model op Arena.ai's Image-to-WebDev
Het derde onafhankelijke resultaat kwam op 26 augustus binnen, en het is tot nu toe het sterkste voor een model van deze omvang. Image-to-WebDev is het zusterbord van Code Arena's WebDev op Arena.ai — de arena waar een model een screenshot of andere visuele referentie krijgt en dat moet omzetten in een werkende webinterface, waarbij blinde menselijke stemmers kiezen welke output zij liever zouden uitbrengen. Op dat openbare leaderboard staat Qwen3.8-27B op #1 bij open modellen en #7 in totaal, met een gerapporteerde arena-score van 1.574.
De plaatsing is het onafhankelijke deel — het staat op een leaderboard van een derde partij dat iedereen kan openen. De kop eromheen is door Alibaba geformuleerd: in de aankondiging van 26 augustus omschrijft het Qwen-team de 27B als "op gelijke hoogte met modellen die 100x zo groot zijn" op deze test, een vergelijking die het leaderboard niet documenteert. En een voorkeursrangschikking is geen oordeel over codekwaliteit — Image-to-WebDev-stemmen meten welke output een mens liever zou uitbrengen, niet of de HTML veilig, toegankelijk of onderhoudbaar is. Wat het resultaat wél vaststelt, is dat een 27B-model met open gewichten nu zijn hele open veld aanvoert in het omzetten van een afbeelding naar een pagina — de vaardigheid waarop een groeiende categorie "screenshot naar site"-producten is gebouwd.
De eerlijke hiaten: waar het nog steeds tekortschiet, en de methodologische kanttekeningen
Tegen de frontier is het beeld vleiend maar niet eenzijdig. Waar Qwen3.8-27B en Claude Opus 4.6 Max overlappen, wint Qwen de meerderheid — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, en het hele visionblok. Tegen Meta's Muse Glimmer-30B, de natuurlijke rivaal in de lokale klasse, wint het alle acht overlappende benchmarks overtuigend. Maar het verliest nog steeds Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) en NL2Repo-Bench (42.3 vs 47.6) aan Claude Opus 4.6 Max. Als je workload de moeilijkste frontier-redenering is — frontier-wiskunde, enorm multidisciplinaire vragen — is de 27B er nog niet.
Drie kanttekeningen voordat je dit citeert. Ten eerste is de modelkaarttabel hierboven nog volledig door Alibaba gerapporteerd — er is nog geen Artificial Analysis-index voor de 27B. Er zijn nu drie onafhankelijke resultaten van derden, maar elk is beperkt: de Code Arena-ranglijst meet het bouwen van webapps op basis van tekstprompts, de Image-to-WebDev-ranglijst meet het omzetten van een screenshot naar een werkende pagina, beide beoordeeld via blinde stemmen over geanonimiseerde outputs, en de Harvey legal-agentstudie bestrijkt een enkel domein met een model dat voor de test is getraind. Geen daarvan betreft de standaardgewichten die door een algemene testomgeving worden gedraaid. Ten tweede gebruikt de modelkaart de Claude Code-harness voor SWE-bench Pro en QwenSWEBench en een GPT-4o-jury voor Humanity's Last Exam — vergelijkingen met modellen die op andere opstellingen zijn gescoord, zullen de cijfers beïnvloeden. Ten derde gebruikte Alibaba's MathVision-run een vaste prompt, terwijl concurrenten de hoogste van twee varianten kregen. Dit betekent niet dat de resultaten fout zijn; het betekent dat ze een plafond zijn, geen vloer, totdat onafhankelijke labs het model draaien op neutrale algemene testomgevingen.
Wat er nodig is om het te laten draaien
Qwen3.8-27B is een lokaal model, dat verandert wat 'prestaties' betekent: doorvoersnelheid op je eigen hardware in plaats van een prijskaart. De BF16-gewichten zijn ongeveer 55,6 GB; gekwantiseerd naar 4-bit past het op een 24GB-kaart zoals een RTX 3090 of 4090. AMD bood op de lanceerdag Day-0-ondersteuning, en zijn eigen metingen met llama.cpp/Vulkan – augustus 2026, gemiddelde van drie of meer runs – kwamen uit op 24,5 tokens/s op een Ryzen AI Max+ 395 en 51,8 tokens/s op een Radeon AI PRO R9700 met 32GB, op systemen met meer dan ruwweg 24GB aan variabel grafisch geheugen of VRAM. Communitytests van de FP8-build op een NVIDIA GH200 hielden 10 gelijktijdige 262K-contextverzoeken vast met een time-to-first-token van minder dan 10 ms. Jouw eigen cijfers zullen verschillen – dat zijn GPU's van iemand anders – maar het beeld klopt: dit is de eerste Qwen-release in deze klasse die op één enkele workstation draait, en niet alleen in een review.
Gratis gewichten, of een betaalde API?
De keuze die dit model afdwingt, is die tussen lokaal en gehost draaien: de gewichten kosten niets, maar je GPU's zijn niet gratis. Zelf hosten betekent dat je de hardware bezit — één 24GB-kaart als je 4-bit-kwantisatie en tragere generatie accepteert, iets groters als je de volledige 262K-context in volledige kwaliteit wilt. Het gehoste alternatief op OrcaRouter kost $0.33 per miljoen input-tokens en $2.40 per miljoen output-tokens, met dezelfde 262K-context en beeld-plus-video-input, en een p50-time-to-first-token van 225ms, gemeten over de afgelopen zeven dagen — geen GPU om te kopen, geen VRAM om in de gaten te houden. De rekensom is dezelfde die je altijd maakt bij open gewichten: de token-doorvoer die je daadwerkelijk nodig hebt, vermenigvuldigd met je kosten per token, versus de vaste prijs van een kaart. Bij zware, aanhoudende belasting wint self-hosting; bij grillige of bescheiden volumes is $0.33/$2.40 betalen beter dan hardware kopen die je meestal onbenut laat.

Kortom
Qwen3.8-27B is het sterkste open-weights-model dat Alibaba in deze grootteklasse heeft uitgebracht, volgens Alibaba's eigen cijfers: beste in de tabel op het gebied van agentische codering, computergebruik en visuele redenering, met een contextvenster van 262K en Apache 2.0-gewichten. De juiste interpretatie van de scorecard is voorwaardelijk — elk cijfer op de modelkaart is door de leverancier gerapporteerd, specifiek voor de testomgeving en nog niet gereproduceerd, en de frontier-modellen winnen nog steeds de moeilijkste reasoning-benchmarks. Als je beslist of je het model zelf host of als API aanroept, behandel de benchmarktabel dan als de belofte, de AMD-doorvoercijfers als de eerste onafhankelijke hardwaremeting, het Harvey legal-agent-resultaat als het eerste onafhankelijke teken dat het vermogen van het model buiten Alibaba's eigen testomgevingen standhoudt, en de twee webdev-arena-plaatsingen — #9 overall op Code Arena's WebDev en #1 open model op Arena.ai's Image-to-WebDev — als de eerste onafhankelijke bevestigingen op coderingsranglijsten van dat vermogen. We zullen deze pagina bijwerken naarmate meer onafhankelijke labs scores publiceren.
