
Qwen3.8-27B Benchmarks: De volledige tabel, met de bijbehorende kanttekeningen
- obsidianNIEUWQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
Qwen3.8-27B scoort 73,0 op Terminal-Bench 2.1, 61,7 op SWE-bench Pro, 90,3 op LiveCodeBench v6 en 84,3 op OSWorld-Verified — en al die cijfers zijn afkomstig van Alibaba zelf. Het open-gewichtenmodel met 27 miljard parameters verscheen op 14 augustus 2026 op Hugging Face onder Apache 2.0, en per 15 augustus heeft niemand buiten Alibaba de kwaliteit onafhankelijk beoordeeld. Deze pagina is het complete, met bronnen onderbouwde overzicht: alle 25 officiële benchmarks uit de modelkaart, wat er veranderd is ten opzichte van zijn voorganger Qwen3.6-27B, wat een onafhankelijke AMD-doorvoertest heeft gemeten, en welke beweringen je als voorlopig moet beschouwen.
Een leesgids vóór de cijfers: "officieel" betekent hier de evaluatie van Alibaba die op de modelkaart staat vermeld bij Qwen/Qwen3.8-27B. Deze is door de leverancier gerapporteerd en niet onafhankelijk gereproduceerd. "Onafhankelijk" betekent dat iemand buiten het lab het heeft gemeten — dat geldt tot nu toe alleen voor hardware-doorvoer, niet voor kwaliteitsscores. Benchmarks waarbij de testopstelling ertoe doet, zijn inline gemarkeerd.
Het model, één regel per specificatie
• 27B dense parameters (28B inclusief de vision-encoder), 64 lagen, hidden size 5120.
• Hybride attention — 48 Gated DeltaNet lineaire attention-lagen plus 16 volledige attention-lagen, een verhouding van 3:1 — wat het betaalbaar maakt om een venster van 262K tokens te draaien.
262.144 tokens native context, uitbreidbaar tot 1.000.000 met YaRN-schaling.
• Native afbeelding- en video-invoer (tekstuitvoer), Apache 2.0-gewichten, ongeveer 55,6 GB in BF16.
De korte versie: dit is het model dat bedoeld is om wat Alibaba heeft geleerd bij het bouwen van de Qwen3.8-Max met 2,4 biljoen parameters te comprimeren tot iets dat een enkele GPU kan draaien.
De scorekaart: elke benchmark op de modelkaart
Alle onderstaande scores zijn door Alibaba gerapporteerd in de modelkaart van 14 augustus, met de score van Qwen3.6-27B, het model dat wordt vervangen, tussen haakjes.
Coderen. Terminal-Bench 2.1 (agentische terminalcodering) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). De SWE-bench Pro- en QwenSWEBench-runs gebruikten de Claude Code-harness, volgens een voetnoot in de modelkaart — het is goed om in gedachten te houden voordat je ze vergelijkt met een model dat op een andere harness is gescoord.
Langetermijnagenten en kantoorwerk. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / score 42.9 (10.6 / 27.3).
Redeneren en kennis. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instructie-opvolging 79.5 (69.1). HLE wordt beoordeeld door GPT-4o, volgens de kaart.
Visie en computergebruik. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 met CI / 90.0 zonder (85.1); BabyVision 85.6 met CI / 65.7 zonder (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" is Alibaba's verbetering tijdens de inferentie; het verschil tussen de aan- en uit-status is het meest informatieve getal op de kaart over hoeveel score je kunt kopen met extra inferentie-rekenkracht.

Wat is er daadwerkelijk veranderd ten opzichte van Qwen3.6-27B
Elke benchmark op de kaart ging omhoog, maar de verschillen zijn niet uniform — en de vorm van de verbetering is het verhaal. De winsten clusteren in agentisch coderen en computergebruik, niet in het ophalen van kennis:
• DeepSWE 1.1 (agentic coding) 13.3 → 42.2, ruwweg een sprong van 3x
• QwenSWEBench 49.3 → 79.0
• Agents' Last Exam-score 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 en AndroidWorld 70.3 → 81.9
• BabyVision (met CI) 28.9 → 85.6 — de grootste relatieve stijging op de kaart
Ondertussen ging GPQA Diamond van 87.8 naar 89.2 en RealWorldQA van 84.1 naar 85.9: echt, maar klein. Dit is geen “slimmer in alles”-release. Het is een release die rechtstreeks is gericht op agents die schermen lezen, tools gebruiken en code schrijven over veel stappen.

De eerlijke hiaten: waar het nog steeds tekortschiet, en de methodologische kanttekeningen
Tegen de frontier {{1}}is het beeld vleiend maar niet eenzijdig. Waar Qwen3.8-27B en Claude Opus 4.6 Max elkaar overlappen, wint Qwen de meerderheid — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, en het hele vision-blok.{{/1}} Tegen Meta's Muse Glimmer-30B, de natuurlijke rivaal in de lokale klasse, wint het glansrijk alle acht overlappende benchmarks. Maar het verliest nog steeds Terminal-Bench 2.1 (73,0 tegen 78,2), GPQA Diamond (89,2 tegen 91,3), Humanity's Last Exam (30,8 tegen 40,0) en NL2Repo-Bench (42,3 tegen 47,6) van Claude Opus 4.6 Max. Als je workload het zwaarste frontier-reasoning is — frontier-wiskunde, enorm multidisciplinaire vragen — dan is de 27B er nog niet aan toe.
Drie kanttekeningen voordat u dit citeert. Ten eerste is niets ervan onafhankelijk geverifieerd; er is geen Artificial Analysis-index en geen LMArena-run voor de 27B per 15 augustus, en Alibaba's eigen testomgevingen zijn niet degenen die derden zullen gebruiken. Ten tweede gebruikt de modelkaart de Claude Code-harness voor SWE-bench Pro en QwenSWEBench en een GPT-4o-judge voor Humanity's Last Exam — vergelijkingen met modellen die op andere setups zijn gescoord, zullen de cijfers veranderen. Ten derde gebruikte Alibaba's MathVision-run een vaste prompt, terwijl concurrenten de hogere van twee varianten kregen. Dit betekent niet dat de resultaten fout zijn; het betekent dat ze een plafond zijn, geen vloer, totdat iemand anders het model draait.
Wat er nodig is om het te laten draaien
Qwen3.8-27B is een lokaal model, wat verandert wat 'prestaties' betekent: doorvoer op je eigen hardware in plaats van een prijslijst. De BF16-gewichten zijn ongeveer 55,6 GB; gekwantiseerd naar 4-bit past het op een 24GB-kaart zoals een RTX 3090 of 4090. AMD leverde op de lanceringsdag Day-0-ondersteuning, en zijn eigen llama.cpp/Vulkan-metingen — augustus 2026, gemiddelde van drie of meer runs — komen uit op 24,5 tokens/s op een Ryzen AI Max+ 395 en 51,8 tokens/s op een Radeon AI PRO R9700 met 32 GB, op systemen met meer dan ongeveer 24 GB aan variabel grafisch geheugen of VRAM. Communitytests van de FP8-build op een NVIDIA GH200 hielden 10 gelijktijdige 262K-contextverzoeken vast met een time-to-first-token van minder dan 10 ms. Jouw eigen cijfers zullen verschillen — dat zijn andermans GPU's — maar de vorm is echt: dit is de eerste Qwen-release in deze klasse die draait, niet alleen in een review, op één enkele workstation.
Gratis gewichten, of een betaalde API?
De keuze die dit model afdwingt, is die tussen lokaal en gehost draaien: de gewichten kosten niets, maar je GPU's zijn niet gratis. Zelf hosten betekent dat je de hardware bezit — één 24GB-kaart als je 4-bit-kwantisatie en tragere generatie accepteert, iets groters als je de volledige 262K-context in volledige kwaliteit wilt. Het gehoste alternatief op OrcaRouter kost $0.33 per miljoen input-tokens en $2.40 per miljoen output-tokens, met dezelfde 262K-context en beeld-plus-video-input, en een p50-time-to-first-token van 225ms, gemeten over de afgelopen zeven dagen — geen GPU om te kopen, geen VRAM om in de gaten te houden. De rekensom is dezelfde die je altijd maakt bij open gewichten: de token-doorvoer die je daadwerkelijk nodig hebt, vermenigvuldigd met je kosten per token, versus de vaste prijs van een kaart. Bij zware, aanhoudende belasting wint self-hosting; bij grillige of bescheiden volumes is $0.33/$2.40 betalen beter dan hardware kopen die je meestal onbenut laat.

Kortom
Qwen3.8-27B is het sterkste open-weights-model dat Alibaba in deze grootteklasse heeft uitgebracht, op basis van Alibaba's eigen cijfers: het beste in de tabel bij agentisch coderen, computergebruik en visueel redeneren, met een contextvenster van 262K en Apache 2.0-gewichten. De juiste interpretatie van de scorekaart is voorwaardelijk — elk cijfer is door de leverancier gerapporteerd, specifiek voor de testomgeving en nog niet gereproduceerd, en de frontiermodellen winnen nog steeds de moeilijkste redeneerbenchmarks. Als je besluit of je het zelf host of als API aanroept, behandel de benchmarktabel dan als de belofte en de AMD-doorvoercijfers als de enige onafhankelijke meting die vandaag bestaat. We zullen deze pagina bijwerken op de dag dat een onafhankelijk lab een score publiceert.
