Titelkort för Qwen3.8-27B benchmark-sammanfattningen, som visar ett benchmarkrapportkort med en stämpel där det står OPEN WEIGHTS och ikoner för kodning, genomströmning, vision, lång kontext och lokal hårdvara, med taggar där det står 27B DENSE, 262K CONTEXT och APACHE 2.0.
Guides & Insights

Qwen3.8-27B Prestandamätningar: Hela tabellen, med tillhörande förbehåll

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Qwen/Qwen3.8-27B får 73,0 på Terminal-Bench 2.1, 61,7 på SWE-bench Pro, 90,3 på LiveCodeBench v6 och 84,3 på OSWorld-Verified – och vartenda ett av dessa resultat är Alibabas egna. Den 27-miljarder parametrar stora modellen med öppna vikter dök upp på Hugging Face den 14 augusti 2026 under licensen Apache 2.0, och inom de första två veckorna fick den tre oberoende tredjepartsresultat: förstaplatsen bland öppna vikter på Harveys Legal Agent-benchmark, i en studie genomförd av legal-AI-företaget Harvey och minnesföretaget Engram; en total 9:e-plats på Code Arenas WebDev-topplista, den enda modellen i sin storleksklass bland topp 10, enligt Alibabas tillkännagivande den 25 augusti; och, tillkännagivet den 26 augusti, förstaplatsen bland öppna vikter på Arena.ai:s Image-to-WebDev-topplista, rankad som 7:a totalt med en rapporterad poäng på 1 574. Den här sidan är den kompletta, källbelagda genomgången: alla 25 officiella benchmarks från modellkortet, vad som ändrades jämfört med föregångaren Qwen3.6-27B, vad ett oberoende AMD-genomströmningstest mätte, resultaten från legal-agent- och webdev-arena-testerna, samt vilka påståenden du fortfarande bör betrakta som preliminära.

En läsguide innan siffrorna: "officiell" här betyder Alibabas utvärdering tryckt på modellkortet för Qwen/Qwen3.8-27B. Den är leverantörsrapporterad och ej oberoende reproducerad. "Oberoende" betyder att någon utanför labbet har mätt den — hittills omfattar det ett hårdvarugenomströmningstest, en studie av agenter inom juridik, samt placeringar på två av Arena.ai:s webbutvecklingslistor, Code Arenas WebDev och Image-to-WebDev-arenan. Riktmärken där testmiljön har betydelse flaggas {{1}}i texten{{/1}}.

Modellen, en rad per spec

• 27B täta parametrar (28B räknat med visionskodaren), 64 lager, dold storlek 5120.

• Hybrid attention — 48 Gated DeltaNet linear-attention-lager plus 16 full-attention-lager, ett 3:1-förhållande — vilket är det som gör ett fönster på 262K-token överkomligt att köra.

• 262 144 tokens inbyggd kontext, utbyggbar till 1 000 000 med YaRN-skalning.

• Inbyggd bild- och videoinmatning (textutmatning), Apache 2.0-vikter, ungefär 55,6 GB i BF16.

Den korta versionen: detta är modellen som är tänkt att ta det Alibaba lärde sig när de byggde Qwen3.8-Max med 2,4 biljoner parametrar och komprimera det till något som en enda GPU kan köra.

Resultattavlan: alla benchmarks på modellkortet

Alla poäng nedan är Alibaba-rapporterade från modellkortet av den 14 augusti, med poängen för Qwen3.6-27B som modellen ersätter inom parentes.

Kodning.Terminal-Bench 2.1 (agentisk terminalkodning) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). SWE-bench Pro- och QwenSWEBench-körningarna använde Claude Code-harnessen, enligt en fotnot i modellkortet – värt att ha i åtanke innan man jämför dem med en modell som poängsatts med en annan harness.

Långsiktiga agenter och kontorsarbete. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / score 42.9 (10.6 / 27.3).

Resonemang och kunskap. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruktionsföljning 79.5 (69.1). HLE bedöms av GPT-4o, enligt kortet.

Vision och datoranvändning. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 med CI / 90.0 utan (85.1); BabyVision 85.6 med CI / 65.7 utan (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" är Alibabas inferensförbättring; gapet mellan dess på- och av-lägen är det enskilt mest informativa talet på kortet om hur mycket poäng du kan köpa med extra beräkningskraft för inferens.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

Vad ändrades faktiskt jämfört med Qwen3.6-27B

Varje riktmärke på kortet gick upp, men skillnaderna är inte enhetliga – och formen på förbättringen är det viktiga. Vinsterna klustrar kring agentisk kodning och datoranvändning, inte kunskapsåterkallning:

• DeepSWE 1.1 (agentisk kodning) 13.3 → 42.2, ungefär en 3x-ökning.

• QwenSWEBench 49.3 → 79.0

• Agents' Last Exam-poäng 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 och AndroidWorld 70.3 → 81.9

• BabyVision (med CI) 28.9 → 85.6 — den största relativa förbättringen på kortet

Samtidigt gick GPQA Diamond från 87.8 → 89.2 och RealWorldQA från 84.1 → 85.9: verklig men liten. Detta är inte en "smartare på allt"-release. Det är en release som är riktad rakt mot agenter som läser skärmar, använder verktyg och skriver kod över många steg.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

Sedan den här sidan publicerades är den viktigaste utvecklingen juridisk, inte teknisk. Alibaba tillkännagav att Qw​en3.8-27B är den #1-modellen med öppna vikter på Harveys Legal Agent-benchmark — ett rankningspåstående från leverantörens eget håll, så betrakta det som Alibabas eget uttalande. Resultatet bakom detta är en studie som inte är Alibabas: Harvey, företaget inom juridisk AI, och Engram, en AI-minnesstartup, byggde en syntetisk advokatbyrå som heter Calderwood & Harkness av 100M+ tokens över cirka 10 000 dokument och 266 ärenden, och anpassade sedan Qw​en3.8-27B till den med parametriskt minne, komprimerade anteckningar och ett hämtningsverktyg.

På 250 juridiska uppgifter nådde den anpassade 27B-modellen i genomsnitt 67 %, före alla modeller som studien testade – inklusive Claude Opus 4.8 – och när det gällde strikt allt-eller-inget-korrekthet ledde den över Opus 4.8 med 30 % mot 25 %, till en kostnad på ungefär 0,13 USD per fråga jämfört med 1,32 USD för Opus 4.8. Dessa siffror är rapporterade av Harvey/Engram och har ännu inte oberoende verifierats. Innan träning på företagets egna dokument presterade samma modell bara 4,7 % på företagsspecifika frågor; efter att ha studerat dem, 72,6 %.

Läs #1 med en stor varning: modellen som toppade benchmarken hade studerat testkorpusen i förväg, finjusterad på företagets 100M tokens innan den utvärderades. Det gör detta till en demonstration av vad 27B kan absorbera med domänspecifik tuning, inte ett resultat för de färdiga Apache-2.0-vikterna på en neutral testmiljö — och den täcker en domän, juridik, inte allmän kvalitet. Vad den däremot stödjer är budskapet bakom tweeten: en 27B som är tillräckligt liten för att köras på en lokal maskin är stark nog för professionellt arbete när den väl har rätt kunskap.

Det andra oberoende resultatet: #9 totalt på Code Arenas WebDev

Det andra oberoende resultatet är ett kodningsresultat, och det är anledningen till att denna sida ändrades den 25 augusti. Code Arena är Arena.ais webbutvecklingstopplista — projektet tidigare känt som WebDev Arena, på webbplatsen tidigare känd som LMArena — där användare bygger riktiga appar med anonymiserade modellpar och röstar på vilket resultat de hellre skulle lansera. På den offentliga topplistan ligger Qw​en3.8-27B på #9 totalt med en poäng på 1595, den enda modellen i sin storleksklass inom topp 10.

Placeringen är den oberoende delen — den finns på en tredjepartstopplista som vem som helst kan öppna. Rubriken kring den är Alibabas egen formulering: inramningen "enda lilla modellen bland de tio bästa" och de medföljande placeringarna kommer från Qw​ens tillkännagivande den 25 augusti. De är värda att upprepa med den etiketten. 27B rankas sex platser under den betydligt större Qwen3.8-Max (som tillkännagivandet placerar som #3 totalt) och väl före den till storleken liknande Gemma 4-31B (som samma tillkännagivande placerar som #80). Poängen är inte att en 27B slår frontlinjen när det gäller att bygga webbappar; det är att en modell som är tillräckligt liten för att köras på ett enda GPU-kort finns bland de tio bästa i en blindkodningsarena vars övriga deltagare är mycket större modeller.

Det tredje oberoende resultatet: #1 öppen modell på Arena.ais Image-to-WebDev

Det tredje oberoende resultatet kom den 26 augusti, och det är det starkaste hittills för en modell av den här storleken. Image-to-WebDev är systerbrädet till Code Arenas WebDev på Arena.ai — arenan där en modell får en skärmdump eller annan visuell referens och måste omvandla den till ett fungerande webbgränssnitt, med blinda mänskliga röstande som väljer utdata de hellre skulle skicka. På den offentliga topplistan rankas Qw​en3.8-27B som #1 bland öppna modeller och #7 totalt, med en rapporterad arena-poäng på 1 574.

Placeringen är den oberoende delen — den finns på en tredjeparts leaderboard som vem som helst kan öppna. Rubriken runt den är Alibabas egen: Qwen-teamets tillkännagivande den 26 augusti beskriver 27B-modellen som "i nivå med modeller som är 100 gånger så stora" på detta test, en jämförelse som leaderboarden inte dokumenterar. Och en preferensrankning är inte ett omdöme om kodkvalitet — Image-to-WebDev-röster mäter vilken utdata en människa hellre skulle leverera, inte huruvida HTML:en är säker, tillgänglig eller underhållbar. Vad resultatet faktiskt etablerar är att en 27B open-weights-modell nu leder hela sitt öppna fält när det gäller att förvandla en bild till en webbsida, vilket är den färdighet som en växande kategori av "screenshot to site"-produkter bygger på.

De ärliga luckorna: där den fortfarande förlorar, och metodologiska förbehåll

Mot frontlinjen är bilden smickrande men inte ensidig. Där Qw​en3.8-27B och Claude Opus 4.6 Max överlappar, vinner Qw​en majoriteten — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, och hela visionsblocket. Mot Metas Muse Glimmer-30B, den naturliga lokalklasskonkurrenten, vinner den samtliga åtta överlappande benchmarks utan undantag. Men den förlorar fortfarande Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) och NL2Repo-Bench (42.3 vs 47.6) mot Claude Opus 4.6 Max. Om din arbetsbelastning är det svåraste frontlinjeresonemanget — frontlinjematematik, massivt multidisciplinära frågor — så är 27B inte där ännu.

Tre förbehåll innan du citerar något av detta. För det första är modellkortstabellen ovan fortfarande helt rapporterad av Alibaba – det finns ännu inget Artificial Analysis-index för 27B. Den har nu tre oberoende tredjepartsresultat, men vart och ett är begränsat: Code Arena-rankningen mäter webbappbyggande utifrån textprompter, Image-to-WebDev-rankningen mäter att förvandla en skärmbild till en fungerande sida, båda bedömda genom blinda omröstningar på anonymiserade utdata, och Harvey-studien om juridisk agent täcker en enda domän med en modell som tränats för testet. Inget av dem rör standardvikterna som körts i en generell utvärderingsmiljö. För det andra använder modellkortet Claude Code-harnessen för SWE-bench Pro och QwenSWEBench samt en GPT-4o-domare för Humanity's Last Exam – jämförelser med modeller som poängsatts i andra konfigurationer kommer att förändra siffrorna. För det tredje använde Alibabas MathVision-körning en fast prompt medan konkurrenterna fick den högre av två varianter. Inget av detta betyder att resultaten är fel; det betyder att de är ett tak, inte ett golv, tills oberoende labb kör modellen på neutrala generella utvärderingsmiljöer.

Vad som krävs för att köra det

Qw​en3.8-27B är en lokal modell, vilket förändrar vad "prestanda" betyder: genomströmning på din egen hårdvara istället för en prislapp. BF16-vikterna är ungefär 55,6 GB; kvantiserade till 4 bitar får de plats på ett 24 GB-kort som ett RTX 3090 eller 4090. AMD levererade Day-0-stöd på lanseringsdagen, och dess egna llama.cpp/Vulkan-mätningar — augusti 2026, medelvärde av tre eller fler körningar — ger 24,5 tokens/s på en Ryzen AI Max+ 395 och 51,8 tokens/s på en Radeon AI PRO R9700 med 32 GB, på system med mer än ungefär 24 GB variabel grafikminne eller VRAM. Community-tester av FP8-versionen på en NVIDIA GH200 höll 10 samtidiga 262K-kontextförfrågningar med sub-10ms tid-till-första-token. Dina egna siffror kommer att skilja sig — det är någon annans GPU:er — men formen är verklig: detta är den första Qw​en-utgåvan i denna klass som körs, inte bara i en recension, på en enda arbetsstation.

Fria vikter, eller ett betalt API?

Beslutet som denna modell tvingar fram är det som skiljer lokalt från molnbaserat: vikterna kostar ingenting, men dina GPU:er är inte gratis. Självhostning innebär att du äger kisel — ett 24 GB-kort om du accepterar 4-bitars kvantisering och långsammare generering, något större om du vill ha hela 262K-kontexten i full kvalitet. Det molnbaserade alternativet på OrcaRouter kostar $0.33 per miljon inmatningstokens och $2.40 per miljon utdatatokens, med samma 262K-kontext och inmatning av bilder och video, och en p50-tid till första token på 225ms uppmätt över de senaste sju dagarna — ingen GPU att köpa, inget VRAM att hålla koll på. Aritmetiken är den du alltid gör med öppna vikter: det token-genomflöde du faktiskt behöver gånger din kostnad per token, jämfört med det fasta priset för ett kort. Vid tung kontinuerlig last vinner självhostning; vid ryckig eller måttlig last lönar det sig att betala $0.33/$2.40 snarare än att köpa kisel som du mest låter stå overksamt.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

Slutsats

Qw​en3.8-27B är den starkaste open-weights-modellen som Alibaba har släppt i den här storleksklassen, enligt Alibabas egna siffror: bäst i tabellen inom agentisk kodning, datoranvändning och visuellt resonerande, med ett kontextfönster på 262K och Apache 2.0-vikter. Den korrekta tolkningen av resultattavlan är villkorad — varje siffra i modellkortet är leverantörsrapporterad, specifik för testmiljön och ännu inte oberoende verifierad, och frontmodellerna vinner fortfarande de svåraste resonemangsbenchmarkerna. Om du funderar på att självhosta den eller anropa den som ett API, betrakta benchmarktabellen som löftet, AMD-genomströmningssiffrorna som det första oberoende hårdvarumåttet, Harvey-resultatet för den juridiska agenten som det första oberoende tecknet på att modellens förmåga överlever utanför Alibabas egna testmiljöer, och de två placeringarna i webdev-arenan — #9 totalt på Code Arenas WebDev och #1 bland öppna modeller på Arena.ai:s Image-to-WebDev — som de första oberoende bekräftelserna på kodledartavlor av den förmågan. Vi kommer att uppdatera den här sidan när fler oberoende labb publicerar resultat.