
Qwen3.8-27B Prestandamätningar: Hela tabellen, med tillhörande förbehåll
- obsidianNYQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
Qwen3.8-27B når Terminal-Bench 2.1 på 73,0, SWE-bench Pro på 61,7, LiveCodeBench v6 på 90,3 och OSWorld-Verified på 84,3 — och vartenda ett av dessa siffror är Alibabas egna. Den 27-miljarder-parameter stora modellen med öppna vikter släpptes på Hugging Face den 14 augusti 2026 under Apache 2.0, och per den 15 augusti har ingen utanför Alibaba oberoende bedömt dess kvalitet. Den här sidan är den kompletta, källbelagda sammanfattningen: alla 25 officiella benchmarks från modellkortet, vad som ändrades jämfört med föregångaren Qwen3.6-27B, vad ett oberoende AMD-genomströmningstest mätte, och vilka påståenden du bör betrakta som preliminära.
En läsguide innan siffrorna: "officiell" betyder här Alibabas utvärdering som anges på modellkortet på Qwen/Qwen3.8-27B. Den är leverantörsrapporterad och inte reproducerad. "Oberoende" betyder att någon utanför labbet mätte den — hittills gäller det endast hårdvarugenenomströmning, inte något kvalitetsresultat. Prestandatest där testmiljön har betydelse är flaggade i texten.
Modellen, en rad per spec
• 27B täta parametrar (28B räknat med visionskodaren), 64 lager, dold storlek 5120.
• Hybrid attention — 48 Gated DeltaNet linear-attention-lager plus 16 full-attention-lager, ett 3:1-förhållande — vilket är det som gör ett fönster på 262K-token överkomligt att köra.
• 262 144 tokens inbyggd kontext, utbyggbar till 1 000 000 med YaRN-skalning.
• Inbyggd bild- och videoinmatning (textutmatning), Apache 2.0-vikter, ungefär 55,6 GB i BF16.
Den korta versionen: detta är modellen som är tänkt att ta det Alibaba lärde sig när de byggde Qwen3.8-Max med 2,4 biljoner parametrar och komprimera det till något som en enda GPU kan köra.
Resultattavlan: alla benchmarks på modellkortet
Alla poäng nedan är Alibaba-rapporterade från modellkortet av den 14 augusti, med poängen för Qwen3.6-27B som modellen ersätter inom parentes.
Kodning.Terminal-Bench 2.1 (agentisk terminalkodning) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). SWE-bench Pro- och QwenSWEBench-körningarna använde Claude Code-harnessen, enligt en fotnot i modellkortet – värt att ha i åtanke innan man jämför dem med en modell som poängsatts med en annan harness.
Långsiktiga agenter och kontorsarbete. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / score 42.9 (10.6 / 27.3).
Resonemang och kunskap. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruktionsföljning 79.5 (69.1). HLE bedöms av GPT-4o, enligt kortet.
Vision och datoranvändning. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 med CI / 90.0 utan (85.1); BabyVision 85.6 med CI / 65.7 utan (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" är Alibabas inferensförbättring; gapet mellan dess på- och av-lägen är det enskilt mest informativa talet på kortet om hur mycket poäng du kan köpa med extra beräkningskraft för inferens.

Vad ändrades faktiskt jämfört med Qwen3.6-27B
Varje riktmärke på kortet gick upp, men skillnaderna är inte enhetliga – och formen på förbättringen är det viktiga. Vinsterna klustrar kring agentisk kodning och datoranvändning, inte kunskapsåterkallning:
• DeepSWE 1.1 (agentisk kodning) 13.3 → 42.2, ungefär en 3x-ökning.
• QwenSWEBench 49.3 → 79.0
• Agents' Last Exam-poäng 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 och AndroidWorld 70.3 → 81.9
• BabyVision (med CI) 28.9 → 85.6 — den största relativa förbättringen på kortet
Samtidigt gick GPQA Diamond från 87.8 → 89.2 och RealWorldQA från 84.1 → 85.9: verklig men liten. Detta är inte en "smartare på allt"-release. Det är en release som är riktad rakt mot agenter som läser skärmar, använder verktyg och skriver kod över många steg.

De ärliga luckorna: där den fortfarande förlorar, och metodologiska förbehåll
Mot frontlinjen är bilden smickrande men inte ensidig. Där Qwen3.8-27B och Claude Opus 4.6 Max överlappar, vinner Qwen majoriteten — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench och hela visionsblocket. Mot Metas Muse Glimmer-30B, den naturliga lokalklass-rivalen, vinner den samtliga åtta överlappande benchmarks utan diskussion. Men den förlorar fortfarande Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0) och NL2Repo-Bench (42.3 vs 47.6) mot Claude Opus 4.6 Max. Om din arbetsbelastning är det svåraste frontlinjeresonemanget — frontlinjematematik, massivt tvärvetenskapliga frågor — så är 27B inte där ännu.
Tre varningar innan du citerar något av detta. För det första är inget av det oberoende verifierat; det finns inget Artificial Analysis-index och ingen LMArena-körning för 27B per den 15 augusti, och Alibabas egna testmiljöer är inte de som tredje parter kommer att använda. För det andra använder modellkortet Claude Code-miljön för SWE-bench Pro och QwenSWEBench och en GPT-4o-domare för Humanity's Last Exam — jämförelser med modeller som poängsatts i andra uppställningar kommer att flytta siffrorna. För det tredje använde Alibabas MathVision-körning en fast prompt medan konkurrenterna fick det högre av två varianter. Inget av detta innebär att resultaten är fel; det innebär att de är ett tak, inte ett golv, tills någon annan kör modellen.
Vad som krävs för att köra det
Qwen3.8-27B är en lokal modell, vilket förändrar vad ”prestanda” innebär: genomströmning på din egen hårdvara istället för en prislapp. BF16-vikterna är ungefär 55,6 GB; kvantiserade till 4-bit får de plats på ett 24 GB-kort som ett RTX 3090 eller 4090. AMD levererade Day-0-stöd på lanseringsdagen, och dess egna llama.cpp/Vulkan-mätningar — augusti 2026, medelvärde av tre eller fler körningar — placerar den på 24,5 token/s på en Ryzen AI Max+ 395 och 51,8 token/s på ett Radeon AI PRO R9700 med 32 GB, på system med mer än cirka 24 GB variabel grafikminne eller VRAM. Community-tester av FP8-bygget på en NVIDIA GH200 höll 10 samtidiga 262K-kontextförfrågningar med sub-10ms tid-till-första-token. Dina egna siffror kommer att skilja sig — det är någon annans GPU:er — men formen är verklig: det här är den första Qwen-utgåvan i den här klassen som körs, inte bara i en recension, på en enda arbetsstation.
Fria vikter, eller ett betalt API?
Beslutet som denna modell tvingar fram är det som skiljer lokalt från molnbaserat: vikterna kostar ingenting, men dina GPU:er är inte gratis. Självhostning innebär att du äger kisel — ett 24 GB-kort om du accepterar 4-bitars kvantisering och långsammare generering, något större om du vill ha hela 262K-kontexten i full kvalitet. Det molnbaserade alternativet på OrcaRouter kostar $0.33 per miljon inmatningstokens och $2.40 per miljon utdatatokens, med samma 262K-kontext och inmatning av bilder och video, och en p50-tid till första token på 225ms uppmätt över de senaste sju dagarna — ingen GPU att köpa, inget VRAM att hålla koll på. Aritmetiken är den du alltid gör med öppna vikter: det token-genomflöde du faktiskt behöver gånger din kostnad per token, jämfört med det fasta priset för ett kort. Vid tung kontinuerlig last vinner självhostning; vid ryckig eller måttlig last lönar det sig att betala $0.33/$2.40 snarare än att köpa kisel som du mest låter stå overksamt.

Slutsats
Qwen3.8-27B är den starkaste modellen med öppna vikter som Alibaba har släppt i denna storleksklass, enligt Alibabas egna siffror: bäst i tabellen inom agentisk kodning, datoranvändning och visuellt resonemang, med ett 262K kontextfönster och Apache 2.0-vikter. Den korrekta tolkningen av resultattavlan är villkorad — varje siffra är leverantörsrapporterad, specifik för testmiljön och ännu inte reproducerad, och frontmodellerna vinner fortfarande de svåraste resonemangsriktmärkena. Om du funderar på att driva den själv eller anropa den som ett API, behandla benchmark-tabellen som löftet och AMD-genomströmningssiffrorna som den enda oberoende mätning som finns idag. Vi uppdaterar denna sida den dag ett oberoende labb publicerar ett resultat.
