Hero-titelkort för Qwen3.8-27B, den täta vision-språkmodellen med 27 miljarder parametrar i Alibabas Qwen3.8-serie, med underrubriken '27B tät – inbyggd vision–språk – Apache 2.0' och tre funktionschips med texten '262 144-tokenkontext', 'text + bild + video in' och 'text ut', med OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Qwen3.8-27B: Den kompakta multimodala modellen i Alibabas Qwen3.8-serie

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Qwen3.8-27B är den täta, en-nodiga medlemmen i Alibabas Qwen3.8-generation: en nativ synspråkmodell med 27 miljarder parametrar, publicerad på Hugging Face under Apache 2.0, som tar emot text, bilder och video och returnerar text med ett kontextfönster på 262 144 token. Detta är referenssidan för den modellen – den kanoniska beskrivningen av vad den är, vad det kostar att anropa den och vad den kan göra – och det är värt att säga inledningsvis varför en sida finns för en modell vars vikter först dök upp i augusti 2026 snarare än under de senaste sju dagarna. Vi rapporterar inte en lansering. Vi besvarar en stående fråga: läsare når oss för namnet ”Qwen3.8-27B” tusentals gånger i månaden, och fram till nu har ingen av våra sidor ägt det svaret. Modellens egen release, daterad på Qwens kort och registrerad som 2026-08-14 av Artificial Analysis, är ett faktum som denna sida använder för att datera modellen, inte en händelse som den rapporterar.

Läs det som det undantag det är: vid en strikt sjudagarsläsning är en modell från mitten av augusti 2026 inte aktuell, och den här posten skulle hoppas över som nyhet. Motiveringen här är en annan. Det är en referenssida vars siffror verifierades mot Qwe​ns eget modellkort, repots licensfil, Qwe​n Cloud-prislistan och Artificial Analysis den 2026-09-28, och vars existensberättigande är den sökefterfrågan som vi mätte i förstapartsdata samma dag. Det är inte ett andra tillkännagivande, och ingen bör läsa det som ett.

Var 27B placerar sig i Qwen3.8-serien

Qwen3.8-generationen är inte en enda modell, och storlekssuffixet är hela poängen med namnet. Qwens egna repositorieanteckningar för hela familjen gör uppdelningen explicit:

• Qwen3.8-27B — 27B densa parametrar, inbyggd bild- och videoinmatning, Apache 2.0. Den driftsättningsvänliga medlemmen: en modell dimensionerad för att köras på en GPU eller en liten nod, och ämnet för den här sidan.

• Qwen3.8-Max, byggd på Qwen3.8-2.4T-A95B — 2,4 biljoner parametrar totalt, varav 95B aktiva, Qwen-Max-klassmodellen som Alibaba öppnade för första gången i den här generationen. Dess repo har en skräddarsydd qwen3.8-max-licens i stället för Apache 2.0.

• Qwen3.8-Flash-Next — den experimentella arkitekturförhandsvisningen som Qwen säger kommer att ligga till grund för Qwen4, släppt under qwen-community-1.0-licensen. Den hostade Qwen3.8-Flash bygger på den.

Så "27B" är inte en utrustningsnivå i Max-modellen; det är den storleksklass som ett enskilt team faktiskt kan betjäna. Det Alibaba hävdar att den ärver är träningsreceptet: kortet beskriver Qwen3.8-27B som att den tar den här generationens framsteg inom kodning, professionellt arbete, forskning och långsiktiga agentiska uppgifter och komprimerar dem till en dense checkpoint.

Scoreboard infographic titled 'Qwen3.8-27B - the scoreboard' with six rows: Parameters 27B dense (27.8B with vision), Context 262,144 native and 1M with YaRN, Modalities text + image + video in and text out, Licence Apache 2.0 with commercial use, Terminal Bench 2.1 of 73.0 marked vendor-reported, and AA Intelligence Index 33.7 marked independent, with a footer reading 'Qwen figures vendor-reported and unreproduced; AA figures per Artificial Analysis.' and the OrcaRouter logo in the bottom-right corner.

Arkitekturen som Qwen publicerar

Alla siffror nedan kommer från modellkortet på Qwen/Qwen3.8-27B, vilket är leverantörens egen dokumentation:

• Parametrar — 27B enligt marknadsföringen. Repositoriets egen safetensors-metadata uppgår till 27 781 427 952 parametrar i BF16 fördelade över 18 shards, så ungefär 27,8B när visionstornet räknas med. Det finns ingen mixture-of-experts här: alla parametrar är aktiva för varje token.

• Form — 64 lager, dold dimension 5 120, mellanliggande feed-forward-dimension 17 408, tokeninbäddning och LM-utdata 248 320 (paddad).

• Hybriduppmärksamhet — layouten som Qwen skriver ut är 16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)): tre linjära uppmärksamhetsblock för varje fullt uppmärksamhetsblock, ett förhållande på 3:1. Gated DeltaNet kör 48 linjära uppmärksamhetshuvuden för V och 16 för QK vid huvuddimension 128; Gated Attention kör 24 query-huvuden mot 4 KV-huvuden vid huvuddimension 256, med en roterande dimension på 64. Det förhållandet är vad som gör ett 262K-fönster överkomligt i en 27B-modell, och det är samma linje som Qwen3.8-Flash-Next vidareutvecklar med sparse attention.

• Förutsägelse av flera token — modellkortet anger att modellen tränas med MTP över flera steg, drafting-tricket som snabbar upp genereringen i MTP-medvetna serveringsstackar.

• Tankekontroll — tankeläget är på som standard och kan stängas av per begäran. reasoning_effort tar xhigh (standard), medium eller low, och preserve_thinking är på som standard så att resonemangsspår följer med mellan turer i stället för att regenereras.

Kontextfönster och utdatatak

Kortet anger 262 144 tokens inbyggt, utbyggbart till 1 000 000 med RoPE-skalning (YaRN). Qwens egen serveringsvägledning för långa agentiska körningar, inom den 1M-ramen, är att tillåta upp till 262 144 tokens för resonemangsinnehåll och upp till 131 072 tokens för det slutliga svaret — taket är en serveringskonfiguration, inte en fast egenskap hos checkpointen.

Två fönster är värda att hålla isär, eftersom de är lätta att sammanblanda. De öppna vikterna körs på 262 144 nativt; den hostade versionen på Qwe​n Cloud, som modellkortet beskriver som ännu inte tillgänglig ("tjänsten kommer snart"), listas på modellsidan för Qwe​n Cloud med en 1M-kontext, 991K max indata, 131K max utdata och en maximal resonemangsbudget på 262K. Den hostade produktens specifikationsblad är inte checkpointens specifikationsblad.

Modaliteter: vad som går in och vad som kommer ut

Indata är text, bild och video; utdata är endast text. Kortet kallar Qwen3.8-27B för ”en inbyggd bild- och språkmodell som förstår bilder och videor” och dess exempelkod skickar in alla tre indatatyperna. Det finns ingen ljudindata, ingen bildgenerering och ingen talutdata. Modellposten hos Artificial Analysis för samma checkpoint stämmer överens om omfånget — bild, video och text in, text ut — vilket är en användbar andra tolkning eftersom det inte är Alibabas egen sida.

Vad Apache 2.0-utgivningen faktiskt tillåter

Licensen är inte en sammanfattning i ett blogginlägg; förvaret innehåller själva texten för Apache License, Version 2.0, och kortets metadata anger license: apache-2.0. Vad detta ger, läst ur licenstexten: en evigvarande, världsomfattande, royaltyfri upphovsrättslicens att reproducera, framställa bearbetningar av, offentligt visa, vidarelicensiera och distribuera verket och dess bearbetningar, samt en patentlicens från bidragsgivare — där kommersiell användning ingår bland de tillåtna ändamålen och utan begränsning av användningsområde, utan tröskel för antal användare och utan separat kommersiellt avtal. Apache 2.0 är också tillåtande i den mening som har betydelse för att leverera produkter: derivatvikter får återdistribueras under andra villkor, förutsatt att du behåller licens- och attributionsmeddelanden och anger vad du har ändrat (avsnitten 4a–4c). Avsnitt 6 ger inga rättigheter till namnet Qwe​n eller varumärken, så en Apache-2.0-fork kan inte marknadsföra sig som Qwe​n.

Jämförelsen inom familjen är lärorik, och den är synlig från repositorierna snarare än från bevakningen: 2.4T-A95B-checkpointen kallar sig för annat med en qwen3.8-max-licens, och Qwen3.8-Flash-Next använder qwen-community-1.0. 27B är den av de tre som levereras under vanlig Apache 2.0.

Den oberoende benchmarkpositionen

Artificial Analysis har kört modellen, och dess resultat är värt att separera från Alibabas egen tabell eftersom de två besvarar olika frågor. Det oberoende indexet, mätt på xhigh-konfigurationen:

• Intelligence Index 33.7 — det lagrade värdet hos Artificial Analysis, som deras modellsida visar avrundat till 34. Två rankningar publiceras och de mäter olika grupper: sidans egen sammanfattningsruta placerar modellen som 1:a av de 142 modellerna i sin storleksklass, i den jämförelse inom samma klass som sidans verktygstips beskriver, medan vår katalogs rad med Artificial Analysis som källa anger 45:e av 145, ungefär 67:e percentilen. Ingen av dem är en rankning mot samma fält som den andra, så läs dem inte som ett nummer i två format.

• Coding Index 68,1 — finns i vår katalog med artificialanalysis.ai som angiven källa, rankad som 35:a av 138 i det indexets pool. Modellen ligger högre på kodning än på allmän intelligens, vilket överensstämmer med formen på leverantörens egen tabell.

• Ansträngningsstege, samma testrigg — att sänka resonemangsansträngningen flyttar indexet en lång bit: 33,7 vid xhigh, 27,6 vid medium, 26,2 vid low, och 20,2 med resonemang helt avstängt. Det är en uppmätt spridning på 13,5 punkter, och det är det mest konkreta argumentet för att ställa in ansträngning per arbetsbelastning snarare än per modell.

• Där de två källorna är eniga och oeniga — på GPQA Diamond rapporterar Aliba​bas kort 89,2 och Artificial Analysis mäter 90,5. På Humanity's Last Exam rapporterar kortet 30,8 och Artificial Analysis 33,9. Nära, men inte samma siffra, och det är normalt: olika testramverk, olika körningar. En varning hör hemma i artikeln snarare än i en fotnot — ingen tredje part har publicerat en direkt jämförelse mellan Qwen3.8-27B och någon av modellerna i Aliba​bas jämförelsetabell som körts med matchad ansträngning i ett matchat testramverk, så varje jämförelse mellan modeller på den här sidan är en jämförelse av separata mätningar, inte ett resultat.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B in its xhigh configuration showing a same-class comparison rank of 1 of 142 next to an Intelligence tile, 46.6 output tokens per second at rank 55 of 142, $0.50 per million input tokens and $3.00 per million output tokens, a 256k-token context window, 27B total parameters, an Apache 2.0 licence, an open-weights marker and a release month of August 2026, with the summary text reporting a score of 34 on the Artificial Analysis Intelligence Index.

Vad Qwen rapporterar, och hur du tolkar det

Modellkortet innehåller ungefär två dussin poäng med jämförelsekolumner för Qwen3.6-27B, Qwen3.7-Plus, Muse Glimmer-30B och Opus4.6 Max. Allt är leverantörsrapporterat och inte reproducerat – Aliba​bas egen utvärdering, tryckt av Aliba​ba – och flera rader använder en Claude Code-testrigg som bedömts av en GPT-5.4-build, vilket kortets fotnoter uppger. Leverantörens rubriksiffror, utifrån detta:

• Agentisk terminalkodning – Terminal Bench 2.1 (Terminus) 73,0, mot 63,4 för Qwen3.6-27B som den ersätter, med Opus4.6 Max i topp på raden med 78,2.

• Agentisk kodning — SWE-bench Pro 61,7, QwenSWEBench 79,0, DeepSWE 1.1 42,2, NL2Repo-Bench 42,3, LiveCodeBench v6 90,3.

• Agenter och kontorsarbete — CoWorkBench 70,7, JobBench 33,4, Agents' Last Exam 42,9 i poäng (Pass@1 20,4).

• Allmän resonemangsförmåga — GPQA Diamond 89,2, HLE 30,8, IFBench 79,5. Opus4.6 Max toppar båda resonemangsraderna i leverantörens egen tabell, med 91,3 och 40,0.

• Syn och datoranvändning — OSWorld-Verified 84,3, AndroidWorld 81,9, WebArena-Verified 64,8, OmniDocBench 1.5 91,1, RealWorldQA 85,9.

Den ärliga sammanfattningen av den tabellen är snävare än vad tabellen ser ut att vara. Jämfört med sin direkta föregångare är vinsterna stora och konsekventa – QwenSWEBench 79,0 mot 49,3, DeepSWE 42,2 mot 13,3 – och det är ett påstående om en generations receptförändring. Jämfört med frontier-modellerna i de angränsande kolumnerna vinner den vissa rader och förlorar andra, enligt Aliba​bas egna siffror, genom Aliba​bas eget val av utvärderingsram.

Kör det

Vikterna är 18 BF16-shards i Transformers-formatet, och kortet listar Hugging Face Transformers, vLLM, SGLang och TokenSpeed som stackar som stöds. Vi har skrivit vägarna för lokal distribution och kvantisering separat, och de är rätt platser för den detaljen: Qwen3.8-27B på Ollama för en lokal daemon, och benchmark-genomgången för hela resultatkortet inklusive vad som har ändrats från Qwen3.6-27B. Den här sidan håller sig till själva modellen.

Qwen3.8-27B i vår katalog

Två kort är live på OrcaRouter idag, sida vid sida, och båda lästes om den 2026-09-28 innan detta stycke skrevs. qwen/qwen3.8-27b listas till $0,33 per miljon indatatokens och $2,40 per miljon utdatatokens med det fulla fönstret på 262 144 tokens, text-, bild- och videoinmatning, och resonemang, verktyg, strukturerad utdata och JSON-gränssnitt exponerade som parametrar. Dess syskonmodell obsidian/Qwen3.8-27B — samma vikter som serveras i block-FP8 med visionstornet bevarat i full precision, och, med kortets egna ord, ”utformad för att ge direkta, fullständiga svar över ett brett spektrum av promptar” — listas till $0,40 in och $4,21 ut. Båda svarar på chat completions och Responses API, så att ett jobb för dokumenttolkning eller skärmbild kan riktas mot endera modellen under en och samma nyckel och en och samma endpoint, utan ett andra avtal och utan kodändring.

För att sätta det i perspektiv: vår egen playground har under de senaste sju dagarna skickat 105,1 miljoner tokens genom qwen/qwen3.8-27b, med en median på 3,8 sekunder till första byte och en felfrekvens på 3,3 % under samma period. Det är våra serveringssiffror, inte ett omdöme om modellen.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing a 262K-token context window, text, image and video input, text output, the vision, tools, JSON and reasoning badges, a 3.80-second p50 time to first token, 105.1M tokens served in seven days, and list pricing of $0.33 per million input tokens and $2.40 per million output tokens.

Sökningarna som leder hit

Efterfrågan bakom den här sidan är utspridd och ligger precis utanför klicket. Under de 28 dagarna fram till 2026-09-25 fick vår webbplats 8 931 visningar och 273 klick fördelade över 69 distinkta exakta stavningar av modellens namn – "qwen3.8 27b", "qwen3.8-27b", "qwen 3.8 27b" och dussintals andra sätt att skriva samma tre token. Vår bästa position för de största stavningarna låg mellan 9,0 och 10,6. Det är positioner vi råkade hålla tack vare andra sidor, vilket är precis det problem en kanonisk sida löser: på nionde plats finns du på sidan, och ingen klickar. Den enda platsen där trafiken konverterar är icke-engelska – en ryskspråkig stavning av namnet ligger på position 1,8 för oss och konverterar till 14,4 %.

Inget av det är bevis om modellen. Det är bevis om vad människor skriver, och det är därför sidan finns.

Vad det hela summerar till: en 27B tät checkpoint med en genuint ovanlig attention-layout, en tillåtande licens, inbyggd videoförståelse, Apache-2.0-villkor som låter dig släppa ett derivat, en oberoende kodningsplacering i den översta fjärdedelen av vad Artificial Analysis mäter, och en leverantörstabell som är stark mot sin föregångare och blandad mot frontlinjen. Den öppna frågan är den som ingen utanför Alibaba ännu kan besvara — hur den hostade 1M-token-vägen beter sig i produktion, och om Flash-Next-arkitekturen landar i en modell av den här storleken.

Kärnan 2.4T-A95B bakom Qwen3.8-Max finns nu i samma katalog: qwen/qwen3.8-max för $2.00 / $6.00 per miljon tokens, om 27B inte är den storlek du behöver.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen