Hero-titelkort för Qwen3.8-27B-recensionen, med titeln 'Qwen3.8-27B Review' och underrubriken 'Den open-weight-27B-modell som är Opus hemma — testad mot hypen', som visar ett open-weights-märke, ett Apache 2.0-märke och en ikonuppsättning för GPU och server på en ren vit bakgrund med mjuka blå gradientaccenter.
Guides & Insights

Qwen3.8-27B-recension: den open-weight 27B:n som är "Opus at home" — testad mot hypen

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Qwen3.8 27Bär den bästa 27B-modellen med öppna vikter som du kan självhosta just nu, och det är inte särskilt nära. Vikterna släpptes den 14 augusti 2026 under Apache 2.0: en tät 27B (28B om man räknar visionskodaren) med 262K nativ kontext, nativ bild- och videoinmatning, och leverantörsrapporterade poäng för agentisk kodning som ligger på eller över Cla​ude Opus 4.6 Max — SWE-bench Pro 61.7, DeepSWE 1.1 42.2, LiveCodeBench v6 90.3. Huvudpriset är noll: ladda ner 55.6 GB och kör den. Förbehållen är också reella — oberoende tester visar att den är ungefär tre gånger långsammare och mer tokenhungrig än föregångaren, alla benchmarks på kortet är fortfarande Ali​baba-rapporterade, och 1M-kontexten är en funktion som bara finns i den hostade versionen. Slutsats: om du har ett 24 GB+-grafikkort och vill ha kapacitet nära frontlinjen utan en mätad räkning, självhosta den — men gå in med vetskapen om exakt var siffrorna är svaga.

Slutsats först: bör du använda Qwen3.8 27B?

Kort svar — ja för lokala och privata arbetsbelastningar; vänta på tredjepartssiffror innan ett upphandlingsbeslut. Qwen3.8 27Bär den sällsynta modellen där de öppna vikterna är produkten och API:et är bekvämligheten. Eftersom licensen är Apache 2.0 är priset per token permanent noll när du väl har hårdvaran, och inget du bygger på den kan omlicensieras eller faktureras retroaktivt. Det du ger upp är hastighet, verifiering och bekvämlighet.

Om du redan kör Qwen3.6-27B och är nöjd med den, är uppgraderingen verklig men inte gratis mätt i faktisk tid. Om du kom hit från Qwen3.8-Max-lanseringen är detta den mindre, självhostningsbara medlemmen av samma generation — ett annat verktyg för en annan uppgift.

De snabba fakta, kontrollerade den 15 augusti 2026

Släppt — vikterna publicerades den 14 augusti 2026 på Qwen/Qwen3.8-27B på Hugging Face, speglade på ModelScope; tidszonsbaserad täckning nämner också 13 augusti, och releasen kom ungefär en vecka efter att Qwen3.8-generationen tillkännagavs.

Licens — Apache 2.0: nedladdning, modifiering, omdistribution, kommersiell användning, med uttrycklig patentlicens. Permanent.

Parametrar — 27B dense (28B räknat med vision-encodern), 64 lager, dold storlek 5 120, vokabulär 248 320.

Arkitektur — hybrid uppmärksamhet: 48 Gated DeltaNet-lager för linjär uppmärksamhet jämfört med 16 fullständiga Gated Attention-lager (en 3:1-fördelning). Det är därför en 27B dense-modell kan hantera 262K tokens av inbyggd kontext.

Kontext — 262 144 token nativt; utökningsbar till 1 000 000 via YaRN i den hostade versionen.

Input — native image and video alongside text; returns text. The vision encoder is why the parameter count reads 28B.

Tänkande — resoneringsläge på som standard och avaktiverbart per begäran; reasoning_effort (låg/medel/hög) och preserve_thinking för långa agentkörningar.

Vikter — 55,6 GB av BF16-safetensors i 18 shards; FP8 och community-GGUFs levereras också.

Specifikationerna ovan kommer från Hugging Face-modellkortet och konfigurationen för Qwen3.8 27B, lästa idag. Benchmark-påståendena är rapporterade av Ali​baba; hittills har inget oberoende labb replikerat dem.

Vad Qwen3.8 27B är genuint bra på

Det starkaste fallet är agentisk mjukvaruutveckling. Alibaba rapporterar en 3x ökning på DeepSWE 1.1 jämfört med den tidigare 27B (42,2 mot 13,3) och en poäng över Claude Opus 4.6 Max på SWE-bench Pro (61,7 mot 53,4). Det är de siffrorna som gav den smeknamnet "Opus at home" — en tät 27B som utför frontiärnära kodningsarbete på hårdvara en person faktiskt kan äga.

Benchmark scoreboard card comparing Qwen3.8-27B with Qwen3.6-27B and Claude Opus 4.6 Max: SWE-bench Pro 61.7 vs 53.5 vs 53.4; DeepSWE 1.1 42.2 vs 13.3 vs n/a; LiveCodeBench v6 90.3 vs 83.9 vs 88.8; Terminal Bench 2.1 73.0 vs 63.4 vs 78.2; GPQA Diamond 89.2 vs 87.8 vs 91.3; OSWorld-Verified 84.3 vs 63.9 vs 72.7; QwenSWEBench 79.0 vs 49.3 vs 63.8; CoWorkBench 70.7 vs 61.0 vs 68.2. Footer: all figures Alibaba-reported, not yet independently reproduced.

Tre saker förutom de råa siffrorna gör det till ett försvarbart köp:

Inbyggt multimodalt. Bild och video in, text ut — ett dokument med diagram eller en videogenomgång är inte en separat modell. De visuella resonemangspoängen (85,6 med aktiverad tankekedjefunktion, 94,6 visuell matematik, båda leverantörsrapporterade) är där visionskodaren gör skäl för sin plats.

262K inbyggd kontext. Långsiktiga agentuppgifter, stora kodbaser och flera timmar långa transkript får plats i ett enda fönster. Den hybrida designen med linjär uppmärksamhet håller KV-kostnaden för den kontexten lägre än en ren full-uppmärksamhetsmodell av samma storlek.

Gratis, permanenta vikter. Detta är hela poängen med kategorin: en sluten API-modell hyrs; Qwen3.8 27B ägs. Vid 4-bitars körs det på ett 24 GB-kort (RTX 3090/4090-klass), och AMD levererade Day-0-stöd (upp till 24,5 tokens/s på en Ryzen AI Max+ 395 och 51,8 tokens/s på en Radeon AI PRO R9700, enligt AMDs egen blogg).

Där granskningen blir obehaglig: hastighet, tokens och verifiering

Oberoende testning hittills är en testares testrigg, inte ett labb — men det är den bästa signalen vi har. Vid körningen av Qwen3.8 27B mot Qwen3.6-27B på tio verkliga uppgifter (bedömda av GPT-5.5 via llmcompare-testriggen), vann 3.8:an nio av tio och fick 8.838 mot 6.862 i genomsnitt — "en av de mer imponerande intelligenslyften" som testaren hade sett. Den använde också nästan tre gånger så många tokens och var betydligt långsammare; en uppgift tog cirka 600% längre tid. Så kvalitetshoppet är verkligt, och detsamma gäller priset i faktisk tid.

Fyra saker till att hålla emot det:

Inga tredjepartsbenchmarks ännu. Varje rubriksiffra i den här artikeln är Ali​baba-rapporterad per den 15 augusti. Leverantörskortet är detaljerat, men reproducering av ett oberoende labb har inte skett. Om ditt beslut beror på verifierade siffror, vänta på dem — vikterna kommer fortfarande att finnas kvar.

VRAM-golvet är på riktigt. BF16 kräver ett GPU i 80 GB-klassen. För att få plats på ett 24 GB-kort måste du köra 4-bitars, och community-rapporter (en kommentartråd på dev.to, dagar efter lanseringen) säger att kvantiserade versioner "tappar fokus efter lång kontext." Officiella vikter om du har VRAM; kvantiserade om du inte har det.

1M-kontexten finns endast i den värdbaserade versionen. De öppna vikterna har ett tak på 262K. Möjligheten att utöka till 1M är en värdbaserad funktion i Qwen Cloud, inte något som en lokal kopia gör direkt ur lådan.

"Beats Opus" behöver kvalificeringar.Agentiska benchmarks belönar harness-specifika beteenden, och en toppkommentar på dev.to-lanseringsinlägget uttryckte det rakt på sak: "de slår inte opus i verklig användning." Behandla poängtavlan som en övre gräns en bra dag, inte ett löfte.

Hur den passar in i Qwe​n 3.8-familjen

jämfört med Qwen3.6-27B — samma hårdvaruklass och 262K kontext, men ett stort kapacitetshopp på bekostnad av hastighet och tokeneffektivitet. Om du redan kör 3.6 och är genomströmningsbegränsad, är det försvarbart att stanna kvar.

vs Qwen3-Coder-30B-A3B — Coder är en MoE med cirka 3,3 miljarder aktiva parametrar som kör mycket snabbare (~90–110 tokens/s). Den täta 27B-modellen är långsammare per token men ärver generationens agentiska fördelar; om 27B:ns programvaruutvecklingsresultat håller vid oberoende testning, krymper Coder-30B:s roll.

jämfört med Qwen3.8-Max — 2.4T MoE-flaggskeppet är en datacentermodell (endast API, cirka $2/$6 per miljon tokens enligt publicerade uppgifter) med 1M kontext och video. 27B är den som kan driftsättas. De svarar på olika frågor.

Kostnad: frågan om lokalt kontra API, avgjord.

För en sluten modell jämför du priser per token. För Qwen3.8 27B kostar marginaltoken ingenting på din egen hårdvara — det verkliga priset är den initiala GPU-investeringen och din tid. Vid 4-bit är det ett 24 GB-kort; vid BF16 är det en maskin i 80 GB-klass. Om du bara behöver utvärdera modellen, eller saknar hårdvaran, finns det värdbaserade alternativet: OrcaRouter listar nu Qwen3.8 27B med en gratis, taktbegränsad nivå som debiterar $0 och returnerar HTTP 429 när taket överskrids, plus en betald nivå på $0,33 per miljon inmatningstoken och $2,40 per miljon utmatningstoken (kontrollerat den 15 augusti). Qwen Clouds värdbaserade version, med 1M-kontext, är markerad som "kommer snart."

Cost comparison card for Qwen3.8-27B titled 'Self-host vs hosted — the real price': Apache 2.0 weights at $0 license plus your own GPU and electricity; a 4-bit GGUF of roughly 17 GB that fits a 24 GB card; BF16 at 55.6 GB needing an 80 GB-class GPU; a free rate-limited hosted tier at $0 with HTTP 429 past the cap; and a paid hosted tier at $0.33 input / $2.40 output per million tokens with a 262K context window. Footer: prices from the OrcaRouter model page, read August 15, 2026.

Det ärliga perspektivet: för en modell med öppna vikter är en leverantör en bekvämlighet, inte ett beroende. Gratisnivån är det billigaste sättet att avgöra om en nedladdning på 55,6 GB är värd det. Men när du väl har bestämt dig är vikterna det viktiga – och de är gratis.

Hur du faktiskt provar det

Snabbaste utvärderingen — använd den kostnadsfria hastighetsbegränsade värdtjänsten; om den svarar på det du behöver är du klar och det kostar ingenting.

Verkligt test på din hårdvara — ladda ner en community-GGUF (Q4_K_M-bygget är cirka 17 GB och passar på ett 24 GB-kort) och kör den i llama.cpp eller Ollama. Skicka Jinja-chattmallen, annars svarar modellen dig i thought-taggar. För vision från en GGUF behöver du också den separata mmproj-filen. Vår runbook för att köra Qwen3.8 27B lokalt går igenom det hela.

Full precision — huggingface-cli download Qwen/Qwen3.8-27B till en GPU i 80 GB-klassen.

Verifiera vad du laddade ner — kontrollera att utgivaren är Qwe​n-organisationen och validera shards mot crc32.txt; lookalike-repon har dykt upp före releasen.

När denna recension är fel (och vem som bör hoppa över Qwen3.8 27B)

Du har ingen GPU och kommer inte att hyra en. Gratisnivån är hastighetsbegränsad och betalnivån kostar $0,33/$2,40 per miljon — en liten API-modell kan betjäna dig billigare och mer tillförlitligt. Den här modellen är för människor som vill äga inferensen.

Du behöver ett SLA. Den värdbaserade nivån är bara dagar gammal; modellsidan för OrcaRouter, läst idag, visar en felfrekvens på 33,3 % över de senaste sju dagarna och en p50-latens för första token på 225 ms. Det är en helt ny modell under tidig belastning, inte ett produktionsavtal. Den som själv hostar bör låsa sin nedladdningscommit och ha en fallback.

Du behöver verifierade riktmärken för ett inköpsbeslut. Leverantörsrapporterade siffror är vägledande, inte upphandlingsklassade. Vänta på oberoende reproduktion.

262K open-weights-kontext räcker inte. 1M-förlängningen är endast värdbaserad idag.

Genomströmningen är din flaskhals.Bulksammanfattning eller stora batchar kommer att bli ett problem: detta är en tät 27B som också förbrukar ungefär 3x så många token jämfört med sin föregångare. För billigt bulkarbete vinner en mindre eller snabbare modell.

Du har ett 12 GB-kort. 2-bit GGUFs får plats med synlig kvalitetsförlust; det här är inte modellen för dig.

Verdict infographic titled 'Use it if / Skip it if' for Qwen3.8-27B: left lane in soft blue labeled 'Use it if' with three items — '24 GB GPU', 'Free Apache 2.0 weights', '262K context + image/video'; right lane in soft gray labeled 'Skip it if' with three items — 'No GPU', 'Need an SLA', 'Need verified benchmarks'.

Slutsatsen

Qwen3.8 27B är den starkaste 27B-modellen med öppna vikter som finns idag, och den är gratis för alltid under Apache 2.0. Om du har ett GPU med 24 GB+ och vill ha agentisk kodning, 262K kontext och inbyggd bild-/videoinmatning utan en mätad nota, så är det här rätt köp. Skälen att avvakta är lika konkreta: du behöver oberoende benchmarkbekräftelse, ett SLA, mer än 262K kontext med öppna vikter, eller högre genomströmning än vad en tät 27B ger dig. Modellen är ute, vikterna är verkliga och siffrorna är bra – kom bara ihåg vems siffror det är.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube