
Qwen3.8-27B för kodning: Vad du kan förvänta dig innan vikterna släpps
- obsidianNYQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1M tokens
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenNYQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 2401 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
Om du kör lokala modeller för kodning är den siffra som betyder mest från Alibabas lansering av Qwen3.8 den 3 augusti 2026 inte Qwen3.8-Max:s rubriksiffra på 2,4 biljoner parametrar — det är FrontierSWE-poängen som steg från 40,7 i föregående generation till 73,5 i den här. Det hoppet skedde i flaggskeppsmodellen. Modellen som kan föra en del av det vidare till din egen hårdvara är Qwen3.8-27B, den ungefär 27-miljarder-parameter stora modellen med öppna vikter i Qwen3.8-generationen, som tillkännagavs samma dag och ännu inte går att ladda ner när detta skrivs. Detta är en text om vad vi vet hittills, inte en recension: ingen utanför Alibabas labb har kört Qwen3.8-27B ännu, det finns inget officiellt modellkort, och alla nedladdningar som just nu påstår sig vara den är en platshållare eller en uppladdning från tredje part.
Här är den ärliga utgångspunkten för alla som planerar en lokal kodningsuppsättning kring 27B: flaggskeppets förbättringar är leverantörsrapporterade tills oberoende tester landar, 27B:s egna specifikationer är obekräftade, och det enda vi kan mäta idag är dess föregångare Qwen3.6-27B — som redan var en av de bästa lokala kodningsmodellerna 2026. Det är den baslinje som denna generation måste slå, och den är hög.
Varför 27B är modellen som kodare faktiskt bryr sig om
Qwen3.8-Max är en datacenter-modell: en mixture-of-experts med 2,4 biljoner parametrar och ungefär 95 miljarder aktiva parametrar, ett kontextfönster på 1M token, och ingen konsumentväg för att köra den lokalt. Qwen3.8-27B är den motsatta satsningen — en öppen viktmodell i 27B-klassen anpassad för ett enda GPU, positionerad som generationens självhostningsbara release. För utvecklarpubliken är 27B produkten. Max är beviset på att generationens träning faktiskt åstadkom något.
Vad detta "något" är, enligt Alibabas egna utvärderingar: Terminal-Bench 2.1 på 86,6 (upp från 74,5 för Qwen 3.7 Max), SWE-bench Pro på 67,7, PaperBench på 93,0 och FrontierSWE-hoppet från 40,7 till 73,5 som signalerar en stegförändring inom agentisk kodning över långa tidshorisonter — modellen arbetar autonomt igenom flerstegsuppgifter i koddatabaser snarare än att svara på enskilda promptar. Oberoende mätningar placerar Qwen3.8-Max på ett Artificial Analysis Coding-index på 71,8 och Intelligence-index på 58,1, så förbättringen är verklig även när man rensar bort Alibabas marknadsföring. Inga av dessa siffror överförs direkt till 27B. Men de är anledningen till att 27B är den mest efterlängtade lokala kodningsmodellen under andra halvan av 2026: en mindre modell som ärver ens en bråkdel av den agentiska förbättringen skulle omdefiniera vad "bra lokal kodning" innebär i 27B-skala.

Föregångaren satte ribban: Qwen3.6-27B
Qwen3.6-27B är modellen som varje projektion för 3.8 27B bygger på, eftersom den är av samma klass och samma fysik. Det är en 27B dense-modell med en inbyggd kontext på 262K, dubbla tanke- och icke-tankelägen, inbyggd inmatning av text, bild och video, samt en Apache 2.0-licens. Den fick sitt rykte som lokal kodare inte genom att vinna varje benchmark utan genom att vara den största modellen som fortfarande fick plats i en konsument-GPU med användbar kvalitet – punkten på storlek/kvalitetskurvan där du slutar byta kapacitet mot hårdvara.
Det är kontextfönstret på 3.8-27B: det måste vara minst lika bra som 3.6-27B till samma hårdvarukostnad, och helst bättre på agentiskt arbete, eftersom det är den enda ärliga anledningen att byta. Om det matchar 3.6 på ren kodning och lägger till generationens agentiska förbättringar, blir det det självklara lokala valet. Om det bara kör om samma poäng, är uppgraderingen marginell.
Hårdvarans verklighet: 16 GB är fel fråga.
Eftersom det inte finns några officiella specifikationer kommer VRAM-uppskattningarna från mätningar på Qwen3.6-27B, och den ärliga sammanfattningen är att 4-bitarskvantisering är ett 24 GB-spel, inte ett 16 GB-sådant. Vid Q4_K_M är vikterna ungefär 16–17 GB, vilket låter som att ett 16 GB-kort klarar det – tills KV-cachen och modellens overhead driver det faktiska behovet till cirka 20–24 GB. Den praktiska vägledningen från Alibaba Clouds egen text är kärnfull: Q4_K_M får inte plats på en 16 GB-GPU i verklig användning. Communitysiffror kretsar kring:
• Q3_K_M — ~13 GB vikter, passar 12–16 GB-kort med reducerad kvalitet
• Q4_K_M — ~16–17 GB vikter, realistiskt 20–24 GB med kontext — sweet spot för RTX 3090/4090
• Q6_K — ~21–22 GB, nästan förlustfri på 24 GB-grafikkort
• Q8_0 — ~28,6 GB, kräver 32 GB
• BF16 full precision — ~54–56 GB, utom räckhåll för alla konsument-GPU:er
Unsloth förhandsvisade en 4-bitars build som kördes på ungefär 17 GB, vilket överensstämmer med en ~27B-modell i 4-bit — betrakta det som golvet för en nedskalad arbetsbelastning utan kontext, inte som ditt produktionsnummer. Om du planerar hårdvara, planera runt ett 24 GB-kort.
Verktygskedja: vad som lanseras dag ett jämfört med vecka två
När vikterna släpps kommer stödet inte på en gång. Servingsmotorerna vLLM och SGLang lägger vanligtvis till stöd inom dagar efter en Alibaba-release, vilket är hur självhostare snabbt får en OpenAI-kompatibel endpoint. Communityns GGUF- och AWQ-kvantiseringar släpar efter med en till två veckor, vilket innebär att "pull and run"-upplevelsen via verktyg baserade på llama.cpp (Ollama, LM Studio) kommer att hamna efter de råa vikterna – och om 27B delar en genuint ny arkitektur med Max snarare än att återanvända 3.6-layouten, förvänta dig att verktygen tar längre tid. Under de första en eller två veckorna kommer den snabbaste vägen att vara vLLM på de okvantiserade vikterna, inte ett enda pull-kommando.

Vad en 27B faktiskt kan göra för agentiskt arbete
Sätt förväntningen rätt: den 16-dagars autonoma demon — Alibabas Qwen3.8 som bygger en självutvecklande agentsele över hundratals commits utan mänsklig inblandning — är ett flaggskeppsexempel. En 27B kommer inte att klara det. Vad en 27B-klass lokal kodare bevisligen gör bra, baserat på communityns erfarenhet med Qwen3.6-27B och Qwen3-Coder-30B-A3B:
• Grooma och triagera ärenden, identifiera grundorsaker och lägg grunden för att en starkare modell avslutar.
• Hantera refaktoreringar i repositorieskala och verktygsanropsloopar med interaktiv hastighet
• Kör din dagliga kodningsvolym lokalt — data finns kvar på din maskin, kostnaden är fast
• Upprätthåll en ~50/50 träffsäkerhet när det gäller att helt åtgärda en verkligt komplex bugg – tillräckligt bra för att vara användbar, inte tillräckligt tillförlitlig för att vara din enda agent.
27B är en volymmodell med en bedömningssvans. Den kommer att vara utmärkt i den högvolymmässiga mitten av din arbetsbelastning och ha fel på de svåraste tio procenten. Det är inte en brist; det är designen.
Bygg runt det: dela upp trafiken
Det upplägg som de flesta team landar i är en uppdelning: den lokala 27B-modellen hanterar volymen — rutinmässig generering, boilerplate, refaktoreringar, lint-liknande fixar — och en värdbaserad frontier-modell hanterar den svåra svansen där några extra kvalitetspoäng rättfärdigar API-kostnaden. Det rena sättet att genomföra den uppdelningen är genom en router, eftersom de två sidorna har olika felfrekvenser och du vill inte att din agentpipeline fastnar på en lokal flaskhals eller en leverantörsstörning.
Det är arbetsflödet som OrcaRouter är byggt för. Qwen3.8-Max är live där till leverantörens listpris — 2 dollar per miljon inmatningstoken, 6 dollar per miljon utdatatoken — vidarebefordrat utan påslag, så när Alibaba sänker priset sänks din faktura samma dag. Du pekar en OpenAI-kompatibel slutpunkt mot splitten, dirigerar den svåra svansen till Qwen3.8-Max, behåller den lokala 27B-modellen för volym när dess vikter väl landar, och låter automatisk redundans fånga upp en långsam eller felande leverantör utan en kodändring. Du utvärderar 27B-modellen på din egen hårdvara medan din produktionsväg förblir live — modellen som ännu inte har bevisats blir aldrig en enda felkälla.

Vad du ska kontrollera den dag vikterna släpps.
När det officiella arkivet dyker upp på Hugging Face eller ModelScope, verifiera följande innan du bygger något på det:
• Repot ligger i den officiella Qwen-organisationen — inte en mirror eller namnsquatter.
• LICENSE-filen finns faktiskt på plats och matchar licensen som versionsinformationen anger.
• Modellkortet anger kontextfönstret, arkitekturen (tät eller MoE) och tankelägen.
• Första oberoende körningar dyker upp på Terminal-Bench eller Artificial Analysis — leverantörspåståenden förblir leverantörspåståenden tills dess
• GGUF-stöd landar i llama.cpp och din favoritlokala runtime
När det gäller den sista punkten gäller disciplinen från tidigare: tills en oberoende körning bekräftar kodvinsterna, behandla det från FrontierSWE ärvda löftet som skälet att testa, inte skälet att leverera.
Förväntningen, rättvist formulerad: Qwen3.8-27B är den mest lovande lokala kodningsutgåvan 2026 på pappret — en beprövad 27B-baslinje plus en generation av agentiska träningsvinster, till en hårdvarukostnad som communityn redan är van vid att betala. Huruvida den levererar beror på vad vikterna faktiskt innehåller. Håll koll på det officiella repot, läs licensen och låt det första oberoende benchmarktestet avgöra. Tills dess håller Qwen3.6-27B stolen varm, och en dirigerad värdbaserad flaggskeppsmodell hanterar den tunga svansen.
