En titelbild för artikeln Qwen3.8-27B på Ollama, som visar ett minimalistiskt terminalfönster med kommandot 'ollama run qwen3.8:27b' och en blinkande markör, tre märken med texten '18 GB nedladdning', 'Q4_K_M som standard' och '262K kontext', samt bildtexten 'gratis att köra, din hårdvara'.
Guides & Insights

Qwen3.8-27B på Ollama: Ett kommando, fyra kvantiseringar, och vad "gratis" egentligen kostar

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Kör det med ett enda kommando: ollama run qwen3.8:27b. Det är hela svaret på frågan som den här sidan handlar om. Qwen3.8 27B — Ali​babas täta modell med 27 miljarder parametrar, vars vikter släpptes den 14 augusti 2026 under Apache 2.0 — gick live i Ollama-biblioteket den här veckan, och standardbygget är redan en vettig 18 GB Q4_K_M-kvantisering (17 GB vikter plus en 931 MB vision-encoder). Den kör helt på en 24 GB GPU vid normala kontextlängder, delas upp till CPU om ditt grafikkort är mindre, och kostar ingenting per token.

Allt här är daterat till den 15 augusti 2026. Specifikationerna kommer från Qwen3.8 27B-modellkortet; nedladdningsstorlekar, taggar och nedladdningsantal kommer från den live Ollama-bibliotekssidan; benchmarksiffrorna är Ali​baba-rapporterade och har ännu inte oberoende replikerats. Modellen släpptes för några dagar sedan, så behandla allt som kan ändras som preliminärt.

One-linern som faktiskt fungerar

Om du redan har Ollama installerat, är du två ord bort:

ollama run qwen3.8:27b

Ollama-stöd kom i v0.32.12 — versionsmeddelandet säger helt enkelt: "Den här versionen lägger till stöd för Qwe​n 3.8 27B." Första körningen laddar ner standardbygget (cirka 18 GB, Q4_K_M) och öppnar sedan en chatt-REPL med tankeläge aktiverat som standard. Bibliotekssidan listar bygget med kapabilitetstaggarna "vision tools thinking 27b", vilket är så du vet att vision- och verktygsanropsvägarna är kopplade till samma nedladdning. I skrivande stund visar sidan fler än 40 000 nedladdningar och en taglista som redan omfattar elva varianter.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

Två varianter som du faktiskt kommer att sträcka dig efter:

• ollama run qwen3.8:27b-mlx — Apple Silicon-versionen, samma 18 GB-fotavtryck men kompilerad för Metal; det är den som Ollamas versionsinformation specifikt optimerar "för maximal prestanda och utskriftskvalitet lämplig för upprepade uppgifter och kodningsagenter."

• ollama run qwen3.8:27b-q8_0 — en 30 GB 8-bitars kvantisering, för när du har VRAM och vill ha vikterna närmare full precision.

Vad du faktiskt laddar ner

Namnet säger 27B, men det totala antalet parametrar är 28B: en 27,3B tät språkmodell plus en 461M vision-encoder som ger den inbyggd bild- och videoinmatning. Resten av huvudspecifikationen, direkt från modellkortet:

• 64 lager, dold storlek 5,120, vokabulär 248,320.

• Hybrid attention: 16 fulla Gated Attention-lager och 48 linjära Gated DeltaNet-lager — en 3:1 mager-linjär mix, och anledningen till att en 27B kan hålla ett nativt sammanhang på 262 144 token (utökbart till 1M) utan att KV-cachen slukar ett helt datacenter.

• Inbyggd bild- och videoförståelse — ”från STEM-diagram och dokument till timslånga videor” är Ali​babas formulering.

• Apache 2.0. Ladda ner det, modifiera det, sälj en produkt baserad på det. Den licensen är det juridiska faktum som resten av den här artikelns ekonomi hänger på.

Referensen med full precision är BF16, vilket är anledningen till att 56 GB-taggarna finns; varje mindre tagg är en avvägning mellan precision och fotavtryck, och modellkortets egna riktmärken är det du väger mot.

Välj en kvantisering, kontrollera sedan ditt VRAM, inte tvärtom.

Ollama ger dig elva taggar, men beslutet krymper till tre storlekar.

18 GB — Q4_K_M (standard). Ryms helt på ett 24 GB-kort (RTX 4090 / 5090-klass) vid normal kontext och på 16 GB-kort med delvis CPU-avlastning — långsammare, men det fungerar. Det här är bygget för "bara kör".

30 GB — Q8_0. Vikterna ligger nära full precision och kräver ungefär 40 GB VRAM för att hållas helt på GPU:n. På en 27B bör du redan veta varför du vill ha den extra precisionen innan du betalar för den.

56 GB — BF16.Referensversionen. Kräver H100-klass eller 96 GB hårdvara. Ingen kör det här på en konsument-GPU, och det är okej.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

Det som många snubblar på är KV-cachen. Att nedladdningen är 18 GB betyder inte att 18 GB VRAM räcker för en session med 262K-kontext — vid lång kontext tillkommer flera gigabyte utöver vikterna, vilket är anledningen till att ett 24 GB-kort rymmer modellen bekvämt vid 8K–32K kontext men inte vid 262K. På ett kort som ligger på gränsen, minska kontexten, inte kvantiseringen.

Apple Silicon är ett förstklassigt mål här.

Ollamas v0.32.12-versionsinformation nämner macOS specifikt. Konkret kräver `ollama run qwen3.8:27b-mlx` cirka 18 GB enhetligt minne, så en Mac med 24 GB eller mer kör modellen helt på GPU:n med marginal för kontext. Det finns också en 32 GB mxfp8 MLX-tagg och en 56 GB mlx-bf16-tagg för maskinerna med 64–128 GB. Om din M-serie Mac har följt nyheterna om desktopmodellerna är detta den bygge du har väntat på.

Sammanhang: 262K på specifikationsbladet, mindre i sadeln

Modellkortet listar 262,144 inbyggda tokens, utökningsbart till 1M; Ollamas bibliotekssida rapporterar samma fönster som 256K. Båda stämmer — 262,144 är 256K gånger 1024 — och ingen av dem innebär att du ska skriva in det numret i --num-ctx på ett 24 GB-kort. KV-cachen växer ungefär linjärt med kontexten, så på konsumenthårdvara lever du på 16K–64K, inte 262K. Börja med Ollamas standard, höj --num-ctx bara när en uppgift faktiskt kräver det, och kom ihåg att 1M-siffran kräver utökningsmekanismerna plus VRAM för att mata den.

Vad som fortfarande är ostadigt — läs detta innan du satsar på det

Inga oberoende riktmärken ännu. Alla siffror på modellkortet är Ali​babas ord från och med den 15 augusti. De påstådda förbättringarna jämfört med Qwen3.6-27B är stora — SWE-bench Pro 61.7 vs 53.5, Terminal Bench 2.1 73.0 vs 63.4, LiveCodeBench v6 90.3 vs 83.9, GPQA Diamond 89.2 vs 87.8 — och de verkar alla rimliga, och ingen av dem har reproducerats av en extern testmiljö. Basera inte ett produktionsbeslut enbart på dem.

Visionsstacken är bara dagar gammal. En tidig buggrapport (ollama issue #17753) visade att Q4-bygget dirigerade visionsinmatningen genom Qwen3.5-parsern och misslyckades med bilder; det fixades inom några dagar i PR #17755, men den multimodala vägen på en veckogammal modell är precis där du bör testa innan du litar på den.

Standardbygget inkluderar MTP. q4_K_M-taggen är också multi-token-prediktionsbygget — snabbare avkodning, och anledningen till att "18 GB" och "27B" kan samexistera utan motsägelse.

Quant-etiketter kan vilseleda på Apple.De 18 GB "mlx"- och "nvfp4"-taggarna skiljer sig åt i kvantisering — NVFP4 är ett NVIDIA FP4-format — så på en Mac föredrar du det vanliga -mlx-bygget om du inte specifikt behöver en FP8/FP4-variant för ett Blackwell-GPU.

"Free" gör en hel del arbete i den rubriken.

Att självhosta en 27B är gratis per token, men det är inte gratis. Det ärliga perspektivet är tre alternativ som kostar olika valutor:

Kör det själv (Ollama). $0 per token, offline, obegränsat, privat — och hårdvaran är din. Ett 24 GB GPU-kort eller en Mac med 18 GB+ är en rejäl investering, liksom elen och installationstiden. Detta är rätt val när Qwen3.8 27B blir ett dagligt verktyg.

Anropa ett API med $0-pris och hastighetsbegränsning. OrcaRouter tillhandahåller Qwen3.8 27B på egen infrastruktur utan kostnad (modell-ID qwen/qwen3.8-27b-free, $0 per begäran, hastighetsbegränsad) — eftersom vikterna är öppna finns det ingen per-token-leverantörskostnad att föra vidare. Detta är rätt val när du vill prova modellen utan att köpa hårdvara för att testa en vecka gammal version.

Anropa ett obegränsat API. Samma modell utan anropsbegränsningen kostar $0,33 per miljon input-tokens och $2,40 per miljon output på OrcaRouter (qwen/qwen3.8-27b, 262K kontext, text-, bild- och videoinput). Detta är rätt val när du behöver produktionsskala och inte vill passa en GPU.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

Matematiken som avgör mellan dem: tillfällig användning lönar sig bättre vid $0 eller vid $0,33/$2,40 än till priset av en GPU; daglig interaktiv användning är billigare lokalt; kontinuerlig produktionsgenomströmning är billigast som ett API som du inte behöver hålla vid liv. Sekretess- och offlinekrav flyttar dig till första kolumnen oavsett vad matematiken säger.

När denna rekommendation är fel

Du behöver verkligen 100K+ kontext. Modellen klarar det; ditt 24 GB-kort kan inte. Vid riktigt lång kontext är ett 40 GB+-grafikkort eller ett API med längre kontext ingen lyx.

Du behöver video i produktion idag. Synvägen fick precis sin parserbugg åtgärdad; produktionsvideo på en veckogammal multimodal modell är ett vad du inte bör lägga utan en fallback.

Du vill ha samtidighet. En konsument-GPU klarar en eller två generationer åt gången. En 27B är inte en serveringsmaskin.

Du kör på hårdvara utan GPU. En 27B med 4-bit på CPU är en långsam demonstration, inte ett verktyg. Ett API är det ärliga valet tills du har en GPU.

Slutsatsen

Qwen3.8 27B på Ollama är det enklaste sättet att köra en 27B av nuvarande generation som någon har släppt hittills: ett kommando, en standard på 18 GB som ryms på ett 24 GB-kort, ett förstklassigt Apple Silicon-bygge och Apache 2.0-frihet. Kvantiseringen du bör välja är nästan alltid standardinställningen Q4_K_M — gå över till q8_0 bara när du kan mäta skillnaden. Och ”gratis” är villkorat: om du rör modellen då och då, är det $0 rate-begränsade API:et friare än att köpa hårdvara; om den blir något du använder dagligen, är den lokala kopian det billigaste du äger. Verifiera siffrorna innan du bygger på dem — allt i den här artikeln var sant den 15 augusti 2026, och den här modellen förändras dag för dag.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube