Een titelkaart voor het artikel Qwen3.8-27B over Ollama, met een minimalistisch terminalvenster met het commando 'ollama run qwen3.8:27b' en een knipperende cursor, drie badges met de tekst '18 GB download', 'Q4_K_M default' en '262K context', en het bijschrift 'gratis te draaien, jouw hardware'.
Guides & Insights

Qwen3.8-27B op Ollama: één commando, vier quants, en wat "gratis" echt kost

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Draai het met één commando: ollama run qwen3.8:27b. Dat is het hele antwoord op de vraag waar deze pagina over gaat. Qwen3.8 27B — Ali​baba's dichte model met 27 miljard parameters, waarvan de gewichten op 14 augustus 2026 onder Apache 2.0 zijn vrijgegeven — is deze week live gegaan in de Ollama-bibliotheek, en de standaardbuild is al een verstandige 18 GB Q4_K_M-kwantisatie (17 GB aan gewichten plus een vision-encoder van 931 MB). Het draait volledig op een 24 GB GPU bij normale contextlengtes, offloadt naar de CPU als je videokaart kleiner is, en kost niets per token.

Alles hier is gedateerd op 15 augustus 2026. De specificaties komen van de Qwen3.8 27B-modelkaart; downloadgroottes, tags en downloadaantallen komen van de livepagina van de Ollama-bibliotheek; benchmarkcijfers zijn door Ali​baba gerapporteerd en zijn nog niet onafhankelijk gerepliceerd. Het model is enkele dagen geleden uitgebracht, dus behandel alles wat kan veranderen als voorlopig.

De one-liner die daadwerkelijk werkt

Als je Ollama al hebt geïnstalleerd, ben je nog maar twee woorden verwijderd:

ollama run qwen3.8:27b

Ollama-ondersteuning is toegevoegd in v0.32.12 — de release note vermeldt kort en bondig: "Deze release voegt de ondersteuning voor Qwen 3.8 27B toe." Tijdens de eerste run wordt de standaardbuild gedownload (ongeveer 18 GB, Q4_K_M), waarna je in een chat-REPL terechtkomt met de denkmodus standaard ingeschakeld. De bibliotheekpagina vermeldt de build met de mogelijkheidstags "vision tools thinking 27b", waaraan je kunt zien dat de visie- en toolaanroeppaden in dezelfde download zijn opgenomen. Op het moment van schrijven toont de pagina meer dan 40.000 downloads en een taglijst die al elf varianten omvat.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

Twee varianten waar je daadwerkelijk naar zult grijpen:

• ollama run qwen3.8:27b-mlx — de Apple Silicon-build, dezelfde 18 GB-voetafdruk maar gecompileerd voor Metal; het is degene die Ollama's release note specifiek optimaliseert "voor maximale prestaties en uitvoerkwaliteit, geschikt voor herhaalde taken en codeeragenten."

• ollama run qwen3.8:27b-q8_0 — een 30 GB 8-bit quant, voor wanneer je het VRAM hebt en de gewichten dichter bij volledige precisie wilt.

Wat je daadwerkelijk downloadt

De naam zegt 27B, maar het totale aantal parameters is 28B: een dense taalmodel van 27.3B plus een vision-encoder van 461M die het model native beeld- en video-invoer geeft. De rest van de belangrijkste specificaties, rechtstreeks uit de modelkaart:

• 64 lagen, verborgen grootte 5.120, woordenschat 248.320.

• Hybride aandacht: 16 volledige Gated Attention-lagen en 48 lineaire Gated DeltaNet-lagen — een 3:1 lean-lineaire mix, en de reden waarom een 27B een native context van 262.144 tokens kan behouden (uitbreidbaar tot 1M) zonder dat de KV-cache een heel datacenter opslokt.

• Native beeld- en videobegrip — "van STEM-diagrammen en documenten tot video's van een uur lang" is de formulering van Alibaba.

• Apache 2.0. Download het, wijzig het, verkoop er een product mee. Die licentie is het juridische feit waar de economie van de rest van dit artikel op steunt.

De full-precision-referentie is BF16, en daarom bestaan de 56 GB-tags; elke kleinere tag is een afweging tussen precisie en voetafdruk, en de eigen benchmarks van de modelkaart zijn de maatstaf waartegen je afweegt.

Kies eerst een quant, controleer dan je VRAM, niet andersom.

Ollama geeft je elf tags, maar de beslissing komt neer op drie formaten.

18 GB — Q4_K_M (standaard). Past volledig op een 24 GB-kaart (RTX 4090 / 5090-klasse) bij normale context, en op 16 GB-kaarten met gedeeltelijke CPU-offload — langzamer, maar het werkt. Dit is de build voor "gewoon draaien."

30 GB — Q8_0.Gewichten dicht bij volledige precisie, vereist ongeveer 40 GB VRAM om volledig op de GPU te blijven. Bij een 27B weet je al waarom je de extra nauwkeurigheid wilt voordat je ervoor betaalt.

56 GB — BF16.De referentiebuild. Vereist H100-klasse of 96 GB hardware. Niemand draait dit op een consumenten-GPU, en dat is prima.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

Het getal waar mensen over struikelen is de KV-cache. De 18 GB-download betekent niet dat 18 GB VRAM genoeg is voor een sessie met 262K-context — bij lange context voegt de cache enkele gigabytes toe bovenop de gewichten, en daarom kan een 24 GB-kaart dit model comfortabel aan bij 8K–32K context, maar niet bij 262K. Als de kaart op het randje zit, verlaag dan de context, niet de quant.

Apple Silicon is hier een eersteklas doelplatform.

De release note van Ollama's v0.32.12 noemt specifiek macOS. Concreet heeft `ollama run qwen3.8:27b-mlx` ongeveer 18 GB unified memory nodig, dus een Mac met 24 GB of meer draait het volledig op de GPU met ruimte voor context. Er is ook een 32 GB mxfp8 MLX-tag en een 56 GB mlx-bf16-tag voor de 64–128 GB-machines. Als jouw M-series Mac het nieuws over de desktopmodellen heeft gevolgd, is dit de build waar je op hebt gewacht.

Context: 262K op het specblad, minder in je stoel

De modelkaart vermeldt 262.144 native tokens, uitbreidbaar tot 1M; de bibliotheekpagina van Ollama rapporteert hetzelfde venster als 256K. Beide zijn waar — 262.144 is 256K maal 1024 — en geen van beide betekent dat je dat aantal in --num-ctx moet typen op een kaart van 24 GB. De KV-cache groeit ongeveer lineair met de context, dus op consumentenhardware zit je op 16K–64K, niet 262K. Begin met de standaardwaarde van Ollama, verhoog --num-ctx alleen wanneer een taak het echt nodig heeft, en onthoud dat het 1M-cijfer de uitbreidingsmechanismen plus de VRAM vereist om het te voeden.

Wat nog wankel is — lees dit voordat je erop gokt

Nog geen onafhankelijke benchmarks. Elk cijfer op de modelkaart is het woord van Ali​baba per 15 augustus. De geclaimde verbeteringen ten opzichte van Qwen3.6-27B zijn groot — SWE-bench Pro 61,7 tegen 53,5, Terminal Bench 2.1 73,0 tegen 63,4, LiveCodeBench v6 90,3 tegen 83,9, GPQA Diamond 89,2 tegen 87,8 — en ze komen allemaal plausibel over, en geen ervan is door een externe testomgeving gereproduceerd. Baseer geen productiebeslissing uitsluitend op deze cijfers.

De vision-stack is pas een paar dagen oud. Een vroeg bugrapport (ollama issue #17753) liet zien dat de Q4-build vision-invoer via de Qwen3.5-parser routeerde en faalde op afbeeldingen; het werd binnen enkele dagen verholpen in PR #17755, maar het multimodale pad op een model dat pas een week oud is, is precies waar je zou moeten testen voordat je erop vertrouwt.

De standaardbuild bevat MTP. Het q4_K_M-label is ook de build met multi-token-predictie — snellere decodering, en de reden dat "18 GB" en "27B" zonder tegenstrijdigheid kunnen samengaan.

Quant-labels kunnen misleidend zijn op Apple. De 18 GB "mlx" en "nvfp4" tags verschillen in kwantisering — NVFP4 is een NVIDIA FP4-formaat — geef dus op een Mac de voorkeur aan de gewone -mlx build, tenzij je specifiek een FP8/FP4-variant nodig hebt voor een Blackwell GPU.

"Free" doet veel werk in die kop.

Self-hosting van een 27B is gratis per token, maar het is niet gratis. De eerlijke framing is drie opties die verschillende valuta kosten:

Draai het zelf (Ollama). $0 per token, offline, onbeperkt, privé — en de hardware is van jou. Een 24 GB GPU of een 18 GB+ Mac is een echte aankoop, en dat geldt ook voor de elektriciteit en de installatietijd. Dit is de juiste keuze wanneer Qwen3.8 27B je dagelijkse model wordt.

Roep een $0 API met snelheidsbeperking aan.OrcaRouter serveert Qwen3.8 27B op eigen infrastructuur tegen nul kosten (model-ID qwen/qwen3.8-27b-free, $0 per verzoek, met snelheidsbeperking) — omdat de weights open zijn, zijn er geen per-token leverancierskosten om door te berekenen. Dit is de juiste keuze als je het model wilt uitproberen zonder hardware te kopen om een week oude release te testen.

Roep een onbeperkte API aan. Hetzelfde model zonder de snelheidslimiet kost $0,33 per miljoen invoertokens en $2,40 per miljoen uitvoer op OrcaRouter (qwen/qwen3.8-27b, 262K context, tekst, afbeelding en video-invoer). Dit is de juiste keuze wanneer je productieschaal nodig hebt en geen GPU in de gaten wilt houden.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

De wiskunde die tussen hen beslist: incidenteel gebruik betaalt zich beter terug bij $0 of bij $0.33/$2.40 dan tegen de prijs van een GPU; dagelijks interactief gebruik is lokaal goedkoper; aanhoudende productiedoorvoer is het goedkoopst als een API die je niet in leven hoeft te houden. Privacy- en offlinevereisten brengen je naar de eerste kolom, wat de wiskunde ook zegt.

Wanneer deze aanbeveling onjuist is

Je hebt echt 100K+ context nodig. Het model kan het; jouw 24 GB-kaart niet. Bij echte lange context is een 40 GB+ GPU of een API met een langere context geen luxe.

Je hebt vandaag video in productie nodig. Het vision-pad heeft net een parserbugfix gekregen; productievideo op een multimodaal model van een week oud is een gok die je niet zonder fallback moet nemen.

Je wilt concurrency. Eén consumenten-GPU streamt één of twee generaties tegelijk. Een 27B is geen serving-box.

Je draait op CPU-only hardware. Een 27B met 4-bit op CPU is een langzame demonstratie, geen hulpmiddel. Een API is de eerlijke keuze totdat je een GPU hebt.

De bottom line

Qwen3.8 27B op Ollama is de gemakkelijkste manier om een huidige generatie 27B te draaien die iemand tot nu toe heeft uitgebracht: één commando, een standaard van 18 GB die op een 24 GB-kaart past, een eersteklas Apple Silicon-build en Apache 2.0-vrijheid. De quant die je moet kiezen is bijna altijd de standaard Q4_K_M — stap alleen over naar q8_0 als je het verschil kunt meten. En 'gratis' is voorwaardelijk: als je het model af en toe gebruikt, is de $0 API met snelheidslimiet vrijer dan het kopen van hardware; als het je dagelijkse driver wordt, is de lokale kopie het goedkoopste dat je bezit. Controleer de cijfers voordat je erop bouwt — alles in dit artikel klopte op 15 augustus 2026, en dit model verandert met de dag.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube