
Qwen3.8-27B op Ollama: één commando, vier quants, en wat "gratis" echt kost
- obsidianNIEUWQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 per 1 mln tokens · 18 tok/s
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenNIEUWQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
Draai het met één commando: ollama run qwen3.8:27b. Dat is het hele antwoord op de vraag waar deze pagina over gaat. Qwen3.8 27B — Alibaba's dichte model met 27 miljard parameters, waarvan de gewichten op 14 augustus 2026 onder Apache 2.0 zijn vrijgegeven — is deze week live gegaan in de Ollama-bibliotheek, en de standaardbuild is al een verstandige 18 GB Q4_K_M-kwantisatie (17 GB aan gewichten plus een vision-encoder van 931 MB). Het draait volledig op een 24 GB GPU bij normale contextlengtes, offloadt naar de CPU als je videokaart kleiner is, en kost niets per token.
Alles hier is gedateerd op 15 augustus 2026. De specificaties komen van de Qwen3.8 27B-modelkaart; downloadgroottes, tags en downloadaantallen komen van de livepagina van de Ollama-bibliotheek; benchmarkcijfers zijn door Alibaba gerapporteerd en zijn nog niet onafhankelijk gerepliceerd. Het model is enkele dagen geleden uitgebracht, dus behandel alles wat kan veranderen als voorlopig.
De one-liner die daadwerkelijk werkt
Als je Ollama al hebt geïnstalleerd, ben je nog maar twee woorden verwijderd:
ollama run qwen3.8:27b
Ollama-ondersteuning is toegevoegd in v0.32.12 — de release note vermeldt kort en bondig: "Deze release voegt de ondersteuning voor Qwen 3.8 27B toe." Tijdens de eerste run wordt de standaardbuild gedownload (ongeveer 18 GB, Q4_K_M), waarna je in een chat-REPL terechtkomt met de denkmodus standaard ingeschakeld. De bibliotheekpagina vermeldt de build met de mogelijkheidstags "vision tools thinking 27b", waaraan je kunt zien dat de visie- en toolaanroeppaden in dezelfde download zijn opgenomen. Op het moment van schrijven toont de pagina meer dan 40.000 downloads en een taglijst die al elf varianten omvat.

Twee varianten waar je daadwerkelijk naar zult grijpen:
• ollama run qwen3.8:27b-mlx — de Apple Silicon-build, dezelfde 18 GB-voetafdruk maar gecompileerd voor Metal; het is degene die Ollama's release note specifiek optimaliseert "voor maximale prestaties en uitvoerkwaliteit, geschikt voor herhaalde taken en codeeragenten."
• ollama run qwen3.8:27b-q8_0 — een 30 GB 8-bit quant, voor wanneer je het VRAM hebt en de gewichten dichter bij volledige precisie wilt.
Wat je daadwerkelijk downloadt
De naam zegt 27B, maar het totale aantal parameters is 28B: een dense taalmodel van 27.3B plus een vision-encoder van 461M die het model native beeld- en video-invoer geeft. De rest van de belangrijkste specificaties, rechtstreeks uit de modelkaart:
• 64 lagen, verborgen grootte 5.120, woordenschat 248.320.
• Hybride aandacht: 16 volledige Gated Attention-lagen en 48 lineaire Gated DeltaNet-lagen — een 3:1 lean-lineaire mix, en de reden waarom een 27B een native context van 262.144 tokens kan behouden (uitbreidbaar tot 1M) zonder dat de KV-cache een heel datacenter opslokt.
• Native beeld- en videobegrip — "van STEM-diagrammen en documenten tot video's van een uur lang" is de formulering van Alibaba.
• Apache 2.0. Download het, wijzig het, verkoop er een product mee. Die licentie is het juridische feit waar de economie van de rest van dit artikel op steunt.
De full-precision-referentie is BF16, en daarom bestaan de 56 GB-tags; elke kleinere tag is een afweging tussen precisie en voetafdruk, en de eigen benchmarks van de modelkaart zijn de maatstaf waartegen je afweegt.
Kies eerst een quant, controleer dan je VRAM, niet andersom.
Ollama geeft je elf tags, maar de beslissing komt neer op drie formaten.
• 18 GB — Q4_K_M (standaard). Past volledig op een 24 GB-kaart (RTX 4090 / 5090-klasse) bij normale context, en op 16 GB-kaarten met gedeeltelijke CPU-offload — langzamer, maar het werkt. Dit is de build voor "gewoon draaien."
• 30 GB — Q8_0.Gewichten dicht bij volledige precisie, vereist ongeveer 40 GB VRAM om volledig op de GPU te blijven. Bij een 27B weet je al waarom je de extra nauwkeurigheid wilt voordat je ervoor betaalt.
• 56 GB — BF16.De referentiebuild. Vereist H100-klasse of 96 GB hardware. Niemand draait dit op een consumenten-GPU, en dat is prima.

Het getal waar mensen over struikelen is de KV-cache. De 18 GB-download betekent niet dat 18 GB VRAM genoeg is voor een sessie met 262K-context — bij lange context voegt de cache enkele gigabytes toe bovenop de gewichten, en daarom kan een 24 GB-kaart dit model comfortabel aan bij 8K–32K context, maar niet bij 262K. Als de kaart op het randje zit, verlaag dan de context, niet de quant.
Apple Silicon is hier een eersteklas doelplatform.
De release note van Ollama's v0.32.12 noemt specifiek macOS. Concreet heeft `ollama run qwen3.8:27b-mlx` ongeveer 18 GB unified memory nodig, dus een Mac met 24 GB of meer draait het volledig op de GPU met ruimte voor context. Er is ook een 32 GB mxfp8 MLX-tag en een 56 GB mlx-bf16-tag voor de 64–128 GB-machines. Als jouw M-series Mac het nieuws over de desktopmodellen heeft gevolgd, is dit de build waar je op hebt gewacht.
Context: 262K op het specblad, minder in je stoel
De modelkaart vermeldt 262.144 native tokens, uitbreidbaar tot 1M; de bibliotheekpagina van Ollama rapporteert hetzelfde venster als 256K. Beide zijn waar — 262.144 is 256K maal 1024 — en geen van beide betekent dat je dat aantal in --num-ctx moet typen op een kaart van 24 GB. De KV-cache groeit ongeveer lineair met de context, dus op consumentenhardware zit je op 16K–64K, niet 262K. Begin met de standaardwaarde van Ollama, verhoog --num-ctx alleen wanneer een taak het echt nodig heeft, en onthoud dat het 1M-cijfer de uitbreidingsmechanismen plus de VRAM vereist om het te voeden.
Wat nog wankel is — lees dit voordat je erop gokt
• Nog geen onafhankelijke benchmarks. Elk cijfer op de modelkaart is het woord van Alibaba per 15 augustus. De geclaimde verbeteringen ten opzichte van Qwen3.6-27B zijn groot — SWE-bench Pro 61,7 tegen 53,5, Terminal Bench 2.1 73,0 tegen 63,4, LiveCodeBench v6 90,3 tegen 83,9, GPQA Diamond 89,2 tegen 87,8 — en ze komen allemaal plausibel over, en geen ervan is door een externe testomgeving gereproduceerd. Baseer geen productiebeslissing uitsluitend op deze cijfers.
• De vision-stack is pas een paar dagen oud. Een vroeg bugrapport (ollama issue #17753) liet zien dat de Q4-build vision-invoer via de Qwen3.5-parser routeerde en faalde op afbeeldingen; het werd binnen enkele dagen verholpen in PR #17755, maar het multimodale pad op een model dat pas een week oud is, is precies waar je zou moeten testen voordat je erop vertrouwt.
• De standaardbuild bevat MTP. Het q4_K_M-label is ook de build met multi-token-predictie — snellere decodering, en de reden dat "18 GB" en "27B" zonder tegenstrijdigheid kunnen samengaan.
• Quant-labels kunnen misleidend zijn op Apple. De 18 GB "mlx" en "nvfp4" tags verschillen in kwantisering — NVFP4 is een NVIDIA FP4-formaat — geef dus op een Mac de voorkeur aan de gewone -mlx build, tenzij je specifiek een FP8/FP4-variant nodig hebt voor een Blackwell GPU.
"Free" doet veel werk in die kop.
Self-hosting van een 27B is gratis per token, maar het is niet gratis. De eerlijke framing is drie opties die verschillende valuta kosten:
• Draai het zelf (Ollama). $0 per token, offline, onbeperkt, privé — en de hardware is van jou. Een 24 GB GPU of een 18 GB+ Mac is een echte aankoop, en dat geldt ook voor de elektriciteit en de installatietijd. Dit is de juiste keuze wanneer Qwen3.8 27B je dagelijkse model wordt.
• Roep een $0 API met snelheidsbeperking aan.OrcaRouter serveert Qwen3.8 27B op eigen infrastructuur tegen nul kosten (model-ID qwen/qwen3.8-27b-free, $0 per verzoek, met snelheidsbeperking) — omdat de weights open zijn, zijn er geen per-token leverancierskosten om door te berekenen. Dit is de juiste keuze als je het model wilt uitproberen zonder hardware te kopen om een week oude release te testen.
• Roep een onbeperkte API aan. Hetzelfde model zonder de snelheidslimiet kost $0,33 per miljoen invoertokens en $2,40 per miljoen uitvoer op OrcaRouter (qwen/qwen3.8-27b, 262K context, tekst, afbeelding en video-invoer). Dit is de juiste keuze wanneer je productieschaal nodig hebt en geen GPU in de gaten wilt houden.

De wiskunde die tussen hen beslist: incidenteel gebruik betaalt zich beter terug bij $0 of bij $0.33/$2.40 dan tegen de prijs van een GPU; dagelijks interactief gebruik is lokaal goedkoper; aanhoudende productiedoorvoer is het goedkoopst als een API die je niet in leven hoeft te houden. Privacy- en offlinevereisten brengen je naar de eerste kolom, wat de wiskunde ook zegt.
Wanneer deze aanbeveling onjuist is
• Je hebt echt 100K+ context nodig. Het model kan het; jouw 24 GB-kaart niet. Bij echte lange context is een 40 GB+ GPU of een API met een langere context geen luxe.
• Je hebt vandaag video in productie nodig. Het vision-pad heeft net een parserbugfix gekregen; productievideo op een multimodaal model van een week oud is een gok die je niet zonder fallback moet nemen.
• Je wilt concurrency. Eén consumenten-GPU streamt één of twee generaties tegelijk. Een 27B is geen serving-box.
• Je draait op CPU-only hardware. Een 27B met 4-bit op CPU is een langzame demonstratie, geen hulpmiddel. Een API is de eerlijke keuze totdat je een GPU hebt.
De bottom line
Qwen3.8 27B op Ollama is de gemakkelijkste manier om een huidige generatie 27B te draaien die iemand tot nu toe heeft uitgebracht: één commando, een standaard van 18 GB die op een 24 GB-kaart past, een eersteklas Apple Silicon-build en Apache 2.0-vrijheid. De quant die je moet kiezen is bijna altijd de standaard Q4_K_M — stap alleen over naar q8_0 als je het verschil kunt meten. En 'gratis' is voorwaardelijk: als je het model af en toe gebruikt, is de $0 API met snelheidslimiet vrijer dan het kopen van hardware; als het je dagelijkse driver wordt, is de lokale kopie het goedkoopste dat je bezit. Controleer de cijfers voordat je erop bouwt — alles in dit artikel klopte op 15 augustus 2026, en dit model verandert met de dag.
