Een hero-titelkaart met de tekst Qwen3.8-27B met Unsloth, met het ondertitel 'run, quantize, or fine-tune it locally', een terminalvenster-pictogram, en chips met de tekst 'UD-Q4_K_XL 17.9GB' en 'Studio no-config'.
Guides & Insights

Qwen3.8-27B met Unsloth: lokaal uitvoeren, kwantiseren of fijn afstemmen

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Ja — Unsloth draait Qwen3.8 27B, en het is de snelste manier om Ali​baba's nieuwe Apache-2.0-model op je eigen GPU te krijgen. Het hele antwoord in één regel: open Unsloth Studio, zoek op "Qwen3.8 27B", kies UD-Q4_K_XL (17.9GB) op een 24GB-kaart en chat binnen een minuut. Achter die klik leverde Unsloth in dezelfde week dat de gewichten uitkwamen (13–14 augustus 2026) drie dingen: de unsloth/Qwen3.8-27B-GGUF-pack gebaseerd op Unsloth Dynamic V3.0 (preview)-quantisatie, volledige ondersteuning in Unsloth Studio en Desktop, en de v0.1.800-beta-release met GGUF-export, imatrix-detectie en VRAM-fit-verbeteringen. Het finetunet ook het model — Unsloth claimt 2× snellere training met 70% minder VRAM. Qwen3.8 27B is een dicht vision-taalmodel met 27 miljard parameters waarvan de hybride aandacht slechts 16 van de 64 lagen in volledige aandacht houdt; daarom past een 4-bit-bestand op kaarten waar de meeste 27B-modellen niet op passen.

Over bronvermelding: de modelgegevens zijn officieel, afkomstig van de Qwen3.8 27B-modelkaart op Hugging Face, geverifieerd op 15 augustus 2026. De Unsloth-ondersteuning, quant-groottes, VRAM-vereisten en installatieopdrachten komen uit Unsloth's release-opmerkingen en documentatie, op dezelfde dag. De API-prijs is live uit OrcaRouter's catalogus, op dezelfde dag. Unsloth's "2× sneller, 70% minder VRAM" en "veruit het sterkste model voor zijn formaat" zijn leveranciersclaims, niet onafhankelijk gereproduceerd.

Wat "Qwen3.8 + Unsloth" betekent: vier verschillende dingen

Unsloth is vier afzonderlijke dingen, en de zoekresultaten op trefwoorden halen ze door elkaar. Weten welke je nodig hebt is de helft van de installatie:

unsloth/Qwen3.8-27B-GGUF — de gekwantiseerde gewichtsbestanden op Hugging Face, 21 quants plus een vision-projector. Gebouwd met Dynamic V3.0 (preview), niet de oudere Dynamic 2.0 (die op 24 april 2025 werd aangekondigd en ouder is dan dit model). Dit is de "download een bestand"-route, bruikbaar vanuit elke llama.cpp-build.

Unsloth Studio — de browser-app die je installeert of draait vanuit een Hugging Face Space. Doorzoek de Model Hub, klik op een quant, chat met tools. Geen handmatige configuratie van templates of inferentieparameters.

Unsloth Desktop — de lokale GUI-app voor macOS, Windows en Linux die Studio plus training omvat. Dit is waar de fine-tuning "2× sneller met 70% minder VRAM" plaatsvindt.

De unsloth Python-bibliotheek — from unsloth import FastLanguageModel, de QLoRA fine-tuning API die in notebooks en scripts gebruikt wordt.

De releaseopmerkingen van Unsloth voor v0.1.800-beta, getiteld "Release Qwen3.8 27B", zeggen dat Qwen3.8 27B en de 2,4T-parameter Qwen3.8-2.4T-A95B "nu lokaal in Unsloth kunnen worden uitgevoerd", dat de 27B "draait op 17GB RAM via Unsloth Dynamic GGUFs", en dat "je Qwen3.8 27B ook kunt fine-tunen in Unsloth". Dezelfde release voegt NVFP4-quants toe, controleert de schijfruimte vóór GGUF-exports, detecteert echte GGUF-imatrix-ondersteuning in Studio en maakt inferentie tot 10% sneller op GGUF met een instelbare VRAM-limiet.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

Kies je quant op basis van VRAM, niet op vibes

Unsloth's geheugentabel is in totaal RAM plus VRAM (of unified memory), en het is de officiële richtlijn. Een 4-bit Qwen3.8 27B heeft 17–19GB nodig; een 24GB RTX 4090, RTX 5080, of een 24GB Mac met unified memory is de realistische ondergrens voor een comfortabele 4-bit setup. De drie keuzes die bijna iedereen dekken:

12GB → UD-IQ2_XXS op 9.0GB — het enige bestand dat in zijn geheel past; verwacht zichtbaar kwaliteitsverlies. Maak deze keuze bewust.

16GB → UD-Q3_K_XL op 13.4GB — het beste 3-bit-bestand, volgens Unsloth's eigen picker.

24GB → UD-Q4_K_XL op 17.9GB — het aanbevolen 4-bit bestand en het standaardantwoord van dit artikel.

48–64GB → UD-Q8_K_XL op 31.5GB — bijna verliesvrij op een workstation of dual-GPU-opstelling.

De volledige ladder, uit de bestandslijst van unsloth/Qwen3.8-27B-GGUF en de documentatie van Unsloth, beide geverifieerd op 15 augustus 2026: UD-Q8_K_XL 31,5 GB, UD-Q6_K_XL 25,9 GB, UD-Q5_K_XL 20,2 GB, UD-Q4_K_XL 17,9 GB, UD-Q3_K_XL 13,4 GB, UD-Q2_K_XL 10,7 GB, UD-IQ3_XXS 11,9 GB, UD-IQ2_M 10,3 GB, UD-IQ2_XXS 9,0 GB. Standaard K-quants (Q4_K_M 17,1 GB, Q8_0 29,0 GB) zijn er ook, en het pakket bevat een vision-projector (mmproj-BF16, 931 MB), zodat afbeeldingen en video werken als je die laadt. Unsloth noemt de hele ladder "Dynamic V3.0 (preview)" — nieuwer dan de Dynamic 2.0 die je in oudere artikelen ziet, die is gebouwd voor modellen die meer dan een jaar eerder zijn uitgebracht.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

Voer het uit met Unsloth in drie minuten

De route met één klik: op macOS of Linux, curl -fsSL https://unsloth.ai/install.sh | sh, daarna unsloth studio -p 8888 en open http://127.0.0.1:8888. Op Windows: irm https://unsloth.ai/install.ps1 | iex. Als je helemaal geen installatie wilt, is Unsloth's Studio ook gepubliceerd als een Hugging Face Space — open het in een browser, zoek op "Qwen3.8 27B" en kies een quant op basis van het geheugen dat je hebt. Studio stemt de sampling parameters en de chat template automatisch af, offloadt naar RAM wanneer VRAM tekortschiet en detecteert multi-GPU-opstellingen — het 'no-config'-gedeelte is echt, en het is de snelste manier om het model van deze week te laten draaien.

De bestanden-eerst-route, als je al llama.cpp gebruikt: download één quant en voer het direct uit. Dit zijn Unsloth's eigen commando's, geverifieerd aan de hand van hun documentatie:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Die samplingwaarden zijn de aanbevolen denkmodus-instellingen van de modelkaart. Vervang de --include glob door *UD-Q3_K_XL* op een 16GB-kaart, en voeg --mmproj toe dat naar de mmproj-BF16.gguf van de pack wijst als je vision nodig hebt. Een valkuil: llama.cpp moet een recente build zijn — het bestand registreert de nieuwe qwen35-architectuur, en alles van vóór de releaseweek weigert het te laden.

Fine-tune het met Unsloth

Fine-tuning is waar Unsloth zijn reputatie verdient: de bibliotheek claimt 2× snellere training met 70% minder VRAM vergeleken met standaard Transformers + PEFT, wat QLoRA op een 27B op een enkele consumentenkaart haalbaar maakt. Het ingangspunt voor fine-tuning is de gewone repository unsloth/Qwen3.8-27B (safetensors, 28B-bestandenpagina) in plaats van het GGUF-pakket. Het standaard Unsloth QLoRA-patroon, toegepast op dit model:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

gebruik dan een standaard trl.SFTTrainer-loop op je dataset. Dat fragment is het standaard QLoRA-patroon uit de documentatie van Unsloth — de trainingsbenchmark-claims zijn van Unsloth zelf en niet iets dat ik heb gereproduceerd — en er gelden twee kanttekeningen: de kernels van Unsloth patchen de teksttransformatorlagen, dus plan om de vision-encoder apart te behandelen, en houd het unsloth-pakket op de huidige release, want deze architectuur is nog maar een paar dagen oud en versieverschillen leiden tot duidelijke fouten.

Wat Unsloth Studio voor je regelt

Een GGUF handmatig draaien betekent het balanceren van contextgrootte, RAM-offload en tool calling. Studio reduceert dat tot standaardinstellingen: het bepaalt de context op basis van het geheugen dat daadwerkelijk vrij is, ontlaadt inactieve vision-modellen om VRAM vrij te maken voor chat of training, detecteert multi-GPU-configuraties en verzorgt standaard webzoekopdrachten, code-uitvoering en agentverbindingen (Claude Code, Codex, MCP). De v0.1.800-beta-release heeft ook de onderdelen aangescherpt die in de praktijk pijn doen: GGUF-export controleert nu de schijfruimte voordat een lange merge begint, in plaats van halverwege te falen, Studio detecteert of de GGUF die het exporteert daadwerkelijk imatrix ondersteunt (zodat je geen run verspilt), en de geheugenbewaking reserveert niet langer te veel GPU-geheugen. Voor een model dat drie dagen oud is, levert 'no-config' echt werk.

Lokaal gratis versus API betaald: de eerlijke economie.

Het kernverschil tussen Unsloth en een API is niet kwaliteit — het is wie de hardware bezit. Unsloth is de gratis route: nul marginale kosten per token, niets verlaat je machine, geen rate limits, en volledige controle over de gewichten. Het is niet gratis in absolute termen: jij levert de GPU en elektriciteit, en een 2-bits bestand op een 12GB-kaart is een gecompromitteerde ervaring. Qwen3.8 27B is dense en vision-capabel, dus 4-bit is 17,9GB aan gewichten vóór context; de machine is de toegangsprijs.

De API-route bestaat omdat de gewichten onder Apache-2.0 vallen, dus iedereen kan ze tegen bijna nul marginale kosten hosten. Qwen3.8 27B staat vandaag in de catalogus van OrcaRouter voor $0,33 per miljoen input-tokens en $2,40 per miljoen output-tokens, het model zelf gehost op onze eigen infrastructuur — geen leveranciersprijs om door te berekenen — met een contextvenster van 262K tokens en tekst-, beeld- en video-invoer. Omdat de gewichten open zijn, is er ook een gratis tier die een aanvraaglimiet heeft en $0 per aanvraag kost. Een representatieve maand van 10 miljoen tokens met een invoeraandeel van 70% kost ongeveer $9,51 op de betaalde tier. Als je al een 24GB-kaart hebt, wint lokaal draaien qua kosten; zo niet, dan kun je beter tokens huren tegen dat tarief dan een kaart kopen voor een zijproject, en de gratis tier is de eerlijke manier om het model te testen voordat je je aan hardware vastlegt.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Wanneer Unsloth het verkeerde antwoord is

Unsloth Studio en het GGUF-pack zijn de juiste keuze voor één enkele machine. Ze zijn de verkeerde keuze wanneer:

Je bezit een Blackwell RTX 50-series kaart. De unsloth/Qwen3.8-27B-NVFP4 quants zijn ongeveer 1,5× sneller dan BF16 in hetzelfde VRAM en gebruiken een FP8 KV-cache voor een langere context. Dat pad loopt via vLLM of SGLang, niet via een GGUF en niet via Studio.

In productie heb je het volledige 262K native venster of de 1M YaRN-extensie nodig. Een dicht visiemodel met een lange context is zwaar; Unsloth's contextafstemming draait voor jou gerust korter, maar een serving-stack met goed KV-beheer verslaat een lokale app.

Je bedient veel gebruikers. Unsloth is een lokale app en een fine-tuning-bibliotheek, geen multi-tenant server. Voor concurrency, automatisch schalen en uptime-garanties heb je een gehost eindpunt nodig.

Je hebt helemaal geen GPU. Een eerlijk antwoord: een 2-bit 27B op een 12GB-kaart is merkbaar slechter dan hetzelfde model dat correct wordt gedraaid. Gebruik eerst de gratis API-laag; als dat goed genoeg is, koop hardware wanneer het gebruiksscenario bewezen is.

Je wilt de visuele kant verfijnen. De versnellingen van Unsloth richten zich op de tekst-transformerlagen; een volledige multimodale fine-tuning vereist een andere stack.

Kortom

Qwen3.8 27B met Unsloth is sinds deze week een opgelost probleem: installeer Studio, kies UD-Q4_K_XL voor een 24GB-kaart (UD-Q3_K_XL voor 16GB, UD-IQ2_XXS voor 12GB), en het model draait zonder configuratie en zonder kosten per token. Het fine-tuningpad is echt en Unsloth's snelheidsclaims zijn de reden dat 27B QLoRA praktisch is op één kaart. Weet dat de kwantiseringsladder Dynamic V3.0 (preview) is, niet Dynamic 2.0 zoals oudere artikelen beschrijven; houd llama.cpp actueel; en als je de hardware niet bezit, zijn dezelfde gewichten een API van $0,33/$2,40 met een gratis laag met snelheidslimiet — dus er is geen reden om een 2-bit bestand te draaien waar je niet tevreden mee bent. Lokaal is de gratis route, en voor het eerst in deze gewichtsklasse is het ook de makkelijke route.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube