Een zandloper op een leeg modelvoetstuk — de Qwen3.8-27B-gewichten zijn niet vrijgegeven, dus er kan geen gratis API bestaan.
Guides & Insights

Gratis Qwen 3.8 27B API: Nog niet — Wat je in plaats daarvan kunt draaien

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Nee — vanaf 12 augustus 2026 is er geen gratis Qwen3.8-27B-API en ook geen betaalde. Het model werd op 3 augustus aangekondigd met open gewichten die 'de week van 10 augustus' aan Hugging Face en ModelScope zijn beloofd, maar de officiële Qwe​n-organisatie heeft nog steeds geen Qwen3.8-repository. Zolang de gewichten niet verschijnen, kan niemand Qwen3.8-27B hosten, dus is 'gratis' niet aan de orde. Hier zijn de drie routes naar gratis zodra de gewichten er zijn (en wat elke route werkelijk kost), plus de modellen die je vandaag al gratis lokaal kunt draaien.

Er is nog geen gratis API — de gewichten zijn de toegangspoort.

Alibaba kondigde op 3 augustus 2026 de Qwen3.8-familie aan: de Qwen3.8-Max met 2,4 biljoen parameters (ongeveer 95 miljard actieve parameters, een context van 1M tokens, geprijsd op $2 per miljoen invoertokens en $6 per miljoen uitvoertokens op Alibaba Cloud Model Studio) en de dense, single-machine Qwen3.8-27B. Beide werden dezelfde week beloofd als open gewichten op Hugging Face en ModelScope.

Die belofte is nu twee dagen over tijd. Ik heb op 12 augustus rechtstreeks op Hugging Face gecontroleerd: de officiële Qwe​n-organisatie heeft geen enkele Qwen3.8-repository. De Qwen3.8-27B-GGUF-, -FP8-, -NVFP4A16- en -NInfer-repositories die in de modelzoekopdracht verschijnen, zijn placeholder-cards — nul gewichtsbestanden, downloadaantallen in de enkele cijfers, en modelkaarten die letterlijk melden: 'gereserveerd voorafgaand aan de Qwe​n/Qwen3.8-27B-release.' Zie die niet als bewijs dat het model bestaat; zie ze als mensen die parkeerplaatsen reserveren.

Twee dingen kun je niet aannemen. Ten eerste de licentie: er is geen genoemd voor Qwen3.8-27B. Recente Qwe​n open gewichten zijn uitgebracht onder de Tongyi Qianwen-licentie, waarvan de clausule van 100 miljoen maandelijkse actieve gebruikers bij schaal leidt tot gesprekken over commerciële licenties — Apache 2.0 is geen veilige standaard. Ten tweede de specificaties: Alibaba heeft geen benchmarktabel, contextvenster of bevestigde hardwarevereiste voor de 27B gepubliceerd. Alles wat er vandaag over wordt herhaald, is projectie.

We hebben de pre-drop-checklist behandeld — wat bevestigd is, wat gerucht is, wat je moet controleren voordat je downloadt — in Qwen3.8-27B Open Weights: What We Know Before the Drop. Dit artikel is het deel dat dat stuk niet dekte: hoe "gratis" daadwerkelijk zal werken zodra het model wordt uitgebracht.

Nadat de gewichten zijn gevallen: drie routes naar vrijheid, en wat elke werkelijk kost.

"Gratis" is nooit gratis. Alle drie de routes naar een gratis Qwen3.8-27B verplaatsen de kosten ergens naartoe; het verschil zit in waar ze belanden. De 27B is een dicht model — elk van de ~27 miljard parameters is actief bij elke token — dus de onderstaande kosten gaan over echte hardware, niet over marketing.

Three routes to a free Qwen3.8-27B API after the weights drop: run it yourself, a hosted free tier, or OrcaRouter's planned free tier — and the real cost of each.

Route 1: Draai het zelf — gratis in geld, geprijsd in hardware

De enige route waarbij "gratis" letterlijk waar wordt nadat de hardware is gekocht. Unsloth-medeoprichter Daniel Han verwacht dat de 27B bij release in ongeveer 17GB VRAM zal draaien — een doelstelling, geen geleverde specificatie. Met de gemeten kwantiseringsladder van Qwen3.6-27B als benadering: Q4_K_M komt rond de 16GB uit, Q6_K rond 21GB, FP8 rond 27GB, en volledige BF16 rond 54–56GB. Het realistische minimum vandaag is een 24GB-kaart — RTX 3090, RTX 4090, of A6000-klasse — op Q4.

Timing is belangrijk: officiële gewichten met vLLM of SGLang werken meestal binnen enkele dagen na een release, maar community-GGUF- en AWQ-kwantiscaties lopen één tot twee weken achter, dus een Ollama-achtige "pull and run" zal op de releasedag niet bestaan. De verborgen kosten zijn stroom, een stille machine en je tijd. De winst is privacy — niets verlaat je machine — en een marginale kost van nul die zich opstapelt als je de GPU ook voor andere modellen gebruikt.

Route 2: Gehoste gratis lagen — gratis in geld, geprijsd in beperkingen

Zodra de gewichten beschikbaar zijn, kun je een evaluatiequotum van Alibaba Cloud verwachten en gratis lagen van de gebruikelijke serverloze hosts. Het patroon dat je kunt verwachten is dat wat Alibaba al draait voor Qwen3.8-Max: een quotum van 1M tokens voor nieuwe gebruikers, alleen in de regio Singapore, 90 dagen geldig, niet verlengbaar — en reasoning-tokens worden als output gefactureerd, dus een model dat standaard redeneert kan de hele toelage in een weekend prototyping verbruiken. Wat je daadwerkelijk betaalt is snelheidslimieten, een regionale vergrendeling, een vervaldatum en dat je prompts naar een derde partij gaan. Een gratis laag is een opstapje om het model te evalueren, geen plek om het in te zetten.

Route 3: OrcaRouter's gratis laag — gepland, niet live

Omdat de zoekopdracht letterlijk "gratis" is, zullen we expliciet zijn: OrcaRouter is van plan een gratis laag aan te bieden voor Qwen3.8-27B zodra de gewichten beschikbaar komen. Het is nog niet live. Er is geen endpoint om aan te roepen, en ik ga geen placeholder-voorbeeld plakken. We zullen het aankondigen wanneer er iets aan te kondigen valt. Wat we vandaag wel hosten is Qwen3.8-Max tegen $2/$6 per 1M tokens zonder opslag — en de 27B staat niet op het platform, omdat niemand het nog kan draaien.

Wat je nu gratis kunt gebruiken

Als je behoefte "{{1}}een open model van de 27B-klasse dat ik zonder te betalen kan draaien{{/1}}" is, hoef je niet te wachten. Het eerlijke antwoord op hetzelfde niveau is Qwen3.6-27B, {{2}}de directe voorganger van het model waar je op wacht{{/2}}.

Comparison of Qwen3.6-27B and Nemotron 3.5 Lightning 30B A3B, which you can run free today, against Qwen3.8-27B, which is not yet released.

Qwen3.6-27B is Apache 2.0, een dense 27.8B-model met 262K context en native invoer voor tekst, afbeeldingen en video. Een Q4_K_M GGUF is ongeveer 16.5GB en draait met ruwweg 25 tokens per seconde op een 24GB-consumenten-GPU (16–18 tokens per seconde op een M4 Max). Door de leverancier gerapporteerde cijfers uit de modelkaart: SWE-Bench Verified 77.2, MMLU-Pro 86.2, AIME 2026 94.1, GPQA Diamond 87.8 en MMMU 82.9. Als Qwen3.8-27B "een 27B" is, dan is dit de 27B die je vandaag daadwerkelijk kunt gebruiken — dezelfde familie, hetzelfde dense ontwerp, al open.

Nemotron 3.5 Lightning 30B A3B heeft een andere vorm, ook gratis: uitgebracht op 11 augustus 2026 onder NVIDIA's OpenMDW 1.1-licentie. Het is een Mixture-of-Experts-model met in totaal 30B en ~3B actieve parameters, met een hybride Mamba-2-architectuur en tot 1M context — NVFP4-checkpoints zijn ongeveer 21,6 GB en een Q4 GGUF ongeveer 25 GB. Er is een kaart met 24 GB of meer nodig, omdat alle 30 miljard parameters in het geheugen staan, ook al worden er per token slechts ongeveer 3 miljard geactiveerd. Volgens eerste rapporten ligt het rond de 45 tokens per seconde op een enkele GPU. Het is gebouwd voor de agent-uitvoeringslaag — toolaanroepen, validatie, formattering — niet voor frontier-reasoning. Als je workload grootschalig routinewerk voor agents is, kan het een dense 27B verslaan bij je daadwerkelijke werk.

En als je vandaag specifiek een gratis gehoste API wilt in plaats van een lokale installatie, is het enige eerlijke "gratis" het quotum van Alibaba's Qwen3.8-Max: 1M tokens, regio Singapore, 90 dagen. Het is niet de 27B, en het is een evaluatietegoed, geen service — gebruik het om nu het gedrag van Qwen3.8 uit te proberen en stap dan over.

Wanneer dit advies verkeerd is

Als je al een 24GB+ GPU bezit, is de "wacht op gratis tiers"-framing voor jou verkeerd. Op de dag dat de gewichten vrijkomen, is vLLM op de officiële gewichten jouw gratis tier; je zou wachten op gemak dat je niet nodig hebt. Wacht alleen ongeveer twee weken als je specifiek de gepolijste GGUF-quantisatieladder wilt.

Als je een prototype ontwikkelt aan de hand van een API-contract, kunnen de gehoste gratis quota's (zodra de 27B die heeft) goedkoper zijn dan je tijd — zelfs met de vervaldatum van 90 dagen en de regioblokkering is het huren van een GPU-box voor een week prototypen meestal de duurdere optie.

Als de licentie Tongyi Qianwen blijkt te zijn in plaats van Apache, "vrije gewichten" zal niet betekenen dat je vrij bent om te commercialiseren boven de drempel van 100 miljoen MAU. Lees het LICENSE-bestand in de daadwerkelijke repository voordat je er iets op bouwt — dat is de meest voorkomende manier waarop "vrije open-gewichten" een factuur wordt.

En als Alibaba de datum opnieuw mist — het is al twee dagen voorbij de beloofde termijn — elke week die voorbijgaat maakt Qwen3.6-27B de juiste keuze in plaats van de noodoplossing.

A timeline from announcement to free local run of Qwen3.8-27B.

Kortom

Er is geen gratis Qwen3.8-27B-API, omdat er nergens een Qwen3.8-27B bestaat. Wanneer de gewichten uitkomen, zijn de drie gratis routes: zelf hosten (betaal je met hardware), gratis hostinglagen (betaal je met beperkingen), en de geplande gratis laag van OrcaRouter — die nog niet live is, en we zullen dat zeggen wanneer het zover is. Vandaag is het dichtstbijzijnde gratis alternatief Qwen3.6-27B op je eigen hardware. Wachten kost je niets behalve de 27B; het draaien van de voorganger kost je niets behalve een GPU die je in de tussentijd voor al het andere kunt gebruiken.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt