Een hero-titelkaart met de tekst 'Qwen3.8-27B — Text+Video on CPU', met de ondertitel 'Inside SGLang's torchcodec / ffmpeg CPU path' en drie chips met de tekst Apache 2.0, 27B open weights, No GPU required, met platte lijnpictogrammen van een videoplay-frame, een CPU-chip en een filmstrip, en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Qwen3.8-27B Text+Video komt naar CPU: Wat de torchcodec-PR van SGLang verandert

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Een concept-pull-request in SGLang heeft momenteel als titel “[CPU] Support Qw​en3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory.” Haal de technische details eraf en het leest als een routekaart: Qwen3.8-27B — Alibaba’s Apache-2.0-visietaalmodel met 27 miljard parameters, dat vijf dagen geleden als opensource is uitgebracht — wordt zodanig ingebouwd dat de tekst+video-modus draait op hardware zonder GPU aan boord. Dat is het eerste concrete signaal dat de multimodale 27B een echt CPU-servingpad krijgt in een van de inferentieruntimes die teams daadwerkelijk inzetten, en het is relevant voor iedereen die heeft gewacht om videoanalyse lokaal te draaien zonder een 48GB-kaart te kopen.

Niets in die PR is al gemerged — het is een concept, CI is rood, en de versiepinnen zijn nog in beweging. Maar dat is juist waarom het de moeite waard is om het zorgvuldig te lezen. Het model erachter is echt en uitgebracht, het serving-ecosysteem is op GPU-gebied al bijgekomen, en deze PR laat zien waar het pad zonder GPU naartoe gaat. Dit is wat de wijziging daadwerkelijk doet, waarom CPU-video-inferentie voor een 27B-model een grotere zaak is dan het klinkt, wat er bevestigd is over Qwen3.8-27B, en waar je het vandaag kunt aanroepen.

Het model in één paragraaf

Qwen3.8-27B is de open-gewicht 27B van de Qw​en 3.8-generatie: een dicht vision-taalmodel met ~27,8 miljard parameters (64 lagen, hidden size 5.120) met een speciale vision-toren, uitgebracht onder Apache 2.0 op Hugging Face en ModelScope op de avond van 14 augustus 2026 (Beijing-tijd). Het accepteert tekst, afbeeldingen en video en retourneert tekst — native, niet via een aangeplakte adapter — met een native contextvenster van 262.144 tokens, uitbreidbaar tot ongeveer een miljoen via YaRN. De licentie is de permissieve: commercieel gebruik, fine-tuning en herdistributie, geen omzetdrempel en geen aparte commerciële overeenkomst, in tegenstelling tot de voorwaarden van het vlaggenschip-checkpoint.

Twee architecturale details zijn voor een deployer belangrijker dan de hoofdspecificaties. De eerste is hybride attention: de meeste lagen gebruiken Gated DeltaNet lineaire attention en slechts een kwart behoudt een volledige KV-cache, waardoor het geheugen voor lange contexten een fractie is van wat een conventioneel dicht model met 64 lagen nodig heeft — dezelfde truc die een 262K-venster realistisch maakt binnen één enkele consumenten-GPU. De tweede is multi-token predictie (MTP), die het checkpoint meelevert met een eigen speculative-decoding-kop en het decoderen meetbaar versnelt wanneer de serving-stack deze gebruikt.

Het is ook het videogeschikte model van de familie. Het vlaggenschip open checkpoint, Qwen3.8-2.4T-A95B, is in zijn downloadbare vorm effectief alleen-tekst, en de gehoste Qwen3.8-Max API voegt visuele mogelijkheden toe bovenop die gewichten. De 27B is het gewicht dat je daadwerkelijk kunt downloaden en draaien en dat uit de doos tekst, beeld en video ondersteunt — daarom is een CPU-pad voor de videomodus de moeite waard om in de gaten te houden.

Wat de SGLang PR {{1}}daadwerkelijk{{/1}} verandert

De pull request (sgl-project/sglang #35492) is goed afgebakend en goed te volgen. De eigen beschrijving luidt: "Deze PR voegt ondersteuning toe voor Qwen3.8 text+video, door torchcodec en ffmpeg toe te voegen en pin_memory te verwijderen." In de praktijk komt dat neer op drie wijzigingen.

torchcodec — de op ffmpeg gebaseerde videodecoderingsbibliotheek van PyTorch — wordt aan de stack toegevoegd, zodat videoframes voor Qw​en3.8 text+video op de host-CPU kunnen worden gedecodeerd en voorbewerkt. De PR koppelt torchcodec 0.12.0 aan torch 2.12, en merkt op dat ffmpeg onder versie 9 moet blijven.

pin_memory is verwijderd uit het multimodale pad. pin_memory is een optimalisatie voor GPU-overdracht die hostbuffers vastzet voor snelle asynchrone kopie naar een apparaat; het weglaten ervan op een CPU-only-pad is de aanwijzing dat de doelhardware geen discrete versneller in het gegevenspad heeft.

• Het reproductiecommando start het daadwerkelijke model — Qwen/Qwen3.8-27B — via sglang.launch_server op CPU met het tekst+video-invoerpad ingeschakeld.

Lees de statuslabels voordat je erop voortbouwt: de PR is een concept, beide CI-runs mislukken, en het wacht per vandaag nog steeds op beoordeling van de code-eigenaren van SGLang. Het is een richting, geen release. De belangrijke context is dat SGLang Qwen3.8-27B al op GPU serveert — het cookbook behandelt H200, RTX PRO 6000, RTX 5090 en DGX Spark, met een speciale lmsysorg/sglang:qwen38-27b image — dus het CPU-tekst+video-pad is het werkelijk nieuwe onderdeel.

A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.

Waarom CPU-tekst+video belangrijker is dan het klinkt

Alibaba positioneerde de 27B vanaf dag één voor edge AI — MediaTek paste het dezelfde dag dat de gewichten uitkwamen aan voor Dimensity-mobiele chips en de C-X1-automotive-cockpit. Het lokale-implementatieverhaal versterkte dat: een Q4_K_M-kwantalisatie is ongeveer 17,1 GB, wat past in een 24GB-consumenten-GPU of een Apple Silicon Mac met 32GB unified memory. Het enige dat dat verhaal niet kon, was video op een machine zonder GPU. Dat is de kloof die deze PR aanpakt.

Een CPU-tekst+videopad maakt videobegrip inzetbaar op gewone CPU-boxen — virtuele machines, kleine servers, on-premises rackunits, edge-gateways — waar de werklast asynchroon is en doorvoer belangrijker is dan latentie. Videobijschriften, contentmoderatie, document- en diagramparsing, offline zoeken in opnames: dit zijn precies de batchtaken die geen GPU nodig hebben, en vandaag veronderstellen ze er nog steeds een voor elke VLM met video-invoer.

De eerlijke afweging is dat Qwen3.8-27B een model met 27 miljard parameters is en geen enkele CPU-route maakt een 27B snel. Verwacht enkele tokens per seconde op een serieuze AVX-klasse server met videoframes in de context — levensvatbaar voor batch- en nachtelijke taken, niet voor interactieve chat over video. Het punt van de CPU-route is dat de optie überhaupt bestaat: een implementatie zonder GPU kan de videomodus van hetzelfde model draaien in plaats van terug te vallen op een kleiner vision-model of elk frame naar een cloud-GPU te sturen.

Waar Qwen3.8-27B vandaag draait

Het ecosysteem heeft het model snel ingehaald. Aan de self-host-kant heb je llama.cpp en LM Studio met GGUF-packs tot ongeveer een 10,7GB 2-bit quant, Ollama voor een one-liner, en vLLM en SGLang voor volwaardig serveren. Het meeste daarvan is tegenwoordig tekst of beeld; het videogedeelte op CPU is het deel dat nog wordt gebouwd.

Als je liever geen 27B zelf draait, bestaat de gehoste route al: OrcaRouter serveert qwen/qwen3.8-27b met tekst-, beeld- en video-ingangen, een contextvenster van 262.144 tokens, en tekstuitvoer, voor $0,33 per miljoen invoertokens en $2,40 per miljoen uitvoertokens. Het zit achter hetzelfde OpenAI-compatibele eindpunt als elk ander model op het platform — één API-sleutel, geen tweede contract — en de automatische failover en routing-DSL van het platform zijn van toepassing op de 200+ modellen op die sleutel. Een model van vijf dagen oud met een onbewezen CPU-pad is het schoolvoorbeeld van routeren in plaats van hardwiring: je kunt Qwen3.8-27B uitproberen op echte workloads achter een route zonder je hele aanroeppad in de waagschaal te stellen voor één serving-stack, en wisselen tussen zelf-gehoste en gehoste versies zonder code te wijzigen.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the capability chips Vision, Tools, JSON and Reasoning, a description of Qwen3.8-27B as Alibaba's Apache-2.0 open-weight 27B multimodal model self-hosted on OrcaRouter accepting text, images and video with a 262,144-position context window, and the price of /bin/bash.33 per 1M input tokens and .40 per 1M output tokens.

De cijfers — door leverancier gerapporteerd, en de moeite waard om te controleren

Elk hieronder genoemd cijfer is afkomstig van Alibaba zelf, uit de modelkaart en het lanceermateriaal. Het model is vijf dagen oud en onafhankelijke reproductie begint pas op gang te komen, dus behandel deze als beweringen met een duidelijke richting, niet als oordelen. Voor een 27B zijn de coderings- en agentscores de blikvangers:

• SWE-bench Pro — 61.7 (door Alibaba gerapporteerd; Alibaba's eigen tabel toont Claude Opus 4.6 Max op 53.4)

• Terminal-Bench 2.1 — 73.0 (agentisch terminalcoderen)

• OSWorld-Verified — 84.3 (taken voor computergebruik-agenten)

• AndroidWorld — 81.9

• DeepSWE 1.1 — 42.2, ongeveer het drievoudige van de 13.3 van de vorige open 27B

Op het visuele vlak — het vlak waar dit artikel echt over gaat — rapporteert Alibaba VideoMME 87.0 voor videobegrip en MathVision 90.0 voor visueel redeneren zonder tools. Artificial Analysis' vroege inschatting plaatst het model op 52 op zijn Intelligence Index en 51 op zijn Agentic Index, concurrerend met veel grotere gesloten modellen bij bepaalde redeneerinstellingen; dat zijn nog vroege scores voor een model van vijf dagen oud.

A single-column scoreboard titled 'Qwen3.8-27B — the scoreboard' with six rows: Input text + image + video, Context 262K native (1M via YaRN), VideoMME 87.0, SWE-bench Pro 61.7, License Apache 2.0, API price /bin/bash.33 / .40 per 1M, with a footer stating VideoMME and SWE-bench figures are vendor-reported with no independent scores yet and API price per OrcaRouter, and the OrcaRouter logo in the bottom-right corner.

Eén kanttekening is onevenredig belangrijk voor iedereen die het model lokaal of op CPU draait, en dat is de reasoning-knop. Qwen3.8-27B wordt geleverd met ingeschakelde denkmodus en een per verzoek in te stellen reasoning_effort-instelling (laag / medium / xhigh). De standaardinstelling xhigh denkt veel te veel na: de inmiddels beroemde eerste run van de 17GB-GGUF duurde ongeveer 21 minuten en 22.000 reasoning-tokens om een eenvoudige afbeelding te tekenen. Vooral op CPU moet je reasoning_effort bewust instellen — het verschil tussen interactief en onbruikbaar is één parameter.

Wat te kijken

Drie dingen zullen je vertellen of het CPU-pad werkelijkheid wordt:

Of PR #35492 gemerged wordt. Het is vandaag een draft met rode CI. Een gemergde, groene versie die in een release belandt, is het punt waarop het CPU-tekst+video-pad voor de rest van ons bruikbaar wordt.

Onafhankelijke benchmarks. De cijfers van 61,7 op SWE-bench Pro en 87,0 op VideoMME zijn door de leverancier gerapporteerd. De runs van LMArena en Artificial Analysis in de komende weken zullen laten zien hoeveel overeind blijft buiten Alibaba's eigen testomgeving.

Of een gehoste 1M-contextversie werkelijkheid wordt. Native 262K is al veel; een multimodale modus met een miljoen tokens is waar de besparingen op de hybride-attentioncache zichzelf terugverdienen.

Voor nu is de beslissing eenvoudig. Als je de hardware hebt, draait de 17GB Q4 GGUF plus SGLang of llama.cpp het model vandaag al, en de CPU-tekst+video-PR laat zien waar de route zonder GPU naartoe gaat. Als je dat niet hebt, is Qwen3.8-27B aanroepbaar via OrcaRouter voor $0.33 per miljoen input- en $2.40 per miljoen output-tokens achter één enkele sleutel. Hoe dan ook is het video-capabele open 27B het interessantste model om in de gaten te houden in de Qw​en 3.8-generatie — en het is vijf dagen oud.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube