Eine Hero-Titelkarte mit dem Text „Qwen3.8-27B — Text+Video auf CPU“, dem Untertitel „In SGLangs torchcodec / ffmpeg CPU-Pfad“ und drei Chips mit der Aufschrift Apache 2.0, 27B offene Gewichte, Keine GPU erforderlich, mit flachen Linien-Symbolen für einen Video-Play-Rahmen, einen CPU-Chip und einen Filmstreifen sowie dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Qwen3.8-27B Text+Video kommt auf die CPU: Was SGLangs torchcodec-PR ändert

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ein Entwurf eines Pull Requests in SGLang trägt aktuell den Titel „[CPU] Support Qw​en3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory“. Entfernt man den technischen Ballast, liest er sich wie eine Roadmap: Qwen3.8-27B — das von Alibaba unter Apache-2.0 veröffentlichte Vision-Language-Modell mit 27 Milliarden Parametern, das vor fünf Tagen als Open Source bereitgestellt wurde — wird so integriert, dass sein Text+Video-Modus auf Hardware ohne eingebaute GPU läuft. Das ist das erste konkrete Signal, dass das multimodale 27B-Modell einen echten CPU-Serving-Pfad in einer der Inferenz-Runtimes erhält, die Teams tatsächlich einsetzen, und es ist wichtig für alle, die darauf gewartet haben, Video-Understanding lokal auszuführen, ohne eine 48-GB-Karte kaufen zu müssen.

Nichts in diesem PR ist bereits gemerged – es ist ein Entwurf, die CI ist rot, und die Versions-Pins sind noch in Bewegung. Aber genau deshalb lohnt es sich, ihn sorgfältig zu lesen. Das Modell dahinter ist real und veröffentlicht, das Serving-Ökosystem hat auf der GPU bereits aufgeholt, und dieser PR zeigt, wohin der Weg ohne GPU führt. Hier ist, was die Änderung tatsächlich bewirkt, warum CPU-Videoinferenz für ein 27B-Modell eine größere Sache ist, als es klingt, was über Qwen3.8-27B bestätigt ist, und wo man es heute aufrufen kann.

Das Modell in einem Absatz.

Qwen3.8-27B ist das Open-Weight-Modell mit 27B Parametern der Qw​en-3.8-Generation: ein dichtes Vision-Language-Modell mit ~27,8 Mrd. Parametern (64 Schichten, Hidden Size 5.120) mit einem dedizierten Vision-Tower, veröffentlicht unter Apache 2.0 auf Hugging Face und ModelScope am Abend des 14. August 2026 (Peking-Zeit). Es akzeptiert Text, Bilder und Videos und gibt Text zurück — nativ, nicht über einen aufgesetzten Adapter — mit einem nativen Kontextfenster von 262.144 Token, erweiterbar auf etwa eine Million per YaRN. Die Lizenz ist die permissive: kommerzielle Nutzung, Feintuning und Weiterverbreitung, ohne Umsatzschwelle und ohne separate kommerzielle Vereinbarung, anders als die Bedingungen des Flaggschiff-Checkpoints.

Zwei architektonische Details sind für den Bereitsteller wichtiger als die Spezifikationen im Datenblatt. Das erste ist die hybride Attention: Die meisten Schichten nutzen lineare Gated-DeltaNet-Attention und nur ein Viertel behält einen vollständigen KV-Cache, sodass der Langkontext-Speicher nur einen Bruchteil dessen ausmacht, was ein herkömmliches dichtes Modell mit 64 Schichten benötigt – derselbe Trick, der ein 262K-Fenster in einer einzigen Consumer-GPU realistisch macht. Das zweite ist die Multi-Token-Vorhersage (MTP), die den Checkpoint samt eigenem Head für spekulatives Decoding ausliefert und die Dekodierung messbar beschleunigt, wenn der Serving-Stack sie verwendet.

Es ist auch das videofähige Modell der Familie. Das Flaggschiff unter den offenen Checkpoints, {{1}}Qwen3.8-2.4T-A95B{{/1}}, ist in seiner herunterladbaren Form praktisch auf Text beschränkt, und die gehostete {{2}}Qwen3.8-Max{{/2}}-API fügt diesen Gewichten Bildverständnis hinzu. Bei der {{3}}27B{{/3}} handelt es sich um das Gewicht, das man tatsächlich herunterladen und ausführen kann und das von Haus aus Text, Bild und Video unterstützt – weshalb ein CPU-Pfad für ihren Videomodus Beachtung verdient.

Was die SGLang-PR tatsächlich ändert

Der Pull-Request (sgl-project/sglang #35492) ist schmal und gut lesbar. Seine eigene Beschreibung: „Dieser PR dient dazu, Qwen3.8 Text+Video zu unterstützen, indem torchcodec und ffmpeg hinzugefügt und pin_memory entfernt werden.“ In der Praxis sind das drei Änderungen.

torchcodec — PyTorchs ffmpeg-gestützte Videodekodierungs-Bibliothek — wird dem Stack hinzugefügt, sodass Videoframes für Qwen3.8 text+video auf der Host-CPU dekodiert und vorverarbeitet werden können. Der PR pinnt torchcodec 0.12.0 auf torch 2.12 und weist darauf hin, dass ffmpeg unter Version 9 bleiben muss.

pin_memory ist entfernt aus dem multimodalen Pfad. pin_memory ist eine GPU-Transfer-Optimierung, die Host-Puffer für schnelles asynchrones Kopieren auf ein Gerät pinnt; das Entfernen auf einem CPU-only-Pfad ist der Hinweis darauf, dass die Zielhardware keinen diskreten Beschleuniger im Datenpfad hat.

• Der Reproduktionsbefehl startet das eigentliche Modell — Qwen/Qwen3.8-27B — über sglang.launch_server auf der CPU mit aktiviertem Text+Video-Eingabepfad.

Lies die Status-Labels, bevor du irgendetwas darauf aufbaust: Der PR ist ein Entwurf, beide CI-Läufe schlagen fehl, und er wartet stand heute auf die Überprüfung durch die Code-Owner von SGLang. Es ist eine Richtung, keine Veröffentlichung. Der wichtige Kontext ist, dass SGLang bereits Qwen3.8-27B auf der GPU bereitstellt – das Kochbuch deckt H200, RTX PRO 6000, RTX 5090 und DGX Spark ab, mit einem dedizierten lmsysorg/sglang:qwen38-27b-Image –, sodass der CPU-Text+Video-Pfad das wirklich neue Element ist.

A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.

Warum CPU-Text+Video wichtiger ist, als es klingt

Alibaba positionierte die 27B von Anfang an für Edge AI — MediaTek passte sie am selben Tag, an dem die Gewichte veröffentlicht wurden, an Dimensity-Mobilchips und das C-X1-Automobil-Cockpit an. Die Geschichte der lokalen Bereitstellung untermauerte das: Eine Q4_K_M-Quantisierung umfasst etwa 17,1 GB und passt in eine 24-GB-Consumer-GPU oder einen Apple-Silicon-Mac mit 32 GB einheitlichem Speicher. Das Einzige, was diese Geschichte nicht konnte, war Video auf einem Rechner ganz ohne GPU. Genau diese Lücke schließt dieser PR.

Ein CPU-Text+Video-Pfad macht Video-Verständnis auf einfachen CPU-Boxen einsetzbar – virtuelle Maschinen, kleine Server, On-Premises-Rack-Einheiten, Edge-Gateways – wo die Arbeitslast asynchron ist und der Durchsatz mehr zählt als die Latenz. Video-Captioning, Content-Moderation, Dokument- und Diagramm-Parsing, Offline-Retrieval über Aufnahmen: Das sind genau die Batch-Jobs, die keine GPU benötigen – und heute setzen sie für jedes VLM mit Video-Eingabe dennoch eine voraus.

Der ehrliche Kompromiss ist, dass Qwen3.8-27B ein Modell mit 27 Milliarden Parametern ist und kein CPU-Pfad ein 27B-Modell schnell macht. Erwarte einstellige Tokens pro Sekunde auf einem ernsthaften AVX-Server mit Videoframes im Kontext – brauchbar für Batch- und Nachtjobs, nicht für interaktiven Chat über Video. Der Sinn des CPU-Pfads besteht darin, dass die Option überhaupt existiert: Eine Bereitstellung ohne GPU kann denselben Videomodus des Modells ausführen, anstatt auf ein kleineres Vision-Modell auszuweichen oder jeden Frame an eine Cloud-GPU zu senden.

Wo Qwen3.8-27B heute läuft

Das Ökosystem hat schnell zum Modell aufgeschlossen. Auf der Self-Host-Seite gibt es llama.cpp und LM Studio mit GGUF-Paketen bis hinunter zu einem etwa 10,7 GB großen 2-Bit-Quant, Ollama für einen Einzeiler und vLLM und SGLang für ordentliches Serving. Das meiste davon ist heute Text oder Bild; der Videopfad auf der CPU ist der Teil, der noch im Aufbau ist.

Wenn Sie nicht selbst ein 27B-Modell betreiben möchten, existiert die gehostete Route bereits: OrcaRouter stellt qwen/qwen3.8-27b mit Text-, Bild- und Videoeingaben, einem Kontextfenster von 262.144 Token und Textausgabe zu 0,33 $ pro Million Eingabe-Token und 2,40 $ pro Million Ausgabe-Token bereit. Es befindet sich hinter demselben OpenAI-kompatiblen Endpunkt wie jedes andere Modell auf der Plattform – ein API-Schlüssel, kein zweiter Vertrag – und das automatische Failover und die Routing-DSL der Plattform gelten für die 200+ Modelle auf diesem Schlüssel. Ein erst fünf Tage altes Modell mit unerprobtem CPU-Pfad ist der Lehrbuchfall für Routing statt fester Verdrahtung: Sie können Qwen3.8-27B hinter einer Route mit realen Workloads ausprobieren, ohne Ihren gesamten Aufrufpfad auf einen einzigen Serving-Stack zu setzen, und zwischen selbst gehosteten und gehosteten Versionen wechseln, ohne Code zu ändern.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the capability chips Vision, Tools, JSON and Reasoning, a description of Qwen3.8-27B as Alibaba's Apache-2.0 open-weight 27B multimodal model self-hosted on OrcaRouter accepting text, images and video with a 262,144-position context window, and the price of /bin/bash.33 per 1M input tokens and .40 per 1M output tokens.

Die Zahlen — vom Hersteller angegeben und einer Überprüfung wert

Jede unten aufgeführte Kennzahl stammt von Alibaba selbst, aus dem Model Card und den Launch-Materialien. Das Modell ist fünf Tage alt und unabhängige Reproduktionen beginnen erst zu erscheinen, also behandeln Sie diese als Behauptungen mit einer klaren Richtung und nicht als endgültige Urteile. Bei einem 27B-Modell sind die Coding- und Agenten-Werte die Aufmerksamkeitsmagneten:

• SWE-bench Pro — 61,7 (von Alibaba gemeldet; die eigene Tabelle zeigt Claude Opus 4.6 Max bei 53,4)

• Terminal-Bench 2.1 — 73.0 (agentisches Terminal-Coding)

• OSWorld-Verified — 84.3 (Aufgaben für Computer-Use-Agenten)

• AndroidWorld — 81.9

• DeepSWE 1.1 — 42,2, etwa das Dreifache der 13,3 des vorherigen offenen 27B

Auf der Vision-Seite – der Seite, um die es in diesem Artikel eigentlich geht – meldet Alibaba VideoMME 87.0 für das Verständnis von Videos und MathVision 90.0 für visuelles Denken ohne Werkzeuge. Die frühe Einschätzung von Artificial Analysis setzt das Modell auf 52 beim Intelligence Index und 51 beim Agentic Index, konkurrenzfähig mit viel größeren geschlossenen Modellen bei bestimmten Reasoning-Einstellungen; das sind immer noch frühe Werte für ein fünf Tage altes Modell.

A single-column scoreboard titled 'Qwen3.8-27B — the scoreboard' with six rows: Input text + image + video, Context 262K native (1M via YaRN), VideoMME 87.0, SWE-bench Pro 61.7, License Apache 2.0, API price /bin/bash.33 / .40 per 1M, with a footer stating VideoMME and SWE-bench figures are vendor-reported with no independent scores yet and API price per OrcaRouter, and the OrcaRouter logo in the bottom-right corner.

Eine Einschränkung ist für alle, die das Modell lokal oder auf der CPU ausführen, überproportional wichtig: der Reasoning-Regler. Qwen3.8-27B wird mit aktiviertem Denkmodus und einer Pro-Anfrage-Einstellung reasoning_effort (low / medium / xhigh) ausgeliefert. Der Standardwert xhigh denkt stark über: Der inzwischen berühmte erste Lauf des 17-GB-GGUF dauerte etwa 21 Minuten und 22.000 Reasoning-Tokens, um ein einfaches Bild zu zeichnen. Besonders auf der CPU sollte man reasoning_effort bewusst setzen – der Unterschied zwischen interaktiv und unbrauchbar ist ein einziger Parameter.

Was zu sehen

Drei Dinge werden Ihnen sagen, ob der CPU-Pfad real wird:

Ob PR #35492 gemergt wird. Er ist heute ein Entwurf mit roter CI. Eine gemergte, grüne Version, die in einem Release landet, ist der Zeitpunkt, an dem der Text+Video-Pfad der CPU für den Rest von uns lauffähig wird.

Unabhängige Benchmarks. Die Werte für SWE-bench Pro (61,7) und VideoMME (87,0) wurden vom Anbieter gemeldet. Läufe von LMArena und Artificial Analysis in den nächsten Wochen werden zeigen, wie viel außerhalb von Alibabas eigener Testumgebung Bestand hat.

Ob eine gehostete 1M-Kontext-Version Realität wird. Nativ ist 262K bereits viel; ein multimodaler Modus mit einer Million Token ist der Punkt, an dem sich die Cache-Ersparnisse der Hybrid-Attention auszahlen.

Vorerst ist die Entscheidung einfach. Wenn Sie die Hardware haben, läuft das Modell heute mit {{1}}17GB Q4 GGUF plus SGLang oder llama.cpp{{/1}}, und der CPU-Text+Video-PR zeigt, wohin der Weg ohne GPU führt. Falls nicht, ist {{2}}Qwen3.8-27B{{/2}} über {{3}}OrcaRouter{{/3}} mit einem einzigen Schlüssel für {{4}}$0,33 pro Million Input-Tokens und $2,40 pro Million Output-Tokens{{/4}} aufrufbar. So oder so ist das videofähige offene 27B-Modell das interessanteste Modell, das man in der {{5}}Qw​en 3.8{{/5}}-Generation im Auge behalten sollte — und es ist erst fünf Tage alt.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube