Baner tytułowy z napisem „Qwen3.8-27B — Text+Video on CPU” i podtytułem „Inside SGLang's torchcodec / ffmpeg CPU path”, z trzema chipami z napisami „Apache 2.0”, „27B open weights” i „No GPU required”, z płaskimi ikonami liniowymi: ramką odtwarzacza wideo, chipem CPU i taśmą filmową, oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Qwen3.8-27B Text+Video trafia na CPU: Co zmienia PR torchcodec w SGLang

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Szkic pull requesta w SGLang nosi w tej chwili tytuł “[CPU] Support Qw​en3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory.” Jeśli odrzucić całą techniczną otoczkę, czyta się to jak plan działania: Qwen3.8-27B — model wizyjno-językowy Alibaba na licencji Apache-2.0, o 27 miliardach parametrów, udostępniony jako open source pięć dni temu — jest przystosowywany tak, aby jego tryb tekst+wideo działał na sprzęcie bez GPU. To pierwszy konkretny sygnał, że multimodalny model 27B dostaje prawdziwą ścieżkę serwowania na CPU w jednym ze środowisk wnioskowania, które zespoły faktycznie wdrażają, i ma to znaczenie dla każdego, kto czekał na możliwość lokalnego uruchomienia rozumienia wideo bez kupowania karty z 48 GB pamięci.

Nic w tym PR nie zostało jeszcze scalone — to szkic, CI jest czerwone, a przypięcia wersji wciąż się zmieniają. Ale właśnie dlatego warto go przeczytać uważnie. Model, który za nim stoi, jest prawdziwy i opublikowany, ekosystem serwowania już dogonił GPU, a ten PR pokazuje, dokąd zmierza ścieżka bez GPU. Oto, co ta zmiana faktycznie robi, dlaczego wnioskowanie wideo na CPU dla modelu 27B to większa sprawa, niż się wydaje, co jest potwierdzone na temat Qwen3.8-27B, i gdzie można go wywołać już dziś.

Model w jednym akapicie.

Qwen3.8-27B to model o otwartych wagach 27B z generacji Qw​en 3.8: gęsty model wizyjno-językowy z ~27,8 mld parametrów (64 warstwy, ukryty wymiar 5120) z dedykowaną wieżą wizyjną, wydany na licencji Apache 2.0 w serwisach Hugging Face i ModelScope wieczorem 14 sierpnia 2026 r. (czasu pekińskiego). Przyjmuje tekst, obrazy i wideo, a zwraca tekst — natywnie, a nie przez doczepiany adapter — z natywnym oknem kontekstu wynoszącym 262 144 tokenów, które można rozszerzyć do około miliona za pomocą YaRN. Licencja jest liberalna: użycie komercyjne, dostrajanie i redystrybucja, bez progu przychodów i bez odrębnej umowy handlowej, w przeciwieństwie do warunków flagowego checkpointu.

Dla wdrażającego dwa szczegóły architektoniczne liczą się bardziej niż główne specyfikacje. Pierwszy to hybrydowa uwaga: większość warstw używa liniowej uwagi Gated DeltaNet, a tylko jedna czwarta utrzymuje pełną pamięć podręczną KV, więc pamięć dla długiego kontekstu to ułamek tego, czego potrzebuje konwencjonalny gęsty model o 64 warstwach — ten sam trik, który sprawia, że okno 262K jest realne na pojedynczym GPU klasy konsumenckiej. Drugi to przewidywanie wielu tokenów (MTP), które dostarcza punkt kontrolny z własną głową dekodowania spekulatywnego i wymiernie przyspiesza dekodowanie, gdy stos serwujący go używa.

Jest to również model z tej rodziny obsługujący wideo. Flagowy otwarty checkpoint, Qwen3.8-2.4T-A95B, w swojej do pobrania formie jest praktycznie tylko tekstowy, a hostowany Qwen3.8-Max API dodaje widzenie do tych wag. Wersja 27B to waga, którą faktycznie można pobrać i uruchomić, obsługująca tekst, obraz i wideo od razu po wyjęciu z pudełka — dlatego ścieżka CPU dla jej trybu wideo jest warta uwagi.

Co właściwie zmienia PR SGLang

Pull request (sgl-project/sglang #35492) jest wąski i przejrzysty. Jego opis: „Ten PR ma wspierać Qw​en3.8 text+video, poprzez dodanie torchcodec, ffmpeg i usunięcie pin_memory.” W praktyce to trzy kroki.

torchcodec — PyTorch’s ffmpeg-backed video decoding library — is added to the stack, so video frames for Qw​en3.8 text+video can be decoded and preprocessed on the host CPU. The PR pins torchcodec 0.12.0 against torch 2.12, and notes that ffmpeg must stay below version 9.

pin_memory zostało usunięte ze ścieżki multimodalnej. pin_memory to optymalizacja transferu GPU, która przypina bufory hosta w celu szybkiego asynchronicznego kopiowania do urządzenia; usunięcie go na ścieżce tylko CPU świadczy o tym, że docelowy sprzęt nie ma dyskretnego akceleratora w ścieżce danych.

Polecenie reprodukcji uruchamia faktyczny model — Qwen/Qwen3.8-27B — przez sglang.launch_server na CPU z włączoną ścieżką wejścia tekst+wideo.

Przeczytaj etykiety statusu, zanim cokolwiek na tym zbudujesz: PR jest szkicem, oba przebiegi CI kończą się niepowodzeniem, a na dziś wciąż czeka na przegląd właścicieli kodu SGLang. To kierunek, a nie wydanie. Istotny kontekst jest taki, że SGLang już obsługuje Qwen3.8-27B na GPU — cookbook obejmuje H200, RTX PRO 6000, RTX 5090 i DGX Spark, z dedykowanym obrazem lmsysorg/sglang:qwen38-27b — więc ścieżka tekst+wideo na CPU jest naprawdę nowym elementem.

A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.

Dlaczego tekst+video na CPU ma większe znaczenie, niż się wydaje

Alibaba od samego początku pozycjonował 27B jako model do edge AI — MediaTek zaadaptował go do chipów mobilnych Dimensity i kokpitu samochodowego C-X1 tego samego dnia, w którym udostępniono wagi. Narracja o lokalnym wdrożeniu to wzmocniła: kwantyzacja Q4_K_M to około 17,1 GB, co mieści się w konsumenckim GPU z 24 GB pamięci lub Macu z Apple Silicon i 32 GB pamięci zunifikowanej. Jedyną rzeczą, jakiej ta historia nie mogła dokonać, było odtwarzanie wideo na maszynie bez GPU. To właśnie tę lukę wypełnia ten PR.

Dzięki ścieżce tekst+video na CPU rozumienie wideo można wdrażać na zwykłych maszynach CPU — maszynach wirtualnych, małych serwerach, lokalnych szafach rack, bramkach brzegowych — gdzie obciążenie jest asynchroniczne, a przepustowość ma większe znaczenie niż opóźnienie. Generowanie opisów wideo, moderacja treści, analiza dokumentów i diagramów, wyszukiwanie offline w nagraniach: to dokładnie te zadania wsadowe, które nie potrzebują GPU, a dziś wciąż zakładają jego obecność dla każdego VLM z wejściem wideo.

Uczciwy kompromis polega na tym, że Qwen3.8-27B to model o 27 miliardach parametrów i żadna ścieżka CPU nie sprawi, że 27B będzie szybki. Należy spodziewać się jednocyfrowej liczby tokenów na sekundę na solidnym serwerze klasy AVX z klatkami wideo w kontekście — wystarczająco do zadań wsadowych i nocnych, ale nie do interaktywnego czatu na wideo. Sedno ścieżki CPU tkwi w tym, że ta opcja w ogóle istnieje: wdrożenie bez GPU może uruchomić tryb wideo tego samego modelu zamiast schodzić do mniejszego modelu wizyjnego lub wysyłać każdą klatkę do chmurowego GPU.

Gdzie dziś działa Qwen3.8-27B

Ekosystem szybko dogonił model. Po stronie self-hostingu masz llama.cpp i LM Studio z pakietami GGUF aż do mniej więcej 10.7GB kwantyzacji 2-bitowej, Ollama do jednego polecenia, oraz vLLM i SGLang do właściwego serwowania. Większość z tego to dziś tekst lub obraz; ścieżka wideo na CPU to część wciąż budowana.

Jeśli wolisz nie uruchamiać samodzielnie modelu 27B, hostowana trasa już istnieje: OrcaRouter obsługuje qwen/qwen3.8-27b z wejściami tekstowymi, obrazowymi i wideo, oknem kontekstowym o długości 262,144 tokenów i wyjściem tekstowym, po cenie 0,33 USD za milion tokenów wejściowych i 2,40 USD za milion tokenów wyjściowych. Jest dostępny za tym samym punktem końcowym zgodnym z OpenAI, co każdy inny model na platformie — jeden klucz API, bez drugiej umowy — a automatyczne przełączanie awaryjne i DSL routingu platformy dotyczą ponad 200 modeli na tym kluczu. Model liczący pięć dni z nieprzetestowaną ścieżką CPU to podręcznikowy przykład routingu zamiast podłączania na sztywno: możesz wypróbować Qwen3.8-27B na rzeczywistych obciążeniach za pośrednictwem trasy, nie stawiając całej ścieżki wywołań na jednym stosie serwującym, i przełączać się między wersją self-hosted a hostowaną bez zmiany kodu.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the capability chips Vision, Tools, JSON and Reasoning, a description of Qwen3.8-27B as Alibaba's Apache-2.0 open-weight 27B multimodal model self-hosted on OrcaRouter accepting text, images and video with a 262,144-position context window, and the price of /bin/bash.33 per 1M input tokens and .40 per 1M output tokens.

Liczby — podawane przez dostawcę, i warto je sprawdzić.

Każda liczba w nagłówkach poniżej pochodzi od samego Alibaba, z karty modelu i materiałów premierowych. Model ma zaledwie pięć dni, a niezależne odtworzenia dopiero zaczynają się pojawiać, więc traktuj te wartości jako twierdzenia o wyraźnym kierunku, a nie jako rozstrzygnięcia. Jak na model 27B, wyniki w kodowaniu i w zadaniach agentowych najbardziej przyciągają uwagę:

• SWE-bench Pro — 61,7 (raportowane przez Alibaba; ich własna tabela pokazuje Claude Opus 4.6 Max na poziomie 53,4)

Terminal-Bench 2.1 — 73.0 (agentowe kodowanie terminalowe)

OSWorld-Verified — 84.3 (zadania agentów korzystających z komputera)

• AndroidWorld — 81.9

• DeepSWE 1.1 — 42,2, mniej więcej trzykrotność wyniku 13,3 poprzedniego otwartego 27B.

Po stronie wizji — tej stronie, o której naprawdę jest ten artykuł — Alibaba podaje VideoMME 87.0 dla rozumienia wideo i MathVision 90.0 dla wizualnego rozumowania bez narzędzi. Wstępna ocena Artificial Analysis plasuje model na 52 w swoim Indeksie Inteligencji i 51 w Indeksie Agencyjnym, co przy pewnych ustawieniach rozumowania jest konkurencyjne wobec znacznie większych modeli zamkniętych; to wciąż wstępne wyniki dla modelu, który ma zaledwie pięć dni.

A single-column scoreboard titled 'Qwen3.8-27B — the scoreboard' with six rows: Input text + image + video, Context 262K native (1M via YaRN), VideoMME 87.0, SWE-bench Pro 61.7, License Apache 2.0, API price /bin/bash.33 / .40 per 1M, with a footer stating VideoMME and SWE-bench figures are vendor-reported with no independent scores yet and API price per OrcaRouter, and the OrcaRouter logo in the bottom-right corner.

Jeden aspekt ma nieproporcjonalnie duże znaczenie dla każdego, kto uruchamia model lokalnie lub na CPU: chodzi o parametr rozumowania. Qwen3.8-27B jest dostarczany z włączonym trybem myślenia i ustawieniem reasoning_effort dla każdego żądania (low / medium / xhigh). Domyślne ustawienie xhigh nadmiernie rozmyśla: słynne już pierwsze uruchomienie 17GB GGUF zajęło około 21 minut i 22 000 tokenów rozumowania, aby narysować prosty obraz. Szczególnie na CPU ustawiaj reasoning_effort świadomie — różnica między interaktywnym a bezużytecznym to jeden parametr.

Co obejrzeć

Trzy rzeczy wskażą ci, czy ścieżka CPU stanie się realna:

Czy PR #35492 zostanie scalony. Jest to dziś szkic z czerwonym CI. Scalona, zielona wersja trafiająca do wydania to moment, w którym ścieżka CPU text+video staje się uruchamialna dla reszty z nas.

Niezależne benchmarki. Wyniki 61.7 SWE-bench Pro i 87.0 VideoMME są podawane przez dostawcę. Testy LMArena i Artificial Analysis w ciągu najbliższych kilku tygodni pokażą, ile z tego przetrwa poza własnym środowiskiem testowym Alibaba.

Czy zmaterializuje się hostowana wersja z kontekstem 1M. Natywne 262K to już dużo; to w trybie multimodalnym na milion tokenów oszczędności z pamięci podręcznej hybrydowej atencji zwracają się z nawiązką.

Na razie decyzja jest prosta. Jeśli masz odpowiedni sprzęt, 17GB Q4 GGUF z SGLang lub llama.cpp uruchomi model już dziś, a PR dotyczący tekstu i wideo na CPU pokazuje, dokąd zmierza ścieżka bez GPU. Jeśli nie masz, Qwen3.8-27B jest dostępny przez OrcaRouter za 0,33 USD za milion tokenów wejściowych i 2,40 USD za milion tokenów wyjściowych, za pomocą jednego klucza. Tak czy inaczej, otwarty model 27B obsługujący wideo to najciekawszy model do obserwowania w generacji Qw​en 3.8 — i ma zaledwie pięć dni.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube