Una card hero con il titolo 'Qwen3.8-27B — Testo+Video su CPU', il sottotitolo 'Nel percorso CPU di torchcodec / ffmpeg di SGLang' e tre chip con le scritte Apache 2.0, 27B pesi open, Nessuna GPU richiesta, con icone flat a linee di una cornice di riproduzione video, un chip CPU e una striscia di pellicola, e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Qwen3.8-27B Text+Video Sta Arrivando su CPU: Cosa Cambia la PR di torchcodec di SGLang

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Una bozza di pull request su SGLang in questo momento è intitolata “[CPU] Supporto Qwen3.8 text+video: aggiunta di torchcodec, ffmpeg e rimozione di pin_memory.” Al netto della parte tecnica, si legge come una tabella di marcia: Qwen3.8-27B — il modello visione-linguaggio da 27 miliardi di parametri di Alibaba, con licenza Apache-2.0, reso open source cinque giorni fa — sta venendo predisposto affinché la sua modalità text+video funzioni su hardware senza GPU a bordo. Questo è il primo segnale concreto che il 27B multimodale sta ottenendo un vero percorso di serving su CPU in uno dei runtime di inferenza che i team effettivamente distribuiscono, ed è importante per chiunque abbia aspettato di eseguire la comprensione video in locale senza acquistare una scheda da 48GB.

Non è ancora stato unito nulla in quella PR — è una bozza, la CI è rossa, e i pin delle versioni si stanno ancora muovendo. Ma è proprio per questo che vale la pena leggerla con attenzione. Il modello che c'è dietro è reale e rilasciato, l'ecosistema di serving si è già adeguato lato GPU, e questa PR mostra dove sta andando il percorso senza GPU. Ecco cosa fa effettivamente la modifica, perché l'inferenza video su CPU per un modello da 27B è più importante di quanto sembri, cosa è confermato riguardo a Qwen3.8-27B, e dove puoi chiamarlo oggi.

Il modello in un paragrafo

Qwen3.8-27B è il modello open-weight da 27B della generazione Qwen 3.8: un modello vision-language denso da ~27,8 miliardi di parametri (64 layer, hidden size 5.120) con una vision tower dedicata, rilasciato sotto licenza Apache 2.0 su Hugging Face e ModelScope la sera del 14 agosto 2026 (ora di Pechino). Accetta testo, immagini e video e restituisce testo — in modo nativo, non tramite un adattatore aggiunto a posteriori — con una finestra di contesto nativa di 262.144 token, estendibile a circa un milione tramite YaRN. La licenza è quella permissiva: uso commerciale, fine-tuning e ridistribuzione, senza soglie di fatturato e senza accordo commerciale separato, a differenza dei termini del checkpoint di punta.

Per chi effettua il deploy, due dettagli architetturali contano più delle specifiche principali. Il primo è l'attenzione ibrida: la maggior parte dei layer usa l'attenzione lineare Gated DeltaNet e solo un quarto mantiene una cache KV completa, quindi la memoria per il contesto lungo è una frazione di quella che servirebbe a un modello denso convenzionale a 64 layer — lo stesso trucco che rende realistica una finestra di 262K all'interno di una singola GPU consumer. Il secondo è la previsione multi-token (MTP), che fornisce il checkpoint con la propria testa di decodifica speculativa e accelera in modo misurabile la decodifica quando lo stack di serving la utilizza.

È anche quello della famiglia in grado di gestire video. Il checkpoint open di punta, Qwen3.8-2.4T-A95B, è di fatto solo testuale nella sua forma scaricabile, e l'API ospitata Qwen3.8-Max aggiunge la visione a quei pesi. Il 27B è il peso che puoi effettivamente scaricare ed eseguire e che gestisce testo, immagini e video fin da subito — ecco perché un percorso CPU per la sua modalità video è da tenere d'occhio.

Cosa cambia effettivamente la PR di SGLang

La pull request (sgl-project/sglang #35492) è mirata e chiara. La sua stessa descrizione: “Questa PR serve a supportare Qw​en3.8 testo+video, aggiungendo torchcodec, ffmpeg e rimuovendo pin_memory.” In pratica, si tratta di tre modifiche.

torchcodec — la libreria di decodifica video basata su ffmpeg di PyTorch — viene aggiunta allo stack, così i fotogrammi video per Qw​en3.8 text+video possono essere decodificati e preprocessati sulla CPU host. La PR fissa torchcodec 0.12.0 con torch 2.12 e nota che ffmpeg deve rimanere al di sotto della versione 9.

pin_memory è stato rimosso dal percorso multimodale. pin_memory è un'ottimizzazione per il trasferimento GPU che blocca i buffer host per una copia asincrona veloce verso un dispositivo; rimuoverlo su un percorso solo CPU è l'indizio che l'hardware di destinazione non ha un acceleratore discreto nel percorso dati.

• Il comando di riproduzione avvia il modello effettivo — Qwen/Qwen3.8-27B — tramite sglang.launch_server su CPU con il percorso di input testo+video abilitato.

Leggi le etichette di stato prima di costruirci sopra qualsiasi cosa: la PR è una bozza, entrambe le esecuzioni CI stanno fallendo e, ad oggi, è ancora in attesa di revisione da parte dei code owner di SGLang. È una direzione, non una release. Il contesto importante è che SGLang serve già Qwen3.8-27B su GPU — il cookbook copre H200, RTX PRO 6000, RTX 5090 e DGX Spark, con un'immagine dedicata lmsysorg/sglang:qwen38-27b — quindi il percorso testo+video su CPU è l'elemento davvero nuovo.

A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.

Perché il testo+video della CPU è più importante di quanto sembri

Alibaba ha posizionato il 27B per l'edge AI fin dal primo giorno — MediaTek lo ha adattato ai chip mobili Dimensity e al cockpit automotive C-X1 lo stesso giorno in cui sono stati rilasciati i pesi. La storia del deployment locale lo ha rafforzato: una quantizzazione Q4_K_M è di circa 17,1 GB, che sta in una GPU consumer da 24 GB o in un Mac Apple Silicon con 32 GB di memoria unificata. L'unica cosa che quella storia non poteva fare era l'elaborazione video su una macchina priva di GPU. Questa è la lacuna che questa PR colma.

Un percorso testo+video su CPU rende la comprensione video implementabile su normali box CPU — macchine virtuali, piccoli server, unità rack on-premise, gateway edge — dove il carico di lavoro è asincrono e il throughput conta più della latenza. Sottotitolazione video, moderazione dei contenuti, parsing di documenti e diagrammi, recupero offline da registrazioni: questi sono esattamente i lavori batch che non necessitano di una GPU, e oggi presuppongono comunque una GPU per qualsiasi VLM con input video.

Il compromesso onesto è che Qwen3.8-27B è un modello da 27 miliardi di parametri e nessun percorso CPU rende un 27B veloce. Aspettatevi token a una cifra al secondo su un server serio di classe AVX con frame video nel contesto — utilizzabile per lavori batch e notturni, non per chat interattive su video. Il punto del percorso CPU è che l'opzione esiste comunque: una distribuzione senza GPU può eseguire la modalità video dello stesso modello invece di ripiegare su un modello di visione più piccolo o inviare ogni frame a una GPU cloud.

Dove gira Qwen3.8-27B oggi

L'ecosistema si è adeguato rapidamente al modello. Sul lato self-host hai llama.cpp e LM Studio con pacchetti GGUF fino a una quantizzazione a 2 bit di circa 10,7GB, Ollama per una soluzione one-liner, e vLLM e SGLang per un serving vero e proprio. La maggior parte di questo oggi è testo o immagine; il percorso video su CPU è la parte ancora in fase di sviluppo.

Se preferisci non eseguire tu stesso un 27B, il percorso ospitato esiste già: OrcaRouter serve qwen/qwen3.8-27b con input di testo, immagini e video, una finestra di contesto di 262.144 token e output di testo, a $0,33 per milione di token in input e $2,40 per milione di token in output. Si trova dietro lo stesso endpoint compatibile con OpenAI di ogni altro modello sulla piattaforma — una sola chiave API, nessun secondo contratto — e il failover automatico della piattaforma e il DSL di routing si applicano ai 200+ modelli su quella chiave. Un modello di cinque giorni con un percorso CPU non testato è il caso da manuale per il routing invece del collegamento diretto: puoi provare Qwen3.8-27B su carichi di lavoro reali tramite un percorso senza scommettere l’intero percorso di chiamata su un unico stack di servizio, e passare da una versione self-hosted a una ospitata senza modificare il codice.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the capability chips Vision, Tools, JSON and Reasoning, a description of Qwen3.8-27B as Alibaba's Apache-2.0 open-weight 27B multimodal model self-hosted on OrcaRouter accepting text, images and video with a 262,144-position context window, and the price of /bin/bash.33 per 1M input tokens and .40 per 1M output tokens.

I numeri — dichiarati dal fornitore, e vale la pena verificarli

Ogni cifra chiave qui sotto è di Alibaba, tratta dalla scheda del modello e dai materiali di lancio. Il modello ha solo cinque giorni e le riproduzioni indipendenti stanno appena iniziando ad apparire, quindi trattate questi dati come affermazioni con una direzione chiara, non come verdetti definitivi. Per un 27B, i punteggi di coding e agenti sono ciò che cattura l'attenzione:

• SWE-bench Pro — 61.7 (riportato da Alibaba; la sua stessa tabella mostra Claude Opus 4.6 Max a 53.4)

• Terminal-Bench 2.1 — 73.0 (codifica terminale agentica)

• OSWorld-Verified — 84.3 (compiti per agenti che usano il computer)

• AndroidWorld — 81.9

• DeepSWE 1.1 — 42.2, circa il triplo del 13.3 della precedente open 27B

Sul lato della visione — il lato di cui questo articolo tratta davvero — Alibaba riporta VideoMME 87.0 per la comprensione video e MathVision 90.0 per il ragionamento visivo senza strumenti. La prima valutazione di Artificial Analysis colloca il modello a 52 sul suo Intelligence Index e a 51 sul suo Agentic Index, competitivo con modelli chiusi molto più grandi in determinate impostazioni di ragionamento; sono ancora punteggi preliminari per un modello di cinque giorni.

A single-column scoreboard titled 'Qwen3.8-27B — the scoreboard' with six rows: Input text + image + video, Context 262K native (1M via YaRN), VideoMME 87.0, SWE-bench Pro 61.7, License Apache 2.0, API price /bin/bash.33 / .40 per 1M, with a footer stating VideoMME and SWE-bench figures are vendor-reported with no independent scores yet and API price per OrcaRouter, and the OrcaRouter logo in the bottom-right corner.

Un avvertimento conta in modo sproporzionato per chiunque esegua il modello localmente o su CPU, ed è la manopola del ragionamento. Qwen3.8-27B viene fornito con la modalità di pensiero attivata e un'impostazione reasoning_effort per richiesta (low / medium / xhigh). Il valore predefinito xhigh pensa troppo, e male: il famoso primo avvio del GGUF da 17 GB ha richiesto circa 21 minuti e 22.000 token di ragionamento per disegnare un'immagine semplice. Soprattutto su CPU, imposta reasoning_effort in modo deliberato: la differenza tra interattivo e inutilizzabile è un solo parametro.

Cosa guardare

Tre cose ti diranno se il percorso della CPU diventa reale:

Se la PR #35492 verrà integrata. Oggi è una bozza con CI rossa. Una versione integrata e verde pubblicata in una release è il punto in cui il percorso CPU testo+video diventa eseguibile per il resto di noi.

Benchmark indipendenti. I punteggi di 61.7 su SWE-bench Pro e 87.0 su VideoMME sono dichiarati dal fornitore. Le esecuzioni di LMArena e Artificial Analysis nelle prossime due settimane mostreranno quanto sopravvive al di fuori dell’ambiente di test di Alibaba.

Se una versione ospitata con contesto da 1M si concretizzerà. Il contesto nativo di 262K è già molto; una modalità multimodale da un milione di token è dove i risparmi della cache di attenzione ibrida si ripagano da soli.

Per ora la decisione è semplice. Se hai l'hardware, il GGUF Q4 da 17 GB con SGLang o llama.cpp esegue il modello oggi, e la PR per text+video su CPU mostra dove sta andando il percorso senza GPU. Se non ce l'hai, Qwen3.8-27B è chiamabile tramite OrcaRouter a $0.33 per milione di token in input e $2.40 per milione di token in output con una sola chiave. In ogni caso, l'open 27B con capacità video è il modello più interessante da tenere d'occhio nella generazione Qw​en 3.8 — ed è nato solo cinque giorni fa.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube