
Qwen3.8-27B Text+Video Sta Arrivando su CPU: Cosa Cambia la PR di torchcodec di SGLang
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 232 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
Una bozza di pull request su SGLang in questo momento è intitolata “[CPU] Supporto Qwen3.8 text+video: aggiunta di torchcodec, ffmpeg e rimozione di pin_memory.” Al netto della parte tecnica, si legge come una tabella di marcia: Qwen3.8-27B — il modello visione-linguaggio da 27 miliardi di parametri di Alibaba, con licenza Apache-2.0, reso open source cinque giorni fa — sta venendo predisposto affinché la sua modalità text+video funzioni su hardware senza GPU a bordo. Questo è il primo segnale concreto che il 27B multimodale sta ottenendo un vero percorso di serving su CPU in uno dei runtime di inferenza che i team effettivamente distribuiscono, ed è importante per chiunque abbia aspettato di eseguire la comprensione video in locale senza acquistare una scheda da 48GB.
Non è ancora stato unito nulla in quella PR — è una bozza, la CI è rossa, e i pin delle versioni si stanno ancora muovendo. Ma è proprio per questo che vale la pena leggerla con attenzione. Il modello che c'è dietro è reale e rilasciato, l'ecosistema di serving si è già adeguato lato GPU, e questa PR mostra dove sta andando il percorso senza GPU. Ecco cosa fa effettivamente la modifica, perché l'inferenza video su CPU per un modello da 27B è più importante di quanto sembri, cosa è confermato riguardo a Qwen3.8-27B, e dove puoi chiamarlo oggi.
Il modello in un paragrafo
Qwen3.8-27B è il modello open-weight da 27B della generazione Qwen 3.8: un modello vision-language denso da ~27,8 miliardi di parametri (64 layer, hidden size 5.120) con una vision tower dedicata, rilasciato sotto licenza Apache 2.0 su Hugging Face e ModelScope la sera del 14 agosto 2026 (ora di Pechino). Accetta testo, immagini e video e restituisce testo — in modo nativo, non tramite un adattatore aggiunto a posteriori — con una finestra di contesto nativa di 262.144 token, estendibile a circa un milione tramite YaRN. La licenza è quella permissiva: uso commerciale, fine-tuning e ridistribuzione, senza soglie di fatturato e senza accordo commerciale separato, a differenza dei termini del checkpoint di punta.
Per chi effettua il deploy, due dettagli architetturali contano più delle specifiche principali. Il primo è l'attenzione ibrida: la maggior parte dei layer usa l'attenzione lineare Gated DeltaNet e solo un quarto mantiene una cache KV completa, quindi la memoria per il contesto lungo è una frazione di quella che servirebbe a un modello denso convenzionale a 64 layer — lo stesso trucco che rende realistica una finestra di 262K all'interno di una singola GPU consumer. Il secondo è la previsione multi-token (MTP), che fornisce il checkpoint con la propria testa di decodifica speculativa e accelera in modo misurabile la decodifica quando lo stack di serving la utilizza.
È anche quello della famiglia in grado di gestire video. Il checkpoint open di punta, Qwen3.8-2.4T-A95B, è di fatto solo testuale nella sua forma scaricabile, e l'API ospitata Qwen3.8-Max aggiunge la visione a quei pesi. Il 27B è il peso che puoi effettivamente scaricare ed eseguire e che gestisce testo, immagini e video fin da subito — ecco perché un percorso CPU per la sua modalità video è da tenere d'occhio.
Cosa cambia effettivamente la PR di SGLang
La pull request (sgl-project/sglang #35492) è mirata e chiara. La sua stessa descrizione: “Questa PR serve a supportare Qwen3.8 testo+video, aggiungendo torchcodec, ffmpeg e rimuovendo pin_memory.” In pratica, si tratta di tre modifiche.
• torchcodec — la libreria di decodifica video basata su ffmpeg di PyTorch — viene aggiunta allo stack, così i fotogrammi video per Qwen3.8 text+video possono essere decodificati e preprocessati sulla CPU host. La PR fissa torchcodec 0.12.0 con torch 2.12 e nota che ffmpeg deve rimanere al di sotto della versione 9.
• pin_memory è stato rimosso dal percorso multimodale. pin_memory è un'ottimizzazione per il trasferimento GPU che blocca i buffer host per una copia asincrona veloce verso un dispositivo; rimuoverlo su un percorso solo CPU è l'indizio che l'hardware di destinazione non ha un acceleratore discreto nel percorso dati.
• Il comando di riproduzione avvia il modello effettivo — Qwen/Qwen3.8-27B — tramite sglang.launch_server su CPU con il percorso di input testo+video abilitato.
Leggi le etichette di stato prima di costruirci sopra qualsiasi cosa: la PR è una bozza, entrambe le esecuzioni CI stanno fallendo e, ad oggi, è ancora in attesa di revisione da parte dei code owner di SGLang. È una direzione, non una release. Il contesto importante è che SGLang serve già Qwen3.8-27B su GPU — il cookbook copre H200, RTX PRO 6000, RTX 5090 e DGX Spark, con un'immagine dedicata lmsysorg/sglang:qwen38-27b — quindi il percorso testo+video su CPU è l'elemento davvero nuovo.
![A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.](https://cms.orcarouter.ai/api/media/file/2-375.png)
Perché il testo+video della CPU è più importante di quanto sembri
Alibaba ha posizionato il 27B per l'edge AI fin dal primo giorno — MediaTek lo ha adattato ai chip mobili Dimensity e al cockpit automotive C-X1 lo stesso giorno in cui sono stati rilasciati i pesi. La storia del deployment locale lo ha rafforzato: una quantizzazione Q4_K_M è di circa 17,1 GB, che sta in una GPU consumer da 24 GB o in un Mac Apple Silicon con 32 GB di memoria unificata. L'unica cosa che quella storia non poteva fare era l'elaborazione video su una macchina priva di GPU. Questa è la lacuna che questa PR colma.
Un percorso testo+video su CPU rende la comprensione video implementabile su normali box CPU — macchine virtuali, piccoli server, unità rack on-premise, gateway edge — dove il carico di lavoro è asincrono e il throughput conta più della latenza. Sottotitolazione video, moderazione dei contenuti, parsing di documenti e diagrammi, recupero offline da registrazioni: questi sono esattamente i lavori batch che non necessitano di una GPU, e oggi presuppongono comunque una GPU per qualsiasi VLM con input video.
Il compromesso onesto è che Qwen3.8-27B è un modello da 27 miliardi di parametri e nessun percorso CPU rende un 27B veloce. Aspettatevi token a una cifra al secondo su un server serio di classe AVX con frame video nel contesto — utilizzabile per lavori batch e notturni, non per chat interattive su video. Il punto del percorso CPU è che l'opzione esiste comunque: una distribuzione senza GPU può eseguire la modalità video dello stesso modello invece di ripiegare su un modello di visione più piccolo o inviare ogni frame a una GPU cloud.
Dove gira Qwen3.8-27B oggi
L'ecosistema si è adeguato rapidamente al modello. Sul lato self-host hai llama.cpp e LM Studio con pacchetti GGUF fino a una quantizzazione a 2 bit di circa 10,7GB, Ollama per una soluzione one-liner, e vLLM e SGLang per un serving vero e proprio. La maggior parte di questo oggi è testo o immagine; il percorso video su CPU è la parte ancora in fase di sviluppo.
Se preferisci non eseguire tu stesso un 27B, il percorso ospitato esiste già: OrcaRouter serve qwen/qwen3.8-27b con input di testo, immagini e video, una finestra di contesto di 262.144 token e output di testo, a $0,33 per milione di token in input e $2,40 per milione di token in output. Si trova dietro lo stesso endpoint compatibile con OpenAI di ogni altro modello sulla piattaforma — una sola chiave API, nessun secondo contratto — e il failover automatico della piattaforma e il DSL di routing si applicano ai 200+ modelli su quella chiave. Un modello di cinque giorni con un percorso CPU non testato è il caso da manuale per il routing invece del collegamento diretto: puoi provare Qwen3.8-27B su carichi di lavoro reali tramite un percorso senza scommettere l’intero percorso di chiamata su un unico stack di servizio, e passare da una versione self-hosted a una ospitata senza modificare il codice.

I numeri — dichiarati dal fornitore, e vale la pena verificarli
Ogni cifra chiave qui sotto è di Alibaba, tratta dalla scheda del modello e dai materiali di lancio. Il modello ha solo cinque giorni e le riproduzioni indipendenti stanno appena iniziando ad apparire, quindi trattate questi dati come affermazioni con una direzione chiara, non come verdetti definitivi. Per un 27B, i punteggi di coding e agenti sono ciò che cattura l'attenzione:
• SWE-bench Pro — 61.7 (riportato da Alibaba; la sua stessa tabella mostra Claude Opus 4.6 Max a 53.4)
• Terminal-Bench 2.1 — 73.0 (codifica terminale agentica)
• OSWorld-Verified — 84.3 (compiti per agenti che usano il computer)
• AndroidWorld — 81.9
• DeepSWE 1.1 — 42.2, circa il triplo del 13.3 della precedente open 27B
Sul lato della visione — il lato di cui questo articolo tratta davvero — Alibaba riporta VideoMME 87.0 per la comprensione video e MathVision 90.0 per il ragionamento visivo senza strumenti. La prima valutazione di Artificial Analysis colloca il modello a 52 sul suo Intelligence Index e a 51 sul suo Agentic Index, competitivo con modelli chiusi molto più grandi in determinate impostazioni di ragionamento; sono ancora punteggi preliminari per un modello di cinque giorni.

Un avvertimento conta in modo sproporzionato per chiunque esegua il modello localmente o su CPU, ed è la manopola del ragionamento. Qwen3.8-27B viene fornito con la modalità di pensiero attivata e un'impostazione reasoning_effort per richiesta (low / medium / xhigh). Il valore predefinito xhigh pensa troppo, e male: il famoso primo avvio del GGUF da 17 GB ha richiesto circa 21 minuti e 22.000 token di ragionamento per disegnare un'immagine semplice. Soprattutto su CPU, imposta reasoning_effort in modo deliberato: la differenza tra interattivo e inutilizzabile è un solo parametro.
Cosa guardare
Tre cose ti diranno se il percorso della CPU diventa reale:
• Se la PR #35492 verrà integrata. Oggi è una bozza con CI rossa. Una versione integrata e verde pubblicata in una release è il punto in cui il percorso CPU testo+video diventa eseguibile per il resto di noi.
• Benchmark indipendenti. I punteggi di 61.7 su SWE-bench Pro e 87.0 su VideoMME sono dichiarati dal fornitore. Le esecuzioni di LMArena e Artificial Analysis nelle prossime due settimane mostreranno quanto sopravvive al di fuori dell’ambiente di test di Alibaba.
• Se una versione ospitata con contesto da 1M si concretizzerà. Il contesto nativo di 262K è già molto; una modalità multimodale da un milione di token è dove i risparmi della cache di attenzione ibrida si ripagano da soli.
Per ora la decisione è semplice. Se hai l'hardware, il GGUF Q4 da 17 GB con SGLang o llama.cpp esegue il modello oggi, e la PR per text+video su CPU mostra dove sta andando il percorso senza GPU. Se non ce l'hai, Qwen3.8-27B è chiamabile tramite OrcaRouter a $0.33 per milione di token in input e $2.40 per milione di token in output con una sola chiave. In ogni caso, l'open 27B con capacità video è il modello più interessante da tenere d'occhio nella generazione Qwen 3.8 — ed è nato solo cinque giorni fa.
