
Qwen3.8-27B Text+Video arrive sur CPU : ce que change la PR torchcodec de SGLang
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
Une ébauche de pull request dans SGLang est actuellement intitulée « [CPU] Prise en charge de Qwen3.8 text+video : ajout de torchcodec, ffmpeg et suppression de pin_memory. » Une fois la tuyauterie retirée, cela se lit comme une feuille de route : Qwen3.8-27B — le modèle vision-langage d'Alibaba, sous licence Apache-2.0, à 27 milliards de paramètres, open-sourcé il y a cinq jours — est en train d'être câblé pour que son mode text+video fonctionne sur du matériel sans GPU dans le boîtier. C'est le premier signal concret que le 27B multimodal obtient un véritable chemin de serving CPU dans l'un des runtimes d'inférence que les équipes déploient réellement, et c'est important pour tous ceux qui attendaient de pouvoir exécuter la compréhension vidéo en local sans acheter une carte de 48 Go.
Rien dans cette PR n'est encore fusionné — c'est un brouillon, la CI est rouge, et les versions épinglées bougent encore. Mais c'est justement pour cela qu'il vaut la peine de la lire attentivement. Le modèle qui se cache derrière est réel et a été publié, l'écosystème de déploiement a déjà suivi sur GPU, et cette PR montre où se dirige la voie sans GPU. Voici ce que fait réellement ce changement, pourquoi l'inférence vidéo sur CPU pour un modèle de 27B est un enjeu plus important qu'il n'y paraît, ce qui est confirmé à propos de Qwen3.8-27B, et où vous pouvez l'appeler dès aujourd'hui.
Le modèle en un paragraphe
Qwen3.8-27B est le modèle open-weight de 27B de la génération Qwen 3.8 : un modèle vision-langage dense d'environ 27,8 milliards de paramètres (64 couches, taille cachée de 5 120) doté d'une tour de vision dédiée, publié sous licence Apache 2.0 sur Hugging Face et ModelScope le soir du 14 août 2026 (heure de Pékin). Il accepte du texte, des images et des vidéos et renvoie du texte — nativement, et non via un adaptateur greffé — avec une fenêtre de contexte native de 262 144 jetons, extensible à environ un million via YaRN. La licence est permissive : utilisation commerciale, fine-tuning et redistribution, sans seuil de revenus ni accord commercial séparé, contrairement aux conditions du checkpoint phare.
Deux détails architecturaux comptent plus pour un déployeur que les spécifications principales. Le premier est l'attention hybride : la plupart des couches utilisent l'attention linéaire Gated DeltaNet et seul un quart conserve un cache KV complet, de sorte que la mémoire pour longs contextes ne représente qu'une fraction de ce qu'un modèle dense classique de 64 couches nécessite — la même astuce qui rend réaliste une fenêtre de 262K à l'intérieur d'un seul GPU grand public. Le second est la prédiction multi-tokens (MTP), qui livre le checkpoint avec sa propre tête de décodage spéculatif et accélère de manière mesurable le décodage lorsque la pile de service l'utilise.
C'est également celui de la famille qui prend en charge la vidéo. Le checkpoint ouvert phare, Qwen3.8-2.4T-A95B, est en pratique limité au texte dans sa forme téléchargeable, et l'API hébergée Qwen3.8-Max ajoute la vision par-dessus ces poids. La 27B est le poids que l'on peut réellement télécharger et exécuter, qui gère le texte, l'image et la vidéo dès la sortie de la boîte — c'est pourquoi un chemin CPU pour son mode vidéo vaut la peine d'être surveillé.
Ce que le PR SGLang change réellement
La pull request (sgl-project/sglang #35492) est ciblée et lisible. Sa propre description : « Cette PR vise à prendre en charge Qwen3.8 texte+vidéo, en ajoutant torchcodec, ffmpeg et en supprimant pin_memory. » En pratique, cela correspond à trois changements.
• torchcodec — la bibliothèque de décodage vidéo de PyTorch basée sur ffmpeg — est ajouté à la pile logicielle, afin que les images vidéo pour Qwen3.8 texte+vidéo puissent être décodées et prétraitées sur le CPU hôte. Le PR épingle torchcodec 0.12.0 avec torch 2.12, et note que ffmpeg doit rester en dessous de la version 9.
• pin_memory est supprimé du chemin multimodal. pin_memory est une optimisation de transfert GPU qui épingle les tampons hôtes pour une copie asynchrone rapide vers un périphérique ; l'omettre sur un chemin uniquement CPU est le signe que le matériel cible ne comporte pas d'accélérateur discret dans le chemin de données.
• La commande de reproduction lance le modèle réel — {{1}}Qwen/Qwen3.8-27B{{/1}} — via sglang.launch_server sur CPU avec le chemin d'entrée texte+vidéo activé.
Lisez les étiquettes de statut avant de construire quoi que ce soit dessus : la PR est un brouillon, les deux exécutions CI échouent, et elle attend toujours la revue des propriétaires du code SGLang à ce jour. C’est une direction, pas une version. Le contexte important est que SGLang sert déjà Qwen3.8-27B sur GPU — le cookbook couvre H200, RTX PRO 6000, RTX 5090 et DGX Spark, avec une image dédiée lmsysorg/sglang:qwen38-27b — donc le chemin CPU texte+vidéo est la pièce véritablement nouvelle.
![A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.](https://cms.orcarouter.ai/api/media/file/2-375.png)
Pourquoi le texte+vidéo du CPU compte plus qu'il n'y paraît
Alibaba a positionné le modèle 27B pour l'IA de périphérie dès le premier jour — MediaTek l'a adapté aux puces mobiles Dimensity et au cockpit automobile C-X1 le jour même où les poids ont été publiés. Le récit du déploiement local l'a renforcé : une quantification Q4_K_M fait environ 17,1 Go, ce qui tient sur un GPU grand public de 24 Go ou sur un Mac Apple Silicon avec 32 Go de mémoire unifiée. La seule chose que cette histoire ne pouvait pas faire, c'était la vidéo sur une machine sans GPU du tout. C'est cette lacune que cette PR comble.
Un pipeline texte+vidéo sur CPU rend la compréhension vidéo déployable sur de simples machines CPU — machines virtuelles, petits serveurs, baies rack sur site, passerelles edge — où la charge de travail est asynchrone et où le débit prime sur la latence. Sous-titrage vidéo, modération de contenu, analyse de documents et de diagrammes, recherche hors ligne dans des enregistrements : ce sont exactement les tâches par lots qui n'ont pas besoin de GPU, et pourtant elles supposent aujourd'hui encore qu'un VLM avec entrée vidéo en requiert un.
Le compromis honnête est que Qwen3.8-27B est un modèle à 27 milliards de paramètres et qu'aucun chemin CPU ne rend un 27B rapide. Attendez-vous à un débit de quelques tokens par seconde sur un serveur sérieux de classe AVX avec des images vidéo dans le contexte — viable pour des traitements par lots et de nuit, mais pas pour un chat interactif sur vidéo. L'intérêt du chemin CPU est que l'option existe tout simplement : un déploiement sans GPU peut exécuter le mode vidéo du même modèle au lieu de passer à un modèle de vision plus petit ou d'envoyer chaque image à un GPU cloud.
Où Qwen3.8-27B s'exécute aujourd'hui
L'écosystème a rattrapé le modèle rapidement. Côté auto-hébergement, vous avez llama.cpp et LM Studio avec des packs GGUF allant jusqu'à un quant 2 bits d'environ 10,7 Go, Ollama pour une commande unique, et vLLM et SGLang pour un service adéquat. La plupart de cela concerne actuellement le texte ou l'image ; le chemin vidéo sur CPU est la partie encore en cours de développement.
Si vous préférez ne pas faire tourner un 27B vous-même, la route hébergée existe déjà : OrcaRouter propose qwen/qwen3.8-27b avec des entrées texte, image et vidéo, une fenêtre de contexte de 262 144 tokens, et une sortie texte, à 0,33 $ par million de tokens d’entrée et 2,40 $ par million de tokens de sortie. Il est derrière le même point de terminaison compatible OpenAI que tous les autres modèles de la plateforme — une seule clé API, pas de second contrat — et le basculement automatique et le DSL de routage de la plateforme s’appliquent aux 200+ modèles associés à cette clé. Un modèle de cinq jours avec un chemin CPU non éprouvé est le cas d’école du routage plutôt que du câblage en dur : vous pouvez essayer Qwen3.8-27B sur des charges de travail réelles derrière une route sans miser tout votre chemin d’appel sur une seule pile de service, et basculer entre les versions auto-hébergées et hébergées sans modifier le code.

Les chiffres — rapportés par le fournisseur, et à vérifier.
Chaque chiffre clé ci-dessous provient d'Alibaba, tiré de la fiche du modèle et des documents de lancement. Le modèle a cinq jours et la reproduction indépendante ne commence qu'à apparaître. Considérez donc ces chiffres comme des affirmations avec une direction claire plutôt que comme des verdicts. Pour un 27B, les scores de codage et d'agent sont ce qui attire l'attention :
• SWE-bench Pro — 61,7 (chiffre rapporté par Alibaba ; son propre tableau indique Claude Opus 4.6 Max à 53,4)
• Terminal-Bench 2.1 — 73.0 (codage terminal agentique)
• OSWorld-Verified — 84.3 (tâches d'agent d'utilisation d'ordinateur)
• AndroidWorld — 81.9
• DeepSWE 1.1 — 42,2, soit environ le triple du 13,3 du précédent 27B open.
Côté vision — le sujet principal de cet article — Alibaba rapporte un score de 87,0 sur VideoMME pour la compréhension vidéo et de 90,0 sur MathVision pour le raisonnement visuel sans outils. La lecture préliminaire d’Artificial Analysis place le modèle à 52 sur son Intelligence Index et à 51 sur son Agentic Index, ce qui le rend compétitif avec des modèles fermés bien plus grands à certains réglages de raisonnement ; ce sont encore des scores précoces pour un modèle âgé de cinq jours.

Une mise en garde revêt une importance disproportionnée pour quiconque exécute le modèle localement ou sur CPU : c'est le curseur de raisonnement. Qwen3.8-27B est livré avec le mode thinking activé et un paramètre reasoning_effort par requête (low / medium / xhigh). Le xhigh par défaut sur-réfléchit de façon désastreuse : le premier lancement désormais célèbre du GGUF de 17 Go a pris environ 21 minutes et 22 000 jetons de raisonnement pour générer une simple image. Sur CPU en particulier, réglez reasoning_effort délibérément — la différence entre interactif et inutilisable tient à un seul paramètre.
Que regarder
Trois éléments vous indiqueront si le chemin du processeur devient réel :
• La question de savoir si la PR #35492 sera fusionnée. C'est un brouillon avec une CI rouge aujourd'hui. Une version fusionnée et verte qui arrive dans une release est le moment où le chemin texte+vidéo du CPU devient exécutable pour le reste d'entre nous.
• Benchmarks indépendants. Les chiffres de 61.7 SWE-bench Pro et 87.0 VideoMME sont fournis par le vendeur. Les exécutions de LMArena et d'Artificial Analysis au cours des deux prochaines semaines montreront dans quelle mesure cela survivra en dehors du propre harnais d'Alibaba.
• Qu'une version hébergée avec un contexte de 1M se matérialise. Le natif 262K est déjà énorme ; un mode multimodal à un million de jetons est là où les économies de cache de l'attention hybride se rentabilisent.
Pour l'instant, la décision est simple. Si vous disposez du matériel, le Q4 GGUF de 17 Go avec SGLang ou llama.cpp fait tourner le modèle dès aujourd'hui, et la PR CPU text+video montre où se dirige le chemin sans GPU. Sinon, Qwen3.8-27B peut être appelé via OrcaRouter à 0,33 $ par million de tokens en entrée et 2,40 $ par million de tokens en sortie, derrière une seule clé. Quoi qu'il en soit, le 27B open doté de capacités vidéo est le modèle le plus intéressant à suivre dans la génération Qwen 3.8 — et il n'a que cinq jours.
