
Qwen3.8-27B Texto+Vídeo Está Chegando à CPU: O Que a PR de torchcodec do SGLang Muda
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
Um rascunho de pull request no SGLang agora está intitulado “[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory.” Se você remover o encanamento, a leitura é a de um roteiro: Qwen3.8-27B — o modelo de visão e linguagem de 27 bilhões de parâmetros da Alibaba, sob licença Apache-2.0, lançado como código aberto há cinco dias — está sendo conectado para que seu modo texto+vídeo rode em hardware sem GPU. Esse é o primeiro sinal concreto de que o 27B multimodal está ganhando um caminho real de serviço em CPU em um dos runtimes de inferência que as equipes de fato implantam, e isso importa para qualquer um que esperava executar compreensão de vídeo localmente sem comprar uma placa de 48GB.
Nada nesse PR foi mesclado ainda — é um rascunho, o CI está vermelho, e as versões fixadas ainda estão mudando. Mas é exatamente por isso que vale a pena ler com atenção. O modelo por trás dele é real e foi lançado, o ecossistema de serving já alcançou o ritmo em GPU, e este PR mostra para onde está indo o caminho sem GPU. Aqui está o que a mudança realmente faz, por que a inferência de vídeo em CPU para um modelo de 27B é mais importante do que parece, o que está confirmado sobre o Qwen3.8-27B, e onde você pode usá-lo hoje.
O modelo em um parágrafo.
Qwen3.8-27B é o modelo de 27B com pesos abertos da geração Qwen 3.8: um modelo denso de visão-linguagem com cerca de 27,8 bilhões de parâmetros (64 camadas, dimensão oculta de 5.120) e uma torre de visão dedicada, lançado sob a licença Apache 2.0 no Hugging Face e no ModelScope na noite de 14 de agosto de 2026 (horário de Pequim). Ele aceita texto, imagens e vídeo e retorna texto — nativamente, não por meio de um adaptador externo acoplado — com uma janela de contexto nativa de 262.144 tokens, extensível para aproximadamente um milhão via YaRN. A licença é permissiva: uso comercial, fine-tuning e redistribuição, sem limite de receita e sem acordo comercial separado, ao contrário dos termos do checkpoint principal.
{{1}}Dois detalhes arquiteturais importam mais para quem faz deploy do que as especificações principais.{{/1}} {{2}}O primeiro é a atenção híbrida: a maioria das camadas usa atenção linear Gated DeltaNet e apenas um quarto mantém um cache KV completo; assim, a memória de contexto longo é uma fração do que um modelo denso convencional de 64 camadas precisa — o mesmo truque que torna uma janela de 262K realista dentro de uma única GPU de consumo. O segundo é a previsão de múltiplos tokens (MTP), que acompanha o checkpoint com seu próprio cabeçote de decodificação especulativa e acelera de forma mensurável a decodificação quando a stack de serving a utiliza.{{/2}}
É também o modelo da família com capacidade para vídeo. O checkpoint aberto de ponta, Qwen3.8-2.4T-A95B, é efetivamente somente texto na sua forma para download, e a API hospedada Qwen3.8-Max adiciona visão sobre esses pesos. O 27B é o peso que você pode de fato baixar e executar e que já lida com texto, imagem e vídeo de fábrica — e é por isso que vale a pena acompanhar um caminho de CPU para o seu modo de vídeo.
O que o PR do SGLang realmente muda
O pull request (sgl-project/sglang #35492) é objetivo e legível. Sua própria descrição: “Este PR tem como objetivo dar suporte a Qwen3.8 texto+vídeo, adicionando torchcodec, ffmpeg e removendo pin_memory.” Na prática, são três mudanças.
• torchcodec — PyTorch’s ffmpeg-backed video decoding library — is added to the stack, so video frames for Qwen3.8 text+video can be decoded and preprocessed on the host CPU. The PR pins torchcodec 0.12.0 against torch 2.12, and notes that ffmpeg must stay below version 9.
• pin_memory foi removido do caminho multimodal. pin_memory é uma otimização de transferência de GPU que fixa buffers do host para cópia assíncrona rápida para um dispositivo; removê-lo em um caminho somente de CPU é o sinal de que o hardware de destino não possui acelerador discreto no caminho de dados.
• O comando de reprodução inicia o modelo real — Qwen/Qwen3.8-27B — por meio de sglang.launch_server na CPU com o caminho de entrada de texto+vídeo habilitado.
Leia os rótulos de status antes de construir qualquer coisa sobre ele: o PR é um rascunho, ambas as execuções de CI estão falhando, e ele ainda aguarda revisão dos proprietários de código do SGLang até o momento. É uma direção, não um lançamento. O contexto importante é que o SGLang já atende ao Qwen3.8-27B em GPU — o cookbook cobre H200, RTX PRO 6000, RTX 5090 e DGX Spark, com uma imagem dedicada lmsysorg/sglang:qwen38-27b — portanto, o caminho de texto+vídeo em CPU é a parte genuinamente nova.
![A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.](https://cms.orcarouter.ai/api/media/file/2-375.png)
Por que texto+vídeo na CPU importa mais do que parece
A Alibaba posicionou o 27B para IA de borda desde o primeiro dia — a MediaTek o adaptou para os chips móveis Dimensity e para o cockpit automotivo C-X1 no mesmo dia em que os pesos foram disponibilizados. A história da implantação local reforçou isso: uma quantização Q4_K_M tem cerca de 17,1GB, o que cabe em uma GPU de consumo com 24GB ou em um Mac com Apple Silicon e 32GB de memória unificada. A única coisa que essa história não conseguia fazer era vídeo em uma máquina sem GPU alguma. Essa é a lacuna que este PR resolve.
Um caminho de texto+vídeo em CPU torna a compreensão de vídeo implantável em máquinas CPU simples — máquinas virtuais, servidores pequenos, unidades de rack locais, gateways de borda — onde a carga de trabalho é assíncrona e a taxa de transferência importa mais que a latência. Legendagem de vídeo, moderação de conteúdo, análise de documentos e diagramas, recuperação offline de gravações: esses são exatamente os trabalhos em lote que não precisam de GPU, e hoje ainda assumem uma para qualquer VLM com entrada de vídeo.
O trade-off honesto é que o Qwen3.8-27B é um modelo de 27 bilhões de parâmetros e nenhum caminho de CPU torna um 27B rápido. Espere tokens de um dígito por segundo em um servidor robusto classe AVX com quadros de vídeo no contexto — viável para trabalhos em lote e noturnos, não para chat interativo sobre vídeo. O ponto do caminho de CPU é que a opção existe de fato: uma implantação sem GPU pode executar o modo de vídeo do mesmo modelo em vez de recorrer a um modelo de visão menor ou enviar cada quadro para uma GPU na nuvem.
Onde o Qwen3.8-27B roda hoje
O ecossistema alcançou o modelo rapidamente. No lado do self-host, você tem llama.cpp e LM Studio com pacotes GGUF que vão até cerca de 10,7 GB em quantização de 2 bits, Ollama para uma linha de comando, e vLLM e SGLang para servir modelos adequadamente. A maior parte disso é texto ou imagem atualmente; o caminho de vídeo na CPU é a parte que ainda está sendo construída.
Se você preferir não executar um 27B por conta própria, a rota hospedada já existe: o OrcaRouter serve qwen/qwen3.8-27b com entradas de texto, imagem e vídeo, uma janela de contexto de 262.144 tokens e saída de texto, a US$ 0,33 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída. Ele está atrás do mesmo endpoint compatível com OpenAI que todos os outros modelos da plataforma — uma chave de API, sem segundo contrato — e o failover automático e o DSL de roteamento da plataforma se aplicam aos mais de 200 modelos dessa chave. Um modelo com cinco dias de existência e um caminho de CPU não comprovado é o caso clássico para roteamento em vez de conexão direta: você pode testar o Qwen3.8-27B em cargas de trabalho reais atrás de uma rota sem arriscar todo o seu caminho de chamadas em uma única stack de servição, e alternar entre versões auto-hospedadas e hospedadas sem alterar o código.

Os números — relatados pelo fornecedor, e que valem a pena conferir.
Todos os números principais abaixo são da própria Alibaba, retirados do cartão do modelo e dos materiais de lançamento. O modelo tem cinco dias e a reprodução independente está apenas começando a aparecer, portanto trate esses números como afirmações com uma direção clara, e não como veredictos. Para um modelo de 27B, as pontuações de codificação e de agente são o que mais chama a atenção:
• SWE-bench Pro — 61,7 (relatado pela Alibaba; sua própria tabela mostra Claude Opus 4.6 Max em 53,4)
• Terminal-Bench 2.1 — 73.0 (codificação de terminal agêntica)
• OSWorld-Verified — 84.3 (computer-use agent tasks)
• AndroidWorld — 81.9
• DeepSWE 1.1 — 42,2, aproximadamente o triplo do 13,3 do 27B aberto anterior.
On the vision side — the side this article is really about — Alibaba reports VideoMME 87.0 for video understanding and MathVision 90.0 for visual reasoning without tools. Artificial Analysis’s early read puts the model at 52 on its Intelligence Index and 51 on its Agentic Index, competitive with much larger closed models at certain reasoning settings; those are still early scores against a five-day-old model.

One caveat matters disproportionately for anyone running the model locally or on CPU, and it is the reasoning dial. Qwen3.8-27B ships with thinking mode on and a per-request reasoning_effort setting (low / medium / xhigh). The default xhigh over-thinks badly: the now-famous first run of the 17GB GGUF took roughly 21 minutes and 22,000 reasoning tokens to draw a simple image. On CPU especially, set reasoning_effort deliberately — the difference between interactive and unusable is one parameter.
O que assistir
Three things will tell you whether the CPU path becomes real:
• Whether PR #35492 merges. It is a draft with red CI today. A merged, green version landing in a release is the point the CPU text+video path becomes runnable for the rest of us.
• Independent benchmarks. The 61.7 SWE-bench Pro and 87.0 VideoMME figures are vendor-reported. LMArena and Artificial Analysis runs over the next couple of weeks will show how much survives outside Alibaba’s own harness.
• Whether a hosted 1M-context version materialises. Native 262K is already a lot; a million-token multimodal mode is where the hybrid-attention cache savings pay for themselves.
For now the decision is simple. If you have the hardware, the 17GB Q4 GGUF plus SGLang or llama.cpp runs the model today, and the CPU text+video PR shows where the no-GPU path is heading. If you do not, Qwen3.8-27B is callable through OrcaRouter at $0.33 per million input and $2.40 per million output tokens behind a single key. Either way, the video-capable open 27B is the most interesting model to watch in the Qwen 3.8 generation — and it is five days old.
