
Qwen3.8-27B Text+Video выходит на CPU: что меняет PR SGLang для torchcodec
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
Черновой pull request в SGLang на данный момент озаглавлен «[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory». Если убрать техническую начинку, это читается как дорожная карта: Qwen3.8-27B — модель Alibaba с лицензией Apache-2.0, 27 миллиардов параметров, визуально-языковая модель, выпущенная пять дней назад, — подключается так, чтобы её режим «текст+видео» работал на оборудовании без GPU. Это первый конкретный сигнал того, что мультимодальная 27B-модель получает полноценный путь для инференса на CPU в одной из сред выполнения, которые команды действительно разворачивают, и это важно для всех, кто ждал возможности запускать анализ видео локально, не покупая карту на 48 ГБ.
В этом PR пока ничего не смержено — это черновик, CI красный, а пины версий всё ещё меняются. Но именно поэтому его стоит внимательно прочитать. Модель, стоящая за ним, реальна и выпущена, экосистема сервинга уже догнала GPU, и этот PR показывает, куда движется путь без GPU. Вот что именно делает это изменение, почему видеоинференс на CPU для 27B-модели — это более серьёзно, чем кажется, что подтверждено о Qwen3.8-27B, и где вы можете запустить её уже сегодня.
Модель в одном абзаце
Qwen3.8-27B — это модель с открытыми весами размером 27B из поколения Qwen 3.8: плотная визуально-языковая модель на ~27,8 млрд параметров (64 слоя, скрытый размер 5 120) с выделенной зрительной башней, выпущенная под лицензией Apache 2.0 на Hugging Face и ModelScope вечером 14 августа 2026 года (по пекинскому времени). Она принимает текст, изображения и видео и возвращает текст — нативно, а не через прикрученный адаптер, — с нативным контекстным окном в 262 144 токена, расширяемым примерно до миллиона с помощью YaRN. Лицензия — пермиссивная: коммерческое использование, дообучение и распространение без порога по выручке и без отдельного коммерческого соглашения, в отличие от условий флагманского чекпоинта.
Две архитектурные детали важнее для инженера по развёртыванию, чем основные характеристики. Первая — гибридное внимание: большинство слоёв используют линейное внимание Gated DeltaNet, и только четверть сохраняет полный KV-кэш, поэтому память для длинного контекста составляет лишь долю того, что требуется обычной плотной модели с 64 слоями — тот же приём, который делает окно в 262K реалистичным в пределах одного потребительского GPU. Вторая — многотокенное предсказание (MTP), которое поставляет чекпойнт с собственной головой спекулятивного декодирования и заметно ускоряет декодирование, когда серверный стек использует эту технику.
Это также модель семейства, поддерживающая видео. Флагманский открытый чекпойнт Qwen3.8-2.4T-A95B в скачиваемом виде фактически работает только с текстом, а размещённый API Qwen3.8-Max добавляет зрение поверх этих весов. 27B — это те веса, которые можно реально скачать и запустить. Из коробки они работают с текстом, изображениями и видео. Именно поэтому стоит следить за возможностью запуска видеорежима этой модели на CPU.
Что на самом деле меняет PR SGLang
Pull request (sgl-project/sglang #35492) узкий и внятный. В его описании сказано: «Этот PR предназначен для поддержки Qwen3.8 text+video, добавляя torchcodec, ffmpeg и удаляя pin_memory». На практике это три шага.
• torchcodec — библиотека декодирования видео PyTorch на базе ffmpeg — добавляется в стек, поэтому видеокадры для Qwen3.8 text+video могут декодироваться и предобрабатываться на хостовом процессоре. PR привязывает torchcodec 0.12.0 к torch 2.12 и отмечает, что ffmpeg должен оставаться ниже версии 9.
• pin_memory удалён из мультимодального пути. pin_memory — это оптимизация передачи на GPU, которая закрепляет буферы хоста для быстрого асинхронного копирования на устройство; отказ от неё на пути, использующем только CPU, является признаком того, что целевое оборудование не имеет дискретного ускорителя в пути данных.
• Команда воспроизведения запускает реальную модель — Qwen/Qwen3.8-27B — через sglang.launch_server на CPU с включённым путём ввода текста+видео.
Прочитайте статусные метки, прежде чем строить что-либо на его основе: PR — черновик, оба прогона CI падают, и на сегодняшний день он всё ещё ожидает ревью от владельцев кода SGLang. Это направление, а не релиз. Важно отметить, что SGLang уже обслуживает Qwen3.8-27B на GPU — cookbook охватывает H200, RTX PRO 6000, RTX 5090 и DGX Spark, с выделенным образом lmsysorg/sglang:qwen38-27b — так что путь для текста и видео на CPU — это действительно новая часть.
![A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.](https://cms.orcarouter.ai/api/media/file/2-375.png)
Почему текст+видео на CPU важнее, чем кажется
Alibaba с самого начала позиционировала 27B для edge AI — MediaTek адаптировала его к мобильным чипам Dimensity и автомобильному кокпиту C-X1 в тот же день, когда были опубликованы веса. История локального развёртывания подкрепила это: квантование Q4_K_M составляет примерно 17.1 ГБ, что помещается в потребительский GPU на 24 ГБ или Mac на Apple Silicon с 32 ГБ унифицированной памяти. Единственное, чего эта история не могла обеспечить, — это видео на машине без GPU вообще. Именно этот пробел устраняет данный PR.
CPU-путь для текста и видео делает понимание видео развёртываемым на обычных CPU-машинах — виртуальных машинах, небольших серверах, локальных стоечных устройствах, периферийных шлюзах — где нагрузка асинхронна и пропускная способность важнее задержки. Субтитрирование видео, модерация контента, разбор документов и диаграмм, офлайн-поиск по записям — это как раз те пакетные задачи, которым не нужен GPU, но сегодня они всё равно предполагают его наличие для любой VLM с видеовходом.
Честный компромисс состоит в том, что Qwen3.8-27B — это модель с 27 миллиардами параметров, и ни один путь на CPU не сделает 27B быстрым. Ожидайте однозначные токены в секунду на серьёзном сервере класса AVX с видеокадрами в контексте — это приемлемо для пакетных и ночных задач, но не для интерактивного чата с видео. Смысл пути на CPU в том, что такая опция вообще существует: развёртывание без GPU может запускать видеорежим той же модели, вместо того чтобы переходить на меньшую модель зрения или отправлять каждый кадр в облачный GPU.
Где сегодня работает Qwen3.8-27B
Экосистема быстро догнала модель. На стороне самостоятельного хостинга есть llama.cpp и LM Studio с пакетами GGUF вплоть до примерно 10,7 ГБ 2-битного квантования, Ollama для запуска одной командой, а также vLLM и SGLang для полноценного обслуживания. Большая часть этого сегодня — текст или изображения; видеопоток на CPU — та часть, которую ещё только создают.
Если вы предпочитаете не запускать 27B самостоятельно, размещённый маршрут уже существует: OrcaRouter обслуживает qwen/qwen3.8-27b с вводом текста, изображений и видео, окном контекста на 262 144 токена и выводом текста, по цене $0,33 за миллион входных токенов и $2,40 за миллион выходных токенов. Она находится за тем же OpenAI-совместимым эндпоинтом, что и все остальные модели на платформе — один API-ключ, без второго контракта — и автоматическое переключение при отказе и DSL маршрутизации платформы применяются к 200+ моделям на этом ключе. Модель пятидневной давности с непроверенным процессорным путём — это классический случай для маршрутизации вместо жёсткого подключения: вы можете попробовать Qwen3.8-27B на реальных рабочих нагрузках через маршрут, не ставя весь свой путь вызовов в зависимость от одного серверного стека, и переключаться между локальной и размещённой версиями без изменения кода.

Цифры — предоставленные вендором, и их стоит проверить.
Каждая ключевая цифра ниже принадлежит самому Alibaba и взята из карточки модели и материалов запуска. Модели всего пять дней, и независимое воспроизведение только начинает появляться, так что относитесь к этим данным как к заявлениям с понятным направлением, а не как к окончательным вердиктам. Для 27B показатели кодинга и агентских задач привлекают больше всего внимания:
• SWE-bench Pro — 61.7 (по данным Alibaba; в их собственной таблице Claude Opus 4.6 Max показывает 53.4)
• Terminal-Bench 2.1 — 73.0 (агентное программирование в терминале)
• OSWorld-Verified — 84.3 (задачи агента по использованию компьютера)
• AndroidWorld — 81.9
DeepSWE 1.1 — 42.2, что примерно втрое больше 13.3 у предыдущей открытой модели 27B
Что касается зрительной стороны — той стороны, которой на самом деле посвящена эта статья, — Alibaba сообщает о VideoMME 87.0 для понимания видео и MathVision 90.0 для визуальных рассуждений без инструментов. Предварительные данные Artificial Analysis оценивают модель в 52 балла по Intelligence Index и 51 по Agentic Index, что позволяет ей конкурировать с гораздо более крупными закрытыми моделями при определённых настройках рассуждений; это всё ещё ранние показатели для модели, которой всего пять дней.

Одно предостережение имеет непропорционально большое значение для любого, кто запускает модель локально или на CPU, и это регулятор рассуждений. Qwen3.8-27B поставляется с включённым режимом мышления и настройкой reasoning_effort для каждого запроса (low / medium / xhigh). Значение xhigh по умолчанию ужасно переусердствует: получивший известность первый запуск 17GB GGUF занял примерно 21 минуту и 22 000 токенов рассуждений, чтобы нарисовать простое изображение. Особенно на CPU устанавливайте reasoning_effort осознанно — разница между интерактивным и непригодным к использованию — всего один параметр.
Что посмотреть
Три вещи подскажут вам, станет ли путь CPU реальным:
• Смержится ли PR #35492. Сегодня это черновик с красным CI. Смерженная зелёная версия, попавшая в релиз, — это тот момент, когда путь CPU текст+видео становится запускаемым для остальных.
• Независимые бенчмарки. Значения 61.7 SWE-bench Pro и 87.0 VideoMME предоставлены вендором. Прогоны LMArena и Artificial Analysis в ближайшие пару недель покажут, насколько эти результаты сохранятся за пределами собственной тестовой среды Alibaba.
• Появится ли хостинговая версия с контекстом в 1 млн токенов. Нативные 262K — это уже много; мультимодальный режим с миллионом токенов — это то, где экономия кэша гибридного внимания окупается.
Пока решение простое. Если у вас есть необходимое оборудование, связка из 17-гигабайтного Q4 GGUF и SGLang или llama.cpp запускает модель уже сегодня, а PR с поддержкой текста и видео на CPU показывает, куда движется путь без GPU. Если же нет, Qwen3.8-27B доступен через OrcaRouter по цене $0,33 за миллион входных и $2,40 за миллион выходных токенов при использовании одного ключа. В любом случае, открытая 27B с поддержкой видео — самая интересная модель в поколении Qwen 3.8, за которой стоит следить, — и ей всего пять дней.
