Крупная титульная карточка с надписью {{KEEP}}Qwen3.8-27B{{/KEEP}} на vLLM, с подзаголовком «запускайте его в продакшене на одном или двух GPU», с иконкой сервера и чипами форматов с подписями NVFP4 24.6 GiB, FP8 48GB и BF16 80GB.
Guides & Insights

Qwen3.8-27B на vLLM: обслуживание в продакшене на одной или двух GPU

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Да — Qwen3.8 27B уже работает в продакшене на vLLM, и в большинстве случаев на одном GPU. Актуальная версия — vLLM 0.17.0 или новее: в неё входят официальный рецепт, гибридные ядра внимания, необходимые этой модели, и эндпоинт /v1, совместимый с O​penAI. Для одного GPU Blackwell запускайте квантизацию NVFP4 — собственный рецепт vLLM оценивает её в 24,6 ГиБ VRAM при tensor-parallel размере 1. Для одной карты на 48 ГБ запускайте FP8. Полный BF16, чекпойнт на 51,7 ГБ, требует один GPU на 80 ГБ или две карты по 48 ГБ в tensor-parallel. Точные команды приведены ниже; первая — однострочная.

Всё здесь было проверено 15 августа 2026 года, на третий день после публикации весов. Архитектура, контекст и лицензия взяты из карточки модели Qwen3.8 27B на Hugging Face; размер чекпоинта — это сумма 18 шардов safetensors из репозитория; команды vLLM и значение 24.6 ГиБ взяты со страницы рецепта vLLM для этой модели. Qwen3.8 27B — это плотная мультимодальная модель Alibaba с 27 миллиардами параметров — веса под лицензией Apache 2.0, выпущены 13–14 августа — и благодаря открытым весам вы можете обслуживать её сами, а не арендовать токены. Именно эта развилка и есть настоящая тема данной статьи.

Факты, которые имеют значение, с источниками.

Архитектура — 27B плотная (27.8B с учётом визуальной башни и дополненного словаря), 64 слоя, скрытый размер 5,120, словарь 248,320. Официальная карточка модели, проверено сегодня.

Внимание — гибрид: 16 слоёв полного внимания и 48 линейных слоёв Gated DeltaNet в блочной структуре 3:1. Только 16 слоёв хранят растущий кэш ключей и значений; остальные 48 вместо этого поддерживают рекуррентное состояние фиксированного размера.

Контекст — 262 144 токена изначально, расширяется примерно до 1M с помощью масштабирования YaRN RoPE. Карточка модели, проверено сегодня.

Вход — нативные текст, изображение и видео; вывод — текст. vLLM предоставляет все три через стандартный API chat-completions, без отдельного файла проектора.

Лицензия — Apache 2.0. Именно этот факт объясняет, почему вообще существует вопрос «обслуживать самостоятельно или арендовать токены».

Веса — контрольная точка BF16 в общей сложности занимает 51,7 ГБ и разбита на 18 шардов safetensors (Hugging Face, проверено сегодня). Qwe​n также публикует контрольные точки FP8 и NVFP4, созданные для vLLM.

Требование к vLLM — 0.17.0 или новее, с transformers ≥ 5.8.0. Страница рецептов vLLM, проверена сегодня. «Any vLLM» — небезопасное указание; ядра рекуррентных слоёв — вот что добавляет новая версия.

Мультитокенное предсказание — черновой модуль спекулятивного декодирования встроен в чекпоинт, поэтому отдельная черновая модель не нужна. В vLLM описан этот флаг; независимых данных об ускорении пока нет.

Лестница GPU — какой квант на какой карте

Три формата раздачи покрывают весь практический диапазон. Выбирайте по VRAM, которая у вас реально есть, а не по «лучшему кванту».

NVFP4 — 24.6 GiB суммарно (веса плюс FP8 KV-кэш), согласно рецепту vLLM при TP1. Помещается в один GPU класса Blackwell — на практике это 32GB RTX 5090 или B200. Это путь с наименьшей задержкой и тот, который сохраняет больше всего контекста на карту: рецепт vLLM указывает ёмкость 6.6M KV-токенов даже при расширении контекста до 1M.

FP8 — около 26 ГБ весов. Одна карта на 48 ГБ (L40S, RTX A6000, RTX 6000 Ada) обслуживает её с запасом под контекст; две карты по 48 ГБ в тензорном параллелизме дают запас для более длинного контекста или более высокой конкурентности. Собственный рецепт vLLM запускает FP8 с TP4 на четырёх GPU в лотке GB300, когда нужен максимально возможный KV-кэш.

BF16 — 51.7GB весов, поэтому достаточно одного GPU на 80GB (H100, A100 80GB, B200, GB300) или двух карт по 48GB при TP2. Это вариант с эталонной точностью, и именно его использует приведённая ниже команда расширения контекста до 1M.

MXFP4 — не используйте на NVIDIA. В пути MXFP4 в vLLM в настоящее время отсутствует поддержка linear-method; те же веса публикуются как NVFP4 — именно этот формат фактически используется в рецепте NVIDIA.

A GPU ladder card for Qwen3.8-27B on vLLM: NVFP4 at 24.6 GiB on one 32GB Blackwell card at TP1 highlighted as the single-GPU pick, FP8 at about 26GB on one 48GB card or two at TP2, BF16 at 51.7GB on one 80GB GPU or two 48GB at TP2, plus a warning that MXFP4 does not run on NVIDIA.

Запустите — команды vLLM

Низколатентный вариант по умолчанию для одного GPU (NVFP4, один GPU Blackwell), дословно из рецепта vLLM:

vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

Команда FP8 из того же рецепта (TP4, один лоток GB300, максимальный KV-кэш):

vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3

Для двух карт по 48 ГБ оставьте команду FP8 и установите --tensor-parallel-size 2 вместо 4.

Добавьте это к любой из команд, чтобы включить спекулятивное декодирование MTP:

--speculative-config '{"method":"mtp","num_speculative_tokens":3}'

Расширение контекста 1M (также из рецепта vLLM):

vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

A terminal-style card showing the vLLM serve command for Qwen3.8-27B NVFP4 on one GPU with the flags tensor-parallel-size 1, max-model-len 262144, kv-cache-dtype fp8, reasoning-parser qwen3, and tool-call-parser qwen3_coder.

Point any O​penAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.

Что обещают и не обещают собственные страницы vLLM

Показателей пропускной способности для 27B пока нет. По состоянию на 15 августа на странице рецептов vLLM нет ни показателей пропускной способности, ни задержек для Qwen3.8 27B. Цифра «более 4000 токенов в секунду на GPU», которая гуляет по сети, относится к Qwen3.8 2.4T-A95B на стойке GB300 NVL72 с 72 GPU, предоставлена вендором и не имеет отношения к этой модели. Показатели токенов в секунду от сообщества, которые вы увидите в обращении для GGUF под llama.cpp или Ollama, — это другая среда выполнения и другая рабочая нагрузка, нежели обслуживание через vLLM.

Утверждение, что KV-кэш дёшев, зависит от среды выполнения. В карточке модели сказано, что только 16 из 64 слоёв хранят кэш, но это помогает только в том случае, если обслуживающий движок действительно реализует слои Gated DeltaNet. vLLM 0.17+ — это версия, которая их реализует; именно поэтому фиксация версии вынесена в начало этой статьи, а не в сноску.

MTP встроен, но здесь не измерялся. Черновая голова находится в чекпоинте, и vLLM документирует флаг, но никто ещё не опубликовал независимую оценку ускорения для этой модели 27B на vLLM. Планируйте измерить это на своём трафике.

NVIDIA — проверенный путь. Рецепт vLLM написан для GPU NVIDIA (NVFP4 и FP8). Развёртывание этой модели с гибридным вниманием на AMD Instinct или Intel Gaudi всё ещё находится на переднем крае, и эта статья не претендует на обратное.

Обслуживайте себя сами или арендуйте токены

Здесь вступает в силу Apache 2.0. Нет лицензионной платы за токен для Qwen3.8 27B, так что единственный реальный вопрос — владеете ли вы оборудованием или арендуете токены.

Собственный хостинг (эта статья) — вы платите за GPU один раз, и каждый последующий токен бесплатен. Уже имеющаяся у вас RTX 5090 превращает команду NVFP4 в конечную точку с нулевой предельной стоимостью, и данные не покидают устройство. Если GPU приходится арендовать, облачная 5090 или пара A6000 становится статьёй расходов, и весь аргумент работает только в том случае, если у вас уже есть карта или устойчивый объём.

Арендуйте токены — поскольку веса открыты, его запускают несколько хостов, а нижняя граница цены — стоимость оборудования. Qwen3.8 27B сегодня доступен на OrcaRouter по цене $0.33 за миллион входных токенов и $2.40 за миллион выходных — без наценки посредника, так как OrcaRouter запускает открытые веса на собственной инфраструктуре, — а те же открытые веса обеспечивают бесплатный тариф с ограничением скорости, который берёт $0 за запрос и возвращает HTTP 429 при превышении лимита. Показательный месяц с 10 миллионами токенов при 70% входных обойдётся примерно в $9.51 на платном тарифе.

Решающее правило — если у вас уже есть GPU, размещайте его у себя. Если бы вам пришлось покупать или арендовать его, API быстро окупается при объёмах сайд-проекта, а один и тот же OpenAI-совместимый клиент указывает на любую из конечных точек, так что при переходе код не меняется.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, text image and video input, and p50 time-to-first-token of 225 milliseconds.

Когда vLLM — неправильный ответ

Вы один человек за ноутбуком — vLLM — это serving-движок, а не десктопное приложение. Для локального запуска в одиночку llama.cpp или Ollama с Q4 GGUF проще и требуют видеокарту на 24 ГБ, а не Blackwell GPU; наше руководство how-to-run-Qwen3.8-27B-locally описывает этот путь от начала до конца.

Вам нужна гарантированная пропускная способность при нулевом администрировании — самостоятельный хостинг означает, что вы отвечаете за подкачку, управление очередями и отработку отказов. Если фраза «API недоступен» — не то, что вы хотите слышать, арендуйте токены и позвольте кому-то другому обслуживать парк серверов.

Вам действительно нужен полный контекст объёмом ~1M на уровне передовых моделей — это задача Qwen3.8 2.4T-A95B, развёрнутого через vLLM или SGLang на стойке GB300 NVL72 с 72 GPU. Qwen3.8 27B на одном или двух GPU с этим не справится; наша статья о развёртывании модели 2.4T объясняет, почему эта модель относится к другому классу задач.

Вы на более старой видеокарте с 24 ГБ — NVFP4 — это формат Blackwell; на картах Ampere (RTX 3090) или Ada (RTX 4090) с 24 ГБ путь FP8 — это опция vLLM, а дальше квант GGUF под llama.cpp — прагматичный предел. Та же модель на карте с 24 ГБ — это совсем другое дело.

Вы должны обеспечить максимальное число одновременных запросов на одной видеокарте — указанные выше значения по умолчанию для одной видеокарты — это отправная точка, а не производственная конфигурация. Настройте --max-num-seqs, кэш KV и конфигурацию MTP в соответствии с вашим собственным смешанным набором запросов, прежде чем считать задачу выполненной.

Суть

Qwen3.8 27B — это редкая плотная 27B-модель, которую vLLM обслуживает на одном GPU в продакшене. Обновитесь до vLLM 0.17.0+, скачайте NVFP4-квант объёмом 24.6 ГиБ для карты Blackwell на 32 ГБ, FP8-квант для одной карты на 48 ГБ или двух в тензорном параллелизме, а BF16 оставьте для GPU на 80 ГБ. Команды — это однострочники, эндпоинт совместим с O​penAI, а поскольку веса распространяются под Apache 2.0, вы можете либо запустить модель самостоятельно, либо арендовать её за $0.33/$2.40 за миллион токенов с бесплатным тарифом — клиентский код в обоих случаях один и тот же. Единственное, чего пока ни у кого нет, — это независимые цифры пропускной способности для 27B на vLLM, так что заложите час на бенчмаркинг после запуска, прежде чем обещать кому-либо цифры задержки.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube