
Qwen3.8-27B на vLLM: обслуживание в продакшене на одной или двух GPU
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 за 1 млн токенов · 42 tok/s
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1326 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 3320 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
Да — Qwen3.8 27B уже работает в продакшене на vLLM, и в большинстве случаев на одном GPU. Актуальная версия — vLLM 0.17.0 или новее: в неё входят официальный рецепт, гибридные ядра внимания, необходимые этой модели, и эндпоинт /v1, совместимый с OpenAI. Для одного GPU Blackwell запускайте квантизацию NVFP4 — собственный рецепт vLLM оценивает её в 24,6 ГиБ VRAM при tensor-parallel размере 1. Для одной карты на 48 ГБ запускайте FP8. Полный BF16, чекпойнт на 51,7 ГБ, требует один GPU на 80 ГБ или две карты по 48 ГБ в tensor-parallel. Точные команды приведены ниже; первая — однострочная.
Всё здесь было проверено 15 августа 2026 года, на третий день после публикации весов. Архитектура, контекст и лицензия взяты из карточки модели Qwen3.8 27B на Hugging Face; размер чекпоинта — это сумма 18 шардов safetensors из репозитория; команды vLLM и значение 24.6 ГиБ взяты со страницы рецепта vLLM для этой модели. Qwen3.8 27B — это плотная мультимодальная модель Alibaba с 27 миллиардами параметров — веса под лицензией Apache 2.0, выпущены 13–14 августа — и благодаря открытым весам вы можете обслуживать её сами, а не арендовать токены. Именно эта развилка и есть настоящая тема данной статьи.
Факты, которые имеют значение, с источниками.
• Архитектура — 27B плотная (27.8B с учётом визуальной башни и дополненного словаря), 64 слоя, скрытый размер 5,120, словарь 248,320. Официальная карточка модели, проверено сегодня.
• Внимание — гибрид: 16 слоёв полного внимания и 48 линейных слоёв Gated DeltaNet в блочной структуре 3:1. Только 16 слоёв хранят растущий кэш ключей и значений; остальные 48 вместо этого поддерживают рекуррентное состояние фиксированного размера.
• Контекст — 262 144 токена изначально, расширяется примерно до 1M с помощью масштабирования YaRN RoPE. Карточка модели, проверено сегодня.
• Вход — нативные текст, изображение и видео; вывод — текст. vLLM предоставляет все три через стандартный API chat-completions, без отдельного файла проектора.
• Лицензия — Apache 2.0. Именно этот факт объясняет, почему вообще существует вопрос «обслуживать самостоятельно или арендовать токены».
• Веса — контрольная точка BF16 в общей сложности занимает 51,7 ГБ и разбита на 18 шардов safetensors (Hugging Face, проверено сегодня). Qwen также публикует контрольные точки FP8 и NVFP4, созданные для vLLM.
• Требование к vLLM — 0.17.0 или новее, с transformers ≥ 5.8.0. Страница рецептов vLLM, проверена сегодня. «Any vLLM» — небезопасное указание; ядра рекуррентных слоёв — вот что добавляет новая версия.
• Мультитокенное предсказание — черновой модуль спекулятивного декодирования встроен в чекпоинт, поэтому отдельная черновая модель не нужна. В vLLM описан этот флаг; независимых данных об ускорении пока нет.
Лестница GPU — какой квант на какой карте
Три формата раздачи покрывают весь практический диапазон. Выбирайте по VRAM, которая у вас реально есть, а не по «лучшему кванту».
• NVFP4 — 24.6 GiB суммарно (веса плюс FP8 KV-кэш), согласно рецепту vLLM при TP1. Помещается в один GPU класса Blackwell — на практике это 32GB RTX 5090 или B200. Это путь с наименьшей задержкой и тот, который сохраняет больше всего контекста на карту: рецепт vLLM указывает ёмкость 6.6M KV-токенов даже при расширении контекста до 1M.
• FP8 — около 26 ГБ весов. Одна карта на 48 ГБ (L40S, RTX A6000, RTX 6000 Ada) обслуживает её с запасом под контекст; две карты по 48 ГБ в тензорном параллелизме дают запас для более длинного контекста или более высокой конкурентности. Собственный рецепт vLLM запускает FP8 с TP4 на четырёх GPU в лотке GB300, когда нужен максимально возможный KV-кэш.
• BF16 — 51.7GB весов, поэтому достаточно одного GPU на 80GB (H100, A100 80GB, B200, GB300) или двух карт по 48GB при TP2. Это вариант с эталонной точностью, и именно его использует приведённая ниже команда расширения контекста до 1M.
• MXFP4 — не используйте на NVIDIA. В пути MXFP4 в vLLM в настоящее время отсутствует поддержка linear-method; те же веса публикуются как NVFP4 — именно этот формат фактически используется в рецепте NVIDIA.

Запустите — команды vLLM
Низколатентный вариант по умолчанию для одного GPU (NVFP4, один GPU Blackwell), дословно из рецепта vLLM:
vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
Команда FP8 из того же рецепта (TP4, один лоток GB300, максимальный KV-кэш):
vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3
Для двух карт по 48 ГБ оставьте команду FP8 и установите --tensor-parallel-size 2 вместо 4.
Добавьте это к любой из команд, чтобы включить спекулятивное декодирование MTP:
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
Расширение контекста 1M (также из рецепта vLLM):
vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

Point any OpenAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.
Что обещают и не обещают собственные страницы vLLM
• Показателей пропускной способности для 27B пока нет. По состоянию на 15 августа на странице рецептов vLLM нет ни показателей пропускной способности, ни задержек для Qwen3.8 27B. Цифра «более 4000 токенов в секунду на GPU», которая гуляет по сети, относится к Qwen3.8 2.4T-A95B на стойке GB300 NVL72 с 72 GPU, предоставлена вендором и не имеет отношения к этой модели. Показатели токенов в секунду от сообщества, которые вы увидите в обращении для GGUF под llama.cpp или Ollama, — это другая среда выполнения и другая рабочая нагрузка, нежели обслуживание через vLLM.
• Утверждение, что KV-кэш дёшев, зависит от среды выполнения. В карточке модели сказано, что только 16 из 64 слоёв хранят кэш, но это помогает только в том случае, если обслуживающий движок действительно реализует слои Gated DeltaNet. vLLM 0.17+ — это версия, которая их реализует; именно поэтому фиксация версии вынесена в начало этой статьи, а не в сноску.
• MTP встроен, но здесь не измерялся. Черновая голова находится в чекпоинте, и vLLM документирует флаг, но никто ещё не опубликовал независимую оценку ускорения для этой модели 27B на vLLM. Планируйте измерить это на своём трафике.
• NVIDIA — проверенный путь. Рецепт vLLM написан для GPU NVIDIA (NVFP4 и FP8). Развёртывание этой модели с гибридным вниманием на AMD Instinct или Intel Gaudi всё ещё находится на переднем крае, и эта статья не претендует на обратное.
Обслуживайте себя сами или арендуйте токены
Здесь вступает в силу Apache 2.0. Нет лицензионной платы за токен для Qwen3.8 27B, так что единственный реальный вопрос — владеете ли вы оборудованием или арендуете токены.
• Собственный хостинг (эта статья) — вы платите за GPU один раз, и каждый последующий токен бесплатен. Уже имеющаяся у вас RTX 5090 превращает команду NVFP4 в конечную точку с нулевой предельной стоимостью, и данные не покидают устройство. Если GPU приходится арендовать, облачная 5090 или пара A6000 становится статьёй расходов, и весь аргумент работает только в том случае, если у вас уже есть карта или устойчивый объём.
• Арендуйте токены — поскольку веса открыты, его запускают несколько хостов, а нижняя граница цены — стоимость оборудования. Qwen3.8 27B сегодня доступен на OrcaRouter по цене $0.33 за миллион входных токенов и $2.40 за миллион выходных — без наценки посредника, так как OrcaRouter запускает открытые веса на собственной инфраструктуре, — а те же открытые веса обеспечивают бесплатный тариф с ограничением скорости, который берёт $0 за запрос и возвращает HTTP 429 при превышении лимита. Показательный месяц с 10 миллионами токенов при 70% входных обойдётся примерно в $9.51 на платном тарифе.
• Решающее правило — если у вас уже есть GPU, размещайте его у себя. Если бы вам пришлось покупать или арендовать его, API быстро окупается при объёмах сайд-проекта, а один и тот же OpenAI-совместимый клиент указывает на любую из конечных точек, так что при переходе код не меняется.

Когда vLLM — неправильный ответ
• Вы один человек за ноутбуком — vLLM — это serving-движок, а не десктопное приложение. Для локального запуска в одиночку llama.cpp или Ollama с Q4 GGUF проще и требуют видеокарту на 24 ГБ, а не Blackwell GPU; наше руководство how-to-run-Qwen3.8-27B-locally описывает этот путь от начала до конца.
• Вам нужна гарантированная пропускная способность при нулевом администрировании — самостоятельный хостинг означает, что вы отвечаете за подкачку, управление очередями и отработку отказов. Если фраза «API недоступен» — не то, что вы хотите слышать, арендуйте токены и позвольте кому-то другому обслуживать парк серверов.
• Вам действительно нужен полный контекст объёмом ~1M на уровне передовых моделей — это задача Qwen3.8 2.4T-A95B, развёрнутого через vLLM или SGLang на стойке GB300 NVL72 с 72 GPU. Qwen3.8 27B на одном или двух GPU с этим не справится; наша статья о развёртывании модели 2.4T объясняет, почему эта модель относится к другому классу задач.
• Вы на более старой видеокарте с 24 ГБ — NVFP4 — это формат Blackwell; на картах Ampere (RTX 3090) или Ada (RTX 4090) с 24 ГБ путь FP8 — это опция vLLM, а дальше квант GGUF под llama.cpp — прагматичный предел. Та же модель на карте с 24 ГБ — это совсем другое дело.
• Вы должны обеспечить максимальное число одновременных запросов на одной видеокарте — указанные выше значения по умолчанию для одной видеокарты — это отправная точка, а не производственная конфигурация. Настройте --max-num-seqs, кэш KV и конфигурацию MTP в соответствии с вашим собственным смешанным набором запросов, прежде чем считать задачу выполненной.
Суть
Qwen3.8 27B — это редкая плотная 27B-модель, которую vLLM обслуживает на одном GPU в продакшене. Обновитесь до vLLM 0.17.0+, скачайте NVFP4-квант объёмом 24.6 ГиБ для карты Blackwell на 32 ГБ, FP8-квант для одной карты на 48 ГБ или двух в тензорном параллелизме, а BF16 оставьте для GPU на 80 ГБ. Команды — это однострочники, эндпоинт совместим с OpenAI, а поскольку веса распространяются под Apache 2.0, вы можете либо запустить модель самостоятельно, либо арендовать её за $0.33/$2.40 за миллион токенов с бесплатным тарифом — клиентский код в обоих случаях один и тот же. Единственное, чего пока ни у кого нет, — это независимые цифры пропускной способности для 27B на vLLM, так что заложите час на бенчмаркинг после запуска, прежде чем обещать кому-либо цифры задержки.
