Qwen3.8-27B on vLLM과 '하나 또는 두 개의 GPU에서 프로덕션으로 서비스'라는 부제가 표시된 히어로 타이틀 카드, 서버 아이콘, NVFP4 24.6 GiB, FP8 48GB, BF16 80GB로 라벨링된 포맷 칩.
Guides & Insights

vLLM에서의 Qwen3.8-27B: GPU 1개 또는 2개로 프로덕션에서 서빙하기

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

네 — Qwen3.8 27B는 오늘날 vLLM에서 프로덕션 서빙되고 있으며, 대부분의 경우 단일 GPU에서도 작동합니다. 중요한 버전은 vLLM 0.17.0 이상입니다. 이 버전은 공식 레시피, 이 모델에 필요한 하이브리드 어텐션 커널, 그리고 OpenAI 호환 /v1 엔드포인트를 제공합니다. Blackwell GPU 하나를 사용한다면 NVFP4 양자화를 실행하세요. vLLM 자체 레시피는 텐서 병렬 크기 1에서 VRAM 24.6 GiB를 사용한다고 측정합니다. 단일 48GB 카드에서는 FP8을 실행하세요. 전체 BF16은 51.7GB 체크포인트로, 80GB GPU 하나 또는 텐서 병렬로 구성된 48GB 카드 두 개가 필요합니다. 정확한 명령어는 아래에 있으며, 첫 번째는 한 줄짜리입니다.

여기에 있는 모든 내용은 2026년 8월 15일, 가중치가 공개된 지 사흘째 되는 날에 검증되었습니다. 아키텍처, 컨텍스트, 라이선스는 Hugging Face의 Qwen3.8 27B 모델 카드에서 가져왔고, 체크포인트 크기는 리포지토리의 safetensors 샤드 18개의 합계입니다. vLLM 명령어와 24.6 GiB 수치는 이 모델에 대한 vLLM 자체 레시피 페이지에서 가져온 것입니다. Qwen3.8 27B는 Alibaba의 밀집 270억 파라미터 멀티모달 모델로, Apache 2.0 가중치를 사용하며 8월 13~14일에 공개되었습니다. 가중치가 공개되어 있으므로 토큰을 임대하는 대신 직접 서비스할 수 있습니다. 그 포크가 바로 이 글의 진짜 주제입니다.

중요한 사실, 출처와 함께

아키텍처 — 27B dense(비전 타워와 패딩 어휘 포함 27.8B), 64개 레이어, 히든 크기 5,120, 어휘 248,320. 공식 모델 카드에서 오늘 확인됨.

어텐션 — 하이브리드: 3:1 블록 패턴으로 16개의 전체 어텐션 레이어와 48개의 Gated DeltaNet 선형 레이어로 구성됩니다. 오직 16개 레이어만 증가하는 키-값 캐시를 유지하고, 나머지 48개는 대신 고정 크기의 순환 상태를 유지합니다.

컨텍스트 — 기본적으로 262,144개 토큰을 지원하며, YaRN RoPE 스케일링을 통해 약 1M까지 확장 가능합니다. 모델 카드, 오늘 검증됨.

입력 — 네이티브 텍스트, 이미지, 비디오; 텍스트 출력. vLLM은 표준 chat-completions API를 통해 세 가지 모두를 제공하며, 별도의 projector 파일이 필요하지 않습니다.

라이선스 — Apache 2.0. 이 한 가지 사실이 바로 "직접 서빙할 것인가 vs 토큰을 임대할 것인가"라는 질문이 존재하는 이유입니다.

가중치 — BF16 체크포인트는 총 51.7GB로 18개의 safetensors 샤드에 걸쳐 있습니다 (Hugging Face, 오늘 확인됨). Qwe​n은 또한 vLLM용으로 구축된 FP8 및 NVFP4 체크포인트를 게시합니다.

vLLM 요구 사항 — 0.17.0 이상, transformers ≥ 5.8.0 포함. vLLM의 레시피 페이지에서 오늘 확인함. "모든 vLLM"은 안전한 지침이 아닙니다. 새 버전에서 추가된 것은 순환 계층 커널입니다.

멀티 토큰 예측 — 추측 디코딩 드래프트 헤드가 체크포인트에 내장되어 있으므로 별도의 드래프트 모델이 필요하지 않습니다. vLLM은 플래그를 문서화하며, 아직 독립적인 속도 향상 수치가 없습니다.

GPU 사다리 — 어떤 카드에 어떤 양자화

세 가지 서빙 형식이 실용적인 범위를 포괄합니다. '최고의 양자화'가 아니라 실제로 가진 VRAM에 따라 선택하세요.

NVFP4 — TP1 기준 vLLM 레시피에 따르면 총 24.6GiB(가중치와 FP8 KV 캐시 포함)입니다. 단일 Blackwell급 GPU에 맞으며, 실질적으로는 32GB RTX 5090 또는 B200에 해당합니다. 이는 최저 지연 시간 경로이자 카드당 가장 많은 컨텍스트를 유지하는 방식입니다. vLLM 레시피는 1M 컨텍스트 확장에서도 6.6M KV-토큰 용량을 보고합니다.

FP8 — 약 26GB의 가중치입니다. 48GB 카드 한 장(L40S, RTX A6000, RTX 6000 Ada)으로 컨텍스트 여유를 두고 서빙할 수 있으며, tensor-parallel로 48GB 카드 두 장을 사용하면 더 긴 컨텍스트나 더 높은 동시성을 처리할 여유가 생깁니다. 가장 큰 KV 캐시를 원한다면 vLLM의 자체 레시피는 4-GPU GB300 트레이에서 TP4로 FP8을 실행합니다.

BF16 — 51.7GB의 가중치이므로 단일 80GB GPU(H100, A100 80GB, B200, GB300) 또는 TP2의 48GB 카드 두 개면 충분합니다. 이것이 기준 정밀도 옵션이며, 아래의 1M 컨텍스트 확장 명령이 실제로 사용하는 옵션입니다.

MXFP4 — NVIDIA에서는 사용하지 마십시오. vLLM의 MXFP4 경로에는 현재 linear-method 지원이 빠져 있습니다. 동일한 가중치는 NVIDIA 레시피에서 실제로 사용하는 형식인 NVFP4로 게시되어 있습니다.

A GPU ladder card for Qwen3.8-27B on vLLM: NVFP4 at 24.6 GiB on one 32GB Blackwell card at TP1 highlighted as the single-GPU pick, FP8 at about 26GB on one 48GB card or two at TP2, BF16 at 51.7GB on one 80GB GPU or two 48GB at TP2, plus a warning that MXFP4 does not run on NVIDIA.

실행하세요 — vLLM 명령어

저지연 단일 GPU 기본값(NVFP4, Blackwell GPU 1개), vLLM의 레시피에서 그대로:

vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

동일한 레시피의 FP8 명령(TP4, GB300 트레이 1개, 최대 KV 캐시):

vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3

48GB 카드 두 개를 사용하는 경우, FP8 명령을 유지하고 --tensor-parallel-size 2를 4 대신 설정하세요.

MTP 추측 디코딩을 활성화하려면 다음을 두 명령 중 하나에 추가하십시오:

--speculative-config '{"method":"mtp","num_speculative_tokens":3}'

1M-컨텍스트 확장 (vLLM의 레시피에서도):

vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

A terminal-style card showing the vLLM serve command for Qwen3.8-27B NVFP4 on one GPU with the flags tensor-parallel-size 1, max-model-len 262144, kv-cache-dtype fp8, reasoning-parser qwen3, and tool-call-parser qwen3_coder.

Point any O​penAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.

vLLM 자체 페이지가 약속하는 것과 약속하지 않는 것

아직 27B 처리량 수치는 없습니다.8월 15일 기준, vLLM의 레시피 페이지는 Qwen3.8 27B에 대한 처리량 또는 지연 시간 벤치마크를 게시하지 않습니다. 돌아다니는 'GPU당 초당 4,000개 이상의 토큰' 수치는 72-GPU GB300 NVL72 랙의 Qwen3.8 2.4T-A95B에 속한 것으로, 벤더가 보고한 것이며 이 모델에 대한 것이 아닙니다. 커뮤니티에서 유포되는 초당 토큰 수치는 llama.cpp 또는 Ollama에서 GGUF에 대한 것으로, vLLM 서빙과는 다른 런타임이자 다른 워크로드입니다.

'저비용 KV 캐시'라는 주장은 런타임에 따라 달라집니다. 모델 카드에는 64개 레이어 중 16개만 캐시를 유지한다고 나와 있지만, 이는 서빙 엔진이 실제로 Gated DeltaNet 레이어를 구현하고 있을 때만 의미가 있습니다. 해당 기능을 구현한 버전은 vLLM 0.17+이며, 이것이 이 문서에서 버전 고정을 각주가 아닌 첫 번째 항목으로 배치한 이유입니다.

MTP는 내장되어 있지만 여기서는 측정되지 않았습니다. 드래프트 헤드는 체크포인트에 있고 vLLM이 해당 플래그를 문서화하고 있지만, 아직 이 27B에 대한 독립적인 속도 향상 수치를 vLLM에서 발표한 사람은 없습니다. 자체 트래픽에서 직접 측정할 계획을 세우세요.

NVIDIA는 검증된 경로입니다.vLLM의 레시피는 NVIDIA GPU(NVFP4 및 FP8)용으로 작성되었습니다. 이 하이브리드 어텐션 모델의 AMD Instinct 또는 Intel Gaudi 배포는 아직 초기 단계이며, 이 글도 이를 인정합니다.

직접 제공하거나 토큰을 대여하세요

Apache 2.0이 제 역할을 하는 곳이 바로 여기입니다. Qwen3.8 27B에는 토큰당 라이선스 요금이 없으므로, 진짜 질문은 하드웨어를 소유할지 아니면 토큰을 임대할지뿐입니다.

자체 호스팅(이 글) — GPU 비용을 한 번만 지불하면 이후 모든 토큰은 무료입니다. 이미 보유한 RTX 5090은 NVFP4 명령을 한계 비용 0 엔드포인트로 만들어 주며, 데이터가 장비 밖으로 나가지 않습니다. GPU를 임대해야 한다면 클라우드 5090 또는 A6000 두 대가 비용 항목이 되며, 이 주장은 이미 카드를 보유했거나 지속적인 사용량이 있을 때만 설득력을 얻습니다.

토큰을 임대하세요 — 가중치가 공개되어 있으므로 여러 호스트가 이를 실행하며, 최저 가격은 하드웨어 비용입니다. Qwen3.8 27B가 오늘 OrcaRouter에서 출시되었으며, 입력 토큰 100만 개당 $0.33, 출력 토큰 100만 개당 $2.40입니다 — OrcaRouter가 자체 인프라에서 오픈 가중치를 실행하므로 전가할 벤더 마크업이 없습니다 — 그리고 동일한 오픈 가중치는 요청당 $0를 청구하고 한도를 초과하면 HTTP 429를 반환하는 속도 제한 무료 티어를 지원합니다. 대표적인 예로, 입력 비중 70%의 월 1,000만 토큰 사용 시 유료 티어에서 약 $9.51이 부과됩니다.

결정 규칙 — GPU를 이미 소유하고 있다면 자체 호스팅하세요. GPU를 사거나 임대해야 한다면, API는 사이드 프로젝트 규모에서 빠르게 손익분기점에 도달하며, 동일한 O​penAI 호환 클라이언트가 어느 엔드포인트든 가리키므로 코드는 이동하더라도 변경되지 않습니다.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, text image and video input, and p50 time-to-first-token of 225 milliseconds.

vLLM이 틀린 답일 때

당신은 노트북 한 대를 쓰는 한 명의 사용자입니다 — vLLM은 데스크톱 앱이 아니라 서빙 엔진입니다. 단일 사용자의 로컬 실행에는 Q4 GGUF를 사용하는 llama.cpp나 Ollama가 더 간단하며, Blackwell GPU가 아닌 24GB 카드면 충분합니다. 저희 how-to-run-Qwen3.8-27B-locally 가이드가 그 과정을 처음부터 끝까지 안내합니다.

보장된 처리량과 제로 옵스가 필요합니다 — 자체 호스팅은 페이징, 큐잉, 페일오버를 모두 직접 책임진다는 뜻입니다. 'API가 다운됐다'는 말을 하고 싶지 않다면, 대신 토큰을 임대하고 다른 사람이 플릿을 운영하게 하세요.

정말로 최첨단 품질의 전체 ~1M 컨텍스트가 필요하다면, 그것은 Qwen3.8 2.4T-A95B의 몫이며, 72-GPU GB300 NVL72 랙에서 vLLM 또는 SGLang으로 서빙됩니다. Qwen3.8 27B는 GPU 1~2개로는 이를 따라올 수 없습니다. 2.4T에 대한 저희 서빙 관련 글에서 그 모델이 왜 다른 종류의 문제인지 설명합니다.

당신은 구형 24GB 카드를 사용 중입니다 — NVFP4는 Blackwell 포맷입니다. Ampere(RTX 3090) 또는 Ada(RTX 4090) 24GB 카드에서는 FP8 경로가 vLLM 옵션이며, 그 너머로는 llama.cpp의 GGUF 양자화가 실용적인 종착점입니다. 같은 모델이라도 24GB 카드에서는 다른 이야기입니다.

단일 카드에서 최대 동시성을 제공해야 합니다 — 위의 단일 GPU 기본값은 시작점일 뿐, 프로덕션 형태가 아닙니다. --max-num-seqs, KV 캐시 및 MTP 구성을 자체 요청 혼합에 맞게 조정한 후 완료로 간주하세요.

결론

Qwen3.8 27B는 vLLM이 프로덕션에서 단일 GPU로 서빙하는 보기 드문 밀집형 27B 모델입니다. vLLM 0.17.0+로 업데이트하고, 32GB Blackwell 카드에서는 24.6 GiB NVFP4 양자화 버전을, 48GB 카드 한 개 또는 텐서 병렬로 두 개를 사용할 때는 FP8 양자화 버전을 받으세요. BF16은 80GB GPU용으로 남겨 두세요. 명령어는 한 줄로 끝나고, 엔드포인트는 OpenAI 호환이며, 가중치가 Apache 2.0이므로 직접 서빙하거나 무료 티어가 포함된 백만 토큰당 $0.33/$2.40으로 임대할 수 있습니다. 어느 쪽이든 동일한 클라이언트 코드입니다. 아직 아무도 vLLM에서 27B에 대한 독립적인 처리량 수치를 갖고 있지 않으니, 부팅한 뒤 벤치마킹에 한 시간을 투자하고 나서 누구에게 지연 시간 수치를 약속하세요.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube