Qwen3.8-27B on vLLM이라고 적혀 있고 '하나 또는 두 개의 GPU에서 프로덕션 환경으로 서비스하세요'라는 부제목이 있는 히어로 타이틀 카드, 서버 아이콘, 그리고 NVFP4 24.6 GiB, FP8 48GB, BF16 80GB로 레이블이 지정된 포맷 칩.
Guides & Insights

vLLM에서 Qwen3.8-27B: 하나 또는 두 개의 GPU로 프로덕션 서비스하기

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

네 — Qwen3.8 27B는 오늘날 vLLM에서 프로덕션 환경으로 서빙되며, 대부분의 경우 단일 GPU에서도 가능합니다. 중요한 것은 vLLM 0.17.0 이상 버전입니다. 이 버전에는 공식 레시피, 이 모델에 필요한 하이브리드 어텐션 커널, 그리고 OpenAI 호환 /v1 엔드포인트가 포함되어 있습니다. Blackwell GPU 한 장이라면 NVFP4 양자화를 실행하세요 — vLLM 자체 레시피에서 텐서 병렬 크기 1 기준 VRAM 24.6 GiB로 측정됩니다. 48GB 카드 한 장이라면 FP8을 실행하세요. 전체 BF16은 51.7GB 체크포인트로, 80GB GPU 한 장 또는 48GB 카드 두 장을 텐서 병렬로 구성해야 합니다. 정확한 명령은 아래에 있으며, 첫 번째는 한 줄 명령입니다.

여기 있는 모든 내용은 가중치가 공개된 셋째 날인 2026년 8월 15일에 검증되었습니다. 아키텍처, 컨텍스트, 라이선스는 Hugging Face의 Qwen3.8 27B 모델 카드에서 가져왔고, 체크포인트 크기는 해당 리포지토리의 18개 safetensors 샤드 합계이며, vLLM 명령과 24.6 GiB 수치는 이 모델에 대한 vLLM 자체 레시피 페이지에서 가져왔습니다. Qwen3.8 27B는 Alibaba의 270억 파라미터 dense 멀티모달 모델로, Apache 2.0 가중치이며 8월 13–14일에 공개되었습니다. 가중치가 오픈되어 있으므로 토큰을 임대하는 대신 직접 서빙할 수 있습니다. 그 갈림길이 바로 이 글이 정말로 다루는 주제입니다.

출처와 함께, 중요한 사실들

• 아키텍처 — 27B dense(비전 타워와 패딩된 어휘를 포함하면 27.8B), 64개 레이어, 히든 크기 5,120, 어휘 크기 248,320. 공식 모델 카드, 오늘 검증 완료.

• 어텐션 — 하이브리드: 3:1 블록 패턴으로 구성된 16개의 전체 어텐션 층과 48개의 Gated DeltaNet 선형 층. 16개 층만 계속 커지는 키-값 캐시를 유지하고, 나머지 48개 층은 대신 고정 크기의 순환 상태를 유지합니다.

• 컨텍스트 — 네이티브 262,144 토큰, YaRN RoPE 스케일링을 통해 약 1M까지 확장 가능. 모델 카드, 오늘 검증됨.

• 입력 — 네이티브 텍스트, 이미지, 동영상, 텍스트 출력. vLLM은 표준 chat-completions API를 통해 이 세 가지를 모두 제공하며, 별도의 프로젝터 파일이 필요하지 않습니다.

• 라이선스 — Apache 2.0. 바로 이 단 하나의 사실 때문에 "직접 서빙할 것인가, 토큰을 임대할 것인가"라는 질문이 애초에 존재하는 것입니다.

• 가중치 — BF16 체크포인트는 18개의 safetensors 샤드에 걸쳐 총 51.7GB입니다(Hugging Face, 오늘 확인). Qwen은 vLLM용으로 제작된 FP8 및 NVFP4 체크포인트도 공개합니다.

• vLLM 요구 사항 — 0.17.0 이상, transformers ≥ 5.8.0 필요. vLLM의 레시피 페이지에서 오늘 확인함. "아무 vLLM"은 안전한 지침이 아니다; 새로운 버전이 추가하는 것은 순환 레이어 커널이다.

• 멀티 토큰 예측 — 추측 디코딩(speculative decoding)용 드래프트 헤드가 체크포인트에 포함되어 제공되므로 별도의 드래프트 모델이 필요하지 않습니다. vLLM이 해당 플래그를 문서화하고 있지만, 아직 독립적인 속도 향상 수치는 존재하지 않습니다.

GPU 래더 — 어떤 퀀트를 어느 카드에

세 가지 서빙 형식이 실용적인 범위를 아우릅니다. "최고의 양자화"가 아니라, 실제로 보유한 VRAM을 기준으로 선택하세요.

• NVFP4 — 총 24.6 GiB(가중치에 FP8 KV 캐시 포함), TP1에서의 vLLM 레시피 기준. Blackwell급 GPU 한 장에 들어갑니다 — 실제로는 32GB RTX 5090 또는 B200입니다. 지연 시간이 가장 낮은 경로이며 카드당 가장 많은 컨텍스트를 유지하는 방식입니다: vLLM 레시피는 1M 컨텍스트 확장에서도 6.6M KV 토큰 용량을 보고합니다.

• FP8 — 약 26GB의 가중치입니다. 48GB 카드 한 장(L40S, RTX A6000, RTX 6000 Ada)이면 컨텍스트를 위한 여유를 남기고 이를 서비스할 수 있으며, 48GB 카드 두 장을 텐서 병렬로 구성하면 더 긴 컨텍스트나 더 높은 동시성을 위한 여유가 생깁니다. vLLM 자체 레시피는 가능한 한 가장 큰 KV 캐시를 원할 때 4-GPU GB300 트레이 전반에서 TP4로 FP8을 실행합니다.

• BF16 — 51.7GB의 가중치이므로 단일 80GB GPU(H100, A100 80GB, B200, GB300) 또는 TP2로 구성한 48GB 카드 2장이면 됩니다. 이것은 참조 정밀도 옵션이며, 아래의 1M 컨텍스트 확장 명령이 실제로 사용하는 옵션입니다.

• MXFP4 — NVIDIA에서는 사용하지 마세요. vLLM의 MXFP4 경로에는 현재 linear 방식 지원이 빠져 있습니다. 동일한 가중치가 NVFP4로도 공개되어 있는데, 이는 NVIDIA 레시피가 실제로 사용하는 형식입니다.

A GPU ladder card for Qwen3.8-27B on vLLM: NVFP4 at 24.6 GiB on one 32GB Blackwell card at TP1 highlighted as the single-GPU pick, FP8 at about 26GB on one 48GB card or two at TP2, BF16 at 51.7GB on one 80GB GPU or two 48GB at TP2, plus a warning that MXFP4 does not run on NVIDIA.

실행하세요 — vLLM 명령어

저지연 단일 GPU 기본값(NVFP4, Blackwell GPU 1개), vLLM 레시피에서 그대로:

vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

동일한 레시피의 FP8 명령(TP4, GB300 트레이 1개, 최대 KV 캐시):

vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3

48GB 카드 두 장의 경우에는 FP8 명령을 유지하고 --tensor-parallel-size 2를 4 대신 설정하세요.

MTP 추측 디코딩을 활성화하려면 두 명령 중 하나에 다음을 추가하세요:

--speculative-config '{"method":"mtp","num_speculative_tokens":3}'

1M 컨텍스트 확장(vLLM의 레시피에서도 나온 것입니다):

vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

A terminal-style card showing the vLLM serve command for Qwen3.8-27B NVFP4 on one GPU with the flags tensor-parallel-size 1, max-model-len 262144, kv-cache-dtype fp8, reasoning-parser qwen3, and tool-call-parser qwen3_coder.

Point any O​penAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.

vLLM 자체 페이지가 약속하는 것과 약속하지 않는 것

• 아직 27B 처리량 수치는 없습니다. 8월 15일 기준, vLLM의 레시피 페이지에는 Qwen3.8 27B에 대한 처리량 또는 지연 시간 벤치마크가 게시되어 있지 않습니다. 떠도는 "GPU당 초당 4,000+ 토큰" 수치는 72-GPU GB300 NVL72 랙에서의 Qwen3.8 2.4T-A95B에 해당하며, 벤더가 보고한 수치이고, 이 모델의 수치가 아닙니다. 여러분이 보게 될 커뮤니티의 초당 토큰 수치는 llama.cpp 또는 Ollama에서 GGUF용으로 유통되는 것으로, vLLM 서빙과는 다른 런타임이자 다른 워크로드입니다.

• 저렴한 KV 캐시라는 주장은 런타임에 따라 달라진다. 모델 카드에는 64개 레이어 중 16개만 캐시를 유지한다고 적혀 있지만, 이는 서빙 엔진이 실제로 Gated DeltaNet 레이어를 구현한 경우에만 도움이 된다. vLLM 0.17+가 바로 그 구현을 갖춘 버전이며, 그래서 이 글에서 버전 고정이 각주가 아니라 맨 처음에 등장하는 것이다.

• MTP는 내장되어 있지만 여기서는 측정되지 않았습니다. 드래프트 헤드는 체크포인트에 포함되어 있고 vLLM이 해당 플래그를 문서화하고 있지만, 아직 아무도 vLLM에서 이 27B 모델의 독립적인 속도 향상 수치를 발표하지 않았습니다. 자체 트래픽에서 측정할 계획을 세우세요.

• NVIDIA가 검증된 경로입니다. vLLM의 레시피는 NVIDIA GPU(NVFP4 및 FP8)를 위해 작성되었습니다. 이 하이브리드 어텐션 모델을 AMD Instinct나 Intel Gaudi에 배포하는 것은 여전히 최첨단 실험 단계에 있으며, 이 글은 그렇지 않은 척하지 않습니다.

직접 서비스하거나, 토큰을 임대하세요

바로 여기서 Apache 2.0이 위력을 발휘합니다. Qwen3.8 27B에는 토큰당 라이선스 요금이 없으므로, 실제로 남는 질문은 하드웨어를 소유하느냐, 아니면 토큰을 빌리느냐뿐입니다.

• 셀프 호스팅(이 글) — GPU 비용은 한 번만 지불하면 그 이후의 모든 토큰은 무료입니다. 이미 보유한 RTX 5090이 있다면 NVFP4 명령은 데이터가 장비 밖으로 나가지 않는 한계 비용 제로 엔드포인트가 됩니다. GPU를 임대해야 한다면 클라우드 5090 또는 A6000 두 대가 비용 항목이 되며, 이 논리는 이미 카드를 보유했거나 지속적인 볼륨이 있을 때만 성립합니다.

• 토큰을 임대하세요 — 가중치가 공개되어 있기 때문에 여러 호스트가 이를 운영하며, 가격 하한선은 하드웨어 비용입니다. Qwen3.8 27B는 오늘 OrcaRouter에서 백만 입력 토큰당 $0.33, 백만 출력 토큰당 $2.40에 제공됩니다 — OrcaRouter가 자체 인프라에서 공개 가중치를 운영하므로 전달할 벤더 마크업이 없습니다 — 그리고 동일한 공개 가중치가 요청당 $0를 청구하고 한도를 초과하면 HTTP 429를 반환하는 속도 제한 무료 티어를 지원합니다. 입력 비중 70%인 대표적인 월 1,000만 토큰 사용량은 유료 티어에서 약 $9.51입니다.

• 판단 기준 — 이미 GPU를 보유하고 있다면 자체 호스팅하세요. GPU를 사거나 빌려야 한다면, 사이드 프로젝트 규모에서는 API가 금방 본전을 뽑습니다. 게다가 동일한 O​penAI 호환 클라이언트가 양쪽 엔드포인트를 가리키므로, 옮겨가도 코드는 바뀌지 않습니다.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, text image and video input, and p50 time-to-first-token of 225 milliseconds.

vLLM이 잘못된 선택일 때

• 노트북 한 대에서 혼자 쓰는 상황 — vLLM은 서빙 엔진이지 데스크톱 앱이 아닙니다. 단일 사용자 로컬 실행에는 Q4 GGUF를 사용하는 llama.cpp나 Ollama가 더 간단하며, Blackwell GPU가 아니라 24GB 카드가 필요합니다. Qwen3.8-27B를 로컬에서 실행하는 방법 가이드에서 그 경로를 처음부터 끝까지 안내합니다.

• 운영 부담 없이 보장된 처리량이 필요합니다 — 자체 호스팅은 호출 알림, 큐잉, 페일오버를 모두 직접 감당해야 한다는 뜻입니다. "API가 다운됐다"는 말을 당신의 어휘에 넣고 싶지 않다면, 대신 토큰을 임대하고 다른 누군가가 인프라를 운영하게 하십시오.

• 프런티어급 품질로 전체 ~1M 컨텍스트가 정말로 필요하다면 — 그 일은 Qwen3.8 2.4T-A95B의 몫이며, 72-GPU GB300 NVL72 랙 전반에서 vLLM 또는 SGLang으로 서빙됩니다. GPU 한두 개에 올린 Qwen3.8 27B는 이에 맞먹지 못합니다. 2.4T에 관한 저희 서빙 아티클에서 그 모델이 왜 다른 부류의 문제인지 설명합니다.

• 구형 24GB 카드를 사용 중입니다 — NVFP4는 Blackwell 형식입니다. Ampere(RTX 3090) 또는 Ada(RTX 4090) 24GB 카드에서는 FP8 경로가 vLLM 옵션이고, 그 이상은 llama.cpp에서의 GGUF 양자화가 현실적인 한계입니다. 24GB 카드에서 같은 모델은 다른 글입니다.

• 카드 한 장에서 최대 동시성을 처리해야 합니다 — 위의 단일 GPU 기본값은 출발점일 뿐, 프로덕션 형태가 아닙니다. 완료라고 판단하기 전에 자체 요청 구성에 맞춰 --max-num-seqs, KV 캐시, MTP 구성을 튜닝하세요.

결론

Qwen3.8 27B는 vLLM이 프로덕션에서 단일 GPU로 서빙하는 드문 dense 27B 모델입니다. vLLM 0.17.0+로 업데이트하고, 32GB Blackwell 카드용 NVFP4 양자화를 24.6 GiB로 받고, 48GB 카드 한 장 또는 텐서 병렬로 두 장을 위한 FP8 양자화를 받으며, BF16은 80GB GPU용으로 남겨 두세요. 명령은 한 줄짜리이고, 엔드포인트는 OpenAI 호환이며, 가중치가 Apache 2.0이므로 직접 서빙하거나 무료 티어가 포함된 백만 토큰당 $0.33/$2.40에 임대할 수 있습니다 — 어느 쪽이든 클라이언트 코드는 동일합니다. 아직 아무도 없는 한 가지는 vLLM에서 27B의 독립적인 처리량 수치이므로, 누군가에게 지연 시간 수치를 약속하기 전에 부팅 후 벤치마킹 한 시간을 잡아 두세요.