
Qwen4Exp 배치 샤딩 샘플링: vLLM PR #61018 내부, 그리고 Qwen 4에 대해 말하는 내용
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 82 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
vLLM 풀 리퀘스트 #61018에서 가장 많은 정보를 담고 있는 숫자는 손실값, 1.5%다. 그것은 작성자가 자기 변경에 스스로 붙인 상한이다. 42밀리초짜리 평균 스텝에서 약 0.6~0.8밀리초를 아끼는 정도이고, 그것도 그가 소유하지도 않은 머신에서 측정한 값이며, 그가 전혀 실행해 볼 수 없는 패치에서 나온 값이다. "[Model] Qwen4Exp: support batch-sharded sampling (compute_logits_local)"이라는 제목으로 2026-10-10에 기여자 kimseunghyun-kr가 연 이 풀 리퀘스트는, Qwen4Exp 아키텍처가 vLLM이 8월에 출시한 샘플링 경로를 택할 수 있도록 두 파일에 세 줄의 모델 코드를 추가한다. 초안 상태다. 모델 코드 14줄에 테스트 57줄이 전부다. 그런데도 자세히 읽어볼 가치가 있다. 그 세 줄이 무엇을 덧대고 있는지 때문이다. Qwen4Exp는 Qwen3.8-Flash-Next 내부의 아키텍처로, 벤더가 2026-08-24에 "Qwen4를 떠받칠 아키텍처의 실험적 프리뷰"로 공개한 1,250억 매개변수 오픈 웨이트 모델인데, 그 아키텍처의 텍스트 전용 절반에 있는 두 경로짜리 버그는 바로 출시 발표문이 아니라 서빙 계층을 지켜봐야만 알게 되는 그런 종류의 세부 사항이다.
프레이밍에 대해 분명히 하자면, 여기서 중요한 부분이기 때문입니다: Qwen 4 자체는 아직 출시되지 않았습니다. 공급업체는 2026-09-22 자사의 Apsara 콘퍼런스에서 Qwen 4의 네 가지 티어 — Qwen 4 Max, Flash, Plus, 27B — 를 거명했으며, 그중 어느 것에 대해서도 가중치, 식별자, 가격, 컨텍스트 길이, 벤치마크를 공개하지 않았습니다. 아래 내용 중 출시된 것은 없습니다. 이 글은 단일 초안 풀 리퀘스트에 관한 현시점까지 알려진 내용 정리이며, 여기서 숫자를 담고 있는 모든 항목은 검증할 수 있는 타임스탬프이거나, 기여자가 자신의 PR 본문에 입력한 수치이거나, 공개된 모델 구성 파일에서 읽어낸 값입니다.
배치 샤딩 샘플링이란 무엇인지, 한 문단으로
텐서 병렬화는 모델의 가중치를 여러 GPU에 분할합니다. 어휘 프로젝션은 스택에서 가장 넓은 단일 텐서이므로, 각 랭크는 보통 어휘에서 자신의 슬라이스만 계산하고, 그다음 모든 랭크가 올개더(all-gather)를 수행하여 각 랭크가 배치의 모든 요청에 대한 전체 로짓을 보유하게 됩니다. 샤딩된 샘플링은 이 교환을 뒤집습니다. 랭크 간에 어휘를 복제하는 대신 배치를 샤딩합니다. 즉, 각 랭크는 요청의 한 슬라이스를 샘플링하고, 랭크들은 올투올(all-to-all)을 통해 서로 어휘 슬라이스를 교환합니다. vLLM 자체 CLI 문서는 이 플래그를 간단히 설명합니다 — "각 랭크는 배치의 일부를 샘플링하며, 모든 랭크가 전체를 샘플링하는 것이 아닙니다" — 그리고 제약 조건을 명시합니다: --enable-batch-sharded-sampling의 기본값은 False이고, 다음을 요구합니다: tensor_parallel_size가 1보다 클 것, 최대 시퀀스 수가 최소 tensor_parallel_size개일 것, 그리고 음수가 아닌 max_logprobs. 그 문서의 마지막 줄은 이 풀 리퀘스트가 매달려 있는 고리입니다: "모델은 compute_logits_local을 구현함으로써 옵트인합니다."
이 기능 자체는 새로운 것이 아니다. vLLM은 2026-08-24에 Giancarlo Delfin이 올린 PR #50465 — "[Model Runner V2] batch-sharded sample" — 로 이를 병합했는데, 이는 Qwen3.8-Flash-Next의 가중치가 공개된 바로 그날이었다. 당시의 동기는 메모리와 지연 시간이었다: 전체 타깃 로짓을 실제로 물질화하는 데는 배치 크기 × (추측 토큰 + 1) × 어휘 크기 정도의 비용이 들고, 샤딩은 그 할당량을 텐서 병렬 차수만큼 줄이는 동시에 샘플러의 top-k 및 top-p 작업이 병렬로 실행되게 해준다. 이것은 목적지가 아니라 이를 가능하게 하는 단계일 뿐이다: PR 본문 자체에서도 샤딩된 드래프트 로짓을 향후 작업으로 언급하고 있다.
왜 세 줄이 작업의 전부였는지
![GitHub page for vllm-project/vllm pull request 61018, titled "[Model] Qwen4Exp: support batch-sharded sampling (compute_logits_local)", showing the Draft badge, a three-file diff with 71 additions, the qwen label and the PR body.](https://cms.orcarouter.ai/api/media/file/2-1829.png)
여기 실제 결함이 있습니다. 이 결함은 코드 외부에서는 보이지 않기 때문에 좋은 결함입니다. vLLM의 Qwen4Exp 구현은 두 개의 클래스로 제공됩니다. Qwen4ExpForConditionalGeneration은 비전-언어 래퍼입니다 — 언어 모델에 Qwen3-VL 비전 타워를 붙인 것입니다 — 그리고 Qwen4ExpForCausalLM은 텍스트 전용 경로입니다. 래퍼는 compute_logits_local을 Qwen3_5ForConditionalGeneration으로부터 상속받는데, 이는 호출을 language_model.compute_logits_local로 전달합니다. 하지만 래퍼가 가리키던 언어 모델 클래스는 그 메서드를 정의한 적이 없습니다.
그래서 두 경로는 서로 다른 상태에 있었습니다. Qwen3.8-Flash-Next의 비전-언어 배포는 샤딩된 경로를 탈 수 있었지만, 텍스트 전용 배포는 그럴 수 없었습니다. 래퍼가 위임한 메서드가 존재하지 않았기 때문입니다. 해결책은 하나의 메서드이며, 모델 파일의 NVIDIA 및 AMD 사본에서 동일합니다:
• 이 메서드는 self.logits_processor(self.lm_head, hidden_states, skip_gather=True)를 반환합니다 — 해당 랭크 자체의 어휘 샤드이며, 어떤 랭크에서도 gather가 없고 전체 어휘를 메모리에 올리지 않습니다.
• 이는 PR이 "Qwen3.5 및 MiniMax M3와 동일한 3줄 패턴"이라고 부르는 방식을 따르는데, 잠시 짚고 넘어갈 만하다: 같은 저장소에 있는 다른 두 모델 패밀리는 이미 참여했었다. Qwen4Exp는 단지 그렇게 하지 않은 유일한 모델이었을 뿐이다.
테스트 파일은 패치의 정직성을 확인하기 가장 쉬운 곳이며, 그 한계를 보기 가장 쉬운 곳이다. 57줄이고, NVIDIA와 AMD 모듈 모두에 대해 파라미터화되어 있으며, 모델을 다운로드하지 않는다. 헬퍼는 object.__new__로 클래스를 만들고, 언어 모델 헤드 자리에 nn.Identity를 대체하며, 입력에 1을 더한 값을 반환하면서 호출된 방식을 기록하는 가짜 로짓 프로세서를 설치한다. 첫 번째 테스트는 4.0이 들어가면 5.0이 나오는지, 그리고 기록된 호출이 skip_gather=True를 담고 있었는지 검증한다. 두 번째는 언어 모델을 조건부 생성 클래스로 감싸고 위임이 제대로 전달되는지 검증한다. 이는 배선에 대한 진짜 테스트이고 그 외에는 아무것도 테스트하지 않는다 — 어떤 커널도 실행되지 않고, 어떤 랭크 경계도 넘지 않으며, 관련된 GPU 수는 0이다.
그 두 가지 사실은 PR에 묻혀 있지 않고 명시되어 있습니다. 테스트 파일 자체의 docstring은 Qwen4Exp를 "CPU 전용의 아주 작은 테스트 더블"이라고 부릅니다. 작성자의 검증 섹션에 따르면, 그는 자신의 macOS 환경에서 모델을 전혀 임포트할 수 없었는데, transformers 빌드에 Qwen4ExpConfig가 포함되어 있지 않았기 때문입니다. CUDA 실행은 아직 대기 중이었습니다. 엔드투엔드 벤치마크 — MLPerf 에이전틱 데이터셋, 20개 동시 세션, 60분짜리 3개 조건 — 도 아직 대기 중이었습니다. MTP 드래프터 자체의 로짓 경로는 미검증으로 표시되어 있습니다. LoRA는 이미 업스트림의 플래그에서 거부되므로, 회귀가 아니라 범위 밖의 사안입니다. 초안이 AI 지원으로 작성되었다는 사실을 밝히는 문구도 있으며, 커밋 트레일러에는 Claude Opus 5.5가 공동 작성자로 명시되어 있습니다. 이 정도 규모의 스택에서는 이런 종류의 공개가 당연히 일반적이어야 하는데, 대부분은 그렇지 않습니다.
1.5% 추정치, 그리고 그것과 나란히 놓인 측정값들
기여자의 추정치는 nsys 트레이스인데, Qwen3.8-Flash-Next-FP8에서 텐서 병렬화 8과 8개의 A100-SXM4-40GB 카드에 걸친 전문가 병렬화를 사용한 16개의 동시 세션에서 42밀리초 단계의 약 1.6밀리초이고, 대략 그 3분의 1로 줄어들어 1.5~2%의 종단 간 이득을 제공합니다. 그의 헤드라인은 산술입니다 — 42밀리초 대비 0.6~0.8밀리초. 그것에 붙은 점에 주목하십시오: 42밀리초는 토큰 간 지연 시간 수치이므로, 1.7% 감소는 토큰 생성 시간의 1.7% 감소이며, 추상적인 처리량 주장이 아닙니다.
정직한 비교는 상위 기능 자체의 병합된 수치와 대조하는 것입니다. 왜냐하면 그 수치들은 해당 하드웨어를 가진 사람이 엔드 투 엔드로 측정한 것이기 때문입니다. PR #50465에 게재된 Speed-Bench 2K/2K 실행에서, 배치 샤딩 샘플링은 7개의 추측 토큰과 동시성 64에서 DSpark를 사용하는 DeepSeek V4를 초당 2.62에서 2.66 요청으로 이동시켰습니다 — 1.53% 처리량 증가 — 중앙값 토큰 간 지연 시간은 3.09% 감소하고 첫 토큰까지의 시간은 1.45% 증가했습니다. 8개의 추측 토큰에서 DSpark를 사용하는 MiniMax M3에서는 요청 처리량이 5.38% 상승했고 중앙값 TPOT는 15.61밀리초에서 14.31밀리초로 8.33% 하락했습니다. 그리고 같은 계획은 도움이 되지 않는 부분도 문서화합니다: 동시성 4에서 16에서는 실행 결과가 보합 내지 약간 마이너스였으며, 동시성 16 구간은 처리량 0.54%, 수락 길이 1.89% 감소했습니다.
그 패턴이 기억해야 할 핵심이다. 샤딩된 샘플링은 샘플링이 무겁고 배치가 넓을 때 — 높은 동시성, 많은 추측 토큰, 실제로 동작하는 top-k와 top-p — 이득을 보며, all-to-all이 순전히 오버헤드에 불과할 만큼 배치가 작을 때는 약간의 비용이 든다. 한 모델이 옵트인할 때의 1.5% 추정치는 그와 일치하며, 그것과 상충하지 않는다: 5.38%와 8.33% 수치는 서로 다른 추측 예산을 가진 서로 다른 모델에 속하며, 이 PR의 모델은 자체 구성, 자체 248,320토큰 어휘, 자체 추측 디코딩 경로를 가지고 있다.
이 중 어느 것도 검증되지 않았다. 상위 PR의 수치들은 한 기여자가 단일 노드에서 짝지어 수행한 실행들이고, 여기 스모크 테스트 수치들은 작성자가 가지고 있지 않은 하드웨어에서의 트레이스이며, 그가 단지 16개 세션에서만 측정되었다고 말하는 패치 리비전에서 나온 것이다. 단일 기여자, 단일 구성 측정은 방향에 대한 유용한 신호이지만 용량 계획의 근거로는 빈약하다. 이 주제를 굳이 글로 쓸 가치가 있는 이유는 소수점 값이 아니라 방향이다.
주변 패치 클러스터가 하는 일
초안 PR 하나만으로는 이야기가 되지 않는다. 이야기는 Qwen4Exp가 이것이 반영된 주에 지속적인 서빙 대상이 되었다는 것이고, 그 클러스터에서 가장 작은 패치가 바로 그 패턴을 읽을 수 있게 만드는 패치다. 2026-10-10까지의 7일 동안, vLLM은 같은 기여자와 다른 이들로부터 다음을 포함했다: Ampere에서의 희소 어텐션을 위한 FP8 메인 KV 캐시 경로 — 8개의 A100에서 KV 용량이 1.83배, 4개의 RTX 3090에서 1.87배 증가했고 동시성 16에서 요청 수가 약 2.7배였으며, 대가는 단일 스트림 디코드 TPOT가 약 6% 높아진 것; tensor-parallel 1과 expert parallelism에서의 W4A4 MoE 패딩 수정; 지원되지 않는 AITER FP8 MoE 연산에서 폴백하여 fp16으로 서빙하는 AMD 경로; align 모드를 통해 PLE short-convolution 상태를 전달하는 수정; 그리고 sm_80에서 레지스터당 한 번에 4개의 e4m3 바이트를 언팩하는 디코드 커널. 그중 하나인 H200 M=4 merged QSA LL-GEMM 계획의 재튜닝은 2026-10-09에 main에 병합되었다.
그 목록을 전체적으로 읽어 보면 구체적인 내용을 말해 준다. 벤더가 아직 공개하지 않은 Qwen4Exp 아키텍처는 Ampere, Hopper, ROCm 및 fp16 폴백을 동시에 겨냥해 튜닝되고 있으며, 이는 사람들이 실제로 다운로드할 수 있는 모델에 대한 출시 당일 지원을 제공하는 프로젝트에서 이루어지고 있다. 그 이유는 신비롭지 않다: Qwen3.8-Flash-Next는 실제로 다운로드 가능하고 많이 사용되는 모델이며, Qwen 4가 사용할 아키텍처 위에 구축되어 있다. Qwen 4 가중치가 언젠가 이런 모습으로 등장할지는 알 수 없고 벤더는 아무 말도 하지 않았지만, 서빙 범위는 공개적으로 넓어지고 있으며, 이는 10월에서 11월로 소문난 기간과 달리 검증 가능한 정보이다.
아키텍처 구조의 일부는 발표문이 아니라 구성을 읽는 사람이라면 누구나 알 수 있게 공개되어 있다. Qwen3.8-Flash-Next의 구성에는 48개 레이어에 걸친 248,320토큰 어휘, 전문가 중간 너비 640에서 토큰당 라우팅되는 전문가 10개와 공유 활성 전문가 1개를 둔 512개 전문가, 은닉 크기 2,560, 그리고 100만까지 확장 가능하다고 설명된 262,144토큰의 네이티브 컨텍스트가 나열되어 있다. 이것은 하이브리드다. 레이어 유형 목록은 선형 어텐션 블록 3개와 전체 어텐션 블록 1개를 번갈아 배치하고, 전체 어텐션 블록은 키를 4배로 압축하며 2,048 위치 예산을 유지하는 단일 헤드 인덱서를 갖춘 희소 어텐션 경로를 사용한다. 레이어 2에는 레이어별 임베딩 테이블이 있고, 2천만 항목 어휘를 가진 n-gram 임베딩(이 클러스터의 다른 패치들이 호스트 스테이징하느라 분주한 47.7 GiB 테이블이다)과 추측 디코딩용 1개 레이어 MTP 헤드가 있다. 모델 카드 자체의 요약은 "125B(6B 활성), 그리고 51B n-gram 임베딩과 4B MTP"이다. 로짓 투영을 애초에 샤딩할 만한 이유가 바로 248,320개 항목 어휘다.
이것이 당신에게 달라지지 않는 것
정확하게 짚고 넘어갈 가치가 있습니다. 이 정도로 밀도 높은 패치 묶음은 마치 정식 출시처럼 읽힐 수 있기 때문입니다. 위에서 언급한 것 중 병합된 것은 하나도 없고, 그중 한 가지 — Ampere FP8 KV 캐시 작업 — 은 vLLM의 CI에 A100이 없기 때문에 CI에서 명시적으로 검증되지 않은 상태입니다. Qwen4Exp의 샤딩 샘플링 옵트인을 포함한 vLLM 릴리스 버전은 오늘날 설치할 수 있는 것이 없습니다. 이러한 변경들 아래에서 Qwen3.8-Flash-Next의 서빙 동작에 대한 독립적인 벤치마크도 없습니다. 위에 인용된 모든 수치는 PR 본문에서 나온 것으로, 제3자가 해당 실행을 재현한 적이 없다는 특정한 의미에서 기여자 보고 수치이며 감사되지 않은 것입니다. 그리고 이 글을 시작하게 한 PR의 헤드라인 수치는 1.5%인데, 이는 서빙 스택에서 실질적인 이득이지 모델 선택을 바꿀 이유는 아닙니다.
결정을 바꿀 수 있는 것은 완전하고 감사를 거친 서빙 실행이며, 그것은 아직 존재하지 않습니다. Qwen3.8-Flash-Next에 대해 실제로 존재하는 페이싱 측정값들은 이 패치들과는 전적으로 별개입니다. 이 모델은 Artificial Analysis에서 Intelligence Index 40을 기록하는데, 이는 비슷한 규모의 오픈 웨이트 모델의 중앙값 18을 훨씬 웃돌며, 그 수치는 여기서 논의된 모든 것과 무관합니다.
오늘 무엇을 호출할 수 있는지, 그리고 라우팅 관점

여기까지 읽고 모델을 직접 계측하기보다 호스팅 모델을 사용하고 싶은 분이라면, 이 부분에서 그림이 실용적으로 바뀝니다. Qwen3.8-Flash-Next는 OrcaRouter의 카탈로그에 없습니다. 우리가 라우팅하는 205개 모델 중 하나가 아니며, 여기에는 호스팅 엔드포인트도 없습니다. 하지만 이것이 미리 보여주는 프로덕션 형제 모델은 있습니다: qwen/qwen3.8-flash, 벤더 자체 모델 카드에서 프리뷰보다 더 많은 기능을 갖추고 있다고 설명하는 공식 Qwen3.8-Flash 릴리스로, 기본적으로 100만 토큰 컨텍스트와 내장 도구를 포함하며, 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.47에 제공되고, 제공사 정가로 마크업 없이 그대로 전달됩니다. 같은 패밀리 안에서 규모를 보면, qwen/qwen3.8-27b는 $0.33과 $2.40이고, qwen/qwen3.8-max는 $2.00과 $6.00입니다 — 모두 하나의 키로 접근할 수 있습니다.
아직 출시되지 않은 아키텍처를 다룬 글에서는 평소보다 더 중요한 이유가 두 가지 있습니다. 첫 번째는 전환 비용입니다. Qwen 4가 등장하기 전에 희소 어텐션 모델이 여러분의 트래픽에서 어떤 느낌인지 가늠하고 싶다면, 비교 대상으로 삼아야 할 것은 정가 기준 qwen/qwen3.8-flash입니다 — 그리고 라우터를 통해 비교하면 측정 중인 모델과 폴백 대상이 될 수 있는 모델이 같은 엔드포인트, 같은 SDK, 같은 키 뒤에 있게 되어 두 번째 계약을 체결할 필요가 없습니다. 두 번째는 이 패치 묶음의 모든 서빙 변경 사항이 자체 호스팅 vLLM을 대상으로 한다는 점입니다. A100 8대를 운영하고 있지 않다면, 1.83× KV 용량과 1.5% 샘플링 이득은 직접 얻는 것이 아니라 글로만 접하게 되는 것들입니다. 라우팅된 엔드포인트는 빌드 단계 없이 도착하는 이 방식의 버전입니다: 공급자의 성능이 저하되면 자동 페일오버되고, 라우팅 DSL을 사용하면 직접 측정할 하드웨어가 있을 때 호스팅 호출과 자체 호스팅 호출을 단일 엔드포인트에 나란히 배치할 수 있습니다.
이 글을 Qwen 4를 기다려야 할 이유로 읽는 것만은 하지 말아야 한다. 날짜도 없다. 가격도 없다. 실제 제품의 가중치 수치도 없다 — 위 숫자들은 제품이 아니라 미리보기 빌드를 설명한다. 존재하는 것은, 현재로서는 미리보기 형태로만 다운로드할 수 있는 아키텍처를 위해 공개적으로 준비 중인 서빙 스택이다.
간략 버전

하나의 모델 파일에서 텍스트 전용 경로와 비전-언어 경로 사이의 간극을 메우는 세 줄은 그 자체로는 뉴스가 아니다. 누군가 리뷰할 시간만 있었다면 병합 커밋 속에 묻혔을 종류의 패치이며, 더 큰 변경에 포함되거나 아예 닫힐 가능성도 충분하다 — PR에서 인용된 vLLM 봇 자체의 에이전트 가이드라인은 AI 지원 기여자들에게 상당한 이점이 없으면 작업을 닫으라고 지시하며, 1.5%는 그런 질문을 불러일으키는 숫자다. 이것이 주목할 가치가 있는 이유는 그것이 문서화하는 대상에 있다: 2천만 개 항목의 n-gram 테이블, 토큰당 10개 전문가가 활성화되는 512-전문가 MoE, 선형 어텐션과 압축 희소 어텐션의 하이브리드, 추측 헤드 — 이 모든 것이 이를 탑재할 제품이 존재하기도 전에 NVIDIA와 AMD, Ampere부터 Hopper까지 전반에서 튜닝되고 있다. Qwen4 서빙 범위에 관심이 있다면, 현재 그 실제 사양이 존재하는 곳은 PR 본문이다. 오늘 모델을 호출하고 싶다면, 실제로 존재하는 것은 Qwen3.8-Flash다.
200개 이상의 모델을 위한 단일 API, 자동 페일오버, 라우팅 DSL. OrcaRouter 모델 카탈로그 살펴보기
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
