
Qwen4Exp 批次分片取樣:在 vLLM PR #61018 中,以及它對 Qwen 4 的說明
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens · 79 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
vLLM 拉取請求 #61018 中最有資訊量的數字是一個損失值:1.5%。這是作者為自己的改動所設下的上限——在平均 42 毫秒的一步中大約省下 0.6 至 0.8 毫秒,而且是在他並不擁有的機器上、在他根本無法執行的修補程式中測得的。這份拉取請求標題為「[Model] Qwen4Exp:支援批次分片取樣(compute_logits_local)」,由貢獻者kimseunghyun-kr於 2026-10-10 提交,只在兩個檔案中加入三行模型程式碼,好讓 Qwen4Exp 架構能採用 vLLM 在八月推出的取樣路徑。它是草稿。它是 14 行模型程式碼外加 57 行測試。然而它仍值得細讀,因為那三行所修補掉的東西是:Qwen4Exp 正是 Qwen3.8-Flash-Next 內部的架構,那是廠商於 2026-08-24 發布的 1250 億參數開放權重模型,被譽為「將支撐 Qwen4 的架構的實驗性預覽」——而該架構純文字那一半裡的雙路徑錯誤,正是那種只有盯著服務層、而非盯著發布文章,才會學到的細節。
為了把定位說清楚,因為這點在這裡很重要:Qwen 4 本身尚未發布。該廠商在 2026-09-22 的 Apsara 大會上,公布了 Qwen 4 的四個層級——Qwen 4 Max、Flash、Plus 與 27B——但並未發布其中任何一個的權重、識別碼、價格、脈絡長度或基準測試。以下沒有任何內容屬於正式發布。這是針對單一草稿 pull request 的目前已知資訊整理,而其中所有帶有數字的內容,不是你可驗證的時間戳記,就是貢獻者自己打進 PR 內文的數字,或是從公開模型設定檔讀出的值。
請用一段文字說明什麼是批次分片取樣。
張量平行處理會將模型的權重分散到多個 GPU 上;詞彙投影是整個堆疊中最寬的單一張量,因此每個 rank 通常只計算自己所負責的詞彙切片——接著每個 rank 都會進行 all-gather,最後每個 rank 都持有批次中每個請求的完整 logits。分片取樣則反轉了這種交換方式。它不是在多個 rank 之間複製詞彙,而是將批次:每個 rank 取樣請求中的一個切片,而各個 rank 之間透過 all-to-all 交換詞彙切片。vLLM 自家的 CLI 文件對這個旗標的描述很直白——「每個 rank 取樣批次中的一個切片,而不是每個 rank 都取樣整個批次」——並說明了限制條件:--enable-batch-sharded-sampling 預設為 False,且要求 tensor_parallel_size 大於 1,且最大序列數至少為 tensor_parallel_size,以及非負的 max_logprobs。這份文件的最後一行,正是這個 pull request 所依附的鉤子:「模型透過實作 compute_logits_local 來選擇加入。」
這個功能本身並不新。vLLM 於 2026-08-24 以 PR #50465 合併了它——由 Giancarlo Delfin 提交的「[Model Runner V2] batch-sharded sample」——而當天正是 Qwen3.8-Flash-Next 權重上線的同一天。當時的動機在於記憶體與延遲:將完整的目標 logits 具體化,所需成本約為 batch size × (speculative tokens + 1) × vocabulary size,而分片可依張量平行度(tensor-parallel degree)的倍數削減該配置,同時讓取樣器的 top-k 與 top-p 運算得以平行執行。這是促成後續發展的一步,而非終點:該 PR 本身的文字便將分片式 draft-logits 標示為未來工作。
為什麼三行就是整個工作
![GitHub page for vllm-project/vllm pull request 61018, titled "[Model] Qwen4Exp: support batch-sharded sampling (compute_logits_local)", showing the Draft badge, a three-file diff with 71 additions, the qwen label and the PR body.](https://cms.orcarouter.ai/api/media/file/2-1829.png)
這才是真正的缺陷,而且它很妙,因為從程式碼外部根本看不出來。vLLM 的 Qwen4Exp 實作是以兩個類別的形式提供。Qwen4ExpForConditionalGeneration 是視覺語言包裝器——一個硬接到語言模型上的 Qwen3-VL 視覺塔——而 Qwen4ExpForCausalLM 是純文字路徑。這個包裝器繼承了 compute_logits_local,來自 Qwen3_5ForConditionalGeneration,後者會將呼叫向下轉送到 language_model.compute_logits_local。但這個包裝器所指向的語言模型類別從未定義該方法。
因此,這兩條路徑處於不同狀態。Qwen3.8-Flash-Next 的視覺語言部署可以採用分片路徑;純文字部署則不行,因為包裝器委派給的方法不存在。修正方式是加入一個方法,而該方法在模型檔案的 NVIDIA 與 AMD 副本中完全相同:
• 此方法會回傳 self.logits_processor(self.lm_head, hidden_states, skip_gather=True)——該 rank 自身的詞彙分片,且不會在任何 rank 上進行 gather 或完整詞彙的具體化。
• 這遵循了 PR 所稱的「與 Qwen3.5 和 MiniMax M3 相同的三行模式」,這點值得停下來想想:同一個儲存庫中的另外兩個模型系列早已選擇採用。Qwen4Exp 只不過是尚未這麼做的那一個。
測試檔案是最容易檢查修補程式誠實程度的地方,也是最容易看出其限制的地方。它有 57 行,並同時對 NVIDIA 與 AMD 模組進行參數化,而且不會下載模型。輔助函式以 object.__new__ 建構該類別,並以nn.Identity 取代語言模型頭部,並安裝一個假的 logits 處理器,它會回傳其輸入加一,同時記錄它被呼叫的方式。第一個測試斷言輸入 4.0 會得到 5.0,而且記錄到的呼叫帶有 skip_gather=True。第二個測試則將語言模型包裝在條件生成類別中,並斷言委派能正確送達。這是對接線的真實測試,除此之外什麼也沒測試——沒有執行任何核心,沒有跨越任何 rank 邊界,且涉及的 GPU 數量為零。
這兩項事實都在 PR 中明確寫出,而非被埋藏起來。測試檔本身的 docstring 稱 Qwen4Exp 為「一個微小的純 CPU 測試替身」。作者的驗證章節指出,他在自己的 macOS 環境上根本無法匯入該模型,因為他手上的 transformers 組建並未附帶 Qwen4ExpConfig。CUDA 執行仍待完成。端到端基準測試——MLPerf agentic 資料集、20 個並行工作階段、三個 60 分鐘的分支——也仍待進行。MTP 草擬器的自身 logits 路徑被標記為未檢查。LoRA 在上游已被該旗標拒絕,因此屬於範圍之外,而非回歸問題。文中還有一行揭露該草稿是在 AI 協助下撰寫的,而提交訊息的 trailer 將 Claude Opus 5.5 列為共同作者;這類揭露在這種規模的技術堆疊中本應是常態,但大多時候並非如此。
1.5% 的估計值,以及它旁邊的測量數據
這位貢獻者的估計是nsys在 16 個並行工作階段下,於 Qwen3.8-Flash-Next-FP8 上以張量平行度 8 及專家平行度、橫跨八張 A100-SXM4-40GB 顯示卡的追蹤:42 毫秒步驟中約 1.6 毫秒,經修剪至大約其中的三分之一,帶來 1.5% 至 2% 的端到端增益。他的標題是那個算術——42 毫秒中的 0.6 至 0.8 毫秒。請注意附帶於此的是什麼:42 毫秒是 token 間延遲數字,因此 1.7% 的削減就是 token 生成時間上的 1.7% 削減,而不是抽象意義上的輸送量宣稱。
誠實的比較,是對照父功能本身已合併的數據,因為那些數據是由擁有硬體的人端到端量測而來。在 PR #50465 中發表的 Speed-Bench 2K/2K 測試運行裡,批次分片取樣將搭配 DSpark、使用 7 個推測 token 與並行度 64 的 DeepSeek V4,從每秒 2.62 次請求提升到 2.66 次——吞吐量增加 1.53%——中位 token 間延遲下降 3.09%,首 token 時間上升 1.45%。在搭配 DSpark、使用 8 個推測 token 的 MiniMax M3 上,請求吞吐量上升 5.38%,中位 TPOT 下降 8.33%,從 15.61 毫秒降至 14.31 毫秒。而同樣的方案並非都有幫助:在並行度 4 到 16 時,測試結果持平到略微為負,其中並行度 16 的那組吞吐量下降 0.54%,接受長度下降 1.89%。
那個模式才是要帶走的重點。分片取樣在取樣負載重且批次寬時才划算——高併發、大量推測 token、top-k 與 top-p 真正在發揮作用——而當批次小到全對全通訊純屬額外開銷時,它則會帶來一點成本。對於某個選擇啟用的模型而言,1.5% 的估計值與這一點一致,並不矛盾:5.38% 和 5.38% 屬於具有推測預算的不同模型,而這個 PR 中的模型有自己的配置、自己的 248,320 詞彙表,以及自己的推測解碼路徑。
這一切都未經稽核。上層 PR 的數字,是某位貢獻者在單一節點上所做的配對執行;這裡的冒煙測試數字,則是在作者並未持有的硬體上取得的追蹤資料,且來自他聲稱僅以 16 個工作階段量測過的修補版本。單一貢獻者、單一組態的量測,是判斷方向的有用訊號,卻是容量規劃的糟糕依據。這個主題之所以值得動筆,歸根究柢在於方向,而不是那個小數值。
周圍的補丁叢集對 Qwen4Exp 說明了什麼
一份草稿 PR 不會成為一則故事。故事在於,Qwen4Exp 在這批變更落地的那一週已成為一個持續的服務目標,而這群修補中最小的那一個,正是讓整體模式變得清晰可辨的關鍵。在截至 2026-10-10 的七天內,vLLM 承載了來自同一位貢獻者與其他人的多項變更:一條在 Ampere 上為稀疏注意力提供的 FP8 主 KV 快取路徑,在八張 A100 上 KV 容量提升 1.83×、在四張 RTX 3090 上提升 1.87×,並在併發數 16 時帶來約 2.7× 的請求量,代價是單流解碼 TPOT 約高出 6%;一項針對張量平行度 1 與專家平行化下 W4A4 MoE 填充問題的修正;一條 AMD 路徑,會從不受支援的 AITER FP8 MoE 運算回退,並以 fp16 提供服務;一項讓 PLE 短卷積狀態通過 align 模式的修正;以及一個在 sm_80 上每個暫存器一次解包四個 e4m3 位元組的解碼核心。其中一項——H200 M=4 合併 QSA LL-GEMM 方案的重新調校——已於 2026-10-09 合併進 main。
把那份清單當作一個整體來讀,它傳達了具體的訊息。Qwen4Exp 架構——也就是廠商尚未發布的那個——正同時針對 Ampere、Hopper、ROCm 與 fp16 後備方案進行調校,而這個專案會為人們真正能下載的模型提供首日支援。原因並不神祕:Qwen3.8-Flash-Next 是真實存在、可下載且被大量使用的模型,而它正是建構在 Qwen 4 將會採用的架構上。Qwen 4 的權重最終是否會以這種樣貌問世仍是未知數,廠商也什麼都沒說,但服務涵蓋範圍正在公開地持續擴大,而這是可查證的資訊——傳聞中十月到十一月的發布窗口則不然。
有些架構形貌也是公開的,寫給任何閱讀配置而非發布公告的人看。Qwen3.8-Flash-Next 的配置列出:248,320 個 token 的詞彙表、48 層、512 個專家,每個 token 有 10 個路由專家加上 1 個共享專家處於啟用狀態,專家中間寬度為 640,隱藏層維度為 2,560,原生上下文為 262,144 個 token,並描述為可擴展至一百萬。它是混合架構:層類型列表以三個線性注意力區塊與一個完整注意力區塊交替排列,而完整注意力區塊使用稀疏注意力路徑,搭配一個單頭索引器,將鍵壓縮為四分之一,並維持 2,048 個位置的預算。第 2 層有一張逐層嵌入表、一個詞彙量 2,000 萬的 n-gram 嵌入——那就是此叢集中其他 patch 正忙於在主機端預備的 47.7 GiB 表格——以及一個用於推測解碼的單層 MTP 頭。模型卡自己的摘要是「125B,其中 6B 啟用,外加 51B n-gram 嵌入與 4B MTP」。248,320 個項目的詞彙表,正是 logits 投影從一開始就值得分片的原因。
這對你來說不會改變什麼
精確一點是值得的,因為如此密集的一組修補程式,讀起來可能像一場正式發布。上述內容全都還沒合併,而其中一部分——Ampere FP8 KV 快取的工作——在 CI 中明確未經驗證,因為 vLLM 的 CI 沒有 A100。今天沒有任何已發布的 vLLM 版本可供安裝,並帶有 Qwen4Exp 分片取樣的選擇加入功能。也沒有針對 Qwen3.8-Flash-Next 在這些變更下服務行為的獨立基準測試;上面引用的每個數字都來自 PR 本文,這使得它們屬於貢獻者自行回報且未經稽核——具體來說,就是沒有第三方重現過該次執行。而催生這篇文章的那個 PR 的頭條數字是 1.5%,這在服務堆疊中是實實在在的增益,但不是改變模型選擇的理由。
能改變決定的,是一次完整且經審計的服務執行,而這目前尚不存在。現有關於 Qwen3.8-Flash-Next 的節奏量測,完全不在這些修補程式範圍內:該模型在 Artificial Analysis 上的 Intelligence Index 評分為 40,遠高於同尺寸開放權重模型的中位數 18,而這個數字與此處討論的一切無關。
你今天可以撥打的,以及路由的角度

讀到這裡、想使用代管模型而非自行埋設監控的人,這正是情況變得務實的地方。Qwen3.8-Flash-Next 並不在 OrcaRouter 的型錄中——它不是我們所路由的 205 個模型之一,這裡也沒有它的代管端點。但它所預覽的正式版兄弟模型則是:qwen/qwen3.8-flash,這是官方的 Qwen3.8-Flash 發行版,廠商自家的模型卡描述其功能比預覽版更多,包括預設即具備一百萬詞元的上下文與內建工具,價格為每百萬輸入詞元 $0.15、每百萬輸出詞元 $0.47,依供應商定價原價傳遞,不額外加價。若要在同一系列中了解規模,qwen/qwen3.8-27b 的價格為 $0.33 與 $2.40,而 qwen/qwen3.8-max 為 $2.00 與 $6.00——全部都能以同一把金鑰存取。
對一篇關於尚未發布架構的文章來說,有兩件事比平時更為要緊。第一是轉換成本。如果你想在 Qwen 4 問世之前,先校準稀疏注意力模型在你的流量上跑起來是什麼感覺,你想做的比較對象是牌價上的 qwen/qwen3.8-flash——而透過路由器來做這件事,意味著你正在測量的模型與你可能退回去用的模型,都位於同一個端點、同一套 SDK、同一把金鑰之後,不必再簽第二份合約。第二是這個修補程式集群裡的每一項服務變更,都針對自架的 vLLM。如果你沒在跑八張 A100,那 1.83× 的 KV 容量和 1.5% 的取樣提升,是你讀到的事,而不是你得到的事。路由端點則是這件事不必經過建置步驟就能到手的版本:供應商效能變差時自動容錯移轉,以及一套路由 DSL,讓你在真的擁有自己的硬體可測量時,能把一個託管呼叫和一個自架呼叫放在同一個端點裡。
唯一不該做的一件事,就是把這篇文章當成等待 Qwen 4 的理由。沒有日期。沒有價格。真正的成品也沒有權重數量——上述數字描述的是預覽組建,不是產品本身。目前存在的,是一個正在公開籌備中的服務堆疊,為一個現階段只能以預覽形式下載的架構而準備。
簡短版本

一個模型檔案中,純文字路徑與視覺語言路徑之間的三行補丁,本身並不是什麼新聞。這種補丁,若真有人有空審閱,大概也只會被埋在合併提交裡;它很可能被併入更大的變更,或直接關閉——PR 上引用的 vLLM 機器人自身代理準則就指示,AI 協助的貢獻者若其工作缺乏顯著效益,應關閉自己的成果,而 1.5% 正是會引人提出這個疑問的數字。真正讓它值得你注意的,是它所記錄的東西:一張兩千萬條目的 n-gram 表、一個 512 專家的 MoE(每個 token 有十個專家啟用)、線性注意力與壓縮稀疏注意力的混合架構、一個推測頭——這一切都在 NVIDIA 與 AMD、從 Ampere 到 Hopper 之間調校,而承載它的產品甚至還不存在。如果你關心 Qwen4 的服務範疇,它的真正規格目前就活在那些 PR 內文裡。如果你想今天就呼叫模型,Qwen3.8-Flash 才是真正已經在那裡的。
一個 API 即可存取 200 多個模型,自動容錯移轉,路由 DSL。探索 OrcaRouter 模型目錄
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
