
K-EXAONE-2.0-750B-A37B-DSpark:LG的750B韓語MoE即將登陸vLLM
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 2031 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1653智能69程式60數學
2026年8月9日,vLLM 儲存庫中開啟了一個 pull request,以加入K-EXAONE-2.0-750B-A37B-DSpark——即 LG AI Research 旗下 7500 億參數韓國旗艦模型的推測解碼變體。變更日誌中的一行,卻填補了一個實際的缺口。基礎模型K-EXAONE-2.0-750B-A37B已於 7 月 31 日以 Apache 2.0 授權釋出,而在發布之初,vLLM 可以透過 MTP 草稿方法來服務該模型,但無法使用 DSpark——亦即 LG 也一併釋出、並宣稱能帶來 3–5× 解碼加速的草稿模型。DSpark 變體存在的全部意義,實際上一直卡在 SGLang 上。DSpark 本身就是 DeepSeek 的方法,也就是同一套半自迴歸草稿模型,運行於DeepSeek-V4-Pro-DSpark與DeepSeek-V4-Flash-DSpark之上,因此這個 PR 也是迄今最明確的訊號,顯示 DeepSeek 的推測解碼技術棧正逐漸成為開放權重模型的預設選擇。
這是一篇「目前已知資訊」的報導,而非發布消息。該 PR 仍是開啟且未合併的狀態,DSpark 檢查點尚無獨立的基準測試,而 LG 的加速數字是廠商的宣稱。以下所有內容均依此標示。目前確定的內容:權重已放在 Hugging Face 上,基礎模型已釋出,而針對 DSpark 變體的 vLLM 支援正在進行中。
簡短版本。
• PR #51558 於 2026 年 8 月 9 日開啟,將 K-EXAONE-2.0-750B-A37B-DSpark 加入 vLLM;目前該 PR 仍為開啟狀態,尚未獲得任何批准。
• DSpark 是 DeepSeek 開源的 EAGLE 系列草稿模型,搭載於 DeepSeek-V4-Pro-DSpark 與 DeepSeek-V4-Flash-DSpark;LG 是迄今為止其他實驗室中最受矚目的採用案例。
• DSpark 變體是 78 層 750B MoE 加上五個額外的草稿層;LG 聲稱 DSpark 和 MTP 各自能提供約 3–5× 的解碼加速,目標是長時程的代理型工作負載。
• 在發佈時,vLLM 為 K-EXAONE 2.0 支援了 MTP,但不支援 DSpark;這個 PR 是 DSpark 支援的落地。
• 目前沒有任何供應商託管任何 K-EXAONE 2.0 檢查點,且規格表上的所有基準測試都是 LG 自家的。
這個 pull request 是什麼(以及不是什麼)
vLLM PR #51558,標題為「[Model] Add K-EXAONE-2.0-750B-A37B-DSpark」,由 lkm2835 開啟——就是先前在 vLLM(#50524,針對基礎模型)與 SGLang(#33648)中支援 K-EXAONE 的同一貢獻者。這是一個帶有 new-model 標籤的分支 PR,已請求 vLLM 程式碼擁有者審查,但目前尚未有任何批准。描述有三行:它增加了對 DSpark 檢查點(由 LG AI Research 開發)的支援,連結了 Hugging Face 模型卡與 K-EXAONE 2.0 技術報告(arXiv 2608.04505),並引用了先前在 #50524 中的 vLLM 工作。
![Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.](https://cms.orcarouter.ai/api/media/file/2-70.png)
請照字面解讀這個狀態。「支援正在加入」不是「支援已可用」:在 PR 合併並隨版本發布之前,標準的 vLLM 建置仍然無法載入 DSpark 變體。模型卡本身也表示,目前 vLLM 不支援使用 DSpark 服務 K-EXAONE 2.0,而是使用 MTP。這個 PR 正是改變那句話的一步——如果且當它落地。
為何 DSpark 才是這裡真正的主角
模型名稱本身就資訊量十足。「A37B」代表每個 token 有 370 億個啟用參數。「DSpark」是 DeepSeek 今年推出的推測解碼草稿模型——一個半自迴歸、EAGLE 系列家族的草稿模型,能在單次前向傳遞中提出一整批 token,再讓目標模型加以驗證,因此在生成速度加快的同時,輸出品質維持不變。DeepSeek 已將其開源,並將該草稿模型與自家 DeepSeek-V4-Pro-DSpark 及 DeepSeek-V4-Flash-DSpark 檢查點一同發布;根據社群回報,與單 token MTP 基線相比,Flash 的加速幅度約為 60–85%,Pro 約為 57–78%。
K-EXAONE-2.0-750B-A37B-DSpark 保留了基礎模型的 78 層,並新增了五層 DSpark 草稿層。LG 的模型卡宣稱,DSpark 與 MTP 都能將生成速度提升約 3–5 倍——這是它自己的數據,目標是「諸如代理型任務等長時程工作負載」,而這類場景的瓶頸正是解碼延遲。由此可得出兩點結論。第一,推測解碼正從事後外掛的部署技巧,轉變為開放前沿模型的一級功能。第二,正在成為預設選項的是 DeepSeek 的草稿技術棧——這正是韓國政府支持的主權旗艦模型搭載它之所以重要的原因,其意義遠不止常見的「新模型」新聞熱點。
PR 背後的模型
K-EXAONE-2.0-750B-A37B-DSpark 是 K-EXAONE 2.0 的一個變體;K-EXAONE 2.0 是 LG 236B K-EXAONE 系列的后繼版本,也是韓國最大的自主開發基礎模型,是在政府主權AI計畫下建構而成。基礎模型——總參數 750B、活躍參數 37B、混合專家架構(256 個專家,每個 token 啟動 8 個)、262,144 token 的上下文窗口、支援十種語言、Apache 2.0 授權——於 2026 年 7 月 31 日在 Hugging Face 上發布,是從 236B 前代模型升級改造而來,而非從零開始訓練。

{{1}}LG 自家基準測試的平均成績(24 項基準測試,整體 70.1 分){{/1}}呈現出{{2}}韓國主權模型{{/2}}應有的樣貌:{{3}}在長上下文檢索、韓國社會安全與代理式編碼方面有亮眼的報告數據{{/3}},{{4}}但一般推理表現卻落後於阿里巴巴的 Qwen3.5(例如在 MMLU-Pro 上為 83.5 對 89.8){{/4}}。{{5}}這些成績目前均未經獨立驗證。{{/5}}{{6}}DSpark 版本並未改變這些分數中的任何一項——它只是服務化產物,一種以更快方式執行同一模型的方法——這正是它出現在推論框架的 pull request 而非官方公告中的原因。{{/6}}
750B MoE 背後的服務現實
這裡才是 DSpark 支援真正重要的地方。K-EXAONE-2.0-750B-A37B-DSpark 是一個採用 BF16/F32 格式、擁有 7510 億參數的檢查點,而 LG 的建議是最少兩個節點、每個節點八張 NVIDIA H200 GPU(16 張 GPU,張量並行度 16)。在那種規模下,解碼吞吐量就是一切——每秒 token 數,以及一次長時間 agentic 回合的成本——而這正是投機解碼(speculative decoding)所攻擊的痛點。若能實現 3–5 倍解碼加速,且不只是在 LG 的測試框架內成立,這就決定了 H200 叢集是否經濟可行。LG 也記錄了 B200 GPU 上的一個生成崩潰(generation-collapse)問題,在修復之前需要使用 --disable-prefill-cuda-graph 這個繞過方案——這提醒我們,這是尖端前沿的服務,而非隨插即用的解決方案。

它的成本是多少,以及你實際上會如何嘗試
目前沒有任何 API 提供 K-EXAONE 2.0 服務。DSpark 版本的 Hugging Face 卡片仍顯示「此模型尚未由任何推論供應商部署」,而其 16×H200 的硬體需求意味著,只有當擁有該硬體的人決定託管時,它才能透過託管 API 提供服務。這才是真正的瓶頸所在:開放權重的前沿日益成為一個部署服務的問題,而非可用性的問題。
當提供者確實採用它時,推測解碼的加速效果會反映在每個 token 的價格上,而如果你的應用程式已經是模型無關的,嘗試它的切換成本應該趨近於零。在 OrcaRouter 上——一個涵蓋 200+ 模型的 OpenAI 相容端點,以 0% 加成直接傳遞提供者的牌價——任何落在上游提供者的模型都只是路由變更,而非重新整合;自動故障轉移表示,一個全新、結果卻緩慢或不穩定的 750B MoE 模型會無縫回退到已知良好的模型,而不會造成事故。明確來說:OrcaRouter 目前並未託管 K-EXAONE-2.0-750B-A37B-DSpark,我們能找到的其他 API 也同樣沒有。路由層的意義就在於,為其中一個提供者開始託管的那一天做好準備。
我們正在觀看的內容
• PR 合併。 #51558 尚未獲得任何核准。合併並發佈,才能將「DSpark 支援」從 pull request 變成實際可傳遞的旗標。
• 第一個獨立評分。 卡片上的每個基準測試均由LG自行運行。750B韓國MoE的第一個Artificial Analysis或arena數據點,將是第一個不是由供應商發布的數字。
• DSpark 超越 DeepSeek。 DeepSeek 已經為其他目標發佈 DSpark 草稿模型;LG 是另一個實驗室中最受矚目的採用者。這個方法是否會成為開放權重的預設,本身就值得關注。
• 量化服務。LG 提供基座模型的 FP8 與 NVFP4 檢查點;一個能在更少 GPU 上運行的量化 DSpark 變體,會比任何基準測試更快地改變成本結構。
常見問題
K-EXAONE-2.0-750B-A37B-DSpark 是否已發布?
權重已在 Hugging Face 上以 Apache 2.0 授權發布,但這並非一則發布消息:vLLM 支援仍是一個開放且未合併的 pull request(#51558),加速數據是 LG 自己的說法,且沒有供應商託管該模型。
K-EXAONE-2.0-750B-A37B 和 DSpark 變體有什麼不同?
基礎模型的 78 層加上五個用於推測解碼的 DSpark 草稿層——底層權重相同、基準測試相同,是一個解碼更快的服務產物,而非不同的模型。
DSpark 是 LG 的還是 DeepSeek 的?
DSpark 是 DeepSeek 推出的開源推測解碼方法,也搭載於 DeepSeek-V4-Pro-DSpark 與 DeepSeek-V4-Flash-DSpark 上;LG 是迄今為止最受矚目的採用者,其模型卡宣稱具有相同的 3–5× 加速範圍。
我今天可以在自己的硬體上運行 K-EXAONE-2.0-750B-A37B-DSpark 嗎?
只能透過自行託管:LG 的建議是需要至少十六張 NVIDIA H200 GPU,而 vLLM、SGLang 和 Transformers 的標準版本仍需要未合併的分支才能辨識該架構。
這件事值得關注的地方,不在於 pull request 本身,而在於它所傳遞的訊號。一個擁有 7,500 億參數、採用 Apache-2.0 授權的韓國主權級旗艦模型,選擇搭載 DeepSeek 的推測解碼技術棧,而服務生態系統也正逐層跟上:先是 SGLang,接著是 vLLM。這就是前沿開放模型真正落地的方式——不是在權重釋出的那一刻,而是在草稿模型(drafters)合併的那一刻。
