
K-EXAONE-2.0-750B-A37B-DSpark: MoE tiếng Hàn 750B của LG sắp có mặt trên vLLM
- metaMỚIMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenMỚIQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 2031 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0856Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0642Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3055Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1653Trí tuệ69Lập trình60Toán
Vào ngày 9 tháng 8 năm 2026, một pull request đã được mở trong kho lưu trữ vLLM để thêm K-EXAONE-2.0-750B-A37B-DSpark — biến thể giải mã suy đoán của mô hình Hàn Quốc hàng đầu 750 tỷ tham số của LG AI Research. Một dòng trong changelog, nhưng nó lấp đầy một khoảng trống thực sự. Mô hình cơ sở K-EXAONE-2.0-750B-A37B được phát hành vào ngày 31 tháng 7 dưới giấy phép Apache 2.0, và khi ra mắt, vLLM có thể phục vụ mô hình này bằng phương pháp draft MTP nhưng không phải với DSpark — bộ draft mà LG cũng phát hành và tuyên bố mang lại tốc độ giải mã nhanh gấp 3–5×. Toàn bộ lý do tồn tại của biến thể DSpark về cơ bản đã bị mắc kẹt trên SGLang. Bản thân DSpark là phương pháp của DeepSeek, cùng một bộ draft bán tự hồi quy chạy trên DeepSeek-V4-Pro-DSpark và DeepSeek-V4-Flash-DSpark, vì vậy PR này cũng là dấu hiệu rõ ràng nhất cho đến nay rằng stack giải mã suy đoán của DeepSeek đang trở thành lựa chọn mặc định cho các mô hình open-weights.
Đây là bài viết dạng “những gì chúng ta biết cho đến nay”, không phải câu chuyện ra mắt. PR vẫn đang mở và chưa được merge, checkpoint DSpark chưa có benchmark độc lập, và con số tăng tốc của LG chỉ là tuyên bố từ nhà cung cấp. Mọi thứ bên dưới được gắn nhãn tương ứng. Điều có thật ngay lúc này: các trọng số đã có trên Hugging Face, mô hình nền đã được phát hành, và hỗ trợ vLLM cho biến thể DSpark đang được triển khai.
Phiên bản ngắn.
• PR #51558, mở ngày 9 tháng 8 năm 2026, thêm K-EXAONE-2.0-750B-A37B-DSpark vào vLLM; hiện nó đang mở và chưa có sự phê duyệt nào.
• DSpark là trình soạn thảo thuộc họ EAGLE mà DeepSeek đã mã nguồn mở và phân phối trên DeepSeek-V4-Pro-DSpark và DeepSeek-V4-Flash-DSpark; LG là sự áp dụng nổi bật nhất từ một phòng thí nghiệm khác cho đến nay.
• Biến thể DSpark là MoE 750B với 78 lớp cộng thêm năm lớp dự thảo; LG tuyên bố DSpark và MTP mỗi loại giúp tăng tốc giải mã khoảng 3–5 lần, nhắm tới các khối lượng công việc tác nhân dài hạn.
• Tại thời điểm ra mắt, vLLM hỗ trợ MTP cho K-EXAONE 2.0 nhưng không hỗ trợ DSpark; PR này bổ sung hỗ trợ DSpark.
• Không có nhà cung cấp nào lưu trữ bất kỳ checkpoint K-EXAONE 2.0 nào hiện nay, và mọi điểm chuẩn trên thẻ đều là của riêng LG.
Pull request là gì (và không phải là gì)
vLLM PR #51558, "[Model] Thêm K-EXAONE-2.0-750B-A37B-DSpark," được mở bởi lkm2835 — cũng chính là người đóng góp trước đó cho hỗ trợ K-EXAONE trong vLLM (#50524 cho mô hình cơ sở) và trong SGLang (#33648). Đây là một PR fork được gắn nhãn new-model, đã yêu cầu đánh giá từ các chủ sở hữu mã nguồn vLLM và hiện chưa có sự chấp thuận nào. Mô tả gồm ba dòng: bổ sung hỗ trợ cho checkpoint DSpark "được phát triển bởi LG AI Research," liên kết đến thẻ mô hình Hugging Face và báo cáo kỹ thuật K-EXAONE 2.0 (arXiv 2608.04505), đồng thời tham chiếu công việc vLLM trước đó trong #50524.
![Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.](https://cms.orcarouter.ai/api/media/file/2-70.png)
Đọc trạng thái đó theo nghĩa đen. {{1}}"Hỗ trợ đang được thêm vào" không phải là "hỗ trợ đã có sẵn"{{/1}}: cho đến khi PR được merge và được phát hành trong một bản release, một bản build vLLM tiêu chuẩn vẫn sẽ không tải được biến thể DSpark. {{2}}Chính model card cũng nói rằng việc phục vụ K-EXAONE 2.0 với DSpark hiện không được hỗ trợ trên vLLM, vốn sử dụng MTP thay vào đó.{{/2}} PR này là bước thay đổi câu đó {{3}}— nếu và khi nó được merge.{{/3}}
Vì sao DSpark mới là câu chuyện thực sự ở đây
Tên mô hình mang rất nhiều ý nghĩa. "A37B" nghĩa là 37 tỷ tham số hoạt động trên mỗi token. "DSpark" là mô hình soạn thảo (drafter) dùng kỹ thuật giải mã suy đoán mà DeepSeek giới thiệu trong năm nay: một mô hình dự thảo bán tự hồi quy thuộc họ EAGLE, đề xuất một khối token trong một lượt duy nhất và để mô hình đích xác minh chúng, nhờ đó chất lượng đầu ra không đổi trong khi tốc độ tạo sinh được cải thiện. DeepSeek đã mã nguồn mở nó và phân phối kèm mô hình soạn thảo này trong các checkpoint DeepSeek-V4-Pro-DSpark và DeepSeek-V4-Flash-DSpark của riêng họ, với tốc độ tăng tốc được cộng đồng báo cáo trong khoảng 60–85% cho Flash và 57–78% cho Pro so với đường cơ sở MTP một token.
K-EXAONE-2.0-750B-A37B-DSpark giữ nguyên 78 lớp của mô hình gốc và bổ sung năm lớp nháp DSpark; thẻ mô hình của LG tuyên bố cả DSpark lẫn MTP đều tăng tốc quá trình sinh khoảng 3–5 lần — con số do chính LG đưa ra, nhắm vào {{1}}"các tác vụ dài hạn như tác vụ agentic,"{{/1}} nơi độ trễ giải mã là điểm nghẽn. Điều này dẫn đến hai hệ quả. Thứ nhất, giải mã suy đoán đang trở thành tính năng hạng nhất của các mô hình tiên phong mở, thay vì một thủ thuật phục vụ gắn thêm sau. Thứ hai, bộ khung nháp của DeepSeek đang trở thành tiêu chuẩn mặc định — và đó chính là lý do vì sao một mô hình chủ quyền chủ lực được chính phủ Hàn Quốc hậu thuẫn, ra mắt cùng bộ khung này, lại có ý nghĩa vượt xa một bản tin {{2}}"mô hình mới"{{/2}} thông thường.
Mô hình đằng sau PR
K-EXAONE-2.0-750B-A37B-DSpark là một biến thể của K-EXAONE 2.0, phần tiếp theo của dòng K-EXAONE 236B của LG và là mô hình nền tảng nội địa lớn nhất Hàn Quốc, được xây dựng theo chương trình AI có chủ quyền của chính phủ. Mô hình cơ sở — 750B tổng tham số, 37B tham số hoạt động, Kiến trúc Hỗn hợp chuyên gia với 256 chuyên gia và 8 chuyên gia hoạt động trên mỗi token, cửa sổ ngữ cảnh 262.144 token, mười ngôn ngữ, Apache 2.0 — được phát hành trên Hugging Face vào ngày 31 tháng 7 năm 2026, được nâng cấp từ phiên bản tiền nhiệm 236B thay vì huấn luyện từ đầu.

Điểm chuẩn trung bình của riêng LG (24 bài benchmark, tổng thể 70,1) cho thấy hình dạng dự kiến của một mô hình chủ quyền Hàn Quốc: kết quả báo cáo mạnh về truy xuất ngữ cảnh dài, an toàn xã hội Hàn Quốc và lập trình tác tử (agentic coding), cùng với các con số thua kém Qwen3.5 của Alibaba về suy luận tổng quát (ví dụ: 83,5 so với 89,8 trên MMLU-Pro). Chưa có con số nào được xác minh độc lập. Biến thể DSpark không làm thay đổi bất kỳ điểm số nào trong số đó — nó chỉ là một artifact phục vụ, một cách chạy nhanh hơn cùng một mô hình — đó chính xác là lý do nó xuất hiện trong một pull request của khung suy diễn (inference framework) thay vì một thông báo chính thức.
Thực tế phục vụ đằng sau một MoE 750B
Đây là nơi hỗ trợ DSpark thực sự quan trọng. K-EXAONE-2.0-750B-A37B-DSpark là checkpoint 751 tỷ tham số ở định dạng BF16/F32, và hướng dẫn của LG yêu cầu tối thiểu hai node với tám GPU NVIDIA H200 (16 GPU, tensor-parallel 16). Ở quy mô đó, thông lượng giải mã là yếu tố cốt lõi — token mỗi giây và chi phí cho một lượt tác tử dài — và đó chính xác là điều mà giải mã suy đoán (speculative decoding) tấn công. Tăng tốc giải mã gấp 3–5 lần, nếu duy trì được bên ngoài môi trường thử nghiệm của LG, chính là ranh giới giữa một cụm H200 có hiệu quả kinh tế hay không. LG cũng ghi nhận sự cố sụp đổ sinh văn bản (generation-collapse) trên GPU B200, cần dùng giải pháp khắc phục --disable-prefill-cuda-graph cho đến khi được sửa — một lời nhắc rằng đây là hạ tầng phục vụ tiên phong, không phải giải pháp trọn gói.

Chi phí là bao nhiêu, và cách bạn thực sự sẽ dùng thử nó
Hiện không có API nào phục vụ K-EXAONE 2.0. Thẻ Hugging Face của biến thể DSpark vẫn ghi rằng "mô hình này chưa được triển khai bởi bất kỳ nhà cung cấp suy luận nào," và với yêu cầu 16×H200, nó chỉ có thể tiếp cận một API được lưu trữ khi ai đó sở hữu phần cứng đó quyết định lưu trữ. Đó mới là điểm nghẽn thực sự: biên giới trọng số mở ngày càng trở thành bài toán phục vụ, chứ không phải bài toán về khả năng tiếp cận.
Khi một nhà cung cấp thực sự hỗ trợ mô hình này, tốc độ tăng tốc từ speculative decoding sẽ thể hiện qua giá trên mỗi token, và chi phí chuyển đổi để dùng thử gần như bằng không nếu ứng dụng của bạn đã không phụ thuộc vào mô hình cụ thể. Trên OrcaRouter — một endpoint tương thích OpenAI cho hơn 200 mô hình, với giá niêm yết của nhà cung cấp được giữ nguyên, không cộng thêm phí — một mô hình đặt trên bất kỳ nhà cung cấp upstream nào chỉ là một thay đổi định tuyến chứ không phải tích hợp lại, và tự động chuyển đổi dự phòng đảm bảo rằng một MoE 750B mới toanh nếu hóa ra chậm hoặc không ổn định sẽ tự động quay về mô hình đã biết là tốt mà không gây sự cố. Nói rõ: hiện tại OrcaRouter không lưu trữ K-EXAONE-2.0-750B-A37B-DSpark, và cũng không có API nào khác mà chúng tôi tìm thấy làm điều đó. Ý nghĩa của lớp định tuyến là được cấu hình sẵn cho ngày một trong số họ hỗ trợ mô hình này.
Những gì chúng tôi đang xem
• Việc merge PR. #51558 đang mở mà chưa có sự phê duyệt nào. Merge và release chính là thứ biến "DSpark support" từ một pull request thành một flag mà bạn thực sự có thể truyền vào.
• Một điểm số độc lập đầu tiên. Mọi benchmark trên thẻ đều do LG chạy. Điểm dữ liệu đầu tiên từ Artificial Analysis hoặc arena trên một MoE Hàn Quốc 750B sẽ là con số đầu tiên không phải do nhà cung cấp công bố.
• DSpark vượt ra ngoài DeepSeek. DeepSeek đã phát hành các drafter DSpark cho các mục tiêu khác; LG là bên áp dụng nổi bật nhất trong số các phòng lab khác. Liệu phương pháp này có trở thành mặc định cho các mô hình trọng số mở hay không, tự nó cũng đáng để theo dõi.
• Phục vụ lượng tử hóa.LG cung cấp các checkpoint FP8 và NVFP4 của mô hình cơ sở; một biến thể DSpark được lượng tử hóa cần ít GPU hơn sẽ thay đổi chi phí nhanh hơn bất kỳ benchmark nào.
Câu hỏi thường gặp
K-EXAONE-2.0-750B-A37B-DSpark đã được phát hành chưa?
Các trọng số được đăng tải trên Hugging Face theo giấy phép Apache 2.0, nhưng đây không phải là câu chuyện ra mắt: hỗ trợ vLLM mới chỉ là một pull request mở, chưa được hợp nhất (#51558), con số tăng tốc là do chính LG công bố, và không có nhà cung cấp nào lưu trữ mô hình này.
Sự khác biệt giữa K-EXAONE-2.0-750B-A37B và biến thể DSpark là gì?
Mô hình cơ sở có 78 lớp cộng với năm lớp dự thảo DSpark để giải mã suy đoán — các trọng số bên dưới vẫn giống nhau, các benchmark vẫn tương đương, và đây là một artifact phục vụ giải mã nhanh hơn thay vì một mô hình khác.
DSpark là của LG hay của DeepSeek?
DSpark là phương pháp giải mã suy đoán mã nguồn mở của DeepSeek, cũng được tích hợp trên DeepSeek-V4-Pro-DSpark và DeepSeek-V4-Flash-DSpark; LG là bên áp dụng nổi bật nhất cho đến nay, và thẻ mô hình của họ tuyên bố cùng mức tăng tốc 3–5×.
Tôi có thể chạy K-EXAONE-2.0-750B-A37B-DSpark trên phần cứng của riêng mình ngay hôm nay không?
Chỉ khi tự lưu trữ (self-hosting): hướng dẫn của LG yêu cầu tối thiểu mười sáu GPU NVIDIA H200, và các bản phát hành tiêu chuẩn của vLLM, SGLang và Transformers vẫn cần các nhánh (fork) chưa hợp nhất để nhận diện kiến trúc.
Điều khiến chuyện này đáng để theo dõi không phải là bản thân pull request — mà là những gì nó báo hiệu. Một mô hình chủ lực có chủ quyền của Hàn Quốc với 750 tỷ tham số theo giấy phép Apache-2.0 đã chọn tích hợp bộ công cụ giải mã suy đoán của DeepSeek, và hệ sinh thái serving đang bắt kịp từng lớp một: SGLang trước, vLLM tiếp theo. Đó là cách các mô hình mở tiên phong trở thành hiện thực — không phải ở thời điểm trọng số được tung ra, mà ở thời điểm các mô hình nháp được hợp nhất.
