Đã tạo thẻ tiêu đề hero cho bài viết về K-EXAONE-2.0-750B-A37B-DSpark. Văn bản tiêu đề lớn 'K-EXAONE-2.0-750B-A37B-DSpark' kèm nhãn dạng viên thuốc ghi 'VLLM PR · RÒ RỈ / NHỮNG GÌ CHÚNG TA BIẾT CHO ĐẾN NAY', phụ đề 'MoE 750B tiếng Hàn của LG đang được trang bị DSpark của DeepSeek trong vLLM', cùng ba chip thông số '750B tổng · 37B hoạt động', '5 lớp draft DSpark', 'ngữ cảnh 262.144 token', theo phong cách B2B xanh dương và xanh cyan nội bộ với họa tiết nút nhỏ từ mô hình draft đến mô hình lớn, logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

K-EXAONE-2.0-750B-A37B-DSpark: MoE tiếng Hàn 750B của LG sắp có mặt trên vLLM

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 9 tháng 8 năm 2026, một pull request đã được mở trong kho lưu trữ vLLM để thêm K-EXAONE-2.0-750B-A37B-DSpark — biến thể speculative-decoding của mô hình chủ lực Hàn Quốc 750 tỷ tham số của LG AI Research. Bốn ngày sau, vào ngày 13 tháng 8, một PR thứ hai mang tính nền tảng hơn đã làm rò rỉ trở nên cụ thể: vLLM hiện có một đường dẫn cấu hình DSparkDraftModel chung, ánh xạ bất kỳ checkpoint Hugging Face nào khai báo architectures=DSparkDraftModel với model_type=qw​en​3 thành Qw​en3DSparkModel được nhận diện, kèm theo một kế hoạch kiểm thử thực sự phục vụ bộ dự thảo RadixArk Qw​en​3.8-2.4T-A95B-DSpark thông qua phương thức spec dspark. Mô hình cơ sở K-EXAONE-2.0-750B-A37B được phát hành vào ngày 31 tháng 7 theo giấy phép Apache 2.0, và khi ra mắt, vLLM có thể phục vụ nó bằng phương pháp dự thảo MTP nhưng không phải bằng DSpark — bộ dự thảo mà LG cũng phát hành và tuyên bố mang lại tốc độ giải mã nhanh gấp 3–5×. Bản thân DSpark là phương pháp của Deep​Seek, cùng một bộ dự thảo bán tự hồi quy chạy trên Deep​Seek-V4-Pro-DSpark và Deep​Seek-V4-Flash-DSpark, vì vậy hai PR kết hợp lại là dấu hiệu rõ ràng nhất cho đến nay cho thấy ngăn xếp speculative-decoding của Deep​Seek đang trở thành lựa chọn mặc định cho các mô hình trọng số mở (open-weights).

Đây là bài viết tổng hợp những gì chúng ta biết cho đến nay, không phải bài viết về sự kiện ra mắt. Cả hai pull request đều đang mở và chưa được hợp nhất, checkpoint DSpark chưa có benchmark độc lập, và con số tăng tốc của LG chỉ là tuyên bố từ nhà cung cấp. Mọi thứ bên dưới đều được gắn nhãn tương ứng. Điều có thật hôm nay: các trọng số đã có trên Hugging Face, mô hình gốc đã được phát hành, bộ giải mã đặc tả DSpark của vLLM đã phục vụ các checkpoint Deep​Seek và Kim​i, và đường dẫn cấu hình chung — thứ mà bài rò rỉ này đang chờ đợi — để cho phép một bộ soạn thảo DSpark của bên thứ ba tải lên, nay đã nằm trong một pull request công khai, đã được thử nghiệm nhưng chưa được phát hành.

Phiên bản ngắn

• PR #51558, mở ngày 9 tháng 8 năm 2026, thêm K-EXAONE-2.0-750B-A37B-DSpark vào vLLM; hiện nó đang mở và chưa có sự phê duyệt nào.

• PR #52197, được mở vào ngày 13 tháng 8 năm 2026, bổ sung hỗ trợ cấu hình DSparkDraftModel tổng quát — architectures=DSparkDraftModel với model_type=qwen3, được chuẩn hóa thành Qwen3DSparkModel — và kế hoạch kiểm thử của nó chạy bộ tạo RadixArk Qwen3.8-2.4T-A95B-DSpark với phương thức spec dspark và bảy token spec. Cũng đang mở, cũng chưa hợp nhất.

DSpark là drafter thuộc họ EAGLE mà DeepSeek đã mã nguồn mở và phân phối trên DeepSeek-V4-Pro-DSpark và DeepSeek-V4-Flash-DSpark; LG là trường hợp áp dụng nổi bật nhất từ một phòng thí nghiệm khác cho đến nay, còn drafter Qwen3.8 của RadixArk là một triển khai độc lập thứ hai.

• Biến thể DSpark là MoE 750B với 78 lớp cộng thêm năm lớp dự thảo; LG tuyên bố DSpark và MTP mỗi loại giúp tăng tốc giải mã khoảng 3–5 lần, nhắm tới các khối lượng công việc tác nhân dài hạn.

• Tại thời điểm ra mắt, vLLM hỗ trợ MTP cho K-EXAONE 2.0 nhưng không hỗ trợ DSpark; PR dành riêng cho mô hình và đường dẫn cấu hình chung là nơi hỗ trợ DSpark được triển khai.

• Không có nhà cung cấp nào lưu trữ bất kỳ checkpoint K-EXAONE 2.0 nào hiện nay, và mọi điểm chuẩn trên thẻ đều là của riêng LG.

Pull request là gì (và không phải là gì)

vLLM PR #51558, "[Model] Thêm K-EXAONE-2.0-750B-A37B-DSpark," được mở bởi lkm2835 — cũng chính là người đóng góp trước đó cho hỗ trợ K-EXAONE trong vLLM (#50524 cho mô hình cơ sở) và trong SGLang (#33648). Đây là một PR fork được gắn nhãn new-model, đã yêu cầu đánh giá từ các chủ sở hữu mã nguồn vLLM và hiện chưa có sự chấp thuận nào. Mô tả gồm ba dòng: bổ sung hỗ trợ cho checkpoint DSpark "được phát triển bởi LG AI Research," liên kết đến thẻ mô hình Hugging Face và báo cáo kỹ thuật K-EXAONE 2.0 (arXiv 2608.04505), đồng thời tham chiếu công việc vLLM trước đó trong #50524.

Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.

PR ngày 13 tháng 8 khác về bản chất. #52197, "Hỗ trợ cấu hình DSpark với architectures=DSparkDraftModel + model_type=qwen3," bổ sung một lớp chuẩn hóa tổng quát: một draft checkpoint của Hugging Face khai báo chính nó là DSparkDraftModel trên loại model qwen3 được ánh xạ lại thành Qwen3DSparkModel mà spec-decoder hiện có của vLLM có thể tải. Model tham chiếu trong kế hoạch kiểm thử là RadixArk/Qwen3.8-2.4T-A95B-DSpark — một bộ suy đoán DSpark cho target Qwen3.8-2.4T-A95B thuộc lớp tối đa — được phục vụ bằng phương thức spec dspark và cửa sổ spec bảy token. Thông điệp commit là toàn bộ ý tưởng: "architectures=DSparkDraftModel+model_type=qwen3." Mục đích của thay đổi là một drafter DSpark bên thứ ba có thể được tải bằng cấu hình thay vì cần mã riêng cho từng model, như cách mọi checkpoint DSpark được hỗ trợ hiện nay đều được kết nối. Nó đang mở và chưa được hợp nhất, giống như #51558.

Đọc trạng thái đó theo nghĩa đen. "Hỗ trợ đang được bổ sung" không phải là "hỗ trợ đã có sẵn": cho đến khi một trong hai PR được merge và phát hành, bản dựng vLLM tiêu chuẩn vẫn sẽ không tải được biến thể DSpark. Bản thân model card cũng nói rằng việc serving K-EXAONE 2.0 với DSpark hiện chưa được hỗ trợ trên vLLM, vốn dùng MTP thay thế. Hai PR này chính là các bước để thay đổi câu đó — nếu và khi chúng được merge.

Vì sao DSpark mới là câu chuyện thực sự ở đây

Tên mô hình thể hiện rất nhiều điều. "A37B" nghĩa là 37 tỷ tham số hoạt động trên mỗi token. "DSpark" là bộ soạn thảo giải mã suy đoán mà Deep​Seek giới thiệu trong năm nay: một mô hình nháp bán tự hồi quy thuộc họ EAGLE, đề xuất một khối token trong một lần duyệt và để mô hình đích xác minh chúng, nhờ đó chất lượng đầu ra không đổi trong khi tốc độ sinh nhanh hơn. Deep​Seek đã công khai mã nguồn của nó và phân phối bộ soạn thảo này kèm với các checkpoint Deep​Seek-V4-Pro-DSpark và Deep​Seek-V4-Flash-DSpark của riêng mình, với mức tăng tốc được cộng đồng báo cáo trong khoảng 60–85% đối với Flash và 57–78% đối với Pro so với đường cơ sở MTP một token.

Điều mà PR mới làm rõ là hỗ trợ DSpark trong vLLM chưa bao giờ là câu hỏi bỏ ngỏ. Tài liệu của chính vLLM đã liệt kê các mô-đun DSpark cho các checkpoint Deep​Seek-V4, Kimi K3 và Gem​ma​4, và nhóm đã trình bày thiết kế trong một bài viết kỹ thuật hồi tháng Bảy. Tuy nhiên, từng tích hợp trong số đó đều được đấu nối thủ công — một danh sách checkpoint được chọn sẵn, không phải một tuyến đường mà bất kỳ ai cũng dùng được. Checkpoint K-EXAONE đơn giản là không có trong danh sách đó. #52197 là nỗ lực làm cho tuyến đường trở nên tổng quát: một ánh xạ cấu hình (DSparkDraftModel cộng với qw​en​3) thay vì một lớp mô hình riêng biệt khác, và một drafter của bên thứ ba làm trường hợp kiểm thử tham chiếu thay vì mô hình Deep​Seek. Đó là lý do vì sao câu chuyện rò rỉ checkpoint nháp thực chất là một câu chuyện về hạ tầng.

K-EXAONE-2.0-750B-A37B-DSpark giữ nguyên 78 lớp của mô hình gốc và bổ sung năm lớp nháp DSpark; thẻ mô hình của LG tuyên bố cả DSpark lẫn MTP đều tăng tốc quá trình sinh khoảng 3–5 lần — con số do chính LG đưa ra, nhắm vào {{1}}"các tác vụ dài hạn như tác vụ agentic,"{{/1}} nơi độ trễ giải mã là điểm nghẽn. Điều này dẫn đến hai hệ quả. Thứ nhất, giải mã suy đoán đang trở thành tính năng hạng nhất của các mô hình tiên phong mở, thay vì một thủ thuật phục vụ gắn thêm sau. Thứ hai, bộ khung nháp của DeepSeek đang trở thành tiêu chuẩn mặc định — và đó chính là lý do vì sao một mô hình chủ quyền chủ lực được chính phủ Hàn Quốc hậu thuẫn, ra mắt cùng bộ khung này, lại có ý nghĩa vượt xa một bản tin {{2}}"mô hình mới"{{/2}} thông thường.

Mô hình đằng sau PR

K-EXAONE-2.0-750B-A37B-DSpark là một biến thể của K-EXAONE 2.0, phần tiếp theo của dòng K-EXAONE 236B của LG và là mô hình nền tảng nội địa lớn nhất Hàn Quốc, được xây dựng theo chương trình AI có chủ quyền của chính phủ. Mô hình cơ sở — 750B tổng tham số, 37B tham số hoạt động, Kiến trúc Hỗn hợp chuyên gia với 256 chuyên gia và 8 chuyên gia hoạt động trên mỗi token, cửa sổ ngữ cảnh 262.144 token, mười ngôn ngữ, Apache 2.0 — được phát hành trên Hugging Face vào ngày 31 tháng 7 năm 2026, được nâng cấp từ phiên bản tiền nhiệm 236B thay vì huấn luyện từ đầu.

Screenshot of the Hugging Face model card for LGAI-EXAONE/K-EXAONE-2.0-750B-A37B-DSpark, captured August 9, 2026. It shows a 751B-parameter Mixture-of-Experts model under Apache 2.0 with F32/BF16 tensors, ten languages, 659 downloads in the last month, the notice that the model is not deployed by any inference provider, and a link to the K-EXAONE 2.0 technical report. English UI.

Điểm benchmark trung bình do chính LG công bố (24 benchmark, tổng thể 70,1) cho thấy hình dạng dự kiến của một mô hình chủ quyền Hàn Quốc: kết quả được báo cáo mạnh về truy xuất ngữ cảnh dài, an toàn xã hội Hàn Quốc và lập trình tác nhân, cùng với những con số thua kém Qw​en​3.5 của Alibaba về lý luận tổng quát (83,5 so với 89,8 trên MMLU-Pro, chẳng hạn). Chưa có con số nào được xác minh độc lập. Biến thể DSpark không thay đổi bất kỳ điểm số nào — nó là một hiện vật phục vụ, một cách nhanh hơn để chạy cùng một mô hình — đó chính xác là lý do nó xuất hiện trong các pull request của khung suy luận thay vì một thông báo công bố.

Thực tế phục vụ đằng sau một MoE 750B

Đây là nơi hỗ trợ DSpark thực sự quan trọng. K-EXAONE-2.0-750B-A37B-DSpark là checkpoint 751 tỷ tham số ở định dạng BF16/F32, và hướng dẫn của LG yêu cầu tối thiểu hai node với tám GPU NVIDIA H200 (16 GPU, tensor-parallel 16). Ở quy mô đó, thông lượng giải mã là yếu tố cốt lõi — token mỗi giây và chi phí cho một lượt tác tử dài — và đó chính xác là điều mà giải mã suy đoán (speculative decoding) tấn công. Tăng tốc giải mã gấp 3–5 lần, nếu duy trì được bên ngoài môi trường thử nghiệm của LG, chính là ranh giới giữa một cụm H200 có hiệu quả kinh tế hay không. LG cũng ghi nhận sự cố sụp đổ sinh văn bản (generation-collapse) trên GPU B200, cần dùng giải pháp khắc phục --disable-prefill-cuda-graph cho đến khi được sửa — một lời nhắc rằng đây là hạ tầng phục vụ tiên phong, không phải giải pháp trọn gói.

Generated single-model scoreboard for K-EXAONE-2.0-750B-A37B-DSpark: Parameters 750B total / 37B active; Draft layers 5 DSpark on 78 main; Context 262,144 tokens; Spec decode DSpark + MTP (3-5x, LG-claimed); License Apache 2.0; Independent score none yet. Footer reads 'All figures LG AI Research model card, August 2026 (vendor-reported). vLLM support pending PR #51558.' OrcaRouter logo composited bottom-right.

Chi phí là bao nhiêu, và cách bạn thực sự sẽ dùng thử nó

Hiện không có API nào phục vụ K-EXAONE 2.0. Thẻ Hugging Face của biến thể DSpark vẫn ghi rằng "mô hình này chưa được triển khai bởi bất kỳ nhà cung cấp suy luận nào," và với yêu cầu 16×H200, nó chỉ có thể tiếp cận một API được lưu trữ khi ai đó sở hữu phần cứng đó quyết định lưu trữ. Đó mới là điểm nghẽn thực sự: biên giới trọng số mở ngày càng trở thành bài toán phục vụ, chứ không phải bài toán về khả năng tiếp cận.

Khi một nhà cung cấp thực sự triển khai nó, tốc độ tăng nhờ giải mã suy đoán (speculative-decoding) sẽ thể hiện qua giá mỗi token, và chi phí chuyển đổi để thử nghiệm gần như bằng không nếu ứng dụng của bạn đã không phụ thuộc vào mô hình. Trên OrcaRouter — một endpoint tương thích Open​AI với hơn 200 mô hình, chuyển tiếp giá niêm yết của nhà cung cấp mà không tăng thêm phí — một mô hình xuất hiện trên bất kỳ nhà cung cấp hạ nguồn nào sẽ chỉ là một thay đổi định tuyến chứ không phải tích hợp lại, và cơ chế tự động chuyển đổi dự phòng có nghĩa là một mô hình MoE 750B hoàn toàn mới nếu hóa ra chậm hoặc không ổn định sẽ quay về mô hình đã biết là tốt mà không gây ra sự cố. Để nói rõ: OrcaRouter hiện không lưu trữ K-EXAONE-2.0-750B-A37B-DSpark, và API nào khác mà chúng tôi tìm thấy cũng không. Điểm của lớp định tuyến là được thiết kế sẵn cho cái ngày một trong số họ sẽ cung cấp nó.

Những gì chúng tôi đang xem

• Hai PR cần hợp nhất: #51558 (dành riêng cho mô hình) và #52197 (cấu hình chung) đều đang mở và chưa có phê duyệt nào. Việc merge kèm release chính là thứ biến "hỗ trợ DSpark" từ các pull request thành các cờ bạn thực sự có thể truyền vào.

• Phạm vi của đường dẫn tổng quát. Nếu #52197 được merge, bất kỳ DSparkDraftModel kiểu qwen3 nào trên Hugging Face đều có thể được tải bằng cấu hình — sự khác biệt giữa DSpark là một danh sách các checkpoint được chấp thuận và DSpark là một tiêu chuẩn mở.

• Một điểm số độc lập đầu tiên. Mọi điểm chuẩn trên thẻ đều do LG chạy. Điểm dữ liệu Artificial Analysis hoặc arena đầu tiên trên một MoE Hàn Quốc 750B sẽ là con số đầu tiên không do nhà cung cấp công bố.

• DSpark vượt xa Deep​Seek. LG và RadixArk hiện là hai nhà sản phẩm hóa độc lập phương pháp draft của Deep​Seek, và đường dẫn vLLM tổng quát là tín hiệu thứ ba cho thấy ngăn xếp đang hợp nhất.

• Phục vụ lượng tử hóa. LG phát hành các checkpoint FP8 và NVFP4 của mô hình cơ sở; một biến thể DSpark được lượng tử hóa chạy vừa trên ít GPU hơn sẽ thay đổi tính kinh tế nhanh hơn bất kỳ điểm chuẩn nào.

FAQ

K-EXAONE-2.0-750B-A37B-DSpark đã được phát hành chưa?

Các trọng số được đăng tải trên Hugging Face dưới giấy phép Apache 2.0, nhưng đây không phải là câu chuyện ra mắt: hỗ trợ vLLM là hai pull request đang mở, chưa được hợp nhất (#51558 và #52197), con số tăng tốc là của riêng LG, và không có nhà cung cấp nào lưu trữ mô hình. Điều "xác nhận" ở đây có nghĩa là đường dẫn phục vụ — hỗ trợ cấu hình DSparkDraftModel chung hiện đã tồn tại trong một PR công khai kèm kế hoạch kiểm thử có thể chạy — chứ không phải là bất kỳ bản build vLLM nào đã phát hành đều có thể phục vụ nó.

Sự khác biệt giữa K-EXAONE-2.0-750B-A37B và biến thể DSpark là gì?

Mô hình cơ sở có 78 lớp cộng với năm lớp dự thảo DSpark để giải mã suy đoán — các trọng số bên dưới vẫn giống nhau, các benchmark vẫn tương đương, và đây là một artifact phục vụ giải mã nhanh hơn thay vì một mô hình khác.

DSpark là của LG hay của DeepSeek?

DSpark là phương pháp giải mã suy đoán (speculative decoding) mã nguồn mở của Deep​Seek, cũng được tích hợp trong Deep​Seek-V4-Pro-DSpark và Deep​Seek-V4-Flash-DSpark; LG là bên áp dụng nổi bật nhất cho đến nay, và Qw​en​3.8-2.4T-A95B-DSpark của RadixArk là một drafter độc lập thứ hai được xây dựng trên cùng phương pháp. Thẻ mô hình của LG tuyên bố cùng mức tăng tốc 3–5×.

Tôi có thể chạy K-EXAONE-2.0-750B-A37B-DSpark trên phần cứng của riêng mình ngay hôm nay không?

Chỉ khi tự lưu trữ: hướng dẫn của LG yêu cầu tối thiểu mười sáu GPU NVIDIA H200, và các bản phát hành tiêu chuẩn của vLLM, SGLang và Transformers vẫn cần các fork chưa được hợp nhất hoặc đường dẫn cấu hình chung đang chờ xử lý để nhận diện kiến trúc. Hỗ trợ DSparkDraftModel trong #52197 là thứ gần nhất với một hướng đi chung, nhưng nó vẫn là một pull request đang mở.

Điều khiến nội dung này đáng xem không phải là bản thân các pull request — mà là những gì chúng báo hiệu. Một mô hình chủ lực có chủ quyền của Hàn Quốc với 750 tỷ tham số, giấy phép Apache-2.0, đã chọn tích hợp bộ công cụ giải mã suy đoán của DeepSeek; một công ty suy luận độc lập đã xây dựng bộ draft DSpark cho Qwen3.8 hạng max; và vLLM đang đáp lại bằng một đường dẫn cấu hình tổng quát thay vì một bản vá riêng cho từng mô hình. Đó là cách các mô hình mở tiên phong trở thành hiện thực — không phải ở thời điểm trọng số được phát hành, mà ở thời điểm các bộ draft được merge.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày