Kartu judul hero yang dibuat untuk artikel tentang K-EXAONE-2.0-750B-A37B-DSpark. Teks judul besar 'K-EXAONE-2.0-750B-A37B-DSpark' dengan label pil bertuliskan 'VLLM PR · BOCORAN / APA YANG KITA KETAHUI SEJAUH INI', subjudul 'MoE Korea 750B milik LG akan mendapatkan DSpark dari DeepSeek di vLLM', dan tiga chip spesifikasi '750B total · 37B aktif', '5 lapisan draft DSpark', 'konteks 262.144 token', dengan gaya B2B biru-dan-sian khas perusahaan serta motif simpul kecil dari model draft ke model besar, logo OrcaRouter ditempatkan di kanan bawah.
Guides & Insights

K-EXAONE-2.0-750B-A37B-DSpark: MoE Korea 750B dari LG Segera Hadir di vLLM

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 9 Agustus 2026, sebuah pull request dibuka di repositori vLLM untuk menambahkan K-EXAONE-2.0-750B-A37B-DSpark — varian speculative decoding dari model unggulan Korea LG AI Research dengan 750 miliar parameter. Empat hari kemudian, pada 13 Agustus, PR kedua yang lebih fundamental membuat kebocoran itu menjadi konkret: vLLM kini memiliki jalur konfigurasi DSparkDraftModel yang generik, yang memetakan checkpoint Hugging Face mana pun yang mendeklarasikan architectures=DSparkDraftModel dengan model_type=qw​en​3 ke Qw​en3DSparkModel yang dikenali, dengan rencana pengujian yang benar-benar menyajikan drafter RadixArk Qw​en​3.8-2.4T-A95B-DSpark melalui metode spek dspark. Basis K-EXAONE-2.0-750B-A37B dirilis pada 31 Juli di bawah Apache 2.0, dan saat peluncuran vLLM dapat menyajikannya dengan metode draf MTP tetapi tidak dengan DSpark — drafter yang juga dirilis LG dan diklaim memberikan percepatan decoding 3–5×. DSpark sendiri adalah metode Deep​Seek, drafter semi-autoregressive yang sama yang berjalan di Deep​Seek-V4-Pro-DSpark dan Deep​Seek-V4-Flash-DSpark, jadi kedua PR tersebut bersama-sama adalah tanda paling jelas bahwa tumpukan speculative decoding Deep​Seek menjadi standar bobot terbuka.

Ini adalah artikel tentang apa yang kita ketahui sejauh ini, bukan cerita peluncuran. Kedua pull request masih terbuka dan belum digabung, checkpoint DSpark belum memiliki benchmark independen, dan angka percepatan dari LG adalah klaim vendor. Semua di bawah ini diberi label sesuai. Yang nyata saat ini: bobotnya ada di Hugging Face, model dasar telah dirilis, spec-decoder DSpark dari vLLM sudah melayani checkpoint DeepSeek dan Kimi, dan jalur konfigurasi generik yang memungkinkan drafter DSpark pihak ketiga dimuat — bagian yang ditunggu oleh kebocoran ini — kini ada di pull request publik, sudah diuji tetapi belum dirilis.

Versi singkatnya

• PR #51558, dibuka pada 9 Agustus 2026, menambahkan K-EXAONE-2.0-750B-A37B-DSpark ke vLLM; masih terbuka dan belum ada persetujuan.

• PR #52197, dibuka pada 13 Agustus 2026, menambahkan dukungan konfigurasi DSparkDraftModel generik — architectures=DSparkDraftModel dengan model_type=qw​en​3, dinormalisasi menjadi Qw​en3DSparkModel — dan rencana pengujiannya menjalankan drafter RadixArk Qw​en​3.8-2.4T-A95B-DSpark dengan metode spesifikasi dspark dan tujuh token spesifikasi. Juga terbuka, juga belum digabungkan.

• DSpark adalah drafter keluarga EAGLE yang dirilis sebagai sumber terbuka oleh Deep​Seek dan disertakan pada Deep​Seek-V4-Pro-DSpark dan Deep​Seek-V4-Flash-DSpark; LG adalah adopsi paling menonjol oleh laboratorium lain sejauh ini, dan drafter Qw​en3.8 dari RadixArk adalah yang kedua yang independen.

Varian DSpark adalah MoE 750B dengan 78 lapisan ditambah lima lapisan draf ekstra; LG mengklaim DSpark dan MTP masing-masing memberikan percepatan decoding sekitar 3–5×, yang ditujukan untuk beban kerja agentik berhorizon panjang.

• Pada peluncuran, vLLM mendukung MTP untuk K-EXAONE 2.0 tetapi tidak untuk DSpark; dukungan DSpark akan hadir melalui PR khusus model dan jalur konfigurasi generik.

• Tidak ada penyedia yang meng-hosting checkpoint K-EXAONE 2.0 saat ini, dan semua benchmark pada kartu tersebut adalah milik LG sendiri.

Apa itu pull requests (dan bukan)

PR vLLM #51558, "[Model] Add K-EXAONE-2.0-750B-A37B-DSpark," dibuka oleh lkm2835 — kontributor yang sama di balik dukungan K-EXAONE sebelumnya di vLLM (#50524 untuk model dasar) dan di SGLang (#33648). Ini adalah PR fork yang ditandai dengan label new-model, peninjauan diminta dari pemilik kode vLLM, dan belum ada persetujuan. Deskripsinya terdiri dari tiga baris: menambahkan dukungan untuk checkpoint DSpark yang "dikembangkan oleh LG AI Research," menautkan kartu model Hugging Face dan laporan teknis K-EXAONE 2.0 (arXiv 2608.04505), serta merujuk pada karya vLLM sebelumnya di #50524.

Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.

PR 13 Agustus berbeda jenisnya. #52197, "Support DSpark configs dengan architectures=DSparkDraftModel + model_type=qw​en​3," menambahkan lapisan normalisasi generik: checkpoint draf Hugging Face yang mendeklarasikan dirinya sebagai DSparkDraftModel pada tipe model qw​en​3 dipetakan ulang menjadi Qw​en3DSparkModel yang dapat dimuat oleh spec-decoder vLLM yang sudah ada. Model referensi dalam rencana pengujiannya adalah RadixArk/Qw​en​3.8-2.4T-A95B-DSpark — spekulator DSpark untuk target Qw​en​3.8-2.4T-A95B kelas maks — dilayani dengan metode spec dspark dan jendela spec tujuh token. Pesan commit-nya adalah gagasan utuhnya: "architectures=DSparkDraftModel+model_type=qw​en​3." Inti perubahan ini adalah drafter DSpark pihak ketiga harus dapat dimuat melalui konfigurasi, bukan memerlukan kode per model, seperti yang saat ini dilakukan untuk setiap checkpoint DSpark yang didukung. PR ini terbuka dan belum digabung, sama seperti #51558.

Bacalah status itu secara harfiah. "Dukungan sedang ditambahkan" bukan berarti "dukungan sudah tersedia": hingga salah satu PR digabungkan dan dirilis dalam sebuah rilis, build vLLM standar tetap tidak akan memuat varian DSpark. Kartu model itu sendiri menyebutkan bahwa melayani K-EXAONE 2.0 dengan DSpark saat ini belum didukung di vLLM, yang justru menggunakan MTP. Kedua PR itulah langkah yang mengubah kalimat tersebut — jika dan ketika keduanya benar-benar masuk.

Mengapa DSpark adalah kisah sebenarnya di sini.

Nama model ini memuat banyak informasi. "A37B" berarti 37 miliar parameter aktif per token. "DSpark" adalah drafter speculative-decoding yang diperkenalkan Deep​Seek tahun ini: model draft semi-autoregressive dari keluarga EAGLE yang mengusulkan blok token dalam satu lintasan dan memungkinkan model target memverifikasinya, sehingga kualitas keluaran tidak berubah sementara pembuatan menjadi lebih cepat. Deep​Seek membuka sumbernya dan menyertakan drafter tersebut dengan checkpoint Deep​Seek-V4-Pro-DSpark dan Deep​Seek-V4-Flash-DSpark miliknya sendiri, dengan percepatan yang dilaporkan komunitas berkisar 60–85% untuk Flash dan 57–78% untuk Pro dibandingkan dengan baseline MTP satu token.

Yang diperjelas oleh PR baru ini adalah bahwa dukungan DSpark di vLLM tidak pernah menjadi pertanyaan terbuka. Dokumentasi vLLM sendiri sudah mencantumkan modul DSpark untuk checkpoint Deep​Seek-V4, Kimi K3, dan Gem​ma​4, dan tim telah menuliskan desainnya dalam sebuah tulisan teknik pada bulan Juli. Namun, setiap integrasi tersebut dihubungkan secara manual — sebuah daftar checkpoint yang "diberkati", bukan jalur yang bisa digunakan siapa pun. Checkpoint K-EXAONE jelas tidak ada dalam daftar itu. #52197 adalah upaya untuk membuat jalur tersebut generik: satu pemetaan konfigurasi (DSparkDraftModel plus qw​en​3) alih-alih kelas model khusus lainnya, dan drafter pihak ketiga sebagai kasus uji referensi, bukan model Deep​Seek. Itulah sebabnya kisah bocornya draft checkpoint sebenarnya adalah kisah infrastruktur.

K-EXAONE-2.0-750B-A37B-DSpark mempertahankan 78 lapisan model dasar dan menambahkan lima lapisan draf DSpark, dan kartu model LG mengklaim bahwa DSpark dan MTP sama-sama mempercepat generasi sekitar 3–5× — angka mereka sendiri, yang ditujukan untuk "beban kerja jangka panjang seperti tugas-tugas agenik," di mana latensi dekode menjadi hambatan utamanya. Dua hal menyusul. Pertama, decoding spekulatif menjadi fitur kelas satu dari model-model frontier terbuka, bukan sekadar trik penyajian yang ditambahkan belakangan. Kedua, tumpukan draf DeepSeek-lah yang menjadi default — itulah sebabnya flagship berdaulat yang didukung pemerintah Korea ini menggunakannya, sehingga penting melampaui pemberitaan "model baru" yang biasa.

Model di balik PR

K-EXAONE-2.0-750B-A37B-DSpark adalah varian dari K-EXAONE 2.0, sekuel dari lini K-EXAONE 236B milik LG dan model fondasi buatan dalam negeri terbesar di Korea Selatan, yang dibangun di bawah program AI berdaulat pemerintah. Model dasarnya — 750B total parameter, 37B aktif, Mixture-of-Experts dengan 256 pakar dan 8 aktif per token, jendela konteks 262.144 token, sepuluh bahasa, Apache 2.0 — dirilis di Hugging Face pada 31 Juli 2026, di-upcycle dari pendahulunya yang 236B daripada dilatih dari awal.

Screenshot of the Hugging Face model card for LGAI-EXAONE/K-EXAONE-2.0-750B-A37B-DSpark, captured August 9, 2026. It shows a 751B-parameter Mixture-of-Experts model under Apache 2.0 with F32/BF16 tensors, ten languages, 659 downloads in the last month, the notice that the model is not deployed by any inference provider, and a link to the K-EXAONE 2.0 technical report. English UI.

Rata-rata benchmark LG sendiri (24 benchmark, 70.1 keseluruhan) menunjukkan bentuk yang diharapkan untuk model berdaulat Korea: hasil yang dilaporkan kuat dalam pengambilan konteks panjang, keamanan sosial Korea, dan pengkodean agen, di samping angka-angka yang tertinggal dari Qwen3.5 milik Alibaba pada penalaran umum (83.5 vs 89.8 pada MMLU-Pro, misalnya). Belum ada satu pun yang diverifikasi secara independen. Varian DSpark tidak mengubah skor-skor tersebut — varian itu adalah artefak penyajian, cara yang lebih cepat untuk menjalankan model yang sama — yang justru menjadi alasan mengapa varian itu muncul dalam pull request kerangka kerja inferensi, bukan dalam sebuah pengumuman.

Realitas penyajian di balik MoE 750B

Di sinilah dukungan DSpark sebenarnya penting. K-EXAONE-2.0-750B-A37B-DSpark adalah checkpoint dengan 751 miliar parameter dalam BF16/F32, dan panduan LG adalah minimum dua node dengan delapan GPU NVIDIA H200 (16 GPU, tensor-parallel 16). Pada skala tersebut, throughput decode adalah segalanya — token per detik, dan biaya dari satu giliran agen yang panjang — dan justru itulah yang diserang oleh speculative decoding. Percepatan decode 3–5×, jika bertahan di luar lingkungan pengujian LG, adalah perbedaan antara klaster H200 yang ekonomis atau tidak. LG juga mendokumentasikan masalah keruntuhan generasi pada GPU B200 yang memerlukan solusi sementara --disable-prefill-cuda-graph hingga diperbaiki — sebuah pengingat bahwa ini adalah penyajian mutakhir, bukan solusi siap pakai.

Generated single-model scoreboard for K-EXAONE-2.0-750B-A37B-DSpark: Parameters 750B total / 37B active; Draft layers 5 DSpark on 78 main; Context 262,144 tokens; Spec decode DSpark + MTP (3-5x, LG-claimed); License Apache 2.0; Independent score none yet. Footer reads 'All figures LG AI Research model card, August 2026 (vendor-reported). vLLM support pending PR #51558.' OrcaRouter logo composited bottom-right.

Berapa biayanya, dan bagaimana Anda benar-benar mencobanya

Tidak ada API yang melayani K-EXAONE 2.0 saat ini. Kartu Hugging Face untuk varian DSpark masih berbunyi "model ini tidak disebarkan oleh penyedia inferensi mana pun," dan jejak 16×H200 berarti ia dapat menjangkau API yang dihosting hanya jika seseorang dengan perangkat keras tersebut memutuskan untuk menghostingnya. Itulah titik gesekan yang sebenarnya: perbatasan open-weights semakin menjadi masalah serving, bukan masalah ketersediaan.

Ketika sebuah penyedia layanan akhirnya mengadopsinya, percepatan speculative decoding akan terlihat pada harga per token, dan biaya peralihan untuk mencobanya seharusnya mendekati nol jika aplikasi Anda sudah agnostik terhadap model. Di OrcaRouter — satu endpoint yang kompatibel dengan OpenAI untuk 200+ model, dengan harga daftar penyedia diteruskan dengan markup 0% — model yang mendarat di penyedia hulu mana pun menjadi perubahan rute, bukan integrasi ulang, dan failover otomatis berarti MoE 750B yang baru, yang ternyata lambat atau tidak stabil, akan beralih kembali ke model yang sudah dikenal baik tanpa insiden. Untuk lebih jelasnya: OrcaRouter saat ini tidak menghosting K-EXAONE-2.0-750B-A37B-DSpark, dan API lain yang kami temukan juga tidak. Inti dari lapisan routing ini adalah disiapkan untuk hari ketika salah satu dari mereka menyediakannya.

Apa yang sedang kami tonton

• Dua PR sedang digabungkan. #51558 (khusus model) dan #52197 (konfigurasi umum) keduanya masih terbuka tanpa persetujuan. Penggabungan plus rilis adalah yang mengubah "dukungan DSpark" dari pull request menjadi flag yang benar-benar dapat Anda operkan.

• Cakupan jalur generik. Jika #52197 digabungkan, DSparkDraftModel bertipe qw​en​3 apa pun di Hugging Face dapat dimuat melalui konfigurasi — perbedaan antara DSpark sebagai daftar checkpoint yang disetujui dan DSpark sebagai standar terbuka.

• Skor independen pertama. Setiap benchmark pada kartu tersebut dijalankan oleh LG. Titik data pertama dari Artificial Analysis atau arena pada MoE Korea 750B akan menjadi angka pertama yang tidak dicetak oleh vendor.

• DSpark melampaui Deep​Seek. LG dan RadixArk kini menjadi dua productizer independen dari metode draft Deep​Seek, dan jalur vLLM generik adalah sinyal ketiga bahwa stack sedang mengonsolidasi.

• Penyajian terkuantisasi. LG merilis checkpoint FP8 dan NVFP4 dari model dasar; varian DSpark terkuantisasi yang dapat berjalan pada lebih sedikit GPU akan mengubah ekonomi lebih cepat daripada benchmark mana pun.

FAQ

Apakah K-EXAONE-2.0-750B-A37B-DSpark sudah dirilis?

{{1}}Bobot model tersedia di Hugging Face di bawah lisensi Apache 2.0{{/1}}, {{2}}tetapi ini bukan kisah peluncuran{{/2}}: {{3}}dukungan vLLM berupa dua pull request yang terbuka dan belum digabung (#51558 dan #52197){{/3}}, {{4}}angka percepatan adalah milik LG sendiri{{/4}}, {{5}}dan tidak ada penyedia yang menghosting model tersebut{{/5}}. {{6}}Yang dimaksud "dikonfirmasi" di sini adalah jalur penyajiannya{{/6}} — {{7}}dukungan konfigurasi DSparkDraftModel generik kini ada dalam PR publik dengan rencana pengujian yang dapat dijalankan{{/7}} — {{8}}bukan bahwa build vLLM yang dirilis mana pun sudah dapat menyajikannya{{/8}}.

Apa perbedaan antara K-EXAONE-2.0-750B-A37B dan varian DSpark?

Model dasar dengan 78 lapisan ditambah lima lapisan draft DSpark untuk decoding spekulatif — bobot yang sama di bawahnya, tolok ukur yang sama, dan artefak penyajian yang lebih cepat untuk didekode, bukan model yang berbeda.

Apakah DSpark milik LG atau milik Deep​Seek?

DSpark adalah metode speculative decoding bersumber terbuka milik Deep​Seek, yang juga disertakan pada Deep​Seek-V4-Pro-DSpark dan Deep​Seek-V4-Flash-DSpark; LG adalah pengadopsi paling terkenal sejauh ini, dan Qw​en​3.8-2.4T-A95B-DSpark milik RadixArk adalah drafter independen kedua yang dibangun dengan metode yang sama. Kartu model LG mengklaim rentang percepatan 3–5× yang sama.

Bisakah saya menjalankan K-EXAONE-2.0-750B-A37B-DSpark pada perangkat keras saya sendiri hari ini?

Hanya dengan self-hosting: panduan LG mensyaratkan minimal enam belas GPU NVIDIA H200, dan rilis standar vLLM, SGLang, serta Transformers masih memerlukan fork yang belum digabung atau jalur konfigurasi generik yang tertunda untuk mengenali arsitektur tersebut. Dukungan DSparkDraftModel di #52197 adalah hal yang paling mendekati rute bersama, tetapi masih berupa pull request yang terbuka.

Yang membuat ini layak diperhatikan bukanlah pull request-nya itu sendiri — melainkan apa yang mereka isyaratkan. Sebuah model flagship berdaulat asal Korea dengan 750 miliar parameter dan berlisensi Apache-2.0 memilih untuk menyertakan tumpukan speculative-decoding milik Deep​Seek, sebuah perusahaan inferensi independen telah membangun drafter DSpark untuk Qw​en​3.8 kelas max, dan vLLM merespons dengan jalur konfigurasi generik, bukan patch per-model. Begitulah model terbuka kelas frontier menjadi nyata — bukan saat bobotnya rilis, melainkan saat para drafter di-merge.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari