K-EXAONE-2.0-750B-A37B-DSpark 기사용 히어로 타이틀 카드가 생성되었습니다. 대형 타이틀 텍스트는 '{{1}}K-EXAONE-2.0-750B-A37B-DSpark{{/1}}', 필 라벨은 '{{2}}VLLM PR · 유출 / 현재까지 알려진 정보{{/2}}', 부제목은 '{{3}}LG의 750B 한국어 MoE가 vLLM에서 DeepSeek의 DSpark를 도입합니다{{/3}}', 스펙 칩 3개는 '{{4}}총 750B · 활성 37B{{/4}}', '{{5}}DSpark 드래프트 레이어 5개{{/5}}', '{{6}}262,144토큰 컨텍스트{{/6}}'입니다. 하우스 블루-시안 B2B 스타일에 드래프트 모델에서 대형 모델로 이어지는 작은 노드 모티프가 포함되며, OrcaRouter 로고는 오른쪽 하단에 합성되었습니다.
Guides & Insights

K-EXAONE-2.0-750B-A37B-DSpark: LG의 750B 한국어 MoE, vLLM에 출시 예정

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 8월 9일, vLLM 저장소에 K-EXAONE-2.0-750B-A37B-DSpark를 추가하기 위한 풀 리퀘스트가 열렸습니다. 이는 LG AI Research의 7,500억 파라미터 한국형 플래그십 모델의 스페큘레이티브 디코딩 변형입니다. 4일 후인 8월 13일, 더 근본적인 두 번째 PR로 이 유출이 구체화되었습니다. 이제 vLLM에는 일반적인 DSparkDraftModel 구성 경로가 있으며, 이는 architectures=DSparkDraftModel 및 model_type=qw​en​3을 선언하는 모든 Hugging Face 체크포인트를 인식된 Qw​en3DSparkModel에 매핑하고, 실제로 dspark spec 메서드를 통해 RadixArk Qw​en​3.8-2.4T-A95B-DSpark 드래프터를 서빙하는 테스트 계획을 포함합니다. 기본 K-EXAONE-2.0-750B-A37B는 7월 31일 Apache 2.0 라이선스로 출시되었으며, 출시 당시 vLLM은 MTP 드래프트 방법으로는 서빙할 수 있었지만 DSpark로는 서빙할 수 없었습니다. DSpark는 LG가 함께 출시하고 3–5배 디코딩 속도 향상을 주장하는 드래프터입니다. DSpark 자체는 Deep​Seek의 방법으로, Deep​Seek-V4-Pro-DSpark 및 Deep​Seek-V4-Flash-DSpark에서 실행되는 것과 동일한 준자기회귀(semi-autoregressive) 드래프터입니다. 따라서 두 PR을 합치면 Deep​Seek의 스페큘레이티브 디코딩 스택이 오픈 가중치(open-weights) 기본값이 되고 있음을 보여주는 가장 분명한 신호입니다.

이 글은 출시 기사가 아니라 지금까지 알려진 사실을 정리한 것이다. 두 풀 리퀘스트 모두 아직 열려 있고 병합되지 않았으며, DSpark 체크포인트에는 독립적인 벤치마크가 없고, LG의 속도 향상 수치는 벤더의 주장일 뿐이다. 아래의 모든 내용은 그에 따라 표시되어 있다. 오늘 실제로 확인된 사실: 가중치는 Hugging Face에 올라와 있고, 베이스 모델은 출시되었으며, vLLM의 DSpark 스펙 디코더는 이미 Deep​Seek 및 Kim​i 체크포인트를 서빙하고 있다. 그리고 서드파티 DSpark 드래프터가 로드될 수 있게 해 주는 범용 구성 경로 — 이번 유출이 기다리던 바로 그 부분 — 가 이제 공개 풀 리퀘스트에 올라와 있으며, 테스트는 끝났지만 아직 출시되지는 않았다.

간략 버전

• PR #51558, 2026년 8월 9일에 오픈된, K-EXAONE-2.0-750B-A37B-DSpark를 vLLM에 추가합니다; 아직 승인 없이 열려 있습니다.

• PR #52197(2026년 8월 13일 오픈)은 범용 DSparkDraftModel 구성 지원을 도입합니다 — architectures=DSparkDraftModel 및 model_type=qw​en​3, Qw​en3DSparkModel로 정규화 — 테스트 계획은 dspark 스펙 메서드와 7개의 스펙 토큰을 사용하여 RadixArk Qw​en​3.8-2.4T-A95B-DSpark 드래프터를 실행합니다. 이 역시 오픈 상태이며 아직 병합되지 않았습니다.

DSpark는 EAGLE 계열 드래프터로, Deep​Seek가 오픈소스로 공개했으며 Deep​Seek-V4-Pro-DSpark 및 Deep​Seek-V4-Flash-DSpark에 탑재되어 있습니다. LG는 지금까지 다른 연구소의 채택 중 가장 주목할 만한 사례이고, RadixArk의 Qw​en​3.8 드래프터는 두 번째 독립적 사례입니다.

DSpark 변형은 78개 레이어의 750B MoE에 드래프트 레이어 5개를 추가한 것입니다. LG는 DSpark와 MTP가 각각 약 3~5배의 디코딩 속도 향상을 제공하며, 장기적(long-horizon) 에이전트 워크로드를 겨냥한다고 주장합니다.

• 출시 당시 vLLM은 K-EXAONE 2.0에 대해 MTP를 지원했지만 DSpark는 지원하지 않았습니다. DSpark 지원은 모델별 PR과 일반 구성 경로를 통해 도입되고 있습니다.

• 현재 K-EXAONE 2.0 체크포인트를 호스팅하는 제공업체는 없으며, 카드의 모든 벤치마크는 LG 자체의 것입니다.

{{1}}풀 리퀘스트가 무엇인지(그리고 무엇이 아닌지){{/1}}

vLLM PR #51558, "[Model] K-EXAONE-2.0-750B-A37B-DSpark 추가"는 lkm2835에 의해 열렸습니다. lkm2835는 이전에 vLLM(#50524, 기본 모델) 및 SGLang(#33648)에서 K-EXAONE 지원을 담당했던 동일한 기여자입니다. 이 PR은 포크 PR이며 new-model 레이블이 지정되어 있고, vLLM 코드 소유자의 리뷰가 요청되었지만 아직 승인은 없습니다. 설명은 세 줄로 구성됩니다: LG AI Research에서 개발한 DSpark 체크포인트에 대한 지원을 추가하고, Hugging Face 모델 카드와 K-EXAONE 2.0 기술 보고서(arXiv 2608.04505)를 링크하며, 이전 vLLM 작업 #50524를 참조합니다.

Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.

8월 13일 PR은 성격이 다릅니다. #52197, "architectures=DSparkDraftModel + model_type=qw​en​3로 DSpark 구성을 지원"은 일반적인 정규화 계층을 추가합니다. 자신을 qw​en​3 모델 타입의 DSparkDraftModel로 선언하는 Hugging Face 드래프트 체크포인트는 vLLM의 기존 스펙 디코더가 로드할 수 있는 Qw​en3DSparkModel로 다시 매핑됩니다. 테스트 계획의 참조 모델은 RadixArk/Qw​en​3.8-2.4T-A95B-DSpark입니다. 이 모델은 최대 클래스 Qw​en​3.8-2.4T-A95B 타깃을 위한 DSpark 스펙레이터이며, dspark 스펙 메서드와 7-토큰 스펙 윈도로 서비스됩니다. 커밋 메시지가 핵심을 그대로 담고 있습니다: "architectures=DSparkDraftModel+model_type=qw​en​3." 이 변경의 요점은 타사 DSpark 드래프터가 모델별 코드를 필요로 하는 대신 구성만으로 로드될 수 있어야 한다는 것입니다. 현재 지원되는 모든 DSpark 체크포인트는 바로 그런 모델별 코드로 연결되어 있습니다. 이 PR은 #51558과 마찬가지로 오픈 상태이며 아직 병합되지 않았습니다.

그 상태 메시지를 문자 그대로 읽어야 한다. "지원이 추가되는 중"은 "지원이 가능함"과 다르다: 두 PR 중 하나라도 병합되어 릴리스로 배포되기 전까지는, 표준 vLLM 빌드는 여전히 DSpark 변형을 로드하지 못한다. 모델 카드 자체에도 K-EXAONE 2.0을 DSpark로 서빙하는 것은 현재 vLLM에서 지원되지 않으며, vLLM은 대신 MTP를 사용한다고 명시되어 있다. 이 두 PR은 그 문장을 바꾸는 단계들이다 — 그것들이 실제로 병합된다면, 그리고 그때에 말이다.

왜 DSpark가 여기서 진짜 이야기인가

모델 이름은 많은 정보를 담고 있습니다. "A37B"는 토큰당 활성 매개변수가 370억 개라는 뜻입니다. "DSpark"는 Deep​Seek가 올해 소개한 추측 디코딩(speculative decoding) 드래프터입니다. 즉, 한 번의 패스로 토큰 블록을 제안하고 대상 모델이 이를 검증하게 하는 반자기회귀(semi-autoregressive) 방식의 EAGLE 계열 드래프트 모델로, 출력 품질은 그대로 유지하면서 생성 속도를 높입니다. Deep​Seek는 이를 오픈소스로 공개했으며 자체 Deep​Seek-V4-Pro-DSpark 및 Deep​Seek-V4-Flash-DSpark 체크포인트에 드래프터를 포함해 배포합니다. 커뮤니티에서 보고된 속도 향상은 단일 토큰 MTP 기준으로 Flash의 경우 60~85%, Pro의 경우 57~78%입니다.

새 PR이 분명히 보여주는 것은 vLLM에서 DSpark 지원이 결코 미해결 문제가 아니었다는 점이다. vLLM 자체 문서에는 이미 Deep​Seek-V4, Kimi K3, Gem​ma​4 체크포인트용 DSpark 모듈이 나열되어 있고, 팀은 7월 엔지니어링 게시물에서 그 설계를 설명했다. 다만 그런 통합은 모두 수동으로 연결되어 있다. 즉, 누구나 사용할 수 있는 경로가 아니라 허용된 체크포인트 목록인 셈이다. K-EXAONE 체크포인트는 그 목록에 그냥 없다. #52197은 그 경로를 일반화하려는 시도다. 또 다른 맞춤형 모델 클래스 대신 하나의 구성 매핑(DSparkDraftModel + qw​en​3)을 사용하고, Deep​Seek 모델이 아닌 서드파티 드래프터를 참조 테스트 사례로 삼는다. 이것이 유출된 드래프트 체크포인트 이야기가 사실은 인프라 이야기인 이유다.

K-EXAONE-2.0-750B-A37B-DSpark는 기본 모델의 78개 레이어를 유지하면서 5개의 DSpark 드래프트 레이어를 추가했으며, LG의 모델 카드에 따르면 DSpark와 MTP 모두 생성 속도를 약 3~5배 가속화한다고 합니다. 이는 자체 수치로, "에이전트 작업과 같은 장기 실행 워크로드"를 겨냥한 것으로, 디코딩 지연 시간이 병목 지점인 경우입니다. 여기서 두 가지가 따라옵니다. 첫째, 추측적 디코딩은 오픈 프런티어 모델의 일급 기능이 되고 있으며, 나중에 붙이는 서빙 트릭이 아닙니다. 둘째, {{1}}Deep​Seek{{/1}}의 드래프트 스택이 기본값이 되고 있다는 점입니다. {{2}}이것이 바로 한국 정부가 지원하는 소버린 플래그십 모델에 이 기술이 탑재된 것이 단순한 "새 모델" 소식 이상으로 중요한 이유입니다.{{/2}}

PR 뒤에 있는 모델

K-EXAONE-2.0-750B-A37B-DSpark는 K-EXAONE 2.0의 변형 모델입니다. K-EXAONE 2.0은 LG의 236B K-EXAONE 제품군의 후속작이자 정부의 주권 AI 프로그램 하에 구축된 한국 최대 규모의 자체 개발 기반 모델입니다. 기본 모델(총 750B 파라미터, 활성 37B, 256개 전문가와 토큰당 8개 활성 전문가로 구성된 Mixture-of-Experts, 262,144토큰 컨텍스트 창, 10개 언어, Apache 2.0)은 처음부터 학습하는 대신 236B 전작에서 업사이클링되어 2026년 7월 31일 Hugging Face에 공개되었습니다.

Screenshot of the Hugging Face model card for LGAI-EXAONE/K-EXAONE-2.0-750B-A37B-DSpark, captured August 9, 2026. It shows a 751B-parameter Mixture-of-Experts model under Apache 2.0 with F32/BF16 tensors, ten languages, 659 downloads in the last month, the notice that the model is not deployed by any inference provider, and a link to the K-EXAONE 2.0 technical report. English UI.

LG 자체 벤치마크 평균(24개 벤치마크, 종합 70.1)은 한국 주권 모델에서 기대되는 형태를 보여준다: 장문 맥락 검색, 한국 사회 안전성, 에이전트 코딩에서 강력한 보고 결과를 보여주는 한편, 일반 추론에서는 알리바바의 Qw​en​3.5에 뒤처지는 수치(예: MMLU-Pro 83.5 대 89.8)를 기록했다. 이 중 어느 것도 아직 독립적으로 검증되지 않았다. DSpark 변형은 그러한 점수를 전혀 바꾸지 않는다. 이는 서빙 산출물, 즉 동일한 모델을 더 빠르게 실행하는 방식일 뿐이며, 바로 그 이유로 발표가 아닌 추론 프레임워크 풀 리퀘스트에 등장하는 것이다.

750B MoE 뒤에 숨은 서빙 현실

여기서 DSpark 지원이 실제로 중요해집니다. K-EXAONE-2.0-750B-A37B-DSpark는 BF16/F32 형식의 7,510억 파라미터 체크포인트이며, LG의 가이드라인에 따르면 NVIDIA H200 GPU 8개로 구성된 노드 2개(총 16개 GPU, 텐서 병렬 16)가 최소 사양입니다. 그런 규모에서는 디코드 처리량이 곧 전부입니다. 즉, 초당 토큰 수와 긴 에이전트 턴의 비용이 핵심이며, 이것이 바로 스페큘레이티브 디코딩이 공략하는 부분입니다. 3–5배의 디코드 속도 향상은 LG의 테스트 환경 밖에서도 유지된다면 H200 클러스터가 경제적인지 아닌지를 가르는 요소입니다. LG는 또한 B200 GPU에서 생성 붕괴(generation collapse) 문제를 문서화했는데, 해결될 때까지 --disable-prefill-cuda-graph 우회 옵션이 필요합니다. 이는 이것이 턴키 방식이 아닌 최첨단 서빙이라는 점을 상기시켜 줍니다.

Generated single-model scoreboard for K-EXAONE-2.0-750B-A37B-DSpark: Parameters 750B total / 37B active; Draft layers 5 DSpark on 78 main; Context 262,144 tokens; Spec decode DSpark + MTP (3-5x, LG-claimed); License Apache 2.0; Independent score none yet. Footer reads 'All figures LG AI Research model card, August 2026 (vendor-reported). vLLM support pending PR #51558.' OrcaRouter logo composited bottom-right.

비용이 얼마인지, 그리고 실제로 시도하는 방법

오늘날 K-EXAONE 2.0을 제공하는 API는 없습니다. DSpark 변형에 대한 Hugging Face 카드에는 여전히 '이 모델은 어떤 추론 제공자도 배포하지 않습니다'라고 표시되어 있으며, 16×H200 규모의 하드웨어 구성은 해당 하드웨어를 보유한 누군가가 호스팅하기로 결정했을 때만 호스팅 API에 연결될 수 있음을 의미합니다. 이것이 실제 마찰 지점입니다. 오픈 가중치(open-weights) 프런티어는 점점 더 가용성 문제가 아니라 서빙(serving) 문제가 되고 있습니다.

어떤 제공자가 이를 채택하면, 추측 디코딩 속도 향상은 토큰당 가격에 반영될 것이며, 애플리케이션이 이미 모델에 구애받지 않는다면 이를 시도하기 위한 전환 비용은 거의 0에 가까울 것입니다. OrcaRouter — 200개 이상의 모델을 아우르는 OpenAI 호환 엔드포인트로, 제공업체 공시 가격을 0% 마크업으로 그대로 전달하는 — 에서는 어떤 업스트림 제공업체에든 모델이 배치되면 재통합이 아닌 라우팅 변경이 되며, 자동 장애 조치 덕분에 느리거나 불안정한 것으로 판명된 새로운 750B MoE가 장애 없이 알려진 정상 모델로 대체됩니다. 명확히 하자면: OrcaRouter는 현재 K-EXAONE-2.0-750B-A37B-DSpark를 호스팅하지 않으며, 우리가 찾을 수 있는 다른 어떤 API도 호스팅하지 않습니다. 라우팅 계층의 요점은 그중 하나가 호스팅하는 날을 대비해 연결되어 있다는 것입니다.

우리가 보고 있는 것

• 병합할 두 개의 PR. #51558(모델별) 및 #52197(일반 구성)은 둘 다 승인 없이 열려 있습니다. 병합과 릴리스가 있어야 "DSpark 지원"이 풀 리퀘스트에서 실제로 전달할 수 있는 플래그가 됩니다.

• 일반 경로의 범위. #52197이 병합되면 Hugging Face의 qw​en​3 타입 DSparkDraftModel은 설정만으로 로드할 수 있게 됩니다 — DSpark가 공인된 체크포인트 목록에 불과한 것과 DSpark가 개방형 표준이 되는 것의 차이입니다.

• 첫 번째 독립 점수. 카드의 모든 벤치마크는 LG가 실행한 것입니다. 750B 한국어 MoE에 대한 첫 번째 Artificial Analysis 또는 arena 데이터 포인트는 공급업체가 발표하지 않은 첫 번째 숫자가 될 것입니다.

• DSpark는 DeepSeek를 넘어섭니다. LG와 RadixArk는 이제 DeepSeek의 드래프트 방식을 제품화하는 두 독립적 주체이며, 범용 vLLM 경로는 스택이 통합되고 있다는 세 번째 신호입니다.

• 양자화 서빙. LG는 기본 모델의 FP8 및 NVFP4 체크포인트를 제공합니다; 더 적은 GPU에 맞는 양자화된 DSpark 변형은 어떤 벤치마크보다도 경제성을 더 빠르게 바꿀 것입니다.

자주 묻는 질문

K-EXAONE-2.0-750B-A37B-DSpark가 출시되었나요?

가중치는 Apache 2.0 하에 Hugging Face에 있지만, 이것은 출시 스토리가 아닙니다. vLLM 지원은 두 개의 공개되었지만 병합되지 않은 풀 리퀘스트(#51558 및 #52197)이며, 속도 향상 수치는 LG 자체의 것이고, 어떤 제공업체도 모델을 호스팅하지 않습니다. 여기서 "확인됨"이 의미하는 것은 서빙 경로입니다. 즉, 일반적인 DSparkDraftModel 구성 지원이 실행 가능한 테스트 계획과 함께 공개 PR에 존재한다는 것이지, 출시된 vLLM 빌드가 아직 그 모델을 서빙할 수 있다는 뜻은 아닙니다.

K-EXAONE-2.0-750B-A37B와 DSpark 변형의 차이점은 무엇인가요?

베이스 모델의 78개 레이어와 추측 디코딩을 위한 5개의 DSpark 드래프트 레이어 — 동일한 가중치, 동일한 벤치마크, 그리고 다른 모델이 아니라 더 빠른 디코딩을 위한 서빙 아티팩트.

DSpark는 LG의 것인가요, 아니면 Deep​Seek의 것인가요?

DSpark는 Deep​Seek의 오픈소스 추측 디코딩 방식으로, Deep​Seek-V4-Pro-DSpark 및 Deep​Seek-V4-Flash-DSpark에도 탑재되어 있습니다. LG는 현재까지 가장 주목할 만한 채택 사례이며, RadixArk의 Qw​en​3.8-2.4T-A95B-DSpark는 동일한 방식을 기반으로 구축된 두 번째 독립 드래프터입니다. LG의 모델 카드는 동일한 3–5배 속도 향상 범위를 주장합니다.

오늘 내 하드웨어에서 K-EXAONE-2.0-750B-A37B-DSpark를 실행할 수 있나요?

자가 호스팅만이 방법입니다: LG의 지침은 최소한 16개의 NVIDIA H200 GPU를 요구하며, vLLM, SGLang, Transformers의 표준 릴리스는 아직 아키텍처를 인식하지 못합니다. 이를 위해서는 병합되지 않은 포크나 대기 중인 일반 구성 경로가 필요합니다. #52197의 DSparkDraftModel 지원이 공유 경로에 가장 가깝지만, 여전히 열려 있는 풀 리퀘스트입니다.

이것이 주목할 만한 이유는 풀 리퀘스트 자체가 아니라 그것이 시사하는 바에 있다. 7,500억 개 파라미터 규모의 Apache-2.0 한국 주권 플래그십 모델이 Deep​Seek의 스펙큘레이티브 디코딩 스택을 탑재하기로 선택했고, 한 독립 인퍼런스 기업이 맥스급 Qw​en​3.8용 DSpark 드래프터를 구축했으며, vLLM은 모델별 패치 대신 범용 구성(config) 경로로 대응하고 있다. 이것이 바로 프런티어 오픈 모델이 현실이 되는 방식이다 — 가중치가 공개되는 순간이 아니라, 드래프터가 머지되는 순간에 말이다.