
A.X K2 DSpark vs A.X K2: 초안 전용 모델이 실제로 가져다주는 것
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
A.X K2 DSpark와 A.X K2를 비교하는 것에서 가장 이상한 점은 그것이 실제로는 비교가 아니라는 것입니다. A.X K2 DSpark는 A.X K2를 대신해 사용될 수 없습니다. 단독으로는 전혀 사용할 수 없습니다. 그것은 SK Telecom이 8월 초에 아무 발표 없이 조용히 Hugging Face에 올린 '드래프터 전용 체크포인트'입니다. 추측 디코딩(speculative decoding)용 드래프트 모델로서, 그 전체 임무는 회사의 6,880억 파라미터 오픈 가중치 Mixture-of-Experts 플래그십인 A.X K2가 답변은 그대로 둔 채 토큰을 더 빠르게 생성하도록 만드는 것입니다. 따라서 이 대결에서 중요한 진짜 질문은 '어느 것이 더 나은가'가 아닙니다. 'DSpark를 사용해 A.X K2를 실행할 것인가, 아니면 사용하지 않을 것인가'입니다. 이 글의 모든 내용은 출처별로 표시되어 있습니다. 저장소가 알려주는 것과 실제로 측정된 것 사이의 간격이 바로 이 이야기의 전부이기 때문입니다.
A.X K2 DSpark가 실제로 무엇인지
SK Telecom의 모델 카드는 이 모델이 무엇을 위한 것인지에 대해 이례적으로 솔직하다. A.X K2 DSpark는 "A.X K2를 위한 DSpark 추측 디코딩 드래프트 모델"이며 "드래프터 전용 체크포인트: 단독으로는 사용처가 없으며 추측 디코딩을 통해 A.X K2와 함께 vLLM에 로드되도록 설계되었다." 실제로는 모델을 다운로드하여 호환되는 vLLM이 A.X K2와 함께 이를 가리키게 하면, 두 모델이 팀으로 작동한다: DSpark가 후보 토큰을 제안하고, A.X K2가 이를 검증하며, 검증된 토큰만 출력된다.
두 가지 초안 메커니즘의 세부 사항은 저장소에서 확인할 수 있습니다. 첫째, {{1}}DSpark는 토큰을 하나씩 초안 시퀀스로 작성하는 대신 여러 후보 토큰을 병렬로 제안하며, A.X K2 자체의 은닉 표현과 가벼운 로컬 의존성 모델링을 활용합니다{{/1}}. 둘째, 전체 구조는 무손실을 지향합니다: {{2}}모든 후보는 커밋되기 전에 대상 모델에 의해 검증되므로, A.X K2의 출력 분포는 설계상 변경되지 않습니다{{/2}}.
이번 릴리스 자체는 사전 공지입니다. 카드에는 모델이 "현재 최종 검증 중이며 며칠 내 공개 릴리스될 예정"이라고 명시되어 있고, 평가는 "현재 진행 중"입니다. 카드의 모든 처리량(throughput), TPOT 및 평균 허용 길이(mean-accepted-length) 지표는 여전히 TBD로 표시되어 있습니다.
이 'versus'가 실제로는 'with versus without'인 이유
A.X K2 DSpark는 단독으로 사용되는 경우가 없으므로, A.X K2 대신 그것을 선택할 상황은 없습니다. 선택은 A.X K2 단독과 드래프트 모델이 부착된 A.X K2 사이에서 이루어집니다. 출력 품질 측면에서 두 구성은 구조적으로 동일하며, 변동될 수 있는 유일한 축은 디코딩 속도입니다.
참고로 A.X K2가 무엇인지 설명하면: 총 6,880억(688B) 파라미터 중 330억(33B)만 활성화되는 Mixture-of-Experts 디코더로, 256개 전문가와 1개 공유 전문가(순방향 패스당 8개 활성), 61개 레이어, 64개 어텐션 헤드, 163,840개 토큰 어휘를 갖추고 있으며, 7월 29일 Apache 2.0 라이선스로 오픈 가중치가 공개되었습니다. 약 8.2조 개 토큰으로 MXFP8 네이티브 방식으로 사전 학습되었고, 긴 컨텍스트 효율성을 위해 SK텔레콤의 Sparse Gated Attention을 사용하며, 262,144개 토큰 컨텍스트(네이티브 128K를 YaRN으로 256K까지 확장)를 지원합니다. SK텔레콤은 14개 벤치마크에서 A.X K1 대비 평균 +32.2%포인트, 장문 컨텍스트 및 에이전트 평가에서 약 83.9포인트 향상을 보고했습니다. 이 모든 수치는 공급업체가 보고한 것이며, 독립적인 종합 점수는 아직 발표되지 않았습니다.
DSpark는 그 아키텍처에 맞춰 특별히 설계되었습니다. 카드에는 A.X K2의 MoE 구조, attention 레이아웃, 그리고 기본 256K 구성에 맞춰져 있으며 다른 대상에 대해서는 검증되지 않았다고 명시되어 있습니다. 동일한 262,144-토큰 컨텍스트를 상속하므로, 실행 시 윈도우 크기에 대한 추가 비용이 들지 않습니다.

모델 카드 읽기: 알 수 있지만 아직 확인되지 않음
리포지토리는 모델이 무엇인지에 대한 명확한 그림을 제공하며, 알려주지 않는 사항에 대한 간단한 목록도 제공합니다.
오늘 알 수 있는 것:
• 단독으로 사용되지 않는 드래프터 전용 체크포인트로, vLLM이 speculative decoding을 통해 A.X K2와 함께 로드합니다.
• 라이선스는 Apache 2.0이며, 가중치는 무료로 다운로드하여 사용할 수 있습니다.
• 컨텍스트 길이는 262,144개 토큰으로 A.X K2와 동일합니다.
• SK Telecom의 vLLM 포크(SKT-AI/vllm 저장소, axk2-v0.23.0 브랜치)를 통해 --speculative-config 플래그를 사용하여 실행됩니다.
• 이 방법은 "DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation" (arXiv:2607.05147, 2026년 7월 6일 제출)이라는 논문에 기술되어 있습니다 — 이 논문은 또한 인용된 속도 향상 수치의 출처이기도 합니다.
• 현재 어떤 추론 제공업체도 이를 배포하지 않으므로, 호출할 수 있는 호스팅 API가 없습니다.
아직 확인되지 않음:
• 공식 발표 — 해당 카드는 "며칠 내" 공개 출시를 약속하고 있습니다.
• A.X K2 특화 속도 향상 수치. 평가가 진행 중이며 모든 성능 지표는 TBD입니다.
• 부하 상태에서 실제로 얼마나 도움이 되는지, 카드에서는 이를 "workload-dependent"로 표시한다.
• 초안 모델에 대한 독립적인 제3자 측정.

DSpark가 일반적인 추측 디코딩과 어떻게 다른가
투기적 디코딩은 잘 알려진 기법입니다. 작고 빠른 드래프트 모델이 다음 몇 개의 토큰에 대한 추측을 작성하면, 큰 모델이 단일 순방향 패스로 전체 추측을 검증하고, 검증을 통과한 접두사를 수용한 뒤 하나의 교정 단계를 수행합니다. 제대로 활용하면 품질 손실 없이 지연 시간을 극적으로 줄일 수 있습니다.
DSpark 논문이 지적하듯, 문제는 최근의 병렬 드래프터(parallel drafter)가 한 번에 긴 시퀀스를 제안하지만, 드래프트에서 뒤쪽에 있는 토큰은 앞쪽 토큰에 대한 의존성이 없어 거부되는 경우가 훨씬 많다는 '빠른 수용 감쇠(rapid acceptance decay)'를 겪는다는 점이다. 또한 긴 블록을 무작정 검증하면 거부될 가능성이 높은 토큰에 배치 용량을 낭비하게 되며, 이는 정확히 동시성이 높은 서빙 시스템에서 처리량(throughput)을 떨어뜨린다.
DSpark는 두 문제를 모두 공략합니다:
• 반자기회귀적 드래프팅. 병렬 백본을 경량 순차 모듈과 결합하여 블록 내 의존성 모델링을 추가함으로써, 이후의 드래프트 토큰이 이전 토큰에 의존하도록 한다 — 이것이 접미사 붕괴를 완화하는 핵심이다.
• 신뢰도 기반 검증. 고정된 블록 길이를 검증하는 대신, 추정된 접두어 생존 확률과 엔진의 처리량 프로필을 기반으로 요청별 검증 길이를 맞춤 조정합니다. 이로써 검증은 부하를 인지하게 됩니다.
논문의 숫자들 — 그리고 그것들이 말해주지 않는 것
여기 인용될 수치가 있습니다: DSpark는 MTP-1 생산 기준선 대비 동일한 처리량 수준에서 "사용자별 생성 속도를 60~85% 가속화합니다." 또한 논문은 오프라인 벤치마크에서 최첨단 자기회귀 및 병렬 드래프터와 비교하여 수용 길이가 상당히 개선되었음을 보고하며, 엄격한 상호작용 제약 조건에서 심각한 처리량 저하를 방지한다고 말합니다.
세부 조항을 잘 읽어 보세요. 이 특정 매치업에서는 중요하니까요. 그 60~85% 수치는 DeepSeek-V4의 서빙 시스템에서 실사용자 트래픽 하에 측정된 값이지, A.X K2에서 측정된 것이 아닙니다. 이는 다른 모델 스택에 배포된 DSpark 방법에 대한 주장입니다. 반면 A.X K2 DSpark 카드는 아직 속도 향상 수치가 전혀 없습니다. 따라서 이 조합에 대한 정직한 성적표는 다음과 같습니다. 설계상 동일한 출력, 그리고 그 방법의 논문이 가능성이 있다고 시사하지만 SK Telecom 자체가 이 초안 체크포인트가 대상으로 하는 모델에서는 아직 측정하지 않은 속도 향상입니다.

실제로 실행하는 데 필요한 것
대부분의 사람들이 좌절하는 지점이 바로 전제 조건입니다: A.X K2를 자체 호스팅해야 합니다. 대상 모델에는 호스팅 API가 없습니다. 오픈 가중치 모델이며, 688B/33B 활성 MoE를 서빙하는 것은 상당한 인프라 구축 부담을 요구합니다. DSpark는 이미 그러한 부담을 감수한 팀에게만 의미가 있습니다.
이미 있다면, 드래프트 모델을 추가하는 데 드는 한계 비용은 적습니다:
• Apache 2.0 초안 체크포인트를 다운로드하고 SK Telecom의 vLLM 포크(axk2-v0.23.0 브랜치)를 실행하세요.
--speculative-config 플래그를 통해 추측 디코딩을 활성화하고, 이를 DSpark 체크포인트를 가리키도록 지정합니다.
• 드래프트 가중치를 위해 추가 메모리를 예산에 반영하고, 이제 스톡이 아닌 vLLM의 벤더 포크를 사용하고 있다는 점을 받아들이세요 — 유지 관리 고려 사항입니다.
• 논문 자체의 경고, 즉 검증은 공짜가 아니라는 점을 기억하라: 높은 동시성 하에서 부주의한 검증은 배치 용량을 잡아먹으며, 이는 바로 신뢰도 기반 일정 조정 검증(confidence-scheduled verification)이 관리하도록 설계된 실패 모드이다.
한 가지 더 알아둘 점: Hugging Face는 이 모델의 다운로드가 "추적되지 않는다"고 보고하므로, 실제로 몇 팀이 사용해 봤는지에 대한 공개적인 신호는 없다.
누가 어떤 것을 골라야 하나요
다음 중 하나라도 해당한다면 기본 A.X K2를 실행하세요.
표준 vLLM을 실행 중이고 경로에 두 번째 체크포인트나 벤더 포크를 원하지 않는 경우.
워크로드가 처리량(throughput)에 의해 제약되지만 지연 시간(latency)에는 제약을 받지 않으며, 사용자들은 긴 생성 시간을 기다리는 것을 용인합니다.
공식 출시와 첫 독립 측정치를 기다리는 편이 낫다.
이것이 당신이라면 A.X K2 및 DSpark를 실행하세요:
• A.X K2를 자체 호스팅하는 경우, 생성 지연 시간이나 토큰 처리량이 문제가 됩니다.
• 긴 컨텍스트와 에이전트 기반 워크로드는 사용자들이 긴 출력을 기다리게 만든다 — 추측 디코딩(speculative decoding)이 설계된 바로 그 상황이다.
단점이 제한적인 사전 공지 구성 요소를 실행하는 데 부담이 없어야 합니다. 최악의 경우 도움이 되지 않을 뿐이며, 출력 품질을 변경할 수 없습니다.
688B MoE를 전혀 자체 호스팅하지 않는다면 둘 다 선택하지 마세요. A.X K2의 주권과 한국어 강점은 직접 실행해야만 얻을 수 있고, 많은 팀은 대신 호스팅 카탈로그를 통해 최첨단 오픈 모델에 닿으려 할 것입니다. 바로 그런 상황에서 통합을 모델에 구애받지 않게 유지하는 것이 효과를 발휘합니다. OrcaRouter의 단일 OpenAI 호환 엔드포인트는 200개 이상의 모델을 프로바이더 정가에 0% 마크업으로 제공하며, 자동 장애 조치와 여러 모델을 하나의 호출로 묶는 라우팅 DSL을 지원합니다. (현재 A.X K2와 A.X K2 DSpark 모두 어디에도 호스팅되어 있지 않습니다 — OrcaRouter에서도 마찬가지입니다 — 따라서 이는 이 두 모델을 라우팅하는 문제가 아니라 나머지 스택에 관한 것입니다.) 이러한 자세는 그대로 적용됩니다. 검증되지 않은 모델은 트래픽의 일부에만 적용해 보고 자동으로 장애 조치하세요. 프로덕션 경로를 그 모델에 걸지 마세요.
다음에 볼 콘텐츠
현재 상황은 간단합니다. 저장소는 실제로 존재하고, 방법론은 문서화되어 있지만, 측정값은 그렇지 않습니다. 주목해야 할 세 가지는 약속된 공개 릴리스(카드에는 "며칠 내"라고 적혀 있음), SK Telecom의 평가가 끝난 후 공개될 첫 A.X K2 전용 처리량 또는 지연 시간 수치, 그리고 어떤 추론 제공업체가 이 조합을 채택하는지 여부입니다. 후자가 바로 자체 호스팅을 하지 않는 팀에게 DSpark가 의미를 갖게 만드는 부분입니다.
자주 묻는 질문
A.X K2 DSpark가 A.X K2를 대체할 수 있나요?
아니요. 그것은 독립 실행용이 없는 드래프터 전용 체크포인트입니다. A.X K2 디코딩을 더 빠르게 만들기 위해 존재하는 것이지, 그 대안이 아닙니다. A.X K2 없이 A.X K2 DSpark를 실행할 수 없습니다.
DSpark가 A.X K2의 출력 품질을 변경합니까?
{{1}}아니요, 구조적으로 그렇습니다.{{/1}} 모든 후보 토큰은 커밋되기 전에 {{2}}A.X K2{{/2}}에 의해 검증되므로 출력 분포는 변경되지 않습니다 — 카드는 이 접근 방식을 무손실이라고 설명합니다.
DSpark를 사용하려면 A.X K2를 자체 호스팅해야 하나요?
네, DSpark는 A.X K2와 함께 vLLM에 의해 로드됩니다. 그래서 688B 타겟을 실행하지 않는 한 초안을 작성할 대상이 없습니다. 현재 두 모델 모두 호스팅된 API가 없습니다.
DSpark는 다른 모델과도 작동하나요?
SK Telecom은 A.X K2의 MoE 아키텍처, 어텐션 구조 및 256K 컨텍스트를 위해 이를 설계했으며, 다른 어떤 대상에 대해서도 검증하지 않았습니다.
평결
A.X K2 DSpark vs A.X K2는 "vs" 대결이며, 정직한 답은 "둘 다"입니다. 이미 A.X K2를 운영 중이고 사용자들이 긴 생성 시간을 기다린다면, 드래프트 모델은 무료이고 위험 부담이 적은 실험입니다: Apache 2.0 가중치, 최악의 경우에도 속도 향상이 없으며, 설계상 품질 저하가 불가능합니다. 지연 시간에 민감하지 않거나 애초에 688B MoE를 자체 호스팅하지 않는다면, SK Telecom의 평가 수치가 나오고 약속된 공개 출시로 모델이 공식화될 때까지 안전하게 무시해도 됩니다. 하지 말아야 할 일은 논문의 60–85% 수치를 이 모델의 측정 결과로 오해하는 것입니다. 현재 A.X K2의 DSpark 관련 모든 것은 여전히 미정(TBD)입니다.
