
MiniCPM5-2B-DSpark vs Qwen3-8B: 새로운 2.5B 온디바이스 스택 vs 오픈 웨이트 워크호스
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
모든 모델 비교 뒤에는 하드웨어 질문이 도사리고 있다. MiniCPM5-2B-DSpark와 Qwen3-8B의 비교는 바로 그 질문이 벤치마크 복장을 하고 나온 것이다. Qwen3-8B는 알리바바가 2025년 4월 공개한 오픈 웨이트(open-weights) 주력 모델로, 약 8.2B 규모의 덴스(dense) 파라미터, 119개 언어, 131K까지 확장 가능한 32K 기본 컨텍스트, 하이브리드 사고 모드, 그리고 16개월간 쌓인 커뮤니티 검증 이력을 갖추고 있다. MiniCPM5-2B-DSpark는 Qwen3-8B와 나란히 놓고 견줄 독립 모델이 아니다. 이는 ModelBest가 2026년 7월 19일 WAIC에서 발표한 온디바이스(on-device)용 덴스 2.52B 모델 MiniCPM5-2B를 가속할 목적으로, OpenBMB가 2026년 9월 6일 Hugging Face에 조용히 올린 323.8M 파라미터 규모의 DSpark 드래프트 체크포인트다. 둘을 나란히 놓고 보면 진짜 질문이 드러난다. 현재 8B 모델이 담당하는 워크로드를, 2B만 겨우 감당하는 하드웨어에서 돌려야 하는가? 그리고 무료 드래프트가 붙은 2.5B 모델이 그러한 전환을 택할 만큼 충분한가?
{{1}}대부분의 워크로드에서 짧은 대답은 아직 '아니다'이지만, 그 이유는 크기 격차가 시사하는 것보다 더 좁은 범위에 있으며, 8B로는 전혀 답할 수 없는 배포 유형이 하나 있다.{{/1}} {{2}}이 글의 모든 정량적 수치는 공급업체가 보고한 것이다 — MiniCPM의 수치는 재현되지 않은 ModelBest 자체 수치이고, Qwen3-8B의 수치는 커뮤니티 사용에 오랫동안 노출된 Alibaba의 수치이다 — 따라서 숫자보다 라벨이 더 중요하다.{{/2}}
기억 곡선상의 서로 다른 위치에 있는 두 모델
MiniCPM5-2B는 8B 크기의 1/3인 밀집형(dense) 인과 트랜스포머로, 42개 레이어, 그룹 쿼리 어텐션(grouped-query attention), Apache-2.0을 갖추고 있으며, 대형 모델이 닿을 수 없는 기기 등급, 즉 메모리 버스가 80억 개의 가중치로 질식해버리는 휴대폰·스마트 콕핏·소형 엣지 박스를 위해 만들어졌다. 출시 자료는 단순한 범용성보다 에이전트 작업과 긴 컨텍스트를 강조한다: 128K 네이티브 컨텍스트, 그리고 벤더에 따르면 2B급 오픈소스 SOTA라는 평균 53.9를 자체 평가 스위트에서 기록한다는 ModelBest의 주장 — 여기에는 벤더가 실행한 SWE-bench Verified 46.4가 포함되며, 이 점수는 독립적인 테스트에서도 유지된다면 2B로서는 놀라운 수치다. DSpark 드래프트는 작은 밀집 모델이 로딩은 빠르지만 생성은 느리다는 명백한 반론에 대한 처리량 차원의 답이다. 모든 토큰이 가중치를 메모리 버스를 통해 끌고 가야 하기 때문이다. 이 드래프트는 대상(target) 모델이 한 번에 최대 7개의 토큰을 검증하도록 제안한다. 저장소는 집계 기준 검증 단계당 그리디 수용(greedy acceptance)이 평균 5.52토큰, 코드에서는 6.11토큰이라고 보고한다. 그 숫자가 드래프트의 품질을 나타낼 뿐이며, 실제 속도 향상은 아직 측정되지 않았고 초당 토큰 수치도 공개된 바 없다.

위의 openbmb/MiniCPM5-2B-DSpark 카드는 조용한 9월 6일 릴리스의 전체 공개 표면입니다: 수용 길이를 보고하는 서빙 액세서리로, 발표도 없고 실제 시간 속도 향상도 없습니다.
Qwen3-8B는 3배 더 크고 16개월 더 오래된 동일한 아키텍처 제품군입니다. 그룹 쿼리 어텐션을 갖춘 밀집 인과 트랜스포머로, 36조 토큰의 다국어 코퍼스로 학습되었고, Apache-2.0 라이선스이며, 오픈 가중치 세계에서 가장 널리 자체 호스팅되고 서비스되는 8B 모델 중 하나입니다. 그 시그니처는 요청별로 사고를 켜거나 끌 수 있는 Qwen3 하이브리드 추론 모드이며, 그 프로필은 의도적으로 광범위합니다: MMLU 70점대 후반, 강력한 GSM8K 및 코딩 결과, 119개 언어. 실제 GPU 또는 강력한 엣지 박스가 필요합니다. 실용적인 양자화 수준에서는 수 기가바이트로 실행되어 중간급 카드 한 장으로 충분히 구동되지만 휴대폰에서는 구동되지 않습니다.

위의 Qwen3-8B에 대한 알리바바의 모델 카드는 기존 강자의 얼굴이다: 119개 언어에서 문서화되고 커뮤니티에서 검증된 16개월간의 행동 기록이다.
8B가 여전히 이기는 곳
체급을 한 단계 내리면 세 가지 구체적인 것을 포기하게 된다. 언어부터 보자: Qwen3-8B는 119개 언어를 지원한다. 반면 MiniCPM5-2B의 카드와 데이터셋은 영어와 중국어에 집중되어 있으며, 다국어 범위에 대한 주장은 없다. 언어의 긴 꼬리(long tail)를 서비스하는 제품에게 이는 유연한 벽이 아니라 단단한 벽이다. {{1}}둘째, 증거다: Qwen3-8B의 수치는 16개월 동안 검증되고, 양자화되고, 파인튜닝되었으며, 대규모로 서빙되어 왔다. 그 실패 모드는 알려져 있고, 양자화 버전도 존재하며, 생태계는 어디에나 있다. MiniCPM5-2B는 2026년 7월 출시 제품으로, 벤더가 운영하는 점수판에 의존하고 독립적인 재현 결과가 없으며, 초안도 하루밖에 되지 않았다.{{/1}} {{2}}셋째, 서빙 스택이다: 이미 Qwen3-8B와 연동되는 모든 것 — vLLM, SGLang, llama.cpp, 수천 개의 파인튠 — 은 성숙한 대상을 상대하는 반면, MiniCPM 초안은 추측 디코딩 엔진 빌드(SGLang의 DSPARK 알고리즘)를 요구하는데, 이는 저장소에 문서화되어 있지만 더 넓은 생태계에는 아직 흡수되지 않았다.{{/2}}
2B 스택이 유일한 선택지인 곳
해당 장치 클래스에서는 8B 모델이 아예 들어가지 않으므로 그런 논의는 무의미합니다. DRAM이 몇 기가바이트에 불과한 휴대폰이나 엣지 보드에서 Qwen3-8B는 MiniCPM5-2B와 경쟁조차 할 수 없습니다. 실용적인 속도로 배포하는 것이 애초에 불가능하기 때문입니다. 2B 스택이 존재하는 이유가 바로 이것이며, 초안 모델(draft)이 이번 릴리스에서 장식이 아니라 핵심 역할을 담당하는 이유도 바로 이것입니다. 추측 디코딩(speculative decoding)은 작은 실리콘에서 실행되는 소형 모델이 처하는 바로 그 밀집형 메모리 바운드(memory-bound) 영역에서 가장 효과적입니다. 즉, 컴팩트한 드래프터(drafter)가 블록을 제안하면 대상 모델이 한 번의 패스로 검증하고, 가중치 로딩 비용은 토큰당 한 번이 아니라 블록당 한 번만 지불하면 됩니다. DeepSeek 기원의 DSpark 방식(arXiv 2607.05147)은 고동시성 서빙 시스템용으로 설계되었지만, 그 메커니즘과 이 저장소의 수용률(acceptance) 수치는 제한된 하드웨어에서 인터랙티브하게 동작해야 하는 2B 모델에 적용할 수 있는 핵심 레버입니다. 다만 정직한 한계를 염두에 두시기 바랍니다. OpenBMB가 측정한 것은 드래프트의 수용률이지 속도 향상이 아니므로, 실제 목표 장치에서의 토큰/초(tokens-per-second) 개선 폭은 여전히 직접 측정해야 하는 몫입니다.
정직하게 표시된 스코어보드
• 출시 — MiniCPM5-2B: 2026년 7월 19일(발표됨); MiniCPM5-2B-DSpark: 2026년 9월 6일, 조용히 출시됨. Qwen3-8B: 2025년 4월, 발표됨.
• 크기 — MiniCPM5-2B: 2.52B dense + 324M 드래프트. Qwen3-8B: 약 8.2B dense.
컨텍스트 — MiniCPM5-2B: 네이티브 128K. Qwen3-8B: 네이티브 32K, YaRN 경유 131K.
• 지원 언어 — MiniCPM5-2B: 영어/중국어 중심. Qwen3-8B: 119개 언어.
• 추론 — MiniCPM5-2B: 실행 자료에 따른 하이브리드 고속/심층 모드. Qwen3-8B: 요청에 따라 사고 기능 켜기/끄기.
• 증거 — MiniCPM 수치는 ModelBest 카드의 주장입니다(자체 스위트에서 평균 53.9, 독립적인 실행 없음). Qwen3-8B 수치는 Alibaba가 보고한 것으로, 16개월 동안 커뮤니티에 노출되었습니다.

위의 스코어보드는 불일치를 정직하게 보여 줍니다. 열들은 공개된 Apache-2.0 라이선스를 제외한 거의 모든 면에서 차이가 나며, 배포 대상 기기 등급이 어느 열을 선택할 수 있는지조차 결정합니다.
라우팅의 현실
오늘날 두 모델 모두 OrcaRouter의 호스팅 카탈로그에는 등록되어 있지 않으므로, 이 비교는 전적으로 자체 호스팅 환경에서 이루어집니다. 그러나 바로 그 환경에서 라우팅 계층이 여전히 제 역할을 합니다. Qwen3-8B는 해당 공급업체와 여러 제3자 플랫폼에서 서비스되지만, MiniCPM5-2B와 그 드래프트 모델은 직접 실행해야 하는 대상입니다. 팀이 2.5B 스택이 8B 워크로드의 일부를 감당할 수 있는지 테스트하려 할 때, 되돌릴 수 있는 방법은 자동 장애 조치를 갖춘 단일 API를 통해 자체 호스팅된 MiniCPM5-2B-plus-draft SGLang 빌드를 테스트 경로로 지정하는 것입니다. 그러면 프로덕션 환경은 기존 모델에 유지되고, 새 스택이 중단되더라도 아무것도 다운되지 않으며, 공급업체의 표시 가격은 전체 비교 과정에서 0% 마크업으로 전달됩니다. 따라서 A/B 테스트는 도박이 아니라 저렴하고 되돌릴 수 있는 선택입니다. 라우팅 계층은 어떤 모델도 호스팅하지 않지만, 실험을 안전하게 실행할 수 있게 해줍니다.
누가 움직여야 하고, 누가 기다려야 할까요?
다국어 작업, 16개월간 검증된 동작이 필요한 작업, 또는 이미 8B를 무리 없이 구동하는 하드웨어에서 서비스 중인 워크로드에는 Qwen3-8B를 계속 사용하십시오. 크기 격차는 마이그레이션의 이유가 되지 않으며, 검증 데이터의 부족은 오히려 전환에 반대합니다. MiniCPM5-2B 스택과 DSpark 드래프트는 대상 기기가 8B를 전혀 구동할 수 없을 때만, 또는 이미 출시한 하드웨어에서 에이전트 및 장문 맥락 작업을 따라잡는 2.5B가 메모리와 전력 절감을 가능하게 할 때만 진지하게 테스트하십시오. 그리고 드래프트를 도입하기 전에 OpenBMB가 공개하지 않은 측정을 직접 실행하십시오. 수용 길이는 지연 시간이 아니며, 허깅페이스의 조용한 작은 체크포인트를 다운로드할 가치가 있었는지를 실제로 결정하는 수치는 여러분의 기기에서 측정된 초당 토큰 향상분입니다.
