
MiniCPM5-2B-DSpark vs Gemma 4 12B: 두 가지 초안 작성 방식, 로컬 AI의 두 체급
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniCPM5-2B-DSpark와 Gemma 4 12B가 같은 맥락에서 다뤄져야 하는 이유를 가장 빠르게 이해하려면, 일단 크기는 무시하고 각각이 문장을 쓰는 방식을 지켜보면 된다. 둘 다 드래프터(drafter)로 메모리 버스를 아낀다. 작은 모델이 여러 개의 다음 토큰을 한 번에 제안하면 실제 모델이 그 블록을 한 번에 검증하는 방식이라, 실리콘은 토큰당 한 번이 아니라 블록당 한 번만 가중치 로딩 비용을 지불한다. MiniCPM5-2B-DSpark는 OpenBMB가 2026년 9월 6일 Hugging Face에 조용히 공개한 드래프트다. ModelBest가 2026년 7월 19일 WAIC에서 발표한 덴스(dense) 2.52B 온디바이스 모델 MiniCPM5-2B를 가속하는 323.8M 파라미터의 동반 체크포인트다. Gemma 4 12B는 Google의 11.95B 인코더 없는 멀티모달 범용 모델로, 2026년 6월 3일 출시됐으며 자체 내장 드래프터와 256K 컨텍스트를 갖췄다. 전자는 드래프터를 사용자가 직접 로드하는 별도의 Apache-2.0 체크포인트로 제공하고, 후자는 그와 비슷한 기법을 그냥 실행하기만 하면 되는 단일 대형 모델 내부에 숨겨 둔다.
이 글의 골격을 결정짓는 솔직한 고지: MiniCPM5-2B-DSpark는 프롬프트를 넣을 수 있는 모델이 아닙니다. 토크나이저도, 채팅 템플릿도, 단독 출력도 없습니다. model.safetensors, config, README만을 나열하는 카드일 뿐이죠. 이는 2B급 타깃을 위한 서빙 레이어 부속물입니다. 독자가 실제로 비교하는 것은 두 로컬 AI 가중치 계층 사이입니다. 즉, 토큰을 생성하는 스마트폰 크기 2B 스택과, 토큰을 생성하는 16GB 12B 범용 모델 사이 말입니다. 아래의 모든 내용은 바로 그 선택을 구체화한 것입니다.
MiniCPM5-2B-DSpark가 실제로 무엇인지
모델 카드는 릴리스의 공개 표면 전체이므로, 이를 통해 알 수 있는 내용은 다음과 같습니다. MiniCPM5-2B-DSpark는 DSpark 드래프트 체크포인트입니다. 즉, 5개의 전체 어텐션 레이어, 323,776,001개의 파라미터, 16개의 쿼리 헤드와 2개의 KV 헤드를 가진 grouped-query attention, 그리고 블록 크기 7을 가지며, 포워드 패스당 최대 7개의 후보 토큰을 제안하여 MiniCPM5-2B 대상이 검증하도록 합니다. config는 DSparkDraftModel auto-map이 포함된 Qwen3DSparkModel 아키텍처를 선언하며, DSpark 방식(arXiv 2607.05147, 2026년 7월의 DeepSeek 논문)의 신뢰도 헤드와 마르코프 헤드가 여전히 활성화된 상태로 제공됩니다 — 즉, 접미사를 확인할 가치가 없는 시점을 판단하는 부하 인식 검증기입니다. 이 모델은 일반, 수학, 코드 프롬프트에 대한 MiniCPM5-2B 생성 응답들로 이루어진 70억 5천만 개의 토큰으로 6에폭 동안 학습되었습니다.

위의 openbmb/MiniCPM5-2B-DSpark 카드가 공개된 것의 전부입니다: 모델 카드, config, Safetensors 파일 하나뿐이며, 발표도, 블로그 게시물도, 보도자료도 없었습니다 — 이 글을 쓰는 시점 기준 하루 전의 조용한 가중치 공개였습니다.
모델 카드에 담기지 않은 내용은 담긴 내용만큼 중요하다. 이 카드는 수용 길이(acceptance length)를 보고한다. 저장소 자체 평가에 따르면, greedy decoding에서 검증 단계당 평균 5.52개의 토큰이 수용되었고, 7-토큰 상한 기준으로 수학은 6.05, 코드는 6.11이다. 그러나 실측 시간(wall-clock) 속도 향상, 초당 토큰 수, 독립적인 벤치마크 결과는 공개하지 않는다. 문서화된 서빙 경로는 SGLang의 DSPARK 엔진이며, 드래프트 모델은 타깃 모델인 MiniCPM5-2B 옆에 로드된다. 다시 말해, 드래프트의 품질은 정량화되었지만 그 성과는 아직 정량화되지 않았다. 이를 도입하려는 사람은 믿기 전에 먼저 측정해야 한다.
Gemma 4 12B가 상대편에 가져다주는 것
Gemma 4 12B는 Google Gemma 4 제품군의 중간 자식이자, 로컬 AI 곡선에서 완전히 다른 지점에 위치한 모델입니다. 별도의 인코더 없이 텍스트, 이미지, 오디오, 비디오를 입력으로 받는 하나의 조밀한(dense) 11.95B 모델이며, 기본으로 도구 호출을 따르고, 네이티브 256K 컨텍스트를 멀티 토큰 예측 드래프터와 결합합니다. 이 드래프터는 내부적으로 동일한 메모리 버스 트릭을 제공하지만, 체크포인트 내부에서 처리되므로 사용자가 다운로드하거나 연결할 추가 요소가 없습니다. Apache 2.0 라이선스로 배포되며, 실제로 16GB 랩톱에서 실행됩니다. 또한 Google의 전폭적인 지원 체계와 함께 출시되었습니다. 출시 평가, 기본 및 명령 변형에 대한 모델 카드, Model Garden, LM Studio, Ollama에 걸친 에코시스템 지원이 그것입니다. 이 모델에는 수개월간의 커뮤니티 배포 경험이 쌓여 있는데, 하루밖에 안 된 MiniCPM 초안에는 그런 이력이 없습니다.

위의 Gemma 4 12B에 대한 Google의 모델 카드는 한 프레임 속 대비를 보여 줍니다. 성숙한 멀티모달 종합 모델로서, 그 드래프터들은 별도의 저장소가 아닌 릴리스의 한 특징으로 제공됩니다.
정직하게 표기된 사양
출처를 염두에 두고 이 수치들을 읽으십시오: MiniCPM5-2B 수치는 ModelBest 카드의 주장이며, 재현되지 않았습니다; Gemma 4 12B 수치는 Google 자체 수치로, 커뮤니티 사용에 오랫동안 노출되어 왔습니다.
• 실행 대상 — MiniCPM5-2B-DSpark: MiniCPM5-2B(2.52B dense, 42개 레이어) 옆에서만 사용되는 324M 드래프트. Gemma 4 12B: 단독 실행되는 11.95B dense 모델.
• 컨텍스트 — MiniCPM5-2B 목표: 128K 네이티브. Gemma 4 12B: 256K 네이티브.
• 모달리티 — MiniCPM5-2B 스택: 텍스트 전용. Gemma 4 12B: 텍스트, 이미지, 오디오, 비디오 입력, 인코더 프리.
• 드래프팅 — MiniCPM5-2B-DSpark: 외부 DSpark 드래프트, 패스당 7개 토큰, SGLang DSPARK 엔진. Gemma 4 12B: 내부 다중 토큰 예측 드래프터, 설치 불필요.
• 풋프린트 — MiniCPM5-2B는 BF16 기준 약 5GB에 ~650MB 드래프트 파일이 추가되며, Gemma 4 12B는 BF16 기준 약 18GB로 양자화 시 16GB급 하드웨어에서 실용적입니다.
• 근거 — MiniCPM5-2DSpark: 저장소 승인 길이 수치뿐이며 하루 전 자료임. Gemma 4 12B: 출시 평가 및 수개월간의 커뮤니티 배포 실적이 있음.

위 점수판은 여섯 줄로 된 동일한 초상화입니다. 두 열은 거의 모든 것에 대해 의견이 다르지만, 둘 다 빠르게 쓰기 위해 사용하는 전략만은 예외입니다.
실제로 가진 실리콘에 맞는 체급은 무엇입니까?
MiniCPM5-2B-DSpark는 모델이 아니므로, 의미 있는 분기점은 대상 모델의 가중치 클래스와 Gemma 4 12B의 가중치 클래스의 대비에 있다. 그리고 그 분기점은 대체로 하드웨어 문제다. DRAM이 수 기가바이트에 불과한 휴대폰, 스마트 콕핏 보드, 또는 소형 엣지 박스는 11.95B 모델을 실용적인 속도로 구동할 수 없다. 메모리 버스가 바로 그 모델을 질식시키는 병목 지점이기 때문이다. MiniCPM5-2B 스택이 설계된 세계가 바로 그런 환경이다. 즉, 가중치가 온디바이스 메모리에 들어맞는 덴스 2B 모델에 드래프트를 결합해, 소형 덴스 모델이 어쩔 수 없이 내주는 초당 토큰 수를 일부 되찾는 구조다. 추측 디코딩은 정확히 이런 덴스이면서 메모리 바운드인 영역에서 가장 효과적이며, 그래서 드래프트는 이번 릴리스에서 단순한 장식이 아니라 흥미로운 핵심이다.
{{1}}Gemma 4 12B는 한 체급 위의 답입니다.{{/1}} {{2}}시스템 메모리가 16GB 이상이라면 — 노트북, 워크스테이션, 사양이 넉넉한 엣지 서버 등 — 멀티모달 제너럴리스트를 구동할 수 있고, 2B 스택이 제공하지 못하는 세 가지를 얻게 됩니다: 인코더나 두 번째 파이프라인 없이 처리되는 이미지·오디오·비디오 입력, 리포지토리 규모나 문서 규모의 작업을 위한 256K 윈도우, 그리고 하루 된 초안 체크포인트가 애초에 갖지 못한 성숙도입니다.{{/2}} {{3}}가장 작은 기기에서 실행할 수 있는 능력을 포기하고, 메모리 사용량이 약 세 배로 늘어나는 비용을 치르게 됩니다.{{/3}}
두 경우 모두의 라우팅 현실
이 비교의 양쪽 모두 현재 호스팅 카탈로그에 등록되어 있지 않으며, OrcaRouter도 마찬가지입니다. MiniCPM5-2B-DSpark는 정의상 자체 호스팅 서빙 액세서리입니다. SGLang 스택을 직접 실행해야 하며, 드래프트는 로컬 배포 환경에만 존재합니다. Gemma 4 12B는 오픈 가중치 모델이므로 직접 서빙하거나 이미 제공되는 곳에서 사용하면 됩니다. 라우팅 계층이 전달 메커니즘이 아니라 안전망으로서 제 역할을 하는 상황이 정확히 이 경우입니다. 이미 서빙 중인 워크로드에 새로운 드래프트 빌드를 시험 적용할 때, 자동 장애 조치를 갖춘 단일 API로 테스트 경로를 지정하면 검증되지 않은 스택이 중단되어도 프로덕션이 다운되지 않습니다. 그리고 주변 제공업체의 목록 가격은 0% 마크업으로 그대로 전달되므로 비교 대상이 되는 호스팅 모델의 가격 변경도 같은 날 바로 반영됩니다. 다만 비교 자체를 놓고 보면 두 모델 모두에게 정직한 방법은 동일합니다. 자체 호스팅을 하고 있으므로, 중요한 벤치마크는 자신의 하드웨어에서 직접 실행하는 것입니다.
평결
MiniCPM5-2B-DSpark와 Gemma 4 12B는 어떤 의미에서도 정면 대결 구도의 경쟁자가 아닙니다. 이 둘은 우연히 같은 기법을 공유하는 로컬 AI의 서로 다른 체급입니다. 기기가 12B 모델을 감당할 수 없고, 온디바이스 메모리에 들어맞는 텍스트 처리·Apache-2.0·에이전트 지향 모델이 필요하다면 DSpark 드래프트가 포함된 MiniCPM5-2B 스택을 선택하십시오. 드래프트는 유망한 무료 가속이지만, 그 효과는 아직 정량화되지 않았으므로 신뢰하기 전에 직접 구축한 SGLang 빌드에서 측정해 보십시오. 하드웨어에 여유가 있고 256K 윈도우와 생태계가 뒷받침되는 하나의 멀티모달 모델을 원한다면 Gemma 4 12B를 선택하십시오. 문제는 어느 모델이 더 똑똑한가가 아니라, 당신의 실리콘이 실제로 어느 모델을 구동할 수 있느냐입니다.
