MiniCPM5-2B-DSpark와 Granite 4.2 3B 비교를 위한 히어로 타이틀 카드로, 부제는 "작고 빠른 서빙을 위한 두 가지 조용한 Apache-2.0 릴리스"입니다. 나란히 놓인 두 개의 열린 판지 상자를 보여주며, 왼쪽 상자는 DSpark 초안이라는 라벨이 붙은 번개를 발산하고, 오른쪽 상자는 추론 모드라는 라벨이 붙은 기어를 표시합니다. 하단을 가로지르는 Apache-2.0 리본과 오른쪽 하단 모서리의 OrcaRouter 로고가 있습니다.
Guides & Insights

MiniCPM5-2B-DSpark vs Granite 4.2 3B: 작고 빠른 자체 호스팅 서빙을 위한, 조용히 공개된 Apache-2.0 모델 두 가지

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 8월과 9월 초에는 동일한 작업, 즉 직접 서비스하는 소형 모델을 겨냥한 두 건의 조용한 Apache-2.0 릴리스가 있었으며, 두 릴리스는 정반대 방향에서 접근했다. Granite 4.2 3B는 IBM의 노트북급 추론 모델로, 가중치는 8월 초 Hugging Face에 공개되었고 모델 카드와 기술 블로그는 2026년 8월 25일에 게재되었다. MiniCPM5-2B-DSpark는 같은 의미의 모델이 전혀 아니다. 이는 OpenBMB가 2026년 9월 6일에 아무런 발표 없이 게시한 323.8M 파라미터 DSpark 드래프트 체크포인트로, ModelBest가 2026년 7월 19일 WAIC에서 발표한 2.52B 밀집형 온디바이스 모델 MiniCPM5-2B가 추측적 디코딩을 통해 더 빠르게 토큰을 생성하도록 만들기 위해 구축되었다. 하나의 릴리스는 독립형 소형 추론 모델이고, 다른 하나는 소형 모델용 가속 액세서리다. 둘 다 Apache-2.0 아래에 있으며, 둘 다 자체 호스팅 전용이고, 어느 쪽도 아직 독립적인 벤치마크를 거치지 않았다.

마케팅 레이어를 걷어 내면 팀이 직면하는 실질적인 질문은 명확하다. 2026년 말의 소규모 자체 호스팅 서빙 워크로드에서 IBM의 3B 추론 전문 모델을 쓸 것인가, 아니면 무료 드래프트를 얹은 ModelBest의 2B 에이전트 중심 스택을 쓸 것인가이다. 두 벤더의 사양서가 암시하는 것보다 실제 근거는 빈약하다. 그래서 이 글은 출시 사실, 실제로 존재하는 유일한 동일 스위트 수치, 그리고 선택을 좌우해야 할 워크로드 차이를 살펴본다.

두 가지 릴리스, 무엇을 알 수 있는가

Granite 4.2 3B는 IBM의 가장 작은 추론 모델로, Granite-4.1-3B-Base에서 사후 훈련되었습니다. 이 모델은 밀집(dense) 구조이며 텍스트 전용입니다. 40개의 레이어, 그룹화된 쿼리 어텐션(grouped-query attention), 128K 기본 컨텍스트(다섯 번째 사전 훈련 단계에서 512K로 확장)를 갖추고 있으며, 세 가지 추론 모드(기본 전체 사고, 저노력 모드, 비추론 경로)를 지원합니다. IBM의 카드에는 3B가 더 큰 Granite 4.2 형제 모델들이 받은 에이전틱 강화 학습 블록을 의도적으로 건너뛰었다고 명시되어 있습니다. 따라서 SWE-Bench 결과가 없으며 에이전트 모델이 아닌 추론 모델입니다. vLLM, SGLang, Transformers, GGUF, Ollama(granite4.2:3b)를 통해 제공되며, 호스팅 API는 없습니다. 헤드라인 카드 수치인 AIME 2025에서 78.33, GPQA 54.80, LiveCodeBench v6에서 69.71은 공급업체가 보고한 것으로, 현재까지 재현되지 않았습니다.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b (reused from a published sibling) showing the Model Overview with the 3B dense decoder-only architecture, 128K native context extending to 512K, and the Apache-2.0 license.

{{1}}위의 ibm-granite/granite-4.2-3b 카드는 해당 릴리스의 공개적인 얼굴입니다: 추론 튜닝된 3B 모델로, 긴 컨텍스트 스토리를 갖추고 있으며 에이전트 기능에 대한 주장은 없습니다.{{/1}}

반면, MiniCPM5-2B-DSpark는 오직 대상(target)을 위해서만 존재한다. 드래프트는 총 323,776,001개 파라미터의 5개 full-attention 레이어로 구성되며, 포워드 패스당 후보 토큰 7개의 블록 크기를 갖는다. 그리고 MiniCPM5-2B가 생성한 70.5억 개의 응답 토큰으로 6 에폭 동안 훈련되었다. 해당 저장소(repo)는 수락 길이(acceptance length)를 보고한다. 즉, greedy 디코딩 기준 전체 평균 검증 단계당 5.52개의 수락 토큰, 코드에서는 6.11개이다. 그러나 초당 토큰 수(tokens per second)는 보고하지 않는다. 드래프트가 가속하는 대상 모델인 MiniCPM5-2B는 더 흥미로운 제품이다. 이는 2.52B 밀집(dense) 모델, 42레이어, 128K 컨텍스트를 갖춘 모델로, 출시 자료는 에이전트 역량을 강조한다 — ModelBest의 7월 발표에 따르면 200B 규모의 에이전트 중간 훈련(agent mid-training), 대규모 에이전트 SFT 세트, 에이전트 RL 정렬을 포함 — 또한 네이티브 롱 컨텍스트와 하이브리드 고속/심사숙고(fast/deliberate) 모드를 갖추고 있다. ModelBest 자체 비교 스위트에서 이 대상 모델은 동급 오픈 모델 대비 평균 53.9점을 기록한다. 이 모든 수치는 벤더(vendor)가 제공한 값이다.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

위의 openbmb/MiniCPM5-2B-DSpark 카드가 이번 릴리스의 전부입니다: 모델 카드, config, Safetensors 파일 하나뿐이며, 공지사항은 없습니다.

동일 스위트 내에서 존재하는 유일한 비교

벤더 간 점수 비교는 대부분 사과와 오렌지를 비교하는 격이지만, Granite 4.2 3B와 MiniCPM5-2B가 함께 측정된 곳이 하나 있다. 바로 ModelBest가 MiniCPM5-2B용으로 공개한 자체 평가표인데, 여기에는 베이스라인 중 하나로 granite-4.2-3B가 포함되어 있다. 그 평가 세트에서 MiniCPM5-2B는 평균 53.9점을, Granite 4.2 3B는 42.7점을 기록했다. 그 숫자는 정확히 있는 그대로 읽어야 한다. 즉, 한 벤더가 자사 모델을 돋보이게 하려고 선택한 단일 평가 세트에서 두 모델을 직접 실행한 결과이며, 재현된 것도 아니다. 이는 결코 최종 판정이 아니다. 다만 이 표가 알려주는 것은 ModelBest가 경쟁사의 3B 모델을 성능표에 올릴 만큼 자신감이 있었다는 점이고, 자사가 주장하는 격차가 가장 큰 부분은 정확히 자체 훈련이 집중된 곳, 즉 긴 문맥(long-context)과 에이전트(agentic) 관련 항목이라는 점이다. 이를 하나의 방향성 주장으로 받아들이고, 자신의 데이터로 검증한 다음, IBM이 별도 성능표에서 내세우는 주장까지 저울질한 후에 어떤 결정을 내려도 늦지 않다.

정직하게 표시된 스코어보드

• 출시 모델 — MiniCPM5-2B-DSpark: MiniCPM5-2B(2.52B 밀집 타깃)용 324M 드래프트로, 단독 실행 모델이 아닙니다. Granite 4.2 3B: 단독 실행 가능한 약 3B 규모의 밀집 추론 모델입니다.

• 역할 — MiniCPM5-2B 스택: ModelBest에 따르면 온디바이스 에이전트 및 도구 사용에 중점. Granite 4.2 3B: 추론 전문가로서 의도적으로 비에이전트적.

• 컨텍스트 — MiniCPM5-2B: 기본 128K. Granite 4.2 3B: 기본 128K, 512K까지 확장 가능.

• 가속 — MiniCPM5-2B-DSpark: 외부 DSpark 드래프트, 패스당 7개 토큰, 단계당 그리디 수용 약 5.5(리포지토리 보고 기준). Granite 4.2 3B: 이번 릴리스에는 포함된 것 없음.

• 라이선스 — 둘 다 Apache-2.0.

● 근거 — MiniCPM 수치는 ModelBest 카드의 주장입니다(해당 제품군: 53.9 대 Granite 42.7). Granite 수치는 IBM 카드의 주장입니다(AIME 2025 78.33, GPQA 54.80). 어느 쪽에 대한 독립적 실행도 존재하지 않습니다.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Granite 4.2 3B: left column MiniCPM5-2B-DSpark with What it is: 324M draft + 2.52B dense target, on-device agent and tool-use role, 128K native context, DSpark acceleration at 7 tokens per pass, Apache-2.0 license, and own-suite average 53.9; right column Granite 4.2 3B with a standalone ~3B dense reasoning model, non-agentic role, 128K native / 512K extended context, no shipped acceleration, Apache-2.0 license, and AIME 2025 78.33 / GPQA 54.80, with a footer reading All figures vendor-reported; no independent run of either and the OrcaRouter logo in the bottom-right corner.

위의 스코어보드는 본문과 동일한 출처를 사용합니다. 즉, 스코어보드의 모든 수치는 업체가 보고한 것이며, 동일한 스위트(suite)에서 두 업체 중 어느 쪽이든 게시한 수치는 ModelBest 자신의 수치가 유일합니다.

모든 벤치마크를 능가하는 차이

점수를 매기기 전에, 워크로드에 필요한 소형 모델의 종류를 결정하세요. 두 릴리스가 서로 다른 질문에 답하기 때문입니다. Granite 4.2 3B는 제한된 하드웨어에서의 추론과 긴 컨텍스트를 위해 설계되었습니다. 512K까지 확장되는 128K 네이티브 윈도우, 세 가지 쿼리별 사고 모드, 랩톱에서 실행되는 풋프린트, 그리고 에이전트 훈련을 건너뛰기로 한 명시적 결정을 갖추고 있습니다. {{1}}작업이 긴 문서 분석, 저장소 규모의 컨텍스트, 또는 소형 장비에서의 안정적인 추론이라면, 이 모델이 적합합니다.{{/1}} MiniCPM5-2B는 반대의 초점으로 설계되었습니다. 즉, 기기 내 에이전트 동작과 도구 사용입니다. {{2}}초안이 존재한다는 사실 자체가 ModelBest가 이 타깃을 대화형으로 서비스할 것으로 예상하고 초당 토큰 수를 되찾고자 한다는 신호입니다.{{/2}} 작업이 도구를 호출하고 긴 대화를 유지하는 온디바이스 에이전트 루프라면, 바로 그 용도에 맞춰진 스택이 이것입니다.

이 초안은 Granite 릴리스가 다루지 않는 방식으로 그 두 번째 선택의 경제성을 변화시킵니다. MiniCPM5-2B는 덴스(dense) 모델이며, 추측적 디코딩은 바로 그 덴스하고 메모리 바운드(memory-bound)인 영역에서 가장 큰 효과를 발휘합니다. 즉, 작은 고정 모델이 약간 더 큰 고정 모델에 토큰을 제안하는 구조입니다. 약 5GB 타깃에 대략 650MB의 BF16 가중치를 추가하는 외부 드래프터는, 문서화된 SGLang 서빙 경로와 검증 단계당 약 5.5개 토큰의 그리디 수용률을 갖추고 있어, 단일 요청 동시성으로 서빙하는 모델에 있어 신뢰할 만한 처리량 레버입니다. 그러나 한계는 피할 수 없습니다. OpenBMB는 종단 간 속도 향상을 발표하지 않았으므로, 이 레버는 보정되지 않은 상태입니다. IBM은 이번 릴리스의 일부로 Granite 4.2 3B용 동급 외부 드래프터를 제공하지 않습니다. 따라서 이를 덴스 모델로 실행하게 되며, 속도 측면의 장점은 단순히 3B가 작다는 것뿐입니다.

누가 어떤 것을 운영해야 하는가

• 워크로드가 노트북급 장비에서의 장문맥 추론(문서, 리포지토리, 심층 단일 스레드 분석)이고, 완전히 제어할 수 있는 Apache-2.0 모델에서 세 가지 사고 모드와 512K 상한을 원한다면 Granite 4.2 3B를 실행하세요. 단, 에이전틱 트레이닝이 없고 호스팅 API도 없다는 점은 감수하세요.

• 워크로드가 대화형 도구 호출 온디바이스 에이전트이고 대상 모델이 메모리 예산에 맞으며 드래프트가 되찾아 줄 수 있는 처리량을 원한다면, MiniCPM5-2B 스택을 DSpark 드래프트와 함께 실행하세요. 자체 SGLang 빌드에서 드래프트의 실제 속도 향상을 측정할 시간을 확보하세요. 해당 수치는 공개된 적이 없기 때문입니다.

• 정말 확신이 없다면 둘 다 라우팅 계층 뒤에서 실행하세요. 현재 어느 모델도 호스팅 카탈로그에 없습니다(OrcaRouter 포함). 둘 다 자체 호스팅 방식입니다. 하지만 자동 장애 조치가 있는 라우터를 자체 엔드포인트 앞에 두면, 프로덕션은 검증된 스택에 유지하면서 새 드래프트 스택은 테스트 경로에 배치할 수 있습니다. 그리고 그 주변 호스팅 모델에 대한 0% 마크업 전가 덕분에 A/B 비교 비용이 저렴하게 유지됩니다. 핵심은 되돌릴 수 있다는 점입니다. 모델 이름을 교체하고 측정한 다음, 하루 전 체크포인트가 멈추면 다시 되돌리면 됩니다.

다음에 볼 콘텐츠

이 대결을 어떤 의견보다도 빨리 판가름할 두 가지가 있다. 첫째, MiniCPM5-2B를 독립적으로 실행해 53.9 평균과 에이전트(agentic) 관련 주장을 확증하거나 반증하는 일이다. SWE-Bench 스타일 과제에서 그런 점수를 낸 2B 모델이 나온다면, 온디바이스(On-Device) 클래스로서는 정말 새로운 데이터 포인트가 될 것이다. 둘째, IBM 자체 추론 모델의 수치가 커뮤니티의 재현 검증을 통과하는 일이다. 3B 모델의 AIME 2025 78.33 기록은 다른 누군가가 다시 실행하면 변동하기 쉬운 종류의 주장이다. 그중 하나가 확인되기 전까지의 정직한 입장은 이렇다. Granite 4.2 3B는 오늘날 더 안전하고 문서화도 더 잘 된 소형 모델이며, MiniCPM5-2B 스택은 더 흥미로운 베팅이다. 주장이 사실이라면 온디바이스에서 더 빠른 에이전트가 될 테지만, 그 성과를 공급업체 스스로조차 아직 측정하지 못한 드래프트(draft)를 동반하고 있기 때문이다.