MiniCPM5-2B-DSpark용으로 생성된 히어로 타이틀 카드로, 부제는 "OpenBMB가 조용히 MiniCPM5-2B 가중치를 공개했다 — 그리고 실행 속도를 높이기 위해 작은 드래프트 모델도 출시했다"이다. 카드에는 각각 둥근 '2B' 칩을 표시하는 휴대폰과 노트북, 더 큰 칩에 일곱 개의 앞쪽 화살표 토큰을 공급하는 더 작은 'Draft 0.3B' 칩, 위쪽을 가리키는 바늘이 달린 속도 게이지, 음소거 벨 아이콘이 보이며, 오른쪽 하단 모서리에는 OrcaRouter 로고가 합성되어 있다.
Guides & Insights

MiniCPM5-2B-DSpark: OpenBMB, 속도에 최적화된 드래프트 모델과 함께 MiniCPM5-2B 가중치를 조용히 공개하다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

6주 전만 해도 MiniCPM5-2B는 하나의 약속이었다. 2026-07-19 상하이에서 열린 WAIC 컨퍼런스에서 Artificial Analysis Index 최상위에 오른 4B 미만 모델로 공개되었으며, 오픈 가중치가 "곧" 공개될 것이라는 로드맵 메모가 함께 전해졌다. 그 "곧"이 이번 주에 아무런 화려한 장식 없이 도래했다. 2026-09-06 OpenBMB는 플래그십 MiniCPM5-2B 저장소를 Apache-2.0 라이선스로 Hugging Face에 게시했고, 21분 후에는 MiniCPM5-2B-DSpark — DSpark 스페큘레이티브 디코딩 알고리즘 하에서 MiniCPM5-2B의 디코딩 속도를 높이는 것만을 목적으로 하는 3억 2,380만 파라미터 규모의 드래프트 체크포인트 — 를 게시했다. GPTQ 빌드는 2026-09-07에 이어졌다. 이 글을 쓰는 시점 기준으로 우리가 찾을 수 있는 발표문, 출시 게시물, 변경 로그 항목은 전무하다. 이번 릴리스는 11일간의 창(window)에 걸쳐 저장소가 조용히 공개되는 방식으로 표면화되었다.

이 글은 지금까지 알려진 사실을 정리한 기사이며, 여기서 중요한 것은 해당 모델을 어떻게 규정하느냐입니다. MiniCPM5-2B-DSpark는 독립형 챗봇도, 새로운 플래그십 모델도 아닙니다. 이는 가속기입니다. MiniCPM5-2B보다 먼저 토큰을 제안하면 MiniCPM5-2B가 그 토큰들을 병렬로 검증하는, 작고 빠른 모델이죠. 이 드래프트 모델은 대상 모델 없이는 쓸모가 없으며, 관심을 가져야 할 이유도 바로 그 대상 모델에 있습니다. OpenBMB가 7월에 약속한 MiniCPM5-2B 오픈 가중치 릴리스가 이제 실제로 Hugging Face에 올라왔고, 함께 공개된 드래프트 모델은 공급업체가 MiniCPM5-2B를 실용적인 속도로 실행하기 위해 권장하는 메커니즘입니다. 아래에서 출처를 명시적으로 밝히지 않은 모든 내용은 두 모델 카드와 해당 리포지토리에서 직접 읽은 것입니다.

무엇이 출시되었고, 언제였는가

2B 제품군은 사전 공지 없이 롤링 방식으로 공개되었으며, 최신 항목이 먼저 나옵니다:

• 2026-08-27 — MiniCPM5-2B-Base 및 MiniCPM5-2B-SFT 등장: 각각 사전학습 원본 체크포인트와 지도 미세조정 체크포인트.

• 2026-09-01 — MiniCPM5-2B-Midtrain, 에이전트형 중간 훈련 단계.

• 2026-09-05 — MiniCPM5-2B-MLX 및 MiniCPM5-2B-GGUF(Apple-Silicon 및 llama.cpp 포맷).

• 2026-09-06 — 플래그십 MiniCPM5-2B 저장소, 그리고 21분 후 MiniCPM5-2B-DSpark.

• 2026-09-07 — MiniCPM5-2B-GPTQ, 양자화된 서빙 포맷.

이들 모두는 지난 5월 ModelBest가 MiniCPM5-1B 패밀리에 사용했던 Apache-2.0 라이선스를 따릅니다. 앞서 공개된 체크포인트들은 여전히 사실상 커뮤니티 반응이 전무하며, 각각 다운로드와 좋아요가 손에 꼽을 정도뿐입니다. 이는 계획된 출시라기보다 진행 중인 가중치 공개(weight drop)의 신호입니다. 아티팩트들이 의존성 순서로 나타나고(베이스와 SFT가 먼저, 양자화 및 드래프트 형식이 마지막), 어느 특정한 날도 출시일 역할을 하지 않기 때문입니다.

MiniCPM5-2B-DSpark가 실제로 무엇인지

추측 디코딩(Speculative decoding)은 생성을 값싼 제안자와 값비싼 검증자로 나눈다. 작은 드래프트 모델이 다음 여러 토큰을 추측하고, 큰 모델은 단일 순방향 패스로 그 추측들을 모두 검사한 뒤 동의하는 것들을 수용한다. 드래프트가 잘 보정되어 있으면 큰 모델의 출력을 훨씬 적은 비용으로 얻을 수 있으며, 틀렸을 때는 검증 단계 하나만 낭비할 뿐이다. DSpark는 그러한 아이디어의 구체적인 레시피로, 2026-07-06에 게재된 논문(arXiv 2607.05147, "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation")에서 나왔다. 이를 구별 짓는 두 가지 설계 선택이 있다. 병렬 드래프터 백본을 경량 순차 모듈과 결합하여 제안된 블록 안의 토큰들이 서로 의존하게 함으로써 블록 끝으로 갈수록 정확도가 떨어지지 않게 한다는 점과, 각 요청에 대해 항상 고정 길이 블록을 검증하는 대신 신뢰도 추정치와 엔진 처리량에 따라 검증 실행의 크기를 조정한다는 점이다.

OpenBMB가 공개한 DSpark 드래프트 모델은 BF16 형식의 3억 2380만 매개변수(약 648MB)로 구성된 5계층 Transformer입니다. 이 모델은 Qwen3 아키텍처 제품군에 속하지만 DSpark 고유의 추가 요소들, 즉 대상 모델의 5개 계층(1, 10, 20, 30, 39)에서 MiniCPM5-2B의 은닉 상태를 읽는 프로젝터, 신뢰도 헤드, 그리고 다음 토큰 분포를 모델링하는 소형 Markov 헤드를 갖추고 있습니다. 이 구성은 순방향 패스당 7개의 토큰 블록을 제안합니다. MiniCPM5-2B의 25억 매개변수의 약 8분의 1에 해당하는 크기로, 주류 오픈 체크포인트용으로 출시된 드래프트 모델 중 가장 작은 축에 속합니다. 이는 엣지 지향 모델에서 핵심적인데, 드래프트 모델은 한 기기에서 두 모델을 함께 실행하는 것이 하나만 실행하는 것보다 여전히 나을 만큼 충분히 가벼워야 하기 때문입니다.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark, captured September 7, 2026, showing the OpenBMB org, the model name, the Apache-2.0 licence, tags including Transformers, Safetensors, text-generation, edge-ai and custom_code, the linked arxiv papers, the MiniCPM5 target reference, and the opening card line "MiniCPM5-2B-DSpark is a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer."

위 저장소는 초안 모델의 공개된 전체 범위입니다. README, 설정 파일, 단일 safetensors 파일, 그리고 훈련 설명에 MiniCPM5-2B가 일반·수학·코드 프롬프트에서 생성한 1,959,525개 시퀀스(7.05B 토큰)를 교차 엔트로피, L1, 신뢰도 목적 함수를 결합하여 6 에포크 동안 훈련했음을 보여주는 모델 카드가 포함되어 있습니다. 이 체크포인트는 단독으로 생성 모델로 사용되지 않습니다.

OpenBMB가 공개한 수치는 정직하게 표시되어 있다.

드래프트 모델의 카드에는 중요한 수치 하나가 보고됩니다. 바로 수용 길이(acceptance length), 즉 대상 모델이 7개 토큰 블록 각각에서 제안된 토큰 중 평균적으로 수용하는 개수입니다. 평가는 MiniCPM5-2B 출력을 대상으로 세 가지 도메인에서 최대 4,096개 생성 토큰까지 실행되었습니다.

• 수학 — 평균적으로 그리디(T=0)에서는 6.05개 토큰이 채택되었고, T=1.0 샘플링에서는 4.61개였다.

• Code — 6.11 그리디; 4.44 샘플링.

• 일반 — 4.16 그리디; 3.10 샘플링.

• 종합 — 그리디 5.52, 샘플링 4.05, 최대 7점 만점 기준.

해당 수치는 공급업체가 모델 카드에 보고한 값으로, 독립적으로 재현된 것이 아닙니다. 또한 이 수치는 드래프트 모델의 적중률을 설명할 뿐, 실측 시간(wall-clock) 기준 속도 향상을 의미하지 않습니다. 속도는 서빙 측정값으로, 드래프트 모델의 제안 패스 비용 대비 타깃 모델의 검증 패스 비용, 배치 점유율, 그리고 DSpark의 신뢰도 스케줄러가 검증 길이를 줄이는 방식에 따라 달라집니다. OpenBMB는 이 조합에 대한 초당 토큰 수치를 공개하지 않았습니다. 이 방법의 성능 상한이 어디쯤인지 가늠해 보면, DSpark 논문은 DeepSeek의 라이브 서빙 시스템에서 MTP-1 기준선 대비 동일 처리량에서 사용자당 생성 속도가 60~85% 더 빠르다고 보고합니다. 이는 해당 알고리즘이 다른 환경에서 어떤 성과를 냈는지 보여주는 유용한 참고 자료일 뿐, 사용자 하드웨어에서 MiniCPM5-2B에 대한 주장은 아닙니다.

A generated single-column scoreboard for MiniCPM5-2B-DSpark listing Draft params 323.8M, 5 layers; Draft tokens per forward pass 7; Target model MiniCPM5-2B, 42 layers; Greedy acceptance length 5.52 of 7; Confidence + Markov heads enabled; License Apache-2.0, with the footer "Acceptance figures from OpenBMB's model card; not independently reproduced" and the OrcaRouter logo composited in the bottom-right corner.

위 스코어보드는 릴리스 자체의 사양 시트입니다. 승인 수치는 초안 적중률로 해석하십시오. 실제 처리량에 대한 배수는 독립적인 SGLang 실행이 여전히 측정해야 할 부분입니다.

초안이 가속화하는 모델

MiniCPM5-2B는 25억(2.5B) 개 파라미터를 가진 덴스(dense) 트랜스포머로, 총 파라미터 수는 2,516,756,480개이며, 42개 레이어, 16개 쿼리 헤드와 2개 KV 헤드, 130,560개 토큰 어휘, 131,072개 토큰 컨텍스트 창을 갖추고 있다. BF16 기준 약 5GB 용량이다. 아키텍처 측면에서 이 모델은 의도적으로 평범하다. 커스텀 커널도 없고 모델 코드 포크도 없는 표준 LlamaForCausalLM 구조로, 바로 그렇기 때문에 수많은 런타임과 칩 타깃으로 쉽게 포팅된다. OpenBMB 자체 내부 벤치마크 스위트에서 모델 카드는 추론, 지시 수행, 지식, 긴 컨텍스트, 도구 사용, 코딩 및 검색 에이전트 작업 전반에 걸쳐 평균 53.9점을 기록했다고 밝힌다. 이는 같은 표에서 51.1점을 기록한 Qwen3.5-4B와 42.7점을 기록한 granite-4.2-3B보다 높은 수치다. 다만 여러 셀(GPQA-Diamond 70.2, HLE 8.9, 그리고 여러 긴 컨텍스트 및 에이전트 관련 행)은 자체 재현이 아니라 Artificial Analysis에서 가져온 것으로 표시되어 있다. 주요 과제별 점수로는 MATH-500 94.6, AIME 2025 및 2026 86.5, IFEval 86.7, MMLU-Pro 70.8, SWE-bench Verified 46.4 등이 있다. 이 수치들은 벤더가 자체 스위트에서 측정한 값이며, 모델 카드는 일부 행이 제3자 출처임을 명확히 밝히고 있다. 따라서 이렇게 혼합된 수치를 그에 맞게 해석해야 한다.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B, captured September 7, 2026, showing the OpenBMB org, the model name, the Apache-2.0 licence, tags including Transformers, Safetensors, English, Chinese, long-context, tool-calling and edge-ai, the arxiv links, and the opening Highlights line "We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B."

7월 공개 당시 ModelBest의 출시 자료는 4B 파라미터 미만 모델 중 1위인 Artificial Analysis Index 17을 인용했으며, 7월 보도에서는 512K 토큰 윈도우를 언급했습니다. 실제로 출하된 체크포인트는 131,072 토큰의 컨텍스트로 구성되어 있습니다. 출시일 마케팅 수치와 출하된 구성이 불일치할 경우, 구성이 실제로 실행 가능한 것을 결정하는 수치이며, 그 차이는 마케팅 수치를 기준으로 장문 컨텍스트 워크로드를 계획하기 전에 알아두어야 할 가치가 있습니다.

MiniCPM5-2B를 자체 드래프트 모델과 함께 실행하기

의도된 경로는 SGLang입니다. SGLang은 v0.5.16부터 업스트림에서 DSpark 알고리즘을 지원해 왔으며, v0.5.16은 모델 카드가 요구하는 최소 버전입니다. 카드에 있는 전체 서빙 명령어는 다음과 같습니다:

python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7

탐욕적 디코딩(T=0)에서 DSpark 검증은 무손실입니다. 즉, 출력이 MiniCPM5-2B 단독 서빙 결과와 동일하므로 드래프트는 순수한 레이턴시 개선 수단입니다. 샘플링이 활성화된 경우 SGLang의 DSpark는 기본적으로 타깃 전용 샘플링을 사용하며, 선택적으로 거부 샘플링(rejection sampling)을 지원합니다. OpenBMB는 또한 일반적인 Transformers 로딩(transformers ≥ 5.6) 및 vLLM ≥ 0.21을 통한 타깃 단독 서빙을 문서화하고, 에이전트 워크로드를 위한 minicpm5 툴 호출 파서를 제공합니다. DSPARK 추측 경로는 구체적으로 SGLang의 기능입니다.

하드웨어 연산량이 엣지급 모델 쌍의 핵심 이야기입니다: MiniCPM5-2B는 BF16 기준 약 5GB, 여기에 드래프트 모델이 약 0.65GB를 차지합니다. 드래프트와 타깃 모델의 조합은 2B 단일 모델만으로도 실행 가능했던 모든 환경에서 무리 없이 동작하며, 이것이 바로 더 큰 두 번째 모델 대신 이렇게 작은 드래프트 모델을 탑재하는 이유입니다.

확인되지 않은 것은 무엇입니까?

• 우리가 찾을 수 있는 공지는 존재하지 않습니다 — OpenBMB나 ModelBest 블로그도, 영어나 중국어 소셜 게시물도 없습니다. "조용히 출시됐다"는 평가는 말 그대로이며, 유일한 공개 표면은 Hugging Face 컬렉션입니다.

• 독립적 평가는 없음. 초안의 수용 길이와 MiniCPM5-2B의 53.9 스위트 평균은 공급업체가 보고한 값이며 재현되지 않았음. AA로 표시된 셀은 제3자 데이터지만 스냅샷 값일 뿐, 이 정확한 가중치로 수행된 실행 결과가 아님.

• 우리가 찾을 수 있는 호스팅 API는 어디에도 없어서, 오늘날 이를 도입하려면 체크포인트를 직접 실행해야 한다. 공개를 보도한 7월 기사에서 약속된 ModelScope 미러는 작성 시점 기준으로는 확인되지 않았다.

• DSPARK 쌍에 대한 wall-clock 속도 향상 수치는 없다. 허용 길이 5.52는 강력한 적중률이지만, 특정 GPU에서 '몇 배 더 빠른지'는 OpenBMB가 공개하지 않은 수치다.

• 위의 컨텍스트 윈도우 모호성: 마케팅 자료는 512K라고 했지만, 출시된 구성은 131,072이며, 저장소에는 이 둘을 연결하는 어떤 것도 없습니다.

조용한 오픈웨이트 드롭이 스택에서 차지하는 위치

오늘날 MiniCPM5-2B를 정직하게 평가하자면, 그것은 하나의 베팅입니다. 공급업체가 발표한 수치는 화려하지만, 독립 실행 기록은 0건이고, 서빙 이력도 없으며, 실제 환경에서의 속도 향상이 측정되지 않은 드래프트 모델이기 때문입니다. {{1}}라우팅 레이어는 바로 그런 상황을 위해 존재합니다.{{/1}} 이미 호출 중인 호스팅 모델의 출력을 더 작은 오픈 모델의 출력으로 대체할 수 있는지 테스트하려는 팀은, 단일 API 하나로 그 비교를 실행할 수 있습니다. OrcaRouter는 마크업 없는 공급업체 정가로 200개 이상의 호스팅 모델을 제공하므로, 일주일간의 평가 환경을 마련하는 데 비용이 들지 않습니다. 게다가 자동 장애 조치 덕분에 며칠 전에 만든 체크포인트가 스스로를 증명하는 동안 프로덕션 경로를 볼모로 잡아 둘 필요도 없습니다. {{2}}그 어느 것도 MiniCPM5-2B가 어딘가에 호스팅되어야 한다는 것을 요구하지 않습니다.{{/2}} OrcaRouter는 자체 호스팅 2B 모델이 GPU를 쓸 가치가 있는지 결정하는 동안, 여러분이 이미 의존하고 있는 모델들을 지켜 주는 안전망입니다.

중요한 순서대로 살펴보면: 해당 쌍에 대한 실제 tokens-per-second를 보고하는 독립적인 SGLang DSPARK 실행이 첫 번째입니다. 수용 길이는 벤치마크라기보다 대리 지표이기 때문입니다. 두 번째는 릴리스가 최종본임을 확인하는 공식 발표 또는 ModelScope 미러이며, 세 번째는 MiniCPM5-2B를 채택하는 호스팅 제공업체입니다. 만약 제공업체가 나타난다면, 우리 쪽에서 지불하는 가격은 같은 날 기준으로 그 제공업체의 공식 가격표 그대로입니다. 그것이 패스스루(pass-through)의 의미이기 때문입니다. 그동안 드래프트 모델은 둘 중 더 흥미로운 산출물입니다. 대상 모델이 7개 중 5.5개 토큰을 수용하는 5계층 제안 모델은, 작은 엣지 모델이 작게 느껴지는 것과 같은 기기에서 더 큰 모델이 돌아가는 것처럼 느껴지는 것 사이의 차이를 만들어냅니다.