
MiniCPM5-2B 웨이트 공개: Sub-4B 정상을 차지한 소형 모델이 오픈소스로 풀렸다
- openaiNEWOpenAI: GPT-6 Astra2026-09-0455지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0247지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0247지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0157지능82코딩
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2646지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1849지능75코딩
- obsidianQwen3.8 27B2026-08-1541지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1251지능77코딩
- metaMeta: Muse Spark 1.22026-08-0547지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0347지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2140지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128지능49코딩
모델 자체는 7주 된 모델이다. MiniCPM5-2B는 7월 19일 2026 세계 인공지능 콘퍼런스에서 공개되었으며, 당시 ModelBest와 OpenBMB는 이를 Artificial Analysis의 리더보드에서 4B 파라미터 미만 모델 중 1위라고 밝히며 가중치를 "머지않아" 공개하겠다고 약속했다. 이번 주말에 일어난 일은, 그 '머지않아'가 어떤 출시 이벤트도 없이 도래했다는 것이다. MiniCPM5-2B 저장소는 9월 6일 Hugging Face에 게시되었고, OpenBMB의 변경 로그는 9월 7일 릴리스로 기록하고 있으며, Apache-2.0 라이선스 하에 BF16 가중치, GGUF, MLX 및 GPTQ 양자화, 베이스 및 SFT 체크포인트, 추론 가속을 위한 DSpark 드래프트 모델, 그리고 그 뒤에 있는 학습 데이터셋까지 전체 패키지가 포함되어 있다.
보도자료도 없었고 출시 행사도 없었다. 그냥 나타났다. 어느 날은 Hugging Face 저장소, 다음 날은 변경 로그 한 줄이었다. 그래서 이 글은 지금까지 알려진 것만 정리한 내용이며, 초기 업데이트 하나가 포함되어 있다. 저장소는 많은 것을 알려준다. 모델은 실제로 다운로드 가능하고 오늘 바로 실행할 수 있으며, 사양표도 공개되어 있다. 게다가 외부 평가 지표도 이미 나왔다. Artificial Analysis는 MiniCPM5-2B를 Intelligence Index v4.2에서 15점으로 등재했다. 이 지수에서 총 파라미터 4B 미만 모델 중 최고 오픈 가중치 결과이므로, 4B 미만 순위는 더 이상 공급업체의 말만으로 결정되지 않는다. 아직 확인되지 않은 것은 모델 카드의 주요 수치다. OpenBMB가 자체 하네스에서 재현했지만, 실험실 밖에서는 아무도 재실행하지 않았다. 여기에 저장소에서 알 수 있는 것, 현재 독립적으로 측정된 것, 그리고 이를 기반으로 작업하기 전에 검증이 필요한 것을 정리했다.
방금 무슨 일이 있었어?
MiniCPM5-2B는 OpenBMB가 5월 19일에 오픈소스로 공개한 MiniCPM5-1B에 이은 MiniCPM5 시리즈의 두 번째 모델이다. 2B가 WAIC에서 제품으로 출시되었을 때, 그 이야기는 모델에 관한 이야기만큼이나 칩에 관한 이야기이기도 했다. ModelBest는 이를 휴대폰, PC, 스마트 콕핏을 위한 온디바이스 에이전트 베이스로 포지셔닝했고, FlagOS 커뮤니티를 통해 화웨이 Ascend부터 NVIDIA, 그리고 다양한 국산 가속기에 이르기까지 총 9개 칩에 대한 출시 당일 지원을 명시했다. 오픈소스 공개는 임박한 것으로 예고되었다. 그러나 7주가 흘렀다.
9월 6일에 openbmb/MiniCPM5-2B 저장소가 나타났습니다. 이 글을 작성하는 시점에서 모델 카드는 릴리스 공지사항이며, 조용한 공개치고는 이례적으로 완전합니다.
• 가중치 — BF16으로 제공되는 최종 RL + OPD 사후 학습 체크포인트로, Apache-2.0 라이선스이고 게이팅되지 않아 누구나 다운로드할 수 있습니다.
• 동반 체크포인트 — RL/OPD 이전의 모델을 원하는 사용자를 위한 MiniCPM5-2B-SFT, -Midtrain 및 -Base, 그리고 -GGUF, -MLX, -GPTQ 및 -DSpark 드래프트 모델까지 모두 Hugging Face의 MiniCPM5 컬렉션에 나열되어 있습니다.
• 데이터 — 훈련 코퍼스도 공개되어 있으며, UltraData 계열의 일부로 출시되었습니다: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 및 UltraData-RL-2609.
• 미러 — README가 Hugging Face와 ModelScope 양쪽을 가리킵니다.
카드의 한 줄이 보기보다 더 중요하다: "커스텀 커널 없음, 모델 코드 포크 없음." MiniCPM5-2B는 표준 LlamaForCausalLM 아키텍처를 사용하므로, 이미 Llama 계열 모델을 서빙하는 엔진이라면 맞춤형 구현을 기다릴 필요 없이 로드할 수 있다.
2.5B 모델이 다시 주목할 만한 이유
WAIC 피치는 순위를 겨냥한 피치였다. ModelBest는 MiniCPM5-2B가 출시 당시 AA 리더보드의 4B 파라미터 미만 모델 중 1위를 차지하며 Artificial Analysis Intelligence Index에서 17점을 기록했다고 밝혔다. 그 숫자 옆에는 두 가지 주의사항이 따라붙는다. 첫째, 지수 점수는 동일한 방법론 버전 내에서만 비교 가능하다. MiniCPM5-1B의 이전 17.9점은 이전 AA 스냅샷에서 나온 것이므로, 더 작은 모델이 "더 높은 점수를 받는다"는 증거가 되지 않는다. 같은 원칙에 따라, 새로운 방법론에서의 새로운 점수는 성능 하락으로 볼 수 없다. 둘째, AA의 수치가 모델 카드에 반영되지만, 카드의 주요 평균은 OpenBMB 자체의 것이며 OpenBMB 자체의 하네스로 재현된 것이다. 이 구분이 중요한 이유는 AA가 이후 더 새로운 방법론으로 전환하고 새로운 점수를 발표했기 때문이다. 이는 오픈 웨이트 공개 이후 이 피치에 대한 첫 번째 외부 검증이다.
모델 가중치가 공개된 그 주, 외부 수치 하나가 도착했다. 9월 4일, Artificial Analysis가 Intelligence Index v4.2를 출시했다. 이번 방법론 개정은 비공개 보류(held-out) 테스트의 가중치를 40%로 높이고, 새 구성 요소 두 가지, 즉 에이전틱(agentic) 평가인 AA-Briefcase와 장문 맥락 문서 추론 과제인 Surge의 GDP.pdf를 추가한다. AA 인덱스에서 MiniCPM5-2B 항목은 이제 v4.2 기준 15점을 기록한다. 이는 총 파라미터 4B 미만의 오픈 웨이트 모델 중 최고 점수이며, AA 목록에서 해당 크기 등급의 오픈 모델 47개 중 1위다. 그 결과 모델은 7월 발표가 내세운 자리에 그대로 있는데, 이번에는 조작하기 더 어려운 방법론과 누구나 다운로드해 다시 확인할 수 있는 가중치를 바탕으로 한 것이다. 15점은 v4.1에서 나온 출시 당시의 17점과 비교할 수 없다. 방법론이 더 엄격해진 것이지 모델이 약해진 것이 아니며, 합성 지수는 모델 카드의 개별 행을 재검증하지 않는다. 그중 대부분은 OpenBMB가 자체 하네스에서 재현한 결과다. 이 지수가 실제로 보여주는 것은 OpenBMB가 최적화했다고 밝힌 두 축에 부합한다는 점이다. v4.2는 에이전틱 과제에 더 큰 비중을 두며, AA의 장황도(verbosity) 추적에 따르면 MiniCPM5-2B는 인덱스 과제 전반에서 5,700만 개의 출력 토큰을 생성해 중앙값 7,200만 개와 비교했을 때 해당 클래스에서 가장 간결한 모델이다. OpenBMB는 AA의 평가 실행에 감사를 표하며 정확히 그런 표현으로 의미를 규정했다. 즉 2.6B에서 에이전틱 성능과 토큰 효율성이 이 모델이 최적화된 부분이라는 것이다.
핵심 주장은 작은 패키지에 에이전트 역량을 담아냈다는 것이다. 네이티브 도구 호출, 딥서치, 코드 생성이 처음부터 학습에 포함됐지 나중에 덧붙여진 기능이 아니라는 이야기다. 모델 카드가 설명하는 파이프라인은 3단계다. 기본 학습(base training), 중간 학습(mid-training), 그리고 후속 학습(post-training)으로 이어진다. 후속 학습 단계에서는 400B 토큰의 심층 사고 데이터로 SFT를 수행하고, 전문화된 RL 교사 모델과 온폴리시 증류(On-Policy Distillation, OPD)를 적용한다. OPD는 16개 RL 전문가 모델(그중 5개는 에이전트형)을 하나의 소형 덴스 네트워크로 병합한다. OpenBMB는 RL+OPD 단계 덕분에 추론 및 일반 과제에서 평균 10.96포인트, 에이전트 과제에서 6.96포인트가 개선됐다고 밝힌다. 내부 평가 기준의 개선 폭이지만, 이 수치는 이 모델의 독특한 구조를 설명해 준다. 2.5B 파라미터 네트워크를 추론 모델처럼 설계하고 도구 사용에 초점을 맞춘 모델이라는 뜻이다.

저장소가 실제로 포함하는 내용
사양 시트는 구성 파일 그 자체이므로 명확하다. MiniCPM5-2B는 총 2,516,756,480개의 파라미터를 가지며, 그중 1,981,982,720개는 비임베딩 파라미터다. 벤더들이 "2B급"이라고 말할 때는 바로 그 비임베딩 수치를 기준으로 한다. 이는 42개 레이어와 은닉 크기 2048을 가진 밀집 트랜스포머로, 16개 쿼리 헤드와 단 2개 KV 헤드로 구성된 그룹 쿼리 어텐션, 130,560개의 어휘, BF16 텐서를 사용한다. 전체 모델은 단일 safetensors 샤드로 제공되며, 노트북 연결로 내려받기에 충분히 작고, 단일 중급 GPU나 폰급 NPU에서 실행할 수 있다.
• 파라미터 — 총 2,516,756,480개; 임베딩 제외 1,981,982,720개
• 아키텍처 — dense LlamaForCausalLM, 42개 레이어, hidden 2048, GQA 16개 query 헤드 / 2개 KV 헤드, vocab 130,560.
• 컨텍스트 — 131,072개 토큰으로 구성됨(max_position_embeddings), 설정에 RoPE 스케일링 없음.
• 라이선스 — Apache-2.0, 모델과 공개된 학습 데이터 모두에 적용됩니다.
• 형식 — BF16; GGUF, MLX 및 GPTQ 동반 버전은 별도로 게시됩니다.

7월 덱의 숫자 하나는 체크포인트에 나타나지 않습니다. WAIC 자료에서는 512K-토큰 컨텍스트 윈도우를 강조했지만, 릴리스된 구성에서는 `max_position_embeddings`가 `rope_scaling` 항목 없이 131,072(128K)로 설정되어 있습니다. 512K 수치는 여러 소형 모델이 컨텍스트를 확장하는 방식처럼 추론 시 확장을 통해 도달하려는 의도일 가능성이 있습니다. 그러나 출시된 저장소는 131,072로 문서화되어 있으며, OpenBMB가 확장 레시피를 공개하기 전까지는 그 숫자를 기준으로 설계해야 합니다.
측정한 사람별로 정렬된 숫자들
모델 카드는 출처(provenance)를 신중하게 다루며, 각주를 읽을 만한 가치가 있다. 모델 카드가 † 표시로 구분한 점수는 '공식 Artificial Analysis 릴리스'에서 가져온 것으로, GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6, GDPval-AA v2 19.6 등의 행이 이에 해당한다. 그 외의 모든 것은 '내부적으로 재현(reproduced internally)'한 것으로 설명되어 있으며, 이는 OpenBMB가 자체 하네스에서 해당 평가(eval)를 실행했음을 의미한다. 이 범주에는 특히 눈길을 끄는 수치들이 포함되는데, 카드의 비교 세트 전체에 대한 내부 평균 53.9, AIME 2025/2026 86.5, MATH-500 94.6, LiveCodeBench v6 69.1, SWE-bench Verified 46.4, BFCL v4 66.6, τ²-Bench Telecom 97.1, GAIA(Text-103) 88.7, MMLU-Pro 70.8 등이다.
이 숫자들을 정직하게 읽게 만드는 세 가지가 있다. 53.9 평균은 절대 점수가 아니라 상대 점수다. 카드가 각 레이더 축을 정규화해 비교 대상 중 최고 모델이 100점을 받게 하기 때문이다. 비교 세트는 벤더가 선정했는데, Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B, LFM2.5-8B-A1B 등 다른 2B-4B 오픈 모델들이 포함된다. 그 세트 안에서 카드는 MiniCPM5-2B가 차선인 Qwen3.5-4B(51.1)를 여유 있게 누르는 모습을 보여 준다. 절반 크기 모델로서는 정말 놀라운 결과이고, 누군가 그 결과 위에 무언가를 세우기 전에 독립적인 재현이 필요한 바로 그런 결과다. 그리고 개별 행 몇 개는 마케팅 문구와 맞아떨어지기 어렵다. 2.5B dense 모델이 기록한 SWE-bench Verified 46.4는 재현된다면 대단한 수치인 반면, HLE 8.9는 'sub-4B 리더'와 '프런티어'가 다른 리그라는 점을 상기시킨다. 이 중 어느 것도 저장소와 모순되지 않는다. 이후 AA의 v4.2 종합 점수도 이 모델이 sub-4B 오픈 가중치 클래스 최상단에 있다는 전반적 위치를 확인해 주었다. 다만 이 특정 행들은 OpenBMB 자체가 만든 것으로, 여전히 연구실 외부의 누구도 검증하지 못했다.
오늘 MiniCPM5-2B를 실행합니다.
아키텍처가 순수한 Llama이므로, 주류 엔진들이 이를 직접 로드한다. OpenBMB의 README는 vLLM(0.21 이상), SGLang(0.5.16 이상), Transformers(5.6 이상)에 대한 빠른 시작 가이드를 제공하며, 온도 1.0과 top-p 0.95에서 샘플링하고, 추론 패스가 필요할 때 enable_thinking을 켜는 것을 권장한다. GGUF 및 MLX 동반 파일은 llama.cpp, Ollama, LM Studio, Apple Silicon을 지원하며, 카드에는 ArcLight 런타임과 일반적인 미세 조정 스택(TRL + PEFT, LLaMA-Factory, ms-swift, unsloth)도 나열되어 있다.
시작하기 전에 알아두면 좋을 배포 관련 세부 사항 두 가지가 있습니다. 도구 및 함수 호출에는 SGLang이 권장 백엔드입니다. 모델이 XML 스타일의 도구 호출을 생성하면, SGLang에 내장된 minicpm5 파서가 이를 OpenAI 호환 tool_calls로 네이티브 변환하므로 표준 도구 호출 클라이언트는 커스텀 shim 없이도 동작합니다. 또한 DSpark 드래프트 모델은 추론 패스 비용을 낮추기 위해 만들어졌습니다. 이 모델을 SGLang에서 DSPARK 추측 디코딩 알고리즘과 함께 실행하면 대상 모델의 출력은 그대로 유지하면서 디코딩 속도를 높일 수 있습니다. 이는 노트북에서 128K 컨텍스트 에이전트 루프가 실사용 가능한지, 아니면 그저 돌아가기만 하는지가 갈리는 핵심 요소입니다.

모델 하나를 손수 튜닝하는 대신 {{1}}소규모 오픈 모델 배치{{/1}}를 평가하고 싶다면, 여기서 라우팅 계층이 진가를 발휘합니다. 제공업체가 MiniCPM5-2B를 등재했을 때, 라우터는 추가 통합 없이도 같은 태스크에서 MiniCPM5-2B를 Qwen3.5-2B 및 그 밖의 4B 미만 오픈 체크포인트와 A/B 테스트할 수 있게 해 주는 저렴한 방법입니다. OrcaRouter에서 이는 하나의 API로 200개 이상의 모델에 접근하고, 제공업체 공시 가격을 0% 마크업으로 그대로 전달하며, 새로운 체크포인트가 프로덕션 경로에서 멈추거나 루프에 빠지면 자동 장애 조치가 수행된다는 뜻입니다. 이 레포는 공개된 지 겨우 이틀밖에 안 되었고, 저희가 안내할 수 있는 호스팅 API 중 MiniCPM5-2B를 등재한 곳은 아직 없습니다. 따라서 오늘날 정직한 기본값은 MiniCPM5-2B를 의존성이 아니라 자체 호스팅 실험으로 취급하는 것입니다.
누가 이 무게들을 당겨야 하나요?
오늘 당장 받아보세요. 여러분의 작업이 온디바이스 에이전트, 엣지 툴 호출, 또는 소형 모델 코딩·추론 실험에 해당하고, 시장에서 가장 공격적으로 훈련된 2B급 옵션을 원한다면 말이죠. Apache-2.0 라이선스와 공개된 훈련 데이터 덕분에 대부분의 팀이 중국 연구소의 소형 모델을 주저하게 만드는 두 가지 이유가 사라집니다. 상업적 사용 제한이 없다는 점, 그리고 블랙박스 말뭉치가 아니라는 점입니다. 반면, 벤치마크 표의 수치만 믿고 프로덕션 모델을 고르려 한다면 경계하며 받아들이세요. 그 카드의 핵심 행들은 OpenBMB 자체 재현 결과이며, 현재까지 유일한 외부 측정인 AA의 v4.2 종합 점수는 이를 보증하지 않습니다. 보고에 따르면 Qwen3.5-4B를 능가한다는 2.5B 모델의 주장은, 직접 SWE-bench를 재현하는 데 걸리는 두 시간을 투자할 가치가 있습니다.
다음에 지켜볼 것. 이 레포지토리는 나온 지 겨우 이틀밖에 안 됐으므로, 단기적 신호는 여전히 기계적인 수준이다. llama.cpp와 Ollama 라이브러리가 GGUF를 지원하게 될지, ModelScope 미러와 FlagOS 칩 빌드가 무사히 공개될지, 호스팅 API에 MiniCPM5-2B가 등재되는지 — 바로 그 순간 이 모델은 더 이상 자체 호스팅 전용이 아니게 된다. 이 글이 빠져 있다고 지적했던 실질적 신호, 즉 Artificial Analysis나 대학 연구실의 독립적 실행은 이제 v4.2 인덱스 점수라는 형태로 도착했고, 이 점수는 MiniCPM5-2B를 4B 미만 오픈 웨이트 모델 중 1위로 유지시켜 준다. 여전히 남은 과제는 행 단위 검증이다. OpenBMB 외부에서는 아무도 모델 카드의 내부 수치, 특히 SWE-bench Verified 46.4와 내부 평균 53.9를 재현하지 못했다. 그 특정 항목들이 다시 실행되기 전까지는 MiniCPM5-2B를 인상적인 모델 카드를 갖추고 조용히 공개된 모델을 대하듯 대해야 한다. 즉, 오늘 밤 로컬에서 돌려볼 수 있는 매우 유망한 가설이자, 실제 업무에 믿고 쓰기 전에 가장 눈에 띄는 수치를 검증해야 하는 모델이다.
