'MiniCPM5-2B vs Granite 4.2 3B'용 히어로 타이틀 카드. 부제는 '에이전트 훈련을 거친 2.5B가 IBM의 3B 추론 전문가와 맞선다', 칩 3개는 '에이전트 스택 vs 추론 모델', '양쪽 모두 Apache-2.0', '가중치 공개: 9월 6~7일', 상단 리본은 '오픈 웨이트 대결 · 2026년 9월'.
Guides & Insights

MiniCPM5-2B 대 Granite 4.2 3B: 3B 추론 특화 모델 대 새로운 2.5B 에이전트 스택

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

ModelBest는 누가 부탁하기도 전에 Granite 4.2 3B를 MiniCPM5-2B의 자체 점수판에 올렸다. OpenBMB가 가중치를 Hugging Face에 조용히 공개하면서 게시한 MiniCPM5-2B 모델 카드에는 IBM의 가장 작은 추론 모델이 비교 기준선 중 하나로 포함되어 있으며, 해당 스위트에서 MiniCPM5-2B는 평균 53.9점을, Granite 4.2 3B는 42.7점을 기록한 것으로 나타난다. 이는 두 공급업체가 이 조합에 대해 공개한 유일한 맞대결 수치이므로, 논의를 시작하기에 자연스러운 지점이자 동시에 주의를 기울여야 할 지점이기도 하다. 두 모델 모두 작은 규모의 Apache-2.0 라이선스 자체 호스팅 오픈 가중치 배포판으로, 2026년 후반의 동일한 작업을 겨냥하고 있다. 다만 정반대 방식으로 접근한다. 하나는 추론하도록 훈련되었고 다른 하나는 행동하도록 훈련되었다.

이 두 출시는 공급업체들의 마케팅이 시사하는 것보다 훨씬 더 닮아 있다. MiniCPM5-2B는 7월 19일 세계 인공지능 컨퍼런스에서 ModelBest와 OpenBMB의 온디바이스 플래그십으로 발표됐다. 스마트폰, PC, 스마트 콕핏을 위한 에이전트의 기반으로 내세워진 2B급 밀집 모델로, 그 가중치는 9월 6일과 7일에 아무런 출시 행사 없이 Apache-2.0 라이선스 아래 GGUF, MLX, GPTQ, base, SFT 및 draft 체크포인트와 그 뒤에 있는 학습 데이터와 함께 공개됐다. Granite 4.2 3B는 IBM의 노트북에 적합한 추론 모델로, 가중치는 8월 초에 Hugging Face에 도달했고, 모델 카드와 기술 블로그는 8월 25일에 나왔다. 두 모델 모두 아직 독립적인 벤치마크로 검증되지 않았으며, 그래서 아래의 출처 라벨이 숫자보다 더 중요하다.

운율이 맞는 두 개의 릴리스

Granite 4.2 3B는 Granite-4.1-3B-Base에서 추가 훈련된 독립형 밀집 추론 모델입니다. grouped-query attention을 갖춘 40개 레이어, IBM이 5차 사전 훈련 단계에서 512K로 확장한 128K 기본 컨텍스트, 그리고 쿼리별 3가지 사고 모드(기본값인 전체 사고, 저효율 모드, 비사고 경로)를 제공합니다. 모델 카드에는 이 모델이 무엇이 아닌지가 명확히 명시되어 있습니다. 8B 및 30B Granite 4.2 형제 모델과 달리 3B는 SWE-agent, 터미널 및 검색 환경에서 훈련된 전문 에이전트 강화학습 블록을 의도적으로 생략했으며, 따라서 IBM은 SWE-bench 결과를 제시하지 않고 이 모델을 에이전트가 아닌 추론 전문가로 규정합니다. 이 모델은 vLLM, SGLang, Transformers, GGUF 및 Ollama(granite4.2:3b)를 통해 서비스되며, bfloat16 기준 약 6-8GB 또는 양자화 시 2GB 미만으로 실행되고, 호스팅 API는 제공되지 않습니다. 주요 수치(AIME 2025 78.33, GPQA 54.80, LiveCodeBench v6 69.71, MMLU-Pro 67.84)는 IBM이 보고한 것으로, 현재까지 독립적으로 재현되지 않았습니다.

Screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the model summary table — developer Granite Team, IBM, 'Decoder-only Dense Transformer (Reasoning)', base model Granite-4.1-3B-Base, 3B parameters, context 'Natively Supports 128K (Long-context extension to 512K)', bfloat16 precision, tested languages, built-in think chain-of-thought — and the Apache-2.0 license tag (captured September 7, 2026).

MiniCPM5-2B는 대신 완성된 에이전트 지향 모델입니다. 모델 카드는 총 2.52B 파라미터(비임베딩 1.98B)를 가진 dense 트랜스포머, hidden size 2048의 42개 레이어, 16개의 쿼리 헤드와 2개의 KV 헤드를 갖춘 grouped-query attention, 그리고 커스텀 커널이 없는 표준 LlamaForCausalLM 아키텍처를 설명합니다. 출시 발표는 에이전트 역량을 강조했습니다 — 200B 규모의 에이전트 중간 학습, 대규모 에이전트 SFT 세트, 에이전트 RL 정렬을 거쳐 16개의 RL 전문가 모델을 하나의 작은 dense 네트워크로 압축하는 On-Policy Distillation으로 마무리했으며, 여기에 네이티브 긴 컨텍스트와 하이브리드 빠른/숙고형 응답 모드를 더했습니다. 출시된 구성(config)은 131,072토큰 컨텍스트 창을 설정합니다(7월 자료는 512K를 내세웠지만, 릴리스된 구성에는 그 내용이 없습니다). 모델 카드는 내장 SGLang 파서를 사용하는 XML 스타일 도구 호출도 주장합니다. 자체 평가 표에서는 공급업체가 선정한 비교 세트에 대한 내부 평균 53.9, AIME 2025/2026 86.5, MATH-500 94.6, 그리고 공급업체가 실행한 SWE-bench Verified에서 46.4를 보고합니다. 이 수치는 독립적인 테스트를 통과한다면 2.5B dense 모델로서는 놀라운 성적일 것입니다.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

누군가 이미 인쇄한 맞대결

벤더 간 스코어보드는 대부분 사과와 오렌지를 비교하는 격이기 때문에, 이번 맞대결에서 가장 유용한 자료는 ModelBest가 직접 공개한 것입니다: MiniCPM5-2B의 카드에는 기준 모델 중 granite-4.2-3B가 포함되어 있고, 해당 스위트에서 MiniCPM5-2B가 평균 53.9점, Granite가 42.7점을 기록했다고 보고합니다. 그 내용을 있는 그대로 읽으십시오 — 한 벤더가 자신이 선택한 하나의 스위트에서 두 모델을 모두 실행한 결과이고, 재현된 적이 없으며, 자기 모델이 이길 동기가 가득한 결과입니다. 그것은 최종 판정이 아닙니다. 그것이 알려주는 것은 ModelBest가 경쟁사의 3B를 자사 카드에 올릴 만큼 자신감이 있었다는 것이며, 주장하는 격차가 가장 큰 곳은 정확히 자체 훈련이 투자된 분야, 즉 에이전틱 및 장문 컨텍스트 항목입니다. 그것을 방향성 있는 주장으로 취급하고, 무엇이든 결정하기 전에 IBM이 별도로 공개한 카드의 주장도 함께 따져 보십시오.

정직하게 표시된 스코어보드

• 릴리스 — MiniCPM5-2B: 2026년 7월 19일 발표; 가중치는 9월 6~7일 조용히 공개. Granite 4.2 3B: 가중치는 8월 초; 모델 카드 및 기술 블로그는 2026년 8월 25일.

• 역할 — MiniCPM5-2B: ModelBest에 따르면 온디바이스 에이전트 및 도구 사용에 중점을 둔 모델. Granite 4.2 3B: IBM에 따르면 추론 특화 모델이며 의도적으로 에이전트 기능을 배제함.

• 크기 — MiniCPM5-2B: 총 2.52B / 비임베딩 1.98B, 42개 레이어. Granite 4.2 3B: ~3B dense, 40개 레이어.

• 컨텍스트 — MiniCPM5-2B: 제공되는 기본 설정에서 131,072개 토큰. Granite 4.2 3B: 기본 128K, 512K까지 확장 가능.

• 사후 훈련 — MiniCPM5-2B: 심층 사고 SFT, 특화 RL, On-Policy Distillation. Granite 4.2 3B: 추론 SFT, GRPO RL 및 RLHF; 에이전틱 RL 블록 없음.

• 근거 — MiniCPM5-2B: ModelBest 카드 주장, 독립 실행 없음. Granite 4.2 3B: IBM 카드 주장, 재현되지 않음; AIME 2025 78.33, GPQA 54.80, LiveCodeBench v6 69.71.

A comparison scoreboard titled 'MiniCPM5-2B vs Granite 4.2 3B — the scoreboard', with left column rows 'What it is: Agent-tuned 2.5B for on-device', 'Params: 2.52B total · 42 layers', 'Context: 128K in shipped config', 'Post-training: Deep-thinking SFT + RL + OPD', 'Card headline: Internal avg 53.9 on own suite', 'Release: Announced Jul 19 · weights Sep 6-7', and right column rows 'What it is: IBM's smallest reasoning 3B', 'Params: ~3B dense · 40 layers', 'Context: 128K native → 512K ext', 'Post-training: Reasoning SFT + GRPO + RLHF', 'Card headline: AIME '25 78.33 · GPQA 54.80', 'Release: Weights Aug · card Aug 25', with a footer reading 'Both vendor-reported and unreproduced; the 53.9-vs-42.7 head-to-head is on ModelBest's own card.'

위의 스코어보드는 본문과 동일한 출처를 지닙니다. 그 위의 모든 수치는 공급업체가 보고한 것이며, 두 공급업체 중 어느 쪽이든 발표한 유일한 동일 스위트 내 비교는 ModelBest 자체 카드에 있는 것입니다.

추론 전문가 vs 에이전트 스택

점수를 확인하기 전에, 워크로드에 필요한 소형 모델의 종류를 먼저 결정하십시오. 이 두 모델은 서로 다른 질문에 답하기 때문입니다. {{1}}Granite 4.2 3B는 제한된 하드웨어에서의 추론과 긴 컨텍스트 처리를 위해 설계되었습니다. 기본 128K, 512K까지 확장되는 컨텍스트 윈도우, 세 가지 사고 모드, 노트북에도 들어가는 작은 용량, 그리고 에이전틱 학습을 생략하기로 한 명시적 결정이 특징입니다. 긴 문서 분석, 레포지토리 규모의 컨텍스트, 또는 작은 장비에서의 안정적인 다단계 추론이 목적이라면, 이 모델은 그 용도에 잘 부합합니다. IBM이 3B 모델에 에이전틱 역량을 내세우지 않기로 한 결정은, 오히려 이 모델의 카드를 신뢰할 이유이지 결함이 아닙니다.{{/1}} {{2}}MiniCPM5-2B는 정반대의 초점으로 설계되었습니다. 바로 기기에서의 에이전틱 동작과 도구 사용입니다. 이 모델의 학습 파이프라인은 Granite 4.2 3B가 의도적으로 제외한 기능들의 목록처럼 읽힙니다. 도구를 호출하고, 긴 대화를 유지하며, 빠른 응답과 신중한 응답을 오가는 온디바이스 에이전트 루프가 목적이라면, 이 스택이 바로 그 용도에 맞습니다. 다만 검증되지 않은 모델 카드를 가진 1주일 된 체크포인트라는 추가적인 불확실성이 따릅니다.{{/2}}

OpenBMB가 공개한 데이터를 IBM은 공개하지 않았다.

가장 눈에 띄지 않는 차이가 파인튜닝을 원하는 팀에게 가장 중요합니다. OpenBMB는 MiniCPM5-2B의 가중치와 함께 훈련 말뭉치를 공개했습니다. Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, 그리고 에이전트 SFT·RL 세트를 포함하는 UltraData 제품군 전체를 Apache-2.0 라이선스로 공개한 것입니다. 이로써 2B 모델은 블랙박스에서 재현 가능한 레시피로 바뀝니다. 에이전트 사후 훈련이 무엇을 기반으로 구축됐는지 확인하고, 이를 자체 도메인에서 이어갈 수 있기 때문입니다. IBM은 Granite 4.2 3B의 가중치를 오픈소스로 공개하고 구축 방식에 대한 상세한 기술 설명을 제공했지만, 훈련 데이터는 공개하지 않았습니다. 모델을 임대하는 대신 소유하려는 조직에게 그 비대칭성은 실질적입니다. 그리고 MiniCPM5-2B는 이 크기에서 Granite가 따라가지 못하는 배포 스토리를 갖고 출시됩니다. ModelBest의 FlagOS 커뮤니티를 통한 9개 칩 제품군에 대한 출시 당일(day-zero) 적응, 즉 화웨이 Ascend부터 NVIDIA, 다양한 중국산 가속기, ARM까지의 지원이 그것입니다. 이는 ModelBest가 2B 모델을 NVIDIA GPU가 아닌 다른 곳에서 실행할 것으로 기대한다는 신호입니다.

라우팅의 현실

현재 두 모델 모두 호스팅 카탈로그에 올라와 있지 않으므로, 이 비교는 자체 호스팅 환경에서 이루어집니다. 하지만 바로 그러한 환경에서 라우팅 계층은 전달 메커니즘이 아니라 안전망으로서 존재 가치를 증명합니다. 팀이 이미 서비스 중인 워크로드에서 출시된 지 일주일 된 에이전트형 2B 모델을 추론형 3B 모델과 비교해 보려 한다면, 되돌리기 쉬운 방법은 자동 장애 조치를 지원하는 단일 API를 통해 자체 호스팅 MiniCPM5-2B 빌드로 테스트 경로를 지정하는 것입니다. 운영 트래픽은 검증된 모델에 그대로 남아 있으므로 새 스택이 멈춰도 아무것도 중단되지 않습니다. 비교 대상인 호스팅 모델의 공급업체 정가도 마크업 0%로 그대로 전달되므로 A/B 테스트 비용은 계속 저렴하게 유지됩니다. 라우팅 계층은 두 모델 중 어느 쪽도 호스팅하지 않지만, 실험을 안전하게 실행하고 쉽게 되돌릴 수 있게 해 줍니다.

실제로 어떤 소형 모델을 실행해야 할까요?

노트북급 장치에서 긴 컨텍스트 추론이 워크로드이고, 세 가지 사고 모드와 512K 상한, 그리고 3B가 훈련받지 않은 것이 정확히 무엇인지 알려주는 정직한 카드를 원한다면 Granite 4.2 3B를 실행하세요. 워크로드가 대화형 도구 호출 온디바이스 에이전트이고 2.5B가 메모리 예산에 맞는다면 MiniCPM5-2B를 실행하세요 — 단, 신뢰하기 전에 헤드라인 수치를 재현할 시간을 확보하세요. 53.9 평균과 46.4 SWE-bench 주장은 아직 공급업체의 것일 뿐, 다른 누구의 것도 아니기 때문입니다. 이 대결을 어떤 의견보다 빠르게 판가름할 두 가지가 있습니다: 에이전트 관련 주장을 확인하거나 반증할 MiniCPM5-2B의 독립적 실행, 그리고 커뮤니티 재현을 통과하는 IBM의 추론 수치입니다. 그중 하나가 확정될 때까지 Granite 4.2 3B는 오늘날 더 안전하고 문서화가 잘 된 소형 모델이며, MiniCPM5-2B는 더 흥미로운 선택지입니다.