'MiniCPM5-2B vs Gemma 4 12B' 히어로 타이틀 카드 — 부제: 'sub-4B 랭킹 1위가 Google의 12B 멀티모달 제너럴리스트를 만난다', 칩 3개: '2.5B vs 11.95B', '128K vs 256K 컨텍스트', 'AA Index 17 — #1 sub-4B', 상단 리본: '오픈 웨이트 대결 · 2026년 9월'.
Guides & Insights

MiniCPM5-2B vs Gemma 4 12B: 4B 미만 순위 선두 vs 구글의 12B 범용 모델

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

MiniCPM5-2B의 출시 자료에는 모든 논쟁이 시작되기 전에 종결시킬 듯한 문장이 하나 담겨 있습니다. 7월 19일 세계인공지능대회에서 ModelBest와 OpenBMB는 이 모델을 Artificial Analysis 리더보드에서 4B 파라미터 미만 모델 중 최상위 모델이라고 밝혔으며, 이제 그 오픈 가중치는 조용히 Hugging Face에 공개되었습니다. Gemma 4 12B는 완전히 다른 가중치 체급에서 나온 Google의 답입니다. 11.95B 밀집(dense) 파라미터를 가진 인코더 없는 멀티모달 범용 모델로, 6월 3일에 출시되어 텍스트, 이미지, 오디오, 비디오를 입력으로 받으며 이미 수개월간 커뮤니티 배포 이력이 있습니다. 이 둘을 비교하는 것은 사양표 대결이 아니라 어떤 디바이스에 제품을 얹을 것인지에 대한 결정입니다. 자체 크기 등급을 이끄는 모델과 단순히 더 큰 모델은 서로 다른 하드웨어 질문에 답하고 있기 때문입니다.

타이밍이야말로 이 비교가 성립하는 이유다. MiniCPM5-2B는 7월 WAIC에서 제품으로 선보였다. 모델에 관한 이야기인 동시에 칩에 관한 이야기였으며, FlagOS 커뮤니티에서 출시 당일부터 참여하는 9개 실리콘 파트너가 함께했다. 가중치는 '가까운 시일 내에' 공개될 것이라고 약속되었다. 7주 후, openbmb/MiniCPM5-2B 레포지토리가 Hugging Face에 등장했다(OpenBMB 체인지로그는 출시일을 9월 7일로 명시한다). Apache-2.0 라이선스, 별도 승인 절차 없이 공개되었으며, BF16 체크포인트, GGUF, MLX, GPTQ, 베이스 및 SFT 체크포인트, 학습 데이터셋이 모두 같은 컬렉션에 포함되어 있었다. 보도자료도, 출시 이벤트도 없었다. 이 글을 쓰는 시점에서 모델 카드가 곧 발표문이며, 아직 독립적인 벤치마크 실행 결과는 발표되지 않았다. 아래 2B에 대한 모든 정량적 수치는 ModelBest 자체의 재현 결과이거나, 해당 문서가 인용하는 Artificial Analysis 스냅샷에서 가져온 것이다. 반면 Gemma 4 12B는 Google의 일반적인 출시 절차를 통해 출시되었고 수백만 번 다운로드되었다. 이러한 증거 격차는 이 비교의 일부이지, 각주에 불과한 것이 아니다.

각 측에서 방금 무엇이 바뀌었나요?

MiniCPM5-2B는 MiniCPM5 시리즈의 두 번째 모델로, OpenBMB가 5월 19일 오픈소스로 공개한 MiniCPM5-1B의 뒤를 잇습니다. 카드에 따르면 이 모델은 총 2,516,756,480개 파라미터(비임베딩 1,981,982,720개 — '2B급'이라는 이름을 얻게 해 주는 수치)를 가진 밀집 트랜스포머로, 히든 크기 2048의 42개 레이어, 16개 쿼리 헤드와 단 2개 KV 헤드를 사용하는 그룹 쿼리 어텐션, 그리고 130,560 어휘 크기를 갖습니다. 이는 순수한 LlamaForCausalLM 아키텍처로, 커스텀 커널이나 모델 코드 포크가 필요 없다는 점이 카드에 명시되어 있으며, 전체 체크포인트는 BF16 safetensors 샤드 하나로 제공됩니다. 흥미로운 설계 선택은 사후 학습(post-training)에 있습니다. 400B 토큰의 심층 사고(deep-thinking) 데이터로 SFT를 수행한 뒤, 온-폴리시 증류(On-Policy Distillation)를 통해 에이전트형 5개를 포함한 16개의 RL 전문가 모델을 다시 하나의 소형 밀집 네트워크로 접어 넣는 것입니다. 카드는 RL + OPD가 추론 및 일반 과제에서 평균 10.96포인트, 에이전트형 과제에서 6.96포인트의 향상을 가져왔다고 밝히는데, 이는 내부 델타일 뿐이지만 이 모델의 형태를 설명해 줍니다. 즉 XML 스타일 도구 호출을 네이티브로 출력하는 온디바이스 에이전트로 설계된 2B 모델이라는 뜻입니다.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Gemma 4 12B는 Google 라인업에서 다른 위치를 차지한다. 이 모델은 Gemma 4 제품군의 중간에 해당하는데, 엣지에 초점을 맞춘 E2B·E4B 모델보다 위에 있고 26B MoE 및 31B 프런티어 모델보다 아래에 있다. 또한 인코더 없는(encoder-free) 설계를 채택한 유일한 구성원이기도 하다. 원시 이미지 패치와 오디오 파형을 토큰 공간에 직접 투영하므로, 별도의 인코더 타워 없이 하나의 덴스(dense) 모델이 텍스트, 이미지, 오디오, 비디오 입력을 모두 처리한다. 256K 컨텍스트 창, 기본 제공되는 도구 호출(tool calling), 선택적 추론(reasoning) 패스, 그리고 체크포인트 내부에서 디코딩을 가속하는 다중 토큰 예측(multi-token-prediction) 드래프터를 갖추고 있다. Apache-2.0 라이선스로 배포되며 16GB급 하드웨어(4비트 기준 약 8GB)에서 실용적으로 동작한다. Hugging Face 페이지에서는 월 수백만 건의 다운로드가 이루어지고 있다.

Screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing Google DeepMind as author, the Apache-2.0 license tag, Transformers and Safetensors tags, 'Model size 12B params', and the opening text describing the Gemma 4 12B Unified model's native text, audio, image and video input with no separate encoders (captured September 7, 2026).

순위 주장, 그리고 그것이 빠뜨린 크기 등급

ModelBest의 MiniCPM5-2B 헤드라인은 Artificial Analysis Intelligence Index {{1}}17로, 출시 당시 4B 파라미터 미만 모델 중 1위{{/1}}입니다. 그 옆에는 두 가지 주의사항이 따라붙습니다. 그 점수는 AA의 v4.1 스냅샷을 반영하며 이전 스냅샷의 지수 값과 직접 비교할 수 없고, 독립적인 재실행이 이루어지기 전에 공급업체가 인용한 출시 시점 수치이기도 합니다. 정직하게 읽으면 그 의미는 더 좁아지지만 여전히 인상적입니다. 출시 당시 AA의 방법론 기준으로는 이 2.5B 모델이 자기 크기 등급 전체에서 선두였습니다. {{2}}Gemma 4 12B는 그 등급에 나타나지 않으며{{/2}}, 오늘날 Artificial Analysis 자체 페이지에서는 더 높은 지수를 보여줍니다. 추론 변형은 {{3}}약 22{{/3}}, 비추론 instruct 모델은 {{4}}약 13{{/4}}으로, 둘 다 해당 비교 그룹에서 "평균보다 훨씬 높습니다". 서로 다른 스냅샷의 지수는 정확히 맞아떨어지지 않으므로, 이를 정밀한 수치가 아니라 방향으로 보십시오. {{5}}12B 범용 모델{{/5}}은 더 유능한 모델로 테스트되었고, {{6}}2B{{/6}}는 해당 크기에서 가장 유능한 모델로 테스트되었습니다. 이는 서로 다른 주장이며 둘 다 사실일 수 있습니다.

정직하게 표시된 스코어보드

다음 행들을 소싱 관점에서 읽어보세요 — MiniCPM5-2B의 수치는 일주일 전에 게재되었고 재현되지 않은 ModelBest 카드의 주장이며, Gemma 4 12B는 Google이 보고한 것으로 커뮤니티 사용에 오랫동안 노출되어 왔습니다:

• 크기 — MiniCPM5-2B: 총 2.52B / 비임베딩 1.98B, 밀집(dense). Gemma 4 12B: 11.95B, 밀집(dense).

• 모달리티 — MiniCPM5-2B: 텍스트 전용. Gemma 4 12B: 텍스트, 이미지, 오디오 및 비디오 입력, 인코더 없음.

• 맥락 — MiniCPM5-2B: 출하 시 구성에서 131,072토큰. Gemma 4 12B: 기본 256K(일부 서빙 레시피는 128K로 고정).

• 언어 — MiniCPM5-2B: {{1}}영어 및 중국어 중심의 카드 및 데이터{{/1}}. Gemma 4 12B: {{2}}140개 이상의 언어{{/2}}.

• 릴리스 — MiniCPM5-2B: 2026년 7월 19일 발표, 9월 6~7일 가중치 공개, 조용한 출시. Gemma 4 12B: 2026년 6월 3일 출시, 전체 출시 평가 포함.

• 근거 — MiniCPM5-2B: 공급업체 카드 및 AA v4.1(Index 17, 4B 미만 1위); 아직 독립 실행 없음. Gemma 4 12B: 출시 평가와 수개월간의 커뮤니티 배포, 월 약 330만 건 다운로드.

A comparison scoreboard titled 'MiniCPM5-2B vs Gemma 4 12B — the scoreboard', with left column rows 'Params: 2.52B total · 1.98B non-emb', 'Modality: Text only', 'Context: 128K (config 131,072)', 'Languages: English / Chinese', 'AA Index: 17 — #1 sub-4B at launch', 'Evidence: Vendor card · no independent run', and right column rows 'Params: 11.95B dense', 'Modality: Text + image + audio + video', 'Context: 256K native', 'Languages: 140+', 'AA Index: 22 reasoning · 13 instruct', 'Evidence: Google evals + months of use', with a footer labeling both sides' sourcing.

위의 스코어보드는 동일한 초상화를 여섯 개의 행으로 보여 줍니다. 두 모델은 거의 모든 차원에서 의견이 일치하지 않으며, 선택을 결정짓는 열들 — 모달리티, 언어, 기기 등급 — 은 어떤 벤치마크 평균도 포착하지 못하는 것들입니다.

12B가 강점을 보이는 분야: 텍스트 전용 2B는 흉내낼 수 없는 것들

모달리티부터 시작하자. Gemma 4 12B는 오디오, 이미지, 비디오를 네이티브로 지원하는 반면, MiniCPM5-2B는 텍스트 전용이다. 음성을 전사하거나, 화면을 보거나, 영상을 처리해야 하는 제품이라면 2B 외에 두 번째 파이프라인이 필요해지며, 그렇게 되면 “작은 모델”이라는 장점은 일부 사라진다. 두 번째 벽은 언어다. 140개 이상의 언어 지원 대 영어·중국어 중심의 출시작이다. 롱테일 언어를 서비스하는 제품에게 2B는 애초에 후보가 되지 못한다. 그리고 증거도 있다. Gemma 4 12B는 수백만 번 다운로드되었고, 양자화·파인튜닝을 거쳐 3개월째 프로덕션에서 서비스되어 왔다. 그 실패 모드는 문서화되어 있고, 생태계는 llama.cpp, Ollama, LM Studio, MLX, vLLM, SGLang에 걸쳐 있다. MiniCPM5-2B는 겨우 일주일 된 저장소다. 그 헤드라인 수치들 — SWE-bench Verified에서 공급업체가 기록한 46.4도 포함되는데, 이 수치가 독립 테스트를 통과한다면 2.5B 덴스 모델로서는 놀라운 기록일 것 — 은 연구소 밖에서 아무도 검증하지 못했다. 성숙도만 놓고 보면, 선택은 접전이 아니다.

2B가 유일한 선택지인 곳

그런 것들은 12B가 애초에 들어맞지 않는 기기 등급에서는 아무 의미가 없습니다. 수 기가바이트의 DRAM을 가진 휴대폰, 스마트 콕핏 보드, 혹은 소형 엣지 박스는 11.95B 모델의 가중치를 메모리 버스를 통해 실용적인 속도로 옮길 수 없습니다. 바로 그 점이 그 모델을 질식시키는 병목입니다. MiniCPM5-2B는 바로 그런 환경을 위해 만들어졌습니다. 온디바이스 메모리에 들어맞는 가중치, 긴 에이전트 세션을 위한 128K 윈도우, 대화형 실행에 맞춰 설계된 네이티브 도구 호출, 그리고 ARM을 포함한 9개 칩 계열에 대한 출시 첫날(day-zero) 적응까지 갖춘 모델입니다. 타깃이 폰급 NPU 또는 임베디드 보드라면, Gemma 4 12B는 MiniCPM5-2B와 경쟁하는 것이 아닙니다. 그런 곳에는 아예 배포가 불가능하기 때문입니다. 그리고 타깃이 12B를 간신히 감당할 수 있는 수준 — 16GB 랩톱 같은 — 이라면, 2B 모델은 충분한 여유를 제공합니다. 토큰당 지연 시간이 더 짧아지고, 전력 소비가 더 낮아지며, 동일한 메모리 공간에서 두 번째 모델을 실행할 수 있는 옵션까지 생기기 때문입니다.

어떤 청구가 살아남는지 알아내는 방법

양쪽 모두 오픈 웨이트(open-weight)이고 자체 호스팅이 가능하기 때문에, 솔직한 다음 단계는 카드(스펙)를 다시 읽는 것이 아니라 자체 하드웨어에서 측정하는 것입니다. 이미 서비스 중인 워크로드에서 MiniCPM5-2B와 Gemma 4 12B를 비교 검토 중이라면, 라우팅 레이어가 제 역할을 하는 지점이기도 합니다. 자동 장애 조치(failover)가 있는 단일 API를 통해 테스트 경로를 새 자체 호스팅 체크포인트로 지정하면, 검증되지 않은 스택이 중단되거나 루프에 빠져도 프로덕션이 중단되지 않으며, 비교 대상 공급업체의 공시 가격은 0% 마크업으로 그대로 전달됩니다. 이 모델 자체는 하루 전에 만들어진 저장소이므로 기본적으로 실험으로 취급하는 것이 맞습니다. 하지만 그 실험은 실행 비용이 낮고, 2B 모델로 SWE-bench나 자체 평가 세트의 일부를 재현하는 데 걸리는 두 시간은 바로 이 맞대결에서 빠져 있는 증거입니다.

평결

하드웨어에 그만한 여유가 있고 워크로드가 텍스트를 넘어서는 경우 — 멀티모달 제품, 다국어 사용자층, 또는 커뮤니티에서 3개월간 검증된 모델 동작이 랭킹 1위 타이틀보다 더 중요한 경우 — {{1}}Gemma 4 12B{{/1}}를 선택하세요. 기기가 12B를 전혀 감당할 수 없거나, 폰급 칩에서 동작하는 텍스트 처리·에이전트 지향 2.5B 모델이 더 큰 모델로는 불가능한 제품을 출시할 수 있게 해주는 경우에는 {{2}}MiniCPM5-2B{{/2}}를 선택하세요. 4B 미만 부문 랭킹 1위는 확실한 성과이며, 오픈 웨이트 공개 덕분에 오늘 바로 테스트해볼 수 있습니다. 다만 현재 확보된 증거로 볼 때, 12B가 실제로 구동될 수 있는 곳 어디에서든 12B 범용 모델을 대체할 수는 없습니다.