큰 굵은 글씨로 'Kolibri vs MiniCPM5 2B'라고 적힌 히어로 타이틀 카드가 있습니다. 그 아래에는 '서버급 모델 대 온디바이스 에이전트'라고 적힌 더 작은 한 줄이 있으며, 나란히 있는 두 개의 작은 플랫 라인 아이콘 — 왼쪽에는 벌새, 오른쪽에는 작은 모바일 칩 윤곽 — 이 얇은 세로 구분선으로 분리되어 있습니다. 이 카드는 부드러운 파란색과 청록색 그라데이션 액센트가 있는 흰색 배경 위에 배치되어 있고, 오른쪽 아래 모서리에 OrcaRouter 로고가 있습니다.
Guides & Insights

Kolibri vs MiniCPM5-2B: 780억 개 매개변수 대 2.5, 그리고 작은 쪽이 저렴한 선택지가 아닌 이유

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두고 보면Kolibri옆에MiniCPM5-2B 직관적으로 읽히는 것은 이것이 크기 비교이며, 25억 파라미터 모델이 경제적인 선택이라는 것이다. 그 독해는 교훈적인 방식으로 틀렸다. Kolibri는 Aleph Alpha의 781억 파라미터 전문가 혼합 모델로, 2026년 10월 3일 공개되었으며, 토큰당 34억 6천만 파라미터를 활성화하고, FP8 사용량은 약 78GB이며 최소 서빙 구성은 A100 80GB 카드 두 장이다. MiniCPM5-2B는 ModelBest와 OpenBMB의 25억 2천만 파라미터 덴스 모델로, 2026년 7월 19일 세계인공지능대회에서 공개되었고 가중치는 9월 6일 Hugging Face에 공개되었다. MiniCPM5-2B는 파라미터 수 기준으로 31배 더 작다. 또한 신뢰하기 전에 평가 예산을 요구하는 쪽도 바로 이 모델이다. 가장 많이 인용되는 수치가 벤더가 실행한 것이고 재현되지 않았기 때문이다 — 이는 "소형 모델"이 위험에 대해 일반적으로 함축하는 것과 정확히 반대다.

둘 다 조용히 출시되었고, 그중 하나만 최근에 출시되었습니다.

그들은 비슷한 기원 이야기를 갖고 있지만 나이는 매우 다르며, 그 나이가 중요하다. Aleph Alpha의 Kolibri 리포지토리는 2026년 10월 2일에 생성되었고 공개 예정일은 10월 3일로 명시되었으며, 벤더 자체의 뉴스룸 발표는 그날 아침 독일 통일의 날에 나갔다. 일반 AI 언론은 그날 대체로 이를 놓쳤고, "조용한 출시"라는 프레이밍은 여기서 나왔다. 하지만 모델 카드, 기술 보고서, 벤더 게시물은 조용한 공개가 아니다. MiniCPM5-2B는 정말로 더 조용했다: 7월의 WAIC 발표는 피치와 사양을 콘퍼런스에서 공개한 것이었고, 실제 가중치는 9월 6일이 되어서야 등장했으며, 출시 행사 없이 GGUF, MLX, GPTQ, base, SFT 및 draft 체크포인트와 그 뒤의 훈련 코퍼스와 함께 공개되었다.

발표와 가중치 사이의 그 5주 간격은 기억할 가치가 있다. 이 모델에 대해 서로 다른 두 숫자 집합이 도는 이유가 바로 그것이기 때문이다. 7월 자료는 512K 토큰 컨텍스트 창을 내세웠다. 실제 배포된 구성은 131,072로 설정되어 있다. 기준이 되는 것은 공개된 아티팩트다.

각 모델의 실제 용도

Kolibri는 독일어와 영어 문서 작업을 위해 구축되었으며, Aleph Alpha는 그것이 왜 실제 엔지니어링을 필요로 했는지 유난히 구체적으로 설명한다. 작은 프록시 모델 실험은 훈련 데이터에서 대략 20퍼센트의 독일어를 목표로 삼았고, 이는 20조 토큰 규모의 실행에서 4조 개의 독일어 토큰을 찾아야 한다는 뜻이었다. 중복 제거와 필터링을 거친 공개 독일어 데이터셋은 3,900억 개를 내놓았는데, 이는 10배가량 부족한 규모였다. 그래서 연구소는 Common Crawl 필터를 독일어 전용으로 재조정해 1조 3,000억 개의 고유한 자연 발생 토큰을 만들어냈고, 기존 독일어 문서를 백과사전 항목, 대화, 구절로 재작성해 약 1조 개를 추가로 확보했으며, 이것이 가장 큰 단일 독일어 출처가 되었다. 전작 Kolibri Origin에 사용되었던 번역은 Kolibri에서 제외되었다. 꼭 기억해 둘 것은 필터의 세부 사항이다. 표준 언어 데이터 파이프라인은 긴 단어가 너무 많은 문서를 버리는데, 독일어 행정 문체는 평균 단어 길이에 대한 영어 기준을 일상적으로 넘어선다. 그래서 기본 설정은 공공 행정이 사용하는 문체를 조용히 삭제한다.

MiniCPM5-2B는 정반대의 목표, 즉 온디바이스 에이전트를 위해 만들어졌다. 모델 카드에는 총 25억 2천만 개 파라미터(임베딩 제외 19억 8천만 개), 히든 크기 2048의 42개 레이어, 16개 쿼리 헤드와 2개 KV 헤드의 그룹화된 쿼리 어텐션, 그리고 커스텀 커널이 없는 표준 LlamaForCausalLM 아키텍처로 구성된 덴스 트랜스포머가 설명되어 있다. 학습 파이프라인은 에이전트 중심으로 기울어져 있다: 2,000억 규모의 에이전트 중간 학습, 대규모 에이전트-SFT 세트, 에이전트 RL 정렬, 그리고 열여섯 개의 RL 전문가 모델을 하나의 작은 덴스 네트워크로 다시 접어 넣는 최종 On-Policy Distillation 단계. 내장 SGLang 파서를 통한 XML 스타일 도구 호출을 제공하며, 공개된 구성은 131,072토큰 윈도우를 설정한다.

• 매개변수 — Kolibri: 총 78,103,074,560개, 활성 3,457,573,120개, 희소성 22.6:1. MiniCPM5-2B: 총 2,516,756,480개, 비임베딩 1.98B, 밀집형.

• 출시 — Kolibri: 2026년 10월 3일. MiniCPM5-2B: 2026년 7월 19일 발표, 2026년 9월 6일 가중치 공개.

• 컨텍스트 — Kolibri: 16,384 학습됨, 65,536 중간 학습됨, 262,144 네이티브, 1,048,576 검증됨. MiniCPM5-2B: 배포된 구성에서는 131,072; 7월의 512K 주장은 여기에 포함되어 있지 않습니다.

• 풋프린트 — Kolibri: FP8 기준 약 78GB; 최소 A100 80GB 2개, H100 SXM5 2개, H200 1개, B200 1개 또는 B300 1개. MiniCPM5-2B: 단일 BF16 샤드, 노트북급.

• 언어 — Kolibri: 설계상 독일어와 영어뿐이며 그 외에는 없습니다. MiniCPM5-2B: 영어와 중국어이며, 공개된 모든 평가 스위트가 영어로 제공됩니다.

• 도구 호출 — Kolibri: vLLM 파서가 기본 제공되는 Hermes 스타일. MiniCPM5-2B: SGLang 파서를 사용하는 XML 스타일.

• 라이선스 — 둘 다 Apache 2.0이며, 둘 다 허용 사용 부가 조항이 없습니다.

A two-column comparison scoreboard titled 'Kolibri vs MiniCPM5 2B'. Left column Kolibri: Parameters 78.1B MoE / 3.46B active, Context 262,144 native / 1M validated, Footprint about 78 GB in FP8, Languages German and English, Tool calling Hermes-style with a vLLM parser, Licence Apache 2.0. Right column MiniCPM5 2B: Parameters 2.52B total / 1.98B non-embedding, Context 131,072 in the shipped config, Footprint a single BF16 shard, laptop-class, Languages English and Chinese, Tool calling XML-style with an SGLang parser, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; MiniCPM5 2B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

스코어보드, 그리고 그 이면의 소싱

이 조합에 대한 일대일 비교 수치는 어느 공급업체 자료에도, 어디에도 없습니다. 그리고 우리는 서로 다른 두 하네스에서 하나를 짜맞춰 그것을 비교라고 부르지 않을 것입니다. 각 측이 발표하는 내용은 신중하게 구분해 볼 가치가 있습니다. 두 수치 묶음이 담고 있는 근거의 양이 크게 다르기 때문입니다.

Kolibri의 수치는 Aleph Alpha 자체의 14개 모델 비교 표에서 나온 것으로, Kolibri를 reasoning effort high로 설정한 단일 하네스에서 실행한 결과 영어 평균 75.5, 독일어 평균 70.8을 기록했다. 그 표는 대상 모델을 치켜세우지 않는다. Qwen3.8 27B는 같은 두 평균에서 80.2와 79.9를 기록하며 GPQA Diamond, LiveCodeBench v6, SWE-Bench Verified 및 두 장문맥 벤치마크 모두에서 앞서는데, Kolibri 매개변수의 약 8분의 1만 활성화한다. 그 격차에 대한 벤더의 설명은 GPU당 초당 디코딩된 토큰 대비 품질의 파레토 프런티어이며, 비교된 모델 중 어느 것도 이를 능가하지 못한다. 이는 능력 논변이 아니라 서빙 경제성 논변이며, 제3자가 이를 측정한 적도 없다. Kolibri에 대한 Artificial Analysis 항목도 없고 하네스 복제도 없다.

MiniCPM5-2B의 수치들은 자체 모델 카드에서 나온다: 벤더가 선정한 비교 세트 전반에 걸친 내부 평균 53.9, AIME 2025/2026 86.5, MATH-500 94.6, 그리고 독립 테스트에서 살아남는다면 25억 매개변수 dense 모델로서 놀라울 벤더 실행 SWE-bench Verified 46.4. 그 카드에서 IBM의 Granite 4.2 3B는 MiniCPM5-2B의 53.9에 맞서 42.7에 있다 — 한 벤더가 자기가 고른 하나의 스위트에서 두 모델을 모두 실행한 것이다. 서로 다른 스위트, 서로 다른 하네스, 서로 다른 벤더. 이 중 어느 것도 이 조합에 대한 평결이 아니다.

MiniCPM5-2B 쪽에서 진정으로 유용한 것은 바로 공개다. OpenBMB는 가중치와 함께 UltraData 훈련 코퍼스를 공개했다 — Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, 에이전트 SFT 및 RL 세트 — 모두 Apache 2.0이며, 이는 블랙박스를 직접 살펴보고 자신의 도메인에서 이어서 훈련할 수 있는 레시피로 바꿔 놓는다. 이 모델은 또한 ModelBest의 FlagOS 커뮤니티를 통해 Huawei Ascend부터 NVIDIA와 ARM에 이르기까지 아홉 개 칩 제품군 전반에 걸친 데이제로 적응을 제공하는데, 이는 벤치마크가 아니라 배포에 관한 선언이다. 그와 대조적으로 IBM은 Granite 4.2 3B의 가중치와 구축에 관한 상세한 기술 설명을 공개했지만 훈련 데이터는 공개하지 않았고, Aleph Alpha는 Kolibri의 데이터 파이프라인과 에너지 회계 — 데이터센터 오버헤드를 포함하고 지도 미세 조정 및 강화 학습은 제외한 20조 사전 훈련 토큰, 9.5×10² MWh — 를 공개했지만 코퍼스 자체는 공개하지 않았다.

사이즈 차이가 실제로 드러나는 곳

이 둘을 나란히 비교하는 가장 유용한 방식은 실제 배포를 결정짓는 두 축, 즉 현장에 무엇이 있어야 하는가와 모델이 틀렸을 때 무슨 일이 일어나는가를 기준으로 보는 것입니다.

하드웨어에서는 MiniCPM5-2B가 압도적으로 앞선다. 25억 2천만 개 파라미터의 dense 모델이 BF16 샤드 하나에 담겨 노트북, 엣지 박스, 또는 단일 소비자용 GPU에서 실행되며, 9개 칩 계열에 걸친 FlagOS 지원 덕분에 NVIDIA 가속기가 전혀 아닌 하드웨어에서도 실행된다. Kolibri의 최소 요구 사양은 A100 80 GB 카드 두 장 또는 B200 한 장이고, 약 78 GB의 FP8 가중치를 aleph-alpha-inference vLLM 플러그인이나 공개된 컨테이너를 통해 서빙한다. 스마트 콕핏이나 스마트폰에 준하는 워크로드라면 2B가 둘 중 유일하게 조건을 충족하며, Kolibri는 애초에 그 영역에서 경쟁하도록 설계된 모델이 아니다.

검증 가능성 면에서, Kolibri는 더 미묘한 이유로 앞선다. 가장 많이 인용되는 주장인 서빙 경제성은 검증되지 않았지만, 품질 수치는 적어도 설정이 공개된 하나의 하네스에서 이름이 밝혀진 열세 개 경쟁 모델을 상대로 공개되었고, 벤더 자체 표는 대부분의 행에서 승리를 경쟁 상대에게 넘겨준다. MiniCPM5-2B의 대표 수치는 벤더의 스위트에서 벤더가 낸 것이며 비교 하네스는 공개되지 않았고, 이 모델은 며칠 된 것이 아니라 몇 주 된 체크포인트라는 추가 불확실성까지 안고 있다. 두 모델 모두 독립적으로 벤치마크된 적이 없다. 차이는 한 벤더는 자기 모델이 지게 만드는 비교를 적어 두었고, 다른 벤더는 자기 모델이 큰 차이로 이기게 만드는 비교를 적어 두었다는 점이다.

의도적으로, 경쟁은 전혀 성립하지 않는다. Kolibri는 온프레미스에서 독일어 문서 처리를 위해 존재하며, Aleph Alpha가 독일어 웹 텍스트에서 토큰당 평균 4.90바이트라고 보고한 이중 언어 토크나이저를 갖추고 있다 — 이는 GPT-5의 4.35, Kimi K3의 3.28과 대비되며, 모두 벤더 측정치이고 품질 주장이라기보다는 토큰당 비용 효과다. MiniCPM5-2B는 제한된 하드웨어에서 영어와 중국어로 도구 호출 에이전트를 위해 존재한다. 독일어 계약과 규정 준수 요건을 가진 팀은 이 둘 사이에서 선택하지 않는다.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the card header with the OpenBMB organisation and its like count, the TextGeneration, Transformers and Safetensors tags, the English and Chinese language tags, the on-device and tool-calling tags, the Apache 2.0 licence, and the model-size line reading 3B parameters in BF16 tensor type.

라우팅의 현실, 그리고 시도해 볼 가치가 있는 실험

두 모델 모두 현재 호스팅 카탈로그에 없으며, 우리는 가정하지 않고 둘 다 확인했습니다. Kolibri는 벤더 API SKU가 없습니다 — 릴리스는 가중치, 기술 보고서, 컨테이너 이미지로 구성됩니다 — 또한 OrcaRouter에 없습니다: 벤더 접두사와 모델 이름의 모든 표기를 사용해 카탈로그를 조회했지만 '찾을 수 없음'을 반환합니다. MiniCPM5-2B도 ModelBest에서 호스팅 엔드포인트가 없으며, 우리 쪽에서도 라우팅되지 않습니다. 둘 다 자체 호스팅 제안이며, 어느 하나를 제공한다고 암시하기보다 그대로 말하는 편입니다.

여기서 흥미로워지는 지점은 실험이다. 25억 개 파라미터의 에이전트형 모델과 780억 개 파라미터의 문서 모델은 서로 다른 문제를 해결하며, 여러분의 워크로드에 어느 쪽이 필요한지 알 수 있는 유일한 방법은 둘 다 그 워크로드에 대해 실행해 보는 것이다 — 이는 라우팅 레이어가 바로 이런 상황을 위해 만들어진 것이며, 두 모델을 어느 하나도 보유하지 않은 경우에도 마찬가지다. 자체 호스팅 MiniCPM5-2B 빌드를 향해 테스트 경로를 하나의 OpenAI 호환 엔드포인트를 통해 자동 장애 조치와 함께 지정하고, 프로덕션은 검증된 라우팅 모델에 그대로 두면, 새 스택이 멈추거나 엉터리 출력을 내더라도 아무것도 중단되지 않는다. 비교 대상 모델에 대한 공급자 정가는 마크업 없이 그대로 전달되므로, A/B 테스트는 저렴하고 되돌리기 쉬운 상태로 유지된다. 그리고 실험이 실제로 밝혀내는 것이 여러분의 독일어 워크로드에 두 자체 호스팅 모델이 모두 필요 없다는 사실이라면, 동일한 키로 이미 라우팅되어 있는 소규모 전문가 혼합(MoE) 계층에 접근할 수 있다 — Gemma 4 26B-A4B 변형으로, 백만 입력 토큰당 $0.06, 백만 출력 토큰당 $0.33이며, 262,144토큰 창과 텍스트, 이미지, 비디오 입력을 지원한다 — 이는 GPU 두 대를 구매하기 전에 확인할 수 있는 가장 저렴한 방법이다.

어느 것인가요, 그리고 무엇이 답을 바꿀까요?

제약 조건이 기기라면 MiniCPM5-2B를 실행하세요. 25억 2천만 개의 파라미터로, 두 모델 중 노트북, 콕핏, 엣지 박스에 적합한 유일한 모델이며, 워크로드가 영어나 중국어로 된 대화형 도구 호출 에이전트라면 바로 그 워크로드를 겨냥한 모델입니다. 먼저 그 수치를 검증할 시간을 확보하세요 — 평균 53.9와 SWE-bench 46.4 주장은 ModelBest만의 것이며, 학습 코퍼스가 공개되어 있다는 점은 그 재현을 이론이 아니라 실제로 가능하게 만듭니다.

코퍼스가 독일어이고, 하드웨어가 갖춰져 있으며, 가중치가 건물 밖으로 나갈 수 없다면 Kolibri를 실행하세요. 262,144토큰 네이티브 윈도우, FP8 KV 캐시, 네 가지 추론 노력 수준, 그리고 Hermes 도구 호출은 규제 문서 작업에 딱 맞는 형태이며, Apache 2.0 조건과 공개된 데이터 파이프라인은 조달 심사를 통과하는 부분입니다.

두 가지가 있으면 어떤 논쟁보다 이 문제를 더 빨리 매듭지을 수 있다. MiniCPM5-2B에 대한 독립적인 SWE-bench Verified 실행은 두 카드 중 어느 한쪽이 내놓는 가장 놀라운 단일 주장을 확증하거나 무너뜨릴 것이다. 그리고 Kolibri가 권장하는 H100 2장 구성에서의 독립적인 처리량 측정 — 또는 오늘날 존재하지 않는 Artificial Analysis 항목 — 은 "780억 개 파라미터"를 사양에서 비용으로 바꿔 놓을 텐데, 이는 이 비교를 하드웨어와 견주어 저울질하는 사람이라면 누구나 실제로 찾고 있는 숫자다. 그때까지 크기 격차는 실재하고, 목적 격차는 더 크며, 싸 보이는 선택지가 바로 검증되지 않은 주장을 떠안고 있는 쪽이다.

A screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the model header under Google, the 262K-token context badge, the input line reading text plus image plus video, and the community description noting 25.2B total parameters with 3.8B activated per token during inference.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트