'MiniCPM5-2B vs Qwen 3 8B' 히어로 타이틀 카드, 부제 '8B 워크호스의 작업 부하를 2.5B로 내려도 될까?', 세 개의 칩: '2.5B vs ~8.2B', '119개 언어 vs 영어/중국어', '16개월의 검증 vs 1주일', 그리고 상단 리본 '오픈 웨이트 대결 · 2026년 9월'.
Guides & Insights

MiniCPM5-2B vs Qwen 3 8B: 8B 워크로드를 2.5B로 내려야 할까?

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

모든 모델 비교 뒤에는 하드웨어 질문이 숨어 있다. MiniCPM5-2B와 Qwen 3 8B를 견주는 일은 그 질문이 벤치마크라는 의상을 입고 등장한 것이다. Qwen 3 8B는 알리바바가 2025년 4월에 공개한 오픈 웨이트 주력 모델로, 약 82억 개의 밀집 파라미터, 119개 언어, 요청별 하이브리드 추론 온오프, 그리고 16개월간의 커뮤니티 검증 이력을 보유한다. MiniCPM5-2B는 ModelBest와 OpenBMB가 7월 19일 World Artificial Intelligence Conference에서 Artificial Analysis의 리더보드에서 4B 미만 최상위 모델로 발표한 모델이며, 공개된 가중치는 9월 6일과 7일에 조용히 Hugging Face에 실렸다. 두 모델이 정말로 같은 페이지에서 비교되게 만든 질문, 그것은 오픈 8B를 운영하는 대부분의 팀이 어느 지점에서든 스스로에게 던지는 질문이다. 현재 8B로 서빙하는 워크로드를 2.5B로 내릴 수 있을까—그리고 가능하다면 우리는 무엇을 포기하게 될까?

간단한 답은 대부분의 워크로드에서 아직 "그렇다"가 아니라는 것이다. 그러나 그 이유는 네 배 크기 차이가 시사하는 것보다 더 좁으며, 8B가 전혀 답을 내놓지 못하는 배포 유형도 하나 존재한다. 아래의 모든 정량적 수치는 벤더가 보고한 것이며 그렇게 명시되어 있다. MiniCPM5-2B의 수치는 ModelBest 자체 모델 카드 주장으로, 일주일 전에 나온 것이며 연구소 밖에서는 아무도 재현하지 못했다. Qwen 3 8B의 수치는 Alibaba의 것으로, 대규모 커뮤니티가 오래전부터 검증·양자화·재실행해 왔다. 이러한 증거의 비대칭성이 이번 대결의 진짜 핵심이다.

Qwen 3 8B의 16개월

Qwen 3 8B는 동일한 아키텍처 계열에 속하며 경쟁 모델보다 세 배 더 크고 16개월 더 오래된 모델이다. grouped-query attention을 적용한 dense causal transformer로, 약 36조 토큰 규모의 다국어 말뭉치로 사전 학습되었고 Apache-2.0 라이선스로 공개되었다. 오픈 가중치(open-weights) 생태계에서 가장 널리 자체 호스팅·서빙되는 8B 모델 중 하나이기도 하다. 이 모델의 상징은 Qwen3의 하이브리드 추론 모드로, 요청별로 thinking을 켜거나 끌 수 있어 단일 배포만으로 간단한 질문에는 빠르게 답하고 수학이나 코드 문제에 대해서는 신중한 chain-of-thought로 전환할 수 있다. 네이티브 Model Context Protocol과 함수 호출을 지원하며, 기본 컨텍스트는 32K로 알리바바가 YaRN 스케일링을 통해 131K까지 확장을 검증했고, 119개 언어와 방언을 지원한다. 출시 16개월이 지난 지금, 실패 모드는 문서화되어 있고 양자화 버전도 어디서나 존재하며, vLLM, SGLang, llama.cpp, 수천 개의 파인튜닝 등 주변 서빙 스택도 성숙했다. 실용적인 양자화 수준에서는 수 GB의 메모리로 동작해 중간급 GPU 한 대에서도 충분히 실행되지만, 휴대폰에서는 돌아가지 않는다.

Screenshot of the Hugging Face model card for Qwen/Qwen3-8B, showing the Qwen org header, the Apache-2.0 license tag, Transformers and Safetensors tags, and the opening of the model card describing Qwen3's seamless switching between thinking mode and non-thinking mode within a single model (captured September 7, 2026).

MiniCPM5-2B가 그 세계 속으로 주장하는 것

MiniCPM5-2B는 정반대 방향에서 접근한다. 설계상 작고, 훈련을 통해 에이전틱(agentic)한 모델이다. 총 2.52B 파라미터(비임베딩 1.98B)를 가진 덴스 트랜스포머로, 히든 크기 2048에서 42개 레이어, 그룹 쿼리 어텐션(grouped-query attention)을 사용하며, 커스텀 커널이 없는 표준 LlamaForCausalLM 아키텍처를 채택한다. 출시 구성에서 컨텍스트 창은 131,072개 토큰이다(7월 출시 자료는 512K를 내세웠지만, 실제 공개된 구성에는 그 값이 없다). Qwen 3 8B가 36조 토큰 규모의 다국어 사전학습에서 폭(breadth)을 얻는 반면, MiniCPM5-2B는 사후 훈련(post-training)에서 형태(shape)를 얻는다. 즉 400B 토큰의 심층 사고(deep-thinking) 데이터로 SFT(지도 미세조정)를 수행한 뒤, RL 전문가 모델 16개(그중 5개는 에이전틱)를 하나의 작은 덴스 네트워크로 압축하는 온-폴리시 증류(On-Policy Distillation)를 적용한다. 출시 당시 내세운 핵심은 온디바이스 에이전트 베이스로, XML 스타일 호출을 기반으로 한 네이티브 도구 호출(tool calling), 9개 칩 제품군과 ARM을 아우르는 출시 당일(day-zero) 적응, 빠른(fast) 모드와 숙고(deliberate) 모드의 하이브리드 방식이 특징이었다. 모델 카드는 벤더가 선정한 2B~4B 비교 세트에서 내부 평균 53.9, AIME 2025/2026에서 86.5, 그리고 SWE-bench Verified에서 벤더 실행 기준 46.4를 기록했다고 주장한다. 이 SWE-bench 점수는 2.5B 규모로는 매우 이례적이며, 독립적인 테스트에서도 그대로 확인된다면 더욱 주목할 만하다.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

불일치, 차원별로

• 릴리스 — MiniCPM5-2B: 2026년 7월 19일 발표, 가중치는 9월 6~7일 공개. Qwen 3 8B: 2025년 4월 발표.

• 크기 — {{1}}MiniCPM5-2B: 총 2.52B / 비임베딩 1.98B, dense.{{/1}} {{2}}Qwen 3 8B: 약 8.2B, dense.{{/2}}

• 맥락 — MiniCPM5-2B: 기본 구성에서 131,072개의 토큰. Qwen 3 8B: 기본 32K, YaRN을 통해 131K 검증됨.

• 언어 — MiniCPM5-2B: 영어와 중국어 중심. Qwen 3 8B: 119개 언어 및 방언.

• {{1}}추론{{/1}} — MiniCPM5-2B: 고속·숙고 하이브리드 모드(출시 자료 기준). Qwen 3 8B: 요청에 따라 Qwen3 추론 모드 켜기/끄기 가능.

• 근거 — MiniCPM5-2B: 공급업체 카드, 독립 실행 없음. Qwen 3 8B: 알리바바 보고, 16개월간의 커뮤니티 재현 및 배포.

A comparison scoreboard titled 'MiniCPM5-2B vs Qwen 3 8B — the scoreboard', with left column rows 'Release: Announced Jul 19 · weights Sep 6', 'Params: 2.52B dense', 'Context: 128K in shipped config', 'Languages: English / Chinese centered', 'Reasoning: Hybrid fast / deliberate, claimed', 'Evidence: Vendor card · no independent run', and right column rows 'Release: April 2025 · mature', 'Params: ~8.2B dense', 'Context: 32K native · 131K YaRN', 'Languages: 119 languages', 'Reasoning: Thinking on / off per request', 'Evidence: 16 months community-tested', with a footer reading 'MiniCPM5-2B figures are ModelBest card claims; Qwen 3 8B figures are Alibaba's, community-exposed.'

위의 스코어보드는 불일치를 정직하게 보여 줍니다. 열들은 공개된 Apache-2.0 라이선스를 제외한 거의 모든 면에서 차이가 나며, 배포 대상 기기 등급이 어느 열을 선택할 수 있는지조차 결정합니다.

8B가 여전히 이기는 곳

모델 체급을 한 단계 내리면 세 가지 구체적인 것을 포기하게 된다. 첫째, 언어다. Qwen 3 8B는 119개 언어를 지원한다. MiniCPM5-2B의 모델 카드와 데이터는 영어와 중국어에 집중되어 있으며, 폭넓은 다국어 지원을 주장하지 않는다. 롱테일 언어를 서비스하는 제품에게 그것은 부드러운 벽이 아니라 단단한 벽이다. 둘째, 검증 근거다. 16개월간의 커뮤니티 테스트 덕분에 Qwen 3 8B의 동작은 잘 알려져 있고 생태계는 어디에나 있다. 반면 MiniCPM5-2B는 일주일밖에 안 된 저장소(repo)와 검증되지 않은 모델 카드를 가진 모델이며, 그 대표 수치들은 독립적인 실행에서 살아남지 못하면 조용히 개정되는 바로 그런 종류다. 셋째, 서빙 스택이다. 이미 Qwen 3 8B와 연동되는 모든 도구는 성숙한 대상을 향한다. 그러나 새로운 2B급 체크포인트는 양자화, 서빙 설정, 도구 호출 동작을 처음부터 다시 검증해야 함을 의미한다. 이 중 어느 것도 2B가 특정 벤치마크에서 이길 수 없는 이유가 아니다. 그것들은 8B가 들어맞는 곳이라면 어디서든 더 낮은 위험의 기본값이 되는 이유다.

2B가 유일한 답인 곳

8B가 애초에 맞지 않는 기기 등급에서는 그런 고민은 의미가 없다. 스마트폰, 스마트 콕핏 보드, DRAM이 몇 기가바이트밖에 안 되는 소형 엣지 박스에서 Qwen 3 8B는 MiniCPM5-2B와 경쟁하는 게 아니라, 유용한 속도로는 아예 배포가 불가능하다. 2B가 존재하는 이유가 바로 그것이고, 이 대결을 정직하게 규정하는 방식도 '2B가 8B만큼 좋은가'가 아니라 '내 배포 중 어느 쪽이 둘 중 하나로만 서비스될 수 있는가'다. 메모리 버스가 80억 개의 가중치에 질식할 온디바이스 에이전트를 출시하는 상황이라면, MiniCPM5-2B는 가장 공격적으로 훈련된 2B급 옵션 중 하나이며, 물어볼 가치가 있는 유일한 질문은 그 에이전트적 주장이 직접 재현해 봐도 성립하는지다. 워크로드가 이미 8B를 무리 없이 감당하는 하드웨어에서 돌아간다면, 크기 차이만으로 마이그레이션할 이유는 없다. 근거 격차도 마이그레이션에 반대하는 셈이다.

전환을 고려하고 계신다면

이동을 안전하게 테스트하는 방법은 그것을 마이그레이션이 아니라 실험이라고 보는 것이다. MiniCPM5-2B를 자체 하드웨어에서 서빙하고, 자동 장애 조치가 있는 하나의 API를 통해 실제 트래픽의 일부를 그쪽으로 보낸 뒤, 동일한 요청에 대해 8B와 비교 측정하라 — 일주일 된 체크포인트는 프로덕션을 중단시키지 않으면서도 멈추거나 루프에 빠질 수 있기 때문에, 라우팅 계층이 여기서 제 역할을 한다. 그리고 비교 대상으로 삼는 호스팅 모델들의 공급업체 공시 가격은 0% 마크업으로 통과된다. 당신이 실제로 테스트하는 것은 세 가지다: 2B의 정확도가 당신의 데이터에서 유지되는지, 당신의 기기 등급에서의 지연 시간이 다른 방법으로 구매했을 하드웨어에서의 8B보다 나은지, 그리고 영어-중국어 언어 프로필이 실제 사용자들을 커버하는지다. 먼저 SWE-bench나 자체 평가 세트의 일부를 재현하라 — 거기에 드는 두 시간은 이 맞대결이 제공하는 가장 저렴한 보험이다.

평결

Qwen 3 8B을 다국어 작업, 16개월간의 검증된 동작이 필요한 모든 작업, 또는 8B를 무리 없이 구동하는 하드웨어에서 이미 서비스 중인 모든 워크로드에는 계속 사용하십시오. MiniCPM5-2B는 대상 기기가 8B를 전혀 구동할 수 없는 경우에만, 또는 에이전트 및 장문 컨텍스트 작업에서 성능을 유지하는 2.5B가 이미 출시한 하드웨어의 메모리와 전력을 절감할 수 있게 해주는 경우에만 진지하게 테스트하십시오. {{1}}서브-4B 랭킹 선두는{{/1}} 진정한 성과이며, {{2}}오픈 가중치 출시로{{/2}} 오늘 바로 테스트할 수 있습니다. {{3}}하지만 현재 이용 가능한 증거에 따르면{{/3}}, {{4}}이미 그 자리를 입증한{{/4}} 8B 워크호스를 은퇴시킬 이유는 아직 아닙니다.