'Intern-Decision-2B vs MiniCPM5-2B'라는 문구가 적힌 생성된 타이틀 카드, 부제는 '두 개의 2B 예산, 20일 차이', 배지는 '의사 결정 스코어러'와 '고밀도 범용 모델', 모서리에는 OrcaRouter 로고가 합성되어 있습니다.
Guides & Insights

Intern-Decision-2B vs MiniCPM5-2B: 2B 체크포인트 두 개, 20일 차이, 파라미터를 쓰는 상반된 방식

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

internlm/Intern-Decision-2B와 openbmb/MiniCPM5-2B는 크기가 같고, 출시일이 20일 차이이며, 동일한 방식으로 라이선스되고, 서로 전혀 비슷하지 않은 작업을 위해 만들어졌습니다. InternLM의 체크포인트는 2,213,241,664개의 파라미터로 이루어진 결정 스코어러입니다. 상태와 타입이 지정된 질문을 받아 한 번의 순전파를 실행하고, 토큰을 하나도 생성하지 않은 채 보정된 확률을 반환하며, 8,192토큰을 초과하는 입력은 거부합니다. OpenBMB의 것은 2,516,756,480개의 파라미터를 가진 밀집 범용 모델입니다. MiniCPM5 레시피에서 파생된 42층 Llama로, 131,072토큰의 컨텍스트를 받아들이고, 코드를 작성하고, 도구를 호출하고, 수학을 수행하며, Artificial Analysis Intelligence Index는 12.5이고 지난달 다운로드 수는 726,518회입니다. 둘은 다운로드하는 데 드는 비용은 같지만, 전혀 다른 것을 얻는 셈입니다.

이 조합에서 흥미로운 부분은 벤치마크 격차가 아니다 — 비교할 만큼 겹치는 벤치마크가 거의 없기 때문이다. 흥미로운 것은 22억 개 및 25억 개 매개변수 예산을 각각 무엇에 쓸 수 있는지, 그리고 그 선택이 어느 쪽이 완성되었는지에 대해 무엇을 말해 주는지다. MiniCPM5-2B는 5월의 MiniCPM5-1B에 이은 시리즈의 두 번째 모델이며, 완전한 릴리스 체계를 갖추고 등장했다. Intern-Decision-2B는 InternLM이 2026년 9월 26일 05:36 UTC에 아무 발표 없이 Hugging Face에 올린 세 가지 크기 중 중간 모델이며, 그 릴리스 체계 — 학습 코드베이스, 해시로 검증된 평가 번들, 96개 사례 캘리브레이션 벤치마크 — 는 오늘 아침 08:58 UTC에야 공개되었다.

두 예산이 간 곳

두 모델 모두 다른 누군가의 아키텍처를 파인튜닝한 것이고, 둘 다 대략 25억 개의 파라미터를 차지한다. 닮은 점은 거기까지다.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the OpenBMB organisation, the tags Text Generation, Transformers, Safetensors, English, Chinese, llama, minicpm5, long-context, tool-calling, on-device and edge-ai, an Apache 2.0 licence, the MiniCPM Tech Report, MiniCPM Wiki, GitHub Repo, UltraData and Online Demo links, and the model title.

MiniCPM5-2B는 42개 레이어, 은닉 크기 2,048, 16개 어텐션 헤드, 중간 크기 6,144, 130,560개 토큰 어휘, 131,072개 토큰 컨텍스트를 갖춘 dense Transformer로, OpenBMB가 함께 공개한 개방형 코퍼스 혼합물로 학습되었습니다: 웹 사전 학습용 UltraX, L0–L3 계층형 코드 관리를 갖춘 UltraData-Code, UltraData-Math, 그리고 UltraData-RL-2609의 80,000개 이상 RL 샘플과 함께 500,000개 에이전트 SFT 샘플. 사후 학습은 SFT를 실행한 다음, 수학, 코드 및 에이전트 작업에 특화된 RL 교사들을 거친 후, 다시 하나의 모델로 온폴리시 증류를 수행합니다. 이는 전체 파라미터 예산이 프롬프트할 수 있는 능력으로 노출되는 범용 모델입니다.

Intern-Decision-2B는 24개 계층을 가진 Qwen3_5ForConditionalGeneration입니다 — 세 개의 선형 어텐션 계층 대 하나의 전체 어텐션 계층이 반복되는 패턴 — 은닉 크기 2,048, 8개의 쿼리 헤드 대 2개의 키-값 헤드, 헤드 차원 256, 유지된 멀티 토큰 예측 계층, 그리고 262,144 위치 임베딩 상한을 갖습니다. 여기에는 612.5 MB 비전 타워와 50.3 MB 프로젝터가 함께 제공됩니다. 그 예산 중 프롬프트로서 당신에게 주어지는 것은 거의 없습니다: 이 모델은 고정된 질문 스키마에 답하며, 그 아키텍처는 텍스트 생성기가 아니라 소프트맥스를 전달하는 메커니즘입니다.

InternLM이 새로 공개한 저장소에서 짚고 넘어갈 만한 세부 사항이 하나 있는데, 이는 모델 카드의 멀티모달 태그를 다시 해석하게 해 주기 때문입니다. 디시전 튜닝은 "Qwen3.5의 언어 백본을 미세 조정하면서 비전 타워와 프로젝터는 동결합니다." 2B와 4B 디시전 체크포인트 모두 정확히 612,517,440바이트의 비전 샤드를 포함하며, 이 크기는 두 모델에서 동일합니다. 이는 해당 구성 요소가 학습된 것이 아니라 Qwen 베이스에서 상속되었음을 시사합니다. 이미지 경로는 실제로 존재하고 사용할 수 있지만, InternLM의 디시전 튜닝이 공을 들인 대상은 아닙니다. 워크로드가 텍스트 전용 디시전 스코어링이라면, 4.46GB 다운로드 중 약 660MB는 당신에게 아무 역할도 하지 않습니다.

점수판

A two-column comparison scoreboard titled 'Intern-Decision-2B vs MiniCPM5-2B'. The left column reads: Parameters 2,213,241,664 plus vision tower; Context 8,192 tokens, refused above; Output calibrated probabilities, no text; Modality text plus up to 8 images; Published evidence vendor table, unreproduced; Adoption one like, zero downloads. The right column reads: Parameters 2,516,756,480 dense; Context 131,072 tokens; Output generated text, token by token; Modality text only; Published evidence OpenBMB card, AA Index 12.5; Adoption 726,518 downloads last month. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the MiniCPM5-2B figures are OpenBMB's own card plus an independent Artificial Analysis index.

• 매개변수 — Intern-Decision-2B는 BF16 기준 2,213,241,664개에 비전 타워와 프로젝터 약 660MB를 더한, 리포지토리 약 4.46GB; MiniCPM5-2B는 BF16 기준 2,516,756,480개로, 5.03GB safetensors 파일 하나.

• 컨텍스트 — Intern-Decision-2B의 경우 8,192토큰이며, 그 이상은 잘림 없이 거부됨; MiniCPM5-2B의 경우 131,072토큰.

• 출력 — 각 필드에 대해 보정된 분포와 argmax, 텍스트는 전혀 없음; 생성된 텍스트, 토큰 단위로.

• 학습 — 비전 타워를 동결한 Qwen3.5-2B 백본의 결정 튜닝, 학습 데이터 비공개; 전체 사전 학습, 중간 학습, 4,000억 토큰 딥싱킹 SFT 패스에 이어 RL과 온폴리시 증류를 수행했으며, 코퍼스도 함께 공개.

• 공개된 근거 — 7개 스위트로 구성된 벤더 표는 평균 84.68, Brier 0.437, ECE 0.100을 기록했으나 어떤 제3자도 재현하지 못했고, 좋아요 1개에 다운로드 0회; OpenBMB 카드는 자체 비교 세트 내에서 평균 53.9, 독립적인 Artificial Analysis Intelligence Index는 12.5이며, 지난달 다운로드 수는 726,518회.

• 라이선스 — Apache-2.0이며 업스트림 Qwen 약관은 LICENSE-QWEN으로 유지되며, 코드 저장소에는 라이선스가 전혀 명시되어 있지 않음. 코드를 포함해 전체가 Apache-2.0.

각각이 실제로 더 잘하는 것, 그리고 그 차이는 크다

그 비교는 범주 오류라고 할 정도로 비대칭적이므로, 각 작업을 명명하는 편이 더 유용하다.

MiniCPM5-2B는 답을 선택하는 것이 아니라 생성하는 모든 작업에서 승리한다. 코드를 작성한다. Intern-Decision-2B에는 코드 경로가 없다. 131,072토큰 컨텍스트를 처리한다. Intern-Decision-2B는 8,192에서 멈추고 크게 실패한다. 도구를 호출하며, OpenBMB 자체 표에서 BFCL v4 점수 66.6을 기록하고, 수학도 수행한다. MATH-500에서 94.6, GPQA-Diamond에서 70.2를 기록한다 — 벤더 카드의 수치이며, GPQA 행에는 카드 자체가 제공하는 각주가 붙어 있다. MMLU-Pro에서 70.8, MMLU-Redux에서 84.7을 지원한다. llama.cpp와 MLX에서 실행되고, GGUF, GPTQ, DSpark 변형으로 제공되며, Intern-Decision의 카드가 가리키는 401과 달리, Hub에 공개된 데모 Space가 있다.

Intern-Decision-2B가 확실히 이기는 것은 정확히 두 가지이며, 그것들이 이 모델이 존재하는 이유다. 첫째, 사용자가 작성한 스키마를 가진 폐쇄 집합 결정은 임계값을 적용할 수 있는 확률을 단일 순전파에서 약 33밀리초 만에 파서도 샘플링도 없이 반환한다. 이는 MiniCPM5-2B가 텍스트를 생성하고 그 안의 숫자가 잘 나오기를 바라는 것 외에는 만들어낼 수 없는 형태다. 둘째, 이는 재현 가능한 아티팩트다. 저장소에는 이제 학습 목표, SHA-256 해시와 스위트별 행 수를 포함한 7개 정확도 스위트, 채점 코드, 온도 피팅 및 리플레이 스크립트, 그리고 자체 생성기와 오프라인 채점기를 갖춘 96개 사례 분포 캘리브레이션 벤치마크가 포함되어 있다. InternLM의 평가 가이드는 공개된 프리셋이 XTuner 백엔드에 묶여 있으며 HF 결과는 다른 실행 설정으로 보고해야 한다고 명시한다. 이는 바로 재현 키트가 확인 가능하게 만들기 위해 존재하는 종류의 주의사항이다.

A screenshot of the GitHub repository page for InternLM/Intern-Decision, showing the organisation and repository breadcrumb, the description 'Fast multi-modal decision model', 5 stars and 0 forks, the file tree with assets, benchmarks, configs, docs, runtime, scripts, src and tests directories plus a release-manifest.json, and a commit list headed by 'Add demonstration videos and centered README links' roughly an hour old.

누가 어떤 것을 다운로드해야 하나요?

긴 글을 읽거나, 무언가를 작성하거나, 선택지를 미리 나열하지 않은 질문에 답하는 작업이라면 MiniCPM5-2B가 바로 그 모델이며 고민할 필요가 없습니다. 이 모델은 실제 생태계와 이를 뒷받침하는 공개 데이터, 독립적인 평가 목록을 갖춘 완성된 2B급 범용 모델이고, 시도하는 데 비용이 들지 않습니다 — GGUF 및 MLX 빌드는 이미 Hub에 있습니다.

티켓 라우팅, 지원 이메일 분류, 후보자 레이블링, 의도를 순서형 척도로 점수화하는 것처럼 알려진 답 중에서 선택하는 작업이 진짜라면, 생성 모델은 잘못된 도구이며, Intern-Decision-2B가 거의 아무도 실행해 보지 않았음에도 둘 중 더 흥미로운 쪽입니다. 임계값을 적용할 수 있는 확률은 운영 비용이 더 저렴하고, 감사하기 더 쉬우며, 환각을 일으키는 것이 불가능합니다. 그리고 그 체크포인트가 리더보드 게시물이 아니라 재현 키트와 함께 나왔다는 사실은, 그 선택을 정당화해야 할 때 중요한 축에서 이 모델이 둘 중 더 잘 문서화되어 있게 만듭니다.

두 모델 모두 OrcaRouter에 없습니다. Intern-Decision-2B용 모델 페이지는 404를 반환하고 MiniCPM5-2B 라우트도 없습니다. 여기에서 가용성을 주장하는 내용은 전혀 없으며, 두 경우 모두 자체 추론을 실행해야 한다는 뜻입니다. 실질적인 대안이 존재하는 곳은 호스팅된 결정 모델입니다: TypeSafe의 Jev 1.13, InternLM이 자사 제품군 전체를 벤치마킹 대상으로 삼은 모델이며, 카탈로그에 백만 입력 토큰당 $0.042, 65K 컨텍스트, P50 첫 토큰 도달 시간 178ms로 등록되어 있습니다. 그리고 운영 부담 없이 MiniCPM5-2B와 같은 크기 등급의 범용 모델이 필요하다면, 저희의 가장 작은 호스팅 Qwen 라우트는 크기가 몇 배 더 크지만 200개 이상의 모델 중 하나의 키이며, 마크업 없이 그대로 전달되는 제공업체 정가 그리고 자동 페일오버가 그 뒤를 받쳐줍니다.

결정짓는 단 하나의 숫자

그것은 84.68 대 53.9가 아니다. 그 두 평균은 서로 다른 평가 스위트에서 나온 것이고, 서로 다른 연구소에서 측정했으며, 한 경우에는 숫자가 한 번도 검증된 적 없는 연구소에서 측정했다. 그것을 결정하는 숫자는 8,192다. 당신의 상태가 8,000토큰 안에 들어가고 답이 이미 목록이라면, Intern-Decision-2B는 재현 키트를 갖춘 정밀 도구이며, 알아 두어야 할 캘리브레이션 이상이 있다 — InternLM이 공개한 세 가지 크기 중 기대 캘리브레이션 오차 0.100으로 가장 나쁘고, 크기가 절반인 모델은 0.066이므로, 신뢰도 값을 믿기 전에 자체 temperature를 피팅하라. 당신의 상태가 들어가지 않는다면, 그 질문은 벤치마크가 시작되기도 전에 끝나며, MiniCPM5-2B가 답이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트