
MiniCPM-V 4.7 vs Microsoft Mage-VL: 비전 모델의 프레임당 비용은 얼마여야 하는가에 대한 두 가지 매우 다른 베팅
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
MiniCPM-V 4.7과 Microsoft Mage-VL은 둘 다 토큰을 절약해 준다고 주장하는 비전-언어 모델이며, 정반대 경로를 통해 그 목표에 도달한다. Microsoft가 2026년 7월 25일에 공개한 Mage-VL은 비디오 쪽을 공략한다. 비디오 코덱의 구조를 빌려와 모든 앵커 프레임 패치와 실제 모션을 담은 예측 프레임 패치만 유지하며, 균일 프레임 샘플링 대비 최대 3.5배의 실제 시간 기준 속도 향상과 함께 75% 이상의 비주얼 토큰 감소를 주장한다. OpenBMB가 2026년 10월 6일에 업로드한 MiniCPM-V 4.7은 시퀀스 쪽을 공략한다. 352억 개 파라미터의 희소 MoE로, 40개 레이어 중 30개가 선형 어텐션 경로에 있어 256K 컨텍스트 전반에서 KV 캐시가 천천히 증가하게 한다. 한 모델은 보는 것을 압축한다. 다른 모델은 기억하는 것을 압축한다. 그리고 둘 중 하나만이 당신이 평가할 수 있는 무언가를 함께 제공한다.
각각이 무엇인지
Microsoft Mage-VL은 코덱 네이티브(codec-native)이자 능동적 스트리밍(proactive-streaming)을 지원하는 4B 규모의 멀티모달 파운데이션 모델로, 기술 보고서와 방대한 평가 섹션을 포함해 Apache-2.0 라이선스로 공개되었다. 이는 저자들이 VLM의 모라벡 역설(Moravec's paradox)이라고 부르는 것 — 오프라인 추론에는 강하지만 실시간 지각에는 느리다는 문제 — 에 맞서 의도적으로 설계되었다. 시각 인코더인 Mage-ViT는 웹 사전학습된 ViT에서 초기화하는 대신 약 1억 장의 레이블 없는 이미지와 비디오로 완전히 처음부터 학습되었으며, 이 스택에서 유일하게 사전학습된 구성 요소는 Qwen3-4B-Instruct-2507 언어 백본뿐이다. 전체 체크포인트는 별도의 변형 없이 이미지 이해, 오프라인 비디오 추론, 이벤트 게이트 방식의 스트리밍 해설을 수행하는 단일 통합 모델이며, 함께 제공되는 microsoft/Mage-ViT 릴리스는 인코더를 단독으로 제공한다. 출시 이후 약 10,600회의 다운로드와 420개의 좋아요를 기록했다.
MiniCPM-V 4.7은 openbmb/MiniCPM-V-4.7-35B-A3B, 35,212,875,824개 파라미터의 BF16 체크포인트로, 총 70.4GB의 16개 샤드로 구성되어 있으며, Transformers 5.2.0으로 작성되었고 2026년 10월 6일에 업로드되었으며, 모델 카드는 없습니다.

텍스트 구성은 qwen3_5_moe_text 태그가 붙어 있으며, 전문가 256개와 토큰당 8개 활성 전문가를 사용합니다. 이 모델의 layer_types 배열은 40개 계층에 걸쳐 전체 어텐션 계층 하나마다 선형 어텐션 계층 세 개를 배치합니다. 비전 타워는 자체 개발한 minicpmv4_7_vision으로, 27개 계층에 16× 다운샘플링을 적용하고 최대 9개의 이미지 슬라이스를 지원합니다. 컨텍스트는 256K입니다. 이 저장소는 다운로드 0회, 좋아요 3개, 벤치마크 없음, 라이선스 없음입니다.
독자가 확인할 수 있는 6개의 행
양측 모두 동일한 여섯 가지 차원. 숫자가 존재하지 않는 경우, 그 공백은 눈에 보이도록 남겨진다.
• 매개변수 — Mage-VL: 4.74B, 밀집형, 토큰당 모두 활성. MiniCPM-V 4.7: 총 35.2B, 희소형, 토큰당 256개 전문가 중 8개. MiniCPM의 수치는 밀집형 모델의 수치와 직접 비교할 수 없습니다.
• 라이선스 — Mage-VL: Apache-2.0, 카드와 저장소 태그에 명시됨. MiniCPM-V 4.7: 선언된 바 없음.
• 토큰 절감이 어디서 나오는가 — Mage-VL: 인코더 단계에서의 시각 토큰 희소성, 코덱에 정렬된 방식으로, 75% 이상 감소를 주장. MiniCPM-V 4.7: 디코더 단계의 선형 어텐션으로, 긴 시퀀스에서 KV 캐시 증가폭을 줄여 주지만 입력으로 넣는 토큰 수 자체를 줄이지는 않는다.
• 컨텍스트 — Mage-VL: 최대 384 또는 768 프레임의 롤링 코덱 윈도우로 350K 비디오에 대해 장문맥 단계를 거쳐 학습되었습니다. MiniCPM-V 4.7: max_position_embeddings: 262144.
• 비전 인코더 출처 — Mage-VL: 처음부터 학습했으며 약 1억 개의 레이블 없는 프레임으로 훈련됨; 카드에는 256개 토큰으로 ImageNet 85.69%를 보고하고 토큰 예산에 따라 단조적으로 개선된다고 나와 있음. MiniCPM-V 4.7: 계보 타워는 MiniCPM-V 4.6의 설계에서 재사용되었으며 동일한 1152-hidden, 27-layer 형태이고 기본 16x 다운샘플을 사용함.
• 증거 — Mage-VL: DocVQA 95.14, InfoVQA 80.33, OCRBench 81.80, ChartQAPro 32.57, MMStar 67.32, CV-Bench-3D 94.75가 포함된 전체 결과표와 Qwen3-VL-4B 대비 +53.1 CrossPoint 격차를 제시하며, 모두 동일한 백본을 기준으로 벤더가 보고한 수치입니다. MiniCPM-V 4.7: 없음.
• 스트리밍 동작 — Mage-VL: 각 롤링 윈도우에 점수를 매기고 이벤트가 완료될 때까지 침묵하는, 약 330만 개의 스트리밍 샘플로 학습된 인지 게이트. MiniCPM-V 4.7: 어디에도 설명되어 있지 않음.

모두가 Mage-VL의 수치에 대해 잘못 알고 있는 부분
Mage-VL 카드의 벤치마크 표는 강력하며, 가장 강력한 것들은 동시에 가장 쉽게 오독되는 것들이기도 하다. 비교 행은 Mage-VL-4B를 Qwen3-VL-4B, Phi-4-Multimodal-Instruct, Phi-4-Reasoning-Vision과 맞붙인다. 그리고 대표적인 향상폭 — QVHighlight에서 +22.5, VideoEval-Pro에서 +24.5, CrossPoint에서 +53.1 — 은 벤더의 표에 등장한다는 의미에서는 실제다. 그것들은 또한 모델을 학습시킨 팀이 동일한 하네스에서 산출한 벤더 자체 측정치다. 어떤 독립적인 주체도 이를 재현하지 않았다. 이는 출시된 지 네 달 된 모델에게는 정상이며 그 모델을 깎아내리는 요소는 아니다. 하지만 올바른 동사는 "scores"가 아니라 "reports"라는 뜻이다.
테이블 밖에서도 인정할 만한 점이 두 가지 있습니다. 첫째, 매치드 백본 설계 — Qwen3-4B 디코더를 고정하고 ViT만 교체하는 방식 — 는 리더보드 순위보다 더 깔끔한 증거입니다. 이는 전체 시스템이 아니라 비주얼 스택을 분리해내기 때문입니다. 둘째, Mage-ViT의 학습 코퍼스는 약 1억 개의 레이블 없는 프레임으로, 웹 사전학습 인코더가 사용하는 수십억 개의 이미지-텍스트 쌍과 대비됩니다. 따라서 클러스터 구분에서 SigLIP2-at-10B-class 동작을 맞춘다는 것은 일반적인 자랑이 아니라 데이터 효율성에 관한 구체적이고 검증 가능한 주장입니다.
MiniCPM-V 4.7에는 이 중 어느 것도 없습니다. 더 약한 버전이 아니라—전혀 없습니다.

공급업체 제공 여부와 관계없이 어떤 테이블도 없으며, 아키텍처를 설명하는 구성 파일은 정확성에 관해서는 스스로 아무것도 말하지 않는다는 점을 명시적으로 밝히고 있다.
아키텍처: 같은 질문에 대한 두 가지 답변
두 모델 모두 "멀티모달 추론을 어떻게 저렴하게 만드는가"라는 질문에 답하려고 하며, 그 대비는 두 답변이 경쟁하는 것이 아니라 서로를 보완하기 때문에 교훈적이다.
Mage-VL은 입력을 축소합니다. 16×16 패치 그리드는 앵커 프레임과 예측 프레임 간에 공유되며, 예측 프레임은 코덱이 비트를 소비하는 곳, 즉 모션과 새로운 디테일이 발생하는 곳에만 패치를 제공합니다. 그 결과 프레임마다 가변 길이의 토큰 스트림이 만들어지는데, 이것이 바로 이 스택에 가변 시퀀스를 인과적 디코더로 넘겨줄 수 있는 프로젝터가 필요한 이유이며, 동일한 인터페이스가 재학습 없이 H.264/HEVC 모션 벡터나 신경망 코덱의 학습된 레이트 맵을 받아들일 수 있는 이유이기도 합니다. 이어서 3D 로터리 인코딩이 이러한 희소성 전반에서 시공간 위치를 일관되게 유지합니다. 관리 대상이 되는 양은 토큰 예산입니다.
MiniCPM-V 4.7은 상태를 줄입니다. 선형 어텐션 레이어는 증가하는 키-값 캐시 대신 고정 크기의 순환 상태를 유지하므로, 긴 대화의 메모리 비용이 토큰 수에 따라 선형으로 증가하는 것을 멈춥니다. 관리되는 양은 시퀀스 예산이며, 그 이득은 256K 컨텍스트입니다. 특히 MiniCPM-V 4.7의 구성은 16x 시각 다운샘플을 광고하며 — 입력도 압축합니다 — 하지만 MiniCPM-V 4.6이 제공했던 전환 가능한 4x 모드를 유지하는지에 대해서는 언급하지 않습니다.
간단히 말해: Mage-VL의 기법은 대부분의 프레임이 이웃 프레임과 거의 동일한 비디오에서 효과를 발휘한다. MiniCPM-V 4.7의 기법은 토큰이 누적되는 긴 문서와 긴 멀티턴 세션에서 효과를 발휘한다. 라이브 스트림을 입력으로 받아들인 뒤 그에 대해 긴 대화를 나누는 파이프라인이라면 두 가지 이점을 모두 누릴 수 있겠지만, 어느 모델도 아직 상대방의 역할을 해내지 못한다.
이들을 실제 워크플로에 서빙하기
Mage-VL은 오늘 바로 사용해 볼 만큼 실용적입니다: 단일 체크포인트, 문서화된 아키텍처, Apache-2.0, 그리고 저장소에 무엇이 포함되어 있는지 알려주는 카드까지 갖추고 있습니다. 7월부터 공개되어 있었고, 이를 둘러싼 툴링도 자리를 잡을 시간이 충분했습니다.
MiniCPM-V 4.7은 오늘 당장 시도해 보기에는 실용적이지 않습니다. 시시한 이유들 때문이죠. 양자화 없이 BF16으로 70GB라면, 여러분이 아마 유휴 상태로 두고 있지 않을 가속기 메모리가 필요하다는 뜻이고, 라이선스 부재는 이를 사용할 수 있는지 자체가 미해결이라는 뜻입니다. 사용자 지정 코드 경로에는 trust_remote_code가 필요하며, MoE와 선형 어텐션의 조합이 여러분의 서빙 스택에 커널을 갖추고 있는지는 검증되지 않았습니다.
두 경우 모두에 해당하는 사실은 자체 호스팅 비전 모델이 호스팅되는 쪽도 함께 호출해야 하는 시스템의 한 구성 요소라는 점입니다. 그렇기 때문에 호스팅되는 절반을 두 번째 계약과 두 번째 SDK가 아니라 단일 라우터 뒤에 두는 것이 합당합니다: OrcaRouter는 하나의 키로 200개 이상의 모델에 접근할 수 있게 해 주고, 각 제공업체의 정가를 저희가 마진을 붙이지 않고 그대로 전달하며, 제공업체가 성능 저하를 보일 때 자동으로 페일오버합니다. Mage-VL도 MiniCPM-V 4.7도 해당 서비스의 호스팅 모델이 아닙니다 — 둘 다 직접 서빙하는 가중치입니다 — 따라서 이것을 두 모델 중 어느 쪽을 위한 가용성 채널이 아니라 핸드오프 반대편의 배관으로 취급하세요.
평결
Mage-VL은 완성되고 라이선스가 부여되었으며 벤치마크까지 마친 모델로, 구체적이고 잘 논증된 설계 철학을 갖고 있으며, 그 근거는 자사의 코덱 네이티브 인코더가 다른 누구와도 구조적으로 다른 일을 해내는 비디오 스트리밍과 공간 추론에 있습니다. MiniCPM-V 4.7은 더 크지만 라이선스가 없고 측정되지 않은 체크포인트로, 설계 철학은 읽히지만 그 동작은 백지 상태입니다. 오늘 독자가 실제로 행동에 옮길 수 있는 모든 측면에서 Mage-VL이 기본적으로 승리합니다 — 더 나아서가 아니라, 둘 중 판단이 가능한 유일한 모델이기 때문입니다. MiniCPM-V 4.7 README가 등장하면 이 비교를 다시 살펴보십시오. 그날 벤치마크와 라이선스가 나온다면, 흥미로운 질문은 256K 컨텍스트 선형 어텐션 MoE가 긴 비디오에서 코덱 네이티브 희소성 인코더를 이길 수 있는지일 것이며, 그것은 진정으로 열린 싸움입니다.
