
MiniCPM-V 4.7 vs UI-Venus 2.9B: 범용 비전 모델과 목적 특화 GUI 에이전트의 맞대결
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
MiniCPM-V 4.7과 UI-Venus 2.9B는 둘 다 스크린샷을 보고 텍스트를 생성하는 비전-언어 모델이지만, 유사점은 거기서 끝난다. 그중 하나는 바로 그 작업을 위해 만들어졌기 때문이다. UI-Venus 2.9B는 inclusionAI가 2026년 8월 26일에 출시한 범용 GUI 에이전트로, 전체 설계가 인터페이스를 관찰하고, 작업 상태를 추론하고, 행동을 출력하고, 그로 인한 피드백을 반영하는 데 집중되어 있다. 여기에는 기술 보고서, GUI 그라운딩, 모바일, 웹, 컴퓨터 사용 및 CAPTCHA 작업 전반에 걸친 벤치마크 표, 그리고 위험한 행동을 하도록 얼마나 자주 설득될 수 있는지에 대한 명시적 평가가 함께 제공된다. MiniCPM-V 4.7은 OpenBMB가 2026년 10월 6일에 카드도, 라이선스도, 벤치마크도 없이 업로드한 352억 매개변수 희소 전문가 혼합 체크포인트다. 전문가를 측정되지 않은 범용 모델과 비교하는 것은 다소 이례적인 작업이며, 이 페이지는 비교가 성립하는 부분과 그렇지 않은 부분을 분명히 밝힌다.
아주 다른 두 가지 종류의 릴리스
UI-Venus 2.9B는 inclusionAI/UI-Venus-2-9B, Qwen3.5-9B에서 초기화되어 GUI 에이전트로 특별히 후속 학습된 9B 파라미터 모델입니다. 이 카드는 세 단계에 걸쳐 학습된 폐루프 — 인터페이스를 관찰하고, 작업 상태를 추론하고, 행동을 실행하고, 피드백을 다음 결정에 반영하는 — 를 설명합니다: 대규모 시뮬레이션 모바일, 웹 및 데스크톱 궤적에 대한 멀티모달 중간 학습; 다섯 가지 작업군으로 분할된 오프라인 강화 학습; 그리고 도메인 특화 교사들을 하나의 정책으로 통합하는 다중 교사 온폴리시 증류. 이는 GUI 그라운딩, 모바일, 웹, 컴퓨터 사용 및 CAPTCHA 벤치마크에서 평가되며, 별도로 중대한 결과를 초래하는 행동의 안전성에 대해서도 평가됩니다: 카드에 따르면 공격 성공률은 OSHarm에서 11.3%, OSBlind에서 48.8%로, Qwen3.5-9B 기반 모델의 25.3% 및 79.4%와 대비됩니다. 참고로, OpenBMB의 자체 형제 모델도 비슷한 영역을 살펴보았습니다: MiniCPM 조직에는 2026년 1월에 시작된 AgentCPM-GUI 프로젝트가 있으므로, 이는 두 연구소 모두 진입한 분야입니다.
MiniCPM-V 4.7은 openbmb/MiniCPM-V-4.7-35B-A3B, 70.4GB와 16개 샤드에 걸쳐 35,212,875,824개의 BF16 파라미터를 갖추고 있으며, 2026년 10월 6일에 업로드되었습니다.

Sparse MoE 텍스트 백본으로 태그된 qwen3_5_moe_text — 전문가 256개, 토큰당 8개 — 선형 3개 대 전체 1개 어텐션 패턴을 사용하는 40개 이상의 레이어, 16× 다운샘플링과 최대 9개의 이미지 슬라이스를 갖춘 27층 자체 개발 비전 타워, 그리고 256K 컨텍스트 창. README가 없으므로 라이선스도 벤치마크도 없음. 좋아요 3개, 다운로드 0회, 토론 비어 있음.
간극을 열어둔 채进行的比较
• 목적 — UI-Venus 2.9B: 인터페이스 상호작용을 위해 엔드투엔드로 학습된 UI 에이전트. MiniCPM 4.7: 일반 비전-언어 모델이며, 무엇에 최적화되어 있는지는 명시되어 있지 않다.
• 매개변수 — UI-Venus 2.9B: 9.41B, 밀집. MiniCPM-V 4.7: 총 35.2B, 희소, 토큰당 256개 전문가 중 8개.
• 베이스 모델 — UI-Venus 2.9B: Qwen3.5-9B에서 초기화된, 덴스 Qwen 텍스트 스택. MiniCPM-V 4.7: Qwen3.5에서 파생된 MoE 텍스트 스택, 클래스 qwen3_5_moe_text. 같은 패밀리 트리의 서로 다른 가지.
• 인터페이스 그라운딩 — UI-Venus 2.9B: 핵심 역량으로, 훈련에 전용 그라운딩 및 CAPTCHA 태스크 패밀리가 포함되어 있고, 다중 모델 투표를 사용하는 키포인트 기반 검증 시스템을 갖추고 있습니다. MiniCPM-V 4.7: 그라운딩 관련 특정 주장이 없으며, 문서화된 좌표 출력 형식도 없습니다.
• 안전성 평가 — UI-Venus 2.9B: OSHarm에서 ASR 11.3%, OSBlind에서 48.8%를 보고함. MiniCPM-V 4.7: 없음.
• 근거 — UI-Venus 2.9B: arXiv의 기술 보고서, 프로젝트 페이지, GitHub 리포지토리, 그리고 벤치마크 표. MiniCPM-V 4.7: 구성 파일.
• 툴링 — UI-Venus 2.9B: reasoning-parser 플래그를 포함한 vLLM 퀵스타트, 그리고 커뮤니티에서 제공하는 GGUF 변환. MiniCPM-V 4.7: 아직 없음.

GUI 에이전트가 단순히 "화면을 보는 VLM"이 아닌 이유
이 두 모델 사이의 격차는 주로 파라미터 수에서 비롯된 것이 아니며, 이 점은 단순히 일방적인 맞대결이 아니라 흥미로운 맞대결로 만들어 주는 요소이기에 분명히 짚고 넘어갈 가치가 있다.
스크린샷 작업에는 대부분의 비전 벤치마크에 없는 속성이 하나 있습니다. 바로 출력이 실행 가능해야 한다는 점입니다. UI-Venus 2.9B가 버튼을 탭하라는 요청을 받으면, 환경이 실제로 적용할 수 있는 좌표나 구조화된 행동을 내놓아야 하며, 그라운딩에서의 작은 오류는 리더보드상의 오답이 아니라 실패한 작업이자 손상된 상태입니다. 그래서 UI-Venus 2 카드는 검증에 많은 분량을 할애합니다. 작업 완료 여부는 최종 화면을 총체적으로 훑어보는 방식이 아니라 작업 관련 시각적 키포인트로 판단하고, 이질적인 판정자들이 투표해 단일 판정자 편향을 줄입니다. 그 장치의 핵심은 강화학습 보상 신호를 보상 해킹—작업을 완료하기보다 게으른 검증자를 만족시키는 법을 배우는 모델—에 강건하게 만드는 것입니다.
그것은 또한 안전 섹션을 설명합니다.

휴대폰이나 데스크톱을 조작할 수 있는 에이전트는 캡셔닝 모델에는 없는 공격 표면을 가지고 있으며, 공격 성공률을 보고하는 것은 연구소가 그런 에이전트를 출시할 때 해야 할 최소한의 일이다. UI-Venus 2.9B는 OSHarm에서 11.3%, OSBlind에서 48.8%를 보고한다 — 두 번째 수치는 절대적으로 높으며, 카드의 표현은 절대적인 강건성 주장이라기보다 기본 모델과의 비교다. 이는 "출발점보다 의미 있게 나아졌다"로 읽어야 하며, "안전하다"로 읽어서는 안 된다.
MiniCPM-V 4.7의 아키텍처는 이 모든 것에 대해 해 줄 말이 없다. 긴 컨텍스트에 대한 선형 어텐션은 긴 상호작용 이력을 기억해야 하는 에이전트에 도움이 되고, 희소 MoE는 많은 에피소드를 실행할 때 처리량에 도움이 될 것이다. 하지만 에이전트에 유용할 아키텍처가 에이전트인 것은 아니며, 공개된 산출물 어디에도 행동 출력, 그라운딩 정확도, 안전 행동을 문서화한 부분이 없다.
MiniCPM 측에 대한 솔직한 평가
이 섹션을 4.6의 수치로 채우고 싶은 유혹이 듭니다. 그 유혹을 떨쳐내세요. MiniCPM-V 4.6은 Qwen3.5-0.8B 백본을 사용하는 1.3B dense 모델이며, 전환 가능한 4x/16x 시각 압축 방식을 갖추고 있습니다. 그리고 홍보된 결과 — Artificial Analysis Intelligence Index에서 공급업체 보고 기준 13점, 비슷한 소형 모델의 토큰 비용의 일부만으로 — 는 그 모델을 설명합니다. MiniCPM-V 4.7은 백본을 바꾸고, 어텐션 패턴을 바꾸며, 기본 시각 압축을 바꿉니다. 4.6의 측정값 중 그대로 적용되는 것은 하나도 없고, 애초에 그중 어느 것도 GUI 에이전트를 설명하지 않습니다.
MiniCPM-V 4.7에 대해 솔직히 말할 수 있는 것은 제한적이고 사실에 국한된다: 가중치는 존재하고, 구조는 이 계열치고 이례적이며, 컨텍스트 윈도는 길고, 릴리스는 불완전하다. 라이선스의 부재는 실질적인 걸림돌이고, 벤치마크의 부재는 평가상의 걸림돌이다. 그리고 무관심보다는 관심을 가질 만한 소박한 이유가 하나 있다 — OpenBMB는 GUI 도구를 만들며 그중에는 AgentCPM-GUI도 있으므로, 그 연구소에서 나온 장문맥 희소 MoE 비전 모델이 미래의 에이전트 백본이 된다 해도 터무니없지는 않다. 그것은 의도에 관한 가설이며, 저장소가 이를 확인해 주지는 않는다.
당신이라면 무엇을 고를지, 그리고 언제
스크린샷과 동작 — 탭하기, 입력하기, 스크롤하기, 앱이나 웹사이트 탐색하기, UI에서 데이터 추출하기 — 이 관련된 모든 작업에서 UI-Venus 2.9B는 둘 중 그 작업을 다루는 유일한 모델입니다. 여기에는 훈련, 검증 체계, 보고된 안전 수치, 그리고 오늘 vLLM에 바로 올릴 수 있을 만큼의 도구가 갖춰져 있습니다. MiniCPM-V 4.7이 그 영역에서 경쟁한다고 시사하는 점은 없으며, 모델 카드가 없으면 좌표를 출력하는지조차 확인할 수 없습니다.
일반적인 멀티모달 작업 — 이미지 설명, 문서 읽기, 이미지가 많은 자료에 대한 긴 문맥 분석 — 에서는 아직 비교를 결정할 수 없습니다. 한쪽에는 공개된 품질 증거가 없기 때문입니다. 오늘 당장 그게 필요하다면, UI-Venus 2.9B는 적어도 품질을 측정할 수는 있습니다. 다만 이 모델은 문서 추론보다는 인터페이스에 맞게 튜닝되었고, 그 작업을 위한 확실한 첫 번째 선택도 아닙니다.
두 경우 모두 패턴은 같습니다: 일상적인 작업을 처리하는 자체 호스팅 모델과, 그 모델이 넘겨주는 어려운 사례를 위한 호스팅된 프론티어 모델입니다. 그 핸드오프가 바로 라우터가 제 역할을 하는 지점입니다 — 200개 이상의 호스팅 모델에 걸친 하나의 키, 각각은 우리 측 마크업 없이 제공업체의 정가로 전달되며, 제공업체에 장애가 발생하면 자동으로 페일오버됩니다.UI-Venus 2.9B와 MiniCPM-V 4.7 모두 OrcaRouter에서 호스팅되지 않습니다. 둘 다 직접 실행하는 가중치입니다. 라우터는 에이전트가 로컬 모델로는 충분하지 않다고 판단할 때 대화하는 대상입니다.
이 상황이 당신에게 의미하는 바
이것은 아슬아슬한 판단이 아니며, 그 이유는 품질에 대한 판단이라기보다 구조적인 데 있다. UI-Venus 2.9B는 보고서, 라이선스, 벤치마크 표, 안전성 평가, 서빙 레시피를 갖춘 전문가다. MiniCPM-V 4.7은 구성 파일 하나를 가진 범용 모델이다. 둘 중 하나는 제품이고 다른 하나는 약속이며, 이들을 비교하는 유일하게 책임 있는 방식은 그렇게 말하는 것이다. 저장소를 지켜보라: OpenBMB가 인터페이스 그라운딩과 액션 출력을 보여주는 카드를 공개한다면, 256K 컨텍스트 희소 MoE와 증류된 9B 에이전트의 대결은 진정으로 흥미로운 질문이 된다. 그때까지 "무엇을 써야 하나"에 대한 답은 존재하는 쪽이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
