'MiniCPM-V 4.7 vs UI-Venus 2.9B'를 위한 생성된 히어로 타이틀 카드로, 부제는 '범용 비전 모델 대 특수 목적 GUI 에이전트'이며, 왼쪽 카드에는 'UI-Venus 2.9B: 그라운딩, CAPTCHA, 모바일, 웹, 컴퓨터 사용'이라고 적혀 있고, 오른쪽 카드에는 'MiniCPM-V 4.7: 35.2B 스파스, 카드 없음, 벤치마크 없음'이라고 적혀 있으며, 알약 모양 배지에는 '측정되지 않은 범용 모델에 맞선 전문가'라고 적혀 있고, 오른쪽 아래 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

MiniCPM-V 4.7 vs UI-Venus 2.9B: 범용 비전 모델과 목적 특화 GUI 에이전트의 맞대결

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

MiniCPM-V 4.7과 UI-Venus 2.9B는 둘 다 스크린샷을 보고 텍스트를 생성하는 비전-언어 모델이지만, 유사점은 거기서 끝난다. 그중 하나는 바로 그 작업을 위해 만들어졌기 때문이다. UI-Venus 2.9B는 inclusionAI가 2026년 8월 26일에 출시한 범용 GUI 에이전트로, 전체 설계가 인터페이스를 관찰하고, 작업 상태를 추론하고, 행동을 출력하고, 그로 인한 피드백을 반영하는 데 집중되어 있다. 여기에는 기술 보고서, GUI 그라운딩, 모바일, 웹, 컴퓨터 사용 및 CAPTCHA 작업 전반에 걸친 벤치마크 표, 그리고 위험한 행동을 하도록 얼마나 자주 설득될 수 있는지에 대한 명시적 평가가 함께 제공된다. MiniCPM-V 4.7은 OpenBMB가 2026년 10월 6일에 카드도, 라이선스도, 벤치마크도 없이 업로드한 352억 매개변수 희소 전문가 혼합 체크포인트다. 전문가를 측정되지 않은 범용 모델과 비교하는 것은 다소 이례적인 작업이며, 이 페이지는 비교가 성립하는 부분과 그렇지 않은 부분을 분명히 밝힌다.

아주 다른 두 가지 종류의 릴리스

UI-Venus 2.9B는 inclusionAI/UI-Venus-2-9B, Qwen3.5-9B에서 초기화되어 GUI 에이전트로 특별히 후속 학습된 9B 파라미터 모델입니다. 이 카드는 세 단계에 걸쳐 학습된 폐루프 — 인터페이스를 관찰하고, 작업 상태를 추론하고, 행동을 실행하고, 피드백을 다음 결정에 반영하는 — 를 설명합니다: 대규모 시뮬레이션 모바일, 웹 및 데스크톱 궤적에 대한 멀티모달 중간 학습; 다섯 가지 작업군으로 분할된 오프라인 강화 학습; 그리고 도메인 특화 교사들을 하나의 정책으로 통합하는 다중 교사 온폴리시 증류. 이는 GUI 그라운딩, 모바일, 웹, 컴퓨터 사용 및 CAPTCHA 벤치마크에서 평가되며, 별도로 중대한 결과를 초래하는 행동의 안전성에 대해서도 평가됩니다: 카드에 따르면 공격 성공률은 OSHarm에서 11.3%, OSBlind에서 48.8%로, Qwen3.5-9B 기반 모델의 25.3% 및 79.4%와 대비됩니다. 참고로, OpenBMB의 자체 형제 모델도 비슷한 영역을 살펴보았습니다: MiniCPM 조직에는 2026년 1월에 시작된 AgentCPM-GUI 프로젝트가 있으므로, 이는 두 연구소 모두 진입한 분야입니다.

MiniCPM-V 4.7은 openbmb/MiniCPM-V-4.7-35B-A3B, 70.4GB와 16개 샤드에 걸쳐 35,212,875,824개의 BF16 파라미터를 갖추고 있으며, 2026년 10월 6일에 업로드되었습니다.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs UI-Venus 2.9B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Purpose general vision, Grounding not documented, Safety ASR not evaluated, Context 256K, Evidence config file only. Right column 'UI-Venus 2.9B' lists Parameters 9.4B dense, Purpose GUI agent, Grounding core training task, Safety ASR 11.3% OSHarm, Context 256K served, Evidence technical report. The footer reads 'UI-Venus figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Sparse MoE 텍스트 백본으로 태그된 qwen3_5_moe_text — 전문가 256개, 토큰당 8개 — 선형 3개 대 전체 1개 어텐션 패턴을 사용하는 40개 이상의 레이어, 16× 다운샘플링과 최대 9개의 이미지 슬라이스를 갖춘 27층 자체 개발 비전 타워, 그리고 256K 컨텍스트 창. README가 없으므로 라이선스도 벤치마크도 없음. 좋아요 3개, 다운로드 0회, 토론 비어 있음.

간극을 열어둔 채进行的比较

• 목적 — UI-Venus 2.9B: 인터페이스 상호작용을 위해 엔드투엔드로 학습된 UI 에이전트. MiniCPM 4.7: 일반 비전-언어 모델이며, 무엇에 최적화되어 있는지는 명시되어 있지 않다.

• 매개변수 — UI-Venus 2.9B: 9.41B, 밀집. MiniCPM-V 4.7: 총 35.2B, 희소, 토큰당 256개 전문가 중 8개.

• 베이스 모델 — UI-Venus 2.9B: Qwen3.5-9B에서 초기화된, 덴스 Qwen 텍스트 스택. MiniCPM-V 4.7: Qwen3.5에서 파생된 MoE 텍스트 스택, 클래스 qwen3_5_moe_text. 같은 패밀리 트리의 서로 다른 가지.

• 인터페이스 그라운딩 — UI-Venus 2.9B: 핵심 역량으로, 훈련에 전용 그라운딩 및 CAPTCHA 태스크 패밀리가 포함되어 있고, 다중 모델 투표를 사용하는 키포인트 기반 검증 시스템을 갖추고 있습니다. MiniCPM-V 4.7: 그라운딩 관련 특정 주장이 없으며, 문서화된 좌표 출력 형식도 없습니다.

• 안전성 평가 — UI-Venus 2.9B: OSHarm에서 ASR 11.3%, OSBlind에서 48.8%를 보고함. MiniCPM-V 4.7: 없음.

• 근거 — UI-Venus 2.9B: arXiv의 기술 보고서, 프로젝트 페이지, GitHub 리포지토리, 그리고 벤치마크 표. MiniCPM-V 4.7: 구성 파일.

• 툴링 — UI-Venus 2.9B: reasoning-parser 플래그를 포함한 vLLM 퀵스타트, 그리고 커뮤니티에서 제공하는 GGUF 변환. MiniCPM-V 4.7: 아직 없음.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

GUI 에이전트가 단순히 "화면을 보는 VLM"이 아닌 이유

이 두 모델 사이의 격차는 주로 파라미터 수에서 비롯된 것이 아니며, 이 점은 단순히 일방적인 맞대결이 아니라 흥미로운 맞대결로 만들어 주는 요소이기에 분명히 짚고 넘어갈 가치가 있다.

스크린샷 작업에는 대부분의 비전 벤치마크에 없는 속성이 하나 있습니다. 바로 출력이 실행 가능해야 한다는 점입니다. UI-Venus 2.9B가 버튼을 탭하라는 요청을 받으면, 환경이 실제로 적용할 수 있는 좌표나 구조화된 행동을 내놓아야 하며, 그라운딩에서의 작은 오류는 리더보드상의 오답이 아니라 실패한 작업이자 손상된 상태입니다. 그래서 UI-Venus 2 카드는 검증에 많은 분량을 할애합니다. 작업 완료 여부는 최종 화면을 총체적으로 훑어보는 방식이 아니라 작업 관련 시각적 키포인트로 판단하고, 이질적인 판정자들이 투표해 단일 판정자 편향을 줄입니다. 그 장치의 핵심은 강화학습 보상 신호를 보상 해킹—작업을 완료하기보다 게으른 검증자를 만족시키는 법을 배우는 모델—에 강건하게 만드는 것입니다.

그것은 또한 안전 섹션을 설명합니다.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured 7 October 2026) showing the model header, the qwen3_5, multimodal, gui and agent tags, and the opening of the UI-Venus-2 card describing a general-purpose foundation GUI agent that operates across mobile applications, web platforms and desktop operating systems.

휴대폰이나 데스크톱을 조작할 수 있는 에이전트는 캡셔닝 모델에는 없는 공격 표면을 가지고 있으며, 공격 성공률을 보고하는 것은 연구소가 그런 에이전트를 출시할 때 해야 할 최소한의 일이다. UI-Venus 2.9B는 OSHarm에서 11.3%, OSBlind에서 48.8%를 보고한다 — 두 번째 수치는 절대적으로 높으며, 카드의 표현은 절대적인 강건성 주장이라기보다 기본 모델과의 비교다. 이는 "출발점보다 의미 있게 나아졌다"로 읽어야 하며, "안전하다"로 읽어서는 안 된다.

MiniCPM-V 4.7의 아키텍처는 이 모든 것에 대해 해 줄 말이 없다. 긴 컨텍스트에 대한 선형 어텐션은 긴 상호작용 이력을 기억해야 하는 에이전트에 도움이 되고, 희소 MoE는 많은 에피소드를 실행할 때 처리량에 도움이 될 것이다. 하지만 에이전트에 유용할 아키텍처가 에이전트인 것은 아니며, 공개된 산출물 어디에도 행동 출력, 그라운딩 정확도, 안전 행동을 문서화한 부분이 없다.

MiniCPM 측에 대한 솔직한 평가

이 섹션을 4.6의 수치로 채우고 싶은 유혹이 듭니다. 그 유혹을 떨쳐내세요. MiniCPM-V 4.6은 Qwen3.5-0.8B 백본을 사용하는 1.3B dense 모델이며, 전환 가능한 4x/16x 시각 압축 방식을 갖추고 있습니다. 그리고 홍보된 결과 — Artificial Analysis Intelligence Index에서 공급업체 보고 기준 13점, 비슷한 소형 모델의 토큰 비용의 일부만으로 — 는 그 모델을 설명합니다. MiniCPM-V 4.7은 백본을 바꾸고, 어텐션 패턴을 바꾸며, 기본 시각 압축을 바꿉니다. 4.6의 측정값 중 그대로 적용되는 것은 하나도 없고, 애초에 그중 어느 것도 GUI 에이전트를 설명하지 않습니다.

MiniCPM-V 4.7에 대해 솔직히 말할 수 있는 것은 제한적이고 사실에 국한된다: 가중치는 존재하고, 구조는 이 계열치고 이례적이며, 컨텍스트 윈도는 길고, 릴리스는 불완전하다. 라이선스의 부재는 실질적인 걸림돌이고, 벤치마크의 부재는 평가상의 걸림돌이다. 그리고 무관심보다는 관심을 가질 만한 소박한 이유가 하나 있다 — OpenBMB는 GUI 도구를 만들며 그중에는 AgentCPM-GUI도 있으므로, 그 연구소에서 나온 장문맥 희소 MoE 비전 모델이 미래의 에이전트 백본이 된다 해도 터무니없지는 않다. 그것은 의도에 관한 가설이며, 저장소가 이를 확인해 주지는 않는다.

당신이라면 무엇을 고를지, 그리고 언제

스크린샷과 동작 — 탭하기, 입력하기, 스크롤하기, 앱이나 웹사이트 탐색하기, UI에서 데이터 추출하기 — 이 관련된 모든 작업에서 UI-Venus 2.9B는 둘 중 그 작업을 다루는 유일한 모델입니다. 여기에는 훈련, 검증 체계, 보고된 안전 수치, 그리고 오늘 vLLM에 바로 올릴 수 있을 만큼의 도구가 갖춰져 있습니다. MiniCPM-V 4.7이 그 영역에서 경쟁한다고 시사하는 점은 없으며, 모델 카드가 없으면 좌표를 출력하는지조차 확인할 수 없습니다.

일반적인 멀티모달 작업 — 이미지 설명, 문서 읽기, 이미지가 많은 자료에 대한 긴 문맥 분석 — 에서는 아직 비교를 결정할 수 없습니다. 한쪽에는 공개된 품질 증거가 없기 때문입니다. 오늘 당장 그게 필요하다면, UI-Venus 2.9B는 적어도 품질을 측정할 수는 있습니다. 다만 이 모델은 문서 추론보다는 인터페이스에 맞게 튜닝되었고, 그 작업을 위한 확실한 첫 번째 선택도 아닙니다.

두 경우 모두 패턴은 같습니다: 일상적인 작업을 처리하는 자체 호스팅 모델과, 그 모델이 넘겨주는 어려운 사례를 위한 호스팅된 프론티어 모델입니다. 그 핸드오프가 바로 라우터가 제 역할을 하는 지점입니다 — 200개 이상의 호스팅 모델에 걸친 하나의 키, 각각은 우리 측 마크업 없이 제공업체의 정가로 전달되며, 제공업체에 장애가 발생하면 자동으로 페일오버됩니다.UI-Venus 2.9B와 MiniCPM-V 4.7 모두 OrcaRouter에서 호스팅되지 않습니다. 둘 다 직접 실행하는 가중치입니다. 라우터는 에이전트가 로컬 모델로는 충분하지 않다고 판단할 때 대화하는 대상입니다.

이 상황이 당신에게 의미하는 바

이것은 아슬아슬한 판단이 아니며, 그 이유는 품질에 대한 판단이라기보다 구조적인 데 있다. UI-Venus 2.9B는 보고서, 라이선스, 벤치마크 표, 안전성 평가, 서빙 레시피를 갖춘 전문가다. MiniCPM-V 4.7은 구성 파일 하나를 가진 범용 모델이다. 둘 중 하나는 제품이고 다른 하나는 약속이며, 이들을 비교하는 유일하게 책임 있는 방식은 그렇게 말하는 것이다. 저장소를 지켜보라: OpenBMB가 인터페이스 그라운딩과 액션 출력을 보여주는 카드를 공개한다면, 256K 컨텍스트 희소 MoE와 증류된 9B 에이전트의 대결은 진정으로 흥미로운 질문이 된다. 그때까지 "무엇을 써야 하나"에 대한 답은 존재하는 쪽이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트