
MiniCPM-V 4.7 vs UI-Venus 2.9B:通用視覺模型對上專為 GUI 打造的代理
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
MiniCPM-V 4.7 與 UI-Venus 2.9B 都是視覺語言模型,能看著螢幕截圖並產生文字,但相似之處也僅止於此——因為其中一個正是為了這項任務而打造。UI-Venus 2.9B 是來自 inclusionAI 的通用型 GUI 代理,於 2026 年 8 月 26 日發布,其整體設計圍繞著觀察介面、推論任務狀態、輸出動作,以及納入隨之而來的回饋;它隨附一份技術報告、涵蓋 GUI 定位、行動裝置、網頁、電腦操作與 CAPTCHA 任務的基準測試表,以及對它有多常被說服去執行危險動作的明確評估。MiniCPM-V 4.7 是 OpenBMB 於 2026 年 10 月 6 日上傳的 352 億參數稀疏專家混合檢查點,沒有模型卡、沒有授權,也沒有基準測試。將專才與未經衡量的通才相比,是相當不尋常的做法,而本頁明確說明了這項比較在哪些地方成立、哪些地方不成立。
兩種截然不同的發布
UI-Venus 2.9B 是 inclusionAI/UI-Venus-2-9B,一個以 Qwen3.5-9B 為初始基礎、並專門針對 GUI 代理進行後訓練的 90 億參數模型。這張模型卡描述了一個閉環——觀察介面、推理任務狀態、執行動作、把回饋納入下一次決策——並分三個階段訓練:在大規模模擬的行動裝置、網頁與桌面軌跡上進行多模態中期訓練;拆分為五個任務家族的離線強化學習;以及將各領域專門化的教師模型整合為單一策略的多教師同策略蒸餾。它在 GUI 定位、行動裝置、網頁、電腦操作與 CAPTCHA 基準上接受評估,並另外就後果性動作的安全性進行評估:模型卡回報在 OSHarm 上的攻擊成功率為 11.3%、在 OSBlind 上為 48.8%,對比其 Qwen3.5-9B 基礎模型的 25.3% 與 79.4%。順帶一提,OpenBMB 自家的同門也曾著眼於類似領域:MiniCPM 團隊自 2026 年 1 月起便有 AgentCPM-GUI 專案,因此這是兩家實驗室都已踏入的賽道。
MiniCPM-V 4.7 是 openbmb/MiniCPM-V-4.7-35B-A3B,35,212,875,824 個 BF16 參數,分佈於 70.4 GB 及十六個分片,於 2026 年 10 月 6 日上傳。

標記為 qwen3_5_moe_text 的稀疏 MoE 文字主幹——256 個專家,每個 token 使用 8 個——超過 40 層,採用三線性到一全注意力模式,一個 27 層的內部視覺塔,具備 16× 下採樣與最多九個影像切片,以及 256K 上下文視窗。沒有 README,因此沒有授權條款,也沒有基準測試。三個讚,零次下載,討論區空空如也。
比較,其中缺口仍留空
• 用途 — UI-Venus 2.9B:一款 GUI 代理,針對介面互動進行端到端訓練。MiniCPM-V 4.7:一款通用視覺語言模型;並未說明其最佳化的目標為何。
• 參數 — UI-Venus 2.9B:9.41B,稠密。MiniCPM-V 4.7:總計 35.2B,稀疏,每個 token 使用 256 個專家中的 8 個。
• 基礎模型 — UI-Venus 2.9B:從 Qwen3.5-9B 初始化,一個稠密的 Qwen 文字堆疊。MiniCPM-V 4.7:衍生自 Qwen3.5 的 MoE 文字堆疊,類別為 qwen3_5_moe_text。同一棵家族樹的不同分支。
• 介面定位 — UI-Venus 2.9B:核心能力,訓練中包含專門的定位與 CAPTCHA 任務系列,並有一套以關鍵點定位為基礎、採用多模型投票的驗證系統。MiniCPM-V 4.7:未提出專屬於定位的宣稱,也未記載座標輸出格式。
• 安全性評估 — UI-Venus 2.9B:在 OSHarm 上回報 ASR 為 11.3%,在 OSBlind 上為 48.8%。MiniCPM-V 4.7:無。
• 證據 — UI-Venus 2.9B:一份 arXiv 技術報告、一個專案頁面、一個 GitHub 儲存庫,以及一系列基準測試表。MiniCPM-V 4.7:一份設定檔。
• 工具 — UI-Venus 2.9B:附帶 reasoning-parser 旗標的 vLLM 快速入門,以及社群提供的 GGUF 轉換檔。MiniCPM-V 4.7:目前尚無。

為什麼 GUI 代理不只是「一個會看螢幕的 VLM」
這兩個模型之間的差距主要不在於參數量,而這一點值得詳細說明,因為正是它讓這場對決變得有趣,而不只是實力懸殊。
一個截圖任務具備大多數視覺基準測試所沒有的特性:輸出必須是可執行的。當 UI-Venus 2.9B 被要求點擊某個按鈕時,它必須輸出一個座標或結構化動作,讓環境能實際套用;而定位上的微小錯誤並不是排行榜上的一個錯誤答案,而是任務失敗與狀態損毀。這就是為什麼 UI-Venus 2 卡花了那麼多篇幅在驗證上:任務完成與否是依據與任務相關的視覺關鍵點來判定,而不是對最終畫面做整體概覽式的掃視;並且由異質評審投票,以降低單一評審偏誤。這套機制的重點,在於讓強化學習的獎勵訊號對獎勵駭取具有穩健性——避免模型學會去滿足一個懶惰的驗證器,而不是真正完成任務。
它也說明了安全章節。

能操作手機或桌面的代理,具備圖說生成模型所沒有的攻擊面,而回報攻擊成功率是實驗室在推出這類代理時至少該做的事。UI-Venus 2.9B 在 OSHarm 上回報 11.3%,在 OSBlind 上回報 48.8%——第二個數字就絕對值而言偏高,而模型卡的表述框架是與其基礎模型相比,而非對穩健性的絕對宣稱。請把它讀成「比它起步的位置有明顯改善」,而不是「安全」。
MiniCPM-V 4.7 的架構對於這一切沒有任何著墨。在長上下文上運用線性注意力,將能幫助必須記住長互動歷史的代理;而稀疏 MoE 則有助於吞吐量,如果你要執行許多回合。但一個對代理有用的架構本身並不是代理,而且已發布的成品中,沒有任何部分記載了動作輸出、接地準確度或安全行為。
對 MiniCPM 這邊的誠實評估
很誘人用 4.6 的數字填滿本節。請抵抗這個誘惑。MiniCPM-V 4.6 是一款 1.3B 稠密模型,基於 Qwen3.5-0.8B 主幹,具備可切換的 4x/16x 視覺壓縮方案,而其宣傳結果——在 Artificial Analysis Intelligence Index 上得分 13,由廠商回報,且 token 成本僅為同級小型模型的一小部分——描述的是那個模型。MiniCPM-V 4.7 更改了主幹、更改了注意力模式,也更改了預設視覺壓縮。4.6 的任何測量結果都無法轉移過來,而且它們打從一開始就不是在描述 GUI 代理。
關於 MiniCPM-V 4.7,能誠實說出的內容既有限又屬實:權重確實存在,其形態對這個系列而言並不尋常,上下文視窗很長,而發布並不完整。缺少授權條款是實務上的阻礙;缺少基準測試則是評估上的阻礙。而有一個不大卻讓人感興趣、而非漠不關心的理由——OpenBMB 打造 GUI 工具,AgentCPM-GUI 便是其中之一,因此出自該實驗室的長上下文稀疏 MoE 視覺模型,作為未來的 agent 骨幹並非不合理。那是關於意圖的假設,而該儲存庫並未加以證實。
你會選什麼,以及何時選
凡是涉及螢幕截圖與操作的事情——點按、輸入、捲動、瀏覽應用程式或網站、從 UI 擷取資料——UI-Venus 2.9B 是這兩者中唯一處理這類任務的模型。它具備訓練、驗證機制、已回報的安全數字,以及足夠的工具,今天就能在 vLLM 上部署起來。MiniCPM-V 4.7 沒有任何跡象顯示它正在那個領域競爭,而且沒有模型卡,你甚至無法確認它是否會輸出座標。
對於通用的多模態工作——描述圖像、閱讀文件、針對圖像密集素材的長上下文分析——目前還無法判定孰優孰劣,因為其中一方沒有已發表的品質證據。如果你今天就需要這項能力,UI-Venus 2.9B 至少是可衡量的,儘管它是針對介面而非文件推理進行調校,對那項工作來說也不是顯而易見的首選。
這兩種情況的模式都一樣:由你自己託管的模型負責處理例行工作,而棘手的案例則交給託管的頂尖模型。這個交接正是路由器展現價值之處——一組金鑰就能通行 200 多個託管模型,每個都以供應商的定價原價轉送,我們不收取任何加成,當供應商服務品質下降時會自動容錯移轉。UI-Venus 2.9B 和 MiniCPM-V 4.7 都沒有託管在 OrcaRouter 上;兩者都是你自己執行的權重。當你的代理判斷本機模型不夠力時,路由器就是它溝通的對象。
這對你意味著什麼
這不是一個難以取捨的選擇,而其原因在於結構,而非對品質的評判。UI-Venus 2.9B 是專才,附有報告、授權、基準測試表、安全評估與部署配方。MiniCPM-V 4.7 是通才,只有一個設定檔。這兩者之一是產品,另一個是承諾,而唯一負責任的比較方式就是如實說出來。留意該儲存庫:如果 OpenBMB 發布一張展示介面接地與動作輸出的卡,那麼具備 256K 上下文的稀疏 MoE 對上蒸餾的 9B 代理,就會成為真正有趣的問題。在那之前,對於「我該用哪一個」的答案,就是那個已經存在的。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
