
MiniCPM-V 4.7 对比 UI-Venus 2.9B:通用视觉模型迎战专用 GUI 智能体
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
MiniCPM-V 4.7 和 UI-Venus 2.9B 都是视觉语言模型,都能查看截图并生成文本,而相似之处也仅止于此——因为其中一款正是为这项工作而打造的。UI-Venus 2.9B 是来自 inclusionAI 的通用 GUI 智能体,于 2026 年 8 月 26 日发布,其整个设计都围绕观察界面、推理任务状态、发出动作并纳入由此产生的反馈展开;它附带一份技术报告、涵盖 GUI 定位、移动端、网页、计算机使用和 CAPTCHA 任务的基准测试表格,以及对其有多容易被说服执行危险动作的明确评估。MiniCPM-V 4.7 是一个拥有 352 亿参数的稀疏专家混合检查点,由 OpenBMB 于 2026 年 10 月 6 日上传,没有模型卡、没有许可证,也没有基准测试。将一个专才与一个未经测量的通才进行比较是一种颇为不寻常的做法,而本页面明确说明了这种比较在哪些方面成立、在哪些方面不成立。
两种截然不同的发布类型
UI-Venus 2.9B 是 inclusionAI/UI-Venus-2-9B,一个从 Qwen3.5-9B 初始化、并专门作为 GUI 智能体进行后训练的 9B 参数模型。模型卡描述了一个闭环——观察界面、推理任务状态、执行动作、将反馈纳入下一次决策——并分三个阶段完成训练:在大规模模拟移动端、网页和桌面轨迹上进行多模态中期训练;覆盖五个任务族的离线强化学习;以及将各领域专用教师模型整合为单一策略的多教师同策略蒸馏。它在 GUI 定位、移动端、网页、计算机使用和 CAPTCHA 基准上进行评估,另外还单独评估了后果性动作安全性:模型卡报告,在 OSHarm 上的攻击成功率为 11.3%,在 OSBlind 上为 48.8%,而其 Qwen3.5-9B 基座分别为 25.3% 和 79.4%。顺带一提,OpenBMB 自家的同门项目也关注了相似的领域:MiniCPM 组织在 2026 年 1 月有一个 AgentCPM-GUI 项目,所以这是两个实验室都已进入的赛道。
MiniCPM-V 4.7 是openbmb/MiniCPM-V-4.7-35B-A3B,拥有 35,212,875,824 个 BF16 参数,总计 70.4 GB,分为十六个分片,上传于 2026 年 10 月 6 日。

稀疏 MoE 文本骨干,标记为 qwen3_5_moe_text —— 256 个专家,每个 token 激活 8 个 —— 超过 40 层,采用三线性对一全注意力的模式;一个 27 层的自研视觉塔,16 倍下采样,最多支持九个图像切片;以及 256K 上下文窗口。没有 README,因此没有许可证,也没有基准测试。三个点赞,零下载,讨论区空空如也。
比较,空白处留空
• 用途 — UI-Venus 2.9B:一个 GUI 智能体,为界面交互而端到端训练。MiniCPM-V 4.7:一个通用视觉语言模型;其优化目标未予说明。
• 参数 — UI-Venus 2.9B:9.41B,稠密。MiniCPM-V 4.7:总计 35.2B,稀疏,每个 token 激活 256 个专家中的 8 个。
• 基础模型 — UI-Venus 2.9B:从 Qwen3.5-9B 初始化,这是一个稠密的 Qwen 文本堆栈。MiniCPM-V 4.7:一个源自 Qwen3.5 的 MoE 文本堆栈,类别 qwen3_5_moe_text。同一家族树的不同分支。
• 界面定位 —— UI-Venus 2.9B:核心能力,训练中设有专门的定位与 CAPTCHA 任务族,并采用多模型投票的关键点定位验证系统。MiniCPM-V 4.7:未提出定位方面的专门主张,也未记录坐标输出格式。
• 安全评估 — UI-Venus 2.9B:在 OSHarm 上报告的 ASR 为 11.3%,在 OSBlind 上为 48.8%。MiniCPM-V 4.7:无。
• 证据——UI-Venus 2.9B:一篇 arXiv 上的技术报告、一个项目页面、一个 GitHub 仓库以及基准测试表格。MiniCPM-V 4.7:一个配置文件。
• 工具 — UI-Venus 2.9B:带 reasoning-parser 标志的 vLLM 快速入门,外加来自社区的 GGUF 转换。MiniCPM-V 4.7:暂无。

为什么 GUI 智能体不仅仅是一个"看屏幕的 VLM"
这两个模型之间的差距主要不在于参数规模,而这一点值得说清楚,因为正是它让这场较量显得有趣,而不只是实力悬殊。
截图任务有一个大多数视觉基准都不具备的特性:输出必须是可执行的。当 UI-Venus 2.9B 被要求点击某个按钮时,它必须输出一个坐标或一个环境能够实际应用的结构化动作,而定位中的一个小误差在排行榜上并不是一个错误答案,而是一次失败的任务和被破坏的状态。正因如此,UI-Venus 2 卡片才把如此多的篇幅花在验证上:任务完成情况是根据与任务相关的视觉关键点来评判的,而不是对最终屏幕做一次整体性的一瞥,并且由异构评判者投票,以减少单一评判者的偏差。这套机制的意义在于,让强化学习的奖励信号对奖励黑客行为具有鲁棒性——即防止模型学会去满足一个偷懒的验证器,而不是真正完成任务。
它还解释了安全部分。

能够操作手机或桌面的智能体拥有图像描述模型所不具备的攻击面,因此报告攻击成功率是实验室在发布这类智能体时至少应该做的事。UI-Venus 2.9B 在 OSHarm 上报告 11.3%,在 OSBlind 上为 48.8%——第二个数字从绝对值来看很高,而模型卡的表述是与其基础模型进行比较,而非对其鲁棒性作出绝对断言。应将其解读为“比起点有实质性提升”,而不是“安全”。
MiniCPM-V 4.7 的架构对这一切都说明不了什么。长上下文上的线性注意力会有助于必须记住漫长交互历史的智能体,而稀疏 MoE 则能在运行大量回合时提升吞吐量。但一个可能对智能体有用的架构并不是智能体,而且发布产物中没有任何部分记录了动作输出、grounding 准确率或安全行为。
对 MiniCPM 这一方的坦诚评估
用 4.6 的数字来填满这一节很诱人。不要这样做。MiniCPM-V 4.6 是一个基于 Qwen3.5-0.8B 主干的 1.3B 稠密模型,采用可切换的 4x/16x 视觉压缩方案,其宣传的结果——在 Artificial Analysis Intelligence Index 上得分 13(由厂商报告),token 成本仅为同类小模型的一小部分——描述的是那个模型。MiniCPM-V 4.7 改变了主干网络,改变了注意力模式,也改变了默认的视觉压缩方式。4.6 的任何测量结果都无法迁移,而且它们从一开始描述的就不是 GUI 智能体。
关于 MiniCPM-V 4.7,能诚实说出的内容既有限又只关乎事实:权重已经存在,其形态对所属系列来说并不寻常,上下文窗口很长,而发布并不完整。缺少许可证是实际的阻碍;缺少基准测试则是评估上的阻碍。而且,有一个不算大的理由让人感兴趣而非漠不关心——OpenBMB 会构建 GUI 工具,其中包括 AgentCPM-GUI,因此来自该实验室的长上下文稀疏 MoE 视觉模型作为未来的智能体骨干并非不可想象。这是关于意图的假设,而仓库并未证实它。
你会选什么,以及什么时候
对于任何涉及截图和操作的任务——点击、输入、滚动、在应用或网站中导航、从 UI 中提取数据——UI-Venus 2.9B 是两者中唯一能够处理该任务的模型。它具备训练、验证机制、已报告的安全数值,以及足以让它今天就在 vLLM 上部署运行的配套工具。MiniCPM-V 4.7 没有任何迹象表明它在这一领域参与竞争,而且没有模型卡,你甚至无法检查它是否会输出坐标。
对于通用多模态工作——描述图像、阅读文档、对图像密集型材料进行长上下文分析——目前还无法判定孰优孰劣,因为其中一方没有已发布的质量证据。如果你今天就需要这种能力,UI-Venus 2.9B 至少是可衡量的,尽管它是针对界面而非文档推理调优的,而且对于那项工作来说,它显然也不是首选。
两种场景下的模式是相同的:由自托管模型处理常规工作,而将难题移交给托管的前沿模型。正是这种移交,让路由器有了存在的价值——一个密钥即可调用 200 多个托管模型,每个模型都按提供商的标价原价透传,我们不加任何价差,当某家提供商服务降级时自动故障转移UI-Venus 2.9B 和 MiniCPM-V 4.7 都不托管在 OrcaRouter 上;两者都是你自己运行的权重。当你的智能体判断本地模型不够用时,它与之对话的就是这个路由器。
这让你处于什么境地
这不是一个难以抉择的问题,原因在于结构性差异,而不是对质量的判断。UI-Venus 2.9B 是一位专家,配有报告、许可证、基准测试表、安全评估和部署方案。MiniCPM-V 4.7 则是一位通才,只有一个配置文件。前者是成品,后者是承诺,而唯一负责任的比较方式,就是把这一点说清楚。关注这个仓库:如果 OpenBMB 发布了一张展示界面接地和动作输出的卡片,那么一个 256K 上下文的稀疏 MoE 与一个蒸馏 9B 智能体的对比,就会成为一个真正有趣的问题。在那之前,对于“我该用哪个”的答案,就是那个已经存在的。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
