UI-Mate-27B 的英雄标题卡片,腾讯于 2026 年 8 月 14 日发布的开权重基础 GUI 智能体。画面展示一台台式显示器,带有鼠标光标和自动化箭头,副标题为 'Open-Weight Foundation GUI Agent',徽章标签为 'Apache-2.0'、'27B params'、'vLLM ready',右下角为 OrcaRouter 标志。
Guides & Insights

腾讯UI-Mate-27B:低调的开源权重GUI智能体,占据WindowsAgentArena榜首位置

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年8月14日,腾讯的HY Frontier多模态智能体团队在Hugging Face的tencent/组织下推送了三个模型检查点——UI-Mate-27B、较小的UI-Mate-9B,以及演示引导的UI-Mate-democua-27B。四天后,仍然没有任何公开公告:没有发布帖、没有新闻稿、没有产品推文。实际发布的内容对于一次悄然发布而言异常完整:一个项目页面、一个带有可用测试框架的GitHub仓库,以及一篇两天前提交的arXiv论文,该论文称更大的模型是桌面GUI控制领域新的开放权重最先进技术。

本文中的一切内容均来自模型卡、GitHub 仓库、项目页面和那篇论文——其中没有任何部分已被独立复现。截至撰写本文时,这些检查点在 Hugging Face 上的下载量为零,这意味着我们很可能是腾讯之外第一批在论文层面认真对待它们的人。以下是从仓库中实际可知的信息,以及在其他人运行之前仍无法确认的部分。

目录

• 已发布的内容,以及尚未公布的内容

• UI-Mate-27B 实际上是什么

• 与众不同的功能:演示引导执行

• 这些数字——全部由供应商报告

• 这些数字会位于何处——如果它们成立的话

• 如何运行它

• 围绕一个新的 GUI 代理的技术栈

• 接下来看什么

• 常见问题

哪些已发布,哪些尚未公布

腾讯于2026年8月14日发布了UI-Mate-27B(270亿参数,Apache-2.0许可证,BF16格式的safetensors),同时发布的还有9B姊妹模型和演示引导检查点UI-Mate-democua-27B。这两个27B检查点基于Qwen3.6-27B构建——该模型本身是2026年4月发布的Apache-2.0多模态模型——这意味着整个技术栈,包括基础模型和微调模型,均可商用。这些仓库带有本周的最后修改时间戳——演示引导检查点甚至今天仍有更新——可见腾讯一直在积极推进相关工作。

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

截至目前,公开的内容有:

• Hugging Face 上的 UI-Mate-27B、UI-Mate-9B 和 UI-Mate-democua-27B 权重,每个都配有模型卡、评估表格和服务配方。

• 项目页面:ui-mate.github.io,包含演示视频、使用指南和 macOS Apple Silicon 应用(DMG v0.2.4)。

• GitHub 仓库(github.com/Tencent/UI-Mate)包含官方提示词、响应解析器和交互框架——卡片明确指出这是一个“代理检查点,而非独立的视觉对话模型”,并且该框架被推荐用于任何实际用途。

• 一篇 arXiv 预印本(2608.15930),于8月16日提交,题为“UI-Mate:通过上下文演示推进开放权重基础 GUI 智能体”。

尚未公开的内容:腾讯本身未作任何表态——这是仓库先行发布,而非正式发布。项目页面曾列为尚未公开的演示引导变体,现已在 Hugging Face 上提供实时权重:tencent/UI-Mate-democua-27B 仓库与 8 月 14 日的推送同日创建,被明确标记为该系列的演示引导检查点——这是一个独立的模型,而非 27B 的重新命名。目前仍无任何托管的 API。这一点很重要:如今运行 UI-Mate 的唯一方式就是自行下载权重并自行托管。

UI-Mate-27B 实际上是什么

UI-Mate-27B 是一款基础 GUI 智能体,专为“跨应用程序和操作系统的长周期任务”而设计。它观察实时屏幕截图,对可见状态进行推理,并输出结构化的键盘和鼠标操作,用于原生桌面交互。训练过程为监督微调,随后在可执行的 GUI 环境中进行在线强化学习——该模型通过实际驱动桌面来学习,而非仅从静态截图中学习。

行动空间是开发者会关注的部分:鼠标、键盘、滚动、等待、用户交互和任务完成,其输出与 pyautogui 兼容。该模型在归一化的 1000×1000 坐标空间中进行推理,参考代理会将其预测重新缩放回真实的截图分辨率,因此操作在不同机器之间的显示缩放差异下依然有效。模型自带的 README 建议使用 vLLM 通过 OpenAI 兼容端点提供服务。

与众不同的功能:演示引导执行

大多数 GUI 代理只接受一种输入:指令。UI-Mate 则接受第二种输入,这在开放检查点中十分罕见——演示。正如项目页面所说:“展示一次工作流程,让代理使其适应当前任务。”

该机制并非视频上下文或固定动作脚本。演示会在每次键盘或指针操作前后立即记录屏幕截图,随后流水线将轨迹规范化为一致的动作与帧表示,用观察、意图、动作和验证证据对其进行标注,并将其分割为具有完成条件的具名子任务。在推理时,这转化为注入到当前子任务的紧凑工作流——但实时屏幕截图全程保持权威性,因此当应用状态与演示不同时,模型会重新规划,而非重放。

腾讯已将这一工作流背后的检查点作为自己的公开模型发布:UI-Mate-democua-27B 的模型卡片在同一评估集上对比了仅指令与单次演示的结果,其工具模式新增了 subtask_complete 操作——这正是那些命名子任务背后的机制。在 OSWorkerBench 的 self-demo 子集上,一次演示将严格成功率从 17.17 提升至 35.35,进度从 67.85 提升至 81.14;在 OSWorld 子集上,进度从 40.27 提升至 65.75;在 GameDev 评估集上,平均得分从 76.76 提升至 81.15,而平均轨迹长度从 303.6 步降至 253.1 步——演示在改进任务的同时也缩短了任务。该模型卡片报告称,演示改进了 33 个 self-demo 任务中的 28 个,并解决了四个在无指导时得零分的任务。需要注意的事项与贯穿全文的提醒相同:这些是该团队自己的配对评估,取三到五次运行的平均值,且尚未有人复现。

这些数字——全部由供应商报告

仅指令执行,直接来自模型卡:

• OSWorld-Verified 平均分 — 77.0

• WindowsAgentArena 平均得分 — 66.2

• OSWorkerBench 严格成功 — 41.00

• OSWorkerBench 进度 — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

OSWorkerBench本身是论文中三项贡献之一:一个包含41个应用中100项长时程办公任务的新基准,包含33个自演示子集和45个变体演示子集。由于这是一个新的评估,因此没有先前的工作可将这两个分数与之对比。相对于其自身的基础模型,UI-Mate-27B据称在OSWorkerBench上比Qwen3.6-27B高出17.7个百分点的严格成功率和24.5个百分点的进展——这是整个发布中最干净的同类对比数字,因为两个模型都将在相同的测试框架下运行。

上面每一个数字都是团队自己的评估。目前既没有独立评分,也没有第三方复现,而且零下载量意味着也没有社区复现。请把这里的每一个数字都当作一种主张,而非事实。

那些数字会出现在哪里——如果它们保持不变。

WindowsAgentArena 才是真正能登上头条的那个。2026 年初公开报道的最佳 WAA 成绩集中在 61.0 左右(一个名为 VLAA-GUI 的模块化系统,2026 年 4 月);美团的开源权重 EvoCUA-32B 为 56.5,字节跳动的闭源 UI-TARS-2 在同一榜单上处于 50 分出头到中段。如果在 UI-Mate-27B 自己的评测上拿到 66.2,就会超过今年该基准上所有已报道的结果——无论开源还是闭源。这是一个很强的论断,需要独立复跑来验证。

OSWorld-Verified 达到 77.0 虽然表现强劲,但并非公开榜单上新的开放权重纪录。在 2026 年 8 月初的 OSWorld-Verified 排行榜快照中,开放权重模型 Holo3-35B-A3B 以 82.6 在列,其上方还有多个前沿闭源模型(Qwen3.8 Max 为 86.1,Claude Mythos 5 和 Claude Fable 5 为 85.0,Claude Opus 4.8 为 83.4)。因此,论文中"最先进"的措辞只是针对其自身评估设置的主张,而非既定事实——不同的测试框架、动作解析器和自我报告偏差,都使得 77.0 与 82.6 之间的对比只能通过独立复跑来判定。关于一个 27B 开放模型取得 77.0 意味着什么,可以这样理解:它将高于约 72.4 的人类专家基线,也高于同一榜单上多个更大的前沿系统,包括 72.7 的 Claude Opus 4.6 和 73.1 的 Kimi K2.6

腾讯在这个领域并不陌生——它于2026年2月发布了8B GUI接地模型POINTS-GUI-G,5月推出了Marvis OS助手,6月还为GUICrafter计算机使用项目做出了贡献。UI-Mate是一个专门针对完整桌面控制的独立产品线,也是腾讯首个以开放基础模型而非接地组件或产品形式发布的GUI代理。

如何运行它

该模型专为 vLLM 设计,模型卡给出了确切的命令——使用张量并行大小为 2 的 `vllm serve tencent/UI-Mate-27B` 以及兼容 OpenAI 的聊天模板。有一个实际操作细节值得注意:该智能体默认在上下文中保留五张截图,因此服务器每个提示必须至少接受六张图像,因为最新的截图会在最旧的截图被折叠之前到达。推荐使用的参数是 `--limit-mm-per-prompt`,并设置为六张图像、零个视频。演示引导的检查点也以同样的方式部署——其模型卡列出了通过兼容 OpenAI 的端点提供服务的 vLLM 和 SGLang。

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

在服务启动后,Python 代理类(UIMateAgent)会获取截图和一条指令,然后返回响应和结构化操作,并将 1000×1000 的坐标重新映射回你的分辨率。项目页面还提供了一个适用于 macOS Apple Silicon 的应用,用于演示引导模式,这是在不自行构建测试框架的情况下体验“只需展示一次”工作流的最简单方式。整个项目采用 Apache-2.0 许可证,因此允许本地使用、微调和商业集成。

任何“如何运行”计算机操作代理的说明旁边,都应当附上两条警告,而这两条警告都出自模型卡本身。使用隔离或一次性环境。在进行任何敏感操作之前要求人工确认,监控执行轨迹,并且不要将模型报告的成功视为预期结果确实发生的证据。GUI 代理会误点击,而且通过屏幕内容进行的提示注入是一个真实的威胁模型,而非假设。

新 GUI 智能体周围的技术栈

None of the UI-Mate checkpoints are on OrcaRouter yet — the family is days old with zero downloads, and its base model Qwen3.6-27B is not either. There is no hosted API, so if you want to run one this week, you are serving vLLM yourself. That is fine for a lab, but it is the wrong shape for production. UI-Mate 检查点都还没有上 OrcaRouter——这个系列才发布几天,下载量为零,其基础模型 Qwen3.6-27B 也同样没有。目前没有托管的 API,所以如果你想这周运行一个,就得自己部署 vLLM。这在实验室环境没问题,但用于生产环境就不合适了。

生产级的 computer-use 流水线很少只是一个检查点。它包含一个规划模型来决定下一步意图、一个读取屏幕的 grounding 或视觉模型、GUI 智能体本身,以及一个在子步骤失败时使用的廉价回退——而这些组件全部是服务化模型,即使 GUI 智能体是本地运行的。这种组合正是路由层的用武之地:一个 API 覆盖 200 多个托管模型,按提供商列表价格以 0% 加价透传,并自动故障转移,这样某个提供商的短暂中断不会让长时间运行的智能体卡住。路由 DSL 还允许你把多个模型组合成一次调用——前面放规划模型,末尾放廉价验证器——而无需在自己的代码里拼接不同提供商。说白了很简单:驱动桌面的智能体是本地运行的,但围绕它决定该如何行动的模型是可路由的;安全地尝试全新且未经检验的检查点,正是故障转移存在的意义。

接下来看什么

有四件事会改变 UI-Mate-27B 的局面,按重要程度大致排序如下:

• 独立重跑 OSWorld-Verified 和 WindowsAgentArena。尤其是 WAA 的数据,要么是重大成果,要么是测试框架的伪影,只有外部评估才能判定是哪一种。

• 正式技术报告。当前的引用只是占位符,完整的论文预计将揭示摘要中仅作简述的数据引擎细节。

• 腾讯自己的公告。像这样以仓库优先的发布通常预示着某件事——Marvis 集成、托管服务,或更广泛的开放模型推进。

• 托管 API。所有三个检查点的权重现已公开,但任何地方都没有提供服务——没有腾讯端点,也没有第三方推理提供商——因此自托管仍是唯一途径,只有腾讯发布公告或提供商接入才能改变这一现状。

常见问题

Tencent UI-Mate-27B 是什么?

UI-Mate-27B 是腾讯 HY Frontier 多模态智能体团队推出的 Apache-2.0 许可、270亿参数的基座 GUI 智能体,基于 Qwen3.6-27B 微调。它能实时观看桌面截图、进行推理,并输出兼容 pyautogui 的鼠标和键盘操作。该模型于2026年8月14日悄然上线 Hugging Face——与9B版本及演示引导的 UI-Mate-democua-27B 一同发布——没有发布任何公告,其基准测试结果目前也完全由厂商自行报告。

演示引导执行与重放脚本有何不同?

UI-Mate 不会执行录制的宏,而是将演示视为带说明文字、按子任务结构组织的工作流,并将其作为指导注入。实时截图始终保持权威性,因此当应用布局、内容或状态与演示时不同,模型会重新规划,而不是重放过时的坐标。这正是其自称在自演示子集上严格成功率从 17.2 跃升至 35.4 背后的机制——但在有人复现之前,这仍只是供应商的说法。

UI-Mate-27B真的是开放权重GUI代理中的最先进水平吗?

这完全取决于评估设置。其 WindowsAgentArena 66.2 将超越2026年初公开报道的最佳WAA结果,但其 OSWorld-Verified 77.0 在公开榜单上低于开源权重模型 Holo3-35B-A3B 的 82.6。论文称其为新的开源权重最先进水平;只有在一致基准上进行独立复现才能确知。

我今天能运行 UI-Mate-27B 吗?

是的,如果你自己部署的话:从 Hugging Face 下载权重——27B 通用检查点、9B,或者演示引导的 UI-Mate-democua-27B——然后按照模型卡上的 vLLM 命令运行(张量并行大小为 2,每个提示六张图片),并用 Python 代理或 macOS 应用来驱动它。目前没有托管的 API,也还没有任何检查点放到 OrcaRouter 上——对于这么新、这么未经证实的模型来说,暂时把它们放在隔离环境中是一个合理的理由。

对UI-Mate-27B的正确解读不是“赢家”,而是“值得关注”。一个27B开放模型宣称WAA领先,并附带一个一次性演示工作流,这在今年是一个有意义的信号——在这一年里,开放权重的计算机使用智能体已经从笑话变成了触手可及的前沿。既然这个演示引导的检查点现在是公开权重,而不是项目页面上的占位符,那么“只展示一次”的工作流就是你可以真正运行的东西。腾讯此前在发布上一直很谨慎,而这次的发布呈现出一种“公开的进行中作品”的形态。在沙盒中运行它,重新运行基准测试,并继续保持对公告的关注——这个故事的有趣部分还在后面。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube