
InternLumina-U2 对决 Tencent UI-Mate-27B:可立即运行的桌面智能体与只能阅读的统一视觉模型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
腾讯 UI-Mate-27B 和 InternLumina-U2 是来自中国实验室的两款低调的 Apache-2.0 发布,相隔两周问世,而它们并非竞争对手——这正是它们值得比较的原因。腾讯 UI-Mate-27B 于 2026 年 8 月 14 日以开放权重形式发布,是一款桌面智能体:它观察屏幕并执行鼠标和键盘操作。InternLumina-U2 由上海人工智能实验室于 2026 年 9 月 1 日以推理代码形式发布,是一款志在统一的视觉模型:它声称能读取图像、视频和 3D,并能生成和编辑图像。一个对所见采取行动;另一个,当它的权重最终面世时,将能够谈论并绘制它所看到的内容。如果你的工作是操作桌面,那么今天这两者之中只有一个能做到——而且不是架构更花哨的那个。
行动的智能体:Tencent UI-Mate-27B
UI-Mate-27B 是腾讯 HY Frontier 多模态智能体团队推出的 270 亿参数开放权重基础 GUI 智能体,基于 Qwen3.6-27B 微调而成。它观察实时截图,对当前屏幕状态进行推理,并在归一化坐标空间中输出结构化的键盘和鼠标操作——这是一个经过训练能够操作真实桌面(而非谈论桌面)的模型所产出的成果。其显著特性是演示引导执行:只需向它展示一次工作流程,它就能将录制的演示适配到当前任务,当界面与录制内容不一致时,以实时截图为准。腾讯公布的主要成绩为 OSWorld-Verified 77.0 和 WindowsAgentArena 66.2——若经独立复现,这些数据将登顶 2026 年相应排行榜——此外还有一系列 OSWorkerBench 数据。权重真实且可下载:Hugging Face 上有十二个 safetensors 分片,可通过 vLLM 或 SGLang 在几块 GPU 上自行托管。模型卡上附带一条重要提示:这是一个智能体检查点,而非独立的视觉对话模型——如果让它“描述这张图片”,那就是用错了方式。
应许之眼:InternLumina-U2
InternLumina-U2 则完全是另一个物种。它是一个 16B 参数的稀疏混合专家扩散模型(1B 激活参数),实验室打算将其打造为全方位视觉理解、图像生成与图像编辑的统一模型——一种全离散八码本设计,让单一主干网络既能读取图像、图表、视频或 3D 资产,也能写出新的像素。如果你心中设想的是一个 GUI 智能体,那么 InternLumina-U2 正站在相反的一极:它不想点击任何东西,而想理解一切,并在被要求时作画。在 2026 年 9 月 1 日,它发布出来的形态是推理代码和一种架构——GitHub 仓库里的六个任务入口、一个带有初步基准结果表的项目页面、一个空的 Hugging Face 占位页——而它的权重、训练代码和技术报告仍都标注着“即将推出”。没有人能运行它。这两个模型之间的差距不在质量,而在于是否真实存在。
记分牌
UI-Mate-27B 的数据由腾讯报告且未经复现;InternLumina-U2 的数据为实验室报告,属初步且不完整的结果。每一行都标注了其来源。
• 工作 — Tencent UI-Mate-27B:操作桌面 — 读取实时截图,输出鼠标和键盘操作。InternLumina-U2:感知与创造 — 理解图像/视频/3D,生成和编辑图像。
• 权重 — Tencent UI-Mate-27B:自2026年8月14日起公开,十二个safetensors分片,Apache-2.0许可证。InternLumina-U2:尚未公开——Hugging Face仓库为空,权重“即将推出”。
• 规模 — 27B稠密模型,基于Qwen3.6-27B微调,对比总参数16B/活跃参数1B的稀疏MoE扩散模型。
• 输出 — Tencent UI-Mate-27B:在归一化坐标空间中生成结构化的 pyautogui 兼容操作。InternLumina-U2:处理文本、最高 1024×1024 分辨率的文本到图像生成,以及基于指令的图像编辑。
• 核心数据 — Tencent UI-Mate-27B:OSWorld-Verified 77.0,WindowsAgentArena 66.2,OSWorkerBench 从演示中获得增益(均由腾讯报告)。InternLumina-U2:ChartQA 86.52,GenEval 0.81,MathVision 33.22(实验室报告,初步结果)。
• 来源注意事项 —— Tencent UI-Mate-27B:其模型卡本身也警告称,它只是一个智能体检查点(agent checkpoint),并非独立的视觉对话模型。InternLumina-U2:其项目页面也将自身结果标注为“初步的、不完整的”。
• 服务现状 — Tencent UI-Mate-27B:可通过 vLLM 或 SGLang 在约 2 块 GPU 上自托管;目前没有托管推理服务商部署它。InternLumina-U2:没有任何一方可提供服务——已发布的驱动程序所依赖的检查点并不存在于该仓库中。

两种不同口味的“未证实”
这两款模型都尚未得到验证,而“未经验证”这个词在两种语境下含义并不相同。腾讯 UI-Mate-27B 的“未经验证”属于新模型的普通含义:那些抢眼分数是厂商自报的,没有任何人独立复现过,下载量与这些宣称相比也小得可怜——这正是一个乍看只有四天历史、此后才慢慢积累起一个小型社区的检查点所惯有的姿态。但它的“未经验证”是可以检验的。因为权重文件确实存在,任何拥有两块 GPU 和 Windows 测试环境的人本周都能核对那 66.2 和 77.0 的数字,那些由演示引导的宣称也可以在真实工作流中被复现或推翻。InternLumina-U2 的“未经验证”则在更严格的意义上成立:它根本无法检验。其架构公开可读,但它的数字不是——没有任何实物可以证实这些数字,而且该实验室自己公布的部分对照表已经显示,它至少在某一项生成基准上落后于一个被点名指出的对手。厂商把一个数字附在可下载文件上,那是一句等待裁判定夺的声明;厂商把一个数字附在路线图上,那只是一种期许。

tencent/UI-Mate-27B 的 Hugging Face 模型卡,于 2026 年 8 月 27 日截取——Qwen3.6-27B 基座、供应商报告的 OSWorld 和 WindowsAgentArena 得分,以及目前没有任何推理提供商部署它的说明。
自然的劳动分工:行动者及其眼睛
并排放在一起,这两个模型勾勒出一条可靠自动化管线的雏形。GUI 智能体的难题并不在于一般情形;而在于智能体在未预期的屏幕状态下悄悄做错事,却无人察觉。而这正是廉价且值得信赖的视觉模型所存在的意义——在每次动作前后验证屏幕状态,确认弹出的对话框确实是智能体认为出现的那一个,并在现实与智能体对现实的建模发生分歧时中止循环。腾讯 UI-Mate-27B 是执行者;像 InternLumina-U2 所自称的那种统一视觉模型,则是天然的验证者,能够读取智能体据以操作的同一批截图。当——且仅当——InternLumina-U2 的权重真正落地,其关于理解能力的宣称经受住独立测试时,它才能扮演这一角色:与智能体并肩协作,而非与之相对。两者并不是在争夺同一个岗位的对手;它们是一份工作的两半。

The InternLM/InternLumina-U2 GitHub存储库,捕获于2026年9月2日——该存储库的落地页面展示了各任务推理脚本,包括屏幕状态验证器在构建时所基于的图像理解入口点;使其能够运行的权重并不在树结构中。
路由层能为“智能体+视觉”技术栈做些什么
这两个模型都没有托管在 OrcaRouter 上,我们也不会暗示情况并非如此——Tencent UI-Mate-27B 在任何地方都没有托管提供商,而 InternLumina-U2 没有任何权重可供任何提供商托管。适用的路由模式正是针对这种架构的:一个执行行动的智能体加上一个进行验证的视觉模型,其组合方式使得昂贵或高风险的步骤以廉价可靠的步骤为门槛。路由 DSL 将其表达为一次单一的逻辑调用——先行动,再验证,然后继续或暂停——而不是两个模型提供商之间定制的胶水代码,并且自动故障转移覆盖了现实中的故障模式:像 UI-Mate-27B 这样的 GUI 智能体恰恰是那种未经证实、需要先在测试路径上接受考验的检查点,一旦新模型行为异常,调用就会立即落到经过验证的模型上。一个 API 覆盖 200+ 托管模型,提供商列表价格以 0% 加价原样传递,堆栈中未经证实的部分在赢得你的信任之前始终被置于安全护栏之后。
底线
如果你正在构建某种需要操控桌面的系统,腾讯 UI-Mate-27B 是这两者中唯一以可用形态存在的——它如今就能跑在你自己的 GPU 上,评测分数令人印象深刻但尚未被复现,而你可以亲自去实测。如果你正在构建某种需要模型理解所见内容并据此绘图的系统,InternLumina-U2 则是一个前景可期的架构,只是权重还在路上——现在读一读很值得,但在 safetensors 出现之前,作为依赖它毫无价值。关注这两者,等待分工成为可能的那一天:一个执行体操作着你的桌面,一双经过验证的眼睛在旁注视,再加一个路由层让它们保持诚实。
