
InternLumina-U2 vs Tencent UI-Mate-27B:現在就能執行的桌面代理 vs. 只能閱讀的統一視覺模型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75程式
- obsidianQwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
騰訊UI-Mate-27B和InternLumina-U2是來自中國實驗室的兩個低調的Apache-2.0釋出,相隔兩週發布,它們並非競爭對手——而這正是它們值得比較的原因。騰訊UI-Mate-27B於2026年8月14日以開放權重形式釋出,是一個桌面代理:它注視螢幕並輸出滑鼠與鍵盤動作。InternLumina-U2於2026年9月1日由上海人工智慧實驗室以推論程式碼形式發布,是一個號稱要成為統一視覺模型的專案:它號稱能讀取圖像、影片與3D,並能生成和編輯圖像。一個會對所見採取行動;另一個,當它的權重終於存在時,將能談論並描繪它所見的事物。如果你的工作是操作桌面,現今這兩者中只有一個能做到——而它並非擁有較花俏架構的那一個。
執行行動的代理:Tencent UI-Mate-27B
UI-Mate-27B 是來自騰訊HY Frontier多模態代理團隊的270億參數開放權重基礎GUI代理,基於Qwen3.6-27B微調而成。它能觀察即時截圖、針對當前畫面狀態進行推理,並在標準化座標空間中輸出結構化的鍵盤與滑鼠操作——這是一個經過訓練來操作真實桌面、而非談論桌面的模型所產出的成果。其與眾不同的特色在於示範引導執行:只要向它展示一次工作流程,它就能將錄製的示範調整以適應當前任務,當介面與錄製內容不同時,以即時截圖作為權威依據。騰訊公布的領先成績為OSWorld-Verified 77.0與WindowsAgentArena 66.2——若能獨立重現,這些數字將登上2026年排行榜榜首——此外還有一系列OSWorkerBench數據。權重真實存在且可供下載:Hugging Face上有十二個safetensors分片,可透過vLLM或SGLang在數張GPU上自行部署,而模型卡上附有一項重要提醒:這是一個代理檢查點,而非獨立的視覺對話模型——若拿它來「描述這張圖片」,那就是用錯了方式。
應許之眼:InternLumina-U2
InternLumina-U2 完全是另一種物種。它是一個 16B 參數的稀疏混合專家擴散模型(1B 活躍),實驗室打算將其用作一個同時支援全方位視覺理解、影像生成與影像編輯的單一模型——一種完全離散的八碼本設計,其中單一骨幹既可讀取影像、圖表、影片或 3D 資產,也可寫出新的像素。如果你的心智模型是 GUI 代理,InternLumina-U2 正好相反:它不想點擊任何東西,而想理解一切並按請求繪製。它在 2026 年 9 月 1 日公開的形式是推理程式碼與一個架構——GitHub 儲存庫中的六個任務入口點、帶有初步基準測試表的專案頁面、一個空的 Hugging Face 佔位——而它的權重、訓練程式碼與技術報告都仍標記為「即將推出」。目前沒有人能執行它。這兩個模型之間的差距不是品質,而是存在。
計分板
UI-Mate-27B 的數據由騰訊報告且未經複現;InternLumina-U2 的則為實驗室報告,屬初步且部分結果。每一行皆標明其出處。
• 職位 — 騰訊 UI-Mate-27B:操作桌面 — 讀取即時截圖,輸出滑鼠與鍵盤動作。InternLumina-U2:感知與創作 — 理解圖像/影片/3D,生成並編輯圖像。
• 權重 — Tencent UI-Mate-27B:自2026年8月14日起公開,十二個 safetensors 分片,Apache-2.0。InternLumina-U2:未公開——Hugging Face 儲存庫為空,權重「即將推出」。
• 規模 — 27B 密集模型,由 Qwen3.6-27B 微調而成,對比 16B 總參數 / 1B 活躍參數的稀疏 MoE 擴散模型。
• 輸出 — Tencent UI-Mate-27B:在標準化座標空間中輸出結構化且與 pyautogui 相容的動作。InternLumina-U2:宣稱支援文字、最高 1024×1024 的文字轉圖片,以及基於指令的圖片編輯。
• 重點數字 — Tencent UI-Mate-27B:OSWorld-Verified 77.0、WindowsAgentArena 66.2、OSWorkerBench 從示範中獲得提升(全部由騰訊報告)。InternLumina-U2:ChartQA 86.52、GenEval 0.81、MathVision 33.22(實驗室報告,初步結果)。
• 來源警示 — Tencent UI-Mate-27B:模型卡本身警告這是一個代理檢查點(agent checkpoint),而非獨立的視覺對話模型。InternLumina-U2:專案頁面將其自身結果標示為「初步、部分」。
— 實際部署情況 — Tencent UI-Mate-27B:可在約 2 張 GPU 上透過 vLLM 或 SGLang 自行代管;目前沒有託管式推論供應商部署此模型。InternLumina-U2:目前無人能為其提供服務——已釋出的驅動程式所預期的檢查點並不在該儲存庫中。

兩種不同類型的未經證實
兩個模型都未經證實,但「未經證實」一詞兩次出現的意思並不相同。Tencent UI-Mate-27B 以一般新模型的意義而言是未經證實的:其頭條分數來自廠商自身,沒有其他人獨立重跑過,下載量相對於那些宣稱也微不足道——這是一個乍看之下只有四天歷史、之後才逐漸累積出少量社群的檢查點常見的樣態。但它的未經證實是可以檢驗的那種。因為權重存在,66.2 和 77.0 這兩個分數本週內就能被任何擁有兩塊 GPU 與 Windows 測試環境的人驗證;那些由示範引導的宣稱也能在真實工作流程上被重現或證偽。InternLumina-U2 的未經證實則屬於更嚴格的意義:它無法測試。其架構公開且可讀,但數字不是——沒有任何成品能證實這些數字,而實驗室自己公布的部分表格已顯示,它在至少一項生成基準上落後於某個具名對手。附著於可下載檔案上的廠商數字,是一項等待裁判的宣稱;附著於路線圖上的廠商數字,則是一種希望。

2026 年 8 月 27 日所擷取的 tencent/UI-Mate-27B Hugging Face 模型卡——包含 Qwen3.6-27B 基礎模型、廠商回報的 OSWorld 與 WindowsAgentArena 分數,以及目前沒有推論供應商部署該模型的註記。
自然的分工:演員與其雙眼
並排擺放時,這兩個模型勾勒出一個可靠自動化管線的雛形。GUI 代理的難題不在於平均情況;而是代理在非預期的畫面狀態下悄悄做錯事,卻沒有人注意到。這正是便宜且值得信賴的視覺模型存在的意義——在每次動作前後驗證畫面狀態,確認出現的對話框就是代理認為出現的對話框,並在現實與代理對現實的模型產生分歧時中止循環。Tencent UI-Mate-27B 是執行者;而 InternLumina-U2 所聲稱的那種統一視覺模型,則是天然的驗證者,能讀取代理據以行動的同一批螢幕截圖。當——且僅當——InternLumina-U2 的權重真正發布、其理解能力的主張通過獨立測試時,它才能勝任這個角色,與代理並肩合作而非對立。這兩者不是同一份工作的競爭對手;它們是一份工作的兩個半邊。

InternLM/InternLumina-U2 GitHub 儲存庫(擷取於 2026 年 9 月 2 日)— 儲存庫首頁顯示各任務的推論腳本,包括影像理解入口點,螢幕狀態驗證器將以此為基礎建構;然而,使其可執行的權重並不在樹中。
路由層對「智能體+視覺」技術棧的功用
這兩個模型都不在 OrcaRouter 上託管,我們也不會暗示其他情況——Tencent UI-Mate-27B 在任何地方都沒有託管提供者,而 InternLumina-U2 沒有任何權重可供任何提供者託管。適用的路由模式正是針對這種架構的那一種:一個負責行動的代理器,搭配一個負責驗證的視覺模型;其組合方式讓昂貴或高風險的步驟,以便宜且可靠的那一步作為門檻。路由 DSL 將此表達為單一邏輯呼叫——先執行、再驗證、然後繼續或停止——而不是兩個模型提供者之間的客製化膠水;自動容錯切換則涵蓋現實中的失敗模式:像 UI-Mate-27B 這樣的 GUI 代理器,正是你會在測試路徑上先行試用的未經驗證檢查點,一旦新模型出現不當行為,呼叫便會立刻落到已驗證的模型上。單一 API 涵蓋 200 多個託管模型,供應商定價直接以 0% 加價傳遞,而堆疊中尚未驗證的部分,在贏得你的信任之前都會被安全地限制在護欄之內。
底線
如果你正在打造一個會操作桌面的東西,{{1}}Tencent UI-Mate-27B{{/1}} 是這兩者中唯一具備可用性的——今天就能在你自己的 GPU 上運行,分數令人印象深刻但尚未被重現,而且你確實可以親自去測試。如果你正在打造一個需要模型理解並描繪所見內容的應用,{{2}}InternLumina-U2{{/2}} 則是等待權重釋出的前景架構——現在值得一讀,但在 safetensors 出現之前,作為依賴項目還一無是處。持續關注這兩者,直到分工成為可能的那天:桌面上有個執行者、一旁有經認證的眼睛在監看,還有一層路由讓它們保持誠實。
