2026年8月14日にリリースされたTencentのオープンウェイト基盤GUIエージェント「UI-Mate-27B」のヒーロータイトルカード。マウスカーソルと自動化矢印を備えたデスクトップモニターを表示し、サブタイトル「Open-Weight Foundation GUI Agent」、ラベルチップ「Apache-2.0」「27B params」「vLLM ready」、右下隅にはOrcaRouterのロゴが配置されている。
Guides & Insights

Tencent UI-Mate-27B:WindowsAgentArenaのトップスポットを主張する静かなオープンウェイトGUIエージェント

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年8月14日、TencentのHY Frontier Multimodal Agent Teamは、Hugging Faceのtencent/組織に3つのチェックポイントを公開しました — UI-Mate-27B、より小型のUI-Mate-9B、そしてデモ誘導型のUI-Mate-democua-27Bです。4日経っても、どこにも発表はありません。ローンチ投稿も、プレスリリースも、製品ツイートもありません。代わりに公開されたものは、サイレントリリースとしては異例なほど充実しています。プロジェクトページ、動作するハーネスを備えたGitHubリポジトリ、そして2日前に投稿されたarXiv論文 — その論文は、より大きなモデルをデスクトップGUI制御におけるオープンウェイトの新たな最先端であると呼んでいます。

この記事の内容はすべて、モデルカード、GitHubリポジトリ、プロジェクトページ、そしてあの論文に基づいている——そのどれもがまだ独立に再現されたものではない。この記事を書いている時点で、チェックポイントのHugging Faceでのダウンロード数はゼロであり、つまり我々はおそらくTencentの外部でそれらを論文として真剣に検討した最初の数人である。以下がリポジトリから実際に分かることであり、そして誰かが実際に実行するまで未確認のまま残ることである。

目次

• 出荷されたもの、まだ発表されていないもの

• UI-Mate-27Bとは実際には何か

• 異なる特徴: デモンストレーションによるガイド付き実行

• 数字 — そのすべてがベンダー報告によるもの

• それらの数字が置かれるであろう場所 — もしそれらが保持されるなら

• 実行方法

• 新しいGUIエージェントの周辺スタック

• 次に見るもの

• FAQ

出荷されたものと、まだ発表されていないもの

テンセントは2026年8月14日、9B版の姉妹モデルおよびデモンストレーションガイド型チェックポイントUI-Mate-democua-27Bとともに、UI-Mate-27B(270億パラメータ、Apache-2.0、BF16のsafetensors)を公開しました。2つの27Bチェックポイントは、2026年4月にリリースされたApache-2.0のマルチモーダルモデルであるQwen3.6-27Bを基盤としており、ベースモデルとファインチューンを含むスタック全体が商用利用可能です。リポジトリの最終更新タイムスタンプは今週のもので、デモガイド型チェックポイントは今日にも更新されているため、テンセントが活発に開発を進めていることがわかります。

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

これまでに公開されているもの:

• Hugging Face 上の UI-Mate-27B、UI-Mate-9B、UI-Mate-democua-27B のウェイト。それぞれにモデルカード、評価テーブル、サービングレシピが付属しています。

• ui-mate.github.io のプロジェクトページ。デモビデオ、使用ガイド、macOS Apple Silicon アプリ(DMG v0.2.4)を備えています。

• 公式プロンプト、応答パーサー、インタラクションハーネスを含むGitHubリポジトリ(github.com/Tencent/UI-Mate)。モデルカードには、これが「スタンドアロンのビジュアルチャットモデルではなく、エージェントチェックポイントである」と明記されており、実際の用途にはハーネスが推奨されています。

• 8月16日に投稿されたarXivプレプリント(2608.15930)、タイトルは「UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations」。

まだ公開されていないもの: Tencent自身は何も発表していない — これはローンチではなく、リポジトリ先行のリリースだ。プロジェクトページで未公開とされていたデモンストレーションガイド版は、現在Hugging Face上で重みが公開されている: 同じ8月14日のプッシュで作成されたtencent/UI-Mate-democua-27Bリポジトリは、このファミリーのデモンストレーションガイド版チェックポイントとして明示的にタグ付けされており、27Bのリブランドではなく別個のモデルである。ホストされたAPIは今もどこにも存在しない。それが重要なのだ: 今日UI-Mateを実行する唯一の方法は、重みをダウンロードして自分でサーブすることだ。

UI-Mate-27B の正体

UI-Mate-27Bは、{{1}}アプリケーションやOSをまたいだ長期的な作業{{/1}}のための基盤GUIエージェントです。ライブのスクリーンショットを観察し、表示された状態を推論して、ネイティブデスクトップ操作のための構造化されたキーボード操作とマウス操作を出力します。{{2}}トレーニングは、実行可能なGUI環境でのオンライン強化学習に続く教師ありファインチューニングで構成され{{/2}}、モデルは静的なスクリーンショットだけでなく、実際にデスクトップを操作することで学習しました。

アクション空間は、開発者が注目する部分です。マウス、キーボード、スクロール、待機、ユーザーインタラクション、タスク完了などがあり、出力はpyautoguiと互換性があります。モデルは正規化された1000×1000座標空間で推論を行い、リファレンスエージェントがその予測を実際のスクリーンショット解像度に再スケーリングするため、アクションはマシン間のディスプレイスケーリングの差異に影響されません。モデル自身のREADMEでは、OpenAI互換エンドポイントの背後でvLLMを使用して提供することが推奨されています。

異なる特徴:デモンストレーション誘導型実行

ほとんどのGUIエージェントは、入力として指示を1つ受け取る。UI-Mateは、オープンチェックポイントでは極めて珍しい第二の入力、つまりデモンストレーションを受け取る。プロジェクトページが述べているように、「ワークフローを一度見せてください。エージェントにタスクに合わせて適応させましょう。」

このメカニズムは、ビデオ・イン・コンテキストでも固定アクションスクリプトでもありません。デモでは、各キーボード操作またはポインター操作の直前と直後のスクリーンショットを記録します。パイプラインはその後、トレースを一貫したアクションとフレームの表現に正規化し、観察、意図、アクション、検証エビデンスを注釈として付与し、完了基準を持つ名前付きサブタスクに分割します。推論時には、それがアクティブなサブタスクに注入されるコンパクトなワークフローになります。ただし、ライブのスクリーンショットは常に正規の情報源であり続けるため、アプリケーションの状態がデモと異なる場合、モデルはリプレイするのではなく再計画します。

Tencentは、このワークフローの背後にあるチェックポイントを自社の公開モデルとしてリリースしました。UI-Mate-democua-27Bのカードは、同じ評価セット上で命令のみの場合と1回のデモンストレーションの場合の結果を並べて示しており、そのツールスキーマにはsubtask_completeアクションが追加されています。これは、これら名前付きサブタスクの背後にあるメカニズムです。OSWorkerBenchのself-demoサブセットでは、1回のデモンストレーションにより、厳密成功率が17.17から35.35へ、進捗度が67.85から81.14へ向上します。OSWorldサブセットでは、進捗度が40.27から65.75へ向上します。GameDev評価セットでは、平均スコアが76.76から81.15へ向上する一方、平均軌跡長は303.6ステップから253.1ステップへ短縮されます。つまり、デモンストレーションはタスクを改善するだけでなく、短縮もするのです。カードは、デモンストレーションによって33件のself-demoタスクのうち28件が改善され、ガイダンスなしではゼロ点だった4件のタスクを解決したと報告しています。注意点は、この記事全体に共通するものと同じです。すなわち、これらはチーム自身によるペア評価であり、3〜5回の実行の平均値であって、誰も再現していないということです。

数字 — そのすべてはベンダー報告によるもの

指示のみの実行、モデルカードから直接:

• OSWorld-Verifiedの平均スコア — 77.0

• WindowsAgentArenaの平均スコア — 66.2

• OSWorkerBench ストリクト成功 — 41.00

• OSWorkerBench 進捗 — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

OSWorkerBench自体が、この論文における3つの貢献の1つです。すなわち、41のアプリケーションにわたる100の長期的オフィスタスクからなる新しいベンチマークであり、33のセルフデモと45のバリアントデモのサブセットを含みます。これは新しい評価であるため、これら2つのスコアを比較するための先行研究はありません。自身のベースモデルに対して、UI-Mate-27BはOSWorkerBenchにおいて、厳密な成功率で17.7ポイント、進捗度で24.5ポイント、Qwen3.6-27Bを上回ると主張されています。これは、両モデルが同じハーネスで実行されるため、リリース全体の中で最もクリーンな同等条件での比較の数値です。

上記の数値はすべてチーム自身の評価です。独立したスコアはまだなく、第三者による再実行もありません。また、ダウンロード数がゼロのため、コミュニティによる再現もありません。ここに示された数値はすべて事実ではなく主張として扱ってください。

それらの数字が位置する場所 — もしそれらが保たれるなら

WindowsAgentArenaは、真に話題をさらう結果となるでしょう。2026年初頭に公に報告された最良のWAA結果は61.0前後に集中していました(2026年4月のモジュール式システムVLAA-GUI)。美団のオープンウェイトのEvoCUA-32Bは56.5、バイトダンスのクローズドなUI-TARS-2は同じボードで50台前半から半ばでした。UI-Mate-27B自身の評価での66.2は、今年このベンチマークで報告されたすべてのもの(オープンかクローズドかを問わず)を上回ることになります。これは強い主張であり、独立した再実行が必要です。

OSWorld-Verifiedで77.0というスコアは強力ですが、公開リーダーボード上での新しいオープンウェイト記録ではありません。2026年8月上旬時点のOSWorld-Verifiedリーダーボードのスナップショットでは、オープンウェイトのHolo3-35B-A3Bが82.6でリストされており、その上にはいくつかのフロンティアクローズドモデルがあります(Qwen3.8 Max 86.1、Claude Mythos 5とClaude Fable 5 85.0、Claude Opus 4.8 83.4)。したがって、論文の「state of the art」という表現は、独自の評価設定に関する主張であり、確定した事実ではありません。異なるハーネス、アクションパーサー、自己報告のずれにより、77.0対82.6は独立した再実行のみが解決できる問題です。27Bオープンモデルが77.0を達成することの意味を文脈として説明すると、それは約72.4の人間専門家ベースライン、および同じボード上の複数の大規模フロンティアシステム(Claude Opus 4.6 72.7、Kimi K2.6 73.1など)よりも上に位置することになります。

Tencentはこの分野に不慣れなわけではない。2026年2月に8BのGUIグラウンディングモデルであるPOINTS-GUI-Gをリリースし、5月にMarvis OSアシスタントを発表し、6月にはGUICrafterコンピューター操作プロジェクトに貢献した。UI-Mateは、特にデスクトップ全体の制御を目的とした独立したラインであり、TencentのGUIエージェントとして初めて、グラウンディングコンポーネントや製品としてではなく、オープンな基盤モデルとしてリリースされる。

実行方法

このモデルはvLLM向けに設計されており、モデルカードには正確なコマンドが記載されています。すなわち `vllm serve tencent/UI-Mate-27B` を `tensor-parallel size 2` かつOpenAI互換のチャットテンプレートで実行するというものです。実用上の重要な点として、エージェントはデフォルトで5枚のスクリーンショットをコンテキストに保持するため、サーバーはプロンプトごとに少なくとも6枚の画像を受け付ける必要があります。なぜなら、最新のスクリーンショットは最も古いものが畳み込まれる前に到着するからです。推奨フラグは `--limit-mm-per-prompt` で、画像6枚・動画0本です。デモンストレーション誘導型チェックポイントも同様に動作します。そのカードでは、OpenAI互換エンドポイントの背後でvLLMとSGLangが指定されています。

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

起動されると、Pythonエージェントクラス(UIMateAgent)はスクリーンショットと指示を受け取り、応答と構造化されたアクションを返し、1000×1000座標をあなたの解像度に合わせて再スケーリングします。プロジェクトページでは、デモンストレーションガイドモード用のmacOS Apple Siliconアプリも提供しています。これは、自分でハーネスを構築せずに「一度見せる」ワークフローを試す最も簡単な方法です。ライセンスは全体を通してApache-2.0であり、ローカルでの使用、ファインチューニング、商用統合がすべて許可されています。

コンピューター利用エージェントの「実行方法」に関する説明には、必ず2つの警告を添えるべきであり、その両方がモデルカード自体に由来する。隔離された環境または使い捨て環境を使用すること。機密性の高い操作の前には必ず人間の確認を求め、操作の軌跡を監視し、モデルが報告する成功を、意図した結果が実際に達成された証拠として扱わないこと。GUIエージェントはクリックを誤ることがあり、画面上のコンテンツを介したプロンプトインジェクションは仮説上の話ではなく、現実の脅威モデルである。

新しいGUIエージェントを取り巻くスタック

UI-MateチェックポイントはまだどれもOrcaRouter上にありません — このファミリーは登場して数日で、ダウンロード数はゼロ、ベースモデルのQwen3.6-27Bも同様です。ホスト型APIはないので、今週実行したいなら、自分でvLLMをセルフホストすることになります。ラボ用途なら問題ありませんが、本番環境には適していません。

本番環境のコンピュータ操作パイプラインが単一のチェックポイントで済むことはほとんどない。それは、次の意図を決定するプランナーモデル、画面を読み取るグラウンディングまたはビジョンモデル、GUIエージェント本体、そしてサブステップが失敗したときの安価なフォールバックで構成される。そして、これらの構成要素はすべてモデルとして提供されるものであり、GUIエージェントがローカルであっても同様だ。この混在こそが、まさにルーティングレイヤーの出番である。200以上のホスト型モデルにわたる単一のAPI、プロバイダーのリスト価格を0%マークアップでそのまま透過的に渡す仕組み、そして自動フェイルオーバーにより、あるプロバイダーの一時的な障害が長時間のエージェント実行を止めないようにする。ルーティングDSLを使えば、複数のモデルを単一の呼び出しに組み合わせることもできる。最初にプランナー、最後に安価な検証器という構成を、自前のコードでプロバイダーをつなぎ合わせることなく実現できる。正直なまとめは単純だ。デスクトップを操作するエージェントはローカルだが、その周辺で何をするかを決めるモデル群はルーティング可能であり、新しい未検証のチェックポイントを安全に試すことこそが、まさにフェイルオーバーの役割なのである。

次に見るもの

4つのことがUI-Mate-27Bの状況を変えるでしょう。重要度の高い順に:

• {{1}}OSWorld-VerifiedとWindowsAgentArenaの独立した再実行。特にWAAの数値は、大きな意味を持つか、ハーネスのアーティファクトに過ぎないかのどちらかであり、{{2}}外部での評価だけがそのどちらであるかを決定づける。

• 正式なテクニカルレポート。現在の引用は仮のものであり、完全な論文はおそらく、要約が概略のみを示すデータエンジンの詳細を明らかにするだろう。

• Tencent自身の発表。このようなリポジトリ優先のリリースは通常、何かの前触れである — Marvis統合、ホスト型提供、あるいはより広範なオープンモデル推進など。

• ホスト型API。3つのチェックポイントの重みはすべて公開されたが、どこでも提供されていない — Tencentのエンドポイントも、サードパーティの推論プロバイダーもない — そのため、セルフホスティングが唯一の手段であり、Tencentの発表かプロバイダーの採用がない限り、それは変わらない。

よくある質問

Tencent UI-Mate-27Bとは何ですか?

UI-Mate-27Bは、TencentのHY Frontier Multimodal Agent Teamが開発したApache-2.0ライセンスの270億パラメータ基盤GUIエージェントであり、Qwen3.6-27Bからファインチューニングされています。ライブのデスクトップスクリーンショットを監視して推論し、pyautogui互換のマウスおよびキーボード操作を出力します。2026年8月14日にHugging Faceで静かにリリースされました——9Bの姉妹モデルおよびデモンストレーションガイド付きのUI-Mate-democua-27Bと同時に——発表は一切なく、そのベンチマークはこれまでのところすべてベンダー報告に基づいています。

デモンストレーション誘導実行は、スクリプトの再生とどう違うのでしょうか。

記録済みマクロを実行する代わりに、UI-Mateはデモンストレーションを、キャプション付きでサブタスク構造化されたワークフローとして扱い、ガイダンスとして注入する。ライブスクリーンショットが引き続き正規の情報源となるため、アプリのレイアウト、コンテンツ、状態が提示されたものと異なる場合、モデルは古い座標を再生するのではなく、再計画を行う。これが、自己デモサブセットにおける厳密成功率が17.2から35.4へと跳ね上がったとされる主張の背後にあるメカニズムであり、誰かがそれを再現するまでは依然としてベンダーの主張に過ぎない。

UI-Mate-27Bは、オープンウェイトのGUIエージェントにおいて本当に最先端なのでしょうか?

それは完全に評価設定次第です。WindowsAgentArena 66.2は2026年初頭に公表されたWAAの最高結果を上回る一方、OSWorld-Verified 77.0は公開ボード上で82.6を記録したオープンウェイトのHolo3-35B-A3Bを下回っています。論文ではこれを新たなオープンウェイトの最先端としていますが、一貫したハーネスでの独立した再実行だけが確かめる唯一の方法です。

今日、UI-Mate-27Bを実行できますか?

はい、自分でサーバーを立てて提供する場合です。Hugging Face からウェイトをダウンロードします。27B の汎用チェックポイント、9B、またはデモガイド型の UI-Mate-democua-27B です。そして、モデルカードに記載された vLLM コマンド(テンソル並列サイズ2、プロンプトあたり6枚の画像)を実行し、Python エージェントまたは macOS アプリで操作します。ホステッド API はなく、どのチェックポイントもまだ OrcaRouter にはありません。これは、これほど新しく未検証のモデルにとって、当面は隔離された環境に保管するのが妥当な理由です。

{{1}}UI-Mate-27Bに関する正しい読み方は「勝者」ではなく「注目に値する」だ。{{/1}} {{2}}WAAリードを主張し、ワンショットのデモンストレーションワークフローを同梱した27Bオープンモデルは、オープンウェイトのコンピューター使用エージェントが冗談扱いからフロンティアに手が届く範囲へと変わった年に、意味のあるデータポイントだ。{{/2}} デモンストレーション駆動のチェックポイントがプロジェクトページのプレースホルダーではなく公開ウェイトになった今、「一度見せる」ワークフローは実際に実行できる。テンセントはこれまでリリースに慎重で、今回も進行中の作業を公開した形だ。サンドボックスで実行し、ベンチマークを再実行し、発表のウォッチを続けよう——このストーリーの面白い部分はまだ先にある。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube