OrcaRouterのハウススタイルで生成されたタイトルカードは「PixelUMM vs UI-Mate-27B」と表示し、4つの統計タイルを備える:「77.0」(UI-Mate-27Bが報告したOSWorld-Verified平均)、「66.2」(同モデルのWindowsAgentArena平均)、「none」(PixelUMMの行動空間)、「Apache-2.0」(UI-Mate-27Bのコードと重みに関するライセンスで、PixelUMMの非商用チェックポイントと対比)。フッター行には「Tencentが報告したエージェントスコア。PixelUMMの数値は同プレプリントによる。独立した再実行はなし。」とある。OrcaRouterのロゴは、右下のパディングされた帯に合成されている。
Guides & Insights

PixelUMM vs UI-Mate-27B:一方のモデルは見たものを描き、もう一方はそれをクリックする

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Tencen​t UI-Mate-27B と NVIDIA PixelUMM は、スペック表の上では似たものに見えます。270億パラメータ対およそ152億パラメータ、どちらもオープンにダウンロードでき、どちらも Qwe​n をバックボーンに構築されている——しかし、両者はまったく比べられるものではありません。UI-Mate-27B は基盤となる GUI エージェントです。ライブのスクリーンショットを観察し、いま画面に表示されている内容から計画を立て、実際のデスクトップに向けて構造化されたマウス操作とキーボード操作を出力します。PixelUMM は、エンコーダを持たない統合マルチモーダルモデルで、画像や動画を生のピクセル空間のまま読み取り、テキストから画像や動画を生成します。つまり知覚し、生成しますが、行動空間もカーソルもなく、画面に触れる手段もありません。一方は世界に働きかけ、もう一方は世界を記述し描き出すのです。以下のすべてはこの違いから導かれ、両者のライセンスの隔たりは、次に知っておくべき事柄です。

両方の研究所が自前の数値を報告しており、どちらも独立した評価を受けていない。両者ともひっそりと発表した——実際に類似点が終わるのは、発表のスタイルにおいてである。

行為者と知覚者

UI-Mate-27Bは、自然言語の指示とライブスクリーンショットのみからタスクを実行する。可視状態について推論し、インターフェースの変化に応じて再計画し、推論、簡潔な行動記述、そしてマウス、キーボード、スクロール、待機、ユーザー操作、タスク完了にわたる構造化されたコンピュータ操作ツール呼び出しを出力する。その際立った特徴はデモンストレーション誘導実行である。ワークフローを一度見せれば、記録されたデモンストレーションを目の前のタスクに適応させ、インターフェースが先に進んでいる場合には現在のスクリーンショットを権威あるものとして扱う。Qwen3.6-27Bをベースに、実行可能なGUI環境における教師ありファインチューニングとそれに続くオンライン強化学習によって微調整され、OpenAI互換インターフェースを備えたvLLMを通じて提供される。

• 報告されたベンチマーク — OSWorld-Verified 平均 77.0、WindowsAgentArena 平均 66.2、OSWorkerBench の厳格な成功率 41.00、進捗 76.86。いずれも Tencent による報告であり、未再現。

• アクション空間 — マウス、キーボード、スクロール、待機、ユーザー操作、タスク完了。pyautogui 互換の構造化呼び出しを備えた正規化座標空間。

• ハードウェアの現実 — 27Bのdenseモデルで、Tencent自身のクイックスタートでは2基のGPUにまたがるテンソル並列処理によって提供され、Apache-2.0の下にあります。

• カード自体に関する重要な注意点 — UI-Mate-27Bは、単体のビジュアルチャットモデルではなくエージェント用チェックポイントです。Tencentは公式リポジトリにある公式のプロンプト、応答パーサー、インタラクションハーネスの使用を推奨しています。「この画像を説明して」と指示するのは、間違ったツールの使い方です。

PixelUMMは対極に位置する。そのアーキテクチャ全体が表現についての主張だ。VAEも視覚エンコーダもなく、画像は16×16ピクセルパッチ、動画は4フレームの時空間チューブレットとして、単層線形射影を通じてデコーダ専用Transformerに直接入力され、Mixture-of-Transformers設計が共有アテンションとタスク固有パラメータを組み合わせる。理解は自己回帰テキスト、生成はピクセル空間のフローマッチングである。4つのチェックポイントが提供され、S8-F22-R05がデフォルトとして、テキストから画像、96フレーム・24 fpsのテキストから動画、および理解の両方向をカバーする。

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

この二つのリリースパターンは好対照をなしている

UI-Mate-27Bは2026年8月14日にHugging Face上に登場し、モデルカード、2608.15930という番号のarXivプレプリント、プロジェクトページ、GitHubリポジトリ、文書化されたサービングレシピを伴っていた。それから10月初旬までの間に、およそ780ダウンロードと93いいねを集めた——控えめではあるが、書類がきちんと整った、研究エージェントの通常のリリースだった。

PixelUMMの痕跡は種類が異なる。GitHubリポジトリが作成されたのは2026年9月4日、arXivプレプリントの日付は9月29日、Hugging Faceリポジトリが作成されたのは2026年10月1日21:40 UTCで、そのリポジトリの最終コミットの数分後のことだった。NVIDIAのブログ記事、プレスリリース、ローンチスレッドは一切出てこなかった。プロジェクトページ自体のURLパスは今もpixelumm-project-page-previewとなっている。これを書いている時点で、そのダウンロード数はゼロだった。

そこに意図を読み取るのは誤りだ——ラボは研究成果物を公開し、ローンチは後日に予定することもある。知り得ることは、より狭く、より有用だ。一方のモデルには公式の提供経路と10週間分のダウンロードがあり、他方には論文とリポジトリはあっても、ベンダーの声明は一切ない。

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

重ならないスコアボード

両方のモデルが共通して報告しているベンチマークは存在しない。それ自体がまさに要点であり、両者は同じ問題を解いているわけではない。

• エージェント型コンピュータ操作 — UI-Mate-27B: OSWorld-Verified 77.0、WindowsAgentArena 66.2。PixelUMM: 行動空間がないため、スコアは算出できません。

• 画像理解 — UI-Mate-27B:スクリーンショットをエージェント入力として取り込み、汎用VLMとしては評価されない。PixelUMM:MMMU 41.67、AI2D 80.12、DocVQA 90.42、ChartQA 82.96、OCRBench 78.00。

• 動画 — UI-Mate-27B: なし。PixelUMM: MVBench 70.53、Video-MME 57.33、LongVideoBench 59.61、LVBench 40.41。

• 生成 — UI-Mate-27B:なし。PixelUMM:プロンプトリライター使用時のGenEval 0.83、DPG-Bench 85.74、VBench Part 1品質84.10。

• デプロイコスト — UI-Mate-27B: vLLMを介しておよそ2台のGPUにまたがる27Bのdenseモデル、加えて公式ハーネス。PixelUMM: 約30 GBの分散チェックポイントシャード、FlashAttentionをソースからビルドしたCUDA 13、動画パス用のゲート付きガードレールモデル、そしてそのための2つ目のPython環境。

• ライセンス — UI-Mate-27B: Apache-2.0、コードと重み。PixelUMM: Apache-2.0のコード、チェックポイントにはNVIDIA One-Way Noncommercial License。

• 規模 — 27Bのdenseモデルに対し総計約15.2Bで、PixelUMM自身の論文の表では「8B MoT」と表記されています。

唯一真に比較できるのは来歴に関する記述であり、それは両方に当てはまる。上の数字はすべて各ベンダー自身によるもので、それを生み出したラボの外で再実行されたものは一つもなく、二つのモデルのうち一方は自らの結果を明示的に暫定的なものと位置づけている。

それらを使って構築すること、そして両方を使うべき理由

これら2つは競合するよりも組み合わせるほうがうまく機能する。デスクトップ自動化スタックは、実行レイヤーにUI-Mate-27Bを、見たものを推論できる何かを求める。コンテンツまたは検査パイプラインはPixelUMMの読み取りと生成を求め、カーソルは不要だ。重なりは知覚の境界にあり、そこではUI-Mate-27Bのスクリーンショットグラウンディングはタスク固有で、PixelUMMのそれは汎用的だ — 同じピクセル、まったく異なる2つの仕事。

複数のモデルを互いに走らせて比較するとき——エージェント対汎用VLM、あるいは新しい研究用チェックポイント対すでに本番環境にあるもの——その比較のコストは通常、推論ではなく統合にある。2つのAPI形状、2つの認証方式、2つの契約だ。これこそルーティングレイヤーが取り除くために存在する問題であり、OrcaRouterの設計が活きるところでもある。200以上のモデルに1つのキー、プロバイダーの定価を0%のマークアップでパススルー、プロバイダー間の自動フェイルオーバー、そして複数のモデルを1回の呼び出しにまとめるためのルーティングDSLとモデルフュージョン。PixelUMMもUI-Mate-27Bも今日はどのホスト型エンドポイントにも存在せず、OrcaRouterはどちらもルーティングしない——つまりこれは、それらが登場したときのワークフローについての話であり、現時点での可用性についての主張ではない。

どの仕事にどれを使うか

タスクがクリック、キーストローク、または記入済みフォームで終わるなら、ここでの候補はただ一つ、UI-Mate-27B だけだ。それは Apache-2.0 で、arXiv 論文と公式ハーネスがあり、報告されている OSWorld と WindowsAgentArena のスコアは、2 基の GPU と Windows または Ubuntu のテストイメージを持つ誰でも確認できる種類の主張だ — だからこそ、信じるのではなく確認する価値がある。

タスクが答えや画像で終わるなら、それを実現できるのはPixelUMMであり、まず何より研究用の成果物だ。その論文は自らの限界について異例なほど正直で、学習データの違いゆえにベンチマーク比較では「どのアーキテクチャが優れているかを確立できない」と認めている。そのチェックポイントは非商用だ。強みはアーキテクチャ上の新規性と広範さにあり、最先端の数値ではない。そして目下の価値は、エンコーダなしの統合モデルが動画スケールで機能するかどうかを研究する人にとってのものだ。コードを読みデモを実行するためにダウンロードしよう。機能を出荷するためにダウンロードするのではない。

二行の要約は、証拠が示すものと同じだ。一方のモデルは行動できて創造できず、もう一方は創造できて行動できない。そして両者の間のライセンスと成熟度の差は、どんなパラメータ数よりも重要である。