Kartu judul yang dihasilkan dalam gaya khas OrcaRouter bertuliskan “PixelUMM vs UI-Mate-27B”, dengan empat kotak statistik: “77.0” (rata-rata OSWorld-Verified yang dilaporkan UI-Mate-27B), “66.2” (rata-rata WindowsAgentArena-nya), “tidak ada” (ruang aksi PixelUMM) dan “Apache-2.0” (lisensi UI-Mate-27B atas kode dan bobot, dibandingkan dengan checkpoint nonkomersial PixelUMM). Baris footer bertuliskan “Skor agen yang dilaporkan Tencent; angka PixelUMM berasal dari preprint-nya. Tidak ada pengujian ulang independen.”. Logo OrcaRouter dikompositkan ke dalam strip berpadding di kanan bawah.
Guides & Insights

PixelUMM vs UI-Mate-27B: Satu Model Menggambar Apa yang Dilihatnya, Model Lainnya Mengkliknya

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tencen​t UI-Mate-27B dan NVIDIA PixelUMM terlihat sebanding di lembar spesifikasi — 27 miliar parameter berbanding sekitar 15,2 miliar, keduanya dapat diunduh secara terbuka, keduanya dibangun di atas tulang punggung Qwe​n — namun keduanya sama sekali tidak sebanding. UI-Mate-27B adalah agen GUI fondasional: ia mengamati tangkapan layar secara langsung, merencanakan berdasarkan apa yang sedang tampil di layar, dan mengeluarkan aksi mouse dan keyboard terstruktur untuk desktop sungguhan. PixelUMM adalah model multimodal terpadu tanpa encoder yang membaca gambar dan video dalam ruang piksel mentah serta menghasilkan gambar dan video dari teks — ia mempersepsi dan mencipta, tetapi ia tidak memiliki ruang aksi, tidak punya kursor, dan tidak punya cara untuk menyentuh layar. Yang satu bertindak atas dunia. Yang lain menggambarkan dan melukiskannya. Semua yang diuraikan di bawah ini berpangkal dari perbedaan itu, dan kesenjangan lisensi di antara keduanya adalah hal kedua yang perlu Anda ketahui.

Kedua lab melaporkan angka mereka sendiri dan tak satu pun memiliki evaluasi independen. Keduanya dirilis secara diam-diam — gaya perilisannya justru menjadi titik berakhirnya kemiripan itu.

Aktor dan pengamat

UI-Mate-27B menjalankan tugas hanya dari instruksi bahasa alami dan tangkapan layar langsung. Model ini menalar berdasarkan keadaan yang terlihat, merencanakan ulang saat antarmuka berubah, dan menghasilkan penalaran, deskripsi tindakan yang ringkas, serta panggilan alat penggunaan komputer terstruktur untuk mouse, keyboard, menggulir, menunggu, interaksi pengguna, dan penyelesaian tugas. Fitur pembedanya adalah eksekusi yang dipandu demonstrasi: tunjukkan alur kerja satu kali dan model ini menyesuaikan demonstrasi yang direkam dengan tugas yang sedang dihadapi, dengan menganggap tangkapan layar saat ini sebagai acuan yang berwenang ketika antarmuka telah berubah. Model ini disetel halus dari Qwen3.6-27B dengan penyetelan halus terawasi yang diikuti pembelajaran penguatan daring di lingkungan GUI yang dapat dieksekusi, dan dilayani melalui vLLM dengan antarmuka yang kompatibel dengan OpenAI.

• Tolok ukur yang dilaporkan — rata-rata OSWorld-Verified 77,0, rata-rata WindowsArena 66,2, keberhasilan ketat OSWorkerBench 41,00 dan kemajuan 76,86. Semua dilaporkan oleh Tencent dan belum direproduksi.

• Ruang aksi — mouse, papan ketik, penggulungan, penungguan, interaksi pengguna, penyelesaian tugas, dalam ruang koordinat ternormalisasi dengan panggilan terstruktur yang kompatibel dengan pyautogui.

• Realitas perangkat keras — 27B dense, dilayani dengan paralelisme tensor di dua GPU dalam quick-start milik Tencent sendiri, dengan lisensi Apache-2.0.

• Catatan penting pada kartu itu sendiri — UI-Mate-27B adalah checkpoint agen, bukan model obrolan visual yang berdiri sendiri. Tencent merekomendasikan prompt resmi, parser respons, dan harness interaksi dari repositorinya. Arahkan ke "jelaskan gambar ini" dan Anda menggunakan alat yang salah.

PixelUMM menempati kutub yang berlawanan. Seluruh arsitekturnya adalah argumen tentang representasi: tanpa VAE, tanpa encoder visi, gambar sebagai patch piksel 16×16 dan video sebagai tubelet spatiotemporal 4-frame, langsung ke Transformer hanya-dekoder melalui proyeksi linear satu lapis, dengan desain Mixture-of-Transformers yang memasangkan atensi bersama dengan parameter spesifik tugas. Pemahaman adalah teks autoregresif; generasi adalah flow matching ruang piksel. Empat checkpoint dirilis, S8-F22-R05 sebagai default yang mencakup teks-ke-gambar, teks-ke-video pada 96 frame dan 24 fps, serta kedua arah pemahaman.

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Kedua pola rilis tersebut sangat kontras.

UI-Mate-27B muncul di Hugging Face pada 14 Agustus 2026 dengan kartu model, pracetak arXiv bernomor 2608.15930, halaman proyek, repositori GitHub, dan resep penyajian yang didokumentasikan. Antara saat itu dan awal Oktober, model ini mengumpulkan sekitar 780 unduhan dan 93 suka — terbilang sederhana, tetapi merupakan rilis agen riset yang normal dengan dokumen yang sudah tertata.

Jejak PixelUMM berbeda jenisnya. Repositori GitHub-nya dibuat pada 4 September 2026; pracetak arXiv-nya bertanggal 29 September; repositori Hugging Face-nya dibuat pada 21.40 UTC tanggal 1 Oktober 2026, beberapa menit setelah komit terakhir repositori itu. Tidak ada postingan blog, siaran pers, atau utas peluncuran NVIDIA yang muncul untuknya. Jalur URL halaman proyeknya sendiri masih terbaca pixelumm-project-page-preview. Jumlah unduhannya nol ketika ini ditulis.

Menafsirkan niat ke dalam hal itu adalah kesalahan — sebuah lab dapat menerbitkan artefak riset dan menjadwalkan peluncuran nanti. Yang dapat diketahui lebih sempit dan lebih berguna: satu model memiliki jalur penyajian resmi dan sepuluh minggu unduhan; yang lain memiliki makalah, repositori, dan tidak ada pernyataan vendor sama sekali.

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

Papan skor yang tidak tumpang tindih

Tidak ada tolok ukur yang dilaporkan oleh kedua model, dan justru itulah intinya: keduanya tidak sedang memecahkan masalah yang sama.

• Penggunaan komputer agentik — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: tidak ada ruang aksi, sehingga tidak ada skor yang bisa diberikan.

• Pemahaman gambar — UI-Mate-27B: mengonsumsi tangkapan layar sebagai masukan agen, tidak dievaluasi sebagai VLM umum. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00.

• Video — UI-Mate-27B: tidak ada. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.

• Generasi — UI-Mate-27B: tidak ada. PixelUMM: GenEval 0,83 dengan penulis ulang prompt, DPG-Bench 85,74, kualitas VBench Bagian 1 84,10.

• Biaya deployment — UI-Mate-27B: 27B dense di sekitar dua GPU melalui vLLM, ditambah harness resmi. PixelUMM: sekitar 30 GB shard checkpoint terdistribusi, CUDA 13 dengan FlashAttention yang dibangun dari sumber, model guardrail dengan akses terbatas untuk jalur video dan lingkungan Python kedua untuknya.

• Lisensi — UI-Mate-27B: Apache-2.0, kode dan bobot. PixelUMM: kode Apache-2.0, NVIDIA One-Way Noncommercial License pada checkpoint.

• Skala — 27B dense versus total sekitar 15,2B, ditampilkan sebagai "8B MoT" dalam tabel makalah PixelUMM sendiri.

Satu-satunya pernyataan yang benar-benar sebanding adalah tentang asal-usul, dan itu berlaku untuk keduanya: setiap angka di atas adalah milik vendor sendiri, tidak ada yang dijalankan ulang di luar lab yang menghasilkannya, dan salah satu dari dua model itu secara eksplisit memberi label pada hasilnya sendiri sebagai pendahuluan.

Membangun dengan keduanya, dan mengapa Anda mungkin menggunakan keduanya

Keduanya lebih baik saat dikomposisikan daripada saat bersaing. Stack otomasi desktop menginginkan UI-Mate-27B untuk lapisan tindakan dan sesuatu yang dapat bernalar tentang apa yang dilihatnya; pipeline konten atau inspeksi menginginkan pembacaan dan pembangkitan PixelUMM serta tidak membutuhkan kursor. Tumpang tindihnya ada di batas persepsi, tempat grounding tangkapan layar UI-Mate-27B bersifat spesifik untuk tugas dan milik PixelUMM bersifat umum — piksel yang sama, dua pekerjaan yang sepenuhnya berbeda.

Ketika Anda benar-benar menjalankan beberapa model untuk saling diadu — agen melawan VLM generalis, atau checkpoint riset baru melawan model yang sudah ada di produksi — biaya perbandingannya biasanya terletak pada integrasi, bukan inferensi: dua bentuk API, dua skema autentikasi, dua kontrak. Itulah masalah yang hendak dihilangkan oleh lapisan routing, dan di sinilah desain OrcaRouter menunjukkan nilainya: satu kunci untuk 200+ model, harga daftar penyedia diteruskan tanpa markup 0%, failover otomatis antarpenyedia, serta DSL routing dan fusi model untuk menggabungkan beberapa model menjadi satu panggilan. Baik PixelUMM maupun UI-Mate-27B tidak tersedia di endpoint terkelola mana pun saat ini, dan OrcaRouter tidak merutekan keduanya — jadi ini tentang alur kerja ketika keduanya tersedia, bukan klaim tentang ketersediaannya sekarang.

Yang mana untuk pekerjaan yang mana

Jika tugas berakhir dengan klik, penekanan tombol, atau formulir yang telah diisi, hanya ada satu kandidat di sini dan itu adalah UI-Mate-27B. Ia berlisensi Apache-2.0, memiliki makalah arXiv dan harness resmi, dan skor OSWorld serta WindowsAgentArena yang dilaporkan adalah jenis klaim yang dapat diperiksa oleh siapa pun dengan dua GPU dan image pengujian Windows atau Ubuntu — yang justru itulah yang membuatnya layak diperiksa daripada dipercaya.

Jika tugas berakhir dengan jawaban atau gambar, PixelUMM-lah yang bisa melakukannya, dan ia adalah artefak riset terlebih dahulu. Makalahnya luar biasa jujur tentang batasannya sendiri, mengakui bahwa data pelatihan yang berbeda berarti perbandingan benchmark-nya "tidak dapat menetapkan arsitektur mana yang lebih unggul". Checkpoint-nya nonkomersial. Kekuatannya adalah kebaruan arsitektural dan keluasan, bukan angka-angka mutakhir, dan nilai langsungnya adalah bagi siapa pun yang mempelajari apakah model terpadu tanpa encoder berfungsi pada skala video. Unduh untuk membaca kode dan menjalankan demo; jangan unduh untuk merilis sebuah fitur.

Ringkasan dua baris itu sama dengan yang diberikan oleh bukti: satu model dapat bertindak dan tidak dapat mencipta, yang dapat mencipta dan tidak dapat bertindak, dan lisensi serta kesenjangan di antara keduanya lebih penting daripada jumlah parameter apa pun.