
Tencent UI-Mate-27B: Agen GUI Open-Weight yang Tenang Mengklaim Posisi Teratas di WindowsAgentArena
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
Pada 14 Agustus 2026, Tim Agen Multimodal HY Frontier milik Tencent mengunggah tiga checkpoint ke Hugging Face di bawah organisasi tencent/ — UI-Mate-27B, UI-Mate-9B yang lebih kecil, dan UI-Mate-democua-27B yang dipandu demonstrasi. Empat hari kemudian, masih belum ada pengumuman di mana pun: tidak ada postingan peluncuran, tidak ada siaran pers, tidak ada tweet produk. Yang dirilis justru sangat lengkap untuk perilisan senyap: halaman proyek, repositori GitHub dengan harness yang berfungsi, dan makalah arXiv yang diajukan dua hari lalu yang menyebut model yang lebih besar sebagai state of the art bobot terbuka baru dalam kontrol GUI desktop.
Segala sesuatu dalam tulisan ini berasal dari {{1}}kartu model, repo GitHub, halaman proyek, dan makalah tersebut{{/1}} — belum ada satu pun yang {{2}}direproduksi secara independen{{/2}}. Checkpoint-checkpoint tersebut memiliki {{3}}nol unduhan di Hugging Face{{/3}} hingga saat tulisan ini dibuat, yang berarti kita kemungkinan termasuk di antara {{4}}orang-orang pertama di luar Tencent{{/4}} yang menganggapnya serius di atas kertas. Inilah yang sebenarnya {{5}}dapat diketahui dari repositori{{/5}}, dan apa yang tetap {{6}}belum terkonfirmasi sampai orang lain menjalankannya{{/6}}.
Daftar Isi
• Apa yang sudah rilis, dan apa yang belum diumumkan
• Apa sebenarnya UI-Mate-27B itu
• Fitur yang berbeda: eksekusi yang dipandu demonstrasi
• Angka-angka — semuanya dilaporkan vendor
• Di mana angka-angka itu akan berada — jika angka-angka itu bertahan
• Cara menjalankannya
• Tumpukan di sekitar agen GUI baru
• Apa yang ditonton selanjutnya
• Tanya Jawab
Apa yang sudah dirilis, dan apa yang belum diumumkan
Tencent menerbitkan UI-Mate-27B (27 miliar parameter, Apache-2.0, safetensors dalam BF16) pada 14 Agustus 2026, bersama dengan saudara 9B dan checkpoint berpandu demonstrasi UI-Mate-democua-27B. Kedua checkpoint 27B tersebut dibangun di atas Qwen3.6-27B — yang merupakan model multimodal Apache-2.0 yang dirilis pada April 2026 — yang berarti seluruh tumpukan, baik basis maupun fine-tune, dapat digunakan secara komersial. Repo-repo tersebut memiliki cap waktu modifikasi terakhir dari minggu ini — checkpoint berpandu demonstrasi baru saja diubah hari ini — jadi Tencent secara aktif mengerjakannya.

Apa yang sudah diketahui publik sejauh ini:
• Bobot UI-Mate-27B, UI-Mate-9B, dan UI-Mate-democua-27B di Hugging Face, masing-masing dengan kartu model, tabel evaluasi, dan resep penyajian.
• Halaman proyek di ui-mate.github.io dengan video demo, panduan penggunaan, dan aplikasi macOS Apple Silicon (DMG v0.2.4).
• Repositori GitHub (github.com/Tencent/UI-Mate) yang berisi prompt resmi, parser respons, dan kerangka interaksi — kartu tersebut secara eksplisit menyatakan bahwa ini adalah "titik pemeriksaan agen, bukan model obrolan visual yang berdiri sendiri" dan kerangka tersebut direkomendasikan untuk hal yang nyata.
• Sebuah pracetak arXiv (2608.15930), diajukan pada 16 Agustus, berjudul "UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations."
Apa yang belum publik: Tencent sendiri belum mengatakan apa pun — ini rilis berbasis repositori, bukan peluncuran. Varian berpanduan demonstrasi yang sebelumnya tercantum di halaman proyek sebagai belum publik kini memiliki bobot aktif di Hugging Face: repositori tencent/UI-Mate-democua-27B, yang dibuat pada push 14 Agustus yang sama, secara eksplisit diberi tag sebagai checkpoint berpanduan demonstrasi dari keluarga ini — model yang berbeda, bukan sekadar rebrand dari 27B. Masih belum ada API yang dihosting di mana pun. Itu penting: satu-satunya cara menjalankan UI-Mate saat ini adalah mengunduh bobotnya dan menyajikannya sendiri.
Apa sebenarnya UI-Mate-27B itu
UI-Mate-27B adalah agen GUI fondasi untuk "pekerjaan berjangka panjang di berbagai aplikasi dan sistem operasi." Agen ini mengamati tangkapan layar langsung, menalar atas kondisi yang terlihat, dan mengeluarkan aksi keyboard serta mouse terstruktur untuk interaksi desktop asli. Pelatihannya berupa penyetelan halus terawasi yang diikuti pembelajaran penguatan daring di lingkungan GUI yang dapat dieksekusi — model tersebut belajar dengan benar-benar mengoperasikan desktop, bukan hanya dari tangkapan layar statis.
Ruang aksi adalah bagian yang akan diperhatikan pengembang: mouse, keyboard, scrolling, menunggu, interaksi pengguna, dan penyelesaian tugas, dengan keluaran yang kompatibel dengan pyautogui. Model bekerja dalam ruang koordinat ternormalisasi 1000×1000 dan agen referensi menskalakan ulang prediksinya kembali ke resolusi tangkapan layar yang sebenarnya, sehingga aksi tetap bertahan terhadap perbedaan penskalaan tampilan antar mesin. README model itu sendiri merekomendasikan untuk menyajikannya dengan vLLM di belakang endpoint yang kompatibel dengan OpenAI.
Fitur yang membedakan: eksekusi dengan panduan demonstrasi
Sebagian besar agen GUI menerima satu masukan: instruksi. UI-Mate menerima masukan kedua yang benar-benar langka pada checkpoint terbuka — demonstrasi. "Tunjukkan alur kerja sekali. Biarkan agen menyesuaikannya dengan tugas yang dihadapi," seperti yang tertulis di halaman proyek.
Mekanisme ini bukan video-in-context atau skrip aksi tetap. Demonstrasi merekam tangkapan layar tepat sebelum dan sesudah setiap aksi keyboard atau pointer, lalu pipeline menormalkan jejak tersebut menjadi representasi aksi-dan-frame yang konsisten, menganotasikannya dengan observasi, intensi, aksi, dan bukti verifikasi, serta menyegmennya menjadi subtugas bernama dengan kriteria penyelesaian. Pada waktu inferensi, itu menjadi alur kerja ringkas yang disuntikkan untuk subtugas aktif — tetapi tangkapan layar langsung tetap menjadi acuan utama sepanjang proses, jadi ketika status aplikasi berbeda dari demo, model merencanakan ulang alih-alih memutar ulang.
Tencent telah menjadikan checkpoint di balik alur kerja ini sebagai model publiknya sendiri: kartu UI-Mate-democua-27B memasangkan hasil instruksi-saja dan satu-demonstrasi pada evaluasi yang sama, dan skema alatnya menambahkan aksi subtask_complete — mekanisme di balik subtask bernama tersebut. Pada subset self-demo OSWorkerBench, satu demonstrasi meningkatkan keberhasilan ketat dari 17,17 menjadi 35,35 dan progres dari 67,85 menjadi 81,14; pada subset OSWorld, progres naik dari 40,27 menjadi 65,75; pada set evaluasi GameDev, skor rata-rata naik dari 76,76 menjadi 81,15 sementara panjang lintasan rata-rata turun dari 303,6 menjadi 253,1 langkah — demonstrasi tersebut mempersingkat tugas sekaligus memperbaikinya. Kartu tersebut melaporkan bahwa demonstrasi meningkatkan 28 dari 33 tugas self-demo dan menyelesaikan empat tugas yang mendapat skor nol tanpa panduan. Peringatannya sama dengan yang mengalir di seluruh artikel ini: ini adalah evaluasi berpasangan milik tim itu sendiri, dirata-ratakan dari tiga hingga lima kali percobaan, dan belum ada yang mereproduksinya.
Angka-angka tersebut — semuanya dilaporkan oleh vendor.
Eksekusi hanya instruksi, langsung dari kartu model:
• Skor rata-rata OSWorld-Verified — 77.0
• Skor rata-rata WindowsAgentArena — 66.2
• OSWorkerBench sukses ketat — 41.00
• Progres OSWorkerBench — 76.86

OSWorkerBench sendiri merupakan salah satu dari tiga kontribusi dalam makalah tersebut: sebuah tolok ukur baru yang berisi 100 tugas kantor berjangka panjang di 41 aplikasi, dengan 33 subset demo mandiri dan 45 subset demo varian. Ini adalah evaluasi baru, sehingga belum ada karya sebelumnya untuk membandingkan kedua skor tersebut. Dibandingkan dengan model dasarnya sendiri, UI-Mate-27B diklaim mengungguli Qwen3.6-27B dengan selisih 17,7 poin untuk keberhasilan ketat dan 24,5 poin untuk kemajuan pada OSWorkerBench — yang merupakan angka paling adil dalam seluruh rilis ini, karena kedua model akan dijalankan melalui pengaturan pengujian yang sama.
Setiap angka di atas adalah evaluasi tim sendiri. Belum ada skor independen, tidak ada pengulangan dari pihak ketiga, dan dengan nol unduhan, juga tidak ada reproduksi komunitas. Anggap setiap angka di sini sebagai klaim, bukan fakta.
Di mana angka-angka itu akan berada — jika mereka bertahan
WindowsAgentArena adalah salah satu yang akan menjadi berita utama yang sesungguhnya. Hasil WAA terbaik yang dilaporkan publik pada awal 2026 berkisar di angka 61,0 (sistem modular bernama VLAA-GUI, April 2026); EvoCUA-32B open-weight dari Meituan berada di 56,5, dan UI-TARS-2 tertutup milik ByteDance berada di kisaran 50-an bawah hingga menengah pada papan yang sama. Skor 66,2 pada evaluasi UI-Mate-27B sendiri akan menempatkannya di atas semua yang telah dilaporkan pada benchmark ini tahun ini — baik open maupun closed. Itu adalah klaim yang kuat, dan perlu dilakukan pengulangan independen.
OSWorld-Verified pada 77.0 tergolong kuat, tetapi bukan rekor open-weight baru di papan peringkat publik. Pada cuplikan papan peringkat OSWorld-Verified dari awal Agustus 2026, model open-weight Holo3-35B-A3B tercantum di 82.6, dengan beberapa model frontier tertutup di atasnya (Qwen3.8 Max di 86.1, Claude Mythos 5 dan Claude Fable 5 di 85.0, Claude Opus 4.8 di 83.4). Oleh karena itu, frasa "state of the art" dalam makalah tersebut adalah klaim tentang pengaturan evaluasinya sendiri, bukan fakta yang sudah mapan — perbedaan harness, parser aksi, dan drift pelaporan mandiri semuanya membuat 77.0 versus 82.6 menjadi pertanyaan yang hanya dapat dijawab oleh pengulangan independen. Sebagai konteks untuk memahami arti model terbuka 27B yang mencapai 77.0: model tersebut akan menempati posisi di atas baseline ahli manusia ~72.4 dan di atas beberapa sistem frontier yang lebih besar di papan yang sama, termasuk Claude Opus 4.6 di 72.7 dan Kimi K2.6 di 73.1.
Tencent bukanlah pendatang baru di bidang ini — mereka merilis POINTS-GUI-G, model penambat GUI berkemampuan 8B, pada Februari 2026, meluncurkan asisten Marvis OS pada bulan Mei, dan berkontribusi pada proyek penggunaan komputer GUICrafter pada bulan Juni. UI-Mate adalah lini khusus yang ditujukan untuk kontrol desktop penuh, dan merupakan agen GUI pertama dari Tencent yang dirilis sebagai model fondasi terbuka, bukan sebagai komponen penambat atau produk.
Cara menjalankannya
Model ini dirancang untuk vLLM, dan kartu model memberikan perintah yang tepat — vllm serve tencent/UI-Mate-27B dengan ukuran tensor-parallel 2 dan template chat yang kompatibel dengan OpenAI. Satu detail praktis menonjol: agen menyimpan lima tangkapan layar dalam konteks secara default, sehingga server harus menerima setidaknya enam gambar per prompt karena tangkapan layar terbaru tiba sebelum yang terlama dimampatkan. Flag yang disarankan adalah --limit-mm-per-prompt dengan enam gambar dan nol video. Checkpoint yang dipandu demonstrasi disajikan dengan cara yang sama — kartunya menyebutkan vLLM dan SGLang di belakang endpoint yang kompatibel dengan OpenAI.

Setelah disajikan, kelas agen Python (UIMateAgent) mengambil tangkapan layar dan instruksi, lalu mengembalikan respons beserta tindakan terstruktur, dengan menskalakan ulang koordinat 1000×1000 kembali ke resolusi Anda. Halaman proyek juga menawarkan aplikasi macOS Apple Silicon untuk mode berbantuan demonstrasi, yang merupakan cara termudah untuk mencoba alur kerja "tunjukkan sekali" tanpa membuat harness sendiri. Lisensinya sepenuhnya Apache-2.0, sehingga penggunaan lokal, penyesuaian (fine-tuning), dan integrasi komersial semuanya diperbolehkan.
Dua peringatan perlu menyertai panduan "cara menjalankannya" untuk agen penggunaan komputer, dan keduanya berasal dari kartu model itu sendiri. Gunakan lingkungan yang terisolasi atau sekali pakai. Mintalah konfirmasi manusia sebelum melakukan hal yang sensitif, pantau perjalanan eksekusinya, dan jangan menganggap keberhasilan yang dilaporkan model sebagai bukti bahwa hasil yang diinginkan benar-benar tercapai. Agen GUI bisa salah klik, dan injeksi perintah melalui konten di layar adalah model ancaman yang nyata, bukan sekadar hipotetis.
Tumpukan di sekitar agen GUI baru
Belum ada satu pun checkpoint UI-Mate yang tersedia di OrcaRouter — keluarga model ini baru berumur beberapa hari dengan nol unduhan, dan model dasarnya, Qwen3.6-27B, juga belum tersedia. Tidak ada API yang di-hosting, jadi jika Anda ingin menjalankannya minggu ini, Anda harus melayani vLLM sendiri. Itu tidak masalah untuk laboratorium, tetapi bentuknya kurang tepat untuk produksi.
Sebuah pipeline penggunaan komputer yang produksi jarang sekali berupa satu checkpoint. Ia terdiri dari model perencana yang menentukan niat berikutnya, model grounding atau visi yang membaca layar, agen GUI itu sendiri, dan fallback murah saat sub-langkah gagal — dan semua bagian itu adalah model yang dilayani, bahkan ketika agen GUI bersifat lokal. Campuran itulah yang menjadi tujuan lapisan routing: satu API untuk 200+ model yang di-hosting, harga daftar penyedia diteruskan dengan markup 0%, dan failover otomatis sehingga gangguan sementara pada satu penyedia tidak menghentikan proses agen yang panjang. DSL routing juga memungkinkan Anda menyusun beberapa model dalam satu panggilan — perencana di awal, verifikator murah di akhir — tanpa harus menyambungkan penyedia dalam kode Anda sendiri. Ringkasannya jujur saja sederhana: agen yang menggerakkan desktop bersifat lokal, tetapi model yang memutuskan apa yang harus dilakukan di sekitarnya dapat di-routing, dan mencoba checkpoint baru yang belum terbukti dengan aman justru merupakan fungsi failover.
Tontonan Berikutnya
Empat hal akan mengubah gambaran untuk UI-Mate-27B, dalam urutan kepentingan yang kasar:
• Sebuah pelaksanaan ulang independen dari OSWorld-Verified dan WindowsAgentArena. Angka WAA khususnya bisa menjadi hal besar atau artefak harness, dan hanya evaluasi eksternal yang dapat memastikan mana yang benar.
• Laporan teknis formal. Kutipan saat ini masih berupa placeholder, dan makalah lengkapnya kemungkinan besar akan mengungkap detail mesin data yang hanya diuraikan secara garis besar oleh abstrak.
• Pengumuman resmi Tencent. Rilis repo-first seperti ini biasanya mendahului sesuatu — integrasi Marvis, penawaran hosted, atau dorongan model terbuka yang lebih luas.
• API yang di-hosting. Bobot ketiga checkpoint sudah publik sekarang, tetapi tidak ada yang dilayani di mana pun — tidak ada endpoint Tencent, tidak ada penyedia inferensi pihak ketiga — jadi self-hosting tetap satu-satunya jalur, dan hanya pengumuman Tencent atau adopsi oleh penyedia yang mengubahnya.
FAQ
Apa itu Tencent UI-Mate-27B?
UI-Mate-27B adalah agen GUI fondasi berparameter 27 miliar berlisensi Apache-2.0 dari Tim Agen Multimodal HY Frontier milik Tencent, yang disetel halus dari Qwen3.6-27B. Agen ini mengamati tangkapan layar desktop secara langsung, menalar atas tangkapan layar tersebut, dan menghasilkan aksi mouse serta keyboard yang kompatibel dengan pyautogui. Model ini dirilis secara diam-diam di Hugging Face pada 14 Agustus 2026 — bersama saudara 9B-nya dan UI-Mate-democua-27B yang berpanduan demonstrasi — tanpa pengumuman, dan tolok ukurnya sejauh ini seluruhnya dilaporkan sendiri oleh vendor.
Bagaimana eksekusi yang dipandu demonstrasi berbeda dari memutar ulang skrip?
Daripada menjalankan makro yang direkam, UI-Mate memperlakukan demonstrasi sebagai alur kerja berstruktur subtask dengan keterangan yang disuntikkan sebagai panduan. Tangkapan layar langsung tetap menjadi sumber otoritas, sehingga ketika tata letak, konten, atau status aplikasi berbeda dari yang ditunjukkan, model merencanakan ulang daripada memutar ulang koordinat basi. Itulah mekanisme di balik lonjakan yang diklaim dari 17.2 menjadi 35.4 keberhasilan ketat pada subset demo mandiri — dan itu masih klaim vendor sampai seseorang mereproduksinya.
Apakah UI-Mate-27B benar-benar mutakhir untuk agen GUI open-weight?
Itu sepenuhnya bergantung pada pengaturan evaluasi. Skor WindowsAgentArena 66.2-nya akan mengungguli hasil WAA terbaik yang dilaporkan publik dari awal 2026, tetapi OSWorld-Verified 77.0-nya berada di bawah Holo3-35B-A3B open-weight dengan 82.6 di papan publik. Makalah ini menyebutnya sebagai state of the art open-weight baru; pengulangan independen pada harness yang konsisten adalah satu-satunya cara untuk mengetahuinya.
Bisakah saya menjalankan UI-Mate-27B hari ini?
Ya, jika Anda menyajikannya sendiri: unduh bobot dari Hugging Face — checkpoint umum 27B, yang 9B, atau UI-Mate-democua-27B yang dipandu demonstrasi — jalankan perintah vLLM dari kartu model (ukuran tensor-parallel 2, enam gambar per prompt), dan kendalikan dengan agen Python atau aplikasi macOS. Tidak ada API yang dihosting, dan belum ada checkpoint yang ada di OrcaRouter — yang, untuk model yang baru dan belum terverifikasi ini, adalah alasan yang masuk akal untuk menyimpannya di lingkungan terisolasi untuk saat ini.
Pembacaan yang tepat atas UI-Mate-27B bukanlah "pemenang" melainkan "layak diperhatikan." Model terbuka 27B yang mengklaim keunggulan WAA dan merilis alur kerja demonstrasi sekali-tayang merupakan titik data yang bermakna di tahun ketika agen penggunaan komputer berbobot terbuka telah berubah dari sekadar lelucon menjadi nyaris mencapai garis depan. Kini checkpoint berpanduan demonstrasi itu berupa bobot publik, bukan sekadar placeholder di halaman proyek, alur kerja "tunjukkan sekali" benar-benar bisa dijalankan. Tencent selama ini berhati-hati dalam hal rilis, dan yang satu ini tampak seperti karya dalam pengembangan yang dipublikasikan. Jalankan di sandbox, jalankan ulang benchmark-nya, dan terus pantau pengumumannya — bagian menarik dari kisah ini masih ada di depan.
