Kartu judul hero untuk perbandingan 'InternLumina-U2 vs Tencent UI-Mate-27B' dengan subjudul 'Agen desktop yang dapat Anda jalankan sekarang vs model visi yang hanya dapat Anda baca' dan tiga chip statistik — 'UI-Mate-27B: mengoperasikan desktop saat ini', 'InternLumina-U2: visi terpadu, tanpa bobot', 'Keduanya Apache-2.0, keduanya belum terbukti' — dengan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

InternLumina-U2 vs Tencent UI-Mate-27B: Agen Desktop yang Dapat Anda Jalankan Sekarang vs Model Visi Terpadu yang Hanya Dapat Anda Baca

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tencent UI-Mate-27B dan InternLumina-U2 adalah dua rilis tenang berlisensi Apache-2.0 dari laboratorium Tiongkok, dirilis dengan jarak dua minggu, dan keduanya bukanlah pesaing — justru itulah mengapa mereka layak dibandingkan. Tencent UI-Mate-27B, dirilis sebagai bobot terbuka pada 14 Agustus 2026, adalah agen desktop: ia mengamati layar dan mengeluarkan aksi mouse serta keyboard. InternLumina-U2, diterbitkan sebagai kode inferensi pada 1 September 2026 oleh Shanghai AI Laboratory, adalah calon model visi terpadu: ia mengklaim dapat membaca gambar, video, dan 3D serta menghasilkan dan menyunting gambar. Yang satu bertindak berdasarkan apa yang dilihatnya; yang lain, ketika bobotnya akhirnya ada, akan berbicara dan menggambar tentang apa yang dilihatnya. Jika tugas Anda adalah mengoperasikan desktop, hanya satu dari keduanya yang dapat melakukannya saat ini — dan itu bukan yang memiliki arsitektur yang lebih canggih.

Agen yang bertindak: Tencent UI-Mate-27B

UI-Mate-27B adalah agen GUI fondasi open-weight dengan 27 miliar parameter dari tim agen multimodal HY Frontier milik Tencent, yang disempurnakan dari Qwen3.6-27B. Model ini mengamati tangkapan layar langsung, menalar keadaan layar saat ini, dan mengeluarkan aksi keyboard dan mouse terstruktur dalam ruang koordinat yang dinormalisasi — sebuah artefak dari model yang dilatih untuk mengoperasikan desktop sungguhan, bukan sekadar mengobrol tentangnya. Fitur pembedanya adalah eksekusi berbasis demonstrasi: tunjukkan alur kerja sekali, dan ia menyesuaikan demonstrasi yang terekam dengan tugas yang dihadapi, memperlakukan tangkapan layar langsung sebagai sumber otoritatif ketika antarmuka berbeda dari yang direkam. Skor utama yang dilaporkan Tencent adalah OSWorld-Verified 77.0 dan WindowsAgentArena 66.2 — angka-angka yang akan menempati puncak papan peringkat 2026 tersebut jika direproduksi secara independen — bersama dengan sebaran angka OSWorkerBench. Bobot (weights) model ini nyata dan dapat diunduh: dua belas pecahan safetensors di Hugging Face, dapat dihosting sendiri melalui vLLM atau SGLang pada beberapa GPU, dan kartu model memuat peringatan penting bahwa ini adalah checkpoint agen, bukan model visual-chat yang berdiri sendiri — mengarahkannya ke "deskripsikan gambar ini" berarti Anda menggunakannya dengan cara yang salah.

Mata yang dijanjikan: InternLumina-U2

InternLumina-U2 adalah spesies yang sama sekali berbeda. Ia adalah model difusi sparse mixture-of-experts dengan parameter 16B (1B aktif) yang dimaksudkan lab sebagai satu model untuk pemahaman omni-visual, pembuatan gambar, dan penyuntingan gambar — desain delapan codebook yang sepenuhnya diskret di mana satu backbone tunggal sekaligus membaca gambar, bagan, video, atau aset 3D dan menulis piksel baru. Jika model mental Anda adalah agen GUI, InternLumina-U2 adalah kutub yang berlawanan: ia tidak ingin mengeklik apa pun, ia ingin memahami segalanya dan menggambar atas permintaan. Publikasinya pada 1 September 2026 berupa kode inferensi dan arsitektur — enam titik masuk tugas di repositori GitHub, halaman proyek dengan tabel tolok ukur pendahuluan, stub Hugging Face yang kosong — dan bobot, kode pelatihan, serta laporan teknisnya semuanya masih bertanda "coming soon". Tidak seorang pun dapat menjalankannya. Kesenjangan antara kedua model itu bukan kualitas; melainkan eksistensi.

Papan skor

Angka UI-Mate-27B dilaporkan oleh Tencent dan belum direproduksi; angka InternLumina-U2 dilaporkan dari lab, bersifat pendahuluan dan parsial. Setiap baris mencantumkan sumbernya.

• Pekerjaan — Tencent UI-Mate-27B: mengoperasikan desktop — membaca tangkapan layar langsung, mengirim aksi mouse dan keyboard. InternLumina-U2: mempersepsi dan mencipta — memahami gambar/video/3D, membuat dan mengedit gambar.

• Bobot — Tencent UI-Mate-27B: publik sejak 14 Agustus 2026, dua belas shard safetensors, Apache-2.0. InternLumina-U2: belum publik — repositori Hugging Face kosong, bobot "segera hadir."

• Skala — 27B dense, fine-tuned dari Qwen3.6-27B vs model difusi MoE sparse 16B total / 1B aktif.

• Keluaran — Tencent UI-Mate-27B: tindakan terstruktur yang kompatibel dengan pyautogui dalam ruang koordinat ternormalisasi. InternLumina-U2: mengklaim teks, teks-ke-gambar hingga 1024×1024, dan pengeditan gambar berbasis instruksi.

• Angka utama — Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, peningkatan OSWorkerBench dari demonstrasi (semuanya dilaporkan Tencent). InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (dilaporkan lab, masih awal).

• Catatan asal-usul — Tencent UI-Mate-27B: kartu modelnya sendiri memperingatkan bahwa ini adalah checkpoint agen, bukan model obrolan visual yang berdiri sendiri. InternLumina-U2: halaman proyeknya melabeli hasilnya sendiri sebagai "pendahuluan, sebagian."

• Realitas penyajian — Tencent UI-Mate-27B: host sendiri melalui vLLM atau SGLang pada ~2 GPU; saat ini tidak ada penyedia inferensi terhosting yang menyebarkannya. InternLumina-U2: tidak dapat disajikan oleh siapa pun — driver yang dirilis memerlukan checkpoint yang tidak ada di repositori.

A comparison scoreboard for InternLumina-U2 and Tencent UI-Mate-27B: InternLumina-U2 with Job perceive & create visuals, Weights not public 'soon', Output text/images/edits, Headline ChartQA 86.5 (reported), Caveat untestable no weights, Serving no one can run it; Tencent UI-Mate-27B with Job operate a desktop, Weights public since Aug 14 2026, Output mouse & keyboard actions, Headline OSWorld 77.0 WAA 66.2, Caveat agent not visual chat, Serving self-host vLLM ~2 GPUs, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Dua varian berbeda dari yang belum terbukti

Kedua model sama-sama belum terbukti, dan kata itu tidak bermakna sama dua kali. Tencent UI-Mate-27B belum terbukti dalam arti biasa untuk model baru: skor utamanya adalah klaim vendor itu sendiri, tidak ada yang menjalankan ulang secara independen, dan jumlah unduhannya sangat kecil dibandingkan klaim-klaim tersebut — postur yang lazim bagi checkpoint yang pada pandangan pertama baru berumur empat hari dan sejak itu telah menumbuhkan komunitas yang sederhana. Namun, ia belum terbukti dalam cara yang dapat diuji. Karena bobotnya tersedia, angka 66.2 dan 77.0 dapat diperiksa minggu ini oleh siapa pun dengan dua GPU dan lingkungan pengujian Windows, dan klaim yang dipandu demonstrasi dapat direproduksi atau disangkal pada alur kerja nyata. InternLumina-U2 belum terbukti dalam arti yang lebih ketat: ia tidak dapat diuji. Arsitekturnya publik dan dapat dibaca, tetapi angkanya tidak — tidak ada artefak yang dapat mengonfirmasikannya, dan tabel parsial milik lab itu sendiri sudah menunjukkan bahwa model tersebut tertinggal dari saingan yang disebutkan namanya dalam setidaknya satu tolok ukur generasi. Angka vendor yang dilampirkan pada file yang dapat diunduh adalah klaim yang menantikan wasit. Angka vendor yang dilampirkan pada peta jalan adalah harapan.

A screenshot of the Hugging Face model page for tencent/UI-Mate-27B (captured August 27 2026), showing the Qwen3.6-27B base model, the vendor-reported OSWorld and WindowsAgentArena benchmark tags, and the note that no inference provider currently deploys the model.

Kartu Hugging Face tencent/UI-Mate-27B, diambil pada 27 Agustus 2026 — basis Qwen3.6-27B, skor OSWorld dan WindowsAgentArena yang dilaporkan vendor, serta catatan bahwa belum ada penyedia inferensi yang saat ini menerapkannya.

Pembagian kerja alami: seorang aktor dan matanya

Saat disandingkan, kedua model tersebut menggambarkan bentuk pipeline otomasi yang andal. Masalah sulit dengan agen GUI bukanlah kasus rata-rata; melainkan agen yang diam-diam melakukan hal yang salah pada kondisi layar yang tak terduga dan tidak ada yang menyadarinya. Tepat itulah pekerjaan yang menjadi tujuan keberadaan model visi yang murah dan tepercaya — memverifikasi keadaan layar sebelum dan sesudah setiap tindakan, memastikan dialog yang muncul adalah dialog yang menurut agen muncul, dan menghentikan pengulangan ketika realitas dan model realitas dari agen menyimpang. Tencent UI-Mate-27B adalah aktornya; model visi terpadu seperti yang diklaim oleh InternLumina-U2 adalah verifikator alami, yang mampu membaca tangkapan layar yang sama yang menjadi dasar tindakan agen. Ketika — dan hanya ketika — bobot InternLumina-U2 benar-benar tersedia dan klaim pemahamannya lolos pengujian independen, itulah peran yang dapat diisinya di samping agen, bukan melawannya. Keduanya bukan pesaing untuk suatu pekerjaan; mereka adalah dua bagian dari satu pekerjaan.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page and the per-task inference scripts, including the image-understanding entry point that would underpin a screen-state verifier.

Repositori GitHub InternLM/InternLumina-U2, diabadikan pada 2 September 2026 — laman beranda repositori yang menampilkan skrip inferensi per tugas, termasuk titik masuk pemahaman gambar yang menjadi dasar bagi pembangunan verifikator status layar; bobot yang membuatnya dapat dijalankan tidak ada di dalam pohon repo.

Fungsi lapisan routing pada stack agen-plus-mata

Tidak ada satu pun dari kedua model ini yang dihosting di OrcaRouter, dan kami tidak akan menyiratkan sebaliknya — {{1}}Tencent UI-Mate-27B tidak memiliki penyedia hosting di mana pun{{/1}}, dan InternLumina-U2 tidak memiliki weights untuk dihosting oleh penyedia mana pun. Pola perutean yang berlaku adalah pola untuk arsitektur yang persis seperti ini: {{2}}agen yang bertindak dan model visi yang memverifikasi, dirangkai sedemikian rupa sehingga langkah yang mahal atau berisiko baru dijalankan jika langkah yang murah dan andal lolos{{/2}}. DSL perutean merepresentasikan hal itu sebagai satu panggilan logis tunggal — {{3}}bertindak, lalu memverifikasi, lalu melanjutkan atau berhenti{{/3}} — alih-alih kode perekat khusus antara dua penyedia model, dan {{4}}failover otomatis menangani mode kegagalan yang realistis: {{5}}agen GUI seperti UI-Mate-27B adalah persis jenis checkpoint yang belum terbukti yang lebih dulu Anda uji coba di jalur tes{{/5}}, dengan panggilan yang langsung jatuh ke model yang sudah terbukti begitu model yang baru itu berulah{{/4}}. Satu API untuk 200+ model yang dihosting, harga daftar penyedia diteruskan dengan markup 0%, dan {{6}}bagian-bagian stack yang belum terbukti tetap di balik pagar pengaman sambil meraih kepercayaan Anda{{/6}}.

Intinya

Jika Anda membangun sesuatu yang mengoperasikan desktop, Tencent UI-Mate-27B adalah satu-satunya dari kedua model ini yang benar-benar dapat digunakan — dapat dijalankan hari ini di GPU Anda sendiri, dengan skor yang mengesankan namun belum terverifikasi yang bisa Anda uji sendiri. Jika Anda membangun sesuatu yang membutuhkan model untuk memahami dan menggambar tentang apa yang dilihatnya, InternLumina-U2 adalah arsitektur yang menjanjikan yang masih menunggu bobotnya — layak dibaca sekarang, tapi belum berguna sebagai ketergantungan sampai file safetensors-nya muncul. Perhatikan keduanya untuk saat pembagian kerja menjadi mungkin: seorang aktor di desktop Anda, seperangkat mata terverifikasi yang mengawasinya, dan lapisan perutean yang menjaga mereka tetap jujur.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube