
InternLumina-U2 vs Tencent UI-Mate-27B: Agen Desktop yang Dapat Anda Jalankan Sekarang vs Model Visi Terpadu yang Hanya Dapat Anda Baca
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
Tencent UI-Mate-27B dan InternLumina-U2 adalah dua rilis tenang berlisensi Apache-2.0 dari laboratorium Tiongkok, dirilis dengan jarak dua minggu, dan keduanya bukanlah pesaing — justru itulah mengapa mereka layak dibandingkan. Tencent UI-Mate-27B, dirilis sebagai bobot terbuka pada 14 Agustus 2026, adalah agen desktop: ia mengamati layar dan mengeluarkan aksi mouse serta keyboard. InternLumina-U2, diterbitkan sebagai kode inferensi pada 1 September 2026 oleh Shanghai AI Laboratory, adalah calon model visi terpadu: ia mengklaim dapat membaca gambar, video, dan 3D serta menghasilkan dan menyunting gambar. Yang satu bertindak berdasarkan apa yang dilihatnya; yang lain, ketika bobotnya akhirnya ada, akan berbicara dan menggambar tentang apa yang dilihatnya. Jika tugas Anda adalah mengoperasikan desktop, hanya satu dari keduanya yang dapat melakukannya saat ini — dan itu bukan yang memiliki arsitektur yang lebih canggih.
Agen yang bertindak: Tencent UI-Mate-27B
UI-Mate-27B adalah agen GUI fondasi open-weight dengan 27 miliar parameter dari tim agen multimodal HY Frontier milik Tencent, yang disempurnakan dari Qwen3.6-27B. Model ini mengamati tangkapan layar langsung, menalar keadaan layar saat ini, dan mengeluarkan aksi keyboard dan mouse terstruktur dalam ruang koordinat yang dinormalisasi — sebuah artefak dari model yang dilatih untuk mengoperasikan desktop sungguhan, bukan sekadar mengobrol tentangnya. Fitur pembedanya adalah eksekusi berbasis demonstrasi: tunjukkan alur kerja sekali, dan ia menyesuaikan demonstrasi yang terekam dengan tugas yang dihadapi, memperlakukan tangkapan layar langsung sebagai sumber otoritatif ketika antarmuka berbeda dari yang direkam. Skor utama yang dilaporkan Tencent adalah OSWorld-Verified 77.0 dan WindowsAgentArena 66.2 — angka-angka yang akan menempati puncak papan peringkat 2026 tersebut jika direproduksi secara independen — bersama dengan sebaran angka OSWorkerBench. Bobot (weights) model ini nyata dan dapat diunduh: dua belas pecahan safetensors di Hugging Face, dapat dihosting sendiri melalui vLLM atau SGLang pada beberapa GPU, dan kartu model memuat peringatan penting bahwa ini adalah checkpoint agen, bukan model visual-chat yang berdiri sendiri — mengarahkannya ke "deskripsikan gambar ini" berarti Anda menggunakannya dengan cara yang salah.
Mata yang dijanjikan: InternLumina-U2
InternLumina-U2 adalah spesies yang sama sekali berbeda. Ia adalah model difusi sparse mixture-of-experts dengan parameter 16B (1B aktif) yang dimaksudkan lab sebagai satu model untuk pemahaman omni-visual, pembuatan gambar, dan penyuntingan gambar — desain delapan codebook yang sepenuhnya diskret di mana satu backbone tunggal sekaligus membaca gambar, bagan, video, atau aset 3D dan menulis piksel baru. Jika model mental Anda adalah agen GUI, InternLumina-U2 adalah kutub yang berlawanan: ia tidak ingin mengeklik apa pun, ia ingin memahami segalanya dan menggambar atas permintaan. Publikasinya pada 1 September 2026 berupa kode inferensi dan arsitektur — enam titik masuk tugas di repositori GitHub, halaman proyek dengan tabel tolok ukur pendahuluan, stub Hugging Face yang kosong — dan bobot, kode pelatihan, serta laporan teknisnya semuanya masih bertanda "coming soon". Tidak seorang pun dapat menjalankannya. Kesenjangan antara kedua model itu bukan kualitas; melainkan eksistensi.
Papan skor
Angka UI-Mate-27B dilaporkan oleh Tencent dan belum direproduksi; angka InternLumina-U2 dilaporkan dari lab, bersifat pendahuluan dan parsial. Setiap baris mencantumkan sumbernya.
• Pekerjaan — Tencent UI-Mate-27B: mengoperasikan desktop — membaca tangkapan layar langsung, mengirim aksi mouse dan keyboard. InternLumina-U2: mempersepsi dan mencipta — memahami gambar/video/3D, membuat dan mengedit gambar.
• Bobot — Tencent UI-Mate-27B: publik sejak 14 Agustus 2026, dua belas shard safetensors, Apache-2.0. InternLumina-U2: belum publik — repositori Hugging Face kosong, bobot "segera hadir."
• Skala — 27B dense, fine-tuned dari Qwen3.6-27B vs model difusi MoE sparse 16B total / 1B aktif.
• Keluaran — Tencent UI-Mate-27B: tindakan terstruktur yang kompatibel dengan pyautogui dalam ruang koordinat ternormalisasi. InternLumina-U2: mengklaim teks, teks-ke-gambar hingga 1024×1024, dan pengeditan gambar berbasis instruksi.
• Angka utama — Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, peningkatan OSWorkerBench dari demonstrasi (semuanya dilaporkan Tencent). InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (dilaporkan lab, masih awal).
• Catatan asal-usul — Tencent UI-Mate-27B: kartu modelnya sendiri memperingatkan bahwa ini adalah checkpoint agen, bukan model obrolan visual yang berdiri sendiri. InternLumina-U2: halaman proyeknya melabeli hasilnya sendiri sebagai "pendahuluan, sebagian."
• Realitas penyajian — Tencent UI-Mate-27B: host sendiri melalui vLLM atau SGLang pada ~2 GPU; saat ini tidak ada penyedia inferensi terhosting yang menyebarkannya. InternLumina-U2: tidak dapat disajikan oleh siapa pun — driver yang dirilis memerlukan checkpoint yang tidak ada di repositori.

Dua varian berbeda dari yang belum terbukti
Kedua model sama-sama belum terbukti, dan kata itu tidak bermakna sama dua kali. Tencent UI-Mate-27B belum terbukti dalam arti biasa untuk model baru: skor utamanya adalah klaim vendor itu sendiri, tidak ada yang menjalankan ulang secara independen, dan jumlah unduhannya sangat kecil dibandingkan klaim-klaim tersebut — postur yang lazim bagi checkpoint yang pada pandangan pertama baru berumur empat hari dan sejak itu telah menumbuhkan komunitas yang sederhana. Namun, ia belum terbukti dalam cara yang dapat diuji. Karena bobotnya tersedia, angka 66.2 dan 77.0 dapat diperiksa minggu ini oleh siapa pun dengan dua GPU dan lingkungan pengujian Windows, dan klaim yang dipandu demonstrasi dapat direproduksi atau disangkal pada alur kerja nyata. InternLumina-U2 belum terbukti dalam arti yang lebih ketat: ia tidak dapat diuji. Arsitekturnya publik dan dapat dibaca, tetapi angkanya tidak — tidak ada artefak yang dapat mengonfirmasikannya, dan tabel parsial milik lab itu sendiri sudah menunjukkan bahwa model tersebut tertinggal dari saingan yang disebutkan namanya dalam setidaknya satu tolok ukur generasi. Angka vendor yang dilampirkan pada file yang dapat diunduh adalah klaim yang menantikan wasit. Angka vendor yang dilampirkan pada peta jalan adalah harapan.

Kartu Hugging Face tencent/UI-Mate-27B, diambil pada 27 Agustus 2026 — basis Qwen3.6-27B, skor OSWorld dan WindowsAgentArena yang dilaporkan vendor, serta catatan bahwa belum ada penyedia inferensi yang saat ini menerapkannya.
Pembagian kerja alami: seorang aktor dan matanya
Saat disandingkan, kedua model tersebut menggambarkan bentuk pipeline otomasi yang andal. Masalah sulit dengan agen GUI bukanlah kasus rata-rata; melainkan agen yang diam-diam melakukan hal yang salah pada kondisi layar yang tak terduga dan tidak ada yang menyadarinya. Tepat itulah pekerjaan yang menjadi tujuan keberadaan model visi yang murah dan tepercaya — memverifikasi keadaan layar sebelum dan sesudah setiap tindakan, memastikan dialog yang muncul adalah dialog yang menurut agen muncul, dan menghentikan pengulangan ketika realitas dan model realitas dari agen menyimpang. Tencent UI-Mate-27B adalah aktornya; model visi terpadu seperti yang diklaim oleh InternLumina-U2 adalah verifikator alami, yang mampu membaca tangkapan layar yang sama yang menjadi dasar tindakan agen. Ketika — dan hanya ketika — bobot InternLumina-U2 benar-benar tersedia dan klaim pemahamannya lolos pengujian independen, itulah peran yang dapat diisinya di samping agen, bukan melawannya. Keduanya bukan pesaing untuk suatu pekerjaan; mereka adalah dua bagian dari satu pekerjaan.

Repositori GitHub InternLM/InternLumina-U2, diabadikan pada 2 September 2026 — laman beranda repositori yang menampilkan skrip inferensi per tugas, termasuk titik masuk pemahaman gambar yang menjadi dasar bagi pembangunan verifikator status layar; bobot yang membuatnya dapat dijalankan tidak ada di dalam pohon repo.
Fungsi lapisan routing pada stack agen-plus-mata
Tidak ada satu pun dari kedua model ini yang dihosting di OrcaRouter, dan kami tidak akan menyiratkan sebaliknya — {{1}}Tencent UI-Mate-27B tidak memiliki penyedia hosting di mana pun{{/1}}, dan InternLumina-U2 tidak memiliki weights untuk dihosting oleh penyedia mana pun. Pola perutean yang berlaku adalah pola untuk arsitektur yang persis seperti ini: {{2}}agen yang bertindak dan model visi yang memverifikasi, dirangkai sedemikian rupa sehingga langkah yang mahal atau berisiko baru dijalankan jika langkah yang murah dan andal lolos{{/2}}. DSL perutean merepresentasikan hal itu sebagai satu panggilan logis tunggal — {{3}}bertindak, lalu memverifikasi, lalu melanjutkan atau berhenti{{/3}} — alih-alih kode perekat khusus antara dua penyedia model, dan {{4}}failover otomatis menangani mode kegagalan yang realistis: {{5}}agen GUI seperti UI-Mate-27B adalah persis jenis checkpoint yang belum terbukti yang lebih dulu Anda uji coba di jalur tes{{/5}}, dengan panggilan yang langsung jatuh ke model yang sudah terbukti begitu model yang baru itu berulah{{/4}}. Satu API untuk 200+ model yang dihosting, harga daftar penyedia diteruskan dengan markup 0%, dan {{6}}bagian-bagian stack yang belum terbukti tetap di balik pagar pengaman sambil meraih kepercayaan Anda{{/6}}.
Intinya
Jika Anda membangun sesuatu yang mengoperasikan desktop, Tencent UI-Mate-27B adalah satu-satunya dari kedua model ini yang benar-benar dapat digunakan — dapat dijalankan hari ini di GPU Anda sendiri, dengan skor yang mengesankan namun belum terverifikasi yang bisa Anda uji sendiri. Jika Anda membangun sesuatu yang membutuhkan model untuk memahami dan menggambar tentang apa yang dilihatnya, InternLumina-U2 adalah arsitektur yang menjanjikan yang masih menunggu bobotnya — layak dibaca sekarang, tapi belum berguna sebagai ketergantungan sampai file safetensors-nya muncul. Perhatikan keduanya untuk saat pembagian kerja menjadi mungkin: seorang aktor di desktop Anda, seperangkat mata terverifikasi yang mengawasinya, dan lapisan perutean yang menjaga mereka tetap jujur.
