Kartu judul hero untuk 'UI-Venus-2-9B vs Microsoft Mage-VL' dengan subjudul 'Agen tangkapan layar vs pengamat aliran codec', menampilkan lencana biru '9B · AGEN TANGKAP LAYAR' dengan pil 'bertindak' dan lencana cyan '4B · PENGAMAT STREAM' dengan pil 'mendeskripsikan', serta logo OrcaRouter di sudut kanan bawah.
Guides & Insights

UI-Venus-2-9B vs Microsoft Mage-VL: Agen Tangkapan Layar vs Pemantau Aliran Codec

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

UI-Venus-2-9B dan Microsoft Mage-VL sama-sama dirilis secara senyap dalam rentang satu bulan satu sama lain — repositori Mage-VL muncul pada 26 Juli 2026, UI-Venus-2-9B pada 26 Agustus 2026 — keduanya merupakan bobot terbuka Apache-2.0, dan keduanya dibangun di atas backbone keluarga Qwen. Kurang lebih di situlah persamaannya berakhir, dan perbedaannya bukan soal derajat, melainkan soal sisi layar mana yang menjadi tempat tinggal masing-masing model. Microsoft Mage-VL adalah model persepsi streaming native-codec: ia menonton video terkompresi, tetap diam selama cuplikan rutin, dan mengeluarkan teks ketika sebuah peristiwa selesai. UI-Venus-2-9B adalah agen GUI: ia mengonsumsi tangkapan layar diam, menalar keadaan, dan mengeluarkan aksi terstruktur. Yang satu menonton layar dan mendeskripsikannya; yang lain menonton layar dan mengoperasikannya. Memilih di antara keduanya bukanlah keputusan tolok ukur, karena keduanya tidak berbagi satu pun tolok ukur — ini adalah keputusan tentang apakah otomatisasi Anda berakhir pada sebuah jawaban atau pada sebuah aksi.

Apa sebenarnya setiap model itu

Microsoft Mage-VL, dirilis di repositori microsoft/Mage-VL tanpa pengumuman, adalah model multimodal dengan sekitar 4B parameter yang dibangun dari decoder bahasa Qwen3-4B-Instruct-2507, encoder visual buatan baru bernama Mage-ViT, dan gerbang streaming terpisah sekitar 0,5B. Desainnya memang berbasis codec video: alih-alih melakukan sampling bingkai secara seragam, ia menyimpan bingkai jangkar (I) secara penuh dan hanya mempertahankan patch yang menonjol karena gerakan dari bingkai prediksi (P), yang menurut Microsoft mengurangi konsumsi token visual lebih dari 75% dan memberikan percepatan inferensi hingga 3,5× dibandingkan sampling seragam. Desain dua-proses — gerbang kognisi Sistem 1 mengawasi setiap jendela codec yang bergulir, VLM Sistem 2 hanya aktif ketika ada peristiwa yang layak ditanggapi — menjadikannya pengawas video yang selalu aktif yang murah justru karena sebagian besar diam.

UI-Venus-2-9B, dirilis oleh inclusionAI (laboratorium Ant Group dari tim Venus), adalah agen GUI serbaguna 9B yang diinisialisasi dari Qwen3.5-9B. Model ini mengamati antarmuka, menalar status tugas, mengeksekusi aksi, dan menggabungkan umpan balik — sebuah siklus tertutup amati–nalar–aksi–umpan balik — dan kartu modelnya mengklaim cakupan pelatihan atas aplikasi seluler, platform web, dan sistem operasi desktop dalam satu checkpoint. Pada kartu modelnya sendiri, model ini melaporkan AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8, dan ScreenSpot-Pro 73.0, semuanya dilaporkan oleh vendor dan belum ada yang direproduksi secara independen.

Kesenjangan input: piksel yang Anda ambil vs aliran yang Anda simpan

Perbedaan yang paling instruktif adalah apa yang dikonsumsi setiap model. UI-Venus-2-9B adalah agen tangkapan layar: masukannya adalah layar saat ini, satu bingkai pada satu waktu, dan jendela konteks 256K-token adalah caranya menyimpan riwayat bingkai-bingkai tersebut selama tugas yang panjang. Mage-VL adalah agen aliran: masukannya adalah video terkompresi, dan efisiensinya berasal dari memperlakukan gerakan antar bingkai sebagai data — vektor gerakan dan energi residual untuk codec tradisional, peta laju yang dipelajari untuk codec neural. Inilah perbedaan antara model yang melihat momen-momen dan model yang melihat garis waktu yang kontinu. Agen tangkapan layar secara struktural buta terhadap 100 milidetik di antara pengambilan gambar — pemutar, transisi pemuatan, status hover yang hanya ada di layar sesaat. Pengamat aliran hidup di dalam celah tersebut. Itu bukanlah kelemahan dalam kedua desain tersebut; itulah sebabnya agen GUI yang perlu bertindak pada layar langsung dan model persepsi yang perlu merangkum umpan adalah produk yang berbeda dengan kontrak input yang berbeda.

A generated two-column scoreboard for 'UI-Venus-2-9B vs Microsoft Mage-VL': left column UI-Venus-2-9B — Job GUI agent acts on screens, Input still screenshots, Output structured actions, Size 9B, Serving vLLM OpenAI-compatible, Context 256K; right column Microsoft Mage-VL — Job stream watcher describes screens, Input compressed video codec streams, Output event-gated text, Size ~4B + 0.5B gate, Serving trust_remote_code custom, Context rolling codec window; footer 'Both vendor-reported; no shared benchmark.'

Kesenjangan output: tindakan vs komentar

Sisi keluaran adalah tempat keduanya tidak bisa lagi dibandingkan. Keluaran UI-Venus-2-9B adalah aksi terstruktur dalam ruang aksi yang terdefinisi — mouse, keyboard, scroll, navigasi — yang dikeluarkan setelah token penalaran ala Qwen3, dan pelatihannya dibangun di sekitar tugas grounding dan CAPTCHA yang memberi penghargaan pada lokalisasi elemen yang presisi di bawah kekacauan visual. Keluaran Mage-VL adalah teks: komentar yang dipicu peristiwa tentang apa yang dilihatnya. Ia tidak memiliki ruang aksi, tidak ada pemanggilan fungsi, dan tidak ada loop agen. Baca dua kartu model ini berdampingan dan Anda sedang melihat sisi berlawanan dari garis persepsi–aksi — Mage-VL berakhir dengan deskripsi, UI-Venus-2-9B berakhir dengan klik.

Pekerjaan — UI-Venus-2-9B: agen GUI, mengoperasikan antarmuka. Microsoft Mage-VL: persepsi streaming, mendeskripsikan antarmuka.

Masukan — UI-Venus-2-9B: screenshot statis, riwayat 256K-token. Microsoft Mage-VL: aliran codec video terkompresi, sparsitas token saliensi gerakan.

Output — UI-Venus-2-9B: aksi mouse/keyboard/navigasi terstruktur. Microsoft Mage-VL: komentar teks yang dipicu peristiwa.

Ukuran — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B streaming gate.

Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 ditambah Mage-ViT yang dibuat dari nol.

Lisensi — keduanya Apache-2.0 (kartu Mage-VL mencatat bahwa hanya untuk tujuan penelitian di repositorinya).

Kesenjangan pelayanan

Di sini, model yang lebih baru dan lebih besar justru lebih mudah untuk dijalankan. UI-Venus-2-9B mendokumentasikan satu perintah vLLM dengan jendela konteks 256K dan API standar yang kompatibel dengan OpenAI. Mage-VL memerlukan trust_remote_code untuk menjalankan Python kustom Microsoft, plus FFmpeg, jalur neural-codec untuk video, dan dependensi seperti mamba-ssm, serta belum memiliki stack serving vLLM atau SGLang — tanpa paged attention, tanpa jalur serving produksi. Microsoft melaporkan sekitar 10,6 GB total parameter BF16, yang berarti GPU 16 GB adalah batas bawah yang realistis untuk pekerjaan gambar dan 24 GB+ untuk video panjang. Bagi tim yang ingin membawa sesuatu ke produksi hari ini, UI-Venus-2-9B memiliki jalur masuk yang lebih bersih; bagi tim yang membangun pipeline pemantauan atau peringkasan yang selalu aktif, stack serving Mage-VL adalah hal yang Anda hadapi apa pun pilihannya, lengkap dengan Python kustom dan semua itu.

Papan skor yang tidak ada.

Tidak ada benchmark bersama antara kedua model ini, dan menciptakan satu secara mengada-ada akan menjadi tindakan yang tidak jujur. Angka UI-Venus-2-9B berada di papan peringkat GUI-grounding, mobile, web, dan computer-use (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, semuanya dilaporkan vendor). Angka Mage-VL berada di papan peringkat pemahaman video dan spasial (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 di atas Qwen3-VL-4B, semuanya dilaporkan vendor). Cara yang tepat untuk membaca pertarungan ini adalah sebagai percabangan jalan: jika tugasnya adalah "memahami apa yang terjadi di layar ini seiring waktu," Mage-VL adalah alat yang relevan dan UI-Venus-2-9B tidak dirancang untuk itu; jika tugasnya adalah "membuat layar ini melakukan sesuatu," yang berlaku justru sebaliknya.

Di mana keduanya menyusun

Versi menarik dari perbandingan ini bukanlah salah satu/atau. Agen GUI yang mengoperasikan aplikasi langsung memiliki titik buta yang nyata — waktu antara tangkapan layar, dan perubahan status apa pun yang tidak pernah menetap menjadi bingkai statis — dan pengamat aliran asli codec justru merupakan jenis model yang dapat bertindak sebagai lapisan persepsi di celah itu, mendeteksi bahwa halaman selesai dimuat atau bahwa modal selesai beranimasi sebelum proses grounding agen berikutnya. Microsoft tidak membangun Mage-VL untuk pekerjaan itu, dan Ant Group tidak membangun UI-Venus-2-9B untuk dikendalikan oleh model kedua, tetapi kecocokannya nyata. Untuk bagian-bagian dari tumpukan semacam itu yang sudah berkelas produksi — LLM perencana yang menguraikan tugas, model visi yang memverifikasi status layar, model transkripsi yang mencatat sesi agen — satu API dengan harga pass-through dan failover otomatis adalah yang membuat eksperimen menjadi murah, dan itulah fungsi router. Baik UI-Venus-2-9B maupun Microsoft Mage-VL saat ini tidak dilayani melalui OrcaRouter; keduanya adalah proyek self-host dengan bobot terbuka, dan keduanya akan tampil dengan harga daftar penyedia jika suatu saat mencapai penyedia yang dirutekan.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured August 27 2026) showing the model header with one like, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, multimodal, gui, and the opening of the UI-Venus-2 model card.A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026) showing the model header, the tags image-text-to-text, Transformers, Safetensors, mage_vl, multimodal, vision-language-model, and the opening of the Mage-VL model card.

Siapa yang harus memilih yang mana

Pilih Microsoft Mage-VL saat masalah Anda adalah persepsi berkelanjutan — umpan kamera, rekaman layar, aliran yang perlu diringkas atau dipantau secara real-time, dengan biaya yang cukup murah untuk terus berjalan. Pilih UI-Venus-2-9B saat masalah Anda adalah kontrol — tugas yang berakhir pada aksi yang selesai, formulir yang terisi, alur yang dinavigasi, aplikasi yang dioperasikan. Dan jika otomasi Anda benar-benar membutuhkan keduanya — persepsikan aliran, lalu bertindak pada gambar diam — jalankan keduanya sebagai pasangan dan perlakukan pengawas aliran sebagai pendeteksi peristiwa yang memberi agen tangkapan layar momen-momen yang layak untuk ditindaklanjuti. Keduanya adalah dua bagian dari layar yang sama, bukan pesaing untuk pekerjaan yang sama.