Kartu judul hero yang dihasilkan untuk 'MiniCPM-V 4.7 vs UI-Venus 2.9B' dengan subjudul 'Model visi umum melawan agen GUI yang dibangun khusus', kartu kiri bertuliskan 'UI-Venus 2.9B: grounding, CAPTCHA, seluler, web, penggunaan komputer', kartu kanan bertuliskan 'MiniCPM-V 4.7: 35.2B sparse, tanpa kartu, tanpa benchmark' dan pil bertuliskan 'Spesialis melawan generalis yang belum terukur', dengan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

MiniCPM-V 4.7 vs UI-Venus 2.9B: Model Visi Umum Melawan Agen GUI yang Dirancang Khusus

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

MiniCPM-V 4.7 dan UI-Venus 2.9B keduanya adalah model visi-bahasa yang melihat tangkapan layar dan menghasilkan teks, dan di situ kemiripannya berakhir — karena salah satunya dibangun tepat untuk pekerjaan itu. UI-Venus 2.9B adalah agen GUI serbaguna dari inclusionAI, dirilis 26 Agustus 2026, yang seluruh desainnya berpusat pada mengamati antarmuka, menalar keadaan tugas, mengeluarkan aksi, dan memasukkan umpan balik yang dihasilkan; ia disertai laporan teknis, tabel benchmark di seluruh tugas GUI grounding, seluler, web, penggunaan komputer, dan CAPTCHA, serta evaluasi eksplisit tentang seberapa sering ia dapat dibujuk melakukan tindakan berbahaya. MiniCPM-V 4.7 adalah checkpoint sparse mixture-of-experts 35,2 miliar parameter yang diunggah oleh OpenBMB pada 6 Oktober 2026 tanpa kartu model, tanpa lisensi, dan tanpa benchmark. Membandingkan spesialis dengan generalis yang tidak terukur adalah latihan yang agak tidak biasa, dan halaman ini menjelaskan secara eksplisit di mana perbandingan itu berlaku dan di mana tidak.

Dua jenis rilis yang sangat berbeda

UI-Venus 2.9B adalah inclusionAI/UI-Venus-2-9B, sebuah model 9B-parameter yang diinisialisasi dari Qwen3.5-9B dan dilatih lanjut secara khusus sebagai agen GUI. Kartu tersebut menjelaskan sebuah loop tertutup — mengamati antarmuka, menalar keadaan tugas, mengeksekusi tindakan, melipat umpan balik ke dalam keputusan berikutnya — yang dilatih melalui tiga tahap: pelatihan menengah multimodal pada lintasan seluler, web, dan desktop simulasi berskala besar; pembelajaran penguatan offline yang terbagi ke dalam lima keluarga tugas; dan distilasi on-policy multi-guru yang menggabungkan guru-guru terspesialisasi domain menjadi satu kebijakan. Model ini dievaluasi pada tolok ukur GUI grounding, seluler, web, penggunaan komputer, dan CAPTCHA, serta secara terpisah pada keamanan tindakan berkonsekuensi: kartu tersebut melaporkan tingkat keberhasilan serangan sebesar 11,3% pada OSHarm dan 48,8% pada OSBlind, dibandingkan dengan 25,3% dan 79,4% untuk basis Qwen3.5-9B-nya. Kebetulan, saudara OpenBMB sendiri juga mengamati wilayah serupa: organisasi MiniCPM memiliki proyek AgentCPM-GUI dari Januari 2026, jadi ini adalah jalur yang telah dimasuki kedua laboratorium.

MiniCPM-V 4.7 adalah openbmb/MiniCPM-V-4.7-35B-A3B, 35.212.875.824 parameter BF16 di seluruh 70,4 GB dan enam belas shard, diunggah pada 6 Oktober 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs UI-Venus 2.9B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Purpose general vision, Grounding not documented, Safety ASR not evaluated, Context 256K, Evidence config file only. Right column 'UI-Venus 2.9B' lists Parameters 9.4B dense, Purpose GUI agent, Grounding core training task, Safety ASR 11.3% OSHarm, Context 256K served, Evidence technical report. The footer reads 'UI-Venus figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Backbone teks Sparse MoE dengan tag qwen3_5_moe_text — 256 pakar, 8 per token — di lebih dari 40 lapisan dengan pola atensi three-linear-to-one-full, menara visi internal 27 lapisan dengan downsampling 16× dan hingga sembilan irisan gambar, serta jendela konteks 256K. Tanpa README, sehingga tidak ada lisensi dan tidak ada benchmark. Tiga suka, nol unduhan, diskusi kosong.

Perbandingannya, dengan celah-celah yang dibiarkan terbuka

• Tujuan — UI-Venus 2.9B: agen GUI, dilatih secara end-to-end untuk interaksi antarmuka. MiniCPM-V 4.7: model visi-bahasa umum; untuk apa model ini dioptimalkan tidak dinyatakan.

• Parameter — UI-Venus 2.9B: 9.41B, padat. MiniCPM-V 4.7: total 35.2B, jarang, 8 dari 256 pakar per token.

• Model dasar — UI-Venus 2.9B: diinisialisasi dari Qwen3.5-9B, stack teks Qwen yang padat. MiniCPM-V 4.7: stack teks MoE turunan Qwen3.5, kelas qwen3_5_moe_text. Cabang berbeda dari pohon keluarga yang sama.

• Grounding antarmuka — UI-Venus 2.9B: kompetensi inti, dengan keluarga tugas khusus untuk grounding dan CAPTCHA dalam pelatihan serta sistem verifikasi berbasis keypoint yang menggunakan pemungutan suara multi-model. MiniCPM-V 4.7: tidak ada klaim khusus grounding, dan tidak ada format output koordinat yang didokumentasikan.

• Evaluasi keamanan — UI-Venus 2.9B: melaporkan ASR sebesar 11,3% pada OSHarm dan 48,8% pada OSBlind. MiniCPM-V 4.7: tidak ada.

• Bukti — UI-Venus 2.9B: laporan teknis di arXiv, halaman proyek, repositori GitHub, dan tabel benchmark. MiniCPM-V 4.7: file konfigurasi.

• Perkakas — UI-Venus 2.9B: quick-start vLLM dengan flag reasoning-parser, plus konversi GGUF dari komunitas. MiniCPM-V 4.7: belum ada.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Mengapa agen GUI bukan sekadar "VLM yang melihat layar"

Kesenjangan antara kedua model ini bukan terutama soal jumlah parameter, dan hal ini perlu diuraikan secara gamblang karena justru itulah yang membuat duel ini menarik, bukan sekadar timpang.

Tugas screenshot memiliki properti yang tidak dimiliki sebagian besar tolok ukur visi: keluarannya harus dapat dieksekusi. Ketika UI-Venus 2.9B diminta mengetuk tombol, ia harus mengeluarkan koordinat atau aksi terstruktur yang benar-benar dapat diterapkan oleh lingkungan, dan kesalahan kecil dalam grounding bukanlah jawaban salah di papan peringkat, melainkan tugas yang gagal dan state yang rusak. Itulah sebabnya kartu UI-Venus 2 menghabiskan begitu banyak ruangnya untuk verifikasi: penyelesaian tugas dinilai berdasarkan keypoint visual yang relevan dengan tugas alih-alih sekilas pandang holistik pada layar akhir, dan juri heterogen memberikan suara untuk mengurangi bias juri tunggal. Tujuan dari mesin tersebut adalah membuat sinyal imbalan pembelajaran penguatan menjadi kuat terhadap peretasan imbalan — model yang belajar memuaskan verifier yang malas alih-alih menyelesaikan tugas.

Ini juga menjelaskan bagian keselamatan.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured 7 October 2026) showing the model header, the qwen3_5, multimodal, gui and agent tags, and the opening of the UI-Venus-2 card describing a general-purpose foundation GUI agent that operates across mobile applications, web platforms and desktop operating systems.

Agen yang dapat mengoperasikan ponsel atau desktop memiliki permukaan serangan yang tidak dimiliki model pembuatan takarir, dan melaporkan tingkat keberhasilan serangan adalah hal minimal yang harus dilakukan sebuah laboratorium saat merilisnya. UI-Venus 2.9B melaporkan 11,3% pada OSHarm dan 48,8% pada OSBlind — angka kedua tinggi secara absolut, dan pembingkaian kartunya adalah perbandingan terhadap model dasarnya, bukan klaim absolut tentang ketangguhan. Bacalah itu sebagai "secara nyata lebih baik daripada titik awalnya," bukan sebagai "aman."

Arsitektur MiniCPM-V 4.7 tidak bisa menjelaskan apa pun tentang semua ini. Perhatian linear atas konteks yang panjang akan membantu agen yang harus mengingat riwayat interaksi yang panjang, dan MoE sparse akan membantu throughput jika Anda menjalankan banyak episode. Tetapi arsitektur yang berguna bagi agen bukanlah agen, dan tidak ada bagian dari artefak yang dirilis yang mendokumentasikan keluaran tindakan, akurasi grounding, atau perilaku keselamatan.

Penilaian jujur dari sisi MiniCPM

Menggoda untuk mengisi bagian ini dengan angka-angka 4.6. Tahan godaan itu. MiniCPM-V 4.6 adalah model dense 1,3B dengan backbone Qwen3.5-0.8B dan skema kompresi visual 4x/16x yang dapat dialihkan, dan hasil yang diiklankannya — skor 13 pada Artificial Analysis Intelligence Index, menurut laporan vendor, dengan biaya token hanya sebagian kecil dari model kecil sebanding — menggambarkan model itu. MiniCPM-V 4.7 mengubah backbone, mengubah pola atensi, dan mengubah kompresi visual default. Tidak ada pengukuran 4.6 yang bisa ditransfer, dan tidak satu pun dari itu yang sejak awal menggambarkan agen GUI.

Apa yang secara jujur dapat dikatakan tentang MiniCPM-V 4.7 terbatas dan faktual: bobotnya ada, bentuknya tidak lazim bagi keluarga ini, jendela konteksnya panjang, dan rilisnya belum lengkap. Tidak adanya lisensi adalah penghambat praktis; tidak adanya benchmark adalah penghambat evaluatif. Dan ada satu alasan sederhana untuk tertarik alih-alih tidak peduli — OpenBMB membangun perkakas GUI, termasuk AgentCPM-GUI, jadi model visi MoE sparse berkonteks panjang dari laboratorium itu bukan hal yang mustahil sebagai tulang punggung agen di masa depan. Itu adalah hipotesis tentang niat, dan repositori tidak mengonfirmasinya.

Apa yang akan Anda pilih, dan kapan

Untuk apa pun yang melibatkan tangkapan layar dan tindakan — mengetuk, mengetik, menggulir, menavigasi aplikasi atau situs web, mengekstrak data dari UI — UI-Venus 2.9B adalah satu-satunya dari keduanya yang menangani tugas itu. Ia memiliki pelatihan, mekanisme verifikasi, angka keamanan yang dilaporkan, dan perkakas yang cukup untuk menjalankannya di vLLM hari ini. Tidak ada yang pada MiniCPM-V 4.7 menunjukkan bahwa ia bersaing di sana, dan tanpa kartu model Anda bahkan tidak dapat memeriksa apakah ia mengeluarkan koordinat.

Untuk pekerjaan multimodal umum — mendeskripsikan gambar, membaca dokumen, analisis konteks panjang atas materi yang padat gambar — perbandingannya belum bisa ditentukan, karena salah satu sisi tidak memiliki bukti kualitas yang dipublikasikan. Jika Anda membutuhkannya hari ini, UI-Venus 2.9B setidaknya terukur, meskipun model ini disetel untuk antarmuka, bukan untuk penalaran dokumen, dan juga bukan pilihan pertama yang jelas untuk pekerjaan itu.

Pola dalam kedua kasus sama: model yang di-host sendiri yang menangani pekerjaan rutin, dan model frontier yang di-host untuk kasus-kasus sulit yang dialihkannya. Pengalihan itulah tempat router membuktikan perannya — satu kunci untuk lebih dari 200 model yang di-host, masing-masing diteruskan dengan harga daftar penyedia tanpa markup dari kami, dan otomatis failover ketika penyedia mengalami degradasi. Baik UI-Venus 2.9B maupun MiniCPM-V 4.7 tidak di-host di OrcaRouter; keduanya adalah bobot yang Anda jalankan sendiri. Router adalah yang dihubungi agen Anda ketika agen memutuskan model lokal sudah tidak cukup.

Ke mana ini membawamu

Ini bukan keputusan yang sulit, dan alasannya struktural, bukan penilaian tentang kualitas. UI-Venus 2.9B adalah spesialis dengan laporan, lisensi, tabel benchmark, evaluasi keamanan, dan resep penyajian. MiniCPM-V 4.7 adalah generalis dengan file konfigurasi. Salah satunya adalah produk dan yang lainnya adalah janji, dan satu-satunya cara yang bertanggung jawab untuk membandingkan keduanya adalah dengan mengatakan hal itu. Pantau repositorinya: jika OpenBMB menerbitkan kartu yang menunjukkan grounding antarmuka dan output aksi, maka sparse MoE dengan konteks 256K melawan agen 9B terdistilasi menjadi pertanyaan yang benar-benar menarik. Sampai saat itu, jawaban untuk "mana yang harus saya gunakan" adalah yang sudah ada.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari