
MiniCPM-V 4.7 vs UI-Venus 2.9B: Model Visi Umum Melawan Agen GUI yang Dirancang Khusus
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
MiniCPM-V 4.7 dan UI-Venus 2.9B keduanya adalah model visi-bahasa yang melihat tangkapan layar dan menghasilkan teks, dan di situ kemiripannya berakhir — karena salah satunya dibangun tepat untuk pekerjaan itu. UI-Venus 2.9B adalah agen GUI serbaguna dari inclusionAI, dirilis 26 Agustus 2026, yang seluruh desainnya berpusat pada mengamati antarmuka, menalar keadaan tugas, mengeluarkan aksi, dan memasukkan umpan balik yang dihasilkan; ia disertai laporan teknis, tabel benchmark di seluruh tugas GUI grounding, seluler, web, penggunaan komputer, dan CAPTCHA, serta evaluasi eksplisit tentang seberapa sering ia dapat dibujuk melakukan tindakan berbahaya. MiniCPM-V 4.7 adalah checkpoint sparse mixture-of-experts 35,2 miliar parameter yang diunggah oleh OpenBMB pada 6 Oktober 2026 tanpa kartu model, tanpa lisensi, dan tanpa benchmark. Membandingkan spesialis dengan generalis yang tidak terukur adalah latihan yang agak tidak biasa, dan halaman ini menjelaskan secara eksplisit di mana perbandingan itu berlaku dan di mana tidak.
Dua jenis rilis yang sangat berbeda
UI-Venus 2.9B adalah inclusionAI/UI-Venus-2-9B, sebuah model 9B-parameter yang diinisialisasi dari Qwen3.5-9B dan dilatih lanjut secara khusus sebagai agen GUI. Kartu tersebut menjelaskan sebuah loop tertutup — mengamati antarmuka, menalar keadaan tugas, mengeksekusi tindakan, melipat umpan balik ke dalam keputusan berikutnya — yang dilatih melalui tiga tahap: pelatihan menengah multimodal pada lintasan seluler, web, dan desktop simulasi berskala besar; pembelajaran penguatan offline yang terbagi ke dalam lima keluarga tugas; dan distilasi on-policy multi-guru yang menggabungkan guru-guru terspesialisasi domain menjadi satu kebijakan. Model ini dievaluasi pada tolok ukur GUI grounding, seluler, web, penggunaan komputer, dan CAPTCHA, serta secara terpisah pada keamanan tindakan berkonsekuensi: kartu tersebut melaporkan tingkat keberhasilan serangan sebesar 11,3% pada OSHarm dan 48,8% pada OSBlind, dibandingkan dengan 25,3% dan 79,4% untuk basis Qwen3.5-9B-nya. Kebetulan, saudara OpenBMB sendiri juga mengamati wilayah serupa: organisasi MiniCPM memiliki proyek AgentCPM-GUI dari Januari 2026, jadi ini adalah jalur yang telah dimasuki kedua laboratorium.
MiniCPM-V 4.7 adalah openbmb/MiniCPM-V-4.7-35B-A3B, 35.212.875.824 parameter BF16 di seluruh 70,4 GB dan enam belas shard, diunggah pada 6 Oktober 2026.

Backbone teks Sparse MoE dengan tag qwen3_5_moe_text — 256 pakar, 8 per token — di lebih dari 40 lapisan dengan pola atensi three-linear-to-one-full, menara visi internal 27 lapisan dengan downsampling 16× dan hingga sembilan irisan gambar, serta jendela konteks 256K. Tanpa README, sehingga tidak ada lisensi dan tidak ada benchmark. Tiga suka, nol unduhan, diskusi kosong.
Perbandingannya, dengan celah-celah yang dibiarkan terbuka
• Tujuan — UI-Venus 2.9B: agen GUI, dilatih secara end-to-end untuk interaksi antarmuka. MiniCPM-V 4.7: model visi-bahasa umum; untuk apa model ini dioptimalkan tidak dinyatakan.
• Parameter — UI-Venus 2.9B: 9.41B, padat. MiniCPM-V 4.7: total 35.2B, jarang, 8 dari 256 pakar per token.
• Model dasar — UI-Venus 2.9B: diinisialisasi dari Qwen3.5-9B, stack teks Qwen yang padat. MiniCPM-V 4.7: stack teks MoE turunan Qwen3.5, kelas qwen3_5_moe_text. Cabang berbeda dari pohon keluarga yang sama.
• Grounding antarmuka — UI-Venus 2.9B: kompetensi inti, dengan keluarga tugas khusus untuk grounding dan CAPTCHA dalam pelatihan serta sistem verifikasi berbasis keypoint yang menggunakan pemungutan suara multi-model. MiniCPM-V 4.7: tidak ada klaim khusus grounding, dan tidak ada format output koordinat yang didokumentasikan.
• Evaluasi keamanan — UI-Venus 2.9B: melaporkan ASR sebesar 11,3% pada OSHarm dan 48,8% pada OSBlind. MiniCPM-V 4.7: tidak ada.
• Bukti — UI-Venus 2.9B: laporan teknis di arXiv, halaman proyek, repositori GitHub, dan tabel benchmark. MiniCPM-V 4.7: file konfigurasi.
• Perkakas — UI-Venus 2.9B: quick-start vLLM dengan flag reasoning-parser, plus konversi GGUF dari komunitas. MiniCPM-V 4.7: belum ada.

Mengapa agen GUI bukan sekadar "VLM yang melihat layar"
Kesenjangan antara kedua model ini bukan terutama soal jumlah parameter, dan hal ini perlu diuraikan secara gamblang karena justru itulah yang membuat duel ini menarik, bukan sekadar timpang.
Tugas screenshot memiliki properti yang tidak dimiliki sebagian besar tolok ukur visi: keluarannya harus dapat dieksekusi. Ketika UI-Venus 2.9B diminta mengetuk tombol, ia harus mengeluarkan koordinat atau aksi terstruktur yang benar-benar dapat diterapkan oleh lingkungan, dan kesalahan kecil dalam grounding bukanlah jawaban salah di papan peringkat, melainkan tugas yang gagal dan state yang rusak. Itulah sebabnya kartu UI-Venus 2 menghabiskan begitu banyak ruangnya untuk verifikasi: penyelesaian tugas dinilai berdasarkan keypoint visual yang relevan dengan tugas alih-alih sekilas pandang holistik pada layar akhir, dan juri heterogen memberikan suara untuk mengurangi bias juri tunggal. Tujuan dari mesin tersebut adalah membuat sinyal imbalan pembelajaran penguatan menjadi kuat terhadap peretasan imbalan — model yang belajar memuaskan verifier yang malas alih-alih menyelesaikan tugas.
Ini juga menjelaskan bagian keselamatan.

Agen yang dapat mengoperasikan ponsel atau desktop memiliki permukaan serangan yang tidak dimiliki model pembuatan takarir, dan melaporkan tingkat keberhasilan serangan adalah hal minimal yang harus dilakukan sebuah laboratorium saat merilisnya. UI-Venus 2.9B melaporkan 11,3% pada OSHarm dan 48,8% pada OSBlind — angka kedua tinggi secara absolut, dan pembingkaian kartunya adalah perbandingan terhadap model dasarnya, bukan klaim absolut tentang ketangguhan. Bacalah itu sebagai "secara nyata lebih baik daripada titik awalnya," bukan sebagai "aman."
Arsitektur MiniCPM-V 4.7 tidak bisa menjelaskan apa pun tentang semua ini. Perhatian linear atas konteks yang panjang akan membantu agen yang harus mengingat riwayat interaksi yang panjang, dan MoE sparse akan membantu throughput jika Anda menjalankan banyak episode. Tetapi arsitektur yang berguna bagi agen bukanlah agen, dan tidak ada bagian dari artefak yang dirilis yang mendokumentasikan keluaran tindakan, akurasi grounding, atau perilaku keselamatan.
Penilaian jujur dari sisi MiniCPM
Menggoda untuk mengisi bagian ini dengan angka-angka 4.6. Tahan godaan itu. MiniCPM-V 4.6 adalah model dense 1,3B dengan backbone Qwen3.5-0.8B dan skema kompresi visual 4x/16x yang dapat dialihkan, dan hasil yang diiklankannya — skor 13 pada Artificial Analysis Intelligence Index, menurut laporan vendor, dengan biaya token hanya sebagian kecil dari model kecil sebanding — menggambarkan model itu. MiniCPM-V 4.7 mengubah backbone, mengubah pola atensi, dan mengubah kompresi visual default. Tidak ada pengukuran 4.6 yang bisa ditransfer, dan tidak satu pun dari itu yang sejak awal menggambarkan agen GUI.
Apa yang secara jujur dapat dikatakan tentang MiniCPM-V 4.7 terbatas dan faktual: bobotnya ada, bentuknya tidak lazim bagi keluarga ini, jendela konteksnya panjang, dan rilisnya belum lengkap. Tidak adanya lisensi adalah penghambat praktis; tidak adanya benchmark adalah penghambat evaluatif. Dan ada satu alasan sederhana untuk tertarik alih-alih tidak peduli — OpenBMB membangun perkakas GUI, termasuk AgentCPM-GUI, jadi model visi MoE sparse berkonteks panjang dari laboratorium itu bukan hal yang mustahil sebagai tulang punggung agen di masa depan. Itu adalah hipotesis tentang niat, dan repositori tidak mengonfirmasinya.
Apa yang akan Anda pilih, dan kapan
Untuk apa pun yang melibatkan tangkapan layar dan tindakan — mengetuk, mengetik, menggulir, menavigasi aplikasi atau situs web, mengekstrak data dari UI — UI-Venus 2.9B adalah satu-satunya dari keduanya yang menangani tugas itu. Ia memiliki pelatihan, mekanisme verifikasi, angka keamanan yang dilaporkan, dan perkakas yang cukup untuk menjalankannya di vLLM hari ini. Tidak ada yang pada MiniCPM-V 4.7 menunjukkan bahwa ia bersaing di sana, dan tanpa kartu model Anda bahkan tidak dapat memeriksa apakah ia mengeluarkan koordinat.
Untuk pekerjaan multimodal umum — mendeskripsikan gambar, membaca dokumen, analisis konteks panjang atas materi yang padat gambar — perbandingannya belum bisa ditentukan, karena salah satu sisi tidak memiliki bukti kualitas yang dipublikasikan. Jika Anda membutuhkannya hari ini, UI-Venus 2.9B setidaknya terukur, meskipun model ini disetel untuk antarmuka, bukan untuk penalaran dokumen, dan juga bukan pilihan pertama yang jelas untuk pekerjaan itu.
Pola dalam kedua kasus sama: model yang di-host sendiri yang menangani pekerjaan rutin, dan model frontier yang di-host untuk kasus-kasus sulit yang dialihkannya. Pengalihan itulah tempat router membuktikan perannya — satu kunci untuk lebih dari 200 model yang di-host, masing-masing diteruskan dengan harga daftar penyedia tanpa markup dari kami, dan otomatis failover ketika penyedia mengalami degradasi. Baik UI-Venus 2.9B maupun MiniCPM-V 4.7 tidak di-host di OrcaRouter; keduanya adalah bobot yang Anda jalankan sendiri. Router adalah yang dihubungi agen Anda ketika agen memutuskan model lokal sudah tidak cukup.
Ke mana ini membawamu
Ini bukan keputusan yang sulit, dan alasannya struktural, bukan penilaian tentang kualitas. UI-Venus 2.9B adalah spesialis dengan laporan, lisensi, tabel benchmark, evaluasi keamanan, dan resep penyajian. MiniCPM-V 4.7 adalah generalis dengan file konfigurasi. Salah satunya adalah produk dan yang lainnya adalah janji, dan satu-satunya cara yang bertanggung jawab untuk membandingkan keduanya adalah dengan mengatakan hal itu. Pantau repositorinya: jika OpenBMB menerbitkan kartu yang menunjukkan grounding antarmuka dan output aksi, maka sparse MoE dengan konteks 256K melawan agen 9B terdistilasi menjadi pertanyaan yang benar-benar menarik. Sampai saat itu, jawaban untuk "mana yang harus saya gunakan" adalah yang sudah ada.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
