
LFM2.5-VL-3B-DSpark vs UI-Venus 2.9B: Pengganda Kecepatan Melawan Agen GUI
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 36 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 181 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
LFM2.5-VL-3B-DSpark dan UI-Venus 2.9B sama-sama dimasukkan ke dalam judul samar yang sama — model visi kecil — lalu dibandingkan satu sama lain, padahal itu kekeliruan kategori yang layak diperbaiki sebelum membuat seseorang kehilangan waktu seminggu untuk integrasi. LFM2.5-VL-3B-DSpark adalah model draf berparameter 279,5M yang mempercepat LFM2.5-VL-3B milik Liquid AI. UI-Venus 2.9B, dari lab inclusionAI milik Ant Group, adalah agen GUI 9B yang membaca tangkapan layar, memutuskan suatu tindakan, dan menjalankannya di lingkungan seluler, web, dan desktop. Satu mempercepat model yang sudah ada. Yang lain adalah yang mengerjakan pekerjaannya. Jika yang Anda butuhkan adalah agen GUI, model draf itu bukan opsi yang lebih murah — model itu sama sekali bukan opsi.
Perbandingan yang berguna bukanlah tentang mana yang lebih baik, melainkan tentang masalah apa yang dipecahkan masing-masing, dan apa yang harus Anda tanggung dalam prosesnya. Keduanya juga merupakan pendatang baru yang belum disusul oleh ekosistem yang lebih luas, dan kesenjangan antara apa yang diklaim oleh repositori mereka dan apa yang telah diverifikasi oleh orang lain lebih besar pada salah satunya daripada pada yang lain.
Apa masing-masingnya, secara tepat
Mulailah dengan bentuk-bentuknya, karena itu menjelaskan sebagian besar sisanya.
• Apa itu — LFM2.5-VL-3B-DSpark adalah drafter speculative-decoding; UI-Venus 2.9B adalah kebijakan agen GUI serbaguna
• Parameter — 279,5M BF16 untuk drafter, dibandingkan dengan 9B untuk UI-Venus 2.9B yang diinisialisasi dari Qwen3.5-9B
• Kemampuan mandiri — penyusun draf tidak menghasilkan apa pun yang dapat digunakan sendiri dan tidak dapat diukur secara terpisah; UI-Venus 2.9B berjalan sebagai agen yang lengkap
• Input — drafter tidak pernah melihat gambar itu sendiri, hanya hidden state model target; UI-Venus 2.9B mengonsumsi tangkapan layar secara langsung dan dibangun sepenuhnya di sekitar tangkapan layar tersebut
• Output — drafter mengusulkan token untuk verifikasi; UI-Venus 2.9B mengeluarkan aksi ter-ground dengan bounding box terhadap antarmuka langsung
• Base — drafter terikat pada LiquidAI/LFM2.5-VL-3B dalam metadatanya sendiri; UI-Venus 2.9B dibangun di atas Qwen3.5-9B
• Konteks — drafter mewarisi apa pun yang disediakan target; UI-Venus 2.9B dilayani pada maksimum 262.144 token dalam resep vLLM milik vendor itu sendiri
• Lisensi — keduanya belum terselesaikan dengan cara yang berbeda; Liquid dirilis di bawah lisensi LFM1.0, dan kartu UI-Venus 2.9B menyatakan secara tegas bahwa lisensi bobotnya masih menunggu konfirmasi akhir

Butir terakhir itulah yang perlu dicermati lebih saksama. Liputan kami sendiri tentang UI-Venus-2-9B pada akhir Agustus menggambarkan rilis tersebut sebagai Apache-2.0, karena itulah yang tercantum dalam materi proyek pada saat itu. Kartu model hari ini menyatakan hal yang berbeda dan lebih tegas: bahwa lisensi bobot model masih menunggu konfirmasi akhir dan akan ditambahkan sebelum rilis publik, dan bahwa pernyataan Apache-2.0 sengaja tidak dipertahankan karena materi upstream saat ini memuat pernyataan lisensi yang saling bertentangan. Jika Anda berencana melakukan penerapan komersial UI-Venus 2.9B, pertanyaan lisensi masih terbuka berdasarkan pengakuan vendor sendiri, dan itu merupakan risiko material, bukan sekadar catatan kaki.
Angka-angka yang sebenarnya diterbitkan oleh masing-masing pihak
Kedua repositori tersebut mengukur hal yang berbeda, dan itulah intinya. Liquid menerbitkan throughput; Ant Group menerbitkan keberhasilan tugas.
Untuk drafter, menurut harness milik Liquid sendiri: percepatan dekode paling tinggi 2,66× pada satu H100 80GB dalam BF16 melalui SGLang, paling tinggi 3,13× dengan MLX-VLM pada Apple M5 Max, dan paling tinggi 2,14× dengan llama.cpp pada M3 Ultra. Secara end-to-end, proses yang sama berada di antara 1,30× dan 2,62× tergantung stack dan tugas. Penerimaan draft berada sekitar 3,2 hingga 4,5 token per pass verifikasi. Semuanya diukur oleh vendor tanpa reproduksi eksternal.
Untuk UI-Venus 2.9B, tabel milik kartu itu sendiri melaporkan 80,2 pada AndroidWorld, 65,8 pada MobileWorld dengan anggaran 50 langkah, 70,8 pada OSWorld-Verified, 48,0 pada DeskCraft, 90,8 pada WebVoyager di seluruh split 595 tugas yang diperbarui, 74,0 pada Online-Mind2Web, 73,0 pada ScreenSpot-Pro, dan 77,1 pada VenusBench-GD. Pada CAPTCHA, laporan tersebut menyebutkan 78,1 pada VenusBench-CAPTCHA dan 75,7 pada MCA-Bench. Di sisi keamanan, laporan tersebut menyebutkan tingkat keberhasilan serangan 11,3% pada OSHarm dibandingkan 25,3% untuk basis Qwen3.5-9B-nya. Semua ini dilaporkan vendor, beberapa baseline membawa tanda bintang yang berarti para penulis UI-Venus mengevaluasinya di bawah protokol yang dinyatakan, dan kartu itu sendiri memperingatkan bahwa perbandingan OSWorld-Verified menggunakan scaffold aksi khusus model dan harus dibaca sebagai referensi tingkat benchmark, bukan ablasi terkontrol.
Perhatikan apa yang tidak ada dari kedua daftar: apa pun yang diukur oleh pihak ketiga. Bagi drafter, itu karena checkpoint-nya sudah berusia beberapa hari. Bagi UI-Venus 2.9B, itu karena benchmark agen GUI mahal untuk direproduksi dan hasil lingkungan live berubah mengikuti status lingkungan pada tanggal evaluasi — sebuah catatan yang disampaikan secara sukarela oleh kartu tersebut.
Di mana keduanya sebenarnya bertemu

Ada tumpang tindih yang nyata, dan cakupannya lebih sempit daripada yang disiratkan oleh label kategori. Keduanya relevan jika Anda membangun agen visual on-device atau edge, dan keduanya berkaitan dengan biaya membawa piksel melalui sebuah model. Keduanya menyerangnya dari ujung yang berlawanan.
UI-Venus 2.9B menyerangnya dengan pelatihan: pipeline tiga tahap berupa mid-training multimodal pada lingkungan seluler, web, dan OS yang disimulasikan, RL offline per domain, lalu distilasi on-policy multi-guru ke dalam satu kebijakan. Kemampuan yang dipublikasikan adalah hasilnya. Model ini berukuran 9B, yang kecil untuk agen GUI dan besar untuk perangkat edge, dan konfigurasi penyajian yang dimaksudkan pada kartu adalah deployment vLLM — dokumentasi yang sama mencatat bahwa konfigurasi tersebut tidak divalidasi live-canary sebagai bagian dari pembaruan kartu dan memberi tahu Anda untuk menyematkan dan memverifikasi versi vLLM Anda untuk Qwen3.5 sebelum melakukan deployment.
LFM2.5-VL-3B-DSpark menyerangnya dengan runtime: ia membiarkan bobot model target tidak tersentuh dan mendapatkan kecepatan dengan menyusun serta memverifikasi token. Pada perangkat kelas ponsel, pertukarannya berat sebelah dan menguntungkan drafter, karena output-nya terbukti milik target dan memori tambahannya di bawah sepersepuluh ukuran sebuah model.
Konsekuensinya bagi siapa pun yang memilih: loop agen membuat banyak panggilan model per tugas, dan setiap panggilan membayar prefill untuk tangkapan layar baru. Pengodean visi dan prefill justru merupakan tahap yang tidak dipercepat oleh speculative decoding — pengumuman Liquid sendiri mengajukan argumen ini terhadap pembacaan yang tak terbatas atas angka-angka utamanya. Jadi keunggulan drafter menyusut tepat pada beban kerja tempat UI-Venus 2.9B berada. Sebaliknya, keunggulan UI-Venus 2.9B — benar-benar menyelesaikan tugas — bukanlah sesuatu yang dapat diberikan oleh drafter pada kecepatan berapa pun.
Menjalankan dua

Tidak satu pun merupakan endpoint yang dihosting di OrcaRouter. LFM2.5-VL-3B-DSpark dan UI-Venus 2.9B keduanya mengharuskan Anda menarik bobot dan menyajikannya sendiri, dan cara penyajian keduanya dibentuk oleh peran mereka yang sangat berbeda. Drafter tersebut memerlukan SGLang v0.5.0 atau yang lebih baru dengan flag algoritma spekulatif DSPARK dan ukuran blok 9, atau MLX-VLM v0.7.0 atau yang lebih baru dengan drafter diteruskan sebagai model draft dan temperature dipaksa ke nol, atau llama.cpp dengan GGUF F16 567 MB yang dipasangkan ke target terkuantisasi. UI-Venus 2.9B memerlukan server vLLM yang cukup besar untuk model 9B pada panjang maksimum 262.144 token, plus prompt referensi dan parser aksi dari repositori kode proyek — kartunya secara eksplisit menyatakan bahwa menjalankan server saja tidak memberi Anda agen GUI loop tertutup yang berfungsi.
Keduanya juga meninggalkan celah yang sama di tepi kemampuan yang dapat mereka lakukan. Model visi-bahasa kecil yang dipasangkan dengan drafter masih menghadapi layar dan tugas yang tidak dapat ditanganinya, dan agen GUI masih gagal pada lingkungan di luar distribusi pelatihannya. Kueri yang lolos begitu saja akan mendarat di suatu tempat, dan dalam sebagian besar desain produksi, tempat itu adalah model serbaguna yang lebih besar. Merutekan kueri-kueri tersebut melalui satu endpoint yang mencakup 200+ model pada harga daftar setiap penyedia, dengan failover otomatis ketika penyedia mengalami penurunan kinerja, menjaga jalur fallback tetap di luar daftar integrasi kritis alih-alih mengubahnya menjadi proyek penerapan kedua dengan kunci dan kontraknya sendiri.
Cara memutuskan dalam satu menit
Jika Anda memerlukan perangkat lunak yang mengoperasikan antarmuka pengguna — mengklik, mengetik, menavigasi aplikasi yang belum pernah dilihatnya — Anda sedang membeli sebuah kebijakan, dan itulah UI-Venus 2.9B. Anggarkan untuk deployment vLLM 9B, baca pertanyaan lisensi yang masih tertunda sebelum Anda berkomitmen secara komersial, dan perlakukan tabel benchmark vendor sebagai hipotesis awal yang kuat, bukan hasil yang sudah final, terutama perbandingan OSWorld-Verified yang ditandai oleh kartu model itu sendiri sebagai bergantung pada scaffold.
Jika Anda sudah menjalankan LFM2.5-VL-3B dan menginginkannya lebih cepat pada perangkat keras yang Anda miliki, Anda sedang membeli optimasi runtime, dan itulah LFM2.5-VL-3B-DSpark. Periksa tiga hal terlebih dahulu: bahwa beban kerja Anda berat decode ketimbang berat prefill, bahwa Anda menyajikan pada 16-bit alih-alih ekspor 4-bit, dan bahwa runtime Anda memenuhi batas versi minimum. Jika ketiganya terpenuhi, biaya memorinya adalah 8,9% dan outputnya tidak berubah secara konstruksi.
Satu hal yang tidak bertahan saat bersentuhan dengan salah satu dari kedua repositori itu adalah menganggap keduanya sebagai pengganti. Yang satu adalah pengganda kecepatan dan yang lainnya adalah agen, dan satu-satunya skenario ketika keduanya bersaing adalah skenario ketika Anda sudah memutuskan apa yang sedang Anda bangun dan sedang mencari alasan untuk membangun sesuatu yang lebih murah sebagai gantinya.
OrcaRouter menjangkau 200+ model melalui satu kunci dengan harga daftar penyedia tanpa markup 0%, dengan kebijakan perutean dan failover otomatis untuk kueri yang seharusnya tidak ditangani oleh model edge atau agen. satu API untuk jalur fallback Tidak ada model di halaman ini yang dihosting di sana - keduanya dilayani dari bobot Anda sendiri - tetapi jalur fallback adalah bagian yang tidak perlu Anda bangun.
