Kartu hero dengan kicker 'DUA TUGAS YANG BERBEDA' dan judul utama 'DSpark vs UI-Venus 2.9B', dengan subjudul 'Pengganda kecepatan 279.5M melawan agen GUI 9B - perbandingan ini baru masuk akal setelah Anda berhenti menganggap keduanya sebagai substitusi.' Tiga kartu bertuliskan 'Drafter 279.5M - Membuat LFM2.5-VL-3B lebih cepat; tidak menghasilkan apa pun sendirian', 'Agen GUI 9B - inclusionAI milik Ant Group; mengklik, mengetik, menavigasi' dan 'Bukan substitusi - Yang satu adalah optimasi runtime, yang lain adalah kebijakan'. Footer bertuliskan 'Angka kecepatan diukur oleh vendor, yaitu Liquid AI; skor agen dilaporkan oleh vendor, yaitu Ant Group. Tak satu pun telah direproduksi secara independen.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Engineering & Research

LFM2.5-VL-3B-DSpark vs UI-Venus 2.9B: Pengganda Kecepatan Melawan Agen GUI

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

LFM2.5-VL-3B-DSpark dan UI-Venus 2.9B sama-sama dimasukkan ke dalam judul samar yang sama — model visi kecil — lalu dibandingkan satu sama lain, padahal itu kekeliruan kategori yang layak diperbaiki sebelum membuat seseorang kehilangan waktu seminggu untuk integrasi. LFM2.5-VL-3B-DSpark adalah model draf berparameter 279,5M yang mempercepat LFM2.5-VL-3B milik Liquid AI. UI-Venus 2.9B, dari lab inclusionAI milik Ant Group, adalah agen GUI 9B yang membaca tangkapan layar, memutuskan suatu tindakan, dan menjalankannya di lingkungan seluler, web, dan desktop. Satu mempercepat model yang sudah ada. Yang lain adalah yang mengerjakan pekerjaannya. Jika yang Anda butuhkan adalah agen GUI, model draf itu bukan opsi yang lebih murah — model itu sama sekali bukan opsi.

Perbandingan yang berguna bukanlah tentang mana yang lebih baik, melainkan tentang masalah apa yang dipecahkan masing-masing, dan apa yang harus Anda tanggung dalam prosesnya. Keduanya juga merupakan pendatang baru yang belum disusul oleh ekosistem yang lebih luas, dan kesenjangan antara apa yang diklaim oleh repositori mereka dan apa yang telah diverifikasi oleh orang lain lebih besar pada salah satunya daripada pada yang lain.

Apa masing-masingnya, secara tepat

Mulailah dengan bentuk-bentuknya, karena itu menjelaskan sebagian besar sisanya.

• Apa itu — LFM2.5-VL-3B-DSpark adalah drafter speculative-decoding; UI-Venus 2.9B adalah kebijakan agen GUI serbaguna

• Parameter — 279,5M BF16 untuk drafter, dibandingkan dengan 9B untuk UI-Venus 2.9B yang diinisialisasi dari Qwen3.5-9B

• Kemampuan mandiri — penyusun draf tidak menghasilkan apa pun yang dapat digunakan sendiri dan tidak dapat diukur secara terpisah; UI-Venus 2.9B berjalan sebagai agen yang lengkap

• Input — drafter tidak pernah melihat gambar itu sendiri, hanya hidden state model target; UI-Venus 2.9B mengonsumsi tangkapan layar secara langsung dan dibangun sepenuhnya di sekitar tangkapan layar tersebut

• Output — drafter mengusulkan token untuk verifikasi; UI-Venus 2.9B mengeluarkan aksi ter-ground dengan bounding box terhadap antarmuka langsung

• Base — drafter terikat pada LiquidAI/LFM2.5-VL-3B dalam metadatanya sendiri; UI-Venus 2.9B dibangun di atas Qwen3.5-9B

• Konteks — drafter mewarisi apa pun yang disediakan target; UI-Venus 2.9B dilayani pada maksimum 262.144 token dalam resep vLLM milik vendor itu sendiri

• Lisensi — keduanya belum terselesaikan dengan cara yang berbeda; Liquid dirilis di bawah lisensi LFM1.0, dan kartu UI-Venus 2.9B menyatakan secara tegas bahwa lisensi bobotnya masih menunggu konfirmasi akhir

A two-panel card titled 'Drafter vs agent - different units', subtitled 'One column measures seconds saved. The other measures tasks completed. They are not on the same axis.' The left panel 'LFM2.5-VL-3B-DSpark' has rows: What it is 'Speculative-decoding drafter', Parameters '279.5M BF16', Base 'LiquidAI/LFM2.5-VL-3B', Runs alone 'No, by construction', Its number '2.04x-3.13x decode', License 'LFM1.0, not OSI'. The right panel 'UI-Venus 2.9B' has rows: What it is 'GUI agent policy', Parameters '9B, from Qwen3.5-9B', Base 'Ant Group inclusionAI', Runs alone 'Yes - a complete agent', Its number '80.2 AndroidWorld', License 'Pending final confirmation'. A strip beneath reads 'Neither figure has been reproduced outside the lab that published it. Treat both as ceilings, not expectations.' The OrcaRouter logo is composited in the bottom-right corner.

Butir terakhir itulah yang perlu dicermati lebih saksama. Liputan kami sendiri tentang UI-Venus-2-9B pada akhir Agustus menggambarkan rilis tersebut sebagai Apache-2.0, karena itulah yang tercantum dalam materi proyek pada saat itu. Kartu model hari ini menyatakan hal yang berbeda dan lebih tegas: bahwa lisensi bobot model masih menunggu konfirmasi akhir dan akan ditambahkan sebelum rilis publik, dan bahwa pernyataan Apache-2.0 sengaja tidak dipertahankan karena materi upstream saat ini memuat pernyataan lisensi yang saling bertentangan. Jika Anda berencana melakukan penerapan komersial UI-Venus 2.9B, pertanyaan lisensi masih terbuka berdasarkan pengakuan vendor sendiri, dan itu merupakan risiko material, bukan sekadar catatan kaki.

Angka-angka yang sebenarnya diterbitkan oleh masing-masing pihak

Kedua repositori tersebut mengukur hal yang berbeda, dan itulah intinya. Liquid menerbitkan throughput; Ant Group menerbitkan keberhasilan tugas.

Untuk drafter, menurut harness milik Liquid sendiri: percepatan dekode paling tinggi 2,66× pada satu H100 80GB dalam BF16 melalui SGLang, paling tinggi 3,13× dengan MLX-VLM pada Apple M5 Max, dan paling tinggi 2,14× dengan llama.cpp pada M3 Ultra. Secara end-to-end, proses yang sama berada di antara 1,30× dan 2,62× tergantung stack dan tugas. Penerimaan draft berada sekitar 3,2 hingga 4,5 token per pass verifikasi. Semuanya diukur oleh vendor tanpa reproduksi eksternal.

Untuk UI-Venus 2.9B, tabel milik kartu itu sendiri melaporkan 80,2 pada AndroidWorld, 65,8 pada MobileWorld dengan anggaran 50 langkah, 70,8 pada OSWorld-Verified, 48,0 pada DeskCraft, 90,8 pada WebVoyager di seluruh split 595 tugas yang diperbarui, 74,0 pada Online-Mind2Web, 73,0 pada ScreenSpot-Pro, dan 77,1 pada VenusBench-GD. Pada CAPTCHA, laporan tersebut menyebutkan 78,1 pada VenusBench-CAPTCHA dan 75,7 pada MCA-Bench. Di sisi keamanan, laporan tersebut menyebutkan tingkat keberhasilan serangan 11,3% pada OSHarm dibandingkan 25,3% untuk basis Qwen3.5-9B-nya. Semua ini dilaporkan vendor, beberapa baseline membawa tanda bintang yang berarti para penulis UI-Venus mengevaluasinya di bawah protokol yang dinyatakan, dan kartu itu sendiri memperingatkan bahwa perbandingan OSWorld-Verified menggunakan scaffold aksi khusus model dan harus dibaca sebagai referensi tingkat benchmark, bukan ablasi terkontrol.

Perhatikan apa yang tidak ada dari kedua daftar: apa pun yang diukur oleh pihak ketiga. Bagi drafter, itu karena checkpoint-nya sudah berusia beberapa hari. Bagi UI-Venus 2.9B, itu karena benchmark agen GUI mahal untuk direproduksi dan hasil lingkungan live berubah mengikuti status lingkungan pada tanggal evaluasi — sebuah catatan yang disampaikan secara sukarela oleh kartu tersebut.

Di mana keduanya sebenarnya bertemu

A screenshot of the Hugging Face model card for inclusionAI/UI-Venus-2-9B showing 'Like 34' and 'Downloads last month 8,423'. The card describes UI-Venus-2 as a general-purpose foundation GUI agent covering 170+ multilingual apps and 4,000+ domains across 19 categories, evaluated on OSWorld, AndroidWorld and MobileWorld, and reports an OSHarm attack success rate of 11.3% against 25.3% for its Qwen3.5-9B base and an OSBlind figure of 48.8% against 79.4% for that base.

Ada tumpang tindih yang nyata, dan cakupannya lebih sempit daripada yang disiratkan oleh label kategori. Keduanya relevan jika Anda membangun agen visual on-device atau edge, dan keduanya berkaitan dengan biaya membawa piksel melalui sebuah model. Keduanya menyerangnya dari ujung yang berlawanan.

UI-Venus 2.9B menyerangnya dengan pelatihan: pipeline tiga tahap berupa mid-training multimodal pada lingkungan seluler, web, dan OS yang disimulasikan, RL offline per domain, lalu distilasi on-policy multi-guru ke dalam satu kebijakan. Kemampuan yang dipublikasikan adalah hasilnya. Model ini berukuran 9B, yang kecil untuk agen GUI dan besar untuk perangkat edge, dan konfigurasi penyajian yang dimaksudkan pada kartu adalah deployment vLLM — dokumentasi yang sama mencatat bahwa konfigurasi tersebut tidak divalidasi live-canary sebagai bagian dari pembaruan kartu dan memberi tahu Anda untuk menyematkan dan memverifikasi versi vLLM Anda untuk Qwen3.5 sebelum melakukan deployment.

LFM2.5-VL-3B-DSpark menyerangnya dengan runtime: ia membiarkan bobot model target tidak tersentuh dan mendapatkan kecepatan dengan menyusun serta memverifikasi token. Pada perangkat kelas ponsel, pertukarannya berat sebelah dan menguntungkan drafter, karena output-nya terbukti milik target dan memori tambahannya di bawah sepersepuluh ukuran sebuah model.

Konsekuensinya bagi siapa pun yang memilih: loop agen membuat banyak panggilan model per tugas, dan setiap panggilan membayar prefill untuk tangkapan layar baru. Pengodean visi dan prefill justru merupakan tahap yang tidak dipercepat oleh speculative decoding — pengumuman Liquid sendiri mengajukan argumen ini terhadap pembacaan yang tak terbatas atas angka-angka utamanya. Jadi keunggulan drafter menyusut tepat pada beban kerja tempat UI-Venus 2.9B berada. Sebaliknya, keunggulan UI-Venus 2.9B — benar-benar menyelesaikan tugas — bukanlah sesuatu yang dapat diberikan oleh drafter pada kecepatan berapa pun.

Menjalankan dua

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention plus a Markov head and a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'.

Tidak satu pun merupakan endpoint yang dihosting di OrcaRouter. LFM2.5-VL-3B-DSpark dan UI-Venus 2.9B keduanya mengharuskan Anda menarik bobot dan menyajikannya sendiri, dan cara penyajian keduanya dibentuk oleh peran mereka yang sangat berbeda. Drafter tersebut memerlukan SGLang v0.5.0 atau yang lebih baru dengan flag algoritma spekulatif DSPARK dan ukuran blok 9, atau MLX-VLM v0.7.0 atau yang lebih baru dengan drafter diteruskan sebagai model draft dan temperature dipaksa ke nol, atau llama.cpp dengan GGUF F16 567 MB yang dipasangkan ke target terkuantisasi. UI-Venus 2.9B memerlukan server vLLM yang cukup besar untuk model 9B pada panjang maksimum 262.144 token, plus prompt referensi dan parser aksi dari repositori kode proyek — kartunya secara eksplisit menyatakan bahwa menjalankan server saja tidak memberi Anda agen GUI loop tertutup yang berfungsi.

Keduanya juga meninggalkan celah yang sama di tepi kemampuan yang dapat mereka lakukan. Model visi-bahasa kecil yang dipasangkan dengan drafter masih menghadapi layar dan tugas yang tidak dapat ditanganinya, dan agen GUI masih gagal pada lingkungan di luar distribusi pelatihannya. Kueri yang lolos begitu saja akan mendarat di suatu tempat, dan dalam sebagian besar desain produksi, tempat itu adalah model serbaguna yang lebih besar. Merutekan kueri-kueri tersebut melalui satu endpoint yang mencakup 200+ model pada harga daftar setiap penyedia, dengan failover otomatis ketika penyedia mengalami penurunan kinerja, menjaga jalur fallback tetap di luar daftar integrasi kritis alih-alih mengubahnya menjadi proyek penerapan kedua dengan kunci dan kontraknya sendiri.

Cara memutuskan dalam satu menit

Jika Anda memerlukan perangkat lunak yang mengoperasikan antarmuka pengguna — mengklik, mengetik, menavigasi aplikasi yang belum pernah dilihatnya — Anda sedang membeli sebuah kebijakan, dan itulah UI-Venus 2.9B. Anggarkan untuk deployment vLLM 9B, baca pertanyaan lisensi yang masih tertunda sebelum Anda berkomitmen secara komersial, dan perlakukan tabel benchmark vendor sebagai hipotesis awal yang kuat, bukan hasil yang sudah final, terutama perbandingan OSWorld-Verified yang ditandai oleh kartu model itu sendiri sebagai bergantung pada scaffold.

Jika Anda sudah menjalankan LFM2.5-VL-3B dan menginginkannya lebih cepat pada perangkat keras yang Anda miliki, Anda sedang membeli optimasi runtime, dan itulah LFM2.5-VL-3B-DSpark. Periksa tiga hal terlebih dahulu: bahwa beban kerja Anda berat decode ketimbang berat prefill, bahwa Anda menyajikan pada 16-bit alih-alih ekspor 4-bit, dan bahwa runtime Anda memenuhi batas versi minimum. Jika ketiganya terpenuhi, biaya memorinya adalah 8,9% dan outputnya tidak berubah secara konstruksi.

Satu hal yang tidak bertahan saat bersentuhan dengan salah satu dari kedua repositori itu adalah menganggap keduanya sebagai pengganti. Yang satu adalah pengganda kecepatan dan yang lainnya adalah agen, dan satu-satunya skenario ketika keduanya bersaing adalah skenario ketika Anda sudah memutuskan apa yang sedang Anda bangun dan sedang mencari alasan untuk membangun sesuatu yang lebih murah sebagai gantinya.

OrcaRouter menjangkau 200+ model melalui satu kunci dengan harga daftar penyedia tanpa markup 0%, dengan kebijakan perutean dan failover otomatis untuk kueri yang seharusnya tidak ditangani oleh model edge atau agen. satu API untuk jalur fallback Tidak ada model di halaman ini yang dihosting di sana - keduanya dilayani dari bobot Anda sendiri - tetapi jalur fallback adalah bagian yang tidak perlu Anda bangun.