Card hero con l'occhiello "DUE LAVORI DIVERSI" e il titolo "DSpark vs UI-Venus 2.9B", sottotitolata "Un moltiplicatore di velocità da 279,5M contro un agente GUI da 9B: il confronto ha senso solo quando si smette di trattarli come sostituti". Tre card recitano "Drafter da 279,5M - Rende LFM2.5-VL-3B più veloce; da solo non produce nulla", "Agente GUI da 9B - inclusionAI di Ant Group; clicca, digita, naviga" e "Non sostituti - Uno è un'ottimizzazione runtime, l'altro è la policy". Un footer recita "I dati sulla velocità sono misurati dal fornitore Liquid AI; i punteggi dell'agente sono dichiarati dal fornitore Ant Group. Nessuno dei due è stato riprodotto in modo indipendente." Il logo OrcaRouter è composto nell'angolo in basso a destra.
Engineering & Research

LFM2.5-VL-3B-DSpark vs UI-Venus 2.9B: Un moltiplicatore di velocità contro un agente GUI

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

LFM2.5-VL-3B-DSpark e UI-Venus 2.9B vengono classificati sotto la stessa vaga etichetta — piccoli modelli di visione — e poi confrontati tra loro, il che è un errore di categoria che vale la pena correggere prima che costi a qualcuno una settimana di integrazione. LFM2.5-VL-3B-DSpark è un modello draft da 279,5 milioni di parametri che accelera LFM2.5-VL-3B di Liquid AI. UI-Venus 2.9B, del laboratorio inclusionAI di Ant Group, è un agente GUI da 9B che legge screenshot, decide un'azione e la esegue su ambienti mobile, web e desktop. L'uno rende più veloce un modello esistente. L'altro è ciò che svolge il lavoro. Se ciò di cui hai bisogno è un agente GUI, il modello draft non è un'opzione più economica — non è affatto un'opzione.

Il confronto utile non è quale dei due sia migliore, ma quale problema risolve ciascuno e quanto ciascuno ti costi nel processo. Entrambi sono anche novità recenti con cui l'ecosistema più ampio non si è ancora messo al passo, e il divario tra ciò che i loro repository dichiarano e ciò che chiunque altro ha verificato è maggiore per uno dei due rispetto all'altro.

Che cos'è ciascuno, precisamente

Inizia dalle forme, perché spiegano la maggior parte del resto.

• Che cos'è — LFM2.5-VL-3B-DSpark è un drafter di decodifica speculativa; UI-Venus 2.9B è una policy di agente GUI generalista

Parametri — 279,5M BF16 per il drafter, rispetto a 9B per UI-Venus 2.9B inizializzato da Qwen3.5-9B

• Capacità autonoma — il drafter non genera nulla di utilizzabile da solo e non può essere valutato in isolamento; UI-Venus 2.9B funziona come un agente completo

• Input — il drafter non vede mai l'immagine in sé, ma soltanto gli stati nascosti del modello target; UI-Venus 2.9B consuma direttamente gli screenshot ed è interamente costruito attorno a essi

• Output — il generatore di bozze propone token da verificare; UI-Venus 2.9B emette azioni ancorate con bounding box su un'interfaccia live

• Base — il drafter è legato a LiquidAI/LFM2.5-VL-3B nei propri metadati; UI-Venus 2.9B si basa su Qwen3.5-9B

• Contesto — il drafter eredita qualunque cosa fornisca il target; UI-Venus 2.9B viene servito a un massimo di 262.144 token nella ricetta vLLM del fornitore stesso

• Licenza — entrambe non sono risolte, in modi diversi; Liquid è distribuito con licenza LFM1.0, e la scheda di UI-Venus 2.9B dichiara apertamente che la licenza dei suoi pesi è in attesa di conferma definitiva

A two-panel card titled 'Drafter vs agent - different units', subtitled 'One column measures seconds saved. The other measures tasks completed. They are not on the same axis.' The left panel 'LFM2.5-VL-3B-DSpark' has rows: What it is 'Speculative-decoding drafter', Parameters '279.5M BF16', Base 'LiquidAI/LFM2.5-VL-3B', Runs alone 'No, by construction', Its number '2.04x-3.13x decode', License 'LFM1.0, not OSI'. The right panel 'UI-Venus 2.9B' has rows: What it is 'GUI agent policy', Parameters '9B, from Qwen3.5-9B', Base 'Ant Group inclusionAI', Runs alone 'Yes - a complete agent', Its number '80.2 AndroidWorld', License 'Pending final confirmation'. A strip beneath reads 'Neither figure has been reproduced outside the lab that published it. Treat both as ceilings, not expectations.' The OrcaRouter logo is composited in the bottom-right corner.

L'ultimo punto è quello su cui vale la pena soffermarsi. La nostra stessa trattazione di UI-Venus-2-9B di fine agosto descriveva il modello come Apache-2.0, perché era ciò che i materiali del progetto riportavano allora. La model card odierna dice qualcosa di diverso e più forte: che la licenza dei pesi del modello è in attesa di conferma definitiva e sarà aggiunta prima del rilascio pubblico, e che una dichiarazione Apache-2.0 non è stata volutamente riportata perché i materiali upstream attuali contengono informazioni sulla licenza contrastanti. Se stai pianificando un deployment commerciale di UI-Venus 2.9B, la questione della licenza è aperta per ammissione stessa del fornitore, e questo è un rischio sostanziale, non una nota a piè di pagina.

I numeri che ciascuna parte ha effettivamente pubblicato

I due repository misurano cose diverse, ed è proprio questo il punto. Liquid pubblica il throughput; Ant Group pubblica il tasso di successo delle attività.

Per il drafter, secondo l'harness proprietario di Liquid: accelerazione di decodifica fino a 2,66× su una singola H100 80GB in BF16 tramite SGLang, fino a 3,13× con MLX-VLM su un Apple M5 Max e fino a 2,14× con llama.cpp su un M3 Ultra. End-to-end, quelle stesse esecuzioni si collocano tra 1,30× e 2,62× a seconda dello stack e del task. L'accettazione delle bozze si attesta intorno ai 3,2-4,5 token per passata di verifica. Ognuno di questi valori è misurato dal fornitore, senza riproduzione esterna.

Per UI-Venus 2.9B, le tabelle della scheda stessa riportano 80,2 su AndroidWorld, 65,8 su MobileWorld con un budget di 50 passi, 70,8 su OSWorld-Verified, 48,0 su DeskCraft, 90,8 su WebVoyager nello split aggiornato di 595 attività, 74,0 su Online-Mind2Web, 73,0 su ScreenSpot-Pro e 77,1 su VenusBench-GD. Sul CAPTCHA riporta 78,1 su VenusBench-CAPTCHA e 75,7 su MCA-Bench. Sul fronte della sicurezza riporta un tasso di successo degli attacchi dell'11,3% su OSHarm contro il 25,3% della sua base Qwen3.5-9B. Tutti questi sono riportati dal fornitore, alcune baseline portano un asterisco che significa che gli autori di UI-Venus le hanno valutate secondo il protocollo indicato, e la scheda stessa avverte che i confronti su OSWorld-Verified usano scaffold di azione specifici del modello e dovrebbero essere letti come riferimenti a livello di benchmark piuttosto che come ablazioni controllate.

Nota ciò che è assente da entrambi gli elenchi: qualsiasi cosa misurata da terzi. Per il drafter è perché il checkpoint ha qualche giorno. Per UI-Venus 2.9B è perché i benchmark per agenti GUI sono costosi da riprodurre e i risultati in ambiente live variano con lo stato dell'ambiente alla data di valutazione — un caveat che la scheda dichiara spontaneamente.

Dove i due si incontrano davvero

A screenshot of the Hugging Face model card for inclusionAI/UI-Venus-2-9B showing 'Like 34' and 'Downloads last month 8,423'. The card describes UI-Venus-2 as a general-purpose foundation GUI agent covering 170+ multilingual apps and 4,000+ domains across 19 categories, evaluated on OSWorld, AndroidWorld and MobileWorld, and reports an OSHarm attack success rate of 11.3% against 25.3% for its Qwen3.5-9B base and an OSBlind figure of 48.8% against 79.4% for that base.

C'è una sovrapposizione reale, ed è più stretta di quanto suggerisca l'etichetta della categoria. Entrambi sono rilevanti se stai costruendo un agente visivo on-device o edge, ed entrambi si occupano del costo di far passare i pixel attraverso un modello. Lo affrontano da estremità opposte.

UI-Venus 2.9B lo affronta con l'addestramento: una pipeline a tre stadi composta da mid-training multimodale su ambienti mobili, web e OS simulati, RL offline per dominio, poi distillazione on-policy multi-insegnante in un'unica policy. La capacità pubblicata è il risultato. Il modello è 9B, piccolo per un agente GUI e grande per un dispositivo edge, e la configurazione di serving prevista dalla scheda è un deployment vLLM — la stessa documentazione osserva che tale configurazione non è stata convalidata live-canary nell'ambito dell'aggiornamento della scheda e ti dice di fissare e verificare la tua versione di vLLM per Qwen3.5 prima di distribuire.

LFM2.5-VL-3B-DSpark lo affronta a runtime: lascia intatti i pesi del modello target e guadagna velocità generando bozze e verificando i token. Su un dispositivo di classe smartphone lo scambio pende nettamente a favore del drafter, perché l'output è dimostrabilmente quello del modello target e la memoria aggiuntiva è inferiore a un decimo di quella di un modello.

La conseguenza per chiunque scelga: un ciclo di un agente effettua molte chiamate al modello per ogni attività, e ogni chiamata paga il prefill per un nuovo screenshot. La codifica visiva e il prefill sono esattamente le fasi che la decodifica speculativa non accelera — l'annuncio di Liquid stesso avanza questo argomento contro una lettura illimitata dei suoi numeri di punta. Quindi il vantaggio del drafter si riduce esattamente nel carico di lavoro in cui opera UI-Venus 2.9B. Al contrario, il vantaggio di UI-Venus 2.9B — completare effettivamente l'attività — non è qualcosa che un drafter fornisce a qualsiasi velocità.

Eseguendo i due

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention plus a Markov head and a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'.

Nessuno dei due è un endpoint ospitato su OrcaRouter. LFM2.5-VL-3B-DSpark e UI-Venus 2.9B richiedono entrambi di scaricare i pesi e servirli autonomamente, e le loro modalità di servizio sono plasmate dai loro ruoli molto diversi. Il drafter richiede SGLang v0.5.19 o successivo con un flag per l'algoritmo speculativo DSPARK e una dimensione di blocco pari a 9, oppure MLX-VLM v0.7.2 o successivo con il drafter passato come modello draft e la temperatura forzata a zero, oppure llama.cpp con un GGUF F16 da 567 MB abbinato a un target quantizzato. UI-Venus 2.9B necessita di un server vLLM abbastanza capiente per un modello da 9B con una lunghezza massima di 262.144 token, oltre ai prompt di riferimento e ai parser delle azioni dal repository di codice del progetto — la scheda è esplicita sul fatto che avviare il server da solo non ti fornisce un agente GUI funzionante a ciclo chiuso.

Entrambi lasciano anche lo stesso vuoto ai margini di ciò che sono in grado di fare. Un piccolo modello di visione abbinato a un drafter incontra comunque richieste e attività che non è in grado di gestire, e un agente GUI fallisce comunque in ambienti al di fuori della sua distribuzione di addestramento. Le query che sfuggono finiscono da qualche parte e, nella maggior parte delle implementazioni, si tratta di un modello generalista più grande. Instradarle attraverso un unico endpoint che copre oltre 200 modelli al prezzo di listino di ciascun provider, con failover automatico quando un provider peggiora, tiene il percorso di fallback fuori dalla lista delle integrazioni critiche invece di trasformarlo in un secondo progetto di deployment con le proprie chiavi e i propri contratti.

Come decidere in un minuto

Se hai bisogno di un software che gestisca un'interfaccia utente — facendo clic, digitando, navigando in un'app che non ha mai visto — stai acquistando una policy, e quella è UI-Venus 2.9B. Metti in budget un deployment vLLM da 9B, leggi la questione della licenza in sospeso prima di impegnarti commercialmente, e considera la tabella di benchmark del fornitore come una forte ipotesi di partenza piuttosto che un risultato consolidato, in particolare i confronti OSWorld-Verified che la scheda stessa segnala come dipendenti dallo scaffold.

Se esegui già LFM2.5-VL-3B e vuoi che sia più veloce sull'hardware che possiedi, stai acquistando un'ottimizzazione del runtime, e questa è LFM2.5-VL-3B-DSpark. Controlla prima tre cose: che i tuoi carichi di lavoro siano orientati alla decodifica anziché al prefill, che tu stia servendo a 16 bit anziché un export a 4 bit, e che il tuo runtime soddisfi i requisiti minimi di versione. Se tutte e tre le condizioni valgono, il costo in memoria è dell'8,9% e l'output è invariato per costruzione.

L'unica cosa che non sopravvive al contatto con nessuno dei due repository è trattarli come sostituti. Sono un moltiplicatore di velocità e un agente, e l'unico scenario in cui competono è quello in cui hai già deciso cosa stai costruendo e stai cercando una ragione per costruire invece qualcosa di più economico.

OrcaRouter raggiunge oltre 200 modelli tramite un'unica chiave al prezzo di listino del provider con 0% di ricarico, con policy di routing e fallback automatico per le query che un modello edge o un agente non dovrebbe gestire. una sola API per il percorso di fallbackNessuno dei due modelli in questa pagina è ospitato lì - entrambi sono serviti dai tuoi stessi pesi - ma il percorso di fallback è la parte che non devi costruire.