Una hero card per 'UI-Venus-2-9B vs Microsoft Mage-VL' con il sottotitolo 'L'agente screenshot vs l'osservatore dello stream codec', che mostra un badge blu '9B · AGENTE SCREENSHOT' con una pillola 'agisce' e un badge ciano '4B · OSSERVATORE STREAM' con una pillola 'descrive', e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

UI-Venus-2-9B vs Microsoft Mage-VL: l'agente di screenshot contro l'osservatore del flusso codec

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

UI-Venus-2-9B e Microsoft Mage-VL sono entrambi usciti in sordina a distanza di un mese l'uno dall'altro — il repository di Mage-VL è apparso il 26 luglio 2026, UI-Venus-2-9B il 26 agosto 2026 — entrambi hanno pesi open source con licenza Apache-2.0, ed entrambi si basano su backbone della famiglia Qwen. È più o meno qui che finiscono le somiglianze, e la differenza non è di grado ma di quale lato dello schermo occupi ciascun modello. Microsoft Mage-VL è un modello di percezione in streaming nativo codec: guarda video compressi, resta in silenzio durante filmati di routine, ed emette testo quando un evento si completa. UI-Venus-2-9B è un agente GUI: riceve uno screenshot statico, ragiona sullo stato ed emette un'azione strutturata. Uno guarda lo schermo e lo descrive; l'altro guarda lo schermo e lo opera. Scegliere tra loro non è una decisione da benchmark, perché non condividono un singolo benchmark — è una decisione su se la tua automazione termina in una risposta o in un'azione.

Cosa è realmente ciascun modello

Microsoft Mage-VL, rilasciato nel repository microsoft/Mage-VL senza alcun annuncio, è un modello multimodale di circa 4 miliardi di parametri, costruito da un decoder linguistico Qwen3-4B-Instruct-2507, un encoder visivo creato da zero chiamato Mage-ViT e uno streaming gate separato di ~0,5 miliardi di parametri. Il suo design è nativo per i codec video: invece di campionare i frame in modo uniforme, mantiene i frame di ancoraggio (I) per intero e conserva solo le patch salienti per il movimento dei frame predetti (P); secondo Microsoft, questo riduce il consumo di token visivi di oltre il 75% e offre un'accelerazione wall-clock dell'inferenza fino a 3,5× rispetto al campionamento uniforme. Un design a due processi — il gate cognitivo System 1 osserva ogni finestra di codec scorrevole, mentre la VLM System 2 si attiva solo quando un evento merita una risposta — lo rende un osservatore video sempre attivo, economico proprio perché per lo più silenzioso.

UI-Venus-2-9B, rilasciato da inclusionAI (il laboratorio Ant Group del Venus Team), è un agente GUI generalista da 9B inizializzato da Qwen3.5-9B. Osserva un'interfaccia, ragiona sullo stato del compito, esegue un'azione e incorpora il feedback — un ciclo chiuso osservazione–ragionamento–azione–feedback — e la sua scheda dichiara una copertura di addestramento su app mobili, piattaforme web e sistemi operativi desktop in un unico checkpoint. Sulla sua stessa scheda del modello riporta AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 e ScreenSpot-Pro 73.0, tutti riportati dal fornitore e nessuno riprodotto in modo indipendente.

Il divario di input: pixel che catturi vs un flusso che conservi

La differenza più istruttiva è ciò che ciascun modello consuma. UI-Venus-2-9B è un agente basato su screenshot: il suo input è lo schermo corrente, un fotogramma alla volta, e la sua finestra di contesto da 256K token è il modo in cui mantiene una cronologia di quei fotogrammi durante un compito lungo. Mage-VL è un agente basato su flussi video: il suo input è video compresso, e la sua efficienza deriva dal trattare il movimento tra i fotogrammi come dati — vettori di movimento ed energia residua per i codec tradizionali, mappe di rate apprese per quelli neurali. Questa è la differenza tra un modello che vede istanti e un modello che vede una timeline continua. Un agente basato su screenshot è strutturalmente cieco ai 100 millisecondi tra un'acquisizione e l'altra — lo spinner, la transizione di caricamento, lo stato di hover che esiste sullo schermo solo per un attimo. Un osservatore di flussi vive dentro quella lacuna. Non è un difetto in nessuno dei due design; è il motivo per cui un agente GUI che deve agire su uno schermo live e un modello di percezione che deve riassumere un feed sono prodotti diversi con contratti di input diversi.

A generated two-column scoreboard for 'UI-Venus-2-9B vs Microsoft Mage-VL': left column UI-Venus-2-9B — Job GUI agent acts on screens, Input still screenshots, Output structured actions, Size 9B, Serving vLLM OpenAI-compatible, Context 256K; right column Microsoft Mage-VL — Job stream watcher describes screens, Input compressed video codec streams, Output event-gated text, Size ~4B + 0.5B gate, Serving trust_remote_code custom, Context rolling codec window; footer 'Both vendor-reported; no shared benchmark.'

Il divario di produzione: azioni vs commenti

Il lato dell'output è dove i due smettono di essere paragonabili. L'output di UI-Venus-2-9B è un'azione strutturata in uno spazio d'azione definito — mouse, tastiera, scroll, navigazione — che emette dopo token di ragionamento in stile Qwen3, e il suo addestramento è costruito attorno a compiti di grounding e CAPTCHA che premiano la localizzazione precisa degli elementi in condizioni di clutter visivo. L'output di Mage-VL è testo: un commento guidato da eventi su ciò che vede. Non ha uno spazio d'azione, né chiamata di funzioni, né un ciclo agente. Leggi le due schede tecniche dei modelli fianco a fianco e ti troverai di fronte ai lati opposti della linea percezione-azione: Mage-VL termina con una descrizione, UI-Venus-2-9B termina con un clic.

Job — UI-Venus-2-9B: agente GUI, gestisce l'interfaccia. Microsoft Mage-VL: percezione in streaming, descrive l'interfaccia.

Input — UI-Venus-2-9B: screenshot statici, cronologia di 256K token. Microsoft Mage-VL: flussi codec video compressi, sparsità dei token salienti per il movimento.

Output — UI-Venus-2-9B: azioni strutturate di mouse/tastiera/navigazione. Microsoft Mage-VL: commento testuale controllato da eventi.

Dimensioni — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B gate di streaming.

Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 più Mage-ViT da zero.

Licenza — entrambi Apache-2.0 (la scheda di Mage-VL indica che è solo a scopo di ricerca nel suo repository).

Il gap nel servizio

Qui il modello più nuovo e più grande è il più facile da eseguire. UI-Venus-2-9B documenta un singolo comando vLLM con una finestra di contesto di 256K e un'API standard compatibile con OpenAI. Mage-VL richiede trust_remote_code per eseguire il Python personalizzato di Microsoft, oltre a FFmpeg, un percorso neural-codec per i video e dipendenze come mamba-ssm, e non ha ancora uno stack di serving vLLM o SGLang — niente attenzione a pagine, nessun percorso di serving in produzione. Microsoft riporta circa 10,6 GB di parametri BF16 totali, il che significa che una GPU da 16 GB è il minimo realistico per l'elaborazione di immagini e 24 GB+ per i video lunghi. Per un team che vuole mettere qualcosa in produzione oggi, UI-Venus-2-9B ha la rampa di accesso più pulita; per un team che costruisce una pipeline di monitoraggio o riepilogo sempre attiva, lo stack di serving di Mage-VL è ciò che ci si assume in ogni caso, compreso il Python personalizzato.

Un tabellone segnapunti che non esiste

Non esiste un benchmark condiviso tra questi due modelli, e inventarne uno sarebbe disonesto. I numeri di UI-Venus-2-9B si collocano su board di grounding GUI, mobile, web e utilizzo del computer (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, tutti riportati dal fornitore). I numeri di Mage-VL si collocano su board di comprensione video e spaziale (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 rispetto a Qwen3-VL-4B, tutti riportati dal fornitore). Il modo corretto di leggere il confronto è come un bivio: se il compito è "capire cosa sta succedendo su questo schermo nel tempo", Mage-VL è lo strumento pertinente e UI-Venus-2-9B non è progettato per questo; se il compito è "far fare a questo schermo qualcosa", vale il contrario.

Dove i due compongono

La versione interessante di questo confronto non è un aut-aut. Un agente GUI che opera su un’applicazione live ha un genuino punto cieco — il tempo tra uno screenshot e l’altro, e qualsiasi cambiamento di stato che non si stabilizza mai in un frame statico — e un osservatore di flussi nativo codec è esattamente il tipo di modello che potrebbe fungere da strato percettivo in quella lacuna, rilevando che una pagina ha finito di caricarsi o che una modale ha terminato l’animazione prima del successivo passaggio di ancoraggio dell’agente. Microsoft non ha costruito Mage-VL per quel compito, e Ant Group non ha costruito UI-Venus-2-9B per essere guidato da un secondo modello, ma l’adattamento è reale. Per le parti di uno stack di questo tipo che sono già di livello produttivo — il LLM pianificatore che scompone un compito, il modello visivo che verifica lo stato di una schermata, il modello di trascrizione che registra la sessione di un agente — una singola API con prezzi pass-through e failover automatico è ciò che rende l’esperimento economico, ed è a questo che serve un router. Né UI-Venus-2-9B né Microsoft Mage-VL sono attualmente serviti tramite OrcaRouter; entrambi sono progetti self-host a pesi aperti, ed entrambi comparirebbero al prezzo di listino del provider se mai raggiungessero un provider instradato.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured August 27 2026) showing the model header with one like, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, multimodal, gui, and the opening of the UI-Venus-2 model card.A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026) showing the model header, the tags image-text-to-text, Transformers, Safetensors, mage_vl, multimodal, vision-language-model, and the opening of the Mage-VL model card.

Chi dovrebbe scegliere cosa

Scegli Microsoft Mage-VL quando il tuo problema è la percezione continua — un feed della fotocamera, una registrazione dello schermo, uno stream che devi riassumere o monitorare in tempo reale, a un costo abbastanza basso da poterlo tenere sempre attivo. Scegli UI-Venus-2-9B quando il tuo problema è il controllo — un'attività che termina con un'azione completata, un modulo compilato, un flusso navigato, un'applicazione gestita. E se la tua automazione ha davvero bisogno di entrambe le cose — percepire lo stream, poi agire sull'immagine ferma — eseguile come coppia e tratta il watcher dello stream come il rilevatore di eventi che fornisce all'agente di screenshot i momenti su cui vale la pena agire. Sono due metà dello stesso schermo, non concorrenti per lo stesso compito.