
UI-Venus-2-9B vs Microsoft Mage-VL: l'agente di screenshot contro l'osservatore del flusso codec
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
UI-Venus-2-9B e Microsoft Mage-VL sono entrambi usciti in sordina a distanza di un mese l'uno dall'altro — il repository di Mage-VL è apparso il 26 luglio 2026, UI-Venus-2-9B il 26 agosto 2026 — entrambi hanno pesi open source con licenza Apache-2.0, ed entrambi si basano su backbone della famiglia Qwen. È più o meno qui che finiscono le somiglianze, e la differenza non è di grado ma di quale lato dello schermo occupi ciascun modello. Microsoft Mage-VL è un modello di percezione in streaming nativo codec: guarda video compressi, resta in silenzio durante filmati di routine, ed emette testo quando un evento si completa. UI-Venus-2-9B è un agente GUI: riceve uno screenshot statico, ragiona sullo stato ed emette un'azione strutturata. Uno guarda lo schermo e lo descrive; l'altro guarda lo schermo e lo opera. Scegliere tra loro non è una decisione da benchmark, perché non condividono un singolo benchmark — è una decisione su se la tua automazione termina in una risposta o in un'azione.
Cosa è realmente ciascun modello
Microsoft Mage-VL, rilasciato nel repository microsoft/Mage-VL senza alcun annuncio, è un modello multimodale di circa 4 miliardi di parametri, costruito da un decoder linguistico Qwen3-4B-Instruct-2507, un encoder visivo creato da zero chiamato Mage-ViT e uno streaming gate separato di ~0,5 miliardi di parametri. Il suo design è nativo per i codec video: invece di campionare i frame in modo uniforme, mantiene i frame di ancoraggio (I) per intero e conserva solo le patch salienti per il movimento dei frame predetti (P); secondo Microsoft, questo riduce il consumo di token visivi di oltre il 75% e offre un'accelerazione wall-clock dell'inferenza fino a 3,5× rispetto al campionamento uniforme. Un design a due processi — il gate cognitivo System 1 osserva ogni finestra di codec scorrevole, mentre la VLM System 2 si attiva solo quando un evento merita una risposta — lo rende un osservatore video sempre attivo, economico proprio perché per lo più silenzioso.
UI-Venus-2-9B, rilasciato da inclusionAI (il laboratorio Ant Group del Venus Team), è un agente GUI generalista da 9B inizializzato da Qwen3.5-9B. Osserva un'interfaccia, ragiona sullo stato del compito, esegue un'azione e incorpora il feedback — un ciclo chiuso osservazione–ragionamento–azione–feedback — e la sua scheda dichiara una copertura di addestramento su app mobili, piattaforme web e sistemi operativi desktop in un unico checkpoint. Sulla sua stessa scheda del modello riporta AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 e ScreenSpot-Pro 73.0, tutti riportati dal fornitore e nessuno riprodotto in modo indipendente.
Il divario di input: pixel che catturi vs un flusso che conservi
La differenza più istruttiva è ciò che ciascun modello consuma. UI-Venus-2-9B è un agente basato su screenshot: il suo input è lo schermo corrente, un fotogramma alla volta, e la sua finestra di contesto da 256K token è il modo in cui mantiene una cronologia di quei fotogrammi durante un compito lungo. Mage-VL è un agente basato su flussi video: il suo input è video compresso, e la sua efficienza deriva dal trattare il movimento tra i fotogrammi come dati — vettori di movimento ed energia residua per i codec tradizionali, mappe di rate apprese per quelli neurali. Questa è la differenza tra un modello che vede istanti e un modello che vede una timeline continua. Un agente basato su screenshot è strutturalmente cieco ai 100 millisecondi tra un'acquisizione e l'altra — lo spinner, la transizione di caricamento, lo stato di hover che esiste sullo schermo solo per un attimo. Un osservatore di flussi vive dentro quella lacuna. Non è un difetto in nessuno dei due design; è il motivo per cui un agente GUI che deve agire su uno schermo live e un modello di percezione che deve riassumere un feed sono prodotti diversi con contratti di input diversi.

Il divario di produzione: azioni vs commenti
Il lato dell'output è dove i due smettono di essere paragonabili. L'output di UI-Venus-2-9B è un'azione strutturata in uno spazio d'azione definito — mouse, tastiera, scroll, navigazione — che emette dopo token di ragionamento in stile Qwen3, e il suo addestramento è costruito attorno a compiti di grounding e CAPTCHA che premiano la localizzazione precisa degli elementi in condizioni di clutter visivo. L'output di Mage-VL è testo: un commento guidato da eventi su ciò che vede. Non ha uno spazio d'azione, né chiamata di funzioni, né un ciclo agente. Leggi le due schede tecniche dei modelli fianco a fianco e ti troverai di fronte ai lati opposti della linea percezione-azione: Mage-VL termina con una descrizione, UI-Venus-2-9B termina con un clic.
• Job — UI-Venus-2-9B: agente GUI, gestisce l'interfaccia. Microsoft Mage-VL: percezione in streaming, descrive l'interfaccia.
• Input — UI-Venus-2-9B: screenshot statici, cronologia di 256K token. Microsoft Mage-VL: flussi codec video compressi, sparsità dei token salienti per il movimento.
• Output — UI-Venus-2-9B: azioni strutturate di mouse/tastiera/navigazione. Microsoft Mage-VL: commento testuale controllato da eventi.
• Dimensioni — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B gate di streaming.
• Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 più Mage-ViT da zero.
• Licenza — entrambi Apache-2.0 (la scheda di Mage-VL indica che è solo a scopo di ricerca nel suo repository).
Il gap nel servizio
Qui il modello più nuovo e più grande è il più facile da eseguire. UI-Venus-2-9B documenta un singolo comando vLLM con una finestra di contesto di 256K e un'API standard compatibile con OpenAI. Mage-VL richiede trust_remote_code per eseguire il Python personalizzato di Microsoft, oltre a FFmpeg, un percorso neural-codec per i video e dipendenze come mamba-ssm, e non ha ancora uno stack di serving vLLM o SGLang — niente attenzione a pagine, nessun percorso di serving in produzione. Microsoft riporta circa 10,6 GB di parametri BF16 totali, il che significa che una GPU da 16 GB è il minimo realistico per l'elaborazione di immagini e 24 GB+ per i video lunghi. Per un team che vuole mettere qualcosa in produzione oggi, UI-Venus-2-9B ha la rampa di accesso più pulita; per un team che costruisce una pipeline di monitoraggio o riepilogo sempre attiva, lo stack di serving di Mage-VL è ciò che ci si assume in ogni caso, compreso il Python personalizzato.
Un tabellone segnapunti che non esiste
Non esiste un benchmark condiviso tra questi due modelli, e inventarne uno sarebbe disonesto. I numeri di UI-Venus-2-9B si collocano su board di grounding GUI, mobile, web e utilizzo del computer (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, tutti riportati dal fornitore). I numeri di Mage-VL si collocano su board di comprensione video e spaziale (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 rispetto a Qwen3-VL-4B, tutti riportati dal fornitore). Il modo corretto di leggere il confronto è come un bivio: se il compito è "capire cosa sta succedendo su questo schermo nel tempo", Mage-VL è lo strumento pertinente e UI-Venus-2-9B non è progettato per questo; se il compito è "far fare a questo schermo qualcosa", vale il contrario.
Dove i due compongono
La versione interessante di questo confronto non è un aut-aut. Un agente GUI che opera su un’applicazione live ha un genuino punto cieco — il tempo tra uno screenshot e l’altro, e qualsiasi cambiamento di stato che non si stabilizza mai in un frame statico — e un osservatore di flussi nativo codec è esattamente il tipo di modello che potrebbe fungere da strato percettivo in quella lacuna, rilevando che una pagina ha finito di caricarsi o che una modale ha terminato l’animazione prima del successivo passaggio di ancoraggio dell’agente. Microsoft non ha costruito Mage-VL per quel compito, e Ant Group non ha costruito UI-Venus-2-9B per essere guidato da un secondo modello, ma l’adattamento è reale. Per le parti di uno stack di questo tipo che sono già di livello produttivo — il LLM pianificatore che scompone un compito, il modello visivo che verifica lo stato di una schermata, il modello di trascrizione che registra la sessione di un agente — una singola API con prezzi pass-through e failover automatico è ciò che rende l’esperimento economico, ed è a questo che serve un router. Né UI-Venus-2-9B né Microsoft Mage-VL sono attualmente serviti tramite OrcaRouter; entrambi sono progetti self-host a pesi aperti, ed entrambi comparirebbero al prezzo di listino del provider se mai raggiungessero un provider instradato.


Chi dovrebbe scegliere cosa
Scegli Microsoft Mage-VL quando il tuo problema è la percezione continua — un feed della fotocamera, una registrazione dello schermo, uno stream che devi riassumere o monitorare in tempo reale, a un costo abbastanza basso da poterlo tenere sempre attivo. Scegli UI-Venus-2-9B quando il tuo problema è il controllo — un'attività che termina con un'azione completata, un modulo compilato, un flusso navigato, un'applicazione gestita. E se la tua automazione ha davvero bisogno di entrambe le cose — percepire lo stream, poi agire sull'immagine ferma — eseguile come coppia e tratta il watcher dello stream come il rilevatore di eventi che fornisce all'agente di screenshot i momenti su cui vale la pena agire. Sono due metà dello stesso schermo, non concorrenti per lo stesso compito.
