Una card di titolo hero generata per "MiniCPM-V 4.7 vs UI-Venus 2.9B" con il sottotitolo "Un modello di visione generale contro un agente GUI creato appositamente", una card a sinistra con scritto "UI-Venus 2.9B: grounding, CAPTCHA, mobile, web, computer use", una card a destra con scritto "MiniCPM-V 4.7: 35.2B sparse, nessuna card, nessun benchmark" e una pillola con scritto "Uno specialista contro un generalista non misurato", con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

MiniCPM-V 4.7 vs UI-Venus 2.9B: un modello di visione generale contro un agente GUI progettato appositamente

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

MiniCPM-V 4.7 e UI-Venus 2.9B sono entrambi modelli vision-language che osservano uno screenshot e producono testo, e qui finisce la somiglianza — perché uno dei due è stato costruito esattamente per quel compito. UI-Venus 2.9B è un agente GUI general-purpose di inclusionAI, rilasciato il 26 agosto 2026, il cui intero design è incentrato sull'osservare un'interfaccia, ragionare sullo stato del compito, emettere un'azione e incorporare il feedback risultante; viene distribuito con un report tecnico, tabelle di benchmark su GUI grounding, attività mobile, web, computer-use e CAPTCHA, e una valutazione esplicita di quanto spesso lo si possa convincere a compiere un'azione pericolosa. MiniCPM-V 4.7 è un checkpoint sparse mixture-of-experts da 35,2 miliardi di parametri caricato da OpenBMB il 6 ottobre 2026 senza scheda, senza licenza e senza benchmark. Confrontare uno specialista con un generalista non misurato è un esercizio alquanto inusuale, e questa pagina è esplicita su dove il confronto regge e dove no.

Due tipi molto diversi di rilascio

UI-Venus 2.9B è inclusionAI/UI-Venus-2-9B, un modello da 9 miliardi di parametri inizializzato da Qwen3.5-9B e specializzato tramite post-training specificamente come agente GUI. La scheda descrive un ciclo chiuso — osservare l'interfaccia, ragionare sullo stato del compito, eseguire un'azione, integrare il feedback nella decisione successiva — addestrato in tre fasi: mid-training multimodale su traiettorie simulate su larga scala per mobile, web e desktop; apprendimento per rinforzo offline suddiviso in cinque famiglie di compiti; e distillazione on-policy multi-insegnante che consolida insegnanti specializzati per dominio in un'unica policy. Viene valutato su benchmark di GUI grounding, mobile, web, computer-use e CAPTCHA, e separatamente sulla sicurezza delle azioni con conseguenze: la scheda riporta un tasso di successo degli attacchi dell'11,3% su OSHarm e del 48,8% su OSBlind, rispetto al 25,3% e al 79,4% della sua base Qwen3.5-9B. Per inciso, un progetto gemello della stessa OpenBMB ha esplorato un terreno simile: l'organizzazione MiniCPM ha un progetto AgentCPM-GUI di gennaio 2026, quindi questo è un ambito in cui entrambi i laboratori sono entrati.

MiniCPM-V 4.7 è openbmb/MiniCPM-V-4.7-35B-A3B, 35.212.875.824 parametri BF16 distribuiti su 70,4 GB e sedici shard, caricato il 6 ottobre 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs UI-Venus 2.9B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Purpose general vision, Grounding not documented, Safety ASR not evaluated, Context 256K, Evidence config file only. Right column 'UI-Venus 2.9B' lists Parameters 9.4B dense, Purpose GUI agent, Grounding core training task, Safety ASR 11.3% OSHarm, Context 256K served, Evidence technical report. The footer reads 'UI-Venus figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Backbone testuale MoE sparso con tag qwen3_5_moe_text — 256 esperti, 8 per token — su oltre 40 livelli con uno schema di attenzione da tre lineari a uno completo, una torre di visione interna a 27 livelli con downsampling 16× e fino a nove sezioni di immagine, e una finestra di contesto da 256K. Nessun README, quindi nessuna licenza e nessun benchmark. Tre like, zero download, discussioni vuote.

Il confronto, con le lacune lasciate aperte

• Scopo — UI-Venus 2.9B: un agente GUI, addestrato end-to-end per l'interazione con l'interfaccia. MiniCPM-V 4.7: un modello generale visione-linguaggio; per cosa sia ottimizzato non è specificato.

• Parametri — UI-Venus 2.9B: 9,41B, denso. MiniCPM-V 4.7: 35,2B totali, sparso, 8 esperti su 256 per token.

• Modello base — UI-Venus 2.9B: inizializzato da Qwen3.5-9B, uno stack di testo Qwen denso. MiniCPM-V 4.7: uno stack di testo MoE derivato da Qwen3.5, classe qwen3_5_moe_text. Rami diversi dello stesso albero genealogico.

• Grounding dell'interfaccia — UI-Venus 2.9B: la competenza fondamentale, con famiglie di attività dedicate al grounding e ai CAPTCHA nell'addestramento e un sistema di verifica ancorato ai keypoint che utilizza la votazione multi-modello. MiniCPM-V 4.7: nessuna dichiarazione specifica sul grounding e nessun formato di output delle coordinate documentato.

• Valutazione di sicurezza — UI-Venus 2.9B: riporta un ASR dell'11,3% su OSHarm e del 48,8% su OSBlind. MiniCPM-V 4.7: nessuno.

• Prove — UI-Venus 2.9B: un report tecnico su arXiv, una pagina del progetto, un repository GitHub e tabelle di benchmark. MiniCPM-V 4.7: un file di configurazione.

• Strumenti — UI-Venus 2.9B: avvio rapido di vLLM con un flag reasoning-parser, oltre a conversioni GGUF dalla community. MiniCPM-V 4.7: ancora nulla.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Perché un agente GUI non è semplicemente «un VLM che guarda gli schermi»

Lo scarto tra questi due modelli non riguarda principalmente il numero di parametri, e vale la pena esplicitarlo, perché è ciò che rende il confronto interessante anziché semplicemente sbilanciato.

Un compito di screenshot ha una proprietà che la maggior parte dei benchmark di visione non ha: l'output deve essere eseguibile. Quando a UI-Venus 2.9B viene chiesto di toccare un pulsante, deve emettere una coordinata o un'azione strutturata che l'ambiente possa effettivamente applicare, e un piccolo errore nel grounding non è una risposta sbagliata in una classifica, è un compito fallito e uno stato corrotto. Ecco perché la scheda di UI-Venus 2 dedica così tanta parte della sua lunghezza alla verifica: il completamento del compito viene giudicato su punti chiave visivi rilevanti per il compito anziché su uno sguardo olistico alla schermata finale, e giudici eterogenei votano per ridurre il bias del singolo giudice. Lo scopo di quel meccanismo è rendere il segnale di ricompensa dell'apprendimento per rinforzo robusto al reward hacking — un modello che impara a soddisfare un verificatore pigro anziché a completare il compito.

Spiega anche la sezione sulla sicurezza.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured 7 October 2026) showing the model header, the qwen3_5, multimodal, gui and agent tags, and the opening of the UI-Venus-2 card describing a general-purpose foundation GUI agent that operates across mobile applications, web platforms and desktop operating systems.

Un agente in grado di usare un telefono o un desktop ha una superficie d'attacco che un modello di didascalia non ha, e riportare un tasso di successo degli attacchi è il minimo che un laboratorio dovrebbe fare quando ne distribuisce uno. UI-Venus 2.9B riporta l'11,3% su OSHarm e il 48,8% su OSBlind — la seconda cifra è alta in termini assoluti, e l'inquadramento della scheda è un confronto con il suo modello di base anziché un'affermazione assoluta di robustezza. Leggilo come "decisamente migliore rispetto al punto di partenza", non come "sicuro".

L'architettura di MiniCPM-V 4.7 non ha nulla da dire su nessuno di questi aspetti. L'attenzione lineare su un contesto lungo aiuterebbe un agente che deve ricordare una lunga cronologia di interazioni, e la MoE sparsa aiuterebbe il throughput se si eseguono molti episodi. Ma un'architettura che sarebbe utile per un agente non è un agente, e nessuna parte dell'artefatto rilasciato documenta l'output delle azioni, l'accuratezza del grounding o il comportamento in termini di sicurezza.

La valutazione onesta del lato MiniCPM

È allettante riempire questa sezione con i numeri di 4.6. Resisti. MiniCPM-V 4.6 è un modello denso da 1,3B su un backbone Qwen3.5-0.8B con uno schema di compressione visiva commutabile 4x/16x, e i suoi risultati pubblicizzati — un punteggio di 13 sull'Artificial Analysis Intelligence Index, riportato dal fornitore, a una frazione del costo in token di modelli piccoli comparabili — descrivono quel modello. MiniCPM-V 4.7 cambia il backbone, cambia il pattern di attenzione e cambia la compressione visiva predefinita. Nessuna delle misurazioni di 4.6 è trasferibile, e nessuna di esse descrive un agente GUI in primo luogo.

Ciò che si può dire onestamente su MiniCPM-V 4.7 è limitato e fattuale: i pesi esistono, la forma è insolita per la famiglia, la finestra di contesto è lunga e il rilascio è incompleto. L'assenza di una licenza è l'ostacolo pratico; l'assenza di benchmark è quello valutativo. E c'è una modesta ragione d'interesse anziché d'indifferenza — OpenBMB sviluppa strumenti GUI, tra cui AgentCPM-GUI, quindi un modello vision sparse MoE a contesto lungo proveniente da quel laboratorio non è implausibile come futura spina dorsale per agenti. Questa è un'ipotesi sulle intenzioni, e il repository non la conferma.

Cosa sceglieresti, e quando

Per qualunque cosa che coinvolga uno screenshot e un'azione — toccare, digitare, scorrere, navigare in un'app o in un sito web, estrarre dati da una UI — UI-Venus 2.9B è l'unico dei due ad affrontare il compito. Ha l'addestramento, i meccanismi di verifica, i numeri sulla sicurezza riportati e strumenti sufficienti per metterlo in funzione su vLLM oggi. Nulla, in MiniCPM-V 4.7, suggerisce che sia in competizione su questo fronte, e senza una scheda non puoi nemmeno verificare se emette coordinate.

Per il lavoro multimodale generale — descrivere immagini, leggere documenti, analisi su contesti lunghi di materiale ricco di immagini — il confronto non è ancora decidibile, perché una delle due parti non ha prove di qualità pubblicate. Se ne hai bisogno oggi, UI-Venus 2.9B è almeno misurabile, anche se è stato messo a punto per le interfacce anziché per il ragionamento sui documenti e non è nemmeno una scelta ovvia come prima opzione per quel compito.

Il modello è lo stesso in entrambi i casi: un modello self-hosted che gestisce il lavoro di routine e un modello frontier ospitato per i casi difficili che gli vengono passati. È in quel passaggio di consegne che un router si guadagna il suo posto — una sola chiave per oltre 200 modelli ospitati, ciascuno passato al prezzo di listino del provider senza alcun ricarico da parte nostra, con failover automatico quando un provider peggioraNé UI-Venus 2.9B né MiniCPM-V 4.7 è ospitato su OrcaRouter; entrambi sono pesi che esegui tu stesso. Il router è ciò con cui il tuo agente comunica quando decide che il modello locale non basta.

Dove questo ti lascia

Questa non è una decisione incerta, e la ragione è strutturale più che un giudizio sulla qualità. UI-Venus 2.9B è uno specialista con un report, una licenza, tabelle di benchmark, valutazione di sicurezza e una ricetta di serving. MiniCPM-V 4.7 è un generalista con un file di configurazione. Uno di questi è un prodotto e l'altro è una promessa, e l'unico modo responsabile di confrontarli è dirlo. Tieni d'occhio il repository: se OpenBMB pubblica una card che mostra il grounding dell'interfaccia e l'output delle azioni, allora un MoE sparse con contesto 256K contro un agente distillato da 9B diventa una domanda davvero interessante. Fino ad allora, la risposta a "quale dovrei usare" è quella che esiste.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno