
MiniCPM-V 4.7 vs UI-Venus 2.9B: un modello di visione generale contro un agente GUI progettato appositamente
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
MiniCPM-V 4.7 e UI-Venus 2.9B sono entrambi modelli vision-language che osservano uno screenshot e producono testo, e qui finisce la somiglianza — perché uno dei due è stato costruito esattamente per quel compito. UI-Venus 2.9B è un agente GUI general-purpose di inclusionAI, rilasciato il 26 agosto 2026, il cui intero design è incentrato sull'osservare un'interfaccia, ragionare sullo stato del compito, emettere un'azione e incorporare il feedback risultante; viene distribuito con un report tecnico, tabelle di benchmark su GUI grounding, attività mobile, web, computer-use e CAPTCHA, e una valutazione esplicita di quanto spesso lo si possa convincere a compiere un'azione pericolosa. MiniCPM-V 4.7 è un checkpoint sparse mixture-of-experts da 35,2 miliardi di parametri caricato da OpenBMB il 6 ottobre 2026 senza scheda, senza licenza e senza benchmark. Confrontare uno specialista con un generalista non misurato è un esercizio alquanto inusuale, e questa pagina è esplicita su dove il confronto regge e dove no.
Due tipi molto diversi di rilascio
UI-Venus 2.9B è inclusionAI/UI-Venus-2-9B, un modello da 9 miliardi di parametri inizializzato da Qwen3.5-9B e specializzato tramite post-training specificamente come agente GUI. La scheda descrive un ciclo chiuso — osservare l'interfaccia, ragionare sullo stato del compito, eseguire un'azione, integrare il feedback nella decisione successiva — addestrato in tre fasi: mid-training multimodale su traiettorie simulate su larga scala per mobile, web e desktop; apprendimento per rinforzo offline suddiviso in cinque famiglie di compiti; e distillazione on-policy multi-insegnante che consolida insegnanti specializzati per dominio in un'unica policy. Viene valutato su benchmark di GUI grounding, mobile, web, computer-use e CAPTCHA, e separatamente sulla sicurezza delle azioni con conseguenze: la scheda riporta un tasso di successo degli attacchi dell'11,3% su OSHarm e del 48,8% su OSBlind, rispetto al 25,3% e al 79,4% della sua base Qwen3.5-9B. Per inciso, un progetto gemello della stessa OpenBMB ha esplorato un terreno simile: l'organizzazione MiniCPM ha un progetto AgentCPM-GUI di gennaio 2026, quindi questo è un ambito in cui entrambi i laboratori sono entrati.
MiniCPM-V 4.7 è openbmb/MiniCPM-V-4.7-35B-A3B, 35.212.875.824 parametri BF16 distribuiti su 70,4 GB e sedici shard, caricato il 6 ottobre 2026.

Backbone testuale MoE sparso con tag qwen3_5_moe_text — 256 esperti, 8 per token — su oltre 40 livelli con uno schema di attenzione da tre lineari a uno completo, una torre di visione interna a 27 livelli con downsampling 16× e fino a nove sezioni di immagine, e una finestra di contesto da 256K. Nessun README, quindi nessuna licenza e nessun benchmark. Tre like, zero download, discussioni vuote.
Il confronto, con le lacune lasciate aperte
• Scopo — UI-Venus 2.9B: un agente GUI, addestrato end-to-end per l'interazione con l'interfaccia. MiniCPM-V 4.7: un modello generale visione-linguaggio; per cosa sia ottimizzato non è specificato.
• Parametri — UI-Venus 2.9B: 9,41B, denso. MiniCPM-V 4.7: 35,2B totali, sparso, 8 esperti su 256 per token.
• Modello base — UI-Venus 2.9B: inizializzato da Qwen3.5-9B, uno stack di testo Qwen denso. MiniCPM-V 4.7: uno stack di testo MoE derivato da Qwen3.5, classe qwen3_5_moe_text. Rami diversi dello stesso albero genealogico.
• Grounding dell'interfaccia — UI-Venus 2.9B: la competenza fondamentale, con famiglie di attività dedicate al grounding e ai CAPTCHA nell'addestramento e un sistema di verifica ancorato ai keypoint che utilizza la votazione multi-modello. MiniCPM-V 4.7: nessuna dichiarazione specifica sul grounding e nessun formato di output delle coordinate documentato.
• Valutazione di sicurezza — UI-Venus 2.9B: riporta un ASR dell'11,3% su OSHarm e del 48,8% su OSBlind. MiniCPM-V 4.7: nessuno.
• Prove — UI-Venus 2.9B: un report tecnico su arXiv, una pagina del progetto, un repository GitHub e tabelle di benchmark. MiniCPM-V 4.7: un file di configurazione.
• Strumenti — UI-Venus 2.9B: avvio rapido di vLLM con un flag reasoning-parser, oltre a conversioni GGUF dalla community. MiniCPM-V 4.7: ancora nulla.

Perché un agente GUI non è semplicemente «un VLM che guarda gli schermi»
Lo scarto tra questi due modelli non riguarda principalmente il numero di parametri, e vale la pena esplicitarlo, perché è ciò che rende il confronto interessante anziché semplicemente sbilanciato.
Un compito di screenshot ha una proprietà che la maggior parte dei benchmark di visione non ha: l'output deve essere eseguibile. Quando a UI-Venus 2.9B viene chiesto di toccare un pulsante, deve emettere una coordinata o un'azione strutturata che l'ambiente possa effettivamente applicare, e un piccolo errore nel grounding non è una risposta sbagliata in una classifica, è un compito fallito e uno stato corrotto. Ecco perché la scheda di UI-Venus 2 dedica così tanta parte della sua lunghezza alla verifica: il completamento del compito viene giudicato su punti chiave visivi rilevanti per il compito anziché su uno sguardo olistico alla schermata finale, e giudici eterogenei votano per ridurre il bias del singolo giudice. Lo scopo di quel meccanismo è rendere il segnale di ricompensa dell'apprendimento per rinforzo robusto al reward hacking — un modello che impara a soddisfare un verificatore pigro anziché a completare il compito.
Spiega anche la sezione sulla sicurezza.

Un agente in grado di usare un telefono o un desktop ha una superficie d'attacco che un modello di didascalia non ha, e riportare un tasso di successo degli attacchi è il minimo che un laboratorio dovrebbe fare quando ne distribuisce uno. UI-Venus 2.9B riporta l'11,3% su OSHarm e il 48,8% su OSBlind — la seconda cifra è alta in termini assoluti, e l'inquadramento della scheda è un confronto con il suo modello di base anziché un'affermazione assoluta di robustezza. Leggilo come "decisamente migliore rispetto al punto di partenza", non come "sicuro".
L'architettura di MiniCPM-V 4.7 non ha nulla da dire su nessuno di questi aspetti. L'attenzione lineare su un contesto lungo aiuterebbe un agente che deve ricordare una lunga cronologia di interazioni, e la MoE sparsa aiuterebbe il throughput se si eseguono molti episodi. Ma un'architettura che sarebbe utile per un agente non è un agente, e nessuna parte dell'artefatto rilasciato documenta l'output delle azioni, l'accuratezza del grounding o il comportamento in termini di sicurezza.
La valutazione onesta del lato MiniCPM
È allettante riempire questa sezione con i numeri di 4.6. Resisti. MiniCPM-V 4.6 è un modello denso da 1,3B su un backbone Qwen3.5-0.8B con uno schema di compressione visiva commutabile 4x/16x, e i suoi risultati pubblicizzati — un punteggio di 13 sull'Artificial Analysis Intelligence Index, riportato dal fornitore, a una frazione del costo in token di modelli piccoli comparabili — descrivono quel modello. MiniCPM-V 4.7 cambia il backbone, cambia il pattern di attenzione e cambia la compressione visiva predefinita. Nessuna delle misurazioni di 4.6 è trasferibile, e nessuna di esse descrive un agente GUI in primo luogo.
Ciò che si può dire onestamente su MiniCPM-V 4.7 è limitato e fattuale: i pesi esistono, la forma è insolita per la famiglia, la finestra di contesto è lunga e il rilascio è incompleto. L'assenza di una licenza è l'ostacolo pratico; l'assenza di benchmark è quello valutativo. E c'è una modesta ragione d'interesse anziché d'indifferenza — OpenBMB sviluppa strumenti GUI, tra cui AgentCPM-GUI, quindi un modello vision sparse MoE a contesto lungo proveniente da quel laboratorio non è implausibile come futura spina dorsale per agenti. Questa è un'ipotesi sulle intenzioni, e il repository non la conferma.
Cosa sceglieresti, e quando
Per qualunque cosa che coinvolga uno screenshot e un'azione — toccare, digitare, scorrere, navigare in un'app o in un sito web, estrarre dati da una UI — UI-Venus 2.9B è l'unico dei due ad affrontare il compito. Ha l'addestramento, i meccanismi di verifica, i numeri sulla sicurezza riportati e strumenti sufficienti per metterlo in funzione su vLLM oggi. Nulla, in MiniCPM-V 4.7, suggerisce che sia in competizione su questo fronte, e senza una scheda non puoi nemmeno verificare se emette coordinate.
Per il lavoro multimodale generale — descrivere immagini, leggere documenti, analisi su contesti lunghi di materiale ricco di immagini — il confronto non è ancora decidibile, perché una delle due parti non ha prove di qualità pubblicate. Se ne hai bisogno oggi, UI-Venus 2.9B è almeno misurabile, anche se è stato messo a punto per le interfacce anziché per il ragionamento sui documenti e non è nemmeno una scelta ovvia come prima opzione per quel compito.
Il modello è lo stesso in entrambi i casi: un modello self-hosted che gestisce il lavoro di routine e un modello frontier ospitato per i casi difficili che gli vengono passati. È in quel passaggio di consegne che un router si guadagna il suo posto — una sola chiave per oltre 200 modelli ospitati, ciascuno passato al prezzo di listino del provider senza alcun ricarico da parte nostra, con failover automatico quando un provider peggioraNé UI-Venus 2.9B né MiniCPM-V 4.7 è ospitato su OrcaRouter; entrambi sono pesi che esegui tu stesso. Il router è ciò con cui il tuo agente comunica quando decide che il modello locale non basta.
Dove questo ti lascia
Questa non è una decisione incerta, e la ragione è strutturale più che un giudizio sulla qualità. UI-Venus 2.9B è uno specialista con un report, una licenza, tabelle di benchmark, valutazione di sicurezza e una ricetta di serving. MiniCPM-V 4.7 è un generalista con un file di configurazione. Uno di questi è un prodotto e l'altro è una promessa, e l'unico modo responsabile di confrontarli è dirlo. Tieni d'occhio il repository: se OpenBMB pubblica una card che mostra il grounding dell'interfaccia e l'output delle azioni, allora un MoE sparse con contesto 256K contro un agente distillato da 9B diventa una domanda davvero interessante. Fino ad allora, la risposta a "quale dovrei usare" è quella che esiste.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
