
MiniCPM-V 4.7 vs UI-Venus 2.9B : un modèle de vision généraliste face à un agent GUI conçu sur mesure
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
MiniCPM-V 4.7 et UI-Venus 2.9B sont tous deux des modèles vision-langage qui examinent une capture d’écran et produisent du texte, et c’est là que la ressemblance s’arrête — car l’un d’eux a été conçu exactement pour ce travail. UI-Venus 2.9B est un agent GUI polyvalent d’inclusionAI, publié le 26 août 2026, dont toute la conception est centrée sur l’observation d’une interface, le raisonnement sur l’état d’une tâche, l’émission d’une action et l’intégration du retour résultant ; il est accompagné d’un rapport technique, de tableaux de benchmarks couvrant les tâches d’ancrage GUI, mobiles, web, d’utilisation d’ordinateur et de CAPTCHA, ainsi que d’une évaluation explicite de la fréquence à laquelle on peut le convaincre d’accomplir une action dangereuse. MiniCPM-V 4.7 est un point de contrôle à mélange d’experts clairsemé de 35,2 milliards de paramètres téléversé par OpenBMB le 6 octobre 2026, sans fiche, sans licence et sans benchmark. Comparer un spécialiste à un généraliste non mesuré est un exercice quelque peu inhabituel, et cette page précise clairement où la comparaison tient et où elle ne tient pas.
Deux types de publication très différents
UI-Venus 2.9B est inclusionAI/UI-Venus-2-9B, un modèle de 9 milliards de paramètres initialisé à partir de Qwen3.5-9B et post-entraîné spécifiquement comme agent GUI. La fiche décrit une boucle fermée — observer l’interface, raisonner sur l’état de la tâche, exécuter une action, réinjecter le retour dans la décision suivante — entraînée en trois étapes : un entraînement intermédiaire multimodal sur des trajectoires simulées à grande échelle de mobile, de web et de bureau ; un apprentissage par renforcement hors ligne réparti sur cinq familles de tâches ; et une distillation on-policy multi-enseignants qui consolide des enseignants spécialisés par domaine en une seule politique. Il est évalué sur des benchmarks de GUI grounding, mobile, web, computer-use et CAPTCHA, et séparément sur la sécurité des actions à conséquences : la fiche rapporte un taux de réussite des attaques de 11,3 % sur OSHarm et de 48,8 % sur OSBlind, contre 25,3 % et 79,4 % pour sa base Qwen3.5-9B. Le pendant d’OpenBMB, incidemment, s’est penché sur un terrain similaire : l’organisation MiniCPM dispose d’un projet AgentCPM-GUI de janvier 2026, c’est donc un créneau dans lequel les deux laboratoires se sont engagés.
MiniCPM-V 4.7 est openbmb/MiniCPM-V-4.7-35B-A3B, comptant 35 212 875 824 paramètres BF16 répartis sur 70,4 Go et seize fragments, mis en ligne le 6 octobre 2026.

Backbone textuel MoE à experts clairsemés étiqueté qwen3_5_moe_text — 256 experts, 8 par token — sur plus de 40 couches avec un schéma d'attention de trois couches linéaires pour une couche complète, une tour de vision interne de 27 couches avec un sous-échantillonnage 16× et jusqu'à neuf tranches d'image, et une fenêtre de contexte de 256K. Pas de README, donc pas de licence et pas de benchmarks. Trois likes, zéro téléchargement, discussions vides.
La comparaison, avec les lacunes laissées ouvertes
• Objectif — UI-Venus 2.9B : un agent GUI, entraîné de bout en bout pour l'interaction avec les interfaces. MiniCPM-V 4.7 : un modèle vision-langage général ; ce pour quoi il est optimisé n'est pas précisé.
• Paramètres — UI-Venus 2.9B : 9,41 milliards, dense. MiniCPM-V 4.7 : 35,2 milliards au total, épars, 8 experts sur 256 par token.
• Modèle de base — UI-Venus 2.9B : initialisé à partir de Qwen3.5-9B, une pile de texte Qwen dense. MiniCPM-V 4.7 : une pile de texte MoE dérivée de Qwen3.5, classe qwen3_5_moe_text Des branches différentes du même arbre généalogique.
• Ancrage d'interface — UI-Venus 2.9B : la compétence centrale, avec des familles de tâches dédiées à l'ancrage et aux CAPTCHA dans l'entraînement et un système de vérification ancré sur des points clés recourant à un vote multi-modèles. MiniCPM-V 4.7 : aucune revendication spécifique à l'ancrage, et aucun format de sortie de coordonnées documenté.
• Évaluation de sécurité — UI-Venus 2.9B : rapporte un ASR de 11,3 % sur OSHarm et de 48,8 % sur OSBlind. MiniCPM-V 4.7 : aucun.
• Preuves — UI-Venus 2.9B : un rapport technique sur arXiv, une page de projet, un dépôt GitHub et des tableaux de benchmark. MiniCPM-V 4.7 : un fichier de configuration.
• Outillage — UI-Venus 2.9B : démarrage rapide avec vLLM via un flag de parseur de raisonnement, plus des conversions GGUF de la communauté. MiniCPM-V 4.7 : rien pour l’instant.

Pourquoi un agent GUI n'est pas simplement « un VLM qui regarde des écrans »
L’écart entre ces deux modèles ne tient pas principalement au nombre de paramètres, et il vaut la peine de le préciser, car c’est ce qui rend cet affrontement intéressant plutôt que simplement déséquilibré.
Une tâche de capture d'écran possède une propriété que la plupart des benchmarks de vision n'ont pas : la sortie doit être exécutable. Quand on demande à UI-Venus 2.9B de toucher un bouton, il doit émettre une coordonnée ou une action structurée que l'environnement peut réellement appliquer, et une petite erreur d'ancrage n'est pas une mauvaise réponse dans un classement, c'est une tâche échouée et un état corrompu. C'est pourquoi la fiche UI-Venus 2 consacre une si grande partie de sa longueur à la vérification : l'achèvement de la tâche est jugé sur des points clés visuels pertinents pour la tâche plutôt que sur un coup d'œil holistique à l'écran final, et des juges hétérogènes votent pour réduire le biais d'un juge unique. Le but de ce dispositif est de rendre le signal de récompense de l'apprentissage par renforcement robuste au détournement de la récompense — un modèle qui apprend à satisfaire un vérificateur paresseux plutôt qu'à accomplir la tâche.
Il explique aussi la section relative à la sécurité.

Un agent capable de piloter un téléphone ou un ordinateur de bureau a une surface d'attaque qu'un modèle de légendage n'a pas, et rapporter un taux de réussite des attaques est le minimum qu'un laboratoire devrait faire lorsqu'il en déploie un. UI-Venus 2.9B rapporte 11,3 % sur OSHarm et 48,8 % sur OSBlind — le second chiffre est élevé en termes absolus, et le cadrage de la fiche est une comparaison avec son modèle de base plutôt qu'une affirmation absolue de robustesse. À lire comme « nettement meilleur que son point de départ », et non comme « sûr ».
L'architecture de MiniCPM-V 4.7 n'a rien à dire sur tout cela. Une attention linéaire sur un long contexte aiderait un agent qui doit se souvenir d'un long historique d'interaction, et le MoE clairsemé aiderait le débit si vous exécutez de nombreux épisodes. Mais une architecture qui serait utile à un agent n'est pas un agent, et aucune partie de l'artefact publié ne documente la sortie d'actions, la précision d'ancrage ou le comportement de sécurité.
L'évaluation honnête du côté MiniCPM
Il est tentant de remplir cette section avec les chiffres de la version 4.6. Résistez-y. MiniCPM-V 4.6 est un modèle dense de 1,3 milliard de paramètres reposant sur une base Qwen3.5-0.8B, doté d'un schéma de compression visuelle commutable 4x/16x, et ses résultats annoncés — un score de 13 à l'Artificial Analysis Intelligence Index, rapporté par le fournisseur, pour une fraction du coût en tokens de modèles de petite taille comparables — décrivent ce modèle-là. MiniCPM-V 4.7 change de base, change le schéma d'attention et change la compression visuelle par défaut. Aucune des mesures de la 4.6 n'est transposable, et aucune d'entre elles ne décrit un agent GUI, de toute façon.
Ce qu'on peut honnêtement dire de MiniCPM-V 4.7 est restreint et factuel : les poids existent, la forme est inhabituelle pour la famille, la fenêtre de contexte est longue, et la publication est incomplète. L'absence de licence est l'obstacle pratique ; l'absence de benchmarks, l'obstacle évaluatif. Et il y a une modeste raison de s'y intéresser plutôt que de rester indifférent — OpenBMB développe des outils GUI, dont AgentCPM-GUI, si bien qu'un modèle de vision MoE clairsemé à long contexte issu de ce laboratoire n'est pas invraisemblable comme futur socle d'agent. C'est une hypothèse sur l'intention, et le dépôt ne la confirme pas.
Ce que vous choisiriez, et quand
Pour tout ce qui implique une capture d’écran et une action — appuyer, saisir, faire défiler, naviguer dans une application ou sur un site web, extraire des données d’une UI — UI-Venus 2.9B est le seul des deux à traiter la tâche. Il dispose de l’entraînement, des mécanismes de vérification, des chiffres de sécurité rapportés et de suffisamment d’outils pour le déployer sur vLLM dès aujourd’hui. Rien chez MiniCPM-V 4.7 ne suggère qu’il soit en concurrence sur ce terrain, et sans fiche modèle, vous ne pouvez même pas vérifier s’il émet des coordonnées.
Pour le travail multimodal général — décrire des images, lire des documents, analyser un contexte long sur du matériel riche en images — la comparaison n'est pas encore décidable, car un des deux côtés ne dispose d'aucune preuve de qualité publiée. Si vous en avez besoin dès aujourd'hui, UI-Venus 2.9B est au moins mesurable, bien qu'il ait été ajusté pour les interfaces plutôt que pour le raisonnement documentaire et qu'il ne soit pas non plus un premier choix évident pour cette tâche.
Le schéma est le même dans les deux cas : un modèle auto-hébergé qui gère le travail de routine, et un modèle de pointe hébergé pour les cas difficiles qu'il délègue. C'est dans ce transfert qu'un routeur justifie sa place — une seule clé pour plus de 200 modèles hébergés, chacun transmis au prix catalogue du fournisseur, sans marge de notre part, avec basculement automatique en cas de dégradation d'un fournisseur. Ni UI-Venus 2.9B ni MiniCPM-V 4.7 ne sont hébergés sur OrcaRouter ; tous deux sont des poids que vous exécutez vous-même. Le routeur est ce à quoi votre agent s'adresse lorsqu'il estime que le modèle local ne suffit pas.
Où cela vous laisse
Ce n’est pas une décision difficile à prendre, et la raison est structurelle plutôt qu’un jugement sur la qualité. UI-Venus 2.9B est un spécialiste avec un rapport, une licence, des tableaux de référence, une évaluation de sûreté et une recette de déploiement. MiniCPM-V 4.7 est un généraliste avec un fichier de configuration. L’un est un produit, l’autre une promesse, et la seule manière responsable de les comparer est de le dire. Surveillez le dépôt : si OpenBMB publie une fiche qui montre l’ancrage dans l’interface et la sortie d’actions, alors un MoE sparse à contexte 256K face à un agent 9B distillé devient une question réellement intéressante. D’ici là, la réponse à « lequel dois-je utiliser » est celui qui existe.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
