
UI-Venus-2-9B contre Microsoft Mage-VL : l’agent de capture d’écran face au surveillant de flux codec
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
UI-Venus-2-9B et Microsoft Mage-VL sont tous deux sortis discrètement à moins d'un mois d'intervalle — le dépôt de Mage-VL est apparu le 26 juillet 2026, celui d'UI-Venus-2-9B le 26 août 2026 — tous deux sont à poids ouverts sous licence Apache-2.0, et tous deux reposent sur des modèles de base de la famille Qwen. C'est à peu près là que s'arrêtent les similitudes, et la différence n'est pas une question de degré, mais du côté de l'écran sur lequel chaque modèle vit. Microsoft Mage-VL est un modèle de perception en streaming natif du codec : il regarde une vidéo compressée, reste silencieux pendant les séquences routinières, et émet du texte lorsqu'un événement se termine. UI-Venus-2-9B est un agent GUI : il prend en entrée une capture d'écran fixe, raisonne sur l'état, et émet une action structurée. L'un regarde l'écran et le décrit ; l'autre regarde l'écran et l'actionne. Choisir entre eux ne relève pas d'une décision de benchmark, car ils ne partagent aucun benchmark — c'est une décision quant à savoir si votre automatisation aboutit à une réponse ou à une action.
Ce qu'est réellement chaque modèle
Microsoft Mage-VL, publié dans le dépôt microsoft/Mage-VL sans annonce, est un modèle multimodal d'environ 4B de paramètres, construit à partir d'un décodeur de langage Qwen3-4B-Instruct-2507, d'un encodeur visuel développé de zéro nommé Mage-ViT, et d'une passerelle de streaming séparée d'environ 0,5B. Sa conception est native au codec vidéo : au lieu d'échantillonner uniformément les images, il conserve les images d'ancrage (I) en entier et ne retient que les zones à fort mouvement des images prédites (P), ce qui, selon Microsoft, réduit la consommation de jetons visuels de plus de 75 % et offre un gain de vitesse d'inférence en temps réel allant jusqu'à 3,5× par rapport à l'échantillonnage uniforme. Une conception à deux processus — la passerelle cognitive System 1 surveille chaque fenêtre de codec glissante, le VLM System 2 ne s'active que lorsqu'un événement mérite une réponse — en fait un observateur vidéo toujours actif qui est peu coûteux précisément parce qu'il est la plupart du temps silencieux.
UI-Venus-2-9B, publié par inclusionAI (le laboratoire Ant Group de la Venus Team), est un agent GUI généraliste de 9B initialisé à partir de Qwen3.5-9B. Il observe une interface, raisonne sur l'état de la tâche, exécute une action et intègre un retour — une boucle fermée observer–raisonner–agir–retour — et sa fiche modèle prétend couvrir l'entraînement sur les applications mobiles, les plateformes web et les systèmes d'exploitation de bureau en un seul checkpoint. Sur sa propre fiche modèle, il rapporte AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 et ScreenSpot-Pro 73.0, tous des chiffres fournis par le fournisseur et aucun reproduit de manière indépendante.
L'écart d'entrée : les pixels que vous capturez vs un flux que vous conservez
La différence la plus instructive réside dans ce que chaque modèle consomme. UI-Venus-2-9B est un agent de capture d'écran : son entrée est l'écran actuel, une image à la fois, et sa fenêtre de contexte de 256K tokens lui permet de conserver un historique de ces images tout au long d'une tâche longue. Mage-VL est un agent de flux : son entrée est une vidéo compressée, et son efficacité vient de ce qu'il traite le mouvement entre les images comme des données — vecteurs de mouvement et énergie résiduelle pour les codecs traditionnels, cartes de débit apprises pour les codecs neuronaux. C'est la différence entre un modèle qui voit des instants et un modèle qui voit une chronologie continue. Un agent de capture d'écran est structurellement aveugle aux 100 millisecondes qui séparent les captures — le spinner, la transition de chargement, l'état de survol qui n'existe à l'écran que brièvement. Un observateur de flux vit dans cet intervalle. Ce n'est pas un défaut de l'une ou l'autre conception ; c'est la raison pour laquelle un agent GUI qui doit agir sur un écran en direct et un modèle de perception qui doit résumer un flux sont des produits différents, avec des contrats d'entrée différents.

Le décalage entre les actes et les commentaires
C'est du côté de la sortie que les deux cessent d'être comparables. La sortie de UI-Venus-2-9B est une action structurée dans un espace d'actions défini — souris, clavier, défilement, navigation — qu'elle émet après des jetons de raisonnement de style Qwen3, et son entraînement est construit autour de tâches de grounding et de CAPTCHA qui récompensent une localisation précise des éléments sous un encombrement visuel. La sortie de Mage-VL est du texte : un commentaire déclenché par des événements sur ce qu'elle voit. Elle n'a ni espace d'actions, ni appel de fonction, ni boucle d'agent. Lisez les deux fiches modèles côte à côte et vous regardez les côtés opposés de la ligne perception–action — Mage-VL se termine par une description, UI-Venus-2-9B se termine par un clic.
• Tâche — UI-Venus-2-9B : agent GUI, opère l'interface. Microsoft Mage-VL : perception en streaming, décrit l'interface.
• Entrée — UI-Venus-2-9B : captures d’écran statiques, historique de 256K jetons. Microsoft Mage-VL : flux de codecs vidéo compressés, sparsité des jetons basée sur le mouvement.
• Sortie — UI-Venus-2-9B : actions structurées de souris/clavier/navigation. Microsoft Mage-VL : commentaire textuel déclenché par événements.
• Taille — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B porte de streaming.
• Backbone — UI-Venus-2-9B : Qwen3.5-9B. Microsoft Mage-VL : Qwen3-4B-Instruct-2507 plus un Mage-ViT créé de toutes pièces.
• Licence — toutes deux sous Apache-2.0 (la fiche de Mage-VL précise dans son dépôt que l'utilisation est réservée à la recherche).
L'écart de service
Ici, le modèle plus récent et plus grand est le plus facile à exécuter. UI-Venus-2-9B documente une seule commande vLLM avec une fenêtre de contexte de 256K et une API standard compatible OpenAI. Mage-VL nécessite trust_remote_code pour exécuter le Python personnalisé de Microsoft, ainsi que FFmpeg, un chemin de neural-codec pour la vidéo, et des dépendances comme mamba-ssm, et il n'a pas encore de pile de service vLLM ou SGLang — pas d'attention paginée, pas de chemin de service en production. Microsoft rapporte environ 10,6 Go de paramètres BF16 au total, ce qui signifie qu'un GPU de 16 Go est un minimum réaliste pour le travail sur image et de 24 Go et plus pour la vidéo longue. Pour une équipe qui veut mettre quelque chose en production aujourd'hui, UI-Venus-2-9B offre une rampe d'accès plus propre ; pour une équipe qui construit un pipeline de surveillance ou de synthèse toujours actif, la pile de service de Mage-VL est ce à quoi vous vous engagez de toute façon, Python personnalisé et tout.
Un tableau d'affichage qui n'existe pas.
Il n'existe aucun benchmark commun entre ces deux modèles, et en inventer un serait malhonnête. {{1}}Les scores d'UI-Venus-2-9B figurent sur les classements d'ancrage d'interfaces graphiques, de mobile, de web et d'utilisation d'ordinateur (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, tous rapportés par le fournisseur).{{/1}} {{2}}Les scores de Mage-VL figurent sur les classements de compréhension vidéo et spatiale (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 par rapport à Qwen3-VL-4B, tous rapportés par le fournisseur).{{/2}} La bonne façon de lire cette confrontation est d'y voir un embranchement : si la tâche consiste à « comprendre ce qui se passe à l'écran au fil du temps », Mage-VL est l'outil pertinent et UI-Venus-2-9B n'est pas conçu pour cela ; si la tâche consiste à « faire faire quelque chose à cet écran », l'inverse est vrai.
Où les deux composent
La version intéressante de cette comparaison n'est pas une question d'alternative. Un agent d'interface graphique opérant une application en direct possède un véritable angle mort — le temps entre les captures d'écran, et tout changement d'état qui ne s'immobilise jamais dans une image statique — et un observateur de flux natif du codec est précisément le type de modèle qui pourrait agir comme couche de perception dans cet intervalle, détectant qu'une page a fini de charger ou qu'une modale a terminé son animation avant la prochaine passe d'ancrage de l'agent. Microsoft n'a pas construit Mage-VL pour cette tâche, et Ant Group n'a pas construit UI-Venus-2-9B pour être piloté par un second modèle, mais la compatibilité est réelle. Pour les éléments d'une telle pile qui sont déjà prêts pour la production — le LLM planificateur qui décompose une tâche, le modèle de vision qui vérifie l'état d'un écran, le modèle de transcription qui journalise la session d'un agent — une API avec tarification en transparence et basculement automatique est ce qui rend l'expérience peu coûteuse, et c'est à cela qu'un routeur sert. Ni UI-Venus-2-9B ni Microsoft Mage-VL ne sont servis via OrcaRouter aujourd'hui ; ce sont tous deux des projets open-weights auto-hébergés, et ils apparaîtraient tous deux au prix catalogue du fournisseur s'ils atteignaient un jour un fournisseur routé.


Qui devrait choisir quoi
Choisissez Microsoft Mage-VL lorsque votre problème est la perception continue — un flux de caméra, un enregistrement d'écran, un streaming que vous devez résumer ou surveiller en temps réel, à un coût suffisamment faible pour le maintenir en fonctionnement. Choisissez UI-Venus-2-9B lorsque votre problème est le contrôle — une tâche qui se termine par une action accomplie, un formulaire rempli, un parcours de navigation, une application opérée. Et si votre automatisation a véritablement besoin des deux — percevoir le flux, puis agir sur l'image fixe — exécutez-les en binôme et considérez le surveillant de flux comme le détecteur d'événements qui fournit à un agent de capture d'écran les moments sur lesquels il vaut la peine d'agir. Ce sont deux moitiés du même écran, pas des concurrents pour la même tâche.
