Een hero-titelkaart voor 'UI-Venus-2-9B vs Microsoft Mage-VL' met de ondertitel 'De screenshot-agent versus de codec-stream-watcher', met een blauwe badge '9B · SCREENSHOT-AGENT' met een 'handelt'-pil en een cyaan badge '4B · STREAM-WATCHER' met een 'beschrijft'-pil, en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

UI-Venus-2-9B vs Microsoft Mage-VL: De screenshot-agent versus de codec-stream-watcher

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

UI-Venus-2-9B en Microsoft Mage-VL werden beide stilletjes uitgebracht binnen een maand van elkaar — de repo van Mage-VL verscheen op 26 juli 2026, UI-Venus-2-9B op 26 augustus 2026 — beide hebben Apache-2.0 open gewichten en beide bouwen voort op backbones uit de Qwen-familie. Dat is ongeveer waar de overeenkomsten ophouden, en het verschil is geen kwestie van gradatie maar van aan welke kant van het scherm elk model leeft. Microsoft Mage-VL is een codec-native streaming perceptiemodel: het kijkt naar gecomprimeerde video, blijft stil bij routinematige beelden, en zendt tekst uit wanneer een gebeurtenis is voltooid. UI-Venus-2-9B is een GUI-agent: het verwerkt een stilstaande screenshot, redeneert over de toestand, en zendt een gestructureerde actie uit. De ene kijkt naar het scherm en beschrijft het; de andere kijkt naar het scherm en bedient het. Kiezen tussen hen is geen benchmarkbeslissing, omdat ze geen enkele benchmark gemeen hebben — het is een beslissing over of je automatisering eindigt in een antwoord of in een actie.

Wat elk model daadwerkelijk is

Microsoft Mage-VL, uitgebracht in de microsoft/Mage-VL-repo zonder enige aankondiging, is een multimodaal model van ongeveer 4 miljard parameters, opgebouwd uit een Qwen3-4B-Instruct-2507-taaldecodeur, een vanaf nul ontwikkelde visuele encoder genaamd Mage-ViT, en een aparte streaming gate van ~0,5 miljard parameters. Het ontwerp is video-codec-native: in plaats van frames uniform te sampler, houdt het ankerframes (I) volledig en behoudt het alleen bewegingsrelevante patches van voorspelde (P) frames. Microsoft meldt dat dit het visuele tokenverbruik met meer dan 75% vermindert en tot 3,5× snellere wall-clock-inferentie oplevert vergeleken met uniforme sampling. Een ontwerp met twee processen — een System 1-cognitiegate die elk rollend codecvenster bewaakt, en een System 2-VLM die alleen inschakelt wanneer een gebeurtenis een reactie waard is — maakt er een altijd-aan-videobewaker van die juist goedkoop is omdat hij grotendeels stil is.

UI-Venus-2-9B, uitgebracht door inclusionAI (het Ant Group-lab van het Venus Team), is een 9B GUI-agent voor algemeen gebruik, geïnitialiseerd vanuit Qwen3.5-9B. Het observeert een interface, redeneert over de taakstatus, voert een actie uit en verwerkt feedback — een gesloten observeer–redeneer–handel–feedback-lus — en de kaart claimt trainingsdekking over mobiele apps, webplatforms en desktop-besturingssystemen in één checkpoint. Op de eigen modelkaart worden AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 en ScreenSpot-Pro 73.0 gerapporteerd, allemaal door de leverancier gerapporteerd en geen daarvan onafhankelijk gereproduceerd.

De invoerkloof: pixels die je pakt versus een stream die je bewaart

Het meest verhelderende verschil is wat elk model eet. UI-Venus-2-9B is een screenshot-agent: de input is het huidige scherm, één frame tegelijk, en het contextvenster van 256K-tokens is hoe het een geschiedenis van die frames bijhoudt gedurende een lange taak. Mage-VL is een stream-agent: de input is gecomprimeerde video, en de efficiëntie komt voort uit het behandelen van de beweging tussen frames als data — bewegingsvectoren en residu-energie voor traditionele codecs, geleerde rate maps voor neurale codecs. Dit is het verschil tussen een model dat momenten ziet en een model dat een continue tijdlijn ziet. Een screenshot-agent is structureel blind voor de 100 milliseconden tussen opnames — de spinner, de laadovergang, de hoverstatus die maar kort op het scherm bestaat. Een stream-kijker leeft in dat gat. Dat is in geen van beide ontwerpen een tekortkoming; het is de reden waarom een GUI-agent die op een live-scherm moet handelen en een perceptiemodel dat een feed moet samenvatten verschillende producten zijn met verschillende inputcontracten.

A generated two-column scoreboard for 'UI-Venus-2-9B vs Microsoft Mage-VL': left column UI-Venus-2-9B — Job GUI agent acts on screens, Input still screenshots, Output structured actions, Size 9B, Serving vLLM OpenAI-compatible, Context 256K; right column Microsoft Mage-VL — Job stream watcher describes screens, Input compressed video codec streams, Output event-gated text, Size ~4B + 0.5B gate, Serving trust_remote_code custom, Context rolling codec window; footer 'Both vendor-reported; no shared benchmark.'

De outputkloof: daden versus commentaar

Aan de outputkant zijn de twee niet meer vergelijkbaar. De output van UI-Venus-2-9B is een gestructureerde actie in een gedefinieerde actieruimte — muis, toetsenbord, scrollen, navigatie — die het produceert na redeneringstokens in Qwen3-stijl, en de training is gebouwd rond grounding- en CAPTCHA-taken die nauwkeurige elementlokalisatie onder visuele rommel belonen. De output van Mage-VL is tekst: gebeurtenisgestuurd commentaar over wat het ziet. Het heeft geen actieruimte, geen functieaanroep en geen agentloop. Lees de twee modelkaarten naast elkaar en je kijkt naar tegenovergestelde kanten van de perceptie-actielijn — Mage-VL eindigt in een beschrijving, UI-Venus-2-9B eindigt in een klik.

Taak — UI-Venus-2-9B: GUI-agent, bedient de interface. Microsoft Mage-VL: streaming perceptie, beschrijft de interface.

Invoer — UI-Venus-2-9B: stilstaande screenshots, 256K-token-geschiedenis. Microsoft Mage-VL: gecomprimeerde videocodec-streams, sparsiteit van bewegingssaliente tokens.

Output — UI-Venus-2-9B: gestructureerde muis-/toetsenbord-/navigatieacties. Microsoft Mage-VL: gebeurtenisgestuurd tekstcommentaar.

Grootte — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B streaming gate.

Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 plus Mage-ViT vanaf nul.

Licentie — beide Apache-2.0 (de kaartnotities van Mage-VL: alleen voor onderzoeksdoeleinden in de repo).

De serveerkloof

Hier is het nieuwere, grotere model het eenvoudigst om te draaien. UI-Venus-2-9B documenteert een enkel vLLM-commando met een contextvenster van 256K en een standaard OpenAI-compatibele API. Mage-VL vereist trust_remote_code om Microsofts aangepaste Python uit te voeren, plus FFmpeg, een neural-codec pad voor video, en afhankelijkheden zoals mamba-ssm, en het heeft nog geen vLLM- of SGLang-servingstack — geen paged attention, geen productie-servingpad. Microsoft rapporteert in totaal ongeveer 10,6 GB aan BF16-parameters, wat betekent dat een 16 GB GPU een realistische ondergrens is voor beeldwerk en 24 GB+ voor lange video. Voor een team dat vandaag iets in productie wil nemen, heeft UI-Venus-2-9B de schonere opstap; voor een team dat een altijd-aan monitoring- of samenvattingspijplijn bouwt, is de servingstack van Mage-VL waar je sowieso voor tekent, met aangepaste Python en al.

Een scorebord dat niet bestaat

Er bestaat geen gedeelde benchmark tussen deze twee modellen, en er één verzinnen zou oneerlijk zijn. De cijfers van UI-Venus-2-9B leven op de boards voor GUI-grounding, mobiel, web en computergebruik (ScreenSpot-Pro 73,0, AndroidWorld 80,2, WebVoyager 90,8, OSWorld-Verified 70,8, allemaal door de leverancier gerapporteerd). De cijfers van Mage-VL leven op de boards voor video-begrip en ruimtelijke taken (Video-MME 64,0, NExT-QA 83,1, OVO-Bench 64,0, VSI-Bench +11,0 ten opzichte van Qwen3-VL-4B, allemaal door de leverancier gerapporteerd). De juiste manier om deze confrontatie te lezen is als een splitsing in de weg: als de taak is "begrijpen wat er op dit scherm gebeurt in de loop van de tijd", dan is Mage-VL het relevante hulpmiddel en is UI-Venus-2-9B er niet voor gebouwd; als de taak is "dit scherm iets laten doen", dan geldt het omgekeerde.

Waar de twee componeren

De interessante versie van deze vergelijking is geen of-of-kwestie. Een GUI-agent die een live applicatie bedient, heeft een echte blinde vlek — de tijd tussen screenshots, en elke statuswijziging die nooit in een statisch frame tot rust komt — en een codec-native stream-watcher is precies het soort model dat als perceptielaag in dat hiaat zou kunnen fungeren, door te detecteren dat een pagina klaar is met laden of dat een modal klaar is met animeren vóór de volgende grounding-pass van de agent. Microsoft bouwde Mage-VL niet voor die taak, en Ant Group bouwde UI-Venus-2-9B niet om door een tweede model te worden aangestuurd, maar de fit is er echt. Voor de onderdelen van zo'n stack die al productierijp zijn — de planner-LLM die een taak opsplitst, het visiemodel dat een schermstatus verifieert, het transcriptiemodel dat de sessie van een agent logt — is één API met pass-through-prijzen en automatische failover wat het experiment goedkoop maakt, en daar is een router voor. Noch UI-Venus-2-9B, noch Microsoft Mage-VL wordt vandaag via OrcaRouter aangeboden; beide zijn zelf-gehoste open-weights-projecten, en beide zouden tegen de lijstprijs van de provider verschijnen als ze ooit bij een gerouteerde provider terechtkwamen.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured August 27 2026) showing the model header with one like, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, multimodal, gui, and the opening of the UI-Venus-2 model card.A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026) showing the model header, the tags image-text-to-text, Transformers, Safetensors, mage_vl, multimodal, vision-language-model, and the opening of the Mage-VL model card.

Wie moet welke kiezen

Kies Microsoft Mage-VL wanneer jouw probleem continue perceptie is — een camerafeed, een schermopname, een stream die je in realtime samengevat of gemonitord wilt hebben, goedkoop genoeg om te blijven draaien. Kies UI-Venus-2-9B wanneer jouw probleem controle is — een taak die uitmondt in een voltooide actie, een ingevuld formulier, een doorlopen flow, een bediende applicatie. En als jouw automatisering echt beide nodig heeft — de stream waarnemen en vervolgens actie ondernemen op het stilstaande beeld — zet ze dan samen in en behandel de stream-watcher als de gebeurtenisdetector die een screenshot-agent de momenten aanreikt die het waard zijn om actie te ondernemen. Ze zijn twee helften van hetzelfde scherm, geen concurrenten voor dezelfde klus.