
UI-Venus-2-9B mot Microsoft Mage-VL: Skärmdumpsagenten mot Codec-streambevakaren
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
UI-Venus-2-9B och Microsoft Mage-VL släpptes båda i tysthet inom en månad från varandra — Mage-VL:s repo dök upp den 26 juli 2026, UI-Venus-2-9B den 26 augusti 2026 — båda har Apache-2.0 öppna vikter, och båda bygger på Qwen-familjens ryggrad. Det är ungefär där likheterna slutar, och skillnaden handlar inte om grad utan om vilken sida av skärmen varje modell lever på. Microsoft Mage-VL är en codec-nativ strömmande perceptionsmodell: den tittar på komprimerad video, håller sig tyst genom rutinmässigt material, och sänder text när en händelse är slutförd. UI-Venus-2-9B är en GUI-agent: den tar emot en stillbild, resonerar kring tillståndet, och sänder en strukturerad åtgärd. Den ena tittar på skärmen och beskriver den; den andra tittar på skärmen och manövrerar den. Att välja mellan dem är inte ett riktmärkesbeslut, eftersom de inte delar ett enda riktmärke — det är ett beslut om huruvida din automatisering slutar i ett svar eller i en åtgärd.
Vad varje modell faktiskt är
Microsoft Mage-VL, släppt under microsoft/Mage-VL-repot utan något tillkännagivande, är en multimodal modell med cirka 4 miljarder parametrar, byggd från en Qwen3-4B-Instruct-2507-språkavkodare, en från grunden utvecklad visuell kodare kallad Mage-ViT och en separat streaming-gate på ~0,5B. Designen är videocodec-nativ: i stället för att sampla bildrutor enhetligt behåller den ankarbilder (I-bilder) i sin helhet och endast rörelsemässigt framträdande patchar av predikterade bildrutor (P-bilder), vilket enligt Microsoft minskar förbrukningen av visuella token med över 75 % och ger upp till 3,5× snabbare inferens i verklig tid jämfört med enhetlig sampling. En tvåprocessdesign – en System 1-kognitionsgate som övervakar varje rullande codecfönster och en System 2-VLM som kopplas in endast när en händelse är värd att reagera på – gör den till en ständigt påslagen videoövervakare som är billig just för att den för det mesta är tyst.
UI-Venus-2-9B, utgiven av inclusionAI (Venus Teams Ant Group-labb), är en 9B allmän GUI-agent initierad från Qwen3.5-9B. Den observerar ett gränssnitt, resonerar kring uppgiftstillståndet, utför en åtgärd och integrerar feedback — en sluten observera–resonera–agera–feedback-loop — och dess modellkort uppger att träningen täcker mobilappar, webbplattformar och stationära operativsystem i en enda checkpoint. På sitt eget modellkort rapporterar den AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 och ScreenSpot-Pro 73.0, alla leverantörsrapporterade och ingen oberoende reproducerad.
Insatsgapet: pixlar du fångar vs en ström du behåller
Den mest instruktiva skillnaden är vad varje modell äter. UI-Venus-2-9B är en skärmbildsagent: dess indata är den aktuella skärmen, en bildruta i taget, och dess 256K-token-kontextfönster är hur den håller en historik över dessa bildrutor under en lång uppgift. Mage-VL är en strömagent: dess indata är komprimerad video, och dess effektivitet kommer från att behandla rörelsen mellan bildrutor som data — rörelsevektorer och residualenergi för traditionella codecs, inlärda rate maps för neurala sådana. Detta är skillnaden mellan en modell som ser ögonblick och en modell som ser en kontinuerlig tidslinje. En skärmbildsagent är strukturellt blind för de 100 millisekunderna mellan bildfångster — spinnern, laddningsövergången, hover-tillståndet som bara finns på skärmen en kort stund. En strömbetraktare lever i det gapet. Det är inte en brist i någon av designerna; det är därför en GUI-agent som behöver agera på en live-skärm och en perceptionsmodell som behöver sammanfatta ett flöde är olika produkter med olika indatakontrakt.

Produktionsgapet: handlingar kontra kommentarer
På utdatasidan slutar de två att vara jämförbara. UI-Venus-2-9B:s utdata är en strukturerad åtgärd i ett definierat åtgärdsutrymme — mus, tangentbord, rullning, navigering — som den avger efter Qwen3-liknande resonemangstoken, och dess träning är uppbyggd kring groundning- och CAPTCHA-uppgifter som belönar precis elementlokalisering under visuellt brus. Mage-VL:s utdata är text: händelsestyrda kommentarer om vad den ser. Den har inget åtgärdsutrymme, inga funktionsanrop och ingen agentloop. Läser du de två modellkorten sida vid sida ser du motsatta sidor av perceptions–aktionslinjen — Mage-VL slutar i en beskrivning, UI-Venus-2-9B slutar i ett klick.
• Jobb — UI-Venus-2-9B: GUI-agent, hanterar gränssnittet. Microsoft Mage-VL: streaming-perception, beskriver gränssnittet.
• Indata — UI-Venus-2-9B: stillbilder, 256K-tokens historik. Microsoft Mage-VL: komprimerade videocodec-strömmar, rörelsebaserad token-sparsitet.
• Utdata — UI-Venus-2-9B: strukturerade mus-/tangentbords-/navigeringsåtgärder. Microsoft Mage-VL: händelsestyrd textkommentar.
• Storlek — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B streaming-gate.
• Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 plus Mage-ViT från grunden.
• Licens — båda Apache-2.0 (Mage-VL:s kortnoteringar endast för forskningsändamål i dess repo).
Serveringsgapet
Här är den nyare, större modellen den som är lättast att köra. UI-Venus-2-9B dokumenterar ett enda vLLM-kommando med ett 256K-kontextfönster och ett standard OpenAI-kompatibelt API. Mage-VL kräver trust_remote_code för att exekvera Microsofts anpassade Python, plus FFmpeg, en neural-kodekväg för video, och beroenden som mamba-ssm, och den har ännu ingen vLLM- eller SGLang-serverstack — ingen paginerad attention, ingen produktionsredo serverväg. Microsoft rapporterar totalt cirka 10,6 GB BF16-parametrar, vilket innebär att ett 16 GB GPU är en realistisk lägstanivå för bildarbete och 24 GB+ för lång video. För ett team som vill få något i produktion idag har UI-Venus-2-9B den renare inkörsporten; för ett team som bygger en ständigt pågående övervaknings- eller sammanfattningspipeline är Mage-VL:s serverstack det du skriver upp dig på i vilket fall, med anpassad Python och allt.
En resultattavla som inte finns
Det finns inget gemensamt riktmärke mellan dessa två modeller, och att hitta på ett skulle vara ohederligt. UI-Venus-2-9B:s siffror lever på GUI-grounding-, mobil-, webb- och datoranvändningslistor (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, alla leverantörsrapporterade). Mage-VL:s siffror lever på video- och rumsförståelselistor (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 över Qwen3-VL-4B, alla leverantörsrapporterade). Det korrekta sättet att läsa matchen är som en vägskäl: om uppgiften är "förstå vad som händer på den här skärmen över tid," är Mage-VL det relevanta verktyget och UI-Venus-2-9B är inte byggd för det; om uppgiften är "få den här skärmen att göra något," är det omvända sant.
Där de två komponerar.
Den intressanta versionen av denna jämförelse är inte antingen/eller. En GUI-agent som opererar en liveapplikation har en genuin blind fläck — tiden mellan skärmbilder och alla tillståndsändringar som aldrig stabiliseras i en statisk bildruta — och en codec-nativ strömbevakare är precis den typ av modell som skulle kunna fungera som ett perceptionslager i den luckan, och upptäcka att en sida har laddats klart eller att en modal har avslutat sin animering innan agentens nästa groundingpass. Microsoft byggde inte Mage-VL för den uppgiften, och Ant Group byggde inte UI-Venus-2-9B för att styras av en andra modell, men passformen är verklig. För de delar av en sådan stack som redan är produktionsmogna — planner-LLM:en som delar upp en uppgift, visionsmodellen som verifierar ett skärmtillstånd, transkriptionsmodellen som loggar en agents session — är ett API med pass-through-prissättning och automatisk failover det som gör experimentet billigt, och det är vad en router är till för. Varken UI-Venus-2-9B eller Microsoft Mage-VL levereras idag via OrcaRouter; båda är open-weights-projekt för självhostning, och båda skulle visas till leverantörens listpris om de någonsin skulle nå en routeransluten leverantör.


Vem ska välja vilken
Välj Microsoft Mage-VL när ditt problem är kontinuerlig perception — en kameraström, en skärminspelning, en ström du behöver sammanfatta eller övervaka i realtid, billigt nog att hålla igång. Välj UI-Venus-2-9B när ditt problem är kontroll — en uppgift som slutar i en slutförd åtgärd, ett ifyllt formulär, ett navigerat flöde, en manövrerad applikation. Och om din automatisering verkligen behöver båda — uppfatta strömmen, agera sedan på stillbilden — kör dem som ett par och behandla strömbevakaren som händelsedetektorn som matar en skärmbildsagent med de ögonblick som är värda att agera på. De är två halvor av samma skärm, inte konkurrenter för samma jobb.
