
UI-Venus-2-9B gegen Microsoft Mage-VL: Der Screenshot-Agent gegen den Codec-Stream-Überwacher
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
UI-Venus-2-9B und Microsoft Mage-VL wurden beide im Abstand von nur einem Monat still und leise veröffentlicht – Mage-VLs Repository erschien am 26. Juli 2026, UI-Venus-2-9B am 26. August 2026 – beide sind Open-Weight-Modelle unter Apache-2.0-Lizenz, und beide basieren auf Backbones der Qwen-Familie. Damit enden die Gemeinsamkeiten jedoch weitgehend, und der Unterschied ist keine Frage des Ausmaßes, sondern auf welcher Seite des Bildschirms jedes Modell zu Hause ist. Microsoft Mage-VL ist ein codec-natives Streaming-Wahrnehmungsmodell: Es betrachtet komprimierte Videos, bleibt bei Routineaufnahmen still und gibt Text aus, wenn ein Ereignis abgeschlossen ist. UI-Venus-2-9B ist ein GUI-Agent: Es verarbeitet einen Standbild-Screenshot, analysiert den Zustand und gibt eine strukturierte Aktion aus. Das eine beobachtet den Bildschirm und beschreibt ihn; das andere beobachtet den Bildschirm und bedient ihn. Die Wahl zwischen ihnen ist keine Benchmark-Entscheidung, denn sie teilen sich keine einzige Benchmark – es ist eine Entscheidung darüber, ob Ihre Automatisierung in einer Antwort oder in einer Aktion endet.
Was jedes Modell tatsächlich ist
Microsoft Mage-VL, das ohne Ankündigung unter dem Repository microsoft/Mage-VL veröffentlicht wurde, ist ein multimodales Modell mit etwa 4 Milliarden Parametern, das aus einem Qwen3-4B-Instruct-2507-Sprachdecoder, einem von Grund auf neu entwickelten visuellen Encoder namens Mage-ViT und einem separaten Streaming-Gate mit ~0,5 Milliarden Parametern aufgebaut ist. Sein Design ist video-codec-nativ: Statt Frames gleichmäßig zu sampeln, behält es Anker-(I)-Frames vollständig und bewahrt nur bewegungssaliente Patches von prädizierten (P)-Frames. Microsoft berichtet, dass dies den Verbrauch visueller Tokens um über 75 % senkt und gegenüber gleichmäßigem Sampling eine bis zu 3,5-fache Wanduhr-Beschleunigung der Inferenz erzielt. Ein Zwei-Prozess-Design – ein System-1-Kognitionsgate beobachtet jedes rollierende Codec-Fenster, das System-2-VLM wird nur aktiv, wenn ein Ereignis eine Reaktion wert ist – macht es zu einem ständig aktiven Videobeobachter, der gerade deshalb kostengünstig ist, weil er meistens schweigt.
UI-Venus-2-9B, veröffentlicht von inclusionAI (dem Ant-Group-Labor des Venus-Teams), ist ein 9B-Allzweck-GUI-Agent, der von Qwen3.5-9B initialisiert wurde. Er beobachtet eine Oberfläche, analysiert den Aufgabenstatus, führt eine Aktion aus und integriert Feedback – ein geschlossener Beobachten-Analysieren-Handeln-Feedback-Kreislauf – und auf seiner Karte wird Trainingsabdeckung für mobile Apps, Web-Plattformen und Desktop-Betriebssysteme in einem einzigen Checkpoint beansprucht. Auf seiner eigenen Modellkarte werden AndroidWorld 80,2, OSWorld-Verified 70,8, WebVoyager 90,8 und ScreenSpot-Pro 73,0 angegeben, alle vom Anbieter gemeldet und keines unabhängig reproduziert.
Die Eingabelücke: Pixel, die du erfasst, vs. ein Stream, den du behältst
Der lehrreichste Unterschied ist, was jedes Modell konsumiert. UI-Venus-2-9B ist ein Screenshot-Agent: Seine Eingabe ist der aktuelle Bildschirm, ein Frame nach dem anderen, und sein 256K-Token-Kontextfenster ist die Art, wie es über eine lange Aufgabe hinweg einen Verlauf dieser Frames behält. Mage-VL ist ein Stream-Agent: Seine Eingabe ist komprimiertes Video, und seine Effizienz beruht darauf, die Bewegung zwischen Frames als Daten zu behandeln – Bewegungsvektoren und Restenergie für traditionelle Codecs, gelernte Ratenkarten für neuronale. Dies ist der Unterschied zwischen einem Modell, das Momente sieht, und einem Modell, das eine kontinuierliche Zeitleiste sieht. Ein Screenshot-Agent ist strukturell blind für die 100 Millisekunden zwischen den Aufnahmen – den Spinner, den Ladeübergang, den Hover-Zustand, der nur kurz auf dem Bildschirm existiert. Ein Stream-Beobachter lebt in dieser Lücke. Das ist in keinem der beiden Designs ein Fehler; es ist der Grund, warum ein GUI-Agent, der auf einem Live-Bildschirm handeln muss, und ein Wahrnehmungsmodell, das einen Feed zusammenfassen muss, verschiedene Produkte mit unterschiedlichen Eingabeverträgen sind.

Die Output-Lücke: Handlungen vs. Kommentare
Auf der Ausgabeseite hört die Vergleichbarkeit auf. Die Ausgabe von UI-Venus-2-9B ist eine strukturierte Aktion in einem definierten Aktionsraum — Maus, Tastatur, Scrollen, Navigation — die es nach Qwen3-artigen Reasoning-Tokens ausgibt, und sein Training ist auf Grounding- und CAPTCHA-Aufgaben ausgerichtet, die präzise Elementlokalisierung unter visueller Unübersichtlichkeit belohnen. Die Ausgabe von Mage-VL ist Text: ereignisgesteuerte Kommentare darüber, was es sieht. Es hat keinen Aktionsraum, kein Function Calling und keine Agent-Schleife. Liest man die beiden Modellkarten nebeneinander, blickt man auf entgegengesetzte Seiten der Wahrnehmungs-Handlungs-Linie — Mage-VL endet in einer Beschreibung, UI-Venus-2-9B endet in einem Klick.
• Job — UI-Venus-2-9B: GUI-Agent, bedient die Benutzeroberfläche. Microsoft Mage-VL: Streaming-Wahrnehmung, beschreibt die Benutzeroberfläche.
• Eingabe — UI-Venus-2-9B: statische Screenshots, 256K-Token-Verlauf. Microsoft Mage-VL: komprimierte Video-Codec-Streams, bewegungssaliente Token-Sparsity.
• Ausgabe — UI-Venus-2-9B: strukturierte Maus-/Tastatur-/Navigationsaktionen. Microsoft Mage-VL: ereignisgesteuerter Textkommentar.
• Größe — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B Streaming-Gate.
• Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 plus von Grund auf entwickeltes Mage-ViT.
• Lizenz — beide unter Apache-2.0 (Mage-VLs Modellkartenhinweise in seinem Repo besagen: nur für Forschungszwecke).
Die Servierlücke
Hier ist das neuere, größere Modell einfacher zu betreiben. UI-Venus-2-9B dokumentiert einen einzigen vLLM-Befehl mit einem 256K-Kontextfenster und einer standardmäßigen OpenAI-kompatiblen API. Mage-VL benötigt trust_remote_code, um Microsofts benutzerdefiniertes Python auszuführen, sowie FFmpeg, einen Neural-Codec-Pfad für Video und Abhängigkeiten wie mamba-ssm. Zudem gibt es noch keinen vLLM- oder SGLang-Serving-Stack – keine Paged Attention, keinen Produktions-Serving-Pfad. Microsoft gibt insgesamt etwa 10,6 GB an BF16-Parametern an, was bedeutet, dass eine 16-GB-GPU eine realistische Untergrenze für Bildarbeit ist und 24 GB+ für lange Videos. Für ein Team, das heute etwas in Produktion bringen möchte, hat UI-Venus-2-9B den saubereren Einstieg; für ein Team, das eine Dauerüberwachungs- oder Zusammenfassungspipeline aufbaut, ist Mage-VLs Serving-Stack das, wofür man sich so oder so entscheidet – inklusive des benutzerdefinierten Pythons.
Ein Scoreboard, das nicht existiert
Zwischen diesen beiden Modellen gibt es keine gemeinsame Benchmark, und eine zu erfinden wäre unehrlich. Die Zahlen von UI-Venus-2-9B stehen auf den Leaderboards für GUI-Grounding, Mobile, Web und Computer-Use (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, alle vom Anbieter gemeldet). Die Zahlen von Mage-VL stehen auf den Leaderboards für Video-Verständnis und räumliche Wahrnehmung (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 gegenüber Qwen3-VL-4B, alle vom Anbieter gemeldet). Das Aufeinandertreffen ist am besten als Weggabelung zu verstehen: Wenn die Aufgabe darin besteht, „zu verstehen, was auf diesem Bildschirm im Laufe der Zeit geschieht", dann ist Mage-VL das passende Werkzeug und UI-Venus-2-9B ist nicht dafür gebaut; wenn die Aufgabe darin besteht, „diesen Bildschirm dazu zu bringen, etwas zu tun", gilt das Gegenteil.
Wo die beiden komponieren
Die interessante Version dieses Vergleichs ist nicht entweder/oder. Ein GUI-Agent, der eine Live-Anwendung bedient, hat einen echten blinden Fleck – die Zeit zwischen Screenshots und jede Zustandsänderung, die nie in einem statischen Frame zur Ruhe kommt – und ein codec-nativer Stream-Watcher ist genau die Art von Modell, die in dieser Lücke als Wahrnehmungsschicht fungieren könnte, indem es erkennt, dass eine Seite das Laden abgeschlossen hat oder dass ein Modal seine Animation beendet hat, bevor der nächste Grounding-Durchlauf des Agenten erfolgt. Microsoft hat Mage-VL nicht für diese Aufgabe gebaut, und Ant Group hat UI-Venus-2-9B nicht gebaut, um von einem zweiten Modell gesteuert zu werden, aber die Passung ist tatsächlich gegeben. Für die Teile eines solchen Stacks, die bereits produktionsreif sind – das Planungs-LLM, das eine Aufgabe zerlegt, das Vision-Modell, das einen Bildschirmzustand verifiziert, das Transkriptionsmodell, das die Sitzung eines Agenten protokolliert – ist eine einzige API mit Durchreich-Preisen und automatischem Failover das, was das Experiment billig macht, und genau dafür ist ein Router da. Weder UI-Venus-2-9B noch Microsoft Mage-VL werden derzeit über OrcaRouter bereitgestellt; beide sind Open-Weights-Projekte zum Selbsthosten, und beide würden zum Listenpreis des Anbieters angeboten, falls sie jemals einen gerouteten Anbieter erreichten.


Wer sollte welche auswählen?
Wählen Sie Microsoft Mage-VL, wenn Ihr Problem kontinuierliche Wahrnehmung ist – ein Kamerafeed, eine Bildschirmaufnahme, ein Stream, den Sie in Echtzeit zusammenfassen oder überwachen müssen, und das kostengünstig genug, um weiterzulaufen. Wählen Sie UI-Venus-2-9B, wenn Ihr Problem Kontrolle ist – eine Aufgabe, die in einer abgeschlossenen Aktion endet, einem ausgefüllten Formular, einem navigierten Ablauf, einer bedienten Anwendung. Und wenn Ihre Automatisierung tatsächlich beides braucht – den Stream wahrnehmen, dann auf das Standbild reagieren – führen Sie sie als Paar aus und behandeln Sie den Stream-Beobachter als Ereigniserkenner, der einem Screenshot-Agenten die Momente zuführt, die es wert sind, darauf zu reagieren. Sie sind zwei Hälften desselben Bildschirms, keine Konkurrenten für dieselbe Aufgabe.
