Karta tytułowa hero dla 'UI-Venus-2-9B vs Microsoft Mage-VL' z podtytułem 'Agent zrzutów ekranu kontra obserwator strumienia kodeka', pokazująca niebieską odznakę '9B · AGENT ZRZUTÓW EKRANU' z pigułką 'działa' oraz cyjanową odznakę '4B · OBSERWATOR STRUMIENIA' z pigułką 'opisuje', a w prawym dolnym rogu logo OrcaRouter.
Guides & Insights

UI-Venus-2-9B kontra Microsoft Mage-VL: Agent zrzutów ekranu kontra obserwator strumienia kodeków

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

UI-Venus-2-9B i Microsoft Mage-VL ukazały się po cichu w odstępie miesiąca od siebie — repozytorium Mage-VL pojawiło się 26 lipca 2026 roku, a UI-Venus-2-9B 26 sierpnia 2026 roku — oba mają otwarte wagi na licencji Apache-2.0 i oba bazują na backbone'ach z rodziny Qwen. To mniej więcej w tym miejscu kończą się podobieństwa, a różnica nie jest kwestią stopnia, lecz tego, po której stronie ekranu żyje każdy z modeli. Microsoft Mage-VL to natywny dla kodeka strumieniowy model percepcji: ogląda skompresowane wideo, milczy podczas rutynowego materiału i emituje tekst, gdy zdarzenie się zakończy. UI-Venus-2-9B to agent GUI: przyjmuje statyczny zrzut ekranu, rozumuje o stanie i emituje ustrukturyzowaną akcję. Jeden patrzy na ekran i go opisuje; drugi patrzy na ekran i nim steruje. Wybór między nimi nie jest decyzją benchmarkową, ponieważ nie mają żadnego wspólnego benchmarku — to decyzja o tym, czy Twoja automatyzacja kończy się odpowiedzią, czy akcją.

Czym tak naprawdę jest każdy model

Microsoft Mage-VL, opublikowany w repozytorium microsoft/Mage-VL bez żadnego ogłoszenia, to multimodalny model o około 4B parametrów, zbudowany z dekodera językowego Qwen3-4B-Instruct-2507, stworzonego od zera enkodera wizualnego o nazwie Mage-ViT oraz osobnej bramki strumieniowej o ~0,5B parametrów. Jego konstrukcja jest natywna dla kodeków wideo: zamiast równomiernie próbkować klatki, zachowuje w całości klatki odniesienia (I), a z klatek przewidywanych (P) zatrzymuje tylko fragmenty istotne pod względem ruchu. Microsoft podaje, że zmniejsza to zużycie tokenów wizualnych o ponad 75% i skraca czas zegarowy wnioskowania nawet 3,5-krotnie w porównaniu z równomiernym próbkowaniem. Dwuetapowa konstrukcja — bramka poznawcza Systemu 1 monitoruje każde przesuwające się okno kodeka, a System 2 (VLM) uruchamia się tylko wtedy, gdy zdarzenie jest warte reakcji — sprawia, że jest to stale aktywny obserwator wideo, który jest tani właśnie dlatego, że przeważnie milczy.

UI-Venus-2-9B, wydany przez inclusionAI (laboratorium Ant Group należące do zespołu Venus), to 9-miliardowy uniwersalny agent GUI zainicjalizowany na bazie Qwen3.5-9B. Obserwuje interfejs, rozumuje o stanie zadania, wykonuje akcję i przetwarza informację zwrotną — zamkniętą pętlę obserwacja–rozumowanie–działanie–reakcja — a jego karta deklaruje pokrycie szkoleniowe aplikacji mobilnych, platform webowych i systemów operacyjnych dla komputerów stacjonarnych w jednym punkcie kontrolnym. Na własnej karcie modelu raportuje AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 i ScreenSpot-Pro 73.0 — wszystko raportowane przez producenta, bez niezależnej reprodukcji.

Luka wejściowa: przechwytywane piksele a utrzymywany strumień

Najbardziej pouczająca różnica to to, co każdy model „je". UI-Venus-2-9B to agent zrzutów ekranu: jego wejściem jest bieżący ekran, jedna klatka na raz, a okno kontekstowe o wielkości 256 tys. tokenów pozwala mu przechowywać historię tych klatek podczas długiego zadania. Mage-VL to agent strumieniowy: jego wejściem jest skompresowane wideo, a jego wydajność wynika z traktowania ruchu między klatkami jako danych — wektorów ruchu i energii resztkowej dla tradycyjnych kodeków oraz wyuczonych map przepływności dla kodeków neuronowych. To jest różnica między modelem, który widzi chwile, a modelem, który widzi ciągłą oś czasu. Agent zrzutów ekranu jest strukturalnie ślepy na 100 milisekund między przechwyceniami — na wskaźnik ładowania, przejście ładowania, stan najechania, który istnieje na ekranie tylko przez chwilę. Obserwator strumienia żyje w tej luce. To nie jest wada żadnego z tych rozwiązań; to dlatego agent GUI, który musi działać na żywym ekranie, i model percepcji, który ma podsumowywać strumień, to różne produkty o różnych kontraktach wejściowych.

A generated two-column scoreboard for 'UI-Venus-2-9B vs Microsoft Mage-VL': left column UI-Venus-2-9B — Job GUI agent acts on screens, Input still screenshots, Output structured actions, Size 9B, Serving vLLM OpenAI-compatible, Context 256K; right column Microsoft Mage-VL — Job stream watcher describes screens, Input compressed video codec streams, Output event-gated text, Size ~4B + 0.5B gate, Serving trust_remote_code custom, Context rolling codec window; footer 'Both vendor-reported; no shared benchmark.'

Luka produkcyjna: działania a komentarze

{{1}}Po stronie wyjścia te dwa modele przestają być porównywalne.{{/1}} {{2}}Wyjście UI-Venus-2-9B to ustrukturyzowana akcja w zdefiniowanej przestrzeni działań – mysz, klawiatura, przewijanie, nawigacja – którą generuje po tokenach rozumowania w stylu Qwen3, a jego trening opiera się na zadaniach groundingowych i CAPTCHA, które nagradzają precyzyjną lokalizację elementów w wizualnym bałaganie.{{/2}} {{3}}Wyjście Mage-VL to tekst: sterowany zdarzeniami komentarz na temat tego, co widzi.{{/3}} {{4}}Nie ma przestrzeni działań, wywoływania funkcji ani pętli agentowej.{{/4}} {{5}}Czytając obie karty modeli obok siebie, patrzysz na przeciwne strony linii percepcja–działanie – Mage-VL kończy się opisem, a UI-Venus-2-9B kliknięciem.{{/5}}

Zadanie — UI-Venus-2-9B: agent GUI, obsługuje interfejs. Microsoft Mage-VL: percepcja strumieniowa, opisuje interfejs.

Wejście — UI-Venus-2-9B: statyczne zrzuty ekranu, historia 256K tokenów. Microsoft Mage-VL: skompresowane strumienie kodeka wideo, rzadkość tokenów istotnych dla ruchu.

Wyjście — UI-Venus-2-9B: ustrukturyzowane akcje myszy/klawiatury/nawigacji. Microsoft Mage-VL: komentarz tekstowy sterowany zdarzeniami.

Rozmiar — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B streaming gate.

Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 oraz Mage-ViT tworzony od zera.

Licencja — obie Apache-2.0 (notatki na karcie Mage-VL: tylko do celów badawczych w jego repozytorium).

Luka w serwowaniu

Tutaj nowszy, większy model jest łatwiejszy do uruchomienia. UI-Venus-2-9B dokumentuje pojedyncze polecenie vLLM z oknem kontekstowym 256K i standardowym API zgodnym z OpenAI. Mage-VL wymaga trust_remote_code do wykonania niestandardowego kodu Pythona Microsoftu, plus FFmpeg, ścieżkę neural-codec dla wideo, oraz zależności takie jak mamba-ssm, a nie ma jeszcze stosu serwującego vLLM ani SGLang — bez paged attention, bez produkcyjnej ścieżki serwowania. Microsoft raportuje około 10,6 GB parametrów BF16 łącznie, co oznacza, że 16 GB GPU to realistyczne minimum do pracy z obrazami, a 24 GB+ do długiego wideo. Dla zespołu, który chce wdrożyć coś do produkcji już dziś, UI-Venus-2-9B ma prostszą ścieżkę wejścia; dla zespołu budującego stale działający pipeline monitorowania lub streszczeń, stos serwujący Mage-VL to coś, na co się decydujesz tak czy inaczej, z całym tym niestandardowym kodem Pythona.

Tablica wyników, która nie istnieje.

Nie ma wspólnego benchmarku dla tych dwóch modeli, a wymyślanie takiego byłoby nieuczciwe. Wyniki UI-Venus-2-9B dotyczą list rankingowych GUI-grounding, urządzeń mobilnych, webu i obsługi komputera (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8 – wszystkie raportowane przez producenta). Wyniki Mage-VL dotyczą list rankingowych rozumienia wideo i zadań przestrzennych (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 względem Qwen3-VL-4B – wszystkie raportowane przez producenta). Właściwym sposobem odczytania tego pojedynku jest potraktowanie go jako rozwidlenia dróg: jeśli zadaniem jest „zrozumieć, co dzieje się na tym ekranie w czasie”, odpowiednim narzędziem jest Mage-VL, a UI-Venus-2-9B nie jest do tego stworzony; jeśli zadaniem jest „sprawić, żeby ten ekran coś zrobił”, sytuacja jest odwrotna.

Gdzie te dwa komponują

Ciekawa wersja tego porównania nie sprowadza się do wyboru albo-albo. Agent GUI obsługujący działającą aplikację ma autentyczną martwą strefę — czas między zrzutami ekranu oraz każdą zmianę stanu, która nigdy nie zatrzymuje się w statycznej klatce — a natywny dla kodeka obserwator strumienia to dokładnie ten rodzaj modelu, który mógłby stanowić warstwę percepcji w tej luce, wykrywając, że strona zakończyła ładowanie albo że modal zakończył animację, zanim agent wykona kolejny przebieg ugruntowania (grounding pass). Microsoft nie zbudował Mage-VL do tego zadania, a Ant Group nie zbudował UI-Venus-2-9B po to, by był sterowany przez drugi model, ale to dopasowanie jest realne. W przypadku części takiego stosu technologicznego, które są już klasy produkcyjnej — planera LLM, który dekomponuje zadanie, modelu wizyjnego, który weryfikuje stan ekranu, modelu transkrypcji, który rejestruje sesję agenta — to właśnie jedno API z ceną pass-through i automatycznym przełączaniem awaryjnym sprawia, że eksperyment jest tani, i właśnie do tego służy router. Ani UI-Venus-2-9B, ani Microsoft Mage-VL nie są dziś udostępniane za pośrednictwem OrcaRouter; oba to projekty z otwartymi wagami do samodzielnego hostowania i oba pojawiłyby się po cenie katalogowej swojego dostawcy, gdyby kiedykolwiek trafiły do dostawcy z sieci routingu.

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured August 27 2026) showing the model header with one like, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, multimodal, gui, and the opening of the UI-Venus-2 model card.A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026) showing the model header, the tags image-text-to-text, Transformers, Safetensors, mage_vl, multimodal, vision-language-model, and the opening of the Mage-VL model card.

Kto powinien wybrać, które

{{1}}Wybierz Microsoft Mage-VL, gdy Twój problem dotyczy ciągłej percepcji — strumienia z kamery, nagrania ekranu, transmisji, którą trzeba podsumowywać lub monitorować w czasie rzeczywistym, na tyle tanio, by mogła działać bez przerwy.{{/1}} {{2}}Wybierz UI-Venus-2-9B, gdy Twój problem dotyczy sterowania — zadania, które kończy się wykonaną akcją, wypełnionym formularzem, przejściem przez ścieżkę nawigacji, obsłużoną aplikacją.{{/2}} {{3}}A jeśli Twoja automatyzacja naprawdę potrzebuje obu — postrzegania strumienia, a następnie działania na nieruchomym obrazie — uruchom je jako parę i traktuj obserwatora strumienia jako detektor zdarzeń, który przekazuje agentowi zrzutów ekranu momenty warte reakcji.{{/3}} {{4}}To dwie połowy tego samego ekranu, a nie konkurenci do tego samego zadania.{{/4}}