
UI-Venus-2-9B kontra Microsoft Mage-VL: Agent zrzutów ekranu kontra obserwator strumienia kodeków
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
UI-Venus-2-9B i Microsoft Mage-VL ukazały się po cichu w odstępie miesiąca od siebie — repozytorium Mage-VL pojawiło się 26 lipca 2026 roku, a UI-Venus-2-9B 26 sierpnia 2026 roku — oba mają otwarte wagi na licencji Apache-2.0 i oba bazują na backbone'ach z rodziny Qwen. To mniej więcej w tym miejscu kończą się podobieństwa, a różnica nie jest kwestią stopnia, lecz tego, po której stronie ekranu żyje każdy z modeli. Microsoft Mage-VL to natywny dla kodeka strumieniowy model percepcji: ogląda skompresowane wideo, milczy podczas rutynowego materiału i emituje tekst, gdy zdarzenie się zakończy. UI-Venus-2-9B to agent GUI: przyjmuje statyczny zrzut ekranu, rozumuje o stanie i emituje ustrukturyzowaną akcję. Jeden patrzy na ekran i go opisuje; drugi patrzy na ekran i nim steruje. Wybór między nimi nie jest decyzją benchmarkową, ponieważ nie mają żadnego wspólnego benchmarku — to decyzja o tym, czy Twoja automatyzacja kończy się odpowiedzią, czy akcją.
Czym tak naprawdę jest każdy model
Microsoft Mage-VL, opublikowany w repozytorium microsoft/Mage-VL bez żadnego ogłoszenia, to multimodalny model o około 4B parametrów, zbudowany z dekodera językowego Qwen3-4B-Instruct-2507, stworzonego od zera enkodera wizualnego o nazwie Mage-ViT oraz osobnej bramki strumieniowej o ~0,5B parametrów. Jego konstrukcja jest natywna dla kodeków wideo: zamiast równomiernie próbkować klatki, zachowuje w całości klatki odniesienia (I), a z klatek przewidywanych (P) zatrzymuje tylko fragmenty istotne pod względem ruchu. Microsoft podaje, że zmniejsza to zużycie tokenów wizualnych o ponad 75% i skraca czas zegarowy wnioskowania nawet 3,5-krotnie w porównaniu z równomiernym próbkowaniem. Dwuetapowa konstrukcja — bramka poznawcza Systemu 1 monitoruje każde przesuwające się okno kodeka, a System 2 (VLM) uruchamia się tylko wtedy, gdy zdarzenie jest warte reakcji — sprawia, że jest to stale aktywny obserwator wideo, który jest tani właśnie dlatego, że przeważnie milczy.
UI-Venus-2-9B, wydany przez inclusionAI (laboratorium Ant Group należące do zespołu Venus), to 9-miliardowy uniwersalny agent GUI zainicjalizowany na bazie Qwen3.5-9B. Obserwuje interfejs, rozumuje o stanie zadania, wykonuje akcję i przetwarza informację zwrotną — zamkniętą pętlę obserwacja–rozumowanie–działanie–reakcja — a jego karta deklaruje pokrycie szkoleniowe aplikacji mobilnych, platform webowych i systemów operacyjnych dla komputerów stacjonarnych w jednym punkcie kontrolnym. Na własnej karcie modelu raportuje AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 i ScreenSpot-Pro 73.0 — wszystko raportowane przez producenta, bez niezależnej reprodukcji.
Luka wejściowa: przechwytywane piksele a utrzymywany strumień
Najbardziej pouczająca różnica to to, co każdy model „je". UI-Venus-2-9B to agent zrzutów ekranu: jego wejściem jest bieżący ekran, jedna klatka na raz, a okno kontekstowe o wielkości 256 tys. tokenów pozwala mu przechowywać historię tych klatek podczas długiego zadania. Mage-VL to agent strumieniowy: jego wejściem jest skompresowane wideo, a jego wydajność wynika z traktowania ruchu między klatkami jako danych — wektorów ruchu i energii resztkowej dla tradycyjnych kodeków oraz wyuczonych map przepływności dla kodeków neuronowych. To jest różnica między modelem, który widzi chwile, a modelem, który widzi ciągłą oś czasu. Agent zrzutów ekranu jest strukturalnie ślepy na 100 milisekund między przechwyceniami — na wskaźnik ładowania, przejście ładowania, stan najechania, który istnieje na ekranie tylko przez chwilę. Obserwator strumienia żyje w tej luce. To nie jest wada żadnego z tych rozwiązań; to dlatego agent GUI, który musi działać na żywym ekranie, i model percepcji, który ma podsumowywać strumień, to różne produkty o różnych kontraktach wejściowych.

Luka produkcyjna: działania a komentarze
{{1}}Po stronie wyjścia te dwa modele przestają być porównywalne.{{/1}} {{2}}Wyjście UI-Venus-2-9B to ustrukturyzowana akcja w zdefiniowanej przestrzeni działań – mysz, klawiatura, przewijanie, nawigacja – którą generuje po tokenach rozumowania w stylu Qwen3, a jego trening opiera się na zadaniach groundingowych i CAPTCHA, które nagradzają precyzyjną lokalizację elementów w wizualnym bałaganie.{{/2}} {{3}}Wyjście Mage-VL to tekst: sterowany zdarzeniami komentarz na temat tego, co widzi.{{/3}} {{4}}Nie ma przestrzeni działań, wywoływania funkcji ani pętli agentowej.{{/4}} {{5}}Czytając obie karty modeli obok siebie, patrzysz na przeciwne strony linii percepcja–działanie – Mage-VL kończy się opisem, a UI-Venus-2-9B kliknięciem.{{/5}}
• Zadanie — UI-Venus-2-9B: agent GUI, obsługuje interfejs. Microsoft Mage-VL: percepcja strumieniowa, opisuje interfejs.
• Wejście — UI-Venus-2-9B: statyczne zrzuty ekranu, historia 256K tokenów. Microsoft Mage-VL: skompresowane strumienie kodeka wideo, rzadkość tokenów istotnych dla ruchu.
• Wyjście — UI-Venus-2-9B: ustrukturyzowane akcje myszy/klawiatury/nawigacji. Microsoft Mage-VL: komentarz tekstowy sterowany zdarzeniami.
• Rozmiar — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B streaming gate.
• Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 oraz Mage-ViT tworzony od zera.
• Licencja — obie Apache-2.0 (notatki na karcie Mage-VL: tylko do celów badawczych w jego repozytorium).
Luka w serwowaniu
Tutaj nowszy, większy model jest łatwiejszy do uruchomienia. UI-Venus-2-9B dokumentuje pojedyncze polecenie vLLM z oknem kontekstowym 256K i standardowym API zgodnym z OpenAI. Mage-VL wymaga trust_remote_code do wykonania niestandardowego kodu Pythona Microsoftu, plus FFmpeg, ścieżkę neural-codec dla wideo, oraz zależności takie jak mamba-ssm, a nie ma jeszcze stosu serwującego vLLM ani SGLang — bez paged attention, bez produkcyjnej ścieżki serwowania. Microsoft raportuje około 10,6 GB parametrów BF16 łącznie, co oznacza, że 16 GB GPU to realistyczne minimum do pracy z obrazami, a 24 GB+ do długiego wideo. Dla zespołu, który chce wdrożyć coś do produkcji już dziś, UI-Venus-2-9B ma prostszą ścieżkę wejścia; dla zespołu budującego stale działający pipeline monitorowania lub streszczeń, stos serwujący Mage-VL to coś, na co się decydujesz tak czy inaczej, z całym tym niestandardowym kodem Pythona.
Tablica wyników, która nie istnieje.
Nie ma wspólnego benchmarku dla tych dwóch modeli, a wymyślanie takiego byłoby nieuczciwe. Wyniki UI-Venus-2-9B dotyczą list rankingowych GUI-grounding, urządzeń mobilnych, webu i obsługi komputera (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8 – wszystkie raportowane przez producenta). Wyniki Mage-VL dotyczą list rankingowych rozumienia wideo i zadań przestrzennych (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 względem Qwen3-VL-4B – wszystkie raportowane przez producenta). Właściwym sposobem odczytania tego pojedynku jest potraktowanie go jako rozwidlenia dróg: jeśli zadaniem jest „zrozumieć, co dzieje się na tym ekranie w czasie”, odpowiednim narzędziem jest Mage-VL, a UI-Venus-2-9B nie jest do tego stworzony; jeśli zadaniem jest „sprawić, żeby ten ekran coś zrobił”, sytuacja jest odwrotna.
Gdzie te dwa komponują
Ciekawa wersja tego porównania nie sprowadza się do wyboru albo-albo. Agent GUI obsługujący działającą aplikację ma autentyczną martwą strefę — czas między zrzutami ekranu oraz każdą zmianę stanu, która nigdy nie zatrzymuje się w statycznej klatce — a natywny dla kodeka obserwator strumienia to dokładnie ten rodzaj modelu, który mógłby stanowić warstwę percepcji w tej luce, wykrywając, że strona zakończyła ładowanie albo że modal zakończył animację, zanim agent wykona kolejny przebieg ugruntowania (grounding pass). Microsoft nie zbudował Mage-VL do tego zadania, a Ant Group nie zbudował UI-Venus-2-9B po to, by był sterowany przez drugi model, ale to dopasowanie jest realne. W przypadku części takiego stosu technologicznego, które są już klasy produkcyjnej — planera LLM, który dekomponuje zadanie, modelu wizyjnego, który weryfikuje stan ekranu, modelu transkrypcji, który rejestruje sesję agenta — to właśnie jedno API z ceną pass-through i automatycznym przełączaniem awaryjnym sprawia, że eksperyment jest tani, i właśnie do tego służy router. Ani UI-Venus-2-9B, ani Microsoft Mage-VL nie są dziś udostępniane za pośrednictwem OrcaRouter; oba to projekty z otwartymi wagami do samodzielnego hostowania i oba pojawiłyby się po cenie katalogowej swojego dostawcy, gdyby kiedykolwiek trafiły do dostawcy z sieci routingu.


Kto powinien wybrać, które
{{1}}Wybierz Microsoft Mage-VL, gdy Twój problem dotyczy ciągłej percepcji — strumienia z kamery, nagrania ekranu, transmisji, którą trzeba podsumowywać lub monitorować w czasie rzeczywistym, na tyle tanio, by mogła działać bez przerwy.{{/1}} {{2}}Wybierz UI-Venus-2-9B, gdy Twój problem dotyczy sterowania — zadania, które kończy się wykonaną akcją, wypełnionym formularzem, przejściem przez ścieżkę nawigacji, obsłużoną aplikacją.{{/2}} {{3}}A jeśli Twoja automatyzacja naprawdę potrzebuje obu — postrzegania strumienia, a następnie działania na nieruchomym obrazie — uruchom je jako parę i traktuj obserwatora strumienia jako detektor zdarzeń, który przekazuje agentowi zrzutów ekranu momenty warte reakcji.{{/3}} {{4}}To dwie połowy tego samego ekranu, a nie konkurenci do tego samego zadania.{{/4}}
