
UI-Venus-2-9B против Microsoft Mage-VL: Агент скриншотов против наблюдателя за кодек-потоком
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
UI-Venus-2-9B и Microsoft Mage-VL оба тихо вышли в течение месяца друг за другом — репозиторий Mage-VL появился 26 июля 2026 года, UI-Venus-2-9B — 26 августа 2026 года — обе модели имеют открытые веса под лицензией Apache-2.0 и построены на базе семейства Qwen. На этом сходства в основном заканчиваются, и различие заключается не в степени, а в том, на какой стороне экрана живёт каждая модель. Microsoft Mage-VL — это кодек-нативная модель потокового восприятия: она смотрит сжатое видео, молчит во время обычных кадров и выдаёт текст, когда событие завершается. UI-Venus-2-9B — это GUI-агент: она потребляет статичный скриншот, анализирует состояние и выдаёт структурированное действие. Одна смотрит на экран и описывает его; другая смотрит на экран и управляет им. Выбор между ними — это не решение на основе бенчмарков, потому что у них нет ни одного общего бенчмарка — это решение о том, заканчивается ли ваша автоматизация ответом или действием.
Что на самом деле представляет собой каждая модель
{{1}}Microsoft Mage-VL{{/1}}, выпущенный в репозитории {{2}}microsooft/Mage-VL{{/2}} без анонса, — это мультимодальная модель примерно с 4 млрд параметров, построенная на языковом декодере {{3}}Qwen3-4B-Instruct-2507{{/3}}, визуальном энкодере {{4}}Mage-ViT{{/4}}, созданном с нуля, и отдельном стриминговом гейте объёмом около 0,5 млрд параметров. Её архитектура изначально ориентирована на видеокодеки: вместо равномерной выборки кадров она полностью сохраняет опорные (I) кадры и удерживает только патчи предсказанных (P) кадров, значимые для движения, что, по данным Microsoft, сокращает потребление визуальных токенов более чем на 75% и обеспечивает ускорение инференса до 3,5 раза по фактическому времени выполнения по сравнению с равномерной выборкой. Двухпроцессная конструкция — когнитивный гейт {{5}}Системы 1{{/5}} следит за каждым скользящим окном кодека, а VLM {{6}}Системы 2{{/6}} включается только тогда, когда событие заслуживает реакции, — делает её постоянно работающим видеонаблюдателем, который дёшев именно потому, что в основном молчит.
UI-Venus-2-9B, выпущенный inclusionAI (лабораторией Ant Group из команды Venus), — это универсальный GUI-агент на 9B параметров, созданный на базе Qwen3.5-9B. Он наблюдает за интерфейсом, анализирует состояние задачи, выполняет действие и учитывает обратную связь — замкнутый цикл «наблюдение–рассуждение–действие–обратная связь». Согласно карточке модели, обучение охватывает мобильные приложения, веб-платформы и настольные операционные системы в рамках одного чекпоинта. В собственной карточке модели указаны результаты AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 и ScreenSpot-Pro 73.0; все показатели заявлены поставщиком, и ни один не был воспроизведён независимо.
Разрыв ввода: пиксели, которые вы захватываете, против потока, который вы сохраняете
Самое показательное различие — это то, что ест каждая модель. UI-Venus-2-9B — агент по скриншотам: его входные данные — текущий экран, один кадр за раз, а его контекстное окно на 256K токенов — это то, как он хранит историю этих кадров на протяжении длительной задачи. Mage-VL — потоковый агент: его входные данные — сжатое видео, а его эффективность достигается за счёт обработки движения между кадрами как данных — векторов движения и остаточной энергии для традиционных кодеков, изученных карт скоростей для нейронных. Это разница между моделью, которая видит моменты, и моделью, которая видит непрерывную временную линию. Агент по скриншотам структурно слеп к 100 миллисекундам между снимками — к спиннеру, переходу загрузки, состоянию наведения, которое существует на экране лишь мгновение. Наблюдатель потока живёт внутри этого промежутка. Это не недостаток ни в одном из подходов; это объясняет, почему GUI-агент, которому нужно действовать на живом экране, и модель восприятия, которой нужно резюмировать видеопоток, — это разные продукты с разными входными контрактами.

Разрыв выпуска: действия против комментариев
Что касается вывода, тут они перестают быть сопоставимыми. Вывод UI-Venus-2-9B — это структурированное действие в заданном пространстве действий: мышь, клавиатура, прокрутка, навигация, — которое генерируется после токенов рассуждения в стиле Qwen3, а её обучение строится вокруг задач на grounding и CAPTCHA, которые поощряют точную локализацию элементов при визуальном шуме. Вывод Mage-VL — это текст: событийно-управляемый комментарий о том, что она видит. У неё нет пространства действий, нет вызова функций и нет агентного цикла. Прочитайте две карточки моделей рядом — и вы увидите противоположные стороны линии «восприятие–действие»: Mage-VL заканчивается описанием, а UI-Venus-2-9B — кликом.
• Задача — UI-Venus-2-9B: GUI-агент, управляет интерфейсом. Microsoft Mage-VL: потоковое восприятие, описывает интерфейс.
• Ввод — UI-Venus-2-9B: статические скриншоты, история на 256K токенов. Microsoft Mage-VL: сжатые видеопотоки через кодек, разреженность токенов по значимым движениям.
• Вывод — UI-Venus-2-9B: структурированные действия мыши/клавиатуры/навигации. Microsoft Mage-VL: текстовый комментарий, управляемый событиями.
• Размер — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B потоковый шлюз.
• Базовая модель — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 плюс Mage-ViT, созданный с нуля.
• Лицензия — обе Apache-2.0 (в карточке Mage-VL в его репозитории указано: только для исследовательских целей).
Разрыв в подаче
В данном случае более новая и крупная модель запускается проще. Для UI-Venus-2-9B в документации приведена одна команда vLLM с контекстным окном 256K и стандартным OpenAI-совместимым API. Mage-VL требует trust_remote_code для выполнения кастомного Python от Microsoft, а также FFmpeg, нейрокодек для видео и зависимости вроде mamba-ssm, и у него пока нет serving-стека vLLM или SGLang — ни paged attention, ни продакшен-пути для serving. Microsoft сообщает, что в общей сложности это около 10,6 ГБ параметров в BF16, то есть реалистичный минимум для работы с изображениями — GPU на 16 ГБ, а для длинного видео — 24 ГБ и более. Для команды, которая хочет запустить что-то в продакшен уже сегодня, у UI-Venus-2-9B более простая точка входа; а для команды, строящей постоянно работающий пайплайн мониторинга или суммаризации, serving-стек Mage-VL — это то, на что вы в любом случае подписываетесь, вместе со всем его кастомным Python.
Табло, которого не существует
У этих двух моделей нет общего бенчмарка, и выдумывать его было бы нечестно. Показатели UI-Venus-2-9B живут на лидербордах по привязке к GUI, мобильным, веб- и компьютерным сценариям (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8 — всё по данным вендора). Показатели Mage-VL живут на лидербордах по пониманию видео и пространственному восприятию (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 к Qwen3-VL-4B — всё по данным вендора). Правильно читать это сравнение как развилку: если задача — «понять, что происходит на экране с течением времени», то Mage-VL — подходящий инструмент, а UI-Venus-2-9B для этого не предназначен; если задача — «заставить экран что-то сделать», верно обратное.
Где двое составляют
Интересная версия этого сравнения — не «либо-либо». У GUI-агента, работающего с живым приложением, есть настоящая слепая зона — время между скриншотами и любое изменение состояния, которое так и не застывает в статическом кадре, — и потоковый наблюдатель, нативный к кодеку, — это ровно та модель, которая могла бы действовать как слой восприятия в этом промежутке, определяя, что страница закончила загрузку или что модальное окно завершило анимацию до следующего прохода привязки агента. Microsoft не создавала Mage-VL для этой работы, и Ant Group не создавала UI-Venus-2-9B, чтобы им управляла вторая модель, но соответствие реально. Для тех частей такого стека, которые уже продакшен-готовы — LLM-планировщик, разбивающий задачу на шаги, модель зрения, проверяющая состояние экрана, модель транскрипции, логирующая сессию агента, — один API со сквозными ценами и автоматическим фейловером делает эксперимент дешёвым, и именно для этого нужен роутер. Ни UI-Venus-2-9B, ни Microsoft Mage-VL сегодня не обслуживаются через OrcaRouter; оба — self-host проекты с открытыми весами, и оба появлялись бы по цене провайдера, если бы когда-либо попали к маршрутизируемому провайдеру.


Кто должен выбирать
Выбирайте Microsoft Mage-VL, когда ваша задача — непрерывное восприятие: видеопоток с камеры, запись экрана, поток, который нужно резюмировать или отслеживать в реальном времени, достаточно дёшево, чтобы он мог работать постоянно. Выбирайте UI-Venus-2-9B, когда ваша задача — управление: задача, завершающаяся выполненным действием, заполненной формой, пройденным сценарием, управляемой программой. А если вашей автоматизации действительно нужно и то и другое — воспринимать поток, затем действовать по кадру, — запускайте их в паре и используйте наблюдателя за потоком как детектор событий, который передаёт агенту по скриншотам моменты, заслуживающие реакции. Они — две половины одного экрана, а не конкуренты за одну и ту же работу.
