Сгенерированная титульная карточка в фирменном стиле OrcaRouter с надписью «PixelUMM vs Microsoft Mage-VL», с четырьмя статистическими плитками: «>75%» (сокращение количества визуальных токенов, о котором сообщает Mage-VL), «3.5×» (заявленное ускорение по времени выполнения относительно равномерной выборки кадров), «15.2B vs 4B» (общее число параметров PixelUMM против базовой модели Qwen3-4B у Mage-VL) и «0 / 1» (нулевая способность Mage-VL к генерации против одной модели PixelUMM, охватывающей изображения и видео). Строка в нижнем колонтитуле гласит: «Собственные данные обеих лабораторий; независимый повторный запуск ни одной из моделей не проводился». Логотип OrcaRouter вкомпонован в полосу с отступами в правом нижнем углу.
Guides & Insights

PixelUMM против Microsoft Mage-VL: один удаляет визуальный токенизатор, другой переписывает его

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

И PixelUMM, и Microsoft Mage-VL были созданы командами, убеждёнными, что способ превращения зрения в токены — это не то узкое место, — и они исправили это в противоположных направлениях. Mage-VL, нативная для кодеков потоковая модель Microsoft, сохраняет токенизатор и делает его гораздо более агрессивным: она следует структуре современных видеокодеков, сохраняет каждый опорный кадр и только те патчи предсказанных кадров, на которые кодек тратит биты, и сообщает о сокращении визуальных токенов более чем на 75% при ускорении до 3,5× по реальному времени по сравнению с равномерной выборкой кадров. PixelUMM, унифицированная модель NVIDIA без энкодера, полностью убирает токенизатор — каждый патч необработанных пикселей размером 16×16 попадает в основную сеть через одну линейную проекцию, без VAE и без визуального трансформера вообще. Одна сжимает сильнее. Другая отказывается сжимать вообще. И только одна из них способна что-либо генерировать.

Именно это последнее различие делает это сопоставление интереснее, чем спор о характеристиках. Mage-VL — это наблюдатель: потоковая модель восприятия с проактивным шлюзом, который решает, когда говорить. PixelUMM — это читатель, который ещё и рисует: одни и те же веса отвечают на вопросы об изображении и генерируют новое видео по текстовому запросу. Это два несовместимых ответа на вопрос «какой должна быть унифицированная модель зрения», и у каждой лаборатории свои цифры.

Где происходит сжатие

В основе Mage-VL лежит современный парадокс Моравека: визуально-языковые модели сильны в сложных офлайн-рассуждениях, но медленны и требовательны к вычислениям при простом восприятии в реальном времени. Её решение — согласование с кодеком. Вместо того чтобы декодировать поток в равномерно дискретизированные кадры и подавать плотную сетку через замороженный ViT, предварительно обученный на веб-данных, Mage-VL разделяет поток на опорные (I) кадры и предсказанные (P) кадры, сохраняет все патчи опорных кадров и оставляет только патчи предсказанных кадров, несущие реальное движение или новые детали. Кодировщик, Mage-ViT, обучается с нуля на сетке патчей 16×16 с трёхмерным ротационным позиционным кодированием и явно не зависит от кодека — один и тот же интерфейс принимает векторы движения и энергию остатков H.264/AVC или HEVC, либо обученную карту скоростей нейронного кодека, без изменения архитектуры или переобучения.

Посылка PixelUMM состоит в том, что проблема — в самом энкодере, а не в его эффективности. В статье PixelUMM утверждается, что модели вроде BAGEL содержат два визуальных интерфейса — ViT для семантических признаков и VAE для латентов реконструкции — что примерно вдвое увеличивает визуальный контекст на каждое условное изображение и вынуждает перестраивать конвейеры визуально-языкового предобучения вокруг второго потока. PixelUMM удаляет и то, и другое: изображения становятся пространственными патчами 16×16, видео — пространственно-временными тублетами из 4 кадров, а сырые пиксели через однослойные линейные проекции попадают в Transformer, состоящий только из декодера. Понимание — это авторегрессионный текст; генерация — это flow matching в пиксельном пространстве.

• Стратегия сжатия — Mage-VL: временная, производная от кодека; сохранять опорные кадры, прореживать предсказанные кадры. PixelUMM: нет; сохранять каждый патч исходных пикселей.

• Что обучается с нуля — Mage-VL: весь визуальный стек, примерно на 100 млн неразмеченных изображений и видео. PixelUMM: пиксельные эмбеддеры и декодеры, поверх языкового бэкбона Qwen3-8B.

• Базовая модель — Mage-VL: Qwen3-4B-Instruct-2507, единственный предобученный компонент, стоящий за двухслойным MLP-проектором. PixelUMM: Qwen3-8B, всего около 15,2 млрд параметров.

• Поведение при потоковой передаче — Mage-VL: когнитивный шлюз оценивает каждое скользящее окно и сохраняет молчание, пока не завершится событие, достойное ответа, и только тогда вызывает полную модель. PixelUMM: режим потоковой передачи отсутствует; запросы представляют собой вызовы генерации или понимания.

A headless-browser capture of the Hugging Face model card for the Microsoft Mage-VL repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Что делает каждый из них и чего он не делает

Mage-VL — это единый чекпоинт, который одновременно обеспечивает понимание изображений и видео, а также проактивный шлюз потоковой передачи — одни и те же веса отвечают на офлайн-вопросы и управляют комментариями, запускаемыми событиями. Он объединяет в себе процессор кодеков, пакет нейронных кодеков и шлюз. Второй релиз, microsoft/Mage-ViT, — это отдельный визуальный энкодер из этапа предварительного обучения с нуля, предлагаемый как готовый к подключению фронтенд для другого мультимодального обучения. Mage-VL не генерирует. Он читает.

PixelUMM охватывает преобразование текста в изображение, текста в видео с 96 кадрами при 24 кадрах в секунду, а также текст, обусловленный изображением и видео. Поставляется с четырьмя чекпоинтами — S8-F22-R05 в качестве стандартного, охватывающего все четыре задачи, S8-F18-R01 настроенный на лучшее преобразование текста в видео при 480p и 720p, но не способный понимать видео, и два промежуточных этапа. Чего он не делает — это потоковая передача, редактирование или 3D. Если вам нужна модель, которая следит за прямым эфиром и говорит, когда что-то происходит, PixelUMM — совершенно не та форма, и ни один столбец бенчмарка вам об этом не скажет.

Разрыв во внедрении — первый честный сигнал.

Эти два релиза не одинаково зрелые, и счётчики загрузок говорят об этом прямее, чем любой пост о запуске.

• Mage-VL — опубликована на Hugging Face 25 июля 2026 года под лицензией Apache-2.0, вместе с сопроводительным техническим отчётом и идентификатором arXiv. К началу октября она набрала примерно 13 800 загрузок и 414 лайков, а вокруг неё выросла небольшая экосистема проектов сообщества.

• PixelUMM — опубликован на Hugging Face 1 октября 2026 года под некоммерческой лицензией для чекпоинта. На момент написания этого текста число его загрузок было равно нулю, а число лайков — трём. Ему всего несколько дней.

До сих пор ни одна из лабораторий не объявила о соответствующем релизе — Mage-VL вышел в июле без анонса, и PixelUMM вышел в октябре без него. Эта симметрия реальна, но было бы ошибкой воспринимать её как указание на то, что это два эквивалентных артефакта. Mage-VL уже десять недель находится в центре внимания сообщества; PixelUMM — всего несколько дней. Модель, которую никто за пределами лаборатории не запускал, — это совсем другое дело, чем модель, которую скачали несколько тысяч человек, и только одна из этих двух относится ко второй категории.

A generated scoreboard card titled “PixelUMM vs Microsoft Mage-VL — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual tokenizer, backbone, trained from scratch, streaming, generation and licence. Mage-VL's column shows a codec-native sparse token grid, a Qwen3-4B-Instruct-2507 backbone, a Mage-ViT pretrained from scratch on about 100M unlabeled media, proactive streaming with a cognition gate, no generation, and Apache-2.0; PixelUMM's column shows no tokenizer at all, a Qwen3-8B backbone at 15.2B total, pixel embedders and decoders trained on top of it, no streaming mode, text-to-image and text-to-video plus understanding, and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

Табло, с указанием происхождения

Все цифры — собственные данные лаборатории-разработчика. Цифры Mage-VL взяты из карточки модели и технического отчёта Microsoft; цифры PixelUMM — из его препринта. Ни те, ни другие не были независимо воспроизведены.

• Визуальные токены — Mage-VL: заявлено сокращение более чем на 75% по сравнению с плотной покадровой выборкой. PixelUMM: сокращения нет; аргумент в том, что необработанные патчи устраняют второе кодирование, а не уменьшают первое.

• Скорость по реальному времени — Mage-VL: до 3,5× быстрее равномерной выборки кадров при сопоставимой точности, по данным Microsoft. PixelUMM: в статье нет сравнительных утверждений о скорости.

• Качество энкодера — Mage-VL: Mage-ViT сообщает о 99,33 % на CIFAR-10 и 85,69 % на ImageNet при бюджете в 256 токенов, на основе примерно 100 млн неразмеченных медиаданных. PixelUMM: эквивалентного бенчмарка энкодера нет, поскольку нет энкодера для тестирования.

• Понимание видео — Mage-VL: сообщается о приросте по сравнению с Qwen3-VL-4B на всех бенчмарках для видео и временной локализации, по которым он отчитывается, включая +22.5 на QVHighlight и +17.1 на ActivityNet. PixelUMM: MVBench 70.53, Video-MME 57.33 без субтитров, LongVideoBench 59.61, LVBench 40.41.

• Понимание изображений — Mage-VL: не уступает Qwen3-VL-4B на статических изображениях, по данным Microsoft. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96.

• Генерация — Mage-VL: нет. PixelUMM: GenEval в целом 0.83 с рерайтером промптов, DPG-Bench 85.74, качество VBench Part 1 — 84.10.

• Стриминг — Mage-VL: проактивное гейтирование событий с заявленными лучшими показателями TimVal, F1, ROC-AUC и PR-AUC на потоковых данных SoccerNet. PixelUMM: не поддерживается.

• Лицензия — Mage-VL: Apache-2.0, код и веса. PixelUMM: код Apache-2.0, на чекпоинт распространяется лицензия NVIDIA One-Way Noncommercial License.

Две колонки пересекаются недостаточно, чтобы можно было ранжировать. Mage-VL сообщает об эффективном энкодере, превосходящем конкурента того же масштаба; PixelUMM сообщает, что модель на 15B попадает в тот же диапазон, что и специализированные системы вокруг неё, и прямо заявляет в своей собственной статье, что различия в обучающих данных означают, что результаты «не позволяют установить, какая архитектура превосходит».

Практическое разделение

Выбирайте по задаче, а не по баллам. Если вы создаёте восприятие видео в реальном времени — монитор, который следит за потоком и комментирует, когда что-то происходит, при этом стоимость токенов является жёстким ограничением, — Mage-VL — единственная из двух, кто это делает, она под Apache-2.0, а её масштаб класса 4B означает, что её может обслуживать один узел. Если вам нужна одна модель, которая читает изображения и видео, а также генерирует их, PixelUMM — единственная из двух, кто это умеет, но это исследовательский артефакт на некоммерческой лицензии, её веса — это 128 шардов распределённого чекпоинта за скрытым индексом, а преобразование текста в видео по умолчанию проходит через защитные ограничители Cosmos с отдельным окружением Python для этого шлюза.

Для команды, которой нужны обе эти возможности, довод в пользу того, чтобы получать к ним доступ через один слой маршрутизации, а не через две прямые интеграции, очевиден, даже если сегодня ни одна из них не хостится: один ключ, цены провайдеров из прайс-листа, передаваемые с наценкой 0%, и правила отказоустойчивости, которые позволяют направить часть трафика на недавно открытую модель Apache-2.0, пока проверенная модель обслуживает остальное. OrcaRouter создан именно для таких задач — и, если говорить прямо, мы сейчас не маршрутизируем ни PixelUMM, ни Mage-VL, так что это описание рабочего процесса, а не перечень.

Что бы это уладило

Два события имеют значение. Первое — независимый повторный прогон метрик энкодера Mage-ViT или видеорезультатов Mage-VL кем-то, кто не имеет в них никакой доли; десять недель загрузок пока не дали ни одного такого. Второе — любое изменение лицензии на чекпойнт PixelUMM, а это единственный факт, который сейчас отделяет исследовательский артефакт от того, что можно развернуть. Пока не произойдёт хотя бы одно из них, самое полезное, что можно сказать об этой паре, — это то, что Microsoft сделала ставку на удешевление визуального интерфейса, а NVIDIA — на его устранение, и ни одна из этих ставок не была оценена кем-либо за пределами лаборатории, которая её сделала.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube