Сгенерированная титульная карточка в фирменном стиле OrcaRouter с надписью «NVIDIA PixelUMM» и четырьмя плитками статистики: «1 окт. 2026» (репозиторий Hugging Face создан, ноль загрузок), «15,2 млрд» (в таблицах статьи указано как «8B MoT»), «0» (анонсы вендоров) и «noncommercial» (лицензия чекпойнта; код — Apache-2.0). В нижнем колонтитуле указано: «Источники: карточка модели Hugging Face · arXiv:2609.38597». Логотип OrcaRouter вкомпонован в полосу с внутренними отступами в правом нижнем углу.
Engineering & Research

NVIDIA PixelUMM вышла без анонса — веса только что появились

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самый простой способ узнать, что NVIDIA создала новую унифицированную мультимодальную модель, — это заметить, что вам об этом никто не сказал. nvidia/PixelUMM — это репозиторий, появившийся на Hugging Face в 21:40 UTC 1 октября 2026 года, содержащий контрольную точку на 15,2 млрд параметров, весь обученный стек которой построен на основе Qwen3-8B в качестве базовой модели — и не было ни поста в блоге, ни пресс-релиза, ни слайда с презентации, ни треда о запуске. Поиск по этому названию не находит ничего в собственном блоге NVIDIA. Вместо этого есть репозиторий на GitHub, страница проекта, в URL которой до сих пор написано «preview», препринт arXiv под номером 2609.38597 и контрольная точка, разбитая на 128 файлов со скрытым индексом, без которого загрузчик отказывается работать. PixelUMM существует и доступен для скачивания уже сегодня. Считает ли NVIDIA его выпущенным — на этот вопрос компания не ответила.

Этот разрыв — между артефактом, который существует, и вендором, который ничего не сказал, — и есть вся суть этой истории, и стоит точно указать, по какую сторону от него находится каждый факт. Всё нижеследующее взято из репозитория, карточки модели и статьи, которую опубликовали сами авторы. Ничего не взято из анонса, поскольку анонса не было.

Что появилось и когда

Эта серия растянулась примерно на четыре недели, и каждый материал выходил тихо.

• 4 сентября 2026 — nv-tlabs/PixelUMM создан на GitHub под лицензией репозитория Apache-2.0, описан просто как «Унифицированное понимание и генерация изображений и видео без энкодера». До конца сентября он остаётся с единственным первоначальным коммитом.

• 28–29 сентября 2026 г. — появляется первый коммит репозитория, а arXiv присваивает препринту идентификатор arXiv:2609.38597, датированный 29 сентября, где указаны авторы из NVIDIA и Университета Уотерлу: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang и Jay Zhangjie Wu.

• 1 октября 2026, 21:32 UTC — последний коммит в репозиторий под названием «docs: add PixelUMM paper citation».

• 1 октября 2026 г., 21:40 UTC — репозиторий модели Hugging Face создаётся, а через восемь минут наполняется шардами контрольных точек.

Страница проекта размещена по пути, который буквально читается как pixelumm-project-page-preview, а у статьи нет строки с указанием места публикации — ни CVPR, ни NeurIPS, ни «принято на». В совокупности эта последовательность выглядит так, будто исследовательская команда выкладывает артефакт статьи в открытый доступ, а анонсом становится сама загрузка на HF. Это наблюдение, основанное на свидетельствах, а не утверждение о намерениях: у NVIDIA вполне может быть запланирован запуск на более поздний срок, и ничто здесь этого не исключает.

A headless-browser capture of the PixelUMM project page, hosted at a URL path that still reads pixelumm-project-page-preview, showing the model's title, its summary line about encoder-free unified image and video understanding and generation, and the project's task links.

Что такое PixelUMM на самом деле

Тезис дизайна заявлен в первой строке карточки модели: никакого VAE, никакого визуального энкодера. Там, где обычная унифицированная модель имеет два визуальных интерфейса — визуальный трансформер, создающий семантические признаки для понимания, и вариационный автоэнкодер, создающий латентные представления реконструкции для генерации, — у PixelUMM нет ни одного. Изображения разрезаются на патчи размером 16×16 пикселей; видео разрезаются на пространственно-временные тублеты из 4 кадров; и то и другое попадает в бэкбон посредством не более чем однослойных линейных проекций. На входе — сырые пиксели; на выходе — сырые пиксели.

• Архитектура — Transformer, состоящий только из декодера, с эмбеддингами патчей необработанных пикселей и итеративной головкой генерации пикселей; в статье описан как Mixture-of-Transformers, сочетающий общее внимание с параметрами, специфичными для задачи.

• Бэкбон — Qwen3-8B, привязанный к ревизии b968826d9c46dd6066d109eabc6255188de91218. Нужны только его файлы конфигурации и токенизатора; чекпоинт содержит собственные обученные языковые веса.

• Параметры — 15 199 672 064 (примерно 15,2 млрд), в собственных таблицах бенчмарков статьи обозначается как «8B MoT», где нотация размера учитывает backbone и generation expert по отдельности.

• Цели — авторегрессионное предсказание текста и сопоставление потоков в пиксельном пространстве, обучаемые совместно, что позволяет одному набору весов как отвечать на вопрос об изображении, так и рисовать новое.

• Задачи — преобразование текста в изображение, преобразование текста в видео при 96 кадрах / 24 кадра/с / 4 секундах, текст, обусловленный изображением, и текст, обусловленный видео.

Эмпирический раздел статьи необычен в том смысле, который заслуживает отдельного упоминания. Восемь его разделов — это исследования проектных решений, а не позиций в таблице лидеров: размер патча изображения, размер патча видео, артефакты патчей, динамика обучения в пиксельном пространстве по сравнению с пространством VAE, размер модели, масштабирование вычислений, мультимодальное контекстное обусловливание и интерфейсы понимания видео. Это статья, написанная людьми, которые пытаются ответить на вопрос, работает ли подход, а не работа, нацеленная на победу в таблице.

Это собственные цифры авторов.

Каждая цифра ниже приводится авторами PixelUMM в их собственном препринте. Независимого воспроизведения нет, рейтинга Elo на арене нет и оценки третьих сторон нет, потому что модели максимум шесть недель, и она появилась раньше любых внешних испытательных стендов. Относитесь к этим данным как к заявлениям со ссылкой для скачивания, а не как к подтверждённой производительности.

• Понимание изображений — MMMU 41.67, MMStar 53.99, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00, BLINK 53.46, MMMU-Pro 27.63, по официальному протоколу LMMS-Eval (64,750 генераций в рамках 21 задачи).

• Понимание видео — MVBench 70.53, Video-MME 57.33 без субтитров, LongVideoBench 59.61, LVBench 40.41.

• Генерация изображений — GenEval в целом 0.83 с LLM-переписывателем промптов, 0.77 без него; DPG-Bench в целом 85.74.

• Генерация видео — VBench, часть 1: оценка качества 84.10, оценка семантики 79.80; VBench, часть 2: итог 83.24.

Честное прочтение таково: это конкурентоспособные в пределах класса показатели, а не лидирующие в категории, и статья сама это признаёт: в ней отмечается, что, поскольку обучающие данные различаются между моделями, результаты «не позволяют установить, какая архитектура превосходит другие». В сравнении с Qwen3-VL-8B разрыв в понимании изображений велик на MMMU (41,67 против 69,60) и на MMMU-Pro, где авторы не приводят сопоставимого показателя. В сравнении с Qwen-Image 20B разрыв в GenEval составляет 0,83 против 0,87. PixelUMM, судя по его собственным показателям, не является моделью передового уровня. А является он, судя по его собственным показателям, моделью на 15B с действительно необычной архитектурой, которая оказывается в том же диапазоне, что и специализированные системы вокруг неё.

Самая острая грань — это лицензия, а не бенчмарк

Репозиторий распространяется под лицензией Apache-2.0, и в карточке модели это прямо указано. Чекпойнт — это другой артефакт с другими условиями, и именно эта деталь чаще всего может застать команду врасплох. Веса поставляются под лицензией NVIDIA One-Way Noncommercial License, использование которых ограничено некоммерческими исследованиями или оценкой — существенно более узкое разрешение, чем у кода, находящегося рядом. Один исходный файл в репозитории, modeling/pixelumm/modeling_utils.py, дополнительно сохраняет уведомление CC BY-NC 4.0, унаследованное от DiT.

Для исследовательской группы, команды оценщиков или любого, кто публикует статью, это вполне пригодная лицензия. Для продуктовой команды, прототипирующей внутреннюю функцию, это первое, что нужно показать юристам, и ответ может быть «нет». Модель, которую вы не можете выпустить, — это актив иного рода, чем модель, которую можете, и никакой паритет по бенчмаркам этого не меняет.

A headless-browser capture of the Hugging Face model card for nvidia/PixelUMM, showing the model title, the licence tag, and the repository's download and like counters.

Что нужно, чтобы запустить это

Это не загрузка на выходные. Документация по окружению требует Linux x86-64, Python 3.12, набор инструментов разработки CUDA 13.0, GPU NVIDIA и FlashAttention, собранный из исходников с использованием этого набора инструментов — CUDA-образ только для выполнения не подойдёт. Сам чекпоинт — это не файл model.safetensors: это 128 .distcp шардов общим объёмом примерно 30 ГБ плюс скрытый индекс .metadata, и загрузчик требует наличия каждого указанного шарда и этого индекса.

Ещё две детали определяют, что вы действительно можете с ним делать. Во-первых, text-to-video по умолчанию задействует защитные механизмы Cosmos, а для них нужен доступ к репозиторию nvidia/Cosmos-1.0-Guardrail с ограниченным доступом и второе окружение Python с другой мажорной версией Transformers — одного входа недостаточно, чтобы разблокировать веса. Во-вторых, игрушечный пример обучения из четырёх шагов — единственный опубликованный рецепт обучения — согласно документации требует семи GPU с как минимум 48 ГиБ каждая и около 61 ГБ свободного дискового пространства для выходных данных. Дообучение на рабочей станции — не предполагаемый путь; инференс на одной современной карте — вот для чего это предназначено.

Репозиторий поставляется с четырьмя чекпоинтами. S8-F22-R05 — это чекпоинт по умолчанию и тот, который используется для оценки в статье, охватывая все четыре задачи. S8-F18-R01 прошёл дополнительные 10 000 шагов дообучения при 480p и 720p и обычно даёт немного лучшие результаты text-to-video, но не умеет понимать видео. S8-F19-R03 и S8-F21-R02 — промежуточные этапы. Выбор между ними — это настоящее решение, а не деталь.

Что не подтверждено

Короткий список — и он важнее длинного, что выше.

• Никаких объявлений от NVIDIA. Ни пресс-релиза, ни публикации в собственном блоге компании об этой модели на момент написания не появилось. Такое тихое появление может быть намеренным — исследовательские артефакты часто выпускаются именно так, — а может быть, запуска просто ещё не было.

• Независимой оценки нет. Все числа в этой статье принадлежат самим авторам. Ничего не перепроверялось за пределами NVIDIA и Waterloo.

• Нигде нет хостингового маршрута. Сегодня вы не можете вызывать PixelUMM через API, и это касается в том числе OrcaRouter — мы его не маршрутизируем, и не можем, потому что чекпоинт с некоммерческой лицензией — это не то, что может предложить коммерческая платформа для предоставления услуг. Тот, кто говорит вам обратное, описывает вариант с самостоятельным хостингом.

• Позиция по будущему лицензированию не заявлена. Некоммерческие условия — это условия в том виде, в каком они поставляются. Смягчат ли их — неизвестно, и, учитывая историю NVIDIA с исследовательскими чекпоинтами, рассчитывать на это не стоит.

A headless-browser capture of the GitHub repository page for nv-tlabs/PixelUMM, showing the repository description “Encoder-Free Unified Image and Video Understanding and Generation” and the Apache-2.0 repository licence.

За чем следить дальше

Три события превратили бы PixelUMM из исследовательского артефакта в нечто, чем сможет пользоваться более широкая аудитория. Первое — изменение лицензии на чекпоинт: этот единственный файл — вся преграда между «интересно» и «можно использовать в продукте». Второе — официальный запуск от NVIDIA, который принёс бы позиционирование, какое репозиторий дать не может: для чего эта модель и является ли она продуктовым направлением или статьёй. Третье — первое независимое воспроизведение, скорее всего повторный прогон GenEval или MVBench кем-то с запасным кластером GPU, — и это момент, когда числа авторов перестают быть единственными числами.

До тех пор правильная позиция — та, которую подтверждают доказательства. PixelUMM существует, код и статья опубликованы и доступны для чтения, веса скачиваются, и ни одна из заявлений о производительности не была проверена кем-либо за пределами команды, сделавшей их. Это не критика работы — так выглядит исследовательский релиз, которому шесть недель. Это также ровно та ситуация, когда слой маршрутизации позже окупит себя, если лицензия когда-нибудь смягчится: один ключ для моделей, которым вы уже доверяете, цены из прайс-листа без наценки, и отказоустойчивое переключение, позволяющее направить часть трафика на что-то непроверенное, не ставя на это продакшен-путь. Но пока честное резюме проще. NVIDIA создала нечто необычное, тщательно это опубликовала и никому не сказала. Репозиторий и есть анонс.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube