
NVIDIA PixelUMM вышла без анонса — веса только что появились
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 223 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Самый простой способ узнать, что NVIDIA создала новую унифицированную мультимодальную модель, — это заметить, что вам об этом никто не сказал. nvidia/PixelUMM — это репозиторий, появившийся на Hugging Face в 21:40 UTC 1 октября 2026 года, содержащий контрольную точку на 15,2 млрд параметров, весь обученный стек которой построен на основе Qwen3-8B в качестве базовой модели — и не было ни поста в блоге, ни пресс-релиза, ни слайда с презентации, ни треда о запуске. Поиск по этому названию не находит ничего в собственном блоге NVIDIA. Вместо этого есть репозиторий на GitHub, страница проекта, в URL которой до сих пор написано «preview», препринт arXiv под номером 2609.38597 и контрольная точка, разбитая на 128 файлов со скрытым индексом, без которого загрузчик отказывается работать. PixelUMM существует и доступен для скачивания уже сегодня. Считает ли NVIDIA его выпущенным — на этот вопрос компания не ответила.
Этот разрыв — между артефактом, который существует, и вендором, который ничего не сказал, — и есть вся суть этой истории, и стоит точно указать, по какую сторону от него находится каждый факт. Всё нижеследующее взято из репозитория, карточки модели и статьи, которую опубликовали сами авторы. Ничего не взято из анонса, поскольку анонса не было.
Что появилось и когда
Эта серия растянулась примерно на четыре недели, и каждый материал выходил тихо.
• 4 сентября 2026 — nv-tlabs/PixelUMM создан на GitHub под лицензией репозитория Apache-2.0, описан просто как «Унифицированное понимание и генерация изображений и видео без энкодера». До конца сентября он остаётся с единственным первоначальным коммитом.
• 28–29 сентября 2026 г. — появляется первый коммит репозитория, а arXiv присваивает препринту идентификатор arXiv:2609.38597, датированный 29 сентября, где указаны авторы из NVIDIA и Университета Уотерлу: Cong Wei, Xuanchi Ren, Bryan Chu, Weiming Ren, Huan Ling, Jiahui Huang, Laura Leal-Taixé, Sanja Fidler, Wenhu Chen, Zian Wang и Jay Zhangjie Wu.
• 1 октября 2026, 21:32 UTC — последний коммит в репозиторий под названием «docs: add PixelUMM paper citation».
• 1 октября 2026 г., 21:40 UTC — репозиторий модели Hugging Face создаётся, а через восемь минут наполняется шардами контрольных точек.
Страница проекта размещена по пути, который буквально читается как pixelumm-project-page-preview, а у статьи нет строки с указанием места публикации — ни CVPR, ни NeurIPS, ни «принято на». В совокупности эта последовательность выглядит так, будто исследовательская команда выкладывает артефакт статьи в открытый доступ, а анонсом становится сама загрузка на HF. Это наблюдение, основанное на свидетельствах, а не утверждение о намерениях: у NVIDIA вполне может быть запланирован запуск на более поздний срок, и ничто здесь этого не исключает.

Что такое PixelUMM на самом деле
Тезис дизайна заявлен в первой строке карточки модели: никакого VAE, никакого визуального энкодера. Там, где обычная унифицированная модель имеет два визуальных интерфейса — визуальный трансформер, создающий семантические признаки для понимания, и вариационный автоэнкодер, создающий латентные представления реконструкции для генерации, — у PixelUMM нет ни одного. Изображения разрезаются на патчи размером 16×16 пикселей; видео разрезаются на пространственно-временные тублеты из 4 кадров; и то и другое попадает в бэкбон посредством не более чем однослойных линейных проекций. На входе — сырые пиксели; на выходе — сырые пиксели.
• Архитектура — Transformer, состоящий только из декодера, с эмбеддингами патчей необработанных пикселей и итеративной головкой генерации пикселей; в статье описан как Mixture-of-Transformers, сочетающий общее внимание с параметрами, специфичными для задачи.
• Бэкбон — Qwen3-8B, привязанный к ревизии b968826d9c46dd6066d109eabc6255188de91218. Нужны только его файлы конфигурации и токенизатора; чекпоинт содержит собственные обученные языковые веса.
• Параметры — 15 199 672 064 (примерно 15,2 млрд), в собственных таблицах бенчмарков статьи обозначается как «8B MoT», где нотация размера учитывает backbone и generation expert по отдельности.
• Цели — авторегрессионное предсказание текста и сопоставление потоков в пиксельном пространстве, обучаемые совместно, что позволяет одному набору весов как отвечать на вопрос об изображении, так и рисовать новое.
• Задачи — преобразование текста в изображение, преобразование текста в видео при 96 кадрах / 24 кадра/с / 4 секундах, текст, обусловленный изображением, и текст, обусловленный видео.
Эмпирический раздел статьи необычен в том смысле, который заслуживает отдельного упоминания. Восемь его разделов — это исследования проектных решений, а не позиций в таблице лидеров: размер патча изображения, размер патча видео, артефакты патчей, динамика обучения в пиксельном пространстве по сравнению с пространством VAE, размер модели, масштабирование вычислений, мультимодальное контекстное обусловливание и интерфейсы понимания видео. Это статья, написанная людьми, которые пытаются ответить на вопрос, работает ли подход, а не работа, нацеленная на победу в таблице.
Это собственные цифры авторов.
Каждая цифра ниже приводится авторами PixelUMM в их собственном препринте. Независимого воспроизведения нет, рейтинга Elo на арене нет и оценки третьих сторон нет, потому что модели максимум шесть недель, и она появилась раньше любых внешних испытательных стендов. Относитесь к этим данным как к заявлениям со ссылкой для скачивания, а не как к подтверждённой производительности.
• Понимание изображений — MMMU 41.67, MMStar 53.99, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00, BLINK 53.46, MMMU-Pro 27.63, по официальному протоколу LMMS-Eval (64,750 генераций в рамках 21 задачи).
• Понимание видео — MVBench 70.53, Video-MME 57.33 без субтитров, LongVideoBench 59.61, LVBench 40.41.
• Генерация изображений — GenEval в целом 0.83 с LLM-переписывателем промптов, 0.77 без него; DPG-Bench в целом 85.74.
• Генерация видео — VBench, часть 1: оценка качества 84.10, оценка семантики 79.80; VBench, часть 2: итог 83.24.
Честное прочтение таково: это конкурентоспособные в пределах класса показатели, а не лидирующие в категории, и статья сама это признаёт: в ней отмечается, что, поскольку обучающие данные различаются между моделями, результаты «не позволяют установить, какая архитектура превосходит другие». В сравнении с Qwen3-VL-8B разрыв в понимании изображений велик на MMMU (41,67 против 69,60) и на MMMU-Pro, где авторы не приводят сопоставимого показателя. В сравнении с Qwen-Image 20B разрыв в GenEval составляет 0,83 против 0,87. PixelUMM, судя по его собственным показателям, не является моделью передового уровня. А является он, судя по его собственным показателям, моделью на 15B с действительно необычной архитектурой, которая оказывается в том же диапазоне, что и специализированные системы вокруг неё.
Самая острая грань — это лицензия, а не бенчмарк
Репозиторий распространяется под лицензией Apache-2.0, и в карточке модели это прямо указано. Чекпойнт — это другой артефакт с другими условиями, и именно эта деталь чаще всего может застать команду врасплох. Веса поставляются под лицензией NVIDIA One-Way Noncommercial License, использование которых ограничено некоммерческими исследованиями или оценкой — существенно более узкое разрешение, чем у кода, находящегося рядом. Один исходный файл в репозитории, modeling/pixelumm/modeling_utils.py, дополнительно сохраняет уведомление CC BY-NC 4.0, унаследованное от DiT.
Для исследовательской группы, команды оценщиков или любого, кто публикует статью, это вполне пригодная лицензия. Для продуктовой команды, прототипирующей внутреннюю функцию, это первое, что нужно показать юристам, и ответ может быть «нет». Модель, которую вы не можете выпустить, — это актив иного рода, чем модель, которую можете, и никакой паритет по бенчмаркам этого не меняет.

Что нужно, чтобы запустить это
Это не загрузка на выходные. Документация по окружению требует Linux x86-64, Python 3.12, набор инструментов разработки CUDA 13.0, GPU NVIDIA и FlashAttention, собранный из исходников с использованием этого набора инструментов — CUDA-образ только для выполнения не подойдёт. Сам чекпоинт — это не файл model.safetensors: это 128 .distcp шардов общим объёмом примерно 30 ГБ плюс скрытый индекс .metadata, и загрузчик требует наличия каждого указанного шарда и этого индекса.
Ещё две детали определяют, что вы действительно можете с ним делать. Во-первых, text-to-video по умолчанию задействует защитные механизмы Cosmos, а для них нужен доступ к репозиторию nvidia/Cosmos-1.0-Guardrail с ограниченным доступом и второе окружение Python с другой мажорной версией Transformers — одного входа недостаточно, чтобы разблокировать веса. Во-вторых, игрушечный пример обучения из четырёх шагов — единственный опубликованный рецепт обучения — согласно документации требует семи GPU с как минимум 48 ГиБ каждая и около 61 ГБ свободного дискового пространства для выходных данных. Дообучение на рабочей станции — не предполагаемый путь; инференс на одной современной карте — вот для чего это предназначено.
Репозиторий поставляется с четырьмя чекпоинтами. S8-F22-R05 — это чекпоинт по умолчанию и тот, который используется для оценки в статье, охватывая все четыре задачи. S8-F18-R01 прошёл дополнительные 10 000 шагов дообучения при 480p и 720p и обычно даёт немного лучшие результаты text-to-video, но не умеет понимать видео. S8-F19-R03 и S8-F21-R02 — промежуточные этапы. Выбор между ними — это настоящее решение, а не деталь.
Что не подтверждено
Короткий список — и он важнее длинного, что выше.
• Никаких объявлений от NVIDIA. Ни пресс-релиза, ни публикации в собственном блоге компании об этой модели на момент написания не появилось. Такое тихое появление может быть намеренным — исследовательские артефакты часто выпускаются именно так, — а может быть, запуска просто ещё не было.
• Независимой оценки нет. Все числа в этой статье принадлежат самим авторам. Ничего не перепроверялось за пределами NVIDIA и Waterloo.
• Нигде нет хостингового маршрута. Сегодня вы не можете вызывать PixelUMM через API, и это касается в том числе OrcaRouter — мы его не маршрутизируем, и не можем, потому что чекпоинт с некоммерческой лицензией — это не то, что может предложить коммерческая платформа для предоставления услуг. Тот, кто говорит вам обратное, описывает вариант с самостоятельным хостингом.
• Позиция по будущему лицензированию не заявлена. Некоммерческие условия — это условия в том виде, в каком они поставляются. Смягчат ли их — неизвестно, и, учитывая историю NVIDIA с исследовательскими чекпоинтами, рассчитывать на это не стоит.

За чем следить дальше
Три события превратили бы PixelUMM из исследовательского артефакта в нечто, чем сможет пользоваться более широкая аудитория. Первое — изменение лицензии на чекпоинт: этот единственный файл — вся преграда между «интересно» и «можно использовать в продукте». Второе — официальный запуск от NVIDIA, который принёс бы позиционирование, какое репозиторий дать не может: для чего эта модель и является ли она продуктовым направлением или статьёй. Третье — первое независимое воспроизведение, скорее всего повторный прогон GenEval или MVBench кем-то с запасным кластером GPU, — и это момент, когда числа авторов перестают быть единственными числами.
До тех пор правильная позиция — та, которую подтверждают доказательства. PixelUMM существует, код и статья опубликованы и доступны для чтения, веса скачиваются, и ни одна из заявлений о производительности не была проверена кем-либо за пределами команды, сделавшей их. Это не критика работы — так выглядит исследовательский релиз, которому шесть недель. Это также ровно та ситуация, когда слой маршрутизации позже окупит себя, если лицензия когда-нибудь смягчится: один ключ для моделей, которым вы уже доверяете, цены из прайс-листа без наценки, и отказоустойчивое переключение, позволяющее направить часть трафика на что-то непроверенное, не ставя на это продакшен-путь. Но пока честное резюме проще. NVIDIA создала нечто необычное, тщательно это опубликовала и никому не сказала. Репозиторий и есть анонс.
