
PixelUMM против InternLumina-U2: две бета-версии без энкодера и единственное различие, которое всё решает
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 223 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Две модели, обе публичные, обе необычно устроенные, и только на одной из них можно построить продукт. PixelUMM — это унифицированная модель NVIDIA без энкодера: 15,2 млрд параметров на базе Qwen3-8B, читает и записывает необработанные пиксели через патчи 16×16 и 4-кадровые тубулеты, без VAE и без какого-либо визуального энкодера где-либо в стеке. InternLumina-U2 — это 16B диффузионная модель смеси экспертов от Shanghai AI Laboratory, которая сжимает каждый визуальный вход в восемь взаимодополняющих дискретных кодов с помощью токенизатора под названием AToken. Обе ставили на то, что визуальный интерфейс — узкое место. Но ставка, которая важнее, — это то, что в файлах лицензии: InternLumina-U2 поставляется с весами под Apache-2.0, PixelUMM поставляется с чекпоинтом под некоммерческой лицензией. Если вы выбираете между ними для чего-либо коммерческого, это предложение и есть всё сравнение, а остальная часть этой страницы — контекст к нему.
Оба приведённых ниже набора показателей исходят от самих лабораторий. Ни одна из моделей не имеет независимой оценки, Elo на арене или воспроизведения третьей стороной. Ни одна из них не обслуживается через какой-либо хостируемый API. Различается то, что вам разрешено делать с артефактом после его скачивания, и насколько каждый релиз действительно продвинулся.
Где сейчас находится каждый из них
Сроки релизов сдвигались с разной скоростью, причём оба — тихо.
• PixelUMM — репозиторий GitHub создан 4 сентября 2026 г.; препринт arXiv 2609.38597 от 29 сентября 2026 г.; репозиторий модели на Hugging Face создан 1 октября 2026 г. в 21:40 UTC. Ни записи в блоге NVIDIA, ни пресс-релиза, ни треда о запуске, посвящённых ему, не обнаружено.
• InternLumina-U2 — репозиторий GitHub создан 1 сентября 2026 г.; заглушка на Hugging Face зарегистрирована в тот же день; веса контрольной точки, обученной на Ascend, добавлены 10 сентября 2026 г.; веса контрольной точки NVIDIA/CUDA добавлены 24 сентября 2026 г. Семь шардов на каждый стек, оба доступны для скачивания сегодня.
Тот InternLumina-U2, что существовал в начале сентября — только код, веса «скоро появятся», пустой репозиторий модели — это уже не тот InternLumina-U2, который существует сейчас. Всем, кто читал о нём в начале месяца и решил, что веса отсутствуют, стоит проверить снова; и чекпоинты для Huawei Ascend, и для NVIDIA/CUDA уже выложены, под лицензией Apache-2.0, вместе с токенизатором, конфигурацией, шаблоном чата и кодом удалённого моделирования.

Два ответа на один и тот же вопрос
Обе модели отталкиваются от одной и той же жалобы: использование визуального энкодера для понимания и VAE для генерации означает представление каждого изображения дважды, примерно удваивая визуальный контекст и вынуждая пайплайн обучения поддерживать два интерфейса.
Ответ PixelUMM — удалить и то и другое. Сырые пиксели поступают напрямую через однослойные линейные проекции — патч 16×16 на каждую позицию изображения, 4-кадровый тьюблет на каждую позицию видео — а основой служит decoder-only Transformer, чья архитектура Mixture-of-Transformers сочетает общее внимание с параметрами, специфичными для задачи. Текст предсказывается авторегрессионно; пиксели — с помощью flow matching. В статье восемь разделов посвящены исследованиям дизайна — размер патча, артефакты патчей, динамика в пиксельном пространстве против пространства VAE, масштабирование вычислений — что говорит о том, что настоящий вопрос команды был: работает ли эта парадигма вообще.
Ответ InternLumina-U2 заключается в том, чтобы сохранить дискретный интерфейс, но сделать каждый токен гораздо более ёмким. Токенизатор AToken описывает каждую визуальную позицию с помощью восьми взаимодополняющих кодовых книг, охватывающих текстуру, встроенный текст и геометрию; восемь эмбеддингов конкатенируются для каждой позиции и проецируются в один токен магистрали. Декодирование работает в обратном направлении, с пространственно параллельным удалением шума и многокнижным авторегрессионным заголовком, предсказывающим восемь кодов по порядку. Магистраль представляет собой разреженную диффузионную LLM из линии LLaDA-2.0, 16B всего с 1B активных.
• Визуальный интерфейс — PixelUMM: необработанные пиксельные патчи и тублеты, вообще без токенизатора. InternLumina-U2: полностью дискретные токены из восьми кодовых книг от AToken, без непрерывного латента.
• Основа — PixelUMM: Qwen3-8B (всего 15,2 млрд), единый плотный декодер с экспертами по пониманию и генерации. InternLumina-U2: всего 16 млрд / 1 млрд активных, разреженная MoE-диффузионная языковая модель.
• Метод генерации — PixelUMM: сопоставление потоков в пиксельном пространстве плюс авторегрессионный текст. InternLumina-U2: маскированное диффузионное шумоподавление по дискретным кодам.
• Заявленные задачи — PixelUMM: преобразование текста в изображение, текста в видео, изображения в текст, видео в текст. InternLumina-U2: то же самое плюс редактирование изображений и понимание 3D.
• Формат весов — PixelUMM: 128 .distcp шардов (~30 ГБ) за скрытым .metadata-индексом. InternLumina-U2: семь .safetensors шардов на аппаратный стек, стандартная структура Hugging Face.

Табло, с прикреплённой к нему информацией о происхождении
Читайте каждую строку как собственное заявление лаборатории. Строки PixelUMM взяты из её препринта; строки InternLumina-U2 — это собственное описание лаборатории, где они названы «предварительными, частичными», а полные таблицы сравнения отложены до технического отчёта, который так и не появился.
• MMMU (рассуждение по изображениям) — PixelUMM 41.67 (по данным авторов). InternLumina-U2: не сообщается.
• ChartQA — PixelUMM 82,96. InternLumina-U2 86,52.
• DocVQA — PixelUMM 90.42. InternLumina-U2: не сообщается.
• Video-MME (без субтитров) — PixelUMM 57.33. InternLumina-U2 51.26.
• MVBench — PixelUMM 70,53. InternLumina-U2 59,74.
• GenEval в целом — PixelUMM 0,83 с LLM-переписчиком промптов, 0,77 без него. InternLumina-U2 0,81.
• DPG-Bench в целом — PixelUMM 85.74. InternLumina-U2 87.10.
• Генерация видео — PixelUMM VBench, часть 1: качество 84.10 / семантика 79.80, часть 2: итог 83.24. InternLumina-U2: не указано.
• 3D-понимание — PixelUMM: такой задачи нет. InternLumina-U2 сообщает 3D MM-Vet 41.8.
Сравнение неравноценно, потому что две лаборатории публикуют разные таблицы, а не потому, что одна из них выигрывает. У PixelUMM есть полноценный раздел по генерации видео и нет редактирования или 3D; InternLumina-U2 заявляет шесть семейств задач и приводит частичную таблицу по ним. Числа из разных лабораторий для одного и того же названия бенчмарка — не одно и то же измерение: разбиения, промпты и сэмплирование различаются, — поэтому считайте строки ChartQA и GenEval примерно равными и на этом остановитесь.
Лицензирование — вот где это перестаёт быть ничьей.
Это та часть, которую не показывает ни одна таблица бенчмарков. Репозиторий PixelUMM — Apache-2.0, и в карточке это указано на видном месте. Чекпойнт — отдельный артефакт под лицензией NVIDIA One-Way Noncommercial License, ограниченной некоммерческими исследованиями или оценкой, а один исходный файл вдобавок сохраняет уведомление CC BY-NC 4.0, унаследованное от DiT. Исследовательское использование: можно. Внутренняя функция продукта: разговор с юристами — и, возможно, короткий.
InternLumina-U2 полностью под Apache-2.0 — и код, и обе контрольные точки, без отдельного исключения для некоммерческого использования. Для команды, которой нужно выпускать продукт, это не маленькое преимущество — это решает всё. Обе модели по зрелости относятся к исследовательскому уровню. Только одну из них можно использовать без ограничений.
Какой именно стоит попробовать и как
Если ваша работа — это понимание видео или вам нужна модель, которая генерирует видео и изображения из одного набора весов, то PixelUMM — более полный артефакт, а его статья — более полезное чтение, — но это исследовательский проект под некоммерческой лицензией, поэтому ему место на стенде оценки, а не в пайплайне. Если ваша работа — это широта генерации диаграмм, документов и изображений или вам нужны редактирование и 3D, InternLumina-U2 охватывает больше областей и не имеет лицензионного потолка; его цена в том, что диффузионный бэкбон 16B-A1B и токенизатор AToken означают реальную инженерную работу по обслуживанию, а его опубликованные показатели явно неполны.
Ни одна из них на момент написания не доступна ни на одном хостируемом API, включая OrcaRouter — мы не маршрутизируем ни одну из этих моделей. Когда это изменится, довод в пользу доступа к ним через слой маршрутизации, а не через прямую интеграцию, будет тем же, что применим к любой недавно открытой модели: один ключ для 200+ моделей, списочные цены провайдеров, передаваемые с наценкой 0%, и автоматическое переключение при сбое, чтобы модель, которая окажется хуже, чем следовало из таблицы её вендора, можно было понизить, изменив маршрут, а не переписывая развёртывание. А до тех пор честный совет — скучный: скачайте тот вариант, лицензия которого допускает ваш сценарий использования, проведите собственную оценку на собственных данных и не планируйте, исходя из цифр ни одной из лабораторий, пока кто-то за пределами лаборатории не перепроверит их.
Что изменило бы ответ?
Три вещи, по степени влияния. Коммерческая лицензия на чекпойнт PixelUMM сделала бы сравнение по-настоящему близким и перевела бы его из «читать статью» в «оценивать веса». Технический отчёт от Shanghai AI Laboratory, содержащий полные таблицы сравнения, превратил бы частичные цифры InternLumina-U2 во что-то проверяемое, а также показал бы, какая доля широты охвата шести задач находится на уровне паритета, а какая — на уровне глубины токенов. А первое независимое воспроизведение любой из этих моделей — повторный прогон GenEval или MVBench командой, не заинтересованной в результате, — это момент, когда любая из них перестаёт быть вендорской таблицей. До тех пор одна — необычная архитектура, которую можно только изучать, а другая — необычная архитектура, которую можно выпускать.
