
PixelUMM против North Micro Vision Instruct: некоммерческая исследовательская модель против ридера на 2,4 млрд, который можно выпустить
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 223 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Поставьте North Micro Vision Instruct и PixelUMM рядом — и разница в размере почти что отвлекает: 2,4 млрд параметров у нативного ридера Cohere с нативным разрешением против 15,2 млрд у унифицированной модели NVIDIA. Интересная ось — это энкодер. North Micro Vision Instruct построен традиционным способом — 400M-визуальный энкодер, инициализированный из SigLIP 2 SO400M, питающий 2B-языковую модель, обёрнутую в словарь на 262 144 токена и выпущенный под Apache-2.0. PixelUMM построен на тезисе, что именно такая схема является узким местом, и удаляет энкодер: необработанные патчи 16×16 пикселей подаются в бэкбон Qwen3-8B через однослойные линейные проекции, и те же веса генерируют видео, а также отвечают на вопросы о нём. Один — это специализированное устройство для чтения, которое можно скачать и развернуть уже сегодня. Другой — исследовательский тезис со ссылкой для скачивания и лицензией, которая не позволяет использовать его в продуктах.
Приведённые ниже показатели обеих моделей взяты из их собственных лабораторий. Ни те, ни другие не были независимо воспроизведены, и обе публикуют разные наборы бенчмарков, поэтому область пересечения уже, чем кажется.
Аргументы в пользу скучной архитектуры
North Micro Vision Instruct был опубликован на Hugging Face 10 августа 2026 года, имел восемь недель, чтобы набрать пользователей, и к началу октября показывал примерно 180 000 загрузок и 150 лайков — на порядок больше внимания, чем у репозитория PixelUMM, которому всего несколько дней. Его посыл конкретен и прозаичен: большинство моделей компьютерного зрения уменьшают изображение до фиксированной сетки и теряют мелкие детали, на которых держатся документы, поэтому эта модель обрабатывает изображения в нативном разрешении, сохраняя соотношение сторон и мелкий текст.
• Параметры — всего 2,4 млрд: языковая модель на 2 млрд параметров плюс визуальный энкодер на 400 млн, специально обученный на основе SigLIP 2 SO400M.
• Контекст — языковой бэкбон на 128K токенов, однако подтверждённый рабочий диапазон для мультимодальности составляет около 8K токенов. В карточке прямо указано, что более длинные мультимодальные контексты опираются на экстраполяцию и не проверялись бенчмарками.
• Входы и выходы — на входе чередующиеся текст и изображения, на выходе текст. Многоязычность: более одиннадцати языков. Никакой генерации любого рода.
• Заявленные оценки — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, все заявлены Cohere и не воспроизведены. MMMU 0.329, и карточка этого не скрывает: это специалист по чтению, а не универсал в рассуждениях.
• Развёртывание — Transformers 5.16.0 и ускоритель, одна современная GPU при 2.4B в bfloat16, Flash Attention 2 — опционально, а не обязательно.
В этом дизайне нет ничего нового. Это также причина, по которой его можно скачать, дообучить и уже на этой неделе поставить перед реальными документами.

Аргументы против этого, выдвинутые другой стороной
Препринт PixelUMM начинается с указания цены этой архитектуры. Замороженный предварительно обученный на веб-данных трансформер компьютерного зрения предоставляет семантические признаки для понимания; отдельный VAE предоставляет ориентированные на реконструкцию латентные представления для генерации; использование обоих примерно удваивает визуальный контекст на каждое условное изображение и вынуждает перестраивать конвейеры визуально-языкового предобучения вокруг второго потока. North Micro Vision Instruct избегает удвоения лишь за счёт полного отказа от второй задачи — он не генерирует, поэтому ему нужен один интерфейс, а не два.
PixelUMM доводит эту мысль до логического завершения. Ни кодера, ни VAE, ни токенизатора: патчи размером 16×16 пикселей для изображений, пространственно-временные тубулеты из 4 кадров для видео — и то и другое попадает в Transformer, состоящий только из декодера, через однослойные линейные проекции; понимание достигается авторегрессионным текстом, а генерация — flow matching в пиксельном пространстве. Восемь его эмпирических разделов — это исследования проектных решений, а не побед в лидербордах: размер патча, артефакты патчей, динамика обучения в пиксельном пространстве в сравнении с VAE-пространством, масштабирование вычислений; иными словами, это статья, которая спрашивает, выдерживает ли парадигма проверку, а не заявляет, что она уже победила.
• Визуальный путь — North Micro Vision Instruct: предобученный визуальный энкодер на 400M при нативном разрешении. PixelUMM: без энкодера; необработанные патчи через линейную проекцию.
• Что он умеет — North Micro Vision Instruct: распознавать изображения и документы, отвечать текстом, локализовать объекты и создавать подписи. PixelUMM: распознавать изображения и видео, а также генерировать изображения и 4-секундное видео по тексту.
• Масштаб — 2,4B плотных параметров против примерно 15,2B общих на базе Qwen3-8B, обозначается как «8B MoT» в собственных таблицах статьи.
• Лицензия — Apache-2.0 на код и веса в сравнении с Apache-2.0 на код и лицензией NVIDIA One-Way Noncommercial License на чекпойнт.

Честное прочтение двух табло
Две модели публикуют разные бенчмарки, и там, где они пересекаются, шкалы различаются.
• DocVQA — North Micro Vision Instruct 0,921 в виде доли точности. PixelUMM 90,42 в процентах. Одно и то же название бенчмарка, разные разбиения и настройки промптов, и только один из этих двух называет обработку в нативном разрешении причиной.
• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. И снова примерно тот же диапазон, если перестать сравнивать исходные строки.
• OCRBench — North Micro Vision Instruct 0,792. PixelUMM 78,00.
• MMMU — North Micro Vision Instruct 0.329, PixelUMM 41.67. Оба показателя низки по меркам больших визуально-языковых моделей, и обе лаборатории сообщают о них без прикрас.
• Только PixelUMM — MVBench 70,53, Video-MME 57,33, LongVideoBench 59,61, GenEval 0,83 с рерайтером промптов, качество VBench Part 1 — 84,10.
• North Micro Vision Instruct — привязка к контексту, создание подписей и мультиагентность; документально зафиксированное отсутствие какого-либо агентного поведения
В этом пересечении поражает то, насколько близко специализированная модель на 2,4 млрд параметров подходит к универсальной модели на 15,2 млрд параметров в чтении документов и диаграмм. Это не свидетельство того, что подход без энкодера терпит неудачу, — это свидетельство того, что чтение документов — задача, для которой компактный энкодер с нативным разрешением подходит очень хорошо, а архитектура PixelUMM нацелена на другой аргумент. В собственной статье PixelUMM этот момент признаётся во фразе, которую стоит процитировать: поскольку обучающие данные различаются между моделями, её результаты «не позволяют установить, какая архитектура превосходит другую».
Где на самом деле оказывается решение
Если у вас есть документы, графики, формы или скриншоты и вам нужны ответы уже в этом месяце, North Micro Vision Instruct — практичный выбор, и это даже не близко: Apache-2.0, 2.4B, стандартный путь загрузки Transformers, никакой среды с защитными ограничениями, никакого индекса распределённых контрольных точек, никакого второго стека Python. Дообучите её на собственном распределении документов — и у вас получится специалист. Оговорка — область применения: направьте её на задачу рассуждения, и число MMMU вас найдёт.
Предложение PixelUMM — это широта охвата и исследовательский вопрос. Он читает и генерирует изображения и видео на основе одного набора весов, и это с большим отрывом более интересный материал. Но его чекпоинт распространяется по некоммерческой лицензии, его веса — это 128 шардов распределённого чекпоинта общим объёмом около 30 ГБ, скрытых за индексом метаданных, ему требуется набор инструментов CUDA 13 с FlashAttention, скомпилированным из исходного кода, а его конвейер текст-в-видео задействует защитные механизмы Cosmos, для которых нужен репозиторий с контролируемым доступом и отдельное окружение. Это лабораторный стенд, а не развёртывание.
Аспект маршрутизации появится позже — если вообще появится. Ни одна из этих моделей сегодня не доступна через какой-либо хостинговый API — OrcaRouter не маршрутизирует ни одну из них — и ни одна из них не будет, пока этого не позволит их лицензирование. Когда такая модель, как North Micro Vision Instruct, всё же появляется за общим эндпоинтом, причина предпочесть такой вариант прямой интеграции — обычная: один ключ для 200+ моделей, прейскурантные цены провайдеров, передаваемые с наценкой 0%, отказоустойчивость, которая понижает модель, показывающую результаты хуже, чем указано в её карточке, и не нужно согласовывать второй контракт, когда вы хотите провести A/B-тестирование замены. Это описание рабочего процесса, а не утверждение о доступности.
Тот единственный тест, который бы их разделил
Запустите обе на одном и том же наборе документов с одинаковым разрешением и оцените случаи с мелким текстом, затем измените одну переменную: исключите визуальный энкодер из сравнения, подав на вход PixelUMM данные в его нативном разрешении. Если модель без энкодера справляется с плотным текстом при затратах по параметрам, составляющих лишь долю, это сильнейшее из возможных доказательств в пользу тезиса — и это тест, который может запустить любой, у кого есть свободная видеокарта, потому что оба чекпойнта можно скачать. Пока кто-нибудь этого не сделает, прагматичный вывод остаётся в силе: небольшой ридер Apache-2.0 — это тот, который вы развёртываете, а крупная некоммерческая универсальная модель — та, которую вы изучаете.
