
InternLumina-U2 против North Micro Vision Instruct: Doc Reader, который можно запустить уже сегодня, против 16B-модели, которая ещё не готова
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Если на этой неделе вам нужна модель, которая читает документы, скриншоты и диаграммы, в этом сравнении есть короткий практический ответ: North Micro Vision Instruct — это открытая модель с 2,4 миллиарда параметров от Cohere, выпущенная под Apache-2.0, доступная для загрузки с 10 августа 2026 года и достаточно хорошая в работе с документами, чтобы уже сегодня её стоило направить на ваши собственные файлы. InternLumina-U2 — это диффузионная модель Шанхайской лаборатории искусственного интеллекта на 16 миллиардов параметров — куда более амбициозная разработка, которая также заявляет о понимании диаграмм и документов, среди ещё полдюжины других задач, — но её веса не публичны, её репозиторий на Hugging Face — пустая заглушка, и никто нигде пока не может её запустить. Более длинный ответ — о том, что происходит, когда две модели под Apache-2.0 заявляют о пересекающихся возможностях чтения, но только одна из них — то, что можно подержать в руках.
Те 2.4B, которые на самом деле существуют
North Micro Vision Instruct — это специалист по зрению в семействе North от Cohere: примерно 2,4 млрд параметров, компактная модель, созданная для чтения в исходном разрешении. Ключевая идея в том, что большинство моделей зрения уменьшают изображения до фиксированной сетки и теряют мелкие детали, на которых держатся документы, — поэтому North Micro Vision Instruct принимает изображения в их исходном разрешении вплоть до страницы A4 при 200 dpi, сохраняя соотношение сторон и мелкий текст. Заявленные Cohere показатели сильны для данного класса размера: DocVQA — 0,921, ChartQA — 0,808, OCRBench — 0,792; все цифры предоставлены Cohere и независимо не воспроизведены. Подтверждённый мультимодальный контекст — около 8K токенов, а задокументированное слабое место — MMMU (0,329), что напоминает: это специалист по чтению, а не универсальный рассуждатель. У модели нет собственного хостингового API и стандартного хостинг-решения; практическая история — самостоятельный хостинг модели на 2,4 млрд параметров, которая достаточно мала, чтобы работать на одной современной рабочей GPU. Сообщество принимает её стабильно: к концу августа карточка на Hugging Face показывала десятки тысяч загрузок в месяц.
16B, которое является обещанием
InternLumina-U2 — артефакт иного рода. То, что Шанхайская лаборатория искусственного интеллекта опубликовала 1 сентября 2026 года, — это инференс-код и архитектура, а не модель: разреженная диффузионная LLM на основе смеси экспертов, с 16B суммарных параметров и 1B активных, построенная на полностью дискретном визуальном представлении с восемью кодовыми книгами. Среди шести семейств задач, которые покрывает управляющий скрипт репозитория, — текст, понимание изображений, генерация изображений по тексту, редактирование изображений, понимание видео, понимание 3D, — понимание изображений явно включает плотные графики и документы. В предварительной таблице на странице проекта приводятся показатели для графиков и документов, которые лаборатория сообщает в том же диапазоне, что и профильный специалист: ChartQA 86,52, CharXiv-DQ 83,65, а также HallusionBench 62,15 и MathVision 33,22. На странице результаты названы «предварительными, частичными», технический отчет с полными таблицами помечен как «скоро появится», и — решающий факт — весов, с помощью которых можно было бы проверить, нет.
Табло
Все цифры ниже сообщены вендором. Для North Micro Vision Instruct это собственная оценка Cohere; для InternLumina-U2 — предварительная частичная таблица лаборатории.
• Размер и форма — North Micro Vision Instruct: ~2.4B плотная модель, считыватель с нативным разрешением. InternLumina-U2: 16B всего / 1B активных параметров, разреженная MoE, дискретная диффузионная модель с несколькими кодовыми книгами.
• Что это делает — North Micro Vision Instruct: читает изображения, документы, диаграммы и экраны интерфейсов; отвечает текстом с привязкой к источникам. InternLumina-U2: заявляет чтение плюс генерацию — понимает изображения/видео/3D, генерирует и редактирует изображения.
• Веса — North Micro Vision Instruct: в открытом доступе с 10 августа 2026 года (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: не публичны; заглушка на Hugging Face пуста, веса помечены как "скоро".
• Ключевые показатели — North Micro Vision Instruct: DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 (по данным Cohere). InternLumina-U2: ChartQA 86,52, CharXiv-DQ 83,65, HallusionBench 62,15 (по данным лаборатории, предварительно).
• Контекст документа — North Micro Vision Instruct: нативное разрешение до ~A4 при 200 dpi, подтверждённый мультимодальный контекст ~8K. InternLumina-U2: диаграммы с высокой плотностью данных и естественные изображения обрабатываются с помощью энкодера AToken с несколькими кодовыми книгами; контекст пока не указан.
• Известные слабости — North Micro Vision Instruct: MMMU 0,329, нет вызова инструментов — это читатель, а не рассуждатель и не агент. InternLumina-U2: отстаёт как минимум от одного названного конкурента по GenEval (0,81 против 0,89) в собственной неполной таблице; всё непроверено.
• Как это запускается — North Micro Vision Instruct: самостоятельно хостите модель 2.4B; поддержка vLLM ещё только внедрялась, когда писался этот текст. InternLumina-U2: запустить не может никто — весов нет, а выпущенный драйвер требует каталог контрольных точек и файлы токенизатора, которых нет в репозитории.

Один и тот же бенчмарк — две очень разные эпистемики.
ChartQA — самый наглядный способ увидеть разницу между двумя утверждениями. Обе модели дают число по ChartQA: North Micro Vision Instruct сообщает 0,808 как долю точности, а InternLumina-U2 — 86,52 как процент. Это один и тот же бенчмарк и по сути один и тот же результат — в диапазоне восьмидесяти с чем-то процентов, — только в разных шкалах, с поправкой на разные разбиения данных и настройки промптов, из-за которых сравнение ChartQA между статьями ненадёжно, даже когда обе модели существуют. Ключевая разница — эпистемическая: показатель 0,808 у North Micro Vision Instruct привязан к загружаемому артефакту, поэтому любая команда с GPU и набором диаграмм может воспроизвести или опровергнуть его уже на этой неделе. А показатель 86,52 у InternLumina-U2 привязан к дорожной карте. Число, которое нельзя проверить, — это число, на которое не стоит опираться, — что как раз и признаёт сама лаборатория, помечая свою таблицу как предварительную.

Карточка модели CohereLabs/North-Micro-Vision-Instruct на Hugging Face, зафиксированная 27 августа 2026 года — описание видения и языка с нативным разрешением на 2,4 млрд параметров, лицензия Apache-2.0 и заявленные показатели Cohere по чтению документов.
Чтение, в отличие от чтения и рисования
Разрыв в архитектурной философии значит больше, чем разрыв в бенчмарках. North Micro Vision Instruct — это узкий специалист: он читает и делает эту одну задачу достаточно дёшево, чтобы вы могли запускать его на каждой странице, каждом скриншоте, каждом счете в пайплайне, не следя за счётом за GPU. Именно эта дешевизна — ключевая особенность: интеллектуальная обработка документов в масштабе — это проблема стоимости не в меньшей степени, чем проблема точности. InternLumina-U2 — это противоположная ставка: огромная разреженная модель, пытающаяся объединить чтение с генерацией изображений, редактированием изображений, пониманием видео и 3D-пониманием в единый интерфейс дискретных токенов, исходя из теории, что понимание и генерация усиливают друг друга. Если это сработает, это будет инструмент другого класса — но «если это сработает» здесь тянет на себе очень много, и диффузионный MoE 16B-A1B с собственным токенизатором и 3D-предобработкой, отрендеренной в Blender, никогда не станет дешёвым постоянно включённым ридером, каким является специалист на 2.4B. Это не совсем взаимозаменяемые вещи. Это инструмент, который можно развернуть уже сегодня, и направление исследований, к которому можно готовиться.

Репозиторий InternLM/InternLumina-U2 на GitHub — снимок от 2 сентября 2026 года: целевая страница репозитория с описанием «Omni-Visual Understanding, Image Generation and Editing» и скриптами инференса для каждой задачи; среди них путь понимания изображений — то, что ориентировано на естественные изображения и диаграммы с высокой плотностью данных.
Что это означает, если вы создаете конвейер обработки документов
Ни одна из моделей на OrcaRouter не размещена: North Micro Vision Instruct — модель для самостоятельного развёртывания без публичного API, а у InternLumina-U2 нет весов, которые кто-то мог бы хостить. Так что маршрутизация здесь — не про то, чтобы «вызвать обе через один ключ уже сегодня». Это паттерн на тот день, когда изменится ситуация с любой из них: пайплайн обработки документов почти всегда связывает дешёвую читающую модель с более крупной рассуждающей, а ценность слоя маршрутизации — в том, чтобы оформить эту пару одним вызовом и сохранить честную сквозную передачу с нулевой наценкой на тех размещённых моделях, которые вы действительно используете. Когда чекпоинт под лицензией Apache-2.0, такой как InternLumina-U2, наконец появится, разумный шаг — не вырывать с корнем работающий стек обработки документов, а вывести новичка на тестовый маршрут под защитой автоматического переключения при сбое: пусть он заработает продакшн-трафик, выдержав его, и в тот момент, когда он споткнётся на реальном графике, вызов откатится на модель, которая уже доказала себя. Один API на более чем 200 моделей — это механизм; переключение при сбое — страховочная сеть; специализированная модель, которую можно запускать уже сегодня, — это то, что оплачивает счета, пока обещание 16B всё ещё в силе.
Вердикт
Что касается чтения документов и графиков здесь и сейчас, North Micro Vision Instruct — единственная из двух, которая существует в пригодном для использования виде: компактная, под лицензией Apache-2.0, скачиваемая, с сильными показателями, заявленными вендором, которые действительно можно проверить. InternLumina-U2 — более интересный долгосрочный артефакт, потому что она пытается сделать чтение одним из шести навыков в единой унифицированной модели, и если это сработает, это изменит значение термина «vision model». Следите за её пустым репозиторием на Hugging Face так же, как за обратным отсчётом перед запуском: в день, когда появятся файлы safetensors, обещание превратится в модель, и сравнение станет настоящим. А до тех пор не позволяйте вендорским 86,52 на бенчмарке по графикам перевесить скачиваемые 0,808 при принятии вашего решения.
