Титульная карточка для сравнения 'InternLumina-U2 vs North Micro Vision Instruct' с подзаголовком 'Документ-ридер, который можно запустить сегодня, против 16B-модели, которой ещё нет' и тремя чипами статистики — 'North Micro: 2.4B, доступен сегодня', 'InternLumina-U2: 16B, весов пока нет', 'ChartQA 0.808 против 86.52 (оба заявлены)' — с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

InternLumina-U2 против North Micro Vision Instruct: Doc Reader, который можно запустить уже сегодня, против 16B-модели, которая ещё не готова

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Если на этой неделе вам нужна модель, которая читает документы, скриншоты и диаграммы, в этом сравнении есть короткий практический ответ: North Micro Vision Instruct — это открытая модель с 2,4 миллиарда параметров от Cohere, выпущенная под Apache-2.0, доступная для загрузки с 10 августа 2026 года и достаточно хорошая в работе с документами, чтобы уже сегодня её стоило направить на ваши собственные файлы. InternLumina-U2 — это диффузионная модель Шанхайской лаборатории искусственного интеллекта на 16 миллиардов параметров — куда более амбициозная разработка, которая также заявляет о понимании диаграмм и документов, среди ещё полдюжины других задач, — но её веса не публичны, её репозиторий на Hugging Face — пустая заглушка, и никто нигде пока не может её запустить. Более длинный ответ — о том, что происходит, когда две модели под Apache-2.0 заявляют о пересекающихся возможностях чтения, но только одна из них — то, что можно подержать в руках.

Те 2.4B, которые на самом деле существуют

North Micro Vision Instruct — это специалист по зрению в семействе North от Cohere: примерно 2,4 млрд параметров, компактная модель, созданная для чтения в исходном разрешении. Ключевая идея в том, что большинство моделей зрения уменьшают изображения до фиксированной сетки и теряют мелкие детали, на которых держатся документы, — поэтому North Micro Vision Instruct принимает изображения в их исходном разрешении вплоть до страницы A4 при 200 dpi, сохраняя соотношение сторон и мелкий текст. Заявленные Cohere показатели сильны для данного класса размера: DocVQA — 0,921, ChartQA — 0,808, OCRBench — 0,792; все цифры предоставлены Cohere и независимо не воспроизведены. Подтверждённый мультимодальный контекст — около 8K токенов, а задокументированное слабое место — MMMU (0,329), что напоминает: это специалист по чтению, а не универсальный рассуждатель. У модели нет собственного хостингового API и стандартного хостинг-решения; практическая история — самостоятельный хостинг модели на 2,4 млрд параметров, которая достаточно мала, чтобы работать на одной современной рабочей GPU. Сообщество принимает её стабильно: к концу августа карточка на Hugging Face показывала десятки тысяч загрузок в месяц.

16B, которое является обещанием

InternLumina-U2 — артефакт иного рода. То, что Шанхайская лаборатория искусственного интеллекта опубликовала 1 сентября 2026 года, — это инференс-код и архитектура, а не модель: разреженная диффузионная LLM на основе смеси экспертов, с 16B суммарных параметров и 1B активных, построенная на полностью дискретном визуальном представлении с восемью кодовыми книгами. Среди шести семейств задач, которые покрывает управляющий скрипт репозитория, — текст, понимание изображений, генерация изображений по тексту, редактирование изображений, понимание видео, понимание 3D, — понимание изображений явно включает плотные графики и документы. В предварительной таблице на странице проекта приводятся показатели для графиков и документов, которые лаборатория сообщает в том же диапазоне, что и профильный специалист: ChartQA 86,52, CharXiv-DQ 83,65, а также HallusionBench 62,15 и MathVision 33,22. На странице результаты названы «предварительными, частичными», технический отчет с полными таблицами помечен как «скоро появится», и — решающий факт — весов, с помощью которых можно было бы проверить, нет.

Табло

Все цифры ниже сообщены вендором. Для North Micro Vision Instruct это собственная оценка Cohere; для InternLumina-U2 — предварительная частичная таблица лаборатории.

• Размер и форма — North Micro Vision Instruct: ~2.4B плотная модель, считыватель с нативным разрешением. InternLumina-U2: 16B всего / 1B активных параметров, разреженная MoE, дискретная диффузионная модель с несколькими кодовыми книгами.

• Что это делает — North Micro Vision Instruct: читает изображения, документы, диаграммы и экраны интерфейсов; отвечает текстом с привязкой к источникам. InternLumina-U2: заявляет чтение плюс генерацию — понимает изображения/видео/3D, генерирует и редактирует изображения.

• Веса — North Micro Vision Instruct: в открытом доступе с 10 августа 2026 года (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: не публичны; заглушка на Hugging Face пуста, веса помечены как "скоро".

• Ключевые показатели — North Micro Vision Instruct: DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 (по данным Cohere). InternLumina-U2: ChartQA 86,52, CharXiv-DQ 83,65, HallusionBench 62,15 (по данным лаборатории, предварительно).

• Контекст документа — North Micro Vision Instruct: нативное разрешение до ~A4 при 200 dpi, подтверждённый мультимодальный контекст ~8K. InternLumina-U2: диаграммы с высокой плотностью данных и естественные изображения обрабатываются с помощью энкодера AToken с несколькими кодовыми книгами; контекст пока не указан.

• Известные слабости — North Micro Vision Instruct: MMMU 0,329, нет вызова инструментов — это читатель, а не рассуждатель и не агент. InternLumina-U2: отстаёт как минимум от одного названного конкурента по GenEval (0,81 против 0,89) в собственной неполной таблице; всё непроверено.

• Как это запускается — North Micro Vision Instruct: самостоятельно хостите модель 2.4B; поддержка vLLM ещё только внедрялась, когда писался этот текст. InternLumina-U2: запустить не может никто — весов нет, а выпущенный драйвер требует каталог контрольных точек и файлы токенизатора, которых нет в репозитории.

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Один и тот же бенчмарк — две очень разные эпистемики.

ChartQA — самый наглядный способ увидеть разницу между двумя утверждениями. Обе модели дают число по ChartQA: North Micro Vision Instruct сообщает 0,808 как долю точности, а InternLumina-U2 — 86,52 как процент. Это один и тот же бенчмарк и по сути один и тот же результат — в диапазоне восьмидесяти с чем-то процентов, — только в разных шкалах, с поправкой на разные разбиения данных и настройки промптов, из-за которых сравнение ChartQA между статьями ненадёжно, даже когда обе модели существуют. Ключевая разница — эпистемическая: показатель 0,808 у North Micro Vision Instruct привязан к загружаемому артефакту, поэтому любая команда с GPU и набором диаграмм может воспроизвести или опровергнуть его уже на этой неделе. А показатель 86,52 у InternLumina-U2 привязан к дорожной карте. Число, которое нельзя проверить, — это число, на которое не стоит опираться, — что как раз и признаёт сама лаборатория, помечая свою таблицу как предварительную.

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

Карточка модели CohereLabs/North-Micro-Vision-Instruct на Hugging Face, зафиксированная 27 августа 2026 года — описание видения и языка с нативным разрешением на 2,4 млрд параметров, лицензия Apache-2.0 и заявленные показатели Cohere по чтению документов.

Чтение, в отличие от чтения и рисования

Разрыв в архитектурной философии значит больше, чем разрыв в бенчмарках. North Micro Vision Instruct — это узкий специалист: он читает и делает эту одну задачу достаточно дёшево, чтобы вы могли запускать его на каждой странице, каждом скриншоте, каждом счете в пайплайне, не следя за счётом за GPU. Именно эта дешевизна — ключевая особенность: интеллектуальная обработка документов в масштабе — это проблема стоимости не в меньшей степени, чем проблема точности. InternLumina-U2 — это противоположная ставка: огромная разреженная модель, пытающаяся объединить чтение с генерацией изображений, редактированием изображений, пониманием видео и 3D-пониманием в единый интерфейс дискретных токенов, исходя из теории, что понимание и генерация усиливают друг друга. Если это сработает, это будет инструмент другого класса — но «если это сработает» здесь тянет на себе очень много, и диффузионный MoE 16B-A1B с собственным токенизатором и 3D-предобработкой, отрендеренной в Blender, никогда не станет дешёвым постоянно включённым ридером, каким является специалист на 2.4B. Это не совсем взаимозаменяемые вещи. Это инструмент, который можно развернуть уже сегодня, и направление исследований, к которому можно готовиться.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

Репозиторий InternLM/InternLumina-U2 на GitHub — снимок от 2 сентября 2026 года: целевая страница репозитория с описанием «Omni-Visual Understanding, Image Generation and Editing» и скриптами инференса для каждой задачи; среди них путь понимания изображений — то, что ориентировано на естественные изображения и диаграммы с высокой плотностью данных.

Что это означает, если вы создаете конвейер обработки документов

Ни одна из моделей на OrcaRouter не размещена: North Micro Vision Instruct — модель для самостоятельного развёртывания без публичного API, а у InternLumina-U2 нет весов, которые кто-то мог бы хостить. Так что маршрутизация здесь — не про то, чтобы «вызвать обе через один ключ уже сегодня». Это паттерн на тот день, когда изменится ситуация с любой из них: пайплайн обработки документов почти всегда связывает дешёвую читающую модель с более крупной рассуждающей, а ценность слоя маршрутизации — в том, чтобы оформить эту пару одним вызовом и сохранить честную сквозную передачу с нулевой наценкой на тех размещённых моделях, которые вы действительно используете. Когда чекпоинт под лицензией Apache-2.0, такой как InternLumina-U2, наконец появится, разумный шаг — не вырывать с корнем работающий стек обработки документов, а вывести новичка на тестовый маршрут под защитой автоматического переключения при сбое: пусть он заработает продакшн-трафик, выдержав его, и в тот момент, когда он споткнётся на реальном графике, вызов откатится на модель, которая уже доказала себя. Один API на более чем 200 моделей — это механизм; переключение при сбое — страховочная сеть; специализированная модель, которую можно запускать уже сегодня, — это то, что оплачивает счета, пока обещание 16B всё ещё в силе.

Вердикт

Что касается чтения документов и графиков здесь и сейчас, North Micro Vision Instruct — единственная из двух, которая существует в пригодном для использования виде: компактная, под лицензией Apache-2.0, скачиваемая, с сильными показателями, заявленными вендором, которые действительно можно проверить. InternLumina-U2 — более интересный долгосрочный артефакт, потому что она пытается сделать чтение одним из шести навыков в единой унифицированной модели, и если это сработает, это изменит значение термина «vision model». Следите за её пустым репозиторием на Hugging Face так же, как за обратным отсчётом перед запуском: в день, когда появятся файлы safetensors, обещание превратится в модель, и сравнение станет настоящим. А до тех пор не позволяйте вендорским 86,52 на бенчмарке по графикам перевесить скачиваемые 0,808 при принятии вашего решения.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube