Титульная карточка для North Micro Vision Instruct с надписью «North Micro Vision Instruct» и подзаголовком «Cohere's 2.4B Apache-2.0 document VLM», а также чипом, отмечающим, что он был выпущен 12 августа 2026 года, над тремя линейными значками для сканирования документов, чтения графиков и привязки ограничивающих рамок.
Guides & Insights

North Micro Vision Instruct: незаметная документная VLM от Cohere с 2,4 млрд параметров — объясняем

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

CohereLabs/North-Micro-Vision-Instruct — сокращённо «North Micro Vision» — это визуально-языковая модель с 2,4 млрд параметров, которая вышла тихо: веса появились на Hugging Face 10 августа 2026 года, объявление Cohere последовало 12 августа, а день спустя всё ещё нет ни публичного API, ни прайс-листа, ни записи в сторонних лидербордах. North Micro Vision создана для одной задачи — чтения документов в исходном разрешении, как человек щурится на отсканированную страницу A4, а не как модель генерации подписей, которая скользит взглядом по миниатюре, — и её карточка модели необычно прямо говорит о том, чем она не является: ни вызова инструментов, ни цикла рассуждений, системные промпты активно не рекомендуются. Это материал в духе «что мы знаем на данный момент», поэтому каждая цифра ниже помечена: что устанавливает сам репозиторий, что заявляет Cohere, но никто не воспроизвёл, и что добавляет единственный сторонний обзор, опубликованный на данный момент.

Что на самом деле выпустила Cohere

Всё в этом разделе читается напрямую из репозитория: config.json, README и карточки модели. Это основные источники Cohere, и для большей части того, что известно о модели, они являются единственными источниками.

• Размер — 2,4B параметров всего: визуальный энкодер на ~400M и языковая модель "North Micro LLM" на 2B, в bfloat16, около 4,97 ГБ весов.

• Лицензия — Apache 2.0, разрешает коммерческое использование, веса и токенизатор открыты

• Визуальный энкодер — специально обученный под нативное разрешение, инициализированный из SigLIP 2 SO400M

• Языковая модель — собственная 2B North Micro LLM, построенная на архитектуре Command A+: три слоя внимания со скользящим окном, чередующиеся с одним глобальным слоем внимания, внимание с группировкой запросов (16 голов запросов на 8 голов KV), связанные эмбеддинги, словарь из 262 144 токенов.

• Проектор — "DeepStack": эмбеддинги патчей из нескольких слоёв зрительного энкодера внедряются в ранние языковые слои, а не добавляются один раз в начале, — так мелкий текст и геометрия таблиц сохраняются.

• Разрешение — ввод в исходном разрешении с сохранением пропорций, до примерно 1654 × 2339 пикселей, что соответствует одной странице формата A4 при примерно 200 DPI.

• Контекст — 128K текстового контекста на языковом ядре; 8K проверенного мультимодального контекста (подробности ниже)

• Языки — поддерживается 11: английский, китайский, немецкий, французский, испанский, итальянский, португальский, хинди, японский, корейский, арабский

Суффикс «Instruct» имеет значение. Это чекпоинт, дообученный под инструкции — модель для чата и визуальных вопросов-ответов — и на момент написания это единственный чекпоинт. В дереве моделей уже перечислены одиннадцать квантизаций от сообщества и три дообученные версии, но отдельного базового варианта под другим именем опубликовано не было.

Почему архитектура заслуживает абзаца

Большинство VLM размером 2-3B уменьшают ваше изображение до фиксированной сетки и теряют мелкий шрифт. Ставка North Micro Vision противоположна: сохранять разрешение, тратить токены. Визуальный энкодер использует 2D RoPE плюс обучаемые одномерные позиционные эмбеддинги, а проектор DeepStack подаёт патч-эмбеддинги в несколько языковых слоёв, а не в одно добавление в начало, — именно поэтому плотно заполненная таблица или сноска не теряется. Позиционное кодирование — это перемежающееся mRoPE, поэтому количество визуальных токенов масштабируется вместе с разрешением изображения, а не ограничивается заранее заданным значением.

Этот выбор и есть весь продукт — и у него есть цена. Согласно анализу запуска RohitAI, нативная страница A4 при максимальном разрешении составляет примерно 3 800 объединённых визуальных позиций. Прочитайте это число вместе с приведённым ниже контекстным предостережением: 3 800 визуальных токенов плюс промпт могут заполнить большую часть проверенного мультимодального окна, прежде чем вы зададите свой вопрос.

Бенчмарк-карта при честном прочтении

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

Каждая цифра в этом разделе предоставлена вендором. Ни одна из них не была воспроизведена независимой лабораторией, и модель пока не появляется ни в одном публичном рейтинге. На бумаге показатели действительно сильны в том, на что указывает Cohere:

• DocVQA — 0.921 (визуальный вопросно-ответный анализ документов)

• ChartQA — 0.808 (чтение графиков)

• OCRBench — 0.792 (OCR в реальных условиях)

• RefCOCO граундинг — 0.732 средний P@1 (указание на объекты)

• MMMU — 0.329 (мультимодальные знания уровня колледжа — слабое место, как и ожидалось при таком размере)

• IFEval — 0.749 (следование инструкциям)

Формулировка запуска Cohere утверждает, что North Micro Vision превосходит Gemma 4 E2B и Ministral 3 3B «по ряду бенчмарков визуального понимания», при этом сила сосредоточена в понимании документов и визуальном QA. Это заявление Cohere о модели Cohere — относитесь к нему соответственно. Одна загвоздка: сравнение Cohere с семейством Liquid использовало контрольную точку 1.6B, а не 3B, поэтому в карточке нет корректного сравнения North и LFM2.5-VL-3B, даже несмотря на то, что обе модели будут конкурировать за один и тот же бюджет на периферийные документы.

Единственный сторонний обзор, опубликованный на данный момент, — прогон одного блогера, а не лабораторный набор тестов, — дополняет картину, которую карточка модели оставляет без внимания. В нём сообщается, что North Micro Vision превосходит Ministral 3 3B Instruct по пяти из семи строк в категориях документов, диаграмм и OCR, что соответствует подаче вендора. Но также сообщается, что Qwen3.5-2B превосходит North Micro Vision по шести из этих семи строк и по всем раскрытым строкам general-VQA, reasoning, counting, hallucination и text-knowledge; единственная победа North Micro Vision над Qwen3.5-2B в этом наборе — AI2D. А английский OCRBench v2 показывает 0,367 против основного показателя OCRBench 0,792 — напоминание о том, что оценки OCR сильно зависят от того, какой сплит и какой уровень сложности запускать. Один прогон — не приговор, но это первое свидетельство того, что реальный конкурент North Micro Vision в этом размере — семейство Qwen 3.5, а не модели, которые Cohere выбрала для сравнительного тестирования.

Одно контекстное окно, два числа

На карточке указано 128K текстового контекста и 8K проверенного мультимодального контекста, и разрыв между этими двумя значениями играет реальную роль. Число 128K относится только к языковому ядру; промпты, сочетающие изображения и текст и превышающие 8K токенов, никогда не обучались и не проверялись, так что всё, что выходит за эту границу, — экстраполяция. Поскольку плотная страница формата A4 занимает примерно 3 800 визуальных позиций, окно в 8K можно заполнить одним документом и коротким вопросом. Практический вывод: планируйте свой пайплайн вокруг нарезки страниц на области — таблица, блок подписей, отдельный счёт — вместо того чтобы подавать целые страницы и рассчитывать на продолжительный диалог по их содержимому.

Что нельзя делать согласно карточке модели

North Micro Vision — это слой восприятия, а не агент, и Cohere с завидной прямотой об этом заявляет. В карточке модели сказано, что она не является моделью рассуждений, обладает ограниченными способностями в математике и программировании, не поддерживает вызов инструментов и агентные сценарии, и не должна заменять более крупного универсального ассистента. Она идёт дальше большинства карточек: не рекомендует использовать системные промпты, потому что они не использовались при обучении модели. Калиброванных оценок уверенности тоже нет. Из этого следует разделение: North Micro Vision читает и извлекает, схема отвечает за структуру, правила — за инварианты, более сильная модель обрабатывает неоднозначные запросы, а человек утверждает всё, что имеет последствия. Относитесь к тексту на странице как к данным, а не как к правилам: отсканированная инструкция, спрятанная в документе, — это ровно тот вид визуальной промпт-инъекции, от которого защищает это разделение.

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

Как запустить это сегодня

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

Краткое руководство честно признаёт собственные шероховатости: карточка модели требует Transformers 5.16.0, который на момент запуска не был последним стабильным релизом PyPI, поэтому ранним пользователям приходится устанавливать из исходников. Публичная поддержка vLLM указана как «скоро»; Cohere тестировала модель с внутренней сборкой vLLM. В остальном поддержка экосистемы с первого дня хорошая: рецепты NVIDIA NeMo AutoModel для развертывания на периферийных устройствах и GPU, рецепты Axolotl для QLoRA и полной тонкой настройки, а также квантизации MLX от сообщества для Apple Silicon — 4-битная сборка составляет около 2,17 ГБ. Отдельно стоит назвать одну ловушку развертывания: задавайте max_pixels явно, потому что sequence_len не ограничивает количество токенов изображения, и без этого можно случайно выйти за пределы проверенного мультимодального окна.

North Micro Vision нет в OrcaRouter и, судя по его собственной карточке, нет ни у одного инференс-провайдера — это история про самостоятельный хостинг, и точка. Именно поэтому в следующем предложении важен слой маршрутизации: как только любой провайдер поднимет для неё эндпоинт, роутер позволит вам поставить свежую модель под Apache-2.0 рядом с теми, к которым вы уже обращаетесь в проде, — один API, без нового контракта, цена провайдера передаётся как есть с наценкой 0%, и автоматический фейловер, чтобы непроверенная модель принимала реальный трафик, а проверенная подхватывала вызовы, с которыми первая не справляется. Пока такого эндпоинта не существует, единственное сравнение, которое вы реально можете провести сегодня, — это сравнение этого чекпоинта с размещёнными в облаке моделями для работы с документами, за которые вы уже платите, бок о бок на ваших собственных страницах.

Кому следует двигаться, а кому — ждать

Действуйте, если у вас есть ограниченная задача по извлечению данных из документов — счета, банковские выписки, контракты, структурированные формы — и требования к локализации данных или аудиту, из-за которых облачный API непривлекателен. Лицензия Apache 2.0, дешёвая доменная адаптация QLoRA и энкодер с нативным разрешением — действительно необычное сочетание для такой рабочей нагрузки, а ограничения самой карточки достаточно ясны, так что сюрпризов не будет. Ждите, если вам нужен облачный эндпоинт, оплата за каждый токен или агентное поведение — ничего этого пока нет. И не спешите считать какой-либо из приведённых выше бенчмарков окончательным: все ключевые цифры принадлежат Cohere, единственный внешний прогон рисует более спорную картину в верхней части класса малых моделей, а сама модель выпущена менее недели назад. Главное, за чем стоит следить, — это история с развёртыванием: в тот день, когда и стандартные Transformers, и публичный релиз vLLM будут её поддерживать, North Micro Vision перестанет быть репозиторием, с которым приходится бороться, и станет моделью, которую можно просто навести на свои документы.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube