
North Micro Vision Instruct: незаметная документная VLM от Cohere с 2,4 млрд параметров — объясняем
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 144 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
CohereLabs/North-Micro-Vision-Instruct — сокращённо «North Micro Vision» — это визуально-языковая модель с 2,4 млрд параметров, которая вышла тихо: веса появились на Hugging Face 10 августа 2026 года, объявление Cohere последовало 12 августа, а день спустя всё ещё нет ни публичного API, ни прайс-листа, ни записи в сторонних лидербордах. North Micro Vision создана для одной задачи — чтения документов в исходном разрешении, как человек щурится на отсканированную страницу A4, а не как модель генерации подписей, которая скользит взглядом по миниатюре, — и её карточка модели необычно прямо говорит о том, чем она не является: ни вызова инструментов, ни цикла рассуждений, системные промпты активно не рекомендуются. Это материал в духе «что мы знаем на данный момент», поэтому каждая цифра ниже помечена: что устанавливает сам репозиторий, что заявляет Cohere, но никто не воспроизвёл, и что добавляет единственный сторонний обзор, опубликованный на данный момент.
Что на самом деле выпустила Cohere
Всё в этом разделе читается напрямую из репозитория: config.json, README и карточки модели. Это основные источники Cohere, и для большей части того, что известно о модели, они являются единственными источниками.
• Размер — 2,4B параметров всего: визуальный энкодер на ~400M и языковая модель "North Micro LLM" на 2B, в bfloat16, около 4,97 ГБ весов.
• Лицензия — Apache 2.0, разрешает коммерческое использование, веса и токенизатор открыты
• Визуальный энкодер — специально обученный под нативное разрешение, инициализированный из SigLIP 2 SO400M
• Языковая модель — собственная 2B North Micro LLM, построенная на архитектуре Command A+: три слоя внимания со скользящим окном, чередующиеся с одним глобальным слоем внимания, внимание с группировкой запросов (16 голов запросов на 8 голов KV), связанные эмбеддинги, словарь из 262 144 токенов.
• Проектор — "DeepStack": эмбеддинги патчей из нескольких слоёв зрительного энкодера внедряются в ранние языковые слои, а не добавляются один раз в начале, — так мелкий текст и геометрия таблиц сохраняются.
• Разрешение — ввод в исходном разрешении с сохранением пропорций, до примерно 1654 × 2339 пикселей, что соответствует одной странице формата A4 при примерно 200 DPI.
• Контекст — 128K текстового контекста на языковом ядре; 8K проверенного мультимодального контекста (подробности ниже)
• Языки — поддерживается 11: английский, китайский, немецкий, французский, испанский, итальянский, португальский, хинди, японский, корейский, арабский
Суффикс «Instruct» имеет значение. Это чекпоинт, дообученный под инструкции — модель для чата и визуальных вопросов-ответов — и на момент написания это единственный чекпоинт. В дереве моделей уже перечислены одиннадцать квантизаций от сообщества и три дообученные версии, но отдельного базового варианта под другим именем опубликовано не было.
Почему архитектура заслуживает абзаца
Большинство VLM размером 2-3B уменьшают ваше изображение до фиксированной сетки и теряют мелкий шрифт. Ставка North Micro Vision противоположна: сохранять разрешение, тратить токены. Визуальный энкодер использует 2D RoPE плюс обучаемые одномерные позиционные эмбеддинги, а проектор DeepStack подаёт патч-эмбеддинги в несколько языковых слоёв, а не в одно добавление в начало, — именно поэтому плотно заполненная таблица или сноска не теряется. Позиционное кодирование — это перемежающееся mRoPE, поэтому количество визуальных токенов масштабируется вместе с разрешением изображения, а не ограничивается заранее заданным значением.
Этот выбор и есть весь продукт — и у него есть цена. Согласно анализу запуска RohitAI, нативная страница A4 при максимальном разрешении составляет примерно 3 800 объединённых визуальных позиций. Прочитайте это число вместе с приведённым ниже контекстным предостережением: 3 800 визуальных токенов плюс промпт могут заполнить большую часть проверенного мультимодального окна, прежде чем вы зададите свой вопрос.
Бенчмарк-карта при честном прочтении

Каждая цифра в этом разделе предоставлена вендором. Ни одна из них не была воспроизведена независимой лабораторией, и модель пока не появляется ни в одном публичном рейтинге. На бумаге показатели действительно сильны в том, на что указывает Cohere:
• DocVQA — 0.921 (визуальный вопросно-ответный анализ документов)
• ChartQA — 0.808 (чтение графиков)
• OCRBench — 0.792 (OCR в реальных условиях)
• RefCOCO граундинг — 0.732 средний P@1 (указание на объекты)
• MMMU — 0.329 (мультимодальные знания уровня колледжа — слабое место, как и ожидалось при таком размере)
• IFEval — 0.749 (следование инструкциям)
Формулировка запуска Cohere утверждает, что North Micro Vision превосходит Gemma 4 E2B и Ministral 3 3B «по ряду бенчмарков визуального понимания», при этом сила сосредоточена в понимании документов и визуальном QA. Это заявление Cohere о модели Cohere — относитесь к нему соответственно. Одна загвоздка: сравнение Cohere с семейством Liquid использовало контрольную точку 1.6B, а не 3B, поэтому в карточке нет корректного сравнения North и LFM2.5-VL-3B, даже несмотря на то, что обе модели будут конкурировать за один и тот же бюджет на периферийные документы.
Единственный сторонний обзор, опубликованный на данный момент, — прогон одного блогера, а не лабораторный набор тестов, — дополняет картину, которую карточка модели оставляет без внимания. В нём сообщается, что North Micro Vision превосходит Ministral 3 3B Instruct по пяти из семи строк в категориях документов, диаграмм и OCR, что соответствует подаче вендора. Но также сообщается, что Qwen3.5-2B превосходит North Micro Vision по шести из этих семи строк и по всем раскрытым строкам general-VQA, reasoning, counting, hallucination и text-knowledge; единственная победа North Micro Vision над Qwen3.5-2B в этом наборе — AI2D. А английский OCRBench v2 показывает 0,367 против основного показателя OCRBench 0,792 — напоминание о том, что оценки OCR сильно зависят от того, какой сплит и какой уровень сложности запускать. Один прогон — не приговор, но это первое свидетельство того, что реальный конкурент North Micro Vision в этом размере — семейство Qwen 3.5, а не модели, которые Cohere выбрала для сравнительного тестирования.
Одно контекстное окно, два числа
На карточке указано 128K текстового контекста и 8K проверенного мультимодального контекста, и разрыв между этими двумя значениями играет реальную роль. Число 128K относится только к языковому ядру; промпты, сочетающие изображения и текст и превышающие 8K токенов, никогда не обучались и не проверялись, так что всё, что выходит за эту границу, — экстраполяция. Поскольку плотная страница формата A4 занимает примерно 3 800 визуальных позиций, окно в 8K можно заполнить одним документом и коротким вопросом. Практический вывод: планируйте свой пайплайн вокруг нарезки страниц на области — таблица, блок подписей, отдельный счёт — вместо того чтобы подавать целые страницы и рассчитывать на продолжительный диалог по их содержимому.
Что нельзя делать согласно карточке модели
North Micro Vision — это слой восприятия, а не агент, и Cohere с завидной прямотой об этом заявляет. В карточке модели сказано, что она не является моделью рассуждений, обладает ограниченными способностями в математике и программировании, не поддерживает вызов инструментов и агентные сценарии, и не должна заменять более крупного универсального ассистента. Она идёт дальше большинства карточек: не рекомендует использовать системные промпты, потому что они не использовались при обучении модели. Калиброванных оценок уверенности тоже нет. Из этого следует разделение: North Micro Vision читает и извлекает, схема отвечает за структуру, правила — за инварианты, более сильная модель обрабатывает неоднозначные запросы, а человек утверждает всё, что имеет последствия. Относитесь к тексту на странице как к данным, а не как к правилам: отсканированная инструкция, спрятанная в документе, — это ровно тот вид визуальной промпт-инъекции, от которого защищает это разделение.

Как запустить это сегодня

Краткое руководство честно признаёт собственные шероховатости: карточка модели требует Transformers 5.16.0, который на момент запуска не был последним стабильным релизом PyPI, поэтому ранним пользователям приходится устанавливать из исходников. Публичная поддержка vLLM указана как «скоро»; Cohere тестировала модель с внутренней сборкой vLLM. В остальном поддержка экосистемы с первого дня хорошая: рецепты NVIDIA NeMo AutoModel для развертывания на периферийных устройствах и GPU, рецепты Axolotl для QLoRA и полной тонкой настройки, а также квантизации MLX от сообщества для Apple Silicon — 4-битная сборка составляет около 2,17 ГБ. Отдельно стоит назвать одну ловушку развертывания: задавайте max_pixels явно, потому что sequence_len не ограничивает количество токенов изображения, и без этого можно случайно выйти за пределы проверенного мультимодального окна.
North Micro Vision нет в OrcaRouter и, судя по его собственной карточке, нет ни у одного инференс-провайдера — это история про самостоятельный хостинг, и точка. Именно поэтому в следующем предложении важен слой маршрутизации: как только любой провайдер поднимет для неё эндпоинт, роутер позволит вам поставить свежую модель под Apache-2.0 рядом с теми, к которым вы уже обращаетесь в проде, — один API, без нового контракта, цена провайдера передаётся как есть с наценкой 0%, и автоматический фейловер, чтобы непроверенная модель принимала реальный трафик, а проверенная подхватывала вызовы, с которыми первая не справляется. Пока такого эндпоинта не существует, единственное сравнение, которое вы реально можете провести сегодня, — это сравнение этого чекпоинта с размещёнными в облаке моделями для работы с документами, за которые вы уже платите, бок о бок на ваших собственных страницах.
Кому следует двигаться, а кому — ждать
Действуйте, если у вас есть ограниченная задача по извлечению данных из документов — счета, банковские выписки, контракты, структурированные формы — и требования к локализации данных или аудиту, из-за которых облачный API непривлекателен. Лицензия Apache 2.0, дешёвая доменная адаптация QLoRA и энкодер с нативным разрешением — действительно необычное сочетание для такой рабочей нагрузки, а ограничения самой карточки достаточно ясны, так что сюрпризов не будет. Ждите, если вам нужен облачный эндпоинт, оплата за каждый токен или агентное поведение — ничего этого пока нет. И не спешите считать какой-либо из приведённых выше бенчмарков окончательным: все ключевые цифры принадлежат Cohere, единственный внешний прогон рисует более спорную картину в верхней части класса малых моделей, а сама модель выпущена менее недели назад. Главное, за чем стоит следить, — это история с развёртыванием: в тот день, когда и стандартные Transformers, и публичный релиз vLLM будут её поддерживать, North Micro Vision перестанет быть репозиторием, с которым приходится бороться, и станет моделью, которую можно просто навести на свои документы.
