一张North Micro Vision Instruct的标题卡片,显示'North Micro Vision Instruct'字样,副标题为'Cohere的2.4B Apache-2.0文档VLM',还有一个标签注明发布于2026年8月12日,下方是三个线条图标,分别表示文档扫描、图表读取和边界框定位。
Guides & Insights

North Micro Vision Instruct:解析 Cohere 低调的 2.4B 文档 VLM

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

CohereLabs/North-Micro-Vision-Instruct——简称“North Micro Vision”——是一个拥有24亿参数的视觉-语言模型,它悄然登场:权重于2026年8月10日出现在Hugging Face上,Cohere的公告于8月12日发布,而一天之后仍然没有托管API、没有价格表,也没有第三方排行榜条目。North Micro Vision专为一项任务而生——以原始分辨率阅读文档,就像一个人眯着眼看扫描的A4页面,而不是像图像描述模型那样瞥一眼缩略图——其模型卡对于“它不是什么”这一点出奇地直接:不支持工具调用、没有推理循环、明确不鼓励使用系统提示。这是一篇汇总截至目前已知信息的文章,因此下文中的每个数据都带有标注:哪些是仓库本身确认的,哪些是Cohere声称但无人复现的,以及目前唯一已发表的第三方评测补充了什么。

Cohere 实际发布的内容

本节中的所有内容均直接来自仓库:config.json、README 和模型卡。这些是 Cohere 的主要来源,而且对于该模型的大多数已知信息来说,它们是唯一的来源。

• 大小 — 总计 2.4B 参数:一个约 400M 的视觉编码器加上一个 2B 的 "North Micro LLM" 语言模型,采用 bfloat16 格式,权重约 4.97 GB

• 许可证 — Apache 2.0,商业友好,权重和分词器开放

• 视觉编码器 — {{1}}针对原生分辨率进行定制训练{{/1}},{{2}}从 SigLIP 2 SO400M 初始化{{/2}}

• 语言模型 — 自研 2B North Micro LLM,采用 Command A+ 架构:三个滑动窗口注意力层与一个全局注意力层交错排列,分组查询注意力(16 个查询头对应 8 个 KV 头),共享嵌入,262,144 token 词表

• 投影器 — "DeepStack":将来自多个视觉编码器层的图像块嵌入注入到早期语言层,而非一次性前置注入,这正是小文本和表格几何结构得以保留的原因。

• 分辨率 — 保持宽高比的原始分辨率输入,最高约 1654 × 2339 像素,相当于约 200 DPI 下的一页 A4 纸

• 上下文 — 语言主干上的128K文本上下文;8K经验证的多模态上下文(详见下文)

• 语言 — 支持11种:英语、中文、德语、法语、西班牙语、意大利语、葡萄牙语、印地语、日语、韩语、阿拉伯语

「Instruct」这个后缀很重要。这是指令微调(instruction-tuned)检查点——一个聊天与视觉问答(visual-QA)模型——截至撰写本文时,它是唯一的检查点。模型树中已经列出了十一个社区量化版本和三个微调版本,但尚未以其他名称发布独立的基座(base)变体。

为什么这种架构值得单独一段来介绍

大多数2-3B量级的VLM会把图像降采样到固定网格,从而丢失小字内容。North Micro Vision的赌注恰恰相反:保留分辨率,消耗token。视觉编码器使用2D RoPE加可学习的1D位置嵌入,DeepStack投影器将patch嵌入送入多个语言层,而不是只做一次前置拼接——这正是密集表格或脚注能幸存下来的原因。位置编码采用交错的mRoPE,因此视觉token数量随图像分辨率缩放,而不是被预设值封顶。

那个选择就是整个产品——而且它有代价。RohitAI的发布分析估计,在最大分辨率下,原生A4页面大约相当于3,800个合并视觉位置。把这个数字与下面的上下文警告对照阅读:3,800个视觉标记加上一个提示词,在你还未提出问题之前,就可能填满已验证多模态窗口的很大一部分。

基准卡,如实解读

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

本节中的所有数据均由供应商报告。没有任何数据经独立实验室复现,且该模型尚未出现在任何公开排行榜上。从纸面上看,该记录在Cohere所指出的方面确实很强:

• DocVQA — 0.921 (文档视觉问答)

• ChartQA — 0.808(图表阅读)

• OCRBench — 0.792(真实场景OCR)

• RefCOCO 指代定位 — 平均 P@1 0.732(指向物体)

• MMMU — 0.329(大学水平的多模态知识——薄弱环节,在这个规模下正如所料)

• IFEval — 0.749 (指令遵循)

Cohere的发布宣传称,North Micro Vision在“一系列视觉理解基准测试”上优于Gemma 4 E2B和Ministral 3 3B,其优势主要集中在文档理解和视觉问答方面。这是Cohere对其自家模型的宣称——应如此看待。一个值得注意的细节是:Cohere与Liquid系列模型的对比使用的是1.6B检查点,而非3B版本,因此该模型卡中并不存在有效的North与LFM2.5-VL-3B对比,尽管这两款模型将在同一边缘文档预算领域展开竞争。

迄今为止公布的唯一一项第三方评测——只是单个博主的运行,而非实验室套件——补充了该卡片遗漏的图景。该评测报告称,North Micro Vision 在七项文档、图表和 OCR 指标中的五项上胜过 Ministral 3 3B Instruct,这与厂商的说法相符。但该评测也报告称,Qwen3.5-2B 在这七项指标中的六项上以及所有已披露的通用 VQA、推理、计数、幻觉和文本知识指标上均胜过 North Micro Vision;North Micro Vision 在该组中唯一赢过 Qwen3.5-2B 的是 AI2D。此外,英文 OCRBench v2 的成绩为 0.367,而标题所示的 OCRBench 为 0.792——这提醒我们,OCR 分数在很大程度上取决于你运行的是哪个子集以及哪种难度。单次运行不能作为定论,但它是首个证据,表明 North Micro Vision 在这一规模上的真正竞争对手是 Qwen 3.5 系列,而非 Cohere 选择用来做基准对比的那些模型。

一个上下文窗口,两个数字

该规格表列出128K的文本上下文和8K的经验证多模态上下文,而两者之间的差距正在产生实际影响。128K这个数字仅属于语言主干;超过8K token的图文提示从未经过训练或验证,因此超出该界限的内容都只是外推。一页内容密集的A4纸大约占用3,800个视觉位置,仅需一份文档加一个简短问题就能填满8K窗口。实际后果是:规划流水线时应围绕页面裁剪来设计——裁剪出表格、签名栏、单张发票——而不是整页输入并期望能对整页进行长时间的多轮交互。

模型卡告诉你不要做的事情

North Micro Vision 是一个感知层,而非智能体,Cohere 对此直言不讳。模型卡明确指出:该模型不是推理模型,数学与代码能力有限,不支持工具调用或智能体工作流,也不应取代更大的通用助手。它比大多数模型卡更进一步:建议不要使用系统提示词,因为该模型在训练时并未使用系统提示词。此外,它也没有经过校准的置信度分数。这种设计意味着一种拆分:North Micro Vision 负责读取与提取,schema 负责结构,规则负责不变量,更强的模型处理歧义请求,而任何有重大影响的决策都需人工审批。把页面上的文本当作数据,切勿当作策略——文档中埋藏的扫描指令,正是这种拆分所要防御的那种视觉提示注入。

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

今天如何运行它

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

快速入门指南对其自身的摩擦点直言不讳:模型卡要求使用 Transformers 5.16.0,而该版本在发布当天并非 PyPI 上的最新稳定版,因此早期用户需要从源码安装。公开的 vLLM 支持被列为"即将推出";Cohere 使用内部 vLLM 构建进行了评估。除此之外,首日生态系统支持相当完善:NVIDIA NeMo AutoModel 提供了面向边缘和 GPU 部署的配方,Axolotl 提供了 QLoRA 和全参数微调配方,社区还为 Apple Silicon 提供了 MLX 量化版本——4 位构建约 2.17 GB。有一个值得指出的部署陷阱:请显式设置 max_pixels,因为 sequence_len 并不会限制图像 token 数量,若不设置,你可能会在无意间超出已验证的多模态窗口。

North Micro Vision 不在 OrcaRouter 上,而且按其自己的说法,它也不在任何推理提供商上——这纯粹是一个自托管的故事,仅此而已。这正是下一句话里路由层至关重要的原因:一旦任何提供商为它部署端点,路由器就能让你把一个发布才几天的 Apache-2.0 模型,与你已经在生产环境中调用的模型放在一起——一个 API,无需新合同,提供商挂牌价以 0% 加价原样传递,并具备自动故障转移,让未经证实的模型可以承载真实流量,而经过验证的模型则接住它失手的调用。在那个端点存在之前,你今天真正能做的对比,是把这个检查点与你已经在付费的托管文档模型,在你自己的页面上并排比较。

谁该动,谁该等

如果你有范围明确的文档提取任务——发票、银行对账单、合同、结构化表单——并且数据驻留或审计要求使托管API不具吸引力,那就采用它。Apache 2.0、廉价的QLoRA领域适配以及原生分辨率编码器,对这类工作负载来说确实是罕见的组合,而且模型卡自身列出的局限性已经足够清晰,你不会感到意外。 如果你需要托管端点、按token计费或智能体行为——这些目前都还不存在,那就等待。在把上述任何基准当作定论之前也要等待:每个头条数字都出自Cohere,唯一的一次外部运行在小模型类别顶端描绘了一幅更具争议的图景,而且该模型发布还不到一周。值得关注的是服务方案——当原版Transformers和公开的vLLM版本都能支持它时,North Micro Vision就不再是一个需要费力摆弄的仓库,而变成一个只需指向你的文档就能使用的模型。