一張針對 North Micro Vision Instruct 的標題卡,標題顯示「North Micro Vision Instruct」,副標題為「Cohere 的 2.4B Apache-2.0 文件 VLM」,並附有一個註明其於 2026 年 8 月 12 日推出的徽章,上方有三個線條圖示,分別代表文件掃描、圖表閱讀與邊界框定位。
Guides & Insights

North Micro Vision Instruct:Cohere 低調的 2.4B 文件視覺語言模型(VLM)解析

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

CohereLabs/North-Micro-Vision-Instruct——簡稱「North Micro Vision」——是一個擁有24億參數的視覺語言模型,發布方式相當低調:權重於2026年8月10日出現在Hugging Face上,Cohere的公告在8月12日發布,而一天之後,既沒有託管API、沒有價格表,也沒有第三方排行榜條目。North Micro Vision只為一件事而生——以原始解析度閱讀文件,就像一個人瞇著眼看掃描的A4頁面,而不是像影像描述模型那樣匆匆瞥一眼縮圖——而且它的模型卡對「它不是什麼」異常直白:沒有工具呼叫、沒有推理迴圈、明確不鼓勵使用系統提示詞。這是一篇彙整「目前已知資訊」的文章,因此下列每一項數據都有標註:哪些是儲存庫本身確立的、哪些是Cohere宣稱但尚未有人複現的、以及目前唯一一份已發布的第三方評測補充了什麼。

Cohere 實際上發布了什麼

本節的所有內容均直接取自儲存庫:config.json、README 和模型卡。這些是 Cohere 的主要來源,而就外界對該模型所知的大部分資訊而言,它們是唯一的來源。

• 大小 — 總共 2.4B 參數:一個約 400M 的視覺編碼器,加上一個 2B 的 "North Micro LLM" 語言模型,採用 bfloat16 格式,約 4.97 GB 的權重

• 授權條款 — Apache 2.0,商用許可寬鬆,權重與 tokenizer 開放

• 視覺編碼器 — 針對原生解析度進行自訂訓練,初始化自 SigLIP 2 SO400M

• 語言模型 — 內部 2B North Micro LLM,遵循 Command A+ 架構:三層滑動視窗注意力層與一層全域注意力層交錯,分組查詢注意力(16 個查詢頭對應 8 個 KV 頭),綁定嵌入,262,144 個 token 的詞彙表

投影器 — "DeepStack":將來自多個視覺編碼器層的圖塊嵌入注入到較早的語言層中,而不是一次性前置,這正是小型文字和表格幾何結構得以保留的方式。

• 解析度 — 保留原始解析度與長寬比的輸入,最高約 1654 × 2339 像素,約為 200 DPI 的 A4 頁面

• 上下文 — 語言骨幹上的 128K 文字上下文;8K 經驗證的多模態上下文(詳細資訊如下)

• 語言 — 支援 11 種:英文、中文、德文、法文、西班牙文、義大利文、葡萄牙文、印地文、日文、韓文、阿拉伯文

「Instruct」後綴很重要。這是經指令微調的檢查點——一個聊天與視覺問答模型——截至撰寫本文時,它是唯一的檢查點。模型樹中已列出十一個社群量化版本和三個微調版本,但目前尚未以不同名稱發布單獨的基礎變體。

為什麼這個架構值得用一個段落來介紹

大多數 2-3B 規模的 VLM 會將你的影像縮小到固定網格,因而遺失細小文字。North Micro Vision 押注的方向正好相反:保留解析度,耗用 token。其視覺編碼器使用 2D RoPE 加上可學習的 1D 位置嵌入,而 DeepStack 投影器會將 patch 嵌入饋入多個語言層,而非僅在序列前端單次前置,這正是內容密集的表格或註腳得以留存的原因。位置編碼採用交錯式 mRoPE,因此視覺 token 數量會隨影像解析度擴展,而非被預設上限綁死。

這個選擇就是產品本身——而且它有其代價。RohitAI 的上市分析估計,最大解析度下的原生 A4 頁面,大約等同於 3,800 個合併後的視覺位置。請把這個數字與下方的上下文警語對照著看:在你提出問題之前,3,800 個視覺 token 加上一段提示詞,就可能填滿已驗證多模態視窗的很大一部分。

如實解讀的基準卡

A single-column scoreboard for North Micro Vision Instruct listing six rows: Size 2.4B (2B LM + 400M vision), License Apache 2.0, DocVQA 0.921, ChartQA 0.808, Multimodal context 8K validated, Tool calling none, with a footer noting the benchmarks are vendor-reported and not independently reproduced.

本節中的每項數據皆由供應商自行報告。目前尚無獨立實驗室複現過任何一項,且該模型也未出現在任何公開排行榜上。就紙面資料而言,Cohere 所指出的記錄確實相當亮眼:

• DocVQA — 0.921(文件視覺問答)

• ChartQA — 0.808(圖表閱讀)

• OCRBench — 0.792(真實場景中的 OCR)

• RefCOCO 指代定位 — 平均 P@1 0.732(指向物體)

• MMMU — 0.329(大學程度的多模態知識——弱項,以這個規模而言如預期)

• IFEval — 0.749(指令遵循)

Cohere 在發布時的框架宣稱,North Micro Vision 在「一系列視覺理解基準測試」上優於 Gemma 4 E2B 和 Ministral 3 3B,其優勢集中在文件理解與視覺問答。這是 Cohere 對自家模型的主張——應按此看待。有一個小問題:Cohere 與 Liquid 系列模型的比較使用的是 1.6B checkpoint,而非 3B 版本,因此即使這兩個模型將爭奪相同的邊緣文件預算,規格卡中也不存在有效的 North 對 LFM2.5-VL-3B 比較。

迄今唯一公開的第三方評測——單一部落格作者的跑分,而非實驗室完整測試——補足了官方規格表遺漏的圖像。該評測指出,North Micro Vision 在七項文件、圖表與 OCR 測試中有五項擊敗 Ministral 3 3B Instruct,這與供應商的宣傳相符。但該評測也指出,Qwen3.5-2B 在同樣七項測試中的六項,以及所有已揭露的一般視覺問答、推理、計數、幻覺與文字知識測試中,皆擊敗 North Micro Vision;North Micro Vision 在該組測試中唯一勝過 Qwen3.5-2B 的是 AI2D。此外,英文 OCRBench v2 得分為 0.367,對比標題所稱的 OCRBench 0.792——這提醒我們 OCR 分數高度取決於你執行哪個分項與哪種難度。一次跑分不是定論,但這確實是首個證據,顯示 North Micro Vision 在此尺寸等級的真正競爭對手是 Qwen 3.5 系列,而非 Cohere 選擇用來做基準對比的那些模型。

一個上下文窗口,兩個數字

該規格卡列出 128K 的文字上下文與 8K 的已驗證多模態上下文,而兩者之間的落差其實肩負著實質功能。128K 這個數字僅屬於語言主幹;超過 8K token 的圖文提示從未經過訓練或驗證,因此超過那條線的任何內容都只是外推。一張內容密集的 A4 頁面約佔 3,800 個視覺位置,所以只要一份文件加上一個簡短問題,就能達到該 8K 視窗。實際的影響是:規劃管線時,應圍繞「將頁面裁切成區域」這個原則——例如表格、簽名欄、單張發票——而非餵入整頁,並期望能與整頁內容進行長時間的來回問答。

模型卡告訴你不要做的事

North Micro Vision 是一個感知層,而非代理,Cohere 對此直言不諱。模型卡說明該模型並非推理模型,數學與程式碼能力有限,不支援工具調用或代理工作流,也不應取代較大型的通用助理。它比多數模型卡更進一步:建議不要使用系統提示詞,因為該模型訓練時並未使用系統提示詞。同樣地,也沒有校準的置信度分數。此設計隱含的是一套分工:North Micro Vision 負責讀取與萃取,schema 掌握結構,規則掌握不變量,較強模型處理模糊的判斷,而任何重大事項須由人類批准。將頁面上的文字視為資料,絕非政策——文件中埋藏的掃描指令,正是這套分工所要防禦的視覺提示詞注入。

A four-step document pipeline diagram reading Scan, North Micro Vision — perception, Schema + rules, and Stronger model — decisions, connected by arrows, with a footer reading 'Keep perception and decisions separate.'

今天如何執行它

The Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, showing the Image-Text-to-Text pipeline badge, Apache 2.0 license, 11 languages, the model tree, and the opening description of a 2.4B-parameter open-weight vision-language model with native-resolution image support, noting it is not deployed by any inference provider.

快速入門指南坦承自身的不順暢之處:{{1}}模型卡要求 Transformers 5.16.0,而該版本在發布當天並非 PyPI 最新的穩定版,因此早期使用者需從原始碼安裝{{/1}}。{{2}}公開的 vLLM 支援被列為「即將推出」;Cohere 是以內部 vLLM 建置來進行評估{{/2}}。{{3}}首日生態系支援在其他方面表現良好:NVIDIA NeMo AutoModel 提供邊緣及 GPU 部署的配方、Axolotl QLoRA 與完整微調配方,以及社群為 Apple Silicon 提供的 MLX 量化版本——4-bit 建置約 2.17 GB{{/3}}。{{4}}有一個值得指出的部署陷阱:必須明確設定 max_pixels,因為 sequence_len 不會限制圖像 token 數量,若未設定,你可能會在無意間超出已驗證的多模態窗口{{/4}}。

{{1}}North Micro Vision 並不在 OrcaRouter 上,而且按照它自己的模型卡所述,它也不在任何推論供應商上——這是個純粹的自架故事,僅此而已。{{/1}}而這正是路由層在下一句中如此重要的原因:一旦任何供應商為它部署端點,路由器就能讓你把一個才推出幾天的 Apache-2.0 模型,跟你已經在生產環境中呼叫的模型並列使用——單一 API、無需新合約、供應商列表價格以 0% 加成原樣轉傳,並提供自動故障轉移,讓未經驗證的模型可以承擔真實流量,同時由經過驗證的模型接住它漏接的呼叫。{{/2}}在該端點出現之前,你今天真正能跑的比較,就是把這個檢查點與你已付費使用的託管文件模型,在你自己的頁面上並排比較。{{/3}}

誰應該移動,誰應該等待

如果您有範圍明確的文件擷取需求——發票、銀行對帳單、合約、結構化表單——同時有資料落地或稽核要求,使託管型 API 失去吸引力,那就採用它。Apache 2.0、平價的 QLoRA 領域調適,以及原生解析度編碼器,對這類工作負載來說確實是難得的組合;模型卡自身的限制也寫得夠清楚,您不會感到意外。如果您需要託管端點、按 token 計價,或代理型(agentic)行為,請再等等——這些都還不存在。同樣地,在把上述任何基準視為定論之前也請再等:每個頭條數字都出自 Cohere,唯一的外部評測在小模型類別的頂端呈現出更具爭議的樣貌,而且該模型發布至今還不到一週。真正值得關注的是伺服部署的發展——當標準 Transformers 與公開的 vLLM 版本都能支援它時,North Micro Vision 就不再是需要您費力應付的儲存庫,而是可以直接指向您文件、隨插即用的模型。