一張用於比較「InternLumina-U2 vs North Micro Vision Instruct」的主視覺標題卡片,副標題為「今天就能執行的文件閱讀器 vs 尚未就緒的 16B 模型」,並附三個統計標籤——「North Micro:2.4B,現已可執行」、「InternLumina-U2:16B,尚未釋出權重」、「ChartQA 0.808 vs 86.52(兩者皆為官方回報數據)」——右下角放置 OrcaRouter 標誌。
Guides & Insights

InternLumina-U2 對比 North Micro Vision Instruct:一個現今即可執行的文件閱讀器,對比一個尚未成熟的 16B 模型

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

如果你這週需要一個能讀文件、截圖和圖表的模型,這篇比較給出了一個簡短而實用的答案:North Micro Vision Instruct 是 Cohere 推出的 24 億參數開放權重模型,以 Apache-2.0 授權釋出,自 2026 年 8 月 10 日起開放下載;它在文件任務上的表現已經夠好,值得今天就拿它來處理你自己的文件。InternLumina-U2 則是上海人工智慧實驗室的 160 億參數擴散模型——設計野心大得多,除了一堆其他任務之外,也宣稱具備圖表與文件理解能力——但它的權重並未公開,Hugging Face 上的儲存庫只是空殼,目前世上還沒有任何人能實際執行它。至於更長的答案,則要談當兩個 Apache-2.0 模型在閱讀能力上提出重疊宣稱時會發生什麼事——只是兩者之中,只有一個是你真正能握在手中的東西。

實際存在的2.4B

North Micro Vision Instruct {{1}}是 Cohere 的 North 系列中的視覺專家:{{/1}}約 2.4B {{2}}總參數;這是一款專為以原生解析度閱讀而設計的緊湊型模型。{{/2}}設計重點在於,{{3}}多數視覺模型會將影像縮小至固定網格,因而失去文件內容所寄託的精細細節{{/3}}——所以 North Micro Vision Instruct 接受原生解析度的影像,最大可達約 200 dpi 的 A4 頁面,並保留長寬比與小字。{{4}}Cohere 公布的數據以這個尺寸級別而言表現強勁:DocVQA 0.921、ChartQA 0.808、OCRBench 0.792,均為 Cohere 自行通報、未經他人複現,{{5}}並具有經實測驗證、約 8K tokens 的多模態上下文,以及有紀錄可循的弱點:MMMU 僅 0.329{{6}}——這提醒我們,它是閱讀專家,而非推理通才。{{7}}它本身並無託管 API,也沒有標準的託管途徑;實務上須自行託管這款 2.4B 模型——其體積小到足以在單張現代工作站 GPU 上運行。{{8}}社群採用情況一直很穩定——截至 8 月下旬,Hugging Face 上的模型卡已顯示每月有數萬次下載。{{9}}

那個16B就是一個承諾

InternLumina-U2 是另一種不同類型的人工製品。上海人工智能實驗室於 2026 年 9 月 1 日發布的是推論程式碼與架構,而非模型:一個稀疏混合專家擴散 LLM,總參數 160 億,其中 10 億為活躍參數,建立在完全離散化的八本碼簿視覺表示之上。該儲存庫的驅動腳本涵蓋六大任務家族——文字、影像理解、文字轉影像、影像編輯、影片理解、3D 理解——其中影像理解明確包含密集圖表與文件。專案頁面的初步表格列出實驗室所報告的圖表與文件數據,與該專家宣稱的範圍相同:ChartQA 86.52、CharXiv-DQ 83.65,另有 HallusionBench 62.15 與 MathVision 33.22。頁面稱這些結果為「初步、部分」,而承載完整表格的技術報告標記為「即將推出」,同時——決定性的事實是——沒有任何可供任何人查核的權重。

計分板

以下每個數字皆是供應商回報的數據。North Micro Vision Instruct 的結果是 Cohere 自己的評測;InternLumina-U2 的結果則是該實驗室初步整理的部分表格。

• 大小與形態 — {{1}}North Micro Vision Instruct:約 2.4B 的稠密模型、原生解析度閱讀器。InternLumina-U2:總參數 16B、活躍 1B 的稀疏 MoE,離散多碼本擴散模型。{{/1}}

• 它能做什麼 — North Micro Vision Instruct:讀取圖片、文件、圖表和 UI 畫面;以文字回答,並提供依據。InternLumina-U2:宣稱具備讀取與生成能力 — 理解圖片/影片/3D,也能生成與編輯圖片。

• 權重 — North Micro Vision Instruct:自 2026 年 8 月 10 日起公開(CohereLabs/North-Micro-Vision-Instruct,Apache-2.0)。InternLumina-U2:未公開;Hugging Face 存根為空,權重標記為「即將推出」。

• 主要閱讀評分 — North Micro Vision Instruct:DocVQA 0.921、ChartQA 0.808、OCRBench 0.792(Cohere 報告)。InternLumina-U2:ChartQA 86.52、CharXiv-DQ 83.65、HallusionBench 62.15(實驗室報告,初步)。

• 文件上下文 — North Micro Vision Instruct:原生解析度最高約為 A4(200 dpi),已驗證約 8K 的多模態上下文。InternLumina-U2:透過 AToken 多碼簿編碼器處理密集圖表及自然影像;上下文尚未指定。

• 已知弱點 — North Micro Vision Instruct:MMMU 0.329,無工具呼叫功能 — 是閱讀器,而非推理器或代理。InternLumina-U2:在其自身的部分表格中,於 GenEval 上落後至少一個具名競爭對手(0.81 對 0.89);一切皆未經驗證。

• 如何執行 — North Micro Vision Instruct:自架一個 2.4B 模型;撰寫本文時,vLLM 支援仍在陸續實作中。InternLumina-U2:沒有任何人能執行它——沒有權重,而發布的驅動程式需要檢查點目錄和分詞器檔案,但這些都不在儲存庫中。

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

同一個基準,兩種截然不同的認識論

ChartQA 是看清這兩種宣稱之間差異的最直接方式。兩個模型都回報了 ChartQA 數字:North Micro Vision Instruct 以準確率分數回報 0.808,InternLumina-U2 則以百分比回報 86.52——同一個基準,本質上是同一個結果,只是落在八十分區帶中的不同量尺上;縱使兩個模型都已存在,不同的評測切分與提示設定也足以讓跨論文的 ChartQA 比較寸步難行。真正要緊的是知識論上的差異:North Micro Vision Instruct 的 0.808 對應的是可下載的成果(artifact),因此任何一組有 GPU 和一批圖表的團隊,這週就能重現或推翻它。InternLumina-U2 的 86.52 對應的卻是一份路線圖。一個你無法查證的數字,就是一個你不該據以建構的數字——而這正是實驗室自己在表格上標註「初步(preliminary)」時所承認的立場。

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

CohereLabs/North-Micro-Vision-Instruct 的 Hugging Face 卡片,於 2026 年 8 月 27 日擷取——包含 2.4B 原生解析度視覺語言描述、Apache-2.0 授權,以及 Cohere 所報告的文件閱讀基準。

閱讀,相較於閱讀與畫圖

架構哲學上的差距,比基準測試上的差距更值得重視。North Micro Vision Instruct 是一個窄領域專家模型:它做的就是閱讀,而這個單一任務便宜到你可以把它跑在每一頁文件、每一張螢幕截圖、每一張發票上,不必時時盯著 GPU 帳單。這種低成本正是它的賣點——規模化的文件智慧既是成本問題,也是精確度問題。InternLumina-U2 押的則是相反的賭注:一個龐大的稀疏模型,試圖把閱讀、圖像生成、圖像編輯、影片理解和 3D 理解全部整併進同一個共享的離散 token 介面,其理論是理解與生成會互相強化。如果它行得通,它會是另一個等級的工具——但這個「如果」本身就承擔了很多重量:一個配備自訂 tokenizer、以 Blender 渲染 3D 預處理的 16B-A1B 擴散式 MoE,永遠不會像 2.4B 的窄領域專家那樣,成為便宜、隨時可用的閱讀器。兩者其實不是替代品。一個是今天就能部署的工具,一個是你可以預先做好準備的研究方向。

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

於2026年9月2日擷取的 InternLM/InternLumina-U2 GitHub 儲存庫——該儲存庫登陸頁面帶有「全視覺理解、圖像生成與編輯」的描述,以及各任務的推論腳本;其中,圖像理解路徑所針對的是自然圖像與密集圖表。

若您正在建置文件管線,這對您意味著什麼

這兩個模型都沒有託管在 OrcaRouter 上——North Micro Vision Instruct 是自託管模型,沒有託管 API;而 InternLumina-U2 目前沒有公開權重可供任何人託管——所以在路由這件事上,重點不是「今天就用一個金鑰同時呼叫兩者」。而是當兩者中任何一個發生變化時你會採用的模式:文件處理管線幾乎總是將一個輕量閱讀模型與一個更大的推理模型配對,而路由層的價值在於把這種配對包裝成一次呼叫,同時讓你所使用的託管模型保持 0% 加成、誠實透明的轉發。當像 InternLumina-U2 這樣的 Apache-2.0 checkpoint 最終釋出時,明智的做法不是拆掉一套運作良好的文件處理架構——而是把新模型放到自動故障轉移後方的測試路徑上,讓它透過承受真實流量來贏得上線資格;一旦它在實際圖表上出錯,呼叫便會自動回退到那個已經證明自己的模型。一套 API 涵蓋 200+ 模型是機制;故障轉移是安全網;你今天就能運行的專業模型才是支付帳單的來源,而那 16B 的承諾仍在兌現的路上。

裁決

就當下的文件與圖表閱讀而言,North Micro Vision Instruct 是兩者之中唯一真正以可用形式存在的那個——它小巧、採用 Apache-2.0、可下載,而且廠商回報的分數亮眼,你可以實際去查核。InternLumina-U2 則是更有長期意義的產物,因為它試圖在單一統一模型中,把閱讀變成六種技能之一;如果成功了,這會改變「視覺模型」的定義。不妨像觀看發射倒數那樣,盯著它空蕩蕩的 Hugging Face 儲存庫:當 safetensors 檔案出現的那一天,承諾就成了模型,比較也才真正成立。在那之前,別讓廠商在圖表基準上回報的 86.52 分,在你做決策時壓過一個可下載模型的 0.808。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube