
InternLumina-U2 对比 North Micro Vision Instruct:一个是今日即可运行的文档阅读器,另一个是尚未成熟的 16B 模型
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1860智能75代码
- obsidianQwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
如果你本周需要一个能读取文档、截图和图表的模型,这份对比有一个简短而实用的答案:North Micro Vision Instruct 是 Cohere 发布的 24 亿参数开放权重模型,采用 Apache-2.0 许可,自 2026 年 8 月 10 日起即可下载,其文档任务能力已经好到足以今天就拿来处理你自己的文件。InternLumina-U2 则是上海人工智能实验室的 160 亿参数扩散模型——一个野心大得多的设计,除了图表和文档理解,它还宣称能完成五六项其他任务——但其权重尚未公开,Hugging Face 仓库只是一个空占位,目前世上无人能运行它。更长的答案则关乎:当两个 Apache-2.0 模型都在阅读能力上宣称重叠,却只有其中一个是你真正能握在手里的东西时,意味着什么。
实际存在的那个2.4B
North Micro Vision Instruct 是 Cohere North 系列中的视觉专家:总参数约 24 亿,是一个以原生分辨率读取文档的紧凑模型。其设计要点在于,大多数视觉模型会将图像缩小到固定网格,从而丢失文档所依赖的精细细节——因此 North Micro Vision Instruct 接受原生分辨率的图像,最高约为 200 dpi 的 A4 页面,同时保留宽高比和小字号文本。Cohere 报告的数据在同尺寸级别中表现强劲:DocVQA 0.921,ChartQA 0.808,OCRBench 0.792,均为 Cohere 自行报告且未复现;已验证的多模态上下文约为 8K token,并在 MMMU(0.329)上存在有记录的短板——这也提醒我们,它是一个阅读专家,而非推理通才。它没有自己的托管 API,也没有标准的托管路线;实际使用方式是在本地自行托管一个 2.4B 模型,该模型足够小,可在单张现代工作站 GPU 上运行。社区采用一直稳步增长——到 8 月下旬,Hugging Face 页面显示每月下载量已达数万次。
作为承诺的那个16B
InternLumina-U2是一件不同寻常的产物。上海人工智能实验室于2026年9月1日发布的是推理代码和架构,而非模型:一个稀疏专家混合扩散大语言模型,总参数160亿、激活参数10亿,围绕全离散八码本视觉表示构建。该仓库的驱动脚本覆盖六类任务——文本、图像理解、文生图、图像编辑、视频理解、3D理解——其中图像理解明确包含密集图表和文档。项目页面的初步表格列出了该实验室报告的数字,与那位专家的声称处于同一区间:ChartQA 86.52、CharXiv-DQ 83.65,另有HallusionBench 62.15和MathVision 33.22。页面称这些结果为“初步的、不完整的”,本应承载完整表格的技术报告标注为“即将推出”,而且——决定性的事实是——没有任何权重可供任何人验证。
记分牌
下方所有数字均由供应商自行报告。North Micro Vision Instruct 的数据来自 Cohere 自己的评估;InternLumina-U2 的数据则来自其实验室初步整理的部分数据表。
• 尺寸与形态 — North Micro Vision Instruct:约24亿参数的稠密模型,原生分辨率阅读器。InternLumina-U2:总计160亿参数 / 激活10亿参数的稀疏MoE,离散多码本扩散模型。
• 功能 — North Micro Vision Instruct:可读取图像、文档、图表和 UI 界面;以文本形式作答,并引用依据。InternLumina-U2:宣称兼具读取与生成能力——可理解图像/视频/3D,并能生成和编辑图像。
• 权重 — North Micro Vision Instruct:自2026年8月10日起公开(CohereLabs/North-Micro-Vision-Instruct,Apache-2.0)。InternLumina-U2:未公开;Hugging Face 存根为空,权重标记为“即将推出”。
• 主要阅读成绩——North Micro Vision Instruct:DocVQA 0.921,ChartQA 0.808,OCRBench 0.792(Cohere 报告)。InternLumina-U2:ChartQA 86.52,CharXiv-DQ 83.65,HallusionBench 62.15(实验室报告,初步数据)。
• 文档上下文——North Micro Vision Instruct:原生分辨率最高支持约A4幅面(200 dpi),已验证约8K多模态上下文。InternLumina-U2:通过AToken多码本编码器处理密集图表和自然图像;上下文尚未指定。
已知弱点 — 北微视觉指令(North Micro Vision Instruct):MMMU 0.329,无工具调用 — 是一个阅读器,而非推理器或代理。InternLumina-U2:在其自身的部分表格中,在GenEval上落后于至少一个具名对手(0.81对0.89);一切未经验证。
• 如何运行它——North Micro Vision Instruct:自行托管一个 2.4B 模型;vLLM 支持在撰写本文时仍在落地中。InternLumina-U2:没人能运行它——没有权重,而且发布的驱动需要的 checkpoint 目录和 tokenizer 文件都不在仓库中。

同样的基准,两种截然不同的认知方式
ChartQA 是看清这两种说法之间差异的最直接方式。两个模型都报告了 ChartQA 数值:North Micro Vision Instruct 报告的是 0.808 这个准确率分数,而 InternLumina-U2 报告的是 86.52 这个百分比——同一个基准,本质上是在不同量纲下落在 80 多分区间内的相近结果,即便不同的评估划分和提示设置使得跨论文的 ChartQA 比较即使在两个模型都存在时也充满陷阱。真正重要的是认识层面的差异:North Micro Vision Instruct 的 0.808 与一个可下载的产物绑定在一起,因此任何拥有 GPU 和一组图表的团队本周就能复现或推翻它。InternLumina-U2 的 86.52 则与一份路线图绑定。一个你无法核验的数字,就是你不应据以构建的数字——而这恰恰是该实验室自身也承认的立场,它给自己的表格标注了“初步”字样。

CohereLabs/North-Micro-Vision-Instruct 的 Hugging Face 模型卡,截取于2026年8月27日——2.4B原生分辨率视觉-语言描述、Apache-2.0许可证,以及 Cohere 报告的文件阅读基准测试。
阅读,与阅读和绘画相比
架构哲学的差距比基准测试的差距更有价值。North Micro Vision Instruct 是一个狭窄的专才:它负责阅读,而且它能以足够低的成本完成这一项工作,让你可以在流水线中对每一页、每一张截图、每一张发票运行它,而不必盯着你的 GPU 账单。这种廉价本身就是特性——规模化的文档智能,与其说是准确性问题,不如说是成本问题。InternLumina-U2 则是相反的下注:一个巨大的稀疏模型,试图将阅读与图像生成、图像编辑、视频理解和 3D 理解折叠进同一个共享的离散词元接口,其理论依据是理解与生成能够相互强化。如果它成功了,那将是另一类工具——但“如果它成功了”这个前提承担了太多分量,而一个带有自定义分词器和 Blender 渲染 3D 预处理的 16B-A1B 扩散 MoE,永远不可能成为 2.4B 专才那样的廉价常驻阅读器。这两者其实并非替代品。它们一个是今天就可以部署的工具,一个是你可以为之准备的研究方向。

截图于2026年9月2日的 InternLM/InternLumina-U2 GitHub 仓库——仓库首页展示了"Omni-Visual Understanding, Image Generation and Editing"的描述,以及各任务对应的推理脚本;其中图像理解路径面向的是自然图像和密集图表。
如果你正在构建文档流水线,这意味着什么
这两个模型都没有托管在OrcaRouter上——North Micro Vision Instruct是自托管模型,没有托管API;InternLumina-U2也没有开放权重可供任何人托管——所以这里的路由切入点不是“今天通过同一个密钥同时调用它们两个”。而是有朝一日其中任何一个发生变化时你会采用的那种模式:文档流水线几乎总是将低成本阅读器与更强大的推理器配对使用,而路由层的价值就在于把这种配对表达为一次调用,同时在你实际使用的托管模型上保持0%加价的透明直传。当InternLumina-U2这样的Apache-2.0检查点最终落地时,明智的做法不是拆掉一套运转良好的文档技术栈——而是把新模型放到自动故障转移后方的测试路径上,让它通过经受住生产流量的考验来赢得生产流量;一旦它在处理真实图表时失败,调用就会回退到那个已经证明过自己的模型。一个覆盖200多个模型的API是机制,故障转移是安全网,而今天就能运行的那个专业模型才是付账单的收入来源——与此同时,16B的承诺仍在兑现之中。
裁决
就当下的文档与图表阅读而言,North Micro Vision Instruct 是两者中唯一具有实际可用意义的——体积小、Apache-2.0 许可、可下载,而且厂商报告的高分你确实可以亲自查证。InternLumina-U2 则是更有意思的长期产物,因为它正试图在单个统一模型中将“阅读”打造为六项技能之一;如果这能成功,就会改变“视觉模型”的定义。关注它那个空荡荡的 Hugging Face 仓库,要像注视发射倒计时一样:当 safetensors 文件出现的那一天,承诺就变成了模型,比较也随之成为真正的比较。在那之前,做决策时不要让厂商报告的图表基准 86.52 压过一个可下载的 0.808。
