一个用于“InternLumina-U2 vs North Micro Vision Instruct”对比的主标题卡片,副标题为“一个今天即可运行的文档阅读器 vs 一个尚未就绪的16B模型”,并带三个统计徽章——“North Micro:2.4B,现在即可运行”,“InternLumina-U2:16B,暂无权重”,“ChartQA 0.808 vs 86.52(均为报告值)”——右下角带有OrcaRouter标志。
Guides & Insights

InternLumina-U2 对比 North Micro Vision Instruct:一个是今日即可运行的文档阅读器,另一个是尚未成熟的 16B 模型

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

如果你本周需要一个能读取文档、截图和图表的模型,这份对比有一个简短而实用的答案:North Micro Vision Instruct 是 Cohere 发布的 24 亿参数开放权重模型,采用 Apache-2.0 许可,自 2026 年 8 月 10 日起即可下载,其文档任务能力已经好到足以今天就拿来处理你自己的文件。InternLumina-U2 则是上海人工智能实验室的 160 亿参数扩散模型——一个野心大得多的设计,除了图表和文档理解,它还宣称能完成五六项其他任务——但其权重尚未公开,Hugging Face 仓库只是一个空占位,目前世上无人能运行它。更长的答案则关乎:当两个 Apache-2.0 模型都在阅读能力上宣称重叠,却只有其中一个是你真正能握在手里的东西时,意味着什么。

实际存在的那个2.4B

North Micro Vision Instruct 是 Cohere North 系列中的视觉专家:总参数约 24 亿,是一个以原生分辨率读取文档的紧凑模型。其设计要点在于,大多数视觉模型会将图像缩小到固定网格,从而丢失文档所依赖的精细细节——因此 North Micro Vision Instruct 接受原生分辨率的图像,最高约为 200 dpi 的 A4 页面,同时保留宽高比和小字号文本。Cohere 报告的数据在同尺寸级别中表现强劲:DocVQA 0.921,ChartQA 0.808,OCRBench 0.792,均为 Cohere 自行报告且未复现;已验证的多模态上下文约为 8K token,并在 MMMU(0.329)上存在有记录的短板——这也提醒我们,它是一个阅读专家,而非推理通才。它没有自己的托管 API,也没有标准的托管路线;实际使用方式是在本地自行托管一个 2.4B 模型,该模型足够小,可在单张现代工作站 GPU 上运行。社区采用一直稳步增长——到 8 月下旬,Hugging Face 页面显示每月下载量已达数万次。

作为承诺的那个16B

InternLumina-U2是一件不同寻常的产物。上海人工智能实验室于2026年9月1日发布的是推理代码和架构,而非模型:一个稀疏专家混合扩散大语言模型,总参数160亿、激活参数10亿,围绕全离散八码本视觉表示构建。该仓库的驱动脚本覆盖六类任务——文本、图像理解、文生图、图像编辑、视频理解、3D理解——其中图像理解明确包含密集图表和文档。项目页面的初步表格列出了该实验室报告的数字,与那位专家的声称处于同一区间:ChartQA 86.52、CharXiv-DQ 83.65,另有HallusionBench 62.15和MathVision 33.22。页面称这些结果为“初步的、不完整的”,本应承载完整表格的技术报告标注为“即将推出”,而且——决定性的事实是——没有任何权重可供任何人验证。

记分牌

下方所有数字均由供应商自行报告。North Micro Vision Instruct 的数据来自 Cohere 自己的评估;InternLumina-U2 的数据则来自其实验室初步整理的部分数据表。

• 尺寸与形态 — North Micro Vision Instruct:约24亿参数的稠密模型,原生分辨率阅读器。InternLumina-U2:总计160亿参数 / 激活10亿参数的稀疏MoE,离散多码本扩散模型。

• 功能 — North Micro Vision Instruct:可读取图像、文档、图表和 UI 界面;以文本形式作答,并引用依据。InternLumina-U2:宣称兼具读取与生成能力——可理解图像/视频/3D,并能生成和编辑图像。

• 权重 — North Micro Vision Instruct:自2026年8月10日起公开(CohereLabs/North-Micro-Vision-Instruct,Apache-2.0)。InternLumina-U2:未公开;Hugging Face 存根为空,权重标记为“即将推出”。

• 主要阅读成绩——North Micro Vision Instruct:DocVQA 0.921,ChartQA 0.808,OCRBench 0.792(Cohere 报告)。InternLumina-U2:ChartQA 86.52,CharXiv-DQ 83.65,HallusionBench 62.15(实验室报告,初步数据)。

• 文档上下文——North Micro Vision Instruct:原生分辨率最高支持约A4幅面(200 dpi),已验证约8K多模态上下文。InternLumina-U2:通过AToken多码本编码器处理密集图表和自然图像;上下文尚未指定。

已知弱点 — 北微视觉指令(North Micro Vision Instruct):MMMU 0.329,无工具调用 — 是一个阅读器,而非推理器或代理。InternLumina-U2:在其自身的部分表格中,在GenEval上落后于至少一个具名对手(0.81对0.89);一切未经验证。

• 如何运行它——North Micro Vision Instruct:自行托管一个 2.4B 模型;vLLM 支持在撰写本文时仍在落地中。InternLumina-U2:没人能运行它——没有权重,而且发布的驱动需要的 checkpoint 目录和 tokenizer 文件都不在仓库中。

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

同样的基准,两种截然不同的认知方式

ChartQA 是看清这两种说法之间差异的最直接方式。两个模型都报告了 ChartQA 数值:North Micro Vision Instruct 报告的是 0.808 这个准确率分数,而 InternLumina-U2 报告的是 86.52 这个百分比——同一个基准,本质上是在不同量纲下落在 80 多分区间内的相近结果,即便不同的评估划分和提示设置使得跨论文的 ChartQA 比较即使在两个模型都存在时也充满陷阱。真正重要的是认识层面的差异:North Micro Vision Instruct 的 0.808 与一个可下载的产物绑定在一起,因此任何拥有 GPU 和一组图表的团队本周就能复现或推翻它。InternLumina-U2 的 86.52 则与一份路线图绑定。一个你无法核验的数字,就是你不应据以构建的数字——而这恰恰是该实验室自身也承认的立场,它给自己的表格标注了“初步”字样。

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

CohereLabs/North-Micro-Vision-Instruct 的 Hugging Face 模型卡,截取于2026年8月27日——2.4B原生分辨率视觉-语言描述、Apache-2.0许可证,以及 Cohere 报告的文件阅读基准测试。

阅读,与阅读和绘画相比

架构哲学的差距比基准测试的差距更有价值。North Micro Vision Instruct 是一个狭窄的专才:它负责阅读,而且它能以足够低的成本完成这一项工作,让你可以在流水线中对每一页、每一张截图、每一张发票运行它,而不必盯着你的 GPU 账单。这种廉价本身就是特性——规模化的文档智能,与其说是准确性问题,不如说是成本问题。InternLumina-U2 则是相反的下注:一个巨大的稀疏模型,试图将阅读与图像生成、图像编辑、视频理解和 3D 理解折叠进同一个共享的离散词元接口,其理论依据是理解与生成能够相互强化。如果它成功了,那将是另一类工具——但“如果它成功了”这个前提承担了太多分量,而一个带有自定义分词器和 Blender 渲染 3D 预处理的 16B-A1B 扩散 MoE,永远不可能成为 2.4B 专才那样的廉价常驻阅读器。这两者其实并非替代品。它们一个是今天就可以部署的工具,一个是你可以为之准备的研究方向。

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

截图于2026年9月2日的 InternLM/InternLumina-U2 GitHub 仓库——仓库首页展示了"Omni-Visual Understanding, Image Generation and Editing"的描述,以及各任务对应的推理脚本;其中图像理解路径面向的是自然图像和密集图表。

如果你正在构建文档流水线,这意味着什么

这两个模型都没有托管在OrcaRouter上——North Micro Vision Instruct是自托管模型,没有托管API;InternLumina-U2也没有开放权重可供任何人托管——所以这里的路由切入点不是“今天通过同一个密钥同时调用它们两个”。而是有朝一日其中任何一个发生变化时你会采用的那种模式:文档流水线几乎总是将低成本阅读器与更强大的推理器配对使用,而路由层的价值就在于把这种配对表达为一次调用,同时在你实际使用的托管模型上保持0%加价的透明直传。当InternLumina-U2这样的Apache-2.0检查点最终落地时,明智的做法不是拆掉一套运转良好的文档技术栈——而是把新模型放到自动故障转移后方的测试路径上,让它通过经受住生产流量的考验来赢得生产流量;一旦它在处理真实图表时失败,调用就会回退到那个已经证明过自己的模型。一个覆盖200多个模型的API是机制,故障转移是安全网,而今天就能运行的那个专业模型才是付账单的收入来源——与此同时,16B的承诺仍在兑现之中。

裁决

就当下的文档与图表阅读而言,North Micro Vision Instruct 是两者中唯一具有实际可用意义的——体积小、Apache-2.0 许可、可下载,而且厂商报告的高分你确实可以亲自查证。InternLumina-U2 则是更有意思的长期产物,因为它正试图在单个统一模型中将“阅读”打造为六项技能之一;如果这能成功,就会改变“视觉模型”的定义。关注它那个空荡荡的 Hugging Face 仓库,要像注视发射倒计时一样:当 safetensors 文件出现的那一天,承诺就变成了模型,比较也随之成为真正的比较。在那之前,做决策时不要让厂商报告的图表基准 86.52 压过一个可下载的 0.808。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube