《Nemotron Parse 2.0 vs olmOCR》的标题卡:主标题“Nemotron Parse 2.0 vs olmOCR”,副标题“两份工作,都叫解析”,配以左右分栏插图——左侧是一页文档被解析为带标签的边界框,下方标注“版面语义”;右侧是流动的文本行并带有 Markdown 符号,下方标注“线性化 Markdown”。OrcaRouter 标志合成于右下角。
Guides & Insights

Nemotron Parse 2.0 对比 olmOCR:两项任务,都称为解析

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

2026年8月3日,NVIDIA在Hugging Face上发布了一款新的文档解析模型,而且没有告诉任何人。NVIDIA-Nemotron-Parse-2.0是一个0.9B的视觉编码器-解码器,其模型卡声称相比2026年2月的前代产品,在多语言和图表感知方面有了飞跃,并且它落在了与olmOCR相同的生态系统角落——更准确地说,是olmOCR-2-7B-1025,这是艾伦人工智能研究所推出的7B线性化器,它已悄然成为将PDF转换为LLM训练数据的默认方式。把这称为正面交锋本身就是一个陷阱:这两个模型都被描述为“文档解析”,但它们返回不同的产物,供给不同的流水线,而且它们的基准测试数字实际上从未正面交锋过。真正的问题是,你雇佣一个解析器来做两项工作中的哪一项。

这两件人工制品

Nemotron Parse 2.0 是一个布局语义引擎。给它一个页面图像和一个任务提示,它会返回文本以及顶层的语义层:每个区域(标题、章节、说明文字、表格、图表、页眉、页脚、脚注、参考书目条目)的布局类别、每个区域的边界框,以及它们之间的阅读顺序——markdown 是可选的一种顶层序列化形式。olmOCR 2 是一个线性化器。它接收相同的页面,返回干净、线性化的 markdown,并附带简短的 YAML frontmatter 记录页面级元数据,如主要语言、旋转校正,以及页面是表格还是图表。没有边框、没有类别、没有几何信息:一次遍历,按文档顺序输出文本。

产物决定任务。如果你的流水线需要把事实引用回页面上的某个区域、在扫描件上高亮表格,或者为文档智能提取布局语义,你就需要几何信息——这正是 Nemotron Parse 2.0 的输出空间。如果你在构建训练数据,或者向只消费 token 的文本 LLM 喂入内容,几何信息就是噪声,线性化的 markdown 才恰到好处——这正是 olmOCR 的全部设计。你可以用一个独立的检测器把布局检测附加到 olmOCR 的输出上,也可以丢弃 Nemotron Parse 2.0 的边界框只保留 markdown,但每个模型都是为了把其中一种任务变成原生能力而构建的。

安静的船:代码库展示的内容,尚未确认的内容

NVIDIA-Nemotron-Parse-2.0 于2026年8月3日出现在 Hugging Face 上,没有公告,没有博客文章,也没有 NIM 打包。可了解的是该仓库。它是一个 0.9B 视觉编码器-解码器:基于 NVIDIA C-RADIO 主干网络的 ViT-H 图像编码器、轻量级 1D 卷积适配器,以及十层 mBART 风格解码器。分词器增加了约 20,000 个词条,总数约 72,000,明确用于更高效的多语言支持,模型卡将图表感知解析列为主要功能,通过新的 class_Chart 标记,以及一系列表格序列化(LaTeX、HTML、markdown、JSON、分层 JSON、CSV)。随附两个可选的 logits 处理器:一个用于停止重复的结构化输出,另一个用于对表格裁剪强制应用表格结构。推荐的输入分辨率约为 1024×1280 至 1664×2048,生成上限为 9,000 个 token,模型卡将 Transformers、vLLM、SGLang 和 Docker Model Runner 列为在 Ampere、Hopper、Blackwell 和 Turing 硬件上的运行时。

然而,这些说法全部出自NVIDIA自身,没有任何一项经过独立复现。该模型卡报告ParseBench整体得分为0.6391(高于v1.2的0.5782),MOSCAR多语言OCR的BoC-F1为0.9102(高于0.4410),IndicVisionBench的ANLS-character为0.7203(高于0.0612),以及OmniDocBench手写子集在文本编辑距离上从0.9739提升至0.3395。这些是最大幅度的跃升,但也是验证最少的:ParseBench是NVIDIA自家的基准套件,目前还没有第三方在独立语料上运行Parse 2.0。未得到确认的远不止分数——没有托管推理(模型卡指出该模型尚未由任何推理提供商部署)、没有定价,也没有公布这两项的时间表。

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that 2.0 adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

olmOCR 2:人人早已以此衡量的现行基准

olmOCR 是发明了该类目如今所争论基准的模型。olmOCR-2-7B-1025 于 2025 年 10 月 22 日发布,是一个 7B 视觉语言模型,基于 Qwen2.5-VL-7B-Instruct 在 27 万页的 olmOCR-mix-1025 语料库上进行微调,随后通过 GRPO 强化学习,针对自动化"单元测试"奖励进行优化——这些确定性检查用于验证表格是否保持其结构、公式是否被准确转录、阅读顺序是否得以维持。这一单元测试框架演变成了 olmOCR-Bench,涵盖约 1,400 份 PDF 和 7,000 多项检查,并已成为事实上的行业基准:Marker、MinerU 以及十余款商业 OCR 模型现在都在其上公布成绩。olmOCR 2 本身在该基准上总体得分 82.4,比上一版本高出约 4 分,也高于 AI2 在同一页面上引用的 Marker(76.1)和 MinerU(75.8)的分数。

olmOCR 也是这一组合中更成熟的选择。它采用 Apache-2.0 许可,其权重在过去一个月内已被下载约 21.8 万次,olmOCR 工具包在 vLLM 后端上大规模处理渲染、旋转和重试——AI2 的批量估算显示,在租用 GPU 上该流水线的成本约为每百万页 176–190 美元,FP8 版本在单块 H100 上每秒可输出约 3,400 个 token,速度之快以至于发布文章中引用了“不到 2 美元即可处理 10,000 页”。权衡在于语言:olmOCR 明确针对英语数字化印刷品构建并进行基准测试,其模型卡将其标注为英语。Nemotron Parse 2.0 的卖点则完全相反——其宣称的优势集中在中日韩(CJK)和印度语系文字上。

Screenshot of the Hugging Face repository page for allenai/olmOCR-2-7B-1025, showing the Apache-2.0 license tag, the English language tag, 217,859 downloads last month, 8B params, the description that it is the BF16 release fine-tuned from Qwen2.5-VL-7B-Instruct on the olmOCR-mix-1025 dataset with additional GRPO RL training for math equations and tables, the note that the best way to use it is the olmOCR toolkit via vLLM, and the line 'This model isn't deployed by any Inference Provider.'

体现权衡的六行

这两个模型都是开放权重的,都可在 Transformers、vLLM 或 SGLang 上运行,并且目前都支持自托管。在决定如何选择它们的关键维度上:

规模 — Nemotron Parse 2.0 为 0.9B;olmOCR 2 为 7B。参数量约为前者的八倍,显存下限也约为其八倍。

• 输出 — Nemotron Parse 2.0 返回文本、布局类别、边界框、阅读顺序和 Markdown;olmOCR 2 返回带有 YAML 元数据块的线性化 Markdown。

• 多语言 — Nemotron Parse 2.0 声称对 CJK 和印度语系提供强大支持(MOSCAR 0.9102、IndicVisionBench 0.7203,厂商报告);olmOCR 2 以英语为优先。

• 旗舰得分 — Nemotron Parse 2.0 报告 ParseBench 分数为 0.6391(NVIDIA 自测,未经审计);olmOCR 2 在 olmOCR-Bench 上得分 82.4(AI2 自测,社区已复用十个月)。

• 许可 — Nemotron Parse 2.0 依据 NVIDIA Open Model License 发布;olmOCR 2 采用 Apache-2.0 许可。

• 已发布 — Nemotron Parse 2.0 于 2026 年 8 月 3 日悄然推出,未事先公告;olmOCR 2 于 2025 年 10 月 22 日发布,并配有发布文章。

Two-column comparison scoreboard titled 'Nemotron Parse 2.0 vs olmOCR — the scoreboard'. Left column 'Nemotron Parse 2.0': Size 0.9B vision-encoder-decoder, Output bboxes, classes, reading order + markdown, Multilingual CJK + Indic strong, Score ParseBench 0.6391 (vendor), License NVIDIA Open Model, Shipped Aug 3, 2026 unannounced. Right column 'olmOCR 2': Size 7B VLM (Qwen2.5-VL), Output linearized markdown + YAML metadata, Multilingual English-first, Score olmOCR-bench 82.4, License Apache 2.0, Shipped Oct 22, 2025. Footer: 'Nemotron scores vendor-reported (NVIDIA); olmOCR scores per AI2's olmOCR-bench.' OrcaRouter logo composited bottom-right.

决策真正产生影响的三个地方

规模与延迟。0.9B 解码器在服务成本上远低于 7B VLM:更小的 GPU、更少的显存、相同硬件上每秒处理更多页面,而且在按 GPU 时间付费时每页成本更低。如果你已经运行 GPU 基础设施并且语料库很大,那么这每月就会产生实实在在的差异。olmOCR 自己的数据表明,通过 FP8 量化可以让 7B 模型跑得多快——但要想达到这样的速度,仍然需要 H100 级 GPU;而 Nemotron Parse 2.0 的硬件底线是 Ampere 时代的显卡。

多语言。这是最不对称的一行。Nemotron Parse 2.0 专门为多语言 OCR 扩展了约 20,000 个分词器条目,其模型卡声称的提升集中在印度系文字和中日韩文字上。olmOCR 2 没有此类声称——其语言标签为英语。如果你的语料是印地语、泰米尔语、孟加拉语、日语或混合文字,Nemotron Parse 2.0 的数据才值得测试,正因这些数字来自厂商报告且时效较新。

服务端的现实情况。olmOCR 2 已经发布十个月,它的工具链平淡无奇——但这种平淡是好事。Nemotron Parse 2.0 才发布五天,它的服务端故事明显还很稚嫩:vLLM 需要一个带有 Nemotron Parse 远程代码支持的构建版本,绑定的输出头会让某些 vLLM 0.20 构建版本出错(仓库附带了一个运行时补丁),而且 tokenizer.json 带有序列化填充,最多填充到 9,000 个 token——有一个服务栈在打补丁之前,遇到了一个六 token 的提示词扩展到 54,000 个 token ID 的情况。这些都不是致命问题,但正是你在使用新模型时需要预估到的那种摩擦。

为你的流水线选择一个

{{1}}如果你正在为英文文档构建 LLM 训练数据或高吞吐量的文本提取流水线,请选择 olmOCR 2。{{/1}}你将获得一个成熟的工具包、Apache-2.0 许可证、业界如今用以衡量的基准,以及一条久经考验的批处理路径。{{2}}它公认的短板在于语言覆盖范围。{{/2}}

如果您的流水线需要几何信息——布局类别、边界框以及用于接地检索或文档智能的阅读顺序——或者您的语料库以印度语系、中日韩文字或手写页面为主(其声称的优势所在),请选择 Nemotron Parse 2.0。0.9B 的规模让周末测试成本低廉,即使您不确定也值得一试。其公认的局限在于:卡片上的每个数字都是 NVIDIA 自己的,在独立评估中可能会发生变化。

如果你的输入主要是英文原生数字PDF,并且你只需要干净的markdown,那么olmOCR 2是风险较低的默认选择。如果你已经在自托管,并且多语言或基于布局的使用场景确实存在,那么Nemotron Parse 2.0是更值得押注的选择——在正式采用前,先在你自己的页面上测试一下。

避免解析器选择被锁定

文档流水线包含一个解析器阶段,之后是一个 LLM 阶段。一旦数据量真正上来,解析器通常是最便宜的环节——真正让成本随规模增长的是那个把解析后的 markdown 变成摘要、结构化记录或答案的 LLM。路由层改变的正是这个阶段。OrcaRouter 将 200 多个模型放在同一个 API 后面,按提供商的标价收费,不加任何加价,所以供应商降价当天即可生效;自动故障转移也能防止某个性能下降的提供商拖慢批处理任务。本次对比中的两个解析器都不在我们的目录中——两张模型卡均声明它们未被任何推理提供商部署,因此这是一个自托管决策——但让解析器与模型栈解耦的原因,恰恰正是路由在下游侧带来的价值:在 Nemotron Parse 2.0 和 olmOCR 2 之间来回切换,无需改动任何集成,因为 LLM 层始终留在同一个 API 后面,只需一把密钥。

常见问题解答

哪个模型在基准测试中胜出?

两者都不是——这些数字并不构成正面对比。Nemotron Parse 2.0 报告了 ParseBench、MOSCAR、IndicVisionBench 以及 OmniDocBench 手写子集,全部是 NVIDIA 自家的,且没有一项被独立复现。olmOCR 2 报告了 olmOCR-Bench,这是 AI2 自己的基准,业内其他机构现在都基于它发布结果。没有第三方在同一语料库上运行过这两个模型,因此任何直接的“赢家”论断都只是推测。从趋势上看:olmOCR 的数据经受住了社区十个月的使用考验;Nemotron Parse 2.0 的数据是全新的,未来可能变动。

Nemotron Parse 2.0 在处理非英语文档方面真的更好吗?

这就是其宣称的内容——约20,000个token的词汇表扩展,外加MOSCAR达到0.9102、IndicVisionBench达到0.7203,两者均为厂商报告数据,且相较v1.2均有大幅提升。olmOCR 2没有做多语言方面的宣称,并被标注为英语。但在独立评测结果出来之前,请将Nemotron Parse 2.0的多语言增益视为"有前景但未经证实",并在依赖其之前,先在您自己的Indic或CJK页面上进行测试。

其中一个需要更大容量的 GPU 吗?

是的,它能追踪尺寸差异。Nemotron Parse 2.0 的 0.9B 版本适用于中端 Ampere 时代显卡,并且在你已有的硬件上是更便宜的按页选择。olmOCR 2 的 7B VLM 需要大得多的 GPU;据 AI2 称,其 FP8 版本在 H100 上每秒可达到约 3,400 个输出 token。

哪个更适合 RAG 预处理?

这取决于你的检索器需要什么。如果你需要将答案溯源到页面区域、需要布局类别,或者希望将表格和图表作为独立单元进行索引,Nemotron Parse 2.0 的边界框和类别能原生满足这些需求。如果你的 RAG 技术栈只处理干净文本且语料为英文,olmOCR 2 的线性化 markdown 久经考验、更简单,并且有成熟工具包支持。

归根结底

NVIDIA{{1}}本周悄悄发布了一款真正的解析器,且未告诉任何人{{/1}};AI2{{2}}十个月前就发布了一款,并为这一类别设立了基准{{/2}}。当需要{{3}}在预算有限时所需的版面语义、多语言覆盖或手写提取{{/3}}时,Nemotron Parse 2.0 是更合适的选择——而{{4}}其数据最缺乏验证的领域,恰恰是它声称能获胜的领域{{/4}}。当需要{{5}}对英文文档进行大规模线性化文本处理{{/5}},并希望拥有{{6}}一套已稳定运行十个月的工具链{{/6}}时,olmOCR 2 是更合适的选择。两者都尚未部署在任何地方,因此无论怎么选都是自托管决策;{{7}}最便宜的做法,是让两者都跑在你自己的最难处理的页面上,观察各自在哪里出错{{/7}}。