
Nemotron Parse 2.0 对比 olmOCR:两项任务,都称为解析
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026年8月3日,NVIDIA在Hugging Face上发布了一款新的文档解析模型,而且没有告诉任何人。NVIDIA-Nemotron-Parse-2.0是一个0.9B的视觉编码器-解码器,其模型卡声称相比2026年2月的前代产品,在多语言和图表感知方面有了飞跃,并且它落在了与olmOCR相同的生态系统角落——更准确地说,是olmOCR-2-7B-1025,这是艾伦人工智能研究所推出的7B线性化器,它已悄然成为将PDF转换为LLM训练数据的默认方式。把这称为正面交锋本身就是一个陷阱:这两个模型都被描述为“文档解析”,但它们返回不同的产物,供给不同的流水线,而且它们的基准测试数字实际上从未正面交锋过。真正的问题是,你雇佣一个解析器来做两项工作中的哪一项。
这两件人工制品
Nemotron Parse 2.0 是一个布局语义引擎。给它一个页面图像和一个任务提示,它会返回文本以及顶层的语义层:每个区域(标题、章节、说明文字、表格、图表、页眉、页脚、脚注、参考书目条目)的布局类别、每个区域的边界框,以及它们之间的阅读顺序——markdown 是可选的一种顶层序列化形式。olmOCR 2 是一个线性化器。它接收相同的页面,返回干净、线性化的 markdown,并附带简短的 YAML frontmatter 记录页面级元数据,如主要语言、旋转校正,以及页面是表格还是图表。没有边框、没有类别、没有几何信息:一次遍历,按文档顺序输出文本。
产物决定任务。如果你的流水线需要把事实引用回页面上的某个区域、在扫描件上高亮表格,或者为文档智能提取布局语义,你就需要几何信息——这正是 Nemotron Parse 2.0 的输出空间。如果你在构建训练数据,或者向只消费 token 的文本 LLM 喂入内容,几何信息就是噪声,线性化的 markdown 才恰到好处——这正是 olmOCR 的全部设计。你可以用一个独立的检测器把布局检测附加到 olmOCR 的输出上,也可以丢弃 Nemotron Parse 2.0 的边界框只保留 markdown,但每个模型都是为了把其中一种任务变成原生能力而构建的。
安静的船:代码库展示的内容,尚未确认的内容
NVIDIA-Nemotron-Parse-2.0 于2026年8月3日出现在 Hugging Face 上,没有公告,没有博客文章,也没有 NIM 打包。可了解的是该仓库。它是一个 0.9B 视觉编码器-解码器:基于 NVIDIA C-RADIO 主干网络的 ViT-H 图像编码器、轻量级 1D 卷积适配器,以及十层 mBART 风格解码器。分词器增加了约 20,000 个词条,总数约 72,000,明确用于更高效的多语言支持,模型卡将图表感知解析列为主要功能,通过新的 class_Chart 标记,以及一系列表格序列化(LaTeX、HTML、markdown、JSON、分层 JSON、CSV)。随附两个可选的 logits 处理器:一个用于停止重复的结构化输出,另一个用于对表格裁剪强制应用表格结构。推荐的输入分辨率约为 1024×1280 至 1664×2048,生成上限为 9,000 个 token,模型卡将 Transformers、vLLM、SGLang 和 Docker Model Runner 列为在 Ampere、Hopper、Blackwell 和 Turing 硬件上的运行时。
然而,这些说法全部出自NVIDIA自身,没有任何一项经过独立复现。该模型卡报告ParseBench整体得分为0.6391(高于v1.2的0.5782),MOSCAR多语言OCR的BoC-F1为0.9102(高于0.4410),IndicVisionBench的ANLS-character为0.7203(高于0.0612),以及OmniDocBench手写子集在文本编辑距离上从0.9739提升至0.3395。这些是最大幅度的跃升,但也是验证最少的:ParseBench是NVIDIA自家的基准套件,目前还没有第三方在独立语料上运行Parse 2.0。未得到确认的远不止分数——没有托管推理(模型卡指出该模型尚未由任何推理提供商部署)、没有定价,也没有公布这两项的时间表。

olmOCR 2:人人早已以此衡量的现行基准
olmOCR 是发明了该类目如今所争论基准的模型。olmOCR-2-7B-1025 于 2025 年 10 月 22 日发布,是一个 7B 视觉语言模型,基于 Qwen2.5-VL-7B-Instruct 在 27 万页的 olmOCR-mix-1025 语料库上进行微调,随后通过 GRPO 强化学习,针对自动化"单元测试"奖励进行优化——这些确定性检查用于验证表格是否保持其结构、公式是否被准确转录、阅读顺序是否得以维持。这一单元测试框架演变成了 olmOCR-Bench,涵盖约 1,400 份 PDF 和 7,000 多项检查,并已成为事实上的行业基准:Marker、MinerU 以及十余款商业 OCR 模型现在都在其上公布成绩。olmOCR 2 本身在该基准上总体得分 82.4,比上一版本高出约 4 分,也高于 AI2 在同一页面上引用的 Marker(76.1)和 MinerU(75.8)的分数。
olmOCR 也是这一组合中更成熟的选择。它采用 Apache-2.0 许可,其权重在过去一个月内已被下载约 21.8 万次,olmOCR 工具包在 vLLM 后端上大规模处理渲染、旋转和重试——AI2 的批量估算显示,在租用 GPU 上该流水线的成本约为每百万页 176–190 美元,FP8 版本在单块 H100 上每秒可输出约 3,400 个 token,速度之快以至于发布文章中引用了“不到 2 美元即可处理 10,000 页”。权衡在于语言:olmOCR 明确针对英语数字化印刷品构建并进行基准测试,其模型卡将其标注为英语。Nemotron Parse 2.0 的卖点则完全相反——其宣称的优势集中在中日韩(CJK)和印度语系文字上。

体现权衡的六行
这两个模型都是开放权重的,都可在 Transformers、vLLM 或 SGLang 上运行,并且目前都支持自托管。在决定如何选择它们的关键维度上:
规模 — Nemotron Parse 2.0 为 0.9B;olmOCR 2 为 7B。参数量约为前者的八倍,显存下限也约为其八倍。
• 输出 — Nemotron Parse 2.0 返回文本、布局类别、边界框、阅读顺序和 Markdown;olmOCR 2 返回带有 YAML 元数据块的线性化 Markdown。
• 多语言 — Nemotron Parse 2.0 声称对 CJK 和印度语系提供强大支持(MOSCAR 0.9102、IndicVisionBench 0.7203,厂商报告);olmOCR 2 以英语为优先。
• 旗舰得分 — Nemotron Parse 2.0 报告 ParseBench 分数为 0.6391(NVIDIA 自测,未经审计);olmOCR 2 在 olmOCR-Bench 上得分 82.4(AI2 自测,社区已复用十个月)。
• 许可 — Nemotron Parse 2.0 依据 NVIDIA Open Model License 发布;olmOCR 2 采用 Apache-2.0 许可。
• 已发布 — Nemotron Parse 2.0 于 2026 年 8 月 3 日悄然推出,未事先公告;olmOCR 2 于 2025 年 10 月 22 日发布,并配有发布文章。

决策真正产生影响的三个地方
规模与延迟。0.9B 解码器在服务成本上远低于 7B VLM:更小的 GPU、更少的显存、相同硬件上每秒处理更多页面,而且在按 GPU 时间付费时每页成本更低。如果你已经运行 GPU 基础设施并且语料库很大,那么这每月就会产生实实在在的差异。olmOCR 自己的数据表明,通过 FP8 量化可以让 7B 模型跑得多快——但要想达到这样的速度,仍然需要 H100 级 GPU;而 Nemotron Parse 2.0 的硬件底线是 Ampere 时代的显卡。
多语言。这是最不对称的一行。Nemotron Parse 2.0 专门为多语言 OCR 扩展了约 20,000 个分词器条目,其模型卡声称的提升集中在印度系文字和中日韩文字上。olmOCR 2 没有此类声称——其语言标签为英语。如果你的语料是印地语、泰米尔语、孟加拉语、日语或混合文字,Nemotron Parse 2.0 的数据才值得测试,正因这些数字来自厂商报告且时效较新。
服务端的现实情况。olmOCR 2 已经发布十个月,它的工具链平淡无奇——但这种平淡是好事。Nemotron Parse 2.0 才发布五天,它的服务端故事明显还很稚嫩:vLLM 需要一个带有 Nemotron Parse 远程代码支持的构建版本,绑定的输出头会让某些 vLLM 0.20 构建版本出错(仓库附带了一个运行时补丁),而且 tokenizer.json 带有序列化填充,最多填充到 9,000 个 token——有一个服务栈在打补丁之前,遇到了一个六 token 的提示词扩展到 54,000 个 token ID 的情况。这些都不是致命问题,但正是你在使用新模型时需要预估到的那种摩擦。
为你的流水线选择一个
{{1}}如果你正在为英文文档构建 LLM 训练数据或高吞吐量的文本提取流水线,请选择 olmOCR 2。{{/1}}你将获得一个成熟的工具包、Apache-2.0 许可证、业界如今用以衡量的基准,以及一条久经考验的批处理路径。{{2}}它公认的短板在于语言覆盖范围。{{/2}}
如果您的流水线需要几何信息——布局类别、边界框以及用于接地检索或文档智能的阅读顺序——或者您的语料库以印度语系、中日韩文字或手写页面为主(其声称的优势所在),请选择 Nemotron Parse 2.0。0.9B 的规模让周末测试成本低廉,即使您不确定也值得一试。其公认的局限在于:卡片上的每个数字都是 NVIDIA 自己的,在独立评估中可能会发生变化。
如果你的输入主要是英文原生数字PDF,并且你只需要干净的markdown,那么olmOCR 2是风险较低的默认选择。如果你已经在自托管,并且多语言或基于布局的使用场景确实存在,那么Nemotron Parse 2.0是更值得押注的选择——在正式采用前,先在你自己的页面上测试一下。
避免解析器选择被锁定
文档流水线包含一个解析器阶段,之后是一个 LLM 阶段。一旦数据量真正上来,解析器通常是最便宜的环节——真正让成本随规模增长的是那个把解析后的 markdown 变成摘要、结构化记录或答案的 LLM。路由层改变的正是这个阶段。OrcaRouter 将 200 多个模型放在同一个 API 后面,按提供商的标价收费,不加任何加价,所以供应商降价当天即可生效;自动故障转移也能防止某个性能下降的提供商拖慢批处理任务。本次对比中的两个解析器都不在我们的目录中——两张模型卡均声明它们未被任何推理提供商部署,因此这是一个自托管决策——但让解析器与模型栈解耦的原因,恰恰正是路由在下游侧带来的价值:在 Nemotron Parse 2.0 和 olmOCR 2 之间来回切换,无需改动任何集成,因为 LLM 层始终留在同一个 API 后面,只需一把密钥。
常见问题解答
哪个模型在基准测试中胜出?
两者都不是——这些数字并不构成正面对比。Nemotron Parse 2.0 报告了 ParseBench、MOSCAR、IndicVisionBench 以及 OmniDocBench 手写子集,全部是 NVIDIA 自家的,且没有一项被独立复现。olmOCR 2 报告了 olmOCR-Bench,这是 AI2 自己的基准,业内其他机构现在都基于它发布结果。没有第三方在同一语料库上运行过这两个模型,因此任何直接的“赢家”论断都只是推测。从趋势上看:olmOCR 的数据经受住了社区十个月的使用考验;Nemotron Parse 2.0 的数据是全新的,未来可能变动。
Nemotron Parse 2.0 在处理非英语文档方面真的更好吗?
这就是其宣称的内容——约20,000个token的词汇表扩展,外加MOSCAR达到0.9102、IndicVisionBench达到0.7203,两者均为厂商报告数据,且相较v1.2均有大幅提升。olmOCR 2没有做多语言方面的宣称,并被标注为英语。但在独立评测结果出来之前,请将Nemotron Parse 2.0的多语言增益视为"有前景但未经证实",并在依赖其之前,先在您自己的Indic或CJK页面上进行测试。
其中一个需要更大容量的 GPU 吗?
是的,它能追踪尺寸差异。Nemotron Parse 2.0 的 0.9B 版本适用于中端 Ampere 时代显卡,并且在你已有的硬件上是更便宜的按页选择。olmOCR 2 的 7B VLM 需要大得多的 GPU;据 AI2 称,其 FP8 版本在 H100 上每秒可达到约 3,400 个输出 token。
哪个更适合 RAG 预处理?
这取决于你的检索器需要什么。如果你需要将答案溯源到页面区域、需要布局类别,或者希望将表格和图表作为独立单元进行索引,Nemotron Parse 2.0 的边界框和类别能原生满足这些需求。如果你的 RAG 技术栈只处理干净文本且语料为英文,olmOCR 2 的线性化 markdown 久经考验、更简单,并且有成熟工具包支持。
归根结底
NVIDIA{{1}}本周悄悄发布了一款真正的解析器,且未告诉任何人{{/1}};AI2{{2}}十个月前就发布了一款,并为这一类别设立了基准{{/2}}。当需要{{3}}在预算有限时所需的版面语义、多语言覆盖或手写提取{{/3}}时,Nemotron Parse 2.0 是更合适的选择——而{{4}}其数据最缺乏验证的领域,恰恰是它声称能获胜的领域{{/4}}。当需要{{5}}对英文文档进行大规模线性化文本处理{{/5}},并希望拥有{{6}}一套已稳定运行十个月的工具链{{/6}}时,olmOCR 2 是更合适的选择。两者都尚未部署在任何地方,因此无论怎么选都是自托管决策;{{7}}最便宜的做法,是让两者都跑在你自己的最难处理的页面上,观察各自在哪里出错{{/7}}。
