'NVIDIA-Nemotron-Parse-2.0' 的标题卡片:标题行 'NVIDIA-Nemotron-Parse-2.0',副标题 '一次低调的文档解析器更新',描述文字 '0.9B 视觉编码器-解码器 · 多语言 OCR · 图表感知',旁边配有一幅扁平风格插图:一个正在被解析的文档页面,带有彩色边界框和一个图表图标。OrcaRouter 标识合成于右下角。
Guides & Insights

NVIDIA-Nemotron-Parse-2.0:NVIDIA悄然推出更智能的文档解析器

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

NVIDIA-Nemotron-Parse-2.0 于 2026 年 8 月 3 日出现在 Hugging Face 上,截至本文撰写时(五天后),NVIDIA 仍未发布任何公告——没有博客文章、没有新闻稿、没有 X 上的帖子。该仓库内容完整:一个 0.9B 视觉编码器-解码器、一张带有与 NVIDIA-Nemotron-Parse-v1.2 对比的完整基准测试表的模型卡、配置文件、一个 Dockerfile、一套测试套件,甚至还有一个已经引用新模型辅助头的 vLLM 拉取请求。一个没有任何宣传的完整发布,正是那种值得我们盘点已知信息的事件,所以本文做的就是这件事:仓库所确认的事实、仍由厂商提供的数字,以及通常需要官方公告来回答的悬而未决的问题。

NVIDIA-Nemotron-Parse-2.0 是什么

Nemotron Parse 是 NVIDIA 的文档解析模型:你向它输入扫描或渲染后的页面,它会按阅读顺序返回文本、每个区域的边界框和语义类别,以及 Markdown——表格也包含在内,格式可选 LaTeX、HTML、Markdown、JSON、分层 JSON 或 CSV。它不是通用大语言模型,也不是纯粹的 OCR 引擎。它介于两者之间:一种布局感知的提取工具,旨在为 RAG、提取和文档智能流水线提供数据。

根据仓库配置,2.0版与v1.2版保持相同的架构家族。视觉编码器是基于NVIDIA C-RADIOv2主干构建的ViT-H,解码器是十层mBART风格解码器,整体参数量约为0.9B。输入页面最高支持2048×1664,生成长度上限为9,000个token,模型用一组语义类别标记区域(文本、标题、章节标题、列表项、表格、公式、图片、说明文字、脚注、页眉/页脚,以及其他)。该模型足够小,可以在单块GPU上自行托管,这一点很重要,因为目前这是运行它的唯一方式。

v1.2 有什么变化?

这张模型卡的有趣之处不在于模型本身,而在于增量。NVIDIA-Nemotron-Parse-v1.2 于 2026 年 2 月在 Hugging Face 上发布,词汇量为 52,329 个 token。2.0 版本将词汇量扩展到 72,256 个 token,增加了约 2 万个 token。模型卡明确说明了原因:额外的 token 换来了多语言 OCR 能力,其中在 CJK 和印度系文字上提升最大。模型卡还列出了另外三项变更:

• 图表感知解析 — 一种新的class_Chart> 类标记,使图表区域拥有自己的语义类别,而不是与图片或表格归为一类。

• 改进了手写文本提取——该卡片报告 OmniDocBench Notes 数据集上的文本编辑距离从 v1.2 的 0.9739 下降到 0.3395(越低越好),对于这些模型历史上最薄弱的场景来说,这是一个巨大的改善。

• 改进了表格处理,并将其并入 ParseBench 的整体提升中,而不是作为独立数字单独报告。

一个值得注意的训练细节:模型卡显示 2.0 是对第 58k 到 66k 步训练检查点进行等权平均得到的检查点汤,这是小版本发布的常见做法——它往往能在无需完整重新训练的情况下提升稳健性。

该卡报告的数字

以下所有数据均来自NVIDIA自家的模型卡,基于v1.2版本测得,且目前均未经独立第三方复现验证。请将其视为厂商报告值,仅作方向性参考:

• ParseBench 整体评分——从 v1.2 的 0.5782 到 2.0 的 0.6391。ParseBench 是 NVIDIA 自己的基准测试,涵盖文本保真度、语义格式、表格、图表和视觉定位。

• MOSCAR 多语言 BoC F1 — 从 0.4410 跃升至 0.9102。这是整张榜单上最大的一次提升,与词汇扩展相吻合;MOSCAR 涵盖拉丁文、阿拉伯文、西里尔文、中文、韩文、日文、印度文、希伯来文、泰文、希腊文等。

• IndicVisionBench 总体 ANLS-character 从 0.0612 到 0.7203,涵盖十种印度语言(孟加拉语、古吉拉特语、印地语、卡纳达语、马拉雅拉姆语、马拉地语、奥里亚语、旁遮普语、泰米尔语、泰卢固语)。

• OmniDocBench 笔记手写文本编辑距离 — 从 0.9739 降至 0.3395(越低越好)。

Scoreboard for NVIDIA-Nemotron-Parse-2.0: six rows reading Params 0.9B vision-encoder-decoder, Max image 2048×1664, ParseBench 0.6391 (vendor-reported), MOSCAR BoC F1 0.9102 (vendor-reported), IndicVisionBench ANLS 0.7203 (vendor-reported), License NVIDIA Open Model. Footer: 'All figures vendor-reported; no independent scores yet.' OrcaRouter logo composited bottom-right.

这些差异的规模正是此次发布即使没有公告也意义重大的原因。多语言OCR F1指标从0.44跃升至0.91,这绝非小版本更新;这看起来像是通常会被当作发布主打亮点的多语言工作成果。这些进展能否经得起独立评估的检验,正是缺乏报道所留下未决的问题。

仓库没有告诉我们的事

如实说明不足之处,正是低调发布帖的意义所在。该仓库并未确认:

• 2.0 是否(或将会)作为 NVIDIA NIM 微服务提供 — v1.2 通过 NVIDIA 自家的 NIM API 提供服务,2.0 卡片未列出 NIM 标签且没有部署端点,其仓库页面注明该模型“未由任何推理提供商部署”。

• 定价(如有)——权重本身不收取使用费,但托管选项尚未定价或公布。

• 独立基准测试——Artificial Analysis、LMArena 或 OmniDocBench 上尚无 2.0 的条目,因此没有可供交叉核对供应商数据的依据。

路线图——2.0究竟是垫脚石还是终点,以及是否会有2.1式的后续版本,目前尚不可知。

唯一确定的是许可证:该模型采用 NVIDIA 开放模型许可证,允许商业和非商业用途,分词器则采用 CC-BY-4.0。如果你想在产品中使用它,这一项已经满足了。

今天运行它。

目前唯一的选择是自托管,并且它带有一些在您围绕它做规划之前值得了解的不便之处。该模型通过 `trust_remote_code` 在 Hugging Face Transformers 中加载,vLLM 也可以为其提供服务——但前提是所使用的 vLLM 构建版本包含 Nemotron Parse 的远程代码支持。在 A100/A10 级别的硬件上,NVIDIA 建议强制使用 Triton 注意力后端,并且您需要四个额外的依赖项:albumentations、timm、open_clip_torch 和 einops。还有一个 tied-output-head(输出头绑定)的怪癖:2.0 将 LM 头与解码器嵌入保持绑定,而某些 vLLM 构建会生成一个独立的输出头,除非您将 NVIDIA 附带的运行时补丁添加到 PYTHONPATH。

生态中的两个服务化细节补全了这一图景。首先,vLLM 上有一个目前处于打开状态的拉取请求(截至 8 月初仍在评审中),它利用仓库的 auxiliary_prediction_heads.safetensors.extra sidecar 文件中存储的辅助预测头,为 NVIDIA-Nemotron-Parse-2.0 启用了投机解码(speculative decoding)——模型卡自己的文档将该文件描述为标准推理中不会使用,因此这个 PR 是第一个真正用到该文件的。在一张 H100 上,针对 ParseBench 的 1,005 页基准语料,作者报告称,与单 token 解码相比,在并发度为 1、8、32 时,中位输出吞吐量分别提升约 45%、41% 和 40%——所有这些数据均来自该 PR,尚未合并,也未经独立复现。其次,Dynamo 的一个 issue 指出了 2.0 分词器中的一个真实陷阱:它附带了一个序列化的 tokenizer.json,其中内置了填充逻辑,会将每次编码都填充到 9,000 个 token,因此,加载该带填充分词器的服务栈,可能会把一个 6 token 的多模态提示词膨胀成 54,000 个 token ID。如果你自托管,请确保你的服务链路执行在线分词,而不是加载这个带填充的产物。

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that the model adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

它在2026年解析市场中的位置

Nemotron Parse 2.0正进入一个竞争激烈且快速演进的领域。当前开源文档解析的领先者包括MinerU 2.5-Pro(来自上海人工智能实验室的1.2B模型)和PaddleOCR-VL(0.9B与7B版本),两者在OmniDocBench排行榜上的综合得分均在90出头,此外还有来自StepFun的GOT-OCR 2.0,作为580M的轻量级选择;在API层面,Mistral OCR是主要的商业产品。在你尝试将2.0纳入这一排名之前,有两点需要注意。第一,数字并不具备可比性:Parse 2.0报告的是ParseBench(NVIDIA自有的评测集),而该领域其他模型的得分是OmniDocBench综合分数——任务不同、权重不同,目前尚不存在可对等比较的数值。第二,你不应将NVIDIA-Nemotron-Parse-2.0与NVIDIA另一款独立的NVIDIA-Nemotron-OCR-v2模型混淆,后者是为NeMo Curator流水线构建的词级稠密OCR模型。Parse 2.0是布局与类别感知的解析器;OCR v2则是逐词提取器。它们是互补的工具,而非同一个模型。

实事求是的说,Parse 2.0 的卖点并非"在每项解析指标上都碾压对手"。它是一款 0.9B 参数、采用宽松许可协议、具备布局感知能力的解析器,其规格表声称相较前代产品实现了非常大的多语言能力跃升——从其产品迭代线(2025 年 11 月的 v1.1、2026 年 2 月的 v1.2、2026 年 8 月的 2.0)可以看出,NVIDIA 大约每个季度都会发布一款新解析器。对于已经标准化采用 Nemotron Parse 系列的团队来说,2.0 是一次无缝升级,API 形态相同,多语言能力大幅增强。对其他人而言,问题在于这款尚未官宣的模型所宣称的性能能否经得起独立测试的验证。

路由层在解析管道中的位置

文档解析模型通常是更长流程中的一个阶段,而它周围的阶段正是路由发挥价值之处。常见的形态是:Parse 2.0 将页面转换为结构化块,然后由 LLM 进行摘要、回答问题、提取实体或为下游存储结构化结果。LLM 阶段正是路由平台改变经济性的地方。OrcaRouter 以提供商的标价将 200 多个模型放在一个 API 后面——0% 加价,因此供应商降价会在公布当天就反映在我们这边——并且如果某个提供商性能下降,会自动故障转移。具体来说,这意味着解析器可以保持不变,而解释其输出的模型可以在无需第二份合同或代码更改的情况下被替换、比较或故障转移路由。如果解析阶段是瓶颈,您需要一个可以调优并自行托管的模型,Parse 2.0 正是如此;如果解释阶段是可变成本,那么路由器应管理的就是这个阶段。我们自己不托管 Parse 2.0——它是一个自托管模型,而非 API——但为 LLM 提供输入的解析器正是单个端点用于 LLM 层最划算的设置。

Pipeline diagram titled 'A parsing pipeline with a routing layer': four rounded cards in a flow — Parse 2.0 (page → text · bboxes · markdown), Chunks (structured regions in reading order), OrcaRouter (one API · 200+ models · 0% markup), LLM (summary · QA · extraction) — with a footer line 'The parsing stage is self-hosted; OrcaRouter routes the LLM stage at provider list price with automatic failover.' OrcaRouter logo composited bottom-right.

底线

NVIDIA-Nemotron-Parse-2.0 是一个真实、完整、尚未公开宣布的发布,日期为 2026 年 8 月 3 日。该仓库展示了一个 0.9B 参数的布局感知解析器,其模型卡声称在多语言和手写识别方面相比 v1.2 有非常大的提升,并以宽松许可证发布,不过围绕自托管存在切实的摩擦。这些数字均尚未得到独立验证,而且没有托管选项,也没有定价。正确的做法取决于你的风险承受能力:如果你目前就在解析多语言文档,并且你关心的正是多语言指标,那么声称的 0.44→0.91 MOSCAR 提升幅度足以让你在自己的语料库上花一个周末进行测试——这类增量要么能复现,要么会崩塌,而一次静默发布正是找出答案的最廉价方式。如果你需要一个可以引用的基准,或一个受支持的 API 来押注生产路径,那就等待官方公告或独立运行的结果。与此同时,这就是静默发布的样子,值得关注。

常见问题

NVIDIA-Nemotron-Parse-2.0 是泄露版还是正式发布版?

这两种标签都不完全贴切。它不是那种零散或不完整权重意义上的泄露——代码仓库是完整装配好的,包含详细的模型卡、配置文件、Dockerfile、带黄金输出的测试套件,以及同时面向 Transformers 和 vLLM 的推理脚本。但这也算不上通常意义上的发布:NVIDIA 没有发布任何公告,而且此前 Nemotron Parse 版本附带的 NIM 打包和托管端点也缺失了。准确的说法是:这是一个完整的发布,但供应商尚未选择推广——这就是为什么诚实的标签是"悄然发布",也是为什么那些通常由公告来定论的事项(定价、路线图、托管可用性)仍然是悬而未决的问题。

供应商的基准测试与人们为其他解析器引用的 OmniDocBench 数字相比如何?

它们不会直接可比。NVIDIA-Nemotron-Parse-2.0 卡片上的数据来自 ParseBench——NVIDIA 自家的基准,涵盖文本保真度、语义格式、表格、图表和视觉定位,外加 MOSCAR、IndicVisionBench 以及 OmniDocBench 手写子集——而市场主流分数(MinerU 2.5-Pro、PaddleOCR-VL、Mistral OCR)则是 OmniDocBench 综合分数。任务不同,指标不同,目前还没有已发布的同类可比评测。唯一与生态重叠的数字——OmniDocBench Notes 手写分数——是以针对 v1.2 的文本编辑距离形式报告的,而非综合分数,因此仍然无法与其他结果进行排名对比。在独立评测结果出现之前,请将 Parse 2.0 的说法视为方向性且未经证实的。

团队在将产品投入生产之前应该测试什么?

三件事。第一,你自己的多语种语料库:2.0 的全部卖点就是多语种跃升,而一次低调的发布恰恰是这样的场景——声称的收益要么能在你的数据上复现,要么不能;在相信那张卡片之前,先在你实际解析的语言上跑一遍。第二,自托管技术栈:确认你的 vLLM 构建支持 Nemotron Parse 的远程代码执行,应用 tied-output-head 补丁,并验证你的服务路径执行的是在线分词,而不是加载填充后的 tokenizer.json——后者可能把一条很短的提示词扩展到 9,000 个 token。第三,许可证与服务方面:权重在 NVIDIA Open Model License 下免费,但没有已公布的 NIM、没有定价、也没有支持合同——所以要围绕自托管来规划,并让下游的 LLM 阶段通过一个层进行路由,这个层能让你在不重新工程化的情况下替换模型和故障转移,这正是路由平台的设计初衷。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube