
Nemotron Parse 2.0 对比 MinerU:未公开的挑战者与开源默认之选
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA-Nemotron-Parse-2.0 和 MinerU 从相反方向解决同一个问题。两者都接收扫描或渲染后的页面,并返回干净、结构化的 Markdown,表格、公式和阅读顺序都完好保留。但 MinerU 是开源领域的默认选择——数万个 GitHub Star、Apache-2.0 许可证,以及带免费每日额度的托管 API,是大多数文档团队首先会伸手去拿的安全之选。Nemotron Parse 2.0 则恰恰相反,远未尘埃落定:它于 2026 年 8 月 3 日出现在 Hugging Face 上,NVIDIA 未就此发布任何公告,其模型卡上附带的一系列基准测试声明,如果经得起验证,将成为今年开放文档解析领域最重大的事件。这种配对刻意呈现出一边倒的格局——现有主流玩家对阵未经宣布的挑战者——而全部问题在于,双方的主张究竟各自价值几何。
各方实际上是什么
MinerU 是来自 OpenDataLab 的完整文档解析系统,OpenDataLab 是上海人工智能实验室开源发布背后的数据团队。当前旗舰版本是 MinerU 2.5-Pro,这是一个 1.2B 参数的视觉语言模型,属于 2604/2605 小版本发布系列(2604 模型于 2026 年 4 月上线,随后有 2605 刷新版本)。它基于两阶段引擎构建——先进行粗略的全局版面分析,再对原生分辨率裁剪区域进行针对性识别——该项目将模型封装为 PDF、DOCX、PPTX 和 XLSX 的导入、版面检测、公式与表格识别以及阅读顺序重建功能。它是 RAG 预处理领域的参考级开源解析器,其社区就是最好的证明。
Nemotron Parse 2.0 是 NVIDIA 推出的一款 0.9B 视觉编码器-解码器模型,与 2026 年 2 月发布的 NVIDIA-Nemotron-Parse-v1.2 属于同一系列。它采用基于 NVIDIA C-RADIOv2 骨干网络的 ViT-H 视觉编码器,以及十层 mBART 风格解码器。输入页面最高支持 2048×1664,生成上限为 9,000 个 token,并输出与 MinerU 相同的结构化结果:markdown 或纯文本,以及 LaTeX、HTML、markdown、JSON、分层 JSON 或 CSV 格式的表格,同时包含布局类别、边界框和阅读顺序。该代码仓库完整——包含配置、Dockerfile、带黄金输出的测试套件——但 NVIDIA 并未推广它,没有 NIM 打包,也没有任何推理服务商托管。目前唯一的选择是自托管。

价格的故事:“免费”有两种不同的含义
最大的实际差异在于,MinerU 可以免费调用,而 Nemotron Parse 2.0 只能免费运行。MinerU 在 mineru.net 上的官方 API 提供每日免费额度——根据当前推广活动,大约每天 1,000 个高优先级页面——在额度内不按次收费,单个文件最多 200 页。超出配额后,任务会被降级处理而不是计费,商业托管方对自托管模型的定价约为每页十分之一美分。如果你的流水线每天需要处理数千页,又不想自己运维任何东西,MinerU 提供了一条几乎零成本的路径。
Nemotron Parse 2.0 没有这样的路径。权重在 NVIDIA 开放模型许可下免费提供,但模型卡说明它未由任何推理提供商部署,NVIDIA 也没有定价或公布托管选项。使用它意味着需要租用或拥有 GPU,搭建支持 Nemotron Parse 远程代码的 Transformers 或 vLLM 构建,并处理下面列出的部署问题。对于小批量项目来说,这是一笔实实在在的成本——GPU 比每月几百页的免费 API 层要昂贵得多。对于已经在运行 GPU 基础设施的团队来说,权重免费是一个真正的优势;问题在于运维开销是否值得该模型所声称的增益。
基准差距:这些数字彼此并不对应
这是大多数比较在不知不觉中出错的部分,所以让我们明确说明。Nemotron Parse 2.0 的卡片报告了四项基准测试:ParseBench 总体得分为 0.6391(高于 v1.2 的 0.5782),MOSCAR 多语言 OCR 的 BoC F1 得分为 0.9102(高于 0.4410),IndicVisionBench 的 ANLS 字符得分为 0.7203(高于 0.0612),以及 OmniDocBench 手写子集,其文本编辑距离从 0.9739 改善到 0.3395。MinerU 2.5-Pro 报告的则是一套不同的测试:OmniDocBench v1.6 总体得分 95.69——这是最先进的,超过了许多更大的模型——此外,密集公式解析得分为 97.29,在其自身的 OmniDocBench 运行中,文本编辑距离为 0.036。
这两个模型共享“OmniDocBench”这一名称,因而看起来具有可比性,但指标却并不一致。NVIDIA 报告的是仅手写子集的编辑距离;OpenDataLab 报告的则是不同基准版本上的总体综合得分。ParseBench 是 NVIDIA 自家的测试套件,其中没有 MinerU 的条目。MOSCAR 和 IndicVisionBench 中也没有 MinerU 的条目。双方的所有数字均为厂商自行报告,且两个模型都没有已发表的、双方共同出现的独立第三方评测结果。这意味着目前没有任何一对一的数字可以将 Nemotron Parse 2.0 与 MinerU 进行排名比较——任何告诉你某个模型在基准对比中“胜出”的人,都是在从不同的测试中做外推。你可以从方向上这么说:MinerU 的声明已经成熟,并经受住了一年的社区使用考验;而 Nemotron Parse 2.0 的声明则是全新的、未经审计的,并且——如果其 MOSCAR 和 IndicVisionBench 的提升能够复现——对多语言解析来说尤其意义重大。

它们在实际工作负载上的差异

抛开基准测试不谈,流水线中显现出来的差异主要体现在范围、延迟和多语言覆盖方面。
• 输入范围 — MinerU 通过其 API 摄取每个文件最多 200 页的完整 PDF,并合并跨页表格;Nemotron Parse 2.0 每次调用接受最大 2048×1664 的页面图像,因此一份 200 页的文档需要 200 次请求。如果您的输入是 PDF,那么在探讨任何准确性问题之前,这就已经是一个工作流差异。
• 服务成熟度——MinerU 提供 vLLM 和 SGLang 后端,并带有已公布的吞吐量(通过其异步引擎,在单块 A100 上约每秒处理 2 页)、一个 Docker 运行器和一个托管 API。Nemotron Parse 2.0 的服务能力还很稚嫩且问题不少:vLLM 需要远程代码支持,并且在 A100/A10 硬件上还需要 Triton 注意力后端;分词器附带了一个序列化的 tokenizer.json,内置了填充至 9,000 个 token 的配置,某个服务栈就曾遇到一个 6 token 的提示词爆炸式地变成 54,000 个 token ID;此外,仓库中还带有一个运行时补丁,用于不支持其捆绑输出头的 vLLM 构建。这些都不是无法克服的,但确实是实实在在的摩擦。
多语言能力——这是 {{1}}Nemotron Parse 2.0{{/1}} 最亮眼的卖点。2.0 版本将词表从约 52,000 个 token 扩展到 72,000 个,专门用于多语言 OCR,所宣称的提升也集中于此:MOSCAR 从 0.44 提升到 0.91,IndicVisionBench(孟加拉语、印地语、泰米尔语以及另外七种印度文字)从 0.06 提升到 0.72。MinerU 将支持 109 种语言作为核心宣传功能,但其依据是 {{2}}OmniDocBench{{/2}} 综合基准,而非逐文字的细分数据。如果你的语料以印度文字或低资源文字为主,Nemotron Parse 2.0 的数据是更值得验证的宣称——同时它们也是独立验证最少的。
• 手写体——在NVIDIA的记分卡上,最大的单项差异就是手写体:OmniDocBench笔记子集上的编辑距离从0.97降到了0.34。MinerU自己的0.036文本编辑距离是在其整体OmniDocBench运行上的,而非手写子集,所以这些数字依然无法直接对比。但手写笔记对两者来说都是典型的失败模式,而正是在这一领域,Nemotron Parse 2.0声称的改进足够大,值得在你自己的页面上做一次直接测试。
谁应该选择哪个
如果你想要一个今天就能调用的解析器,那就选MinerU:免费每日额度、成熟的托管服务、完整的PDF输入、无需合规审查的Apache-2.0许可证,以及一个足够大的社区,配置问题的答案早已存在。它成为默认选择是有道理的,对于大多数RAG预处理工作负载而言,它是风险更低的选择。
如果你已经习惯自行托管模型,那就选 Nemotron Parse 2.0——尤其是当你身处 NVIDIA NIM 或 NeMo 生态时,因为 v1.2 是以 NIM 形式提供的,而 2.0 看起来像是它的继任者——并且如果你的语料库确实需要多语言或手写内容支持。在自己的印度语系页面或笔记密集页面上做一个周末测试,比任何基准表都更有说服力,因为这些宣称要么会在独立数据下得到验证,要么会崩塌。但在你运行该测试并确认 tokenizer 和服务相关的怪癖已在你的技术栈中得到处理之前,不要围绕一个未发布的模型规划生产路径。
为什么解析器不是流水线中唯一的成本
无论你选择什么,一旦数据量真正上来,解析器通常是文档流水线中最便宜的一环。昂贵的环节是把解析后的 Markdown 变成摘要、结构化记录或答案的 LLM——而正是在这个环节,路由层会改变成本格局。OrcaRouter 将 200 多个模型放在同一个 API 后面,按提供商目录价计费、不加任何溢价,因此供应商降价当天即生效;自动故障转移则意味着某个提供商性能下降不会拖垮整个抽取任务。具体来说:你可以用自己的语料库,将 Nemotron Parse 2.0 的手写识别能力与 MinerU 对比测试,而无需把下游模型栈绑定到任何一个解析器——解析器替换与 LLM 层是解耦的。目前我们没有托管这两款解析器:Nemotron Parse 2.0 是自托管模型,MinerU 运行在自己的服务上——但在 LLM 阶段加一个路由层,恰恰是避免解析器选择变成锁定决策的关键。
归根结底
MinerU 是理性的默认选择:成熟、小规模调用免费、许可宽松,且已在生产中得到验证。Nemotron Parse 2.0 则是有趣的赌注:一款 0.9B 参数的 NVIDIA 模型于五天前悄然发布,其模型卡宣称在多语言和手写识别上取得了巨大飞跃,但尚未有人独立验证。如果你主要是在大规模解析英文技术文档,MinerU 就是答案,Nemotron Parse 2.0 的风险不值得冒。如果你解析的是印度系或低资源文字,或是手写笔记,这些宣称足够有分量——权重也足够免费——自己动手跑一次测试很划算。NVIDIA 大约每季度推出一个新解析器(2025 年 11 月发布 v1.1,2026 年 2 月发布 v1.2,现在发布 2.0),这暗示近期可能还有公告发布;在那之前,请把 2.0 的数据当作方向性参考,并在自己的语料库上测试。
常见问题解答
Nemotron Parse 2.0 是否可通过任何 API 使用?
不是通过托管的。Hugging Face 模型卡指出,截至2026年8月初,该模型未由任何推理提供商部署,NVIDIA 也未宣布其 NIM 打包或定价。运行它的唯一方式是自托管权重——通过 Hugging Face Transformers 并使用 trust_remote_code,或通过包含 Nemotron Parse 远程代码支持的 vLLM 构建。相比之下,MinerU 有一个官方 API,提供每日免费页面额度。
对于RAG预处理,哪种模型更好?
对于典型的 RAG 流水线——英语和 CJK 技术文档、表格以及混合版式——MinerU 是更安全、更成熟的选择:它能处理完整 PDF、合并跨页表格、具备成熟的部署能力,并且通过其免费层在小规模使用时无需任何成本。Nemotron Parse 2.0 只有当你的语料库以印度系文字或低资源文字、手写笔记或图表密集页面为主时才成为正确的选择——其宣称的优势集中于此——即便如此,也要在正式采用前用你自己的文档进行验证。
两个模型卡上的基准测试数字可以直接比较吗?
不。Nemotron Parse 2.0 报告的是 ParseBench(NVIDIA 自家套件)、MOSCAR、IndicVisionBench 以及 OmniDocBench 手写子集的编辑距离。MinerU 2.5-Pro 报告的是 OmniDocBench v1.6 总体综合得分,外加公式与文本编辑指标。重叠的基准名称并不代表同一指标;没有独立运行将两个模型置于同一测试中;两张卡上的所有数字均为供应商自行报告。应将其视为方向性参考,而非直接可比。
