
Nemotron Parse 2.0 vs MinerU:未公開的挑戰者 vs 開源默認之選
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA-Nemotron-Parse-2.0 和 MinerU 從相反方向解決同一個問題。兩者都能接受掃描或渲染後的頁面,並回傳乾淨、結構化的 Markdown,表格、公式與閱讀順序都完整保留。但 MinerU 是開源預設首選——數萬顆 GitHub 星星、Apache-2.0 授權,以及具免費每日額度的託管 API,是多數文件團隊最先接觸的安全選擇。Nemotron Parse 2.0 則遠非定案:它於 2026 年 8 月 3 日出現在 Hugging Face,NVIDIA 沒有發布任何公告,其模型卡上還有一系列基準測試宣稱;若這些宣稱屬實,將成為今年開源文件解析領域最重大的事件。這個組合刻意不對稱——現任者對上未經宣布的挑戰者——而真正的問題在於,雙方的說法究竟有多少實際價值。
每一方實際上是什麼
MinerU 是一套完整的文件解析系統,出自 OpenDataLab——上海人工智慧實驗室(Shanghai AI Laboratory)開源發布背後的資料團隊。目前的旗艦版本是 MinerU 2.5-Pro,這是一個具有 1.2B 參數的視覺語言模型,屬於 2604/2605 點版本發布系列(2604 版於 2026 年 4 月推出,其後接著 2605 的更新版本)。它建立在一個兩階段引擎之上:先進行粗略的全域版面分析,再針對原生解析度的裁切區域進行定向辨識;該專案並將模型整合至 PDF、DOCX、PPTX 與 XLSX 的檔案解析、版面偵測、公式與表格辨識,以及閱讀順序重建等功能中。它是 RAG 前處理的參考開源解析器,而其社群就是最好的證明。
Nemotron Parse 2.0 是 NVIDIA 推出的 0.9B 視覺編碼器-解碼器,與 2026 年 2 月發布的 NVIDIA-Nemotron-Parse-v1.2 屬同一系列。它採用基於 NVIDIA C-RADIOv2 骨幹的 ViT-H 視覺編碼器,搭配十層 mBART 風格解碼器。輸入頁面最高可達 2048×1664,生成上限為 9,000 個 token,並輸出與 MinerU 相同的結構化結果:Markdown 或純文字,加上 LaTeX、HTML、Markdown、JSON、階層式 JSON 或 CSV 格式的表格,並附帶版面類別、邊界框與閱讀順序。此儲存庫內容完整——包含設定檔、Dockerfile、具黃金輸出的測試套件——但 NVIDIA 尚未推廣它,沒有 NIM 封裝,也沒有任何推論供應商代管。目前唯一的選項是自行代管。

價格的故事:「免費」意味著兩種不同的事物
實務上最大的差異在於:MinerU 免費呼叫,而 Nemotron Parse 2.0 僅有執行免費。MinerU 在 mineru.net 的官方 API 提供每日免費額度——依目前活動大約每天 1,000 頁高優先權頁面——額度內不按次收費,且單一檔案最多 200 頁。超過配額後,工作會被降級處理而非收費;商業代管業者對自架模型(self-hosted)的定價約為每頁十分之一美分。如果你的流程每天需要數千頁、又不想自己維運任何東西,MinerU 提供一條幾乎零成本的路徑。
Nemotron Parse 2.0 沒有這樣的路徑。其權重在 NVIDIA 開放模型授權(NVIDIA Open Model License)下免費提供,但模型卡說明它並未由任何推論供應商部署,而且 NVIDIA 尚未為託管選項定價或發布相關消息。使用它意味著需要租用或自備 GPU、架設支援 Nemotron Parse 遠端程式碼的 Transformers 或 vLLM 建置,並處理下列部署上的特殊狀況。對小量專案而言,這是實實在在的成本——GPU 遠比每月幾百頁的免費 API 方案昂貴得多。對於已經運行 GPU 基礎設施的團隊來說,權重免費是一項真正的優勢;問題在於營運成本是否值得換取該模型所宣稱的額外價值。
基準差距:這些數字彼此無法對應。
這是大多數比較在不知不覺中出錯的部分,所以讓我們把話說清楚。Nemotron Parse 2.0 的模型卡報告了四項基準:ParseBench 整體得分 0.6391(高於 v1.2 的 0.5782)、MOSCAR 多語言 OCR 的 BoC F1 得分 0.9102(高於 0.4410)、IndicVisionBench 的 ANLS-character 得分 0.7203(高於 0.0612),以及 OmniDocBench 手寫子集的文本編輯距離從 0.9739 改善至 0.3395。MinerU 2.5-Pro 則報告了不同的測試組合:OmniDocBench v1.6 整體得分 95.69——最先進的成績,高於許多更大的模型——另外在密集公式解析上取得 97.29,以及在其自身的 OmniDocBench 測試中文本編輯距離為 0.036。
這兩個模型共用「OmniDocBench」這個名稱,讓它們看起來可以比較,但指標卻不是同一套。NVIDIA 回報的是僅手寫字跡子集的編輯距離;OpenDataLab 回報的則是不同基準版本上的整體綜合分數。ParseBench 是 NVIDIA 自有的測試套件,其中沒有 MinerU 的條目。MOSCAR 和 IndicVisionBench 也都沒有 MinerU 的條目。雙方的每個數字都是廠商自行回報,而且兩個模型都沒有對方也出現於其中的獨立第三方評測結果公開發表。這表示目前沒有一個真正對等比較的數據,能將 Nemotron Parse 2.0 拿來與 MinerU 排名比較——任何告訴你某個模型在基準比較中「勝出」的人,都是在從不同的測試中推論結果。你可以說的大方向是:MinerU 的宣稱已臻成熟,並經得起一年來的社群使用考驗;而 Nemotron Parse 2.0 的宣稱則很新、未經稽核,而且——如果它在 MOSCAR 和 IndicVisionBench 上的大幅躍進能夠重現——對多語言解析尤其意義重大。

它們在實際工作負載上的分歧所在

先擱置基準測試不提,管線中出現的差異主要在於範圍、延遲和多語言覆蓋。
• 輸入範圍 — MinerU 透過其 API 一次處理最多 200 頁的完整 PDF,並合併跨頁表格;Nemotron Parse 2.0 每次呼叫接收一張最大 2048×1664 的頁面影像,因此一份 200 頁的文件需要 200 次請求。如果您的輸入是 PDF,那麼在談論任何準確性問題之前,這就是工作流程上的差異。
• 服務成熟度 — MinerU 提供 vLLM 與 SGLang 後端,並公布吞吐量數據(在單張 A100 上透過其非同步引擎約每秒處理 2 頁),同時附帶 Docker runner 與代管 API。Nemotron Parse 2.0 的服務部署經驗則尚屬早期且顛簸:vLLM 需要遠端程式碼支援,且在 A100/A10 硬體上需使用 Triton attention 後端;其 tokenizer 出廠即帶有序列化的 tokenizer.json,並內建 9,000 token 的填充(padding),曾有服務堆疊因此遇到 6 個 token 的提示詞爆增至 54,000 個 token ID;此外,該 repo 還攜帶一個執行期修補程式,用於不支援其 tied output head 的 vLLM 建置。這些都不是無法克服的問題,但確實存在實際上的摩擦。
• 多語言 — 這是 Nemotron Parse 2.0 最響亮的一張王牌。2.0 版本將詞彙量從約 52,000 擴展到 72,000 個 token,專門用於多語言 OCR,而宣稱的增益也集中在這裡:MOSCAR 從 0.44 提升到 0.91,IndicVisionBench(孟加拉語、印地語、坦米爾語,以及另外七種印度文字)從 0.06 提升到 0.72。MinerU 以支援 109 種語言作為主打特色,但其證明是 OmniDocBench 綜合指標,而非逐種文字的細分數據。如果你的語料庫以印度文字或低資源文字為主,Nemotron Parse 2.0 的數據是更值得測試的宣稱——它們也是最缺乏獨立驗證的。
• 手寫 — NVIDIA 卡片上最大的一項差異就是手寫:OmniDocBench 筆記子集的編輯距離從 0.97 降到 0.34。MinerU 自己的 0.036 文字編輯距離是整體 OmniDocBench 執行的結果,並非手寫子集,所以這兩個數字依然無法直接對比。不過,手寫筆記對兩者來說都是典型的失敗情境,而這正是 Nemotron Parse 2.0 宣稱改進幅度大到值得在你自己的頁面上直接測試的唯一領域。
該由誰來選擇哪一個
如果您想要一個今天就能使用的解析器,請選擇 MinerU:免費的每日配額、成熟的服務、完整的 PDF 輸入、Apache-2.0 授權且無需合規審查,以及一個大到足以讓設定問題的答案早已存在的社群。它成為預設選項是有原因的,而且對於大多數 RAG 預處理工作負載而言,它是風險較低的選擇。
如果你已經習慣自行託管模型,可以選擇 Nemotron Parse 2.0——特別是如果你身處 NVIDIA NIM 或 NeMo 生態系,因為 v1.2 是以 NIM 形式提供,而 2.0 看起來像是它的後繼版本——而且如果你的語料庫特別需要多語言或手寫內容的處理能力。花一個週末在你自己的印度語系頁面或大量筆記的頁面上測試,會比任何基準測試表格都更有參考價值,因為這些宣稱要麼會在獨立資料下重現,要麼就會被推翻。但在你跑過測試、確認你的技術棧已經能處理 tokenizer 與服務部署上的各種特殊狀況之前,不要圍繞一個尚未發布的模型來規劃正式生產路徑。
為什麼解析器不是管線中唯一的成本
無論你選擇哪種方案,一旦文件處理量達到實際規模,解析器通常是文件管線中最便宜的一環。成本高昂的是將解析後的 markdown 轉換為摘要、結構化記錄或答案的 LLM——而正是在這個階段,路由層改變了整體經濟效益。OrcaRouter 將 200+ 模型整合在單一 API 之後,按供應商列表價格收費、不加價,因此供應商降價當天就能立即生效;自動故障轉移也意味著單一供應商效能衰退不會拖垮整個萃取作業。具體來說:你可以在自己的語料庫上,將 Nemotron Parse 2.0 的手寫辨識宣稱與 MinerU 進行比對測試,而無需將下游模型堆疊綁定在任何一種解析器上,因為解析器替換與 LLM 層是解耦的。我們目前並未代管任何一種解析器——Nemotron Parse 2.0 是自架模型,MinerU 則在其自有服務上運行——但 LLM 階段的路由層正是讓解析器選擇不致成為鎖定決策的關鍵。
重點
MinerU 是理性的預設選擇:成熟、小規模呼叫免費、授權寬鬆,且已在生產環境中經過驗證。Nemotron Parse 2.0 則是有趣的賭注:五天前低調推出的 0.9B NVIDIA 模型,其模型卡片宣稱在多語言和手寫辨識上有大幅躍進,但尚無任何人獨立驗證過。如果你主要大量解析英文技術文件,MinerU 就是答案,Nemotron Parse 2.0 的風險不值得承擔。如果你要解析印度語系或低資源文字系統,或手寫筆記,這些宣稱夠重大——而且權重夠免費——自行跑測試的成本很低。NVIDIA 大約每季推出一個新解析器(2025 年 11 月 v1.1、2026 年 2 月 v1.2、現在 2.0),這暗示可能很快就會有新的公告;在公告發布之前,請將 2.0 的數據視為方向性參考,並在你自己的語料庫上測試。
常見問題
Nemotron Parse 2.0 是否可透過任何 API 使用?
無法透過託管服務使用。Hugging Face 模型卡片顯示,該模型尚未由任何推論服務提供商部署,且截至 2026 年 8 月上旬,NVIDIA 也未公布其 NIM 封裝或定價。執行該模型的唯一方式是透過 Hugging Face Transformers(使用 trust_remote_code)自行託管權重,或透過包含 Nemotron Parse 遠端程式碼支援的 vLLM 建置版本。相較之下,MinerU 提供官方 API,並有每日免費頁面額度。
The "best" model for RAG preprocessing depends on your specific workflow. Here's a breakdown: --- **For Embedding (dense retrieval):** - **OpenAI text-embedding-3-large** — excellent semantic quality, good for general-purpose English content, supports Matryoshka dimensionality reduction. - **BGE-M3** (BAAI) — multi-lingual, supports dense + sparse + multi-vector retrieval, strong on long documents. - **Cohere embed-v3** — high quality, supports compression to reduce storage cost. - **E5 / gte-large** (open-source) — solid performance if you need self-hosting or offline processing. **Winning choice:** If cost and latency are not constraints, a commercial API model (OpenAI / Cohere) usually performs best out-of-the-box. If you need multilingual, open-source, or custom domain fine-tuning, BGE-M3 or a fine-tuned E5 model is the practical pick. --- **For Chunking / Preprocessing LLM:** Some pipelines use a language model to clean, normalize, or extract metadata from raw documents before chunking. In that case: - **GPT-4o-mini** — fast, cheap, high-quality at cleaning/structuring text. - **Claude 3.5 Haiku** — strong at following formatting instructions, good for table extraction. - **Mistral Small / Llama 3 8B** — open-source alternatives for self-hosted pipelines where privacy matters. --- **For Re-ranking (after retrieval):** - **Cohere Rerank 3** — best accuracy-to-cost ratio in production. - **BGE-reranker-v2 / bge-reranker-large** — strong open-source option. - **MonoT5 / Cross-Encoder (from sentence-transformers)** — reliable when self-hosted. --- **TL;DR:** | Use case | Recommended | |---|---| | General-purpose English embedding | OpenAI text-embedding-3-large | | Multilingual / free / open-source | BGE-M3 | | Cleaning text + extracting metadata | GPT-4o-mini or Claude Haiku | | Final re-ranking step | Cohere Rerank 3 or BGE-reranker-v2 | If you tell me your data language, domain, and deployment constraints (cloud vs. on-premise, budget, latency), I can narrow it down further.
對於典型的 RAG 管線——英文與中日韓(CJK)技術文件、表格及混合版面——MinerU 是更安全、更經得起考驗的選擇:它接受完整 PDF、合併跨頁表格、具備成熟的伺服能力,且透過免費方案讓小規模使用完全零成本。Nemotron Parse 2.0 只有在你的語料庫以印度語系或低資源文字、手寫筆記、或圖表密集型頁面為主時才是正確的選擇——這些正是其宣稱優勢集中的領域——即便如此,在採用前仍應先用你自己的文件進行驗證。
兩張模型卡上的基準測試數字可以直接比較嗎?
不。Nemotron Parse 2.0 報告 ParseBench(NVIDIA 自家的測試套件)、MOSCAR、IndicVisionBench,以及 OmniDocBench 手寫子集的編輯距離(edit distance)。MinerU 2.5-Pro 報告的是 OmniDocBench v1.6 整體綜合分數,再加上公式與文字編輯指標。重疊的基準名稱並非相同的指標,沒有獨立執行能讓兩個模型在同一測試上互相比較,而且兩張規格表上的每個數字皆為廠商自行回報。應將其視為方向性參考,而非可直接比較的數據。
