「NVIDIA-Nemotron-Parse-2.0」的標題卡:主標題「NVIDIA-Nemotron-Parse-2.0」,副標題「一次低調的文件解析器更新」,以及描述文字「0.9B 視覺編碼器-解碼器・多語言 OCR・圖表感知」,旁邊搭配一幅平面插圖,描繪文件頁面正被解析,帶有彩色邊界框與圖表圖示。OrcaRouter 標誌合成於右下角。
Guides & Insights

NVIDIA-Nemotron-Parse-2.0:NVIDIA 低調推出更智慧的文檔解析器

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

NVIDIA-Nemotron-Parse-2.0 於2026年8月3日出現在 Hugging Face 上,截至撰寫本文時(五天後),NVIDIA 仍未發布任何相關公告——沒有部落格文章、沒有新聞稿,也沒有 X 上的貼文。該儲存庫內容完整:一個 0.9B 的視覺編碼器-解碼器、一張載有與 NVIDIA-Nemotron-Parse-v1.2 對比的完整基準測試表之模型卡、設定檔、Dockerfile、測試套件,甚至還有一個已引用新模型輔助頭的 vLLM 拉取請求。一個零宣傳的完整發布,正是值得我們一探「目前已知資訊」的信號,因此本文正是如此:儲存庫所確立的事實、仍屬廠商自行回報的數字,以及一般發布公告會回答的開放性問題。

什麼是 NVIDIA-Nemotron-Parse-2.0

Nemotron Parse 是 NVIDIA 的文件解析模型:你輸入掃描或渲染的頁面,它會按閱讀順序回傳文字、每個區域的邊界框與語意類別,以及 markdown——包含表格,可選擇 LaTeX、HTML、markdown、JSON、階層式 JSON 或 CSV 格式。它不是通用型 LLM,也不是單純的 OCR 引擎。它介於兩者之間:具版面感知能力的擷取,專為餵給 RAG、擷取和文件智慧流程而設計。

版本 2.0 依據 repo 的配置,保留了與 v1.2 相同的架構家族。視覺編碼器是建立在 NVIDIA C-RADIOv2 骨幹上的 ViT-H,解碼器是十層的 mBART 風格解碼器,整體參數量約為 0.9B。輸入頁面最高可達 2048×1664,生成長度上限為 9,000 個 token,模型會以一組語義類別(文字、標題、章節標題、列表項目、表格、公式、圖片、圖說、腳註、頁首/頁尾,以及其他)來標記區域。這個模型足夠小,可以自托管在單張 GPU 上,這點很重要,因為目前這是唯一能執行它的方式。

v1.2 之後有何變更

這份卡片的有趣之處不在於模型本身,而在於其差異(delta)。NVIDIA-Nemotron-Parse-v1.2 於 2026 年 2 月發布在 Hugging Face 上,詞彙表有 52,329 個 token。2.0 版本將其擴展至 72,256 個 token,約增加了 20k 個 token,而這份卡片也明確說明了原因:這些額外的 token 換來的是多語言 OCR 能力,其中在 CJK 與印度系文字上收益最大。這份模型卡片還列出了另外三項變更:

• 圖表感知解析 — 一個新的 class_Chart> 類別 token,使圖表區域擁有自己的語意類別,而不會與圖片或表格混為一談。

• 改進的手寫文字提取 — 該卡報告 OmniDocBench Notes 資料集上的文字編輯距離從 v1.2 的 0.9739 下降至 0.3395(越低越好),對於這些模型歷史上最弱的案例來說,這是一個大幅度的轉變。

• 改進表格處理,已將其併入 ParseBench 的整體增益中,而非作為獨立數字回報。

一個值得注意的訓練細節:卡片上寫明 2.0 是第 58k 步至第 66k 步訓練檢查點的等權重檢查點湯,這是平穩點版本發布的常見做法——它往往能在不需完全重新訓練的情況下換取穩健性。

卡片回報的數字

以下所有數據均來自NVIDIA自己的模型卡,針對v1.2進行測量,且尚未有任何獨立的第三方運行結果。請將其視為供應商提供的方向性參考數據:

• ParseBench 整體評分 — 從 v1.2 的 0.5782 到 2.0 的 0.6391。ParseBench 是 NVIDIA 自家的基準測試,涵蓋文字保真度、語意格式、表格、圖表與視覺定位。

• MOSCAR 多語言 BoC F1 — 0.4410 至 0.9102。這是該成績表上最大的一次躍升,且與詞彙擴充一致;MOSCAR 涵蓋拉丁字母、阿拉伯文、西里爾字母、中文、韓文、日文、印度文、希伯來文、泰文、希臘文等。

• IndicVisionBench 整體 ANLS-character 分數 — 0.0612 至 0.7203,涵蓋十種印度語言(孟加拉語、古吉拉特語、印地語、卡納達語、馬拉雅拉姆語、馬拉地語、奧里亞語、旁遮普語、泰米爾語、泰盧固語)。

• OmniDocBench 筆記手寫文字編輯距離 — 0.9739 至 0.3395(越低越好)。

Scoreboard for NVIDIA-Nemotron-Parse-2.0: six rows reading Params 0.9B vision-encoder-decoder, Max image 2048×1664, ParseBench 0.6391 (vendor-reported), MOSCAR BoC F1 0.9102 (vendor-reported), IndicVisionBench ANLS 0.7203 (vendor-reported), License NVIDIA Open Model. Footer: 'All figures vendor-reported; no independent scores yet.' OrcaRouter logo composited bottom-right.

這些變化的規模,正是此次發布即使沒有公告也值得重視的原因。在多語言 OCR F1 指標上,{{1}}0.44→0.91 的變動{{/1}}不是一次次要的點版本更新;它看起來像是通常會佔據發布頭條的多語言成果。這些提升能否在獨立評估中站穩腳跟,正是缺乏報導所留下的懸而未決的問題。

repo 沒有告訴我們的事

誠實面對邊界是 quiet-ship 貼文的重點。該 repo 並未確認:

• 2.0 是否(或將)作為 NVIDIA NIM 微服務提供 — v1.2 是透過 NVIDIA 自家的 NIM API 提供服務,2.0 的卡片上未列出 NIM 標籤,也沒有部署端點,且其 repo 頁面註明該模型「未由任何 Inference Provider 部署」。

• 定價(若有的話)——權重本身不收取使用費,但託管選項尚未定價或公佈。

• 獨立基準測試 — Artificial Analysis、LMArena 或 OmniDocBench 目前都還沒有 2.0 的條目,因此沒有可交叉比對廠商數字的參考依據。

• 路線圖——2.0 是墊腳石還是終點,以及是否會有 2.1 風格的後續版本,仍然是未知數。

唯一確定的是授權:該模型採用 NVIDIA Open Model License,允許商業及非商業使用,tokenizer 則採用 CC-BY-4.0。如果你想在產品中使用它,那這項條件已經滿足了。

今天執行它。

自行託管是目前唯一的選項,在您以它為基礎做規劃之前,有一些值得先了解的摩擦點。此模型可透過 `trust_remote_code` 在 Hugging Face Transformers 中載入,vLLM 也能為其提供服務——但前提是所使用的 vLLM 建置版本必須包含 Nemotron Parse 的遠端程式碼支援。在 A100/A10 等級的硬體上,NVIDIA 建議強制使用 Triton 注意力後端,而且您需要四個額外相依套件:albumentations、timm、open_clip_torch 和 einops。另外還有一個 tied-output-head 的怪異之處:2.0 會讓 LM head 與解碼器嵌入(decoder embeddings)保持綁定,而某些 vLLM 建置版本則會另外建立一個獨立的輸出頭——除非您將 NVIDIA 隨附的執行時期修補程式加入 `PYTHONPATH`。

來自生態系的兩個服務層細節讓這更完整。首先,一個目前開放中的 vLLM pull request(截至八月初仍在審查中)透過使用存放於 repo 的 auxiliary_prediction_heads.safetensors.extra sidecar 中的輔助預測頭,為 NVIDIA-Nemotron-Parse-2.0 啟用投機式解碼——模型卡自己的文件描述該檔案在標準推論中並不會被使用,因此這個 PR 是第一個實際用到它的東西。在 H100 上針對 ParseBench 的 1,005 頁普查資料,作者回報相對於單一 token 解碼,並行度 1 時中位數輸出吞吐量提升約 45%,並行度 8 時為 41%,並行度 32 時為 40%——所有數據均來自該 PR,尚未合併也未經獨立重現。其次,一個 Dynamo issue 指出了 2.0 tokenizer 中一個實際的陷阱:它隨附一個序列化的 tokenizer.json,內建了 padding,會將每次 encode 填補到 9,000 個 token,因此載入該 padding tokenizer 的服務堆疊,可能把一個六個 token 的多模態提示詞暴漲成 54,000 個 token ID。如果你自行托管,請確保你的服務路徑是進行線上 tokenization,而不是載入這個被 padding 過的 artifact。

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that the model adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

它在2026年解析市場中的定位

Nemotron Parse 2.0 正在進入一個競爭激烈、快速變化的領域。目前開源文件解析的領導者包括 MinerU 2.5-Pro(上海 AI 實驗室的 1.2B 模型)和 PaddleOCR-VL(0.9B 與 7B 兩種版本),兩者在 OmniDocBench 排行榜上都取得了 90 分左右的綜合分數;此外還有 StepFun 的 GOT-OCR 2.0 作為輕量級的 580M 選項。在 API 方面,Mistral OCR 是主要的商業產品。在您嘗試將 2.0 納入該排名之前,有兩點需要注意。第一,這些數字無法直接比較:Parse 2.0 報告的是 NVIDIA 自家的 ParseBench 套件,而其他模型的分數是 OmniDocBench 綜合分數——任務不同、權重不同,目前尚無公平可比的數字。第二,您不應將 NVIDIA-Nemotron-Parse-2.0 與 NVIDIA 另一個獨立的 NVIDIA-Nemotron-OCR-v2 模型混淆,後者是為 NeMo Curator 管線建置的詞級密集 OCR 模型。Parse 2.0 是具備版面與類別感知的解析器;OCR v2 是逐詞擷取器。兩者是互補工具,而非同一個模型。

誠實來說,Parse 2.0 的賣點並非「在每一項剖析指標上都勝過競爭對手」。它是一個 0.9B 參數、採用寬鬆授權、具版面感知能力的剖析器,其模型卡宣稱在自家前代產品基礎上實現了大幅度的多語言能力躍進——而其產品演進脈絡(2025 年 11 月的 v1.1、2026 年 2 月的 v1.2、2026 年 8 月的 2.0)顯示 NVIDIA 大約每季就會推出新的剖析器。對於已經標準化採用 Nemotron Parse 系列的團隊而言,2.0 是一次可直接替換的升級,具備相同的 API 形式,並提供更強大的多語言表現。至於其他團隊,問題則在於這款尚未公布的模型的宣稱能否經得起獨立測試。

路由層在解析管線中的位置

文件解析模型通常是更長管線中的一個階段,而路由的價值正體現在它周圍的階段。常見的樣態是:Parse 2.0 將頁面轉換為結構化區塊,然後由 LLM 進行摘要、回答問題、抽取實體,或將結果結構化以存入下游儲存庫。而 LLM 這個階段正是路由平台改變成本結構的地方。OrcaRouter 將 200 多個模型整合在單一 API 後方,以供應商的定價收費——零加價——因此供應商宣佈降價當天,我們這邊就會同步反映;若某個供應商效能下降,還會自動容錯轉移。具體而言,這代表解析器可以保持不變,而負責解讀其輸出的模型可以切換、比較或進行容錯路由,無需另簽合約或修改程式碼。如果解析階段是瓶頸,你會想要一個可以微調並自行託管的模型,Parse 2.0 正是如此;如果解讀階段是可變成本,那麼路由平台就應該管理這個階段。我們並不自行託管 Parse 2.0——它是一個自行託管的模型,而非 API——但解析器將結果餵給 LLM 的架構,正是讓 LLM 層使用單一端點發揮效益的典型情境。

Pipeline diagram titled 'A parsing pipeline with a routing layer': four rounded cards in a flow — Parse 2.0 (page → text · bboxes · markdown), Chunks (structured regions in reading order), OrcaRouter (one API · 200+ models · 0% markup), LLM (summary · QA · extraction) — with a footer line 'The parsing stage is self-hosted; OrcaRouter routes the LLM stage at provider list price with automatic failover.' OrcaRouter logo composited bottom-right.

底線

NVIDIA-Nemotron-Parse-2.0 是真實、完整且未對外公布的版本,發布日期為 2026 年 8 月 3 日。該儲存庫展示了一個 0.9B 的版面感知解析器,其模型卡聲稱在多語言與手寫辨識方面相較 v1.2 有非常大的提升,以寬鬆授權發布,但實際自架部署存在不少摩擦。這些數字都尚未經過獨立驗證,而且沒有託管選項,也沒有定價。該怎麼做取決於你的風險承受度:如果你目前正在解析多語言文件,而且你關心的正是多語言指標,那麼宣稱的 0.44→0.91 MOSCAR 躍升幅度已足以讓你在自己的語料庫上花一個週末測試——這種性能差異要麼能複現,要麼會崩潰,而低調發布正是找出答案的最便宜方式。如果你需要可引用的基準數據,或需要受支援的 API 來押注生產路徑,那就等待官方公告或獨立評測結果。與此同時,這就是低調發布的樣貌,而且值得關注。

常見問題

NVIDIA-Nemotron-Parse-2.0 是洩漏還是正式發佈?

這兩個標籤都不太貼切。從零散或部分權重的意義上來說,這並非洩漏——這個 repo 已完整就緒,包含詳細的模型卡、設定檔、Dockerfile、附有黃金輸出的測試套件,以及同時支援 Transformers 和 vLLM 的推理腳本。但從一般意義上來說,這也不是一次正式發布:NVIDIA 沒有發出任何公告,而先前 Nemotron Parse 版本所附的 NIM 封裝和託管端點都已缺席。準確的描述是:這是一次完整的發布,只是廠商尚未選擇推廣——這就是為什麼這裡最誠實的標籤是「靜默發布」,也是為什麼公告通常會定案的事項(定價、路線圖、託管可用性)仍然懸而未決。

供應商的基準測試結果與人們為其他解析器引用的 OmniDocBench 數字相比如何?

它們並不會直接比較。NVIDIA-Nemotron-Parse-2.0 模型卡上的數據來自 ParseBench——NVIDIA 自家的基準測試,涵蓋文字保真度、語義格式、表格、圖表與視覺定位——此外還有 MOSCAR、IndicVisionBench 以及 OmniDocBench 的手寫子集;而市場上的主打分數(MinerU 2.5-Pro、PaddleOCR-VL、Mistral OCR)則是 OmniDocBench 的綜合分數。任務不同、指標不同,目前尚無已發表的同類對比。唯一與生態系統重疊的數字——OmniDocBench Notes 的手寫分數——是以相對於 v1.2 的文字編輯距離來呈現,而非綜合分數,因此仍無法與其他產品排名比較。在獨立評測出現之前,請將 Parse 2.0 的宣稱視為方向性且未經驗證的數據。

團隊在將其投入生產之前應該測試什麼?

三件事。第一,你自己的多語系語料庫:2.0 的全部賣點就在於多語系躍進,而低調發布正好是檢驗那些宣稱的效益能否在你的資料上重現的場合——先跑過你實際會解析的語言,再來相信規格表。第二,自架技術棧:確認你的 vLLM 版本具備 Nemotron Parse 遠端程式碼支援、套用 tied-output-head 修補程式,並驗證你的服務路徑是做線上 tokenization,而不是載入經過填充的 tokenizer.json——後者可能把一段簡短提示詞擴張成 9,000 個 token。第三,授權與服務的課題:權重依 NVIDIA Open Model License 免費提供,但目前沒有已公布的 NIM、沒有定價、也沒有支援合約——所以要圍繞自架來規劃,並在下游透過一個能讓你更換模型、不必重新工程就能容錯轉移的層來路由 LLM 階段,這正是路由平台存在的意義。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube