「NVIDIA-Nemotron-Parse-2.0」のタイトルカード:見出し「NVIDIA-Nemotron-Parse-2.0」、サブタイトル「静かなドキュメントパーサーのアップデート」、および説明文「0.9Bビジョン・エンコーダー・デコーダー・多言語OCR・チャート対応」を、カラーのバウンディングボックスとチャートアイコンを備えた解析中のドキュメントページのフラットイラストの横に配置。右下にOrcaRouterのロゴを合成。
Guides & Insights

NVIDIA-Nemotron-Parse-2.0:NVIDIAはひっそりと、よりスマートなドキュメントパーサーをリリースした

著者

Jim Song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

NVIDIA-Nemotron-Parse-2.0 は2026年8月3日にHugging Faceに登場しましたが、この記事を書いている時点(5日後)でも、NVIDIAはまだこれを発表していません。ブログ投稿もプレスリリースもXのスレッドもありません。リポジトリは完成しています。0.9Bのビジョンエンコーダー・デコーダー、NVIDIA-Nemotron-Parse-v1.2との完全なベンチマーク表を備えたモデルカード、設定ファイル、Dockerfile、テストスイート、そして新しいモデルの補助ヘッドをすでに参照しているvLLMのプルリクエストまで含まれています。まったく騒がずに完全なリリースを行うのは、まさに「これまでにわかっていること」をまとめる価値のあるシグナルであり、これがその内容です。すなわち、リポジトリが確定させた事実、まだベンダー側の報告にすぎない数値、そして通常なら発表で答えられるはずの未解決の疑問です。

NVIDIA-Nemotron-Parse-2.0とは

Nemotron Parse は NVIDIA のドキュメント解析モデルです。スキャンまたはレンダリングされたページを入力すると、読み順に沿ったテキスト、各領域のバウンディングボックスとセマンティッククラス、そしてマークダウン(表も含む)を返します。出力形式は LaTeX、HTML、markdown、JSON、階層 JSON、CSV から選択できます。これは汎用 LLM ではなく、単純な OCR エンジンでもありません。その位置づけは両者の中間にあり、RAG、抽出、ドキュメントインテリジェンスの各パイプラインに供給することを目的とした、レイアウトを認識する抽出機能を備えています。

バージョン2.0は、リポジトリの構成によると、v1.2と同じアーキテクチャファミリーを維持しています。ビジョンエンコーダーはNVIDIAのC-RADIOv2バックボーン上に構築されたViT-Hであり、デコーダーは10層のmBARTスタイルのデコーダーで、全体で約0.9Bパラメータになります。入力ページは最大2048×1664まで対応し、生成は9,000トークンの上限まで実行されます。モデルは領域を一連のセマンティッククラス(テキスト、タイトル、セクションヘッダー、リスト項目、表、数式、画像、キャプション、脚注、ページヘッダー/フッター、その他)でタグ付けします。これは単一GPU上でセルフホストできるほど小さなモデルであり、それが重要なのは、現在実行する唯一の方法だからです。

v1.2から何が変わりましたか?

カードの興味深い点はモデルそのものではなく、その差分だ。NVIDIA-Nemotron-Parse-v1.2は2026年2月にHugging Faceで公開され、52,329トークンの語彙を備えていた。バージョン2.0ではそれが72,256トークンに拡大され、約2万トークンの増加だ。カードはその理由を明確に述べている:追加トークンは多言語OCRに割り当てられ、CJK文字とインド系文字で最も大きな効果が得られている。モデルカードには、他にも3つの変更点が挙げられている:

• チャート対応の解析 — 新しい class_Chart> クラストークン。これにより、チャート領域は画像や表とひとくくりにされるのではなく、独自のセマンティッククラスを持つようになります。

• 手書きテキスト抽出を改善 — モデルカードは、OmniDocBench Notes セットにおけるテキスト編集距離が v1.2 の 0.9739 から 0.3395 に低下したと報告しています(低いほど良い)。これは、これらのモデルにとって歴史的に最も弱点とされてきたケースでの大きな変化です。

• テーブル処理を改善し、個別の数値として報告するのではなく、ParseBench全体の向上に織り込みました。

注目すべきトレーニング詳細の1つ:カードには、2.0はステップ58k〜66kのトレーニングチェックポイントを均等に重み付けしたチェックポイントスープであると記載されており、これは静かなポイントリリースの一般的な手法です。完全な再トレーニングなしでロバスト性を高める傾向があります。

カードが報告する数値

以下の数値はすべてNVIDIA自身のモデルカードに基づくもので、v1.2に対して測定されたものです。また、いずれも独立した第三者による実行はまだありません。これらはベンダー報告による値であり、方向性を示すものとして扱ってください。

• ParseBench総合スコア — v1.2の0.5782から2.0の0.6391へ。ParseBenchはNVIDIA独自のベンチマークで、テキスト忠実度、意味的フォーマット、表、チャート、視覚的グラウンディングを対象としています。

• MOSCAR multilingual BoC F1 — 0.4410 から 0.9102。これはカード上で最大の飛躍であり、語彙の拡張と軌を一にしています。MOSCAR はラテン文字、アラビア文字、キリル文字、中国語、ハングル、日本語、インド系文字、ヘブライ文字、タイ文字、ギリシャ文字などをカバーしています。

• IndicVisionBenchの全体的なANLS-character — 0.0612から0.7203、10のインド言語(ベンガル語、グジャラート語、ヒンディー語、カンナダ語、マラヤーラム語、マラーティー語、オディア語、パンジャーブ語、タミル語、テルグ語)にわたって。

• OmniDocBench 手書きノートのテキスト編集距離 — 0.9739 から 0.3395(低いほど良い)。

Scoreboard for NVIDIA-Nemotron-Parse-2.0: six rows reading Params 0.9B vision-encoder-decoder, Max image 2048×1664, ParseBench 0.6391 (vendor-reported), MOSCAR BoC F1 0.9102 (vendor-reported), IndicVisionBench ANLS 0.7203 (vendor-reported), License NVIDIA Open Model. Footer: 'All figures vendor-reported; no independent scores yet.' OrcaRouter logo composited bottom-right.

これらの差分の規模こそが、たとえ発表がなくても今回のリリースが重要である理由です。多言語OCRのF1メトリクスが0.44→0.91に動くのは、マイナーなポイントリリースではありません。それは通常、発表の目玉となるような多言語対応の成果のように見えます。その改善が独立した評価でも維持されるかどうかは、まさに報道の欠如が未解決のままにしている問いなのです。

リポジトリが教えてくれないこと

静かなリリースの投稿の要点は、エッジについて正直であることです。このリポジトリは以下を確認するものではありません:

• 2.0がNVIDIA NIMマイクロサービスとして利用可能か(または今後利用可能になるか)— v1.2はNVIDIA独自のNIM APIを通じて提供されているが、2.0のカードにはNIMタグもデプロイメントエンドポイントも記載されておらず、そのリポジトリページには、このモデルは「いかなるInference Providerによってもデプロイされていない」と記されている。

• 価格設定(ある場合)— ウェイト自体に使用料はかからないが、ホステッドオプションの価格設定や発表はまだ行われていない。

• 独立系ベンチマーク — 2.0にはまだArtificial Analysis、LMArena、OmniDocBenchのエントリが存在しないため、ベンダーの数値を照合する手段がない。

• ロードマップ — 2.0が単なる通過点なのか最終目標なのか、そして2.1型のフォローアップが来るのかどうかは不明である。

確実なことがあるとすれば、それはライセンスだ。モデルはNVIDIA Open Model Licenseの下にあり、商用・非商用の利用が許可されている。トークナイザーはCC-BY-4.0の下にある。製品で使用したいのであれば、その条件はクリアされている。

今日それを実行する。

セルフホスティングが現時点で唯一の選択肢であり、それを前提に計画を立てる前に知っておくべきいくつかの摩擦があります。モデルはHugging Face Transformersで`trust_remote_code`を使って読み込まれ、vLLMでも提供できますが、Nemotron Parseのリモートコードサポートを含むvLLMビルドでのみ可能です。A100/A10クラスのハードウェアでは、NVIDIAはTritonアテンションバックエンドの使用を強制することを推奨しており、さらに4つの追加依存関係(albumentations、timm、open_clip_torch、einops)が必要です。また、出力ヘッド結合に関する癖もあります。2.0ではLMヘッドがデコーダ埋め込みに結合されたままですが、一部のvLLMビルドでは、NVIDIA付属のランタイムパッチをPYTHONPATHに追加しない限り、別個の出力ヘッドが実体化されます。

サービングに関する2つの詳細がこれを補完します。まず、現在オープン中のvLLMプルリクエスト(8月初旬時点でレビュー中)は、リポジトリ内のauxiliary_prediction_heads.safetensors.extraサイドカーに保存された補助予測ヘッドを使用して、NVIDIA-Nemotron-Parse-2.0の投機的デコーディングを可能にします。モデルカード自体のドキュメントでは、このファイルは標準推論では使用されないと説明されているため、このPRが実際にそのファイルを消費する最初のものとなります。H100上でParseBenchの1,005ページの調査において、著者はシングルトークンデコーディングと比較して、コンカレンシー1で中央値出力スループットが約45%向上、コンカレンシー8で41%向上、コンカレンシー32で40%向上と報告しています。これらの数値はすべてPRからのものであり、まだマージも独立した再現もされていません。次に、Dynamoのイシューは2.0のトークナイザーにおける実際の落とし穴を指摘しています。シリアル化されたtokenizer.jsonにはパディングが組み込まれており、すべてのエンコードを9,000トークンにパディングするため、パディングされたトークナイザーを読み込むサービングスタックは、6トークンのマルチモーダルプロンプトを54,000トークンIDに膨張させる可能性があります。セルフホストする場合は、パディングされたアーティファクトを読み込むのではなく、オンラインでトークナイズを行うようにしてください。

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that the model adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

2026年のパーシング市場におけるその位置づけ

Nemotron Parse 2.0は、混雑し、変化の激しい分野に参入しようとしている。現在のオープンソース文書解析の主要モデルには、MinerU 2.5-Pro(上海AIラボの1.2Bモデル)やPaddleOCR-VL(0.9Bおよび7Bのバリエーション)があり、どちらもOmniDocBenchリーダーボードで90点台前半の複合スコアを記録している。さらに、StepFunのGOT-OCR 2.0が軽量な580Mオプションとして存在する。API側では、Mistral OCRが主要な商用製品である。2.0をそのランキングに当てはめようとする前に、2つの注意点がある。1つ目は、数値が比較可能ではないことだ。Parse 2.0はNVIDIA独自のスイートであるParseBenchを報告しているのに対し、この分野のスコアはOmniDocBenchの複合スコアである。タスクも重み付けも異なり、現時点で直接比較できる数値は存在しない。2つ目は、NVIDIA-Nemotron-Parse-2.0を、NVIDIAの別モデルであるNVIDIA-Nemotron-OCR-v2(NeMo Curatorパイプライン向けに構築された単語レベルの高密度OCRモデル)と混同すべきではないということだ。Parse 2.0はレイアウトとクラスを認識するパーサーであり、OCR v2は単語単位の抽出器である。これらは同じモデルではなく、補完的なツールである。

正直に言って、Parse 2.0の売り文句は「あらゆる解析メトリクスで他を凌ぐ」というものではない。これは0.9Bパラメータの、寛容なライセンスの下で提供される、レイアウトを認識するパーサーであり、そのカードには前世代からの非常に大きな多言語性能の飛躍が謳われている。そしてその系譜(2025年11月のv1.1、2026年2月のv1.2、2026年8月の2.0)を見れば、NVIDIAがほぼ四半期ごとに新しいパーサーをリリースしていることがわかる。すでにNemotron Parseファミリーを標準化しているチームにとって、2.0は同じAPI形状を持つドロップインアップグレードであり、多言語対応のストーリーもはるかに強力になっている。それ以外のチームにとっての問題は、この未発表モデルの主張が独立したテストを生き残るかどうかだ。

ルーティング層が解析パイプラインのどこに位置するか

文書解析モデルは通常、より長いパイプラインの一段階であり、ルーティングがその真価を発揮するのはその前後の段階です。一般的な構成としては、Parse 2.0がページを構造化されたチャンクに変換し、続いてLLMが要約、質問応答、エンティティ抽出、あるいはダウンストリームのストア向けの構造化を行います。このLLMの段階こそ、ルーティングプラットフォームがコスト構造を変えるポイントです。OrcaRouterは200以上のモデルを、プロバイダーのリスト価格のまま単一のAPIで提供します。マークアップは0%なので、ベンダーが値下げを発表した当日に、その価格がこちらにも反映されます。また、あるプロバイダーの性能が低下した場合には、自動フェイルオーバーが働きます。具体的には、パーサーを固定したままで、その出力を解釈するモデルを、追加契約やコード変更なしに交換・比較・フェイルオーバーさせることができます。解析段階がボトルネックであるなら、チューニングしてセルフホストできるモデル、すなわちParse 2.0が適しています。一方、解釈段階が変動費であるなら、その段階こそルーターが管理すべきです。当社はParse 2.0をホストしていません。Parse 2.0はAPIではなくセルフホスト型のモデルです。しかし、パーサーがLLMにデータを渡す構成は、まさにLLM層の単一エンドポイントが効果を発揮するセットアップです。

Pipeline diagram titled 'A parsing pipeline with a routing layer': four rounded cards in a flow — Parse 2.0 (page → text · bboxes · markdown), Chunks (structured regions in reading order), OrcaRouter (one API · 200+ models · 0% markup), LLM (summary · QA · extraction) — with a footer line 'The parsing stage is self-hosted; OrcaRouter routes the LLM stage at provider list price with automatic failover.' OrcaRouter logo composited bottom-right.

結論

NVIDIA-Nemotron-Parse-2.0は、2026年8月3日付けの、実在する完全な未発表リリースです。リポジトリには0.9Bのレイアウト認識パーサーが示されており、そのモデルカードはv1.2と比較して多言語および手書き認識において非常に大きな改善を主張しています。寛容なライセンスの下で提供されていますが、実際にはセルフホスティングに関する摩擦があります。これらの数値はいずれもまだ独立に検証されておらず、ホスティングオプションも価格設定もありません。適切な対応はリスク許容度によって異なります。現在多言語ドキュメントをパースしており、多言語メトリクスを重視するなら、主張されている0.44→0.91のMOSCARの改善は、自分のコーパスで週末にテストする価値があるほど大きいものです。そのような差分は、再現されるか崩壊するかのどちらかであり、静かなリリースはそれを確かめる最も安価な方法です。引用できるベンチマークや、本番運用の道筋を託せるサポート済みAPIが必要なら、発表または独立した実行を待つべきです。それまでの間、これが静かな出荷の姿であり、注目に値します。

よくある質問

NVIDIA-Nemotron-Parse-2.0はリークですか、それとも正式リリースですか?

どちらのラベルも完全には当てはまらない。これは、散逸した重みや部分的な重みという意味でのリークではない。リポジトリは完全に組み立てられており、詳細なモデルカード、設定ファイル、Dockerfile、ゴールデン出力付きのテストスイート、そしてTransformersとvLLMの両方に対応した推論スクリプトが含まれている。だが、通常の意味でのローンチでもない。NVIDIAは何の発表も行っておらず、以前のNemotron Parseリリースに付随していたNIMパッケージングとホスト型エンドポイントも存在しない。正確には、これはベンダーがまだプロモーションを選択していない完全なリリースである。だからこそ、ここで正直なラベルは「静かな出荷」であり、発表があれば通常決着するであろう事項(価格設定、ロードマップ、ホスト型サービスの利用可能性)が未解決の問いとして残っているのである。

ベンダーのベンチマークは、他のパーサーについて人々が引用するOmniDocBenchの数値と比べてどうですか?

いや、直接的にはそうではない。NVIDIA-Nemotron-Parse-2.0 のカードに記載されている数値は、NVIDIA 独自のベンチマークである ParseBench(テキスト忠実度、セマンティックフォーマット、表、チャート、ビジュアルグラウンディングをカバー)に加え、MOSCAR、IndicVisionBench、OmniDocBench の手書きサブセットに基づくものだ。一方、市場の主要スコア(MinerU 2.5-Pro、PaddleOCR-VL、Mistral OCR)は OmniDocBench の複合スコアである。タスクも指標も異なるため、同じ条件で比較した公開結果はまだ存在しない。エコシステムと重なる唯一の数値、つまり OmniDocBench Notes の手書きスコアは、v1.2 とのテキスト編集距離として報告されており、複合スコアではないため、依然として他との順位付けはできない。独立した実行結果が得られるまでは、Parse 2.0 の主張は方向性のみを示す未検証のものとして扱うべきだ。

本番に移行する前に、チームは何をテストすべきですか?

「3つのこと。第一に、{{1}}自社の多言語コーパスについて。2.0のセールスポイントはすべて多言語対応へのジャンプであり、静かなリリースとは、主張された利点が自社データで再現されるかどうかが問われるまさにその状況です。カードの記載を信じる前に、実際にパースする言語で実行してください{{/1}}。第二に、{{2}}セルフホスティングスタックについて。お使いのvLLMビルドにNemotron Parseのリモートコードサポートがあることを確認し、tied-output-headパッチを適用し、さらに、パディング済みのtokenizer.jsonを読み込むと短いプロンプトが9,000トークンに膨張する可能性があるため、サービングパスがそれを読み込むのではなくオンライントークン化を行うことを検証してください{{/2}}。第三に、{{3}}ライセンスとサービス体制について。ウェイトはNVIDIA Open Model Licenseのもとで無償ですが、発表されたNIMはなく、価格設定もなく、サポート契約もありません。したがって、セルフホスティングを前提に計画し、LLMステージの後段では、モデルの交換やフェイルオーバーを再設計なしで可能にするレイヤーを経由してルーティングしてください。それがルーティングプラットフォームが作られた本来の役割です{{/3}}。」

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube