タイトルカード「Nemotron Parse 2.0 vs olmOCR」:見出し「Nemotron Parse 2.0 vs olmOCR」、サブタイトル「二つの仕事、どちらもパースと呼ばれる」、左右分割のイラスト付き——左側は「layout semantics」というキャプションの下に、ラベル付きバウンディングボックスに解析された文書ページ、右側は「linearized markdown」というキャプションの下に、マークダウン記号を伴う流れるテキスト行。OrcaRouterのロゴは右下に合成される。
Guides & Insights

Nemotron Parse 2.0 vs olmOCR: 2つの仕事、どちらもパースと呼ばれる

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年8月3日、NVIDIAは新しい文書解析モデルをHugging Faceに公開しましたが、誰にも知らせませんでした。NVIDIA-Nemotron-Parse-2.0は0.9Bの視覚エンコーダ・デコーダで、そのモデルカードは2026年2月の前身モデルから多言語対応とチャート認識の点で飛躍したと主張しています。また、これはolmOCRと同じエコシステムの一角に登場しました。より正確には、Allen Institute for AIの7BリニアライザーであるolmOCR-2-7B-1025で、PDFをLLMのトレーニングデータに変換する標準的な方法として静かに定着してきました。これを「直接対決」と呼ぶこと自体が罠です。両モデルとも「文書解析」と説明されますが、返す成果物は異なり、利用するパイプラインも異なり、ベンチマークの数値が実際に比較されることもありません。本当の問いは、パーサーに2つの仕事のうちどちらを任せるかです。

二つのアーティファクト

{{1}}Nemotron Parse 2.0 はレイアウトセマンティクスエンジンです。{{/1}} {{2}}ページ画像とタスクプロンプトを渡すと、テキストに加えて意味レイヤーを返します。各領域(タイトル、セクション、キャプション、表、チャート、ヘッダー、フッター、脚注、参考文献エントリ)のレイアウトクラス、それぞれのバウンディングボックス、そしてそれらの間の読み順です。さらに、マークダウンをオプションのシリアライゼーションとして出力することもできます。{{/2}} {{3}}olmOCR 2 はリニアライザーです。{{/3}} {{4}}同じページを受け取り、クリーンでリニアライズされたマークダウンを返します。主要言語、回転補正、ページが表か図かなどのページレベルのメタデータを記録する短いYAMLフロントマター付きです。{{/4}} {{5}}ボックスもクラスもジオメトリもありません。1回のパスで、文書の順序どおりにテキストを返します。{{/5}}

アーティファクトがタスクを決定する。パイプラインがページの領域にファクトを引用して紐づける必要がある場合、スキャン上の表をハイライトする必要がある場合、またはドキュメントインテリジェンスのためのレイアウト・セマンティクスを抽出する必要がある場合、必要となるのはジオメトリだ——それがNemotron Parse 2.0の出力空間である。トレーニングデータを構築している場合や、トークンのみを消費するテキストLLMにデータを渡す場合、ジオメトリはノイズであり、線形化されたマークダウンがまさに正解である——それがolmOCRの設計の全てだ。レイアウト検出を別の検出器でolmOCRの出力に後付けすることもできるし、Nemotron Parse 2.0のボックスを破棄してマークダウンのみを保持することもできる。しかし、各モデルはそれらのタスクのいずれかをネイティブに実行するよう構築されている。

「静かな船:リポジトリが示すこと、確認されていないこと」

NVIDIA-Nemotron-Parse-2.0が、2026年8月3日にHugging Face上に公開されました。アナウンスもブログ記事もNIMパッケージングもない状態での公開です。判明しているのはリポジトリの内容だけです。これは0.9Bのビジョン・エンコーダ・デコーダモデルで、NVIDIAのC-RADIOバックボーン上に構築されたViT-H画像エンコーダ、軽量な1D畳み込みアダプタ、そして10層のmBARTスタイルのデコーダから構成されています。トークナイザは約20,000エントリ増加し、合計で約72,000トークンになりましたが、これは明示的に多言語サポートの効率化を目的としています。モデルカードでは、新しいclass_Chartトークンによるチャート対応パースが目玉機能として記載され、さらにテーブル直列化のファミリー(LaTeX、HTML、markdown、JSON、階層JSON、CSV)も挙げられています。オプションのロジッツプロセッサが2つ同梱されており、1つは反復的な構造化出力を停止するもの、もう1つはテーブルクロップにテーブル構造を強制するものです。推奨入力解像度は約1024×1280から1664×2048の範囲で、生成は9,000トークンの上限まで実行されます。モデルカードには、Ampere、Hopper、Blackwell、Turingハードウェア上のランタイムとしてTransformers、vLLM、SGLang、Docker Model Runnerが記載されています。

しかし、これらの主張はすべてNVIDIA自身によるものであり、独立に再現されたものは一つもない。このカードによれば、ParseBench全体スコアは0.6391(v1.2の0.5782から上昇)、MOSCAR多言語OCRはBoC-F1で0.9102(0.4410から上昇)、IndicVisionBenchはANLS-characterで0.7203(0.0612から上昇)、OmniDocBenchの手書きサブセットはテキスト編集距離で0.9739から0.3395へ改善している。これらは最大の上昇幅であり、同時に最も検証が進んでいない部分でもある。ParseBenchはNVIDIA自身のベンチマークであり、独立したコーパスでParse 2.0を実行した第三者はいまだいない。確認されていないのはスコアだけにとどまらない。ホスト型推論はなく(カードには、このモデルはいかなる推論プロバイダーによってもデプロイされていないと記載されている)、価格設定もなく、そのいずれについても発表されたスケジュールもない。

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that 2.0 adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

olmOCR 2: 誰もがすでに評価基準としている現行モデル

olmOCRは、このカテゴリーが現在論争の的としているベンチマークを発明したモデルです。2025年10月22日にリリースされたolmOCR-2-7B-1025は、Qwen2.5-VL-7B-Instructを270,000ページのolmOCR-mix-1025コーパスでファインチューニングした7Bビジョン言語モデルであり、その後、自動化された「ユニットテスト」報酬に対するGRPO強化学習によって洗練されました。これは、テーブルが構造を維持したか、数式が正確に転写されたか、読み順が保持されたかを判定する決定的なチェックです。このユニットテストの枠組みはolmOCR-Benchとなり、約1,400のPDFと7,000以上のチェックを含み、事実上の業界ベンチマークとなっています。Marker、MinerU、そして十数社の商用OCRモデルが現在このベンチマークで成果を発表しています。olmOCR 2自体もそこで総合82.4を記録しており、前回リリースより約4ポイント高く、AI2が同じページで引用しているMarker(76.1)およびMinerU(75.8)の数値を上回っています。

olmOCR はこの組み合わせの中でも成熟した選択肢です。Apache-2.0 ライセンスで、そのウェイトは先月だけで約21万8,000回ダウンロードされており、olmOCR ツールキットは vLLM バックエンド上でレンダリング、回転、再試行を大規模に処理します。AI2 のバッチ見積もりでは、レンタル GPU 上でのパイプライン費用は100万ページあたり約176〜190ドルとされ、FP8 ビルドは H100 1基で毎秒約3,400出力トークンを処理するため、リリース記事が「2ドル未満で10,000ページ」と引用するほどの速さです。トレードオフは言語です。olmOCR は英語のデジタル化された印刷物向けに明示的に構築・ベンチマークされており、モデルカードも英語とタグ付けされています。Nemotron Parse 2.0 の売りはその正反対で、主張されている利点は CJK およびインド系文字に集中しています。

Screenshot of the Hugging Face repository page for allenai/olmOCR-2-7B-1025, showing the Apache-2.0 license tag, the English language tag, 217,859 downloads last month, 8B params, the description that it is the BF16 release fine-tuned from Qwen2.5-VL-7B-Instruct on the olmOCR-mix-1025 dataset with additional GRPO RL training for math equations and tables, the note that the best way to use it is the olmOCR toolkit via vLLM, and the line 'This model isn't deployed by any Inference Provider.'

トレードオフが現れる6つの行

両方のモデルはオープンウェイトであり、両方ともTransformers、vLLM、またはSGLangで動作し、現在はどちらもセルフホストされています。両者を選ぶ際に重要となる点は次のとおりです。

• 規模 — Nemotron Parse 2.0 は 0.9B、olmOCR 2 は 7B。パラメータはおよそ8倍、VRAM の最低要件もおよそ8倍。

• 出力 — Nemotron Parse 2.0 はテキスト、レイアウトクラス、バウンディングボックス、読み取り順序、マークダウンを返し、olmOCR 2 は YAML メタデータブロック付きの線形化マークダウンを返します。

• 多言語 — Nemotron Parse 2.0は、CJKおよびインド系言語の強力なサポートを主張しています(MOSCAR 0.9102、IndicVisionBench 0.7203、ベンダー報告値)。一方、olmOCR 2は英語優先です。

• フラッグシップスコア — Nemotron Parse 2.0 は ParseBench 0.6391 を報告(NVIDIA 自身による、未監査);olmOCR 2 は olmOCR-Bench で 82.4 を記録(AI2 自身、10か月のコミュニティ再利用)。

• ライセンス — Nemotron Parse 2.0 は NVIDIA Open Model License のもとで提供され、olmOCR 2 は Apache-2.0 です。

• 出荷済み — Nemotron Parse 2.0は2026年8月3日に予告なくリリースされました。olmOCR 2は2025年10月22日にローンチ記事とともに出荷されました。

Two-column comparison scoreboard titled 'Nemotron Parse 2.0 vs olmOCR — the scoreboard'. Left column 'Nemotron Parse 2.0': Size 0.9B vision-encoder-decoder, Output bboxes, classes, reading order + markdown, Multilingual CJK + Indic strong, Score ParseBench 0.6391 (vendor), License NVIDIA Open Model, Shipped Aug 3, 2026 unannounced. Right column 'olmOCR 2': Size 7B VLM (Qwen2.5-VL), Output linearized markdown + YAML metadata, Multilingual English-first, Score olmOCR-bench 82.4, License Apache 2.0, Shipped Oct 22, 2025. Footer: 'Nemotron scores vendor-reported (NVIDIA); olmOCR scores per AI2's olmOCR-bench.' OrcaRouter logo composited bottom-right.

その決定が実際に効いてくる3つの場面

スケールとレイテンシ。0.9Bデコーダは、7B VLMに比べてはるかに安価にサービスを提供できます。より小さなGPU、少ないVRAM、同じハードウェアでの1秒あたりのページ処理数の増加、そしてGPU時間に対して支払う際の1ページあたりのコスト削減です。すでにGPUインフラを運用しており、コーパスが大規模な場合、これは実際の月間コスト差になります。olmOCR自身の数値は、FP8量子化により7Bモデルがどれほど高速化できるかを示していますが、それを実現するには依然としてH100クラスのGPUが必要です。Nemotron Parse 2.0のハードウェア下限はAmpere世代のカードです。

多言語。これは最も非対称な行です。Nemotron Parse 2.0は、多言語OCR専用にトークナイザーを約2万エントリ拡張しており、そのモデルカードで主張されている改善はインド系文字とCJKに集中しています。olmOCR 2はそのような主張をしていません——その言語タグは英語です。コーパスがヒンディー語、タミル語、ベンガル語、日本語、または混在スクリプトの場合、テストする価値があるのはNemotron Parse 2.0の数値です。まさにそれらがベンダー報告による新しいデータだからです。

サービスの現実。olmOCR 2 はリリースから10ヶ月が経過し、そのツールチェーンは良い意味で退屈なほど安定しています。一方、Nemotron Parse 2.0 はリリースから5日しか経っておらず、サービス提供の面では明らかに未成熟です:vLLMにはNemotron Parseのリモートコードサポートを含むビルドが必要で、結合された出力ヘッドが一部のvLLM 0.20ビルドで問題を引き起こします(リポジトリにはランタイムパッチが同梱されています)。さらに、tokenizer.jsonには9,000トークンへのシリアル化されたパディングが含まれており、あるサービススタックではパッチ適用前に6トークンのプロンプトが54,000トークンIDに膨張するケースがありました。これらはいずれも致命的ではありませんが、まさに新しいモデルで想定しておくべき摩擦そのものです。

パイプライン用に1つ選択してください

LLMトレーニングデータや英語文書を対象とした大規模テキスト抽出パイプラインを構築するなら、olmOCR 2を選びましょう。成熟したツールキット、Apache-2.0ライセンス、業界が現在の基準として採用しているベンチマーク、そして実績のあるバッチ処理経路が手に入ります。その許容された欠点は言語カバレッジです。

パイプラインにジオメトリ(レイアウトクラス、バウンディングボックス、接地検索やドキュメントインテリジェンスのための読み順)が必要な場合、またはコーパスにIndic、CJK、手書きページが多い場合(そこで主張された利点がある)、Nemotron Parse 2.0を選択してください。0.9Bサイズなので、確信がなくても週末のテストは安価です。その許容される失敗モードは、カード上のすべての数値がNVIDIA独自のものであり、独立した評価では変動する可能性があることです。

入力が主に英語のデジタル生成PDFで、クリーンなMarkdownさえあればよい場合、{{1}}olmOCR 2{{/1}}が低リスクの既定の選択肢です。すでにセルフホスティングをしており、多言語やレイアウトを考慮したユースケースが実際にあるなら、{{2}}Nemotron Parse 2.0{{/2}}の方が興味深い候補です。導入を決める前に、自分のページでテストしてください。

パーサーの選択がロックインにならないようにする

ドキュメントパイプラインには、パーサーステージとその後のLLMステージがあります。実際にボリュームが出てくると、パーサーは通常、最もコストの低いステージです。コストがスケールするのは、パース済みマークダウンを要約、構造化レコード、回答に変換するLLMの方です。ルーティングレイヤーが変更するのは、まさにこのステージです。OrcaRouterは200以上のモデルを1つのAPIの背後に置き、プロバイダーのリスト価格のままマークアップなしで提供するため、ベンダーの値下げは当日中に反映されます。また、自動フェイルオーバーにより、劣化したプロバイダーが1つあってもバッチジョブが停止することはありません。この比較におけるパーサーはどちらも当社のカタログにはありません。両方のモデルカードに、いかなる推論プロバイダーによってもデプロイされていないと記載されているため、これはセルフホストの判断になります。しかし、パーサーをモデルスタックから分離しておく理由は、まさにルーティングが下流側で提供する価値にあります。つまり、LLMレイヤーが同じワンキーAPIの背後に維持されるため、統合に一切触れることなく、Nemotron Parse 2.0をolmOCR 2に、またはその逆に交換できるのです。

よくある質問

どのモデルがベンチマークで勝つのですか?

どちらでもない——その数値は互いに対峙していない。Nemotron Parse 2.0 は ParseBench、MOSCAR、IndicVisionBench、および OmniDocBench の手書きサブセットを報告しているが、いずれも NVIDIA 自身のものであり、独立に再現されたものはない。olmOCR 2 は olmOCR-Bench を報告している。これは AI2 自身のベンチマークであり、今や業界の他の企業もこのベンチマークで結果を発表している。第三者が同じコーパスで両モデルを実行したことはないため、「勝者」と直接的に主張するのは外挿に過ぎない。方向性として言えば、olmOCR の数値は 10 か月間のコミュニティ利用に耐えてきた。Nemotron Parse 2.0 の数値は新しく、今後変動し得る。

Nemotron Parse 2.0は非英語のドキュメントで本当に優れているのでしょうか?

それが主張です——約20,000トークンの語彙拡張に加え、MOSCAR 0.9102、IndicVisionBench 0.7203という結果で、いずれもベンダー報告値であり、v1.2から大幅に向上しています。olmOCR 2は多言語対応を謳っておらず、英語扱いとされています。しかし、独立した評価が行われるまでは、Nemotron Parse 2.0の多言語での改善は有望だが未検証として扱い、依存する前にご自身のIndicまたはCJKページでテストしてください。

それらのうちの1つには、より大きなGPUが必要ですか?

はい、サイズの違いも追跡しています。Nemotron Parse 2.0 の 0.9B は、一般的な Ampere 世代のカードで動作し、既存のハードウェア上ではページ単価がより安価な選択肢です。olmOCR 2 の 7B VLM は、かなり大規模な GPU を必要とします。AI2 によると、その FP8 ビルドは H100 上で毎秒約 3,400 出力トークンを達成します。

RAGの前処理にはどちらの方が良いですか?

それは、お使いのリトリーバーが何を必要とするかによります。回答をページ領域に関連付ける場合、レイアウトクラスが必要な場合、または表やチャートを独自のユニットとしてインデックスしたい場合、Nemotron Parse 2.0のバウンディングボックスとクラスがそれをネイティブに提供します。お使いのRAGスタックがクリーンなテキストだけを消費し、コーパスが英語の場合、olmOCR 2の線形化されたマークダウンは実証済みで、よりシンプルであり、成熟したツールキットに支えられています。

結論

NVIDIAは今週、本物のパーサーを出荷したが、誰にも知らせなかった。AI2は10か月前にパーサーを出荷し、このカテゴリにベンチマークを与えた。{{1}}Nemotron Parse 2.0は、レイアウトのセマンティクス、多言語対応、少ない予算での手書き抽出が必要な場合に適している。そして、その数値が最も検証されていない領域は、まさに同製品が勝つと主張する領域である。{{/1}} {{2}}olmOCR 2は、英語ドキュメントに対して大規模に線形化されたテキストが必要で、10か月間安定しているツールチェーンを求めている場合に適している。{{/2}} {{3}}どちらもどこにも展開されていないので、どちらにせよセルフホストの意思決定だ。最も安価な方法は、両方を自分自身の最も難しいページで実行し、それぞれがどこで壊れるかを観察することだ。{{/3}}