「Nemotron Parse 2.0 vs MinerU — 未発表の挑戦者 vs オープンソースの定番」のタイトルカード。左側にドキュメントページアイコン、右側にオープンソースボックスアイコンが配置されている。
Guides & Insights

Nemotron Parse 2.0 vs MinerU:未発表の挑戦者 vs オープンソースの定番

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

NVIDIA-Nemotron-Parse-2.0とMinerUは、同じ問題を正反対の方向から解決する。どちらもスキャンまたはレンダリング済みのページを受け取り、テーブル、数式、読み順を維持した、クリーンで構造化されたMarkdownを返す。だがMinerUはオープンソースの標準的存在だ。数万のGitHubスター、Apache-2.0ライセンス、無料の日次クォータ付きホステッドAPIを備え、多くのドキュメントチームが最初に手にする安全な選択肢である。Nemotron Parse 2.0はその対極にある。2026年8月3日にHugging Faceに現れたが、NVIDIAからは何の発表もなく、モデルカードには、もし裏付けが取れれば今年のオープンな文書解析にとって最大の出来事となる一連のベンチマーク主張が記載されている。この組み合わせは意図的に不均衡だ。既存の本命と、未発表の挑戦者という構図であり、問題はそれぞれの売り込みに実際にどれほどの価値があるかだけである。

それぞれの側が実際に何なのか

MinerUは、上海AI研究所(Shanghai AI Laboratory)のオープンリリースを支えるデータグループOpenDataLabによる、完全なドキュメント解析システムです。現在の主力はMinerU 2.5-Proで、2604/2605ポイントリリース系統に属する1.2Bの視覚言語モデルです(2604モデルは2026年4月に登場し、その後に2605の更新版が続きました)。このシステムは2段階エンジンを基盤としています。まず大まかな全体レイアウト分析を行い、次にネイティブ解像度の切り出し画像に対して対象認識を実行します。そしてプロジェクトは、モデルをPDF、DOCX、PPTX、XLSXの取り込み、レイアウト検出、数式・表認識、読み順の再構築に組み込んでいます。これはRAG前処理におけるリファレンスとなるオープンソースパーサーであり、それを裏付けるコミュニティを備えています。

Nemotron Parse 2.0 は、NVIDIA が開発した 0.9B パラメータのビジョン・エンコーダー・デコーダーモデルで、2026年2月にリリースされた NVIDIA-Nemotron-Parse-v1.2 と同じファミリーに属します。ViT-H ビジョンエンコーダー(NVIDIA の C-RADIOv2 バックボーンをベースに構築)と、mBART スタイルの10層デコーダーを採用しています。入力ページは最大 2048×1664 に対応し、生成は9,000トークンを上限とします。出力は MinerU と同じ構造化出力で、markdown またはプレーンテキストに加え、表は LaTeX、HTML、markdown、JSON、階層型 JSON、CSV で出力され、レイアウトクラス、バウンディングボックス、読み取り順序も含まれます。リポジトリは完成した状態で提供されており(設定ファイル、Dockerfile、ゴールデン出力付きのテストスイートを完備)、NVIDIA はこれをプロモーションしておらず、NIM パッケージもなく、推論プロバイダーもこれをホストしていません。現時点で選択肢となるのはセルフホスティングのみです。

Screenshot of the Hugging Face model card for NVIDIA-Nemotron-Parse-2.0, showing the nvidia-open-model-license, 0.9B model size, 2,156 downloads last month, and the note that the model isn't deployed by any inference provider.

価格の話:「free」という言葉には二つの異なる意味がある

最も大きな実際的な違いは、{{1}}MinerUは無料で呼び出せる{{/1}}のに対し、{{2}}Nemotron Parse 2.0は実行のみ無料である{{/2}}ということです。{{3}}mineru.netにあるMinerUの公式APIには日次の無料枠があり{{/3}}、現在のキャンペーンに応じて1日あたり約1,000ページの優先度の高いページが含まれ、その範囲内では呼び出しごとの課金はなく、各ファイルは最大200ページです。{{4}}クォータを超えると、課金されるのではなくジョブの優先度が下がり{{/4}}、{{5}}商用ホストはセルフホストモデルを1ページあたり約0.1セントで提供しています{{/5}}。パイプラインで1日に数千ページを処理する必要があり、何も運用したくない場合、{{6}}MinerUにはほぼコストのかからない道があります{{/6}}。

Nemotron Parse 2.0 にはそのようなパスはありません。ウェイトは NVIDIA Open Model License の下で無料ですが、モデルカードには、いかなる推論プロバイダーによってもデプロイされておらず、NVIDIA はホステッドオプションの価格設定も発表も行っていないと記載されています。それを使用するには、GPU をレンタルまたは所有し、Nemotron Parse のリモートコードサポートを備えた Transformers または vLLM ビルドを立ち上げ、以下に挙げるデプロイ上の癖に対処する必要があります。小規模プロジェクトにとって、これは実際のコストです。GPU は、月あたり数百ページの無料 API ティアよりもはるかに高価です。すでに GPU インフラを運用しているチームにとって、ウェイトが無料であることは真の利点です。問題は、運用オーバーヘッドが、モデルが追加すると主張する価値に見合うかどうかです。

ベンチマークのギャップ:これらの数字は互いに向き合っていない

このセクションは、ほとんどの比較が気づかれないうちに間違ってしまう箇所なので、明確にしておきましょう。Nemotron Parse 2.0のモデルカードは4つのベンチマークを報告しています:ParseBench総合スコアは0.6391(v1.2の0.5782から上昇)、MOSCAR多言語OCRはBoC F1 0.9102(0.4410から上昇)、IndicVisionBenchはANLS文字単位0.7203(0.0612から上昇)、そしてOmniDocBench手書きサブセットはテキスト編集距離として測定され、0.9739から0.3395へ改善しました。MinerU 2.5-Proは異なるベンチマーク群を報告しています:OmniDocBench v1.6総合スコア95.69——はるかに大規模なモデルを上回る最先端——に加えて、高密度数式解析で97.29、そしてMinerU自身のOmniDocBench実行ではテキスト編集距離0.036です。

2つのモデルは『OmniDocBench』という名前を共有しており、一見すると比較可能に見えるが、実際の指標は異なる。NVIDIAは手書き文字のみのサブセットを編集距離として報告し、OpenDataLabは別のベンチマークバージョンにおける総合複合スコアを報告している。ParseBenchはNVIDIA独自のスイートであり、MinerUのエントリはない。MOSCARとIndicVisionBenchにもMinerUのエントリはない。両者の数値はすべてベンダーによる自己報告であり、どちらのモデルも、もう一方が登場する独立した第三者による実行結果は公開されていない。つまり、現在のところNemotron Parse 2.0とMinerUを順位付けする『同一条件での比較』数値は存在しない。どちらかのモデルがベンチマーク比較で『勝つ』と言う人は、異なるテストから外挿しているに過ぎない。方向性として言えるのは、MinerUの主張は成熟しており、1年間のコミュニティ利用を乗り越えてきたこと、一方Nemotron Parse 2.0の主張は新しく、未監査であり、MOSCARとIndicVisionBenchでの飛躍が再現されるなら、特に多言語パース処理にとっては大きな意味を持つということだ。

A comparison scoreboard for Nemotron Parse 2.0 and MinerU 2.5-Pro. Nemotron Parse 2.0: shipped Aug 3 2026 unannounced, 0.9B params, NVIDIA Open Model license, no hosted API, ParseBench 0.6391, MOSCAR 0.9102 F1. MinerU 2.5-Pro: shipped Apr 2026, 1.2B params, Apache 2.0, official API with free tier, OmniDocBench v1.6 95.69, 109 languages.

実際のワークロードにおける相違点

Screenshot of the Hugging Face model card for opendatalab/MinerU2.5-Pro-2604-1.2B, showing the Apache-2.0 license, the arXiv tech report 'MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale', and an 'unmatched SOTA Performance' banner.

ベンチマークはさておき、パイプラインに現れる違いは、スコープ、レイテンシ、多言語カバレッジに関するものだ。

• 入力範囲 — MinerUはAPIを通じてファイルあたり最大200ページの完全なPDFを取り込み、ページをまたがるテーブルを結合します。一方、Nemotron Parse 2.0は1回の呼び出しで最大2048×1664のページ画像を受け取るため、200ページのドキュメントは200リクエストになります。入力がPDFの場合、これは精度の問題以前のワークフローの違いです。

• サービスの成熟度 — MinerUは、公開されたスループット(非同期エンジンにより単一A100で約2ページ/秒)、Dockerランナー、ホステッドAPIを備えたvLLMおよびSGLangバックエンドを出荷しています。Nemotron Parse 2.0のサービングはまだ初期段階で、でこぼこしています。vLLMはリモートコードサポートを必要とし、A100/A10ハードウェアではTritonアテンションバックエンドが必要です。トークナイザーは、9,000トークンへのパディングが組み込まれたシリアライズ済みのtokenizer.jsonを同梱しており、あるサービングスタックでは、6トークンのプロンプトが54,000のトークンIDに膨れ上がるという問題に直面しました。また、リポジトリには、結合出力ヘッドをサポートしないvLLMビルド向けのランタイムパッチが含まれています。これらはどれも克服不可能ではありませんが、現実的な摩擦です。

• 多言語対応 — ここがNemotron Parse 2.0が最も存在感を示す分野です。2.0リリースでは、多言語OCRに特化して語彙数を約52,000から72,000トークンに拡張し、その効果はここに集中しています:MOSCARは0.44から0.91へ、IndicVisionBench(ベンガル語、ヒンディー語、タミル語、その他7つのインド系文字)は0.06から0.72へ向上しました。MinerUは主要機能として109言語をサポートしていますが、その根拠はOmniDocBenchの複合スコアであり、文字体系ごとの内訳によるものではありません。コーパスにインド系文字や低リソース言語が多く含まれる場合、Nemotron Parse 2.0の数値の方がより興味深い検証対象です — ただし、それらは独立した検証が最も行われていないものでもあります。

• 手書き文字 — NVIDIAのカードにおける最大の差は手書き文字です。OmniDocBenchのノートサブセットにおける編集距離が0.97から0.34へと低下しています。MinerU自身の0.036というテキスト編集距離は、手書きサブセットではなくOmniDocBench全体の実行結果に基づくものであり、やはり両者の数値は直接比較できるものではありません。しかし、手書きノートは両者にとって古典的な失敗パターンであり、Nemotron Parse 2.0が主張する改善が十分に大きいため、自分自身のページで直接テストを行う価値がある唯一の領域です。

誰がどれを選ぶべきか

今日すぐに呼び出せるパーサーをお求めなら、MinerUを選びましょう。無料のデイリーティア、成熟したサービング、全PDF対応のインプット、コンプライアンス審査不要のApache-2.0ライセンス、そしてセットアップに関する質問への回答がすでに存在するほど十分な規模のコミュニティを備えています。これがデフォルトであるのには理由があり、ほとんどのRAG前処理ワークロードにとって、これは低リスクな選択肢です。

モデルのセルフホスティングにすでに慣れているのであれば、Nemotron Parse 2.0 を選びましょう。特に NVIDIA NIM または NeMo の世界にいる場合はそうで、v1.2 が NIM として提供されており、2.0 はその後継のように見えます。また、コーパスが多言語対応または手書き文字処理を特に必要としている場合も同様です。週末に自分のIndic言語またはノート中心のページでテストしてみれば、どんなベンチマーク表よりもよくわかります。その主張は独自のデータで再現されるか、それとも崩れるか、どちらかなのですから。ただし、そのテストを実行し、トークナイザーやサービングの癖が自分のスタックで処理できることを確認するまでは、未発表のモデルを本番環境の計画に組み込まないでください。

なぜパーサーがパイプラインにおける唯一のコストではないのか

何を選ぶにせよ、実際のボリュームが出てくれば、パーサーは通常、ドキュメントパイプラインの中で最も安価なステージです。コストがかかるのは、パースされたマークダウンを要約や構造化レコード、回答に変換するLLMのステージであり、そこでルーティングレイヤーが経済性を変えるのです。OrcaRouterは、200以上のモデルをプロバイダーのリスト価格のまま、マークアップなしで1つのAPIの背後に配置します。そのため、ベンダーの値下げは発表当日に反映され、自動フェイルオーバーにより、1つのプロバイダーが劣化しても抽出ジョブ全体が停止することはありません。具体的には、Nemotron Parse 2.0の手書き文字認識の性能を、MinerUと比較して自社のコーパスでテストできます。パーサーの交換とLLMレイヤーが分離されているため、下流のモデルスタックをどちらかのパーサーにコミットする必要はありません。現在、当社はどちらのパーサーもホストしていません(Nemotron Parse 2.0はセルフホストモデル、MinerUは独自のサービス上で動作します)が、LLMステージのルーティングレイヤーこそが、パーサーの選択をロックインにしないための鍵なのです。

結論

MinerUは合理的なデフォルトです。成熟しており、小規模であれば無料で呼び出せ、寛容なライセンスで、本番環境での実績もあります。Nemotron Parse 2.0は興味深い賭けです。5日前に静かにリリースされた0.9BのNVIDIAモデルで、そのカードには多言語と手書き認識の劇的な飛躍が謳われていますが、誰も独立検証していません。主に英語の技術文書を大量にパースする場合、MinerUが答えであり、Nemotron Parse 2.0のリスクを取る価値はありません。インド系言語や低リソースの文字体系、または手書きノートをパースする場合、その主張は十分に大きく、ウェイトも十分に無料なため、自分でテストを実行するのは安価です。NVIDIAがほぼ四半期ごとに新しいパーサーをリリースしていること(2025年11月のv1.1、2026年2月のv1.2、そして今回の2.0)は、近々発表があることを示唆しています。それまでは、2.0の数値は方向性を示すものとして扱い、自分のコーパスでテストしてください。

よくある質問

Nemotron Parse 2.0は、何らかのAPIを通じて利用できますか?

ホスト型のものではありません。Hugging Faceのカードによると、このモデルはどの推論プロバイダーでもデプロイされておらず、NVIDIAも2026年8月上旬時点でNIMパッケージや価格設定を発表していません。実行する唯一の方法は、Hugging Face Transformersの`trust_remote_code`を使って重みをセルフホストするか、Nemotron Parseのリモートコード対応を含むvLLMビルドを使うことです。一方、MinerUには公式APIがあり、1日あたりの無料ページ枠が提供されています。

RAGの前処理にはどのモデルの方が良いですか?

一般的なRAGパイプライン — 英語およびCJK技術文書、表、混合レイアウト — の場合、MinerUの方がより安全で実績のある選択肢です:完全なPDFを受け入れ、ページをまたぐ表を統合し、成熟したサービングを備え、無料ティアにより小規模ではコストがかかりません。Nemotron Parse 2.0が適切な選択となるのは、コーパスがインド系文字やリソースの少ない文字、手書きメモ、または主張された利点が集中しているチャート中心のページに重きを置いている場合のみです — それでも、導入を決める前に、ご自身のドキュメントで検証してください。

2つのモデルカードのベンチマーク数値は直接比較できますか?

いいえ。Nemotron Parse 2.0 は、ParseBench(NVIDIA 独自のスイート)、MOSCAR、IndicVisionBench、および OmniDocBench の手書きサブセットを編集距離として報告しています。MinerU 2.5-Pro は、OmniDocBench v1.6 の総合複合スコアに加え、数式およびテキスト編集メトリクスを報告しています。重複するベンチマーク名は同じメトリクスではなく、両モデルを同じテストで評価した独立した実行は存在せず、両カードのすべての数値はベンダー報告によるものです。これらは方向性を示すものとして扱い、直接比較はできません。