Eine Titelkarte für „Nemotron Parse 2.0 vs. MinerU — der unangekündigte Herausforderer vs. der Open-Source-Standard“, mit einem Dokumentseiten-Symbol links und einem Open-Source-Box-Symbol rechts.
Guides & Insights

Nemotron Parse 2.0 gegen MinerU: Der unangekündigte Herausforderer gegen die Open-Source-Standardoption

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

NVIDIA-Nemotron-Parse-2.0 und MinerU lösen dasselbe Problem aus entgegengesetzten Richtungen. Beide nehmen eine gescannte oder gerenderte Seite und liefern sauberes, strukturiertes Markdown mit Tabellen, Formeln und korrekter Lesereihenfolge zurück. Doch MinerU ist der Open-Source-Standard – zehntausende GitHub-Sterne, eine Apache-2.0-Lizenz und eine gehostete API mit einem kostenlosen Tageskontingent: die sichere erste Wahl, zu der die meisten Dokument-Teams greifen. Nemotron Parse 2.0 ist das Gegenteil von etabliert: Es erschien am 3. August 2026 auf Hugging Face, NVIDIA hat keine Ankündigung dazu herausgegeben, und seine Modellkarte enthält eine Reihe von Benchmark-Behauptungen, die das größte Ereignis für Open-Source-Dokument-Parsing in diesem Jahr wären, wenn sie sich bestätigen. Diese Paarung ist bewusst unausgewogen – etablierter Anbieter gegen unangekündigten Herausforderer – und die ganze Frage ist, was das Versprechen jeder Seite tatsächlich wert ist.

Was jede Seite tatsächlich ist

MinerU ist ein vollständiges Dokumenten-Parsing-System von OpenDataLab, der Datengruppe hinter den offenen Veröffentlichungen des Shanghai AI Laboratory. Das aktuelle Flaggschiff ist MinerU 2.5-Pro, ein 1,2B-Vision-Language-Modell in der 2604/2605-Point-Release-Reihe (das 2604-Modell erschien im April 2026, danach folgte ein 2605-Refresh). Es basiert auf einer zweistufigen Engine – zunächst grobe globale Layoutanalyse, dann gezielte Erkennung auf Bildausschnitten in nativer Auflösung – und das Projekt bindet das Modell in die Verarbeitung von PDF, DOCX, PPTX und XLSX, die Layout-Erkennung, die Formel- und Tabellenerkennung sowie die Rekonstruktion der Lesereihenfolge ein. Es ist der Referenz-Open-Source-Parser für RAG-Preprocessing, und die Community, die dahintersteht, ist der Beweis dafür.

Nemotron Parse 2.0 ist ein 0,9B-Vision-Encoder-Decoder von NVIDIA aus derselben Familie wie NVIDIA-Nemotron-Parse-v1.2, das im Februar 2026 veröffentlicht wurde. Er verwendet einen ViT-H-Vision-Encoder auf Basis von NVIDIAs C-RADIOv2-Backbone und einen zehnschichtigen Decoder im mBART-Stil. Eingabeseiten gehen bis zu 2048×1664, die Generierung läuft bis zu einer Obergrenze von 9.000 Tokens, und er liefert dieselben strukturierten Ausgaben wie MinerU: Markdown oder Klartext, plus Tabellen in LaTeX, HTML, Markdown, JSON, hierarchischem JSON oder CSV, mit Layout-Klassen, Bounding Boxes und Lesereihenfolge. Das Repo ist vollständig – Konfigurationen, ein Dockerfile, eine Testsuite mit Golden Outputs – aber NVIDIA hat es nicht beworben, es gibt kein NIM-Paket und kein Inferenz-Anbieter hostet es. Selbsthosting ist heute die einzige Option.

Screenshot of the Hugging Face model card for NVIDIA-Nemotron-Parse-2.0, showing the nvidia-open-model-license, 0.9B model size, 2,156 downloads last month, and the note that the model isn't deployed by any inference provider.

Die Preisgeschichte: „frei“ bedeutet zwei verschiedene Dinge.

Der mit Abstand größte praktische Unterschied besteht darin, dass MinerU kostenlos aufrufbar ist und Nemotron Parse 2.0 nur kostenlos ausführbar ist. Die offizielle MinerU-API auf mineru.net bietet ein tägliches kostenloses Kontingent – je nach aktueller Aktion etwa 1.000 Seiten mit hoher Priorität pro Tag – ohne Gebühr pro Aufruf, und Dateien mit bis zu 200 Seiten. Über das Kontingent hinaus werden Aufträge herabgestuft statt in Rechnung gestellt, und kommerzielle Anbieter bepreisen das selbstgehostete Modell mit etwa einem Zehntel Cent pro Seite. Wenn Ihre Pipeline Tausende von Seiten pro Tag benötigt und Sie nichts betreiben möchten, bietet MinerU einen Weg, der fast nichts kostet.

Nemotron Parse 2.0 hat keinen solchen Pfad. Die Gewichte sind unter der NVIDIA Open Model License kostenlos, aber die Modellkarte besagt, dass es von keinem Inferenzanbieter bereitgestellt wird, und NVIDIA hat keine gehostete Option bepreist oder angekündigt. Die Nutzung bedeutet, eine GPU zu mieten oder zu besitzen, eine Transformers- oder vLLM-Umgebung mit Nemotron-Parse-Remote-Code-Unterstützung aufzusetzen und die unten genannten Bereitstellungs-Eigenheiten zu handhaben. Für ein Projekt mit geringem Volumen sind das echte Kosten – eine GPU ist deutlich teurer als eine kostenlose API-Stufe bei ein paar hundert Seiten pro Monat. Für ein Team, das bereits GPU-Infrastruktur betreibt, ist die Tatsache, dass die Gewichte kostenlos sind, ein echter Vorteil; die Frage ist, ob der Betriebsaufwand den Mehrmutzen rechtfertigt, den das Modell laut eigenen Angaben bietet.

Die Benchmark-Lücke: Diese Zahlen stehen sich nicht gegenüber

Dies ist der Abschnitt, in dem die meisten Vergleiche still und heimlich schiefgehen, also seien wir explizit. Die Modellkarte von Nemotron Parse 2.0 führt vier Benchmarks auf: ParseBench insgesamt bei 0,6391 (gegenüber 0,5782 bei v1.2), MOSCAR mehrsprachige OCR bei 0,9102 BoC F1 (gegenüber 0,4410), IndicVisionBench bei 0,7203 ANLS-character (gegenüber 0,0612) und einen OmniDocBench-Teilbereich für Handschrift, gemessen als Bearbeitungsdistanz, die sich von 0,9739 auf 0,3395 verbessert. MinerU 2.5-Pro meldet eine andere Suite: einen OmniDocBench-v1.6-Gesamtwert von 95,69 — Stand der Technik, besser als die viel größerer Modelle — plus 97,29 beim dichten Formel-Parsing und eine Bearbeitungsdistanz von 0,036 bei seinen eigenen OmniDocBench-Läufen.

Die beiden Modelle teilen sich den Namen „OmniDocBench“, wodurch sie vergleichbar wirken – und dann sind die Metriken es nicht. NVIDIA gibt eine reine Handschrift-Untermenge als Editierdistanz an; OpenDataLab berichtet einen Gesamtverbundwert auf einer anderen Benchmark-Version. ParseBench ist NVIDIAs eigene Suite und enthält keinen MinerU-Eintrag. MOSCAR und IndicVisionBench haben keinen MinerU-Eintrag. Jede Zahl auf beiden Seiten stammt vom jeweiligen Anbieter, und für kein Modell gibt es eine veröffentlichte unabhängige Drittmessung, auf der das jeweils andere ebenfalls auftaucht. Das bedeutet: Es gibt derzeit keine Äpfel-mit-Birnen-freie Kennzahl, die Nemotron Parse 2.0 direkt mit MinerU vergleicht – wer auch immer behauptet, ein Modell „gewinne“ den Benchmark-Vergleich, extrapoliert aus unterschiedlichen Tests. Was man tendenziell sagen kann: MinerUs Behauptungen sind ausgereift und haben ein Jahr Community-Nutzung überstanden, während Nemotron Parse 2.0s Behauptungen frisch und ungeprüft sind – und falls sich die MOSCAR- und IndicVision-Sprünge reproduzieren lassen, sind sie speziell für mehrsprachiges Parsing eine große Sache.

A comparison scoreboard for Nemotron Parse 2.0 and MinerU 2.5-Pro. Nemotron Parse 2.0: shipped Aug 3 2026 unannounced, 0.9B params, NVIDIA Open Model license, no hosted API, ParseBench 0.6391, MOSCAR 0.9102 F1. MinerU 2.5-Pro: shipped Apr 2026, 1.2B params, Apache 2.0, official API with free tier, OmniDocBench v1.6 95.69, 109 languages.

Wo sie sich bei realen Workloads unterscheiden.

Screenshot of the Hugging Face model card for opendatalab/MinerU2.5-Pro-2604-1.2B, showing the Apache-2.0 license, the arXiv tech report 'MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale', and an 'unmatched SOTA Performance' banner.

Lässt man die Benchmarks beiseite, betreffen die Unterschiede in einer Pipeline Umfang, Latenz und mehrsprachige Abdeckung.

• Eingabeumfang – MinerU verarbeitet über seine API vollständige PDFs mit bis zu 200 Seiten pro Datei und führt seitenübergreifende Tabellen zusammen; Nemotron Parse 2.0 nimmt pro Aufruf ein Seitenbild mit bis zu 2048×1664 auf, ein 200-seitiges Dokument entspricht also 200 Anfragen. Wenn Ihre Eingabe ein PDF ist, ist das ein Workflow-Unterschied, bevor überhaupt eine Genauigkeitsfrage aufkommt.

• Serving-Reife – MinerU liefert vLLM- und SGLang-Backends mit veröffentlichtem Durchsatz (etwa 2 Seiten pro Sekunde auf einer einzelnen A100 über seine asynchrone Engine), einen Docker-Runner und eine gehostete API. Die Serving-Geschichte von Nemotron Parse 2.0 ist jung und holprig: vLLM benötigt Remote-Code-Unterstützung und auf A100/A10-Hardware das Triton-Attention-Backend; der Tokenizer liefert ein serialisiertes tokenizer.json mit fest eingebautem Padding auf 9.000 Token, was ein Serving-Stack als einen Prompt mit sechs Token erlebte, der auf 54.000 Token-IDs explodierte; und das Repo enthält einen Laufzeit-Patch für vLLM-Builds, die seinen gebundenen Ausgabekopf nicht unterstützen. Nichts davon ist unüberwindbar, aber es ist echte Reibung.

• {{1}}Mehrsprachig{{/1}} — hier ist Nemotron Parse 2.0 am stärksten. Die 2.0-Version hat den Wortschatz von etwa 52.000 auf 72.000 Token erweitert, speziell für mehrsprachige OCR, und die behaupteten Verbesserungen konzentrieren sich genau dort: MOSCAR von 0,44 auf 0,91 gestiegen und IndicVisionBench (Bengali, Hindi, Tamil und sieben weitere indische Schriften) von 0,06 auf 0,72. MinerU unterstützt 109 Sprachen als Aushängeschild, aber sein Beleg ist der OmniDocBench-Gesamtwert, keine Aufschlüsselung nach einzelnen Schriften. Wenn Ihr Korpus viele indische oder ressourcenarme Schriften enthält, sind die Zahlen von Nemotron Parse 2.0 die interessantere Behauptung, die es zu testen gilt — sie sind auch am wenigsten unabhängig verifiziert.

Handschrift — der größte einzelne Unterschied auf NVIDIAs Karte ist Handschrift: Die Editierdistanz beim OmniDocBench-Notiz-Subset sinkt von 0,97 auf 0,34. MinerUs eigene Text-Editierdistanz von 0,036 stammt aus den gesamten OmniDocBench-Läufen, nicht aus dem Handschrift-Subset, also sind die Zahlen auch hier nicht direkt vergleichbar. Aber handschriftliche Notizen sind für beide ein klassischer Schwachpunkt, und dies ist der eine Bereich, in dem die behauptete Verbesserung von Nemotron Parse 2.0 groß genug ist, um einen direkten Test an eigenen Seiten zu rechtfertigen.

Wer sollte welche auswählen?

Wählen Sie MinerU, wenn Sie einen Parser benötigen, den Sie noch heute nutzen können: ein kostenloses tägliches Kontingent, ausgereiftes Serving, Voll-PDF-Eingabe, eine Apache-2.0-Lizenz ohne Compliance-Prüfung und eine Community, die groß genug ist, dass Antworten auf Einrichtungsfragen bereits existieren. Es ist aus gutem Grund die Standardwahl und für die meisten RAG-Vorverarbeitungsworkloads die risikoärmere Option.

Wählen Sie Nemotron Parse 2.0, wenn Sie bereits mit dem Selbsthosten von Modellen vertraut sind — insbesondere wenn Sie ohnehin in der NVIDIA-NIM- oder NeMo-Welt zu Hause sind, denn v1.2 wird als NIM ausgeliefert und 2.0 wirkt wie dessen Nachfolger — und wenn Ihr Korpus konkret Mehrsprachigkeit oder Handschrift benötigt. Ein Wochenendtest auf Ihren eigenen Indic- oder notizenlastigen Seiten verrät Ihnen mehr als jede Benchmark-Tabelle, denn die Behauptungen werden sich unter unabhängigen Daten entweder bewahrheiten oder in Luft auflösen. Bauen Sie jedoch keinen Produktionspfad um ein noch nicht angekündigtes Modell herum, bis Sie diesen Test durchgeführt und bestätigt haben, dass die Tokenizer- und Serving-Eigenheiten in Ihrem Stack abgedeckt sind.

Warum der Parser nicht die einzige Kostenquelle in der Pipeline ist.

Was auch immer Sie wählen: Sobald das Volumen real ist, ist der Parser in einer Dokument-Pipeline in der Regel die günstigste Stufe. Die teure Stufe ist das LLM, das geparstes Markdown in Zusammenfassungen, strukturierte Datensätze oder Antworten umwandelt – und genau auf dieser Stufe verändert eine Routing-Ebene die Kostenstruktur. OrcaRouter stellt über eine einzige API mehr als 200 Modelle zum Listenpreis des Anbieters ohne Aufschlag bereit, sodass eine Preissenkung des Anbieters noch am selben Tag aktiv ist; automatisches Failover verhindert zudem, dass ein einzelner beeinträchtigter Anbieter den gesamten Extraktionsauftrag aufhält. Konkret: Sie können die Behauptungen von Nemotron Parse 2.0 zur Handschrifterkennung anhand Ihres eigenen Korpus gegen MinerU testen, ohne Ihren nachgelagerten Modell-Stack auf einen der beiden Parser festzulegen, denn der Parser-Wechsel und die LLM-Ebene sind entkoppelt. Wir hosten derzeit keinen der beiden Parser – Nemotron Parse 2.0 ist ein selbst gehostetes Modell und MinerU läuft über einen eigenen Dienst – aber eine Routing-Ebene auf der LLM-Stufe ist genau das, was die Parser-Entscheidung davor bewahrt, zu einer Lock-in-Entscheidung zu werden.

Fazit

MinerU ist die rationale Standardwahl: ausgereift, in kleinem Maßstab kostenlos nutzbar, mit permissiver Lizenz und in der Praxis bewährt. Nemotron Parse 2.0 ist die interessante Wette: ein 0,9B-NVIDIA-Modell, das vor fünf Tagen still veröffentlicht wurde und dessen Datenblatt einen dramatischen Sprung bei Mehrsprachigkeit und Handschrift behauptet, den niemand unabhängig verifiziert hat. Wenn du überwiegend englische technische Dokumente in großem Umfang verarbeitest, ist MinerU die Antwort, und das Risiko von Nemotron Parse 2.0 lohnt sich nicht. Wenn du indische oder low-resource-Schriften oder handschriftliche Notizen verarbeitest, sind die Behauptungen groß genug – und die Gewichte frei genug –, dass es günstig ist, den Test selbst durchzuführen. Dass NVIDIA etwa vierteljährlich einen neuen Parser ausliefert (v1.1 im November 2025, v1.2 im Februar 2026, jetzt 2.0), deutet darauf hin, dass bald eine Ankündigung kommen könnte; bis dahin behandle die Zahlen von 2.0 als Richtwerte und teste an deinem eigenen Korpus.

FAQ

Ist Nemotron Parse 2.0 über eine API verfügbar?

Nicht über einen gehosteten Dienst. Die Hugging-Face-Karte gibt an, dass das Modell von keinem Inferenzanbieter bereitgestellt wird, und NVIDIA hat Stand Anfang August 2026 keine NIM-Paketierung oder Preisgestaltung dafür angekündigt. Der einzige Weg, es auszuführen, besteht darin, die Gewichte selbst zu hosten – über Hugging Face Transformers mit trust_remote_code oder über einen vLLM-Build, der Remote-Code-Unterstützung für Nemotron Parse enthält. MinerU hingegen bietet eine offizielle API mit einem kostenlosen täglichen Seitenkontingent.

Welches Modell ist besser für die RAG-Vorverarbeitung?

Für typische RAG-Pipelines — englische und CJK-technische Dokumente, Tabellen und gemischte Layouts — ist MinerU die sicherere, erprobtere Wahl: Es akzeptiert vollständige PDFs, führt seitenübergreifende Tabellen zusammen, bietet ein ausgereiftes Serving und kostet im kleinen Maßstab dank seines kostenlosen Tarifs nichts. Nemotron Parse 2.0 ist nur dann die richtige Wahl, wenn Ihr Korpus viele Indic- oder ressourcenarme Schriften, handschriftliche Notizen oder diagrammlastige Seiten enthält, auf die sich die behaupteten Vorteile konzentrieren — und selbst dann prüfen Sie es anhand Ihrer eigenen Dokumente, bevor Sie sich festlegen.

Sind die Benchmark-Zahlen auf den beiden Modellkarten direkt vergleichbar?

Nein. Nemotron Parse 2.0 meldet für ParseBench (NVIDIAs eigene Suite), MOSCAR, IndicVisionBench und eine OmniDocBench-Handschrift-Untermenge Editierdistanz als Metrik. MinerU 2.5-Pro meldet einen OmniDocBench-v1.6-Gesamtwert sowie Formel- und Text-Edit-Metriken. Der überlappende Benchmark-Name ist nicht dieselbe Metrik, kein unabhängiger Lauf testet beide Modelle mit demselben Test, und jede Zahl auf beiden Karten wurde von den Anbietern gemeldet. Behandeln Sie sie als richtungsweisend, nicht direkt vergleichbar.