Titelkarte für 'Nemotron Parse 2.0 vs olmOCR': Überschrift 'Nemotron Parse 2.0 vs olmOCR', Untertitel 'Zwei Aufgaben, beide Parsing genannt', mit einer geteilten Illustration — linke Seite eine Dokumentseite, analysiert in beschriftete Begrenzungsrahmen, unter der Bildunterschrift 'Layout-Semantik', rechte Seite fließende Textzeilen mit einem Markdown-Symbol unter der Bildunterschrift 'linearisiertes Markdown'. OrcaRouter-Logo unten rechts eingefügt.
Guides & Insights

Nemotron Parse 2.0 vs. olmOCR: Zwei Aufgaben, beide Parsing genannt

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 3. August 2026 veröffentlichte NVIDIA ein neues Dokument-Parsing-Modell auf Hugging Face – und erzählte niemandem davon. NVIDIA-Nemotron-Parse-2.0 ist ein 0,9B-Vision-Encoder-Decoder, dessen Modellkarte einen multilingualen und diagrammbewussten Sprung gegenüber seinem Vorgänger vom Februar 2026 beansprucht, und es landete in derselben Ecke des Ökosystems wie olmOCR – genauer gesagt olmOCR-2-7B-1025, der 7B-Linearisierer des Allen Institute for AI, der sich leise zum Standard entwickelt hat, um PDFs in LLM-Trainingsdaten zu verwandeln. Das als direktes Duell zu bezeichnen, ist die Falle: Beide Modelle werden als „Dokument-Parsing“ beschrieben, aber sie liefern unterschiedliche Artefakte, speisen unterschiedliche Pipelines, und ihre Benchmark-Zahlen stehen nie wirklich im direkten Vergleich. Die eigentliche Frage ist, für welche von zwei Aufgaben man einen Parser engagiert.

Die beiden Artefakte

Nemotron Parse 2.0 ist eine Layout-Semantik-Engine. Gib ihr ein Seitenbild und einen Aufgaben-Prompt, und sie liefert den Text plus eine semantische Ebene darüber: eine Layout-Klasse für jede Region (Titel, Abschnitt, Bildunterschrift, Tabelle, Diagramm, Kopfzeile, Fußzeile, Fußnote, Bibliografieeintrag), einen Begrenzungsrahmen für jede und die Lesereihenfolge zwischen ihnen – mit Markdown als optionaler Serialisierung obendrauf. olmOCR 2 ist ein Linearisierer. Er nimmt dieselbe Seite und liefert sauberes, linearisiertes Markdown mit einem kurzen YAML-Frontmatter, das Metadaten auf Seitenebene erfasst, wie primäre Sprache, Rotationskorrektur und ob die Seite eine Tabelle oder ein Diagramm ist. Keine Boxen, keine Klassen, keine Geometrie: ein Durchgang, Text in Dokumentreihenfolge.

Das Artefakt bestimmt die Aufgabe. Wenn Ihre Pipeline eine Tatsache auf eine Region der Seite zurückführen, eine Tabelle in einem Scan hervorheben oder Layout-Semantik für Document Intelligence extrahieren muss, brauchen Sie Geometrie — das ist der Ausgaberaum von Nemotron Parse 2.0. Wenn Sie Trainingsdaten erstellen oder ein Text-LLM füttern, das nur Tokens verarbeitet, ist Geometrie Rauschen und linearisiertes Markdown ist genau richtig — das ist das gesamte Design von olmOCR. Sie können Layout-Erkennung mit einem separaten Detektor an die Ausgabe von olmOCR anbinden, und Sie können die Boxen von Nemotron Parse 2.0 verwerfen und nur das Markdown behalten, aber jedes Modell ist dafür gebaut, eine dieser Aufgaben nativ zu erledigen.

Das stille Schiff: was das Repo zeigt, was nicht bestätigt ist

NVIDIA-Nemotron-Parse-2.0 erschien am 3. August 2026 auf Hugging Face, ohne Ankündigung, ohne Blogbeitrag und ohne NIM-Paketierung. Was man wissen kann, ist das Repository. Es handelt sich um einen 0,9B-Vision-Encoder-Decoder: einen ViT-H-Bildencoder auf Basis von NVIDIAs C-RADIO-Backbone, einen leichten 1D-Faltungsadapter und einen zehnschichtigen mBART-ähnlichen Decoder. Der Tokenizer wuchs um etwa 20.000 Einträge auf insgesamt etwa 72.000, ausdrücklich für eine effizientere mehrsprachige Unterstützung, und die Karte listet chart-bewusstes Parsen als Hauptmerkmal über ein neues class_Chart-Token sowie eine Familie von Tabellenserialisierungen (LaTeX, HTML, Markdown, JSON, hierarchisches JSON, CSV). Zwei optionale Logits-Prozessoren werden mitgeliefert: einer stoppt repetitive strukturierte Ausgaben, und einer erzwingt eine Tabellenstruktur auf einem Tabellenausschnitt. Die empfohlene Eingabeauflösung reicht von etwa 1024×1280 bis 1664×2048, die Generierung läuft bis zu einer Obergrenze von 9.000 Token, und die Modellkarte listet Transformers, vLLM, SGLang und Docker Model Runner als Laufzeiten auf Ampere-, Hopper-, Blackwell- und Turing-Hardware.

Die Behauptungen stammen {{1}}jedoch{{/1}} alle von NVIDIA selbst, und keine davon wurde unabhängig reproduziert. Das Datenblatt verzeichnet ParseBench gesamt bei 0,6391 (gegenüber 0,5782 in v1.2), MOSCAR multilingual OCR bei 0,9102 BoC-F1 (gegenüber 0,4410), IndicVisionBench bei 0,7203 ANLS-character (gegenüber 0,0612) und ein OmniDocBench-Handschrift-Subset, das sich bei der Text-Edit-Distanz von 0,9739 auf 0,3395 verbessert hat. Das sind die größten Sprünge, und sie sind zugleich am wenigsten verifiziert: ParseBench ist NVIDIAs eigene Suite, und noch kein Dritter hat Parse 2.0 gegen ein unabhängiges Korpus laufen lassen. Was nicht bestätigt ist, geht über die Werte hinaus — es gibt keine gehostete Inferenz (das Datenblatt gibt an, dass das Modell von keinem Inferenzanbieter bereitgestellt wird), keine Preisangaben und keinen angekündigten Zeitplan für beides.

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that 2.0 adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

olmOCR 2: der etablierte Standard, an dem sich bereits alle messen

olmOCR ist das Modell, das den Benchmark erfunden hat, über den in dieser Kategorie heute gestritten wird. olmOCR-2-7B-1025, veröffentlicht am 22. Oktober 2025, ist ein 7B-Vision-Language-Modell, das auf der Basis von Qwen2.5-VL-7B-Instruct mit dem 270.000 Seiten umfassenden Korpus olmOCR-mix-1025 feinabgestimmt und anschließend mit GRPO-Verstärkungslernen gegen automatisierte „Unit-Test“-Belohnungen verfeinert wurde – deterministische Prüfungen, die sicherstellen, dass eine Tabelle ihre Struktur behalten hat, dass eine Formel exakt übertragen wurde und dass die Lesereihenfolge eingehalten wurde. Dieser Unit-Test-Ansatz wurde zu olmOCR-Bench, mit etwa 1.400 PDFs und mehr als 7.000 Prüfungen, und hat sich zum De-facto-Industriestandard entwickelt: Marker, MinerU und ein Dutzend kommerzieller OCR-Modelle veröffentlichen inzwischen ihre Ergebnisse auf diesem Benchmark. olmOCR 2 selbst erreicht dort insgesamt 82.4 Punkte, etwa vier Punkte mehr als die vorherige Version und über den Werten von Marker (76.1) und MinerU (75.8), die AI2 auf derselben Seite angibt.

olmOCR ist auch die ausgereifte Option in dieser Kombination. Es ist unter Apache-2.0 lizenziert, seine Gewichte wurden im letzten Monat rund 218.000 Mal heruntergeladen, und das olmOCR-Toolkit übernimmt Rendering, Rotation und Wiederholungsversuche in großem Maßstab auf einem vLLM-Backend — AI2s Batch-Schätzung beziffert die Pipeline auf etwa 176–190 US-Dollar pro Million Seiten auf gemieteten GPUs, und der FP8-Build erreicht etwa 3.400 Ausgabe-Tokens pro Sekunde auf einer einzelnen H100, schnell genug, dass der Release-Beitrag „10.000 Seiten für weniger als 2 US-Dollar“ zitiert. Der Kompromiss betrifft die Sprache: olmOCR wurde ausdrücklich für englischsprachige digitalisierte Druckerzeugnisse entwickelt und benchmarkt, und seine Modellkarte kennzeichnet es als Englisch. Das gesamte Verkaufsargument von Nemotron Parse 2.0 ist das Gegenteil — seine behaupteten Vorteile konzentrieren sich auf CJK- und indische Schriften.

Screenshot of the Hugging Face repository page for allenai/olmOCR-2-7B-1025, showing the Apache-2.0 license tag, the English language tag, 217,859 downloads last month, 8B params, the description that it is the BF16 release fine-tuned from Qwen2.5-VL-7B-Instruct on the olmOCR-mix-1025 dataset with additional GRPO RL training for math equations and tables, the note that the best way to use it is the olmOCR toolkit via vLLM, and the line 'This model isn't deployed by any Inference Provider.'

Sechs Zeilen, in denen der Kompromiss sichtbar wird

Beide Modelle sind Open-Weight, beide laufen auf Transformers, vLLM oder SGLang, und beide sind heute selbst gehostet. Bei den Kriterien, die für die Wahl zwischen ihnen entscheidend sind:

• Größe — Nemotron Parse 2.0 hat 0,9B Parameter; olmOCR 2 hat 7B. Ungefähr achtmal so viele Parameter, ungefähr achtmal so hoher VRAM-Mindestbedarf.

• Ausgabe — Nemotron Parse 2.0 liefert Text, Layout-Klassen, Bounding-Boxes, Lesereihenfolge und Markdown; olmOCR 2 liefert linearisiertes Markdown mit einem YAML-Metadatenblock.

• Mehrsprachig — Nemotron Parse 2.0 verspricht starke CJK- und Indik-Unterstützung (MOSCAR 0.9102, IndicVisionBench 0.7203, vom Anbieter gemeldet); olmOCR 2 ist Englisch-orientiert.

• Flaggschiff-Ergebnis — Nemotron Parse 2.0 meldet 0,6391 beim ParseBench (von NVIDIA selbst, ungeprüft); olmOCR 2 erzielt 82,4 beim olmOCR-Bench (von AI2 selbst, zehn Monate Community-Wiederverwendung).

• Lizenz — Nemotron Parse 2.0 wird unter der NVIDIA Open Model License bereitgestellt; olmOCR 2 steht unter Apache-2.0.

• Versandt — Nemotron Parse 2.0 kam am 3. August 2026 ohne Ankündigung; olmOCR 2 wurde am 22. Oktober 2025 mit einem Einführungsbeitrag veröffentlicht.

Two-column comparison scoreboard titled 'Nemotron Parse 2.0 vs olmOCR — the scoreboard'. Left column 'Nemotron Parse 2.0': Size 0.9B vision-encoder-decoder, Output bboxes, classes, reading order + markdown, Multilingual CJK + Indic strong, Score ParseBench 0.6391 (vendor), License NVIDIA Open Model, Shipped Aug 3, 2026 unannounced. Right column 'olmOCR 2': Size 7B VLM (Qwen2.5-VL), Output linearized markdown + YAML metadata, Multilingual English-first, Score olmOCR-bench 82.4, License Apache 2.0, Shipped Oct 22, 2025. Footer: 'Nemotron scores vendor-reported (NVIDIA); olmOCR scores per AI2's olmOCR-bench.' OrcaRouter logo composited bottom-right.

Drei Stellen, an denen die Entscheidung tatsächlich wehtut.

Skalierung und Latenz. Ein 0.9B-Decoder ist erheblich günstiger zu betreiben als ein 7B-VLM: eine kleinere GPU, weniger VRAM, mehr Seiten pro Sekunde auf derselben Hardware und niedrigere Kosten pro Seite, sobald man für GPU-Zeit bezahlt. Wenn Sie bereits GPU-Infrastruktur betreiben und Ihr Korpus groß ist, macht das monatlich einen echten Unterschied. olmOCRs eigene Zahlen zeigen, wie schnell ein 7B-Modell mit FP8-Quantisierung gemacht werden kann — aber es braucht immer noch eine GPU der H100-Klasse, um diese Werte zu erreichen; die Hardware-Untergrenze von Nemotron Parse 2.0 ist eine Karte aus der Ampere-Ära.

Mehrsprachig. Dies ist die asymmetrischste Zeile. Nemotron Parse 2.0 hat seinen Tokenizer um etwa 20.000 Einträge speziell für mehrsprachige OCR erweitert, und die auf seiner Karte angegebenen Verbesserungen konzentrieren sich auf indische Schriften und CJK. olmOCR 2 erhebt keinen solchen Anspruch – sein Sprach-Tag ist Englisch. Wenn Ihr Korpus aus Hindi, Tamil, Bengalisch, Japanisch oder gemischten Schriften besteht, sind die Zahlen von Nemotron Parse 2.0 diejenigen, die es wert sind, getestet zu werden, gerade weil sie vom Anbieter gemeldet und aktuell sind.

Die Serving-Realität. olmOCR 2 ist zehn Monate alt und seine Toolchain ist in gutem Sinne langweilig. Nemotron Parse 2.0 ist fünf Tage alt und seine Serving-Geschichte ist sichtlich jung: vLLM benötigt einen Build mit Nemotron-Parse-Remote-Code-Unterstützung, das gebundene Output-Head bringt einige vLLM-0.20-Builds ins Straucheln (das Repo enthält einen Runtime-Patch), und die tokenizer.json enthält serialisiertes Padding bis 9.000 Token – bei einem Serving-Stack weitete sich ein Sechs-Token-Prompt vor dem Patchen auf 54.000 Token-IDs aus. Nichts davon ist fatal, aber es ist genau die Art von Reibung, mit der man bei einem neuen Modell rechnet.

Wähle eine für deine Pipeline aus.

Entscheiden Sie sich für olmOCR 2, wenn Sie LLM-Trainingsdaten oder eine Hochdurchsatz-Pipeline zur Textextraktion aus englischen Dokumenten erstellen. Sie erhalten ein ausgereiftes Toolkit, eine Apache-2.0-Lizenz, den Maßstab, an dem sich die Branche heute misst, und einen bewährten Batch-Pfad. Die akzeptierte Einschränkung ist die Sprachabdeckung.

Wählen Sie Nemotron Parse 2.0, wenn Ihre Pipeline Geometrie benötigt — Layout-Klassen, Begrenzungsrahmen und Lesereihenfolge für fundiertes Retrieval oder Dokumentenintelligenz — oder wenn Ihr Korpus viele indische, CJK- oder handschriftliche Seiten enthält, wo seine behaupteten Vorteile liegen. Die 0,9B-Größe macht einen Wochenendtest günstig, selbst wenn Sie unsicher sind. Sein akzeptierter Fehlermodus ist, dass jede Zahl auf der Karte von NVIDIA stammt und sich bei unabhängiger Evaluierung verschieben könnte.

Wenn Ihre Eingaben hauptsächlich englische, originär digitale PDFs sind und Sie nur sauberes Markdown benötigen, ist olmOCR 2 die risikoärmere Standardwahl. Wenn Sie bereits Self-Hosting betreiben und der mehrsprachige oder layoutbezogene Anwendungsfall real ist, ist Nemotron Parse 2.0 die interessantere Wette — testen Sie es an Ihren eigenen Seiten, bevor Sie sich festlegen.

Verhindern Sie, dass die Parser-Wahl zu einer Abhängigkeit wird.

Ein Dokument-Pipeline besteht aus einer Parser-Stufe und danach einer LLM-Stufe, wobei der Parser bei nennenswertem Volumen in der Regel die günstigste Stufe ist – das LLM, das geparste Markdown-Dateien in Zusammenfassungen, strukturierte Datensätze oder Antworten umwandelt, ist der Punkt, an dem die Kosten skalieren. Genau diese Stufe verändert eine Routing-Ebene. OrcaRouter stellt über eine einzige API mehr als 200 Modelle zum Listenpreis des Anbieters ohne Aufschlag bereit, sodass eine Preissenkung des Anbieters noch am selben Tag wirksam wird, und automatisches Failover verhindert, dass ein einzelner degradierter Anbieter einen Stapeljob blockiert. Keiner der Parser in diesem Vergleich ist in unserem Katalog – beide Modellkarten geben an, dass sie von keinem Inferenz-Anbieter bereitgestellt werden, es handelt sich also um eine Entscheidung für Selbsthosting –, aber der Grund, den Parser von Ihrem Modell-Stack entkoppelt zu halten, ist genau das, was Routing auf der nachgelagerten Seite einbringt: Nemotron Parse 2.0 gegen olmOCR 2 austauschen oder zurück, ohne eine einzige Integration anzufassen, denn die LLM-Schicht bleibt hinter derselben Ein-Schlüssel-API.

FAQ

Welches Modell gewinnt bei Benchmarks?

Weder noch — die Zahlen stehen sich nicht direkt gegenüber. Nemotron Parse 2.0 nennt ParseBench, MOSCAR, IndicVisionBench und eine Handschrift-Teilmenge von OmniDocBench, allesamt NVIDIAs eigene und keine davon unabhängig reproduziert. olmOCR 2 führt olmOCR-Bench an, AI2s eigenen Benchmark, auf den die übrige Branche inzwischen ihre Veröffentlichungen stützt. Kein Dritter hat beide Modelle auf demselben Korpus laufen lassen, daher ist jede direkte „Sieger“-Behauptung eine Extrapolation. In der Tendenz: olmOCRs Zahlen haben zehn Monate Community-Nutzung überstanden; die von Nemotron Parse 2.0 sind frisch und könnten sich noch bewegen.

Ist Nemotron Parse 2.0 wirklich besser bei nicht-englischen Dokumenten?

{{1}}Das ist die Behauptung — eine Erweiterung des Wortschatzes um etwa 20.000 Token, plus MOSCAR bei 0,9102 und IndicVisionBench bei 0,7203, beides vom Anbieter gemeldet und beides deutlich gestiegen gegenüber v1.2.{{/1}} {{2}}olmOCR 2 erhebt keinen Anspruch auf Mehrsprachigkeit und ist als Englisch gekennzeichnet.{{/2}} {{3}}Aber bis eine unabhängige Auswertung vorliegt, betrachte die mehrsprachigen Verbesserungen von Nemotron Parse 2.0 als vielversprechend, aber unbestätigt, und teste sie an deinen eigenen Indic- oder CJK-Seiten, bevor du dich auf sie verlässt.{{/3}}

Brauche ich für einen davon eine größere GPU?

Ja, und es verfolgt den Größenunterschied. Das 0,9B-Modell von Nemotron Parse 2.0 passt auf eine moderate Karte aus der Ampere-Ära und ist bei Hardware, die Sie bereits besitzen, die günstigere Option pro Seite. Das 7B-VLM von olmOCR 2 benötigt eine wesentlich größere GPU; sein FP8-Build erreicht laut AI2 etwa 3.400 Ausgabe-Token pro Sekunde auf einer H100.

Welches ist besser für die RAG-Vorverarbeitung?

Es hängt davon ab, was Ihr Retriever benötigt. Wenn Sie Antworten auf Seitenbereiche zurückführen, Layout-Klassen benötigen oder Tabellen und Diagramme als eigene Einheiten indizieren möchten, bieten Ihnen die Bounding-Boxes und Klassen von Nemotron Parse 2.0 dies nativ. Wenn Ihr RAG-Stack lediglich sauberen Text verarbeitet und Ihr Korpus Englisch ist, ist das linearisierte Markdown von olmOCR 2 bewährt, einfacher und wird von einem ausgereiften Toolkit unterstützt.

Fazit

NVIDIA hat diese Woche einen echten Parser veröffentlicht und niemandem davon erzählt; AI2 hat vor zehn Monaten einen veröffentlicht und den Maßstab für die Kategorie gesetzt. Nemotron Parse 2.0 passt besser, wenn Sie Layout-Semantik, mehrsprachige Abdeckung oder Handschriftenextraktion mit kleinem Budget benötigen – und die Bereiche, in denen seine Zahlen am wenigsten verifiziert sind, sind genau die, in denen es den Sieg beansprucht. olmOCR 2 passt besser, wenn Sie linearisierten Text in großem Maßstab für englische Dokumente benötigen und eine Toolchain möchten, die seit zehn Monaten stabil ist. Keines von beiden wird irgendwo eingesetzt, also ist das so oder so eine Entscheidung für Selfhosting; der günstigste Weg, diese Entscheidung zu treffen, ist, beide auf Ihren eigenen schwierigsten Seiten laufen zu lassen und zu beobachten, wo jedes versagt.