Titelkaart voor 'Nemotron Parse 2.0 vs olmOCR': kop 'Nemotron Parse 2.0 vs olmOCR', ondertitel 'Twee taken, beide parsing genoemd', met een gesplitste illustratie — links een documentpagina geparsed tot gelabelde bounding boxes onder het bijschrift 'lay-outsemantiek', rechts doorlopende tekstregels met een markdown-symbool onder het bijschrift 'gelineariseerde markdown'. OrcaRouter-logo rechtsonder gecomponeerd.
Guides & Insights

Nemotron Parse 2.0 vs olmOCR: Twee taken, beide parsing genoemd

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 3 augustus 2026 plaatste NVIDIA een nieuw documentparsemodel op Hugging Face en vertelde het niemand. NVIDIA-Nemotron-Parse-2.0 is een 0.9B vision-encoder-decoder waarvan de modelkaart een meertalige en grafiekbewuste sprong claimt ten opzichte van zijn voorganger van februari 2026, en het belandde in dezelfde hoek van het ecosysteem als olmOCR — om precies te zijn olmOCR-2-7B-1025, de 7B-linearizer van het Allen Institute for AI dat stilletjes de standaardmanier is geworden om PDF's om te zetten in LLM-trainingsdata. Dit een head-to-head noemen is al de valkuil: beide modellen worden omschreven als 'documentparsing', maar ze leveren verschillende artefacten op, voeden verschillende pijplijnen, en hun benchmarkcijfers staan nooit echt tegenover elkaar. De echte vraag is voor welke van twee taken je een parser inhuurt.

De twee artefacten

Nemotron Parse 2.0 is een engine voor layoutsemantiek. Geef het een pagina-afbeelding en een taakprompt en het retourneert de tekst plus een semantische laag erbovenop: een layoutklasse voor elke regio (titel, sectie, bijschrift, tabel, grafiek, koptekst, voettekst, voetnoot, bibliografie-item), een bounding box voor elk en de leesvolgorde daartussen — met markdown als een optionele serialisatie erbovenop. olmOCR 2 is een linearizer. Het neemt dezelfde pagina en retourneert schone, gelineariseerde markdown met een korte YAML-frontmatter die metadata op paginaniveau vastlegt, zoals primaire taal, rotatiecorrectie en of de pagina een tabel of een diagram is. Geen boxes, geen klassen, geen geometrie: één doorgang, tekst in documentvolgorde.

Het artefact bepaalt de taak. Als je pijplijn een feit moet herleiden tot een gebied op de pagina, een tabel op een scan moet markeren, of layoutsemantiek moet extraheren voor documentintelligentie, heb je geometrie nodig — dat is de uitvoerruimte van Nemotron Parse 2.0. Als je trainingsdata bouwt of een tekst-LLM voedt dat alleen tokens verwerkt, is geometrie ruis en is gelineariseerde markdown precies goed — dat is het hele ontwerp van olmOCR. Je kunt lay-outdetectie aan de uitvoer van olmOCR koppelen met een aparte detector, en je kunt de kaders van Nemotron Parse 2.0 weggooien en alleen de markdown houden, maar elk model is gebouwd om een van die taken native uit te voeren.

De stille repo: wat de repository toont, wat niet bevestigd is

NVIDIA-Nemotron-Parse-2.0 verscheen op 3 augustus 2026 op Hugging Face, zonder aankondiging, zonder blogpost en zonder NIM-pakket. Wat er te weten valt, is de repository. Het is een vision-encoder-decoder van 0,9B: een ViT-H-beeldencoder gebouwd op de C-RADIO-backbone van NVIDIA, een lichtgewicht 1D-convolutie-adapter en een decoder in mBART-stijl met tien lagen. De tokenizer groeide met ruwweg 20.000 items tot ongeveer 72.000 in totaal, uitdrukkelijk voor efficiëntere meertalige ondersteuning, en de kaart vermeldt grafiekbewuste parsing als een hoofdfunctie via een nieuw class_Chart-token, plus een familie van tabelserialisaties (LaTeX, HTML, markdown, JSON, hiërarchische JSON, CSV). Er worden twee optionele logits-processors meegeleverd: één die repetitieve gestructureerde output stopt, en één die een tabellstructuur afdwingt op een uitsnede van een tabel. De aanbevolen invoerresolutie varieert van ongeveer 1024×1280 tot 1664×2048, generatie loopt tot een maximum van 9.000 tokens, en de modelkaart vermeldt Transformers, vLLM, SGLang en Docker Model Runner als runtimes op Ampere-, Hopper-, Blackwell- en Turing-hardware.

De beweringen zijn echter allemaal van NVIDIA zelf, en geen ervan is onafhankelijk gereproduceerd. Het kaartje vermeldt ParseBench overall op 0.6391 (tegenover 0.5782 in v1.2), MOSCAR meertalige OCR op 0.9102 BoC-F1 (tegenover 0.4410), IndicVisionBench op 0.7203 ANLS-character (tegenover 0.0612), en een OmniDocBench-handschriftsubset die verbetert van 0.9739 naar 0.3395 op tekstbewerkingsafstand. Dat zijn de grootste sprongen, en ze zijn ook het minst geverifieerd: ParseBench is NVIDIA's eigen suite, en nog geen derde partij heeft Parse 2.0 tegen een onafhankelijk corpus laten draaien. Wat niet bevestigd is, gaat verder dan scores — er is geen gehoste inferentie (het kaartje stelt dat het model door geen enkele inferentieprovider is ingezet), geen prijzen, en geen aangekondigde tijdlijn voor een van beide.

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that 2.0 adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

olmOCR 2: de referentie waaraan iedereen zich al meet

olmOCR is het model dat de benchmark heeft uitgevonden waar deze categorie nu over discussieert. olmOCR-2-7B-1025, uitgebracht op 22 oktober 2025, is een 7B vision-language-model dat is fine-tuned vanuit Qwen2.5-VL-7B-Instruct op de 270.000 pagina's tellende olmOCR-mix-1025-corpus, en vervolgens is verfijnd met GRPO-reinforcement learning tegen geautomatiseerde 'unit test'-beloningen — deterministische controles die nagaan of een tabel zijn structuur behield, of een formule exact werd getranscribeerd, en of de leesvolgorde intact bleef. Die unit-test-opzet werd olmOCR-Bench, met ongeveer 1.400 pdf's en meer dan 7.000 controles, en het is uitgegroeid tot de de facto industriebenchmark: Marker, MinerU en een tiental commerciële OCR-modellen publiceren er nu hun scores op. olmOCR 2 zelf scoort daar 82,4 in totaal, ongeveer vier punten boven de vorige release en boven de cijfers van Marker (76,1) en MinerU (75,8) die AI2 op dezelfde pagina noemt.

olmOCR is ook de volwassen optie in deze combinatie. Het is Apache-2.0, de gewichten zijn in de afgelopen maand ongeveer 218.000 keer gedownload, en de olmOCR-toolkit verwerkt rendering, rotatie en retries op schaal met een vLLM-backend — AI2's batchschatting plaatst de pipeline rond $176–190 per miljoen pagina's op gehuurde GPU's, en de FP8-build draait ongeveer 3.400 outputtokens per seconde op een enkele H100, snel genoeg dat het releasebericht "10.000 pagina's voor minder dan $2" aanhaalt. De afweging is taal: olmOCR is expliciet gebouwd en gebenchmarkt voor Engelstalige gedigitaliseerde drukwerken, en de modelkaart labelt het als Engels. De hele pitch van Nemotron Parse 2.0 is het tegenovergestelde — de geclaimde winsten zijn geconcentreerd in CJK- en Indische scripts.

Screenshot of the Hugging Face repository page for allenai/olmOCR-2-7B-1025, showing the Apache-2.0 license tag, the English language tag, 217,859 downloads last month, 8B params, the description that it is the BF16 release fine-tuned from Qwen2.5-VL-7B-Instruct on the olmOCR-mix-1025 dataset with additional GRPO RL training for math equations and tables, the note that the best way to use it is the olmOCR toolkit via vLLM, and the line 'This model isn't deployed by any Inference Provider.'

Zes rijen waar de afweging zichtbaar is

Beide modellen zijn open-weight, beide draaien op Transformers, vLLM of SGLang, en beide worden vandaag zelf gehost. Op de dimensies die ertoe doen bij het kiezen tussen de twee:

• Grootte — Nemotron Parse 2.0 is 0.9B; olmOCR 2 is 7B. Ongeveer acht keer zoveel parameters, ongeveer acht keer de VRAM-ondergrens.

Output — Nemotron Parse 2.0 retourneert tekst, layoutklassen, begrenzingskaders, leesvolgorde en markdown; olmOCR 2 retourneert gelineariseerde markdown met een YAML-metadatablok.

• Meertalig — Nemotron Parse 2.0 claimt sterke CJK- en Indic-ondersteuning (MOSCAR 0.9102, IndicVisionBench 0.7203, door de leverancier gerapporteerd); olmOCR 2 is primair Engelstalig.

• Vlaggenschipscore — Nemotron Parse 2.0 rapporteert ParseBench 0,6391 (eigen cijfers van NVIDIA, niet gecontroleerd); olmOCR 2 scoort 82,4 op olmOCR-Bench (eigen cijfers van AI2, tien maanden community-hergebruik).

• Licentie — Nemotron Parse 2.0 wordt geleverd onder de NVIDIA Open Model License; olmOCR 2 is Apache-2.0.

• Uitgebracht — Nemotron Parse 2.0 verscheen op 3 augustus 2026, onaangekondigd; olmOCR 2 werd uitgebracht op 22 oktober 2025, met een aankondigingspost.

Two-column comparison scoreboard titled 'Nemotron Parse 2.0 vs olmOCR — the scoreboard'. Left column 'Nemotron Parse 2.0': Size 0.9B vision-encoder-decoder, Output bboxes, classes, reading order + markdown, Multilingual CJK + Indic strong, Score ParseBench 0.6391 (vendor), License NVIDIA Open Model, Shipped Aug 3, 2026 unannounced. Right column 'olmOCR 2': Size 7B VLM (Qwen2.5-VL), Output linearized markdown + YAML metadata, Multilingual English-first, Score olmOCR-bench 82.4, License Apache 2.0, Shipped Oct 22, 2025. Footer: 'Nemotron scores vendor-reported (NVIDIA); olmOCR scores per AI2's olmOCR-bench.' OrcaRouter logo composited bottom-right.

Drie plekken waar het besluit echt bijt

Schaal en latentie. Een 0.9B-decoder is aanzienlijk goedkoper om te draaien dan een 7B-VLM: een kleinere GPU, minder VRAM, meer pagina's per seconde op dezelfde hardware en lagere kosten per pagina zodra je voor GPU-tijd betaalt. Als je al GPU-infrastructuur draait en je corpus groot is, is dat echt een maandelijks verschil. olmOCR's eigen cijfers tonen hoe snel een 7B-model met FP8-kwantalisatie kan draaien — maar het heeft nog steeds een H100-klasse GPU nodig om die cijfers te halen; de minimale hardwarevereiste van Nemotron Parse 2.0 is een kaart uit het Ampere-tijdperk.

Meertalig. Dit is de meest asymmetrische rij. Nemotron Parse 2.0 heeft zijn tokenizer met ongeveer 20.000 items uitgebreid, specifiek voor meertalige OCR, en de geclaimde winsten op de modelkaart zijn geconcentreerd in Indiase schriften en CJK. olmOCR 2 maakt geen dergelijke claim — de taalcode is Engels. Als uw corpus Hindi, Tamil, Bengaals, Japans of gemengd schrift bevat, zijn de cijfers van Nemotron Parse 2.0 de moeite van het testen waard, juist omdat ze door de leverancier zijn gerapporteerd en vers zijn.

De serving-realiteit. olmOCR 2 is tien maanden oud en zijn toolchain is prettig saai. Nemotron Parse 2.0 is vijf dagen oud en zijn serving-verhaal is duidelijk nog jong: vLLM heeft een build nodig met ondersteuning voor de remote-code van Nemotron Parse, de gekoppelde output-head laat sommige vLLM 0.20-builds struikelen (de repo wordt geleverd met een runtime-patch), en de tokenizer.json bevat geserialiseerde padding tot 9.000 tokens — één serving-stack kwam een prompt van zes tokens tegen die uitgroeide tot 54.000 token-ID's voordat er gepatcht werd. Niets daarvan is fataal, maar het is precies het soort wrijving waar je rekening mee houdt bij een nieuw model.

Kies er één voor je pipeline

Kies voor olmOCR 2 als je LLM-trainingsdata of een pijplijn voor tekstextractie met hoge volumes over Engelstalige documenten bouwt. Je krijgt een volwassen toolkit, een Apache-2.0-licentie, de benchmark waaraan de industrie zich nu meet, en een beproefd batchpad. Het geaccepteerde faalgedrag is taaldekking.

Kies Nemotron Parse 2.0 als je pipeline geometrie nodig heeft — lay-outklassen, bounding boxes en leesvolgorde voor grounded retrieval of documentintelligentie — of als je corpus zwaar op Indic-, CJK- of handgeschreven pagina's leunt, waar de geclaimde winsten liggen. Het 0,9B-formaat maakt een weekendtest goedkoop, zelfs als je twijfelt. De geaccepteerde faalmodus is dat elk getal op de kaart van NVIDIA zelf is en kan veranderen bij onafhankelijke evaluatie.

Als uw invoer voornamelijk Engelstalige born-digital pdf's betreft en u alleen schone markdown nodig hebt, is olmOCR 2 de standaardkeuze met het laagste risico. Als u al self-hosting gebruikt en de meertalige of lay-outgerichte use case reëel is, is Nemotron Parse 2.0 de interessantere gok — test het op uw eigen pagina's voordat u zich vastlegt.

Voorkom dat de parserkeuze een lock-in wordt

Een documentpijplijn heeft een parsestap en daarna een LLM-stap, en de parser is meestal de goedkoopste stap zodra het volume reëel is — de LLM die geparseerde markdown omzet in samenvattingen, gestructureerde records of antwoorden is waar de kosten opschalen. Dat is de stap waar een routeringslaag verandering in brengt. OrcaRouter plaatst 200+ modellen achter één API tegen de lijstprijs van de provider zonder opslag, dus een prijsverlaging van een leverancier is dezelfde dag live, en automatische failover voorkomt dat één gedegradeerde provider een batchtaak laat stagneren. Geen van beide parsers in deze vergelijking staat in onze catalogus — beide modelkaarten vermelden dat ze niet door een inferentieprovider worden ingezet, dus dit is een beslissing voor zelfhosting — maar de reden om de parser los te koppelen van je modelstack is precies wat routering aan de stroomafwaartse kant oplevert: wissel Nemotron Parse 2.0 voor olmOCR 2, of terug, zonder één integratie aan te raken, omdat de LLM-laag achter dezelfde API met één sleutel blijft.

Veelgestelde vragen

Welk model wint op benchmarks?

Geen van beide — de cijfers staan niet tegenover elkaar. Nemotron Parse 2.0 rapporteert ParseBench, MOSCAR, IndicVisionBench en een OmniDocBench-handschriftsubset, allemaal van NVIDIA zelf en geen ervan onafhankelijk gereproduceerd. olmOCR 2 rapporteert olmOCR-Bench, de eigen benchmark van AI2 waar de rest van de industrie inmiddels op publiceert. Geen derde partij heeft beide modellen op hetzelfde corpus laten draaien, dus elke directe "winnaar"-claim is extrapolatie. Richtinggevend: de cijfers van olmOCR hebben tien maanden community-gebruik overleefd; die van Nemotron Parse 2.0 zijn vers en kunnen nog wijzigen.

Is Nemotron Parse 2.0 echt beter in niet-Engelse documenten?

Dat is de bewering — een vocabulaire-uitbreiding van ongeveer 20.000 tokens, plus MOSCAR op 0,9102 en IndicVisionBench op 0,7203, beide door de leverancier gerapporteerd en beide fors gestegen ten opzichte van v1.2. olmOCR 2 doet geen meertalige claim en is getagd als Engels. Maar totdat er een onafhankelijke run verschijnt, beschouw de meertalige verbeteringen van Nemotron Parse 2.0 als veelbelovend maar ongeverifieerd, en test ze op je eigen Indic- of CJK-pagina's voordat je erop vertrouwt.

Heb ik voor een ervan een grotere GPU nodig?

Ja, en het houdt het grootteverschil bij. De 0.9B van Nemotron Parse 2.0 past op een bescheiden Ampere-kaart en is per pagina de goedkopere optie op hardware die je al bezit. De 7B VLM van olmOCR 2 vereist een aanzienlijk grotere GPU; de FP8-build bereikt ongeveer 3.400 outputtokens per seconde op een H100, volgens AI2.

Welke is beter voor RAG-preprocessing?

Het hangt af van wat je retriever nodig heeft. Als je antwoorden verankert aan paginaregio's, layoutklassen nodig hebt, of tabellen en grafieken als zelfstandige eenheden wilt indexeren, geven Nemotron Parse 2.0's begrenzingskaders en klassen je dat native. Als je RAG-stack gewoon schone tekst verwerkt en je corpus Engelstalig is, is olmOCR 2's gelineariseerde markdown bewezen, eenvoudiger en ondersteund door een volwassen toolkit.

Kortom

NVIDIA heeft deze week een echte parser uitgebracht en het aan niemand verteld; AI2 bracht er tien maanden geleden één uit en gaf de categorie zijn benchmark. Nemotron Parse 2.0 is de betere keuze als je met een klein budget layoutsemantiek, meertalige dekking of handschriftextractie nodig hebt — en de gebieden waar de cijfers het minst zijn geverifieerd, zijn precies de gebieden waar het beweert te winnen. olmOCR 2 is de betere keuze als je gelineariseerde tekst op schaal nodig hebt voor Engelstalige documenten en een toolchain wilt die tien maanden stabiel is gebleven. Geen van beide is ergens ingezet, dus dit is in beide gevallen een self-host-beslissing; de goedkoopste manier om dit te doen is beide op je eigen moeilijkste pagina's te draaien en te kijken waar elk bezwijkt.