
Nemotron Parse 2.0 vs olmOCR: Twee taken, beide parsing genoemd
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Op 3 augustus 2026 plaatste NVIDIA een nieuw documentparsemodel op Hugging Face en vertelde het niemand. NVIDIA-Nemotron-Parse-2.0 is een 0.9B vision-encoder-decoder waarvan de modelkaart een meertalige en grafiekbewuste sprong claimt ten opzichte van zijn voorganger van februari 2026, en het belandde in dezelfde hoek van het ecosysteem als olmOCR — om precies te zijn olmOCR-2-7B-1025, de 7B-linearizer van het Allen Institute for AI dat stilletjes de standaardmanier is geworden om PDF's om te zetten in LLM-trainingsdata. Dit een head-to-head noemen is al de valkuil: beide modellen worden omschreven als 'documentparsing', maar ze leveren verschillende artefacten op, voeden verschillende pijplijnen, en hun benchmarkcijfers staan nooit echt tegenover elkaar. De echte vraag is voor welke van twee taken je een parser inhuurt.
De twee artefacten
Nemotron Parse 2.0 is een engine voor layoutsemantiek. Geef het een pagina-afbeelding en een taakprompt en het retourneert de tekst plus een semantische laag erbovenop: een layoutklasse voor elke regio (titel, sectie, bijschrift, tabel, grafiek, koptekst, voettekst, voetnoot, bibliografie-item), een bounding box voor elk en de leesvolgorde daartussen — met markdown als een optionele serialisatie erbovenop. olmOCR 2 is een linearizer. Het neemt dezelfde pagina en retourneert schone, gelineariseerde markdown met een korte YAML-frontmatter die metadata op paginaniveau vastlegt, zoals primaire taal, rotatiecorrectie en of de pagina een tabel of een diagram is. Geen boxes, geen klassen, geen geometrie: één doorgang, tekst in documentvolgorde.
Het artefact bepaalt de taak. Als je pijplijn een feit moet herleiden tot een gebied op de pagina, een tabel op een scan moet markeren, of layoutsemantiek moet extraheren voor documentintelligentie, heb je geometrie nodig — dat is de uitvoerruimte van Nemotron Parse 2.0. Als je trainingsdata bouwt of een tekst-LLM voedt dat alleen tokens verwerkt, is geometrie ruis en is gelineariseerde markdown precies goed — dat is het hele ontwerp van olmOCR. Je kunt lay-outdetectie aan de uitvoer van olmOCR koppelen met een aparte detector, en je kunt de kaders van Nemotron Parse 2.0 weggooien en alleen de markdown houden, maar elk model is gebouwd om een van die taken native uit te voeren.
De stille repo: wat de repository toont, wat niet bevestigd is
NVIDIA-Nemotron-Parse-2.0 verscheen op 3 augustus 2026 op Hugging Face, zonder aankondiging, zonder blogpost en zonder NIM-pakket. Wat er te weten valt, is de repository. Het is een vision-encoder-decoder van 0,9B: een ViT-H-beeldencoder gebouwd op de C-RADIO-backbone van NVIDIA, een lichtgewicht 1D-convolutie-adapter en een decoder in mBART-stijl met tien lagen. De tokenizer groeide met ruwweg 20.000 items tot ongeveer 72.000 in totaal, uitdrukkelijk voor efficiëntere meertalige ondersteuning, en de kaart vermeldt grafiekbewuste parsing als een hoofdfunctie via een nieuw class_Chart-token, plus een familie van tabelserialisaties (LaTeX, HTML, markdown, JSON, hiërarchische JSON, CSV). Er worden twee optionele logits-processors meegeleverd: één die repetitieve gestructureerde output stopt, en één die een tabellstructuur afdwingt op een uitsnede van een tabel. De aanbevolen invoerresolutie varieert van ongeveer 1024×1280 tot 1664×2048, generatie loopt tot een maximum van 9.000 tokens, en de modelkaart vermeldt Transformers, vLLM, SGLang en Docker Model Runner als runtimes op Ampere-, Hopper-, Blackwell- en Turing-hardware.
De beweringen zijn echter allemaal van NVIDIA zelf, en geen ervan is onafhankelijk gereproduceerd. Het kaartje vermeldt ParseBench overall op 0.6391 (tegenover 0.5782 in v1.2), MOSCAR meertalige OCR op 0.9102 BoC-F1 (tegenover 0.4410), IndicVisionBench op 0.7203 ANLS-character (tegenover 0.0612), en een OmniDocBench-handschriftsubset die verbetert van 0.9739 naar 0.3395 op tekstbewerkingsafstand. Dat zijn de grootste sprongen, en ze zijn ook het minst geverifieerd: ParseBench is NVIDIA's eigen suite, en nog geen derde partij heeft Parse 2.0 tegen een onafhankelijk corpus laten draaien. Wat niet bevestigd is, gaat verder dan scores — er is geen gehoste inferentie (het kaartje stelt dat het model door geen enkele inferentieprovider is ingezet), geen prijzen, en geen aangekondigde tijdlijn voor een van beide.

olmOCR 2: de referentie waaraan iedereen zich al meet
olmOCR is het model dat de benchmark heeft uitgevonden waar deze categorie nu over discussieert. olmOCR-2-7B-1025, uitgebracht op 22 oktober 2025, is een 7B vision-language-model dat is fine-tuned vanuit Qwen2.5-VL-7B-Instruct op de 270.000 pagina's tellende olmOCR-mix-1025-corpus, en vervolgens is verfijnd met GRPO-reinforcement learning tegen geautomatiseerde 'unit test'-beloningen — deterministische controles die nagaan of een tabel zijn structuur behield, of een formule exact werd getranscribeerd, en of de leesvolgorde intact bleef. Die unit-test-opzet werd olmOCR-Bench, met ongeveer 1.400 pdf's en meer dan 7.000 controles, en het is uitgegroeid tot de de facto industriebenchmark: Marker, MinerU en een tiental commerciële OCR-modellen publiceren er nu hun scores op. olmOCR 2 zelf scoort daar 82,4 in totaal, ongeveer vier punten boven de vorige release en boven de cijfers van Marker (76,1) en MinerU (75,8) die AI2 op dezelfde pagina noemt.
olmOCR is ook de volwassen optie in deze combinatie. Het is Apache-2.0, de gewichten zijn in de afgelopen maand ongeveer 218.000 keer gedownload, en de olmOCR-toolkit verwerkt rendering, rotatie en retries op schaal met een vLLM-backend — AI2's batchschatting plaatst de pipeline rond $176–190 per miljoen pagina's op gehuurde GPU's, en de FP8-build draait ongeveer 3.400 outputtokens per seconde op een enkele H100, snel genoeg dat het releasebericht "10.000 pagina's voor minder dan $2" aanhaalt. De afweging is taal: olmOCR is expliciet gebouwd en gebenchmarkt voor Engelstalige gedigitaliseerde drukwerken, en de modelkaart labelt het als Engels. De hele pitch van Nemotron Parse 2.0 is het tegenovergestelde — de geclaimde winsten zijn geconcentreerd in CJK- en Indische scripts.

Zes rijen waar de afweging zichtbaar is
Beide modellen zijn open-weight, beide draaien op Transformers, vLLM of SGLang, en beide worden vandaag zelf gehost. Op de dimensies die ertoe doen bij het kiezen tussen de twee:
• Grootte — Nemotron Parse 2.0 is 0.9B; olmOCR 2 is 7B. Ongeveer acht keer zoveel parameters, ongeveer acht keer de VRAM-ondergrens.
Output — Nemotron Parse 2.0 retourneert tekst, layoutklassen, begrenzingskaders, leesvolgorde en markdown; olmOCR 2 retourneert gelineariseerde markdown met een YAML-metadatablok.
• Meertalig — Nemotron Parse 2.0 claimt sterke CJK- en Indic-ondersteuning (MOSCAR 0.9102, IndicVisionBench 0.7203, door de leverancier gerapporteerd); olmOCR 2 is primair Engelstalig.
• Vlaggenschipscore — Nemotron Parse 2.0 rapporteert ParseBench 0,6391 (eigen cijfers van NVIDIA, niet gecontroleerd); olmOCR 2 scoort 82,4 op olmOCR-Bench (eigen cijfers van AI2, tien maanden community-hergebruik).
• Licentie — Nemotron Parse 2.0 wordt geleverd onder de NVIDIA Open Model License; olmOCR 2 is Apache-2.0.
• Uitgebracht — Nemotron Parse 2.0 verscheen op 3 augustus 2026, onaangekondigd; olmOCR 2 werd uitgebracht op 22 oktober 2025, met een aankondigingspost.

Drie plekken waar het besluit echt bijt
Schaal en latentie. Een 0.9B-decoder is aanzienlijk goedkoper om te draaien dan een 7B-VLM: een kleinere GPU, minder VRAM, meer pagina's per seconde op dezelfde hardware en lagere kosten per pagina zodra je voor GPU-tijd betaalt. Als je al GPU-infrastructuur draait en je corpus groot is, is dat echt een maandelijks verschil. olmOCR's eigen cijfers tonen hoe snel een 7B-model met FP8-kwantalisatie kan draaien — maar het heeft nog steeds een H100-klasse GPU nodig om die cijfers te halen; de minimale hardwarevereiste van Nemotron Parse 2.0 is een kaart uit het Ampere-tijdperk.
Meertalig. Dit is de meest asymmetrische rij. Nemotron Parse 2.0 heeft zijn tokenizer met ongeveer 20.000 items uitgebreid, specifiek voor meertalige OCR, en de geclaimde winsten op de modelkaart zijn geconcentreerd in Indiase schriften en CJK. olmOCR 2 maakt geen dergelijke claim — de taalcode is Engels. Als uw corpus Hindi, Tamil, Bengaals, Japans of gemengd schrift bevat, zijn de cijfers van Nemotron Parse 2.0 de moeite van het testen waard, juist omdat ze door de leverancier zijn gerapporteerd en vers zijn.
De serving-realiteit. olmOCR 2 is tien maanden oud en zijn toolchain is prettig saai. Nemotron Parse 2.0 is vijf dagen oud en zijn serving-verhaal is duidelijk nog jong: vLLM heeft een build nodig met ondersteuning voor de remote-code van Nemotron Parse, de gekoppelde output-head laat sommige vLLM 0.20-builds struikelen (de repo wordt geleverd met een runtime-patch), en de tokenizer.json bevat geserialiseerde padding tot 9.000 tokens — één serving-stack kwam een prompt van zes tokens tegen die uitgroeide tot 54.000 token-ID's voordat er gepatcht werd. Niets daarvan is fataal, maar het is precies het soort wrijving waar je rekening mee houdt bij een nieuw model.
Kies er één voor je pipeline
Kies voor olmOCR 2 als je LLM-trainingsdata of een pijplijn voor tekstextractie met hoge volumes over Engelstalige documenten bouwt. Je krijgt een volwassen toolkit, een Apache-2.0-licentie, de benchmark waaraan de industrie zich nu meet, en een beproefd batchpad. Het geaccepteerde faalgedrag is taaldekking.
Kies Nemotron Parse 2.0 als je pipeline geometrie nodig heeft — lay-outklassen, bounding boxes en leesvolgorde voor grounded retrieval of documentintelligentie — of als je corpus zwaar op Indic-, CJK- of handgeschreven pagina's leunt, waar de geclaimde winsten liggen. Het 0,9B-formaat maakt een weekendtest goedkoop, zelfs als je twijfelt. De geaccepteerde faalmodus is dat elk getal op de kaart van NVIDIA zelf is en kan veranderen bij onafhankelijke evaluatie.
Als uw invoer voornamelijk Engelstalige born-digital pdf's betreft en u alleen schone markdown nodig hebt, is olmOCR 2 de standaardkeuze met het laagste risico. Als u al self-hosting gebruikt en de meertalige of lay-outgerichte use case reëel is, is Nemotron Parse 2.0 de interessantere gok — test het op uw eigen pagina's voordat u zich vastlegt.
Voorkom dat de parserkeuze een lock-in wordt
Een documentpijplijn heeft een parsestap en daarna een LLM-stap, en de parser is meestal de goedkoopste stap zodra het volume reëel is — de LLM die geparseerde markdown omzet in samenvattingen, gestructureerde records of antwoorden is waar de kosten opschalen. Dat is de stap waar een routeringslaag verandering in brengt. OrcaRouter plaatst 200+ modellen achter één API tegen de lijstprijs van de provider zonder opslag, dus een prijsverlaging van een leverancier is dezelfde dag live, en automatische failover voorkomt dat één gedegradeerde provider een batchtaak laat stagneren. Geen van beide parsers in deze vergelijking staat in onze catalogus — beide modelkaarten vermelden dat ze niet door een inferentieprovider worden ingezet, dus dit is een beslissing voor zelfhosting — maar de reden om de parser los te koppelen van je modelstack is precies wat routering aan de stroomafwaartse kant oplevert: wissel Nemotron Parse 2.0 voor olmOCR 2, of terug, zonder één integratie aan te raken, omdat de LLM-laag achter dezelfde API met één sleutel blijft.
Veelgestelde vragen
Welk model wint op benchmarks?
Geen van beide — de cijfers staan niet tegenover elkaar. Nemotron Parse 2.0 rapporteert ParseBench, MOSCAR, IndicVisionBench en een OmniDocBench-handschriftsubset, allemaal van NVIDIA zelf en geen ervan onafhankelijk gereproduceerd. olmOCR 2 rapporteert olmOCR-Bench, de eigen benchmark van AI2 waar de rest van de industrie inmiddels op publiceert. Geen derde partij heeft beide modellen op hetzelfde corpus laten draaien, dus elke directe "winnaar"-claim is extrapolatie. Richtinggevend: de cijfers van olmOCR hebben tien maanden community-gebruik overleefd; die van Nemotron Parse 2.0 zijn vers en kunnen nog wijzigen.
Is Nemotron Parse 2.0 echt beter in niet-Engelse documenten?
Dat is de bewering — een vocabulaire-uitbreiding van ongeveer 20.000 tokens, plus MOSCAR op 0,9102 en IndicVisionBench op 0,7203, beide door de leverancier gerapporteerd en beide fors gestegen ten opzichte van v1.2. olmOCR 2 doet geen meertalige claim en is getagd als Engels. Maar totdat er een onafhankelijke run verschijnt, beschouw de meertalige verbeteringen van Nemotron Parse 2.0 als veelbelovend maar ongeverifieerd, en test ze op je eigen Indic- of CJK-pagina's voordat je erop vertrouwt.
Heb ik voor een ervan een grotere GPU nodig?
Ja, en het houdt het grootteverschil bij. De 0.9B van Nemotron Parse 2.0 past op een bescheiden Ampere-kaart en is per pagina de goedkopere optie op hardware die je al bezit. De 7B VLM van olmOCR 2 vereist een aanzienlijk grotere GPU; de FP8-build bereikt ongeveer 3.400 outputtokens per seconde op een H100, volgens AI2.
Welke is beter voor RAG-preprocessing?
Het hangt af van wat je retriever nodig heeft. Als je antwoorden verankert aan paginaregio's, layoutklassen nodig hebt, of tabellen en grafieken als zelfstandige eenheden wilt indexeren, geven Nemotron Parse 2.0's begrenzingskaders en klassen je dat native. Als je RAG-stack gewoon schone tekst verwerkt en je corpus Engelstalig is, is olmOCR 2's gelineariseerde markdown bewezen, eenvoudiger en ondersteund door een volwassen toolkit.
Kortom
NVIDIA heeft deze week een echte parser uitgebracht en het aan niemand verteld; AI2 bracht er tien maanden geleden één uit en gaf de categorie zijn benchmark. Nemotron Parse 2.0 is de betere keuze als je met een klein budget layoutsemantiek, meertalige dekking of handschriftextractie nodig hebt — en de gebieden waar de cijfers het minst zijn geverifieerd, zijn precies de gebieden waar het beweert te winnen. olmOCR 2 is de betere keuze als je gelineariseerde tekst op schaal nodig hebt voor Engelstalige documenten en een toolchain wilt die tien maanden stabiel is gebleven. Geen van beide is ergens ingezet, dus dit is in beide gevallen een self-host-beslissing; de goedkoopste manier om dit te doen is beide op je eigen moeilijkste pagina's te draaien en te kijken waar elk bezwijkt.
