
NVIDIA-Nemotron-Parse-2.0: NVIDIA heeft stilletjes een slimmere documentparser uitgebracht
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenNIEUWQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekNIEUWDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- qwenNIEUWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 591 tok/s
- orcaNIEUWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligentie42Coderen
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligentie39Coderen
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligentie72Coderen
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligentie52Coderen57Wiskunde
- z-aiZ.ai: GLM 5.22026-06-1653Intelligentie69Coderen60Wiskunde
NVIDIA-Nemotron-Parse-2.0 verscheen op 3 augustus 2026 op Hugging Face, en op het moment van schrijven, vijf dagen later, heeft NVIDIA het nog steeds niet aangekondigd — geen blogpost, geen persbericht, geen thread op X. De repo is compleet: een 0.9B vision-encoder-decoder, een modelkaart met een volledige benchmarktabel tegen NVIDIA-Nemotron-Parse-v1.2, configs, een Dockerfile, een testsuite, en zelfs een vLLM-pull request dat al verwijst naar de hulpkop van het nieuwe model. Een complete release zonder enige opsmuk is precies het soort signaal dat een 'wat we tot nu toe weten'-blik waard is, en dat is wat dit is: de feiten die de repo vaststelt, de cijfers die nog steeds door de leverancier zijn gerapporteerd, en de open vragen die een aankondiging normaal gesproken zou beantwoorden.
Wat NVIDIA-Nemotron-Parse-2.0 is
Nemotron Parse is het documentparsemodel van NVIDIA: je voert een gescande of gerenderde pagina in en het retourneert de tekst in leesvolgorde, de bounding box en semantische klasse van elk gebied, en markdown — inclusief tabellen, in jouw keuze uit LaTeX, HTML, markdown, JSON, hiërarchisch JSON of CSV. Het is geen algemene LLM en geen gewone OCR-engine. Het zit tussen beide in: layoutbewuste extractie, ontworpen om RAG-, extractie- en documentintelligentiepijplijnen te voeden.
Versie 2.0 behoudt dezelfde architectuurfamilie als v1.2, volgens de configuratie van de repository. De vision-encoder is een ViT-H gebouwd op NVIDIA's C-RADIOv2-backbone, de decoder is een tienlaagse decoder in mBART-stijl, en het geheel komt op ongeveer 0,9B parameters. Invoerpagina's gaan tot 2048×1664, generatie loopt tot een maximum van 9.000 tokens, en het model labelt regio's met een reeks semantische klassen (tekst, titel, sectiekop, lijstitem, tabel, formule, afbeelding, bijschrift, voetnoot, paginakop/-voet, en de rest). Het is een klein genoeg model om op één GPU te hosten, wat er toe doet omdat dat vandaag de enige manier is om het te draaien.
Wat is er veranderd ten opzichte van v1.2
Het interessante deel van de kaart is niet het model — het is de delta. {{KEEP}}NVIDIA-Nemotron-Parse-v1.2{{/KEEP}} werd in februari 2026 op Hugging Face uitgebracht met een woordenschat van 52.329 tokens. Versie 2.0 breidt dat uit tot 72.256 tokens, een sprong van ruwweg 20k tokens, en de kaart legt expliciet uit waarom: de extra tokens leveren meertalige OCR op, met de grootste winst op CJK- en Indic-schriften. De modelkaart vermeldt ook drie andere wijzigingen:
• Grafiekbewuste parsing — een nieuw class_Chart> class-token, zodat grafiekgebieden hun eigen semantische klasse krijgen in plaats van op één hoop te worden gegooid met afbeeldingen of tabellen.
• Verbeterde extractie van handgeschreven tekst — de kaart rapporteert dat de tekstbewerkingsafstand op de OmniDocBench Notes-set daalt van 0.9739 op v1.2 naar 0.3395 (lager is beter), een grote sprong voor wat historisch gezien het zwakste geval is voor deze modellen.
• Verbeterde tabelverwerking, opgenomen in de totale ParseBench-winst in plaats van als afzonderlijk cijfer te worden gerapporteerd.
Een trainingsdetail dat het vermelden waard is: volgens de kaart is 2.0 een checkpoint soup met gelijke gewichten van trainingscheckpoints van stap 58k tot en met 66k, wat een veelgebruikte methode is voor een rustige puntrelease — het levert doorgaans robuustheid op zonder een volledige hertraining.
De getallen die de kaart rapporteert
Alle volgende cijfers zijn afkomstig van NVIDIA's eigen modelkaart, gemeten tegen v1.2, en geen ervan heeft al een onafhankelijke uitvoering door een derde partij gehad. Beschouw ze als door de leverancier gerapporteerd en richtinggevend:
• ParseBench algemene score — van 0.5782 op v1.2 naar 0.6391 op 2.0. ParseBench is NVIDIA's eigen benchmark die tekstgetrouwheid, semantische opmaak, tabellen, grafieken en visuele grounding omvat.
• MOSCAR meertalige BoC F1 — 0.4410 tot 0.9102. Dit is veruit de grootste sprong op de kaart, en het sluit aan bij de vocabulaire-uitbreiding; MOSCAR omvat Latijn, Arabisch, Cyrillisch, Chinees, Hangul, Japans, Indic, Hebreeuws, Thai, Grieks en meer.
• IndicVisionBench algemene ANLS-character — 0,0612 tot 0,7203, over tien Indiase talen (Bengaals, Gujarati, Hindi, Kannada, Malayalam, Marathi, Odia, Punjabi, Tamil, Telugu).
• OmniDocBench Notes handgeschreven tekstbewerkingsafstand — 0.9739 tot 0.3395 (lager is beter).

De omvang van deze delta's is de reden dat deze release ertoe doet, zelfs zonder aankondiging. Een verschuiving van 0.44→0.91 op een meertalige OCR-F1-score is geen kleine puntrelease; het ziet eruit als het meertalige werk dat normaal gesproken een lancering zou aanvoeren. Of de winsten standhouden bij onafhankelijke evaluatie is precies de vraag die het gebrek aan berichtgeving openlaat.
Wat de repo ons niet vertelt
Eerlijk zijn over de randen is het punt van een quiet-ship post. De repo bevestigt niet:
• Of 2.0 beschikbaar is (of zal zijn) als een NVIDIA NIM-microservice — v1.2 wordt aangeboden via NVIDIA's eigen NIM-API, de 2.0-modelkaart bevat geen NIM-tag en geen deployment-eindpunt, en op de repositorypagina staat dat het model "niet door een Inference Provider wordt ingezet."
• Prijzen, indien van toepassing — de gewichten brengen geen gebruiksvergoeding met zich mee, maar een gehoste optie is nog niet geprijsd of aangekondigd.
• Onafhankelijke benchmarks — er is nog geen Artificial Analysis-, LMArena- of OmniDocBench-vermelding voor 2.0, dus er is niets om de cijfers van de leverancier mee te vergelijken.
De roadmap — of 2.0 een tussenstap of een eindbestemming is, en of er een vervolg zoals 2.1 komt, is onbekend.
Het enige dat zeker is, is de licentie: het model valt onder de NVIDIA Open Model License, die commercieel en niet-commercieel gebruik toestaat, met de tokenizer onder CC-BY-4.0. Als je het in een product wilt gebruiken, is dat vakje aangevinkt.
Vandaag draaien we het.
Self-hosting is momenteel de enige optie, en daar komt wat frictie bij kijken die je moet kennen voordat je er je plan op baseert. Het model laadt in Hugging Face Transformers met trust_remote_code, en vLLM kan het serveren — maar alleen met een vLLM-build die ondersteuning voor Nemotron Parse remote-code bevat. Op A100/A10-klasse hardware raadt NVIDIA aan om de Triton attention backend te forceren, en je hebt vier extra afhankelijkheden nodig: albumentations, timm, open_clip_torch en einops. Er is ook een eigenaardigheid met de gekoppelde output-head: 2.0 houdt de LM-head gekoppeld aan de decoder-embeddings, terwijl sommige vLLM-builds een aparte output-head materialiseren, tenzij je NVIDIA's meegeleverde runtime-patch aan PYTHONPATH toevoegt.
Twee serveerdetails uit het ecosysteem ronden dit af. Ten eerste maakt een vLLM-pull-request die nu openstaat (in review sinds begin augustus) speculatieve decodering mogelijk voor NVIDIA-Nemotron-Parse-2.0 door gebruik te maken van de hulpvoorspellingshead die is opgeslagen in de sidecar `auxiliary_prediction_heads.safetensors.extra` van de repo — de eigen documentatie van de modelkaart beschrijft dat bestand als niet gebruikt in standaardinferentie, dus deze PR is het eerste dat het daadwerkelijk consumeert. Op een H100 over de ParseBench-telling van 1.005 pagina's rapporteert de auteur mediane outputdoorvoerwinsten van ongeveer 45% bij concurrency 1, 41% bij concurrency 8 en 40% bij concurrency 32 ten opzichte van single-token-decodering — alle cijfers uit de PR, nog niet samengevoegd of onafhankelijk gereproduceerd. Ten tweede wijst een Dynamo-issue op een echte valkuil in de tokenizer van 2.0: deze wordt geleverd met een geserialiseerde `tokenizer.json` met ingebakken padding die elke encode opvult tot 9.000 tokens, waardoor een serving-stack die de opgevulde tokenizer laadt, een multimodale prompt van zes tokens kan opblazen tot 54.000 token-ID's. Als je zelf host, zorg er dan voor dat je serving-pad online-tokenisatie gebruikt in plaats van het opgevulde artefact te laden.

Waar het staat op de parsingmarkt van 2026
Nemotron Parse 2.0 betreedt een druk, snel bewegend veld. De huidige open-source koplopers op het gebied van documentparsing zijn MinerU 2.5-Pro (een 1.2B-model van Shanghai AI Lab) en PaddleOCR-VL (0.9B- en 7B-varianten), beide met samengestelde scores in de lage 90 op de OmniDocBench-leaderboard, plus GOT-OCR 2.0 van StepFun als de lichtgewicht 580M-optie; aan de API-kant is Mistral OCR het belangrijkste commerciële aanbod. Twee kanttekeningen voordat je 2.0 in die rangschikking probeert te plaatsen. De eerste is dat de cijfers niet vergelijkbaar zijn: Parse 2.0 rapporteert ParseBench, NVIDIA's eigen suite, terwijl de scores van het veld OmniDocBench-samenstellingen zijn — verschillende taken, verschillende weging, er bestaat nog geen eerlijke vergelijking. De tweede is dat je NVIDIA-Nemotron-Parse-2.0 niet moet verwarren met NVIDIA's afzonderlijke NVIDIA-Nemotron-OCR-v2-model, een dicht OCR-model op woordniveau dat is gebouwd voor NeMo Curator-pijplijnen. Parse 2.0 is de lay-out- en klassebewuste parser; OCR v2 is een extractor per woord. Het zijn complementaire tools, niet hetzelfde model.
Eerlijk gezegd is de pitch van Parse 2.0 niet "verslaat het veld op elke parsingmetriek." Het is een 0,9B, permissief gelicentieerde, layoutbewuste parser waarvan de modelkaart een zeer grote meertalige sprong ten opzichte van zijn eigen voorganger claimt — en wiens afstamming (v1.1 in november 2025, v1.2 in februari 2026, 2.0 in augustus 2026) laat zien dat NVIDIA ongeveer elk kwartaal een nieuwe parser uitbrengt. Voor teams die al gestandaardiseerd zijn op de Nemotron Parse-familie, is 2.0 een drop-in upgrade met dezelfde API-vorm en een veel sterker meertalig verhaal. Voor alle anderen is de vraag of de claims van het niet-aangekondigde model onafhankelijke tests overleven.
Waar een routinglaag past in een parsing-pijplijn
Een documentparsemodel is meestal één fase van een langere pijplijn, en de fasen eromheen zijn waar routing zijn bestaansrecht verdient. De gebruikelijke vorm is: Parse 2.0 zet een pagina om in gestructureerde chunks, waarna een LLM samenvat, vragen beantwoordt, entiteiten extraheert of het resultaat structureert voor een downstream-opslag. Die LLM-fase is waar een routingplatform de economie verandert. OrcaRouter zet 200+ modellen achter één API tegen de catalogusprijs van de provider — 0% opslag, dus een prijsverlaging van de leverancier verschijnt bij ons op dezelfde dag als die wordt aangekondigd — met automatische failover als een provider degradeert. Concreet betekent dat dat de parser vast kan blijven staan terwijl het model dat de uitvoer interpreteert, wordt gewisseld, vergeleken of via failover wordt omgeleid, zonder een tweede contract of een codewijziging. Als de parsefase het knelpunt is, wil je een model dat je kunt afstemmen en zelf hosten, en dat krijg je met Parse 2.0; als de interpretatiefase de variabele kosten vormt, dan is dat de fase die een router zou moeten beheren. We hosten Parse 2.0 zelf niet — het is een zelfgehost model, geen API — maar een parser die een LLM voedt, is precies de opzet waarbij één endpoint voor de LLM-laag zich terugverdient.

Kortom
NVIDIA-Nemotron-Parse-2.0 is een echte, complete, niet-aangekondigde release van 3 augustus 2026. De repo toont een 0,9B layoutbewuste parser waarvan de modelkaart zeer grote verbeteringen op het gebied van meertaligheid en handschrift ten opzichte van v1.2 claimt, uitgebracht onder een permissieve licentie met echte zelfhostingsfrictie eromheen. Geen van die cijfers is al onafhankelijk geverifieerd, en er is geen gehoste optie en geen prijsstelling. De juiste zet hangt af van je risicobereidheid: als je vandaag meertalige documenten parseert en het je om de meertalige metriek te doen is, is de geclaimde verschuiving van 0,44 naar 0,91 op MOSCAR groot genoeg om een weekendtest op je eigen corpus te rechtvaardigen — de delta's zijn van het soort dat zich ofwel laat reproduceren ofwel instort, en een stille release is de goedkoopste manier om erachter te komen welke. Als je een benchmark nodig hebt om aan te halen of een ondersteunde API om je productiepad op te baseren, wacht dan op een aankondiging of een onafhankelijke run. In de tussentijd is dit hoe een stille ship eruitziet, en het is de moeite waard om in de gaten te houden.
Veelgestelde vragen
Is NVIDIA-Nemotron-Parse-2.0 een lek of een echte release?
Geen van beide labels past echt goed. Het is geen lek in de zin van losse of gedeeltelijke gewichten — de repo is volledig samengesteld, met een gedetailleerde modelkaart, configuratiebestanden, een Dockerfile, een testsuite met gouden outputs en inferentiescripts voor zowel Transformers als vLLM. Maar het is ook geen lancering in de normale zin: NVIDIA heeft geen aankondiging gedaan, en de NIM-verpakking en het gehoste endpoint die bij eerdere Nemotron Parse-releases hoorden, ontbreken. De juiste beschrijving is een volledige release die de leverancier nog niet heeft gekozen te promoten — en daarom is het eerlijke label hier "stille lancering", en blijven de zaken die een aankondiging normaal gesproken zou vastleggen (prijzen, roadmap, gehoste beschikbaarheid) open vragen.
Hoe verhouden de leveranciersbenchmarks zich tot de OmniDocBench-cijfers die mensen voor andere parsers aanhalen?
Dat doen ze niet, direct. De cijfers op de kaart van NVIDIA-Nemotron-Parse-2.0 komen van ParseBench, NVIDIA's eigen benchmark die tekstgetrouwheid, semantische opmaak, tabellen, grafieken en visuele verankering dekt, plus MOSCAR, IndicVisionBench en een OmniDocBench-handschriftsubset — terwijl de belangrijkste scores in de markt (MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR) samengestelde OmniDocBench-scores zijn. Verschillende taken, verschillende metrieken; er bestaat nog geen gepubliceerde appels-met-appels-vergelijking. Het enige getal dat wél overlapt met het ecosysteem — het OmniDocBench Notes-handschriftcijfer — wordt gerapporteerd als een tekstbewerkingsafstand ten opzichte van v1.2, niet als een samengestelde score, dus het kan nog steeds niet tegen de andere worden gerangschikt. Totdat er een onafhankelijke run verschijnt, behandel de claims van Parse 2.0 als richtinggevend en ongeverifieerd.
Wat moet een team testen voordat het in productie wordt genomen?
Drie dingen. Ten eerste, je eigen meertalige corpus: de hele pitch van 2.0 is de meertalige sprong, en een stille release is precies de situatie waarin de geclaimde winsten zich op jouw data wel of niet reproduceren — draai de talen die je daadwerkelijk parseert voordat je de kaart gelooft. Ten tweede, de self-hosting stack: bevestig dat je vLLM-build remote-code-ondersteuning voor Nemotron Parse heeft, pas de tied-output-head-patch toe en verifieer dat je servingpad online tokenisatie doet in plaats van het opgevulde tokenizer.json-bestand te laden, dat een kort prompt tot 9.000 tokens kan uitbreiden. Ten derde, het verhaal over licenties en service: de gewichten zijn gratis onder de NVIDIA Open Model License, maar er is geen aangekondigde NIM, geen prijzen en geen supportcontract — dus plan rond self-hosting en routeer de LLM-fase stroomafwaarts door een laag waarmee je modellen kunt wisselen en failover kunt uitvoeren zonder herontwerp, en dat is precies waar een routingplatform voor is gebouwd.
