Een titelkaart voor 'Nemotron Parse 2.0 vs MinerU — de onaangekondigde uitdager vs de open-source standaard', met een documentpagina-pictogram aan de linkerkant en een open-source doospictogram aan de rechterkant.
Guides & Insights

Nemotron Parse 2.0 vs MinerU: De onaangekondigde uitdager vs de open-source standaard

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

NVIDIA-Nemotron-Parse-2.0 en MinerU lossen hetzelfde probleem op vanuit tegenovergestelde richtingen. Beide nemen een gescande of gerenderde pagina en leveren schone, gestructureerde markdown op met tabellen, formules en leesvolgorde intact. Maar MinerU is de open-source standaard — tienduizenden GitHub-sterren, een Apache-2.0-licentie en een gehoste API met een gratis dagelijkse quota, de veilige eerste keuze waar de meeste documentteams naar grijpen. Nemotron Parse 2.0 is het tegenovergestelde van gevestigd: het verscheen op 3 augustus 2026 op Hugging Face, NVIDIA heeft er geen aankondiging voor uitgegeven, en de modelkaart bevat een reeks benchmarkclaims die het grootste zouden zijn wat open documentparsing dit jaar zou overkomen als ze standhouden. Deze combinatie is opzettelijk scheef — gevestigde speler versus onaangekondigde uitdager — en de hele vraag is wat de pitch van elke kant daadwerkelijk waard is.

Wat elke kant eigenlijk is

MinerU is een compleet documentparsesysteem van OpenDataLab, de datagroep achter de open releases van het Shanghai AI Laboratory. Het huidige vlaggenschip is MinerU 2.5-Pro, een vision-taalmodel van 1,2 miljard parameters in de 2604/2605-pointrelease-lijn (het 2604-model verscheen in april 2026, met daarna een 2605-verversing). Het draait bovenop een tweetrapsengine — grove globale lay-outanalyse, gevolgd door gerichte herkenning op crops met native resolutie — en het project verpakt het model in PDF-, DOCX-, PPTX- en XLSX-invoer, lay-outdetectie, formule- en tabelherkenning, en reconstructie van leesvolgorde. Het is de referentie-open-sourceparser voor RAG-voorverwerking en heeft de community om dat te bewijzen.

Nemotron Parse 2.0 is een 0,9B vision-encoder-decoder van NVIDIA, uit dezelfde familie als NVIDIA-Nemotron-Parse-v1.2, die in februari 2026 is uitgebracht. Het gebruikt een ViT-H vision-encoder op basis van NVIDIA's C-RADIOv2-backbone en een tienlaagse decoder in mBART-stijl. Invoerpagina's kunnen maximaal 2048×1664 zijn, de generatie loopt tot een maximum van 9.000 tokens, en het levert dezelfde gestructureerde uitvoer als MinerU: markdown of platte tekst, plus tabellen in LaTeX, HTML, markdown, JSON, hiërarchisch JSON of CSV, met layoutklassen, bounding boxes en leesvolgorde. De repository is compleet — configuraties, een Dockerfile, een testsuite met gouden outputs — maar NVIDIA heeft het niet gepromoot, er is geen NIM-packaging en geen enkele inferentieprovider host het. Zelf hosten is op dit moment de enige optie.

Screenshot of the Hugging Face model card for NVIDIA-Nemotron-Parse-2.0, showing the nvidia-open-model-license, 0.9B model size, 2,156 downloads last month, and the note that the model isn't deployed by any inference provider.

Het prijsverhaal: "gratis" betekent twee verschillende dingen.

Het grootste praktische verschil is dat MinerU gratis aan te roepen is en Nemotron Parse 2.0 alleen gratis te draaien is. De officiële API van MinerU op mineru.net biedt een dagelijkse gratis laag — ongeveer 1.000 pagina's met hoge prioriteit per dag, afhankelijk van de huidige promotie — zonder kosten per aanroep, en bestanden tot 200 pagina's per stuk. Boven het quotum worden taken gedeprioriteerd in plaats van in rekening gebracht, en commerciële hosts bieden het zelf-gehoste model aan voor ongeveer een tiende van een cent per pagina. Als je pijplijn duizenden pagina's per dag nodig heeft en je niets wilt beheren, biedt MinerU een route die vrijwel niets kost.

Nemotron Parse 2.0 kent dat pad niet. De gewichten zijn gratis onder de NVIDIA Open Model License, maar de modelcard vermeldt dat het model door geen enkele inference-provider wordt aangeboden, en NVIDIA heeft geen prijs vastgesteld of een gehoste optie aangekondigd. Het gebruiken ervan betekent het huren of bezitten van een GPU, het opzetten van Transformers of een vLLM-build met Nemotron Parse remote-code-ondersteuning, en het omgaan met de onderstaande implementatie-eigenaardigheden. Voor een project met een klein volume is dat een reële kostenpost — een GPU is aanzienlijk duurder dan een gratis API-laag bij een paar honderd pagina's per maand. Voor een team dat al GPU-infrastructuur draait, is het feit dat de gewichten gratis zijn een echt voordeel; de vraag is of de operationele overhead opweegt tegen wat het model beweert toe te voegen.

De benchmarkkloof: deze cijfers staan niet tegenover elkaar.

Dit is het gedeelte waar de meeste vergelijkingen stilletjes de fout in gaan, dus laten we expliciet zijn. De kaart van Nemotron Parse 2.0 rapporteert vier benchmarks: ParseBench algemeen op 0.6391 (gestegen van 0.5782 van v1.2), MOSCAR meertalige OCR op 0.9102 BoC F1 (gestegen van 0.4410), IndicVisionBench op 0.7203 ANLS-teken (gestegen van 0.0612), en een OmniDocBench-handschriftsubset gemeten als tekstbewerkingsafstand die verbetert van 0.9739 naar 0.3395. MinerU 2.5-Pro rapporteert een andere suite: een algemene OmniDocBench v1.6-score van 95.69 — state of the art, boven veel grotere modellen — plus 97.29 op het parseren van dichte formules en een tekstbewerkingsafstand van 0.036 op de eigen OmniDocBench-runs.

De twee modellen delen de naam 'OmniDocBench', waardoor ze vergelijkbaar lijken, maar de metrieken zijn dat niet. NVIDIA rapporteert een subset met uitsluitend handschrift als bewerkingsafstand; OpenDataLab rapporteert een algemene samengestelde score op een andere benchmarkversie. ParseBench is NVIDIA's eigen suite en bevat geen MinerU-vermelding. MOSCAR en IndicVisionBench hebben geen MinerU-vermelding. Elk getal aan beide kanten is door de leverancier gerapporteerd, en van geen van beide modellen is er een onafhankelijke run door een derde partij gepubliceerd waarin het andere model voorkomt. Dat betekent dat er momenteel geen appels-met-appels-cijfer bestaat dat Nemotron Parse 2.0 tegen MinerU afzet — iedereen die je vertelt dat het ene model de benchmarkvergelijking 'wint', extrapoleert uit verschillende tests. Wat je in grote lijnen wel kunt zeggen: de claims van MinerU zijn volwassen en hebben een jaar gebruik door de community overleefd, terwijl de claims van Nemotron Parse 2.0 nieuw en niet gecontroleerd zijn en — als zijn sprongen op MOSCAR en IndicVision zich herhalen — van groot belang zijn, met name voor meertalig parsen.

A comparison scoreboard for Nemotron Parse 2.0 and MinerU 2.5-Pro. Nemotron Parse 2.0: shipped Aug 3 2026 unannounced, 0.9B params, NVIDIA Open Model license, no hosted API, ParseBench 0.6391, MOSCAR 0.9102 F1. MinerU 2.5-Pro: shipped Apr 2026, 1.2B params, Apache 2.0, official API with free tier, OmniDocBench v1.6 95.69, 109 languages.

Waar ze verschillen bij echte workloads

Screenshot of the Hugging Face model card for opendatalab/MinerU2.5-Pro-2604-1.2B, showing the Apache-2.0 license, the arXiv tech report 'MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale', and an 'unmatched SOTA Performance' banner.

Zet de benchmarks opzij en de verschillen die in een pipeline naar voren komen, gaan over omvang, latentie en meertalige dekking.

Inputomvang — MinerU verwerkt volledige PDF's tot 200 pagina's per bestand via zijn API en voegt tabellen over pagina's samen; Nemotron Parse 2.0 neemt per aanroep een pagina-afbeelding tot 2048×1664, dus een document van 200 pagina's betekent 200 verzoeken. Als uw invoer een PDF is, is dat een workflowverschil voordat we het over nauwkeurigheid hebben.

Serverrijpheid — MinerU levert vLLM- en SGLang-backends met gepubliceerde doorvoer (ongeveer 2 pagina's per seconde op een enkele A100 via zijn asynchrone engine), een Docker-runner en een gehoste API. Het serververhaal van Nemotron Parse 2.0 is jong en hobbelig: vLLM heeft ondersteuning voor remote-code nodig en, op A100/A10-hardware, de Triton attention-backend; de tokenizer wordt geleverd met een geserialiseerde tokenizer.json met ingebakken padding tot 9.000 tokens, wat een serverstack tegenkwam als een prompt van zes tokens die explodeerde naar 54.000 token-ID's; en de repository bevat een runtime-patch voor vLLM-builds die de gebonden uitvoerkop niet ondersteunen. Niets hiervan is onoverkomelijk, maar het is echte wrijving.

• Multilingual — dit is waar de troefkaart van Nemotron Parse 2.0 het meest in het oog springt. De 2.0-release breidde de woordenschat uit van ongeveer 52.000 naar 72.000 tokens, specifiek voor meertalige OCR, en de geclaimde winsten zijn daar geconcentreerd: MOSCAR steeg van 0,44 naar 0,91, en IndicVisionBench (Bengaals, Hindi, Tamil en zeven andere Indiase schriften) steeg van 0,06 naar 0,72. MinerU ondersteunt 109 talen als hoofdkenmerk, maar het bewijs daarvan is de samengestelde OmniDocBench-score, niet een uitsplitsing per schrift. Als je corpus veel Indiase of laag-resource schriften bevat, zijn de cijfers van Nemotron Parse 2.0 de interessantere claim om te testen — ze zijn ook het minst onafhankelijk geverifieerd.

• Handschrift — de grootste afwijking op NVIDIA's kaart is handschrift: de bewerkingsafstand op de OmniDocBench-notitiesubset daalt van 0,97 naar 0,34. MinerU's eigen 0,036 tekstbewerkingsafstand betreft de totale OmniDocBench-runs, niet de handgeschreven subset, dus opnieuw staan de cijfers niet tegenover elkaar. Maar handgeschreven notities zijn een klassiek faalgeval voor beide, en dit is het enige gebied waar de geclaimde verbetering van Nemotron Parse 2.0 groot genoeg is om een directe test op je eigen pagina's te rechtvaardigen.

Wie moet welke kiezen

Kies MinerU als je een parser wilt die je vandaag nog kunt aanroepen: een gratis dagelijkse laag, volwassen serving, volledige PDF-invoer, een Apache-2.0-licentie zonder compliancebeoordeling, en een community die groot genoeg is dat antwoorden op installatievragen al bestaan. Het is standaard om een reden, en voor de meeste RAG-voorverwerkingsworkloads is het de keuze met het laagste risico.

Kies Nemotron Parse 2.0 als je al vertrouwd bent met het zelf hosten van modellen — vooral als je thuishoort in de NVIDIA NIM- of NeMo-wereld, want v1.2 wordt als NIM aangeboden en 2.0 lijkt de opvolger daarvan — en als meertaligheid of handschrift het specifieke aspect is waar je corpus behoefte aan heeft. Een weekendtest op je eigen Indic- of notitie-intensieve pagina's vertelt je meer dan welke benchmarktabel dan ook, want de beweringen zul je ofwel bevestigd zien ofwel zien instorten onder onafhankelijke data. Plan alleen geen productietraject rond een onaangekondigd model voordat je die test hebt uitgevoerd en hebt bevestigd dat de tokenizer en eventuele serveringspecifieke eigenaardigheden in je stack zijn afgehandeld.

Waarom de parser niet de enige kostenpost in de pipeline is

Wat je ook kiest, de parser is doorgaans de goedkoopste schakel in een documentpijplijn zodra het volume reëel is. De dure schakel is de LLM die geparseerde markdown omzet in samenvattingen, gestructureerde records of antwoorden — en dat is precies de schakel waar een routinglaag de kostenstructuur verandert. OrcaRouter plaatst 200+ modellen achter één API tegen de lijstprijs van de provider zonder opslag, dus een prijsverlaging van een leverancier is dezelfde dag dat hij wordt aangekondigd live, en automatische failover betekent dat één verslechterde provider niet de hele extractietaak laat stagneren. Concreet: je kunt de handschriftclaims van Nemotron Parse 2.0 tegen MinerU testen op je eigen corpus zonder je stroomafwaartse modelstack aan een van beide parsers te committeren, omdat de parserwissel en de LLM-laag ontkoppeld zijn. We hosten vandaag geen van beide parsers — Nemotron Parse 2.0 is een self-hosted model en MinerU draait op zijn eigen service — maar een routinglaag op de LLM-fase is precies wat de parserkeuze geen lock-in-beslissing laat worden.

Kortom

{{1}}MinerU is de rationele standaardkeuze: volwassen, gratis aan te roepen op kleine schaal, permissief gelicentieerd en bewezen in productie.{{/1}} {{2}}Nemotron Parse 2.0 is de interessante gok: een 0,9B NVIDIA-model dat vijf dagen geleden stilletjes is uitgebracht en waarvan de modelkaart een dramatische sprong in meertaligheid en handschrift claimt die niemand onafhankelijk heeft geverifieerd.{{/2}} {{3}}Als je voornamelijk Engelse technische documenten op grote schaal parset, is MinerU het antwoord en is het risico van Nemotron Parse 2.0 het niet waard.{{/3}} {{4}}Als je Indiase of low-resource-schriften, of handgeschreven notities parset, zijn de claims groot genoeg — en de weights gratis genoeg — om de test zelf goedkoop uit te voeren.{{/4}} {{5}}Dat NVIDIA ongeveer elk kwartaal een nieuwe parser uitbrengt (v1.1 in november 2025, v1.2 in februari 2026, 2.0 nu) suggereert dat er binnenkort een aankondiging kan verschijnen; tot die tijd moet je de cijfers van 2.0 als richtinggevend beschouwen en op je eigen corpus testen.{{/5}}

Veelgestelde vragen

Is Nemotron Parse 2.0 beschikbaar via een API?

Niet via een gehoste. Op de Hugging Face-pagina staat dat het model niet wordt ingezet door een inferentieprovider, en NVIDIA heeft per begin augustus 2026 nog geen NIM-pakket of prijzen aangekondigd. De enige manier om het te draaien is door de gewichten zelf te hosten via Hugging Face Transformers met trust_remote_code, of via een vLLM-build met ondersteuning voor de remote-code van Nemotron Parse. MinerU heeft daarentegen een officiële API met een gratis dagelijkse paginaquotum.

Welk model is beter voor RAG-voorbewerking?

{{1}}Voor typische RAG-pijplijnen — Engelstalige en CJK-technische documenten, tabellen en gemengde indelingen —{{/1}} {{2}}is MinerU de veiligere, meer bewezen keuze:{{/2}} {{3}}het accepteert volledige pdf's, voegt tabellen over paginagrenzen heen samen, heeft volwassen serving en kost op kleine schaal niets via de gratis laag.{{/3}} {{4}}Nemotron Parse 2.0 wordt pas de juiste keuze als je corpus veel Indiase of laag-resource schriften, handgeschreven notities of grafiekrijke pagina's bevat, waar de geclaimde verbeteringen geconcentreerd zijn — en zelfs dan moet je eerst op je eigen documenten verifiëren voordat je je vastlegt.{{/4}}

Zijn de benchmarkcijfers op de twee modelkaarten rechtstreeks vergelijkbaar?

Nee. Nemotron Parse 2.0 rapporteert ParseBench (NVIDIA's eigen suite), MOSCAR, IndicVisionBench en een OmniDocBench-handschriftsubset als bewerkingsafstand (edit distance). MinerU 2.5-Pro rapporteert een OmniDocBench v1.6 totale samengestelde score plus formule- en tekstbewerkingsmetrieken. De overlappende benchmarknaam is niet dezelfde metriek; er is geen onafhankelijke run die beide modellen op dezelfde test zet, en elk cijfer op beide kaarten is door de leverancier gerapporteerd. Behandel ze als richtinggevend, niet direct vergelijkbaar.