En titelskylt för 'Nemotron Parse 2.0 vs MinerU — den oannonserade utmanaren vs standardvalet med öppen källkod', med en dokumentsida-ikon till vänster och en lådikon för öppen källkod till höger.
Guides & Insights

Nemotron Parse 2.0 vs MinerU: Den oanmälda utmanaren vs standardvalet med öppen källkod

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

NVIDIA-Nemotron-Parse-2.0 och MinerU löser samma problem från motsatta håll. Båda tar en skannad eller renderad sida och returnerar ren, strukturerad markdown med tabeller, formler och läsordning intakt. Men MinerU är standardvalet inom open source – tiotusentals GitHub-stjärnor, en Apache-2.0-licens och ett värdbaserat API med en kostnadsfri daglig kvot, det trygga förstahandsval som de flesta dokumentteam tar till. Nemotron Parse 2.0 är raka motsatsen till etablerad: den dök upp på Hugging Face den 3 augusti 2026, NVIDIA har inte utfärdat något tillkännagivande för den, och dess modellkort innehåller en uppsättning benchmark-påståenden som skulle bli det största som hänt öppen dokumenttolkning i år om de håller. Denna kombination är medvetet skev – etablerad aktör mot outannonserad utmanare – och hela frågan är vad respektive sidas argument faktiskt är värt.

Vad varje sida faktiskt är

MinerU är ett komplett system för dokumenttolkning från {{1}}OpenDataLab{{/1}}, datagruppen bakom {{2}}Shanghai AI Laboratorys{{/2}} öppna utgivningar. Det nuvarande flaggskeppet är {{3}}MinerU 2.5-Pro{{/3}}, en {{4}}1.2B{{/4}} vision-språkmodell i punktversionslinjen {{5}}2604/2605{{/5}} ({{6}}2604{{/6}}-modellen släpptes i {{7}}april 2026{{/7}}, med en {{8}}2605{{/8}}-uppdatering efter den). Den bygger på en {{9}}tvåstegsmotor{{/9}} — grov global layoutanalys, därefter riktad igenkänning på utsnitt i nativ upplösning — och projektet kapslar in modellen i {{10}}PDF{{/10}}-, {{11}}DOCX{{/11}}-, {{12}}PPTX{{/12}}- och {{13}}XLSX{{/13}}-import, layoutdetektering, formel- och tabelligenkänning samt rekonstruktion av läsordning. Det är referensparsern med öppen källkod för {{14}}RAG{{/14}}-förbehandling, och communityn är beviset.

Nemotron Parse 2.0 är en vision-encoder-dekoder med 0,9B parametrar från NVIDIA i samma familj som NVIDIA-Nemotron-Parse-v1.2, som släpptes i februari 2026. Den använder en ViT-H-vision-encoder byggd på NVIDIAs C-RADIOv2-stomme och en tiolagers mBART-liknande avkodare. Inmatningssidor kan vara upp till 2048×1664, genereringen har ett tak på 9 000 tokens, och den producerar samma strukturerade utdata som MinerU: markdown eller ren text, plus tabeller i LaTeX, HTML, markdown, JSON, hierarkisk JSON eller CSV, med layoutklasser, bounding boxes och läsordning. Repot är komplett — konfigurationer, en Dockerfile, en testsvit med golden outputs — men NVIDIA har inte marknadsfört det, det finns ingen NIM-förpackning, och ingen inferensleverantör hostar det. Egen hosting är det enda alternativet idag.

Screenshot of the Hugging Face model card for NVIDIA-Nemotron-Parse-2.0, showing the nvidia-open-model-license, 0.9B model size, 2,156 downloads last month, and the note that the model isn't deployed by any inference provider.

Prisberättelsen: "gratis" betyder två olika saker

Den enskilt största praktiska skillnaden är att MinerU är gratis att anropa och Nemotron Parse 2.0 är bara gratis att köra. MinerU:s officiella API på mineru.net har en daglig gratiskvot — ungefär 1 000 sidor med hög prioritet per dag beroende på aktuell kampanj — utan avgift per anrop, och filer upp till 200 sidor vardera. Utöver kvoten blir jobb nedprioriterade snarare än fakturerade, och kommersiella värdtjänster prissätter den självhostade modellen runt en tiondels cent per sida. Om din pipeline behöver tusentals sidor om dagen och du inte vill drifta något själv, har MinerU en väg som kostar nästan ingenting.

Nemotron Parse 2.0 har ingen sådan väg. Vikterna är kostnadsfria under NVIDIA Open Model License, men modellkortet anger att den inte driftsätts av någon inferensleverantör, och NVIDIA har varken prissatt eller annonserat ett värdbaserat alternativ. Att använda modellen innebär att hyra eller äga en GPU, sätta upp Transformers eller en vLLM-installation med Nemotron Parse-fjärrkodstöd, samt hantera distributionsavvikelserna nedan. För ett projekt med liten volym är det en reell kostnad – en GPU är dramatiskt mycket dyrare än en gratis API-nivå vid några hundra sidor i månaden. För ett team som redan kör GPU-infrastruktur är fria vikter en genuin fördel; frågan är om det operativa merarbetet är värt vad modellen påstår sig tillföra.

Benchmarkgapet: dessa siffror möter inte varandra.

Detta är avsnittet där de flesta jämförelser tyst går fel, så låt oss vara tydliga. Nemotron Parse 2.0:s kort rapporterar fyra benchmarks: ParseBench totalt på 0.6391 (upp från v1.2:s 0.5782), MOSCAR flerspråkig OCR på 0.9102 BoC F1 (upp från 0.4410), IndicVisionBench på 0.7203 ANLS-character (upp från 0.0612), och en handskriftsdelmängd av OmniDocBench, mätt som textredigeringsavstånd, som förbättrats från 0.9739 till 0.3395. MinerU 2.5-Pro rapporterar en annan testsvit: en OmniDocBench v1.6 totalpoäng på 95.69 — state of the art, över mycket större modeller — plus 97.29 på tät formelparsning och ett textredigeringsavstånd på 0.036 på sina egna OmniDocBench-körningar.

De två modellerna delar namnet ”OmniDocBench”, vilket får dem att verka jämförbara, men mätvärdena är inte det. NVIDIA rapporterar en delmängd med enbart handskrift som redigeringsavstånd; OpenDataLab rapporterar ett sammanvägt totalresultat på en annan benchmarkversion. ParseBench är NVIDIAs egen testsvit och har ingen MinerU-post. MOSCAR och IndicVisionBench har ingen MinerU-post. Varje siffra på båda sidor är leverantörsrapporterad, och ingen av modellerna har en publicerad oberoende tredjepartskörning där den andra förekommer. Det innebär att det för närvarande inte finns någon äpplen-mot-äpplen-siffra som rankar Nemotron Parse 2.0 mot MinerU – den som säger att en modell ”vinner” benchmarkjämförelsen extrapolerar från olika tester. Vad man kan säga riktningsmässigt: MinerU:s påståenden är mogna och har överlevt ett års communityanvändning, medan Nemotron Parse 2.0:s påståenden är färska, oreviderade och – om dess MOSCAR- och IndicVision-hopp replikeras – en stor sak specifikt för flerspråkig parsning.

A comparison scoreboard for Nemotron Parse 2.0 and MinerU 2.5-Pro. Nemotron Parse 2.0: shipped Aug 3 2026 unannounced, 0.9B params, NVIDIA Open Model license, no hosted API, ParseBench 0.6391, MOSCAR 0.9102 F1. MinerU 2.5-Pro: shipped Apr 2026, 1.2B params, Apache 2.0, official API with free tier, OmniDocBench v1.6 95.69, 109 languages.

Där de skiljer sig åt på verkliga arbetsbelastningar

Screenshot of the Hugging Face model card for opendatalab/MinerU2.5-Pro-2604-1.2B, showing the Apache-2.0 license, the arXiv tech report 'MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale', and an 'unmatched SOTA Performance' banner.

Lägg riktmärkena åt sidan och de skillnader som framträder i en pipeline handlar om omfattning, latens och flerspråkig täckning.

• Inmatningsomfång — MinerU tar emot fullständiga PDF-filer upp till 200 sidor per fil via sitt API och sammanfogar tabeller över sidgränser; Nemotron Parse 2.0 tar emot en sidbild på upp till 2048×1664 per anrop, så ett dokument på 200 sidor innebär 200 anrop. Om din indata är en PDF är det en arbetsflödesskillnad innan någon fråga om noggrannhet ens uppstår.

• Serveringsmognad — MinerU levererar vLLM- och SGLang-backends med publicerad genomströmning (cirka 2 sidor per sekund på en enda A100 via sin asynkrona motor), en Docker-runner och ett värdbaserat API. Nemotron Parse 2.0:s serveringsläge är ungt och ojämnt: vLLM kräver stöd för remote-code och, på A100/A10-maskinvara, Triton-attention-backend; tokenizern levererar en serialiserad tokenizer.json med inbyggd padding till 9 000 tokens, vilket en serveringsstack stötte på i form av en sex-tokens-prompt som exploderade till 54 000 token-ID:n; och repot innehåller en körtidsfix för vLLM-byggen som inte stöder dess bundna utmatningshuvud. Inget av detta är oöverstigligt, men det är verklig friktion.

• Flerspråkighet — det är här Nemotron Parse 2.0:s starkaste trumf finns. 2.0-utgåvan utökade ordförrådet från cirka 52 000 till 72 000 token specifikt för flerspråkig OCR, och de påstådda vinsterna är koncentrerade till just detta: MOSCAR upp från 0,44 till 0,91 och IndicVisionBench (bengali, hindi, tamil och sju ytterligare indiska skript) upp från 0,06 till 0,72. MinerU stödjer 109 språk som en huvudfunktion, men dess bevis är OmniDocBench-sammansättningen, inte en uppdelning per skript. Om din korpus till stor del består av indiska eller lågresursskript, är Nemotron Parse 2.0:s siffror det mer intressanta påståendet att testa — de är också de minst oberoende verifierade.

Handskrift — den i särklass största förändringen på NVIDIA:s kort gäller handskrift: redigeringsavståndet på OmniDocBench-anteckningsdelmängden sjunker från 0.97 till 0.34. MinerU:s egna textredigeringsavstånd på 0.036 kommer från dess totala OmniDocBench-körningar, inte från handskriftsdelmängden, så siffrorna är inte heller här direkt jämförbara. Men handskrivna anteckningar är ett klassiskt felscenario för båda, och det är det enda område där Nemotron Parse 2.0:s påstådda förbättring är tillräckligt stor för att motivera ett direkt test på dina egna sidor.

Vem ska välja vilken

Välj MinerU om du vill ha en parser du kan anropa idag: en gratis daglig nivå, mogen serving, full-PDF-inmatning, en Apache-2.0-licens utan efterlevnadsgranskning och en gemenskap som är tillräckligt stor för att det redan finns svar på installationsfrågor. Det är standard av en anledning, och för de flesta RAG-förbehandlingsarbetsbelastningar är det det alternativ med lägre risk.

Välj Nemotron Parse 2.0 om du redan är bekväm med att självhosta modeller — särskilt om du befinner dig i NVIDIA NIM- eller NeMo-världen, eftersom v1.2 serveras som en NIM och 2.0 ser ut att vara dess efterträdare — och om flerspråkighet eller handskrift är det specifika som din korpus behöver. Ett helgtest på dina egna Indic- eller anteckningstunga sidor säger dig mer än någon benchmarktabell, eftersom påståendena antingen kommer att replikeras eller kollapsa under oberoende data. Planera bara inte en produktionsväg kring en oannonserad modell innan du har kört det testet och bekräftat att tokenizer- och serveringsegenheterna hanteras i din stack.

Varför parsern inte är den enda kostnaden i pipelinen

Vad du än väljer är parsern vanligtvis det billigaste steget i en dokumentpipeline när volymen blir verklig. Det dyra steget är LLM:en som omvandlar parsad markdown till sammanfattningar, strukturerade poster eller svar – och det är i det steget som ett routinglager förändrar ekonomin. OrcaRouter lägger 200+ modeller bakom ett API till leverantörens listpris utan påslag, så en prissänkning från en leverantör är aktiv samma dag som den tillkännages, och automatisk failover innebär att en försämrad leverantör inte stoppar hela extraktionsjobbet. Konkret: du kan testa Nemotron Parse 2.0:s handskriftspåståenden mot MinerU på din egen korpus utan att binda din nedströmsmodellstack till någon av parslarna, eftersom parserbytet och LLM-lagret är frikopplade. Vi är värd för ingen av parslarna idag – Nemotron Parse 2.0 är en självvärd modell och MinerU körs på sin egen tjänst – men ett routinglager på LLM-steget är precis det som hindrar parserbeslutet från att bli ett inlåsningsbeslut.

Slutsats

MinerU är det rationella standardvalet: mogen, gratis att anropa i liten skala, permissivt licenserad och beprövad i produktion. Nemotron Parse 2.0 är den intressanta satsningen: en 0.9B NVIDIA-modell som släpptes tyst för fem dagar sedan, och vars modellkort hävdar ett dramatiskt språng i flerspråkighet och handskrift, som ingen har verifierat oberoende. Om du parsar mestadels engelska tekniska dokument i stor volym är MinerU svaret och risken med Nemotron Parse 2.0 är inte värd det. Om du parsar indiska skriftsystem eller skriftsystem med låga resurser, eller handskrivna anteckningar, är påståendena tillräckligt stora – och vikterna tillräckligt fritt tillgängliga – för att det ska vara billigt att köra testet själv. Att NVIDIA släpper en ny parser ungefär varje kvartal (v1.1 i november 2025, v1.2 i februari 2026, 2.0 nu) tyder på att ett tillkännagivande kan komma snart; tills dess, betrakta 2.0:s siffror som vägledande och testa på din egen korpus.

Vanliga frågor

Är Nemotron Parse 2.0 tillgängligt via något API?

Inte via en värdtjänst. Hugging Face-kortet anger att modellen inte driftsätts av någon inferensleverantör, och NVIDIA har inte tillkännagett NIM-paketering eller prissättning för den, i början av augusti 2026. Det enda sättet att köra den är att själv hosta vikterna via Hugging Face Transformers med trust_remote_code, eller via en vLLM-bygge som inkluderar Nemotron Parse-stöd för fjärrkod. MinerU har däremot ett officiellt API med en kostnadsfri daglig sidkvot.

Vilken modell är bättre för RAG-förbehandling?

För typiska RAG-pipelines — engelska och CJK-tekniska dokument, tabeller och blandade layouter — är MinerU det säkrare, mer beprövade valet: det accepterar fullständiga PDF-filer, slår samman tabeller över sidgränser, har mogen serving och kostar ingenting i liten skala genom sin kostnadsfria nivå. Nemotron Parse 2.0 blir bara rätt val om din korpus är tung på indiska eller lågresursskript, handskrivna anteckningar eller diagramtunga sidor där dess påstådda vinster är koncentrerade — och även då, verifiera på dina egna dokument innan du förbinder dig.

Är benchmark-siffrorna på de två modellkorten direkt jämförbara?

Nej. Nemotron Parse 2.0 rapporterar ParseBench (NVIDIAs egen benchmarksvit), MOSCAR, IndicVisionBench och en OmniDocBench-delmängd för handskrift som redigeringsavstånd. MinerU 2.5-Pro rapporterar ett sammansatt totalresultat för OmniDocBench v1.6 samt mått för formler och textredigering. Det överlappande benchmarknamnet är inte samma mått, ingen oberoende körning placerar båda modellerna på samma test, och varje siffra på båda modellkorten är leverantörsrapporterad. Behandla dem som vägledande, inte direkt jämförbara.