Una scheda titolo per 'Nemotron Parse 2.0 vs MinerU — lo sfidante non annunciato vs il default open-source', con un'icona di pagina di documento a sinistra e un'icona di scatola open-source a destra.
Guides & Insights

Nemotron Parse 2.0 vs MinerU: Lo sfidante inatteso contro il default open-source

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

NVIDIA-Nemotron-Parse-2.0 e MinerU risolvono lo stesso problema da direzioni opposte. Entrambi prendono una pagina scansionata o renderizzata e restituiscono markdown pulito e strutturato, con tabelle, formule e ordine di lettura intatti. Ma MinerU è il default open-source — decine di migliaia di stelle su GitHub, licenza Apache-2.0 e un'API ospitata con una quota giornaliera gratuita: la prima scelta sicura a cui ricorre la maggior parte dei team che lavorano con i documenti. Nemotron Parse 2.0 è l'esatto opposto di una soluzione consolidata: è apparso su Hugging Face il 3 agosto 2026, NVIDIA non ha rilasciato alcun annuncio al riguardo, e la sua scheda del modello presenta una serie di affermazioni benchmark che, se si rivelassero vere, sarebbero la cosa più grande accaduta al parsing aperto dei documenti quest'anno. Questo accostamento è volutamente sbilanciato — incumbent contro sfidante non annunciato — e l'intera questione è quanto valga davvero la proposta di ciascuna parte.

Cosa sia realmente ogni lato

MinerU è un sistema completo di parsing dei documenti sviluppato da OpenDataLab, il gruppo dati dietro le release open del Laboratorio di Intelligenza Artificiale di Shanghai. Il modello di punta attuale è MinerU 2.5-Pro, un modello visione-linguaggio da 1.2B nella linea di point-release 2604/2605 (il modello 2604 è stato rilasciato ad aprile 2026, seguito da un aggiornamento 2605). Si basa su un motore a due fasi — analisi grossolana del layout globale, quindi riconoscimento mirato su ritagli a risoluzione nativa — e il progetto integra il modello nell'acquisizione di PDF, DOCX, PPTX e XLSX, nel rilevamento del layout, nel riconoscimento di formule e tabelle e nella ricostruzione dell'ordine di lettura. È il parser open-source di riferimento per la pre-elaborazione RAG, e ha la community a dimostrarlo.

NVIDIA ha rilasciato Nemotron Parse 2.0, un vision-encoder-decoder da 0,9 miliardi di parametri, nella stessa famiglia di NVIDIA-Nemotron-Parse-v1.2, uscito a febbraio 2026. Il modello utilizza un vision encoder ViT-H basato sul backbone C-RADIOv2 di NVIDIA e un decoder a dieci strati in stile mBART. Le pagine in ingresso possono arrivare fino a 2048×1664, la generazione raggiunge un limite massimo di 9.000 token e il sistema produce gli stessi output strutturati di MinerU: markdown o testo semplice, più tabelle in LaTeX, HTML, markdown, JSON, JSON gerarchico o CSV, con classi di layout, bounding box e ordine di lettura. Il repository è completo — configurazioni, un Dockerfile, una suite di test con output golden — ma NVIDIA non lo ha promosso, non esiste un packaging NIM e nessun provider di inferenza lo ospita. Il self-hosting è l'unica opzione oggi.

Screenshot of the Hugging Face model card for NVIDIA-Nemotron-Parse-2.0, showing the nvidia-open-model-license, 0.9B model size, 2,156 downloads last month, and the note that the model isn't deployed by any inference provider.

La storia dei prezzi: "gratis" significa due cose diverse

{{1}}La divergenza pratica più grande è che MinerU è gratuito da chiamare, mentre Nemotron Parse 2.0 è solo gratuito da eseguire.{{/1}} L'API ufficiale di MinerU su mineru.net prevede un livello gratuito giornaliero — circa 1.000 pagine ad alta priorità al giorno a seconda della promozione corrente — senza costi per chiamata al suo interno, e file fino a 200 pagine ciascuno. Oltre la quota, i job vengono de-prioritizzati anziché fatturati, e gli host commerciali prezzano il modello self-hosted a circa un decimo di centesimo per pagina. {{2}}Se la tua pipeline necessita di migliaia di pagine al giorno e non vuoi gestire nulla, MinerU ha un percorso che costa quasi nulla.{{/2}}

Nemotron Parse 2.0 non prevede un percorso del genere. I pesi sono gratuiti in base alla NVIDIA Open Model License, ma la scheda del modello indica che non è distribuito da alcun provider di inferenza e NVIDIA non ha definito un prezzo né annunciato un'opzione ospitata. Usarlo significa noleggiare o possedere una GPU, configurare Transformers o una build vLLM con supporto per il codice remoto di Nemotron Parse e gestire le peculiarità di distribuzione descritte di seguito. Per un progetto a basso volume, questo è un costo reale: una GPU è drasticamente più costosa di un piano API gratuito a poche centinaia di pagine al mese. Per un team che dispone già di infrastruttura GPU, la gratuità dei pesi è un autentico vantaggio; la questione è se il sovraccarico operativo valga ciò che il modello dichiara di aggiungere.

Il divario del benchmark: questi numeri non si fronteggiano

Questa è la sezione in cui la maggior parte dei confronti fallisce silenziosamente, quindi siamo espliciti. La scheda di Nemotron Parse 2.0 riporta quattro benchmark: ParseBench complessivo a 0.6391 (in aumento rispetto allo 0.5782 della v1.2), MOSCAR OCR multilingue a 0.9102 F1 BoC (in aumento rispetto allo 0.4410), IndicVisionBench a 0.7203 ANLS-carattere (in aumento rispetto allo 0.0612), e un sottoinsieme di scrittura a mano di OmniDocBench misurato come distanza di edit, migliorando da 0.9739 a 0.3395. MinerU 2.5-Pro riporta una suite diversa: un punteggio complessivo di 95.69 su OmniDocBench v1.6 — stato dell'arte, superiore a modelli molto più grandi — più 97.29 sull'analisi di formule dense e una distanza di edit di 0.036 nelle proprie esecuzioni OmniDocBench.

Le due suite condividono il nome "OmniDocBench", il che le fa sembrare confrontabili, ma poi le metriche non lo sono. NVIDIA riporta un sottoinsieme dedicato alla sola scrittura a mano come distanza di modifica; OpenDataLab riporta un punteggio composito complessivo su una versione diversa del benchmark. ParseBench è la suite proprietaria di NVIDIA e non ha alcuna voce MinerU. Nemmeno MOSCAR e IndicVisionBench hanno voci MinerU. Ogni numero da entrambe le parti è dichiarato dal venditore, e nessuno dei due modelli ha un benchmark indipendente pubblicato da terze parti in cui compaia anche l'altro. Questo significa che al momento non esiste una cifra alla pari che classifichi Nemotron Parse 2.0 rispetto a MinerU: chiunque vi dica che un modello "vince" il confronto sui benchmark sta estrapolando da test diversi. Quello che si può dire a livello indicativo: le affermazioni di MinerU sono mature e hanno retto a un anno di utilizzo da parte della comunità, mentre quelle di Nemotron Parse 2.0 sono fresche, non verificate e — se i suoi balzi su MOSCAR e IndicVision si replicassero — rappresenterebbero un risultato importante soprattutto per il parsing multilingue.

A comparison scoreboard for Nemotron Parse 2.0 and MinerU 2.5-Pro. Nemotron Parse 2.0: shipped Aug 3 2026 unannounced, 0.9B params, NVIDIA Open Model license, no hosted API, ParseBench 0.6391, MOSCAR 0.9102 F1. MinerU 2.5-Pro: shipped Apr 2026, 1.2B params, Apache 2.0, official API with free tier, OmniDocBench v1.6 95.69, 109 languages.

Dove divergono su carichi di lavoro reali

Screenshot of the Hugging Face model card for opendatalab/MinerU2.5-Pro-2604-1.2B, showing the Apache-2.0 license, the arXiv tech report 'MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale', and an 'unmatched SOTA Performance' banner.

Mettendo da parte i benchmark, le differenze che emergono in una pipeline riguardano l'ambito, la latenza e la copertura multilingue.

• Ambito di input — MinerU ingerisce PDF completi fino a 200 pagine per file tramite la sua API e unisce le tabelle su più pagine; Nemotron Parse 2.0 accetta un'immagine di pagina fino a 2048×1664 per chiamata, quindi un documento di 200 pagine richiede 200 richieste. Se il tuo input è un PDF, questa è una differenza di flusso di lavoro prima ancora di qualsiasi questione di accuratezza.

• Maturità del serving — MinerU fornisce backend vLLM e SGLang con throughput pubblicato (circa 2 pagine al secondo su una singola A100 tramite il suo motore asincrono), un runner Docker e un'API ospitata. La storia del serving di Nemotron Parse 2.0 è giovane e accidentata: vLLM richiede supporto per codice remoto e, su hardware A100/A10, il backend di attenzione Triton; il tokenizer include un tokenizer.json serializzato con padding integrato fino a 9.000 token, che uno stack di serving ha riscontrato come un prompt di sei token esploso in 54.000 ID di token; e il repository include una patch runtime per build vLLM che non supportano la sua output head legata. Niente di tutto ciò è insormontabile, ma è un attrito reale.

• Multilingue — è qui che Nemotron Parse 2.0 gioca la sua carta migliore. La versione 2.0 ha ampliato il vocabolario da circa 52.000 a 72.000 token specificamente per l'OCR multilingue, e i miglioramenti dichiarati si concentrano proprio lì: MOSCAR salito da 0,44 a 0,91, e IndicVisionBench (bengalese, hindi, tamil e altre sette scritture indiche) salito da 0,06 a 0,72. MinerU supporta 109 lingue come caratteristica di punta, ma la sua prova è il benchmark composito OmniDocBench, non una ripartizione per singola scrittura. Se il tuo corpus è ricco di scritture indiche o a basse risorse, i numeri di Nemotron Parse 2.0 sono l'affermazione più interessante da mettere alla prova — sono anche i meno verificati in modo indipendente.

• Scrittura a mano — il delta più grande sulla scheda di NVIDIA è la scrittura a mano: la distanza di editing sul sottoinsieme delle note di OmniDocBench scende da 0,97 a 0,34. La distanza di editing testuale di MinerU, pari a 0,036, riguarda le sue esecuzioni complessive su OmniDocBench, non il sottoinsieme della scrittura a mano, quindi ancora una volta i numeri non si confrontano direttamente. Ma le note scritte a mano sono una modalità di errore classica per entrambi, e questa è l'unica area in cui il miglioramento dichiarato di Nemotron Parse 2.0 è abbastanza grande da giustificare un test diretto sulle tue pagine.

Chi dovrebbe scegliere cosa

Scegli MinerU se vuoi un parser che puoi utilizzare oggi: un livello gratuito giornaliero, un serving maturo, input PDF completo, una licenza Apache-2.0 senza revisione di conformità, e una community abbastanza grande da avere già risposte alle domande di configurazione. È il default per un motivo, e per la maggior parte dei carichi di lavoro di pre-elaborazione RAG, è la scelta meno rischiosa.

Scegli Nemotron Parse 2.0 se hai già dimestichezza con l'hosting autonomo dei modelli — in particolare se sei nel mondo NVIDIA NIM o NeMo, dato che v1.2 è servito come NIM e 2.0 sembra essere il suo successore — e se la questione multilingue o della scrittura a mano è ciò di cui il tuo corpus ha specificamente bisogno. Un test nel fine settimana sulle tue pagine Indic o ricche di note ti dirà più di qualsiasi tabella di benchmark, perché le affermazioni o si replicheranno o crolleranno di fronte a dati indipendenti. Solo non pianificare un percorso di produzione basato su un modello non annunciato finché non hai eseguito quel test e confermato che le stranezze del tokenizer e del serving sono gestite nel tuo stack.

Perché il parser non è l'unico costo nella pipeline.

Qualunque cosa tu scelga, il parser è di solito la fase più economica in una pipeline di documenti quando il volume è reale. La fase costosa è l'LLM che trasforma il markdown parsato in riassunti, record strutturati o risposte — ed è in quella fase che un layer di routing cambia l'economia. OrcaRouter mette 200+ modelli dietro un'unica API al prezzo di listino del provider senza alcun ricarico, quindi un taglio di prezzo del fornitore è attivo lo stesso giorno in cui viene annunciato, e il failover automatico significa che un provider degradato non blocca l'intero lavoro di estrazione. Concretamente: puoi testare le capacità di riconoscimento della scrittura a mano dichiarate da Nemotron Parse 2.0 contro MinerU sul tuo corpus senza vincolare il tuo stack di modelli a valle a nessuno dei due parser, perché il cambio del parser e il layer LLM sono disaccoppiati. Oggi non ospitiamo nessuno dei due parser — Nemotron Parse 2.0 è un modello self-hosted e MinerU gira sul proprio servizio — ma un layer di routing sulla fase LLM è esattamente ciò che impedisce alla scelta del parser di diventare una decisione di lock-in.

Il risultato finale

MinerU è la scelta razionale predefinita: matura, gratuita da usare su piccola scala, con licenza permissiva e comprovata in produzione. Nemotron Parse 2.0 è la scommessa interessante: un modello NVIDIA da 0,9B rilasciato silenziosamente cinque giorni fa, la cui scheda tecnica dichiara un salto drammatico nel supporto multilingue e nella scrittura a mano che nessuno ha verificato in modo indipendente. Se analizzi principalmente documenti tecnici in inglese in grandi volumi, MinerU è la risposta e il rischio di Nemotron Parse 2.0 non vale la pena. Se invece analizzi scritture indiche o a basse risorse, o appunti scritti a mano, le affermazioni sono abbastanza grandi — e i pesi abbastanza gratuiti — da rendere economico eseguire il test da soli. Il fatto che NVIDIA rilasci un nuovo parser all'incirca ogni trimestre (v1.1 a novembre 2025, v1.2 a febbraio 2026, 2.0 ora) suggerisce che un annuncio potrebbe arrivare presto; finché non arriva, tratta i numeri della 2.0 come indicativi e testa sul tuo corpus.

Domande frequenti

Nemotron Parse 2.0 è disponibile tramite qualche API?

Non tramite uno ospitato. La scheda di Hugging Face afferma che il modello non è distribuito da alcun provider di inferenza e NVIDIA non ha annunciato packaging o prezzi NIM per esso, all'inizio di agosto 2026. L'unico modo per eseguirlo è auto-ospitare i pesi tramite Hugging Face Transformers con trust_remote_code, oppure tramite una build vLLM che includa il supporto remote-code di Nemotron Parse. MinerU, al contrario, ha un'API ufficiale con una quota gratuita di pagine giornaliere.

Quale modello è migliore per la preelaborazione RAG?

Per le pipeline RAG tipiche — documenti tecnici in inglese e CJK, tabelle e layout misti — MinerU è la scelta più sicura e più collaudata: accetta PDF completi, unisce le tabelle tra le pagine, ha un servizio maturo e non costa nulla su piccola scala grazie al suo livello gratuito. Nemotron Parse 2.0 diventa la scelta giusta solo se il tuo corpus è ricco di scritture indiche o a risorse limitate, note manoscritte o pagine ricche di grafici, dove si concentrano i suoi presunti vantaggi — e anche in quel caso, verifica sui tuoi documenti prima di impegnarti.

I numeri dei benchmark sulle due schede del modello sono direttamente confrontabili?

No. Nemotron Parse 2.0 riporta ParseBench (la suite proprietaria di NVIDIA), MOSCAR, IndicVisionBench e un sottoinsieme di scrittura manuale di OmniDocBench come distanza di edit. MinerU 2.5-Pro riporta un punteggio composito complessivo OmniDocBench v1.6 più metriche di formula e di modifica del testo. Il nome del benchmark sovrapposto non è la stessa metrica, nessuna esecuzione indipendente mette entrambi i modelli sullo stesso test, e ogni dato su entrambe le schede è riportato dal fornitore. Trattali come indicativi, non direttamente confrontabili.