
Nemotron Parse 2.0 vs olmOCR: Due lavori, entrambi chiamati parsing
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il 3 agosto 2026, NVIDIA ha pubblicato un nuovo modello di parsing di documenti su Hugging Face senza dirlo a nessuno. NVIDIA-Nemotron-Parse-2.0 è un vision-encoder-decoder da 0.9B la cui scheda del modello dichiara un salto multilingue e consapevole dei grafici rispetto al suo predecessore di febbraio 2026, ed è arrivato nello stesso angolo dell'ecosistema di olmOCR — più precisamente olmOCR-2-7B-1025, il linearizzatore da 7B dell'Allen Institute for AI che è diventato silenziosamente il modo predefinito per trasformare i PDF in dati di addestramento per LLM. Definire questo un testa a testa è la trappola: entrambi i modelli vengono descritti come "parsing di documenti", ma restituiscono artefatti diversi, alimentano pipeline diverse, e i loro punteggi di benchmark non si confrontano mai realmente. La vera domanda è quale dei due compiti assumi un parser per svolgere.
I due manufatti
Nemotron Parse 2.0 è un motore di semantica del layout. Dategli un'immagine di pagina e un prompt di attività e restituisce il testo più uno strato semantico sovrapposto: una classe di layout per ogni regione (titolo, sezione, didascalia, tabella, grafico, intestazione, piè di pagina, nota a piè di pagina, voce bibliografica), un bounding box per ciascuna e l'ordine di lettura tra di esse — con markdown come una serializzazione opzionale sovrapposta. olmOCR 2 è un linearizzatore. Prende la stessa pagina e restituisce markdown pulito e linearizzato con un breve frontmatter YAML che registra i metadati a livello di pagina, come la lingua primaria, la correzione della rotazione e se la pagina è una tabella o un diagramma. Niente box, niente classi, niente geometria: una sola passata, testo nell'ordine del documento.
L'artefatto determina il lavoro. {{2}}Se la tua pipeline deve ricondurre un fatto a una regione della pagina, evidenziare una tabella in una scansione o estrarre la semantica di layout per l'intelligenza documentale, ti serve la geometria — questo è lo spazio di output di Nemotron Parse 2.0.{{/2}} {{3}}Se stai costruendo dati di training o alimentando un LLM testuale che consuma solo token, la geometria è rumore e il markdown linearizzato è esattamente ciò che serve — questo è l'intero design di olmOCR.{{/3}} {{4}}Puoi aggiungere il rilevamento del layout all'output di olmOCR con un rilevatore separato, e puoi scartare i riquadri di Nemotron Parse 2.0 tenendo solo il markdown, ma ogni modello è costruito per rendere nativo uno di questi compiti.{{/4}}
La nave silenziosa: cosa mostra il repo, cosa non è confermato
NVIDIA-Nemotron-Parse-2.0 è apparso su Hugging Face il 3 agosto 2026 senza annuncio, senza post sul blog e senza packaging NIM. L'unica cosa conoscibile è il repository. È un vision-encoder-decoder da 0,9B: un encoder di immagini ViT-H basato sul backbone C-RADIO di NVIDIA, un adattatore leggero a convoluzione 1D e un decoder in stile mBART a dieci strati. Il tokenizer è cresciuto di circa 20.000 voci, per un totale di circa 72.000, esplicitamente per un supporto multilingue più efficiente, e la scheda elenca il parsing consapevole dei grafici come funzionalità di punta tramite un nuovo token class_Chart, oltre a una famiglia di serializzazioni di tabelle (LaTeX, HTML, markdown, JSON, JSON gerarchico, CSV). Sono inclusi due processori di logits opzionali: uno che interrompe l'output strutturato ripetitivo e uno che impone una struttura tabellare a un ritaglio di tabella. La risoluzione di input consigliata va da circa 1024×1280 fino a 1664×2048, la generazione arriva a un tetto di 9.000 token e la scheda del modello elenca Transformers, vLLM, SGLang e Docker Model Runner come runtime su hardware Ampere, Hopper, Blackwell e Turing.
Le affermazioni, tuttavia, sono tutte di NVIDIA, e nessuna è stata riprodotta in modo indipendente. La scheda riporta un punteggio complessivo ParseBench di 0,6391 (in aumento rispetto allo 0,5782 della v1.2), un OCR multilingue MOSCAR con BoC-F1 a 0,9102 (in aumento rispetto a 0,4410), IndicVisionBench a 0,7203 ANLS-character (in aumento rispetto a 0,0612) e un sottoinsieme OmniDocBench per la scrittura a mano che migliora da 0,9739 a 0,3395 sulla distanza di modifica del testo. Questi sono i salti più grandi, e sono anche i meno verificati: ParseBench è la suite proprietaria di NVIDIA e nessuna terza parte ha ancora eseguito Parse 2.0 su un corpus indipendente. Ciò che non è confermato va oltre i punteggi: non c'è inferenza ospitata (la scheda afferma che il modello non è distribuito da alcun provider di inferenza), nessun prezzo e nessuna tempistica annunciata per nessuno dei due.

olmOCR 2: il punto di riferimento che tutti già usano come metro di paragone
olmOCR è il modello che ha inventato il benchmark su cui questa categoria ora discute. olmOCR-2-7B-1025, rilasciato il 22 ottobre 2025, è un modello visione-linguaggio da 7B affinato a partire da Qwen2.5-VL-7B-Instruct sul corpus olmOCR-mix-1025 di 270.000 pagine, poi rifinito con apprendimento per rinforzo GRPO su ricompense automatizzate di "unit test" — controlli deterministici che una tabella mantenesse la propria struttura, che una formula fosse trascritta esattamente, che l'ordine di lettura fosse preservato. Questa impostazione basata su unit test è diventata olmOCR-Bench, con circa 1.400 PDF e più di 7.000 controlli, ed è diventata il benchmark industriale de facto: Marker, MinerU e una dozzina di modelli OCR commerciali ora pubblicano i propri risultati su di esso. olmOCR 2 stesso ottiene un punteggio complessivo di 82,4, circa quattro punti in più rispetto alla versione precedente e superiore ai valori di Marker (76,1) e MinerU (75,8) che AI2 cita nella stessa pagina.
olmOCR è anche l'opzione matura in questa coppia. È sotto licenza Apache-2.0, i suoi pesi sono stati scaricati circa 218.000 volte nell'ultimo mese, e il toolkit olmOCR gestisce rendering, rotazione e nuovi tentativi su larga scala su un backend vLLM — la stima batch di AI2 colloca la pipeline intorno a 176–190 dollari per milione di pagine su GPU a noleggio, e la build FP8 elabora circa 3.400 token di output al secondo su una singola H100, tanto veloce che il post di rilascio cita «10.000 pagine per meno di 2 dollari». Il compromesso è la lingua: olmOCR è esplicitamente costruito e benchmarkato per la stampa digitalizzata in inglese, e la sua scheda del modello lo etichetta come inglese. L'intera proposta di Nemotron Parse 2.0 è l'opposto — i suoi guadagni dichiarati si concentrano sulle scritture CJK e indiche.

Sei righe dove il compromesso si vede
Entrambi i modelli sono open-weight, entrambi girano su Transformers, vLLM o SGLang, ed entrambi sono self-hosted oggi. Sugli aspetti che contano per scegliere tra loro:
• Dimensione — Nemotron Parse 2.0 è 0,9B; olmOCR 2 è 7B. Circa otto volte i parametri, circa otto volte il minimo di VRAM.
• Output — Nemotron Parse 2.0 restituisce testo, classi di layout, bounding box, ordine di lettura e markdown; olmOCR 2 restituisce markdown linearizzato con un blocco di metadati YAML.
• Multilingue — Nemotron Parse 2.0 dichiara un forte supporto per le lingue CJK e indiane (MOSCAR 0.9102, IndicVisionBench 0.7203, secondo quanto dichiarato dal fornitore); olmOCR 2 è incentrato principalmente sull'inglese.
• Punteggio di punta — Nemotron Parse 2.0 riporta ParseBench 0,6391 (proprietario di NVIDIA, non verificato); olmOCR 2 totalizza 82,4 su olmOCR-Bench (proprietario di AI2, dieci mesi di riutilizzo da parte della comunità).
• Licenza — Nemotron Parse 2.0 è rilasciato sotto la NVIDIA Open Model License; olmOCR 2 è Apache-2.0.
• Rilasciato — Nemotron Parse 2.0 è arrivato il 3 agosto 2026, senza annuncio; olmOCR 2 è stato rilasciato il 22 ottobre 2025, con un post di lancio.

Tre punti in cui la decisione morde davvero
Scala e latenza. Un decoder da 0.9B è drasticamente più economico da servire rispetto a un VLM da 7B: una GPU più piccola, meno VRAM, più pagine al secondo sullo stesso hardware e un costo per pagina inferiore una volta che paghi per il tempo GPU. Se disponi già di infrastruttura GPU e il tuo corpus è ampio, questa è una differenza mensile concreta. I numeri di olmOCR mostrano quanto veloce possa essere un modello da 7B con quantizzazione FP8 — ma per raggiungerli serve comunque una GPU di classe H100; il requisito hardware minimo di Nemotron Parse 2.0 è una scheda dell'era Ampere.
Multilingue. Questa è la riga più asimmetrica. Nemotron Parse 2.0 ha ampliato il suo tokenizer di circa 20.000 voci specificamente per l'OCR multilingue, e i guadagni dichiarati nella sua scheda sono concentrati nelle scritture indiche e nel CJK. olmOCR 2 non fa una simile affermazione — la sua etichetta linguistica è inglese. Se il tuo corpus è in hindi, tamil, bengalese, giapponese o a scrittura mista, i numeri di Nemotron Parse 2.0 sono quelli che vale la pena testare, proprio perché riportati dal fornitore e recenti.
La realtà del serving. olmOCR 2 ha dieci mesi e la sua toolchain è noiosa nel senso buono. Nemotron Parse 2.0 ha cinque giorni e la sua storia di serving è visibilmente acerba: vLLM richiede una build con supporto per codice remoto di Nemotron Parse, la testa di output vincolata fa inciampare alcune build di vLLM 0.20 (il repository include una patch runtime), e il tokenizer.json trasporta padding serializzato fino a 9.000 token — uno stack di serving ha visto un prompt di sei token espandersi a 54.000 token ID prima della patch. Niente di tutto ciò è fatale, ma è esattamente il tipo di attrito che metti in conto con un modello nuovo.
Scegline uno per la tua pipeline.
Scegli olmOCR 2 se stai creando dati di addestramento per LLM o una pipeline di estrazione di testo ad alto volume su documenti in inglese. Ottieni un toolkit maturo, una licenza Apache-2.0, il benchmark rispetto al quale l'industria ora si misura e un percorso batch ben collaudato. Il suo limite riconosciuto è la copertura linguistica.
Scegli Nemotron Parse 2.0 {{1}}se il tuo pipeline necessita di geometria — classi di layout, bounding box e ordine di lettura per grounded retrieval o document intelligence{{/1}} — {{2}}o se il tuo corpus è ricco di pagine Indic, CJK o manoscritte{{/2}}, {{3}}dove risiedono i suoi vantaggi dichiarati{{/3}}. {{4}}La dimensione da 0,9B rende economico un test in un fine settimana{{/4}} {{5}}anche se non sei sicuro{{/5}}. {{6}}La sua modalità di fallimento accettata è che ogni numero sulla scheda è di NVIDIA{{/6}} {{7}}e potrebbe variare in una valutazione indipendente{{/7}}.
Se il tuo input è costituito principalmente da PDF nati digitali in inglese e tutto ciò di cui hai bisogno è markdown pulito, {{1}}olmOCR 2{{/1}} è l'opzione predefinita a minor rischio. Se stai già effettuando self-hosting e il caso d'uso {{2}}multilingue o basato sul layout{{/2}} è reale, {{1}}Nemotron Parse 2.0{{/1}} è la scommessa più interessante — testalo sulle tue pagine prima di impegnarti.
Evita che la scelta del parser diventi un lock-in.
Una pipeline di documenti prevede una fase di parsing e poi una fase LLM, e il parser di solito è la fase più economica quando il volume diventa reale — l'LLM che trasforma il markdown parsato in riassunti, record strutturati o risposte è dove i costi crescono. È quella la fase che un livello di routing modifica. OrcaRouter mette più di 200 modelli dietro un'unica API al prezzo di listino del fornitore senza ricarichi, quindi un taglio di prezzo da parte del fornitore è attivo lo stesso giorno, e il failover automatico impedisce a un fornitore degradato di bloccare un processo batch. Nessuno dei parser in questo confronto è nel nostro catalogo — entrambe le schede dei modelli dichiarano che non sono distribuiti da alcun provider di inferenza, quindi questa è una decisione di self-host — ma il motivo per mantenere il parser disaccoppiato dal tuo stack di modelli è esattamente ciò che il routing garantisce a valle: sostituire Nemotron Parse 2.0 con olmOCR 2, o viceversa, senza toccare una singola integrazione, perché il livello LLM rimane dietro la stessa API a chiave unica.
Domande frequenti
Quale modello vince nei benchmark?
Né l'uno né l'altro: i numeri non si fronteggiano. {{1}}Nemotron Parse 2.0{{/1}} riporta {{2}}ParseBench{{/2}}, {{3}}MOSCAR{{/3}}, {{4}}IndicVisionBench{{/4}} e un sottoinsieme di {{5}}OmniDocBench{{/5}} relativo alla scrittura a mano, tutti benchmark proprietari NVIDIA e nessuno riprodotto in modo indipendente. {{6}}olmOCR 2{{/6}} riporta {{7}}olmOCR-Bench{{/7}}, il benchmark proprietario di {{8}}AI2{{/8}} su cui ora pubblica il resto del settore. Nessun terzo soggetto ha eseguito entrambi i modelli sullo stesso corpus, quindi qualsiasi affermazione diretta di "vincitore" è una estrapolazione. In termini di tendenza: i numeri di {{9}}olmOCR{{/9}} hanno resistito a dieci mesi di utilizzo da parte della community; quelli di {{10}}Nemotron Parse 2.0{{/10}} sono recenti e potrebbero cambiare.
Nemotron Parse 2.0 è davvero migliore con i documenti non in inglese?
Questa è l'affermazione: un'espansione del vocabolario di circa 20.000 token, più MOSCAR a 0,9102 e IndicVisionBench a 0,7203, entrambi dichiarati dal fornitore ed entrambi in forte aumento rispetto alla v1.2. olmOCR 2 non avanza alcuna pretesa multilingue ed è etichettato come inglese. Ma finché non arriva una verifica indipendente, tratta i miglioramenti multilingue di Nemotron Parse 2.0 come promettenti ma non verificati e testali sulle tue pagine Indic o CJK prima di fare affidamento su di essi.
Ho bisogno di una GPU più grande per una di queste?
Sì, e tiene traccia della differenza di dimensioni. Il modello 0.9B di Nemotron Parse 2.0 sta su una scheda Ampere di fascia modesta ed è l'opzione più conveniente per pagina su hardware che già possiedi. Il VLM 7B di olmOCR 2 richiede una GPU notevolmente più grande; la sua build FP8 raggiunge circa 3.400 token di output al secondo su un H100, secondo AI2.
Qual è meglio per il preprocessing RAG?
Dipende da ciò di cui il tuo retriever ha bisogno. Se riconduci le risposte a regioni della pagina, hai bisogno di classi di layout o vuoi indicizzare tabelle e grafici come unità a sé stanti, i bounding box e le classi di Nemotron Parse 2.0 ti offrono tutto questo in modo nativo. Se il tuo stack RAG consuma solo testo pulito e il tuo corpus è in inglese, il markdown linearizzato di olmOCR 2 è collaudato, più semplice e supportato da un toolkit maturo.
Il risultato finale
NVIDIA ha rilasciato un vero parser questa settimana senza dirlo a nessuno; AI2 ne ha rilasciato uno dieci mesi fa e ha stabilito il benchmark della categoria. Nemotron Parse 2.0 è la scelta migliore quando servono semantica del layout, copertura multilingue o estrazione di scrittura manuale con un budget ridotto — e le aree in cui i suoi numeri sono meno verificati sono esattamente quelle in cui afferma di vincere. olmOCR 2 è la scelta migliore quando serve testo linearizzato su larga scala per documenti in inglese e si vuole una toolchain stabile da dieci mesi. Nessuno dei due è implementato da nessuna parte, quindi è comunque una decisione di self-hosting; il modo più economico per farlo è eseguire entrambi sulle tue pagine più difficili e osservare dove ciascuno fallisce.
