Titelkort för 'NVIDIA-Nemotron-Parse-2.0': rubrik 'NVIDIA-Nemotron-Parse-2.0', underrubrik 'En diskret dokumentparseruppdatering', och beskrivningen '0.9B vision-encoder-decoder · flerspråkig OCR · diagrammedveten' bredvid en platt illustration av en dokumentsida som parsas med färgade avgränsningsramar och en diagramikon. OrcaRouter-logotyp komponerad i nedre högra hörnet.
Guides & Insights

NVIDIA-Nemotron-Parse-2.0: NVIDIA släppte tyst en smartare dokumentparser

Författare

Jim Song

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

NVIDIA-Nemotron-Parse-2.0 dök upp på Hugging Face den 3 augusti 2026, och när detta skrivs, fem dagar senare, har NVIDIA fortfarande inte tillkännagett den — inget blogginlägg, inget pressmeddelande, ingen tråd på X. Repot är komplett: en 0,9B vision-encoder-decoder, ett modellkort med en fullständig benchmark-tabell mot NVIDIA-Nemotron-Parse-v1.2, konfigurationer, en Dockerfile, en testsvit och till och med en pull request för vLLM som redan refererar till den nya modellens extra huvud. En komplett release utan någon som helst uppståndelse är precis den typen av signal som är värd en titt på vad vi vet hittills — så det är precis vad detta är: de fakta som repot fastställer, de siffror som fortfarande är leverantörsrapporterade och de öppna frågor som ett tillkännagivande normalt skulle besvara.

Vad NVIDIA-Nemotron-Parse-2.0 är

Nemotron Parse är NVIDIAs dokumenttolkningsmodell: du matar den med en skannad eller renderad sida och den returnerar texten i läsordning, begränsningsrutan och den semantiska klassen för varje region samt markdown – inklusive tabeller – i valfritt format: LaTeX, HTML, markdown, JSON, hierarkisk JSON eller CSV. Det är inte en allmän LLM och inte en ren OCR-motor. Den ligger mitt emellan: layoutmedveten extraktion utformad för att mata RAG-, extraktions- och dokumentintelligenspipelines.

Version 2.0 behåller samma arkitekturfamilj som v1.2, enligt repots konfiguration. Vision-encodern är en ViT-H byggd på NVIDIAs C-RADIOv2-stomme, avkodaren är en tiolagers mBART-liknande avkodare, och hela modellen uppgår till cirka 0,9 miljarder parametrar. Indatasidor kan vara upp till 2048×1664, genereringen har ett tak på 9 000 tokens, och modellen taggar regioner med en uppsättning semantiska klasser (text, titel, avsnittshuvud, listobjekt, tabell, formel, bild, bildtext, fotnot, sidhuvud/sidfot och övrigt). Modellen är tillräckligt liten för att kunna köras lokalt på en enda GPU, vilket är viktigt eftersom det är det enda sättet att köra den idag.

Vad ändrades från v1.2

Det intressanta med kortet är inte modellen — det är delta. NVIDIA-Nemotron-Parse-v1.2 släpptes på Hugging Face i februari 2026 med ett ordförråd på 52 329 token. Version 2.0 utökar det till 72 256 token, ett hopp på cirka 20 000 token, och kortet är tydligt med varför: de extra token ger flerspråkig OCR, med de största vinsterna på CJK- och indiska skrifter. Modellkortet listar också tre andra ändringar:

• Diagrammedveten parsning — en ny class_Chart>-klasstoken, så diagramregioner får sin egen semantiska klass istället för att slås ihop med bilder eller tabeller.

• Förbättrad extraktion av handskriven text — modellkortet rapporterar att textredigeringsavståndet på OmniDocBench Notes-uppsättningen sjunker från 0,9739 i v1.2 till 0,3395 (lägre är bättre), en kraftig förändring för vad som historiskt sett är det svagaste fallet för dessa modeller.

• Förbättrad tabellhantering, inkluderad i den totala ParseBench-förbättringen snarare än rapporterad som ett eget nummer.

En träningsdetalj värd att notera: kortet säger att 2.0 är en checkpoint soup med lika vikt av träningscheckpoints från steg 58k till 66k, vilket är ett vanligt recept för en stillsam punktrelease — det brukar ge robusthet utan en fullständig omträning.

De siffror som kortet rapporterar

Alla följande siffror kommer från NVIDIAs eget modellkort, mätta mot v1.2, och ingen av dem har ännu körts av en oberoende tredje part. Betrakta dem som leverantörsrapporterade och vägledande:

• ParseBench totalpoäng — 0,5782 på v1.2 till 0,6391 på 2.0. ParseBench är NVIDIAs eget riktmärke som täcker texttrogenhet, semantisk formatering, tabeller, diagram och visuell förankring.

• MOSCAR flerspråkig BoC F1 — 0,4410 till 0,9102. Detta är det enskilt största hoppet på kortet, och det stämmer överens med ordförrådsexpansionen; MOSCAR täcker latin, arabiska, kyrilliska, kinesiska, hangul, japanska, indiska skrifter, hebreiska, thailändska, grekiska och mer.

• IndicVisionBench övergripande ANLS-character — 0,0612 till 0,7203, över tio indiska språk (bengali, gujarati, hindi, kannada, malayalam, marathi, odia, punjabi, tamil, telugu).

• OmniDocBench Notes redigeringsavstånd för handskriven text — 0.9739 till 0.3395 (lägre är bättre).

Scoreboard for NVIDIA-Nemotron-Parse-2.0: six rows reading Params 0.9B vision-encoder-decoder, Max image 2048×1664, ParseBench 0.6391 (vendor-reported), MOSCAR BoC F1 0.9102 (vendor-reported), IndicVisionBench ANLS 0.7203 (vendor-reported), License NVIDIA Open Model. Footer: 'All figures vendor-reported; no independent scores yet.' OrcaRouter logo composited bottom-right.

Omfattningen av dessa deltavärden är anledningen till att denna version är viktig även utan ett tillkännagivande. En rörelse från 0,44→0,91 på ett flerspråkigt OCR-F1-mått är inte en mindre punktversion; det ser ut som det flerspråkiga arbete som normalt skulle vara huvudnumret i en lansering. Huruvida vinsterna håller måttet vid oberoende utvärdering är precis den fråga som bristen på bevakning lämnar öppen.

Vad repot inte berättar för oss

Att vara ärlig om kanterna är poängen med ett quiet-ship-inlägg. Repot bekräftar inte:

• Huruvida 2.0 är (eller kommer att vara) tillgänglig som en NVIDIA NIM-mikrotjänst — v1.2 serveras via NVIDIAs eget NIM-API, 2.0-kortet listar ingen NIM-tagg och ingen distributionsändpunkt, och dess repo-sida noterar att modellen "inte är distribuerad av någon inferensleverantör."

• Prissättning, om någon — vikterna har ingen användningsavgift, men ett hostat alternativ har inte prissatts eller tillkännagivits.

• Oberoende riktmärken — det finns ännu inga resultat i Artificial Analysis, LMArena eller OmniDocBench för 2.0, så det finns inget att jämföra leverantörens siffror mot.

Färdplanen — huruvida 2.0 är ett steg på vägen eller ett slutmål, och huruvida en uppföljare i stil med 2.1 är på väg, är okänt.

Det enda som är säkert är licensen: modellen omfattas av NVIDIA Open Model License, som tillåter både kommersiellt och icke-kommersiellt bruk, med tokenizern under CC-BY-4.0. Om du vill använda den i en produkt är den saken avklarad.

Kör det idag

Självhostning är det enda nuvarande alternativet, och det medför en del friktion som är värd att känna till innan du planerar runt det. Modellen laddas i Hugging Face Transformers med trust_remote_code, och vLLM kan servera den – men endast med ett vLLM-bygge som inkluderar Nemotron Parse-stöd för fjärrkod. På A100/A10-klass hårdvara rekommenderar NVIDIA att tvinga Triton-attention-backend, och du behöver fyra extra beroenden: albumentations, timm, open_clip_torch och einops. Det finns också en egenhet med bunden output-head: 2.0 håller LM-huvudet bundet till decoder-inbäddningarna, medan vissa vLLM-byggen materialiserar ett separat output-head om du inte lägger till NVIDIAs medföljande runtime-patch i PYTHONPATH.

Två servingdetaljer från ekosystemet rundar av det hela. För det första: en vLLM-pull request som nu är öppen (under granskning sedan början av augusti) möjliggör spekulativ avkodning för NVIDIA-Nemotron-Parse-2.0 genom att använda det extra prediktionshuvud som lagras i repots sidecar-fil auxiliary_prediction_heads.safetensors.extra – modellkortets dokumentation beskriver den filen som inte används i standardinferens, så denna PR är det första som faktiskt konsumerar den. På en H100 över ParseBench-censusen med 1 005 sidor rapporterar författaren medianökningar i utdataflöde på cirka 45 % vid concurrency 1, 41 % vid concurrency 8 och 40 % vid concurrency 32 jämfört med enkel-token-avkodning – alla siffror från PR:n, ännu inte sammanslagna eller oberoende reproducerade. För det andra flaggar en Dynamo-issue en verklig fallgrop i tokenizern i 2.0: den levereras med en serialiserad tokenizer.json som har inbakad padding som paddar varje encode till 9 000 tokens, så en servingstack som laddar den paddade tokenizern kan blåsa upp en multimodal prompt på sex tokens till 54 000 token-ID:n. Om du selfhostar, se till att din servingväg gör online-tokenisering istället för att ladda den paddade artefakten.

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that the model adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

Var den befinner sig på parsningsmarknaden 2026

Nemotron Parse 2.0 ger sig in i ett trångt och snabbrörligt område. De nuvarande ledarna inom dokumenttolkningsmodeller med öppen källkod inkluderar MinerU 2.5-Pro (en 1,2B-modell från Shanghai AI Lab) och PaddleOCR-VL (0,9B- och 7B-varianter), som båda uppvisar sammansatta poäng i det låga 90-talet på OmniDocBench-topplistan, samt GOT-OCR 2.0 från StepFun som det lätta 580M-alternativet; på API-sidan är Mistral OCR det främsta kommersiella erbjudandet. Två varningar innan du försöker placera in 2.0 i den rankningen. Det första är att siffrorna inte är jämförbara: Parse 2.0 rapporterar ParseBench, NVIDIAs egen svit, medan fältets poäng är sammansatta OmniDocBench-poäng – olika uppgifter, olika viktning, ingen äpplen-mot-äpplen-siffra finns ännu. Det andra är att du inte ska blanda ihop NVIDIA-Nemotron-Parse-2.0 med NVIDIAs separata NVIDIA-Nemotron-OCR-v2-modell, en ordnivå-tät OCR-modell byggd för NeMo Curator-pipelines. Parse 2.0 är den layout- och klassmedvetna parsern; OCR v2 är en per-ord-extraktor. De är kompletterande verktyg, inte samma modell.

Ärligt talat är Parse 2.0:s pitch inte "slår alla på varje parsningsmätetal." Det är en 0,9B, permissivt licensierad, layoutmedveten parser vars modellkort hävdar ett mycket stort flerspråkigt språng jämfört med sin egen föregångare – och vars härstamning (v1.1 i november 2025, v1.2 i februari 2026, 2.0 i augusti 2026) visar att NVIDIA levererar en ny parser ungefär varje kvartal. För team som redan är standardiserade på Nemotron Parse-familjen är 2.0 en drop-in-uppgradering med samma API-form och en mycket starkare flerspråkig historia. För alla andra är frågan om den oannonserade modellens påståenden överlever oberoende tester.

Var ett routinglager passar in i en parsningspipeline

En dokumenttolkmodell är vanligtvis ett steg i en längre pipeline, och det är stegen runt omkring som gör att routing visar sitt värde. Den vanliga strukturen är: Parse 2.0 omvandlar en sida till strukturerade segment, och sedan sammanfattar en LLM, svarar på frågor, extraherar entiteter eller strukturerar resultatet för ett nedströms datalager. Det är i LLM-steget som en routingplattform förändrar kostnadsbilden. OrcaRouter lägger 200+ modeller bakom ett API till leverantörens listpris – 0 % påslag – så en prissänkning från leverantören syns hos oss samma dag som den tillkännages – med automatisk failover om en leverantörs prestanda försämras. Konkret betyder det att tolken kan förbli oförändrad medan modellen som tolkar dess utdata byts, jämförs eller failover-routas utan ett andra avtal eller en kodändring. Om tolksteget är flaskhalsen vill du ha en modell du kan finjustera och självhosta, vilket Parse 2.0 ger dig; om tolkningssteget är den rörliga kostnaden, är det det steget en router bör hantera. Vi hostar inte Parse 2.0 själva – det är en självhostad modell, inte ett API – men en tolk som matar en LLM är precis den uppställning där en enda endpoint för LLM-lagret lönar sig.

Pipeline diagram titled 'A parsing pipeline with a routing layer': four rounded cards in a flow — Parse 2.0 (page → text · bboxes · markdown), Chunks (structured regions in reading order), OrcaRouter (one API · 200+ models · 0% markup), LLM (summary · QA · extraction) — with a footer line 'The parsing stage is self-hosted; OrcaRouter routes the LLM stage at provider list price with automatic failover.' OrcaRouter logo composited bottom-right.

Slutsats

NVIDIA-Nemotron-Parse-2.0 är en verklig, komplett, oannonserad release från den 3 augusti 2026. Repot visar en layoutmedveten parser på 0,9B vars modellkort gör anspråk på mycket stora flerspråkiga och handskriftsförbättringar jämfört med v1.2, släppt under en tillåtande licens med reell friktion kring självhostning. Inga av dessa siffror är oberoende verifierade ännu, och det finns varken ett hostat alternativ eller prissättning. Rätt val beror på din risktolerans: om du parsar flerspråkiga dokument idag och det flerspråkiga mätvärdet är det du bryr dig om, är den påstådda 0,44→0,91 MOSCAR-rörelsen tillräckligt stor för att motivera ett weekendtest på din egen korpus – deltorna är av det slag som antingen replikeras eller kollapsar, och en tyst release är det billigaste sättet att ta reda på vilket. Om du behöver ett riktmärke att citera eller ett supporterat API att satsa en produktionsväg på, vänta på ett tillkännagivande eller en oberoende körning. Under tiden är detta hur en tyst lansering ser ut, och det är värt att hålla ögonen på.

FAQ

Är NVIDIA-Nemotron-Parse-2.0 en läcka eller en riktig release?

Ingen av etiketterna passar riktigt. Det är inte en läcka i bemärkelsen spridda eller partiella vikter – repot är komplett, med ett detaljerat modellkort, konfigurationsfiler, en Dockerfile, en testsvit med golden outputs och inferensskript för både Transformers och vLLM. Men det är inte heller en lansering i vanlig bemärkelse: NVIDIA har inte publicerat något tillkännagivande, och NIM-paketeringen och den värdbaserade slutpunkten som åtföljde tidigare Nemotron Parse-utgåvor saknas. Den korrekta beskrivningen är en fullständig utgåva som leverantören ännu inte valt att marknadsföra – vilket är anledningen till att den ärliga etiketten här är "quiet ship", och varför de saker som ett tillkännagivande normalt skulle avgöra (prissättning, färdplan, värdbaserad tillgänglighet) förblir öppna frågor.

Hur står sig leverantörernas benchmarkresultat mot de OmniDocBench-siffror som folk anger för andra parsrar?

Det gör de inte, direkt. Siffrorna på NVIDIA-Nemotron-Parse-2.0:s kort kommer från ParseBench, NVIDIAs eget riktmärke som täcker texttrohet, semantisk formatering, tabeller, diagram och visuell förankring, plus MOSCAR, IndicVisionBench och en OmniDocBench-delmängd för handskrift — medan marknadens toppsiffror (MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR) är sammansatta OmniDocBench-resultat. Olika uppgifter, olika mått, ingen publicerad äpplen-mot-äpplen-jämförelse finns ännu. Den enda siffra som faktiskt överlappar med ekosystemet — OmniDocBench Notes handskriftssiffra — rapporteras som ett textredigeringsavstånd mot v1.2, inte som ett sammansatt resultat, så den kan fortfarande inte rangordnas mot de andra. Tills en oberoende körning finns, behandla Parse 2.0:s påståenden som vägledande och overifierade.

Vad bör ett team testa innan de sätter det i produktion?

Tre saker. För det första, din egen flerspråkiga korpus: hela säljargumentet för 2.0 är det flerspråkiga klivet, och en tyst lansering är precis den situation där de påstådda vinsterna antingen replikeras på din data eller inte — kör de språk du faktiskt parsar innan du tror på specen. För det andra, self-hosting-stacken: bekräfta att din vLLM-bygge har stöd för fjärrkod för Nemotron Parse, applicera tied-output-head-patchen, och verifiera att din serveringsväg gör onlinetokenisering snarare än att ladda den utfyllda tokenizer.json, vilket kan expandera en kort prompt till 9 000 tokens. För det tredje, licens- och servicehistorien: vikterna är fria under NVIDIA Open Model License, men det finns ingen annonserad NIM, ingen prissättning och inget supportavtal — så planera för self-hosting, och dirigera LLM-steget nedströms genom ett lager som låter dig byta modeller och växla över utan att göra om konstruktionen, vilket är vad en routingplattform är byggd för.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube