
Nemotron Parse 2.0 vs olmOCR: Två jobb, båda kallade parsing
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Den 3 augusti 2026 publicerade NVIDIA en ny dokumenttolkmodell på Hugging Face utan att berätta för någon. NVIDIA-Nemotron-Parse-2.0 är en 0,9B vision-encoder-dekoder vars modellkort gör anspråk på ett flerspråkigt och diagrammedvetet språng jämfört med föregångaren från februari 2026, och den hamnade i samma hörn av ekosystemet som olmOCR – mer exakt olmOCR-2-7B-1025, den 7B-lineariseraren från Allen Institute for AI som tyst har blivit standardmetoden för att omvandla PDF-filer till träningsdata för LLM:er. Att kalla detta för en direkt jämförelse överhuvudtaget är fällan: båda modellerna beskrivs som ”dokumenttolkning”, men de returnerar olika artefakter, matar olika pipelines, och deras benchmark-siffror ställs aldrig faktiskt mot varandra. Den verkliga frågan är vilket av två jobb du anlitar en tolk för att utföra.
De två artefakterna
Nemotron Parse 2.0 är en layout-semantikmotor. Ge den en sidbild och en uppgiftsprompt så returnerar den texten plus ett semantiskt lager ovanpå: en layoutklass för varje region (titel, sektion, bildtext, tabell, diagram, sidhuvud, sidfot, fotnot, bibliografipost), en begränsningsruta för varje samt läsordningen mellan dem — med markdown som en valfri serialisering ovanpå. olmOCR 2 är en lineariserare. Den tar samma sida och returnerar ren, lineariserad markdown med ett kort YAML-frontmatter som registrerar metadata på sidnivå, såsom primärt språk, rotationskorrigering och huruvida sidan är en tabell eller ett diagram. Inga rutor, inga klasser, ingen geometri: en enda genomkörning, text i dokumentordning.
Artefakten avgör uppgiften. Om din pipeline behöver citera ett faktum tillbaka till en region på sidan, markera en tabell i en skanning, eller extrahera layoutsemantik för dokumentintelligens, behöver du geometri — det är Nemotron Parse 2.0:s utdatautrymme. Om du bygger träningsdata eller matar en text-LLM som bara konsumerar tokens, är geometri brus och lineariserad markdown är precis rätt — det är olmOCR:s hela design. Du kan bulta layoutdetektering på olmOCR:s utdata med en separat detektor, och du kan kassera Nemotron Parse 2.0:s rutor och behålla bara markdown, men varje modell är byggd för att göra en av dessa uppgifter nativt.
Det tysta skeppet: vad repot visar, vad som inte är bekräftat
{{1}}NVIDIA-Nemotron-Parse-2.0 dök upp på Hugging Face den 3 augusti 2026 utan tillkännagivande, utan blogginlägg och utan NIM-paketering.{{/1}} Vad som är känt är repot. Det är en 0,9B-vision-encoder-dekoder: en ViT-H-bildkodare byggd på NVIDIAs C-RADIO-stomme, en lättvikts-1D-konvolutionsadapter och en tiolagers avkodare i mBART-stil. {{2}}Tokenizern växte med cirka 20 000 poster till totalt omkring 72 000, uttryckligen för effektivare flerspråkigt stöd, och modellkortet listar diagrammedveten parsning som en huvudfunktion via en ny class_Chart-token, plus en familj av tabellserialiseringar (LaTeX, HTML, markdown, JSON, hierarkisk JSON, CSV).{{/2}} Två valfria logits-processorer medföljer: en som stoppar repetitiv strukturerad utdata och en som framtvingar en tabellstruktur för en tabellbeskärning. {{3}}Rekommenderad inmatningsupplösning sträcker sig från cirka 1024×1280 upp till 1664×2048, generering löper upp till ett tak på 9 000 token, och modellkortet listar Transformers, vLLM, SGLang och Docker Model Runner som körtider på Ampere-, Hopper-, Blackwell- och Turing-maskinvara.{{/3}}
Påståendena är dock alla NVIDIAs egna, och inget av dem har oberoende reproducerats. Modellkortet rapporterar ParseBench totalt till 0,6391 (upp från v1.2:s 0,5782), MOSCAR flerspråkig OCR till 0,9102 BoC-F1 (upp från 0,4410), IndicVisionBench till 0,7203 ANLS-tecken (upp från 0,0612) och en OmniDocBench-delmängd för handskrift som förbättras från 0,9739 till 0,3395 i textredigeringsavstånd. Det är de största hoppen, och de är också de minst verifierade: ParseBench är NVIDIAs egen svit, och ingen tredje part har ännu kört Parse 2.0 mot en oberoende korpus. Det som inte är bekräftat handlar om mer än siffrorna — det finns ingen värdbaserad inferens (modellkortet anger att modellen inte är distribuerad av någon inferensleverantör), inga priser och ingen annonserad tidslinje för något av detta.

olmOCR 2: den etablerade standarden som alla redan mäter sig mot
olmOCR är modellen som uppfann det riktmärke som denna kategori nu tvistar om. olmOCR-2-7B-1025, som släpptes den 22 oktober 2025, är en 7B vision-språkmodell, finjusterad från Qwen2.5-VL-7B-Instruct på den 270 000-sidiga korpusen olmOCR-mix-1025, och därefter förfinad med GRPO-förstärkningsinlärning mot automatiserade "enhetstest"-belöningar – deterministiska kontroller av att en tabell behöll sin struktur, att en formel transkriberades exakt, att läsordningen hölls. Detta enhetstestkoncept blev olmOCR-Bench, med cirka 1 400 PDF:er och över 7 000 kontroller, och det har blivit industrins de facto-standard: Marker, MinerU och ett dussin kommersiella OCR-modeller publicerar nu sina resultat på den. olmOCR 2 själv får totalt 82,4 där, ungefär fyra poäng över den tidigare utgåvan och över siffrorna för Marker (76,1) och MinerU (75,8) som AI2 anger på samma sida.
olmOCR är också det mogna alternativet i detta par. Den är Apache-2.0, dess vikter har laddats ner cirka 218 000 gånger under den senaste månaden, och olmOCR-verktygslådan hanterar rendering, rotation och återförsök i stor skala på en vLLM-backend — AI2:s batchuppskattning placerar pipelinen på cirka 176–190 dollar per miljon sidor på hyrda GPU:er, och FP8-bygget kör cirka 3 400 utdatatoken per sekund på en enda H100, tillräckligt snabbt för att lanseringsinlägget citerar "10 000 sidor för mindre än 2 dollar." Avvägningen gäller språk: olmOCR är uttryckligen byggd och benchmarkad för engelskspråkig digitaliserad trycktext, och dess modellkort märker den som engelska. Nemotron Parse 2.0:s hela försäljningsargument är det motsatta — dess påstådda vinster är koncentrerade till CJK- och indiska skrifter.

Sex rader där avvägningen syns
Båda modellerna har öppna vikter, båda körs på Transformers, vLLM eller SGLang, och båda är självhostade idag. När det gäller de dimensioner som är avgörande för att välja mellan dem:
• Storlek — Nemotron Parse 2.0 är 0,9B; olmOCR 2 är 7B. Ungefär åtta gånger fler parametrar, ungefär åtta gånger högre minimikrav på VRAM.
• Utdata — Nemotron Parse 2.0 returnerar text, layoutklasser, begränsningsrutor, läsordning och markdown; olmOCR 2 returnerar linjäriserad markdown med ett YAML-metadatablock.
• Flerspråkig — Nemotron Parse 2.0 hävdar starkt stöd för CJK och indiska språk (MOSCAR 0,9102, IndicVisionBench 0,7203, leverantörsrapporterat); olmOCR 2 är i första hand engelska.
• Flaggskeppsresultat — Nemotron Parse 2.0 rapporterar ParseBench 0,6391 (NVIDIAs eget, oreviderat); olmOCR 2 uppnår 82,4 på olmOCR-Bench (AI2:s eget, tio månaders återanvändning av communityn).
• Licens — Nemotron Parse 2.0 distribueras under NVIDIA Open Model License; olmOCR 2 är Apache-2.0.
• Släppt — Nemotron Parse 2.0 släpptes den 3 augusti 2026 utan förvarning; olmOCR 2 släpptes den 22 oktober 2025 med ett lanseringsinlägg.

Tre ställen där beslutet verkligen biter
Skala och latens. En 0,9B-avkodare är dramatiskt billigare att servera än en 7B-VLM: en mindre GPU, mindre VRAM, fler sidor per sekund på samma hårdvara, och en lägre kostnad per sida när du väl betalar för GPU-tid. Om du redan kör GPU-infrastruktur och din korpus är stor, är det en reell månatlig skillnad. olmOCR:s egna siffror visar hur snabb en 7B-modell kan göras med FP8-kvantisering – men den behöver fortfarande en H100-klass GPU för att nå dem; Nemotron Parse 2.0:s hårdvarugolv är ett kort från Ampere-eran.
Flerspråkig. Det här är den mest asymmetriska raden. Nemotron Parse 2.0 utökade sin tokenizer med cirka 20 000 poster specifikt för flerspråkig OCR, och dess korts utlovade förbättringar är koncentrerade till indiska skript och CJK. olmOCR 2 gör inget sådant påstående — dess språktagg är engelska. Om din korpus är hindi, tamil, bengali, japanska eller blandad skrift, är Nemotron Parse 2.0:s siffror värda att testa, just eftersom de är leverantörsrapporterade och färska.
Serveringsverkligheten. olmOCR 2 är tio månader gammal och dess verktygskedja är tråkig på ett bra sätt. Nemotron Parse 2.0 är fem dagar gammal och dess servinghistoria är tydligt omogen: vLLM behöver en build med stöd för Nemotron Parse-fjärrkod, det delade utmatningshuvudet får vissa vLLM 0.20-byggen att fela (repo:t medföljer en runtime-patch), och tokenizer.json innehåller serialiserad padding till 9 000 tokens — en servingstack fick en prompt på sex tokens som expanderade till 54 000 token-ID:n innan patchning. Inget av det är ödesdigert, men det är precis den typ av friktion du budgeterar för med en ny modell.
Välj en för din pipeline
Välj olmOCR 2 om du bygger LLM-träningsdata eller en högvolymspipeline för textextraktion över engelska dokument. Du får en mogen verktygslåda, en Apache-2.0-licens, det riktmärke som branschen nu mäter sig mot, och en välbeträdd batchväg. Dess accepterade brist är språktäckning.
Välj Nemotron Parse 2.0 om din pipeline behöver geometri — layoutklasser, bounding boxes och läsordning för grounded retrieval eller dokumentintelligens — eller om din korpus innehåller mycket indiska, CJK- eller handskrivna sidor, där dess påstådda fördelar ligger. Storleken 0,9B gör ett helgtest billigt även om du är osäker. Dess accepterade felmod är att varje siffra på kortet är NVIDIAs egen och kan ändras vid oberoende utvärdering.
Om din input mestadels består av digitalfödda engelska PDF-filer och allt du behöver är ren markdown, är olmOCR 2 det säkrare standardvalet. Om du redan självhostar och det flerspråkiga eller layoutbaserade användningsfallet är verkligt, är Nemotron Parse 2.0 det mer intressanta valet – testa det på dina egna sidor innan du bestämmer dig.
Undvik att valet av parser blir en inlåsning.
En dokumentpipeline har ett parser-steg och sedan ett LLM-steg, och parsen är vanligtvis det billigaste steget när volymen är på riktigt — LLM:en som omvandlar tolkad markdown till sammanfattningar, strukturerade poster eller svar är där kostnaden skalar. Det är det steget som ett routinglager förändrar. OrcaRouter placerar 200+ modeller bakom ett API till leverantörens listpris utan påslag, så en prissänkning från leverantören är live samma dag, och automatisk failover hindrar en försämrad leverantör från att stoppa ett batchjobb. Ingen av parserna i denna jämförelse finns i vår katalog — båda modellkorten anger att de inte driftsätts av någon inferensleverantör, så detta är ett beslut om självhosting — men anledningen till att hålla parsen frikopplad från din modellstack är exakt vad routing ger på nedströmssidan: byt Nemotron Parse 2.0 mot olmOCR 2, eller tillbaka, utan att röra en enda integration, eftersom LLM-lagret ligger kvar bakom samma API med en nyckel.
Vanliga frågor
Vilken modell vinner på benchmarks?
Varken – siffrorna står inte mot varandra. Nemotron Parse 2.0 rapporterar ParseBench, MOSCAR, IndicVisionBench och en handskriftsdelmängd från OmniDocBench, allt NVIDIA:s eget och inget oberoende reproducerat. olmOCR 2 rapporterar olmOCR-Bench, AI2:s eget riktmärke som resten av branschen nu publicerar sina resultat på. Ingen tredje part har kört båda modellerna på samma korpus, så varje direkt påstående om en ”vinnare” är extrapolering. Riktningsmässigt: olmOCR:s siffror har överlevt tio månaders community-användning; Nemotron Parse 2.0:s är färska och kan komma att ändras.
Är Nemotron Parse 2.0 verkligen bättre på icke-engelska dokument?
Det är påståendet — en ordförrådsutökning på cirka 20 000 tokens, plus MOSCAR på 0.9102 och IndicVisionBench på 0.7203, båda leverantörsrapporterade och båda kraftigt upp från v1.2. {{1}}olmOCR 2 gör inga flerspråkiga anspråk och är märkt som engelskspråkig.{{/1}} Men tills en oberoende körning har genomförts, betrakta Nemotron Parse 2.0:s flerspråkiga vinster som lovande men overifierade och testa dem på dina egna indiska eller CJK-sidor innan du förlitar dig på dem.
Behöver jag en större GPU för en av dem?
Ja, och den håller reda på storleksskillnaden. Nemotron Parse 2.0:s 0,9B ryms på ett blygsamt Ampere-kort och är det billigare alternativet per sida på hårdvara du redan äger. olmOCR 2:s 7B VLM kräver en betydligt större GPU; dess FP8-version når cirka 3 400 utdatatokens per sekund på en H100, enligt AI2.
Vilket är bättre för RAG-förbehandling?
Det beror på vad din retriever behöver. Om du förankrar svar i sidregioner, behöver layoutklasser, eller vill indexera tabeller och diagram som egna enheter, ger Nemotron Parse 2.0:s bounding boxes och klasser dig det inbyggt. Om din RAG-stack bara konsumerar ren text och din korpus är på engelska, är olmOCR 2:s linjäriserade markdown beprövad, enklare och stödd av ett moget verktygspaket.
Slutsats
NVIDIA släppte en riktig parser den här veckan och sa inget till någon; AI2 släppte en för tio månader sedan och gav kategorin dess riktmärke. Nemotron Parse 2.0 är det bättre valet när du behöver layoutsemantik, flerspråkig täckning eller handskriftsextrahering på en liten budget – och områdena där dess siffror är minst verifierade är exakt de områden den påstår sig vinna. olmOCR 2 är det bättre valet när du behöver linjäriserad text i stor skala för engelska dokument och vill ha en verktygskedja som varit stabil i tio månader. Inget av dem är i drift någonstans, så det här är ett self-host-beslut oavsett; det billigaste sättet att ta reda på det är att köra båda på dina egna svåraste sidor och se var var och en fallerar.
