
Nemotron Parse 2.0 vs olmOCR: Dwa zadania, oba zwane parsowaniem
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
3 sierpnia 2026 roku NVIDIA opublikowała nowy model parsowania dokumentów na Hugging Face i nikomu o tym nie powiedziała. NVIDIA-Nemotron-Parse-2.0 to model wizyjno-dekoderowy o wielkości 0,9B, którego karta modelu deklaruje wielojęzyczny i uwzględniający wykresy skok jakościowy względem poprzednika z lutego 2026 roku. Model trafił w ten sam zakątek ekosystemu co olmOCR — a dokładniej olmOCR-2-7B-1025, 7-miliardowy linearyzator z Allen Institute for AI, który po cichu stał się domyślnym sposobem na zamianę plików PDF w dane treningowe dla LLM. Nazwanie tego bezpośrednim pojedynkiem to pułapka: oba modele opisywane są jako „parsowanie dokumentów”, ale zwracają różne artefakty, zasilają różne potoki, a ich wyniki benchmarków nigdy właściwie nie stają naprzeciw siebie. Prawdziwe pytanie brzmi, które z dwóch zadań ma wykonywać parser, którego zatrudniasz.
Te dwa artefakty
Nemotron Parse 2.0 to silnik semantyki układu. Podaj mu obraz strony i prompt z zadaniem, a zwróci tekst oraz nałożoną na niego warstwę semantyczną: klasę układu dla każdego regionu (tytuł, sekcja, podpis, tabela, wykres, nagłówek, stopka, przypis dolny, pozycja bibliograficzna), ramkę ograniczającą dla każdego z nich oraz kolejność czytania między nimi — z markdownem jako jedną z opcjonalnych serializacji na wierzchu. olmOCR 2 to linearyzator. Przyjmuje tę samą stronę i zwraca czysty, zlinearyzowany markdown z krótkim frontmatterem YAML zawierającym metadane na poziomie strony, takie jak język główny, korekta rotacji oraz informacja, czy strona jest tabelą, czy diagramem. Żadnych ramek, żadnych klas, żadnej geometrii: jeden przebieg, tekst w kolejności dokumentu.
Artefakt determinuje zadanie. Jeśli twój potok musi powiązać fakt z obszarem strony, podświetlić tabelę na skanie lub wyodrębnić semantykę układu dla inteligencji dokumentów, potrzebujesz geometrii — to jest przestrzeń wyjściowa Nemotron Parse 2.0. Jeśli budujesz dane treningowe lub zasilasz tekstowy LLM, który konsumuje wyłącznie tokeny, geometria to szum, a linearyzowany markdown jest dokładnie tym, czego potrzeba — taki jest cały zamysł olmOCR. Możesz podpiąć wykrywanie układu do wyjścia olmOCR za pomocą osobnego detektora, a także odrzucić ramki Nemotron Parse 2.0 i zachować tylko markdown, ale każdy model jest zbudowany tak, aby jedno z tych zadań było natywne.
Cichy statek: co pokazuje repo, czego nie potwierdzono
NVIDIA-Nemotron-Parse-2.0 pojawił się na Hugging Face 3 sierpnia 2026 roku bez ogłoszenia, wpisu na blogu ani pakietu NIM. To, co można ustalić, to repozytorium. Jest to model wizyjny typu enkoder-dekoder o parametrach 0,9B: enkoder obrazu ViT-H zbudowany na bazie C-RADIO firmy NVIDIA, lekki adapter z konwolucją 1D oraz dziesięciowarstwowy dekoder w stylu mBART. Tokenizator powiększył się o około 20 000 wpisów do łącznej liczby około 72 000, wyraźnie w celu wydajniejszego wsparcia wielojęzycznego, a karta modelu wymienia parsowanie z uwzględnieniem wykresów jako funkcję główną, za pomocą nowego tokenu class_Chart, a także rodzinę serializacji tabel (LaTeX, HTML, markdown, JSON, hierarchiczny JSON, CSV). Do modelu dołączone są dwa opcjonalne procesory logitów: jeden zatrzymujący powtarzalne strukturalne dane wyjściowe i drugi wymuszający strukturę tabeli na wycinku tabeli. Zalecana rozdzielczość wejściowa wynosi od około 1024×1280 do 1664×2048, generowanie przebiega do górnego limitu 9000 tokenów, a karta modelu wymienia Transformers, vLLM, SGLang i Docker Model Runner jako środowiska uruchomieniowe na sprzęcie Ampere, Hopper, Blackwell i Turing.
Twierdzenia te pochodzą jednak wyłącznie od NVIDIA i żadne z nich nie zostało niezależnie potwierdzone. Karta zgłasza ogólny wynik ParseBench na poziomie 0,6391 (wzrost z 0,5782 w v1.2), MOSCAR wielojęzyczny OCR na poziomie 0,9102 BoC-F1 (wzrost z 0,4410), IndicVisionBench na poziomie 0,7203 ANLS-znak (wzrost z 0,0612) oraz podzbiór pisma odręcznego OmniDocBench poprawiający się z 0,9739 do 0,3395 pod względem odległości edycyjnej tekstu. To największe skoki, a zarazem najmniej zweryfikowane: ParseBench to autorski zestaw testów NVIDIA i żadna strona trzecia nie uruchomiła jeszcze Parse 2.0 na niezależnym korpusie. To, co nie zostało potwierdzone, wykracza poza wyniki — nie ma hostowanej inferencji (karta stwierdza, że model nie jest wdrożony przez żadnego dostawcę inferencji), nie ma cennika ani ogłoszonego harmonogramu dla żadnej z tych rzeczy.

olmOCR 2: obecny punkt odniesienia, z którym wszyscy już się mierzą
olmOCR to model, który wymyślił benchmark, o który spiera się teraz ta kategoria. olmOCR-2-7B-1025, wydany 22 października 2025 r., to 7-miliardowy model wizyjno-językowy dostrojony z Qwen2.5-VL-7B-Instruct na 270 000-stronicowym korpusie olmOCR-mix-1025, a następnie udoskonalony za pomocą uczenia przez wzmacnianie GRPO z automatycznymi nagrodami w postaci „testów jednostkowych” — deterministycznych kontroli sprawdzających, czy tabela zachowała strukturę, czy wzór został przepisany dokładnie, czy kolejność czytania się utrzymała. To podejście z testami jednostkowymi stało się olmOCR-Bench, obejmującym około 1400 plików PDF i ponad 7000 kontroli, i stało się de facto standardem branżowym: Marker, MinerU i kilkanaście komercyjnych modeli OCR publikuje teraz na nim wyniki. Sam olmOCR 2 osiąga tam 82,4 punktu ogółem, czyli około cztery punkty więcej niż poprzednie wydanie i więcej niż wyniki Markera (76,1) i MinerU (75,8), które AI2 podaje na tej samej stronie.
olmOCR jest również bardziej dojrzałą opcją w tym zestawieniu. Jest na licencji Apache-2.0, jego wagi pobrano około 218 000 razy w ciągu ostatniego miesiąca, a zestaw narzędzi olmOCR obsługuje renderowanie, rotację i ponawianie prób na dużą skalę na backendzie vLLM — szacunkowo według AI2 cały potok kosztuje około 176–190 dolarów za milion stron na wynajmowanych GPU, a wersja FP8 generuje około 3 400 tokenów wyjściowych na sekundę na pojedynczym H100, na tyle szybko, że post z premiery cytuje „10 000 stron za mniej niż 2 dolary”. Ceną za to jest język: olmOCR jest wyraźnie zbudowany i testowany pod kątem zdigitalizowanych druków anglojęzycznych, a jego karta modelu przypisuje mu język angielski. Nemotron Parse 2.0 stawia na coś zupełnie odwrotnego — jego deklarowane przewagi koncentrują się na pismach CJK i indyjskich.

Sześć wierszy, w których widać kompromis.
Oba modele są open-weight, oba działają na Transformers, vLLM lub SGLang i oba są dziś hostowane lokalnie. Jeśli chodzi o kryteria, które mają znaczenie przy wyborze między nimi:
• Rozmiar — Nemotron Parse 2.0 ma 0,9B; olmOCR 2 ma 7B. Około osiem razy więcej parametrów, około osiem razy większe minimalne zapotrzebowanie na VRAM.
• Wyjście — Nemotron Parse 2.0 zwraca tekst, klasy układu, ramki ograniczające, kolejność czytania i markdown; olmOCR 2 zwraca linearyzowany markdown z blokiem metadanych YAML.
• Wielojęzyczność — Nemotron Parse 2.0 deklaruje silne wsparcie dla CJK i języków indyjskich (MOSCAR 0,9102, IndicVisionBench 0,7203, raportowane przez producenta); olmOCR 2 jest nastawiony przede wszystkim na angielski.
• Wynik flagowy — Nemotron Parse 2.0 raportuje ParseBench 0.6391 (własny wynik NVIDIA, nieaudytowany); olmOCR 2 uzyskuje 82.4 w olmOCR-Bench (własny wynik AI2, dziesięć miesięcy ponownego wykorzystania przez społeczność).
• Licencja — Nemotron Parse 2.0 jest dystrybuowany na licencji NVIDIA Open Model License; olmOCR 2 jest na Apache-2.0.
• Wydane — Nemotron Parse 2.0 pojawił się 3 sierpnia 2026 r. bez zapowiedzi; olmOCR 2 został wydany 22 października 2025 r. wraz z wpisem o premierze.

Trzy miejsca, w których decyzja naprawdę daje się we znaki.
Skalowanie i opóźnienia. Dekoder o wielkości 0,9B jest znacznie tańszy w serwowaniu niż model VLM 7B: mniejsze GPU, mniej pamięci VRAM, więcej stron na sekundę na tym samym sprzęcie i niższy koszt na stronę, gdy już płacisz za czas GPU. Jeśli już prowadzisz infrastrukturę GPU, a Twój zbiór dokumentów jest duży, to realna różnica w miesięcznych kosztach. Własne dane olmOCR pokazują, jak szybki może być model 7B dzięki kwantyzacji FP8 — ale nadal potrzebuje GPU klasy H100, aby to osiągnąć; minimalne wymagania sprzętowe Nemotron Parse 2.0 to karta z ery Ampere.
Wielojęzyczność. To najbardziej asymetryczny wiersz. Nemotron Parse 2.0 rozbudował swój tokenizator o około 20 000 wpisów specjalnie pod kątem wielojęzycznego OCR, a deklarowane zyski na jego karcie koncentrują się na pismach indyjskich i CJK. olmOCR 2 nie wysuwa takich roszczeń — jej język to angielski. Jeśli Twój korpus to hindi, tamilski, bengalski, japoński lub mieszane pismo, warto przetestować liczby Nemotron Parse 2.0, właśnie dlatego, że pochodzą od producenta i są świeże.
Rzeczywistość serwowania. olmOCR 2 ma dziesięć miesięcy, a jego toolchain jest nudny w dobrym sensie. Nemotron Parse 2.0 ma pięć dni, a jego historia serwowania jest wyraźnie młoda: vLLM wymaga builda z obsługą zdalnego kodu Nemotron Parse, powiązana głowa wyjściowa wywraca niektóre buildy vLLM 0.20 (repo dołącza łatkę runtime'ową), a tokenizer.json zawiera zserializowany padding do 9 000 tokenów — jeden stack serwowania natknął się na prompt o sześciu tokenach, który przed załataniem rozszerzał się do 54 000 ID tokenów. Nic z tego nie jest krytyczne, ale to dokładnie ten rodzaj tarcia, na który trzeba być przygotowanym przy nowym modelu.
Wybierz jeden dla swojego potoku
Wybierz olmOCR 2, jeśli tworzysz dane treningowe dla LLM lub obsługujesz wielkoskalowy potok ekstrakcji tekstu z dokumentów anglojęzycznych. Otrzymujesz dojrzały zestaw narzędzi, licencję Apache-2.0, benchmark, według którego obecnie mierzy się branża, oraz sprawdzoną ścieżkę przetwarzania wsadowego. Jego akceptowanym ograniczeniem jest pokrycie językowe.
Wybierz Nemotron Parse 2.0, jeśli Twój potok przetwarzania potrzebuje geometrii — klas układu, ramek ograniczających i kolejności czytania do ugruntowanego wyszukiwania lub inteligencji dokumentów — lub jeśli Twój korpus jest bogaty w strony w językach indyjskich, CJK lub odręczne, gdzie leżą jego deklarowane zalety. Rozmiar 0.9B sprawia, że test weekendowy jest tani, nawet jeśli nie jesteś pewien. Jego akceptowany tryb awarii polega na tym, że każda liczba na karcie pochodzi od samej NVIDIA i może się zmienić w niezależnej ocenie.
Jeśli Twoje dane wejściowe to głównie natywnie cyfrowe anglojęzyczne pliki PDF i potrzebujesz tylko czystego Markdownu, olmOCR 2 jest bezpieczniejszym wyborem domyślnym. Jeśli już hostujesz samodzielnie, a wielojęzyczne lub oparte na układzie strony przypadki użycia są realne, Nemotron Parse 2.0 to ciekawsza opcja — przetestuj go na własnych stronach, zanim się zdecydujesz.
Nie dopuść, aby wybór parsera stał się uzależnieniem.
Potok dokumentów składa się z etapu parsowania i etapu LLM — a parser zwykle jest najtańszym ogniwem, gdy pojawia się realny wolumen. Koszty rosną w miejscu, w którym LLM zamienia sparsowany markdown w streszczenia, ustrukturyzowane rekordy lub odpowiedzi. To właśnie ten etap zmienia warstwa routingu. OrcaRouter udostępnia ponad 200 modeli za jednym API, po cenie katalogowej dostawcy, bez marży — więc obniżka cen u dostawcy jest aktywna tego samego dnia, a automatyczny failover sprawia, że jeden zdegradowany dostawca nie wstrzyma zadania wsadowego. Żaden z parserów w tym porównaniu nie znajduje się w naszym katalogu — obie karty modeli wskazują, że nie są one wdrożone u żadnego dostawcy inferencji, więc to decyzja o samodzielnym hostingu — ale powód, dla którego warto trzymać parser odseparowany od stosu modeli, to dokładnie to, co routing daje po stronie docelowej: podmiana Nemotron Parse 2.0 na olmOCR 2 lub odwrotnie, bez ruszania jakiejkolwiek integracji, ponieważ warstwa LLM pozostaje za tym samym API z jednym kluczem.
Często zadawane pytania
Który model wygrywa w benchmarkach?
Żaden z nich — te liczby nie są do siebie porównywane wprost. Nemotron Parse 2.0 raportuje ParseBench, MOSCAR, IndicVisionBench oraz podzbiór pisma odręcznego OmniDocBench — wszystko to własne benchmarki NVIDIA, a żaden nie został niezależnie odtworzony. olmOCR 2 raportuje olmOCR-Bench, własny benchmark AI2, na którym publikuje teraz reszta branży. Żadna strona trzecia nie uruchomiła obu modeli na tym samym korpusie, więc każde bezpośrednie twierdzenie o „zwycięzcy” to ekstrapolacja. Kierunkowo: wyniki olmOCR przetrwały dziesięć miesięcy użytkowania przez społeczność; wyniki Nemotron Parse 2.0 są świeże i mogą ulec zmianie.
Czy Nemotron Parse 2.0 jest naprawdę lepszy w przypadku dokumentów nieanglojęzycznych?
To jest twierdzenie — rozbudowa słownictwa o około 20 000 tokenów, plus MOSCAR na poziomie 0,9102 i IndicVisionBench na poziomie 0,7203, oba deklarowane przez producenta i oba znacznie wyższe niż w v1.2. olmOCR 2 nie deklaruje wsparcia wielojęzycznego i jest oznaczony jako angielski. Ale dopóki nie pojawi się niezależny test, traktuj wielojęzyczne osiągnięcia Nemotron Parse 2.0 jako obiecujące, ale niezweryfikowane, i przetestuj je na własnych stronach w językach indyjskich lub CJK, zanim na nich będziesz polegać.
Czy potrzebuję większego GPU do jednego z nich?
Tak, i śledzi różnicę rozmiarów. Model Nemotron Parse 2.0 w wariancie 0.9B mieści się na skromnej karcie z ery Ampere i jest tańszą opcją w przeliczeniu na stronę na sprzęcie, który już posiadasz. Model VLM 7B olmOCR 2 wymaga znacznie większego GPU; jego wersja FP8 osiąga około 3400 tokenów wyjściowych na sekundę na H100, według AI2.
Które jest lepsze do przetwarzania wstępnego RAG?
To zależy od potrzeb twojego retrievera. Jeśli zakotwiczasz odpowiedzi w regionach stron, potrzebujesz klas układu lub chcesz indeksować tabele i wykresy jako osobne jednostki, prostokąty ograniczające i klasy Nemotron Parse 2.0 zapewniają to natywnie. Jeśli twój stos RAG po prostu przetwarza czysty tekst, a twój korpus jest w języku angielskim, linearyzowany markdown olmOCR 2 jest sprawdzony, prostszy i wspierany przez dojrzały zestaw narzędzi.
Sedno sprawy
{{1}}W tym tygodniu NVIDIA wypuściła prawdziwy parser i nikomu o tym nie powiedziała; AI2 wypuściło swój dziesięć miesięcy temu i ustanowiło benchmark dla tej kategorii.{{/1}} {{2}}Nemotron Parse 2.0 sprawdzi się lepiej, gdy potrzebujesz semantyki układu, obsługi wielu języków lub ekstrakcji odręcznego pisma przy małym budżecie — a obszary, w których jego wyniki są najmniej zweryfikowane, to dokładnie te, w których twierdzi, że wygrywa.{{/2}} {{3}}olmOCR 2 sprawdzi się lepiej, gdy potrzebujesz linearyzowanego tekstu na dużą skalę w dokumentach anglojęzycznych i chcesz narzędzi, które są stabilne od dziesięciu miesięcy.{{/3}} {{4}}Żadne z nich nie jest nigdzie wdrożone, więc w obu przypadkach jest to decyzja o self-hostingu; najtańszy sposób, aby to rozstrzygnąć, to uruchomić oba na własnych najtrudniejszych stronach i zobaczyć, gdzie każde zawodzi.{{/4}}
