
NVIDIA-Nemotron-Parse-2.0: NVIDIA po cichu wypuściła mądrzejszy parser dokumentów
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- qwenNOWOŚĆQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 591 tok/s
- orcaNOWOŚĆOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencja42Kod
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencja39Kod
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligencja72Kod
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencja52Kod57Matematyka
- z-aiZ.ai: GLM 5.22026-06-1653Inteligencja69Kod60Matematyka
NVIDIA-Nemotron-Parse-2.0 pojawił się na Hugging Face 3 sierpnia 2026 r., a w chwili pisania tego tekstu, pięć dni później, NVIDIA nadal o nim nie ogłosiła — żadnego wpisu na blogu, żadnego komunikatu prasowego, żadnego wątku na X. Repozytorium jest kompletne: enkoder-dekoder wizyjny o wielkości 0.9B, karta modelu z pełną tabelą benchmarków względem NVIDIA-Nemotron-Parse-v1.2, konfiguracje, Dockerfile, zestaw testów, a nawet pull request do vLLM, który już odwołuje się do pomocniczej głowy nowego modelu. Pełne wydanie bez żadnej pompy to dokładnie taki sygnał, któremu warto przyjrzeć się w ramach przeglądu „co wiemy do tej pory”, więc właśnie to robimy: fakty, które ustala repozytorium, liczby, które wciąż pochodzą od producenta, oraz otwarte pytania, na które normalnie odpowiedziałoby ogłoszenie.
Czym jest NVIDIA-Nemotron-Parse-2.0
Nemotron Parse to model NVIDIA do parsowania dokumentów: podajesz mu zeskanowaną lub wyrenderowaną stronę, a on zwraca tekst w kolejności czytania, bounding box i klasę semantyczną każdego regionu oraz markdown — w tym tabele — w wybranym formacie: LaTeX, HTML, markdown, JSON, hierarchiczny JSON lub CSV. Nie jest to ogólny LLM ani zwykły silnik OCR. Znajduje się pomiędzy nimi: ekstrakcja uwzględniająca układ strony, zaprojektowana do zasilania potoków RAG, ekstrakcji i analizy dokumentów.
Wersja 2.0 zachowuje tę samą rodzinę architektur co wersja 1.2, zgodnie z konfiguracją repozytorium. Enkoder wizyjny to ViT-H zbudowany na szkielecie C-RADIOv2 firmy NVIDIA, dekoder to dziesięciowarstwowy dekoder w stylu mBART, a całość liczy około 0,9 mld parametrów. Strony wejściowe mogą mieć do 2048×1664, generowanie sięga limitu 9000 tokenów, a model oznacza regiony zestawem klas semantycznych (tekst, tytuł, nagłówek sekcji, element listy, tabela, wzór, obrazek, podpis, przypis, nagłówek/stopka strony i reszta). To model na tyle mały, że można go samodzielnie hostować na jednym GPU, co ma znaczenie, ponieważ obecnie to jedyny sposób na jego uruchomienie.
Co zmieniło się od v1.2
Interesująca część karty to nie model — to delta. NVIDIA-Nemotron-Parse-v1.2 trafił na Hugging Face w lutym 2026 roku ze słownikiem liczącym 52 329 tokenów. Wersja 2.0 rozszerza to do 72 256 tokenów, czyli skok o około 20 tys. tokenów, a karta wprost wyjaśnia dlaczego: dodatkowe tokeny zapewniają wielojęzyczny OCR, z największymi zyskami w przypadku pisma CJK i pism indyjskich. Karta modelu wymienia również trzy inne zmiany:
• Parsowanie uwzględniające wykresy — nowy token klasy class_Chart>, dzięki czemu regiony wykresów otrzymują własną klasę semantyczną, zamiast być grupowane razem z obrazami lub tabelami.
• Ulepszona ekstrakcja tekstu pisanego odręcznie — karta raportuje spadek odległości edycyjnej tekstu na zbiorze OmniDocBench Notes z 0.9739 w v1.2 do 0.3395 (niżej oznacza lepiej), co jest dużą zmianą w przypadku, który historycznie był najsłabszym punktem tych modeli.
• Ulepszona obsługa tabel, wliczona do ogólnego wzrostu ParseBench zamiast raportowana jako osobna liczba.
Warto zwrócić uwagę na jeden szczegół dotyczący treningu: karta mówi, że 2.0 to równo ważona zupa checkpointów (ang. checkpoint soup) z checkpointów treningowych z kroków od 58k do 66k, co jest powszechnym przepisem na spokojne wydanie punktowe — zwykle daje to większą odporność bez konieczności pełnego ponownego treningu.
Liczby raportowane przez kartę
Wszystkie poniższe wartości pochodzą z oficjalnej karty modelu firmy NVIDIA, zmierzone względem wersji v1.2, a żadna z nich nie doczekała się jeszcze niezależnego uruchomienia przez stronę trzecią. Należy traktować je jako dane raportowane przez producenta i orientacyjne:
• Wynik ogólny ParseBench — od 0.5782 w v1.2 do 0.6391 w 2.0. ParseBench to autorski benchmark NVIDIA obejmujący wierność tekstu, formatowanie semantyczne, tabele, wykresy i ugruntowanie wizualne.
• MOSCAR wielojęzyczny BoC F1 — od 0,4410 do 0,9102. To największy pojedynczy skok na karcie i jest zgodny z rozszerzeniem słownictwa; MOSCAR obejmuje łacinę, arabski, cyrylicę, chiński, hangul, japoński, pisma indyjskie, hebrajski, tajski, grecki i inne.
• Ogólny ANLS-character — od 0.0612 do 0.7203, w dziesięciu językach indyjskich (bengalski, gudżarati, hindi, kannada, malajalam, marathi, orija, pendżabski, tamilski, telugu).
• OmniDocBench Notes — odległość edycji tekstu odręcznego: od 0,9739 do 0,3395 (niższa jest lepsza).

Skala tych delt jest powodem, dla którego to wydanie ma znaczenie nawet bez ogłoszenia. Skok z 0,44 do 0,91 w wielojęzycznej metryce F1 dla OCR to nie drobne wydanie punktowe; wygląda to na pracę nad wielojęzycznością, która normalnie stanowiłaby główny punkt premiery. To, czy te osiągnięcia wytrzymają niezależną ocenę, to dokładnie pytanie, które pozostaje otwarte z powodu braku relacji.
Czego repo nam nie mówi
Bycie szczerym co do ograniczeń to sedno wpisu typu quiet-ship. Repozytorium tego nie potwierdza:
• Czy wersja 2.0 jest (lub będzie) dostępna jako mikrousługa NVIDIA NIM — wersja 1.2 jest udostępniana przez własne API NIM firmy NVIDIA, karta modelu 2.0 nie wymienia znacznika NIM ani punktu końcowego wdrożenia, a jej strona w repozytorium informuje, że model „nie jest wdrażany przez żadnego dostawcę wnioskowania”.
• Ceny, jeśli istnieją — wagi nie wiążą się z opłatą za użytkowanie, ale opcja hostowana nie została jeszcze wyceniona ani ogłoszona.
• Niezależne benchmarki — nie ma jeszcze wpisu dla 2.0 w Artificial Analysis, LMArena ani OmniDocBench, więc nie ma z czym porównać liczb podawanych przez dostawcę.
Mapa drogowa — czy wersja 2.0 jest etapem przejściowym, czy celem ostatecznym, oraz czy planowana jest kontynuacja w stylu 2.1 — pozostaje nieznana.
Jedyną pewną rzeczą jest licencja: model jest objęty licencją NVIDIA Open Model License, która pozwala na użycie komercyjne i niekomercyjne, a tokenizer jest na licencji CC-BY-4.0. Jeśli chcesz go użyć w produkcie, to pole jest odhaczone.
Uruchamianie tego dzisiaj
Samoobsługowe hostowanie to obecnie jedyna opcja i wiąże się z pewnymi niedogodnościami, o których warto wiedzieć, zanim zaplanujesz wokół nich swoją pracę. Model ładuje się w Hugging Face Transformers z parametrem `trust_remote_code`, a vLLM może go obsługiwać — ale tylko z wersją vLLM, która zawiera wsparcie zdalnego kodu Nemotron Parse. Na sprzęcie klasy A100/A10 firma NVIDIA zaleca wymuszenie backendu uwagi Triton, a do tego potrzebujesz czterech dodatkowych zależności: albumentations, timm, open_clip_torch i einops. Jest też osobliwość dotycząca współdzielonej głowy wyjściowej (tied-output-head): wersja 2.0 utrzymuje głowę LM powiązaną z osadzeniami dekodera, podczas gdy niektóre kompilacje vLLM tworzą oddzielną głowę wyjściową, chyba że dodasz dołączoną poprawkę NVIDIA do PYTHONPATH.
Dwa szczegóły serwowania z ekosystemu domykają ten obraz. Po pierwsze, otwarty pull request w vLLM (w trakcie przeglądu na początku sierpnia) umożliwia dekodowanie spekulatywne dla NVIDIA-Nemotron-Parse-2.0 dzięki wykorzystaniu pomocniczej głowicy predykcyjnej zapisanej w pliku towarzyszącym auxiliary_prediction_heads.safetensors.extra w repozytorium — dokumentacja karty modelu opisuje ten plik jako nieużywany w standardowej inferencji, więc to właśnie ten pull request jest pierwszym rozwiązaniem, które faktycznie go wykorzystuje. Na H100, na zbiorze ParseBench obejmującym 1005 stron, autor podaje medianowe zyski przepustowości wyjściowej rzędu 45% przy współbieżności 1, 41% przy współbieżności 8 i 40% przy współbieżności 32 w porównaniu z dekodowaniem pojedynczego tokena — wszystkie liczby pochodzą z pull requesta, który nie został jeszcze scalony ani niezależnie zweryfikowany. Po drugie, zgłoszenie w Dynamo wskazuje na realną pułapkę w tokenizerze wersji 2.0: jest on dostarczany z serializowanym plikiem tokenizer.json z wbudowanym paddingiem, który dopełnia każde kodowanie do 9000 tokenów, przez co stos serwujący, który wczytuje tokenizer z paddingiem, może rozdąć multimodalny prompt składający się z sześciu tokenów do 54 000 identyfikatorów tokenów. Jeśli hostujesz model samodzielnie, upewnij się, że ścieżka serwowania wykonuje tokenizację online, zamiast wczytywać artefakt z paddingiem.

Gdzie plasuje się na rynku parserów w 2026 roku
Nemotron Parse 2.0 wkracza na zatłoczone i szybko rozwijające się pole. Obecni liderzy open-source w parsowaniu dokumentów to MinerU 2.5-Pro (model 1.2B z Shanghai AI Lab) oraz PaddleOCR-VL (warianty 0.9B i 7B), oba notujące złożone wyniki w niskich latach 90. na liście liderów OmniDocBench, a także GOT-OCR 2.0 od StepFun jako lekka opcja 580M; po stronie API główną ofertą komercyjną jest Mistral OCR. Dwa ostrzeżenia, zanim spróbujesz umieścić 2.0 w tym rankingu. Po pierwsze, liczby nie są porównywalne: Parse 2.0 raportuje ParseBench, własny zestaw testów NVIDIA, podczas gdy wyniki konkurencji to złożone wskaźniki OmniDocBench — inne zadania, inne ważenie, nie istnieje jeszcze porównanie wprost. Po drugie, nie należy mylić NVIDIA-Nemotron-Parse-2.0 z osobnym modelem NVIDIA-Nemotron-OCR-v2, gęstym modelem OCR działającym na poziomie słów, zbudowanym dla potoków NeMo Curator. Parse 2.0 to parser świadomy układu i klas; OCR v2 to ekstraktor działający na pojedynczych słowach. To narzędzia uzupełniające się, a nie ten sam model.
Ujmując rzecz uczciwie, propozycja Parse 2.0 nie brzmi „bijemy konkurencję na głowę pod każdym wskaźnikiem parsowania”. To parser o rozmiarze 0,9B, na liberalnej licencji, uwzględniający układ strony, którego karta informacyjna deklaruje bardzo duży skok wielojęzyczny w porównaniu z własnym poprzednikiem — a jego rodowód (v1.1 w listopadzie 2025, v1.2 w lutym 2026, 2.0 w sierpniu 2026) pokazuje, że NVIDIA wypuszcza nowy parser mniej więcej co kwartał. Dla zespołów, które już ustandaryzowały się na rodzinie Nemotron Parse, wersja 2.0 to aktualizacja typu drop-in, z tym samym kształtem API i znacznie lepszą ofertą wielojęzyczną. Dla wszystkich innych pytanie brzmi, czy twierdzenia nieogłoszonego jeszcze modelu przetrwają niezależne testy.
Gdzie warstwa routingu mieści się w potoku parsowania
Model parsowania dokumentów jest zwykle jednym z etapów dłuższego potoku, a etapy wokół niego to miejsce, w którym routing ma rację bytu. Typowy układ jest następujący: Parse 2.0 zamienia stronę na ustrukturyzowane fragmenty, a następnie LLM streszcza je, odpowiada na pytania, wyodrębnia encje lub porządkuje wynik pod kątem docelowego magazynu danych. To właśnie na etapie LLM platforma routingu zmienia ekonomikę. OrcaRouter udostępnia ponad 200 modeli za pośrednictwem jednego API po cenie katalogowej dostawcy — z zerową marżą, więc obniżka ceny dostawcy pojawia się po naszej stronie tego samego dnia, w którym zostanie ogłoszona — z automatycznym przełączaniem awaryjnym, gdy wydajność któregoś dostawcy spada. W praktyce oznacza to, że parser może pozostać niezmienny, a model interpretujący jego wyniki może być wymieniany, porównywany lub przełączany awaryjnie bez drugiej umowy ani zmian w kodzie. Jeśli etap parsowania jest wąskim gardłem, potrzebujesz modelu, który możesz dostroić i hostować samodzielnie — taki właśnie jest Parse 2.0. Jeśli natomiast etap interpretacji generuje koszty zmienne, to właśnie tym etapem powinien zarządzać router. Nie hostujemy Parse 2.0 sami — to model hostowany samodzielnie, a nie API — ale parser zasilający LLM to dokładnie taka konfiguracja, w której jeden punkt końcowy dla warstwy LLM się opłaca.

Sedno sprawy
NVIDIA-Nemotron-Parse-2.0 to prawdziwe, kompletne, niezapowiedziane wydanie z 3 sierpnia 2026 roku. Repozytorium pokazuje parser o wielkości 0.9B uwzględniający układ strony, którego karta modelu deklaruje bardzo dużą poprawę w zakresie wielojęzyczności i pisma odręcznego w porównaniu z v1.2, wydany na permisywnej licencji, z realnymi utrudnieniami w samodzielnym hostowaniu. Żadna z tych liczb nie została jeszcze niezależnie zweryfikowana, a nie ma opcji hostowanej ani cennika. Właściwy ruch zależy od Twojej tolerancji na ryzyko: jeśli obecnie przetwarzasz dokumenty wielojęzyczne i to właśnie metryka wielojęzyczna jest dla Ciebie najważniejsza, deklarowana zmiana 0.44→0.91 w MOSCAR jest na tyle duża, że uzasadnia weekendowy test na własnym korpusie — tego rodzaju różnice albo się potwierdzają, albo się załamują, a ciche wydanie to najtańszy sposób, by się o tym przekonać. Jeśli potrzebujesz benchmarku, który możesz zacytować, lub wspieranego API, na którym możesz oprzeć ścieżkę produkcyjną, poczekaj na ogłoszenie lub niezależne uruchomienie. W międzyczasie tak właśnie wygląda ciche wydanie i warto je obserwować.
Często zadawane pytania
Czy NVIDIA-Nemotron-Parse-2.0 to wyciek czy prawdziwa premiera?
Żadna etykieta nie pasuje do końca. To nie jest przeciek w sensie porozrzucanych lub częściowych wag — repozytorium jest w pełni skompletowane, z szczegółową kartą modelu, plikami konfiguracyjnymi, Dockerfile, zestawem testów z wzorcowymi wynikami oraz skryptami inferencji zarówno dla Transformers, jak i vLLM. Ale to również nie jest premiera w normalnym sensie: NVIDIA nie wydała żadnego ogłoszenia, a brakuje pakietu NIM i hostowanego punktu końcowego, które towarzyszyły wcześniejszym wydaniom Nemotron Parse. Dokładne określenie to kompletne wydanie, które producent nie zdecydował się jeszcze promować — dlatego uczciwą etykietą jest tu „cicha premiera” i dlatego kwestie, które normalnie rozstrzyga ogłoszenie (ceny, plan rozwoju, dostępność w wersji hostowanej), pozostają otwartymi pytaniami.
Jak benchmarki dostawcy wypadają w porównaniu z wynikami OmniDocBench, które ludzie przytaczają dla innych parserów?
Nie, nie bezpośrednio. Wyniki na karcie NVIDIA-Nemotron-Parse-2.0 pochodzą z ParseBench, własnego benchmarku NVIDIA, obejmującego wierność tekstu, formatowanie semantyczne, tabele, wykresy i ugruntowanie wizualne, a także z MOSCAR, IndicVisionBench i podzbioru odręcznych notatek OmniDocBench — podczas gdy główne wyniki rynkowe (MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR) to złożone wyniki OmniDocBench. Różne zadania, różne metryki — nie opublikowano jeszcze żadnego porównania wprost. Jedyna liczba, która pokrywa się z ekosystemem — wynik odręcznych notatek OmniDocBench Notes — jest podawana jako odległość edycyjna tekstu względem v1.2, a nie jako wynik złożony, więc nadal nie można jej zestawić z pozostałymi. Dopóki nie pojawi się niezależny test, traktuj deklaracje Parse 2.0 jako orientacyjne i niezweryfikowane.
Co zespół powinien przetestować przed wdrożeniem do produkcji?
Trzy rzeczy. Po pierwsze, własny korpus wielojęzyczny: cały argument 2.0 opiera się na skoku wielojęzycznym, a cicha premiera to dokładnie sytuacja, w której deklarowane zyski albo potwierdzają się na twoich danych, albo nie — przetestuj języki, które faktycznie parsujesz, zanim uwierzysz w kartę produktu. Po drugie, stos samodzielnego hostingu: upewnij się, że twoja kompilacja vLLM ma wsparcie Nemotron Parse dla zdalnego kodu, zastosuj łatkę tied-output-head i zweryfikuj, czy twoja ścieżka serwowania wykonuje tokenizację online, zamiast ładować dopełniony plik tokenizer.json, który może rozszerzyć krótki prompt do 9000 tokenów. Po trzecie, kwestia licencji i usług: wagi są darmowe na licencji NVIDIA Open Model License, ale nie ogłoszono NIM, nie ma cennika ani umowy wsparcia — więc zaplanuj samodzielny hosting i poprowadź etap LLM dalej przez warstwę, która pozwoli ci wymieniać modele i przełączać się na zapasowe bez przeprojektowywania, czyli to, do czego służy platforma routingu.
