
Nemotron Parse 2.0 kontra MinerU: Nieogłoszony pretendent kontra domyślny wybór open-source
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA-Nemotron-Parse-2.0 i MinerU rozwiązują ten sam problem z przeciwnych kierunków. Oba rozwiązania przyjmują zeskanowaną lub wyrenderowaną stronę i zwracają czysty, ustrukturyzowany markdown z tabelami, wzorami i zachowaną kolejnością czytania. Jednak MinerU to domyślny wybór w świecie open source — dziesiątki tysięcy gwiazdek na GitHubie, licencja Apache-2.0 i hostowane API z darmowym dziennym limitem, czyli bezpieczny pierwszy wybór, po który sięga większość zespołów pracujących z dokumentami. Nemotron Parse 2.0 jest przeciwieństwem ugruntowanego rozwiązania: pojawił się na Hugging Face 3 sierpnia 2026 roku, NVIDIA nie wydała żadnego ogłoszenia na jego temat, a jego karta modelu zawiera zestaw deklaracji benchmarkowych, które — gdyby się potwierdziły — byłyby największym wydarzeniem w otwartym parsowaniu dokumentów w tym roku. To zestawienie jest celowo nierówne — uznany gracz kontra nieogłoszony challenger — a całe pytanie brzmi: ile właściwie warte są argumenty każdej ze stron.
Czym tak naprawdę jest każda strona
MinerU to kompletny system parsowania dokumentów od OpenDataLab, grupy danych stojącej za otwartymi wydaniami Shanghai AI Laboratory. Obecnym flagowcem jest MinerU 2.5-Pro, model wizyjno-językowy o parametrach 1,2B z linii wydań punktowych 2604/2605 (model 2604 zadebiutował w kwietniu 2026 roku, a po nim ukazało się odświeżenie 2605). Działa on w oparciu o dwustopniowy silnik — najpierw ogólna analiza układu strony, a następnie ukierunkowane rozpoznawanie na wycinkach w natywnej rozdzielczości — a projekt opakowuje model w wczytywanie PDF, DOCX, PPTX i XLSX, wykrywanie układu, rozpoznawanie formuł i tabel oraz rekonstrukcję kolejności czytania. Jest to referencyjny parser open-source do wstępnego przetwarzania RAG i ma społeczność, która to potwierdza.
Nemotron Parse 2.0 to wizyjny enkoder-dekoder o 0,9 mld parametrów od NVIDIA, należący do tej samej rodziny co NVIDIA-Nemotron-Parse-v1.2, który trafił na rynek w lutym 2026 roku. Wykorzystuje wizyjny enkoder ViT-H zbudowany na bazie NVIDIA C-RADIOv2 oraz dziesięciowarstwowy dekoder w stylu mBART. Strony wejściowe mogą mieć do 2048×1664 pikseli, generowanie przebiega do limitu 9000 tokenów, a model emituje te same strukturalne wyniki co MinerU: markdown lub czysty tekst, a także tabele w LaTeX, HTML, markdown, JSON, hierarchicznym JSON lub CSV, z klasami układu, ramkami ograniczającymi i kolejnością czytania. Repozytorium jest kompletne — konfiguracje, Dockerfile, zestaw testów z referencyjnymi wynikami — ale NVIDIA go nie promuje, nie ma pakietu NIM i żaden dostawca inferencji go nie hostuje. Obecnie jedyną opcją jest samodzielne hostowanie.

Historia ceny: „free" oznacza dwie różne rzeczy.
Największa praktyczna różnica polega na tym, że {{1}}MinerU{{/1}} można wywoływać za darmo, a {{2}}Nemotron Parse 2.0{{/2}} jest darmowy tylko do uruchomienia. Oficjalne API {{1}}MinerU{{/1}} na {{3}}mineru.net{{/3}} ma dzienny bezpłatny limit — około {{4}}1 000 stron o wysokim priorytecie dziennie{{/4}} w zależności od aktualnej promocji — w ramach którego nie ma opłat za pojedyncze wywołania, a każdy plik może mieć do {{5}}200 stron{{/5}}. Po przekroczeniu limitu zadania mają obniżony priorytet zamiast być fakturowane, a komercyjni dostawcy hostingu wyceniają model hostowany we własnym zakresie na mniej więcej {{6}}jedną dziesiątą centa za stronę{{/6}}. Jeśli Twój potok potrzebuje tysięcy stron dziennie i nie chcesz niczego utrzymywać, {{1}}MinerU{{/1}} ma rozwiązanie, które kosztuje niemal nic.
Nemotron Parse 2.0 nie ma takiej ścieżki. Wagi są bezpłatne na licencji NVIDIA Open Model License, ale karta modelu stwierdza, że nie jest on wdrażany przez żadnego dostawcę wnioskowania, a NVIDIA nie wyceniła ani nie ogłosiła opcji hostowanej. Korzystanie z niego oznacza wynajęcie lub posiadanie GPU, postawienie Transformers lub kompilacji vLLM z obsługą zdalnego kodu Nemotron Parse oraz radzenie sobie z poniższymi osobliwościami wdrożenia. Dla projektu o małej skali to realny koszt — GPU jest znacznie droższe niż darmowy poziom API przy kilkuset stronach miesięcznie. Dla zespołu, który już korzysta z infrastruktury GPU, darmowe wagi są prawdziwą zaletą; pytanie brzmi, czy koszty operacyjne są warte tego, co model obiecuje dodać.
Luka benchmarkowa: te liczby nie stoją naprzeciw siebie.
To jest sekcja, w której większość porównań po cichu zawodzi, więc mówmy wprost. Karta Nemotron Parse 2.0 raportuje cztery benchmarki: ParseBench ogółem: 0.6391 (wzrost z 0.5782 w v1.2), MOSCAR (wielojęzyczne OCR): 0.9102 BoC F1 (wzrost z 0.4410), IndicVisionBench: 0.7203 ANLS-character (wzrost z 0.0612) oraz podzbiór pisma ręcznego OmniDocBench mierzony odległością edycyjną tekstu, która poprawiła się z 0.9739 do 0.3395. MinerU 2.5-Pro podaje inny zestaw: ogólny wynik OmniDocBench v1.6 na poziomie 95.69 — najlepszy w swojej klasie, wyższy niż w przypadku znacznie większych modeli — a także 97.29 w parsowaniu gęstych formuł i odległość edycyjną tekstu 0.036 we własnych przebiegach OmniDocBench.
Oba modele dzielą nazwę „OmniDocBench”, przez co wyglądają na porównywalne, ale metryki już takie nie są. NVIDIA raportuje podzbiór obejmujący wyłącznie odręczne pismo jako odległość edycyjną; OpenDataLab raportuje ogólny wskaźnik złożony na innej wersji benchmarku. ParseBench to własny zestaw NVIDIA i nie ma w nim wpisu MinerU. MOSCAR i IndicVisionBench również nie mają wpisu MinerU. Każda liczba po obu stronach pochodzi od dostawców, a żaden model nie ma opublikowanego niezależnego testu strony trzeciej, w którym występowałby ten drugi. Oznacza to, że obecnie nie istnieje porównanie apples-to-apples, które rankingowałoby Nemotron Parse 2.0 względem MinerU — każdy, kto twierdzi, że jeden model „wygrywa” porównanie benchmarkowe, ekstrapoluje z różnych testów. Co można powiedzieć kierunkowo: twierdzenia MinerU są dojrzałe i przetrwały rok użytkowania przez społeczność, podczas gdy twierdzenia Nemotron Parse 2.0 są świeże, niezweryfikowane i — jeśli jego skoki w MOSCAR i IndicVision się powtórzą — stanowią dużą sprawę, zwłaszcza dla wielojęzycznego parsowania.

Gdzie różnią się przy rzeczywistych obciążeniach.

Odłóżmy na bok benchmarki, a różnice, które pojawiają się w potoku, dotyczą zakresu, opóźnienia i pokrycia wielojęzycznego.
• Zakres wejściowy — MinerU pobiera pełne pliki PDF do 200 stron na plik przez swoje API i scala tabele obejmujące wiele stron; Nemotron Parse 2.0 przyjmuje obraz strony o wymiarach do 2048×1664 na jedno wywołanie, więc dokument liczący 200 stron to 200 żądań. Jeśli Twoje dane wejściowe to plik PDF, to jest różnica w przepływie pracy, zanim jeszcze pojawi się kwestia dokładności.
• Dojrzałość serwowania — MinerU oferuje backendy vLLM i SGLang z publikowaną przepustowością (około 2 strony na sekundę na pojedynczym A100 dzięki silnikowi asynchronicznemu), runner Dockera oraz hostowane API. Historia serwowania Nemotron Parse 2.0 jest młoda i wyboista: vLLM wymaga obsługi zdalnego kodu, a na sprzęcie A100/A10 — backendu uwagi Triton; tokenizer dostarcza serializowany tokenizer.json z wbudowanym dopełnianiem do 9000 tokenów, co jeden stos serwujący odczuł jako prompt z sześciu tokenów rozrastający się do 54 000 identyfikatorów tokenów; a repozytorium zawiera poprawkę runtime dla buildów vLLM, które nie obsługują jego powiązanej głowy wyjściowej. Żadne z tego nie jest nie do pokonania, ale to realne tarcie.
• Wielojęzyczność — to tutaj karta Nemotron Parse 2.0 jest najmocniejsza. Wersja 2.0 rozszerzyła słownik z około 52 000 do 72 000 tokenów, szczególnie z myślą o wielojęzycznym OCR, a deklarowane zyski koncentrują się właśnie tam: MOSCAR wzrósł z 0,44 do 0,91, a IndicVisionBench (bengalski, hindi, tamilski i siedem innych skryptów indyjskich) z 0,06 do 0,72. MinerU wspiera 109 języków jako funkcję flagową, ale jego dowodem jest złożony wskaźnik OmniDocBench, a nie podział według poszczególnych skryptów. Jeśli Twój korpus zawiera wiele tekstów w skryptach indyjskich lub niskozasobowych, liczby Nemotron Parse 2.0 są ciekawszą tezą do przetestowania — są także najmniej niezależnie zweryfikowane.
• Pismo odręczne — największa pojedyncza różnica na karcie NVIDIA dotyczy pisma odręcznego: odległość edycyjna na podzbiorze notatek OmniDocBench spada z 0.97 do 0.34. Własna odległość edycyjna tekstu MinerU wynosząca 0.036 dotyczy ogółu przebiegów OmniDocBench, a nie podzbioru notatek, więc znowu te liczby nie są bezpośrednio porównywalne. Ale odręczne notatki to klasyczny obszar, w którym oba rozwiązania zawodzą, i to jedyny obszar, w którym deklarowane ulepszenie Nemotron Parse 2.0 jest wystarczająco duże, aby uzasadnić bezpośredni test na własnych stronach.
Kto powinien wybrać, które
Wybierz MinerU, jeśli potrzebujesz parsera, którego możesz użyć od razu: darmowy dzienny limit, dojrzałe serwowanie, obsługa pełnych plików PDF, licencja Apache-2.0 bez przeglądu zgodności oraz społeczność na tyle duża, że odpowiedzi na pytania dotyczące konfiguracji już istnieją. To domyślny wybór nie bez powodu, a w przypadku większości zadań przetwarzania wstępnego dla RAG jest to opcja obarczona mniejszym ryzykiem.
Wybierz Nemotron Parse 2.0, jeśli już swobodnie radzisz sobie z samodzielnym hostowaniem modeli — zwłaszcza jeśli jesteś po stronie NVIDIA NIM lub NeMo, bo v1.2 jest serwowany jako NIM, a 2.0 wygląda na jego następcę — a także jeśli konkretną potrzebą Twojego korpusu jest obsługa wielu języków lub pisma odręcznego. Weekendowy test na własnych stronach w językach indyjskich lub pełnych notatek powie Ci więcej niż jakakolwiek tabela benchmarków, ponieważ te deklaracje albo się potwierdzą, albo upadną w starciu z niezależnymi danymi. Tylko nie planuj ścieżki produkcyjnej wokół nieogłoszonego modelu, dopóki nie przeprowadzisz tego testu i nie potwierdzisz, że tokenizer i osobliwości serwowania są obsłużone w Twoim stacku.
Dlaczego parser nie jest jedynym kosztem w potoku
Cokolwiek wybierzesz, parser jest zwykle najtańszym etapem w potoku przetwarzania dokumentów, gdy wolumen jest już realny. Najdroższym etapem jest LLM, który zamienia sparsowany markdown na streszczenia, ustrukturyzowane rekordy lub odpowiedzi — i to właśnie na tym etapie warstwa routingu zmienia ekonomikę. OrcaRouter udostępnia 200+ modeli za jednym API po cenie listowej dostawcy, bez marży, więc obniżka ceny u dostawcy jest aktywna tego samego dnia, w którym zostanie ogłoszona, a automatyczne przełączanie awaryjne sprawia, że jeden zdegradowany dostawca nie wstrzymuje całego zadania ekstrakcji. Konkretnie: możesz przetestować deklaracje Nemotron Parse 2.0 dotyczące rozpoznawania pisma odręcznego przeciwko MinerU na własnym korpusie, bez wiązania swojego downstreamowego stosu modeli z żadnym z tych parserów, ponieważ wymiana parsera i warstwa LLM są od siebie odseparowane. Nie hostujemy dziś żadnego z tych parserów — Nemotron Parse 2.0 to model hostowany samodzielnie, a MinerU działa we własnej usłudze — ale warstwa routingu na etapie LLM to dokładnie to, co sprawia, że decyzja o parserze nie staje się decyzją o zablokowaniu się na danym rozwiązaniu.
Sedno sprawy
{{1}}MinerU to racjonalny domyślny wybór: dojrzały, darmowy przy małej skali, na liberalnej licencji i sprawdzony w produkcji.{{/1}} {{2}}Nemotron Parse 2.0 to ciekawy zakład: model NVIDIA o 0,9 mld parametrów, wypuszczony po cichu pięć dni temu. Jego karta modelu obiecuje ogromny skok w zakresie wielojęzyczności i pisma odręcznego, którego nikt niezależnie nie zweryfikował.{{/2}} {{3}}Jeśli przetwarzasz głównie anglojęzyczne dokumenty techniczne na dużą skalę, MinerU jest odpowiedzią, a ryzyko związane z Nemotron Parse 2.0 nie jest tego warte.{{/3}} {{4}}Jeśli przetwarzasz pisma indyjskie lub skrypty niskozasobowe albo notatki odręczne, obietnice są wystarczająco duże — a wagi wystarczająco darmowe — aby samodzielne przeprowadzenie testu było tanie.{{/4}} {{5}}To, że NVIDIA wypuszcza nowy parser mniej więcej co kwartał (v1.1 w listopadzie 2025, v1.2 w lutym 2026, 2.0 teraz), sugeruje, że wkrótce może paść ogłoszenie; dopóki to nie nastąpi, traktuj liczby 2.0 jako orientacyjne i testuj na własnym korpusie.{{/5}}
Często zadawane pytania
Czy Nemotron Parse 2.0 jest dostępny przez jakieś API?
Nie przez hostowaną usługę. Karta modelu na Hugging Face informuje, że model nie został wdrożony przez żadnego dostawcę usług inferencyjnych, a NVIDIA nie ogłosiła pakietów NIM ani cen dla tego modelu — według stanu na początek sierpnia 2026 r. Jedynym sposobem uruchomienia go jest samodzielne hostowanie wag za pomocą Hugging Face Transformers z parametrem trust_remote_code lub za pomocą kompilacji vLLM zawierającej obsługę zdalnego kodu dla Nemotron Parse. MinerU ma natomiast oficjalne API z darmowym dziennym limitem stron.
Który model jest lepszy do przetwarzania wstępnego RAG?
Dla typowych potoków RAG — dokumentów technicznych w języku angielskim i językach CJK, tabel oraz mieszanych układów — MinerU jest bezpieczniejszym, bardziej sprawdzonym wyborem: przyjmuje pełne pliki PDF, scala tabele rozciągające się na wiele stron, ma dojrzałe serwowanie i nic nie kosztuje przy małej skali dzięki darmowemu poziomowi. Nemotron Parse 2.0 staje się właściwym wyborem tylko wtedy, gdy w Twoim korpusie dominują pisma indyjskie (Indic) lub niskozasobowe systemy pisma, odręczne notatki albo strony pełne wykresów, na których koncentrują się jego deklarowane korzyści — a nawet wtedy zweryfikuj to na własnych dokumentach, zanim się zdecydujesz.
Czy liczby z benchmarków na dwóch kartach modeli są bezpośrednio porównywalne?
Nie. Nemotron Parse 2.0 raportuje ParseBench (własny zestaw NVIDIA), MOSCAR, IndicVisionBench oraz podzbiór pisma odręcznego OmniDocBench jako odległość edycyjną. MinerU 2.5-Pro raportuje ogólny wskaźnik zbiorczy OmniDocBench v1.6 oraz metryki formuł i edycji tekstu. Nakładająca się nazwa benchmarku nie jest tą samą metryką, żaden niezależny test nie umieszcza obu modeli na tym samym teście, a każda liczba na obu kartach pochodzi od dostawców. Traktuj je jako orientacyjne, a nie bezpośrednio porównywalne.
