
Nemotron Parse 2.0 vs MinerU: 예고되지 않은 도전자 vs 오픈소스의 기본값
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA-Nemotron-Parse-2.0과 MinerU는 같은 문제를 서로 반대 방향에서 해결합니다. 둘 다 스캔되거나 렌더링된 페이지를 입력받아 표, 수식, 읽기 순서가 유지된 깔끔하고 구조화된 마크다운을 반환합니다. 하지만 MinerU는 오픈소스의 기본 선택입니다. 수만 개의 GitHub 스타, Apache-2.0 라이선스, 무료 일일 할당량이 있는 호스팅 API까지 갖춰, 대부분의 문서 팀이 가장 먼저 찾는 안전한 선택입니다. Nemotron Parse 2.0은 정반대입니다. 2026년 8월 3일 Hugging Face에 등장했고, NVIDIA는 이에 대한 어떤 발표도 하지 않았으며, 모델 카드에는 공개 문서 파싱 분야에서 올해 가장 큰 사건이 될 만한 벤치마크 주장들이 담겨 있습니다. 이 비교는 의도적으로 한쪽으로 치우쳐 있습니다. 기존 선두주자 대비 발표되지 않은 도전자라는 구도이며, 핵심 질문은 각자의 주장이 실제로 얼마나 가치 있는지입니다.
각 측이 실제로 무엇인지
MinerU는 Shanghai AI Laboratory의 오픈 릴리스를 뒷받침하는 데이터 그룹 OpenDataLab이 개발한 완전한 문서 파싱 시스템입니다. 현재 플래그십은 2604/2605 포인트 릴리스 라인의 1.2B 비전-언어 모델인 MinerU 2.5-Pro입니다(2604 모델은 2026년 4월에 출시되었고, 이후 2605 리프레시가 이어졌습니다). 이 시스템은 2단계 엔진을 기반으로 합니다 — 먼저 거친 전역 레이아웃 분석을 수행한 다음, 네이티브 해상도 크롭에 대한 타겟 인식을 수행합니다 — 그리고 이 프로젝트는 PDF, DOCX, PPTX, XLSX 수집, 레이아웃 감지, 수식 및 표 인식, 읽기 순서 재구성 기능으로 모델을 감쌉니다. 이는 RAG 전처리를 위한 참조 오픈소스 파서이며, 이를 입증하는 커뮤니티를 보유하고 있습니다.
{{1}}Nemotron Parse 2.0{{/1}}은 {{2}}NVIDIA{{/2}}가 만든 0.9B 비전-인코더-디코더로, 2026년 2월에 출시된 {{3}}NVIDIA-Nemotron-Parse-v1.2{{/3}}와 같은 제품군에 속합니다. {{5}}NVIDIA의 C-RADIOv2{{/5}} 백본을 기반으로 하는 {{4}}ViT-H{{/4}} 비전 인코더와 10-레이어 {{6}}mBART 스타일{{/6}} 디코더를 사용합니다. 입력 페이지는 최대 2048×1664까지 지원하며, 생성은 9,000토큰 상한으로 제한됩니다. 또한 {{7}}MinerU{{/7}}와 동일한 구조화된 출력(마크다운 또는 일반 텍스트, 그리고 LaTeX, HTML, 마크다운, JSON, 계층적 JSON 또는 CSV 형식의 테이블)을 생성하며, 레이아웃 클래스, 바운딩 박스, 읽기 순서도 포함합니다. 저장소에는 구성 파일, Dockerfile, 골든 출력이 포함된 테스트 스위트가 완비되어 있지만, {{8}}NVIDIA{{/8}}는 이를 홍보하지 않았고, NIM 패키징도 없으며, 어떤 추론 제공자도 이를 호스팅하지 않습니다. 현재로서는 자체 호스팅이 유일한 옵션입니다.

가격 이야기: "무료"는 두 가지 다른 의미를 지닌다.
가장 실질적인 차이점은 MinerU는 호출이 무료이고 Nemotron Parse 2.0은 실행만 무료라는 점입니다. mineru.net의 MinerU 공식 API는 현재 프로모션에 따라 하루 약 1,000페이지의 우선 처리 무료 할당량을 제공하며, 호출당 요금은 없고 파일당 최대 200페이지까지 지원합니다. 할당량을 초과하면 비용이 청구되지 않고 작업 우선순위만 낮아집니다. 또한 상용 호스팅 업체는 자체 호스팅 모델을 페이지당 약 0.1센트 미만의 가격으로 제공합니다. 하루에 수천 페이지를 처리해야 하고 직접 운영할 의사가 없다면, MinerU는 거의 비용이 들지 않는 경로를 제공합니다.
Nemotron Parse 2.0에는 그러한 경로가 없습니다. 가중치는 NVIDIA Open Model License에 따라 무료이지만, 모델 카드에는 어떤 추론 제공업체도 배포하지 않는다고 명시되어 있으며, NVIDIA는 호스팅 옵션에 대한 가격을 책정하거나 발표하지 않았습니다. 이를 사용하려면 GPU를 임대하거나 소유하고, Nemotron Parse 원격 코드 지원이 포함된 Transformers 또는 vLLM 빌드를 구성하고, 아래의 배포 시 특이사항을 처리해야 합니다. 소규모 프로젝트의 경우 이는 실질적인 비용입니다. GPU는 월 수백 페이지 수준의 무료 API 티어보다 훨씬 비쌉니다. 이미 GPU 인프라를 운영하는 팀에게는 가중치가 무료라는 점이 진정한 장점입니다. 문제는 운영 오버헤드가 모델이 추가한다고 주장하는 가치만큼 worth it인지입니다.
벤치마크 격차: 이 숫자들은 서로 마주보지 않는다.
대부분의 비교가 조용히 잘못되는 부분이 바로 이 구간이므로, 명확히 짚고 넘어가겠습니다. Nemotron Parse 2.0의 카드에는 네 가지 벤치마크가 보고되어 있습니다: ParseBench 종합 점수 0.6391(v1.2의 0.5782에서 상승), MOSCAR 다국어 OCR BoC F1 0.9102(0.4410에서 상승), IndicVisionBench ANLS-문자 0.7203(0.0612에서 상승), 그리고 OmniDocBench 필기체 하위 집합은 텍스트 편집 거리가 0.9739에서 0.3395로 개선된 것으로 측정되었습니다. MinerU 2.5-Pro는 다른 벤치마크 세트를 보고합니다: OmniDocBench v1.6 종합 점수 95.69 — 훨씬 더 큰 모델들을 제치고 최고 수준 — 그리고 복잡한 수식 파싱에서 97.29, 자체 OmniDocBench 실행에서 텍스트 편집 거리 0.036을 기록했습니다.
두 벤치마크는 'OmniDocBench'라는 이름을 공유해 서로 비교 가능해 보이지만, 실제 지표는 그렇지 않습니다. NVIDIA는 손글씨만 포함된 하위 집합을 편집 거리로 보고하고, OpenDataLab은 다른 벤치마크 버전의 전반적인 종합 점수를 보고합니다. ParseBench는 NVIDIA 자체 스위트이며 MinerU 항목이 없습니다. MOSCAR와 IndicVisionBench에도 MinerU 항목이 없습니다. 양쪽의 모든 수치는 벤더가 보고한 것이고, 두 모델 모두 상대 모델이 포함된 독립적인 제3자 실행 결과가 공개되어 있지 않습니다. 즉, 현재 Nemotron Parse 2.0과 MinerU를 비교해 순위를 매길 수 있는 동등한 기준의 수치는 없습니다. 어떤 모델이 벤치마크 비교에서 '승리'한다고 말하는 사람은 서로 다른 테스트에서 외삽하고 있는 것입니다. 방향성 있게 말할 수 있는 것은 이렇습니다. MinerU의 주장은 성숙했고 1년간의 커뮤니티 사용으로 검증되었지만, Nemotron Parse 2.0의 주장은 새롭고 감사되지 않았으며, MOSCAR와 IndicVision에서의 도약이 재현된다면 특히 다국어 파싱에 있어 큰 의미가 있을 것입니다.

실제 워크로드에서 갈라지는 지점

벤치마크는 제쳐 두고, 파이프라인에서 나타나는 차이점은 범위, 지연 시간, 다국어 지원 범위에 관한 것입니다.
• 입력 범위 — MinerU는 API를 통해 파일당 최대 200페이지의 전체 PDF를 처리하고 페이지를 넘나드는 표를 병합합니다. Nemotron Parse 2.0은 호출당 최대 2048×1664 페이지 이미지를 사용하므로 200페이지 문서는 200번의 요청이 됩니다. 입력이 PDF라면, 정확도 문제를 논하기 전에 워크플로우 차이가 있습니다.
• 서비스 성숙도 — MinerU는 vLLM 및 SGLang 백엔드를 제공하며, 게시된 처리량(비동기 엔진을 통해 단일 A100에서 초당 약 2페이지), Docker 러너, 호스팅 API를 갖추고 있습니다. Nemotron Parse 2.0의 서빙 상황은 초기 단계이며 순탄하지 않습니다: vLLM은 원격 코드 지원이 필요하며, A100/A10 하드웨어에서는 Triton 어텐션 백엔드가 필요합니다. 토크나이저는 9,000 토큰으로 패딩이 내장된 직렬화된 tokenizer.json을 제공하는데, 한 서빙 스택은 6토큰 프롬프트가 54,000 토큰 ID로 폭증하는 문제를 겪었습니다. 또한 저장소에는 tied 출력 헤드를 지원하지 않는 vLLM 빌드를 위한 런타임 패치가 포함되어 있습니다. 이 중 어느 것도 극복 불가능하지는 않지만, 실질적인 마찰입니다.
• {{1}}다국어{{/1}} — 이것이 Nemotron Parse 2.0이 가장 강점을 내세우는 부분입니다. 2.0 릴리스는 특히 다국어 OCR을 위해 어휘를 약 52,000개에서 72,000개 토큰으로 확장했으며, 주장된 개선 효과는 바로 그 부분에 집중되어 있습니다: {{2}}MOSCAR가 0.44에서 0.91로 상승{{/2}}, 그리고 {{3}}IndicVisionBench(벵골어, 힌디어, 타밀어 및 7개 이상의 인도 문자)가 0.06에서 0.72로 상승{{/3}}. MinerU는 헤드라인 기능으로 109개 언어를 지원하지만, 그 증거는 {{4}}OmniDocBench 종합 점수{{/4}}이지 {{5}}문자별 분석{{/5}}이 아닙니다. 말뭉치가 인도계 또는 저자원 문자에 치중되어 있다면, Nemotron Parse 2.0의 수치가 더 흥미로운 테스트 대상입니다 — 또한 가장 덜 독립적으로 검증된 수치이기도 합니다.
• 필기 — NVIDIA 카드에서 가장 큰 델타는 필기입니다. OmniDocBench 노트 하위 집합의 편집 거리(edit distance)가 0.97에서 0.34로 떨어집니다. MinerU 자체의 0.036 텍스트 편집 거리는 전체 OmniDocBench 실행에 대한 측정값이지 필기 하위 집합에 대한 것이 아니므로, 역시 두 수치는 서로 직접 비교할 수 없습니다. 하지만 필기 노트는 두 시스템 모두에게 전형적인 실패 지점이며, Nemotron Parse 2.0이 주장하는 개선 효과가 직접 테스트를 수행할 만큼 충분히 큰 유일한 영역이 바로 이 부분입니다.
누가 어떤 것을 골라야 하나요
MinerU를 선택하세요. 지금 바로 호출할 수 있는 파서를 원한다면: 무료 일일 티어, 성숙한 서빙, 전체 PDF 입력, 규정 준수 검토가 필요 없는 Apache-2.0 라이선스, 그리고 설정 질문에 대한 답변이 이미 존재할 만큼 충분히 큰 커뮤니티를 제공합니다. 기본값인 데는 이유가 있으며, 대부분의 RAG 전처리 작업 부하에서 더 낮은 위험의 선택입니다.
이미 모델 자체 호스팅에 익숙하고, 말뭉치에 다국어 또는 필기체 인식 기능이 특별히 필요하다면 Nemotron Parse 2.0을 선택하세요. 특히 NVIDIA NIM이나 NeMo 쪽에서 작업 중이라면 더욱 좋은데, v1.2가 NIM으로 제공되고 2.0이 그 후속 버전처럼 보이기 때문입니다. 주말 동안 자신의 인도어(Indic) 또는 필기 노트가 많은 페이지에서 테스트해 보면, 어떤 벤치마크 표보다 더 많은 것을 알 수 있습니다. 그 주장들은 독립적인 데이터에서 재현되거나 무너지기 때문입니다. 다만, 그 테스트를 실행하고 토크나이저와 서빙 특이 사항이 스택에서 처리되는지 확인하기 전까지는 아직 공식 발표되지 않은 모델을 기반으로 프로덕션 경로를 계획하지 마세요.
파서가 파이프라인에서 유일한 비용이 아닌 이유
어떤 것을 선택하든, {{1}}실제 볼륨이 발생하면 파서는 보통 문서 파이프라인에서 가장 저렴한 단계입니다{{/1}}. 비용이 많이 드는 단계는 {{2}}파싱된 마크다운을 요약, 구조화된 레코드 또는 답변으로 변환하는 LLM입니다{{/2}}. 그리고 바로 그 단계에서 {{3}}라우팅 계층이 경제성을 바꿉니다{{/3}}. OrcaRouter는 200개 이상의 모델을 단일 API 뒤에 공급업체 정가 그대로, 마크업 없이 제공하므로 공급업체의 가격 인하는 발표 당일 바로 적용됩니다. 또한 자동 장애 조치 덕분에 성능이 저하된 공급업체가 하나 있어도 전체 추출 작업이 중단되지 않습니다. 구체적으로 말하자면: {{4}}자신의 코퍼스에서 Nemotron Parse 2.0의 필기 인식 성능을 MinerU와 비교 테스트할 수 있습니다{{/4}}. 두 파서 중 어느 것에도 다운스트림 모델 스택을 고정하지 않고 말이죠. {{5}}파서 교체와 LLM 계층이 분리되어 있기{{/5}} 때문입니다. 현재 저희는 두 파서 중 어느 것도 호스팅하지 않습니다. Nemotron Parse 2.0은 자체 호스팅 모델이고 MinerU는 자체 서비스에서 실행됩니다. 하지만 {{6}}LLM 단계의 라우팅 계층이야말로 파서 선택이 특정 제품에 종속되는 결정이 되지 않도록 막아주는 요소입니다{{/6}}.
결론
MinerU는 합리적인 기본 선택입니다. 성숙했고, 소규모에서는 무료로 호출할 수 있으며, 허용적 라이선스로 제공되고, 프로덕션에서 검증되었습니다. Nemotron Parse 2.0은 흥미로운 승부수입니다. 5일 전 조용히 출시된 0.9B NVIDIA 모델로, 그 모델 카드는 아무도 독립적으로 검증하지 못한 극적인 다국어 및 필기 인식 도약을 주장합니다. 대부분 영어 기술 문서를 대량으로 파싱한다면 MinerU가 정답이고, Nemotron Parse 2.0의 리스크는 감수할 가치가 없습니다. 인도 문자나 저자원 문자 체계, 또는 필기 노트를 파싱한다면, 그 주장은 충분히 크고 — 가중치도 충분히 무료라서 — 직접 테스트를 돌려보는 것이 저렴합니다. NVIDIA가 거의 분기마다 새 파서를 출시하고 있다는 점(2025년 11월 v1.1, 2026년 2월 v1.2, 지금 2.0)은 곧 발표가 이어질 수 있음을 시사합니다. 그때까지는 2.0의 수치를 방향성 참고치로만 보고 자체 말뭉치로 테스트하세요.
자주 묻는 질문
Nemotron Parse 2.0은 API를 통해 사용할 수 있나요?
호스팅된 것을 통해서는 아닙니다. Hugging Face 카드에 따르면 이 모델은 어떤 추론 제공업체에도 배포되어 있지 않으며, 2026년 8월 초 기준으로 NVIDIA는 이 모델에 대한 NIM 패키징이나 가격을 발표하지 않았습니다. 이 모델을 실행하는 유일한 방법은 trust_remote_code를 사용하여 Hugging Face Transformers를 통해 가중치를 자체 호스팅하거나, Nemotron Parse 원격 코드 지원이 포함된 vLLM 빌드를 사용하는 것입니다. 반면 MinerU는 무료 일일 페이지 할당량이 있는 공식 API를 제공합니다.
RAG 전처리에 어떤 모델이 더 나은가요?
일반적인 RAG 파이프라인(영어 및 CJK 기술 문서, 표, 혼합 레이아웃)의 경우 MinerU가 더 안전하고 검증된 선택입니다. 전체 PDF를 처리하고, 페이지를 넘나드는 표를 병합하며, 성숙한 서빙 기능을 갖추고 있고, 무료 티어 덕분에 소규모에서는 비용이 들지 않습니다. Nemotron Parse 2.0은 코퍼스가 인도 문자나 저리소스 문자, 필기 노트 또는 차트가 많은 페이지에 집중되어 있어 그 주장된 이점이 집중되는 경우에만 올바른 선택이 되며, 그 경우에도 도입을 결정하기 전에 자체 문서로 검증해야 합니다.
두 모델 카드에 있는 벤치마크 수치가 직접적으로 비교 가능한가요?
아니요. Nemotron Parse 2.0은 ParseBench(NVIDIA 자체 스위트), MOSCAR, IndicVisionBench, 그리고 OmniDocBench 필기 하위 집합을 편집 거리(edit distance)로 보고합니다. MinerU 2.5-Pro는 OmniDocBench v1.6 전체 복합 점수와 수식 및 텍스트 편집 지표를 보고합니다. 겹치는 벤치마크 이름이 동일한 지표는 아니며, 두 모델을 동일한 테스트에 올린 독립적인 실행은 없고, 두 카드의 모든 수치는 벤더가 보고한 것입니다. 이를 방향성 지표로 간주하고 직접 비교하지 마십시오.
