
Nemotron Parse 2.0 vs olmOCR: 둘 다 파싱이라 불리는 두 가지 작업
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026년 8월 3일, NVIDIA는 아무에게도 알리지 않은 채 새로운 문서 파싱 모델을 Hugging Face에 게시했다. NVIDIA-Nemotron-Parse-2.0은 0.9B 규모의 비전-인코더-디코더로, 모델 카드는 2026년 2월의 전작보다 다국어 및 차트 인식에서 도약을 이뤘다고 주장한다. 그리고 이 모델은 olmOCR과 같은 생태계의 구석에 안착했는데, 더 정확히는 PDF를 LLM 학습 데이터로 변환하는 기본 방식으로 조용히 자리 잡은 Allen Institute for AI의 7B 선형화 모델 olmOCR-2-7B-1025다. 이 둘을 정면 대결로 보는 것 자체가 함정이다. 두 모델 모두 "문서 파싱"으로 설명되지만, 서로 다른 결과물을 반환하고 서로 다른 파이프라인에 투입되며, 벤치마크 수치는 실제로 서로 마주한 적이 없다. 진짜 질문은 파서를 고용할 때 두 가지 작업 중 어떤 작업을 시킬 것이냐다.
두 유물
Nemotron Parse 2.0은 레이아웃 의미론(layout-semantics) 엔진입니다. 페이지 이미지와 작업 프롬프트(task prompt)를 입력하면 텍스트와 그 위에 얹힌 의미론적 계층(semantic layer)을 반환합니다: 각 영역에 대한 레이아웃 클래스(제목, 섹션, 캡션, 표, 차트, 헤더, 푸터, 각주, 참고문헌 항목), 각 영역의 경계 상자(bounding box), 그리고 그 사이의 읽기 순서가 포함되며, 마크다운은 그 위에 얹을 수 있는 선택적 직렬화 형식 중 하나입니다. olmOCR 2는 선형화기(linearizer)입니다. 동일한 페이지를 입력받아 기본 언어, 회전 보정, 페이지가 표인지 다이어그램인지와 같은 페이지 수준 메타데이터를 기록하는 짧은 YAML frontmatter와 함께 깔끔하게 선형화된 마크다운을 반환합니다. 상자도, 클래스도, 기하학 정보도 없습니다. 단 한 번의 처리로 문서 순서대로 텍스트를 출력합니다.
산출물이 작업을 결정합니다. 파이프라인이 사실을 페이지의 특정 영역으로 소급 인용해야 하거나, 스캔 문서에서 표를 강조해야 하거나, 문서 인텔리전스를 위해 레이아웃 의미론을 추출해야 한다면 지오메트리가 필요합니다 — 그것이 바로 Nemotron Parse 2.0의 출력 공간입니다. 학습 데이터를 구축 중이거나 토큰만 소비하는 텍스트 LLM에 입력을 공급한다면, 지오메트리는 노이즈에 불과하고 선형화된 마크다운이 정확히 맞습니다 — 그것이 olmOCR의 전체 설계입니다. 별도의 검출기를 사용해 olmOCR의 출력에 레이아웃 검출을 덧붙일 수도 있고, Nemotron Parse 2.0의 박스를 버리고 마크다운만 유지할 수도 있습니다. 그러나 각 모델은 그러한 작업 중 하나를 고유 기능으로 처리하도록 구축되었습니다.
조용한 배: 저장소가 보여주는 것, 확인되지 않은 것
NVIDIA-Nemotron-Parse-2.0이 2026년 8월 3일 Hugging Face에 발표도, 블로그 게시물도, NIM 패키징도 없이 공개되었습니다. 알 수 있는 것은 저장소(repo)뿐입니다. 이는 0.9B 규모의 비전-인코더-디코더로, NVIDIA의 C-RADIO 백본을 기반으로 한 ViT-H 이미지 인코더, 경량 1D-컨볼루션 어댑터, 10개 층의 mBART 스타일 디코더로 구성됩니다. 토크나이저는 약 20,000개 항목이 늘어 총 약 72,000개에 이르렀으며, 이는 명시적으로 다국어 지원을 더 효율적으로 하기 위한 것입니다. 모델 카드는 새로운 class_Chart 토큰을 통한 차트 인식 파싱을 핵심 기능으로 내세우고 있으며, 그 외에도 다양한 테이블 직렬화 방식(LaTeX, HTML, markdown, JSON, 계층적 JSON, CSV)을 지원합니다. 두 개의 선택적 로짓 프로세서가 함께 제공되는데, 하나는 반복적인 구조화 출력을 중단시키고, 다른 하나는 테이블 크롭에 테이블 구조를 강제합니다. 권장 입력 해상도는 약 1024×1280에서 1664×2048까지이며, 생성은 최대 9,000토큰으로 제한됩니다. 모델 카드에는 Ampere, Hopper, Blackwell, Turing 하드웨어에서 Transformers, vLLM, SGLang, Docker Model Runner를 런타임으로 명시하고 있습니다.
하지만 이러한 주장은 모두 NVIDIA 자체의 것이며, 어느 것도 독립적으로 재현된 바 없습니다. 모델 카드에 따르면 ParseBench 종합 점수는 0.6391(v1.2의 0.5782에서 상승), MOSCAR 다국어 OCR BoC-F1은 0.9102(0.4410에서 상승), IndicVisionBench ANLS-character는 0.7203(0.0612에서 상승), OmniDocBench 필기체 하위 집합의 텍스트 편집 거리(text-edit distance)는 0.9739에서 0.3395로 개선되었습니다. 이것들은 가장 큰 상승 폭이면서도 가장 검증이 덜 된 부분입니다. ParseBench는 NVIDIA 자체 벤치마크 스위트이며, 아직 어떤 제3자도 독립적인 코퍼스로 Parse 2.0을 실행한 적이 없습니다. 확인되지 않은 것은 점수만이 아닙니다. 호스팅 추론도 없고(모델 카드에는 이 모델이 어떤 추론 제공업체에도 배포되지 않았다고 명시되어 있습니다), 가격도 없으며, 이 둘 모두에 대한 발표된 일정도 없습니다.

olmOCR 2: 모두가 이미 기준으로 삼는 현역
olmOCR는 이제 이 카테고리에서 논쟁의 대상이 되는 벤치마크를 처음 만든 모델입니다. 2025년 10월 22일에 출시된 olmOCR-2-7B-1025는 270,000페이지 분량의 olmOCR-mix-1025 코퍼스로 Qwen2.5-VL-7B-Instruct를 미세 조정한 7B 비전-언어 모델로서, 이후 자동화된 "단위 테스트" 보상에 대한 GRPO 강화 학습으로 정제되었습니다. 단위 테스트는 테이블이 구조를 유지했는지, 수식이 정확히 전사되었는지, 읽기 순서가 유지되었는지를 확인하는 결정적 검사입니다. 이러한 단위 테스트 프레임워크는 olmOCR-Bench로 발전했으며, 약 1,400개의 PDF와 7,000개 이상의 검사 항목을 포함합니다. 이제 이는 업계의 사실상 표준 벤치마크가 되었으며, Marker, MinerU 및 수십 개의 상용 OCR 모델이 이 벤치마크로 결과를 발표하고 있습니다. olmOCR 2 자체는 종합 82.4점을 기록했는데, 이는 이전 릴리스보다 약 4포인트 높은 수치이며, AI2가 같은 페이지에서 인용한 Marker(76.1) 및 MinerU(75.8) 수치보다도 높습니다.
olmOCR은 이 두 옵션 중 더 성숙한 선택이기도 합니다. Apache-2.0 라이선스로 배포되며, 지난 한 달간 가중치가 약 {{1}}218,000{{/1}}회 다운로드되었습니다. {{2}}olmOCR{{/2}} 툴킷은 vLLM 백엔드에서 렌더링, 회전, 재시도를 대규모로 처리합니다. AI2의 배치 추정에 따르면 임대 GPU에서 이 파이프라인의 비용은 백만 페이지당 약 {{3}}$176–190{{/3}}이며, FP8 빌드는 단일 H100에서 초당 약 {{4}}3,400{{/4}} 출력 토큰을 생성합니다. 이는 릴리스 게시물에서 {{5}}"10,000페이지를 2달러 미만으로 처리"{{/5}}라고 인용할 만큼 빠른 속도입니다. 절충점은 언어입니다. olmOCR은 명시적으로 영어 디지털 인쇄물을 위해 구축되고 벤치마킹되었으며, 모델 카드에도 영어로 분류됩니다. {{6}}Nemotron{{/6}} Parse 2.0의 전체적인 포지셔닝은 정반대입니다. 주장하는 성능 향상은 CJK 및 인도 문자에 집중되어 있습니다.

트레이드오프가 나타나는 6개의 행
두 모델 모두 오픈 가중치(open-weight)이며, 둘 다 Transformers, vLLM, 또는 SGLang에서 실행되고, 현재 둘 다 자체 호스팅이 가능합니다. 둘 중 하나를 선택할 때 중요한 기준은 다음과 같습니다:
• 크기 — Nemotron Parse 2.0은 0.9B, olmOCR 2는 7B입니다. 파라미터는 약 8배, VRAM 요구량도 약 8배입니다.
• 출력 — Nemotron Parse 2.0은 텍스트, 레이아웃 클래스, 바운딩 박스, 읽기 순서 및 마크다운을 반환하며, olmOCR 2는 YAML 메타데이터 블록이 포함된 선형화된 마크다운을 반환합니다.
• 다국어 — Nemotron Parse 2.0은 강력한 CJK 및 인도어 지원을 내세웁니다 (MOSCAR 0.9102, IndicVisionBench 0.7203, 공급업체 보고 기준); olmOCR 2는 영어 우선입니다.
• 플래그십 점수 — Nemotron Parse 2.0은 ParseBench 0.6391을 보고함(NVIDIA 자체, 미검증); olmOCR 2는 olmOCR-Bench에서 82.4점을 기록함(AI2 자체, 커뮤니티 재사용 10개월).
• {{1}}라이선스{{/1}} — Nemotron Parse 2.0은 NVIDIA Open Model License에 따라 배포되며, olmOCR 2는 Apache-2.0입니다.
• 출시됨 — Nemotron Parse 2.0은 2026년 8월 3일에 예고 없이 출시되었고, olmOCR 2는 2025년 10월 22일에 출시 게시물과 함께 배포되었습니다.

결정이 실제로 타격을 주는 세 곳
규모와 지연 시간. 0.9B 디코더는 7B VLM보다 서빙 비용이 훨씬 저렴합니다. 더 작은 GPU, 더 적은 VRAM, 동일한 하드웨어에서 초당 더 많은 페이지 처리, 그리고 GPU 시간 비용을 지불할 때 페이지당 더 낮은 비용이 필요합니다. 이미 GPU 인프라를 운영 중이고 말뭉치가 크다면, 이는 실질적인 월간 비용 차이를 만듭니다. olmOCR 자체 수치는 FP8 양자화를 통해 7B 모델이 얼마나 빨라질 수 있는지 보여주지만, 그 속도를 달성하려면 여전히 H100급 GPU가 필요합니다. Nemotron Parse 2.0의 최소 하드웨어는 Ampere 세대 카드입니다.
{{1}}다국어 지원.{{/1}} {{2}}이것이 가장 비대칭적인 행입니다.{{/2}} Nemotron Parse 2.0은 다국어 OCR을 위해 토크나이저를 약 20,000개 항목만큼 늘렸으며, 모델 카드가 주장하는 성능 향상은 인도 문자와 CJK에 집중되어 있습니다. olmOCR 2는 그러한 주장을 하지 않습니다. {{3}}해당 언어 태그는 영어입니다.{{/3}} 힌디어, 타밀어, 벵골어, 일본어 또는 혼합 문자로 된 말뭉치를 다룬다면, Nemotron Parse 2.0의 수치가 테스트해 볼 가치가 있습니다. 정확히는 그 수치가 {{4}}공급업체가 보고한 최신 수치이기 때문입니다.{{/4}}
서빙의 현실. olmOCR 2는 출시된 지 10개월 되었고, 그 툴체인은 좋은 의미로 지루합니다. Nemotron Parse 2.0은 출시된 지 5일밖에 안 되었고, 그 서빙 이야기는 눈에 띄게 어립니다. vLLM은 Nemotron Parse 원격 코드 지원이 포함된 빌드가 필요하고, 결합된 출력 헤드가 일부 vLLM 0.20 빌드에서 문제를 일으킵니다(저장소에 런타임 패치가 포함되어 있습니다). 또한 tokenizer.json에는 9,000개 토큰으로 직렬화된 패딩이 포함되어 있습니다. 한 서빙 스택은 패치 전에 6개 토큰 프롬프트가 54,000개 토큰 ID로 확장되는 문제를 겪었습니다. 그중 어떤 것도 치명적이지는 않지만, 새로운 모델을 도입할 때 감수해야 하는 마찰의 정확히 그런 종류입니다.
파이프라인용으로 하나를 선택하세요.
LLM 학습 데이터나 영어 문서 대상의 대용량 텍스트 추출 파이프라인을 구축 중이라면 olmOCR 2를 선택하세요. 성숙한 툴킷, Apache-2.0 라이선스, 업계가 현재 기준으로 삼는 벤치마크, 그리고 검증된 배치 처리 경로를 제공합니다. 이 모델이 수용하는 실패 모드는 언어 커버리지입니다.
Nemotron Parse 2.0을 선택하세요. 파이프라인에 지오메트리(레이아웃 클래스, 경계 상자, 접지된 검색 또는 문서 인텔리전스를 위한 읽기 순서)가 필요하거나, 코퍼스에 Indic, CJK 또는 손글씨 페이지가 많아 해당 기능의 이점이 기대되는 경우입니다. 0.9B 크기 덕분에 확신이 없더라도 주말 테스트 비용이 부담되지 않습니다. 이 모델의 인정된 한계는 카드에 있는 모든 수치가 NVIDIA 자체 수치이며 독립적인 평가에서 달라질 수 있다는 점입니다.
입력이 대부분 영어로 작성된 디지털 네이티브 PDF이고 깔끔한 마크다운만 필요하다면, olmOCR 2가 리스크가 낮은 기본 선택입니다. 이미 자체 호스팅을 하고 있고 다국어 또는 레이아웃 기반 사용 사례가 실제로 존재한다면, Nemotron Parse 2.0이 더 흥미로운 선택지입니다 — 적용하기 전에 자체 페이지에서 먼저 테스트해 보세요.
파서 선택이 고착화(lock-in)되지 않도록 하세요.
문서 파이프라인에는 파서 단계와 LLM 단계가 있습니다. 실제 볼륨이 발생하기 시작하면 파서는 보통 가장 저렴한 단계이며, 비용이 확장되는 지점은 파싱된 마크다운을 요약, 구조화된 레코드, 또는 답변으로 변환하는 LLM입니다. 라우팅 계층이 변경하는 단계가 바로 이것입니다. OrcaRouter는 200개 이상의 모델을 단일 API 뒤에 공급업체 공시 가격 그대로, 마크업 없이 제공하므로 공급업체의 가격 인하가 당일 바로 반영되며, 자동 장애 조치를 통해 성능이 저하된 공급업체 하나가 배치 작업을 지연시키지 않습니다. 이 비교에 포함된 두 파서 모두 당사 카탈로그에는 없습니다. 두 모델 카드 모두 어떤 추론 제공업체에서도 배포되지 않았다고 명시하고 있으므로 이는 자체 호스팅 결정입니다. 그러나 파서를 모델 스택에서 분리해 두어야 하는 이유는 라우팅이 다운스트림 측면에서 제공하는 이점과 정확히 일치합니다. Nemotron Parse 2.0을 olmOCR 2로 바꾸거나 그 반대로 바꾸더라도 단 하나의 통합도 건드릴 필요가 없습니다. LLM 계층이 동일한 단일 키 API 뒤에 그대로 유지되기 때문입니다.
자주 묻는 질문
어떤 모델이 벤치마크에서 이기나요?
어느 쪽도 아닙니다 — 그 수치들은 서로 직접 비교되지 않습니다. {{1}}Nemotron Parse 2.0은 ParseBench, MOSCAR, IndicVisionBench, 그리고 OmniDocBench 손글씨 하위 집합을 보고합니다{{/1}}, 모두 NVIDIA 자체 것이며 독립적으로 재현된 것은 없습니다. {{2}}olmOCR 2는 나머지 업계가 이제 결과를 게재하는 AI2의 자체 벤치마크인 olmOCR-Bench를 보고합니다{{/2}}. 어떤 제3자도 두 모델을 동일한 말뭉치로 실행하지 않았으므로, 직접적인 "승자" 주장은 추정에 불과합니다. {{3}}방향적으로 보면: olmOCR의 수치는 10개월간의 커뮤니티 사용을 견뎌냈고, Nemotron Parse 2.0의 수치는 새로운 것이어서 변동될 수 있습니다.{{/3}}
Nemotron Parse 2.0은 정말로 비영어 문서에서 더 뛰어난가요?
그것이 주장의 전부입니다 — 약 20,000개 토큰 규모의 어휘 확장, 그리고 MOSCAR 0.9102와 IndicVisionBench 0.7203은 둘 다 공급업체가 보고한 수치로 v1.2 대비 큰 폭으로 상승했습니다. olmOCR 2는 다국어를 주장하지 않으며 영어 전용으로 태그되어 있습니다. 그러나 독립적인 실행 결과가 나오기 전까지는 Nemotron Parse 2.0의 다국어 성능 향상을 유망하지만 검증되지 않은 것으로 간주하고, 이에 의존하기 전에 자체 Indic 또는 CJK 페이지에서 테스트하세요.
둘 중 하나에 더 큰 GPU가 필요한가요?
네, 그리고 크기 차이도 추적합니다. Nemotron Parse 2.0의 0.9B는 적당한 Ampere 세대 카드에도 들어맞으며, 이미 보유한 하드웨어에서 페이지당 비용이 더 저렴한 옵션입니다. olmOCR 2의 7B VLM은 상당히 더 큰 GPU를 요구합니다. AI2에 따르면 FP8 빌드는 H100에서 초당 약 3,400개의 출력 토큰에 도달합니다.
RAG 전처리에는 어떤 것이 더 좋은가요?
이는 검색기(retriever)가 무엇을 필요로 하는지에 달려 있습니다. 답변을 페이지 영역에 근거시키거나 레이아웃 클래스가 필요하거나 표와 차트를 별도의 단위로 인덱싱하려면, Nemotron Parse 2.0의 경계 상자와 클래스가 이러한 기능을 기본으로 제공합니다. RAG 스택이 정제된 텍스트만 소비하고 말뭉치가 영어라면, olmOCR 2의 선형화된 마크다운은 검증되었고 더 단순하며 성숙한 툴킷의 지원을 받습니다.
결론
NVIDIA는 이번 주에 실제 파서를 출시하면서 아무에게도 알리지 않았다. AI2는 10개월 전에 출시하면서 이 분야의 벤치마크를 만들었다. Nemotron Parse 2.0은 적은 예산으로 레이아웃 의미론, 다국어 지원, 손글씨 추출이 필요할 때 더 적합하다. 그리고 그 성능 수치가 가장 덜 검증된 영역이 바로 자사가 승리한다고 주장하는 영역이다. olmOCR 2는 영어 문서를 대규모로 선형화된 텍스트로 처리해야 하고 10개월 동안 안정적으로 유지된 툴체인을 원할 때 더 적합하다. 둘 다 어디에도 배포되지 않았으므로 어느 쪽이든 자체 호스팅으로 결정해야 한다. 가장 저렴한 방법은 두 가지를 모두 자신의 가장 어려운 페이지에서 실행하고 각각 어디에서 실패하는지 지켜보는 것이다.
