
NVIDIA-Nemotron-Parse-2.0: NVIDIA, 더 똑똑한 문서 파서를 조용히 출시하다
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 591 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3055지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1653지능69코딩60수학
NVIDIA-Nemotron-Parse-2.0이 2026년 8월 3일 Hugging Face에 등장했으며, 이 글을 쓰는 시점(5일 후)에도 NVIDIA는 여전히 이를 발표하지 않았다. 블로그 게시물도, 보도자료도, X의 스레드도 없다. 리포지토리는 완전하다: 0.9B 비전 인코더-디코더, NVIDIA-Nemotron-Parse-v1.2와의 전체 벤치마크 표를 포함한 모델 카드, 구성 파일, Dockerfile, 테스트 스위트, 그리고 새 모델의 보조 헤드(auxiliary head)를 이미 참조하는 vLLM 풀 리퀘스트까지 갖추고 있다. 아무런 홍보도 없이 완전한 릴리스가 이루어진 것은 '현재까지 알려진 사실'을 정리할 가치가 충분한 신호이며, 그래서 이 글은 바로 그것을 다룬다: 리포지토리가 확립한 사실, 여전히 공급업체가 보고한 수치, 그리고 공식 발표가 있었다면 일반적으로 답했을 미해결 질문들이다.
NVIDIA-Nemotron-Parse-2.0이란 무엇인가
Nemotron Parse는 NVIDIA의 문서 파싱 모델로, 스캔되거나 렌더링된 페이지를 입력하면 읽기 순서에 따른 텍스트, 각 영역의 경계 상자와 의미 클래스, 그리고 표를 포함한 마크다운을 반환합니다. 출력 형식은 LaTeX, HTML, markdown, JSON, 계층적 JSON 또는 CSV 중에서 선택할 수 있습니다. 이 모델은 범용 LLM도 아니고 단순한 OCR 엔진도 아닙니다. 그 둘 사이에 위치하며, RAG, 추출, 문서 인텔리전스 파이프라인에 공급하도록 설계된 레이아웃 인식 추출 방식입니다.
버전 2.0은 저장소의 구성에 따라 v1.2와 동일한 아키텍처 제품군을 유지합니다. 비전 인코더는 NVIDIA의 C-RADIOv2 백본 위에 구축된 ViT-H이며, 디코더는 10계층 mBART 스타일 디코더이고, 전체는 약 0.9B 파라미터에 달합니다. 입력 페이지는 최대 2048×1664까지 지원하고, 생성은 9,000토큰 상한까지 실행되며, 모델은 일련의 의미 클래스(텍스트, 제목, 섹션 헤더, 목록 항목, 표, 수식, 그림, 캡션, 각주, 페이지 헤더/푸터 및 기타)로 영역에 태그를 지정합니다. 단일 GPU에서 자체 호스팅할 수 있을 만큼 작은 모델이며, 이것이 오늘날 이 모델을 실행할 수 있는 유일한 방법이기 때문에 중요합니다.
v1.2에서 무엇이 변경되었나요?
카드의 흥미로운 부분은 모델이 아니라 델타입니다. NVIDIA-Nemotron-Parse-v1.2는 2026년 2월 Hugging Face에 52,329개 토큰 어휘로 출시되었습니다. 버전 2.0은 이를 72,256개 토큰으로 확장하여 약 2만 개 토큰이 증가했으며, 카드는 그 이유를 명확히 설명합니다: 추가 토큰은 다국어 OCR을 제공하며, 가장 큰 이득은 CJK 및 인도 문자에서 나타납니다. 모델 카드는 또한 세 가지 다른 변경 사항을 나열합니다:
• 차트 인식 파싱 — 새로운 class_Chart> 클래스 토큰으로, 차트 영역이 그림이나 표와 함께 분류되지 않고 고유한 의미 클래스를 갖게 됩니다.
• 필기 텍스트 추출 개선 — 카드에 따르면 OmniDocBench Notes 세트의 텍스트 편집 거리가 v1.2의 0.9739에서 0.3395로 감소했습니다(낮을수록 좋음). 이는 역사적으로 이러한 모델의 가장 취약한 사례였던 부분에서 큰 변화입니다.
• 테이블 처리 기능이 개선되었으며, 별도의 수치로 보고되지 않고 전체 ParseBench 향상에 포함되었습니다.
주목할 만한 훈련 세부 사항 하나: 카드에 따르면 2.0은 58k~66k 스텝의 훈련 체크포인트들을 동일 가중치로 결합한 checkpoint soup이며, 이는 조용한 포인트 릴리스를 위한 흔한 방식입니다. 전체 재훈련 없이 견고성을 확보해 주는 경향이 있죠.
카드가 보고하는 숫자들
다음 수치들은 모두 NVIDIA 자체 모델 카드에서 가져온 것이며, v1.2를 기준으로 측정되었습니다. 그리고 이 중 어느 것도 아직 독립적인 제3자 실행 결과가 없습니다. 이를 벤더 보고 수치이자 방향성 참고용으로 취급하십시오:
• ParseBench 종합 점수 — v1.2에서 0.5782, 2.0에서 0.6391로. ParseBench는 텍스트 충실도, 의미적 서식, 표, 차트 및 시각적 근거를 다루는 NVIDIA 자체 벤치마크입니다.
• MOSCAR 다국어 BoC F1 — 0.4410에서 0.9102로. 이는 카드에서 가장 큰 상승 폭이며, 어휘 확장과 일치합니다. MOSCAR는 라틴 문자, 아랍 문자, 키릴 문자, 한자, 한글, 일본어, 인도 문자, 히브리 문자, 태국 문자, 그리스 문자 등을 포함합니다.
• IndicVisionBench 전체 ANLS-character — 0.0612에서 0.7203까지, 10개의 인도 언어(벵골어, 구자라트어, 힌디어, 칸나다어, 말라얄람어, 마라티어, 오디아어, 펀자브어, 타밀어, 텔루구어)에 걸쳐.
• OmniDocBench Notes 필기 텍스트 편집 거리 — 0.9739에서 0.3395로 (낮을수록 좋음).

이 델타들의 규모가 이번 릴리스가 발표 없이도 중요한 이유입니다. 다국어 OCR F1 지표에서 0.44→0.91의 변화는 사소한 포인트 릴리스가 아닙니다. 이는 일반적으로 출시를 대표할 다국어 작업처럼 보입니다. 이러한 성과가 독립적인 평가에서도 유지될지는 정확히 보도 부족이 남겨둔 질문입니다.
저장소가 우리에게 말해주지 않는 것
한계에 대해 솔직해지는 것이 조용한 출시 포스트의 요점입니다. 리포지토리는 다음을 확인하지 않습니다:
• 2.0이 NVIDIA NIM 마이크로서비스로 제공되는지(또는 제공될 예정인지) 여부 — v1.2는 NVIDIA 자체 NIM API를 통해 제공되며, 2.0 카드에는 NIM 태그와 배포 엔드포인트가 없고, 2.0의 저장소 페이지에는 모델이 "어떤 Inference Provider에서도 배포되지 않는다"고 명시되어 있습니다.
• 가격(있는 경우) — 가중치에는 사용 수수료가 없지만, 호스팅 옵션은 아직 가격이 책정되거나 발표되지 않았습니다.
• 독립적인 벤치마크 — 2.0에 대한 Artificial Analysis, LMArena, 또는 OmniDocBench 항목이 아직 없으므로, 벤더 수치를 교차 검증할 수 있는 것이 없습니다.
• 로드맵 — 2.0이 디딤돌인지 최종 목적지인지, 그리고 2.1 스타일의 후속 버전이 나올지 여부는 알 수 없습니다.
확실한 한 가지는 라이선스입니다. 모델은 NVIDIA 오픈 모델 라이선스(NVIDIA Open Model License)를 따르며, 상업적 및 비상업적 용도 모두 허용됩니다. 토크나이저는 CC-BY-4.0을 따릅니다. 제품에 사용하려는 경우, 그 조건은 충족됩니다.
오늘 실행합니다.
셀프 호스팅이 현재 유일한 옵션이며, 이를 계획하기 전에 알아둘 만한 몇 가지 마찰이 있습니다. 모델은 Hugging Face Transformers에서 trust_remote_code로 로드되며, vLLM도 서빙할 수 있습니다. 단, Nemotron Parse 원격 코드 지원이 포함된 vLLM 빌드에서만 가능합니다. A100/A10급 하드웨어에서 NVIDIA는 Triton 어텐션 백엔드를 강제로 사용할 것을 권장하며, albumentations, timm, open_clip_torch, einops의 네 가지 추가 의존성이 필요합니다. 또한 출력 헤드가 결합된 특이점이 있습니다. 2.0은 LM 헤드를 디코더 임베딩에 연결된 상태로 유지하지만, 일부 vLLM 빌드는 NVIDIA가 포함한 런타임 패치를 PYTHONPATH에 추가하지 않으면 별도의 출력 헤드를 구체화합니다.
이 생태계에서 나온 두 가지 서빙 세부 사항이 이 논의를 완성합니다. 첫째, 현재 오픈되어 있는 vLLM 풀 리퀘스트(8월 초 기준 리뷰 중)는 리포지토리의 auxiliary_prediction_heads.safetensors.extra 사이드카 파일에 저장된 보조 예측 헤드를 사용하여 NVIDIA-Nemotron-Parse-2.0에 대한 추측 디코딩을 가능하게 합니다. 모델 카드의 문서는 해당 파일이 표준 추론에서 사용되지 않는다고 설명하므로, 이 PR이 실제로 이 파일을 사용하는 첫 번째 사례입니다. 저자는 1,005페이지로 구성된 ParseBench 센서스에서 H100상에서 단일 토큰 디코딩 대비 출력 처리량 중앙값이 동시성 1에서 약 45%, 동시성 8에서 약 41%, 동시성 32에서 약 40% 증가했다고 보고합니다. 모든 수치는 PR에서 가져온 것이며 아직 병합되지 않았고 독립적으로 재현되지도 않았습니다. 둘째, Dynamo 이슈는 2.0의 토크나이저에서 실제 함정을 지적합니다. 2.0은 직렬화된 tokenizer.json에 패딩이 내장된 채 제공되며, 이 패딩은 모든 인코딩을 9,000개의 토큰으로 패딩합니다. 따라서 패딩된 토크나이저를 로드하는 서빙 스택은 6개 토큰의 멀티모달 프롬프트를 54,000개의 토큰 ID로 부풀릴 수 있습니다. 자체 호스팅 시, 서빙 경로가 패딩된 아티팩트를 로드하는 대신 온라인 토크나이제이션을 수행하도록 하십시오.

2026년 파싱 시장에서의 위치
Nemotron Parse 2.0은 경쟁이 치열하고 빠르게 변화하는 분야에 진입하고 있습니다. 현재 오픈소스 문서 파싱 분야의 선두주자로는 Shanghai AI Lab의 1.2B 모델인 MinerU 2.5-Pro와 PaddleOCR-VL(0.9B 및 7B 변형)이 있으며, 두 모델 모두 OmniDocBench 리더보드에서 90점대 초반의 종합 점수를 기록하고 있습니다. 또한 StepFun의 GOT-OCR 2.0이 경량 580M 옵션으로 있습니다. API 측면에서는 Mistral OCR이 주요 상용 제품입니다. 2.0을 이 순위에 포함시키기 전에 두 가지 주의할 점이 있습니다. 첫째는 수치를 직접 비교할 수 없다는 점입니다. Parse 2.0은 NVIDIA 자체 벤치마크 스위트인 ParseBench를 사용하는 반면, 다른 모델들의 점수는 OmniDocBench 종합 점수입니다. 서로 다른 태스크에 서로 다른 가중치가 적용되어 있어 동등하게 비교할 수 있는 수치가 아직 존재하지 않습니다. 둘째는 NVIDIA-Nemotron-Parse-2.0을 NVIDIA의 별도 모델인 NVIDIA-Nemotron-OCR-v2와 혼동해서는 안 된다는 점입니다. NVIDIA-Nemotron-OCR-v2는 NeMo Curator 파이프라인을 위해 구축된 단어 수준의 밀집 OCR 모델입니다. Parse 2.0은 레이아웃 및 클래스 인식 파서이고, OCR v2는 단어 단위 추출기입니다. 이 둘은 동일한 모델이 아니라 상호 보완적인 도구입니다.
정직하게 말하자면, {{1}}Parse 2.0의 핵심 주장은 "모든 파싱 지표에서 경쟁 제품을 능가한다"는 것이 아니다.{{/1}} 이는 0.9B 파라미터, 퍼미시브 라이선스, 레이아웃 인식 파서로, {{2}}모델 카드가 자체 전작 대비 매우 큰 다국어 성능 도약을 주장하며{{/2}} — {{3}}그 계보(2025년 11월 v1.1, 2026년 2월 v1.2, 2026년 8월 2.0)는 NVIDIA가 약 3개월마다 새 파서를 출시하고 있음을 보여준다.{{/3}} 이미 Nemotron Parse 제품군을 표준으로 채택한 팀에게 {{4}}2.0은 동일한 API 형태와 훨씬 강력한 다국어 지원을 갖춘 드롭인 업그레이드다.{{/4}} 나머지 팀에게 남는 질문은 {{5}}미공개 모델의 주장이 독립적인 테스트를 통과하는지{{/5}}다.
파싱 파이프라인에서 라우팅 레이어가 어디에 위치하는지
문서 파싱 모델은 보통 더 긴 파이프라인의 한 단계이며, 그 주변 단계들이 라우팅의 가치를 입증하는 곳입니다. 일반적인 구조는 다음과 같습니다: Parse 2.0이 페이지를 구조화된 청크로 변환한 다음, LLM이 요약하고, 질문에 답하고, 엔터티를 추출하거나, 결과를 다운스트림 저장소에 맞게 구조화합니다. 바로 이 LLM 단계에서 라우팅 플랫폼이 경제성을 바꿉니다. OrcaRouter는 200개 이상의 모델을 하나의 API 뒤에 공급업체 정가로 제공합니다. 마크업 0%이므로 공급업체의 가격 인하가 발표된 당일에 저희 측에도 반영됩니다. 또한 특정 공급업체의 성능이 저하되면 자동 장애 조치(failover)가 수행됩니다. 구체적으로, 이는 파서는 그대로 두고 그 출력을 해석하는 모델을 추가 계약이나 코드 변경 없이 교체하거나 비교하거나 장애 조치 라우팅할 수 있음을 의미합니다. 파싱 단계가 병목이라면 튜닝과 자체 호스팅이 가능한 모델이 필요한데, Parse 2.0이 바로 그것입니다. 반대로 해석 단계가 변동 비용이라면 그 단계를 라우터가 관리해야 합니다. 우리는 Parse 2.0을 직접 호스팅하지 않습니다. 자체 호스팅 모델이지 API가 아니기 때문입니다. 그러나 LLM에 파서를 연결하는 구성은 LLM 계층용 단일 엔드포인트가 효과를 발휘하는 바로 그 상황입니다.

결론
NVIDIA-Nemotron-Parse-2.0은 2026년 8월 3일자 실제 완전한 미공개 릴리스입니다. 저장소에는 0.9B 레이아웃 인식 파서가 있으며, 모델 카드에는 {{1}}v1.2 대비 매우 큰 다국어 및 필기 인식 개선{{/1}}이 있다고 명시되어 있습니다. {{2}}허용적 라이선스{{/2}}로 배포되어 있지만, 그 주변에는 실질적인 {{3}}자체 호스팅 마찰{{/3}}이 있습니다. 해당 수치 중 어느 것도 아직 독립적으로 검증되지 않았으며, 호스팅 옵션이나 가격 책정도 마련되어 있지 않습니다. 올바른 선택은 위험 허용도에 달려 있습니다. 오늘날 {{4}}다국어 문서{{/4}}를 파싱하고 있고 {{5}}다국어 지표{{/5}}가 중요한 기준이라면, 주장된 {{6}}0.44→0.91 MOSCAR 개선{{/6}}은 {{8}}자체 말뭉치{{/8}}에서 {{7}}주말 테스트{{/7}}를 진행할 만큼 충분히 큽니다. 델타는 재현되거나 무너지거나 둘 중 하나이며, {{9}}조용한 릴리스{{/9}}가 어느 쪽인지 알아내는 가장 저렴한 방법입니다. 인용할 {{10}}벤치마크{{/10}}나 {{12}}프로덕션 경로{{/12}}를 맡길 {{11}}지원 API{{/11}}가 필요하다면, {{13}}발표{{/13}}나 {{14}}독립적 실행{{/14}}을 기다리십시오. 그동안, 이것이 {{15}}조용한 출시{{/15}}의 모습이며, 주목할 가치가 있습니다.
자주 묻는 질문
NVIDIA-Nemotron-Parse-2.0은 유출인가요, 아니면 공식 릴리스인가요?
어느 쪽 명칭도 정확히 맞아떨어지지는 않는다. 흩어져 있거나 일부만 존재하는 가중치가 새어 나온다는 의미의 유출(leak)은 아니다. 저장소는 완전히 조립되어 있으며, 상세한 모델 카드, 구성 파일, Dockerfile, 골든 출력을 포함한 테스트 스위트, 그리고 Transformers와 vLLM용 추론 스크립트까지 모두 갖춰져 있다. 하지만 일반적인 의미의 출시(launch)도 아니다. NVIDIA는 어떤 발표도 내놓지 않았고, 이전 Nemotron Parse 릴리스에 함께 제공되었던 NIM 패키징과 호스팅 엔드포인트도 없다. 정확한 표현은 공급업체가 아직 홍보를 선택하지 않은 완전한 릴리스라는 것이다. 그래서 여기서 정직한 명칭은 "조용한 출시(quiet ship)"이며, 발표가 일반적으로 해결해 주었을 사항들(가격, 로드맵, 호스팅 이용 가능 여부)이 여전히 미해결 질문으로 남아 있는 이유이기도 하다.
벤더 벤치마크는 다른 파서들에 대해 사람들이 인용하는 OmniDocBench 수치와 어떻게 비교됩니까?
아니요, 직접적으로는 그렇지 않습니다. {{1}}NVIDIA-Nemotron-Parse-2.0의 카드{{/1}}에 기재된 수치는 {{2}}텍스트 충실도, 의미론적 포맷팅, 표, 차트, 시각적 근거를 다루는 NVIDIA 자체 벤치마크인 ParseBench와 MOSCAR, IndicVisionBench, OmniDocBench 필기체 하위 집합{{/2}}에서 나온 것입니다. 반면 시장에서 주목받는 점수들({{3}}MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR{{/3}})은 {{4}}OmniDocBench 종합 점수{{/4}}입니다. 서로 다른 작업, 서로 다른 지표이므로 공개된 동등 비교는 아직 존재하지 않습니다. 생태계와 겹치는 유일한 수치인 {{5}}OmniDocBench Notes 필기체 수치{{/5}}도 {{6}}v1.2{{/6}} 대비 텍스트 편집 거리로 보고되었을 뿐, 종합 점수가 아니므로 여전히 다른 수치들과 순위를 비교할 수 없습니다. 독립적인 실행 결과가 나올 때까지 {{7}}Parse 2.0의 주장{{/7}}은 방향성만 확인된 미검증 수치로 취급하십시오.
팀이 프로덕션에 배포하기 전에 무엇을 테스트해야 합니까?
세 가지입니다. 첫째, 자체 다국어 말뭉치입니다. 2.0의 핵심 요지는 다국어 도약이며, 조용한 릴리스는 바로 주장된 이점이 여러분의 데이터에서 재현되거나 재현되지 않는 상황입니다. 카드에 적힌 내용을 믿기 전에 실제로 파싱하는 언어들로 돌려보세요. 둘째, 자체 호스팅 스택입니다. vLLM 빌드에 Nemotron Parse 원격 코드 지원이 있는지 확인하고, tied-output-head 패치를 적용한 다음, 서빙 경로가 패딩된 tokenizer.json을 로드하는 대신 온라인 토크나이제이션을 수행하는지 검증하세요. 패딩된 토크나이저를 로드하면 짧은 프롬프트가 9,000개 토큰으로 늘어날 수 있습니다. 셋째, 라이선스와 서비스 측면입니다. 가중치는 NVIDIA Open Model License에 따라 무료이지만, 발표된 NIM도, 가격도, 지원 계약도 없습니다. 따라서 자체 호스팅을 전제로 계획을 세우고, LLM 단계를 재설계 없이 모델 교체와 장애 조치가 가능한 레이어를 통해 다운스트림으로 라우팅하세요. 이것이 바로 라우팅 플랫폼이 만들어진 이유입니다.
