Thẻ tiêu đề cho 'NVIDIA-Nemotron-Parse-2.0': tiêu đề chính 'NVIDIA-Nemotron-Parse-2.0', phụ đề 'Bản cập nhật âm thầm cho trình phân tích tài liệu' và phần mô tả '0.9B bộ mã hóa-giải mã thị giác · OCR đa ngôn ngữ · nhận biết biểu đồ' bên cạnh hình minh họa phẳng thể hiện một trang tài liệu đang được phân tích với các hộp giới hạn màu và biểu tượng biểu đồ. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

NVIDIA-Nemotron-Parse-2.0: NVIDIA âm thầm ra mắt trình phân tích tài liệu thông minh hơn

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

NVIDIA-Nemotron-Parse-2.0 xuất hiện trên Hugging Face vào ngày 3 tháng 8 năm 2026, và tính đến lúc bài viết này được đăng — năm ngày sau đó — NVIDIA vẫn chưa chính thức công bố nó: không có bài blog, không có thông cáo báo chí, không có chủ đề nào trên X. Repo khá đầy đủ: một bộ mã hóa–giải mã thị giác 0,9B, một model card kèm bảng benchmark đầy đủ so với NVIDIA-Nemotron-Parse-v1.2, các file cấu hình, một Dockerfile, một bộ test, và thậm chí một pull request trên vLLM đã tham chiếu đến auxiliary head của mô hình mới. Một bản phát hành hoàn chỉnh mà hoàn toàn không có sự phô trương nào chính là loại tín hiệu đáng để xem xét theo dạng "những gì chúng ta biết cho đến nay", và đó là điều bài viết này làm: các dữ kiện mà repo thiết lập, các con số vẫn do nhà cung cấp báo cáo, và những câu hỏi mở mà một thông báo chính thức thường sẽ giải đáp.

NVIDIA-Nemotron-Parse-2.0 là gì

Nemotron Parse là mô hình phân tích tài liệu của NVIDIA: bạn cung cấp cho nó một trang được quét hoặc kết xuất, và nó trả về văn bản theo thứ tự đọc, khung bao quanh (bounding box) và lớp ngữ nghĩa của từng vùng, cùng với markdown — bao gồm cả bảng biểu — ở định dạng bạn lựa chọn: LaTeX, HTML, markdown, JSON, JSON phân cấp hoặc CSV. Nó không phải là LLM đa dụng và cũng không phải công cụ OCR đơn thuần. Nó nằm giữa hai loại đó: trích xuất nhận biết bố cục được thiết kế để phục vụ các pipeline RAG, trích xuất và xử lý thông minh tài liệu.

Phiên bản 2.0 giữ nguyên họ kiến trúc giống như v1.2, theo cấu hình của repo. Bộ mã hóa thị giác là ViT-H được xây dựng trên nền tảng C-RADIOv2 của NVIDIA, bộ giải mã là bộ giải mã kiểu mBART mười tầng, và toàn bộ có khoảng 0,9B tham số. Các trang đầu vào có kích thước lên tới 2048×1664, quá trình sinh chạy tới trần 9.000 token, và mô hình gán nhãn các vùng với một tập hợp các lớp ngữ nghĩa (văn bản, tiêu đề, tiêu đề mục, mục danh sách, bảng, công thức, hình ảnh, chú thích, chân trang, đầu trang/chân trang, và phần còn lại). Đây là mô hình đủ nhỏ để tự triển khai trên một GPU duy nhất, điều này quan trọng vì đó là cách duy nhất để chạy nó hiện nay.

Có gì thay đổi từ v1.2

Phần thú vị của thẻ mô hình không nằm ở bản thân mô hình — mà nằm ở sự khác biệt. NVIDIA-Nemotron-Parse-v1.2 được phát hành trên Hugging Face vào tháng 2 năm 2026 với bộ từ vựng 52.329 token. Phiên bản 2.0 mở rộng lên 72.256 token, tăng khoảng 20k token, và thẻ mô hình nêu rõ lý do: số token bổ sung mang lại khả năng OCR đa ngôn ngữ, với mức cải thiện lớn nhất ở hệ chữ CJK và Ấn Độ. Thẻ mô hình cũng liệt kê ba thay đổi khác:

• Phân tích cú pháp nhận biết biểu đồ — một token lớp class_Chart> mới, để các vùng biểu đồ có lớp ngữ nghĩa riêng thay vì bị gộp chung với hình ảnh hoặc bảng.

• Cải thiện khả năng trích xuất văn bản viết tay — bảng báo cáo cho thấy khoảng cách chỉnh sửa văn bản trên bộ OmniDocBench Notes giảm từ 0.9739 trên v1.2 xuống 0.3395 (giá trị thấp hơn là tốt hơn), một thay đổi lớn đối với trường hợp vốn là điểm yếu nhất về mặt lịch sử của các mô hình này.

• Cải thiện khả năng xử lý bảng, được gộp vào mức tăng tổng thể của ParseBench thay vì được báo cáo như một con số riêng.

Một chi tiết đào tạo đáng lưu ý: thẻ ghi rằng 2.0 là một checkpoint soup có trọng số bằng nhau của các checkpoint huấn luyện từ bước 58k đến 66k, vốn là một công thức phổ biến cho một bản phát hành nhỏ ít thay đổi — nó thường mang lại độ bền vững mà không cần huấn luyện lại toàn bộ.

Các con số mà thẻ báo cáo

Tất cả các số liệu sau đây đều đến từ model card của chính NVIDIA, được đo đạc so với v1.2, và chưa có bên thứ ba độc lập nào chạy thử. Hãy coi chúng là số liệu do nhà cung cấp báo cáo và chỉ mang tính định hướng:

• Điểm tổng thể của ParseBench — từ 0.5782 trên v1.2 lên 0.6391 trên 2.0. ParseBench là benchmark riêng của NVIDIA, bao phủ độ trung thực văn bản, định dạng ngữ nghĩa, bảng biểu, biểu đồ và định vị thị giác.

• MOSCAR đa ngôn ngữ BoC F1 — 0.4410 đến 0.9102. Đây là bước nhảy lớn nhất trên bảng, và nó khớp với việc mở rộng từ vựng; MOSCAR bao gồm Latin, Ả Rập, Cyrillic, Trung, Hangul, Nhật, Indic, Hebrew, Thái, Hy Lạp, và nhiều hơn nữa.

• IndicVisionBench — ANLS-character tổng thể: 0.0612 đến 0.7203, trên mười ngôn ngữ Ấn Độ (Bengali, Gujarati, Hindi, Kannada, Malayalam, Marathi, Odia, Punjabi, Tamil, Telugu).

• Khoảng cách chỉnh sửa văn bản viết tay OmniDocBench Notes — từ 0.9739 đến 0.3395 (thấp hơn là tốt hơn).

Scoreboard for NVIDIA-Nemotron-Parse-2.0: six rows reading Params 0.9B vision-encoder-decoder, Max image 2048×1664, ParseBench 0.6391 (vendor-reported), MOSCAR BoC F1 0.9102 (vendor-reported), IndicVisionBench ANLS 0.7203 (vendor-reported), License NVIDIA Open Model. Footer: 'All figures vendor-reported; no independent scores yet.' OrcaRouter logo composited bottom-right.

Quy mô của những mức chênh lệch này là lý do khiến bản phát hành này quan trọng ngay cả khi không có thông báo chính thức. Sự thay đổi {{1}}0.44→0.91{{/1}} trên {{2}}chỉ số F1 OCR đa ngôn ngữ{{/2}} không phải là một bản phát hành nhỏ; nó trông giống như {{3}}công việc đa ngôn ngữ{{/3}} mà bình thường sẽ là điểm nhấn của một buổi ra mắt. Liệu những cải thiện này có đứng vững dưới {{4}}đánh giá độc lập{{/4}} hay không chính là câu hỏi mà việc thiếu {{5}}sự đưa tin{{/5}} để ngỏ.

Những gì repo không cho chúng ta biết

Việc thành thật về các giới hạn chính là mục đích của một bài đăng quiet-ship. Repo không xác nhận:

• Liệu 2.0 có (hoặc sẽ) khả dụng dưới dạng microservice NVIDIA NIM hay không — v1.2 được phục vụ qua chính NIM API của NVIDIA, thẻ 2.0 không liệt kê nhãn NIM và không có điểm cuối triển khai, đồng thời trang repo của nó ghi chú rằng mô hình "không được triển khai bởi bất kỳ Nhà cung cấp suy luận nào."

• Định giá, nếu có — các bộ trọng số không tính phí sử dụng, nhưng tùy chọn lưu trữ có trả phí vẫn chưa được định giá hoặc công bố.

• Điểm chuẩn độc lập — vẫn chưa có mục nào cho 2.0 trên Artificial Analysis, LMArena, hoặc OmniDocBench, nên không có gì để đối chiếu các con số của nhà cung cấp.

• Lộ trình — liệu 2.0 là một bước đệm hay một điểm đến, và liệu có bản tiếp theo kiểu 2.1 hay không, vẫn chưa được biết.

Điều chắc chắn duy nhất là giấy phép: mô hình nằm dưới NVIDIA Open Model License, giấy phép này cho phép sử dụng thương mại và phi thương mại, với tokenizer theo CC-BY-4.0. Nếu bạn muốn dùng nó trong một sản phẩm, yêu cầu đó đã được đáp ứng.

Chạy nó hôm nay

Tự lưu trữ (self-hosting) hiện là lựa chọn duy nhất, và nó đi kèm với một số rào cản đáng để biết trước khi bạn lên kế hoạch dựa trên nó. Mô hình được tải trong Hugging Face Transformers với trust_remote_code, và vLLM có thể phục vụ nó — nhưng chỉ với bản dựng vLLM bao gồm hỗ trợ remote-code cho Nemotron Parse. Trên phần cứng lớp A100/A10, NVIDIA khuyến nghị ép buộc backend attention Triton, và bạn cần bốn phụ thuộc bổ sung: albumentations, timm, open_clip_torch, và einops. Cũng có một điểm bất thường về tied-output-head: 2.0 giữ LM head liên kết với decoder embeddings, trong khi một số bản dựng vLLM tạo ra một output head riêng biệt trừ khi bạn thêm bản vá runtime đi kèm của NVIDIA vào PYTHONPATH.

Hai chi tiết về serving từ hệ sinh thái giúp hoàn thiện bức tranh này. Thứ nhất, một pull request vLLM hiện đang mở (đang được xem xét tính đến đầu tháng 8) cho phép giải mã dự đoán (speculative decoding) cho NVIDIA-Nemotron-Parse-2.0 bằng cách sử dụng đầu dự đoán phụ trợ được lưu trong tệp sidecar auxiliary_prediction_heads.safetensors.extra của kho lưu trữ — tài liệu của chính model card mô tả tệp này không được dùng trong suy luận tiêu chuẩn, nên PR này là thứ đầu tiên thực sự sử dụng nó. Trên một H100 với khảo sát ParseBench gồm 1.005 trang, tác giả báo cáo mức tăng thông lượng đầu ra trung vị khoảng 45% ở mức đồng thời 1, 41% ở mức đồng thời 8 và 40% ở mức đồng thời 32 so với giải mã từng token đơn lẻ — mọi con số đều lấy từ PR, chưa được hợp nhất hay tái lập độc lập. Thứ hai, một issue trên Dynamo chỉ ra một cạm bẫy thực sự trong tokenizer của bản 2.0: nó đi kèm một tokenizer.json đã tuần tự hóa với phần đệm nhúng sẵn, khiến mỗi lần encode bị đệm tới 9.000 token, nên một ngăn xếp serving tải tokenizer có đệm này có thể thổi phồng một prompt đa phương thức sáu token thành 54.000 ID token. Nếu bạn tự triển khai (self-host), hãy đảm bảo đường dẫn serving của bạn thực hiện token hóa trực tuyến thay vì tải artifact đã bị đệm.

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that the model adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

Vị trí của nó trên thị trường parsing 2026

{{1}}Nemotron Parse 2.0 đang bước vào một lĩnh vực đông đúc và thay đổi nhanh chóng.{{/1}} {{2}}Các công cụ phân tích tài liệu mã nguồn mở dẫn đầu hiện nay gồm có MinerU 2.5-Pro (mô hình 1,2B tham số từ Shanghai AI Lab) và PaddleOCR-VL (các biến thể 0,9B và 7B), cả hai đều đạt điểm tổng hợp ở mức thấp của 90 trên bảng xếp hạng OmniDocBench, cùng với GOT-OCR 2.0 từ StepFun là lựa chọn nhẹ 580M; về phía API, Mistral OCR là sản phẩm thương mại chính.{{/2}} {{3}}Có hai lưu ý trước khi bạn thử xếp 2.0 vào bảng xếp hạng đó.{{/3}} {{4}}Điều đầu tiên là các con số không thể so sánh trực tiếp: Parse 2.0 báo cáo theo ParseBench, bộ đánh giá riêng của NVIDIA, trong khi điểm số của các mô hình khác là điểm tổng hợp OmniDocBench — tác vụ khác nhau, cách tính trọng số khác nhau, hiện chưa có con số nào so sánh được trên cùng một chuẩn.{{/4}} {{5}}Điều thứ hai là bạn không nên nhầm lẫn NVIDIA-Nemotron-Parse-2.0 với mô hình NVIDIA-Nemotron-OCR-v2 riêng của NVIDIA, một mô hình OCR dạng dense ở cấp độ từ được xây dựng cho các pipeline NeMo Curator.{{/5}} {{6}}Parse 2.0 là bộ phân tích nhận biết bố cục và lớp; còn OCR v2 là bộ trích xuất theo từng từ.{{/6}} {{7}}Chúng là những công cụ bổ trợ cho nhau, không phải cùng một mô hình.{{/7}}

Đặt vấn đề một cách trung thực, lời chào hàng của Parse 2.0 không phải là "vượt trội toàn diện ở mọi chỉ số phân tích cú pháp." Đây là một bộ phân tích cú pháp nhận biết bố cục, có dung lượng 0,9B, được cấp phép rộng rãi, mà thẻ mô hình của nó tuyên bố một bước nhảy vọt đa ngôn ngữ rất lớn so với phiên bản tiền nhiệm — và dòng sản phẩm của nó (v1.1 vào tháng 11 năm 2025, v1.2 vào tháng 2 năm 2026, 2.0 vào tháng 8 năm 2026) cho thấy NVIDIA tung ra một bộ phân tích cú pháp mới khoảng mỗi quý. Đối với các nhóm đã tiêu chuẩn hóa trên gia đình Nemotron Parse, 2.0 là một nâng cấp thay thế trực tiếp với cùng cấu trúc API và câu chuyện đa ngôn ngữ mạnh mẽ hơn nhiều. Đối với tất cả những người khác, câu hỏi là liệu những tuyên bố của mô hình chưa được công bố có vượt qua được thử nghiệm độc lập hay không.

Vị trí của lớp định tuyến trong quy trình phân tích cú pháp

A document-parsing model thường là một giai đoạn trong một pipeline dài hơn, và chính các giai đoạn xung quanh nó mới là nơi routing chứng tỏ giá trị. Hình dạng phổ biến là: Parse 2.0 biến một trang giấy thành các khối có cấu trúc, sau đó một LLM tóm tắt, trả lời câu hỏi, trích xuất thực thể hoặc cấu trúc hóa kết quả cho một kho lưu trữ phía sau. Chính giai đoạn LLM đó là nơi một nền tảng routing thay đổi nền kinh tế. OrcaRouter đặt hơn 200 mô hình đằng sau một API duy nhất với giá niêm yết của nhà cung cấp — không tăng giá 0% — vì vậy khi nhà cung cấp giảm giá, phía chúng tôi sẽ phản ánh ngay trong ngày công bố — kèm theo tự động chuyển đổi dự phòng nếu một nhà cung cấp nào đó bị suy giảm hiệu năng. Cụ thể, điều đó có nghĩa là trình phân tích có thể giữ nguyên trong khi mô hình diễn giải đầu ra của nó có thể được hoán đổi, so sánh hoặc định tuyến dự phòng mà không cần thêm hợp đồng thứ hai hay thay đổi mã nguồn. Nếu giai đoạn phân tích là nút thắt, bạn muốn một mô hình có thể tinh chỉnh và tự lưu trữ, điều mà Parse 2.0 mang lại; nếu giai đoạn diễn giải là chi phí biến đổi, thì đó chính là giai đoạn mà một router nên quản lý. Chúng tôi không tự lưu trữ Parse 2.0 — nó là mô hình tự lưu trữ, không phải API — nhưng một trình phân tích cấp dữ liệu cho LLM chính xác là thiết lập mà một endpoint duy nhất cho tầng LLM mang lại hiệu quả.

Pipeline diagram titled 'A parsing pipeline with a routing layer': four rounded cards in a flow — Parse 2.0 (page → text · bboxes · markdown), Chunks (structured regions in reading order), OrcaRouter (one API · 200+ models · 0% markup), LLM (summary · QA · extraction) — with a footer line 'The parsing stage is self-hosted; OrcaRouter routes the LLM stage at provider list price with automatic failover.' OrcaRouter logo composited bottom-right.

Kết luận

NVIDIA-Nemotron-Parse-2.0 là một bản phát hành thực sự, hoàn chỉnh, chưa được công bố chính thức từ ngày 3 tháng 8 năm 2026. Kho lưu trữ cho thấy một trình phân tích cú pháp nhận biết bố cục 0.9B, với thẻ giới thiệu tuyên bố mức cải thiện rất lớn về đa ngôn ngữ và chữ viết tay so với v1.2, được phát hành theo giấy phép cho phép kèm vài rào cản thực tế khi tự triển khai. Hiện chưa có con số nào được kiểm chứng độc lập, và cũng không có tùy chọn lưu trữ có sẵn hay bảng giá. Hướng đi đúng đắn phụ thuộc vào mức độ chấp nhận rủi ro của bạn: nếu bạn đang phân tích tài liệu đa ngôn ngữ và chỉ số đa ngôn ngữ là điều bạn quan tâm, mức tăng từ 0.44→0.91 MOSCAR được tuyên bố là đủ lớn để bạn dành một cuối tuần thử nghiệm trên bộ dữ liệu của riêng mình — loại khác biệt này thường hoặc được tái lập, hoặc sụp đổ, và một bản phát hành thầm lặng là cách rẻ nhất để biết kết quả. Nếu bạn cần một benchmark để trích dẫn hoặc một API được hỗ trợ để đặt cược cho lộ trình sản xuất, hãy chờ thông báo chính thức hoặc một bài đánh giá độc lập. Trong lúc đó, đây chính là hình ảnh của một bản phát hành thầm lặng, và đáng để theo dõi.

Câu hỏi thường gặp

It is a real release. NVIDIA publicly launched Nemotron-Parse-2.0 as an updated version of its open-source document-parsing model, making it available on Hugging Face and via NVIDIA's API platform. It was not a leak; the weights, code, and documentation were distributed officially under NVIDIA's usual open-source terms.

Cả hai cách gọi đều không thực sự khớp. Đây không phải là một vụ rò rỉ theo nghĩa có các trọng số thất lạc hay một phần — kho lưu trữ được tập hợp đầy đủ, với thẻ mô hình chi tiết, các tệp cấu hình, Dockerfile, bộ kiểm thử có đầu ra chuẩn (golden outputs), và các tập lệnh suy luận cho cả Transformers lẫn vLLM. Nhưng đây cũng không phải là một bản ra mắt theo nghĩa thông thường: NVIDIA không hề đưa ra thông báo, và bản đóng gói NIM cùng điểm cuối lưu trữ (hosted endpoint) từng đi kèm các bản phát hành Nemotron Parse trước đây đều không có mặt. Mô tả chính xác là một bản phát hành hoàn chỉnh mà nhà cung cấp chưa chọn quảng bá — đó là lý do cách gọi trung thực ở đây là "ra mắt thầm lặng" (quiet ship), và vì sao những điều mà một thông báo thông thường sẽ giải quyết (định giá, lộ trình, khả năng sẵn sàng của dịch vụ lưu trữ) vẫn là những câu hỏi bỏ ngỏ.

Điểm chuẩn của nhà cung cấp so với các số liệu OmniDocBench mà mọi người trích dẫn cho các trình phân tích cú pháp khác như thế nào?

{{1}}Không, chúng không trực tiếp so sánh được.{{/1}} {{2}}Các con số trên thẻ của NVIDIA-Nemotron-Parse-2.0 đến từ ParseBench, benchmark riêng của NVIDIA bao gồm độ trung thực văn bản, định dạng ngữ nghĩa, bảng biểu, biểu đồ và neo trực quan, cùng với MOSCAR, IndicVisionBench và một tập con viết tay của OmniDocBench{{/2}} — {{3}}trong khi các điểm số nổi bật trên thị trường (MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR) là các chỉ số tổng hợp từ OmniDocBench.{{/3}} {{4}}Nhiệm vụ khác nhau, thước đo khác nhau, chưa có so sánh công khai nào cùng điều kiện được công bố.{{/4}} {{5}}Con số duy nhất trùng với hệ sinh thái — chỉ số viết tay OmniDocBench Notes — được báo cáo dưới dạng khoảng cách chỉnh sửa văn bản so với v1.2, không phải là điểm tổng hợp, nên vẫn không thể xếp hạng cùng các chỉ số khác.{{/5}} {{6}}Cho đến khi có một bài chạy độc lập được công bố, hãy coi các tuyên bố của Parse 2.0 chỉ mang tính định hướng và chưa được xác minh.{{/6}}

Một nhóm nên kiểm tra những gì trước khi đưa vào sản xuất?

Ba điều. Thứ nhất, ngữ liệu đa ngữ của riêng bạn: toàn bộ điểm bán hàng của 2.0 là cú nhảy đa ngữ, và một bản phát hành âm thầm chính là tình huống mà những lợi ích được công bố hoặc tái hiện trên dữ liệu của bạn, hoặc không — hãy chạy thử các ngôn ngữ bạn thực sự phân tích trước khi tin vào bảng thông số. Thứ hai, hệ ngăn xếp tự lưu trữ: xác nhận bản dựng vLLM của bạn có hỗ trợ mã từ xa Nemotron Parse, áp dụng bản vá tied-output-head, và xác minh đường dẫn phục vụ của bạn thực hiện token hóa trực tuyến thay vì tải tokenizer.json đã độn, có thể mở rộng một prompt ngắn lên 9.000 token. Thứ ba, câu chuyện giấy phép và dịch vụ: các trọng số được miễn phí theo NVIDIA Open Model License, nhưng chưa có NIM công bố, chưa có bảng giá, và chưa có hợp đồng hỗ trợ — vì vậy hãy lên kế hoạch dựa trên tự lưu trữ, và định tuyến giai đoạn LLM ở phía hạ nguồn qua một lớp cho phép bạn hoán đổi mô hình và chuyển đổi dự phòng mà không cần thiết kế lại, đây chính là phần mà một nền tảng định tuyến được xây dựng để làm.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube