Một thẻ tiêu đề cho 'Nemotron Parse 2.0 vs MinerU — thách thức chưa được công bố so với lựa chọn mặc định mã nguồn mở', với biểu tượng trang tài liệu ở bên trái và biểu tượng hộp mã nguồn mở ở bên phải.
Guides & Insights

Nemotron Parse 2.0 so với MinerU: Kẻ thách thức không được công bố so với lựa chọn mặc định mã nguồn mở

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

NVIDIA-Nemotron-Parse-2.0 và MinerU giải quyết cùng một bài toán theo hai hướng ngược nhau. Cả hai đều nhận đầu vào là một trang quét hoặc được kết xuất, rồi trả về markdown có cấu trúc, sạch sẽ với bảng biểu, công thức và thứ tự đọc được giữ nguyên. Nhưng MinerU mới là lựa chọn mặc định mã nguồn mở — hàng chục nghìn sao trên GitHub, giấy phép Apache-2.0 và API lưu trữ có hạn ngạch miễn phí mỗi ngày, là lựa chọn an toàn đầu tiên mà hầu hết các nhóm xử lý tài liệu hướng đến. Nemotron Parse 2.0 lại ngược lại với sự ổn định: nó xuất hiện trên Hugging Face vào ngày 3 tháng 8 năm 2026, NVIDIA chưa đưa ra thông báo nào về nó, và thẻ mô hình của nó mang theo một loạt tuyên bố điểm chuẩn mà nếu được xác thực, sẽ là điều lớn nhất từng xảy ra với lĩnh vực phân tích tài liệu mã nguồn mở trong năm nay. Sự ghép cặp này cố tình bất cân xứng — kẻ đương nhiệm đối đầu với kẻ thách thức chưa công bố — và toàn bộ câu hỏi nằm ở chỗ lời đề xuất của mỗi bên thực sự đáng giá bao nhiêu.

Mỗi bên thực sự là gì

{{1}}MinerU{{/1}} là một hệ thống phân tích tài liệu hoàn chỉnh từ {{2}}OpenDataLab{{/2}}, nhóm dữ liệu đứng sau {{3}}các bản phát hành mở của Phòng thí nghiệm Trí tuệ Nhân tạo Thượng Hải{{/3}}. Sản phẩm chủ lực hiện tại là {{4}}MinerU 2.5-Pro{{/4}}, một {{5}}mô hình ngôn ngữ-thị giác 1.2B{{/5}} trong {{6}}dòng bản phát hành điểm 2604/2605{{/6}} ({{7}}mô hình 2604 ra mắt vào tháng 4 năm 2026{{/7}}, với {{8}}bản cập nhật 2605{{/8}} sau đó). Nó được xây dựng trên một {{9}}engine hai giai đoạn{{/9}} — {{10}}phân tích bố cục toàn cục thô{{/10}}, sau đó là {{11}}nhận dạng có mục tiêu trên các vùng ảnh cắt ở độ phân giải gốc{{/11}} — và dự án tích hợp mô hình vào {{12}}khâu tiếp nhận PDF, DOCX, PPTX và XLSX{{/12}}, {{13}}phát hiện bố cục{{/13}}, {{14}}nhận dạng công thức và bảng biểu{{/14}} và {{15}}tái cấu trúc thứ tự đọc{{/15}}. Đây là {{16}}bộ phân tích mã nguồn mở tham chiếu cho tiền xử lý RAG{{/16}}, và {{17}}cộng đồng{{/17}} chính là minh chứng.

Nemotron Parse 2.0 là bộ mã hóa–giải mã thị giác 0,9B của NVIDIA, cùng dòng với NVIDIA-Nemotron-Parse-v1.2 vốn được phát hành vào tháng 2 năm 2026. Mô hình sử dụng bộ mã hóa thị giác ViT-H xây dựng trên nền tảng C-RADIOv2 của NVIDIA và bộ giải mã kiểu mBART mười lớp. Trang đầu vào có kích thước tối đa 2048×1664, quá trình tạo sinh giới hạn ở trần 9.000 token, và mô hình tạo ra các đầu ra có cấu trúc tương tự như MinerU: markdown hoặc văn bản thuần túy, cùng bảng biểu ở dạng LaTeX, HTML, markdown, JSON, JSON phân cấp hoặc CSV, kèm các lớp bố cục, hộp bao quanh và thứ tự đọc. Kho lưu trữ khá đầy đủ — cấu hình, Dockerfile, bộ kiểm thử kèm đầu ra chuẩn — nhưng NVIDIA chưa quảng bá sản phẩm, không có gói NIM, và chưa có nhà cung cấp suy luận nào lưu trữ mô hình. Tự lưu trữ là lựa chọn duy nhất hiện nay.

Screenshot of the Hugging Face model card for NVIDIA-Nemotron-Parse-2.0, showing the nvidia-open-model-license, 0.9B model size, 2,156 downloads last month, and the note that the model isn't deployed by any inference provider.

Câu chuyện về giá cả: "miễn phí" có hai nghĩa khác nhau

Sự khác biệt thực tế lớn nhất là gọi MinerU thì miễn phí, còn Nemotron Parse 2.0 chỉ miễn phí khi bạn tự chạy. API chính thức của MinerU tại mineru.net có hạn mức miễn phí hàng ngày — khoảng 1.000 trang ưu tiên cao mỗi ngày tùy thuộc chương trình khuyến mãi hiện tại — không tính phí theo từng lần gọi trong hạn mức đó, và hỗ trợ tệp lên tới 200 trang mỗi tệp. Vượt quá hạn mức, các tác vụ bị hạ ưu tiên thay vì bị tính phí, và các nhà cung cấp thương mại định giá mô hình tự lưu trữ ở mức khoảng một phần mười xu mỗi trang. Nếu quy trình xử lý của bạn cần hàng nghìn trang mỗi ngày và bạn không muốn vận hành bất kỳ thứ gì, MinerU có một hướng đi gần như không tốn kém.

Nemotron Parse 2.0 không có lựa chọn nào như vậy. Các trọng số được cung cấp miễn phí theo NVIDIA Open Model License, nhưng thẻ mô hình cho biết mô hình này không được bất kỳ nhà cung cấp suy luận nào triển khai, và NVIDIA cũng chưa định giá hay công bố tùy chọn lưu trữ. Việc sử dụng nó có nghĩa là phải thuê hoặc sở hữu một GPU, dựng Transformers hoặc một bản dựng vLLM với hỗ trợ mã từ xa của Nemotron Parse, đồng thời xử lý các trục trặc triển khai nêu dưới đây. Đối với một dự án có khối lượng nhỏ, đó là một chi phí thực sự — một GPU đắt hơn rất nhiều so với một gói API miễn phí ở mức vài trăm trang mỗi tháng. Đối với một nhóm đã có hạ tầng GPU, việc trọng số được miễn phí là một lợi thế thực sự; câu hỏi là chi phí vận hành có xứng đáng với những gì mô hình tuyên bố mang lại hay không.

Khoảng cách chuẩn: những con số này không đối diện với nhau

Đây là phần mà hầu hết các phép so sánh âm thầm sai lệch, vì vậy hãy nói rõ ràng. Thẻ mô hình của Nemotron Parse 2.0 báo cáo bốn điểm chuẩn: ParseBench tổng thể đạt 0.6391 (tăng so với 0.5782 của v1.2), MOSCAR OCR đa ngôn ngữ đạt 0.9102 BoC F1 (tăng so với 0.4410), IndicVisionBench đạt 0.7203 ANLS-ký tự (tăng so với 0.0612), và một tập con viết tay OmniDocBench được đo bằng khoảng cách chỉnh sửa văn bản, cải thiện từ 0.9739 xuống 0.3395. MinerU 2.5-Pro báo cáo một bộ tiêu chí khác: điểm tổng thể OmniDocBench v1.6 đạt 95.69 — tiên tiến nhất, vượt qua các mô hình lớn hơn nhiều — cùng với 97.29 ở hạng mục phân tích công thức dày đặc và khoảng cách chỉnh sửa văn bản 0.036 trong các lần chạy OmniDocBench của chính nó.

Hai mô hình cùng tên "OmniDocBench," khiến chúng trông có vẻ tương đương nhau, nhưng các chỉ số thì không giống nhau. NVIDIA báo cáo một tập con chỉ dành cho chữ viết tay dưới dạng edit distance; OpenDataLab báo cáo một chỉ số tổng hợp trên một phiên bản benchmark khác. ParseBench là bộ benchmark riêng của NVIDIA và không có mục nào của MinerU. MOSCAR và IndicVisionBench cũng không có mục nào của MinerU. Mọi con số ở cả hai phía đều do nhà cung cấp tự báo cáo, và không có mô hình nào có kết quả chạy độc lập bởi bên thứ ba được công bố mà cả hai cùng xuất hiện. Điều đó có nghĩa là hiện không có con số so sánh ngang bằng nào xếp hạng Nemotron Parse 2.0 với MinerU — bất kỳ ai nói với bạn rằng một mô hình này "thắng" trong cuộc so sánh benchmark đều đang ngoại suy từ các bài kiểm tra khác nhau. Điều bạn có thể nói theo hướng tổng quan: các tuyên bố của MinerU đã chín muồi và đã vượt qua một năm cộng đồng sử dụng, trong khi các tuyên bố của Nemotron Parse 2.0 còn mới, chưa được kiểm chứng — và nếu những bước nhảy vọt về MOSCAR và IndicVision của nó được tái lập, đó sẽ là một vấn đề lớn dành riêng cho việc phân tích tài liệu đa ngôn ngữ.

A comparison scoreboard for Nemotron Parse 2.0 and MinerU 2.5-Pro. Nemotron Parse 2.0: shipped Aug 3 2026 unannounced, 0.9B params, NVIDIA Open Model license, no hosted API, ParseBench 0.6391, MOSCAR 0.9102 F1. MinerU 2.5-Pro: shipped Apr 2026, 1.2B params, Apache 2.0, official API with free tier, OmniDocBench v1.6 95.69, 109 languages.

Nơi chúng khác biệt trên khối lượng công việc thực tế

Screenshot of the Hugging Face model card for opendatalab/MinerU2.5-Pro-2604-1.2B, showing the Apache-2.0 license, the arXiv tech report 'MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale', and an 'unmatched SOTA Performance' banner.

Tạm gác các điểm chuẩn sang một bên, những khác biệt xuất hiện trong một pipeline xoay quanh phạm vi, độ trễ và độ bao phủ đa ngôn ngữ.

• Phạm vi đầu vào — MinerU tiếp nhận toàn bộ PDF lên đến 200 trang mỗi tệp thông qua API và hợp nhất các bảng xuyên trang; Nemotron Parse 2.0 nhận một ảnh trang lên đến 2048×1664 cho mỗi lần gọi, vì vậy một tài liệu 200 trang cần 200 yêu cầu. Nếu đầu vào của bạn là PDF, đó là một khác biệt về quy trình trước bất kỳ câu hỏi nào về độ chính xác.

• Mức độ trưởng thành của khả năng serving — MinerU cung cấp backend vLLM và SGLang với thông lượng đã được công bố (khoảng 2 trang mỗi giây trên một A100 nhờ engine không đồng bộ), trình chạy Docker và API lưu trữ. Câu chuyện serving của Nemotron Parse 2.0 vẫn còn non trẻ và gập ghềnh: vLLM cần hỗ trợ mã từ xa và, trên phần cứng A100/A10, cần backend attention Triton; tokenizer đi kèm một tệp tokenizer.json đã tuần tự hóa với phần đệm nhúng sẵn lên tới 9.000 token — một ngăn xếp serving từng vấp phải khi prompt sáu token bùng nổ thành 54.000 token ID; và repo kèm theo một bản vá thời gian chạy cho các bản dựng vLLM không hỗ trợ output head liên kết của nó. Không vấn đề nào trong số này là không thể vượt qua, nhưng đó là ma sát thực sự.

• Đa ngôn ngữ — đây là điểm mà Nemotron Parse 2.0 thể hiện mạnh mẽ nhất. Bản phát hành 2.0 đã mở rộng từ vựng từ khoảng 52.000 lên 72.000 token, chuyên cho OCR đa ngôn ngữ, và những cải thiện được công bố tập trung chủ yếu ở đây: MOSCAR tăng từ 0,44 lên 0,91, còn IndicVisionBench (tiếng Bengal, Hindi, Tamil và bảy hệ chữ Indic khác) tăng từ 0,06 lên 0,72. MinerU hỗ trợ 109 ngôn ngữ như một tính năng nổi bật, nhưng bằng chứng của nó là chỉ số tổng hợp OmniDocBench, không phải bảng phân tích theo từng hệ chữ. Nếu kho ngữ liệu của bạn chủ yếu là các hệ chữ Indic hoặc hệ chữ có ít tài nguyên, thì các con số của Nemotron Parse 2.0 là tuyên bố đáng kiểm chứng hơn — đồng thời cũng là những con số ít được xác minh độc lập nhất.

• Chữ viết tay — khác biệt lớn nhất trên thẻ của NVIDIA chính là chữ viết tay: khoảng cách biên tập trên tập con ghi chú của OmniDocBench giảm từ 0,97 xuống 0,34. Khoảng cách biên tập văn bản 0,036 của MinerU được tính trên toàn bộ các lần chạy OmniDocBench của nó, chứ không phải trên tập con chữ viết tay, nên một lần nữa các con số không thể đối chiếu trực tiếp với nhau. Nhưng ghi chú viết tay là dạng lỗi kinh điển của cả hai, và đây là lĩnh vực duy nhất mà mức cải thiện được tuyên bố của Nemotron Parse 2.0 đủ lớn để biện minh cho việc thử nghiệm trực tiếp trên các trang của chính bạn.

Ai nên chọn cái nào

Hãy chọn MinerU nếu bạn muốn một bộ phân tích có thể sử dụng ngay hôm nay: gói miễn phí theo ngày, hạ tầng phục vụ trưởng thành, hỗ trợ đầu vào PDF đầy đủ, giấy phép Apache-2.0 không cần đánh giá tuân thủ, và cộng đồng đủ lớn để các câu trả lời cho các câu hỏi thiết lập đã có sẵn. Nó có lý do để trở thành lựa chọn mặc định, và đối với hầu hết các tác vụ tiền xử lý RAG, đây là lựa chọn ít rủi ro hơn.

{{1}}Hãy chọn Nemotron Parse 2.0 nếu bạn đã quen với việc tự lưu trữ mô hình — đặc biệt nếu bạn đang ở phía NVIDIA NIM hoặc NeMo, vì v1.2 được cung cấp dưới dạng NIM và 2.0 có vẻ là phiên bản kế nhiệm — và nếu nhu cầu đa ngôn ngữ hoặc chữ viết tay là điều cụ thể mà kho ngữ liệu của bạn cần.{{/1}} {{2}}Một bài kiểm tra cuối tuần trên các trang Indic hoặc nhiều ghi chú của chính bạn sẽ cho bạn biết nhiều hơn bất kỳ bảng điểm chuẩn nào, vì các tuyên bố sẽ được tái hiện hoặc sụp đổ dưới dữ liệu độc lập.{{/2}} {{3}}Chỉ cần đừng lên kế hoạch cho một lộ trình sản xuất dựa trên một mô hình chưa được công bố cho đến khi bạn đã chạy bài kiểm tra đó và xác nhận rằng tokenizer và các trục trặc trong phục vụ đã được xử lý trong stack của bạn.{{/3}}

Tại sao bộ phân tích cú pháp không phải là chi phí duy nhất trong pipeline

Dù bạn chọn gì, trình phân tích cú pháp (parser) thường là khâu rẻ nhất trong quy trình xử lý tài liệu khi khối lượng thực sự lớn. Khâu đắt đỏ nhất là LLM — mô hình chuyển markdown đã được phân tích thành tóm tắt, bản ghi có cấu trúc hoặc câu trả lời — và chính ở khâu này, một lớp định tuyến sẽ thay đổi toàn bộ bài toán kinh tế. OrcaRouter đưa hơn 200 mô hình vào sau một API duy nhất với giá niêm yết của nhà cung cấp, không cộng thêm bất kỳ khoản phụ phí nào, nên khi nhà cung cấp giảm giá, mức giá mới có hiệu lực ngay trong ngày công bố; ngoài ra, cơ chế tự động chuyển đổi dự phòng đảm bảo một nhà cung cấp xuống cấp không làm đình trệ toàn bộ công việc trích xuất. Cụ thể: bạn có thể kiểm chứng các tuyên bố về khả năng nhận dạng chữ viết tay của Nemotron Parse 2.0 so với MinerU trên bộ ngữ liệu của chính mình mà không cần cam kết ngăn xếp mô hình hạ nguồn của bạn vào bất kỳ parser nào, vì việc hoán đổi parser và lớp LLM được tách rời hoàn toàn. Hiện tại, chúng tôi không lưu trữ parser nào cả — Nemotron Parse 2.0 là mô hình tự lưu trữ và MinerU chạy trên dịch vụ riêng của nó — nhưng một lớp định tuyến ở khâu LLM chính là thứ giúp quyết định chọn parser không trở thành quyết định khóa chặt.

Điểm mấu chốt

MinerU là lựa chọn mặc định hợp lý: đã trưởng thành, miễn phí khi gọi API ở quy mô nhỏ, có giấy phép dễ dãi, và đã được kiểm chứng trong thực tế sản xuất. Nemotron Parse 2.0 là canh bạc thú vị: một mô hình 0,9B của NVIDIA được phát hành lặng lẽ năm ngày trước, với model card tuyên bố một bước nhảy vọt ấn tượng về khả năng đa ngôn ngữ và chữ viết tay mà chưa ai xác minh một cách độc lập. Nếu bạn trích xuất chủ yếu các tài liệu kỹ thuật tiếng Anh với khối lượng lớn, thì MinerU là câu trả lời và rủi ro từ Nemotron Parse 2.0 không đáng để chấp nhận. Nếu bạn trích xuất các hệ chữ Indic hoặc hệ chữ ít tài nguyên, hoặc các ghi chú viết tay, thì những tuyên bố đó đủ lớn — và trọng số đủ miễn phí — để việc tự chạy thử nghiệm trở nên rẻ. Việc NVIDIA phát hành một trình parse mới khoảng mỗi quý (v1.1 vào tháng 11/2025, v1.2 vào tháng 2/2026, 2.0 hiện tại) cho thấy một thông báo có thể sớm được đưa ra; cho đến khi điều đó xảy ra, hãy coi các số liệu của 2.0 chỉ mang tính định hướng và thử nghiệm trên kho dữ liệu của riêng bạn.

FAQ

Nemotron Parse 2.0 có khả dụng thông qua bất kỳ API nào không?

Không phải qua một dịch vụ lưu trữ. Thẻ Hugging Face cho biết mô hình không được triển khai bởi bất kỳ nhà cung cấp suy luận nào, và NVIDIA chưa công bố đóng gói hoặc định giá NIM cho nó, tính đến đầu tháng 8 năm 2026. Cách duy nhất để chạy nó là tự lưu trữ các trọng số thông qua Hugging Face Transformers với trust_remote_code, hoặc thông qua một bản dựng vLLM bao gồm hỗ trợ mã từ xa của Nemotron Parse. Ngược lại, MinerU có API chính thức với hạn mức trang miễn phí hàng ngày.

Mô hình nào tốt hơn cho tiền xử lý RAG?

Đối với các pipeline RAG điển hình — tài liệu kỹ thuật tiếng Anh và CJK, bảng biểu và bố cục hỗn hợp — MinerU là lựa chọn an toàn hơn, đã được kiểm chứng nhiều hơn: nó nhận toàn bộ PDF, gộp các bảng trải nhiều trang, có hạ tầng phục vụ trưởng thành và không tốn phí ở quy mô nhỏ nhờ gói miễn phí. Nemotron Parse 2.0 chỉ trở thành lựa chọn đúng đắn nếu kho ngữ liệu của bạn nặng về hệ chữ Indic hoặc các hệ chữ ít tài nguyên, ghi chú viết tay, hoặc các trang nhiều biểu đồ — nơi tập trung những lợi ích mà nó tuyên bố — và ngay cả khi đó, hãy xác minh trên tài liệu của riêng bạn trước khi cam kết.

Các con số benchmark trên hai thẻ mô hình có thể so sánh trực tiếp với nhau không?

Không. Nemotron Parse 2.0 báo cáo ParseBench (bộ đánh giá riêng của NVIDIA), MOSCAR, IndicVisionBench và một tập con viết tay của OmniDocBench dưới dạng khoảng cách chỉnh sửa. MinerU 2.5-Pro báo cáo chỉ số tổng hợp tổng thể của OmniDocBench v1.6 cùng với các chỉ số công thức và chỉnh sửa văn bản. Tên benchmark trùng nhau không phải là cùng một chỉ số, không có lần chạy độc lập nào đặt cả hai mô hình vào cùng một bài kiểm tra, và mọi con số trên cả hai thẻ đều do nhà cung cấp báo cáo. Hãy coi chúng chỉ mang tính định hướng, không thể so sánh trực tiếp.