
Nemotron Parse 2.0 vs olmOCR: Hai công việc, cùng được gọi là parsing
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Vào ngày 3 tháng 8 năm 2026, NVIDIA đã đăng tải một mô hình phân tích tài liệu mới lên Hugging Face mà không báo cho ai biết. {{1}}NVIDIA-Nemotron-Parse-2.0{{/1}} là mô hình mã hóa-giải mã thị giác {{2}}0.9B{{/2}} mà thẻ mô hình của nó tuyên bố tạo ra bước nhảy vọt đa ngôn ngữ và nhận biết biểu đồ so với phiên bản tiền nhiệm {{3}}tháng 2 năm 2026{{/3}}, và nó xuất hiện ở cùng một khu vực của hệ sinh thái với {{4}}olmOCR{{/4}} — chính xác hơn là {{5}}olmOCR-2-7B-1025{{/5}}, bộ tuyến tính hóa {{6}}7B{{/6}} từ {{7}}Allen Institute for AI{{/7}} vốn đã âm thầm trở thành cách mặc định để biến PDF thành dữ liệu huấn luyện LLM. Gọi đây là cuộc so tài trực diện chính là cái bẫy: cả hai mô hình đều được mô tả là "phân tích tài liệu", nhưng chúng trả về các đầu ra khác nhau, phục vụ các pipeline khác nhau, và số liệu benchmark của chúng không bao giờ thực sự đọ sức với nhau. Câu hỏi thực sự là bạn đang thuê bộ phân tích để làm việc nào trong hai công việc.
Hai hiện vật
Nemotron Parse 2.0 là một công cụ phân tích bố cục-ngữ nghĩa. Đưa cho nó một ảnh trang và một lời nhắc tác vụ, nó sẽ trả về văn bản cùng một lớp ngữ nghĩa phía trên: một lớp bố cục cho từng vùng (tiêu đề, mục, chú thích, bảng, biểu đồ, đầu trang, chân trang, ghi chú cuối trang, mục thư mục), một hộp giới hạn cho từng vùng, và thứ tự đọc giữa chúng — với markdown là một dạng tuần tự hóa tùy chọn. olmOCR 2 là một bộ tuyến tính hóa. Nó nhận cùng một trang và trả về markdown sạch, đã tuyến tính hóa, kèm một frontmatter YAML ngắn ghi lại siêu dữ liệu cấp trang như ngôn ngữ chính, hiệu chỉnh xoay, và việc trang đó là bảng hay biểu đồ. Không hộp, không lớp, không hình học: một lượt xử lý, văn bản theo đúng thứ tự tài liệu.
Sản phẩm đầu ra quyết định công việc. Nếu pipeline của bạn cần tham chiếu ngược một dữ kiện về một vùng trên trang, làm nổi bật một bảng trên bản scan, hoặc trích xuất ngữ nghĩa bố cục cho trí tuệ tài liệu, bạn cần hình học — đó là không gian đầu ra của Nemotron Parse 2.0. Nếu bạn đang xây dựng dữ liệu huấn luyện hoặc đưa vào một LLM văn bản chỉ tiêu thụ token, hình học là nhiễu và markdown tuyến tính hóa là chính xác — đó là toàn bộ thiết kế của olmOCR. Bạn có thể gắn thêm tính năng phát hiện bố cục vào đầu ra của olmOCR bằng một bộ dò riêng, và bạn có thể loại bỏ các khung của Nemotron Parse 2.0 và chỉ giữ lại markdown, nhưng mỗi mô hình được xây dựng để thực hiện một trong những công việc đó một cách tự nhiên.
Bản phát hành lặng lẽ: những gì repo cho thấy, những gì chưa được xác nhận
NVIDIA-Nemotron-Parse-2.0 xuất hiện trên Hugging Face vào ngày 3 tháng 8 năm 2026 mà không có thông báo, không có bài viết blog, và không có đóng gói NIM nào. Điều có thể biết được là kho lưu trữ (repo). Đây là một bộ mã hóa-giải mã thị giác 0,9B: bộ mã hóa hình ảnh ViT-H xây dựng trên nền tảng C-RADIO của NVIDIA, một bộ chuyển đổi tích chập 1D nhẹ và bộ giải mã kiểu mBART mười lớp. Bộ tokenizer đã tăng thêm khoảng 20.000 mục lên tổng cộng khoảng 72.000 mục, nhằm hỗ trợ đa ngôn ngữ hiệu quả hơn, và thẻ mô hình liệt kê tính năng phân tích nhận biết biểu đồ như một tính năng nổi bật thông qua token mới class_Chart, cùng với một loạt các định dạng tuần tự hóa bảng (LaTeX, HTML, markdown, JSON, JSON phân cấp, CSV). Hai bộ xử lý logits tùy chọn đi kèm: một bộ dừng đầu ra có cấu trúc lặp lại, và một bộ ép cấu trúc bảng lên phần cắt bảng. Độ phân giải đầu vào khuyến nghị nằm trong khoảng 1024×1280 đến 1664×2048, quá trình sinh chạy tới trần 9.000 token, và thẻ mô hình liệt kê Transformers, vLLM, SGLang và Docker Model Runner làm môi trường chạy trên các phần cứng Ampere, Hopper, Blackwell và Turing.
Tuy nhiên, các tuyên bố này đều là của riêng NVIDIA và chưa có tuyên bố nào được tái lập một cách độc lập. Thẻ thông số báo cáo ParseBench tổng thể đạt {{1}}0.6391{{/1}} (tăng từ mức {{2}}0.5782{{/2}} của v1.2), MOSCAR OCR đa ngôn ngữ đạt {{3}}0.9102{{/3}} BoC-F1 (tăng từ {{4}}0.4410{{/4}}), IndicVisionBench đạt {{5}}0.7203{{/5}} ANLS-character (tăng từ {{6}}0.0612{{/6}}), và tập con viết tay OmniDocBench cải thiện từ {{7}}0.9739{{/7}} lên {{8}}0.3395{{/8}} trên khoảng cách chỉnh sửa văn bản. Đây là những bước nhảy lớn nhất, đồng thời cũng là những con số ít được xác minh nhất: ParseBench là bộ đánh giá của riêng NVIDIA và chưa có bên thứ ba nào chạy Parse 2.0 trên một kho ngữ liệu độc lập. Điều chưa được xác nhận không chỉ dừng ở điểm số — không có dịch vụ suy luận lưu trữ (thẻ thông số nêu rõ mô hình chưa được bất kỳ nhà cung cấp suy luận nào triển khai), không có giá và cũng chưa có lộ trình nào được công bố cho cả hai.

olmOCR 2: tiêu chuẩn mà mọi người đã lấy làm thước đo
olmOCR là mô hình đã tạo ra chuẩn đánh giá mà danh mục này hiện đang tranh cãi. olmOCR-2-7B-1025, phát hành ngày 22 tháng 10 năm 2025, là mô hình ngôn ngữ-thị giác 7B được tinh chỉnh từ Qwen2.5-VL-7B-Instruct trên kho ngữ liệu olmOCR-mix-1025 gồm 270.000 trang, sau đó được tối ưu hóa bằng học tăng cường GRPO với các phần thưởng "kiểm thử đơn vị" tự động — những kiểm tra xác định xem bảng có giữ nguyên cấu trúc, công thức có được chép lại chính xác, và thứ tự đọc có được duy trì hay không. Khung kiểm thử đơn vị đó đã trở thành olmOCR-Bench, gồm khoảng 1.400 tệp PDF và hơn 7.000 phép kiểm tra, và đã trở thành chuẩn đánh giá công nghiệp thực tế: Marker, MinerU và hàng chục mô hình OCR thương mại hiện công bố kết quả dựa trên nó. Bản thân olmOCR 2 đạt 82,4 điểm tổng thể tại đây, cao hơn khoảng bốn điểm so với bản phát hành trước và cao hơn các con số của Marker (76,1) và MinerU (75,8) mà AI2 trích dẫn trên cùng một trang.
olmOCR cũng là lựa chọn trưởng thành hơn trong cặp đôi này. Nó được cấp phép Apache-2.0, các bộ trọng số của nó đã được tải về khoảng 218.000 lần trong tháng qua, và bộ công cụ olmOCR xử lý việc render, xoay và thử lại ở quy mô lớn trên backend vLLM — ước tính theo lô của AI2 cho thấy pipeline có chi phí khoảng $176–190 mỗi triệu trang trên GPU thuê, và bản dựng FP8 chạy khoảng 3.400 token đầu ra mỗi giây trên một H100, đủ nhanh để bài đăng phát hành trích dẫn "10.000 trang với giá dưới 2 đô la". Điểm đánh đổi là ngôn ngữ: olmOCR được xây dựng và đo điểm chuẩn một cách tường minh cho bản in số hóa tiếng Anh, và model card của nó gắn nhãn tiếng Anh. Toàn bộ điểm bán hàng của Nemotron Parse 2.0 lại ngược lại — những cải thiện được tuyên bố của nó tập trung vào các hệ chữ CJK và Indic.

Sáu hàng cho thấy sự đánh đổi
Cả hai mô hình đều có trọng số mở, cả hai đều chạy trên Transformers, vLLM hoặc SGLang, và cả hai đều có thể tự lưu trữ (self-hosted) hiện nay. Xét về các khía cạnh quan trọng khi lựa chọn giữa chúng:
• Kích thước — Nemotron Parse 2.0 là 0,9B; olmOCR 2 là 7B. Gần như gấp tám lần tham số, gần như gấp tám lần mức VRAM tối thiểu.
• Đầu ra — Nemotron Parse 2.0 trả về văn bản, các lớp bố cục, các hộp giới hạn, thứ tự đọc và markdown; olmOCR 2 trả về markdown tuyến tính hóa với khối siêu dữ liệu YAML.
Đa ngôn ngữ — Nemotron Parse 2.0 tuyên bố hỗ trợ mạnh mẽ CJK và Indic (MOSCAR 0.9102, IndicVisionBench 0.7203, theo nhà cung cấp báo cáo); olmOCR 2 ưu tiên tiếng Anh.
• Điểm chủ lực — Nemotron Parse 2.0 công bố ParseBench 0,6391 (số liệu của riêng NVIDIA, chưa được kiểm toán); olmOCR 2 đạt 82,4 trên olmOCR-Bench (số liệu của riêng AI2, đã được cộng đồng tái sử dụng trong mười tháng).
• Giấy phép — Nemotron Parse 2.0 được phát hành theo Giấy phép Mô hình Mở NVIDIA; olmOCR 2 là Apache-2.0.
Đã phát hành — Nemotron Parse 2.0 ra mắt vào ngày 3 tháng 8 năm 2026 mà không có thông báo trước; olmOCR 2 được phát hành vào ngày 22 tháng 10 năm 2025, kèm theo bài viết ra mắt.

Ba nơi quyết định này thực sự gây hậu quả
{{1}}Quy mô và độ trễ.{{/1}} {{2}}Một bộ giải mã 0.9B rẻ hơn đáng kể để phục vụ so với VLM 7B: GPU nhỏ hơn, ít VRAM hơn, nhiều trang mỗi giây hơn trên cùng một phần cứng và chi phí mỗi trang thấp hơn khi bạn phải trả tiền cho thời gian GPU.{{/2}} {{3}}Nếu bạn đã vận hành hạ tầng GPU và kho ngữ liệu của bạn lớn, đó là một khác biệt thực sự hàng tháng.{{/3}} {{4}}Các con số của chính olmOCR cho thấy một mô hình 7B có thể nhanh đến mức nào với lượng tử hóa FP8 — nhưng nó vẫn cần một GPU lớp H100 để đạt được những con số đó;{{/4}} {{5}}Yêu cầu phần cứng tối thiểu của Nemotron Parse 2.0 là một card thuộc thời Ampere.{{/5}}
Đa ngôn ngữ. Đây là dòng bất cân xứng nhất. Nemotron Parse 2.0 đã mở rộng bộ tokenizer của mình thêm khoảng 20.000 mục, dành riêng cho OCR đa ngôn ngữ, và những cải thiện được công bố trên bảng thông số của nó tập trung vào các hệ chữ Ấn Độ và CJK. olmOCR 2 không đưa ra tuyên bố nào như vậy — thẻ ngôn ngữ của nó là tiếng Anh. Nếu kho ngữ liệu của bạn là tiếng Hindi, Tamil, Bengal, Nhật, hoặc hỗn hợp nhiều hệ chữ, thì các con số của Nemotron Parse 2.0 mới là những con số đáng thử nghiệm, chính xác là vì chúng do nhà cung cấp báo cáo và còn mới.
{{1}}Thực tế phục vụ.{{/1}} {{2}}olmOCR 2 đã mười tháng tuổi và chuỗi công cụ của nó nhàm chán theo nghĩa tích cực.{{/2}} {{3}}Nemotron Parse 2.0 mới năm ngày tuổi và câu chuyện phục vụ của nó còn non trẻ rõ rệt:{{/3}} {{4}}vLLM cần một bản build có hỗ trợ mã từ xa Nemotron Parse, đầu ra liên kết làm vấp một số bản build vLLM 0.20 (kho lưu trữ cung cấp bản vá thời gian chạy), và tokenizer.json mang padding tuần tự hóa lên đến 9.000 token — một ngăn xếp phục vụ từng gặp tình trạng prompt sáu token mở rộng thành 54.000 token ID trước khi vá.{{/4}} Không điều nào trong số đó là nghiêm trọng, nhưng đó chính xác là loại ma sát bạn cần dự trù cho một mô hình mới.
Chọn một cho pipeline của bạn
Hãy chọn olmOCR 2 nếu bạn đang xây dựng dữ liệu huấn luyện LLM hoặc một quy trình trích xuất văn bản khối lượng lớn cho các tài liệu tiếng Anh. Bạn sẽ có được một bộ công cụ hoàn thiện, giấy phép Apache-2.0, chuẩn mực mà ngành công nghiệp hiện đang sử dụng để đo lường, và một quy trình xử lý hàng loạt đã được kiểm chứng. Hạn chế được chấp nhận của nó là độ phủ ngôn ngữ.
Hãy chọn Nemotron Parse 2.0 nếu quy trình xử lý của bạn cần hình học — các lớp bố cục, hộp giới hạn và thứ tự đọc cho truy xuất có căn cứ hoặc trí tuệ tài liệu — hoặc nếu kho ngữ liệu của bạn nặng về các trang tiếng Indic, CJK hoặc viết tay, nơi những lợi ích được quảng bá của nó thể hiện rõ. Kích thước 0.9B khiến việc thử nghiệm cuối tuần trở nên rẻ, ngay cả khi bạn còn chưa chắc chắn. Chế độ lỗi được chấp nhận của nó là mọi con số trên thẻ đều là của riêng NVIDIA và có thể thay đổi dưới sự đánh giá độc lập.
{{1}}Nếu dữ liệu đầu vào của bạn chủ yếu là PDF thuần kỹ thuật số bằng tiếng Anh và bạn chỉ cần markdown sạch, olmOCR 2 là lựa chọn mặc định ít rủi ro hơn.{{/1}} {{2}}Nếu bạn đã tự lưu trữ và thực sự có nhu cầu đa ngôn ngữ hoặc dựa trên bố cục, Nemotron Parse 2.0 là lựa chọn đáng để thử hơn{{/2}} {{3}}— hãy chạy thử trên chính các trang của bạn trước khi quyết định.{{/3}}
Đừng để việc lựa chọn parser trở thành một ràng buộc khó thay đổi.
Một đường ống xử lý tài liệu có giai đoạn parser và sau đó là giai đoạn LLM, và parser thường là giai đoạn rẻ nhất khi khối lượng xử lý thực sự đáng kể — LLM chuyển markdown đã được phân tích thành bản tóm tắt, bản ghi có cấu trúc hoặc câu trả lời mới là nơi chi phí tăng theo quy mô. Đó chính là giai đoạn mà một lớp định tuyến thay đổi. OrcaRouter đặt hơn 200 mô hình đằng sau một API duy nhất với giá niêm yết của nhà cung cấp, không tính phí chênh lệch, vì vậy đợt giảm giá từ nhà cung cấp có hiệu lực ngay trong ngày, và cơ chế failover tự động ngăn một nhà cung cấp bị suy giảm làm đình trệ một tác vụ hàng loạt. Không parser nào trong bài so sánh này nằm trong danh mục của chúng tôi — cả hai thẻ mô hình đều nêu rõ chúng không được bất kỳ nhà cung cấp suy luận nào triển khai, vì vậy đây là quyết định tự triển khai (self-host) — nhưng lý do để giữ parser tách rời khỏi ngăn xếp mô hình của bạn chính là những gì định tuyến đem lại ở phía hạ nguồn: hoán đổi Nemotron Parse 2.0 lấy olmOCR 2, hoặc ngược lại, mà không cần đụng đến một tích hợp nào, vì lớp LLM vẫn nằm phía sau cùng một API với một khóa truy cập duy nhất.
FAQ
Mô hình nào thắng trên các benchmark?
Không bên nào — các con số không đối đầu trực tiếp với nhau. Nemotron Parse 2.0 báo cáo ParseBench, MOSCAR, IndicVisionBench và một tập con chữ viết tay của OmniDocBench, tất cả đều do NVIDIA tự xây dựng và chưa có kết quả nào được tái lập độc lập. olmOCR 2 báo cáo olmOCR-Bench, benchmark riêng của AI2 mà phần còn lại của ngành hiện nay công bố dựa trên. Chưa có bên thứ ba nào chạy cả hai mô hình trên cùng một kho ngữ liệu, vì vậy bất kỳ tuyên bố trực tiếp về "người thắng cuộc" nào cũng chỉ là suy diễn. Về xu hướng: các con số của olmOCR đã trụ vững qua mười tháng sử dụng của cộng đồng; còn của Nemotron Parse 2.0 thì mới mẻ và có thể thay đổi.
Nemotron Parse 2.0 có thực sự tốt hơn với các tài liệu không phải tiếng Anh không?
Đó là tuyên bố — mở rộng từ vựng khoảng 20.000 token, cùng MOSCAR ở mức 0,9102 và IndicVisionBench ở mức 0,7203, cả hai đều do nhà cung cấp báo cáo và đều tăng mạnh so với v1.2. olmOCR 2 không đưa ra tuyên bố đa ngôn ngữ và được gắn nhãn tiếng Anh. Nhưng cho đến khi có một đợt chạy độc lập, hãy coi những cải thiện đa ngôn ngữ của Nemotron Parse 2.0 là hứa hẹn nhưng chưa được xác minh và tự kiểm thử trên các trang Indic hoặc CJK của bạn trước khi dựa vào chúng.
Tôi có cần một GPU lớn hơn cho một trong số chúng không?
Vâng, và nó theo dõi sự khác biệt về kích thước. Bản 0.9B của Nemotron Parse 2.0 chạy vừa trên một card thế hệ Ampere tầm trung và là lựa chọn rẻ hơn theo từng trang trên phần cứng bạn đã có. Mô hình VLM 7B của olmOCR 2 đòi hỏi GPU lớn hơn đáng kể; bản FP8 của nó đạt khoảng 3.400 token đầu ra mỗi giây trên H100, theo AI2.
Cái nào tốt hơn cho tiền xử lý RAG?
Điều này tùy thuộc vào những gì bộ truy xuất (retriever) của bạn cần. Nếu bạn cần gắn câu trả lời với các vùng trên trang, cần các lớp bố cục, hoặc muốn lập chỉ mục các bảng và biểu đồ như các đơn vị riêng, thì các hộp giới hạn và lớp của Nemotron Parse 2.0 cung cấp sẵn điều đó. Nếu ngăn xếp RAG của bạn chỉ tiêu thụ văn bản sạch và kho ngữ liệu của bạn là tiếng Anh, thì markdown tuyến tính hóa của olmOCR 2 đã được kiểm chứng, đơn giản hơn và được hỗ trợ bởi một bộ công cụ hoàn thiện.
Điểm mấu chốt
NVIDIA đã phát hành một trình phân tích cú pháp thực thụ trong tuần này mà không hề thông báo cho ai; AI2 đã phát hành một trình từ mười tháng trước và tạo ra chuẩn mực cho hạng mục này. Nemotron Parse 2.0 là lựa chọn phù hợp hơn khi bạn cần ngữ nghĩa bố cục, hỗ trợ đa ngôn ngữ, hoặc trích xuất chữ viết tay với ngân sách nhỏ — và những mảng mà số liệu của nó ít được kiểm chứng nhất lại chính là những mảng mà nó tuyên bố giành chiến thắng. olmOCR 2 là lựa chọn phù hợp hơn khi bạn cần văn bản tuyến tính hóa ở quy mô lớn cho các tài liệu tiếng Anh và muốn một bộ công cụ đã ổn định suốt mười tháng. Cả hai đều chưa được triển khai ở bất kỳ đâu, nên dù thế nào đây cũng là quyết định tự lưu trữ; cách rẻ nhất để thực hiện là chạy cả hai trên những trang khó nhất của bạn và quan sát xem mỗi cái hỏng ở đâu.
