การ์ดชื่อเรื่องสำหรับ 'NVIDIA-Nemotron-Parse-2.0': พาดหัว 'NVIDIA-Nemotron-Parse-2.0', คำบรรยายใต้หัว 'การอัปเดตตัวแยกวิเคราะห์เอกสารแบบเงียบ ๆ' และคำอธิบาย 'ตัวเข้ารหัส-ถอดรหัสภาพ 0.9B · OCR หลายภาษา · รองรับแผนภูมิ' ข้างภาพประกอบแนวแบนของหน้าต้นฉบับที่กำลังถูกแยกวิเคราะห์พร้อมกรอบขอบเขตสีและไอคอนแผนภูมิ โลโก้ OrcaRouter ประกอบที่มุมขวาล่าง
Guides & Insights

NVIDIA-Nemotron-Parse-2.0: NVIDIA เปิดตัวตัวแยกวิเคราะห์เอกสารที่ชาญฉลาดยิ่งขึ้นอย่างเงียบ ๆ

ผู้เขียน

Jim Song

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

NVIDIA-Nemotron-Parse-2.0 ปรากฏบน Hugging Face เมื่อวันที่ 3 สิงหาคม 2026 และในขณะที่เขียนบทความนี้ ซึ่งผ่านมาห้าวันแล้ว NVIDIA ก็ยังไม่ได้ประกาศอย่างเป็นทางการ — ไม่มีบล็อกโพสต์ ไม่มีข่าวประชาสัมพันธ์ ไม่มีเธรดบน X แต่ repo มีความครบถ้วนสมบูรณ์: vision-encoder-decoder ขนาด 0.9B, การ์ดโมเดลพร้อมตาราง benchmark ฉบับเต็มที่เปรียบเทียบกับ NVIDIA-Nemotron-Parse-v1.2, ไฟล์ configs, Dockerfile, ชุดทดสอบ และแม้แต่ pull request ของ vLLM ที่อ้างอิงถึง auxiliary head ของโมเดลใหม่แล้ว การปล่อยเวอร์ชันที่สมบูรณ์โดยไม่มีการโปรโมตใดๆ เลย คือสัญญาณที่ควรค่าแก่การจับตามองในแบบ 'สิ่งที่เรารู้จนถึงตอนนี้' และนี่คือสิ่งนั้น: ข้อเท็จจริงที่ repo ยืนยัน ตัวเลขที่ยังคงเป็นข้อมูลจากผู้ผลิต และคำถามปลายเปิดที่โดยปกติแล้วการประกาศอย่างเป็นทางการจะเป็นผู้ตอบ

NVIDIA-Nemotron-Parse-2.0 คืออะไร

Nemotron Parse เป็นโมเดลแยกวิเคราะห์เอกสารของ NVIDIA: คุณป้อนหน้าที่ยังสแกนหรือเรนเดอร์ แล้วมันจะคืนข้อความตามลำดับการอ่าน, bounding box และคลาสเชิงความหมายของแต่ละภูมิภาค, และ markdown — รวมถึงตาราง, ในรูปแบบที่คุณเลือกจาก LaTeX, HTML, markdown, JSON, hierarchical JSON, หรือ CSV มันไม่ใช่ LLM ทั่วไป และไม่ใช่เครื่องมือ OCR ธรรมดา มันอยู่ระหว่างสองสิ่งนี้: การแยกข้อมูลที่รับรู้เลย์เอาต์ ซึ่งออกแบบมาเพื่อป้อนเข้าสู่ไปป์ไลน์ RAG, การแยกข้อมูล, และระบบประมวลผลเอกสารอัจฉริยะ

เวอร์ชัน 2.0 ยังคงใช้ตระกูลสถาปัตยกรรมเดียวกันกับ v1.2 ตามการกำหนดค่าใน repo ตัวเข้ารหัสภาพเป็น ViT-H ที่สร้างบนโครงสร้างพื้นฐาน C-RADIOv2 ของ NVIDIA ตัวถอดรหัสเป็นแบบ mBART จำนวน 10 ชั้น และทั้งหมดมีพารามิเตอร์ประมาณ 0.9 พันล้าน หน้าอินพุตมีขนาดสูงสุด 2048×1664 การสร้างข้อความสูงสุด 9,000 โทเคน และโมเดลระบุตำแหน่งด้วยชุดคลาสเชิงความหมาย (ข้อความ, ชื่อเรื่อง, หัวข้อส่วน, รายการ, ตาราง, สูตร, รูปภาพ, คำบรรยาย, เชิงอรรถ, ส่วนหัว/ท้ายหน้า และอื่นๆ) โมเดลนี้มีขนาดเล็กพอที่จะโฮสต์เองบน GPU ตัวเดียว ซึ่งสำคัญเพราะนั่นเป็นวิธีเดียวที่จะรันได้ในปัจจุบัน

มีอะไรเปลี่ยนแปลงจาก v1.2

ส่วนที่น่าสนใจของการ์ดไม่ใช่ตัวโมเดล — หากแต่เป็นเดลต้า NVIDIA-Nemotron-Parse-v1.2 เปิดตัวบน Hugging Face ในเดือนกุมภาพันธ์ 2026 ด้วยคำศัพท์ 52,329 โทเคน เวอร์ชัน 2.0 ขยายเป็น 72,256 โทเคน เพิ่มขึ้นประมาณ 20k โทเคน และการ์ดอธิบายเหตุผลไว้อย่างชัดเจนว่า โทเคนที่เพิ่มขึ้นนั้นทำให้เกิด OCR แบบหลายภาษา โดยได้ประโยชน์สูงสุดกับอักษร CJK และอักษรอินดิก โมเดลการ์ดยังระบุการเปลี่ยนแปลงอื่น ๆ อีกสามประการ:

• การแยกวิเคราะห์ที่คำนึงถึงแผนภูมิ — ตัวใหม่ class_Chart> โทเค็นคลาส เพื่อให้บริเวณแผนภูมิได้รับคลาสเชิงความหมายของตนเอง แทนที่จะถูกจัดรวมกับรูปภาพหรือตาราง

• การแยกข้อความที่เขียนด้วยมือได้รับการปรับปรุง — การ์ดรายงานระยะห่างการแก้ไขข้อความ (text-edit distance) บนชุดข้อมูล OmniDocBench Notes ลดลงจาก 0.9739 ใน v1.2 เป็น 0.3395 (ยิ่งต่ำยิ่งดี) ซึ่งเป็นการเปลี่ยนแปลงครั้งใหญ่สำหรับกรณีที่ historically ถือเป็นจุดอ่อนที่สุดของโมเดลเหล่านี้

• ปรับปรุงการจัดการตาราง โดยนับรวมเข้ากับผลการเพิ่มประสิทธิภาพ ParseBench โดยรวม แทนที่จะรายงานเป็นตัวเลขแยกต่างหาก

รายละเอียดการฝึกหนึ่งที่น่าสังเกต: การ์ดระบุว่า 2.0 คือ checkpoint soup แบบถ่วงน้ำหนักเท่ากันของ checkpoint การฝึกตั้งแต่ขั้นที่ 58k ถึง 66k ซึ่งเป็นสูตรทั่วไปสำหรับ point release แบบเงียบ ๆ — มันช่วยเพิ่มความทนทานโดยไม่ต้องฝึกใหม่ทั้งโมเดล

ตัวเลขที่การ์ดรายงาน

ตัวเลขทั้งหมดต่อไปนี้มาจาก model card ของ NVIDIA ซึ่งวัดเทียบกับ v1.2 และยังไม่มีตัวเลขใดที่มีการรันโดยบุคคลที่สามอย่างอิสระ โปรดถือว่าตัวเลขเหล่านี้เป็นข้อมูลที่รายงานโดยผู้ผลิตและใช้เป็นแนวทางเท่านั้น:

• คะแนนรวม ParseBench — 0.5782 ใน v1.2 ถึง 0.6391 ใน 2.0 ParseBench เป็นเกณฑ์มาตรฐานของ NVIDIA เองที่ครอบคลุมความเที่ยงตรงของข้อความ การจัดรูปแบบเชิงความหมาย ตาราง กราฟ และการอ้างอิงเชิงภาพ

• MOSCAR หลายภาษามีค่า BoC F1 — จาก 0.4410 ถึง 0.9102 นี่คือการกระโดดขึ้นครั้งใหญ่ที่สุดในตาราง และสอดคล้องกับการขยายคำศัพท์; MOSCAR ครอบคลุมภาษาละติน อาหรับ ซีริลลิก จีน ฮันกึล ญี่ปุ่น อินดิก ฮีบรู ไทย กรีก และอื่นๆ

• IndicVisionBench โดยรวม ANLS-character — 0.0612 ถึง 0.7203 ในภาษาอินดิกสิบภาษา (เบงกาลี คุชราต ฮินดี กันนาดา มาลายาลัม มราฐี โอเดีย ปัญจาบ ทมิฬ เตลูกู)

• OmniDocBench บันทึกย่อ ระยะห่างการแก้ไขข้อความลายมือ — 0.9739 ถึง 0.3395 (ยิ่งต่ำยิ่งดี)

Scoreboard for NVIDIA-Nemotron-Parse-2.0: six rows reading Params 0.9B vision-encoder-decoder, Max image 2048×1664, ParseBench 0.6391 (vendor-reported), MOSCAR BoC F1 0.9102 (vendor-reported), IndicVisionBench ANLS 0.7203 (vendor-reported), License NVIDIA Open Model. Footer: 'All figures vendor-reported; no independent scores yet.' OrcaRouter logo composited bottom-right.

ขนาดของการเปลี่ยนแปลงเหล่านี้คือเหตุผลที่รีลีสครั้งนี้มีความสำคัญแม้จะไม่มีการประกาศก็ตาม การขยับจาก 0.44→0.91 บนเมตริก F1 ของ OCR แบบหลายภาษานั้นไม่ใช่การออกรุ่นย่อยเล็กน้อย แต่มันดูเหมือนงานด้านหลายภาษาที่ปกติแล้วจะเป็นไฮไลต์ของการเปิดตัว คำถามที่ว่าผลลัพธ์ที่ได้จะคงอยู่ภายใต้การประเมินโดยอิสระหรือไม่นั้น คือคำถามที่การขาดความครอบคลุมของสื่อปล่อยให้ค้างอยู่

สิ่งที่ repo ไม่ได้บอกเรา

การพูดตรงไปตรงมาเกี่ยวกับข้อจำกัดคือจุดประสงค์ของโพสต์แบบเงียบๆ รีโพไม่ได้ยืนยันว่า:

ไม่ว่า 2.0 จะพร้อมใช้งาน (หรือจะพร้อมใช้ในอนาคต) ในรูปแบบไมโครเซอร์วิส NVIDIA NIM หรือไม่ — v1.2 ให้บริการผ่าน NIM API ของ NVIDIA เอง ขณะที่การ์ดของ 2.0 ไม่แสดงแท็ก NIM และไม่มีจุดสิ้นสุดการปรับใช้งาน (deployment endpoint) และหน้าคลังที่เก็บซอร์สโค้ดระบุว่าโมเดลนี้ "ไม่ได้ถูกปรับใช้งานโดยผู้ให้บริการอินเฟอเรนซ์รายใด"

• ราคา (ถ้ามี) — ตัว weights ไม่มีค่าธรรมเนียมการใช้งาน แต่ตัวเลือกแบบโฮสต์ยังไม่ได้กำหนดราคาหรือประกาศ

• เกณฑ์มาตรฐานอิสระ — ยังไม่มีรายการใน Artificial Analysis, LMArena หรือ OmniDocBench สำหรับเวอร์ชัน 2.0 ดังนั้นจึงไม่มีข้อมูลให้ตรวจสอบยืนยันกับตัวเลขของผู้จำหน่าย

• แผนงาน — ไม่ทราบว่า 2.0 เป็นเพียงขั้นหนึ่งหรือเป็นจุดหมายปลายทาง และไม่ทราบว่าจะมีเวอร์ชันติดตามผลแบบ 2.1 ตามมาหรือไม่

สิ่งหนึ่งที่แน่นอนคือใบอนุญาต: โมเดลนี้อยู่ภายใต้ NVIDIA Open Model License ซึ่งอนุญาตให้ใช้ทั้งในเชิงพาณิชย์และไม่ใช่เชิงพาณิชย์ โดย tokenizer อยู่ภายใต้ CC-BY-4.0 หากคุณต้องการใช้ในผลิตภัณฑ์ ข้อกำหนดนั้นก็ผ่านแล้ว

วันนี้กำลังทำอยู่

การโฮสต์ด้วยตนเองเป็นตัวเลือกเดียวในปัจจุบัน และมาพร้อมกับความยุ่งยากบางอย่างที่ควรทราบก่อนวางแผนใช้งาน โมเดลโหลดใน Hugging Face Transformers ด้วย trust_remote_code และ vLLM สามารถให้บริการได้ — แต่ต้องใช้ vLLM บิลด์ที่รองรับโค้ดระยะไกลของ Nemotron Parse เท่านั้น บนฮาร์ดแวร์ระดับ A100/A10 NVIDIA แนะนำให้บังคับใช้แบ็กเอนด์ความสนใจแบบ Triton และคุณต้องมีดีเพนเดนซีเพิ่มเติมสี่รายการ: albumentations, timm, open_clip_torch และ einops นอกจากนี้ยังมีลักษณะเฉพาะของ tied-output-head: เวอร์ชัน 2.0 คงหัว LM ที่เชื่อมกับ embeddings ของดีโค้ดเดอร์ ในขณะที่ vLLM บางบิลด์จะสร้างหัวเอาต์พุตแยกต่างหาก เว้นแต่คุณจะเพิ่มแพตช์รันไทม์ที่รวมมากับ NVIDIA ไปที่ PYTHONPATH

สองรายละเอียดด้านการ serve จากระบบนิเวศที่จะช่วยเติมเต็มภาพนี้ให้สมบูรณ์ ประการแรก Pull Request ของ vLLM ที่เปิดอยู่ตอนนี้ (อยู่ระหว่างรีวิวตั้งแต่ต้นเดือนสิงหาคม) เปิดใช้งาน speculative decoding สำหรับ NVIDIA-Nemotron-Parse-2.0 โดยใช้ auxiliary prediction head ที่เก็บอยู่ในไฟล์ sidecar ชื่อ auxiliary_prediction_heads.safetensors.extra ของ repo — ซึ่งเอกสารบนโมเดลการ์ดเองระบุว่าไฟล์นั้นไม่ได้ถูกใช้ในการอนุมานมาตรฐาน ดังนั้น PR นี้จึงเป็นสิ่งแรกที่นำไฟล์ดังกล่าวมาใช้จริง บน H100 กับชุด ParseBench ที่มีทั้งหมด 1,005 หน้า ผู้เขียนรายงานค่ามัธยฐานของ output throughput ที่เพิ่มขึ้นประมาณ 45% ที่ concurrency 1, 41% ที่ concurrency 8, และ 40% ที่ concurrency 32 เมื่อเทียบกับการถอดรหัสแบบ single-token — ตัวเลขทั้งหมดมาจาก PR ยังไม่ได้ถูกผสาน (merge) หรือยังไม่มีการทดสอบซ้ำโดยอิสระ ประการที่สอง ปัญหา (issue) ของ Dynamo ชี้ให้เห็นกับดักจริงๆ ใน tokenizer ของเวอร์ชัน 2.0: มันมาพร้อมกับไฟล์ tokenizer.json ที่ซีเรียลไลซ์และมี padding ฝังมาด้วย ซึ่งทำให้ทุกการเอนโค้ดถูกแพดจนได้ 9,000 โทเคน ดังนั้นระบบ serving ที่โหลด tokenizer ที่มี padding นี้จะขยายพรอมต์มัลติโมดัลขนาด 6 โทเคนให้กลายเป็น 54,000 token IDs ได้เลย ถ้าคุณโฮสต์เอง ตรวจสอบให้แน่ใจว่าเส้นทาง serving ของคุณใช้การทำ tokenization แบบออนไลน์ แทนที่จะโหลด artifact ที่มี padding ฝังอยู่นั้น

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that the model adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

ตำแหน่งในตลาดการแยกวิเคราะห์ปี 2026

Nemotron Parse 2.0 กำลังเข้าสู่วงการที่คราคร่ำไปด้วยคู่แข่งและมีการเปลี่ยนแปลงอย่างรวดเร็ว ผู้นำด้านการแยกวิเคราะห์เอกสารแบบโอเพนซอร์สในปัจจุบัน ได้แก่ MinerU 2.5-Pro (โมเดล 1.2B จาก Shanghai AI Lab) และ PaddleOCR-VL (รุ่น 0.9B และ 7B) ซึ่งทั้งคู่ทำคะแนนรวมได้ในช่วง 90 ต้น ๆ บนลีดเดอร์บอร์ด OmniDocBench รวมถึง GOT-OCR 2.0 จาก StepFun ที่เป็นตัวเลือกน้ำหนักเบา 580M; ทางด้าน API นั้น Mistral OCR เป็นบริการเชิงพาณิชย์หลัก ข้อควรระวังสองประการก่อนที่คุณจะลองนำ 2.0 ไปจัดอันดับดังกล่าว ประการแรกคือ ตัวเลขไม่สามารถเทียบเคียงกันได้: Parse 2.0 รายงานผลจาก ParseBench ซึ่งเป็นชุดทดสอบของ NVIDIA เอง ในขณะที่คะแนนของคู่แข่งในวงการเป็นคะแนนรวมจาก OmniDocBench — ซึ่งเป็นงานที่แตกต่างกัน การถ่วงน้ำหนักต่างกัน ยังไม่มีตัวเลขที่เทียบได้แบบตรงไปตรงมา ประการที่สองคือ คุณไม่ควรสับสนระหว่าง NVIDIA-Nemotron-Parse-2.0 กับโมเดล NVIDIA-Nemotron-OCR-v2 ที่แยกต่างหากของ NVIDIA ซึ่งเป็นโมเดล OCR แบบ dense ระดับคำ ที่สร้างขึ้นสำหรับไปป์ไลน์ NeMo Curator Parse 2.0 คือตัวแยกวิเคราะห์ที่คำนึงถึงเลย์เอาต์และคลาส ส่วน OCR v2 เป็นตัวแยกคำแบบรายคำ เครื่องมือทั้งสองนี้เสริมซึ่งกันและกัน ไม่ใช่โมเดลเดียวกัน

พูดอย่างตรงไปตรงมา จุดขายของ Parse 2.0 ไม่ใช่ "ทำได้ดีกว่าคู่แข่งในทุกเมตริกการแยกวิเคราะห์" แต่เป็นตัวแยกวิเคราะห์ที่คำนึงถึงเลย์เอาต์ ขนาด 0.9B และมีไลเซนส์แบบผ่อนปรน โดยการ์ดข้อมูลของมันอ้างว่ามีการก้าวกระโดดข้ามภาษาครั้งใหญ่มากเมื่อเทียบกับรุ่นก่อนหน้า — และสายเลือดของมัน (v1.1 ในพฤศจิกายน 2025, v1.2 ในกุมภาพันธ์ 2026, 2.0 ในสิงหาคม 2026) แสดงให้เห็นว่า NVIDIA ปล่อยตัวแยกวิเคราะห์ใหม่ประมาณทุกไตรมาส สำหรับทีมที่ปรับใช้ตระกูล Nemotron Parse อยู่แล้ว 2.0 คือการอัปเกรดแบบถอดเปลี่ยนได้ โดยมีรูปแบบ API เดียวกันและความสามารถหลายภาษาที่แข็งแกร่งกว่ามาก สำหรับคนอื่น ๆ คำถามคือว่าข้ออ้างของโมเดลที่ยังไม่ได้ประกาศจะทนทานต่อการทดสอบอิสระหรือไม่

ชั้นการกำหนดเส้นทางอยู่ในตำแหน่งใดในไพพ์ไลน์การแยกวิเคราะห์

แบบจำลองสำหรับการแยกวิเคราะห์เอกสารมักเป็นขั้นตอนหนึ่งในไปป์ไลน์ที่ยาวกว่า และขั้นตอนรอบๆ มันคือจุดที่การจัดเส้นทาง (routing) แสดงคุณค่า รูปแบบทั่วไปคือ: Parse 2.0 เปลี่ยนหน้าเอกสารให้เป็นชิ้นส่วนที่มีโครงสร้าง จากนั้น LLM จะสรุป ตอบคำถาม ดึงเอนทิตี หรือจัดโครงสร้างผลลัพธ์สำหรับจัดเก็บในระบบปลายทาง ขั้นตอน LLM นี่เองที่แพลตฟอร์มการจัดเส้นทางเปลี่ยนสมการต้นทุน OrcaRouter รวมโมเดลกว่า 200+ รายการไว้เบื้องหลัง API เดียวในราคาตามรายการของผู้ให้บริการ — มาร์กอัป 0% ดังนั้นเมื่อผู้ให้บริการลดราคา ฝั่งเราจะเห็นผลในวันเดียวกับที่ประกาศ — พร้อมการสลับไปใช้ตัวสำรองอัตโนมัติหากผู้ให้บริการรายใดประสิทธิภาพลดลง กล่าวคือ ตัวแยกวิเคราะห์สามารถคงเดิมได้ในขณะที่โมเดลที่ตีความผลลัพธ์ถูกสลับ เปรียบเทียบ หรือจัดเส้นทางสำรองโดยไม่ต้องมีสัญญาเพิ่มเติมหรือแก้ไขโค้ด หากขั้นตอนการแยกวิเคราะห์เป็นคอขวด คุณต้องการโมเดลที่ปรับแต่งและโฮสต์เองได้ ซึ่ง Parse 2.0 ให้คุณได้ หากขั้นตอนการตีความเป็นต้นทุนผันแปร นั่นคือขั้นตอนที่เราเตอร์ควรจัดการ เราไม่ได้โฮสต์ Parse 2.0 เอง — มันเป็นโมเดลที่โฮสต์เอง ไม่ใช่ API — แต่การที่ตัวแยกวิเคราะห์ป้อนข้อมูลให้ LLM คือรูปแบบที่จุดเชื่อมต่อเดียวสำหรับชั้น LLM คุ้มค่าพอดี

Pipeline diagram titled 'A parsing pipeline with a routing layer': four rounded cards in a flow — Parse 2.0 (page → text · bboxes · markdown), Chunks (structured regions in reading order), OrcaRouter (one API · 200+ models · 0% markup), LLM (summary · QA · extraction) — with a footer line 'The parsing stage is self-hosted; OrcaRouter routes the LLM stage at provider list price with automatic failover.' OrcaRouter logo composited bottom-right.

บรรทัดล่าง

NVIDIA-Nemotron-Parse-2.0 เป็นเวอร์ชันจริงที่สมบูรณ์และยังไม่มีการประกาศอย่างเป็นทางการ ออกเมื่อวันที่ 3 สิงหาคม 2026 โครงการแสดงพาร์เซอร์ที่คำนึงถึงเลย์เอาต์ขนาด 0.9B ซึ่งการ์ดผลิตภัณฑ์อ้างว่ามีการปรับปรุงอย่างมากในด้านหลายภาษาและลายมือเมื่อเทียบกับ v1.2 เปิดตัวภายใต้ไลเซนส์แบบ宽松 (permissive) แต่มีความยุ่งยากในการโฮสต์เองจริงรอบ ๆ ตัวมัน ตัวเลขเหล่านั้นยังไม่มีใครตรวจสอบอย่างอิสระ และไม่มีตัวเลือกโฮสต์บริการหรือราคา การตัดสินใจที่ถูกต้องขึ้นอยู่กับระดับความเสี่ยงที่คุณรับได้: ถ้าวันนี้คุณต้องแยกวิเคราะห์เอกสารหลายภาษา และเมตริกหลายภาษาเป็นสิ่งที่คุณให้ความสำคัญ การเปลี่ยนแปลงที่อ้างว่า 0.44→0.91 MOSCAR นั้นใหญ่พอที่จะสมเหตุสมผลในการทดสอบช่วงสุดสัปดาห์กับคลังข้อมูลของคุณเอง — ความแตกต่างแบบนี้มันจะทำซ้ำได้หรือพังทลาย และการปล่อยอย่างเงียบ ๆ คือวิธีที่ถูกที่สุดในการค้นหาว่าเป็นแบบไหน หากคุณต้องการ benchmark เพื่ออ้างอิงหรือ API ที่ได้รับการสนับสนุนเพื่อเดิมพันเส้นทางการผลิต คุณควร รอการประกาศอย่างเป็นทางการหรือการทดสอบจากบุคคลที่สาม ในระหว่างนี้ นี่คือสิ่งที่การปล่อยแบบเงียบ ๆ หน้าตาเป็นอย่างไร และน่าจับตามอง

คำถามที่พบบ่อย

NVIDIA-Nemotron-Parse-2.0 เป็นการรั่วไหลหรือเป็นการเปิดตัวอย่างเป็นทางการ?

ทั้งสองคำเรียกไม่ค่อยเข้ากันทีเดียว ไม่ใช่การรั่วไหลในแง่ของน้ำหนักที่หลงเหลืออยู่หรือเป็นบางส่วน — รีโพถูกประกอบอย่างครบถ้วน มีการ์ดโมเดลโดยละเอียด ไฟล์คอนฟิก Dockerfile ชุดทดสอบพร้อมผลลัพธ์อ้างอิง และสคริปต์สำหรับอินเฟอเรนซ์ทั้ง Transformers และ vLLM แต่มันก็ไม่ใช่การเปิดตัวในความหมายปกติ: NVIDIA ไม่ได้ออกประกาศใด ๆ และทั้งแพ็กเกจ NIM และเอนด์พอยต์ที่โฮสต์ไว้ซึ่งมาพร้อมกับการเผยแพร่ Nemotron Parse รุ่นก่อนหน้าก็ไม่มีอยู่ คำอธิบายที่ถูกต้องคือเป็นการเผยแพร่ที่สมบูรณ์ซึ่งผู้ขายยังไม่ได้เลือกที่จะโปรโมต — นั่นคือเหตุผลที่คำเรียกที่ตรงไปตรงมาที่นี่คือ "การปล่อยแบบเงียบ" และเหตุใดสิ่งที่การประกาศปกติจะทำให้ชัดเจน (ราคา แผนงาน ความพร้อมใช้งานแบบโฮสต์) จึงยังคงเป็นคำถามที่ยังไม่มีคำตอบ

เกณฑ์มาตรฐานของผู้จำหน่ายเปรียบเทียบกับตัวเลข OmniDocBench ที่ผู้คนอ้างถึงสำหรับตัวแยกวิเคราะห์อื่น ๆ อย่างไร

ไม่ได้โดยตรง ตัวเลขบนการ์ดของ NVIDIA-Nemotron-Parse-2.0 มาจาก ParseBench ซึ่งเป็นเกณฑ์มาตรฐานของ NVIDIA เองที่ครอบคลุมความเที่ยงตรงของข้อความ การจัดรูปแบบเชิงความหมาย ตาราง แผนภูมิ และการยึดโยงทางภาพ รวมถึง MOSCAR, IndicVisionBench และชุดย่อยการเขียนด้วยลายมือของ OmniDocBench — ในขณะที่คะแนนเด่นของตลาด (MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR) เป็นค่าประกอบจาก OmniDocBench งานต่างกัน ตัวชี้วัดต่างกัน ยังไม่มีการเปรียบเทียบแบบเทียบเท่ากันโดยตรงที่เผยแพร่ออกมา ตัวเลขเดียวที่ทับซ้อนกับระบบนิเวศ — ตัวเลขการเขียนด้วยลายมือ OmniDocBench Notes — ถูกรายงานเป็นระยะทางแก้ไขข้อความเทียบกับ v1.2 ไม่ใช่ค่าคะแนนประกอบ จึงยังไม่สามารถจัดอันดับเทียบกับตัวอื่นได้ จนกว่าจะมีการทดสอบโดยอิสระเกิดขึ้น ให้ถือว่าข้อกล่าวอ้างของ Parse 2.0 เป็นเพียงตัวชี้ทิศทางและยังไม่ได้รับการยืนยัน

ทีมควรทดสอบอะไรก่อนนำไปใช้งานจริง

สามสิ่ง ประการแรก คลังข้อมูลหลายภาษาของคุณเอง: จุดขายทั้งหมดของ 2.0 คือการก้าวกระโดดด้านหลายภาษา และการเปิดตัวแบบเงียบ ๆ คือสถานการณ์ที่ผลลัพธ์ที่อ้างไว้จะเกิดขึ้นจริงกับข้อมูลของคุณหรือไม่ก็ตาม — ให้ทดสอบกับภาษาที่คุณประมวลผลจริงก่อนที่จะเชื่อสเปก ประการที่สอง สแตกสำหรับการโฮสต์เอง: ยืนยันว่า vLLM build ของคุณรองรับ remote code ของ Nemotron Parse ใช้แพตช์ tied-output-head และตรวจสอบว่าเส้นทางการให้บริการของคุณทำโทเคนไนซ์แบบออนไลน์ แทนที่จะโหลด tokenizer.json ที่มีการเติมแพดดิ้ง ซึ่งอาจขยายพรอมป์สั้น ๆ ให้กลายเป็น 9,000 โทเคน ประการที่สาม เรื่องใบอนุญาตและบริการ: น้ำหนักโมเดลให้ใช้ฟรีภายใต้ NVIDIA Open Model License แต่ยังไม่มีการประกาศ NIM ไม่มีราคา และไม่มีสัญญาซัพพอร์ต — ดังนั้นควรวางแผนสำหรับการโฮสต์เอง และส่งต่อขั้นตอน LLM ไปยังขั้นปลายทางผ่านเลเยอร์ที่ให้คุณสลับโมเดลและทำ fail over ได้โดยไม่ต้องออกแบบระบบใหม่ ซึ่งเป็นสิ่งที่แพลตฟอร์มจัดเส้นทางถูกสร้างขึ้นมาเพื่อจัดการ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

ติดต่อเรา

เข้าร่วมคอมมูนิตี้ของเรา

DiscordEmailXGitHubYouTube