
NVIDIA-Nemotron-Parse-2.0: NVIDIA เปิดตัวตัวแยกวิเคราะห์เอกสารที่ชาญฉลาดยิ่งขึ้นอย่างเงียบ ๆ
- metaใหม่Meta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 591 tok/s
- orcaใหม่OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0642ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3055ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1653ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
NVIDIA-Nemotron-Parse-2.0 ปรากฏบน Hugging Face เมื่อวันที่ 3 สิงหาคม 2026 และในขณะที่เขียนบทความนี้ ซึ่งผ่านมาห้าวันแล้ว NVIDIA ก็ยังไม่ได้ประกาศอย่างเป็นทางการ — ไม่มีบล็อกโพสต์ ไม่มีข่าวประชาสัมพันธ์ ไม่มีเธรดบน X แต่ repo มีความครบถ้วนสมบูรณ์: vision-encoder-decoder ขนาด 0.9B, การ์ดโมเดลพร้อมตาราง benchmark ฉบับเต็มที่เปรียบเทียบกับ NVIDIA-Nemotron-Parse-v1.2, ไฟล์ configs, Dockerfile, ชุดทดสอบ และแม้แต่ pull request ของ vLLM ที่อ้างอิงถึง auxiliary head ของโมเดลใหม่แล้ว การปล่อยเวอร์ชันที่สมบูรณ์โดยไม่มีการโปรโมตใดๆ เลย คือสัญญาณที่ควรค่าแก่การจับตามองในแบบ 'สิ่งที่เรารู้จนถึงตอนนี้' และนี่คือสิ่งนั้น: ข้อเท็จจริงที่ repo ยืนยัน ตัวเลขที่ยังคงเป็นข้อมูลจากผู้ผลิต และคำถามปลายเปิดที่โดยปกติแล้วการประกาศอย่างเป็นทางการจะเป็นผู้ตอบ
NVIDIA-Nemotron-Parse-2.0 คืออะไร
Nemotron Parse เป็นโมเดลแยกวิเคราะห์เอกสารของ NVIDIA: คุณป้อนหน้าที่ยังสแกนหรือเรนเดอร์ แล้วมันจะคืนข้อความตามลำดับการอ่าน, bounding box และคลาสเชิงความหมายของแต่ละภูมิภาค, และ markdown — รวมถึงตาราง, ในรูปแบบที่คุณเลือกจาก LaTeX, HTML, markdown, JSON, hierarchical JSON, หรือ CSV มันไม่ใช่ LLM ทั่วไป และไม่ใช่เครื่องมือ OCR ธรรมดา มันอยู่ระหว่างสองสิ่งนี้: การแยกข้อมูลที่รับรู้เลย์เอาต์ ซึ่งออกแบบมาเพื่อป้อนเข้าสู่ไปป์ไลน์ RAG, การแยกข้อมูล, และระบบประมวลผลเอกสารอัจฉริยะ
เวอร์ชัน 2.0 ยังคงใช้ตระกูลสถาปัตยกรรมเดียวกันกับ v1.2 ตามการกำหนดค่าใน repo ตัวเข้ารหัสภาพเป็น ViT-H ที่สร้างบนโครงสร้างพื้นฐาน C-RADIOv2 ของ NVIDIA ตัวถอดรหัสเป็นแบบ mBART จำนวน 10 ชั้น และทั้งหมดมีพารามิเตอร์ประมาณ 0.9 พันล้าน หน้าอินพุตมีขนาดสูงสุด 2048×1664 การสร้างข้อความสูงสุด 9,000 โทเคน และโมเดลระบุตำแหน่งด้วยชุดคลาสเชิงความหมาย (ข้อความ, ชื่อเรื่อง, หัวข้อส่วน, รายการ, ตาราง, สูตร, รูปภาพ, คำบรรยาย, เชิงอรรถ, ส่วนหัว/ท้ายหน้า และอื่นๆ) โมเดลนี้มีขนาดเล็กพอที่จะโฮสต์เองบน GPU ตัวเดียว ซึ่งสำคัญเพราะนั่นเป็นวิธีเดียวที่จะรันได้ในปัจจุบัน
มีอะไรเปลี่ยนแปลงจาก v1.2
ส่วนที่น่าสนใจของการ์ดไม่ใช่ตัวโมเดล — หากแต่เป็นเดลต้า NVIDIA-Nemotron-Parse-v1.2 เปิดตัวบน Hugging Face ในเดือนกุมภาพันธ์ 2026 ด้วยคำศัพท์ 52,329 โทเคน เวอร์ชัน 2.0 ขยายเป็น 72,256 โทเคน เพิ่มขึ้นประมาณ 20k โทเคน และการ์ดอธิบายเหตุผลไว้อย่างชัดเจนว่า โทเคนที่เพิ่มขึ้นนั้นทำให้เกิด OCR แบบหลายภาษา โดยได้ประโยชน์สูงสุดกับอักษร CJK และอักษรอินดิก โมเดลการ์ดยังระบุการเปลี่ยนแปลงอื่น ๆ อีกสามประการ:
• การแยกวิเคราะห์ที่คำนึงถึงแผนภูมิ — ตัวใหม่ class_Chart> โทเค็นคลาส เพื่อให้บริเวณแผนภูมิได้รับคลาสเชิงความหมายของตนเอง แทนที่จะถูกจัดรวมกับรูปภาพหรือตาราง
• การแยกข้อความที่เขียนด้วยมือได้รับการปรับปรุง — การ์ดรายงานระยะห่างการแก้ไขข้อความ (text-edit distance) บนชุดข้อมูล OmniDocBench Notes ลดลงจาก 0.9739 ใน v1.2 เป็น 0.3395 (ยิ่งต่ำยิ่งดี) ซึ่งเป็นการเปลี่ยนแปลงครั้งใหญ่สำหรับกรณีที่ historically ถือเป็นจุดอ่อนที่สุดของโมเดลเหล่านี้
• ปรับปรุงการจัดการตาราง โดยนับรวมเข้ากับผลการเพิ่มประสิทธิภาพ ParseBench โดยรวม แทนที่จะรายงานเป็นตัวเลขแยกต่างหาก
รายละเอียดการฝึกหนึ่งที่น่าสังเกต: การ์ดระบุว่า 2.0 คือ checkpoint soup แบบถ่วงน้ำหนักเท่ากันของ checkpoint การฝึกตั้งแต่ขั้นที่ 58k ถึง 66k ซึ่งเป็นสูตรทั่วไปสำหรับ point release แบบเงียบ ๆ — มันช่วยเพิ่มความทนทานโดยไม่ต้องฝึกใหม่ทั้งโมเดล
ตัวเลขที่การ์ดรายงาน
ตัวเลขทั้งหมดต่อไปนี้มาจาก model card ของ NVIDIA ซึ่งวัดเทียบกับ v1.2 และยังไม่มีตัวเลขใดที่มีการรันโดยบุคคลที่สามอย่างอิสระ โปรดถือว่าตัวเลขเหล่านี้เป็นข้อมูลที่รายงานโดยผู้ผลิตและใช้เป็นแนวทางเท่านั้น:
• คะแนนรวม ParseBench — 0.5782 ใน v1.2 ถึง 0.6391 ใน 2.0 ParseBench เป็นเกณฑ์มาตรฐานของ NVIDIA เองที่ครอบคลุมความเที่ยงตรงของข้อความ การจัดรูปแบบเชิงความหมาย ตาราง กราฟ และการอ้างอิงเชิงภาพ
• MOSCAR หลายภาษามีค่า BoC F1 — จาก 0.4410 ถึง 0.9102 นี่คือการกระโดดขึ้นครั้งใหญ่ที่สุดในตาราง และสอดคล้องกับการขยายคำศัพท์; MOSCAR ครอบคลุมภาษาละติน อาหรับ ซีริลลิก จีน ฮันกึล ญี่ปุ่น อินดิก ฮีบรู ไทย กรีก และอื่นๆ
• IndicVisionBench โดยรวม ANLS-character — 0.0612 ถึง 0.7203 ในภาษาอินดิกสิบภาษา (เบงกาลี คุชราต ฮินดี กันนาดา มาลายาลัม มราฐี โอเดีย ปัญจาบ ทมิฬ เตลูกู)
• OmniDocBench บันทึกย่อ ระยะห่างการแก้ไขข้อความลายมือ — 0.9739 ถึง 0.3395 (ยิ่งต่ำยิ่งดี)

ขนาดของการเปลี่ยนแปลงเหล่านี้คือเหตุผลที่รีลีสครั้งนี้มีความสำคัญแม้จะไม่มีการประกาศก็ตาม การขยับจาก 0.44→0.91 บนเมตริก F1 ของ OCR แบบหลายภาษานั้นไม่ใช่การออกรุ่นย่อยเล็กน้อย แต่มันดูเหมือนงานด้านหลายภาษาที่ปกติแล้วจะเป็นไฮไลต์ของการเปิดตัว คำถามที่ว่าผลลัพธ์ที่ได้จะคงอยู่ภายใต้การประเมินโดยอิสระหรือไม่นั้น คือคำถามที่การขาดความครอบคลุมของสื่อปล่อยให้ค้างอยู่
สิ่งที่ repo ไม่ได้บอกเรา
การพูดตรงไปตรงมาเกี่ยวกับข้อจำกัดคือจุดประสงค์ของโพสต์แบบเงียบๆ รีโพไม่ได้ยืนยันว่า:
ไม่ว่า 2.0 จะพร้อมใช้งาน (หรือจะพร้อมใช้ในอนาคต) ในรูปแบบไมโครเซอร์วิส NVIDIA NIM หรือไม่ — v1.2 ให้บริการผ่าน NIM API ของ NVIDIA เอง ขณะที่การ์ดของ 2.0 ไม่แสดงแท็ก NIM และไม่มีจุดสิ้นสุดการปรับใช้งาน (deployment endpoint) และหน้าคลังที่เก็บซอร์สโค้ดระบุว่าโมเดลนี้ "ไม่ได้ถูกปรับใช้งานโดยผู้ให้บริการอินเฟอเรนซ์รายใด"
• ราคา (ถ้ามี) — ตัว weights ไม่มีค่าธรรมเนียมการใช้งาน แต่ตัวเลือกแบบโฮสต์ยังไม่ได้กำหนดราคาหรือประกาศ
• เกณฑ์มาตรฐานอิสระ — ยังไม่มีรายการใน Artificial Analysis, LMArena หรือ OmniDocBench สำหรับเวอร์ชัน 2.0 ดังนั้นจึงไม่มีข้อมูลให้ตรวจสอบยืนยันกับตัวเลขของผู้จำหน่าย
• แผนงาน — ไม่ทราบว่า 2.0 เป็นเพียงขั้นหนึ่งหรือเป็นจุดหมายปลายทาง และไม่ทราบว่าจะมีเวอร์ชันติดตามผลแบบ 2.1 ตามมาหรือไม่
สิ่งหนึ่งที่แน่นอนคือใบอนุญาต: โมเดลนี้อยู่ภายใต้ NVIDIA Open Model License ซึ่งอนุญาตให้ใช้ทั้งในเชิงพาณิชย์และไม่ใช่เชิงพาณิชย์ โดย tokenizer อยู่ภายใต้ CC-BY-4.0 หากคุณต้องการใช้ในผลิตภัณฑ์ ข้อกำหนดนั้นก็ผ่านแล้ว
วันนี้กำลังทำอยู่
การโฮสต์ด้วยตนเองเป็นตัวเลือกเดียวในปัจจุบัน และมาพร้อมกับความยุ่งยากบางอย่างที่ควรทราบก่อนวางแผนใช้งาน โมเดลโหลดใน Hugging Face Transformers ด้วย trust_remote_code และ vLLM สามารถให้บริการได้ — แต่ต้องใช้ vLLM บิลด์ที่รองรับโค้ดระยะไกลของ Nemotron Parse เท่านั้น บนฮาร์ดแวร์ระดับ A100/A10 NVIDIA แนะนำให้บังคับใช้แบ็กเอนด์ความสนใจแบบ Triton และคุณต้องมีดีเพนเดนซีเพิ่มเติมสี่รายการ: albumentations, timm, open_clip_torch และ einops นอกจากนี้ยังมีลักษณะเฉพาะของ tied-output-head: เวอร์ชัน 2.0 คงหัว LM ที่เชื่อมกับ embeddings ของดีโค้ดเดอร์ ในขณะที่ vLLM บางบิลด์จะสร้างหัวเอาต์พุตแยกต่างหาก เว้นแต่คุณจะเพิ่มแพตช์รันไทม์ที่รวมมากับ NVIDIA ไปที่ PYTHONPATH
สองรายละเอียดด้านการ serve จากระบบนิเวศที่จะช่วยเติมเต็มภาพนี้ให้สมบูรณ์ ประการแรก Pull Request ของ vLLM ที่เปิดอยู่ตอนนี้ (อยู่ระหว่างรีวิวตั้งแต่ต้นเดือนสิงหาคม) เปิดใช้งาน speculative decoding สำหรับ NVIDIA-Nemotron-Parse-2.0 โดยใช้ auxiliary prediction head ที่เก็บอยู่ในไฟล์ sidecar ชื่อ auxiliary_prediction_heads.safetensors.extra ของ repo — ซึ่งเอกสารบนโมเดลการ์ดเองระบุว่าไฟล์นั้นไม่ได้ถูกใช้ในการอนุมานมาตรฐาน ดังนั้น PR นี้จึงเป็นสิ่งแรกที่นำไฟล์ดังกล่าวมาใช้จริง บน H100 กับชุด ParseBench ที่มีทั้งหมด 1,005 หน้า ผู้เขียนรายงานค่ามัธยฐานของ output throughput ที่เพิ่มขึ้นประมาณ 45% ที่ concurrency 1, 41% ที่ concurrency 8, และ 40% ที่ concurrency 32 เมื่อเทียบกับการถอดรหัสแบบ single-token — ตัวเลขทั้งหมดมาจาก PR ยังไม่ได้ถูกผสาน (merge) หรือยังไม่มีการทดสอบซ้ำโดยอิสระ ประการที่สอง ปัญหา (issue) ของ Dynamo ชี้ให้เห็นกับดักจริงๆ ใน tokenizer ของเวอร์ชัน 2.0: มันมาพร้อมกับไฟล์ tokenizer.json ที่ซีเรียลไลซ์และมี padding ฝังมาด้วย ซึ่งทำให้ทุกการเอนโค้ดถูกแพดจนได้ 9,000 โทเคน ดังนั้นระบบ serving ที่โหลด tokenizer ที่มี padding นี้จะขยายพรอมต์มัลติโมดัลขนาด 6 โทเคนให้กลายเป็น 54,000 token IDs ได้เลย ถ้าคุณโฮสต์เอง ตรวจสอบให้แน่ใจว่าเส้นทาง serving ของคุณใช้การทำ tokenization แบบออนไลน์ แทนที่จะโหลด artifact ที่มี padding ฝังอยู่นั้น

ตำแหน่งในตลาดการแยกวิเคราะห์ปี 2026
Nemotron Parse 2.0 กำลังเข้าสู่วงการที่คราคร่ำไปด้วยคู่แข่งและมีการเปลี่ยนแปลงอย่างรวดเร็ว ผู้นำด้านการแยกวิเคราะห์เอกสารแบบโอเพนซอร์สในปัจจุบัน ได้แก่ MinerU 2.5-Pro (โมเดล 1.2B จาก Shanghai AI Lab) และ PaddleOCR-VL (รุ่น 0.9B และ 7B) ซึ่งทั้งคู่ทำคะแนนรวมได้ในช่วง 90 ต้น ๆ บนลีดเดอร์บอร์ด OmniDocBench รวมถึง GOT-OCR 2.0 จาก StepFun ที่เป็นตัวเลือกน้ำหนักเบา 580M; ทางด้าน API นั้น Mistral OCR เป็นบริการเชิงพาณิชย์หลัก ข้อควรระวังสองประการก่อนที่คุณจะลองนำ 2.0 ไปจัดอันดับดังกล่าว ประการแรกคือ ตัวเลขไม่สามารถเทียบเคียงกันได้: Parse 2.0 รายงานผลจาก ParseBench ซึ่งเป็นชุดทดสอบของ NVIDIA เอง ในขณะที่คะแนนของคู่แข่งในวงการเป็นคะแนนรวมจาก OmniDocBench — ซึ่งเป็นงานที่แตกต่างกัน การถ่วงน้ำหนักต่างกัน ยังไม่มีตัวเลขที่เทียบได้แบบตรงไปตรงมา ประการที่สองคือ คุณไม่ควรสับสนระหว่าง NVIDIA-Nemotron-Parse-2.0 กับโมเดล NVIDIA-Nemotron-OCR-v2 ที่แยกต่างหากของ NVIDIA ซึ่งเป็นโมเดล OCR แบบ dense ระดับคำ ที่สร้างขึ้นสำหรับไปป์ไลน์ NeMo Curator Parse 2.0 คือตัวแยกวิเคราะห์ที่คำนึงถึงเลย์เอาต์และคลาส ส่วน OCR v2 เป็นตัวแยกคำแบบรายคำ เครื่องมือทั้งสองนี้เสริมซึ่งกันและกัน ไม่ใช่โมเดลเดียวกัน
พูดอย่างตรงไปตรงมา จุดขายของ Parse 2.0 ไม่ใช่ "ทำได้ดีกว่าคู่แข่งในทุกเมตริกการแยกวิเคราะห์" แต่เป็นตัวแยกวิเคราะห์ที่คำนึงถึงเลย์เอาต์ ขนาด 0.9B และมีไลเซนส์แบบผ่อนปรน โดยการ์ดข้อมูลของมันอ้างว่ามีการก้าวกระโดดข้ามภาษาครั้งใหญ่มากเมื่อเทียบกับรุ่นก่อนหน้า — และสายเลือดของมัน (v1.1 ในพฤศจิกายน 2025, v1.2 ในกุมภาพันธ์ 2026, 2.0 ในสิงหาคม 2026) แสดงให้เห็นว่า NVIDIA ปล่อยตัวแยกวิเคราะห์ใหม่ประมาณทุกไตรมาส สำหรับทีมที่ปรับใช้ตระกูล Nemotron Parse อยู่แล้ว 2.0 คือการอัปเกรดแบบถอดเปลี่ยนได้ โดยมีรูปแบบ API เดียวกันและความสามารถหลายภาษาที่แข็งแกร่งกว่ามาก สำหรับคนอื่น ๆ คำถามคือว่าข้ออ้างของโมเดลที่ยังไม่ได้ประกาศจะทนทานต่อการทดสอบอิสระหรือไม่
ชั้นการกำหนดเส้นทางอยู่ในตำแหน่งใดในไพพ์ไลน์การแยกวิเคราะห์
แบบจำลองสำหรับการแยกวิเคราะห์เอกสารมักเป็นขั้นตอนหนึ่งในไปป์ไลน์ที่ยาวกว่า และขั้นตอนรอบๆ มันคือจุดที่การจัดเส้นทาง (routing) แสดงคุณค่า รูปแบบทั่วไปคือ: Parse 2.0 เปลี่ยนหน้าเอกสารให้เป็นชิ้นส่วนที่มีโครงสร้าง จากนั้น LLM จะสรุป ตอบคำถาม ดึงเอนทิตี หรือจัดโครงสร้างผลลัพธ์สำหรับจัดเก็บในระบบปลายทาง ขั้นตอน LLM นี่เองที่แพลตฟอร์มการจัดเส้นทางเปลี่ยนสมการต้นทุน OrcaRouter รวมโมเดลกว่า 200+ รายการไว้เบื้องหลัง API เดียวในราคาตามรายการของผู้ให้บริการ — มาร์กอัป 0% ดังนั้นเมื่อผู้ให้บริการลดราคา ฝั่งเราจะเห็นผลในวันเดียวกับที่ประกาศ — พร้อมการสลับไปใช้ตัวสำรองอัตโนมัติหากผู้ให้บริการรายใดประสิทธิภาพลดลง กล่าวคือ ตัวแยกวิเคราะห์สามารถคงเดิมได้ในขณะที่โมเดลที่ตีความผลลัพธ์ถูกสลับ เปรียบเทียบ หรือจัดเส้นทางสำรองโดยไม่ต้องมีสัญญาเพิ่มเติมหรือแก้ไขโค้ด หากขั้นตอนการแยกวิเคราะห์เป็นคอขวด คุณต้องการโมเดลที่ปรับแต่งและโฮสต์เองได้ ซึ่ง Parse 2.0 ให้คุณได้ หากขั้นตอนการตีความเป็นต้นทุนผันแปร นั่นคือขั้นตอนที่เราเตอร์ควรจัดการ เราไม่ได้โฮสต์ Parse 2.0 เอง — มันเป็นโมเดลที่โฮสต์เอง ไม่ใช่ API — แต่การที่ตัวแยกวิเคราะห์ป้อนข้อมูลให้ LLM คือรูปแบบที่จุดเชื่อมต่อเดียวสำหรับชั้น LLM คุ้มค่าพอดี

บรรทัดล่าง
NVIDIA-Nemotron-Parse-2.0 เป็นเวอร์ชันจริงที่สมบูรณ์และยังไม่มีการประกาศอย่างเป็นทางการ ออกเมื่อวันที่ 3 สิงหาคม 2026 โครงการแสดงพาร์เซอร์ที่คำนึงถึงเลย์เอาต์ขนาด 0.9B ซึ่งการ์ดผลิตภัณฑ์อ้างว่ามีการปรับปรุงอย่างมากในด้านหลายภาษาและลายมือเมื่อเทียบกับ v1.2 เปิดตัวภายใต้ไลเซนส์แบบ宽松 (permissive) แต่มีความยุ่งยากในการโฮสต์เองจริงรอบ ๆ ตัวมัน ตัวเลขเหล่านั้นยังไม่มีใครตรวจสอบอย่างอิสระ และไม่มีตัวเลือกโฮสต์บริการหรือราคา การตัดสินใจที่ถูกต้องขึ้นอยู่กับระดับความเสี่ยงที่คุณรับได้: ถ้าวันนี้คุณต้องแยกวิเคราะห์เอกสารหลายภาษา และเมตริกหลายภาษาเป็นสิ่งที่คุณให้ความสำคัญ การเปลี่ยนแปลงที่อ้างว่า 0.44→0.91 MOSCAR นั้นใหญ่พอที่จะสมเหตุสมผลในการทดสอบช่วงสุดสัปดาห์กับคลังข้อมูลของคุณเอง — ความแตกต่างแบบนี้มันจะทำซ้ำได้หรือพังทลาย และการปล่อยอย่างเงียบ ๆ คือวิธีที่ถูกที่สุดในการค้นหาว่าเป็นแบบไหน หากคุณต้องการ benchmark เพื่ออ้างอิงหรือ API ที่ได้รับการสนับสนุนเพื่อเดิมพันเส้นทางการผลิต คุณควร รอการประกาศอย่างเป็นทางการหรือการทดสอบจากบุคคลที่สาม ในระหว่างนี้ นี่คือสิ่งที่การปล่อยแบบเงียบ ๆ หน้าตาเป็นอย่างไร และน่าจับตามอง
คำถามที่พบบ่อย
NVIDIA-Nemotron-Parse-2.0 เป็นการรั่วไหลหรือเป็นการเปิดตัวอย่างเป็นทางการ?
ทั้งสองคำเรียกไม่ค่อยเข้ากันทีเดียว ไม่ใช่การรั่วไหลในแง่ของน้ำหนักที่หลงเหลืออยู่หรือเป็นบางส่วน — รีโพถูกประกอบอย่างครบถ้วน มีการ์ดโมเดลโดยละเอียด ไฟล์คอนฟิก Dockerfile ชุดทดสอบพร้อมผลลัพธ์อ้างอิง และสคริปต์สำหรับอินเฟอเรนซ์ทั้ง Transformers และ vLLM แต่มันก็ไม่ใช่การเปิดตัวในความหมายปกติ: NVIDIA ไม่ได้ออกประกาศใด ๆ และทั้งแพ็กเกจ NIM และเอนด์พอยต์ที่โฮสต์ไว้ซึ่งมาพร้อมกับการเผยแพร่ Nemotron Parse รุ่นก่อนหน้าก็ไม่มีอยู่ คำอธิบายที่ถูกต้องคือเป็นการเผยแพร่ที่สมบูรณ์ซึ่งผู้ขายยังไม่ได้เลือกที่จะโปรโมต — นั่นคือเหตุผลที่คำเรียกที่ตรงไปตรงมาที่นี่คือ "การปล่อยแบบเงียบ" และเหตุใดสิ่งที่การประกาศปกติจะทำให้ชัดเจน (ราคา แผนงาน ความพร้อมใช้งานแบบโฮสต์) จึงยังคงเป็นคำถามที่ยังไม่มีคำตอบ
เกณฑ์มาตรฐานของผู้จำหน่ายเปรียบเทียบกับตัวเลข OmniDocBench ที่ผู้คนอ้างถึงสำหรับตัวแยกวิเคราะห์อื่น ๆ อย่างไร
ไม่ได้โดยตรง ตัวเลขบนการ์ดของ NVIDIA-Nemotron-Parse-2.0 มาจาก ParseBench ซึ่งเป็นเกณฑ์มาตรฐานของ NVIDIA เองที่ครอบคลุมความเที่ยงตรงของข้อความ การจัดรูปแบบเชิงความหมาย ตาราง แผนภูมิ และการยึดโยงทางภาพ รวมถึง MOSCAR, IndicVisionBench และชุดย่อยการเขียนด้วยลายมือของ OmniDocBench — ในขณะที่คะแนนเด่นของตลาด (MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR) เป็นค่าประกอบจาก OmniDocBench งานต่างกัน ตัวชี้วัดต่างกัน ยังไม่มีการเปรียบเทียบแบบเทียบเท่ากันโดยตรงที่เผยแพร่ออกมา ตัวเลขเดียวที่ทับซ้อนกับระบบนิเวศ — ตัวเลขการเขียนด้วยลายมือ OmniDocBench Notes — ถูกรายงานเป็นระยะทางแก้ไขข้อความเทียบกับ v1.2 ไม่ใช่ค่าคะแนนประกอบ จึงยังไม่สามารถจัดอันดับเทียบกับตัวอื่นได้ จนกว่าจะมีการทดสอบโดยอิสระเกิดขึ้น ให้ถือว่าข้อกล่าวอ้างของ Parse 2.0 เป็นเพียงตัวชี้ทิศทางและยังไม่ได้รับการยืนยัน
ทีมควรทดสอบอะไรก่อนนำไปใช้งานจริง
สามสิ่ง ประการแรก คลังข้อมูลหลายภาษาของคุณเอง: จุดขายทั้งหมดของ 2.0 คือการก้าวกระโดดด้านหลายภาษา และการเปิดตัวแบบเงียบ ๆ คือสถานการณ์ที่ผลลัพธ์ที่อ้างไว้จะเกิดขึ้นจริงกับข้อมูลของคุณหรือไม่ก็ตาม — ให้ทดสอบกับภาษาที่คุณประมวลผลจริงก่อนที่จะเชื่อสเปก ประการที่สอง สแตกสำหรับการโฮสต์เอง: ยืนยันว่า vLLM build ของคุณรองรับ remote code ของ Nemotron Parse ใช้แพตช์ tied-output-head และตรวจสอบว่าเส้นทางการให้บริการของคุณทำโทเคนไนซ์แบบออนไลน์ แทนที่จะโหลด tokenizer.json ที่มีการเติมแพดดิ้ง ซึ่งอาจขยายพรอมป์สั้น ๆ ให้กลายเป็น 9,000 โทเคน ประการที่สาม เรื่องใบอนุญาตและบริการ: น้ำหนักโมเดลให้ใช้ฟรีภายใต้ NVIDIA Open Model License แต่ยังไม่มีการประกาศ NIM ไม่มีราคา และไม่มีสัญญาซัพพอร์ต — ดังนั้นควรวางแผนสำหรับการโฮสต์เอง และส่งต่อขั้นตอน LLM ไปยังขั้นปลายทางผ่านเลเยอร์ที่ให้คุณสลับโมเดลและทำ fail over ได้โดยไม่ต้องออกแบบระบบใหม่ ซึ่งเป็นสิ่งที่แพลตฟอร์มจัดเส้นทางถูกสร้างขึ้นมาเพื่อจัดการ
