การ์ดชื่อเรื่องสำหรับ 'Nemotron Parse 2.0 vs olmOCR': พาดหัว 'Nemotron Parse 2.0 vs olmOCR', คำบรรยายใต้หัว 'สองงาน ทั้งคู่เรียกว่าการแยกวิเคราะห์', พร้อมภาพประกอบแบบแบ่งครึ่ง — ด้านซ้ายเป็นหน้าเอกสารที่ถูกแยกวิเคราะห์เป็นกล่องขอบเขตที่มีป้ายกำกับภายใต้คำบรรยายภาพ 'ความหมายเชิงเลย์เอาต์', ด้านขวาเป็นบรรทัดข้อความที่ไหลต่อเนื่องพร้อมสัญลักษณ์มาร์กดาวน์ภายใต้คำบรรยายภาพ 'มาร์กดาวน์เชิงเส้น' โลโก้ OrcaRouter ประกอบที่มุมขวาล่าง
Guides & Insights

Nemotron Parse 2.0 เทียบกับ olmOCR: สองงานที่แตกต่าง แต่ต่างก็ถูกเรียกว่าการแยกวิเคราะห์

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 3 สิงหาคม 2026 NVIDIA ได้โพสต์โมเดลใหม่สำหรับการแยกวิเคราะห์เอกสารบน Hugging Face และไม่ได้บอกใคร NVIDIA-Nemotron-Parse-2.0 เป็นวิทัศน์-เอนโค้ดเดอร์-ดีโค้ดเดอร์ขนาด 0.9B ซึ่งการ์ดโมเดลอ้างว่ามีความสามารถหลากหลายภาษาและเข้าใจแผนภูมิเหนือกว่ารุ่นก่อนหน้าในเดือนกุมภาพันธ์ 2026 และมันมาอยู่ในมุมเดียวกันของระบบนิเวศกับ olmOCR — กล่าวให้เจาะจงคือ olmOCR-2-7B-1025 ตัวทำไลเนียร์ไรซ์ขนาด 7B จาก Allen Institute for AI ที่กลายเป็นวิธีมาตรฐานอย่างเงียบๆ สำหรับการแปลง PDF เป็นข้อมูลฝึกฝน LLM การเรียกสิ่งนี้ว่าเป็นการประจันหน้ากันโดยตรงคือกับดัก: ทั้งสองโมเดลถูกอธิบายว่าเป็นการ "แยกวิเคราะห์เอกสาร" แต่พวกมันส่งคืนอาร์ติแฟกต์ที่ต่างกัน ป้อนไปยังไปป์ไลน์ที่ต่างกัน และตัวเลขเบนช์มาร์กของพวกมันไม่เคยเผชิญหน้ากันจริงๆ คำถามที่แท้จริงคือคุณจ้างนักแยกวิเคราะห์มาทำงานใดในสองงานนี้

สิ่งประดิษฐ์ทั้งสอง

Nemotron Parse 2.0 คือ{{1}}เอนจินด้านความหมายของเลย์เอาต์{{/1}} ป้อนภาพหน้าเอกสารและพรอมปต์งานให้ระบบ ระบบจะคืนข้อความพร้อมกับชั้นความหมายที่วางอยู่ด้านบน: {{2}}คลาสเลย์เอาต์สำหรับทุกพื้นที่ (หัวข้อ, ส่วน, คำบรรยายภาพ, ตาราง, แผนภูมิ, ส่วนหัว, ส่วนท้าย, เชิงอรรถ, รายการบรรณานุกรม){{/2}}, bounding box สำหรับแต่ละพื้นที่ และลำดับการอ่านระหว่างพื้นที่เหล่านั้น — โดยมี{{3}}markdown{{/3}}เป็นรูปแบบซีเรียลไลเซชันทางเลือกหนึ่งที่อยู่ด้านบน olmOCR 2 คือ{{4}}ตัวแปลงเป็นเชิงเส้น (linearizer){{/4}} โดยรับหน้าเดียวกันและคืน{{5}}markdown เชิงเส้นที่สะอาด{{/5}}พร้อมกับ{{6}}YAML frontmatter แบบสั้น{{/6}}ที่บันทึกเมตาเดตาระดับหน้า เช่น{{7}}ภาษาหลัก, การแก้ไขการหมุน, และว่าหน้านั้นเป็นตารางหรือไดอะแกรม{{/7}} ไม่มี bounding box, ไม่มีคลาส, ไม่มีเรขาคณิต: ประมวลผลเพียงรอบเดียว, ได้{{8}}ข้อความตามลำดับเอกสาร{{/8}}

ผลลัพธ์ที่ได้เป็นตัวกำหนดงาน หากไปป์ไลน์ของคุณต้องอ้างอิงข้อเท็จจริงกลับไปยังบริเวณหนึ่งของหน้า ไฮไลต์ตารางบนภาพสแกน หรือแยกความหมายของเลย์เอาต์สำหรับ document intelligence คุณต้องใช้เรขาคณิต — นั่นคือพื้นที่เอาต์พุตของ Nemotron Parse 2.0 หากคุณกำลังสร้างข้อมูลฝึกหรือป้อนให้ LLM แบบข้อความที่ใช้เฉพาะโทเคน เรขาคณิตคือสัญญาณรบกวน และมาร์กดาวน์เชิงเส้นเหมาะสมที่สุด — นั่นคือการออกแบบทั้งหมดของ olmOCR คุณสามารถนำการตรวจจับเลย์เอาต์ไปต่อพ่วงกับเอาต์พุตของ olmOCR โดยใช้ตัวตรวจจับแยกต่างหาก และคุณสามารถทิ้งกล่องขอบเขตของ Nemotron Parse 2.0 แล้วเก็บเฉพาะมาร์กดาวน์ได้ แต่โมเดลแต่ละตัวถูกสร้างมาให้ทำงานหนึ่งในนั้นได้ในตัว

เรือที่เงียบสงบ: สิ่งที่ repo แสดงให้เห็น สิ่งที่ยังไม่ได้รับการยืนยัน

NVIDIA-Nemotron-Parse-2.0 ปรากฏบน Hugging Face เมื่อวันที่ 3 สิงหาคม 2026 โดยไม่มีการประกาศ ไม่มีบล็อกโพสต์ และไม่มีแพ็คเกจ NIM สิ่งที่ทราบได้คือที่เก็บโค้ด (repo) มันเป็นโมเดล vision-encoder-decoder ขนาด 0.9B: ตัวเข้ารหัสรูปภาพ ViT-H ที่สร้างบนแกนหลัก C-RADIO ของ NVIDIA, อะแดปเตอร์แบบ 1D-convolution น้ำหนักเบา และตัวถอดรหัสสไตล์ mBART สิบชั้น โทเคนไนเซอร์เพิ่มขึ้นประมาณ 20,000 รายการเป็นประมาณ 72,000 รายการทั้งหมด เพื่อรองรับหลายภาษาอย่างมีประสิทธิภาพมากขึ้น และการ์ดโมเดลระบุการแยกวิเคราะห์ที่รับรู้แผนภูมิ (chart-aware parsing) เป็นคุณสมบัติเด่นผ่านโทเคนใหม่ class_Chart พร้อมด้วยตระกูลการจัดลำดับตาราง (LaTeX, HTML, markdown, JSON, hierarchical JSON, CSV) โปรเซสเซอร์ logits ทางเลือกสองตัวมาพร้อมกับมัน: หนึ่งใช้หยุดเอาต์พุตโครงสร้างที่ซ้ำซ้อน และอีกหนึ่งบังคับโครงสร้างตารางบนรูปครอบตาราง (table crop) ความละเอียดอินพุตที่แนะนำอยู่ระหว่างประมาณ 1024×1280 ถึง 1664×2048 การสร้างข้อความสูงสุดที่ 9,000 โทเคน และการ์ดโมเดลระบุ Transformers, vLLM, SGLang และ Docker Model Runner เป็นรันไทม์บนฮาร์ดแวร์ Ampere, Hopper, Blackwell และ Turing

อย่างไรก็ตาม การกล่าวอ้างทั้งหมดเป็นของ NVIDIA เอง และยังไม่มีใครทำซ้ำผลลัพธ์ได้อย่างอิสระ การ์ดรายงานผล ParseBench โดยรวมที่ 0.6391 (เพิ่มขึ้นจาก 0.5782 ของ v1.2), MOSCAR OCR หลายภาษาที่ 0.9102 BoC-F1 (เพิ่มขึ้นจาก 0.4410), IndicVisionBench ที่ 0.7203 ANLS-character (เพิ่มขึ้นจาก 0.0612) และชุดย่อยลายมือเขียนของ OmniDocBench ที่ดีขึ้นจาก 0.9739 เป็น 0.3395 ในด้านระยะห่างการแก้ไขข้อความ นี่คือการกระโดดครั้งใหญ่ที่สุด และก็เป็นสิ่งที่ผ่านการตรวจสอบน้อยที่สุดด้วย: ParseBench เป็นชุดทดสอบของ NVIDIA เอง และยังไม่มีบุคคลที่สามนำ Parse 2.0 ไปทดสอบกับคลังข้อมูลอิสระเลย สิ่งที่ยังไม่ได้รับการยืนยันนั้นไปไกลกว่าแค่คะแนน — ไม่มีการอนุมานแบบโฮสต์ (การ์ดระบุว่าโมเดลไม่ได้ถูกปรับใช้โดยผู้ให้บริการอนุมานรายใด) ไม่มีราคา และไม่มีไทม์ไลน์ที่ประกาศไว้สำหรับทั้งสองอย่าง

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that 2.0 adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

olmOCR 2: ผู้ครองตำแหน่งที่ทุกคนใช้เป็นเกณฑ์วัดอยู่แล้ว

olmOCR เป็นโมเดลที่คิดค้น benchmark ที่หมวดหมู่นี้ถกเถียงกันอยู่ตอนนี้ olmOCR-2-7B-1025 เปิดตัวเมื่อวันที่ 22 ตุลาคม 2025 เป็นโมเดล vision-language ขนาด 7B ที่ fine-tune มาจาก Qwen2.5-VL-7B-Instruct บนคลังข้อมูล olmOCR-mix-1025 จำนวน 270,000 หน้า จากนั้นปรับปรุงด้วย GRPO reinforcement learning โดยใช้รางวัล "unit test" แบบอัตโนมัติ — การตรวจสอบเชิงกำหนดว่า ตารางรักษาโครงสร้างไว้ สูตรถูกถอดความอย่างแม่นยำ และลำดับการอ่านคงเดิม กรอบความคิดของ unit test นี้กลายเป็น olmOCR-Bench ซึ่งมี PDF ประมาณ 1,400 ฉบับและการตรวจสอบมากกว่า 7,000 รายการ และได้กลายเป็น benchmark มาตรฐานโดยพฤตินัยของอุตสาหกรรม: Marker, MinerU และโมเดล OCR เชิงพาณิชย์อีกมากมายต่างตีพิมพ์ผลบน benchmark นี้ ตัว olmOCR 2 เองได้คะแนนรวม 82.4 บน benchmark นั้น สูงกว่ารุ่นก่อนหน้าประมาณ 4 จุด และสูงกว่าคะแนนของ Marker (76.1) และ MinerU (75.8) ที่ AI2 อ้างถึงในหน้าเดียวกัน

olmOCR ยังเป็นตัวเลือกที่เติบโตเต็มที่กว่าในคู่เปรียบเทียบนี้ มันใช้ลิขสิทธิ์ Apache-2.0 น้ำหนักของโมเดลถูกดาวน์โหลดประมาณ 218,000 ครั้งในเดือนที่ผ่านมา และชุดเครื่องมือ olmOCR จัดการกับการเรนเดอร์ การหมุน และการลองใหม่ในระดับ規模บนแบ็กเอนด์ vLLM — ประมาณการแบบแบตช์ของ AI2 ระบุว่าไปป์ไลน์มีต้นทุนประมาณ 176–190 ดอลลาร์ต่อล้านหน้าบน GPU เช่า และบิลด์ FP8 ทำงานประมาณ 3,400 โทเค็นเอาต์พุตต่อวินาทีบน H100 ตัวเดียว เร็วพอที่โพสต์เผยแพร่จะอ้างถึง "10,000 หน้าในราคาต่ำกว่า 2 ดอลลาร์" ข้อแลกเปลี่ยนคือภาษา: olmOCR ถูกสร้างและวัดผลสำหรับสิ่งพิมพ์ดิจิทัลภาษาอังกฤษอย่างชัดเจน และการ์ดโมเดลระบุว่าเป็นภาษาอังกฤษ จุดขายทั้งหมดของ Nemotron Parse 2.0 ตรงกันข้าม — ผลประโยชน์ที่อ้างว่าอยู่ในสคริปต์ CJK และอินดิก

Screenshot of the Hugging Face repository page for allenai/olmOCR-2-7B-1025, showing the Apache-2.0 license tag, the English language tag, 217,859 downloads last month, 8B params, the description that it is the BF16 release fine-tuned from Qwen2.5-VL-7B-Instruct on the olmOCR-mix-1025 dataset with additional GRPO RL training for math equations and tables, the note that the best way to use it is the olmOCR toolkit via vLLM, and the line 'This model isn't deployed by any Inference Provider.'

หกแถวที่แสดงให้เห็นถึงการแลกเปลี่ยน

โมเดลทั้งสองเป็นแบบ open-weight ทำงานบน Transformers, vLLM หรือ SGLang ได้ และทั้งคู่สามารถโฮสต์เองได้ในปัจจุบัน สำหรับมิติที่สำคัญในการเลือกใช้ระหว่างทั้งสอง:

• ขนาด — Nemotron Parse 2.0 มีขนาด 0.9B ส่วน olmOCR 2 มีขนาด 7B พารามิเตอร์มากกว่าประมาณแปดเท่า และ VRAM ขั้นต่ำก็มากกว่าประมาณแปดเท่าเช่นกัน

• ผลลัพธ์ — Nemotron Parse 2.0 คืนค่าข้อความ คลาสเลย์เอาต์ bounding boxes ลำดับการอ่าน และ markdown; olmOCR 2 คืนค่า markdown เชิงเส้นพร้อมบล็อกเมทาดาทา YAML

• หลายภาษา — Nemotron Parse 2.0 อ้างว่ารองรับภาษา CJK และ Indic ได้ดี (MOSCAR 0.9102, IndicVisionBench 0.7203, รายงานโดยผู้จำหน่าย); olmOCR 2 เน้นภาษาอังกฤษเป็นหลัก

• คะแนนเรือธง — Nemotron Parse 2.0 รายงาน ParseBench 0.6391 (ของ NVIDIA เอง ยังไม่ผ่านการตรวจสอบ); olmOCR 2 ได้ 82.4 คะแนนบน olmOCR-Bench (ของ AI2 เอง ที่ชุมชนนำไปใช้ต่อเป็นเวลาสิบเดือน)

• ใบอนุญาต — Nemotron Parse 2.0 เผยแพร่ภายใต้ NVIDIA Open Model License; olmOCR 2 อยู่ภายใต้ Apache-2.0

• ส่งมอบแล้ว — Nemotron Parse 2.0 เปิดตัวเมื่อวันที่ 3 สิงหาคม 2026 โดยไม่มีการประกาศล่วงหน้า; olmOCR 2 เปิดตัวเมื่อวันที่ 22 ตุลาคม 2025 พร้อมโพสต์เปิดตัว

Two-column comparison scoreboard titled 'Nemotron Parse 2.0 vs olmOCR — the scoreboard'. Left column 'Nemotron Parse 2.0': Size 0.9B vision-encoder-decoder, Output bboxes, classes, reading order + markdown, Multilingual CJK + Indic strong, Score ParseBench 0.6391 (vendor), License NVIDIA Open Model, Shipped Aug 3, 2026 unannounced. Right column 'olmOCR 2': Size 7B VLM (Qwen2.5-VL), Output linearized markdown + YAML metadata, Multilingual English-first, Score olmOCR-bench 82.4, License Apache 2.0, Shipped Oct 22, 2025. Footer: 'Nemotron scores vendor-reported (NVIDIA); olmOCR scores per AI2's olmOCR-bench.' OrcaRouter logo composited bottom-right.

สามจุดที่การตัดสินใจส่งผลกระทบจริง

ขนาดและเวลาแฝง โมเดลดีโคเดอร์ขนาด 0.9B มีต้นทุนการให้บริการถูกกว่ามากเมื่อเทียบกับ VLM ขนาด 7B: ใช้ GPU เล็กกว่า, VRAM น้อยกว่า, จำนวนหน้าต่อวินาทีบนฮาร์ดแวร์เดียวกันมากกว่า และต้นทุนต่อหน้าต่ำกว่าเมื่อคุณต้องจ่ายค่าเวลา GPU หากคุณมีโครงสร้างพื้นฐาน GPU อยู่แล้วและคลังข้อมูลของคุณมีขนาดใหญ่ นั่นคือความแตกต่างรายเดือนที่แท้จริง ตัวเลขของ olmOCR แสดงให้เห็นว่าโมเดลขนาด 7B สามารถถูกทำให้เร็วได้เพียงใดด้วยการควอนไทซ์ FP8 — แต่ก็ยังต้องใช้ GPU ระดับ H100 เพื่อให้ถึงความเร็วนั้น ส่วนระดับฮาร์ดแวร์ขั้นต่ำของ Nemotron Parse 2.0 คือการ์ดในยุค Ampere

หลากหลายภาษา นี่คือแถวที่ไม่สมมาตรที่สุด Nemotron Parse 2.0 ขยาย tokenizer ของมันประมาณ 20,000 รายการโดยเฉพาะสำหรับ OCR หลายภาษา และผลลัพธ์ที่อ้างไว้ในการ์ดของมันกระจุกตัวอยู่ในสคริปต์อินดิกและ CJK olmOCR 2 ไม่ได้อ้างสิทธิ์เช่นนั้น — แท็กภาษาของมันคือภาษาอังกฤษ หากคลังข้อมูลของคุณเป็นภาษาฮินดี ทมิฬ เบงกาลี ญี่ปุ่น หรือสคริปต์ผสม ตัวเลขของ Nemotron Parse 2.0 คือตัวเลขที่ควรนำไปทดสอบ อย่างแม่นยำเพราะเป็นตัวเลขที่รายงานโดยผู้จำหน่ายและใหม่ล่าสุด

ความเป็นจริงด้านการให้บริการ olmOCR 2 มีอายุสิบเดือนแล้ว และชุดเครื่องมือของมันก็เรียบๆ ในแบบที่ดี Nemotron Parse 2.0 เพิ่งออกมาได้ห้าวัน และเรื่องราวด้านเซิร์ฟวิ่งของมันยังดูใหม่ชัดเจน: vLLM ต้องใช้บิลด์ที่รองรับ remote-code ของ Nemotron Parse, output head ที่ผูกไว้นั้นทำให้ vLLM 0.20 บางบิลด์สะดุด (ในรีโปมีแพตช์ตอนรันไทม์ให้ด้วย) และไฟล์ tokenizer.json ก็มี padding ที่ถูกซีเรียลไลซ์ไว้ถึง 9,000 โทเคน — ซึ่งเซิร์ฟวิ่งสแต็กหนึ่งพบว่าพรอมพ์หกโทเคนขยายเป็น 54,000 token IDs ก่อนที่จะแพตช์ ไม่มีอะไรถึงขั้นวิกฤต แต่มันคือแรงเสียดทานแบบที่คุณต้องตั้งงบประมาณไว้เมื่อใช้โมเดลใหม่

เลือกหนึ่งสำหรับไปป์ไลน์ของคุณ

เลือก olmOCR 2 หากคุณกำลังสร้างข้อมูลการฝึก LLM หรือไปป์ไลน์การแยกข้อความปริมาณมากสำหรับเอกสารภาษาอังกฤษ คุณจะได้รับชุดเครื่องมือที่สมบูรณ์ ใบอนุญาต Apache-2.0 เกณฑ์มาตรฐานที่อุตสาหกรรมใช้วัด และเส้นทางแบบแบตช์ที่ผ่านการใช้งานอย่างแพร่หลาย โหมดความล้มเหลวที่ยอมรับคือความครอบคลุมทางภาษา

เลือก Nemotron Parse 2.0 หากไปป์ไลน์ของคุณต้องการข้อมูลเชิงเรขาคณิต — คลาสเลย์เอาต์ กล่องขอบเขต และลำดับการอ่าน สำหรับการดึงข้อมูลแบบอ้างอิงตำแหน่งหรือระบบเอกสารอัจฉริยะ — หรือหากคลังข้อมูลของคุณมีหน้าเอกสารภาษาอินดิก ภาษา CJK หรือเอกสารเขียนด้วยมือเป็นจำนวนมาก ซึ่งเป็นจุดที่ข้อได้เปรียบที่อ้างไว้นั้นตั้งอยู่ ขนาด 0.9B ทำให้การทดสอบช่วงสุดสัปดาห์มีค่าใช้จ่ายต่ำแม้คุณจะยังไม่แน่ใจ โหมดความล้มเหลวที่ยอมรับได้คือ ตัวเลขทุกตัวบนการ์ดข้อมูลเป็นของ NVIDIA เอง และอาจเปลี่ยนแปลงได้เมื่อมีการประเมินโดยอิสระ

หากอินพุตของคุณส่วนใหญ่เป็น PDF ที่เกิดในยุคดิจิทัลซึ่งเขียนเป็นภาษาอังกฤษ และสิ่งที่คุณต้องการก็คือ markdown ที่สะอาด {{1}}olmOCR 2{{/1}} คือตัวเลือกเริ่มต้นที่ความเสี่ยงต่ำกว่า หากคุณโฮสต์เองอยู่แล้ว และกรณีการใช้งานที่เกี่ยวข้องกับหลายภาษาหรือการยึดตามเลย์เอาต์นั้นเกิดขึ้นจริง {{2}}Nemotron Parse 2.0{{/2}} คือตัวเลือกที่น่าสนใจกว่า — ทดสอบกับหน้าของคุณเองก่อนตัดสินใจ

หลีกเลี่ยงไม่ให้การเลือก parser กลายเป็นข้อผูกมัด

ไปป์ไลน์เอกสารมีขั้นตอน parser และขั้นตอน LLM โดยปกติ parser จะเป็นขั้นตอนที่ถูกที่สุดเมื่อปริมาณข้อมูลจริงเริ่มมากขึ้น — จุดที่ต้นทุนขยายตัวคือ LLM ที่แปลง markdown ที่ parse แล้วเป็นบทสรุป ระเบียนที่มีโครงสร้าง หรือคำตอบ และนั่นคือขั้นตอนที่เลเยอร์การจัดเส้นทาง (routing layer) เข้ามาเปลี่ยนแปลง OrcaRouter นำโมเดลมากกว่า 200 ตัวมารวมไว้เบื้องหลัง API เดียวในราคารายการของผู้ให้บริการโดยไม่มีส่วนเพิ่ม เมื่อผู้ให้บริการลดราคา ราคาใหม่ก็มีผลทันทีในวันเดียวกัน และการสลับระบบอัตโนมัติ (automatic failover) ช่วยให้ผู้ให้บริการที่เสื่อมคุณภาพไม่ทำให้งานแบบแบตช์ต้องหยุดชะงัก parser ทั้งสองตัวในการเปรียบเทียบนี้ไม่อยู่ในแคตตาล็อกของเรา — การ์ดโมเดลทั้งคู่ระบุว่าไม่มีการ部署โดยผู้ให้บริการ inference รายใด ดังนั้นการตัดสินใจนี้จึงเป็นการโฮสต์ด้วยตัวเอง — แต่เหตุผลที่ควรแยก parser ออกจากสแตกโมเดลของคุณก็คือสิ่งที่ routing มอบให้ในฝั่งปลายทาง: สลับ Nemotron Parse 2.0 เป็น olmOCR 2 หรือสลับกลับได้โดยไม่ต้องแตะอินทิเกรชันแม้แต่จุดเดียว เพราะเลเยอร์ LLM ยังคงอยู่เบื้องหลัง API คีย์เดียวเดียวกัน

คำถามที่พบบ่อย

โมเดลไหนชนะในเบนช์มาร์ก?

ไม่ใช่ทั้งสองอย่าง — ตัวเลขไม่ได้ถูกนำมาเทียบกันโดยตรง Nemotron Parse 2.0 รายงานผลบน ParseBench, MOSCAR, IndicVisionBench และชุดย่อยลายมือเขียนของ OmniDocBench ซึ่งทั้งหมดเป็น benchmark ของ NVIDIA เอง และไม่มีชุดใดที่ถูกทำซ้ำโดยอิสระ olmOCR 2 รายงานผลบน olmOCR-Bench ซึ่งเป็น benchmark ของ AI2 เอง ที่วงการที่เหลือใช้เผยแพร่ผลงานกันอยู่ในตอนนี้ ไม่มีบุคคลที่สามรายใดรันทั้งสองโมเดลบนคลังข้อมูลเดียวกัน ดังนั้นการอ้างว่าใคร "ชนะ" โดยตรงจึงเป็นการคาดคะเนล่วงหน้า ในเชิงทิศทาง: ตัวเลขของ olmOCR ผ่านการใช้งานในชุมชนมาสิบเดือนแล้ว ในขณะที่ตัวเลขของ Nemotron Parse 2.0 เพิ่งออกใหม่และอาจเปลี่ยนแปลงได้

Nemotron Parse 2.0 ดีกว่าสำหรับเอกสารที่ไม่ใช่ภาษาอังกฤษจริงหรือ?

นั่นคือข้อกล่าวอ้าง — การขยายคลังคำศัพท์ประมาณ 20,000 โทเคน พร้อมด้วย MOSCAR ที่ 0.9102 และ IndicVisionBench ที่ 0.7203 ซึ่งทั้งคู่เป็นตัวเลขที่ผู้จำหน่ายรายงาน และทั้งคู่เพิ่มขึ้นอย่างชัดเจนจาก v1.2 olmOCR 2 ไม่ได้กล่าวอ้างเรื่องความสามารถหลายภาษา และถูกแท็กเป็นภาษาอังกฤษ แต่จนกว่าจะมีการทดสอบโดยอิสระเกิดขึ้น ให้ถือว่าข้อได้เปรียบด้านหลายภาษาของ Nemotron Parse 2.0 ดูมีแนวโน้มดีแต่ยังไม่ได้รับการยืนยัน และควรทดสอบกับหน้าเว็บ Indic หรือ CJK ของคุณเองก่อนที่จะเชื่อถือผลลัพธ์เหล่านั้น

ฉันต้องใช้ GPU ที่ใหญ่กว่าสำหรับหนึ่งในนั้นไหม

ใช่ และมันติดตามความแตกต่างของขนาด Nemotron Parse 2.0 รุ่น 0.9B ทำงานได้บนการ์ดยุค Ampere ระดับทั่วไป และเป็นตัวเลือกที่ถูกกว่าต่อหน้าบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว olmOCR 2 ซึ่งเป็น VLM ขนาด 7B ต้องการ GPU ที่ใหญ่กว่าอย่างเห็นได้ชัด บิลด์ FP8 ของมันทำความเร็วได้ประมาณ 3,400 โทเค็นเอาต์พุตต่อวินาทีบน H100 ตามข้อมูลของ AI2

อันไหนดีกว่าสำหรับการประมวลผลล่วงหน้าของ RAG?

ขึ้นอยู่กับว่าผู้ดึงข้อมูลของคุณต้องการอะไร หากคุณต้องการอ้างอิงคำตอบกลับไปยังพื้นที่ของหน้า ต้องการคลาสเลย์เอาต์ หรือต้องการจัดทำดัชนีตารางและแผนภูมิเป็นหน่วยของตัวเอง bounding boxes และคลาสของ Nemotron Parse 2.0 ก็ให้สิ่งนั้นมาโดยตรง หากสแตก RAG ของคุณใช้เพียงข้อความที่สะอาดและคลังข้อมูลของคุณเป็นภาษาอังกฤษ markdown แบบ linearized ของ olmOCR 2 ก็ผ่านการพิสูจน์แล้ว ใช้ง่ายกว่า และมีเครื่องมือที่ครบครันรองรับ

บรรทัดล่าง

ในสัปดาห์นี้ NVIDIA ปล่อย parser ตัวจริงโดยไม่บอกใคร ขณะที่ AI2 ปล่อยออกมาเมื่อสิบเดือนก่อน และเป็นผู้กำหนด benchmark ของหมวดหมู่นี้ Nemotron Parse 2.0 เหมาะกับคุณมากกว่าเมื่อคุณต้องการความหมายของเลย์เอาต์ การรองรับหลายภาษา หรือการสกัดลายมือด้วยงบประมาณจำกัด — และจุดที่ตัวเลขของมันยังไม่ได้รับการพิสูจน์มากที่สุดก็คือจุดที่มันอ้างว่าชนะเป๊ะๆ olmOCR 2 เหมาะกว่าเมื่อคุณต้องการข้อความแบบเชิงเส้น (linearized text) ในระดับใหญ่สำหรับเอกสารภาษาอังกฤษ และต้องการชุดเครื่องมือที่เสถียรมานานสิบเดือน ทั้งคู่ยังไม่ถูกนำไปใช้งานที่ไหน ดังนั้นนี่คือการตัดสินใจแบบ self-host ไม่ว่าจะทางไหน; วิธีที่ประหยัดที่สุดคือรันทั้งสองตัวบนหน้าที่ยากที่สุดของคุณเอง แล้วดูว่าแต่ละตัวพังตรงไหน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube