بطاقة عنوان لـ 'Nemotron Parse 2.0 مقابل olmOCR': العنوان الرئيسي 'Nemotron Parse 2.0 مقابل olmOCR'، والعنوان الفرعي 'مهمتان، كلتاهما تسمى تحليلًا'، مع رسم توضيحي مقسوم — الجانب الأيسر صفحة مستند محللة إلى مربعات إحاطة موسومة تحت التسمية التوضيحية 'دلالات التخطيط'، والجانب الأيمن أسطر نصية متدفقة مع رمز markdown تحت التسمية التوضيحية 'markdown خطي'. شعار OrcaRouter مدمج في الزاوية السفلية اليمنى.
Guides & Insights

Nemotron Parse 2.0 مقابل olmOCR: وظيفتان، كلاهما يُسمى تحليلًا

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 3 أغسطس 2026، نشرت NVIDIA نموذجًا جديدًا لتحليل المستندات على Hugging Face دون أن تخبر أحدًا. NVIDIA-Nemotron-Parse-2.0 هو نموذج ترميز-فك ترميز بصري بحجم 0.9B، وتدعي بطاقة النموذج أنه قفزة متعددة اللغات وواعية بالرسوم البيانية مقارنة بسلفه الصادر في فبراير 2026. وقد استقر في نفس ركن النظام البيئي الذي يحتضن olmOCR — وبشكل أكثر دقة olmOCR-2-7B-1025، وهو أداة الخطية (linearizer) بحجم 7B من معهد آلين للذكاء الاصطناعي، والتي أصبحت بهدوء الطريقة الافتراضية لتحويل ملفات PDF إلى بيانات تدريب لنماذج اللغة الكبيرة (LLM). إن تسمية هذا الأمر بمواجهة مباشرة هو الفخ: فكلا النموذجين يوصفان بأنهما "تحليل مستندات"، لكنهما يعيدان مخرجات مختلفة، ويغذيان خطوط أنابيب مختلفة، وأرقامهما المعيارية لا تتواجه في الواقع أبدًا. السؤال الحقيقي هو أيُّ المهمتين تستأجر محلل مستندات للقيام بها.

القطعتان الأثريتان

{{1}}Nemotron Parse 2.0 هو محرك دلالات التخطيط.{{/1}} {{2}}امنحه صورة صفحة وموجّه مهام، فيعيد النص مع طبقة دلالية فوقه:{{/2}} {{3}}فئة تخطيط لكل منطقة (عنوان، قسم، تسمية توضيحية، جدول، مخطط بياني، ترويسة، تذييلة، حاشية سفلية، مدخل ببليوغرافي)،{{/3}} {{4}}صندوقًا محيطًا لكل منها، وترتيب القراءة بينها{{/4}} {{5}}— مع ماركداون كتمثيل تسلسلي اختياري فوق ذلك.{{/5}} {{6}}olmOCR 2 هو أداة تخطيط خطي.{{/6}} {{7}}يأخذ الصفحة نفسها ويعيد ماركداون خطيًا نظيفًا مع ترويسة YAML قصيرة تسجّل بيانات وصفية على مستوى الصفحة مثل اللغة الأساسية وتصحيح التدوير وما إذا كانت الصفحة جدولًا أو رسمًا تخطيطيًا.{{/7}} {{8}}لا صناديق، لا فئات، لا هندسة: تمريرة واحدة، النص بترتيب المستند.{{/8}}

المنتج النهائي يحدد المهمة. إذا كانت خطوط المعالجة لديك تحتاج إلى الاستشهاد بحقيقة إلى منطقة من الصفحة، أو تمييز جدول في صورة ممسوحة ضوئيًا، أو استخراج دلالات التخطيط لذكاء المستندات، فأنت بحاجة إلى الهندسة — وهذا هو فضاء مخرجات Nemotron Parse 2.0. أما إذا كنت تبني بيانات تدريب أو تُغذّي نموذج لغة كبيرًا نصيًا يستهلك الرموز فقط، فإن الهندسة تُعد ضجيجًا وترميز markdown الخطي هو الصحيح تمامًا — وهذا هو التصميم الكامل لـ olmOCR. يمكنك إضافة كشف التخطيط إلى مخرجات olmOCR باستخدام كاشف منفصل، ويمكنك التخلص من مربعات Nemotron Parse 2.0 والاحتفاظ بترميز markdown فقط، لكن كل نموذج مبني ليجعل إحدى هاتين المهمتين أصلية.

السفينة الهادئة: ما يظهره المستودع، وما لم يتم تأكيده

NVIDIA-Nemotron-Parse-2.0 ظهر على منصة Hugging Face في 3 أغسطس 2026 دون أي إعلان أو تدوينة أو حزمة NIM. وما يمكن معرفته هو المستودع. إنه نموذج ترميز-فك ترميز بصري بحجم 0.9 مليار معلمة: مشفّر صور ViT-H مبني على نواة C-RADIO من NVIDIA، ومهايئ التفاف أحادي البعد خفيف الوزن، وفكّ ترميز من عشر طبقات بأسلوب mBART. وقد نما مُرمّز الرموز بنحو 20,000 مدخل ليبلغ حوالي 72,000 مدخلًا إجمالًا، صراحةً لدعم أكثر كفاءة للغات المتعددة، وتُدرج بطاقة النموذج التحليل الواعي بالمخططات كميزة رئيسية عبر رمز class_Chart الجديد، إلى جانب عائلة من تسلسلات الجداول (LaTeX وHTML وmarkdown وJSON وJSON هرمي وCSV). ويُرفق به معالجَا لوجيت اختياريان: أحدهما يوقف المخرجات المنظمة المتكررة، والآخر يفرض بنية جدول على اقتصاص الجدول. وتتراوح دقة الإدخال الموصى بها بين حوالي 1024×1280 وصولًا إلى 1664×2048، ويبلغ سقف التوليد 9,000 رمز، وتُدرج بطاقة النموذج كلاً من Transformers وvLLM وSGLang وDocker Model Runner كبيئات تشغيل على أجهزة Ampere وHopper وBlackwell وTuring.

غير أن هذه الادعاءات كلها صادرة عن NVIDIA وحدها، ولم يُتحقق منها بشكل مستقل. يذكر التقرير أن الأداء الكلي في ParseBench بلغ 0.6391 (مقارنةً بـ0.5782 في الإصدار 1.2)، وMOSCAR للتعرف الضوئي على النصوص متعدد اللغات بلغ 0.9102 في مقياس BoC-F1 (مقارنةً بـ0.4410)، وIndicVisionBench بلغ 0.7203 في مقياس ANLS على مستوى الأحرف (مقارنةً بـ0.0612)، كما تحسّنت مجموعة الكتابة اليدوية ضمن OmniDocBench من 0.9739 إلى 0.3395 على مقياس مسافة التحرير النصية. هذه هي أكبر القفزات، وهي أيضًا الأقل تحققًا: فمنصة ParseBench ملك لـNVIDIA نفسها، ولم تشغّل أي جهة خارجية Parse 2.0 على مجموعة بيانات مستقلة بعد. وما لم يُؤكَّد يتجاوز الأرقام — فلا يوجد استدلال مستضاف (يذكر التقرير أن النموذج غير منشور لدى أي مزوّد خدمة استدلال)، ولا تسعيرة معلنة، ولا جدول زمني مُعلن لأيٍّ من هذين.

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that 2.0 adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

olmOCR 2: المعيار الذي يقيس به الجميع بالفعل

olmOCR هو النموذج الذي ابتكر المعيار الذي يتجادل حوله هذا التصنيف الآن. أُصدر olmOCR-2-7B-1025 في 22 أكتوبر 2025، وهو نموذج رؤية-لغة بحجم 7 مليارات معامل، تمت معايرته بدقة من Qwen2.5-VL-7B-Instruct على مجموعة olmOCR-mix-1025 التي تضم 270,000 صفحة، ثم حُسّن باستخدام تعلم التعزيز GRPO مقابل مكافآت "اختبارات الوحدة" الآلية — فحوصات حتمية للتأكد من أن الجدول حافظ على بنيته، وأن الصيغة نُقلت بدقة، وأن ترتيب القراءة صحيح. هذا الإطار القائم على اختبارات الوحدة أصبح معيار olmOCR-Bench، الذي يضم نحو 1,400 ملف PDF وأكثر من 7,000 فحص، وأصبح المعيار الصناعي الفعلي: الآن تنشر Marker وMinerU وعشرات نماذج OCR التجارية نتائجها عليه. يحقق olmOCR 2 نفسه درجة 82.4 إجمالاً هناك، أي أعلى بنحو أربع نقاط من الإصدار السابق، وأعلى من رقمي Marker (76.1) وMinerU (75.8) اللذين تستشهد بهما AI2 في الصفحة نفسها.

تُعد olmOCR أيضًا الخيار الأكثر نضجًا في هذا الثنائي. وهي مرخّصة بموجب رخصة Apache-2.0، وقد جرى تنزيل أوزانها نحو 218,000 مرة خلال الشهر الماضي. تتولى مجموعة أدوات olmOCR معالجة العرض والتدوير وإعادة المحاولة على نطاق واسع عبر خلفية vLLM — وتُقدّر AI2 تكلفة خط المعالجة بنحو 176–190 دولارًا لكل مليون صفحة على وحدات GPU مستأجرة، بينما يعمل إصدار FP8 بمعدل يبلغ نحو 3,400 رمز إخراج في الثانية على شريحة H100 واحدة، وهي سرعة كافية لدرجة أن منشور الإصدار يقتبس: «10,000 صفحة بأقل من دولارين». أمّا المقايضة فتتمثل في اللغة: فقد بُنيت olmOCR صراحةً وخضعت لقياس الأداء على المطبوعات الرقمية باللغة الإنجليزية، وتصفها بطاقة طرازها بأنها أداة إنجليزية. وفي المقابل، فإن طرح Nemotron Parse 2.0 بأكمله هو عكس ذلك تمامًا — فمكاسبه المزعومة تتركّز في الخطوط الصينية واليابانية والكورية (CJK) والخطوط الهندية (Indic).

Screenshot of the Hugging Face repository page for allenai/olmOCR-2-7B-1025, showing the Apache-2.0 license tag, the English language tag, 217,859 downloads last month, 8B params, the description that it is the BF16 release fine-tuned from Qwen2.5-VL-7B-Instruct on the olmOCR-mix-1025 dataset with additional GRPO RL training for math equations and tables, the note that the best way to use it is the olmOCR toolkit via vLLM, and the line 'This model isn't deployed by any Inference Provider.'

ستة صفوف تظهر فيها المفاضلة

كلا النموذجين مفتوحا الأوزان، وكلاهما يعمل على Transformers أو vLLM أو SGLang، وكلاهما يُستضاف ذاتيًا اليوم. وعلى الأبعاد التي تهم عند الاختيار بينهما:

• الحجم — Nemotron Parse 2.0 هو 0.9B؛ olmOCR 2 هو 7B. تقريبًا ثمانية أضعاف المعلمات، وتقريبًا ثمانية أضعاف الحد الأدنى لذاكرة VRAM.

• الإخراج — يعيد Nemotron Parse 2.0 النص وفئات التخطيط والمربعات المحيطة وترتيب القراءة وMarkdown؛ بينما يعيد olmOCR 2 Markdown خطيًا مع كتلة بيانات وصفية YAML.

• متعدد اللغات — يدّعي Nemotron Parse 2.0 دعمًا قويًا للغات CJK واللغات الهندية (MOSCAR 0.9102، IndicVisionBench 0.7203، وفقًا لتقارير الشركة المصنّعة)؛ بينما olmOCR 2 موجّه للغة الإنجليزية في المقام الأول.

• النتيجة الرئيسية — يُبلغ Nemotron Parse 2.0 عن نتيجة 0.6391 في ParseBench (نتيجة NVIDIA الخاصة، غير مدققة)؛ بينما يحقق olmOCR 2 نتيجة 82.4 في olmOCR-Bench (نتيجة AI2 الخاصة، عشرة أشهر من إعادة الاستخدام المجتمعي).

• الترخيص — يُطرح Nemotron Parse 2.0 بموجب رخصة NVIDIA مفتوحة النموذج؛ بينما olmOCR 2 مرخّص بموجب Apache-2.0.

• تم الإصدار — وصل Nemotron Parse 2.0 في 3 أغسطس 2026 دون إعلان؛ بينما تم إصدار olmOCR 2 في 22 أكتوبر 2025 مع منشور إطلاق.

Two-column comparison scoreboard titled 'Nemotron Parse 2.0 vs olmOCR — the scoreboard'. Left column 'Nemotron Parse 2.0': Size 0.9B vision-encoder-decoder, Output bboxes, classes, reading order + markdown, Multilingual CJK + Indic strong, Score ParseBench 0.6391 (vendor), License NVIDIA Open Model, Shipped Aug 3, 2026 unannounced. Right column 'olmOCR 2': Size 7B VLM (Qwen2.5-VL), Output linearized markdown + YAML metadata, Multilingual English-first, Score olmOCR-bench 82.4, License Apache 2.0, Shipped Oct 22, 2025. Footer: 'Nemotron scores vendor-reported (NVIDIA); olmOCR scores per AI2's olmOCR-bench.' OrcaRouter logo composited bottom-right.

ثلاثة أماكن تظهر فيها وطأة القرار فعلًا

الحجم وزمن الاستجابة. وحدة فك ترميز بحجم 0.9B أرخص بكثير في التشغيل من نموذج VLM بحجم 7B: حيث تتطلب وحدة معالجة رسومات أصغر، وذاكرة VRAM أقل، وتُنتج صفحات أكثر في الثانية على نفس العتاد، وتكلفة أقل لكل صفحة عند الدفع مقابل وقت وحدة معالجة الرسومات. إذا كنت تدير بالفعل بنية تحتية لوحدات معالجة الرسومات وكانت مجموعة نصوصك كبيرة، فهذا فرق شهري حقيقي. أرقام olmOCR الخاصة تُظهر مدى سرعة نموذج 7B عند استخدام تكميم FP8 — لكنه لا يزال يحتاج إلى وحدة معالجة رسومات من فئة H100 لتحقيق هذه الأرقام؛ الحد الأدنى للأجهزة لنموذج Nemotron Parse 2.0 هو بطاقة من عصر Ampere.

متعدد اللغات. هذا هو الصف الأكثر تباينًا. قامت Nemotron Parse 2.0 بتوسيع مُرمِّزها بحوالي 20,000 إدخال خصيصًا للتعرف الضوئي على الحروف متعدد اللغات، وتتركز المكاسب المزعومة في بطاقتها في النصوص الهندية وCJK. لا تقدّم olmOCR 2 مثل هذا الادعاء — وسم لغتها هو الإنجليزية. إذا كانت مجموعتك النصية بالهندية أو التاميلية أو البنغالية أو اليابانية أو مختلطة النصوص، فإن أرقام Nemotron Parse 2.0 هي التي تستحق الاختبار، تحديدًا لأنها مقدمة من البائع وجديدة.

حقيقة الخدمة. عمر olmOCR 2 عشرة أشهر، وأدواته مملة بالمعنى الجيد. بينما عمر Nemotron Parse 2.0 خمسة أيام فقط، وقصته في الخدمة ما زالت يافعة بشكل واضح: vLLM يحتاج إلى بناءٍ مع دعم الكود البعيد لـ Nemotron Parse، ورأس الإخراج المرتبط يتسبب في تعطل بعض إصدارات vLLM 0.20 (ويوفّر المستودع تصحيحًا زمنيًا)، وملف tokenizer.json يحمل حشوًا مُسلسلًا يصل إلى 9,000 رمز — حيث تمدد موجّه من ستة رموز إلى 54,000 معرّف رمز لدى أحد أكوام الخدمة قبل التصحيح. لا شيء من ذلك قاتل، لكنه بالضبط نوع الاحتكاك الذي تخصص له ميزانية عند نموذج جديد.

اختر واحدًا لخط الأنابيب الخاص بك

اختر olmOCR 2 إذا كنت تبني بيانات تدريب لنماذج اللغة أو خط أنابيب لاستخراج النصوص بكميات كبيرة من المستندات الإنجليزية. ستحصل على مجموعة أدوات ناضجة، وترخيص Apache-2.0، والمعيار الذي تقيس به الصناعة الآن، ومسار دفعي مجرّب جيدًا. أسلوب الفشل المعترف به هو تغطية اللغة.

اختر Nemotron Parse 2.0 إذا كانت خطوط المعالجة لديك تحتاج إلى الهندسة — فئات التخطيط، والمربعات المحيطة، وترتيب القراءة من أجل الاسترجاع الموجَّه أو ذكاء المستندات — أو إذا كانت مدونتك اللغوية تعتمد بكثافة على الصفحات الهندية أو صفحات CJK أو المكتوبة بخط اليد، حيث تكمن مكاسبه المزعومة. الحجم 0.9B يجعل اختبار عطلة نهاية الأسبوع منخفض التكلفة حتى لو كنت غير متأكد. نمط الفشل المقبول فيه هو أن كل رقم على البطاقة هو رقم NVIDIA الخاص، وقد يتغير عند التقييم المستقل.

إذا كانت مدخلاتك في الغالب ملفات PDF رقمية المنشأ باللغة الإنجليزية وكل ما تحتاجه هو Markdown نظيف، فإن {{1}}olmOCR 2{{/1}} هو الخيار الافتراضي الأقل خطرًا. إذا كنت تستضيف الحل بنفسك بالفعل وكانت حالة الاستخدام متعددة اللغات أو المعتمدة على التخطيط حقيقية، فإن {{2}}Nemotron Parse 2.0{{/2}} هو الخيار الأكثر إثارة للاهتمام — اختبره على صفحاتك الخاصة قبل الالتزام به.

امنع اختيار المحلل من أن يصبح قيدًا.

خط أنابيب المستندات يتكون من مرحلة محلل ثم مرحلة نموذج لغة كبير (LLM)، وعادةً ما يكون المحلل هو المرحلة الأقل تكلفة بمجرد أن يصبح الحجم حقيقيًا — نموذج اللغة الكبير الذي يحول العلامات النصية (markdown) إلى ملخصات أو سجلات منظمة أو إجابات هو المكان الذي تتزايد فيه التكاليف. تلك هي المرحلة التي تغيرها طبقة التوجيه. يضع OrcaRouter أكثر من 200 نموذج خلف واجهة برمجة تطبيقات واحدة بسعر قائمة المزود دون أي زيادة، لذا فإن أي تخفيض في أسعار البائعين يصبح ساريًا في نفس اليوم، كما يمنع التبديل التلقائي عند الفشل أي مزود متدهور من تعطيل وظيفة دفعة. لا يوجد أي من المحللين في هذه المقارنة ضمن كتالوجنا — توضح بطاقتا النموذج أنهما غير منشورين من قبل أي مزود استدلال، لذا فهذا قرار استضافة ذاتية — لكن سبب إبقاء المحلل منفصلاً عن حزمة النماذج الخاصة بك هو بالضبط ما يوفره التوجيه على الجانب النهائي: استبدل Nemotron Parse 2.0 بـ olmOCR 2 أو العكس دون لمس أي تكامل واحد، لأن طبقة نموذج اللغة الكبير تبقى خلف نفس واجهة البرمجة ذات المفتاح الواحد.

الأسئلة الشائعة

أي نموذج يتفوق في المعايير؟

لا هذا ولا ذاك — فالأرقام لا تواجه بعضها البعض. Nemotron Parse 2.0 يُبلّغ عن ParseBench وMOSCAR وIndicVisionBench ومجموعة فرعية للكتابة اليدوية من OmniDocBench، وكلها معايير خاصة بـ NVIDIA ولم يُعيد إنتاج أيٌّ منها بشكل مستقل. أما olmOCR 2 فيُبلّغ عن olmOCR-Bench، وهو معيار AI2 الخاص الذي أصبحت بقية الصناعة تنشر عليه الآن. لا يوجد طرف ثالث شغّل النموذجين على نفس المجموعة، لذا فإن أي ادعاء مباشر بـ«الفائز» هو استقراء. وعلى المستوى الاتجاهي: أرقام olmOCR صمدت عشرة أشهر من الاستخدام المجتمعي؛ بينما أرقام Nemotron Parse 2.0 جديدة وقد تتغير.

هل Nemotron Parse 2.0 أفضل حقًا في التعامل مع المستندات غير الإنجليزية؟

هذا هو الادعاء — توسيعٌ للمفردات يبلغ نحو 20,000 رمزًا (token)، بالإضافة إلى MOSCAR عند 0.9102 وIndicVisionBench عند 0.7203، وكلاهما مُبلغٌ من جهة البائع ومرتفعان بشكل ملحوظ مقارنةً بالإصدار v1.2. أمّا olmOCR 2 فلا يقدّم أي ادعاءٍ بتعدّد اللغات ومُصنَّفٌ على أنه إنجليزي. لكن حتى يتم تنفيذ اختبارٍ مستقل، تعامل مع مكاسب Nemotron Parse 2.0 متعددة اللغات باعتبارها واعدةً لكنها غير مُتحقَّق منها، واختبر بنفسك على صفحاتك الهندية أو الصينية-اليابانية-الكورية قبل الاعتماد عليها.

هل أحتاج إلى وحدة معالجة رسومات أكبر لواحدة منها؟

نعم، ويتتبّع الفرق في الحجم. نسخة 0.9B من Nemotron Parse 2.0 تناسب بطاقة متواضعة من عصر Ampere، وهي الخيار الأرخص لكل صفحة على الأجهزة التي تمتلكها بالفعل. أما نموذج VLM بحجم 7B من olmOCR 2 فيتطلّب GPU أكبر بكثير؛ إذ يصل إصدار FP8 منه إلى حوالي 3,400 رمز إخراج في الثانية على H100، وفقًا لـ AI2.

أيهما أفضل للمعالجة المسبقة لـ RAG؟

يعتمد ذلك على ما يحتاجه جهاز الاسترجاع لديك. إذا كنت تربط الإجابات بمناطق الصفحة، أو تحتاج إلى فئات التخطيط، أو تريد فهرسة الجداول والرسوم البيانية كوحدات مستقلة، فإن المربعات المحيطة والفئات في Nemotron Parse 2.0 توفر لك ذلك بشكل أصلي. إذا كانت حزمة RAG لديك تستهلك نصًا نظيفًا فقط وكانت مجموعة نصوصك بالإنجليزية، فإن ماركداون الخطي في olmOCR 2 مجرّب وأبسط ومدعوم بأدوات ناضجة.

خلاصة القول

أصدرت NVIDIA محللًا فعليًا هذا الأسبوع دون أن تُخبر أحدًا؛ بينما أصدرت AI2 محللًا قبل عشرة أشهر وأعطت الفئة معيارها المرجعي. يعد Nemotron Parse 2.0 الخيار الأنسب عندما تحتاج إلى دلالات التخطيط أو تغطية متعددة اللغات أو استخراج الكتابة اليدوية بميزانية صغيرة — والمجالات التي تكون أرقامه فيها أقل تحققًا هي بالضبط المجالات التي يدّعي الفوز فيها. أما olmOCR 2 فهو الخيار الأنسب عندما تحتاج إلى نص خطي على نطاق واسع لمستندات إنجليزية وتريد سلسلة أدوات مستقرة منذ عشرة أشهر. ولا يُنشر أي منهما في أي مكان، لذا فإن هذا القرار يتعلق بالاستضافة الذاتية في كل الأحوال؛ الطريقة الأرخص لاتخاذه هي تشغيلهما معًا على أصعب صفحاتك الخاصة ومراقبة أين يتعطل كل منهما.