
Nemotron Parse 2.0 مقابل MinerU: المنافس غير المُعلن عنه مقابل الخيار الافتراضي مفتوح المصدر
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
تحل NVIDIA-Nemotron-Parse-2.0 وMinerU المشكلة نفسها من اتجاهين متعاكسين. كلاهما يأخذ صفحة ممسوحة ضوئيًا أو معروضة ويعيد Markdown منظمًا ونظيفًا مع الحفاظ على الجداول والصيغ وترتيب القراءة. لكن MinerU هو الخيار الافتراضي مفتوح المصدر — عشرات الآلاف من نجوم GitHub، وترخيص Apache-2.0، وواجهة برمجة تطبيقات مستضافة بحصة يومية مجانية، وهو الخيار الأول الآمن الذي تلجأ إليه معظم فرق المستندات. أما Nemotron Parse 2.0 فهو عكس الاستقرار: ظهر على Hugging Face في 3 أغسطس 2026، ولم تصدر NVIDIA أي إعلان عنه، وتحمل بطاقة نموذجه مجموعة من الادعاءات المعيارية التي ستكون أكبر حدث يحدث لتحليل المستندات مفتوح المصدر هذا العام إذا ثبتت صحتها. هذا الاقتران غير متوازن عمدًا — الحالي القائم مقابل المتحدي غير المُعلن — والسؤال كله هو ما قيمة عرض كل طرف في الواقع.
ما هو كل جانب في الواقع
MinerU هو نظام متكامل لتحليل المستندات من OpenDataLab، فريق البيانات الذي يقف خلف الإصدارات المفتوحة لمختبر شنغهاي للذكاء الاصطناعي. المنتج الرائد حاليًا هو MinerU 2.5-Pro، وهو نموذج رؤية-لغة بحجم 1.2 مليار معامل ضمن سلسلة الإصدارات النقطية 2604/2605 (أُطلق نموذج 2604 في أبريل 2026، تلاه تحديث 2605). يعتمد على محرك من مرحلتين — تحليل تقريبي للتخطيط العام، ثم تعرّف موجّه على مقاطع بالدقة الأصلية — ويغلّف المشروع النموذج ضمن عمليات استيعاب ملفات PDF وDOCX وPPTX وXLSX، وكشف التخطيط، والتعرّف على المعادلات والجداول، وإعادة بناء ترتيب القراءة. وهو المحلل المرجعي مفتوح المصدر للمعالجة الأولية في أنظمة RAG، ومجتمعه خير دليل على ذلك.
Nemotron Parse 2.0 هو ترميز-فك ترميز رؤية بحجم 0.9B معلمة من NVIDIA في نفس عائلة NVIDIA-Nemotron-Parse-v1.2 الذي صدر في فبراير 2026. يستخدم مشفر رؤية ViT-H مبنيًا على نواة C-RADIOv2 من NVIDIA ومفكك ترميز من نمط mBART من عشر طبقات. تدخل الصفحات حتى 2048×1664، ويصل التوليد إلى سقف 9,000 رمز، ويُخرج نفس المخرجات المنظمة التي ينتجها MinerU: Markdown أو نص عادي، بالإضافة إلى جداول بصيغ LaTeX أو HTML أو Markdown أو JSON أو JSON هرمي أو CSV، مع فئات التخطيط والمربعات المحيطة وترتيب القراءة. المستودع مكتمل — إعدادات، وملف Dockerfile، ومجموعة اختبار بمخرجات ذهبية — لكن NVIDIA لم تروّج له، ولا يوجد تغليف NIM، ولا يستضيفه أي مزود استنتاج. الاستضافة الذاتية هي الخيار الوحيد اليوم.

قصة السعر: "مجاني" تعني شيئين مختلفين
أكبر اختلاف عملي هو أن MinerU مجاني للاستدعاء بينما Nemotron Parse 2.0 مجاني للتشغيل فقط. توفر واجهة MinerU الرسمية على mineru.net طبقة مجانية يومية — حوالي 1000 صفحة ذات أولوية عالية يوميًا حسب العرض الحالي — دون أي رسوم لكل استدعاء ضمنها، وملفات يصل حجمها إلى 200 صفحة لكل ملف. خارج الحصة، يتم تخفيض أولوية المهام بدلاً من فرض رسوم عليها، وتقوم الاستضافات التجارية بتسعير النموذج المستضاف ذاتيًا بحوالي عُشر سنت للصفحة. إذا كان خط الإنتاج لديك يحتاج إلى آلاف الصفحات يوميًا ولا تريد تشغيل أي شيء، فإن MinerU يوفر مسارًا لا يكاد يكلف شيئًا.
نيموترون بارس 2.0 لا يملك مثل هذا المسار. الأوزان مجانية بموجب ترخيص NVIDIA Open Model License، لكن بطاقة النموذج تنص على أنه لا يتم نشره بواسطة أي مزود استدلال، ولم تقم NVIDIA بتسعيره أو الإعلان عن خيار استضافة. استخدامه يعني استئجار أو امتلاك GPU، وإعداد Transformers أو إصدار vLLM مع دعم الكود البعيد لـ Nemotron Parse، والتعامل مع خصوصيات النشر أدناه. بالنسبة لمشروع صغير الحجم، فهذه تكلفة حقيقية — فـ GPU أغلى بكثير من طبقة API المجانية عند بضع مئات من الصفحات شهريًا. أما بالنسبة لفريق يدير بالفعل بنية تحتية لوحدات GPU، فإن كون الأوزان مجانية هو ميزة حقيقية؛ السؤال هو ما إذا كان العبء التشغيلي يستحق ما يدعي النموذج إضافته.
فجوة المعيار: هذه الأرقام لا تواجه بعضها البعض
هذا هو القسم الذي تخطئ فيه معظم المقارنات بصمت، لذا دعونا نكون صريحين. بطاقة Nemotron Parse 2.0 تذكر أربعة معايير قياسية: معيار ParseBench الكلي عند 0.6391 (ارتفاعًا من 0.5782 في الإصدار 1.2)، وMOSCAR للتعرف الضوئي على الحروف متعدد اللغات عند 0.9102 بمقياس BoC F1 (ارتفاعًا من 0.4410)، وIndicVisionBench عند 0.7203 بمقياس ANLS-الحرف (ارتفاعًا من 0.0612)، ومجموعة فرعية لمجال الكتابة اليدوية من OmniDocBench قيست بمسافة تحرير النص وتحسنت من 0.9739 إلى 0.3395. ويذكر MinerU 2.5-Pro مجموعة مختلفة: نتيجة إجمالية قدرها 95.69 في OmniDocBench الإصدار 1.6 — وهي أحدث ما توصلت إليه التقنية، وتتفوق على نماذج أكبر بكثير — إضافة إلى 97.29 في تحليل الصيغ الكثيفة، ومسافة تحرير نصي قدرها 0.036 في عمليات تشغيل OmniDocBench الخاصة به.
النموذجان يتشاركان الاسم "OmniDocBench"، مما يجعلهما يبدوان قابلين للمقارنة، لكن المقاييس ليست كذلك. تُبلغ NVIDIA عن مجموعة فرعية للكتابة اليدوية فقط كمسافة تحرير؛ بينما تُبلغ OpenDataLab عن مؤشر مركب إجمالي على نسخة مختلفة من المعيار. ParseBench هي مجموعة NVIDIA الخاصة وليس لها إدخال لـMinerU. MOSCAR وIndicVisionBench ليس لهما إدخال لـMinerU. كل رقم في الجانبين مُبلغ من البائع، ولا يوجد لأي من النموذجين تشغيل مستقل من طرف ثالث منشور يظهر عليه الآخر. وهذا يعني أنه لا يوجد حاليًا رقم بمقارنة عادلة يرتب Nemotron Parse 2.0 مقابل MinerU — أي شخص يخبرك أن أحد النموذجين "يفوز" في مقارنة المعايير إنما يستنتج من اختبارات مختلفة. ما يمكنك قوله بشكل اتجاهي: ادعاءات MinerU ناضجة وصمدت أمام عام من الاستخدام المجتمعي، بينما ادعاءات Nemotron Parse 2.0 جديدة وغير مدققة، وإذا تكررت قفزاتها في MOSCAR وIndicVision، فهي أمر كبير للتحليل متعدد اللغات تحديدًا.

حيث تتباين في أعباء العمل الحقيقية

ضع المعايير جانبًا، فالاختلافات التي تظهر في خط الأنابيب تتعلق بالنطاق وزمن الاستجابة والتغطية متعددة اللغات.
• نطاق الإدخال — يستوعب MinerU ملفات PDF كاملة حتى 200 صفحة لكل ملف عبر واجهة برمجة التطبيقات (API) ويدمج الجداول الممتدة عبر الصفحات؛ بينما يستقبل Nemotron Parse 2.0 صورة صفحة يصل حجمها إلى 2048×1664 لكل استدعاء، لذا فإن مستندًا من 200 صفحة يلزمه 200 استدعاء. إذا كان مدخلك ملف PDF، فهذا فرق في سير العمل قبل أي مسألة دقة.
• نضج التقديم — يوفر MinerU خلفيات vLLM وSGLang مع إنتاجية منشورة (حوالي صفحتين في الثانية على وحدة A100 واحدة عبر محركه غير المتزامن)، ومشغّل Docker، وواجهة برمجة تطبيقات مستضافة. قصة تقديم Nemotron Parse 2.0 لا تزال حديثة ومتعثرة: يحتاج vLLM إلى دعم الكود البعيد، وعلى أجهزة A100/A10، إلى خلفية انتباه Triton؛ ويأتي المُرمِّز (Tokenizer) مع ملف tokenizer.json متسلسل يحتوي على حشو مدمج يصل إلى 9000 رمز، وهو ما واجهته إحدى حزم التقديم كطلب من ستة رموز انفجر إلى 54,000 معرّف رمز؛ كما يحتوي المستودع على تصحيح وقت تشغيل لإصدارات vLLM التي لا تدعم رأس الإخراج المرتبط (tied output head). لا شيء من هذا مستعصٍ، لكنه احتكاك حقيقي.
• متعدد اللغات — هنا تكون ورقة Nemotron Parse 2.0 الأعلى صوتًا. أصدر الإصدار 2.0 توسيعًا للمفردات من حوالي 52,000 إلى 72,000 رمزًا خصيصًا للتعرف الضوئي على الحروف متعدد اللغات، وتتركز المكاسب المُدَّعاة هناك: MOSCAR ارتفع من 0.44 إلى 0.91، وIndicVisionBench (البنغالية والهندية والتاميلية وسبع نصوص إندية أخرى) ارتفع من 0.06 إلى 0.72. يدعم MinerU 109 لغات كميزة رئيسية، لكن دليله هو مركب OmniDocBench، وليس تحليلًا لكل نص. إذا كانت مجموعتك النصية غنية بالنصوص الإندية أو منخفضة الموارد، فإن أرقام Nemotron Parse 2.0 هي الادعاء الأكثر إثارة للاهتمام لاختباره — وهي أيضًا الأقل تحققًا بشكل مستقل.
• الكتابة اليدوية — أكبر فارق فردي في بطاقة NVIDIA هو الكتابة اليدوية: مسافة التحرير على مجموعة الملاحظات الفرعية في OmniDocBench تنخفض من 0.97 إلى 0.34. مسافة التحرير النصي لـ MinerU البالغة 0.036 هي على إجمالي تشغيلات OmniDocBench، وليس على مجموعة الكتابة اليدوية الفرعية، لذا مرة أخرى الأرقام لا تواجه بعضها البعض. لكن الملاحظات المكتوبة بخط اليد هي نمط فشل كلاسيكي لكلاهما، وهذا هو المجال الوحيد الذي يكون فيه التحسن المُعلن من Nemotron Parse 2.0 كبيرًا بما يكفي لتبرير اختبار مباشر على صفحاتك الخاصة.
من الذي يجب أن يختار ماذا
اختر MinerU إذا كنت تريد محللاً يمكنك استدعاؤه اليوم: طبقة مجانية يومية، خدمة ناضجة، دعم كامل لإدخال PDF، ترخيص Apache-2.0 دون مراجعة امتثال، ومجتمع كبير بما يكفي لوجود إجابات جاهزة لأسئلة الإعداد. إنه الخيار الافتراضي لسبب وجيه، وبالنسبة لمعظم أعباء المعالجة المسبقة في RAG، فهو الخيار الأقل خطورة.
اختر Nemotron Parse 2.0 إذا كنت مرتاحًا بالفعل لاستضافة النماذج ذاتيًا — خاصةً إذا كنت في عالم NVIDIA NIM أو NeMo، نظرًا لأن الإصدار 1.2 يُقدَّم كخدمة NIM ويبدو أن 2.0 هو خليفته — وإذا كانت ميزة تعدد اللغات أو الكتابة اليدوية هي بالتحديد ما تحتاجه مجموعتك النصية. اختبار في عطلة نهاية الأسبوع على صفحاتك الهندية أو المليئة بالملاحظات سيخبرك أكثر من أي جدول معايير، لأن الادعاءات إما أن تثبت صحتها أو تنهار أمام البيانات المستقلة. فقط لا تخطط لمسار إنتاجي حول نموذج غير مُعلن عنه حتى تجري ذلك الاختبار وتتأكد من أن المُرمِّز وخصوصيات التقديم مُدارة في بيئتك التقنية.
لماذا لا يُعد المحلل اللغوي التكلفة الوحيدة في خط المعالجة؟
أيًا كان ما تختاره، فإن المحلل اللغوي (Parser) عادةً ما يكون المرحلة الأرخص في خط معالجة المستندات بمجرد أن يصبح الحجم حقيقيًا. أما المرحلة المكلفة فهي نموذج اللغة الكبير (LLM) الذي يحوّل تنسيق markdown المُحلَّل إلى ملخصات أو سجلات منظمة أو إجابات — وهذه هي المرحلة التي تُحدث فيها طبقة التوجيه (routing layer) تغييرًا جذريًا في الاقتصاديات. يضع OrcaRouter أكثر من 200 نموذج خلف واجهة برمجة تطبيقات واحدة بسعر القائمة للمزوّد دون أي زيادة، لذا فإن أي تخفيض في أسعار المزوّد يصبح ساريًا في نفس اليوم الذي يُعلن عنه، كما أن التبديل التلقائي للفشل (failover) يضمن ألا يؤدي تعرّض مزوّد واحد للتدهور إلى تعطيل مهمة الاستخراج بأكملها. على نحو ملموس: يمكنك اختبار ادعاءات Nemotron Parse 2.0 بشأن التعرف على خط اليد مقارنةً بـ MinerU على مجموعتك الخاصة دون إلزام حزمة النماذج النهائية لديك بأيٍّ من المحللين، لأن تبديل المحلل وطبقة LLM منفصلان عن بعضهما. نحن لا نستضيف أيًّا من المحللين اليوم — فـ Nemotron Parse 2.0 نموذج يُستضاف ذاتيًا وMinerU يعمل على خدمته الخاصة — لكن طبقة التوجيه في مرحلة LLM هي بالضبط ما يمنع قرار اختيار المحلل من أن يتحوّل إلى قرار إغلاق (lock-in).
خلاصة القول
MinerU هو الخيار العقلاني الافتراضي: ناضج، ومجاني الاستدعاء على النطاق الصغير، ومرخّص برخصة متسامحة، ومُثبت في بيئات الإنتاج. Nemotron Parse 2.0 هو الرهان المثير للاهتمام: نموذج NVIDIA بحجم 0.9B أُطلق بهدوء قبل خمسة أيام، وبطاقته تزعم قفزة هائلة في تعدد اللغات والتعرف على خط اليد لم يتحقق منها أحد بشكل مستقل. إذا كنت تحلل مستندات تقنية إنجليزية في الغالب وبحجم كبير، فإن MinerU هو الحل ومخاطرة Nemotron Parse 2.0 لا تستحق العناء. إذا كنت تحلل نصوصًا هندية أو لغات منخفضة الموارد، أو ملاحظات مكتوبة بخط اليد، فالتصريحات كبيرة بما يكفي — والأوزان مجانية بما يكفي — ليكون تشغيل الاختبار بنفسك أمرًا رخيصًا. إطلاق NVIDIA لمحلل جديد كل ثلاثة أشهر تقريبًا (v1.1 في نوفمبر 2025، v1.2 في فبراير 2026، و2.0 الآن) يوحي بأن إعلانًا قد يصدر قريبًا؛ وحتى يحدث ذلك، تعامل مع أرقام 2.0 باعتبارها استرشادية واختبرها على مجموعتك الخاصة.
الأسئلة الشائعة
هل يتوفر Nemotron Parse 2.0 عبر أي API؟
ليس عبر موفّر مستضاف. توضح بطاقة Hugging Face أن النموذج غير منشور من قبل أي موفّر استدلال، ولم تعلن NVIDIA عن حزمة NIM أو تسعيرها له، حتى أوائل أغسطس 2026. الطريقة الوحيدة لتشغيله هي الاستضافة الذاتية للأوزان عبر Hugging Face Transformers مع trust_remote_code، أو عبر بناء vLLM يتضمن دعم الكود البعيد لـ Nemotron Parse. أما MinerU، ففي المقابل، لديه واجهة برمجة تطبيقات رسمية مع حصة صفحات يومية مجانية.
أي نموذج أفضل للمعالجة المسبقة في RAG؟
بالنسبة لخطوط أنابيب RAG النموذجية — المستندات التقنية بالإنجليزية ولغات CJK، والجداول، والتخطيطات المختلطة — يُعد MinerU الخيار الأكثر أمانًا والأكثر موثوقية: فهو يقبل ملفات PDF كاملة، ويدمج الجداول الممتدة عبر الصفحات، ويتمتع بخدمة ناضجة، ولا يكلف شيئًا على النطاق الصغير عبر خطته المجانية. لا يصبح Nemotron Parse 2.0 الخيار الصحيح إلا إذا كانت مجموعتك النصية غنية بالنصوص الهندية أو النصوص منخفضة الموارد، أو الملاحظات المكتوبة بخط اليد، أو الصفحات المليئة بالرسوم البيانية حيث تتركز مكاسبه المزعومة — وحتى عندئذٍ، تحقق من مستنداتك بنفسك قبل الالتزام.
هل تُقارَن أرقام المعايير على بطاقتَي النموذج بشكل مباشر؟
لا. يُبلغ Nemotron Parse 2.0 عن ParseBench (مجموعة NVIDIA الخاصة)، وMOSCAR، وIndicVisionBench، ومجموعة فرعية من OmniDocBench للكتابة اليدوية كمقياس مسافة التحرير. ويُبلغ MinerU 2.5-Pro عن مركّب OmniDocBench v1.6 الإجمالي بالإضافة إلى مقاييس الصيغ والنص-التحرير. اسم المعيار المتداخل ليس المقياس نفسه، ولا توجد عملية تشغيل مستقلة تضع كلا النموذجين على نفس الاختبار، وكل رقم في البطاقتين مُبلَّغ عنه من البائع. تعامل معها كمؤشرات اتجاهية، وليست قابلة للمقارنة المباشرة.
