
NVIDIA-Nemotron-Parse-2.0: أصدرت NVIDIA بهدوء محلل مستندات أكثر ذكاءً
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenجديدQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekجديدDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- qwenجديدQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 591 tok/s
- orcaجديدOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232الذكاء42البرمجة
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226الذكاء39البرمجة
- anthropicAnthropic: Claude Sonnet 52026-06-3055الذكاء72البرمجة
- klingKling: Kling 3.0 Turbo2026-06-1757الذكاء52البرمجة57الرياضيات
- z-aiZ.ai: GLM 5.22026-06-1653الذكاء69البرمجة60الرياضيات
ظهر NVIDIA-Nemotron-Parse-2.0 على Hugging Face في 3 أغسطس 2026، وحتى وقت كتابة هذا المقال، بعد خمسة أيام، لم تعلن NVIDIA عنه بعد — لا منشور مدونة، ولا بيان صحفي، ولا تغريدة على X. المستودع مكتمل: يشمل مشفر-وحدة فك ترميز رؤية بحجم 0.9B، وبطاقة نموذج مع جدول معايير كامل مقارنةً بـ NVIDIA-Nemotron-Parse-v1.2، وملفات إعداد، وDockerfile، ومجموعة اختبارات، وحتى طلب سحب على vLLM يشير بالفعل إلى الرأس الإضافي للنموذج الجديد. إصدار مكتمل دون أي ضجيج هو بالضبط النوع من الإشارات التي تستحق نظرة "ما نعرفه حتى الآن"، وهذا هو بالضبط ما نقدمه هنا: الحقائق التي يثبتها المستودع، والأرقام التي لا تزال مقدمة من البائع، والأسئلة المفتوحة التي كان سيُجيب عليها الإعلان عادةً.
ما هو NVIDIA-Nemotron-Parse-2.0
نيموترون بارس هو نموذج تحليل المستندات من NVIDIA: تُدخل إليه صفحة ممسوحة ضوئيًا أو معروضة فيعيد النص بترتيب القراءة، والمربع المحيط والفئة الدلالية لكل منطقة، وترميز ماركداون — بما في ذلك الجداول — بصيغة من اختيارك: LaTeX أو HTML أو ماركداون أو JSON أو JSON الهرمي أو CSV. إنه ليس نموذج لغوي كبير للأغراض العامة وليس محرك OCR بسيطًا. بل يقع بين الاثنين: استخراج مدرك للتخطيط مصمَّم لتغذية خطوط عمل RAG والاستخراج وذكاء المستندات.
الإصدار 2.0 يحافظ على نفس عائلة البنية المعمارية مثل الإصدار 1.2، وفقًا لإعدادات المستودع. مشفّر الرؤية هو ViT-H مبني على الأساس C-RADIOv2 من NVIDIA، ووحدة فك الترميز هي وحدة من نمط mBART من عشر طبقات، ويبلغ إجمالي حجم النموذج حوالي 0.9 مليار معلمة. تصل الصفحات المُدخلة إلى 2048×1664، ويصل التوليد إلى سقف 9,000 رمز، ويصنّف النموذج المناطق بمجموعة من الفئات الدلالية (نص، عنوان، ترويسة قسم، عنصر قائمة، جدول، معادلة، صورة، تسمية توضيحية، حاشية سفلية، ترويسة/تذييل صفحة، وغيرها). إنه نموذج صغير بما يكفي لاستضافته ذاتيًا على وحدة معالجة رسومية واحدة، وهذا أمر مهم لأنه الطريقة الوحيدة لتشغيله حاليًا.
ما الذي تغيّر منذ الإصدار 1.2؟
الجزء المثير للاهتمام في البطاقة ليس النموذج — بل هو الفرق. تم إصدار NVIDIA-Nemotron-Parse-v1.2 على Hugging Face في فبراير 2026 بمفردات تضم 52,329 رمزًا. النسخة 2.0 توسّع ذلك إلى 72,256 رمزًا، أي قفزة تبلغ نحو 20 ألف رمز، والبطاقة صريحة بشأن السبب: الرموز الإضافية توفّر OCR متعدد اللغات، مع أكبر المكاسب على نصوص CJK والنصوص الهندية. كما تسرد بطاقة النموذج ثلاثة تغييرات أخرى:
• تحليل مدرك للرسوم البيانية — رمز فئة جديد class_Chart>، بحيث تحصل مناطق الرسوم البيانية على فئة دلالية خاصة بها بدلاً من دمجها مع الصور أو الجداول.
• تحسين استخراج النصوص المكتوبة بخط اليد — تشير البطاقة إلى انخفاض مسافة تعديل النص على مجموعة OmniDocBench Notes من 0.9739 في الإصدار 1.2 إلى 0.3395 (الانخفاض أفضل)، وهو تحول كبير لما يُعد تاريخيًا أضعف حالة لهذه النماذج.
• تحسين معالجة الجداول، تم دمجها في المكسب الإجمالي لـ ParseBench بدلاً من الإبلاغ عنها كرقم مستقل.
من التفاصيل الجديرة بالملاحظة في التدريب: تشير البطاقة إلى أن الإصدار 2.0 عبارة عن حساء نقاط تفتيش متساوي الأوزان من نقاط تفتيش التدريب الممتدة من الخطوة 58k حتى 66k، وهو أسلوب شائع لإصدار نقطي هادئ — إذ يميل إلى منح متانة إضافية دون الحاجة إلى إعادة تدريب كاملة.
الأرقام التي تبلغ عنها البطاقة
جميع الأرقام التالية مأخوذة من بطاقة نموذج NVIDIA الخاصة، وتُقاس مقابل الإصدار v1.2، ولا يوجد أيٌّ منها قد خضع لتشغيل مستقل من طرف ثالث حتى الآن. تعامل معها باعتبارها بيانات مقدَّمة من البائع ولها طابع استرشادي:
• النتيجة الإجمالية في ParseBench — من 0.5782 على v1.2 إلى 0.6391 على 2.0. ParseBench هو معيار NVIDIA الخاص الذي يغطي دقة النص، والتنسيق الدلالي، والجداول، والرسوم البيانية، والاستناد البصري.
• MOSCAR متعدد اللغات BoC F1 — من 0.4410 إلى 0.9102. هذه أكبر قفزة فردية في البطاقة، وتتوافق مع توسيع المفردات؛ تغطي MOSCAR اللاتينية والعربية والسيريلية والصينية والهانغول واليابانية والهندية والعبرية والتايلاندية واليونانية والمزيد.
• IndicVisionBench الإجمالي ANLS-الحرف — من 0.0612 إلى 0.7203، عبر عشر لغات هندية (البنغالية، الغوجاراتية، الهندية، الكانادا، المالايالامية، الماراثية، الأوديا، البنجابية، التاميلية، التيلجو).
• OmniDocBench Notes: مسافة تحرير النص المكتوب بخط اليد — من 0.9739 إلى 0.3395 (الأقل أفضل).

حجم هذه التغييرات هو ما يجعل هذا الإصدار مهمًا حتى من دون إعلان. قفزة من 0.44→0.91 في مقياس F1 للتعرف الضوئي على الحروف متعدد اللغات ليست إصدارًا ثانويًا بسيطًا؛ بل تبدو كالعمل متعدد اللغات الذي عادةً ما يتصدر إطلاقًا رئيسيًا. ما إذا كانت المكاسب ستستمر تحت تقييم مستقل هو بالضبط السؤال الذي يظل مفتوحًا بسبب غياب التغطية.
ما لا يخبرنا به المستودع
الصدق بشأن الحدود هو جوهر منشور الإطلاق الهادئ. المستودع لا يؤكد:
• ما إذا كان الإصدار 2.0 متاحًا (أو سيكون متاحًا) كخدمة مصغرة NVIDIA NIM — يتم تقديم الإصدار 1.2 عبر واجهة برمجة تطبيقات NIM الخاصة بـ NVIDIA، ولا تعرض بطاقة الإصدار 2.0 أي علامة NIM ولا نقطة نشر، وتذكر صفحة المستودع أن النموذج "غير منشور بواسطة أي مزود استدلال."
• التسعير، إن وُجد — الأوزان لا تحمل رسوم استخدام، لكن الخيار المستضاف لم يتم تسعيره أو الإعلان عنه.
• معايير مستقلة — لا يوجد حتى الآن أي إدخال لـ Artificial Analysis أو LMArena أو OmniDocBench للإصدار 2.0، لذا لا يوجد ما يمكن مقارنة أرقام البائع به.
خارطة الطريق — سواء كان الإصدار 2.0 مرحلة انتقالية أو وجهة نهائية، وما إذا كان هناك إصدار لاحق بنمط 2.1 قادم أم لا، أمر غير معروف.
الشيء الوحيد المؤكد هو الترخيص: النموذج مرخّص بموجب ترخيص NVIDIA Open Model License، الذي يسمح بالاستخدام التجاري وغير التجاري، مع أن مُجزِّئ النصوص (tokenizer) خاضع لترخيص CC-BY-4.0. إذا أردت استخدامه في منتج، فهذا الشرط مستوفى.
تشغيله اليوم
الاستضافة الذاتية هي الخيار الوحيد المتاح حاليًا، وهي تنطوي على بعض العقبات التي يجدر بك معرفتها قبل التخطيط بناءً عليها. يتم تحميل النموذج في Hugging Face Transformers باستخدام trust_remote_code، ويمكن لـ vLLM تشغيله — ولكن فقط مع إصدار vLLM يتضمن دعم الكود البعيد لـ Nemotron Parse. على أجهزة من فئة A100/A10، توصي NVIDIA بفرض خلفية انتباه Triton، وتحتاج إلى أربع تبعيات إضافية: albumentations وtimm وopen_clip_torch وeinops. هناك أيضًا خصوصية "tied-output-head": الإصدار 2.0 يُبقي رأس اللغة (LM head) مرتبطًا بتضمينات وحدة فك الترميز، بينما تُنشئ بعض إصدارات vLLM رأس مخرجات منفصلًا ما لم تُضف تصحيح وقت التشغيل المرفق من NVIDIA إلى PYTHONPATH.
تفصيلان مهمان من النظام البيئي يكملان هذه الصورة. أولًا، طلب سحب (Pull Request) في vLLM مفتوح حاليًا (قيد المراجعة منذ أوائل أغسطس) يتيح فك الترميز التخميني (speculative decoding) لنموذج NVIDIA-Nemotron-Parse-2.0 عبر استخدام رأس التنبؤ المساعد المخزَّن في الملف الجانبي auxiliary_prediction_heads.safetensors.extra الموجود في المستودع — إذ تصف وثائق البطاقة هذا الملف بأنه غير مستخدم في الاستدلال القياسي، لذا فإن طلب السحب هذا هو أول شيء يستهلكه فعليًا. وعلى معالج H100 عبر تعداد ParseBench المكوّن من 1,005 صفحات، يذكر المؤلف مكاسب في متوسط إنتاجية الإخراج بنحو 45% عند مستوى التزامن 1، و41% عند مستوى التزامن 8، و40% عند مستوى التزامن 32 مقارنة بفك الترميز أحادي الرمز — وكل الأرقام من طلب السحب، ولم تُدمج بعد ولم يُتحقق منها بشكل مستقل. ثانيًا، تشير مشكلة في Dynamo إلى مأزق حقيقي في مُرمِّز 2.0: فهو يأتي بملف tokenizer.json متسلسل يحتوي حشوًا مدمجًا يمدّد كل ترميز إلى 9,000 رمز، لذا فإن حزمة خدمة تحمّل المُرمِّز المحشو يمكن أن تضخّم مطالَبًا متعدد الوسائط من ستة رموز فقط إلى 54,000 معرّف رمز. إذا كنت تستضيف النموذج بنفسك، فتأكد من أن مسار الخدمة لديك يعتمد الترميز المباشر بدلًا من تحميل الملف المحشو.

مكانتها في سوق التحليل لعام 2026
يدخل Nemotron Parse 2.0 مجالًا مزدحمًا وسريع الحركة. يشمل الرواد الحاليون في تحليل المستندات مفتوحة المصدر MinerU 2.5-Pro (نموذج 1.2B من Shanghai AI Lab) وPaddleOCR-VL (إصدارا 0.9B و7B)، وكلاهما يسجّل درجات مركّبة في أوائل التسعينيات على لوحة OmniDocBench، بالإضافة إلى GOT-OCR 2.0 من StepFun كخيار خفيف بحجم 580M؛ أما على جانب واجهات البرمجة، فإن Mistral OCR هو العرض التجاري الرئيسي. هناك تحذيران قبل محاولة إدراج 2.0 في هذا الترتيب. الأول هو أن الأرقام غير قابلة للمقارنة: يقدّم Parse 2.0 نتائج ParseBench، وهو اختبار NVIDIA الخاص، بينما درجات المجال هي نتائج OmniDocBench المركّبة — مهام مختلفة، وأوزان مختلفة، ولا يوجد رقم متكافئ مباشر بعد. الثاني هو ألّا تخلط بين NVIDIA-Nemotron-Parse-2.0 ونموذج NVIDIA-Nemotron-OCR-v2 المنفصل، وهو نموذج OCR كثيف على مستوى الكلمات مبني لخطوط معالجة NeMo Curator. Parse 2.0 هو المحلّل المدرك للتخطيط والتصنيف؛ بينما OCR v2 هو مستخرج لكل كلمة على حدة. إنهما أداتان متكاملتان، وليس النموذج نفسه.
بصراحة، ليس طرح "Parse 2.0" هو "التفوق على الجميع في كل معايير التحليل". إنه محلل بحجم 0.9B، برخصة متسامحة، ومراعٍ للتخطيط، تدّعي بطاقته قفزة متعددة اللغات كبيرة جدًا مقارنة بسلفه — وسلالته (الإصدار 1.1 في نوفمبر 2025، و1.2 في فبراير 2026، و2.0 في أغسطس 2026) تُظهر أن NVIDIA تُصدر محللًا جديدًا كل ثلاثة أشهر تقريبًا. بالنسبة للفرق التي توحّدت بالفعل على عائلة Nemotron Parse، فإن 2.0 هو ترقية مباشرة بنفس شكل API وقصة متعددة اللغات أقوى بكثير. أما بالنسبة للجميع الآخرين، فالسؤال هو ما إذا كانت ادعاءات النموذج غير المُعلن تصمد أمام الاختبارات المستقلة.
مكان طبقة التوجيه ضمن خط أنابيب التحليل
نموذج تحليل المستندات عادةً ما يكون مرحلة واحدة في خط أنابيب أطول، والمراحل المحيطة به هي المكان الذي يُبرر فيه التوجيه (routing) وجوده. الشكل الشائع هو: يحوّل Parse 2.0 الصفحة إلى أجزاء منظمة، ثم يقوم نموذج لغوي كبير (LLM) بالتلخيص، أو الإجابة عن الأسئلة، أو استخراج الكيانات، أو تنظيم النتيجة لمخزن في مرحلة لاحقة. مرحلة النموذج اللغوي الكبير هذه هي حيث تغيّر منصة التوجيه المعادلة الاقتصادية. يضع OrcaRouter أكثر من 200 نموذج خلف واجهة برمجة تطبيقات واحدة بسعر القائمة من المزود — بهامش ربح صفر بالمائة، لذا فإن أي خفض لسعر البائع يظهر على جانبنا في اليوم نفسه الذي يُعلن عنه — مع تجاوز تلقائي للفشل إذا تراجع أداء أحد المزودين. عمليًا، هذا يعني أن المحلل يمكن أن يبقى ثابتًا بينما يتم تبديل النموذج الذي يفسر مخرجاته، أو مقارنته، أو توجيهه عبر التجاوز دون عقدٍ إضافي أو تغيير في الكود. إذا كانت مرحلة التحليل هي عنق الزجاجة، فأنت بحاجة إلى نموذج يمكنك ضبطه واستضافته ذاتيًا، وهو ما يوفره لك Parse 2.0؛ وإذا كانت مرحلة التفسير هي التكلفة المتغيرة، فهذه هي المرحلة التي ينبغي أن يديرها جهاز التوجيه. نحن لا نستضيف Parse 2.0 بأنفسنا — فهو نموذج مستضاف ذاتيًا وليس واجهة برمجة تطبيقات — لكن المحلل الذي يغذي نموذجًا لغويًا كبيرًا هو بالضبط الإعداد الذي تكون فيه نقطة نهاية واحدة لطبقة النموذج اللغوي مجدية.

خلاصة القول
NVIDIA-Nemotron-Parse-2.0 هو إصدار حقيقي وكامل وغير مُعلن عنه بتاريخ 3 أغسطس 2026. يُظهر المستودع محللاً واعياً بالتخطيط بحجم 0.9B، وتدعي بطاقته تحقيق مكاسب كبيرة جداً في التعدد اللغوي والتعرف على الكتابة اليدوية مقارنةً بـ v1.2، وهو مُتاح بموجب ترخيص متساهل مع احتكاك حقيقي حول الاستضافة الذاتية. لم يتم التحقق من أي من هذه الأرقام بشكل مستقل بعد، ولا يوجد خيار استضافة أو تسعير. القرار الصحيح يعتمد على درجة تحملك للمخاطر: إذا كنت تقوم بتحليل مستندات متعددة اللغات حالياً وكان المقياس متعدد اللغات هو ما يهمك، فإن التقدم المزعوم من 0.44 إلى 0.91 في MOSCAR كبير بما يكفي لتبرير اختبار في عطلة نهاية الأسبوع على مجموعتك الخاصة — فهذه الفوارق من النوع الذي إما أن يتكرر أو ينهار، والإصدار الصامت هو أرخص طريقة لمعرفة ذلك. إذا كنت بحاجة إلى معيار للاستشهاد به أو واجهة برمجة تطبيقات مدعومة لتراهن على مسار إنتاجي، فانتظر الإعلان الرسمي أو تجربة مستقلة. في هذه الأثناء، هذا ما يبدو عليه الإصدار الصامت، وهو يستحق المتابعة.
الأسئلة الشائعة
هل NVIDIA-Nemotron-Parse-2.0 تسريب أم إصدار رسمي؟
لا ينطبق أيٌّ من الوصفين تمامًا. فالأمر ليس تسريبًا بمعنى أوزانٍ شاردة أو جزئية — فالمستودع (repo) مكتمل البناء، ويتضمّن بطاقة نموذج مفصّلة، وملفات إعدادات، وملف Dockerfile، ومجموعة اختبارات بمخرجات ذهبية (golden outputs)، ونصوصًا برمجية للاستدلال تعمل مع كلٍّ من Transformers وvLLM. لكنه ليس إطلاقًا بالمعنى المعتاد أيضًا: لم تصدر NVIDIA أي إعلان، كما أن تغليف NIM ونقطة النهاية المستضافة اللذين رافقا إصدارات Nemotron Parse السابقة غائبان. الوصف الدقيق هو أن هذا إصدار مكتمل لم تختر الشركة المصنّعة الترويج له بعد — ولهذا فإن الوصف الصادق هنا هو «إصدار صامت» (quiet ship)، ولهذا تظل الأمور التي كان الإعلان ليحسمها في العادة (التسعير، وخارطة الطريق، والتوفّر عبر الاستضافة) أسئلةً مفتوحة.
كيف تُقارن معايير البائع بأرقام OmniDocBench التي يستشهد بها الأشخاص لمحللات أخرى؟
لا، ليس بشكل مباشر. الأرقام الواردة في بطاقة NVIDIA-Nemotron-Parse-2.0 مأخوذة من ParseBench، وهو معيار NVIDIA الخاص الذي يغطي دقة النص، والتنسيق الدلالي، والجداول، والرسوم البيانية، والإسناد البصري، بالإضافة إلى MOSCAR وIndicVisionBench ومجموعة فرعية من اختبارات الكتابة اليدوية في OmniDocBench — بينما الدرجات الرئيسية في السوق (MinerU 2.5-Pro وPaddleOCR-VL وMistral OCR) هي نتائج مركّبة من OmniDocBench. مهام مختلفة، ومقاييس مختلفة، ولا توجد حتى الآن مقارنة مباشرة منشورة بينها. الرقم الوحيد الذي يتداخل مع النظام البيئي — رقم الكتابة اليدوية في قسم Notes ضمن OmniDocBench — يُذكَر كمسافة تحرير نصية مقارنةً بالإصدار v1.2، وليس كدرجة مركّبة، لذلك لا يمكن ترتيبه مقابل المقاييس الأخرى. وإلى أن تُجرى عملية تشغيل مستقلة، تعامل مع ادعاءات Parse 2.0 باعتبارها اتجاهية وغير مؤكدة.
ما الذي يجب أن يختبره الفريق قبل وضعه في مرحلة الإنتاج؟
ثلاثة أشياء. أولاً، مجموعتك اللغوية متعددة اللغات: إن الفكرة الأساسية لإصدار 2.0 هي القفزة متعددة اللغات، والإصدار الهادئ هو بالضبط الحالة التي تظهر فيها المكاسب المزعومة إما أن تتكرر على بياناتك أو لا — قم بتشغيل اللغات التي تتعامل معها فعليًا قبل تصديق البطاقة. ثانيًا، البنية التحتية للاستضافة الذاتية: تأكد من أن إصدار vLLM الخاص بك يدعم الكود البعيد لـ Nemotron Parse، وطبق تصحيح tied-output-head، وتحقق من أن مسار التقديم الخاص بك يقوم بالترميز عبر الإنترنت بدلاً من تحميل tokenizer.json المحشو، والذي يمكن أن يوسع موجهًا قصيرًا إلى 9000 رمز. ثالثًا، قصة الترخيص والخدمة: الأوزان مجانية بموجب ترخيص NVIDIA المفتوح للنماذج، لكن لا توجد خدمة NIM مُعلنة، ولا تسعير، ولا عقد دعم — لذا خطط حول الاستضافة الذاتية، ووجّه مرحلة LLM في المراحل اللاحقة عبر طبقة تتيح لك تبديل النماذج والتحويل التلقائي عند الفشل دون إعادة هندسة، وهذا هو الجزء الذي صُممت منصة التوجيه لأجله.
