
نيموترون-3-لابس-ألترا-ماث-آرإل: إنفيديا تتيح بهدوء الكود المصدري لنقطة تحقق التعلّم المعزّز التي اعتمدتها في مشاركتها بأولمبياد الرياضيات الدولي 2026
- openaiجديدOpenAI: GPT-6 Astra2026-09-0455الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0247الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0247الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0157الذكاء82البرمجة
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2646الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1849الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1541الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1251الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0547الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0347الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2140الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128الذكاء49البرمجة
NVIDIA dropped Nemotron-3-Labs-Ultra-Math-RL on Hugging Face on September 2–3, 2026, with no blog post, no X announcement and no press release — the model card simply appears, dated September 3, and explains itself in one line: it is the reinforcement-learning checkpoint, referred to as "Nemotron-3-Ultra-RL" in NVIDIA's accompanying technical report, that was "deployed as part of an ensemble system that achieved a gold-medal level score at the International Mathematical Olympiad 2026." That system's official score — 30 out of 42 points, above the 29-point gold threshold — was widely reported back in late July, when the base model's weights had been public since June. What was not downloadable then was the pair of post-trained specialists the competition run actually used. One of them is now sitting in a public Hugging Face repo with zero likes and a near-zero download count.
هذه قصة إصدار هادئ، لذا من الجدير أن نكون دقيقين بشأن ما هو قابل للمعرفة وما هو غير ذلك. مما يمكن معرفته من المستودع والتقرير: بنية نقطة التحقق، ووصفة تدريبها، والدور الذي لعبته في تقديم IMO 2026، ومجموعات البيانات والمعايير التي أصدرتها NVIDIA إلى جانبها. ولم يتم تأكيده بعد: أي إعلان من بائع، أو أي معيار مستقل من طرف ثالث لنقطة التحقق هذه، أو أي واجهة برمجة تطبيقات مستضافة — فهذا إصدار أوزان ذاتي الاستضافة بموجب ترخيص OpenMDW-1.1، وتشغيله يعني تجهيز حوالي 1.5 تيرابايت من ذاكرة HBM من فئة Blackwell.
ما الذي تم إصداره فعليًا هذا الأسبوع
تم إنشاء المستودع nvidia/Nemotron-3-Labs-Ultra-Math-RL على Hugging Face في 2 سبتمبر 2026 (19:11 UTC) وتم تعديله آخر مرة في 8 سبتمبر. وهو عنصر واحد في إصدار منسّق مجمّع تحت nvidia/nemotron-labs-imo-2026، والذي يحتوي على:
• نقطتا الفحص المُدرّبتان بعد التدريب للمسابقة — Nemotron-3-Labs-Ultra-Math-RL (هذا الموضوع) والنسخة الشقيقة المضبوطة بدقة تحت الإشراف Nemotron-3-Labs-Ultra-Math-SFT، وكلاهما ضمن OpenMDW-1.1.
مجموعتا التدريب المستخدمتان خلفهما — Nemotron-Math-Proofs-v3-SFT وNemotron-Math-Proofs-v3-RL، وكلاهما بموجب ترخيص CC-BY-4.0.
• Nemotron-IMO-Bench، معيار تقييم جديد يضم 200 مسألة غير منشورة بمستوى الأولمبياد (50 في الجبر، و50 في التوافقيات، و50 في الهندسة، و50 في نظرية الأعداد)، وكل مسألة مقترنة بدليل مرجعي مُنسّق يدويًا، وقد أُنشئ هذا المعيار بالتعاون مع عالم الرياضيات تيتو أندريسكو تحديدًا بحيث لا يمكن أن تظهر المسائل في أي مجموعة تدريب.
• نقطة التحقق الأساسية هي NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16، وتم الضبط الدقيق لجميعها انطلاقًا منه.
يشير وصف المجموعة إلى التقرير الفني الذي يجمعها معًا: "An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics" (ملف PDF في مستودع NeMo-Skills الخاص بـ NVIDIA مؤرّخ في 8 سبتمبر 2026). وإلى جانب نقاط التحقق، أصدرت NVIDIA خط أنابيب الاستدلال، والبراهين المقدَّمة، ووصفة التدريب بتعلّم التعزيز (RL)، وحسابًا كاملًا للموارد الحاسوبية لتشغيل المنافسة. التأطير هنا علمٌ قابلٌ للتكرار بشكل صريح: إنها NVIDIA تقول، إليك كل ما يلزم لإعادة بناء النظام.
ما هو Nemotron-3-Labs-Ultra-Math-RL؟
من الناحية المعمارية، ليس هذا نموذجًا أساسيًا جديدًا — بل هو ضبط دقيق للنموذج المتاح عمومًاNVIDIA-Nemotron-3-Ultra-550B-A55B-BF16، وهو الإصدار الهجين Mamba2–Transformer من نوع Latent Mixture-of-Experts الذي أصدرته NVIDIA لأول مرة في 4 يونيو 2026. يحافظ إصدار Math-RL على هذه البنية والمقياس: 550 مليار معلمة إجمالية مع 55 مليارًا نشطة، وتنبؤ متعدد الرموز، ودعم نوافذ سياق يصل إلى مليون رمز. ما يغيّره تدريب التعلم المعزز هو التخصص، وهو تخصص ضيّق بشكل متعمد:
• الهدف — حل مسائل رياضيات المنافسات الصعبة والعمل كحَكَم على البراهين: يُدرَّب النموذج على إنتاج حلٍّ دقيق، وتقييم نفسه وفق مقياس 0 / 0.5 / 1، وتحديد الأخطاء في البراهين.
إنه ليس روبوت محادثة عامًا — فالبطاقة والتقرير يصفان عاملًا متخصصًا لخط أنابيب البحث عن البراهين، وليس مساعدًا يتبع التعليمات.
• الترخيص — OpenMDW-1.1، ترخيص النموذج المفتوح المتساهل من NVIDIA والذي يسمح بالاستخدام التجاري وغير التجاري، وهو نفسه المعتمد للإصدار الأساسي وإصدارات معلمي Nemotron Labs السابقة.
• النشر — لا توجد قائمة أسعار للاستضافة في أي مكان؛ حيث تقوم بتنزيل ملفات safetensors وتستضيفها بنفسك. الإعداد المرجعي من NVIDIA هو عقدة واحدة من 8× B200 (حوالي 1.5 تيرابايت من HBM الإجمالي)، مع خيارات متعددة العقد عبر H100/H200/GB200/GB300. بيئة التشغيل الموصى بها هي vLLM، مع محلل للتفكير، ومحلل استدعاء الأدوات Qwen3-Coder، وإعدادات ذاكرة التخزين المؤقت Mamba SSM، وفك التشفير التخميني MTP على 5 رموز، وكل ذلك مذكور في البطاقة.

لماذا تهم هذه النقطة: كانت داخل نظام IMO 2026
نتيجة أولمبياد الرياضيات الدولي 2026 هي السبب الذي يجعل أي شخص ينظر إلى هذا النموذج، لذا فإن التمييز المهم هو: 30/42 هي درجة النظام، وليست درجة نموذج واحد. كانت مشاركة NVIDIA خط أنابيب من مرحلتين مع نقاط تفتيش متعددة، وكان Nemotron-3-Labs-Ultra-Math-RL مكوّنًا يقوم بوظيفتين.
وفقًا للتقرير، أجرت المرحلة الأولى بحثًا تكراريًا للجيل والتحقق والتحسين لمدة تصل إلى ثماني جولات لكل مشكلة. في الجولة الأولى، تم أخذ عينات من 384 محاولة إثبات — 16 محاولة من كل من ثمانية مطالبات مختلفة لاستراتيجية الحل، ومن كل نقطة من النقاط المرجعية الثلاث: نموذج التوفر العام، المتخصص SFT، والمتخصص RL. استخدم التحقق في وقت البحث نقطتي التحقق RL وSFT كفريق من نموذجين: ثمانية أحكام مستقلة من كل منهما، ولم يتم قبول الإثبات إلا إذا سجلت جميع الأحكام الستة عشر درجة 1. أُعيدت في مرحلة لاحقة عالية الحوسبة تقييم كل مرشح نهائي باستخدام جميع النقاط المرجعية الثلاث (16 حكمًا بأسلوب IMO لكل منها، على مقياس من 0 إلى 7) واختير تقديم واحد لكل مشكلة.
النتيجة الرسمية، كما وردت في الورقة البحثية ومطابقةً لما نُشر في أواخر يوليو: 30 نقطة من أصل 42 في ورقة أولمبياد الرياضيات الدولي 2026، أي أعلى من حدّ الميدالية الذهبية البالغ 29 نقطة، مع حصول على علامات كاملة في المسائل 1 و2 و4 و5 ونقطة واحدة في كلٍّ من المسألتين 3 و6، وقد تم التقييم من قبل مصحّحين رسميين للأولمبياد. ويشير حساب الموارد الخاص بشركة NVIDIA إلى أن جميع البراهين الستة المُقدَّمة وُجدت في حدود 707 مليون رمز مولّد و1,464 ساعة حوسبة على معالجات GB200 GPU؛ واستكمال الجولات قيد التنفيذ رفع التشغيل الكامل إلى حوالي 2.31 مليار رمز و4,800 ساعة حوسبة على معالجات GB200 GPU.
رقمان داخليان من التقرير يعطيان فكرة عن سبب استحقاق نقطة تحقق RL مكانها في التجميع. على مجموعة التطوير المكوّنة من 30 مسألة من NVIDIA، والتي قيّمتها لجنة تحكيم مستقلة تضم GPT-5.5 وGemini 3.1 Pro وClaude Opus 4.8 باتباع إجراء على غرار MathArena، كان المتخصص RL أفضل خط أنابيب بنقطة تحقق واحدة من البداية إلى النهاية (180 من أصل 210 نقاط تحكيم، مقابل 165 للمتخصص SFT و162 للنموذج الأساسي)، رغم أن نقطة تحقق SFT حلّت مسائل أكثر في الجولة الأولى. وعلى مجموعة تدقيق من 300 إثبات، خفّض فريق التحقق المنتشر RL+SFT معدل القبول الزائف — وهو الخطأ الذي ينهي البحث عند إثبات غير صالح — إلى حوالي 1.1%، مقابل 12.4% عند تحكيم نقطة تحقق RL وحدها و31.6% للنموذج الأساسي. والمغزى من التقرير هو أن المتخصصين الانتقائيين يلتقط كل منهما أخطاء الآخر في ظل قاعدة الإجماع.
هذه هي تجارب الإزالة التي أجرتها NVIDIA على مجموعة التطوير الخاصة بها، كما وردت في ورقة NVIDIA، وتستحق أن يُتعامل معها بوصفها دليلًا مقدّمًا من المورّد علىسبب نجاح التصميم، لا بوصفها درجاتٍ مستقلة. ومجموعة التطوير نفسها لا تضم سوى 30 مسألة، ولم يقم أي مختبر خارجي بتشغيل هذا النموذج بعد.
وصفة RL باختصار
بيانات التدريب والمنهجية مفتوحة بالكامل، وهو الخبر الفعلي لأي شخص يبحث في أبحاث التعلم المعزز للاستدلال الرياضي. أبرز النقاط من التقرير:
• البيانات — تُستمد المشكلات من مجموعة AoPS الفرعية من Nemotron-Math-Proofs-v1، بعد فلترتها إلى تلك التي يحلها نموذج Ultra الأساسي في محاولة إلى ثلاث من أصل أربع محاولات (بحسب تقييم DeepSeek-V3.2-Speciale) — وهي مشكلات منهجية صعبة لكنها قابلة للحل. وينتج عن هذا الفلتر 9,597 موجهًا لتوليد البراهين، صدرت تحت اسم Nemotron-Math-Proofs-v3-RL.
• المكافأة — تتبع تصميم DeepSeekMath-V2 لكنها تُسقط حدّ المكافأة المرتبط بالتحليل الذاتي؛ إشارة الحُكم تأتي من خدمة تقييم البراهين أثناء التدريب.
خوارزمية — تعلم معزز غير متزامن مبني على NeMo-RL، مشابه في جوهره لـ PipelineRL: مجموعة ثابتة من المطالبات تظل قيد التنفيذ، وتُغذى التسلسلات المكتملة إلى المُدرِّب عندما تمتلئ الدفعات، وأخذ عينات أهمية مقتطعة، وتقنيع الرموز منخفضة الاحتمال في العينات الإيجابية عندما يرتفع الانتروبيا. استخدم الإعداد سياقًا من 131,072 توكنًا وما يقارب 128 عقدة تدريب، و128 عقدة استدلال، و16 عقدة تحكيم، تتألف كل منها من 4× GB200.
على النقيض من ذلك، كان checkpoint SFT الشقيق عبارة عن ضبط دقيق خاضع للإشراف طويل السياق انطلاقًا من نفس القاعدة الأساسية، وذلك على مجموعة بيانات مُرشّحة الجودة تضم 414,890 مسارًا للإثبات والتحسين والتحقق والتحقق الفوقي، تغطي 15,818 مسألة، وقد أُجري على 512 من وحدات معالجة الرسوم GB200.

ما الذي لم يُعرف بعد؟
المصدرية الصادقة تنطبق على الجانبين هنا، وعلى القارئ الذي يقرر ما إذا كان يهتم بهذا الإصدار أن يأخذ بعين الاعتبار أربعة تحفظات:
• لا يوجد إعلان. حتى وقت كتابة هذا المقال، لم تعلن NVIDIA رسميًا عن المجموعة؛ فقد ظهرت على Hugging Face. التقرير الفني بصيغة PDF مؤرَّخ بتاريخ 8 سبتمبر، لذا تُنشر الوصفة المكتوبة فعليًا هذا الأسبوع أيضًا.
• لا توجد معايير قياس مستقلة.كل رقم أداء مرتبط بنقطة التحقق هذه — تجارب الاستئصال على مجموعة التطوير، ومراجعة المدقق، ونتيجة نظام IMO 2026 — تنبع من تقرير NVIDIA الخاص. أما نتيجة IMO نفسها فهي الأكثر موثوقية ضمن هذه المجموعة لأنها خضعت للتقييم في ظل ظروف رسمية للمسابقة، لكنها نتيجة على مستوى النظام، ولم يقم أي مختبر خارجي بإعادة إنتاج مساهمة نقطة التحقق في هذه النتيجة.
• لا توجد واجهة برمجة تطبيقات مستضافة، ولا سعر معلن. هذا إصدار مستضاف ذاتيًا. أي شخص يريد أن يستدعيها يحتاج إلى العتاد. إن التغطية الصادرة في يوليو والتي تقول "حقّق NVIDIA Nemotron 3 Ultra الذهبية في IMO 2026" يمكن بسهولة أن تُقرأ خطأً على أنها تعني "نزّل هذا وسيحل مسائل الأولمبياد" — أما النسخة الصادقة فهي "نزّل مكونات النظام الذي فعل ذلك."
• التأطير الذهبي. لغة NVIDIA نفسها هي "الوصول إلى عتبة الميدالية الذهبية"، والورقة حريصة على أن النموذج كان جزءًا من مجموعة نماذج. تعامل مع أي ادعاء بأن نقطة التحقق الوحيدة هذه بمفردها "بمستوى الميدالية الذهبية" على أنه غير مدعوم.
لمن هذا؟
هذا الإصدار موجَّه إلى قارئ محدَّد: مختبر أو باحث يعمل على الاستدلال الرياضي، أو توليد البراهين، أو التعلّم المعزَّز بمكافآت قابلة للتحقّق، ويريد تنفيذًا مرجعيًا لنظام تجاوز عتبة الميدالية الذهبية في الأولمبياد باللغة الطبيعية — دون مُثبِت رسمي، ودون أدوات، ودون إنترنت. بالنسبة إلى ذلك القارئ، تكمن القيمة في الحزمة الكاملة: الأوزان، ومجموعات بيانات SFT وRL، والمطالَبات المنسَّقة بصيغة NeMo-Gym، وخط أنابيب الاستدلال، والبراهين المُقدَّمة، وحساب الموارد الحاسوبية الذي يوضِّح ما تكلِّفه الجولة التنافسية فعليًا من ساعات GPU.
بالنسبة للبقية، الملاحظة العملية هي أن البحث البرهاني بمستوى الأولمبياد مبالغ فيه لمعظم أعباء العمل الرياضي الحقيقية. {{1}}مسائل مستوى AIME والمسابقات، وكل الأعمال الرياضية التطبيقية المدمجة في الكود تقريبًا، تُعالَج بشكل مريح بواسطة نماذج أصغر بكثير{{/1}} — {{2}}وهذا مهم لأن checkpoint بحجم 550B ليس شيئًا تشغّله لمهمة دفعة واحدة{{/2}}. {{3}}النماذج الرياضية المفتوحة الأصغر ونماذج الواجهات البرمجية (API) الحدودية يمكن الوصول إليها عبر واجهة برمجية واحدة على OrcaRouter بأسعار المزودين الرسمية (بدون أي هامش ربح من جانبنا، لذا فإن أي تخفيض من المزود يظهر مباشرة في نفس اليوم)، مع تجاوز تلقائي للأعطال إذا أردت تجربة نموذج غير مثبت دون المخاطرة بمسار إنتاجي عليه{{/3}}. ابدأ من هناك؛ وتوجّه إلى استضافة ذاتية لنموذج 550B فقط عندما يتطلب عبء العمل فعلًا بحثًا برهانيًا على نطاق حدودي.
السؤال المفتوح الذي تجب مراقبته هو ما إذا كان هذا الإصدار الهادئ سيحظى بإعلان رسمي وملاحظات إصدار رسمية، وما إذا كان أي شخص خارج NVIDIA سيشغّل الوصفة من طرف إلى آخر ويُبلِغ عن نتيجة مستقلة على معيار IMO-Bench. فهذا المعيار — 200 مسألة أولمبية جديدة غير منشورة — هو على الأرجح العنصر الأكثر فائدة في المجموعة: إنه بالضبط نوع التقييم المقاوم للتلوث الذي كان المجال يفتقر إليه. وإذا أمكن تكرار الوصفة بنجاح، فسيتبيّن أن الرفع الصامت إلى Hugging Face هذا الأسبوع هو أحد أكثر إصدارات النماذج المفتوحة تأثيرًا في العام. وإن لم يحدث ذلك، فستظل المجموعة سردًا مفصّلًا وصادقًا لما تطلّبه فعليًا تشغيلٌ واحد على مستوى النماذج الحدودية لمخطط التوليد–التحقق–التنقيح.

مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
