
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: معلّم الاستدلال ذو الـ550 مليار معلمة خلف Nemotron 3 Ultra أصبح للتو مفتوح الأوزان
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
في 14 أغسطس 2026، نشرت NVIDIA نموذج NVIDIA-Nemotron-Labs-Teacher-General-Reasoning على Hugging Face — وهو نموذج استدلال بمعاملات 550B، وحتى الأمس، كان موجودًا فقط داخل خط أنابيب التدريب لنموذجها الرئيسي Nemotron 3 Ultra. إنه المعلم المخصص لـ"الاستدلال العام" من وصفة التقطير متعدد المعلمين في السياسة (MOPD) التي استخدمتها NVIDIA لتدريب طالب Ultra 550B-A55B، ويعد هذا الإصدار مهمًا لسبب بسيط: في التقرير الفني لـ Nemotron 3 Ultra الذي نشرته NVIDIA في يونيو، ذكرت وصفة التدريب صراحةً أن نقاط التفتيش الخاصة بكل معلم لن يتم توفيرها كمصدر مفتوح. أما هذا الآن فهو متاح — بما في ذلك الأوزان، ومحلل الرموز، وقالب الدردشة، وإعدادات الخدمة — بموجب رخصة OpenMDW-1.1 الملائمة تجاريًا. كما تم إصدار نموذج مماثل، NVIDIA-Nemotron-Labs-Teacher-STEM، في نفس اليوم، وهو ما يبدو أقل كونه إصدارًا لمرة واحدة وأكثر كأنه بداية كشف النقاب عن لوحة المعلمين.
ما هو نموذج المعلم في الواقع
MOPD هي تقنية ما بعد التدريب التي تمنح Nemotron 3 Ultra قدرتها على الاستدلال الوكيل (agentic reasoning). بدلاً من تقطير معلم كبير واحد إلى طالب، درّبت NVIDIA أكثر من عشرة معلمين متخصصين في المجالات — للاستدلال، والبحث، والتحليل القانوني، وهندسة البرمجيات، واستخدام الأدوات، ومجالات أخرى — ثم تركت الطالب يولد مخرجاته (rollouts) الخاصة، واستخدمت كل معلم لتقييم تلك المخرجات في مجال خبرته. ولأن التقييم يتم على مخرجات الطالب الفعلية (on-policy) بدلاً من مجموعة بيانات ثابتة دون اتصال (offline dataset)، تبقى إشارة التدريب متوافقة مع ما ينتجه الطالب فعلياً في وقت الاستدلال. تسمي NVIDIA هذه الحلقة بالتطور المشترك (co-evolution): إذ تتم تهيئة جولات المعلم الجديدة من نقاط تفتيش (checkpoints) الطالب المحدَّثة، بحيث يتحسّن الطرفان باستمرار.
نقطة التحقق هذه هي عضو الاستدلال العام في تلك المجموعة. وهي مُنتَجة من نموذج الطالب Nemotron 3 Ultra الذي خضع للتدريب اللاحق عبر جولة إضافية من SFT المكثف في الاستدلال والتعلم المعزز، وتصفه بطاقة النموذج بأنه مُحسَّن لإنتاج مسارات استدلال طويلة وعالية الجودة في أصعب المسائل متعددة الخطوات في الرياضيات والمنطق والاستدلال المجرد — بما في ذلك البراهين الرسمية والبرمجة التنافسية. وداخل MOPD، يؤدي عدة أدوار في آنٍ واحد — نقطة تحقق واحدة، أدوار متعددة: توليد مسارات الاستدلال، والتحكيم في الرياضيات، وحَكَم التكافؤ الذي يقيّم الإجابات القصيرة الحرة الصياغة بالمقارنة مع إجابة مرجعية. كما تُصدره NVIDIA كنموذج مستقل لأنه مُستدل قوي بحد ذاته — صُمم لتوليد مسارات استدلال طويلة المدى، وحل المسائل الصعبة، والعمل كمعلم أو مصحح داخل خط أنابيب التقطير الخاص بك.
المواصفات في مسار واحد
• المعلمات — 550 مليار إجمالي / 55 مليار نشط، LatentMoE المتفرق
• البنية — هجين Mamba2-Transformer مع خليط خبراء كامن وتنبؤ متعدد الرموز (MTP)
نافذة السياق — حتى مليون رمز؛ الافتراضي 256 ألف رمز في إعدادات الخدمة المرجعية
• اللغات — 10: الإنجليزية، الفرنسية، الإسبانية، الإيطالية، الألمانية، اليابانية، الهندية، الكورية، البرتغالية البرازيلية، الصينية
• الترخيص — OpenMDW-1.1، يُسمح بالاستخدام التجاري وغير التجاري
• الحد الأدنى من العتاد — 4×B200 (أوزان NVFP4)؛ كما يتم دعم GB200/GB300 وفئة H100
البنية المعمارية هي نفس عائلة Nemotron 3 Ultra نفسها: شكل 550B-A55B مع طبقات Mamba-2 وMoE متداخلة، وطبقات انتباه مختارة، ورؤوس MTP لفك الترميز التخميني الأصلي. المعلم ليس طالبًا أصغر حجمًا — بل هو نسخة مُدرَّبة بشكل مختلف من نفس البنية، متخصصة في الاستدلال بعيد المدى بدلاً من الأعمال الوكيلة العامة.

لماذا يهمّ جعل المعلّم مفتوح المصدر
نقاط تفتيش المعلّمين هي أندر أنواع إصدار النماذج المفتوحة. تنشر الشركات الطلاب — النماذج التي تنشرونها — ومجموعات البيانات طوال الوقت؛ لكنها لا تنشر أبدًا تقريبًا النماذج التي صحّحت أعمال الطلاب. لهذا السبب، فُهم السطر الوارد في تقرير يونيو بأن نقاط تفتيش كل معلّم لن تُنشر على أنه إغلاق الباب أمام إعادة إنتاج خط أنابيب MOPD من البداية إلى النهاية. هذا الإصدار يفتح ذلك الباب، على الأقل بالنسبة لمعلّم الاستدلال.
بالنسبة للفرق التي تبني نماذج التفكير الخاصة بها، فهذه قيمة ملموسة. إشارة المكافأة التي شكّلت تفكير نموذج Nemotron 3 Ultra كُتبت جزئيًا بواسطة نقطة التفتيش هذه، والآن يمكن دراستها مباشرة، أو استخدامها كحَكَم، أو لتوليد مسارات تفكير طويلة المدى لبيانات SFT. وبدمجها مع بيانات ما بعد التدريب المفتوحة بالفعل (nvidia/nemotron-post-training-v3) ووصفات التدريب المنشورة، فإنها تضيّق الفجوة بين "درّبت NVIDIA نموذجًا رائعًا" و"يمكننا تدريب نموذج مماثل له".

قرص التفكير
من أبرز ما يُورث من عائلة Nemotron 3 أن التفكير بمثابة مفتاح تشغيل، لا إعداد افتراضي. قالب الدردشة يقبل enable_thinking=true/false، وخيار medium_effort، وسقفًا من الرموز reasoning_budget، لذا يمكن للمتصل فرض تفكير عميق طويل المدى عندما تتطلب المسألة ذلك، والحصول على إجابات مباشرة — أسرع وأقل تكلفة — عندما لا تتطلبه. وبالنسبة لنموذج المعلم، فإن هذا الأمر أهم مما يبدو: فعمليات التقطير تحتاج إلى تمريرات تقييم رخيصة للعينات السهلة، وآثار تفكير مكلفة للعينات الصعبة، ونقطة تفتيش واحدة تدعم الوضعين معًا تزيل الحاجة إلى تبديل النماذج في منتصف خط المعالجة.
تشغيله
هذا ليس نموذجًا ستستدعيه بشكل عابر. الحد الأدنى المعقول لإعداد الخدمة هو 4×B200 مع أوزان NVFP4 وذاكرة تخزين مؤقت لـ KV بصيغة fp8؛ كما تغطي الإعدادات المرجعية الصناديق متعددة العقد GB200/GB300 وفئة H100. تنشر NVIDIA أدلة طهي لثلاثة محركات: vLLM (0.22) وSGLang (0.5.13) وTensorRT-LLM (1.3.0rc17) — جميعها تعرض واجهة برمجة تطبيقات متوافقة مع OpenAI على المنفذ 8000، مع فك تشفير تخميني MTP أو EAGLE وخلفية Mamba من flashinfer. يتطلب سياق 1M-token علامة السماح الصريحة في كل محرك (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 وما يعادلها)؛ الحد الأقصى الافتراضي هو 256K.
حتى وقت كتابة هذا النص، لم يُنشر النموذج من قبل أي مزود استدلال على Hugging Face ولم تعلن NVIDIA عن استضافة NIM — وهذا إصدار للأوزان فقط. وهذا يجعله نموذجًا للمختبرات التي تدير بالفعل أساطيل كبيرة من وحدات GPU، أو للفرق التي تحتاج خطوط التقطير لديها تحديدًا إلى إشارة المعلم الدقيقة. وعندما يُتاح عبر واجهة برمجة تطبيقات مُدارة، تكون حسابات التسعير بسيطة: هذا نموذج MoE نشط بحجم 55 مليار معامل، ومن يستضيفه يفرض تكلفة وحدات GPU. وعلى طبقة توجيه تعمل بهامش ربح 0%، تدفع السعر المعلن من المزود دون أي رسوم منصة إضافية — ونفس المفتاح الذي يصل إلى هذا النموذج يصل إلى النماذج الحدودية التي تقارن مخرجاته بمخرجاتها، مع تجاوز تلقائي للفشل إذا تعطل مضيف. هذا هو الجزء الذي صُممت من أجله أداة توجيه مثل OrcaRouter؛ أما المعلم نفسه فهو الجزء الذي تستضيفه ذاتيًا.
التحفظات الصادقة
هذه نقطة تحقق عمرها 24 ساعة، وبطاقة النموذج لا تتضمن أي أرقام معايير. هذا ليس إغفالًا في هذه الوثيقة — بل هو حالة الإصدار. نشرت NVIDIA تفاصيل البنية والتدريب لكن بدون جدول تقييم، ولم يتسنَّ لأي مختبر مستقل الوقت الكافي لتشغيله بعد. أقرب نقطة مرجعية هي أرقام الطالب المقدمة من البائع: يسجّل Nemotron 3 Ultra 71.9 على SWE-Bench Verified، و86.8 على MMLU-Pro، و89.0 على LiveCodeBench v6، وحوالي 95 على RULER بسياق 1M. تصف هذه الأرقام الطالب Ultra، وليس هذا المعلم، وهي أرقام NVIDIA الخاصة. يجب على أي شخص يخطط لتشغيل تقطير على نقطة التحقق هذه أن يتعامل مع جودة استدلالها باعتبارها غير مُتحقَّق منها حتى تظهر نتائج مستقلة.
ثمة تحفظان إضافيان مدمجان في البطاقة. مجموعة بيانات ما بعد التدريب مرجّحة بشكل كبير نحو الإنجليزية — نحو 8.6 ملايين عينة إنجليزية مقابل ما يقارب 138,000 عينة لكل لغة من اللغات التسع الأخرى — لذا لا ينبغي افتراض جودة الاستدلال متعدد اللغات من وسم اللغات العشر. كما تنبّه البطاقة نفسها إلى انحراف التمثيل في بيانات التدريب الأساسية وتوصي بإجراء تدقيقات للتحيّز قبل الاستخدام النهائي.
من يجب أن يهتمّ؟
ثلاث مجموعات تحصل على قيمة حقيقية هنا. أخيرًا، أمام باحثي التقطير معلم MOPD فعلي لتشريحه، وليس مجرد وصفة تصفه. والمختبرات التي تُدرّب نماذج الاستدلال الخاصة بها تحصل على مولّد مسارات طويلة المدى وحَكَمًا انطلقا من نفس سلالة ما بعد التدريب التي ينتمي إليها النموذج الذي يحاولون مجاراته. ومن يدير تعلمًا معززًا على السياسة يمكنه استخدامه بالطريقة التي استخدمتها NVIDIA به — كمسجّل لأصعب المسائل، مع تفعيل التفكير فقط حيث يستحق تكلفته.
إذا لم تكن ضمن أيٍّ من تلك المجموعات، فإن هذا الإصدار لا يغيّر الكثير بالنسبة لك اليوم: النموذج كبير وغير مُثبت ومخصص للاستضافة الذاتية فقط، وأسرع طريقة للتعامل مع الاتجاه الأساسي — ظهور المزيد من معلمي الاستدلال المفتوحين — هي إبقاء طبقة النموذج في خط الأنابيب الخاص بك قابلة للتبديل خلف واجهة واحدة بدلاً من ربطها بأي نقطة تحقق مفردة.

ماذا تشاهد بعد ذلك
ثلاثة أمور ستُظهر ما إذا كان هذا حادثًا منفردًا أم بدايةً لانطلاق المجموعة. أولًا: ما إذا كان المعلمون المتخصصون الآخرون سيتبعون المسار نفسه — فقد ظهر بالفعل NVIDIA-Nemotron-Labs-Teacher-STEM في اليوم نفسه، لذا السؤال هو: أيُّ المتخصصين في المجالات سيأتون لاحقًا، وهل سيتم وزنهم بالطريقة نفسها. ثانيًا: ما إذا كانت NVIDIA NIM أو مضيف مُدار ستبدأ في تقديمها، وهو ما سيحوّل إصدارًا مخبريًا حصريًا إلى شيء يمكن لبقية الصناعة الاستفادة منه فعليًا. ثالثًا: ما إذا كانت المعايير المستقلة ستظهر — فإدراجٌ على Artificial Analysis أو تشغيلٌ على LMArena سيكون أول فحص حقيقي لمعرفة ما إذا كانت جودة تفكير المعلم تتطابق مع الطالب الذي درّبه.
