כרטיס כותרת ראשי לכתבה 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning' המציג את הכותרת 'המורה להיסק של 550B מאחורי Nemotron 3 Ultra הוא עכשיו במשקלים פתוחים', עם אייקון תיבה למשקלים פתוחים, גליף שבב GPU, תגיות מנוע vLLM / SGLang / TensorRT-LLM, תג תאריך 'שוחרר ב-14 באוגוסט 2026', ולוגו OrcaRouter המשולב בפינה הימנית התחתונה.
Engineering & Research

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: מורת ההיגיון עם 550B הפרמטרים שמאחורי Nemotron 3 Ultra הפכה זה עתה למודל עם משקלים פתוחים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-14 באוגוסט 2026, NVIDIA פרסמה את NVIDIA-Nemotron-Labs-Teacher-General-Reasoning ב-Hugging Face — מודל חשיבה עם 550 מיליארד פרמטרים שעד אתמול התקיים רק בתוך צינור ההדרכה של דגל הסדרה Nemotron 3 Ultra. זהו המודל המורה ל"חשיבה כללית" ממתכון ה-Multi-Teacher On-Policy Distillation (MOPD) שבו השתמשה NVIDIA כדי לאמן את תלמיד ה-550B-A55B Ultra, והפרסום חשוב מסיבה פשוטה: בדו"ח הטכני של Nemotron 3 Ultra שפרסמה NVIDIA ביוני, נכתב במפורש שמחסומי הצ'קפוינטים לכל מורה לא יהיו בקוד פתוח. כעת זה כן — כולל משקולות, טוקנייזר, תבנית צ'אט ותצורות שרת, תחת רישיון OpenMDW-1.1 הידידותי לשימוש מסחרי. מודל אח, NVIDIA-Nemotron-Labs-Teacher-STEM, שוחרר באותו יום, מה שנראה פחות כמו מהלך חד-פעמי ויותר כמו תחילת יציאתם של פאנל המורים.

מה זה בעצם מודל מורה

MOPD היא טכניקת הפוסט-אימון שמעניקה ל-Nemotron 3 Ultra את החשיבה הסוכנתית שלו. במקום לזקק מורה גדול יחיד לתוך תלמיד, NVIDIA אימנה יותר מעשרה מורים שהתמחו בתחומים — לחשיבה, מחקר, ניתוח משפטי, הנדסת תוכנה, שימוש בכלים, ותחומים נוספים — ואז אפשרה לתלמיד לייצר רולאאוטים משל עצמו, והשתמשה בכל מורה כדי לדרג את הרולאאוטים הללו בתחום המומחיות שלו. מכיוון שהדירוג נעשה על פלטי ה-on-policy של התלמיד עצמו, ולא על מאגר נתונים קבוע, אות האימון נשאר מיושר עם מה שהתלמיד בפועל מייצר בזמן ההסקה. NVIDIA מכנה את הלולאה "אבולוציה משותפת": סבבי מורים חדשים מאותחלים מנקודות הביקורת של התלמיד המעודכן, כך ששני הצדדים ממשיכים להשתפר.

נקודת ביקורת זו היא החבר בעל ההיגיון הכללי של אותו פאנל. היא נוצרת מהסטודנט שעבר אימון פוסט-טריין, Nemotron 3 Ultra, באמצעות סבב נוסף של SFT ולמידת חיזוק הממוקדים בחשיבה, וכרטיס המודל מתאר אותה כמותאמת לרצפי חשיבה ארוכים ואיכותיים על הבעיות הרב-שלביות הקשות ביותר במתמטיקה, לוגיקה וחשיבה מופשטת — כולל הוכחות פורמליות וקידוד תחרותי. בתוך MOPD היא ממלאת כמה תפקידים בבת אחת, נקודת ביקורת אחת, תפקידים רבים: יצירת רצפי חשיבה, שיפוט מתמטי, ושופט השקילות שמעריך תשובות קצרות וחופשיות מול תשובת ייחוס. NVIDIA גם משווקת אותה כמוצר עצמאי, כי היא מסיקה חזקה בזכות עצמה — המיועדת ליצירת רצפי חשיבה ארוכי טווח, פתרון בעיות קשות, ושימוש כמורה או כשופט בתוך צינור הזיקוק שלך.

המפרטים במעבר אחד

• פרמטרים — 550B סך הכול / 55B פעילים, LatentMoE דליל

• ארכיטקטורה — היבריד Mamba2-Transformer עם תערובת מומחים סמויה וחיזוי רב-טוקנים (MTP)

• חלון הקשר — עד 1M טוקנים; ברירת מחדל של 256K בתצורות הייחוס

• שפות — 10: אנגלית, צרפתית, ספרדית, איטלקית, גרמנית, יפנית, הינדי, קוריאנית, פורטוגזית ברזילאית, סינית

• רישיון — OpenMDW-1.1, שימוש מסחרי ולא מסחרי מותר

• חומרה מינימלית — 4×B200 (משקלי NVFP4); GB200/GB300 ו-H100-class נתמכים גם כן

הארכיטקטורה היא מאותה משפחה כמו Nemotron 3 Ultra עצמו: מבנה ה-550B-A55B עם שכבות Mamba-2 ו-MoE משולבות, שכבות קשב נבחרות, וראשי MTP לפענוח ספקולטיבי מובנה. המורה אינו תלמיד קטן יותר — הוא גרסה בעלת אימון שונה של אותו מחסן טכנולוגי, המתמחה בחשיבה ארוכת טווח במקום בעבודה סוכנותית כללית.

A single-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning listing 550B total / 55B active parameters, LatentMoE Mamba2-Transformer hybrid + MTP architecture, up to 1M token context, 10 languages, OpenMDW-1.1 commercial license, and vLLM / SGLang / TensorRT-LLM serving, with a footer noting the specs are per NVIDIA's model card and no independent benchmarks exist yet, and the OrcaRouter logo composited in the corner.

למה חשוב לשחרר מורה כקוד פתוח

צ'קפוינטים של מורים הם הסוג הנדיר ביותר של שחרור מודל פתוח. חברות מפרסמות תלמידים — המודלים שאתה פורס — ומערכי נתונים כל הזמן; הן כמעט אף פעם לא מפרסמות את המודלים שהעריכו את עבודת התלמידים. זו הסיבה שהשורה בדו"ח מיוני, לפיה צ'קפוינטים לכל מורה לא ישוחררו, פורשה כסגירת הדלת לשחזור הצינור של MOPD מקצה לקצה. השחרור הזה פותח סדק בדלת, לפחות לגבי מורה ההיגיון.

עבור צוותים שבונים מודלי חשיבה משלהם, זהו ערך קונקרטי. אות התגמול שעיצב את יכולות החשיבה של Nemotron 3 Ultra נכתב בחלקו על ידי נקודת הביקורת הזו, וכעת ניתן לחקור אותה ישירות, להריץ אותה כשופט, או להשתמש בה ליצירת עקבות חשיבה ארוכות-טווח עבור נתוני SFT. בשילוב עם נתוני האימון-המאוחר שכבר פתוחים (nvidia/nemotron-post-training-v3) ומתכוני האימון שפורסמו, זה מצמצם את הפער בין "NVIDIA אימנה מודל מצוין" לבין "אנחנו יכולים לאמן אחד כזה."

A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card summary: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP architecture, up to 1M token context, minimum GPU requirements, supported languages, the openmdw-1.1 license tag, and the files and versions listing.

החוגה החושבת

תכונה ייחודית אחת עוברת ממשפחת Nemotron 3: החשיבה היא מתג, לא ברירת מחדל. תבנית הצ'אט מקבלת enable_thinking=true/false, אפשרות medium_effort, ותקרת אסימונים של reasoning_budget, כך שמתקשר יכול לאלץ חשיבה עמוקה לטווח ארוך כאשר בעיה דורשת זאת, ולקבל תשובות ישירות — מהר יותר וזול יותר — כאשר היא לא דורשת. עבור מודל מורה זה חשוב יותר ממה שנראה: ריצות distillation רוצות מעברי הערכה זולים על דוגמאות קלות ועקבות חשיבה יקרות על קשות, ונקודת checkpoint אחת שתומכת בשני המצבים מסירה את הצורך להחליף מודלים באמצע הצנרת.

מריץ את זה

זה לא מודל שקוראים לו סתם כך. ההגדרה המינימלית הסבירה להגשה היא 4×B200 עם משקלי NVFP4 וזיכרון מטמון KV מסוג fp8; תצורות הייחוס מכסות גם תצורות מרובות-צמתים של GB200/GB300 ומארזים מסוג H100. NVIDIA מפרסמת מדריכי בישול לשלושה מנועים — vLLM (0.22), SGLang (0.5.13) ו‑TensorRT‑LLM (1.3.0rc17) — כולם חושפים API תואם OpenAI על פורט 8000, עם פענוח ספקולטיבי של MTP או EAGLE וצד אחורי של Mamba מבית flashinfer. ההקשר של 1M טוקנים דורש דגל הרשאה מפורש בכל מנוע (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 ומקבילותיו); תקרת ברירת המחדל היא 256K.

נכון למועד כתיבת שורות אלה, המודל אינו פרוס אצל שום ספק הסקה ב-Hugging Face, ו-NVIDIA לא הכריזה על אירוח NIM — זהו שחרור משקלים בלבד. זה הופך אותו למודל עבור מעבדות שכבר מפעילות ציי GPU גדולים, או עבור צוותים שצינור הזיקוק שלהם זקוק ספציפית לאות המורה המדויק. כשהוא כן ינחת על API מנוהל, מתמטיקת התמחור פשוטה: זהו MoE עם 55B פרמטרים פעילים, ומי שמארח אותו גובה מה שעולים ה-GPUs. בשכבת ניתוב שעובדת עם 0% תוספת, אתה משלם את מחיר המחירון של הספק בלי עמלת פלטפורמה נוספת — ואותו מפתח שמתחבר למודל הזה מתחבר גם למודלי הקצה שאיתם אתה משווה את התחקירים שלו, עם מעבר אוטומטי אם מארח נופל. לשם כך נועד ראוטר כמו OrcaRouter; המורה עצמו הוא החלק שאתה מארח בעצמך.

האזהרות הכנות

זהו checkpoint בן 24 שעות, וכרטיס המודל מכיל אפס מספרי benchmark. זו אינה השמטה בדיווח זה — זהו מצב ההשקה. NVIDIA פרסמה פרטי ארכיטקטורה ואימון, אך לא טבלת הערכה, ואף מעבדה עצמאית לא הספיקה עדיין להריץ אותו. נקודת הייחוס הקרובה ביותר היא המספרים המדווחים על ידי היצרן עבור התלמיד: Nemotron 3 Ultra מדווח על 71.9 ב-SWE-Bench Verified, 86.8 ב-MMLU-Pro, 89.0 ב-LiveCodeBench v6, וכ-95 ב-RULER בהקשר של 1M. אלה מתארים את תלמיד ה-Ultra, לא את המורה הזה, והם הנתונים של NVIDIA עצמה. כל מי שמתכנן ריצת distillation על checkpoint זה צריך להתייחס לאיכות ההיגיון שלו כלא מאומתת עד שיופיעו ציונים עצמאיים.

שתי הסתייגויות נוספות טבועות בכרטיס. קורפוס הפוסט-אימון מוטה מאוד לכיוון אנגלית — כ-8.6 מיליון דוגמאות באנגלית לעומת כ-138,000 לכל אחת מתשע השפות האחרות — ולכן אין להניח איכות חשיבה רב-לשונית על סמך התווית של 10 השפות. והכרטיס עצמו מתריע על הטיית ייצוג בנתוני האימון הבסיסיים וממליץ על בדיקות הטיה לפני שימוש במורד הזרם.

מי צריך לדאוג?

שלוש קבוצות מקבלות כאן ערך אמיתי. חוקרי זיקוק סוף סוף יש להם מורה MOPD אמיתי לנתח, לא רק מתכון שמתאר אחד. מעבדות שמאמנות מודלי חשיבה משלהן מקבלות מחולל עקבות ארוך-טווח ושופט שמגיע מאותה שושלת פוסט-אימון כמו המודל שהן מנסות להתאים. וכל מי שמריץ RL על-פוליסה יכול להשתמש בו כמו ש-NVIDIA עשתה — כמודד לבעיות הקשות ביותר, כשהחשיבה מופעלת רק במקום שבו היא משתלמת.

אם אינך באף אחת מהקבוצות האלה, המהדורה הזו משנה מעט עבורך היום: המודל גדול, לא מוכח, ומתאים לאירוח עצמי בלבד, והדרך המהירה ביותר לפעול על המגמה הבסיסית — הופעתם של מורי חשיבה פתוחים נוספים — היא לשמור על שכבת המודל של הצינור שלך ניתנת להחלפה מאחורי ממשק אחד, במקום להיות מרותכת לנקודת ביקורת יחידה.

A flow diagram titled 'How Multi-Teacher On-Policy Distillation works' showing a Student (Nemotron 3 Ultra) node sending rollouts to a Teacher panel of 10+ domain specialist cards, one highlighted as the General Reasoning teacher released Aug 14, 2026, with reward signals flowing back to the student, and the OrcaRouter logo composited in the corner.

מה לצפות בהמשך

שלושה דברים יגידו אם זה מקרה חד-פעמי או שהפאנל יוצא לאור. ראשית, האם מורים אחים ילכו באותו מסלול — NVIDIA-Nemotron-Labs-Teacher-STEM כבר נחת באותו יום, אז השאלה היא אילו מומחי תחום יבואו בהמשך והאם הם משוקללים באותה צורה. שנית, האם NVIDIA NIM או מארח מנוהל יתחיל לשרת אותם, מה שיהפוך מהדורה שמיועדת למעבדות בלבד למשהו ששאר התעשייה תוכל באמת לקרוא לו. שלישית, האם יופיעו מדדים עצמאיים — רשומה ב-Artificial Analysis או ריצה ב-LMArena תהיה הבדיקה האמיתית הראשונה לשאלה אם איכות החשיבה של המורה תואמת את התלמיד שאותו אימן.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube