
Nemotron-3-Labs-Ultra-Math-RL: NVIDIA שחררה בשקט כקוד פתוח את ה-RL Checkpoint שמאחורי הריצה שלה ל-IMO 2026
- openaiחדשOpenAI: GPT-6 Astra2026-09-0455אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0247אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0247אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0157אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2646אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1849אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1541אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1251אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0547אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0347אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2140אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128אינטליגנציה49כתיבת קוד
NVIDIA dropped Nemotron-3-Labs-Ultra-Math-RL on Hugging Face on September 2–3, 2026, with no blog post, no X announcement and no press release — the model card simply appears, dated September 3, and explains itself in one line: it is the reinforcement-learning checkpoint, referred to as "Nemotron-3-Ultra-RL" in NVIDIA's accompanying technical report, that was "deployed as part of an ensemble system that achieved a gold-medal level score at the International Mathematical Olympiad 2026." That system's official score — 30 out of 42 points, above the 29-point gold threshold — was widely reported back in late July, when the base model's weights had been public since June. What was not downloadable then was the pair of post-trained specialists the competition run actually used. One of them is now sitting in a public Hugging Face repo with zero likes and a near-zero download count.
זהו סיפור של שחרור שקט, ולכן כדאי להיות מדויקים לגבי מה ניתן לדעת ומה לא. מה שניתן לדעת מהמאגר ומהדוח: הארכיטקטורה של נקודת הביקורת, מתכון האימון שלה, התפקיד שמילאה בהגשה ל-IMO 2026, ומערכי הנתונים והבנצ'מרק שנVIDIA פרסמה לצידה. עדיין אין אישור לשום הכרזה של ספק, לשום בנצ'מרק עצמאי של צד שלישי לנקודת ביקורת זו, או לשום API מתארח — זהו שחרור משקלים לאירוח עצמי תחת רישיון OpenMDW-1.1, והרצתה משמעה הקמת כ-1.5 TB של HBM ברמת Blackwell.
מה שבאמת שוחרר השבוע
המאגר nvidia/Nemotron-3-Labs-Ultra-Math-RL נוצר ב-Hugging Face ב-2 בספטמבר 2026 (19:11 UTC) ונערך לאחרונה ב-8 בספטמבר. הוא פריט אחד במהדורה מתואמת שאוגדה תחת nvidia/nemotron-labs-imo-2026, המכילה:
• שני הצ'קפוינטים התחרותיים שעברו פוסט-אימון — Nemotron-3-Labs-Ultra-Math-RL (הנושא הזה) ואחיו שעבר כוונון עדין מפוקח Nemotron-3-Labs-Ultra-Math-SFT, שניהם תחת OpenMDW-1.1.
• שני קורפוסי האימון שמאחוריהם — Nemotron-Math-Proofs-v3-SFT ו-Nemotron-Math-Proofs-v3-RL, שניהם ברישיון CC-BY-4.0.
• Nemotron-IMO-Bench, מדד הערכה חדש של 200 בעיות ברמת אולימפיאדה שלא פורסמו (50 אלגברה, 50 קומבינטוריקה, 50 גאומטריה, 50 תורת המספרים), כל אחת עם הוכחת ייחוס שנערכה ידנית, שנוצר עם המתמטיקאי Titu Andreescu במיוחד כך שהבעיות לא יכולות להופיע באף ערכת אימון.
• נקודת הבסיס NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, שכולם כווננו ממנה.
תיאור האוסף מפנה לדו"ח הטכני שמחבר את הכל: "An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics" (ה-PDF במאגר NeMo-Skills של NVIDIA מתוארך ל-8 בספטמבר 2026). לצד הצ'ק-פוינטים שפרסמה NVIDIA, שוחררו גם צינור ההיסק, ההוכחות שהוגשו, מתכון אימון ה-RL, וחשבון מחשוב מלא של ריצת התחרות. המסגור הוא במפורש מדע-בר-שחזור: זו NVIDIA שאומרת — הנה כל מה שצריך כדי לבנות מחדש את המערכת.
מה זה Nemotron-3-Labs-Ultra-Math-RL
מבחינה ארכיטקטונית, זה אינו דגם בסיס חדש — זהו כיוונון של המודל הכלל-זמין NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, צ'קפוינט היברידי של Mamba2–Transformer עם Latent Mixture-of-Experts, ש-NVIDIA שחררה לראשונה ב-4 ביוני 2026. צ'קפוינט ה-Math-RL שומר על אותה ארכיטקטורה ועל אותו קנה מידה: 550B פרמטרים בסך הכול, עם 55B פעילים, חיזוי רב-טוקנים, ותמיכה בחלונות הקשר עד 1M טוקנים. מה שאימון ה-RL משנה הוא ההתמחות, והיא צרה באופן מכוון:
• מטרה — לפתור בעיות קשות במתמטיקה תחרותית ולשמש כשופט הוכחות: המודל מאומן לייצר פתרון קפדני, להעריך אותו לפי מחוון של 0 / 0.5 / 1, ולזהות טעויות בהוכחות.
• זהו לא צ'אטבוט כללי — הכרטיס והדוח מתארים עובד מומחה עבור צינור חיפוש הוכחות, לא עוזר עוקב הוראות.
• רישיון — OpenMDW-1.1, הרישיון המתירני של NVIDIA למודלים פתוחים, שמתיר שימוש מסחרי ולא-מסחרי, זהה לזה של המודל הבסיסי ושל מהדורות המורה הקודמות של Nemotron Labs.
• פריסה — אין מחיר אירוח רשום בשום מקום; מורידים safetensors ומבצעים אירוח עצמי. תצורת הייחוס של NVIDIA היא צומת יחיד של 8× B200 (כ־1.5 TB של HBM מצטבר), עם אפשרויות ריבוי צמתים ב־H100/H200/GB200/GB300. vLLM היא סביבת הריצה המומלצת, עם פרסר חשיבה, פרסר קריאות־הכלים של Qwen3-Coder, הגדרות מטמון של Mamba SSM, ופענוח ספקולטיבי של MTP על 5 טוקנים — כל אלה מצוינים בכרטיס.

למה נקודת הביקורת הזו חשובה: היא הייתה בתוך מערכת IMO 2026
התוצאה של IMO 2026 היא הסיבה שמישהו בכלל מסתכל על המודל הזה, לכן ההבחנה החשובה היא: ה-30/42 הוא ציון מערכת, לא ציון של מודל בודד. ההגשה של NVIDIA הייתה פייפליין דו-שלבי עם מספר נקודות ביקורת, ו-Nemotron-3-Labs-Ultra-Math-RL היה רכיב עם שתי משימות בתוכו.
לפי הדוח, השלב הראשון ניהל חיפוש איטרטיבי של יצירה–אימות–חידוד עד שמונה סבבים לכל בעיה. בסבב הראשון נדגמו 384 ניסיונות הוכחה — 16 מכל אחת משמונה הנחיות אסטרטגיית פתרון שונות, מכל אחת משלוש נקודות הביקורת: המודל הזמין הכללי, המומחה מסוג SFT והמומחה מסוג RL. האימות בזמן החיפוש השתמש בנקודות הביקורת RL ו-SFT כפאנל דו-מודלי: שמונה שיפוטים עצמאיים מכל אחת, והוכחה התקבלה רק אם כל 16 השיפוטים נתנו לה ציון 1. שלב מאוחר יותר בעל עוצמת חישוב גבוהה דירג מחדש כל מועמד סופי עם כל שלוש נקודות הביקורת (16 שיפוטים בסגנון IMO לכל אחד, בסולם 0–7) ובחר את ההגשה היחידה לכל בעיה.
התוצאה הרשמית, כפי שדווח במסמך ובהתאמה לסיקור מסוף יולי: 30 מתוך 42 נקודות במבחן IMO 2026, מעל סף מדליית הזהב של 29 נקודות, עם ציון מלא בבעיות 1, 2, 4 ו-5 ונקודה אחת כל אחת בבעיות 3 ו-6, כאשר הניקוד נקבע על ידי מעריכי IMO רשמיים. חשבון המשאבים של NVIDIA עצמה מצביע על כך שכל שש ההוכחות שהוגשו נמצאו בתוך כ-707 מיליון טוקנים שנוצרו וכ-1,464 שעות GPU של GB200; השלמת הסבבים שהיו בתהליך הביאה את סך כל ההרצה לכ-2.31 מיליארד טוקנים וכ-4,800 שעות GPU של GB200.
שני נתונים פנימיים מתוך הדוח ממחישים מדוע צ'קפוינט ה-RL זכה במקומו באנסמבל. במערך הפיתוח של NVIDIA, שבו יש 30 בעיות, נקבעו הציונים על ידי פאנל שיפוט בלתי תלוי של GPT-5.5, Gemini 3.1 Pro ו-Claude Opus 4.8, לפי נוהל בסגנון MathArena; מומחה ה-RL היה הפייפרליין החד-צ'קפוינטי הטוב ביותר מקצה לקצה (180 מתוך 210 נקודות שיפוט אפשריות, לעומת 165 למומחה ה-SFT ו-162 למודל הבסיס), אם כי צ'קפוינט ה-SFT פתר יותר בעיות בסיבוב הראשון. במערך ביקורת בן 300 הוכחות, פאנל האימות המשולב RL+SFT שנפרס צמצם את שיעור הקבלה השגויה — הכשל שמביא לסיום החיפוש על סמך הוכחה לא תקפה — לכ-1.1%, לעומת 12.4% כשצ'קפוינט ה-RL שופט לבדו ו-31.6% עבור מודל הבסיס. נקודת הדוח היא ששני המומחים הסלקטיביים תופסים זה את הטעויות של זה, תחת כלל של פה אחד.
אלה הן האבלציות ש-NVIDIA עצמה ערכה על סט הפיתוח של עצמה, כפי שדווח במאמר של NVIDIA — וכדאי להתייחס אליהן כראיות מטעם היצרן מדוע התכנון עובד, ולא כציונים עצמאיים. סט הפיתוח עצמו כולל רק 30 בעיות, ואף מעבדה חיצונית לא הריצה את הצ’קפוינט הזה עדיין.
מתכון ה-RL, בקצרה
נתוני האימון והשיטה פתוחים לחלוטין, וזה החדשות האמיתיות עבור כל מי שעוסק במחקר RL להיגיון מתמטי. הנקודות הבולטות מהדו"ח:
• נתונים — הבעיות נלקחות מתת-קבוצת ה-AoPS של Nemotron-Math-Proofs-v1, מסוננות לאלו שמודל ה-Ultra הבסיסי פותר באחת עד שלוש מתוך ארבע ניסיונות (לפי שיפוט של DeepSeek-V3.2-Speciale) — בעיות תכנית לימודים קשות אך ניתנות לטיפול. סינון זה מניב 9,597 הנחיות ליצירת הוכחות, שפורסמו כ-Nemotron-Math-Proofs-v3-RL.
• תגמול — עוקב אחר העיצוב של DeepSeekMath-V2 אך משמיט את רכיב התגמול של ניתוח-עצמי; אות השופט מגיע משירות שיפוט-הוכחות במהלך האימון.
• אלגוריתם — RL אסינכרוני שנבנה על NeMo-RL, בדומה ברוחו ל-PipelineRL: מאגר קבוע של פרומפטים שנשמרים בתהליך, רצפים שהושלמו מוזנים למאמן כשהאצוות מתמלאות, דגימת חשיבות קטועה, וטוקנים בעלי הסתברות נמוכה ממוסכים על דגימות חיוביות כשהאנטרופיה עולה. התצורה השתמשה בקונטקסט של 131,072 טוקנים, ובקירוב 128 צמתי אימון, 128 צמתי הסקה ו-16 צמתי שיפוט של 4× GB200 כל אחד.
לצורך השוואה, נקודת ביקורת ה-SFT האחות הייתה כוונון עדין מפוקח (supervised fine-tune) ארוך-הקשר מאותו הבסיס, על גבי קורפוס מסונן איכותית של 414,890 רצפי הוכחה, עידון, אימות ומטא-אימות, המכסים 15,818 בעיות; האימון בוצע על 512 GPUs מסוג GB200.

מה שעדיין לא ידוע
מקורות כנים פועלים לשני הכיוונים כאן, וקורא שמחליט אם להתעניין במהדורה זו צריך לזכור ארבעה סייגים:
• אין הכרזה. נכון למועד כתיבת שורות אלה, NVIDIA לא הכריזה רשמית על האוסף; הוא הופיע ב־Hugging Face. קובץ ה־PDF של הדוח הטכני מתוארך ל־8 בספטמבר, כך שהמתכון הכתוב מתפרסם למעשה גם השבוע.
• אין אמות מידה עצמאיות.כל נתון ביצועים המצורף לנקודת הביקורת הזו — מדידות ה-dev-set, ביקורת ה-verifier, ציון המערכת ל-IMO 2026 — מקורו בדו"ח של NVIDIA עצמה. לציון ה-IMO עצמו יש את המקור החזק ביותר מבין הנתונים, כיוון שנבחן בתנאי תחרות רשמיים, אך הוא תוצאה ברמת מערכת, ותרומת נקודת הביקורת אליו לא שוחזרה על ידי מעבדה חיצונית כלשהי.
• אין API מתארח, ואין מחירון.זוהי מהדורה לאירוח עצמי. כל מי שרוצה לקרוא לו צריך את החומרה. הסיקור מיולי תחת הכותרת "NVIDIA Nemotron 3 Ultra השיג מדליית זהב ב-IMO 2026" יכול בקלות להתפרש בטעות כ"תוריד את זה וזה פותר בעיות אולימפיאדה" — הגרסה הכנה היא "תוריד את רכיבי המערכת שעשתה זאת."
• המיסגור כ"מדליית זהב". הניסוח של NVIDIA עצמה הוא "מגיעים לסף מדליית הזהב", והמאמר מקפיד לציין שהמודל היה חלק מאנסמבל. יש להתייחס לכל טענה שהצ'קפוינט הבודד הזה לבדו הוא "ברמת מדליית זהב" כאל טענה שאינה מגובה.
למי זה מיועד
המהדורה הזו מיועדת לקהל קוראים ספציפי: מעבדה או חוקר העוסקים בהיגיון מתמטי{{1}}, יצירת הוכחות{{/1}}, או למידת חיזוק עם תגמולים הניתנים לאימות{{2}}, המעוניינים ביישום ייחוס{{/2}} של מערכת שחצתה את סף מדליית הזהב האולימפית בשפה טבעית{{3}} — ללא מוכיח פורמלי, ללא כלים, ללא אינטרנט{{/3}}. עבור אותו קורא, הערך טמון בחבילה כולה: משקלים, קורפוסים של SFT ו-RL, ההנחיות בפורמט NeMo-Gym{{4}}, צינור ההסקה, ההוכחות שהוגשו{{/4}}, וחשבון המשאבים שמפרט כמה עולה בפועל ריצת תחרות בשעות GPU{{5}}.
לכל השאר, ההערה המעשית היא שחיפוש הוכחות ברמת אולימפיאדה הוא מוגזם עבור רוב עומסי העבודה המתמטיים האמיתיים. בעיות ברמת AIME ותחרויות, ולמעשה כל עבודה של מתמטיקה שימושית בקוד, מטופלות בנוחות על ידי מודלים קטנים בהרבה — וזה חשוב כי checkpoint של 550B הוא לא משהו שמריצים עבור עבודת אצווה. מודלי המתמטיקה הפתוחים הקטנים יותר ומודלי ה-API המובילים נגישים דרך API יחיד ב-OrcaRouter במחירי המחירון של הספקים (ללא תוספת מחיר מצידנו, כך שהורדת מחיר של ספק נכנסת לתוקף באותו היום), עם failover אוטומטי אם רוצים לנסות מודל לא מוכח מבלי להמר שמסלול ייצור יתבסס עליו. התחילו שם; עברו לאירוח עצמי של 550B רק כשהעומס דורש באמת חיפוש הוכחות בקנה מידה של המודלים המובילים.
השאלה הפתוחה שכדאי לעקוב אחריה היא האם הירידה השקטה הזו תזכה להכרזה רשמית ולרשומת שחרור רשמית, והאם מישהו מחוץ ל-NVIDIA יריץ את המתכון מקצה לקצה וידווח על ציון IMO-Bench עצמאי. המדד הזה — 200 בעיות אולימפיאדה חדשות שעוד לא פורסמו — הוא ללא ספק הארטיפקט השימושי ביותר באוסף: הוא בדיוק סוג ההערכה העמידה לזיהום שהתחום היה זקוק לו. אם המתכון משתחזר, ההעלאה השקטה של Hugging Face השבוע תתברר כאחת מההפצות המשמעותיות ביותר של מודלים פתוחים השנה. אם לא, האוסף עדיין מהווה תיאור מפורט וכנה של מה שנדרש בפועל כדי להריץ, בקנה מידה של מודל חזית, תהליך אחד של יצירה–אימות–חידוד.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
