כרטיס כותרת ראשי למאמר ההשוואה 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max' עם הכיתוב 'השבוע שבו המשקלים הפתוחים הפכו לרציניים', עם אייקון של כובע בוגר על קופסה פתוחה משמאל, אייקון של כדור הארץ ושבב מימין, תג 'השוואת מודלים', ואת הלוגו של OrcaRouter שמוצב בפינה הימנית התחתונה.
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning נגד Qwen3.8-Max: השבוע שבו משקלים פתוחים הפכו לרציניים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

למודלים עם משקלים פתוחים היה שבוע גדול. ב-12 באוגוסט 2026 או בסביבותיו, אליבאבא פרסמה את ה-Qwen הראשון מסוג Max עם משקלים פתוחים אי פעם — Qwen3.8 Max, דגם דגל עם 2.4 טריליון פרמטרים, שפורסם בשם Qwen3.8-2.4T-A95B ב-Hugging Face וב-ModelScope. יומיים לאחר מכן, ב-14 באוגוסט, NVIDIA פרסמה גם היא ב-Hugging Face את NVIDIA-Nemotron-Labs-Teacher-General-Reasoning, מורה reasoning עם 550B פרמטרים ו-55B פעילים, מצינור האימון של Nemotron 3 Ultra. שניהם checkpoints ענקיים שנפתחו זה עתה ממעבדות frontier, ושם נגמר הדמיון. Qwen3.8 Max פתוח כך שתוכלו להריץ דגם frontier בעצמכם; NVIDIA-Nemotron-Labs-Teacher-General-Reasoning פתוח כך שתוכלו לאמן איתו. ההשוואה ביניהם בעצם שואלת איזה סוג של צוות אתם — אבל העובדה ששניהם נחתו בתוך 72 שעות היא איתות לגבי הכיוון אליו הולכת התעשייה.

מה בעצם מכילה כל מהדורה

Qwen3.8 Max הוא הגרסה הניתנת לפריסה. זהו מודל sparse mixture-of-experts עם 2.4 טריליון פרמטרים בסך הכול, כ-95 מיליארד פעילים לכל טוקן על פני 512 מומחים, הבנוי על הארכיטקטורה ההיברידית של משפחת Qwen3.5. בגרסת המשקולות הפתוחות שלו הוא טקסט בלבד עם הקשר מקורי של 262K טוקנים (ניתן להרחבה מעבר ל-1M), ולצורך העניין — חשיבה נדרשת: המודל פולט תוכן חשיבה בין תגי <think> ואי אפשר לכבות אותה. גרסת ה-API המאוחסנת שאליבאבא השיקה ב-3 באוגוסט מוסיפה קלט תמונה ווידאו, הקשר ברירת מחדל של 1M, וחשיבה אופציונלית. רישיון המשקולות הפתוחות הוא רישיון Qwen3.8 Max מותאם אישית, מתירני אך עם תנאים מבוססי הכנסות לפריסות מסחריות גדולות מאוד. אם יש לך חומרה מרובת צמתים, אתה יכול להריץ מודל ברמת frontier על התשתית שלך.

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning הוא הגרסה לשלב האימון. הוא אחד מיותר מעשרה מורים שמתמחים בתחומים ספציפיים במתכון Multi-Teacher On-Policy Distillation (MOPD) שעומד מאחורי Nemotron 3 Ultra, ונגזר ממודל התלמיד Ultra שעבר אימון מאוחר (post-training), באמצעות שלב נוסף של כוונון־עדין מפוקח (SFT) המתמחה בנימוק ושלב של למידת חיזוק. תפקידו בצנרת הזו הוא לייצר עקבות נימוק ארוכות על הבעיות הקשות ביותר במתמטיקה, בלוגיקה ובנימוק מופשט, ולשמש כשופט שמעניק ציונים לתשובות חופשיות. הוא מופץ תחת רישיון OpenMDW-1.1 הידידותי לשימוש מסחרי, כולל נתוני האימון המאוחר שפורסמו, ואינו נושא אף מספר benchmark — NVIDIA מפנה במקום זאת לגרף הדיוק ולדו"ח הטכני של Ultra. הלקוחות שלו הם ריצות זיקוק, לא תעבורת ייצור.

Qwen3.8 Max, דגם הדגל הפתוח הראשון בדרגת Max

הפרסום של אליבאבא חשוב כי דגמי Qwen ממחלקת Max היו היסטורית זמינים רק דרך API. Qwen3.8 Max שובר את זה: המשקולות ניתנות להורדה, והמודל הוא באמת בחזית — Artificial Analysis נותנת לו Intelligence Index של 58 ו-Agentic Index של 58, מה שמשווה אותו למודלים הסגורים המובילים בתרחישים סוכניים. נקודות החוזק המדווחות על ידי הספק חזקות: 93.0 ב-PaperBench (לפני GPT-5.6 Sol ו-Fable 5), 92.6 ב-GPQA Diamond, 86.1 ב-OSWorld-Verified. נקודות החולשה אמיתיות לא פחות — 67.7 ב-SWE-bench Pro ו-43.6 ב-Humanity's Last Exam מפגרות אחרי המובילים, ובדיקות עצמאיות מצאו שהוא יקר לכל משימה שהושלמה, עם ממוצע של 64 סיבובים למשימה בריצות סוכניות. ב-API של אליבאבא המחיר הוא $2.00 למיליון טוקיני קלט, $6.00 למיליון טוקיני פלט, ו-$0.25 למיליון טוקיני קלט ממטמון — קיצוץ של 20% ממחיר התצוגה המקדימה.

המורה: תשתית אימון עם כרטיס מודל

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning אינו מתחרה באף אחד מהמספרים הללו, משום שלא פרסם נתונים כלשהם. מה שהוא מציע במקום זאת הוא אותה ארכיטקטורה היברידית של LatentMoE Mamba-2 + Transformer כמו המודל התלמיד Ultra, עד 1M טוקנים של קונטקסט, וחוגה היגיון — enable_thinking true/false, מצב medium_effort, ותקרת reasoning_budget קשיחה — שנחוצה לצינור דיסטילציה כדי להשקיע היגיון עמוק בדגימות קשות ולדלג עליו בדגימות קלות. חומרה מינימלית היא 4×B200 (או 8×H100), עם הגשה דרך vLLM, SGLang, או TensorRT-LLM, והצ'קפוינט הוא הורדה בגודל 1.12 טרה-בייט. הוא אינו פרוס אצל אף ספק אינפרנס, ו-NVIDIA לא הכריזה על אירוח NIM.这是一次仅权重发布,面向已经运行大型GPU集群的实验室。

מפרטים, זה לצד זה

• מטרה — מורה: מומחה חשיבה בזמן אימון ושופט. Qwen3.8 Max: ספינת דגל חלוצית הניתנת לפריסה.

• קנה מידה — מורה: 550B סה"כ / 55B פעילים, LatentMoE עם MTP. Qwen3.8 Max: 2.4T סה"כ / ~95B פעילים, 512 מומחים, Qwen3.5 היברידי.

• הקשר — Teacher: עד 1M טוקנים, ברירת מחדל 256K. Qwen3.8 Max: הקשר מובנה של 262K עם משקלים פתוחים, ניתן להרחבה מעבר ל-1M; גרסת API: 1M כברירת מחדל.

• משקלים — מורה: OpenMDW-1.1, שוחרר ב-14 באוגוסט 2026. Qwen3.8 Max: Qwen3.8 Max License, שוחרר ~ב-12 באוגוסט 2026.

• ראיות בלתי תלויות — Teacher: עדיין אין. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.

• חשיבה — Teacher: מתג enable_thinking, medium_effort, תקרת reasoning_budget. Qwen3.8 Max: מופעל בהכרח במשקלים פתוחים, לא ניתן להשבית.

• מחיר — Teacher: אין מחיר מחירון, הוצאות הון לאירוח עצמי. Qwen3.8 Max: $2.00 / $6.00 למיליון טוקנים, $0.25 לקלט במטמון.

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

אסימטריית הראיות היא כל הסיפור

Qwen3.8 Max נבדק; המורה לא. זה בחלקו עניין של גיל — Qwen3.8 Max הושק ב-3 באוגוסט ועבר שבועיים של ריצות לוח תוצאות, בעוד המורה שוחרר אתמול — ובחלקו עניין של כוונה, כי כרטיס המורה מעולם לא נועד להתחרות על ציונים. אבל האסימטריה הזו יוצרת השלכה אמיתית על ההשוואה: כל מספר קונקרטי בעמוד הזה עם מקור מצורף שייך ל-Qwen3.8 Max, וכל מספר שקשור למורה הוא מפרט ארכיטקטורה. איכות ההיגיון של המורה לא אומתה על ידי איש מחוץ ל-NVIDIA, והנתונים ברמת המשפחה שלו (ה-SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0 המדווחים על ידי הספק עבור התלמיד מסוג Ultra) מתארים מודל שונה. כל מי שמבסס החלטה על "מי משיג ציון טוב יותר" חייב לחכות לריצות בלתי תלויות של המורה — וזה בדיוק הפער שהשבועות הקרובים אמורים לסגור.

שני חוגות חשיבה, מכוונות אחרת

הניגוד הטכני המעניין ביותר בין שתי הגרסאות האלה הוא מה שקורה כשמבקשים מהן לנמק. ל-Qwen3.8 Max בצורת המשקלים הפתוחים שלו אין ברירה: החשיבה תמיד פעילה, ועקבות הנימוק הן חלק מכל תשובה. זה מצוין לאיכות התשובה ולשקיפות, אך יקר לייצור בכמויות גדולות. המודל המורה מתייחס לנימוק כאל חוגה: enable_thinking הופך אותה, medium_effort מווסת אותה, ותקרת reasoning_budget חוסמת אותה. עבור צינור זיקוק ההבדל מכריע — הפקת מיליוני עקבות נימוק עם מודל שחשיבתו תמיד פעילה מכפילה את חשבון הטוקנים, בעוד שהמתג של המודל המורה מאפשר לשלם על נימוק מעמיק רק במקום שבו דוגמה קשה דורשת זאת. אלה אינן פילוסופיות עיצוב מתחרות; הן שני כלים המותאמים לקצוות מנוגדים של אותה בעיה, וכל אחד הוא הכלי הנכון לקצה שלו.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

השורה התחתונה

אם אתם רוצים להריץ מודל פרונטיר על החומרה שלכם — או לקרוא לאחד במחיר סביר — Qwen3.8 Max הוא השחרור שחשוב, והוא זמין ב-OrcaRouter במחיר המחירון של Alibaba, מועבר בלי שום תוספת מחיר, כך שהנחת המחיר שאליבאבא הכריזה עליה בהשקה פעילה אצלנו כבר באותו היום. אם אתם רוצים לאמן או לזקק מודל חשיבה — או לבקר את האות שעיצב את Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning הוא השחרור שחשוב, ובינתיים הוא זמין רק באירוח עצמי. הסיפור הגדול יותר הוא ששניהם נחתו באותו שבוע: משקלים פתוחים עברו זה עתה מ"פתוחים מספיק כדי להסתכל" ל"פתוחים מספיק כדי לבנות עליהם", בשתי נקודות שונות בשרשרת האספקה של המודלים. צוותים ששומרים על שכבת המודלים שלהם ניתנת להחלפה מאחורי ממשק אחד — אירוח עצמי לאימון מצד אחד, והסקת פרונטיר מנוהלת מצד שני — הם אלה שממוקמים כדי להשתמש בשניהם.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית