כרטיס כותרת ראשי עבור 'Qwen3.8-Max מול Qwen 3.8' עם כותרת המשנה 'ליבת 2.4T אחת — API להשכרה או משקלים פתוחים', תגים עבור עדכון 0902 מ-2 בספטמבר 2026, ה-API המתארח במחיר של $2/$6 למיליון טוקנים, והמשקלים הפתוחים מ-12 באוגוסט, וכותרת תחתונה המציינת דירוג מקום ראשון עצמאי ב-Code Arena WebDev עם ציון 1,691 עבור build 0902, בעוד שלנקודת הביקורת הפתוחה אין עדיין ציונים עצמאיים.
Guides & Insights

Qwen3.8-Max לעומת Qwen 3.8: ליבת 2.4T אחת, שכורה או מופעלת — אחרי רענון 0902

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-2 בספטמבר 2026, Alibaba שחררה עדכון מתוארך של Qwen3.8-Max — הגרסה שהיא מכנה בשם Qwen3.8-Max-0902 — ולוח דירוג עצמאי לקוד הציב את תמונת המצב החדשה במקום הראשון באותו שבוע. הגרסה הניתנת להורדה של אותה ליבה בעלת 2.4 טריליון פרמטרים, הדגם שרוב האנשים מתכוונים אליו כשהם כותבים "Qwen 3.8" ללא סיומת, עדיין יושבת על נקודת הביקורת של 12 באוגוסט: טקסט בלבד, חשיבה נעולה במצב פעיל, וחסרים מאות גיגה-בייט כדי להריץ אותה על כל דבר קטן יותר ממדף GPU. הפער בין דגם הדגל המאוחסן למשקלים הפתוחים לא היה קיים באוגוסט. הוא עכשיו כל ההשוואה, וזו הסיבה שאותו דגם ממשיך להימכר לך תחת שני שמות.

Qwen3.8-Max הוא דגם הדגל המתארח של Alibaba: מודל mixture-of-experts דליל עם 2.4 טריליון פרמטרים, כ-95 מיליארד פרמטרים פעילים לכל טוקן, חי ב-API בתשלום מאז 3 באוגוסט, ונושא חלון הקשר מולטי-מודאלי של מיליון טוקנים. Qwen 3.8, כשם עצמאי, הוא המהדורה הפתוחה של אותו דור — ובעיקר Qwen3.8-2.4T-A95B, המשקלים שפרסמה Alibaba ב-12 באוגוסט ברישיון מותאם אישית. הם לא אח זול ואח פרימיום; הם אותו מוח שנמכר בשתי דרכים, וסבב פוסט-אימון מספטמבר החל להפריד בין שתי ההפצות. כתבה זו מבררת על איזה "Qwen 3.8" אתה בעצם מסתכל, מה שינתה רענון ה-0902, ובאיזה מסלול — לשכור את ה-API או להריץ את המשקלים — כדאי לך להיות היום.

הזיווג שאינו יריבות

לפני התאריכים וכרטיסי התעריפים, הארכיטקטורה: Qwen3.8-Max ו-Qwen3.8-2.4T-A95B חולקות עיצוב MoE בעל גרעיניות עדינה עם 512 מומחים בכל שכבה (10 מנותבים ועוד אחד משותף, בכל שכבה), 92 שכבות, ומחסנית היברידית שבה 69 מתוך 92 השכבות משתמשות בקשב ליניארי — Gated DeltaNet בשילוב קשב עם שער — כשקשב מלא משולב ביניהן לצורכי הקשר הארוך. זו הסיבה שכרטיס המודל יכול להצהיר על הקשר של מיליון טוקנים ב-API ומדוע הגרסה הפתוחה מגיעה ל-262K מובנה שמתרחב לעבר מיליון עם תצורת ההגשה הנכונה. ההבדלים בין שני השמות אינם בארכיטקטורת המשקלים; הם בקצוות, והקצוות זזו מאז ה-2 בספטמבר.

פרמטרים — Qwen3.8-Max: 2.4T סך הכול / ~95B פעילים, MoE. Qwen3.8-2.4T-A95B: אותה ליבה, אותו מספר פעילים.

• {{1}}אספקה — Qwen3.8-Max: API מתארח, פעיל מאז 3 באוגוסט, עודכן ל-Qwen3.8-Max-0902 ב-2 בספטמבר.{{/1}} {{2}}Qwen3.8-2.4T-A95B: משקלים להורדה,{{/2}} {{3}}פורסם לראשונה ב-12 באוגוסט, ללא גרסת checkpoint חדשה מאז.{{/3}}

• מודאליות — {{1}}Qwen3.8-Max{{/1}}: קלט טקסט, תמונה ווידאו. {{2}}Qwen3.8-2.4T-A95B{{/2}}: טקסט בלבד.

- בקרת חשיבה — Qwen3.8-Max: מתגי חשיבה, כולל מצב ללא חשיבה. Qwen3.8-2.4T-A95B: חשיבה תמיד פעילה, עם רק חוגת מאמץ חשיבה (נמוך / גבוה / גבוה במיוחד).

• כלים — Qwen3.8-Max: קריאות פונקציות מקוריות, חמישה כלים מובנים ופלט מובנה. Qwen3.8-2.4T-A95B: אין שכבת כלים מקורית; מה שמקבלים תלוי במסגרת ההסקה שעליה מריצים את המודל.

מה שינה עדכון ה-2 בספטמבר

ה-build 0902 הוא מעבר פוסט-אימון, לא ארכיטקטורה חדשה. אליבאבא כיוונה אותו לשני הדברים ש-Qwen3.8-Max כבר היה ידוע בהם — קידוד ו-"cowork", השם שהיא נותנת לעבודה אייג'נטית ומשרדית ארוכת-טווח — והמספרים שהצטברו סביבו הם הסיבה לכך שהרענון הזה חשוב. בלוח המובילים העצמאי של Code Arena: WebDev, Qwen3.8-Max-0902 הופיע לראשונה עם דירוג Elo של 1,691 — קפיצה של 22 נקודות לעומת ה-build הקודם, ודי היה בכך כדי לתפוס את המקום הראשון מיד עם השקתו. אליבאבא גם מציגה את ה-build כמודל בעל הניקוד הגבוה ביותר בחזית פארטו של עלות-ביצועים של אותו לוח, בתעריף משולב של כ-5 דולר למיליון טוקנים — מחיר המחירון של 2 ו-6 דולר, משוקלל לפי תעבורה אייג'נטית עתירת פלט, שהם בערך רבע מעלותה של קריאה למודל חזיתי דומה במקום אחר. הנתונים האלה הם שילוב שהקורא צריך להפריד: דירוג ה-1,691 Elo הוא תוצאה של זירה עצמאית; ההצגה במונחי חזית פארטו היא האפיון של אליבאבא עצמה לגבי אותו לוח עצמאי.

ההערכות הפנימיות של Alibaba לגרסה 0902, שדווחו על ידי ספקים ולא שוחזרו, מראות את אותו הכיוון: Terminal-Bench 3.0 עולה מ-11.3 ל-29.0, ProgramBench מ-10.5 ל-28.0, JobBench מ-53.4 ל-64.0, ו-WorkArena Elo מ-1,348 ל-1,468. קראו לכך כ"הרענון הזיז את הצירים הסוכניים וצירי הקידוד", ולא כציונים מאומתים. בצד האינטליגנציה הכללית, מדד האינטליגנציה של Artificial Analysis נותן ל-Qwen3.8-Max 56 — תחרותי, אבל לא הסיבה לבחור בו; התוצאות בקידוד ובפעולות סוכניות הן אלה.

החלק שרוב הסיקורים פסחו עליו הוא שהפוסט-טריינינג של 0902, נכון לרגע כתיבת שורות אלה, זמין רק דרך API. עליבאבא לא פרסמה checkpoint פתוח של המודל המעודכן — המשקלים של Qwen3.8-2.4T-A95B ב-Hugging Face עדיין מתייחסים לשחרור מ-12 באוגוסט. זה אומר שה-Qwen3.8-Max המתארח והליבה הניתנת להורדה הם כבר לא אותו מודל כפי שהיו באמצע אוגוסט. ל-API יש את הפוסט-טריינינג של ספטמבר; למשקלים אין. אם כל הסיבה שלך להריץ את הגרסה הפתוחה הייתה לשחזר בדיוק את מה שמודל הדגל עושה, ההנחה הזו פסקה מלהתקיים בשקט ב-2 בספטמבר.

A comparison scoreboard for Qwen3.8-Max (0902) and Qwen 3.8 (2.4T-A95B open): left column shows Hosted API with a Sep-2 build tag, Text + image + video, 1M native context, a thinking toggle including off, native tools and JSON, and $2/$6 per 1M with a $0.25 cache tag; right column shows Open weights with an Aug-12 tag, Text only, 262K native context, thinking always on, framework-level tools and JSON, and weights plus your own GPUs; the footer notes independent Code Arena WebDev 1,691 and AA Index 56 for the Max, and that the open checkpoint has no independent scores yet.

חמשת המקומות שבהם הם באמת נבדלים

נניח בצד את הארכיטקטורה המשותפת, וההבדלים המעשיים מסתדרים יפה. המודאליות היא המסנן הראשון: אם עומס העבודה שלכם כולל תמונות או וידאו — צילומי מסך, תרשימים, מסמכים עם איורים, פריימים של וידאו — רק Qwen3.8-Max מקבל אותם, וחלון של מיליון טוקנים הוא מובנה ולא הרחבה. גרסת המשקלים הפתוחים היא טקסט בלבד. בקרת החשיבה היא השנייה: ה-API המאונדן יכול לפעול כשהחשיבה כבויה, וזה קריטי לחילוץ רגיש-לשהייה ובנפח גבוה, שבו שרשרת חשיבה היא תקורה טהורה; הגרסה הפתוחה אינה יכולה לכבות אותה. הכלים הם השלישי: קריאות פונקציות, חמשת הכלים המובנים ומצב JSON כלולים במוצר המאונדן, בעוד הגרסה הפתוחה תלויה במה ששכבת ה-serving שלכם מספקת.

ההקשר עדין יותר ממה שגיליון המפרט מרמז. שני הצדדים יכולים להגיע לכמיליון טוקנים, אבל המודל המאוחסן עושה זאת באופן טבעי עם קלט מולטימודלי, בעוד שההקשר הטבעי של 262K בגרסה הפתוחה צריך להיות מורחב בקונפיגורציה, וכל טוקן בחלון המורחב הזה הוא טקסט. גם מגבלות הפלט שונות — ה-API מאפשר עד כ-131K טוקני פלט, והגרסה הפתוחה מוגדרת בדרך כלל לתקרה דומה, אבל התקרה המעשית בצד הפתוח נקבעת על ידי תשתית השרתים שלך, לא על ידי המודל.

כמה עולה כל מסלול בפועל

כאן ההשוואה בין שתי ההפצות מסתיימת לחלוטין. ל-Qwen3.8-Max יש מחיר מחירון: $2.00 למיליון טוקני קלט, $6.00 למיליון טוקני פלט, ו-$0.25 למיליון עבור קלט שמוחזר מהמטמון. מכיוון ש-OrcaRouter מעביר את מחירי המחירון של הספק עם 0% markup, זה התעריף שמשלמים כאן; וכאשר Alibaba משנה אותו, המספר החדש פעיל באותו היום. תמונת המצב של 0902 מקובעת בנפרד בשם qwen/qwen3.8-max-0902, לצוותים שרוצים התנהגות ניתנת לשחזור — אותו מחיר, אותן יכולות, אבל עם checkpoint קבוע במקום המודל המתגלגל. בתעבורה של OrcaRouter, חציון הזמן עד לטוקן הראשון (time-to-first-token) על פני 7 ימים עבור Qwen3.8-Max הוא בערך 2–4 שניות, ו-Artificial Analysis מודדת סביב 45–48 טוקני פלט בשנייה: לא איטי, אבל מילולי, וזו הסיבה שמשימות אייג'נטיות על המודל הזה יכולות לשרוף כמויות טוקנים מפתיעות, למרות התעריף הזול.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max), showing the flagship description, the price card at $2.00 per 1M input and $6.00 per 1M output tokens, a 1,000,000-token context window, and 7-day median time-to-first-token and traffic figures.

ל-Qwen3.8-2.4T-A95B אין מחיר קטלוגי, כי המחיר הוא התשתית שלך. משקלי ה-BF16 תופסים כ-4.9 TB, ואפילו מבנה ה-FP8 הרשמי הוא כ-2.4 TB, אז מדובר בחומרה בקנה מידה של מתלה: התצורות המתועדות הקטנות ביותר לשירות מתחילות בסביבות שמונה GPU מדגם B300 או GB300, ומתלה GB300 NVL72 מלא הוא פריסת הייחוס. קוונטיזציה אגרסיבית משנה את הרף התחתון — מבנה NVFP4 מתאים לכ-1.3 TB, והקוונטיזציה השכבתית של Unsloth ב-1-bit דוחסת את המודל לכ-397 GB, וזה מה שלבסוף הופך צומת יחיד ומאובזר היטב לבר-ביצוע — אבל כל אחד מהמסלולים האלה מניח שאתה מפעיל GPUs בקנה מידה של מרכז נתונים. מארחי צד-שלישי שמשרתים את ה-checkpoint הפתוח ימכרו לך טוקנים במחיר נמוך מהמחיר לטוקן של Max, אבל אתה מוותר על הקלט המולטימודאלי, על מצב ללא החשיבה, על הכלים המקוריים ועל הפוסט-אימון של 0902 בתהליך, ועדיין לא פורסם שום benchmark עצמאי של אותו checkpoint הניתן להורדה עצמו. כרטיס המודל של Alibaba עצמו כן לגבי הקשר: הוא מתאר את Qwen3.8-Max כגרסה הרשמית שנבנתה על Qwen3.8-2.4T-A95B, ומוסיפה על גבי הליבה הפתוחה קלט ראייה, תמיכה במצב ללא חשיבה, הקשר ברירת מחדל של 1M וכלים מובנים.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-2.4T-A95B, showing the Text Generation and Transformers tags and the card text explaining that Qwen3.8-Max is the official version built on Qwen3.8-2.4T-A95B with vision input, non-thinking support, a 1M default context, and built-in tools.

מספרים עצמאיים לעומת טענות ספק

כנות המקור חשובה כאן יותר מאשר ברוב ההשוואות, מכיוון שלשני הצדדים יש גילאי ראיות שונים מאוד. Qwen3.8-Max קיבל ציונים עצמאיים: תוצאת Code Arena: WebDev 1,691 עבור build 0902 ומדד האינטליגנציה של Artificial Analysis שעומד על 56 הם מדידות של צד שלישי, והתמחור שהופך את טענת גבול פארטו למעניינת הוא מחירון שפורסם. ל-Qwen3.8-2.4T-A95B עדיין אין את זה — טבלת הבנצ'מרק שאליבאבא פרסמה מתארת את הליבה של מחלקת Max, לא ריצה עצמאית של נקודת הביקורת הניתנת להורדה, ולכן הצד הפתוח של ההשוואה הזו עדיין בגדר "היצרן אומר שהליבה מקבלת ציונים כאלה". אם אתה מחליט ביניהם על בסיס יכולות, התייחס למספרים הבולטים של המשקולות הפתוחות כאל טענות עד שצד שלישי יריץ אותם.

מי צריך לבחור איזה

ההחלטה נובעת מהרשימה שלמעלה. פנו אל Qwen3.8-Max המאוחסן — היום, ליתר דיוק, ל-build של 0902 — כשאתם צריכים את הפוסט-טריינינג של ספטמבר, קלט של תמונה או וידאו, מצב ללא חשיבה, כלים מובנים ופלט מובנה, או חלון של מיליון טוקנים, בלי להקים תשתית. זוהי עמדת החוד החנית בקידוד ובסוכנים, ובמחיר של $2/$6 עם קלט מטמון ב-$0.25, המחיר אגרסיבי בהתחשב במה שהוא.

בחר ב-Qwen3.8-2.4T-A95B כששליטה גוברת על נוחות: אתה צריך את המשקולות על חומרה משלך או על ספק שאתה כבר מפעיל, אתה רוצה נקודת ביקורת קבועה שתוכל לבקר ולשחזר, או שהנפח השוטף שלך הופך את העלות לאסימון למונח הדומיננטי ואתה מוכן להריץ MoE של 2.4T. קבל את רשימת הפשרות — טקסט בלבד, חשיבה תמיד פעילה, ללא כלים מקוריים, ללא post-training של 0902 עדיין — ובדוק את תנאי הרישיון עבור רצועת ההכנסות שלך, מכיוון שהרישיון המותאם אישית של Qwen3.8-Max אינו Apache 2.0 ומוסיף תנאים למפעילים מסחריים גדולים.

אם עומס העבודה שלך הוא בנפח גבוה, מבוסס GPU יחיד או רגיש לזמן אחזור, אף אחת מאלה אינה בהכרח הנתיב הנכון — האחות מאותו דור, Qwen3.8-27B, בעלת 27 מיליארד הפרמטרים, היא המיועדת לכך, וזוכה לסקירה נפרדת בהשוואת Qwen3.8-27B מול Qwen3.8-Max.

איך לנסות את שתי האפשרויות בלי להמר על כל הקופה

{{1}}הדרך הנקייה להכריע כאן היא להריץ את שני הצדדים על הפרומפטים שלכם — וזה בדיוק המקום שבו שכבת ניתוב מוכיחה את ערכה, במקום לחבר אחת כחיבור חיצוני.{{/1}} {{2}}Qwen3.8-Max ותמונת המצב המעוגנת Qwen3.8-Max-0902 יושבים שניהם מאחורי נקודת קצה אחת תואמת-OpenAI על OrcaRouter, כך שמעבר בין הדגל המתגלגל לבין נקודת הביקורת הניתנת לשחזור הוא שינוי של מזהה מודל, לא פריסה מחדש.{{/2}} {{3}}כשצוות מחליט להביא את המשקולות הפתוחות פנימה, ה-DSL לניתוב יכול לעמוד בחזית מול נקודת קצה מתארחת-עצמית של vLLM או SGLang המשרתת את Qwen3.8-2.4T-A95B ולהציב אותה באותו גרף קריאות — עיקר התעבורה לפריסה שלכם, ופרומפטים קשים ובקשות מולטימודליות נשפכים אל Qwen3.8-Max המתארח, עם מעבר אוטומטי (failover) ביניהם.{{/3}} {{4}}לנסות נקודת ביקורת חדשה בדרך הזאת עולה שינוי תצורה ולא מיגרציה — וזה בדיוק מה שרוצים כששני צדדי ההשוואה הזאת עדיין נעים במהירויות שונות.{{/4}}

השורה התחתונה

Qwen3.8-Max ו-Qwen 3.8 אינם שני מודלים המתחרים על אותה משימה. הם ליבת פרמטרים אחת בהיקף 2.4 טריליון, המועברת כ-API להשכרה וכמשקולות להורדה, ורענון ה-2 בספטמבר הפך את שתי ההעברות למשמעויות שונות. אם תשכור את ה-API, תקבל את הפוסט-אימון של 0902, שהשיג את ההובלה ב-Code Arena: WebDev, בתוספת ראייה, מצב לא-חשיבה, כלים מקוריים, וחלון מקורי של מיליון טוקנים, במחיר של $2/$6 עם $0.25 לקלט שמור במטמון. אם תריץ את המשקולות הפתוחות, תקבל את אותה ארכיטקטורה קפואה במצבה מ-12 באוגוסט — טקסט בלבד, חשיבה נעולה — ללא ציונים עצמאיים עדיין ועם חשבונית חומרה של מרכז נתונים. אם רווחי הקידוד והיכולות הסוכניות של ספטמבר חשובים לך, רק אחד משני השמות כולל אותם היום. אם שליטה ניתנת לשחזור חשובה יותר, רק אחד משני השמות הוא שלך לשמור.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית