
Qwen3.8-Max לעומת Qwen3.7-Max: שתי דרגות Max, 16 נקודות מדד, ומבצע שהופך את המחיר
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 495 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 186 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
לפני ארבעה ימים, הספק אמר לנו שQwen3.8-Maxאינו המודל שהוא סיפק באוגוסט. בהודעה לעיתונות מיום 22 בספטמבר 2026, מכנס Apsara בהאנגג'ואו, החברה חשפה שהדגם המוביל שלה השלים 33 מחזורים איטרטיביים של עבודת אימון ופוסט-אימון אוטומטית לחלוטין במשך יותר מחודש, ושהגרסה שנוצרה העלתה את ה-Artificial Analysis Intelligence Index שלה מ-40 ל-45. מזהה המודל מעולם לא השתנה. המספר שעומד מאחוריו כן.
זה הכי חשוב במקום אחד ספציפי: ההשוואה בין Qwen3.8-Max ל-Qwen3.7-Max, שכבת ה-Max שאותה הוא החליף. Qwen3.8-Max הגיע לזמינות כללית ב-3 באוגוסט 2026; Qwen3.7-Max הושק במאי. על הנייר זה נראה כמו הכרעה דורית קלה — דגל חדש יותר, ציון גבוה יותר, ממשיכים הלאה. המספרים מספרים משהו מביך יותר. השכבה הישנה יותר מהירה פי שלושה עד ארבעה, זולה בערך פי חמישה לכל משימה שהושלמה, וזהה לחדשה יותר במבחני ידע טהור. השכבה החדשה יותר היא מולטימודלית, טובה בהרבה בעבודה סוכנית, וזולה יותר במחירון הבינלאומי. איזו מהן כדאי לכם להפעיל תלוי בשאלה שרוב ההשוואות מדלגות עליה: אם אתם קונים ידע או קונים קריאות לכלים.
מה שהגילוי של Apsara למעשה טוען
הגילוי הוא הצהרת ספק, שפורסמה על ידי Alibaba באתר העיתונות שלה, ויש לקרוא אותה ככזו. מה שהיא אומרת הוא ספציפי: במהלך יותר מחודש של ריצות אוטומטיות לחלוטין שכללו תכנון פייפליין, אימות נתונים, ניסויים איטרטיביים ואבחון תקלות, Qwen3.8-Max השלים 33 מחזורים, ואופטימיזציה אוטונומית של האימון יחד עם טכניקות לאחר-אימון הניבו את השינוי בציון. Alibaba תיארה גם ניסוי שני בתכנון שבבים, שבו המודל הפעיל יותר מ-60 שעות של שיפור עצמי לאורך מחזור חיים של תכנון, ביצע יותר מ-10,000 קריאות לכלי EDA, והפיק מודולי אפיק שבביים ברמת ייצור תוך הקטנת שטח השבב ב-42% ללא פגיעה מוצהרת בביצועים. כל זה הוא התיאור של Alibaba את המודל שלה עצמה, ולא שוחזר על ידי איש מחוץ לחברה.
תנועת הציון עצמה, לעומת זאת, אינה טענה של ספק. האינדקס הוא של Artificial Analysis, והציון 45 נמצא בעמוד של אותו צד שלישי עבור Qwen3.8 Max (0902). הציון 40 שממנו הוא זז נמצא בעמוד של אותו ארגון עבור הבנייה מ-3 באוגוסט, שכעת מסומנת כלא נתמכת ומצביעה קדימה אל הנוכחית. כך שהדלתא היא סיבה שדווחה על ידי הספק ושהוצמדה לאפקט שנמדד באופן עצמאי, וזה מעמד חזק יותר מכל אחד מהחצאים לבדו. זה גם, נכון לכתיבת שורות אלה, הראיה הציבורית הקונקרטית ביותר שיש למישהו לכך שמעבדת חזית הזיזה את היכולת הנמדדת של הדגם המוביל שלה בלי לשחרר מספר גרסה חדש.
שני דברים נוספים בנוגע לשחרור קל לפספס, ושניהם קריטיים. ראשית, Alibaba אישרה שQwen 4 נמצא באימון, כאשר סדרות Qwen 4.5 ו-Qwen 5 צפויות להתרחב ל-5–10 טריליון פרמטרים. שנית, קיימת תמונת מצב מתוארכת של המודל המחודש. Alibaba קבעה את הבילד שלאחר האימון בתור qwen3.8-max-0902 ב-2 בספטמבר, והוא ניתן לניתוב בנפרד. הצמדה הזו היא התשובה המעשית לכל מה שהגילוי של RSI מרמז עליו, ונחזור אליה.
לוח התוצאות
שישה ממדים, שני הצדדים, עם שמירה מפורשת על משמעת איתור המקורות, מפני ששתי העמודות אינן מאומתות באותה מידה.
• חלון הקשר — Qwen3.8-Max 1,000,000 טוקנים לעומת Qwen3.7-Max 1,000,000 טוקנים (זהה)
• פלט מקסימלי — 131,072 טוקנים לעומת 131,072 טוקנים לפי דפי המודל של Alibaba עצמה (זהה; שימו לב שדף הקטלוג שלנו עבור Qwen3.7-Max מציין 64,000, אי-התאמה שאנו מסמנים ולא מטשטשים)
• אופני קלט — טקסט, תמונה ווידאו לעומת טקסט בלבד
• מחיר מחירון בין-לאומי למיליון טוקנים — $2.00 קלט / $6.00 פלט לעומת $2.50 קלט / $7.50 פלט; אותו מחירון כבר מחייב את שני המודלים $1.65 / $4.951 בבייג'ינג, בפרנקפורט ובווירג'יניה
• Artificial Analysis Intelligence Index — 45 לעומת 29
• מהירות פלט עצמאית — 39.7 טוקנים/שנייה לעומת 211.3 טוקנים/שנייה, נמדדת מול אותה כיתת השוואה של 211 מודלים, כאשר Artificial Analysis מדרגת את השכבה החדשה כאיטית באופן ניכר ואת הישנה כמהירה באופן ניכר
שתי השורות האחרונות הן המאמר כולו. באותה משפחת מדדים, הדרג החדש יותר מוביל ב-16 נקודות. במהירות, הוא מפגר ביותר מפי חמישה.

מאיפה מגיעות 16 הנקודות — ומאיפה הן לא מגיעות
פצל את ה-Index לחלקיו, וצורת השדרוג תתבהר — והיא אינה הצורה שהשיווק מציע.
בידע ובהסקה, שני המודלים למעשה שווים. GPQA Diamond: 92.8 לעומת 92.3. Humanity's Last Exam: 43.1 לעומת 40.5. שליפה בהקשר ארוך: 80.33 לעומת 79. SciCode: 52.1 לעומת 49.5. אם עומס העבודה שלך הוא מענה על שאלות מתוך מאגר גדול, הקפיצה הדורית היא שגיאת עיגול. לשלם פי כמה על זה יהיה קשה להצדיק.
בעבודה סוכנית ובכתיבת קוד, הפער נפתח חזק. Terminal-Bench 2.1: 88.76 לעומת 74.53. מדד הקידוד של Artificial Analysis: 76.2 לעומת 66. והפער הגדול ביותר בקבוצה הוא משימת שימוש בכלים בנקאיים, שבה Qwen3.8-Max רושם 47.84 מול 11.75 של Qwen3.7-Max — פער של פי ארבעה בדיוק ביכולת שתיאור ה-RSI אומר שהמחזורים האוטומטיים ביצעו בה אופטימיזציה: תכנון פייפליין, אימות נתונים, ניסויים איטרטיביים, אבחון שגיאות. מודל שמבלה חודש בשיפור לולאת האימון של עצמו הוא מודל שהשתפר בלולאות.
הסתייגות כנה אחת בנוגע לשורות הבודדות האלה. שני עמודי המודלים שייכים לאותה משפחת מהדורות של Intelligence Index (v4.3 ו-v4.3.2), מה שהופך את ההשוואה הכותרתית של 45 מול 29 להוגנת. השורות ברמת כל מבחן בנפרד אינן מאותה קבוצה: הנתונים ברמת המשימה של Qwen3.7-Max מגיעים מחלון ההערכה של מאי, ואילו אלה של Qwen3.8-Max מגיעים מסדרת ספטמבר. קראו את כיוון המגמה, לא את הספרה המשמעותית השלישית.
שאלת המחיר היא שתי שאלות
במחירון הבינלאומי של אליבאבא, ה-Max החדש זול יותר מזה שהוא החליף: $2.00 / $6.00 עבור Qwen3.8-Max לעומת $2.50 / $7.50 עבור Qwen3.7-Max, למיליון טוקנים. הורדה של 20% בשני הכיוונים ככל שהדור מתקדם היא יוצאת דופן וראויה לציון בפני עצמה. גם כלכלת המטמון מעדיפה את השכבה החדשה יותר — מטמון משתמע ב-$0.25 לעומת $0.50, קריאת מטמון מפורשת ב-$0.17 לעומת $0.25.
זו השאלה הראשונה, ויש לה תשובה אזורית שרוב הסיקור משטח. Alibaba גובה משני המודלים $1.65 קלט / $4.951 פלט בבייג'ינג, בפרנקפורט ובווירג'יניה. פער של 20% קיים רק בכרטיס הבינלאומי של סינגפור. אם התעבורה שלך מגיעה לשלושת האזורים האחרים, אסימוני קלט ופלט עולים אותו דבר עבור שני מסלולי Max היום, וההחלטה מצטמצמת ליכולת טהורה — ובשלב הזה המודל החדש יותר מנצח בכל דבר מלבד תפוקה, ולא נותרה שום אריתמטיקה לעשות.
השאלה השנייה היא המלכודת. Qwen3.7-Max לא עולה כיום 2.50$ / 7.50$. הוא מוגש ב-$1.25 / $3.75 — חצי מהמחיר הרשמי, תעריף מבצעי. זה הופך את דרגת הדור הקודם לאפשרות הזולה יותר היום, בפער ניכר. זה גם אומר שהמחיר שאפשר למדוד השבוע אינו המחיר שאליו תתחייבו. בעמוד המודל של אליבאבא נאמר בפשטות שהטבלה המפורסמת מציגה תמחור מקורי "ללא מבצעים לזמן מוגבל" ומפנה אתכם לקונסולה להצעות עדכניות. מבצע הוא, מעצם הגדרתו, תעריף שיכול להסתיים. אם הוא יסתיים, Qwen3.7-Max לא רק הופך ליקר יותר ממה שהוא היום; הוא הופך ליקר ב-25% מהמודל שמנצח אותו.
אנחנו מעבירים את תעריף הספק הלאה במרווח של 0%, כך שגם מחיר המחירון וגם המבצע פעילים אצלנו באותו יום שבו הם משתנים — מה שנוח להשוואה ולא מועיל אם אתם מנסים לתכנן תקציב. בנו את המודל לפי כרטיס המחירון, והתייחסו לתעריף המבצעי כרווח פוטנציאלי.

המספר שהופך את טיעון העלות
מחיר טוקן אינו מה שעולה משימה. Artificial Analysis מפרסמת נתון עלות-לכל-משימה שכולל בתוכו את כלכלת המטמון, נפח החשיבה ואורך התשובה, ולפי מדד זה הדירוג מתהפך לחלוטין: 5.41 דולר לכל משימת Intelligence Index עבור Qwen3.8-Maxלעומת 1.15 דולר עבור Qwen3.7-Max. תוספת של פי 4.7, לעומת תעריף טוקנים שזול ב-20% או זהה, בהתאם לאזור שלך.
הפער הוא בעיקרו אריכות דברים. באותה הערכה, המודל החדש יותר יצר 190M טוקנים של פלטבעוד שהמודל הישן יותר יצר 120M, והוא מנמק באריכות כדי להגיע לתשובותיו. אם אתם משלמים לפי טוקן פלט עבור עומס עבודה בנפח גבוה בדרגת קושי בינונית, ה-Max החדש יותר אינו המודל הזול יותר בכל מחיר טוקן באף אחד משני לוחות התעריפים. הוא היקר יותר, ומחיר המחירון של הטוקן הוא הכלי הלא נכון להכריע בכך.
מהירות, ומה שהתנועה שלנו עצמה מראה
הפער בתפוקה גדול מספיק כדי לשנות ארכיטקטורות. Artificial Analysis ממקמת את Qwen3.8-Max בקצב של 39.7 אסימונים לשנייה — הסיכום שלה מכנה את המודל איטי במיוחד — לעומת 211.3 עבור Qwen3.7-Max, שאותו היא מכנה מהיר במיוחד. זה ההבדל בין מודל שאתם שמים מאחורי משטח אינטראקטיבי לבין אחד שאתם שמים מאחורי תור — וב-Qwen3.8-Max זה הדבר הראשון שפאנל הסטטיסטיקות שלנו מציג לכם.
הטלמטריה שלנו מסביבת הניסוי במהלך שבעת הימים עד 25 בספטמבר מספרת סיפור קצת יותר מורכב לגבי זמן השהיה, והיא מגיעה עם הסתייגות: אלו המדידות שלנו על הניתוב שלנו, לא מבחן ביצועים מבוקר. Qwen3.8-Max הציגה חציון של 2,611 מילישניות עד לתגובה הראשונה בקצב של 54.7 אסימונים לשנייה עם שיעור שגיאות של 2.45%; הבנייה המוצמדת 0902 הציגה חציון של 3,360 מילישניות בקצב של 46.2 אסימונים לשנייה עם שיעור שגיאות נקי יותר באופן בולט של 0.66%. Qwen3.7-Max עמדה על חציון של 4,509 מילישניות אך בקצב של 169.8 אסימונים לשנייה עם שיעור שגיאות של 3.80%. אז השכבה הישנה יותר עונה לאט יותר בהתחלה ואז מזרימה מהר פי שלושה, תוך שהיא נכשלת לעתים קרובות יותר. אם עומס העבודה שלכם מאופיין בפרצים, ההבדל הזה בשיעור השגיאות ראוי ליותר תשומת לב מאשר החציון.
שתי הרמות פעילות על מפתח OrcaRouter אחד לצד תמונת המצב המוצמדת, עם מעבר אוטומטי בין ספקים. בהשוואה כזו, זו הנקודה המעשית: מדידת הפרומפטים שלך מול שני דורות ה-Max היא שינוי תצורה, לא חוזה שני.

יכולת השחזור היא כעת הגורם המכריע
הנה החלק בגילוי של Apsara שאיש לא תמחר. מזהה מודל חי שהיכולת הנמדדת שלו נעה מ-40 ל-45 במהלך חודש, בלי שינוי גרסה ובלי הודעה באותה עת, הוא סכנת שחזוריות. אם התנהגות המוצר שלך היא פונקציה של מזהה משתנה, יש לך מודל שיכול להשתפר — או להשתנות — מתחת לחבילת הערכה קפואה, ספריית פרומפטים במטמון, או סט רגרסיה מאושר.
שני הדורות מציעים תמונות מצב מתוארכות, וזו ההקלה. Qwen3.7-Max מתועד על ידי Alibaba כשקול תפקודית ל-qwen3.7-max-2026-05-20, עם בניות מתוארכות נוספות ב-2026-05-17 וב-2026-06-08. ל-Qwen3.8-Max יש qwen3.8-max-0902, הבנייה מספטמבר שעברה אימון-המשך, וזה מה ש-45 מתייחס אליו. אם אתם משלחים משהו שצריך להיות ניתן לשחזור, נעצו את המזהה המתוארך והתייחסו לזה הצף כיעד סטייג'ינג. מחזורי ה-RSI הם תכונה של המזהה הצף; הנעיצה היא הדרך שבה אתם בוחרים לצאת מהם.
פרט מינוח אחד שכדאי להכיר כדי שלא תטעו בקריאת הקטלוג. Alibaba מפרסמת צורה מתוארכת שלישית, qwen3.8-max-2026-09-02, לצד הכינוי 0902; הם מתייחסים לאותו בילד. הגרסה המקורית מ-3 באוגוסט אינה ניתנת עוד לניתוב מצדנו — אנו מגישים את Qwen3.8-Max, את נעיצת 0902, ואת Qwen3.7-Max.
מי צריך לבחור מה
ההחלטה לא נחלקת בשאלה איזה דגם טוב יותר. היא נחלקת בשאלה מה אתה קונה.
הישארו עם Qwen3.7-Max אם עומס העבודה שלכם הוא טקסטואלי בלבד, עתיר-ידע ולא עתיר-כלים, ורגיש לתפוקה — סיווג בהיקף גבוה, חילוץ, אחזור הקשר ארוך, סיכום באצוות. ב-GPQA Diamond ובאחזור הקשר ארוך הוא נמצא במרחק של נקודה אחת מהמודל החדש יותר, הוא זורם מהר פי שלושה עד ארבעה, והוא עולה 1.15$ למשימה לעומת 5.41$. זו גם התשובה הנכונה לכל מי שרוצה חוות דעת שנייה זולה בתצורת מיזוג או ניתוב, כי בתעריף המבצעי שלו מדובר בסיווג מחיר שונה לחלוטין. שתי הסתייגויות: המבצע הוא מבצע, ו-Artificial Analysis כבר סימנה את המודל כמיושן, לאחר שהוחלף ב-Qwen3.8-Max. אל תתחילו עליו התחייבות רב-שנתית.
עברו ל-Qwen3.8-Maxאם אחד מהתנאים הבאים מתקיים: אתם זקוקים לקלט תמונה או וידאו, שאותו Qwen3.7-Max אינו מקבל כלל; עומס העבודה שלכם הוא סוכני, עם שרשראות ארוכות של קריאות לכלים או לולאות קידוד רב-שלביות, שבהן 88.76 מול 74.53 ב-Terminal-Bench 2.1 והפער פי ארבעה בשימוש בכלים הם ההבדל בין לשחרר לבין לא לשחרר; או שאתם כותבים לפי כרטיס התעריפים הבינלאומי של סינגפור, שבו המודל החדש פשוט זול ב-20% ואין שיקול לאזן. הצמידו qwen3.8-max-0902אם אתם זקוקים לכך שההתנהגות תישאר יציבה.
אם אתם בבייג'ינג, פרנקפורט או וירג'יניה, הבחירה ברורה יותר מכפי שכל השוואה מרמזת: שתי רמות ה-Max עולות $1.65 / $4.951 למיליון טוקנים. זהה. בתעריפים האלה, לא לשלם תוספת עבור קלט מולטימודלי, מדד גבוה ב-16 נקודות וציון שימוש בכלים טוב פי ארבעה אינו החלטה — זה בחינם, והסיבה היחידה להישאר עם Qwen3.7-Max הופכת לתפוקה גולמית.
שתי שאלות ששווה לענות עליהן ישירות
האם ריצת האימון בת 33 מחזורים אומרת שהמודל השתנה תחת תעבורת API קיימת? לכך מרמזת החשיפה, ולכן קיימת הנעיצה המתוארכת. עליבאבא מתארת את המודל המשופר כ"ה-Qwen3.8-Max המעודכן", שזהו המזהה הצף, ולא מזהה חדש. אם היו לכם עומסי עבודה על המזהה הצף במהלך ספטמבר, הם קיבלו שירות ממודל שהיכולת הנמדדת שלו השתנתה במהלך אותו חלון זמן. עליבאבא לא פרסמה יומן שינויים עבור גרסאות הביניים, ולכן הדרך האמינה היחידה לדעת איזו התנהגות יש לכם היא לנעוץ.
האם הטענה בדבר RSI מאומתת באופן בלתי תלוי? הציון שהיא הפיקה — כן: ה-Index הוא של Artificial Analysis, וה-45 מופיע בעמוד שלהם. המנגנון שמאחוריו הוא התיאור של Alibaba עצמה את תהליך האימון שלה, בלי שכפול חיצוני, בלי פרוטוקול הערכה מפורסם, ובלי צד שלישי שצפה ב-33 המחזורים. התייחסו ל"33 מחזורים איטרטיביים" כאל טענת ספק ולמונח "45 אחרי 40" כאל זוג מדיד. אלה אינם אותו סוג של הצהרה, וההבדל הוא הסיבה לכך ששווה לקרוא את הכותרת בעיון במקום לחזור עליה.
הדבר הבא שכדאי לשים לב אליו אינו Qwen 4. אלא האם מבצע החצי-מחיר של Qwen3.7-Max ישרוד את הגעתו של המודל שאמור להחליף אותו. אם הוא לא ישרוד, צוותים רבים מאוד יגלו שהם השוו מחיר מחירון מול הנחה, ושהאח המבוגר מבין השניים היה היקר יותר לכל אורך הדרך.
