
סקירת Qwen3.8-Max: דגל ה-2.4T של עליבאבא ב-$2/$6 — Build 0902 מוביל ב-Code Arena WebDev
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
Alibaba Qwen הציגה בתצוגה מקדימה את Qwen3.8-Max בוועידת ה-AI העולמית בשנגחאי ב-19 ביולי 2026, ובמשך שבועיים היה המודל המדובר ביותר שאף אחד לא יכול היה למעשה לתמחר. לא היה מחירון, לא טבלת benchmark, לא כרטיס מודל, לא רישיון, ולא מספר פרמטרים פעילים — רק כותרת של 2.4 טריליון פרמטרים וטענה שהמודל נמצא "שני רק ל-Claude Fable 5."
ב-3 באוגוסט 2026, זה השתנה. Qwen3.8-Max זמין כעת בגרסת GA: כרטיס מחיר מפורסם של 2 דולר למיליון אסימוני קלט ו-6 דולר למיליון אסימוני פלט, נקודת קצה תואמת OpenAI ו-DashScope, טבלת בנצ'מרקים מלאה, ומשקלים פתוחים ששוחררו ב-12 באוגוסט. כעבור שבוע, ב-14 באוגוסט, הוא עלה לאוויר ב-DigitalOcean Serverless Inference כשותף ההשקה "Day 0" של Alibaba — הענן המערבי הגדול הראשון שהנגיש אותו. ב-2 בספטמבר, Alibaba שחררה גרסה מעודכנת בשם Qwen3.8-Max-0902, שעברה אימון המשך (post-training) נוסף על Coding ו-Cowork, שלפי Qwen משפר ביצועים בעבודה ארגונית ומדעית מורכבת. סקירה זו נכתבה לאור עובדות ה-GA, תוך שילוב השקת יום האפס ובניית 0902, והיא עונה על השאלה שבאמת מעסיקה צוותים עכשיו כשאפשר כבר לרכוש את המודל: האם Qwen3.8-Max מוכן לקלוט תעבורת ייצור, או שהוא עדיין מודל למעקב בלבד?
התשובה הקצרה היא שהוא התקדם רחוק יותר מכפי שרוב האנשים ציפו — התמחור, במיוחד, אגרסיבי באופן שמתמחר מחדש את החזית כולה, ועדכון ה‑2 בספטמבר שם דגש כפול על שני הדברים שהמודל כבר היה טוב בהם — כתיבת קוד ועבודה שיתופית. כרטיס הניקוד העצמאי שהתפרסם מאז הוא טוב באמת, אבל הוא נושא עמו הסתייגות שחשוב לקרוא לפני שמפנים אליו תעבורה.
בקצרה: Qwen3.8-Max זמין כעת באופן כללי (GA) במחיר של $2/$6 לכל מיליון טוקנים, קבוע לאורך כל הקונטקסט של מיליון הטוקנים ללא תוספת תשלום על הנחיות ארוכות — מחיר נמוך משל Kimi K3 ($3/$15) ושל Claude Opus 5 ($5/$25) על הפלט, שהוא גורם העלות המרכזי בעבודת הנמקה. אליבאבא פרסמה טבלת אמות־מידה מרשימה (Terminal-Bench 2.1: 86.6, GPQA Diamond: 92.6, OSWorld-Verified: 86.1), והזינוק ביכולות הקידוד לעומת קודמו דרמטי: FrontierSWE 73.5 לעומת 40.7. אבל טבלת האיכות היא של אליבאבא עצמה, והשופט הבלתי־תלוי הראשון — מדד ה־Artificial Analysis Intelligence Index — כבר נתן את חוות דעתו: Qwen3.8-Max משיג 56 נקודות בעלות של $1.14 למשימה, בשוויון עם Claude Opus 4.8 (56) ונקודה אחת מתחת למוביל במשקלים פתוחים, Kimi K3 (57), בעלות גבוהה ב־25% למשימה. מספר הפרמטרים הפעילים אינו עוד סימן שאלה: 95B מופעלים מתוך 2.4T בסך הכול, אושר בגיליון הנתונים הרשמי של המודל — מה שמאפשר סוף־סוף לגורמים חיצוניים לחשב את הכלכלה של הפעלת המודל. מאז שסקירה זו פורסמה לראשונה נפתח גם מסלול מנוהל שני: Qwen3.8-Max עלה לאוויר ב־DigitalOcean Serverless Inference ב־14 באוגוסט כשותף Day 0 של אליבאבא, עם נתוני שרת שפרסמה DigitalOcean — prefill בקנה מידה של ~16,000 טוקנים לשנייה וכ־1,937 טוקני פלט לשנייה תחת 256 בקשות במקביל ועם אפס שגיאות — נתוני השהיה הקשיחים הראשונים מספק שאינו אליבאבא. ב־2 בספטמבר רעננה אליבאבא את דגל הדגל כ־Qwen3.8-Max-0902, לאחר אימון נוסף על Coding ו־Cowork; Qwen טוענת שהתמונת החדשה חזקה יותר בעומסי עבודה ארגוניים ומדעיים מורכבים — טענה של ספק ללא נתונים בלתי־תלויים עדיין בתחום הארגוני או המדעי. בצד הקידוד, למבנה 0902 יש כעת תוצאת arena בלתי־תלויה משלו: Qwen3.8-Max-0902 הופיע לראשונה במקום הראשון בלוח Code Arena: WebDev עם 1,691 נקודות — עלייה של 22 נקודות לעומת המבנה הקודם ולפני Claude Opus 5 ו־Kimi K3 — לפי אליבאבא, בצטטה את לוח ה־arena החיצוני החי. לסיפור המסחר הסוכני (agentic-commerce) נוסף לוח תוצאות באותו שבוע: ב־CommerceAgentBench, אמת־מידה חדשה מצוות Accio של אליבאבא הבנויה על רפליקות מבוססות־מצב של תוכנות מסחר אמיתיות, Qwen3.8-Max מציג את התוצאה החזקה ביותר מבין הדגמים עם משקלים פתוחים — 156 מעברים מצטברים בשלושה harnesses, שתיים לפני DeepSeek V4 Pro — טבלה בהפקת הספק, לא שופט בלתי־תלוי. פסק הדין: באמת ניתן לרכישה עכשיו, וזול מספיק כדי להצדיק הערכה אמיתית — אבל צריך לנתב אותו בכוונה, לא בסיטונאות.
נקודות עיקריות
• GA מאז 3 באוגוסט 2026. עידן קמפיין התצוגה המקדימה והקרדיטים הסתיים; יש מחירון אמיתי ונקודת קצה אמיתית.
• $2 / $6 לכל מיליון טוקנים, מדרגת מחיר אחת אחידה לרוחב הקשר של מיליון. רוב המתחרים גובים תוספת תשלום עבור הנחיות ארוכות. אליבאבא לא, וזה משמעותי מאוד לעבודה עם מסמכים ארוכים ומאגרי קוד גדולים.
• טבלת הבנצ'מארקים של Alibaba חזקה אך לא מבוקרת: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.
• הקפיצה הדורית בקידוד היא הסיפור האמיתי: FrontierSWE 73.5 (מ-40.7) ו-DeepSWE 1.1 56.6 (מ-21.6) — כמעט הכפלה בשניהם.
• הציון העצמאי הראשון כבר כאן: Qwen3.8-Max קיבל 56 במדד AA Intelligence Index במחיר של $1.14 למשימה — קפיצה של 10 נקודות מעל Qwen3.7-Max (46), שווה ל-Claude Opus 4.8 (56), בנקודה אחת מאחורי Kimi K3 (57). בלוח המובילים הכללי של LMArena עדיין אין ציון פומבי.
• פרמטרים פעילים אושרו ב-95B — כרטיס המודל הרשמי מציין 2.4T בסך הכול ו-95B מופעלים, ובכך נסגרת השאלה הפתוחה הגדולה ביותר בחישובי עלות ההרצה.
• המשקלים הפתוחים יצאו — Qwen3.8-2.4T-A95B (BF16) ו-Qwen3.8-2.4T-A95B-FP8 נחתו ב-Hugging Face ב-12 באוגוסט תחת רישיון Qwen3.8-Max מותאם אישית, לא Apache 2.0. מסלול ה-on-premise של Qwen3.8-27B שוחרר ב-14 באוגוסט תחת Apache 2.0.
• מסלול מנוהל שני נפתח ב-14 באוגוסט. Qwen3.8-Max זמין כעת ב-DigitalOcean Serverless Inference כשותף ההשקה "Day 0" של עליבאבא — NVFP4 על NVIDIA HGX B300, במחיר של $2/$6 עם קלט שמור ב-$0.20, ומוגש בהקשר המקורי של 262K של נקודת הבדיקה הפתוחה. הנתונים שנמדדו ב-DigitalOcean (prefill של כ-16K tokens/שנייה, אפס שגיאות ב-256 במקביליות) הם נתוני ביצועי השירות הראשונים על פלטפורמה מנוהלת מחוץ לעליבאבא.
• עדכון 2 בספטמבר: Qwen3.8-Max-0902. Alibaba המשיכה לאמן את מודל הדגל על Coding ו-Cowork, ומגישה אותו ב-QwenCloud באותם $2/$6 ובהקשר של 1M. Qwen טוענת שהביצועים הארגוניים והמדעיים חזקים יותר — עדיין רק טענות היצרן — בעוד שצד הקידוד השיג באותו יום תוצאת זירה עצמאית: הגרסה הופיעה לראשונה במקום הראשון ב-Code Arena: WebDev עם 1,691 (פירוט Code Arena בהמשך).
• CommerceAgentBench: מוביל דגמי המשקל הפתוח, בהרצת ספק. צוות Accio של Alibaba שחרר השבוע את CommerceAgentBench — 107 משימות ארוכות-טווח בתוך העתקים שומרי מצב של תוכנות מסחר ועסקים אמיתיות, שמוערכות לפי מצב על פני סביבות ההרצה Accio, OpenClaw ו-Pi. Qwen3.8-Max מוביל את דגמי המשקל הפתוח עם 156 מעברים מצטברים, שניים לפני DeepSeek V4 Pro; המודל הסגור Claude Opus 5 מוביל בסך הכול עם 191, והטבלה היא של Alibaba עצמה, לא של שופט בלתי תלוי.
• Code Arena: WebDev #1 — תוצאת הזירה העצמאית של ה-build 0902.Qwen3.8-Max-0902 ערך את הופעת הבכורה שלו בראש טבלת Code Arena: WebDev עם 1,691 נקודות — עלייה של 22 נקודות מה-build הקודם, ולפני Claude Opus 5 ו-Kimi K3 — והוא מוביל את גבול פארטו של עלות-ביצועים של אותה טבלה במחיר משולב של כ-5 דולר ל-MToken, שהם כרבע מהמחיר המשולב של Claude Opus 5. החשבון הרשמי של Qwen, QwenCloud, אישר את המיקום. בניגוד ל-CommerceAgentBench, הטבלה הזו היא של צד שלישי: זירת הצבעה אנושית עיוורת, לא טבלה של אליבאבא, אף ש'הופעת בכורה במקום הראשון' היא הכרזה של אליבאבא על דירוג המשקף נקודת זמן מסוימת.
הערת דיוק: טבלת המדדים של Qwen3.8-Max בסקירה זו מדווחת על ידי עליבאבא ולא שוחזרה באופן בלתי תלוי. ציון מדד הבינה של Artificial Analysis (56 ב-$1.14 למשימה) נמדד באופן בלתי תלוי על ידי AA דרך ה-API הרשמי של עליבאבא — השופט הבלתי תלוי הראשון של המודל. התמחור לקוח מכרטיס התעריפים GA של Alibaba Model Studio. מאגרי המשקולות הפתוחים (Qwen3.8-2.4T-A95B ו-Qwen3.8-2.4T-A95B-FP8), הנתון של 95B פעילים וטקסט הרישיון הם מצד ראשון: הם מגיעים מארגון Hugging Face של Qwen עצמו, ואומתו ב-13 באוגוסט 2026. זמינות DigitalOcean, כרטיס התעריפים שלה, מדידות ביצועי השרת ובדיקת ה-GPQA הנקודתית של 88 על המבנה המכומת מגיעות מהמסמכים ומהמדריך הקהילתי של DigitalOcean עצמה, שפורסמו לצד ההכרזה של 14 באוגוסט; התיאור "שותפת השקה ביום 0" הוא לשון ההכרזה של עליבאבא. היכן שאנו מצטטים נתונים של מתחרים, הם מגיעים מ-Artificial Analysis או מהספק שצוין באופן ישיר. עדכון Qwen3.8-Max-0902 שהוכרז ב-2 בספטמבר מצוין כולו על ידי הספק: המפרטים שלו, תיאור האימון המשלים Coding-and-Cowork, והרווחים הארגוניים והמדעיים שנטענו — כולם מגיעים מההכרזה של Qwen עצמה ומדף המודל QwenCloud שלה, ואף אחד מהנתונים שלו לא שוחזר באופן בלתי תלוי. המיקום ב-Code Arena: WebDev המכוסה בפרק המדדים הוא החריג היחיד: לוח זה הוא זירת הצבעה עיוורת של צד שלישי, ולא טבלה של עליבאבא — אף ש"הופעת בכורה במקום 1 עם 1,691" היא הכרזה של עליבאבא על רשימה נקודתית בזמן, וציוני הזירה ממשיכים לזוז ככל שמצטברות הצבעות. תוצאת CommerceAgentBench המכוסה להלן היא באותה קטגוריה: המדד נבנה ופורסם על ידי Accio, הצוות של Alibaba International, ולכן הטבלאות שלו מדווחות על ידי עליבאבא — מדד בקוד פתוח, אבל לא שופט בלתי תלוי כמו Artificial Analysis. טבלאות מדדים של ספקים נוטות בדרך כלל לאופטימיות — התייחסו אליהן כאל השערה שכדאי לבדוק על עומס העבודה שלכם, ולא כדירוג סופי.

מה זה Qwen3.8-Max?
Qwen3.8-Max הוא דגל משפחת Qwen של אליבאבא: מודל sparse Mixture-of-Experts עם 2.4 טריליון פרמטרים בסך הכול, חלון הקשר של 1M טוקנים, וקלט מולטימודלי מקורי. הוא מקבל טקסט, תמונות ווידאו, ומחזיר טקסט. הוא תומך במצב חשיבה, קריאות פונקציות, כלים מובנים ותפוקות מובנות, והוא מוגש דרך נקודת קצה תואמת OpenAI: /v1/chat/completions, כך שרוב האינטגרציות הקיימות זקוקות לשינוי בכתובת base-URL בלבד, ולא לשכתוב. תמונת הייצור הנוכחית, ששוחררה ב-2 בספטמבר, היא Qwen3.8-Max-0902, אשר עברה אימון נוסף על Coding ו-Cowork.
המספרים המעשיים בהקשר ספציפיים מעט יותר מהשיווקי "1M". מטא-הנתונים בענן של אליבאבא מפרטים חלון של 983,616 טוקנים עם חשיבה מופעלת, קלט מקסימלי של כ-991K טוקנים, ו-פלט מקסימלי של 131,072 טוקנים. תקרת הפלט הזו נדיבה במיוחד וחשובה למשימות כמו יצירת קוד מלא לקובץ או ניסוח דוחות ארוכים, שבהן תקרות נמוכות יותר מאלצות אותך לפצל ולתפור. נקודת הביקורת הפתוחה ש-DigitalOcean משרתת כעת היא תצורה שונה: כרטיס המודל שלה מפרט 262,144 טוקנים במקור, הניתנים להרחבה עד לכ-1,010,000, כך ששרת צד-שלישי שמריץ את הבסיס הפתוח ינחת בדרך כלל על המספר המקורי הקטן יותר.
ספירת הפרמטרים הפעילים היא כעת פומבית, ושם המאגר נושא אותה: {{1}}A95B פירושו 95 מיליארד מופעלים{{/1}}. כרטיס המודל הרשמי של Qwen3.8-2.4T-A95B מציין {{2}}"2.4T בסך הכול ו-95B מופעלים"{{/2}}, Mixture-of-Experts עדין עם 512 מומחים, מתוכם 10 מנותבים ועוד אחד משותף פעילים לכל טוקן. המספר הזה חשוב יותר מכותרת ה-{{3}}2.4T{{/3}} הראשית. עבור מודל צפוף, סך הפרמטרים אומר לך בערך מה עלות ההסקה; עבור מודל MoE, הם לא אומרים כמעט כלום — רק מספר הפרמטרים הפעילים חשוב, כי זה מה שבאמת רץ לכל טוקן. מודל 2.4T שמפעיל 30B מתנהג באופן שונה לחלוטין, מבחינת השהיה ובכלכלת השרתים, ממודל שמפעיל 200B. ב-{{4}}95B פעילים{{/4}}, החישוב לכל טוקן נופל באותו סדר גודל כמו של מודל צפוף סביב רף ה-90B — שבריר ממה שמודל 2.4T צפוף היה דורש — וזה המספר שלבסוף הופך את שאלת האירוח העצמי שלמטה לניתנת לתשובה.
עדכון ה-2 בספטמבר: Qwen3.8-Max-0902
ב-2 בספטמבר 2026, Qwen השיקה את רענון הייצור הראשון בעל השם שלה. Qwen3.8-Max-0902 שומר על אותה ארכיטקטורת sparse-MoE עם 2.4T פרמטרים, אותם 95B פרמטרים פעילים, ואותו חלון הקשר של 1M טוקנים, אבל הוא אומן נוסף על שתי יכולות — Coding ו-Cowork — והוא זמין ב-API של QwenCloud תחת השם qwen3.8-max-0902 (המופיע גם כ-qwen3.8-max-2026-09-02). זהו המבנה המומלץ הנוכחי, לא ענף צדדי: נקודת הקצה הלא-מתוארכת qwen3.8-max של אליבאבא מחזירה כעת את תמונת המצב 0902, כך שקריאה לשם הדגם הסטנדרטי נוחתת על הרענון, בעוד שהמזהה המתוארך קיים עבור צוותים שרוצים לנעול את המבנה המדויק. החל מ-3 בספטמבר, תמונת המצב רשומה גם כמזהה דגם ניתן לניתוב משלה בממשקי API מנוהלים של צד שלישי. כרטיס התעריפים לא השתנה: $2 למיליון טוקני קלט, $6 למיליון טוקני פלט, עם אותם תעריפי cache.
טענות הביצועים הן של Qwen. ההכרזה ודף המודל של QwenCloud מתארים יכולת קידוד ש"פורצת דרך חדשה" בפרויקטים בקנה מידה הנדסי ובפיתוח אוטונומי לטווח ארוך, חוויית סוכן שיתופית "משופרת משמעותית" בתיאום רב-כלי ובמסירת משימות מקצה לקצה, ו — כפי שהחברה מנסחת זאת — ביצועים חזקים יותר במשימות ארגוניות מורכבות, במחקר מדעי ובתהליכי עבודה ארוכי טווח. הבדיקה העצמאית הראשונה פורסמה באותו יום. Qwen3.8-Max-0902 הופיע לראשונה במקום הראשון בלוח Code Arena: WebDev — זירת הצבעה עיוורת של צד שלישי לפיתוח web סוכני, הפרויקט שנודע בעבר בשם WebDev Arena — עם 1,691 נקודות, עלייה של 22 נקודות לעומת הגרסה הקודמת, ולפני Claude Opus 5 ו-Kimi K3, לפי Alibaba, שציטטה את הלוח החי — מיקום שהחשבון הרשמי של Qwen אישר באותו היום, תוך הפנייה ל-API של QwenCloud. מה זה מוכיח ומה זה לא מוכיח — נפרש בחלק מדדי הביצועים להלן. יתר טענות העדכון — חשיבה ארגונית, עבודה מדעית ואוטונומיה כללית לטווח ארוך — עדיין מוצהרות על ידי הספק, אז שמרו על המשמעת שנהגה לגבי טבלת אוגוסט: התייחסו אליהן כהשערה עד שבדיקה של Artificial Analysis או עומס עבודה אמיתי יאשרו אותן.
מה ש-"Cowork" אומר בפועל הוא הנקודה שבה העדכון הופך למעניין. Qwen3.8-Max מתקופת ה-GA כבר נשען על אוטונומיה ארוכת-טווח — בניית ה-oh-my-cli שארכה 16 ימים, העסק הווירטואלי עם למעלה מ-2,000 סבבים — ובניית ה-0902 היא אליבאבא שמכפילה את ההימור על הציר הזה: סוכנים שמתזמנים כלים מרובים ומבצעים משימה מקצה לקצה, במקום תשובות חד-פעמיות. באותו שבוע, צוות Accio של אליבאבא פרסם את CommerceAgentBench, benchmark שתוכנן למדוד את הציר הזה ישירות: 107 משימות ארוכות-טווח בתוך העתקים מצביים (stateful) של תוכנות מסחר ועסקים אמיתיות, שם Qwen3.8-Max מוביל את תחום המודלים עם המשקולות הפתוחות — כפי שמפורט בפרק ה-benchmark להלן. עבור צוותים שבוחנים את המודל לעבודה ארגונית, זו הטענה שצריך לבחון ראשונה, כי היא גם הקשה ביותר לאימות מתוך טבלת benchmark.
תמחור: הדבר האגרסיבי ביותר בהשקה הזו
Alibaba Model Studio מפרט את Qwen3.8-Max במחיר של $2.00 לכל 1M אסימוני קלט ו-$6.00 לכל 1M אסימוני פלט. הפלט כולל אסימוני חשיבה, וזה חשוב מכיוון שתצורות עתירות חשיבה מחייבות את החשיבה הפנימית שלהן בתעריף הפלט. כלכלת מטמון: פגיעות קלט במטמון עולות $0.25 לכל 1M, יצירה מפורשת של מטמון $2.50, וקריאות מפורשות של מטמון $0.17.
החלק המעניין מבחינה מבנית אינו המספר הראשי, אלא זהו הנדבך השטוח. עליבאבא גובה את אותם $2/$6 בין אם ההנחיה שלך היא 5,000 טוקנים ובין אם 900,000. רוב המתחרים גובים תוספת מחיר עבור קונטקסט ארוך, דווקא משום שהגשת הנחיה של כמעט מיליון טוקנים היא יקרה. עליבאבא שבולעת את העלות הזו מהווה מהלך מכוון של תפיסת שוק, המכוון דווקא לעומסי העבודה שבהם קונטקסט ארוך הוא הנקודה: סקירת קוד של מאגר שלם, ניתוח חוזים והגשות, וסינתזה של מחקר רב-מסמכים.
דוגמה מעובדת. נניח שאתה מריץ סוכן לניתוח מאגר קוד: 200,000 טוקני קלט של הקשר קוד ו-8,000 טוקני פלט לכל קריאה.
• לכל קריאה: 0.2M × $2 = $0.40 קלט, ועוד 0.008M × $6 = $0.048 פלט. ≈ $0.45 לכל קריאה.
• ב-1,000 שיחות ליום: ≈ $448 ליום, או בערך $13,400 לחודש.
• אותה קריאה מול Claude Opus 5 ב-$5/$25: $1.00 + $0.20 = $1.20 — בערך פי 2.7 יותר.
• עם אחסון הנחיות במטמון על הקשר קוד יציב, קלט שנשמר במטמון במחיר $0.25 מוריד את צד הקלט מ-$0.40 ל-$0.05, כך שהקריאה עומדת על ≈ $0.10 — הפחתה של כמעט 4.5× על תעבורה חוזרת.
הפרש המחירים הזה במטמון הוא המקום שבו נמצא התקציב האמיתי. אם הסוכן שלך קורא מחדש קונטקסט שכמעט לא השתנה בכל סיבוב — וזה מתאר את רוב סוכני הקידוד והתמיכה — המחיר האפקטיבי קרוב הרבה יותר ל-$0.25/$6 מאשר ל-$2/$6. צוותים שמדלגים על הגדרת המטמון משלמים בדרך כלל פי 3–4 יותר על המודל הזה.
לשם השוואה במחירי מחירון: Qwen3.8-Max $2/$6; קודמו שלו Qwen3.7-Max $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. בקלט, Qwen הוא רק תחרותי. בפלט — הצד השולט בהוצאות בעבודת reasoning ואג'נטית — הוא המודל הזול ביותר ברשימה זו שטוען למעמד frontier.
המדידה העצמאית של Artificial Analysis חושפת את הצד השני של הטוקנים הזולים האלה. במדד ה-Intelligence Index שלה, Qwen3.8-Max עולה $1.14 למשימה — יותר מכפול מ-$0.53 של קודמו, וגבוה ב-25% מ-$0.86 של Kimi K3 למרות ש-Kimi K3 מפרסם מחיר של $3/$15 לטוקן. הפער הוא התנהגותי, לא העלאת מחיר: המודל השיג בממוצע 64 צעדים למשימת GDPval-AA לעומת 14 עבור Qwen3.7-Max, ובגלל שמסגרת הבדיקה שולחת מחדש את כל השיחה בכל צעד, טוקני הקלט גדלו בערך פי 15 והפלט בכ-45%. טוקנים זולים לא שווים סוכנים זולים — לפטפטנות שבודקי התצוגה המקדימה ציינו יש עכשיו תג מחיר נמדד. מכיוון ש-OrcaRouter מעביר את מחירי המחירון בתוספת 0% מאחורי נקודת קצה אחת תואמת OpenAI, השאלה של $1.14 לעומת $0.86 היא משהו שניתן למדוד על פניות זהות בלי חוזה שני.

טבלת המדדים, ומה כל מספר מודד בפועל
במועד השחרור הכללי, אליבאבא פרסמה את הטבלה שמנעה בתצוגה המקדימה. הציונים המדווחים:
• Terminal-Bench 2.1 — 86.6.בודק אם מודל יכול להפעיל מעטפת אמיתית עד לסיום: להריץ פקודות, לקרוא פלט, ולהתאושש משגיאות. זהו המדד הקרוב ביותר ל"האם הוא יכול לתפקד כסוכן קוד במקום כמציע קוד."
• GPQA Diamond — 92.6.שאלות ברמת תואר מתקדם בפיזיקה, כימיה וביולוגיה שנכתבו כך שיהיה קשה לשלוף את תשובותיהן. ציון גבוה מצביע על חשיבה מדעית אמיתית ולא על שינון. 92.6 הוא הציון המוביל בתחום כיום.
• PaperBench — 93.0.שחזור תוצאות ממאמרי מחקר — קריאת מתודולוגיה ומימוש מחדש שלה. מתגמל הבנה רב-שלבית מתמשכת.
• IFBench — 82.8.ציות להוראות תחת אילוצים: פורמט, אורך, והוראות שליליות. ראוי לציין שזהו הציון הנמוך ביותר בטבלה של עליבאבא עצמה, מה שעולה בקנה אחד עם התלונה מתקופת התצוגה המקדימה שהמודל יסודי עד כדי התעלמות ממגבלות היקף.
• OSWorld-Verified — 86.1. שימוש במחשב: נהיגה בממשק משתמש גרפי שולחני אמיתי כדי להשלים משימות. החוזק כאן תומך במיצוב הסוכני.
• OmniDocBench 1.5 — 92.1. ניתוח מסמכים — טבלאות, עימוד, טקסט מעורב ואיורים. משתלב עם חלון הקשר של 1M בתעריף קבוע כדי לבסס טיעון אמיתי למערכות עיבוד מסמכים.
• FrontierSWE — 73.5, לעומת 40.7 של קודמתה. DeepSWE 1.1 — 56.6, לעומת 21.6.
שני אלה האחרונים ראויים להדגשה. הכפלות כמעט במדדי הנדסת תוכנה מאתגרים בדור אחד אינן רווחים מצטברים נורמליים, והן עקביות עם החלטתה של Alibaba לשווק את המודל הזה למפתחים ולא למשתמשי צ'אט. אם הנתון של FrontierSWE ישרוד שכפול עצמאי, Qwen3.8-Max הוא מודל קידוד רציני ולא רק מודל גדול.
ההסתייגות שצוינה בתצוגה המקדימה הצטמצמה, אך לא נעלמה.הטבלה שלעיל הופקה על ידי Alibaba, על גבי תשתית בדיקה משלה, בתנאים שאיש אינו יכול לבחון.טבלאות ספקים נבחרות, לא נדגמות — מעבדות מפרסמות את אמות המידה שבהן הן מצליחות. אבל החל מ-6 באוגוסט יש כעת שופט בלתי-תלוי אמיתי: Artificial Analysis דירגה את Qwen3.8-Max בציון 56 במדד Intelligence Index תמורת $1.14 למשימה, שנמדד על ה-API הרשמי של Alibaba — קפיצה של 10 נקודות לעומת 46 של קודמו, בשורה אחת עם Claude Opus 4.8 (56), ונקודה אחת מאחורי Kimi K3 (57). בלוח ה-GDPval-AA האג'נטי של AA, המודל מגיע ל-1,739 Elo, ועוקף את Kimi K3 (1,685) ואת GPT-5.6 Sol (1,730), כשרק Claude Opus 5 (1,852) לפניו. להסתייגויות של AA עצמה מגיע משקל דומה: ריצה מוקדמת יותר הניבה ציון 53 לפני שנפתרו בעיות נקודת הקצה, והבדיקה החוזרת מול ה-API הרשמי הניבה 56; ציון AA-Omniscience ירד ב-10 נקודות עקב שיעור הזיות שעלה מ-23% ל-40%; והעלות למשימה גבוהה דווקא משום שהמודל מבצע מספר גבוה בהרבה של שלבים. לוח התוצאות הכללי של LMArena עדיין אינו מציג ציון ציבורי.
ההשקה של DigitalOcean הוסיפה נקודת נתונים שלישית, הפעם על הגרסה המכומתת במקום גרסת הדגל. הבדיקה המדגמית הפנימית של DigitalOcean עצמה על משקלי ה-NVFP4 שהיא משרתת השיגה88 במבחן GPQA Diamond, לעומת 92.6 שפרסמה Alibaba עבור גרסת הדגל הלא-מכומתת. DigitalOcean עצמה מתייגת את ההשוואה כ"נקודת נתונים אינדיקטיבית ולא השוואה מבוקרת" — ההבדלים נעים על שלושה צירים (בסיס משקלים פתוחים במקום גרסת הדגל המוגשת, NVFP4 במקום BF16, ומחסנית הערכה שונה) — אבל זוהי הבדיקה העצמאית הראשונה על פריסת שירות אמיתית של משקלים אלה, ותזכורת לכך שהצ'קפוינט הפתוח אינו תואם בייט-בייט למספר שבטבלה של Alibaba.
CommerceAgentBench: לוח התוצאות של מסחר סוכני
לצד העדכון, צוות Accio של אליבאבא אינטרנשיונל (Alibaba International) השיק את CommerceAgentBench, benchmark שתוכנן להעריך בדיוק את העבודה ארוכת הטווח שקוון (Qwen) ממשיכה לשווק. סוכן מתחיל כל משימה בתוך קונטיינר חדש באחת מ-14 סביבות העתק לא־מקוונות של תוכנות מסחר ועסקים אמיתיות — פרסום מוצרים, הזמנת הובלה, ניהול חנות, פעולות תשלום וניתוח ספקים — וההערכה מבוססת מצב: משימה עוברת רק אם שירותי ה-mock והקבצים שמופקים בפועל אכן משתנים, ולכן סוכן שמתאר תהליך עבודה סביר בלי לשנות את המצב לא מקבל ניקוד. הסוויטה כוללת 107 משימות על פני ממשקי CLI, דפדפן, קבצים/מסמכים ו־API/MCP, ומופעלת דרך שלוש תשתיות הרצה — Accio, OpenClaw ו־Pi — וקוד תשתיות ההרצה (Apache 2.0) ונתוני המשימות (CC BY 4.0) פתוחים לעיון או להרצה חוזרת.
בטבלאות שפורסמו, Qwen3.8-Max מציגה את התוצאה החזקה ביותר בקרב דגמי המשקל הפתוח: 56 מתוך 107 משימות במתקן Accio, 47 ב-OpenClaw, ו-53 ב-Pi — 156 מעברי צבירה, שניים לפני DeepSeek V4 Pro עם 154. כל היתרון של המשקל הפתוח מגיע ממתקן Accio; שני הדגמים בשוויון ב-OpenClaw וב-Pi. מובילת המשקל הפתוח אינה המובילה הכללית: דגם הסגור Claude Opus 5 חוצה את השדה עם 191 מעברי צבירה, 35 לפני. והטבלה היא של עליבאבא עצמה — Accio הוא הצוות של עליבאבא, והמאגר עצמו מסמן את מגבלות הביקורת: מתקן Accio הוא לעיון בלבד ואינו ניתן לשחזור מתוך חילוץ (checkout) — OpenClaw הוא המסלול בר-ההרצה החוזרת; תוצאות ברמת משימה חסרות צ'ק-סכומים ציבוריים בלתי ניתנים לשינוי; והשורות של Qwen הסתמכו על פרוטוקול שידור חוזר של תוכן הנמקה כדי להישאר דומות. התייחסו לכך כאל נקודת נתונים המוצהרת על ידי הספק על אותו ציר סוכני ש-OSWorld-Verified וגישת ה-GDPval-AA של AA נוגעות בו מזוויות שונות — ראוי לבחון מול זרימות העבודה שלכם, לא דירוג מגובש.
Code Arena WebDev: השופט העצמאי של ה-build 0902
Code Arena היא פיסת הראיות העצמאית שחסרה לעדכון. זהו לוח מובילים של צד שלישי לפיתוח web אגנטי — הפרויקט שנודע בעבר בשם WebDev Arena — שבו הצבעות אנושיות עיוורות, בזוגות, על איזה פלט של מודל המשתמשים היו מעדיפים לשחרר, מומרות לדירוג בסגנון Elo. בלוח ה-WebDev שלה, Qwen3.8-Max-0902 הופיע לראשונה בראש עם 1,691 נקודות, עלייה של 22 לעומת הגרסה הקודמת, ולפני Claude Opus 5 ו-Kimi K3. למיקום יש גם יתרון עלות-תועלת: במחיר משולב של כ-$5 למיליון טוקנים — תעריף רשימה של $2/$6 המשוקלל לטובת התמהיל הכבד בפלט שפיתוח אפליקציות web בפועל מייצר — הגרסה 0902 היא המודל בעל הציון הגבוה ביותר בחזית פארטו של הלוח, בעלות של כרבע מהמחיר המשולב של ~$20 למיליון של Claude Opus 5, והרבה מתחת ל-~$12 למיליון של Kimi K3, וזו הסיבה ששני אלה נמצאים מחוץ לחזית למרות שהם מדורגים במקומות 2 ו-3 לפי הציון. Alibaba הכריזה על המיקום ב-2 בספטמבר והחשבון הרשמי של Qwen אישר אותו, והפנה משתמשים ל-QwenCloud; המדידה אינה של Alibaba: בניגוד לטבלת ה-benchmark שלמעלה או להרצת CommerceAgentBench שממש מעל, ציון זה מופק על ידי זירה של צד שלישי מהצבעות העדפה אנושיות.
שני סייגים שומרים על האמינות. ראשית, דירוגי הזירה הם נקודתיים בזמן: 1,691 הוא המצב שבו עמד הלוח כשאליבאבא הכריזה על ההשקה, והוא ייסחף ככל שיצטברו קולות, אז יש לקרוא אותו כאיתות חזק בנוגע לקידוד פיתוח אתרים, ולא ככתר קבוע. שנית, הוא מכסה רק את הציר האחד הזה. לטענות העדכון בנוגע להיבטים הארגוניים, המדעיים והכלליים לטווח ארוך עדיין אין שופט בלתי תלוי, ולכן טבלת הספקים ומדד ה‑AA Index 56 על דגם הבסיס נותרו נקודות הייחוס לכל מה שמחוץ לעבודה פרונטלית‑סוכנותית. שלישית, מחיר החזית הוא בחירת מודל, לא כרטיס תעריפים חדש: הנתון של כ‑5 דולר למיליון טוקנים ממזג את המחירון הבלתי משתנה של 2/6 דולר תחת הנחת שימוש כבד בפלט, ולכן יש להתייחס אליו כדירוג יעילות‑עלות במונחי הזירה עצמה, ולא כתמחור מחדש מצד אליבאבא.

משקלים פתוחים, Qwen3.8-27B, ושאלת ההתקנה המקומית
הבטחת המשקלים הפתוחים של אליבאבא קוימה כעת. ב-12 באוגוסט 2026 פרסמה Qwen שני מאגרים ב-Hugging Face — Qwen3.8-2.4T-A95B ב-BF16 ו-Qwen3.8-2.4T-A95B-FP8 — כל אחד עם 213 קבצי משקל. הרישיון הוא רישיון Qwen3.8-Max מותאם אישית, לא Apache 2.0; שדה הרישיון ב-Hugging Face מציג "other". התנאים מתירים שימוש, שינוי, הפצה וכוונון עדין, כולל שימוש מסחרי, עם ייחוס, ובנוסף שני שערים מבוססי גודל: מוצרים עם למעלה מ-100 מיליון משתמשים פעילים חודשיים או הכנסה חודשית של למעלה מ-20 מיליון דולר חייבים להציג את שם המודל באופן בולט, ועסקים בתחום Model-as-a-Service או AI-Work-Assistant עם הכנסה מצטברת של למעלה מ-50 מיליון דולר ב-12 החודשים האחרונים זקוקים לרישיון נפרד מ-Qwen. רוב הצוותים נמצאים מתחת לשערים אלה; אם העסק שלך חוצה אותם, קרא את נוסח הרישיון לפני שאתה בונה עליו. מוני ההורדות מאשרים את הרעננות — 978 במאגר BF16 ו-3,851 במאגר FP8 נכון לכתיבת שורות אלה, נמוך לשחרור מוביל ועולה בקנה אחד עם מאגר שנוצר ב-8 באוגוסט ונחשף לציבור רק ב-12 באוגוסט, לא כזה שהיה גלוי במשך שבוע. עוד הערת כנות: נקודת הבדיקה הפתוחה היא המודל הבסיסי, טקסט בלבד עם חשיבה תמיד מופעלת, בעוד שה-API המארח של Qwen3.8-Max מוסיף קלט ראייה, מצב אי-חשיבה אופציונלי, והקשר מלא של 1M — הורדת המשקולות נותנת לך את המודל, לא את כל תכונות ה-API.
אירוח עצמי של מודל הדגל עדיין אינו בהישג ידם של רוב הצוותים, אבל כעת הוא אינו בהישג יד עם מתמטיקה ידועה. מערך המשקולות המלא של 2.4T פרמטרים הוא בערך 4.9TB ב-BF16 וכ-2.4TB ב-FP8, מכיוון שכל מומחה חייב להיות טעון בזיכרון אף שרק 95B מופעלים לכל טוקן. בקוונטיזציה של 4 ביט מדובר בסדר גודל של 1.2TB לעומת כ-141GB ל-H200, כך שמדובר בשמונה מאיצים מתקדמים או יותר לפני שמגישים טוקן בודד. מה שספירת ההפעלה שפורסמה כעת מוסיפה הוא הצד של התפוקה: עם 95B מופעלים לכל טוקן, החישוב לכל טוקן דומה למודל דחוס במחלקה של ~90B — חלק מהעלות שמודל דחוס של 2.4T היה מטיל — כך שברגע שהמשקולות טעונות בזיכרון, העלות לכל טוקן אינה הסיוט שמספר הפרמטרים הכולל מרמז עליו. השילוב הזה של טביעת זיכרון גדולה וחישוב מתון לכל טוקן הוא בדיוק הסיבה שאליבאבא יכולה לתמחר פלט ב-$6/1M, והוא מכוון צוותי אירוח עצמי לצמתים מרובי GPU עם צ'קפוינטים של FP8 במקום לכל דבר עם GPU בודד.
בחירת ההגשה של DigitalOcean היא דוגמה מעשית למתמטיקה הזו בייצור. היא מריצה את המודל עם קוונטיזציה של NVFP4 על GPUs מסוג NVIDIA HGX B300, במפורש כדי שמשקלי ה-2.4T יתאימו על צומת יחיד, ובכך נמנע ניתוב מומחים בין צמתים — הטמעה חיה של כלכלת ה-4-bit שפרק זה עסק בה על הנייר. הפשרה היא בדיוק זו שבדיקת ה-GPQA שלמעלה מכמתת: טביעת רגל קטנה יותר, במחיר מדיד מסוים באיכות לעומת דגם הדגל ללא קוונטיזציה.
וזה מה שהופך את Qwen3.8-27B לשחרור המשמעותי יותר עבור רוב הקוראים — ובניגוד לדגם הדגל, המשקולות שלו הגיעו לפי לוח הזמנים. ב־14 באוגוסט 2026 פרסמה Qwen את Qwen/Qwen3.8-27B ב־Hugging Face וב־ModelScope תחת רישיון Apache 2.0: מודל צפוף (dense) עם 27B פרמטרים, מולטי־מודאלי באופן מובנה, עם חלון הקשר מקורי של 262K טוקנים הניתן להרחבה עד 1M, ומצב reasoning_effort הניתן להגדרה. דניאל האן מ־Unsloth העריך שהמודל יפעל בכ־17GB של VRAM — כרטיס גרפי פרוסומר יחיד — ועכשיו אפשר לבחון זאת בפועל: המאגר הרשמי כולל קבצי safetensors בפורמט BF16 (כ־55.6GB על פני 18 shards), ובעקבותיהם מגיעות גרסאות GGUF מוקוונטטות (quants) במאגרים קהילתיים. כך שדפוס השחרור של הדור הזה הושלם עכשיו: המשקולות של דגם הדגל 2.4T הגיעו ראשונות ב־12 באוגוסט, והמודל הקטן למסלול ה־on-premise הגיע יומיים לאחר מכן. עקבנו אחר השחרור שלו בפוסט על תאריך השחרור של Qwen3.8-27B.
היכן Qwen3.8-Max משתלב: ארבעה תרחישים
1. ניתוח מסמכים ארוכים וחוזים. זהו ההתאמה החזקה ביותר. תעריף אחיד על פני 1M טוקנים בתוספת OmniDocBench 92.1 פירושו שתוכל להעביר מסמך בן 400 עמודים בקריאה אחת ללא תוספת תשלום וללא חלוקה למקטעים. מתחרים שגובים פרמיה עבור הקשר ארוך הופכים את אותה משימה ליקרה יותר באופן משמעותי. במסלול של DigitalOcean, זכור שמסלול זה משרת את הבסיס הפתוח עם הקשר של 262K — עדיין מסמך גדול, אבל לא מיליון מלא.
2. סוכני קידוד בקנה מידה של מאגר קוד.Terminal-Bench 86.6 ו-FrontierSWE 73.5 תומכים בכך, ותמחור המטמון הופך עבודה איטרטיבית על בסיס קוד יציב לזולה. הדבר הראשון שצריך לבדוק הוא זמן האחזור תחת ריבוי הבקשות שלך, משום שמבקרי תקופת התצוגה המקדימה מצאו שהמודל יסודי אך איטי בריצות סוכן ארוכות, ושרת GA שונה משרת תצוגה מקדימה. התוצאה של AA ב-GDPval-AA — Elo מוביל של 1,739 במחיר של 64 צעדים למשימה — היא האישור העצמאי לשני חצאיו של אותו מחיר־תועלת. המדידות של DigitalOcean מה-12 באוגוסט — תפוקה מצטברת שקרובה לליניאריות עד ל־~1,937 אסימוני פלט לשנייה עם 256 בקשות מקבילות, ללא שגיאות וללא רוויה שנמצאה — הן נקודת הנתונים הראשונה מפלטפורמה מנוהלת בסוגיה זו, אם כי הן מדידות של DigitalOcean עצמה על השרת שלה, ולא השוואה ישירה מול Alibaba.
3. צינורות עיבוד למסמכים וצילומי מסך.קלט וידאו ותמונה, יחד עם OSWorld-Verified 86.1, הופכים אותו לאמין עבור זרימות עבודה שקוראות מסכים — אוטומציית QA, מיון פניות תמיכה מצילומי מסך, משימות סמוכות ל-RPA. שוב, הקלט הרב-מודאלי הוא תכונה של API מתארח; הנתיב בעל הבסיס הפתוח של DigitalOcean הוא טקסט בלבד.
4. היכן שעדיין לא נמקם אותו. UX אינטראקטיבי קריטי להשהיה וכל עומס עבודה מוסדר הדורש הערכה ניתנת לשחזור. לגבי הראשון, אתה רוצה תפוקה נמדדת שאתה שולט בה. לגבי השני, לשחזוריות יש כעת כרטיס מודל ורישיון לצטט, אבל טבלת הבנצ'מרק של Alibaba עדיין לא שוחזרה — והרגרסיה של Omniscience של AA (שיעור הזיות של עד 40%) היא תזכורת לכך שהציון העצמאי פועל לשני הכיוונים.

כיצד לגשת ל-Qwen3.8-Max
יש כמה דרכים מעשיות. גישה ישירה דרך Alibaba Model Studio / DashScope — או דרך QwenCloud API של Qwen — מעניקה לך את המחירון שמופיע למעלה ואת הגישה המוקדמת ביותר לגרסאות מתוארכות חדשות — גרסת Qwen3.8-Max-0902 מ-2 בספטמבר הופיעה שם לראשונה לפני שהופצה לשאר נקודות הקצה — במחיר של הוספת ספק חדש וניהול מפתח נוסף. Qwen Chat ואפליקציית Qwen הן הדרך המהירה ביותר לבחון את ההתנהגות לפני כתיבת קוד. הורדת המשקלים הפתוחים מ-Hugging Face היא דרך רביעית עבור צוותים שרוצים להפעיל תשתית משלהם — בכפוף להסתייגויות בנוגע לגודל ולרישיון שצוינו למעלה. ניתוב דרך ראוטר הוא האופציה שרוב צוותי הפרודקשן צריכים לשקול, משום שהוא מפריד בין החלטת ההגירה להחלטת ההערכה.
מאז 14 באוגוסט 2026, יש אפשרות חדשה באמת: Qwen3.8-Max זמין ב-DigitalOcean Serverless Inference, שהכריזה Alibaba עליו כשותף ההשקה 'Day 0' — המסגור של Alibaba עצמה, אם כי הרישום הוא של DigitalOcean ועומד בפני עצמו. DigitalOcean מגיש את הצ'קפוינט של המשקולות הפתוחות (מזהה מודל בפלטפורמה: qwen3.8-max), מכומת ב-NVFP4 על מעבדי NVIDIA HGX B300 GPU בשיתוף פעולה טכני עם Inferact, כ-API ללא שרתים מנוהל במלואו: נקודת קצה אחת, תמחור מבוסס שימוש, ללא תשתית לניהול. כרטיס התעריפים שלו תואם לרשימה של Alibaba — 2.00$ לקלט / 6.00$ לפלט לכל 1M, עם קלט במטמון במחיר של 0.20$ — והוא משרת את הקונטקסט הטבעי של הבסיס הפתוח, קונטקסט 262K, עם חשיבה תמידית, במקום המצב המולטימודאלי של דגם הדגל המארח, בעל כ-1M טוקנים. תקרת הקונטקסט הזו חשובה אם עומס העבודה שלך נוטה לקצה הארוך: המצב המלא של מיליון טוקנים נשאר זמין רק ב-API של Alibaba.
מה שנתיב DigitalOcean מוסיף מעבר לגאוגרפיה הוא נתוני ה-serving המוצקים הראשונים מספק שאינו Alibaba. המדידות של DigitalOcean עצמה מול נקודת הקצה בייצור שלה, שבוצעו ב-12 באוגוסט, מראות שקצב ה-prefill הוא ליניארי ועומד על כ-16,000 טוקנים לשנייה — כלל אצבע: TTFT ≈ (קלט ÷ 16,000) + 0.7 שניות, כלומר ~1.1 שניות ב-~1,080 טוקנים ו~15.8 שניות ב-~254K — והתפוקה המצטברת מגיעה ל-~1,937 טוקני פלט לשנייה ב-256 בקשות במקביל עם אפס שגיאות וללא נקודת רוויה שנמצאה. אלה המספרים של DigitalOcean על ההתקנה שלה עצמה, לא השוואה מבוקרת, אבל הם נתוני השהיה ומקביליות הראשונים על המודל הזה מחוץ לענן של Alibaba, והם נוגעים ישירות לחשש "יסודי אבל איטי" מתקופת התצוגה המקדימה.
Qwen3.8-Max זמין ב-OrcaRouter בתור qwen/qwen3.8-max, וגרסת ה־2 בספטמבר ניתנת לניתוב תחת מזהה מתוארך משלה — qwen/qwen3.8-max-0902 — בשני המקרים באותו תעריף מחירון: $2.00 / $6.00. OrcaRouter מוסיף 0% מרווח ומעביר את תמחור הספק ישירות, כך שהמסלול בשני המקרים עולה כמו פנייה ישירה. הטלמטרייה של השרת שלנו מראה כרגע p50 של 1.64 שניות בזמן עד לטוקן הראשון, על פני חלון של 7 ימים. זוהי מדידת חביון פנימית, לא טענת ספק, וכדאי לשקול אותה מול הדיווחים מתקופת התצוגה המקדימה על "המודל האיטי ביותר שבו השתמשתי": הם הגיעו מסוקר יחיד שהריץ בניות סוכן (agentic builds) במשך שעה על תשתית תצוגה מקדימה, ויש לבדוק אותם שוב מול שירות ה-GA במקום לחזור עליהם כעובדה עדכנית.
הערך המעשי של נתיב הנתב הוא ש-Qwen3.8-Max יושב מאחורי אותה נקודת קצה תואמת OpenAI כמו המודלים שאתם כבר מריצים, כך שההערכה היא פשוט שינוי של מחרוזת המודל. אתם יכולים לנתב אליו 5% מהתעבורה היצרנית, להשוות אותו מול המודל הנוכחי על אותם פרומפטים, ולשמור על גיבוי — וזו בדיוק העמדה הראויה למודל עם טבלת ספק שאינה משוכפלת. אותה עמדה היא גם הדרך הנכונה לבדוק את הפריסה ב-DigitalOcean: להריץ מולה נתח תעבורה עם גיבוי פעיל, במקום להמר על נתיב ייצור עם מחסנית שרתים בת שבועיים בלבד.

מגבלות וסיכונים כנים
• טבלת הספקים עדיין לא מבוקרת. הציון העצמאי קיים (AA Index 56), אבל טבלת הייחוס של Alibaba עצמה עדיין לא שוכפלה, והמדידה של AA מצביעה על רגרסיית Omniscience עם שיעור הזיות של עד 40%. ניקוד עצמאי עוזר; הוא אינו הופך את טבלת הספקים לניתנת לביקורת.
• הנתיב של DigitalOcean הוא הבסיס הפתוח, לא מוצר הדגל. הוא משרת את הצ'קפוינט בהקשר של 262K, טקסט בלבד, חשיבה תמיד פעילה, עם קוונטיזציה של NVFP4 — וציוני הבדיקות הנקודתיות של DigitalOcean עצמה שמגיעים ל-88 ב-GPQA Diamond לעומת 92.6 שפורסמו על ידי Alibaba, פער ש-DigitalOcean מכנה אינדיקטיבי ולא מבוקר. אם אתם צריכים את ה-API המולטי-מודאלי המלא עם מיליון טוקנים, הוא עדיין מתארח אצל Alibaba.
• Qwen3.8-27B שוחרר, אבל המספור הוא של הספק. משקלי המודל 27B שוחררו ב-14 באוגוסט תחת רישיון Apache 2.0, ובכך נסגר הפער בפריסה מקומית (on-premise) — אך טענות הבנצ'מרק שלו מבוססות על דיווחי Alibaba בלבד ולא שוכפלו, וגרסאות הקוונטיזציה של הקהילה עדיין היו בשלבי השקה נכון לעדכון זה.
• רישיון מותאם אישית, לא Apache 2.0. הרישיון של Qwen3.8-Max מאפשר שימוש מסחרי עם ייחוס, אך כולל שני שערי קנה מידה — הצגת שם מודל בולט מעל 100M משתמשים פעילים חודשיים או $20M הכנסה חודשית, ורישיון נפרד לעסקי MaaS/עוזר-עבודה בינה מלאכותית מעל $50M הכנסה ב-12 החודשים האחרונים. קרא אותו לפני שתחצה את הרפים.
• אריכות יתר וסטייה מההוראות.IFBench 82.8 הוא המספר החלש ביותר בטבלה של עליבאבא עצמה, ובודקי תצוגה מקדימה ראו שוב ושוב את המודל חורג מההיקף — מוסיף תכונות שלא ביקשו. המספרים של AA עצמה מכמתים את זה: 64 צעדים לכל משימת GDPval-AA הם מה שדוחף את העלות ל-1.14 דולר, 25% מעל Kimi K3. מקסים בהדגמה, יקר כשהפלט מחויב ב-6 דולר ל-1M, ומערער יציבות כשיש צורך בפורמטים מדויקים.
• מגבלות תוכן. כמו מודלים פורצי דרך אחרים המתארחים בסין, התגובות בנושאים רגישים פוליטית מוגבלות. רלוונטי אם המוצר שלך משרת שאילתות פתוחות.
• טוקני חשיבה מחויבים כפלט. עם חשיבה מופעלת, העלויות האמיתיות גבוהות מההערכות הנאיביות. מדדו עם חשיבה מוגדרת כפי שתשחררו אותה בפועל.

שאלות נפוצות
האם Qwen3.8-Max זמין כעת?
כן. הוא הגיע לזמינות כללית ב-3 באוגוסט 2026, עם כרטיס תעריפים שפורסם ו-API תואם ל-OpenAI ול-DashScope. תמונת הייצור הנוכחית — Qwen3.8-Max-0902, ששוחררה ב-2 בספטמבר — פעילה ב-API של QwenCloud והיא מה שנקודת הקצה הסטנדרטית qwen3.8-max משרתת כעת. זהו שינוי מסטטוס התצוגה המקדימה שלו מ-19 ביולי, אז הגישה הוגבלה ל-Qwen Chat, לאפליקציית Qwen ולקמפיין הקרדיטים של Qoder.
מה זה Qwen3.8-Max-0902?
Qwen3.8-Max-0902 הוא רענון הייצור מ-2 בספטמבר 2026 של Qwen3.8-Max: אותו דגל sparse-MoE בעל 2.4 טריליון פרמטרים ואותו חלון הקשר של מיליון טוקנים, עם אימון נוסף על Coding ו-Cowork, והוא חי ב-API של QwenCloud באותם $2/$6. Qwen אומרת שתמונת המצב החדשה חזקה יותר במשימות ארגוניות ומדעיות מורכבות — טענה של הספק, שטרם נבדקה באופן בלתי תלוי — בעוד שבציר הקידוד יש לה כבר תוצאה עצמאית: מקום ראשון בלוח Code Arena: WebDev עם 1,691 נקודות, והראשון בגבול פארטו של עלות-ביצועים בעלות משולבת של כ-$5 למיליון טוקנים, לפי הודעת אליבאבא על הרישום החי בזירה, שאושרה על ידי חשבון ה-QwenCloud של Qwen עצמה.
כמה עולה Qwen3.8-Max?
$2.00 לכל מיליון טוקנים של קלט ו-$6.00 לכל מיליון טוקנים של פלט, במחיר אחיד על פני ההקשר המלא של מיליון טוקנים ללא תוספת תשלום עבור פרומפט ארוך. כניסות קלט במטמון עולות $0.25 למיליון, יצירת מטמון מפורשת $2.50, וקריאות מטמון $0.17. טוקני חשיבה מחויבים בתעריף הפלט. במדד האינטליגנציה של Artificial Analysis, העלות הנמדדת של המודל היא $1.14 למשימה — ראו סעיף התמחור להסבר מדוע מדובר בחריגה מהחשבון על פי הטוקנים. הנתיב ללא שרת של DigitalOcean מציג את אותם $2/$6 עם קלט במטמון ב-$0.20.
כמה פרמטרים יש ל-Qwen3.8-Max?
2.4 טריליון בסך הכול, בתצורת Mixture-of-Experts דלילה. מספר הפרמטרים הפעילים — המדד שבפועל קובע את עלות ההגשה והשהות — מאושר כעת ב-95 מיליארד מופעלים, לפי כרטיס המודל הרשמי של Qwen3.8-2.4T-A95B (512 מומחים; 10 מנותבים בתוספת מומחה משותף פעיל אחד לכל טוקן).
האם משקלי Qwen3.8-Max פתוחים?
כן — מאז 12 באוגוסט 2026. Qwen פרסמה את Qwen3.8-2.4T-A95B (BF16) ואת Qwen3.8-2.4T-A95B-FP8 ב-Hugging Face, כשכל אחד מהם כולל 213 קובצי משקל. הרישיון הוא רישיון Qwen3.8-Max מותאם אישית (Hugging Face מפרטת אותו כ-"other"), לא Apache 2.0: הוא מתיר שימוש מסחרי עם ייחוס ונושא שני שערי סף מבוססי היקף. הצ'קפוינט הפתוח הוא טקסט בלבד עם חשיבה פעילה תמיד; ה-API המתארח מוסיף ראייה, מצב ללא-חשיבה אופציונלי, וחלון הקשר המלא של 1M.
האם Qwen3.8-Max עבר בדיקת ביצועים עצמאית?
כן — נכון ל-6 באוגוסט 2026. Artificial Analysis נותן לה ציון 56 במדד האינטליגנציה שלו במחיר של 1.14$ למשימה, שנמדד על ה-API הרשמי של אליבאבא: קפיצה של 10 נקודות מעל Qwen3.7-Max (46), שוויון עם Claude Opus 4.8 (56), ונקודה אחת מאחורי Kimi K3 (57). עם זאת, טבלת ההשוואה שלמעלה נשארת דיווח עצמי של אליבאבא ללא שכפול בלתי תלוי, ובלוח המובילים הכללי של LMArena עדיין אין ציון פומבי. התמונה בזירה הבלתי-תלויה השתנתה ב-2 בספטמבר: גרסת ה-0902 הושקה במקום הראשון בלוח Code Arena: WebDev של אותה פלטפורמה עם 1,691 נקודות — תוצאה של צד שלישי בהצבעה עיוורת, לא טבלה של אליבאבא — וקו גבול העלות-ביצועים של Code Arena מציג אותה כבעלת הערך הגבוה ביותר בלוח במחיר משולב של כ-5$ למיליון טוקנים. הבדיקה הפתעית של DigitalOcean לבנייה המכומתת שלה (88 ב-GPQA Diamond) היא בדיקת הצד השלישי הראשונה על פריסת שרת, והיא במפורש אינדיקטיבית ולא מבוקרת. אזהרה אחת לעמודת ה"בלתי-תלוי": CommerceAgentBench, שבה Qwen3.8-Max מובילה מודלים פתוחי-משקל, אינה שופטת בלתי-תלויה שנייה — Accio, שבנתה ופרסמה אותה, היא הצוות של אליבאבא עצמו.
האם Qwen3.8-Max טוב יותר מ-Qwen3.7-Max?
על פי המספרים של עליבאבא עצמה, באופן מהותי — FrontierSWE 73.5 לעומת 40.7 ו-DeepSWE 1.1 56.6 לעומת 21.6 הם כמעט הכפלה במשימות הנדסת תוכנה קשות. זה גם זול יותר מהמחיר של קודמו, $2.50/$7.50. באופן בלתי תלוי, AA מעריכה את הקפיצה הדורית ב-10 נקודות במדד האינטליגנציה שלה (56 לעומת 46). יש עדיין לאמת את שתי טענות הספקים על עומס העבודה שלכם.
האם אני יכול לארח בעצמי את Qwen3.8-Max?
לא בפועל. מערך המשקולות המלא בגודל 2.4T הוא בערך 4.9TB ב-BF16 וכ-2.4TB ב-FP8, בסביבות 1.2TB ברמת 4-bit — לעומת כ-141GB ל-H200, כלומר שמונה GPUs או יותר מהדרג העליון. עם 95B אקטיביים לכל טוקן, החישוב לכל טוקן נמוך יחסית, אך טביעת הזיכרון היא האילוץ המכריע. שירות ה-NVFP4 של DigitalOcean על B300s הוא ההוכחה המעשית לכך ש-4-bit יכול להכיל את המודל על צומת יחיד. ה-Qwen3.8-27B — על פי הדיווחים כ-17GB של VRAM — הוא האפשרות המציאותית לפריסה מקומית (on-premise), ומשקלי המודל שוחררו ב-14 באוגוסט 2026 תחת רישיון Apache 2.0 — כעת זמין להורדה, לא הבטחה.
מה זה Qwen3.8-27B?
דגם קטן בהרבה שהוכרז לצד דגם הדגל, המוצב כנתיב הפריסה המעשי באתר הלקוח (on-premise). הוא מודל דחוס (dense) בעל 27 מיליארד פרמטרים, רב-מודאלי באופן מובנה, עם הקשר מקורי של 262 אלף טוקנים הניתן להרחבה למיליון, והוא מופץ תחת רישיון Apache 2.0. משקלי המודל עלו ל-Hugging Face ול-ModelScope ב-14 באוגוסט 2026; דניאל האן מ-Unsloth מדווח שהוא רץ בכ-17GB של VRAM — כרטיס צרכני מתקדם יחיד. טענות הביצועים שלו מדווחות על ידי Alibaba ולא שוחזרו באופן בלתי תלוי.
האם Qwen3.8-Max הוא מולטי-מודאלי?
כן — הוא מקבל קלט טקסט, תמונה ווידאו ומחזיר טקסט. הוא גם תומך במצב חשיבה, קריאות לפונקציות, כלים מובנים ופלטים מובנים. הצ'קפוינט עם המשקולות הפתוחים הוא טקסט בלבד; קלט מולטי-מודאלי הוא תכונה של ה-API המתארח, וזה מה שנתיב ה-DigitalOcean אינו כולל.
האם Qwen3.8-Max זמין ב-DigitalOcean?
כן — מאז 14 באוגוסט 2026. DigitalOcean Serverless Inference מגישה את צ'קפוינט המשקלים הפתוחים (NVFP4 על NVIDIA HGX B300) במחיר של $2.00/$6.00 למיליון, עם $0.20 לקלט במטמון, הקשר של 262K אסימונים, טקסט בלבד, וחשיבה תמיד מופעלת. אליבא מכנה את DigitalOcean "שותפת ההשקה Day 0"; הרישום עצמו הוא של DigitalOcean ואינו תלוי בניסוח זה. הנתונים שנמדדו על ידי DigitalOcean: prefill של ~16K אסימונים/שנייה וכ-1,937 אסימוני פלט בשנייה ב-256 בקשות במקביל, עם אפס שגיאות.
האם אני יכול להשתמש ב-Qwen3.8-Max דרך OrcaRouter?
כן. זה פעיל כ-qwen/qwen3.8-max, ותמונת המצב מה-2 בספטמבר זמינה כמזהה משלה הנושא תאריך — qwen/qwen3.8-max-0902 — באותו תמחיר מחירון של $2.00/$6.00, עם 0% תוספת מחיר. הניתוב מתבצע דרך נקודת הקצה התואמת ל-OpenAI שכבר משתמשים בה, ועלותו זהה לעלות פנייה ישירה. הטלמטריה שלנו ל-7 ימים מראה p50 של 1.64 שניות בזמן עד לאסימון הראשון.
האם עליי להעביר אליו היום את תעבורת ה-production?
לא בצורה גורפת. המחיר והציון העצמאי הראשון הופכים הערכה רצינית לזולה וכדאית כבר עכשיו, אבל עם עלות למשימה גבוהה ב-25% מזו של Kimi K3, המהלך הממושמע הוא פיצול תנועה מול הספק הנוכחי שלך על פרומפטים זהים, עם גיבוי במקום — לא הגירה. המסלול של DigitalOcean מוסיף פריסה מנוהלת שנייה שאפשר לבדוק מולה, מה שהופך את ההערכה לזולה עוד יותר.
השורה התחתונה
Qwen3.8-Max בילה שבועיים בתור המודל המעניין ביותר שאיש לא יכול היה לקנות. בגרסת GA (זמינות כללית) הוא מהווה הצעה שונה לחלוטין: תמחור קבוע של $2/$6 לכל מיליון טוקנים הוא תמחור אגרסיבי, תעריפי המטמון הופכים עבודת סוכן איטרטיבית לזולה, והקפיצה הדורית ב-FrontierSWE וב-DeepSWE — אם היא משחזרת את עצמה — הופכת אותו למודל קוד אמיתי, ולא סתם גמישות קנה מידה. הגעת המשקולות הפתוחות תחת רישיון אמיתי ב-12 באוגוסט הפכה את "המשקולות הפתוחות בדרך" מהבטחה לעובדה, ומסלול ה-DigitalOcean שהוכרז ביום ההשקה, 14 באוגוסט — עם מספרי שירות מדודים וקריאת מטמון ב-$0.20 — מחזק את הטענה של "נסו את זה בזול" ומעניק לצוותים פריסה מנוהלת של צד שלישי להשוואה מול ה-API של אליבאבא עצמה. עדכון ה-Qwen3.8-Max-0902 מה-2 בספטמבר שומר על התזה הזו: אותם $2/$6 וקונטקסט של 1M, עם אימון נוסף (post-training) על עבודות הקוד והעבודה השיתופית שהמודל כבר היה ממוצב עבורן. העדכון הוסיף גם לוח תוצאות עצמאי מבוסס העדפות אנושיות עבור אותה טענת קוד: Qwen3.8-Max-0902 הופיע לראשונה במקום ה-#1 בלוח ה-WebDev של Code Arena עם 1,691 נקודות, לפני Claude Opus 5 ו-Kimi K3, ובמחיר משולב של כ-$5 למיליון טוקנים הוא המודל עם הציון הגבוה ביותר בגבול פארטו של עלות-ביצועים באותו לוח. תוצאת ה-CommerceAgentBench שפרסם צוות Accio של אליבאבא באותו שבוע — Qwen3.8-Max מוביל את תחום המשקלות הפתוחות על אמת מידה שנבנתה מעבודה מסחרית אמיתית — מעניקה לתזה של עבודה שיתופית לוח תוצאות קונקרטי משלה, אם כי כזה שמופעל על ידי הספק.
מה שהשתנה הוא שהבודק והמשקלים שניהם הגיעו — והפסק דין הוא ברובו חיובי עם כוכביות אמיתיות. AA ממקמת את Qwen3.8-Max על 56 במדד האינטליגנציה, קפיצת דורות אמיתית שמנחיתה אותו בשורה אחת עם Claude Opus 4.8, אף שאותו גיליון תוצאות מראה את Kimi K3 נקודה אחת קדימה בעלות נמוכה ב-25% לכל משימה, ומסמן ירידה של 10 נקודות ב-Omniscience על רקע שיעור הזיות עולה. שאלת הפרמטרים הפעילים נסגרה — 95B מופעלים, אושר בכרטיס המודל — והרישיון פורסם, מותאם אישית ולא Apache 2.0. מה שלא השתנה: טבלת האמות המידה של עליבאבא עצמה עדיין לא שוכפלה, העלות לכל משימה עדיין גבוהה כי המודל שוחק דרך שלבים רבים כל כך, הבסיס הפתוח המוגש על DigitalOcean הוא מודל שונה במקצת מהמספרים המרכזיים של הדגל (הקשר של 262K, NVFP4, בדיקת GPQA נקודתית של 88 לעומת 92.6), וטענות אמות המידה של Qwen3.8-27B מדווחות על ידי הספק אף שהמשקלים שלו שוחררו. השילוב הזה לא הופך את Qwen3.8-Max להימור גרוע — במחיר הזה הוא קרוב לניסוי חובה — אבל הוא כן אומר שהעמדה הנכונה היא להעריך באגרסיביות, לנתב בכוונה, ולהשאיר גיבוי. האירוע שצריך לעקוב אחריו עכשיו הוא האם ספירת הצעדים הסוכנותית שמאחורי אותה עלות של $1.14 למשימה היא משהו שהעומס שלך יכול לספוג, האם ההובלה של build 0902 ב-Code Arena: WebDev מחזיקה מעמד כשהקולות מצטברים, האם רווחי ה-Coding וה-Cowork שלו משתכפלים על עומסי עבודה אמיתיים, האם ההובלה של CommerceAgentBench במשקל פתוח — שני מעברים מצטברים על הבלם של עליבאבא עצמה — שורדת ריצה עצמאית, האם טענות אמות המידה של ה-27B מחזיקות מעמד, והאם התפוקה הנמדדת של הפריסה על DigitalOcean מחזיקה מעמד תחת תעבורה אמיתית — זה יכריע אם "שני רק ל-Fable 5" היה מיצוב או נבואה.

השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
