
Qwen3.8-Flash-Next: אליבאבא מציגה תצוגה מקדימה של ארכיטקטורת Qwen4 לפני ש-Qwen4 קיים
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
Alibaba עומדת לפרסם את ארכיטקטורת Qwen4 לפני פרסום מודל Qwen4. Qwen3.8-Flash-Next — מודל בעל משקלים פתוחים, רב-מודאלי, מבוסס תערובת מומחים, הבנוי על ארכיטקטורת הדור הבא שתניע את משפחת Qwen4 — צפוי לצאת לציבור ב-ModelScope בשעה 23:00 שעון בייג'ינג ב-26 באוגוסט 2026. Alibaba ממסגרת את ההשקה כתצוגת טכנולוגיה מקדימה: מפתחים מקבלים את הארכיטקטורה מוקדם, ומשפחת Qwen4 המלאה תגיע מאוחר יותר. נכון לכתיבת שורות אלה, מספר הפרמטרים, הרישיון והמחיר אינם מאושרים, ולכן זהו מאמר מסוג 'מה שידוע עד כה' — כל פרט שלהלן מסומן לפי מידת הוודאות שלו.
אם לא עקבתם אחרי הקצב של עליבאבא החודש, נקודת העוגן היא Qwen3.8-Max — דגם הדגל עם 2.4 טריליון פרמטרים ששוחרר ב-3 באוגוסט ונחשף כקוד פתוח בשם Qwen3.8-2.4T-A95B פחות משבועיים לאחר מכן. Qwen3.8-Flash-Next מגיע פחות מחודש אחר כך. אותה מעבדה שהוציאה מודל עם משקלים פתוחים של 2.4 טריליון פרמטרים מחלקת כעת את הארכיטקטורה לדור שאחריו, לפני שדגם הדגל של אותו דור אפילו זכה לשם.
מה הוכרז?
האות הגיעה לזירה בערוצים הרגילים. דף טיזר של ModelScope עבור Qwen3.8-Flash-Next עלה לאוויר ב-25 באוגוסט עם תג "שחרור פתוח בקרוב", שורת התגית "קדימה לדור הבא — מהיר כברק", וטיימר שחרור שהצביע על 2026-08-26 23:00 (UTC+08:00). צוות Qwen של עליבאבא פרסם ב-X באותו יום: "הגל הבא של Qwen מגיע." הפוסט שהפנה אלינו את הכתבה, מאת @kimmonismus ב-X, תיאר את אותו הדבר במילים מעט שונות: מודל MoE מולטי-מודאלי במשקלים פתוחים על ארכיטקטורת הדור הבא, עם גישה מוקדמת כדי שהקהילה תוכל להתכונן למשפחת Qwen4.

החלק שכדאי לקרוא שוב הוא המסגור של עליבאבא עצמה. המודל מתואר כבנוי על ארכיטקטורת הדור הבא "שתניע את משפחת Qwen4 הבאה" — ובמפורש לא כ-Qwen4 עצמו. הסיבה שעליבאבא ציינה היא שהשינויים הארכיטקטוניים צריכים להיות בידי הקהילה לפני שהמשפחה מגיעה, כך שסביבות הריצה, הקוונטיזציות והיישומים יהיו מוכנים כאשר המוצר האמיתי ישוחרר. זו עמדה שיווקית, אבל היא גם מחויבות טכנית: להציג מראש את החלק הקשה, ולקחת את הקהילה יחד.
מה אושר היום, ומה לא:
• אושר, לפי הטיזר וההצהרה של Qwen: Qwen3.8-Flash-Next הוא מודל בעל משקלים פתוחים, רב-מודאלי, ומבוסס MoE על ארכיטקטורת Qwen4.
• אושר, לפי הצהרת Qwen: היא מציגה שני שינויים ארכיטקטוניים מרכזיים — ארכיטקטורת GDN ההיברידית ו-Qwen Sparse Attention (QSA).
• אושר, לפי הטיזר: שעת השחרור, 2026-08-26 23:00 (UTC+08:00), ב-ModelScope.
• לא אושרו: סך כל הפרמטרים או הפרמטרים הפעילים, תנאי הרישיון, אורך ההקשר, זמינות ה-API או התמחור, וכל ציוני ה-benchmark. עדיין אין הערכה עצמאית מכיוון שהמשקולות לא שוחררו.

מהי בעצם הארכיטקטורה של Qwen4
שני מנגנונים נושאים את הסיפור. הראשון, GDN — Gated Delta Network — הוא שכבת הקשב הליניארי של עליבאבא. בעוד שטרנספורמר סטנדרטי שומר מטמון מפתח-ערך שגדל עם אורך הרצף, שכבת GDN מתחזקת מצב רקורסיבי בגודל קבוע ומעדכנת אותו לפי כלל שער נלמד; השושלת עוברת דרך DeltaNet ו-Mamba-2. התמורה היא זו שמניעה בשקט את קו Qwen מאז Qwen3-Next: הקשרים ארוכים נשארים זולים כי המצב אינו גדל, בעוד מיעוט של שכבות קשב מלא נשאר בשילוב כדי לבצע את האחזור המדויק שקשב ליניארי חלש בו. בדור הנוכחי השילוב הזה פועל ביחס של בערך שלוש שכבות GDN על כל שכבת קשב מלא — ניתוח קהילתי של נקודת הבידוק Qwen3.8-2.4T-A95B מונה 69 שכבות GDN מול 23 שכבות קשב. Qwen3.8-Flash-Next מתואר כ"ארכיטקטורת GDN היברידית" בדיוק על אותה שושלת.
השני, QSA — Qwen Sparse Attention — הוא החלק החדש באמת, ועדיין אין תיאור טכני ציבורי שלו: רק השם, והקידום שלו כאחד משני השינויים המרכזיים של התצוגה המקדימה. היעדר הפירוט הזה הוא עצמו חלק מהתבנית. התצוגה המקדימה של Qwen3-Next בסוף 2025 הציגה את Gated DeltaNet עם אותו מחסור בתיעוד, והארכיטקטורה קיבלה מפרט מלא רק כשסדרת Qwen3.5 אימצה אותה. עבור הקורא, המסקנה המעשית זהה בשני המקרים: הארכיטקטורה היא הקנרית שמופיעה ראשונה, והתיעוד ומודלי הייצור מופיעים אחר כך.
תוכנית הפעולה שכבר עבדה פעם אחת
אליבאבא כבר הריצה את המהלך המדויק הזה בעבר, וזה עבד. בסוף 2025, Qwen3-Next הציגה בתצוגה מקדימה את Gated DeltaNet ואת השילוב בין קשב ליניארי לקשב מלא. כאשר סדרת Qwen3.5 הושקה, היא אימצה את התכנית הזו בקנה מידה רחב — והשילוב ההיברידי נמשך מאז לאורך דור Qwen3.8, כולל דגם הדגל 2.4T. הסיבה לכך שהתקדים הזה חשוב כאן היא התזמון שהוא מרמז עליו. אפשר לצפות שמשפחת Qwen4 המלאה תגיע רק לאחר התצוגה המקדימה הזו, לא בתוכה; אם לקחת את פער Qwen3-Next כמדריך, המרחק בין "הנה הארכיטקטורה" ל"הנה המשפחה" נמדד בחודשים. שום דבר בטיזר לא מאשר את זה — זו מסקנה מתבנית שאליבאבא כבר הריצה פעמיים.
מה שאנחנו עדיין לא יודעים
הלא-נודעים הם עיקר העניין בתצוגה מקדימה, והם אמיתיים:
• פרמטרים. הטיזר לא חושף אף אחד מהם. ספקולציות בקהילה ב-X וב-Reddit — ללא גיבוי רשמי — מצביעות על תצורה של כ-125B סה"כ / 6B פעילים, עם טבלת חיפוש גדולה להטמעות n-gram. התייחסו לכך כשמועה.
• דרגת ה-Flash. בדור Qwen3.5, ה-Qwen3.5-Flash הזמין בענן בלבד היה גרסה משופרת של Qwen3.5-35B-A3B בעל המשקלים הפתוחים. האם Qwen3.8-Flash-Next הוא המקביל בעל המשקלים הפתוחים של מודל Qwen3.8 בגודל דומה, אינו ידוע; ייתכן שמדובר במודל מסוג 125B-A6B. שתי הקריאות הן ניחושים.
• רישיון. המהדורות האחרונות של Alibaba ל-Qwen נעות בין רישיון Apache-2.0 (Qwen3.8-27B) לבין רישיון Qwen3.8-Max המותנה בהכנסות. היכן ש-Flash-Next ינחת יקבע אם ניתן יהיה להשתמש בו מסחרית, ובאיזה אופן.
• מדדים. הצהרת Qwen מדגישה קידוד סוכני, משימות לטווח ארוך, ואינטליגנציה מולטימודלית, אך לא מצורפים מספרים ואין הערכה בלתי תלויה עד שהמשקלים יורדים.
משפחה הפועלת במחזורים דו-שבועיים
{{1}}הקצב הסובב הוא סיפור בפני עצמו.{{/1}} {{2}}Qwen3.8-Max, מודל הדגל בעל 2.4 טריליון פרמטרים, שוחרר ב-3 באוגוסט; Qwen3.8-2.4T-A95B בעל המשקלים הפתוחים הגיע אחריו ב-12–13 באוגוסט; Qwen3.8-27B החינמי ברישיון Apache-2.0 הושק ימים ספורים לאחר מכן; ועכשיו, לפני תום החודש, הארכיטקטורה של הדור הבא נחשפת בתצוגה מקדימה.{{/2}} {{3}}אף מעבדה אחרת לא מבצעת כרגע איטרציות בקצב הזה.{{/3}} {{4}}עבור קורא שבוחר מודלים, ההשלכה המעשית היא ש"ה-Qwen הטוב ביותר" הוא יעד נע — והפער בין הדורות מגיע מהר יותר מהקצב שבו המערכת האקולוגית שמסביב בדרך כלל מסתגלת.{{/4}} {{5}}קניית החלטה במקום מודל היא יותר ויותר המהלך המוצדק.{{/5}}
מה מפתח צריך לעשות עכשיו
{{1}}תכננו את הארכיטקטורה, לא רק את המודל. Qwen3.8-Flash-Next יהיה תצוגת מקדימה לא מוכחת ביום הראשון: ללא אמות מידה בלתי תלויות, מערכת ריצה שעדיין מתעדכנת, ורק הצהרות ספק לגבי היכולות הסוכניות ויכולות האופק הארוך שחשובות לעומסי העבודה שהיו משתמשים בו.{{/1}} {{2}}הדרך הבטוחה להעריך אותו אינה לחבר אותו לנתיב ייצור — אלא לנתב אליו עותק בסיכון נמוך של עומס עבודה, להשוות את הפלט מול המודל הנוכחי, ולתת למנגנון החילוף האוטומטי לספוג את הרגעים שבהם הספק שמשרת מודל חדש במשקלים פתוחים מתנהג באופן בלתי תקין.{{/2}} {{3}}ב-OrcaRouter מדובר באותו endpoint ובאותו מפתח שכבר יש לך: Qwen3.8-Flash-Next והמודל הנוכחי שלך יושבים מאחורי API אחד,{{/3}} {{4}}וה-DSL של הניתוב יכול לבצע A/B בין תצוגת המקדימה לבין המודל הנוכחי עם אותה הוראה לפני שמתחייבים למשהו.{{/4}}
כאשר קיים תמחור, יש לקרוא אותו באותה צורה. אליבאבא לא הכריזה על מחיר API עבור Flash-Next, ומשקלים שטרם שוחררו אינם ניתנים לניתוב לשום מקום. כאשר ספק אכן חושף אותו, OrcaRouter מעביר את מחיר המחירון של הספק ישירות ברווח של 0% — כך שכל מספר שאליבאבא תקבע יופיע ללא שינוי, באותו היום. קו הבסיס הקרוב ביותר שאפשר לקרוא בפועל היום הוא Qwen3.8-Max (qwen/qwen3.8-max), הדגם הדגל שהארכיטקטורה הזו תמוקם תחתיו בסופו של דבר: חלון הקשר של 1,000,000 טוקנים במחיר של 2.00 דולר למיליון טוקני קלט ו-6.00 דולר למיליון טוקני פלט, המועבר במחיר המחירון. זכרו את המספר הזה כשהמחיר של Flash-Next יירד; זו העלות שהדור הבא צריך לנצח.

מה לצפות כשייצא
ארבעה דברים חשובים ברגע שטיימר השחרור נגמר:
• מספר הפרמטרים ורמת הפרמטרים הפעילים — האם זהו דגם מסוג 125B-A6B שהשמועות מתארות או גרסה קטנה יותר.
הרישיון — מתירני כמו Qwen3.8-27B, או מוגבל כמו רישיון Max.
• האם ההערכות העצמאיות הראשונות משחזרות את טענות הספק לגבי קידוד-סוכן ואופק ארוך — המספרים שכדאי לסמוך עליהם, לא קו השיווק.
• כמה זמן Alibaba מחכה לפני שמשפחת Qwen4 המלאה מגיעה בעקבות התצוגה המקדימה.
שום דבר מזה אינו ניתן לדעת מכאן. מה שניתן לדעת היום הוא צורת ההחלטה שאליבאבא קיבלה: היא מהמרת שהדור הבא של הארכיטקטורה שלה שווה לתת בחינם לפני מוצר הדגל. ההימור הזה הוא הסיפור — והמשקלים יורדים מחר.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
