
שחרור Qwen3.8-Flash-Next: הצצה לארכיטקטורת Qwen4 של עליבאבא
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
המסמך השימושי ביותר שפרסמה Alibaba ב-26 באוגוסט 2026 לא היה ערכת העיתונות — אלא דו"ח טכני. Qwen3.8-Flash-Next, המודל הרב-מודלי בעל המשקלים הפתוחים (open-weight) המבוסס על ארכיטקטורת mixture-of-experts שיצא באותו יום, הגיע יחד עם מאמר שכותרתו "על תכנון הארכיטקטורה של Qwen3.8-Next: הערכה, יעילות ויציבות אימון", והדו"ח הוא הסיפור. הוא עושה את מה שמהלכי השקה של ספקים כמעט אף פעם לא עושים: הוא מפרסם את מחקרי החיתוך (ablations), את התוצאות השליליות, ואת הניסויים במתכוני האימון, ואז משרטט קו מכל ממצא אל הארכיטקטורה של משפחת Qwen4 שמודל זה נועד להציג מראש.
מה בעצם שוחרר ב-26 באוגוסט
המודל עצמו צנוע בסטנדרטים של Qwen ל-2026, וזאת במכוון. Qwen3.8-Flash-Next מאחסן 125B פרמטרים של המודל הראשי בתוספת טבלת הטמעות n-gram נפרדת של 51B — כ-176B לפני מודול חיזוי רב-טוקנים של 4B — אך מפעיל רק 6B לכל טוקן. זהו מודל mixture-of-experts עם 512 מומחים, ניתוב top-10 ו-48 שכבות, עם קונטקסט מובנה של 262,144 טוקנים, הניתן להרחבה ל-1M באמצעות YaRN. הוא מקבל קלט של טקסט, תמונה ווידאו ופולט טקסט. המשקולות זמינות ב-Hugging Face וב-ModelScope תחת רישיון qwen-community-1.0, והבלוג של Alibaba עצמו מכנה אותו "תצוגה מקדימה ניסיונית של הארכיטקטורה שתעמוד בבסיס Qwen4" — אותו תפקיד שמילא Qwen3-Next עבור סדרת Qwen3.5, קנרית שעפה לפני ספינת הדגל.
באותו יום, Alibaba השיקה את המקבילה המסחרית: גרסת API בשם Qwen3.8-Flash על גבי QwenCloud API במחיר של $0.16 למיליון טוקני קלט ו-$0.47 למיליון טוקני פלט. קל לבלבל בין השניים וכדאי להפריד ביניהם. Qwen3.8-Flash-Next היא תצוגה מקדימה עם משקלים פתוחים שהדוח הטכני מנתח; Qwen3.8-Flash היא גרסת הייצור של ה-API, בתשלום, עם הקשר ברירת מחדל של 1M טוקנים ופורמטי בקשה תואמי OpenAI ו-Anthropic. המחיר, מדדי הביצועים וטיעוני הארכיטקטורה נובעים כולם מאותה הנדסה.

ארבעת ההימורים הארכיטקטוניים בדוח הטכני
עמוד השדרה של המאמר הוא ארבעה הימורים על איך אמור להיראות מודל חזיתי ארוך-הקשר ובעל עלות נמוכה, שלכל אחד מהם מצורף גיבוי ניסיוני.
• קשב — היברידי GDN + QSA. שלוש מתוך כל ארבע שכבות משתמשות ב-Gated DeltaNet, שכבת קשב ליניארית שדוחסת את ההיסטוריה למצב רקורסיבי בגודל קבוע במקום מטמון KV שגדל עם אורך הרצף. השכבה הנותרת היא Qwen Sparse Attention, שמאגדת את הרצף למיקרו-בלוקים, מדרגת אותם בזול, ומריצה קשב מלא רק על האזורים שחשובים. אליבאבא מדווחת על האצות של עד פי 7.6 ב-prefill ופי 4.9 ב-decode בהקשר של 1M; בדיקת הביצועים של SGLang עצמה ביום הראשון מדדה אפילו יותר, פי 10.2 ופי 6.6. בקצב פגיעות של 90% במטמון הקידומת, תפוקת ה-prefill מגיעה לפי 8.6 מזו של Qwen3.7-Plus. אלה נתונים שדווחו על ידי ספק ושותפים, לא נתונים שאומתו באופן בלתי תלוי.
• זרם שיורי — שיורי עם שער (Gated Residual). הנתיב השיורי היחיד מורחב לארבעה ענפים מקבילים עם גייטינג דינמי רכיב-רכיב (element-wise), עיצוב רב-ענפי בסגנון Hyper-Connection עם בקרה בסגנון GatedNorm. השער מווסת קריאות וכתיבות בכל ענף, ולפי המאמר הוא מדכא ערכים חריגים באקטיבציות, ובפועל מאפשר לאחסן את המצבים השיוריים ב-FP8.
• Embedding — טבלת ה-n-gram בגודל 51B. במקום embedding אחד לכל token, המודל ממפה טבלת חיפוש על-פי ה-token הנוכחי והקודמים לו, ומאחסן בכך ביטויים שלמים ותבניות מקומיות. פעולה זו כמעט חופשית לכל token, ומכיוון שכתובות החיפוש ידועות מראש, היא יכולה לשכון בזיכרון המארח ולהיטען מראש באופן אסינכרוני, בלי להיכנס כלל לזיכרון ה-GPU. זהו הטריק שמאפשר להריץ checkpoint בנפח 176B על מכונות מסוג 75GB, ומקורו ב-embeddings השכבתיים של Gemma 3n וב-Engram של DeepSeek.
• אופטימיזציה — Muon, מכוונן. האימון משתמש באופטימייזר Muon, שיטת מומנטום מבוססת אורתוגונליזציה, המיושמת על מפות ליניאריות דו-ממדיות (attention, GDN, ומשקלי מומחים של MoE) בעוד AdamW נשמר עבור embeddings, הראוטר, ופרמטרים בדרגה נמוכה. המאמר גם מדווח על תוצאה שלילית שכדאי לקרוא: חימום גודל אצווה (batch-size warmup) הוסר לאחר שהתברר שהוא דורש 18.8% יותר צעדי אופטימיזציה ללא שיפור כלשהו.
טבלת הבנצ'מארק, קרא בעיון
כל מספר בכותרות כאן הוא של Qwen עצמו, שפורסם בכרטיס המודל ובדוח, ואף אחד מהנתונים לא שוחזר באופן בלתי־תלוי — המודל בן יום אחד ואף צד שלישי לא ערך ביקורת עליו עדיין. גם אם קוראים את זה כך, זה עדיין מרשים, כי Qwen3.8-Flash-Next מתמודד ראש בראש עם DeepSeek-V4-Flash-0731, מודל גדול ומבוסס בהרבה, על 6B פרמטרים פעילים.
• DeepSWE 1.1 — 58.7 לעומת 54.4 (כפי שדווח על ידי הספק).
SWE-bench Pro — 62.5 לעומת 56.0 (דיווח ספק).
• Toolathlon מאומת — 73.5 לעומת 70.3 (לפי דיווח הספק).
• LiveCodeBench v6 — 91.9 לעומת 90.6 (דווח על ידי הספק).
• GPQA Diamond — 91.7 לעומת 90.8 (דיווח ספק).
• IFBench — 81.3 לעומת 79.2 (מדווח על ידי הספק).
אז ההחמצה שהדוח חושף בגלוי: NL2Repo-Bench, 48.1 לעומת 54.2 של DeepSeek-V4-Flash-0731 — פער אמיתי בייצור קוד ברמת מאגר, הממד היחיד של קידוד סוכני שבו המודל הקטן יותר אינו עומד בקצב. Agents' Last Exam מסתיים בשוויון 24.3 לעומת 25.2. באוטומציה משרדית, Qwen מדווח על CoWorkBench 73.9 — אבל זה מדד פנימי ו-Alibaba משאיר אותו מחוץ לתרשים הראשי.

בראייה, הטבלה המדווחת על עצמה מציגה AndroidWorld 84.5 מול 62.0 עבור Claude Opus 4.6 Max ו-RealWorldQA 88.5 מול 73.9. Humanity's Last Exam הוא הכותרת היחידה שבה Qwen מפסידה ל-Claude Opus 4.6 Max לחלוטין — וגם ההערכה של הציון הזה בוצעה על ידי GPT-4o, כך שאפילו ההשוואה הזו אינה נקייה.
המחיר: שתים-עשרה ממחיר הדגל
אז המספר שחשוב לתקציבים. ה-build של Qwen3.8-Flash המוגש עולה $0.16 למיליון טוקנים בקלט ו-$0.47 למיליון בפלט ב-QwenCloud. זה בערך 1/12 מהמחיר של מודל הדגל של Alibaba עצמה, Qwen3.8-Max, שעומד על $2.00 למיליון קלט ו-$6.00 למיליון פלט — על מודל שלפי הדוח אומן עם בערך 1/9 מכוח החישוב של Qwen3.7-Plus. ספקיות מודלים סיניות בילו את הקיץ בהורדת מחירי שכבת ה-flash, והמהדורה הזו היא הצד של Qwen בקמפיין הזה, שנוחתת עם הצדקה ארכיטקטונית מצורפת במקום רק הנחה.
לכל מי שמשווה בין ההצעות בקטגוריה, החישוב פשוט יותר כשכל ספק מציג את אותו המספר. OrcaRouter מנתב את שאר משפחת Qwen — Qwen3.8-Max, Qwen3.8-27B, ו-Qwen3.8 — במחיר המחירון של הספק עם 0% תוספת, כך שהפחתת מחיר של ספק נכנסת לתוקף אצלנו ביום ההכרזה. Qwen3.8-Flash-Next עדיין לא נמצא בקטלוג שלנו; כשהוא יגיע לסביבת ריצה שאנחנו מנתבים, הוא ישתלב באותה הגדרה של לחיצה אחת ומחיר מחירון, ללא חוזה שני.
מה אתה יכול לעשות עם זה היום
תמיכת השירות ביום ההשקה רחבה במיוחד. SGLang משלחת דף מדריך ותמונה ייעודית (lmsysorg/sglang:qwen38flashnext); ל-vLLM יש vllm/vllm-openai:qwen38-flash-next; NVIDIA מאמתת את שתיהן ובנוסף את TensorRT LLM על מארז GB300 NVL72 עם יותר מ־16,000 טוקנים לשנייה לכל GPU ב-FP8, ו-NeMo מכסה כוונון עדין. מתחת לקנה מידה של מרכז נתונים, המודל רץ על אשכולות DGX Spark ועל תחנות עבודה עם 4×RTX PRO 6000, ומסע הקוונטיזציה הקהילתי של אותו יום — GGUFs של Unsloth ובנייה של 1 ביט שנכנסת ל־75GB של זיכרון RAM בדיוק של כ־80% מהדיוק המלא — פירושו שנקודת הביקורת המאוחסנת של 176B אכן ניתנת להרצה על חומרה שבידי צוות קטן. צוותים שמעדיפים לקרוא ל-API במקום להריץ את המודל יכולים לגשת ל-Qwen3.8-Flash API דרך QwenCloud של עליבאבא עצמה וכמה פלטפורמות צד שלישי, אם כי המשקולות הפתוחות הן מה שרוב המאמצים המוקדמים יאספו קודם.

החשבון של ה-VRAM מאחורי הרשימה הזו הוא טבלת ה-n-gram, וזה הכיוון שאליו ערימות ההגשה מתכנסות בשלב הבא. ה-embedding לכל שכבה שהדוח הטכני משאיר מחוץ לזיכרון ה-GPU הוא מבנה חיפוש טהור — עבור כל טוקן שנוצר, המודל שולף רק כ-16 מתוך 320 מיליון השורות שלו — וזה מה שהופך את ההורדה שלו מהזיכרון לזולה. vLLM מגיש את Qwen3.8-Flash-Next מתמונת פיתוח ייעודית בזמן שבקשת המשיכה לתמיכה בארכיטקטורה עדיין פתוחה, והחלק החדש ביותר בעבודה הזו — PR טיוטה מאותו מחבר vLLM (vllm-project/vllm#54371, לא מוזג) — מוסיף נתיב שירות PLE-Offload שמשאיר את הטבלה בזיכרון המארח וקורא אותה דרך CUDA unified virtual addressing במקום להקצות VRAM. ב-FP8 הטבלה תופסת בערך 48GB מתוך ~173GB של ה-checkpoint, כך שהורדתה מהזיכרון היא ההבדל בין GPU של מרכז נתונים לכרטיס 96GB יחיד — RTX PRO 6000 או מאגר הזיכרון המאוחד של DGX Spark אחד. זה מוקדם, אז כדאי להתייחס לזה ככיוון ולא כאופציה נתמכת כרגע; אבל זה זמן הריצה שמדביק את הפער מול מה שהדוח הטכני כבר טען — והדבר שצריך לעקוב אחריו אם מספר ה-VRAM הוא מה שעיכב אתכם.
תצוגה מקדימה בת יום אחד עם מספרים שלא שוחזרו היא המקרה הקלאסי לא להמר על נתיב ייצור עליה, וזה בדיוק מה ש-failover נועד עבורו. אם סביבת ריצה נושאת Qwen3.8-Flash-Next ואתה מצביע על נקודת קצה אחת אליה עם failover אוטומטי למודל שאתה כבר סומך עליו, אתה מקבל את היתרון של הארכיטקטורה החדשה על תעבורה לא קריטית וגיבוי נקי כשהיא מתקשה — ללא חיווט מחדש, כי זה כלל ניתוב, לא שינוי קוד.
מה התצוגה המקדימה הזו אומרת על Qwen4?
Alibaba כבר ביצעה את המהלך הזה בעבר. Qwen3-Next הציגה תצוגה מקדימה של Gated DeltaNet בסוף 2025 עם תיעוד דל, והארכיטקטורה קיבלה מפרט מלא רק לאחר שסדרת ה-Qwen3.5 אימצה אותה בקנה מידה גדול. הדפוס חוזר על עצמו: Qwen3.8-Flash-Next הוא הקנרית, והדו"ח הוא המפרט-באמצעות-ניסוי. הדברים הקונקרטיים שיש לעקוב אחריהם הם האם ספינת הדגל של Qwen4 תאמץ את החלוקה של שלוש-לאחת בין GDN ל-QSA, האם הטמעת ה-n-gram תשרוד מגע עם שרתי ייצור בקנה המידה של ספינת הדגל, והכי חשוב – האם הערכות עצמאיות יאשרו את היתרון של 6B-active על פני דגמים גדולים יותר. אם תזת היעילות תתברר כנכונה, ספינת הדגל של Qwen4 עשויה לצאת עם עלויות הגשה נמוכות בהרבה מאלו של הדור שלפניה.
שאלות נפוצות
Qwen3.8-Flash-Next ו-Qwen3.8-Flash — אותו דגם?
לא, וההבחנה חשובה. Qwen3.8-Flash-Next הוא תצוגה מקדימה של ארכיטקטורת משקלים פתוחים שהדוח הטכני מנתח; Qwen3.8-Flash הוא גרסת ה-API היצרנית ש-Alibaba מספקת ב-QwenCloud במחיר של $0.16/$0.47 למיליון טוקנים עם קונטקסט ברירת מחדל של 1M. אותה שושלת הנדסית, ארטיפקטים שונים — האחד מיועד לאחסון עצמי ולבדיקה, והשני הוא שירות מנוהל בתשלום.
האם עומסי עבודה בייצור צריכים לעבור אליו היום?
לא בלי חוות דעת שנייה. כל מדד ביצועים הוא מדווח-ספק ולא שוחזר, הארכיטקטורה חדשה מספיק כך שערימות ה-serving עדיין מתכנסות — התמיכה של vLLM עצמה עדיין נוחתת דרך pull requests פתוחים — והפער היחיד בקידוד אייג'נטי (NL2Repo) הוא בדיוק על סוג המשימה שמתכנתי ייצור נתקלים בו. המשקלים הפתוחים הופכים את ההערכה העצמית לזולה, ותמיכה כבר מהיום הראשון ב-SGLang וב-vLLM מאפשרת פיילוט השבוע — אבל פיילוט מאחורי failover הוא הדרך הכנה להתחיל, לא cutover.
מתי ה-Qwen4 האמיתי יוצא?
עליבאבא לא אמר. אות התזמון היחיד במהדורה זו הוא היסטורי: הקנרי האחרון, Qwen3-Next, עף בערך עונה לפני שסדרת Qwen3.5 אימצה את הארכיטקטורה שלו. בקצב הזה, דגמי הדגל של Qwen4 קרובים יותר ממה שהם נראים — אבל הדו"ח עוסק במפורש בארכיטקטורה, לא במפת דרכים.
השורה התחתונה
Qwen3.8-Flash-Next הוא שחרור נדיר שבו המאמר הוא המוצר. על המודל עצמו, כרטיס הניקוד הישר מציג: 6B פרמטרים פעילים שמשתווים למודלים גדולים בהרבה ברוב מדדי ההשוואה המשותפים, פער מוגדר אחד בקוד ברמת מאגר, מחיר שירות שהוא 1/12 ממחיר הדגל, וארכיטקטורה שהיא התשובה של Qwen לשאלה איך מודל חזיתי הופך לזול. הדוח הטכני אומר למה Qwen3.8-Flash-Next נועד — וזה לא המודל. הוא הראיה לארכיטקטורה שתהיה Qwen4, וכדאי לקרוא אותו לפני ש-Qwen4 יושק, כי ההחלטה שהוא משנה היא ההחלטה שתקבלו כש-Qwen4 יגיע.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
