כרטיס כותרת ראשי למאמר 'Qwen3.8-Flash-Next — LEAK REPORT' עם תג 'לא מאומת — תצוגה מקדימה של ארכיטקטורת QWEN4', כותרת המשנה 'Alibaba שולחת את ארכיטקטורת Qwen4 לפני המודל', שלושה צ'יפים: 'מקור: @kimmonismus', '25 באוגוסט 2026' ו'שחרור: 26 באוגוסט 23:00 UTC+08', כרטיס שמאלי: 'הטענה: MoE רב-מודאלי במשקלים פתוחים שמציג תצוגה מקדימה של ארכיטקטורת Qwen4' וכרטיס ימני: 'סטטוס: המשקלים לא שוחררו, ~24 שעות עד השחרור'. הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Qwen3.8-Flash-Next יצא: Alibaba משחררת את ארכיטקטורת Qwen4 לפני שקיים Qwen4

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Qwen3.8-Flash-Next סוף סוף יש לו מספרים ש-Aliba​ba לא הפיקה — והם לא אומרים את מה שאומרת הגרסה הקולנית ביותר של הסיפור. במדד Artificial Analysis Intelligence Index, שהוצג מחדש כ-v4.3 ב-7 בספטמבר, התצוגה המקדימה עם המשקלים הפתוחים של Aliba​ba מקבלת ציון 40 ומדורגת חמישית מבין 113 המודלים בקטגוריית ההשוואה שלה. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — המודל שמולו הוא נמדד שוב ושוב — מקבל ציון 35 ומדורג תשיעי. אין כאן שוויון; זה יתרון של חמש נקודות למודל הקטן יותר. זהו גם לוח התוצאות הרחב והעצמאי הראשון שמגיע למודל שהמספרים היחידים שפורסמו עבורו, עד החודש, היו של הספק עצמו. המודל עצמו אינו חדש: המשקלים עלו לאוויר ב-Hugging Face ב-24 באוגוסט, והשחרור הרשמי ב-ModelScope נחת ב-26 באוגוסט. מה שהשתנה החודש הוא שקורא יכול כעת לבדוק את הטענות במקום לקחת אותן כמובן מאליו.

ההנחיה לחזור לפוסט הזה הגיעה מ-@teortaxesTex ב-X, ששאל אם התצוגה המקדימה זוכה לפחות הייפ ממה שמגיע לה בשקט: לכאורה באותה דרגה ב-Artificial Analysis כמו DeepSeek V4 Flash 0731, "קטנה כמעט פי 4," עם "כמעט פי 3 פחות פרמטרים פעילים." שתיים משלוש הטענות האלה לא שורדות מפגש עם הנתונים שפורסמו — והתיקון פועל לטובת המודל, כי במספרים החשובים התצוגה המקדימה מקדימה את ההשוואה שלה, ולא עומדת בשווה לה.

נתחיל בגודל, שבו המספרים חד-משמעיים. Qwen3.8-Flash-Next מאחסן כ-180B פרמטרים — גוף mixture-of-experts של 125B, טבלת embedding נפרדת של n-gram בגודל 51B, וכ-4B של שכבות חיזוי רב-טוקנים — ומפעיל 6B מהם לכל טוקן. DeepSeek V4 Flash 0731 מאחסן 284B ומפעיל 13B. אלה הנתונים שמופיעים בכרטיס המודל של Qw​en ובתיעוד של Deep​Seek, ואלה הנתונים ש-Artificial Analysis מציגה בשני דפי המודלים. היחסים שהם מפיקים הם 1.6x בפרמטרים המאוחסנים ו2.2x בפרמטרים הפעילים. זהו סיפור יעילות אמיתי, וזו הסיבה שהארכיטקטורה הזו חשובה — אבל זה לא פי 4 ולא פי 3. לא הצלחנו למצוא שום נתון מפורסם שתומך במכפילים הגדולים יותר. אם הכוונה הייתה טביעת הזיכרון בזמן הגשה ולא מספר הפרמטרים, גם המספר הזה אינו מפורסם.

מה הוכרז?

Aliba​ba פרסמה את ארכיטקטורת Qwen4 לפני שפרסמה מודל Qwen4. Qwen3.8-Flash-Next — מודל במשקולות פתוחות, מולטימודלי, מסוג תערובת מומחים (mixture-of-experts), הבנוי על הארכיטקטורה מהדור הבא שתניע את משפחת Qwen4 — יצא בשני שלבים: המאגר הרשמי Qw​en/Qwen3.8-Flash-Next עלה לאוויר ב-Hugging Face ב-24 באוגוסט, יומיים לפני ההשקה של ModelScope שאליה הצביע טיימר הטיזר. ההשקה הרשמית של ModelScope התרחשה ב-26 באוגוסט בשעה 23:00 UTC+08:00, כשגרסת Qwen3.8-Flash המוגשת תומחרה באותו זמן. הטענה המרכזית בכרטיס, שנפוצה מאז, היא שמודל שמפעיל 6B פרמטרים לכל טוקן גובר על Claude Opus 4.6 Max ב-8 מתוך 9 מדדי השוואה בטבלה של Aliba​ba עצמה. משפחת Qwen4 המלאה, Aliba​ba ממשיכה לומר, תגיע מאוחר יותר.

אם לא עקבתם אחר הקצב של Alibaba החודש, נקודת העוגן היא Qwen3.8-Max — דגם הדגל בעל 2.4 טריליון פרמטרים שיצא ב-3 באוגוסט ופותח בקוד פתוח כ-Qwen3.8-2.4T-A95B פחות משבועיים לאחר מכן. המשקולות של Qwen3.8-Flash-Next יוצאות פחות מחודש לאחר מכן. אותה מעבדה שהוציאה מודל פתוח עם 2.4 טריליון פרמטרים מחלקת כעת את הארכיטקטורה של הדור שאחריו, עוד לפני שדגם הדגל של אותו דור אפילו קיבל שם.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

החלק ששווה לקרוא שוב הוא הניסוח של Aliba​ba עצמה. המודל מתואר כבנוי על ארכיטקטורת הדור הבא "שתניע את משפחת Qwen4 הקרובה" — ובמפורש לא כ-Qwen4 עצמו. הסיבה המוצהרת של Aliba​ba היא שהשינויים הארכיטקטוניים צריכים להיות בידי הקהילה לפני שהמשפחה מגיעה, כך שסביבות הרצה, כימותים ויישומים יהיו מוכנים כשהדבר האמיתי ישוחרר. זו עמדה שיווקית, אבל היא גם מחויבות טכנית: לתת תצוגה מקדימה לחלק הקשה קודם, ולקחת את הקהילה איתך.

מה שכרטיס המודל מכריע, ומה שאינו מכריע:

• אושר, לפי כרטיס המודל הרשמי: Qwen3.8-Flash-Next הוא בעל משקלים פתוחים, מולטימודלי, ומבוסס תערובת-מומחים על ארכיטקטורת Qwen4 — הכרטיס מכנה אותו "תצוגה מקדימה ניסיונית של הארכיטקטורה שתעמוד בבסיס Qwen4."

• אושר, לפי כרטיס המודל והקונפיגורציה: שני שינויים ארכיטקטוניים בולטים — Gated Delta Network (GDN) ו-Qw​en Sparse Attention (QSA) — בתוך היברידית בת 48 שכבות שמריצה 36 שכבות קשב ליניארי מול 12 שכבות קשב מלא.

• אושר מהמאגר: 125B פרמטרים בסך הכול עם 6B פעילים לכל טוקן (512 מומחים, 10 מנותבים ועוד אחד משותף) — Artificial Analysis מציינת 180B לאחר שמספרים את טבלת ה-embedding הנפרדת של 51B n-gram ואת שכבות ה-MTP — עם חלון הקשר מקורי של 262,144 טוקנים הניתן להרחבה ל-1,000,000 תחת Qw​en Community License 1.0.

• כבר לא בלתי־מאומת: המודל הוערך כעת באופן עצמאי, פעמיים. הטבלה של Aliba​ba היא עדיין של הספק עצמו ועדיין לא שוחזרה, אך היא כבר אינה הראיה היחידה בחדר.

הציונים העצמאיים הראשונים כבר כאן — והם אומרים "ביתרון", לא "שוויון".

Artificial Analysis השיקה את Intelligence Index v4.3 ב-7 בספטמבר, והניקוד מחדש הוא הסיבה לכך שכל זה בכלל ניתן להשוואה. עדכון v4.3 החליף את Terminal-Bench v2.1 ב-Terminal-Bench v4.0 הקשה בהרבה, והחליף את τ³-Banking ב-AutomationBench-AA, בנצ'מרק לתהליכי עבודה סוכניים שנבנה עם Zapier על סט בדיקות פרטי ומוחזק של 657 משימות. המשקל של הסט הפרטי והמוחזק עלה ל-45%. המטרה המוצהרת הייתה למנוע מחזית המודלים לתמרן את המדד, וההשפעה על הציונים הייתה גדולה: GPT-6 Astra ו-Claude Fable 5.1, שני המובילים, שניהם קיבלו 53 לאחר שנמדדו בשנות השישים בסולם הישן.

זה משנה כשקוראים את המספרים של הקהילה. הנתונים של "56 מול 52" שהופצו עבור Qwen3.8-Flash-Next ו-DeepSeek V4 Flash 0731 בתחילת ספטמבר חושבו לפי המדד שלפני v4.3; תחת v4.3 השניים עומדים על 40 ו-35. הצגת אחת מהקבוצות מול האחרת היא השוואה בין שני מבחנים שונים.

במדד הנוכחי, הנה כיצד שני המודלים למעשה משתווים בהערכות של Artificial Analysis עצמה:

• Intelligence Index — Qwen3.8-Flash-Next 40 (החמישי מתוך 113 במחלקה) לעומת DeepSeek V4 Flash 0731 (חשיבה, מאמץ מקסימלי) 35 (התשיעי מתוך 113).

• עבודת ידע סוכנית — AA-Briefcase 1587 לעומת 1259; GDPval-AA v2 1647 לעומת 1468; AutomationBench-AA 56% לעומת 54%.

• טרמינל ותכנות — Terminal-Bench v4.0 ‎25% לעומת 12%; SciCode ‎51% לעומת 50%.

• הסקה כללית ומדעית — Humanity's Last Exam 38% מול 39%; CritPt 11% מול 17%; GDP.pdf 16% מול 11%; AA-LCR v1.1 80% מול 80%.

• זכירה עובדתית לעומת קונפבולציה — AA-Omniscience ‎−10 לעומת −14, יתרון של ארבע נקודות ל-Qw​en preview.

• מחיר — $0.15 למיליון קלט / $0.47 למיליון פלט לעומת $0.44 / $1.32; עלות משוקללת $0.0882 למיליון טוקנים לעומת $0.2298. עלות לכל משימת Intelligence Index: $0.37 לעומת $0.22.

• מהירות ושהיה — 53 טוקנים בפלט לשנייה לעומת 210; זמן לטוקן ראשון 2.80 שניות לעומת 0.98 שניות; תגובה מקצה לקצה 49.76 שניות לעומת 12.88 שניות; זמן למשימה 1,572.60 שניות לעומת 221.65 שניות.

• שימוש בטוקנים — 108k טוקני פלט למשימה לעומת 62k, מתוכם 72k הם טוקני חשיבה לעומת 45k. Artificial Analysis מכנה את גרסת התצוגה המקדימה "מפורטת מאוד" ו"איטית מהממוצע".

• הקשר וגודל — 256k טוקנים לעומת 1,000k; סה״כ 180B / 6B פעילים לעומת 284B / 13B.

כשקוראים אותם יחד, זו תשובה חדה יותר מ"אותה דרגה". Qwen3.8-Flash-Next מנצח בוויכוח על דיוק ויעילות כמעט בכל ציר ש-Artificial Analysis מודדת — הוא המודל בעל הניקוד הגבוה יותר, הוא קטן יותר, והוא עולה כשליש בערך לכל טוקן. DeepSeek V4 Flash 0731 מנצח באופן מוחלט בטיעון הייצור: פי ארבעה תפוקה, רבע מהשהיה מקצה לקצה, פי שבעה פחות זמן שעון לכל משימה שהושלמה, ופי ארבעה חלון הקשר. ובכל הנוגע לעלות לכל משימה שהושלמה — המספר ששורד את שפע הטוקנים — DeepSeek הוא המודל הזול יותר, 0.22$ לעומת 0.37$, למרות המחיר הגבוה יותר. אם "לא מפורסם מספיק" פירושו "טוב יותר מהמוניטין שלו מבחינת איכות לפרמטר", התווית מוצדקת. אם פירושו "אתה צריך להריץ את זה במקום", עמודות המהירות והשהיה אומרות אחרת.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

קיימות גם ראיות בלתי תלויות מחוץ ל-Artificial Analysis. חבילת בדיקות (harness) של צד שלישי, smf-bench, פרסמה ריצת "Official A" ב-5 בספטמבר: Qwen3.8-Flash-Next בקוונטיזציית NVFP4 של NVIDIA על DGX Spark בודד, עם חשיבה כבויה, קיבלה 137 מתוך 157 (87.3%) עם 30 מתוך 30 נקיים במדור הקידוד שלה, לעומת 117 מתוך 157 עבור ריצת DeepSeek V4 Flash Vision-Exp על שני Spark באותה חבילת בדיקות של 157 מבחנים. זוהי חבילת בדיקות אחת על סוג מכונה אחד, והיא אינה תחליף להערכה רחבה — אך זוהי נקודת נתונים שנייה שמצביעה לאותו כיוון, והיא מגיעה ממישהו שאין לו אינטרס באף אחד מהספקים.

מהי בעצם הארכיטקטורה של Qwen4

שני מנגנונים נושאים את הסיפור. הראשון, GDN — Gated Delta Network — הוא שכבת הקשב הלינארית של Aliba​ba. בעוד שטרנספורמר סטנדרטי שומר מטמון מפתח-ערך שגדל עם אורך הרצף, שכבת GDN מתחזקת מצב חוזר בגודל קבוע ומעדכנת אותו עם כלל שער נלמד; השושלת עוברת דרך DeltaNet ו-Mamba-2. התמורה היא זו שמניעה בשקט את קו Qw​en מאז Qwen3-Next: הקשרים ארוכים נשארים זולים כי המצב לא גדל, בעוד שמיעוט של שכבות קשב מלא נשאר בתערובת כדי לבצע את האחזור המדויק שקשב לינארי גרוע בו. בדור הנוכחי התערובת הזו פועלת בערך בשלוש שכבות GDN על כל שכבת קשב מלא — ניתוח קהילתי של נקודת הביקורת Qwen3.8-2.4T-A95B סופר 69 שכבות GDN מול 23 שכבות קשב. Qwen3.8-Flash-Next מציג את אותו יחס של שלוש לאחת: 36 שכבות קשב לינארי מול 12 שכבות קשב מלא.

השני, QSA — Qw​en Sparse Attention — הוא החלק החדש באמת, והתיאור הציבורי שלו עדיין דל: כרטיס המודל מוסיף שהוא פועל ברמת מיקרו-בלוק עם תקציב של 512 בלוקים / 2048 טוקנים, אבל עדיין אין תיאור טכני מלא. המחסור הזה בפרטים הוא עצמו חלק מהדפוס. התצוגה המקדימה של Qwen3-Next בסוף 2025 הציגה את Gated DeltaNet עם אותו תיעוד דל, והארכיטקטורה קיבלה פירוט מלא רק לאחר שסדרת Qwe​n3.5 אימצה אותה. עבור הקורא, המסקנה המעשית זהה בשני המקרים: הקנרית של הארכיטקטורה מופיעה ראשונה, התיעוד ומודלי הייצור מופיעים אחר כך.

תוכנית הפעולה שכבר עבדה פעם אחת

Alibaba כבר הריצה את המהלך המדויק הזה בעבר, וזה עבד. בסוף 2025, Qwen3-Next חשפה את Gated DeltaNet ואת השילוב ההיברידי של קשב ליניארי וקשב מלא. כאשר סדרת Qwen3.5 שוחררה, היא אימצה את התוכנית הזו בקנה מידה גדול — וההיבריד נמשך דרך דור Qwen3.8 מאז, כולל דגם הדגל 2.4T. הסיבה שהתקדים חשוב כאן היא התזמון המשתמע ממנו. יש לצפות שהמשפחה המלאה של Qwen4 תופיע מעבר לתצוגה המקדימה הזו, ולא בתוכה; אם הפער של Qwen3-Next הוא אינדיקציה, המרחק בין "הנה הארכיטקטורה" ל"הנה המשפחה" נמדד בחודשים. שום דבר בכרטיס המודל לא מאשר זאת — זו הסקה מדפוס ש-Alibaba כבר הריצה פעמיים.

מה שאנחנו עדיין לא יודעים

הלא-ידועים הצטמצמו, אבל הם לא נעלמו:

• טבלת הבנצ'מרקים של הספק היא עדיין של הספק. Artificial Analysis העניקה כעת למודל ציון עצמאי, מה שסוגר את הפער הגדול ביותר בסיקור ההשקה — אבל טענת הכותרת של Alibaba עצמה, שהמודל מנצח את Claude Opus 4.6 Max ב-8 מתוך 9 בנצ'מרקים בני-השוואה, נשענת על הערכות פנימיות של Alibaba עצמה (CoWorkBench, JobBench, AndroidWorld) לצד הערכות ציבוריות, ואף אחת מהן לא שוחזרה בידי צד שלישי.

• האם התצוגה המקדימה היא אותו מודל כמו זה המוגש בפועל. כרטיס המודל מציג את Qwen3.8-Flash-Next כתצוגה מקדימה ניסיונית במשקולות פתוחות, ואילו גרסת הייצור המוגשת — Qwen3.8-Flash של Qwen Cloud — מוסיפה חלון הקשר של 1,000,000 טוקנים כברירת מחדל וכלים מובנים. האם אותו מודל מוגש הוא אותה ארכיטקטורה תחת חלון הקשר גדול יותר — הדבר טרם נאמר, והציונים הבלתי־תלויים שלעיל הם עבור התצוגה המקדימה במשקולות פתוחות, ולא עבור מודל ה-API המוגש.

• הרישיון מוכר והוא רישיון אמיתי: Qw​en Community License 1.0 מתיר שימוש מסחרי, כולל מכירת יצירות נגזרות, אך דורש הסכם מסחרי נפרד עם Aliba​ba אם אתה מפעיל עסק של Model-as-a-Service או עוזר עבודה מבוסס AI מעבר לסף מוגדר של הכנסות ומשתמשים פעילים חודשיים. הוא אינו זהה לרישיון Qwen3.8-Max המותנה בהכנסות, אך כדאי לקרוא אותו לפני שבונים על המשקולות.

• דיווח שטח אחד שראוי להדגיש: פרסום מ-6 בספטמבר על בילד קהילתי של NVFP4 מתעד כשל בקריאה לכלים עם אילוצי דקדוק כאשר גם מצב חשיבה וגם חיזוי רב-טוקנים מופעלים, שמקורו במסלול הפענוח המוגבל של xgrammar. זהו באג בזמן ריצה בבילד קהילתי מכומת ולא מאפיין של המודל — אבל אם מערכת ההערכה שלך נשענת על קריאות לכלים עם אילוצי דקדוק, זה הדבר הראשון שכדאי לבדוק.

משפחה הפועלת במחזורים דו-שבועיים

הקצב שמסביב הוא סיפור בפני עצמו. Qwen3.8-Max, דגל הדגמים עם 2.4 טריליון פרמטרים, שוחרר ב-3 באוגוסט; גרסת המשקולות הפתוחות Qwen3.8-2.4T-A95B באה בעקבותיו ב-12–13 באוגוסט; ה-Qwen3.8-27B החופשי תחת Apache-2.0 נחת ימים לאחר מכן; וכעת, בטרם יסתיים החודש, מוצגת בתצוגה מקדימה הארכיטקטורה של הדור הבא — וכעבור שבוע היא גם נבחנת במבחני ביצועים בלתי־תלויים. אף מעבדה אחרת אינה מבצעת איטרציות בקצב כזה כיום. עבור קורא שבוחר דגמים, המשמעות המעשית היא ש"ה-Qw​en הטוב ביותר" הוא מטרה נעה — והפער בין הדורות מגיע מהר יותר משהמערכת האקולוגית שמסביב בדרך כלל מסתגלת. לקנות החלטה ולא דגם הוא יותר ויותר המהלך שניתן להצדיק.

מה מפתח צריך לעשות עכשיו

מספרי היעילות משנים את חישוב ההגשה המקומית יותר מאשר ההשקה עצמה עשתה. מודל עם 6B פרמטרים פעילים שמקבל 40 במדד הנוכחי ניתן לדחיסה: הקוונטיזציה הרשמית NVFP4 של NVIDIA היא זו שבה השתמשה הרצת smf-bench מ-5 בספטמבר, ומעבר לה כבר נמצאים בתפוצה מבני NVFP4 ו-FP8 קהילתיים, וזה מה שמאפשר בכלל פריסה בדרגת GPU בודדת של מודל המאוחסן ב-180B. ההסתייגות לא השתנתה — זו תצוגה מקדימה לא מוכחת, טבלת הספק אינה משוחזרת, וצורת הציונים העצמאיים (חזקים בעבודת ידע ובמשימות מסוף, חלשים יותר ביצירת מאגרי קוד בטווח ארוך ובשיעורי מעבר חד-פעמיים של סוכנים) פירושה שחסרונות המודל מופיעים בדיוק היכן שחיי שינויי קוד בפרודקשן. הריצו עליו עותק בסיכון נמוך של עומס עבודה אמיתי לפני שהוא נוגע במשהו שחשוב, ותנו ל-failover אוטומטי לספוג את הרגעים שבהם תצוגה מקדימה מתנהגת שלא כשורה.

בכל הנוגע למחיר, התמונה שהייתה מעורפלת בעת ההשקה היא כעת מוצקה. Artificial Analysis מפרטת את תעריף השימוש של התצוגה המקדימה כ-0.15 דולר למיליון טוקני קלט ו-0.47 דולר למיליון טוקני פלט, לעומת 0.44 ו-1.32 דולר עבור DeepSeek V4 Flash 0731 — אותו סדר גודל כמו גרסת Qwen3.8-Flash המוצעת, ש-Qwen Cloud מתמחרת ב-¥1 ו-¥3 (כ-0.16 ו-0.47 דולר). גרסת הייצור היא זו שאפשר באמת לקרוא לה היום: היא מנותבת כאן בתור qwen/qwen3.8-flash, ו-OrcaRouter מעבירה הלאה את מחיר המחירון של הספק בתוספת של 0%, כך שכאשר Alibaba משנה את המספר הזה, נקודת הקצה משתנה יחד איתו באותו היום. כך גם לגבי מודל ההשוואה בכתבה הזו — DeepSeek V4 Flash 0731 מנותב בתור deepseek/deepseek-v4-flash-0731 במחיר המחירון של הספק, מה שהופך את חצי העלות-לטוקן של ההשוואה שלמעלה לניתנת לבדיקה מול התעבורה שלכם ולא מול ספירת הטוקנים של מדד. מה שלא מנותב כאן הוא תצוגת ה-Flash-Next בעלת המשקולות הפתוחות עצמה: כדי להשתמש בה היום צריך להוריד את המשקולות ולהריץ אותן בעצמכם, וזו בדיוק הסיבה לכך שסיפור הכימות שלמעלה חשוב יותר ממחיר המחירון. התקרה שהדור הזה צריך לעבור עדיין נראית באותה נקודת קצה: Qwen3.8-Max (qwen/qwen3.8-max) עומדת על 2.00 דולר למיליון טוקני קלט ו-6.00 דולר למיליון טוקני פלט, גם כן בהעברה לפי מחיר המחירון של הספק.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

סדר ההפעלה המעשי לא השתנה בהרבה, אבל הביטחון שמאחוריו כן. אם אתם רוצים את וריאנט הייצור המוגש בלי למשוך 100GB של משקלים, Qwen3.8-Flash כבר ניתן לקריאה במחיר מחירון. אם אתם רוצים את הארכיטקטורה — GDN, QSA, טבלת ה-n-gram, טריקי ה-offload — המשקלים ניתנים להורדה וסביבות ה-runtime מוכנות: vLLM מגיש אותו מהיום הראשון עם מסלול offload ששומר את טבלת ההטמעות n-gram בת 51B הפרמטרים בזיכרון המארח במקום ב-VRAM קבוע, SGLang ו-TensorRT-LLM נמצאים ברשימת Day 0 של NVIDIA, והספרייה של Ollama מכילה build של MLX שאפשר למשוך ב-Apple Silicon. הדבר האחד שצריך להפסיק לעשות הוא להתייחס למודל כלא-ידוע בכל הנוגע לאיכות. הוא נמדד כעת, והוא נמדד היטב.

מה לצפות בהמשך

• האם המספרים העצמאיים יחזיקו מעמד ככל שהמדד מתבגר. ה-40 של Qwen3.8-Flash-Next מגיע עם חשבון טוקנים גבוה במיוחד — הוא שרף 245M טוקנים בהרצת המדד לעומת חציון של 140M — וההערה של Artificial Analysis עצמה מכנה אותו "מילולי מאוד". ציון שמופק מהנמקה ארוכה יותר הוא עדיין ציון, אבל זה מסוג הדברים שזזים כשההערכה משתנה. העדכון הבא של המדד הוא המבחן האמיתי לשאלה אם 40 היה רמה או מקסימום מקומי.

• האם Qwen3.8-Flash המוגש מקבל ציון בנפרד. כל מספר עצמאי בכתבה הזו מתייחס לתצוגה המקדימה עם המשקולות הפתוחות. לגרסת הייצור עם חלון ההקשר של 1M והכלים המובנים אין ציון עצמאי משלה, ואם זו אותה ארכיטקטורה תחת חלון הקשר ארוך יותר, זו הערכה זולה שמישהו צריך לפרסם.

• כיצד תמיכת ההגשה מיום-0 מחזיקה מעמד בפועל — נתוני התפוקה של GB300 כפי שמצוינים על ידי הספק הם עדיין בגדר הצהרות ספק בלבד, ותצורות ה-expert-parallel מסוג TP4 וה-KV-offload עדיין חדשות מספיק כדי להיות שבריריות.

• כמה זמן תמתין אליבאבא עד שמשפחת Qwen4 המלאה תגיע בעקבות התצוגה המקדימה.

החלק של "מה שאנחנו יודעים עד כה" בסיפור הזה נסגר כעת ברובו. גיליון המפרט פומבי, המשקלים ניתנים להורדה, הארכיטקטורה מאושרת, גרסת Qwen3.8-Flash המוגשת זמינה בממשקי API מתארחים במחיר מחירון, והמודל דורג באופן עצמאי בידי שני גורמים נפרדים — כשהמודל הקטן יותר מנצח בוויכוח על האיכות והגדול יותר מנצח בוויכוח על התפוקה. מה שנותר פתוח הוא האם תצוגה מקדימה עם 6B פעילים מכלילה מעבר למדדי הביצועים שאליהם כווננה, וכמה זמן Alibaba תמתין לפני שמשפחת Qwen4 המלאה תגיע בעקבותיה. השאלה האחרונה הזו היא עדיין זו שהשחרור מותיר ללא מענה, והיא עדיין זו שתהיה החשובה ביותר.

השוואות במאמר הזה4

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית