Qwen3.8-Flash-Next לעומת Qwen3.8-27B — ה-MoE של Qwen4-preview מול סוס העבודה בעל המשקלים הפתוחים. איור מחודש.
Guides & Insights

Qwen3.8-Flash-Next לעומת Qwen3.8-27B: ה-MoE של Qwen4-preview מול סוס העבודה בעל המשקלים הפתוחים

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הדבר המפתיע ב־Qwen3.8-Flash-Next אינו שאליבאבא טוענת שמודל שמפעיל רק 6 מיליארד פרמטרים לכל טוקן מנצח את רוב השדה הפתוח — אלא שהגשתו דורשת יותר זיכרון מאשר מודל ה־27 מיליארד פרמטרים הצפוף שאליו הוא מושווה. Qwen3.8-Flash-Next, שקוד הפתוח שלו פורסם ב־26 באוגוסט 2026 כתצוגה מקדימה של ארכיטקטורת Qwen4, שומר טבלת חיפוש N-gram בת 51 מיליארד פרמטרים ב־RAM של המערכת במקום ב־VRAM; Qw​en3.8-27B, מודל המולטימודאלי הצפוף ברישיון Apache-2.0 שיצא באמצע אוגוסט ומשמש כסוס העבודה בקוד הפתוח של דור Qw​en 3.8 הנוכחי, נכנס בכרטיס מסך אחד של 24GB בקוונטיזציה של 4 ביט. בגיליון ההשוואות של אליבאבא עצמה, ה־MoE החדש מנצח את ה־27B ב־21 מתוך 22 מדדים שהושוו. בראיות בלתי תלויות — מיקומי ארנה, מחקר על סוכנים משפטיים, מדידות תפוקה של צד שלישי — ה־27B הוא היחיד משניהם שיש לו עדויות כאלה. השילוב הזה הוא כל ההחלטה.

ההתמודדות בשורה אחת: שני חברים מאותו דור במשקל פתוח, עם טקסט וראייה, עם אותו קונטקסט מקורי של 262K, שניהם מיועדים לפעול מחוץ למרכז נתונים — ומפוצלים לפי ארכיטקטורה, לפי רישיון, לפי מחיר, ולפי כמה מהסיפור שלהם אומת. Qwen3.8-Flash-Next הוא ה-MoE הדליל שמציג תצוגה מקדימה של כל מה ש-Qwen4 צפוי לרשת. Qw​en3.8-27B הוא המודל הצפוף שמדחס את מה שאליבאבא למדה מבניית הדגל של 2.4T למשהו ש-GPU יחיד יכול להריץ. הבחירה ביניהם פחות קשורה ליכולת — אליבאבא אומרת שהתצוגה המקדימה מובילה — ויותר לשאלה אם אתם בוטחים בגיליון נתונים של ספק בן יום אחד על פני מודל שכבר פורק על ידי הקהילה.

לוח התוצאות

ראשית, מקור הנתונים: {{1}}כל נתון של Qwen3.8-Flash-Next להלן הוא של Alibaba עצמה, בן יום אחד ולא שוכפל.{{/1}} טענות הדגל במדדי הביצועים של Qw​en3.8-27B מדווחות גם הן על ידי Alibaba, {{2}}אך ה-27B נושא תוצאות עצמאיות — מיקומים בזירת העדפה אנושית, מחקר בתחום המשפט, ומדידות תפוקה של AMD — שהתצוגה המקדימה אינה יכולה להשתוות אליהן.{{/2}}

• סך הפרמטרים — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B מאוחסנים), 6B פעילים. Qw​en3.8-27B: ~27B דחוסים (28B עם מקודד ראייה), כולם פעילים.

• ארכיטקטורה — Qwen3.8-Flash-Next: Qwen4 preview — {{1}}Qwen Sparse Attention לסירוגין עם Gated DeltaNet, שיורי עם שער, הטמעות N-gram, אומן עם Muon.{{/1}} {{2}}Qwen3.8-27B: 48 שכבות קשב ליניארי GDN ועוד 16 שכבות קשב מלא (3:1), צפוף.{{/2}}

• הקשר — 262,144 טוקנים מקוריים בשני הדגמים, ניתנים להרחבה ל-1M באמצעות YaRN.

• מודאליות — שתיהן מקבלות קלט של טקסט, תמונה ווידאו ומחזירות טקסט.

• רישיון — Qwen3.8-Flash-Next: qwen-community-1.0. Qw​en3.8-27B: Apache 2.0.

• מחיר — Qwen3.8-Flash-Next: $0.16 / $0.47 לכל 1M (הוכרז; API הייצור עדיין לא פתוח). Qwen3.8-27B: $0.33 / $2.40 לכל 1M, זמין היום.

• טביעת ריצה — Qwen3.8-Flash-Next: טבלת 51B בזיכרון RAM של המארח, ~96GB זיכרון מערכת ועוד GPU; FP8 ~186GB, Q4 GGUF ~82GB. Qw​en3.8-27B: BF16 ~55.6GB, 4-bit מתאים לכרטיס 24GB.

• ראיות עצמאיות — Qwen3.8-Flash-Next: אין עדיין. Qwen3.8-27B: מודל פתוח #1 ב-Arena.ai Image-to-WebDev, #9 בסך הכל ב-Code Arena WebDev, #1 במשקל פתוח במדד Legal Agent של Harvey, תפוקה שנמדדה על ידי AMD.

A two-column comparison scoreboard titled 'Qwen3.8-Flash-Next vs Qwen3.8-27B — the scoreboard': left column Qwen3.8-Flash-Next with Params '125B MoE + 51B N-gram', Active per token '~6B', Architecture 'Qwen4 preview', Context '262K native / 1M via YaRN', Price '$0.16 / $0.47 per 1M', Independent score 'none yet'; right column Qwen3.8-27B with Params '27B dense', Active per token '27B (all)', Architecture 'GDN hybrid, current gen', Context '262K native / 1M via YaRN', Price '$0.33 / $2.40 per 1M', Independent score '#1 open Image-to-WebDev'; footer 'Flash-Next figures vendor-reported, unreproduced; 27B independent per Arena.ai, vendor figures Alibaba-reported'; the OrcaRouter logo is composited in the bottom-right corner.

לפי המספרים של עליבאבא עצמה, התצוגה המקדימה מנצחת כמעט בהכול

ההשוואה שפרסמה עליבאבא מעניקה ל-Qwen3.8-Flash-Next ציונים שווים או טובים יותר ב-21 מתוך 22 מדדי שפה וראייה לעומת Qw​en3.8-27B, והניצחונות אינם קוסמטיים. SWE-bench Pro 62.5 לעומת 61.7 הוא יתרון שולי, אבל DeepSWE 58.7 לעומת 42.2, JobBench 55.7 לעומת 33.4, ו-CoWorkBench 73.9 לעומת 70.7 הם פערים אמיתיים בדיוק בעומסי העבודה הסוכנותיים והמשרדיים ששכבת הפלאש מכוונת אליהם. המספרים הראשיים של התצוגה המקדימה — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — עוקפים גם הם את השורות המקבילות של ה-27B בטבלה של עליבאבא. זו התזה של המהדורה כנתונים: רוב יכולת ההיגיון והקידוד של קו Qw​en 3.8 הגדול יותר, בשבריר מהחישוב הפעיל.

השאר את התווית צמודה למשפט הזה. אלה הערכות של עליבאבא עצמה, ממערך ההערכה של עליבאבא עצמה, בנות יום אחד במקרה של התצוגה המקדימה, וללא שכפול בשני המקרים. ניתוח הפירוק של ארכיטקטורת KGP Talkie שמדורג עבור התמודדות זו מגיע לאותה צורת מסקנות, אבל הוא עובד מאותו גיליון נתונים של הספק. טבלת ספק היא הבטחה; שום דבר בפסקה זו לא אושר באופן בלתי תלוי.

מה שיש ל-27B ושאין ל-Flash-Next: הוכחות

{{1}}כאן ההשוואה מפסיקה להיות חד-צדדית. Qw​en3.8-27B נמצא בשטח כבר שבועיים, והקהילה הפיקה שלוש נקודות נתונים עצמאיות.{{/1}} {{2}}בלוח Image-to-WebDev של Arena.ai — הצבעות אנושיות עיוורות על איזה משני הפלטים האנונימיים צופה היה מעדיף לשחרר — דגם ה-27B מדורג במקום הראשון מבין המודלים הפתוחים ובמקום השביעי בסך הכול, עם ציון מדווח של 1,574.{{/2}} {{3}}בלוח Code Arena WebDev המקביל, הוא מדורג במקום התשיעי בסך הכול עם 1,595 — המודל היחיד בקטגוריית הגודל שלו שנכנס לעשירייה הראשונה.{{/3}} {{4}}Harvey, חברת ה-AI המשפטי, ו-Engram ערכו מחקר של משרד עורכי דין סינתטי, שהציב 27B מותאם בראש מדד הסוכן המשפטי שלהם — עם הסתייגות שהמודל למד את קורפוס הבדיקה מראש, מה שהופך זאת להדגמה של פוטנציאל כיוונון עדין, ולא לציון למשקולות המקוריות.{{/4}} {{5}}AMD פרסמה מדידות תפוקה ליום ההשקה: 24.5 טוקנים/שנייה על Ryzen AI Max+ 395, ו-51.8 טוקנים/שנייה על Radeon AI PRO R9700.{{/5}} {{6}}אף אחד מאלה אינו ציון איכות לשימוש כללי — אין עדיין אינדקס Artificial Analysis לדגם ה-27B — אבל כל אחד מהם הוא צד שלישי שהריץ את המודל בפועל.{{/6}}

ל-Qwen3.8-Flash-Next אין שום דבר מזה. גיליון האמות-המידה כולו שייך לאליבאבא, בן שעות ספורות בזמן כתיבת שורות אלו, ואף מעבדה עצמאית לא שחזרה ולו שורה אחת. זו אינה האשמה; זו ההגדרה של שחרור בן יום. אבל זה בדיוק חוסר-הסימטריה שצריך להנחות את הבחירה: התצוגה המקדימה מובילה במספרים היחידים שקיימים, וכל אחד מאותם מספרים נכתב על-ידי הספק שרוצה שתאמין לו.

פיצול הפריסה

ההבדל המעשי בין שני המודלים הללו הוא היכן שהפרמטרים יושבים, וזה קובע איזו חומרה אתה צריך. Qwen3.8-Flash-Next מעביר בכוונה את טבלת ה-embedding של N-gram בגודל 51B לזיכרון המארח, שם ניתן לטעון אותה מראש באופן אסינכרוני — זו הסיבה שהוא מוסיף 51B פרמטרים של קיבולת בלי להוסיף חישוב לכל token. התוצאה היא שהמודל לא ייכנס בכרטיס צריכה של 24GB כמו ש-Qw​en מקומי נכנס בעבר. הערכות הקהילה מעמידות Q4 GGUF על כ-82GB בסך הכול (כ-58GB של משקלים עיקריים ועוד טבלת חיפוש של 24GB), גרסת FP8 על כ-186GB, ו-BF16 על כ-360GB; המתכון המעשי הוא מכונה עם כ-96GB זיכרון RAM מערכת ועוד GPU כלשהו שמריץ את ה-6B הפעיל. התמורה היא שחישוב לכל token זול — ההימור כולו של הארכיטקטורה — וקונטקסט ארוך של 1M tokens נשאר משתלם, כי שכבות ה-GDN דוחסות את ההיסטוריה במקום להגדיל מטמון KV.

Qw​en3.8-27B הוא המודל ההפוך: צפוף, כך שכל טוקן מריץ את כל 27B הפרמטרים, אבל קטן מספיק כדי שכל הדבר יתאים על חומרה שכבר יש לך. משקלי ה-BF16 הם בערך 55.6GB; ב-4-bit הוא רץ על כרטיס 24GB כמו RTX 3090 או 4090, והמדידות של AMD מראות שהוא עושה 24.5 עד 51.8 טוקנים לשנייה על חומרה מסוג AI Max-class ו-Radeon PRO. אם האילוץ הוא תחנת עבודה אחת, ה-27B הוא זה שבאמת מתאים; אם האילוץ הוא עלות לכל טוקן בקנה מידה, Flash-Next הוא זה שמנצח על הנייר.

מזלג המחירים

מחירי ה-API מספרים את אותו סיפור מהצד השני. Qw​en3.8-27B פעיל היום ב-OrcaRouter במחיר של $0.33 למיליון אסימוני קלט ו-$2.40 למיליון אסימוני פלט, מחיר המחירון של הספק מועבר ללא תוספת — אפשרות האירוח העצמי ניתנת כעת לקריאה, ללא צורך בקניית GPU. Qwen3.8-Flash-Next עדיין לא מנותב לשום מקום: המשקלים הפתוחים הם הדרך היחידה עד ש-Qwen3.8-Flash בגרסת הייצור ייפתח ב-API של QwenCloud במחיר המוכרז של $0.16/$0.47. כשה-API הזה ייפתח, אותו מעבר יעמיד את המחיר של $0.16/$0.47 בצד שלנו באותו יום, על אותו מפתח כמו ה-27B, עם מעבר אוטומטי (failover) ביניהם — כך שהדרך לאמץ ארכיטקטורה בת יום אינה להמר עליה בסביבת הייצור, אלא לנתב אליה נתח תנועה כשהמודל המוכח משמש כגיבוי. שכבת ניתוב יכולה גם לשבת לפני מודל שאתה מריץ בעצמך, וזו הדרך המעשית להעריך את המשקלים הפתוחים של Flash-Next היום ללא אינטגרציה נוספת.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b (captured August 27, 2026), showing the model name 'Qwen3.8 27B', model id 'qwen/qwen3.8-27b', Vision/Tools/JSON/Reasoning tags, 'by Qwen - 2026-08-13', pricing $0.33 input and $2.40 output per 1M tokens, a p50 TTFT of 1.63s, the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure', and the OpenAI-compatible endpoint note.

איזה מהם להריץ

בחר ב-Qwen3.8-Flash-Next אם אתה רוצה ללכת בכיוון של Qwen4 עכשיו, אם עומס העבודה שלך בהיקף גדול מספיק כך ש-$0.16/$0.47 לעומת $0.33/$2.40 הוא סכום משמעותי, או אם יש לך מספיק זיכרון RAM כדי לארח אותו בעצמך ואתה מרגיש בנוח עם דף נתונים של ספק. בחר ב-Qw​en3.8-27B אם אתה צריך תנאי Apache-2.0, כרטיס יחיד של 24GB, מודל שתוכל להפעיל היום, או כל מידה של עדות בלתי תלויה — זהו המודל היחיד מבין השניים שהופעל על ידי מישהו מחוץ ל-Alibaba.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the description stating compatibility with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default, plus the license 'qwen-community-1.0' and model size 180B params.

שני צילומי המסך שלמעלה הם החזיתות הציבוריות של כל חצי: רשימת OrcaRouter שבה Qw​en3.8-27B זמין לקריאה היום ב-$0.33/$2.40, וכרטיס המודל Qwen/Qwen3.8-Flash-Next ב-Hugging Face.

והסגירה הכנה היא שאלה, כי בסיס הראיות הוא בן יום אחד: האם מודל שמפעיל 6 מיליארד מהפרמטרים שלו יכול לשמור על תוצאה של 21 מתוך 22 תחת שכפול בלתי תלוי, או שטבלת ה-N-gram שמאפשרת לו לשרת ביעילות היא גם הדבר שנכשל בעומסי עבודה אמיתיים? ה-27B כבר שרד שבועיים של ביקורת קהילתית. Flash-Next נמצא במקום שבו היה ה-27B לפני שבועיים — וזה הטיעון הטוב ביותר להריץ אותם זה לצד זה במקום לבחור.