
Qwen 4 QSA מקבל decode context parallelism: מבפנים אל ה-PR בטיוטה של vLLM עבור Qwen3.8-Flash-Next
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 397 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1136 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
ב-29 בספטמבר 2026, הופיעה במאגר vLLM בקשת משיכה (pull request) בטיוטה שכותרתה "[Model][DCP] Support Qwen4Exp QSA", ולגבי המודל שהיא מתארת, היא נושאת את נתוני ההגשה הקונקרטיים ביותר שמישהו פרסם במהלך כל החודש: ריצות מזווגות של Qwen3.8-Flash-Next על ארבעה GPUs המציגות קיבולת אסימוני KV שעולה מ-9,759,529 ל-17,603,636, מקביליות מקסימלית מ-37.23× ל-67.15×, וזמן לאסימון ראשון שיורד מ-1,869 ms ל-767 ms. Qwen3.8-Flash-Next הוא תצוגה מקדימה של תערובת מומחים בעלת משקולות פתוחות עם 125 מיליארד פרמטרים, שכרטיס ה-Hugging Face שלו מתאר אותו כ"תצוגה מקדימה של ארכיטקטורת Qwen4"; בקשת המשיכה מוסיפה מקביליות הקשר פענוח למסלול הקשב הדליל שהארכיטקטורה הזו בנויה סביבו. Qwen4 עצמו — דרגות ה-Qwen4 Max, Flash, Plus ו-27B שהספק הציג בכנס Apsara שלו ב-22 בספטמבר 2026 — עדיין לא שוחרר, ללא משקולות, ללא מזהה, ללא מחיר וללא תאריך. אז קראו את זה כפי שזה: לא השקה, לא מבחן ביצועים, אלא חפץ הנדסי שאומר לכם כיצד מעטפת ההגשה של Qwen4 מתרחבת לפני שהמשפחה קיימת.
זהו מאמר של מה שאנחנו יודעים עד כה, והמקורות חשובים יותר מהרגיל. ה-pull request הוא במצב טיוטה, פתוח ולא ממוזג — vllm-project/vllm#59279, נפתח ב-2026-09-29 על ידי Sungsoo Ha, מהנדס תוכנה ב-NVIDIA, ועדיין נמצא במצב טיוטה. כל מספר למטה הוא מדידה מזווגת של המחבר עצמו, כפי שדווח בגוף ה-PR, שנלקחה מגרסה מוקדמת של אותה עבודה. שום דבר כאן לא עבר ביקורת בלתי תלויה, שום דבר כאן לא נכנס לגרסה רשמית, וההסתייגות שהמחבר מצרף חשובה מספיק כדי לקבל סעיף משלה בהמשך.
מה שבקשת המשיכה למעשה משנה
הקבלה של הקשר פענוח — DCP — היא טכניקת הגשה, לא שינוי במודל. במקום שקבוצת GPU אחת תחזיק מטמון KV שלם, DCP מפצל את המטמון הזה בין דרגות, כך שכל דרגה קוראת רק את הפרוסה שלה של ההקשר, בעוד שתוצאות הקשב משולבות בין הדרגות בסוף. הנקודה היא קיבולת: כאשר המטמון מחולק, פריסה יכולה להחזיק תעבורת הקשר ארוך במקביל הרבה יותר על אותה חומרה, וזה בדיוק האילוץ שמכביד כשכל בקשה נושאת רבע מיליון טוקנים.
הסיבוך הוא ש-Qwen Sparse Attention — QSA — אינו שכבת תשומת לב רגילה. כפי שמפרט כרטיס המודל של Qwen3.8-Flash-Next, אינדקסר קל-משקל מכווץ מפתחות למיקרו-בלוקים ביחס דחיסה של 4, נותן להם ציונים ושומר את 512 הבלוקים הטובים ביותר, כ-2,048 עמדות טוקנים, בעוד שהסופטמקס הסופי ואגרגציית הערכים עדיין פועלים על ה-K וה-V הלא-דחוסים. משמעות הדבר היא ש-QSA נושאת יותר מצב מאשר מטמון KV: ישנו המטמון הראשי, וישנם מטמוני הבורר ומטמוני הצד שהאינדקסר מתחזק. המימוש הגנרי של DCP ב-vLLM אינו יודע דבר מכל זה.
מה ש-#59279 עושה, לפי התיאור שלו, הוא ללמד את DCP על החלקים הספציפיים ל-QSA:
• כל דירוג קורא את חלקו מתוך מטמון ה-KV הראשי, בעוד שהבורר של QSA ומטמוני הצד נשארים משוכפלים בין הדירוגים במקום מחולקים.
• תוצאות ה-Attention משולבות בין ראנקים לאחר הקריאה המפוצלת.
• הסלקטור ומטמון ה-KV הראשי נשמרים בקבוצת מטמון אחת, כך שהם לא יכולים להיפרד זה מזה.
• אצוות Synthetic V2 נמנעות מכתיבה למטמוני הצד של QSA.
![A capture of the vLLM GitHub pull request #59279, titled '[Model][DCP] Support Qwen4Exp QSA', showing an Open state with a Draft badge, the head branch sungsooha:n4/qsa-dcp-clean-20260929, the description of how decode context parallelism is enabled for Qwen4Exp QSA, and the labels kv-cache-manager, mrv2, speculative-decoding, dflash, nvidia, qwen and ci/build.](https://cms.orcarouter.ai/api/media/file/2-1437.png)
צמד הפרטים האחרון הוא החלק המעניין, אם אכפת לך מנכונות ולא מתפוקה. מטמון קשב מפוצל (sharded) שחולק בשקט על הסלקטור המשוכפל הוא בדיוק סוג הבאג שמתגלה כדעיכת דיוק איטית בהקשר ארוך ולא כקריסה, והשינוי מצהיר במפורש על שמירה על סנכרון בין השניים. המחבר גם מציין שנעשה שימוש בסיוע AI ו-Codex מיוחס כשותף מחבר — כדאי לומר זאת בפשטות, כי בטיוטת PR כזו זו שאלה הוגנת לשאול מי כתב מה.
המספרים המזווגים, וכיצד הם נלקחו
תוכנית הבדיקה ספציפית מספיק כדי להיות ניתנת לבדיקה, ולכן התוצאות ראויות לציטוט. שתי הזרועות מריצות את Qwen/Qwen3.8-Flash-Next-FP8 על ארבעה GPUs עם tensor parallelism 4 ו־expert parallelism מופעל, ב־--gpu-memory-utilization 0.90 עם prefix caching מופעל. ההבדל היחיד בין שתי הזרועות הוא --decode-context-parallel-size: מושמט עבור DCP=1, מוגדר ל־2 עבור DCP=2, עם אתחול בין הזרועות כך שהבנצ'מרק מתחיל ממטמון קר. העומס הוא trace של AgentX 256k עם 128 משתמשים למשך 900 שניות; הדיוק נמדד באמצעות EvalScope עבור GSM8K יחד עם מעריך ה-MRCR המצורף למאגר, בהרצה של שש פעמים לכל זרוע, כאשר ההרצה הראשונה לאחר האתחול מבוטלת.
הפרשי התפוקה המדווחים, DCP=2 לעומת DCP=1:
• טוקנים של KV — 9,759,529 לעומת 17,603,636, עלייה של פי 1.80 בקיבולת המטמון.
• מקביליות מקסימלית — 37.23× לעומת 67.15×, וגם 1.80×.
• בקשות לשנייה — 1.69 לעומת 2.30, פי 1.36.
• טוקני קלט לשנייה — 128,730 לעומת 179,702, 1.40×.
• זמן עד לאסימון הראשון — 1,869 ms לעומת 767 ms, נמוך פי 2.44.
• השהיה בין טוקנים — 43.48 ms לעומת 26.27 ms, נמוכה פי 1.66.
• שיעור פגיעות מטמון הקידומת במצב יציב — 67.85% לעומת 88.98%, שיפור של 21.1 נקודות אחוז.

דיוק, המדווח כממוצע ± סטיית תקן מדגמית על פני ריצות שלאחר החימום, היה כמעט ללא שינוי: מדד MRCR המצטבר 0.8630 ± 0.0005 ב-DCP=1 לעומת 0.8697 ± 0.0153 ב-DCP=2, ו-GSM8K 0.9788 ± 0.0020 לעומת 0.9790 ± 0.0016. מדגמי MRCR של 2 מחטים ו-4 מחטים היו קבועים על 0.9960 ו-0.9906 בשתי הזרועות, כך שכל התנודה בין ריצות נבעה מהמדגמים של 8 מחטים — וריצת צובר אחת של DCP=2 קיבלה ציון 0.8970 בעוד שארבע האחרות נעו בין 0.8620 ל-0.8632. זהו פיזור אמיתי, לא רעש שאפשר לנפנף בו, והוא מצוין ב-PR במקום להיות מוחלק.
מה שהמספרים האלה אינם קובעים
ההסתייגות נמצאת בטקסט ה-PR והיא לא קטנה. התוצאות המזווגות של AgentX והדיוק נמדדו על גרסה קודמת של QSA DCP, תוך שימוש ב-vLLM nightly המבוסס על קומיט 3df4ae153eb. הקומיט הנקי הסופי ב-pull request כולל תיקון עוקב ל-localization kernel של QSA, ועבר אימות B200 ממוקד — אך הערכות ה-AgentX והדיוק המלאות לא בוצעו שוב על אותו מקור בדיוק. במילים אחרות: סיפור התפוקה וה-diff שנשלח אינם אותו ארטיפקט, והמחבר אומר זאת.
מעבר לכך, המשמעת הרגילה חלה, והיא חלה כאן בכל תוקף. אלה מספרים של תצורה בודדת מתורם בודד על מערך בודד של ארבעה GPUs. הם קרובים לספק ולא ניטרליים: תורם לפריימוורק שמודד שינוי בפריימוורק הוא דבר רגיל ושימושי, אבל זה לא ביקורת עצמאית, ואף צד שלישי לא שחזר את ההרצה. אין גרסת vLLM משוחררת שניתן להתקין היום ושכוללת את השינוי הזה, כי השינוי לא מוזג. ו-DCP=2 הוא פיצול דו-כיווני של צורה ספציפית אחת — הדלתאות אינן הבטחה לגבי מה ש-DCP=4 או DCP=8 יעשו, ושום דבר ב-PR לא טוען שהן כן.
למה PR של serving על ארכיטקטורה שטרם שוחררה עדיין שווה את זמנך
ההתנגדות הברורה: המודל שבכותרת אינו קיים, אז למה להתעניין? מפני שהדבר שמכוונן אינו Qwen 4. זה Qwen3.8-Flash-Next, והמודל הזה כן קיים — אליבאבא פרסמה אותו ב-2026-08-24 בתור MoE בעל 125B פרמטרים עם 6B פעילים, טבלת הטמעות n-gram בת 51 מיליארד פרמטרים, ראש MTP בגודל 4B לפענוח ספקולטיבי, 48 שכבות המסודרות כשתים-עשרה חזרות של שלושה בלוקי Gated DeltaNet ואחריהם בלוק QSA אחד, 512 מומחים עם 10 מנותבים ו-1 משותף פעילים, וחלון הקשר מקורי של 262,144 טוקנים שכרטיס המודל אומר שניתן להרחיבו עד 1,000,000. זהו מימוש הייחוס של ארכיטקטורת Qwen4 במשקולות פתוחות, ו-QSA — קשב דליל של מיקרו-בלוקים שבקשת המשיכה הזו מלמדת את DCP לפצל — הוא החלק הייחודי ביותר בו.
מה שהמספרים מתארים זה מה שקורה כשמפסיקים להתייחס לקונטקסט של 262K הזה כאל משהו שקבוצת GPU אחת חייבת להחזיק בשלמותו. הזינוק של פי 1.80 בקיבולת אסימוני KV ובמקביליות הוא האריתמטיקה של פיצול מטמון לשניים, וזו התוצאה הכי פחות מפתיעה ברשימה. הנתונים המעניינים יותר הם נתוני השהיה: זמן נמוך פי 2.44 לאסימון הראשון ושהיה נמוכה פי 1.66 בין אסימונים באותו עומס מוצע, בתוספת שיפור של 21 נקודות בשיעור פגיעות מטמון הקידומת במצב יציב. אלה אומרים שמסלול DCP לא רק קונה קיבולת במחיר של השהיה — בהרצה המזווגת הזו הוא קנה את שניהם. זו צורת השינוי שחשובה לכל מי שמשרת תעבורת סוכנים עם הנחיות מערכת ארוכות מאוד, מכיוון שהתנהגות מטמון קידומת בקונטקסט ארוך היא בדרך כלל המקום שבו תפוקת קונטקסט ארוך מתה בשקט.
וזה לא תיקון מבודד. אותו שבוע הניב מקבץ של עבודות על מנוע Qwen4Exp: #59214 מוסיף תוכניות GEMM לפענוח בעיכוב נמוך ב-SM100 עבור תצורות B200, #59010 מוסיף קרנל prefill דליל נייטיב ב-SM90 עבור מסלול QSA על Hopper, #58977 מכסה הטמעות BF16 INC PLE, ו-#58961 — זה שאכן מוזג, ב-2026-09-28 — תיקן מטמון KV לפרופיילינג שתצוגות מפתח של QSA החזיקו בחיים. כשקוראים אותם יחד, הם מהווים את מעטפת ההגשה של ארכיטקטורת Qwen4 שנבנית בפומבי, בזמני הריצה, חודשים לפני שהמשפחה יוצאת. אם אתם מתכננים לקראת Qwen 4, האות השימושי אינו תאריך השקה — אין כזה — אלא מה שהקרנלים ופריסות המטמון כבר מניחים לגבי האופן שבו תצטרכו להגיש אותה.
מה שאתה יכול להתקשר אליו היום
אם ברצונכם לבדוק התנהגות הקשר ארוך על הארכיטקטורה שסביבה עוסק ה-PR הזה, המודל שאליו יש לפנות הוא שכבת ה-Flash שאליבאבא אכן מגישה בפועל. Qwen3.8-Flash — הפריסה הייצורית הבנויה על Qwen3.8-Flash-Next, עם חלון הקשר של 1,000,000 טוקנים ופלט מקסימלי של 131,072 טוקנים, המקבלת קלט של טקסט, תמונה ווידאו — זמין כעת, והוא נקודת קצה אחת עבור המודל שבאמת מריץ את ארכיטקטורת Qwen4Exp כיום, הרשומה בתור qwen/qwen3.8-flash במחיר של 0.15 דולר למיליון טוקני קלט ו-0.47 דולר למיליון טוקני פלט, עם קריאות מטמון ב-0.0184 דולר. מכיוון שאלה מחירי מחירון של הספק המועברים הלאה ללא תוספת רווח מצדנו, שינוי במחיר או במגבלה של הספק יגיע אליכם באותו יום שבו הוא מוכרז.

שתי הסתייגויות כנות. ראשית, Qwen3.8-Flash-Next עצמו — משקולות ה-FP8 בתוכנית הבדיקה של ה-pull request, אלו שתזדקקו להן כדי לשחזר כל אחת מהמדידות האלה באופן מקומי — אינו נמצא בקטלוג שלנו; שכבת ה-Flash המסופקת היא קו הייצור של QwenCloud, ולא נקודת הביקורת הגולמית של התצוגה המקדימה. אם אתם רוצים להריץ את התצורה המדויקת שב-PR, אתם מארחים בעצמכם על ארבעה GPUs. שנית, שינוי ה-DCP אינו ממוזג, כך ששום דבר שאליו תוכלו לפנות היום בשום מקום לא מריץ אותו. מה ששכבת השירות נותנת לכם הוא דרך לגלות אם עומס העבודה שלכם בכלל מתאים לבעיה ש-DCP פותר: אם ההנחיות שלכם ארוכות, סוכניות ועתירות קידומות, אזי קיבולת ה-1.80× ופער מטמון הקידומת הם המספרים שכדאי לשים לב אליהם בטרייסים שלכם.
ואם החלק המעניין עבורך אינו מודל אחד אלא שאלת ההחלפה — על איזה דרג לבנות כשסדרת Qwen 4 עדיין ללא שם — זו בעיית ניתוב ולא בעיית הגשה, ו-API אחד ל-200+ מודלים הוא הדרך להשאיר את האפשרות פתוחה בלי חוזה נוסף או שינוי קוד כשהמשפחה סוף סוף נוחתת.
שאלות ששווה לענות עליהן ישירות
האם #59279 אומר ש-Qwen 4 כבר יצא, או שעומד לצאת?
לא. ה-PR עוסק בארכיטקטורת Qwen4Exp כפי שהיא מיושמת ב-Qwen3.8-Flash-Next, שאותה Alibaba שחררה ב-24 באוגוסט 2026. משפחת Qwen 4 — Max, Flash, Plus ו-27B — הוכרזה על במה ב-Apsara ב-22 בספטמבר 2026 והוצבה במפת דרכים של החברה, עם קו יורש שצפוי להגיע ל-5 עד 10 טריליון פרמטרים, ועדיין אין לה כרטיס דגם, אין משקלים, אין מזהה API, אין חלון הקשר, אין מחיר ואין תאריך. PR של מסגרת שמוסיף מצב מקביליות לארכיטקטורת התצוגה המקדימה הוא צעד לקראת מתן שירות טוב ל-Qwen 4. הוא לא צעד לקראת קיומו של Qwen 4.
במה מקבילות הקשר בפענוח שונה ממקבילות טנזורית?
הם מפצלים דברים שונים ונכשלים בדרכים שונות. Tensor parallelism מחלק את המשקלים ואת החישוב של כל שכבה בין GPUs, כך שכל דרגה משתתפת בכל טוקן אך רואה את כל הרצף. Decode context parallelism מחלק את מטמון ה-KV עצמו, כך שכל דרגה מחזיקה וקוראת רק פרוסה מההקשר ותוצאות הקשב החלקיות ממוזגות לאחר מכן. TP עוסק בהתאמת המודל; DCP עוסק בהתאמת ההקשר והתעבורה המקבילה שרוכבת עליו. הבחנה זו היא בדיוק הסיבה לכך ש-PR זה אינו טריוויאלי: הבורר והמטמונים הצדדיים של QSA לא יכולים פשוט להיות מפוצלים כמו מטמון ה-KV הראשי, כך שהשינוי חייב לפצל אחד ולשכפל את האחרים, ואז להוכיח ששניהם נשארים עקביים.
אם אני קורא ל-Qwen3.8-Flash-Next היום באמצעות API מתארח, האם אני כבר מקבל את המספרים האלה?
לא, ולפער יש שלושה חלקים. השינוי אינו ממוזג, לכן אף מהדורת vLLM ששוחררה אינה מכילה אותו. גם לאחר שימוזג, הספק יצטרך לאמץ את אותה מהדורה ולבחור להריץ עם גודל DCP הגדול מאחד — זו תצורת הגשה, לא ברירת מחדל. והפערים הנמדדים הם מגרסה מוקדמת יותר של הטלאי ולא מהקומיט הסופי, שלפי מחברו עבר עד כה רק אימות ממוקד ב-B200. התייחס לפערים המדווחים כאל חסם עליון מתועד היטב למה שהגישה משיגה בתצורה אחת, ולא כמפרט של נקודת קצה כלשהי שתוכל לשכור השבוע.
השאלה הפתוחה
הדבר שיש לשים לב אליו הוא לא האם הטיוטה הספציפית הזו תמוזג — סביר להניח שהיא תמוזג בצורה כלשהי, מכיוון שטיפול המטמון הספציפי ל-QSA שהיא מוסיפה הוא פער אמיתי ולא העדפה. הדבר שיש לשים לב אליו הוא האם הקומיט הסופי יקבל את אותה הערכה מזווגת שקיבלה הגרסה הביניימית. שינוי הגשה שטענות התפוקה שלו מגיעות מבנייה אחת וטענות הנכונות שלו מגיעות מבנייה אחרת הוא, לעת עתה, הצעה מנומקת היטב ולא תוצאה מדודה, ופיזור הדיוק בדגימות MRCR עם 8 מחטים רחב מספיק עד שחזרה על ההרצה על קוד המקור שהופץ תהיה הדבר היחיד המועיל ביותר שמישהו יכול לפרסם על זה. עד אז: הכיוון ברור, המאזן לא סגור, והמודל היחיד בארכיטקטורת Qwen4 במשקלים פתוחים נשאר זה מאוגוסט.
