
דליפת Qwen 4: SGLang מפצל את המילוי המקדים של Qwen4Exp כדי להשיג TTFT מהיר ב-18% ולהחזיר GiB לכל GPU
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 64 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
בקשת משיכה (pull request) שנפתחה במאגר SGLang בשעה 03:47 UTC הבוקר, 2026-10-08, מבטיחה משהו שאף הכרזה על Qwen 4 לא הניבה עדיין: מספר. הכותרת שלה היא feat(qwen4-exp): enable LayerNorm sequence parallelism for GR and PLE, ועל ארבעה מעבדי GPU מדגם H20 שמריצים את נקודת הביקורת (checkpoint) בקוד פתוח Qwen3.8-Flash-Next ב-FP8, מחברו מדווח על שיפורים בזמן עד לאסימון הראשון (time-to-first-token) של 17.7–18.4% בקלט של 32K ושל 14.6–14.7% בקלט של 235K, על כגיגה־בייט אחד של זיכרון שיא ששוחרר לכל GPU, ועל עד 22% יותר תפוקת קלט. Qwen 4 עצמו — המשפחה שהספק נתן לה שם אך לא שחרר אותה בכנס Apsara בהאנגג'ואו ב-2026-09-22 — עדיין אינו משוחרר, ללא משקלים, ללא מזהה וללא מחיר. המודל היחיד שמגשים כיום את הארכיטקטורה של Qwen4Exp הוא Qwen3.8-Flash-Next, שפורסם ב-2026-08-26, ואחיו המנוהל Qwen3.8-Flash הוא הגרסה שמי שקורא ל-API יכול למעשה להגיע אליה. לכן קראו את מה שלהלן בדיוק כפי שהוא: מדידות מזווגות של מהנדס אחד, המצורפות לבקשת משיכה פתוחה, טיוטה ולא ממוזגת, על מעטפת השירות (serving envelope) של משפחת מודלים שעדיין אינה קיימת.
המקור קודם, משום שזהו פריט הדלפה וההבחנה הזו עושה עבודה אמיתית. האות הוא sgl-project/sglang#43048, שנפתח ב-2026-10-08 בשעה 03:47 UTC על ידי חשבון ה-GitHub shiyang814-cpu, נגעו בו לאחרונה ב-03:55 UTC, והוא עדיין מסומן draft, ללא סקירה מאשרת שנרשמה וללא מיזוג. הוא משנה שישה קבצים — שני קבצי בדיקה, קובץ המודל Qwen4Exp, מודול LayerNorm-SP, מפעל גבול-שכבה ו-hook של קבוצת ארגומנטים — ב-+345 ו-−50 שורות. כל נתון ביצועים שלהלן מגיע מתיאור ה-PR, הוא מדידת OFF/ON מזווגת של המחבר עצמו, ולא שוחזר על ידי איש. שלוש הרצות CI על הגרסה שבקצה הענף מסומנות כנכשלות. שום דבר כאן אינו יכולת שנשלחה.

מה שבקשת המשיכה למעשה משנה
מקביליות רצפים אינה שינוי מודל ואינה יכולת חדשה. זהו חיווט מחדש של היכן שכמה שכבות מבצעות את האריתמטיקה שלהן. השושלת שלה מובילה חזרה למקביליות רצפים בסגנון Megatron — הטריק מ-arXiv:2205.05198 — ו-SGLang כבר מספקת אותה: מחרוזת התיעוד של המודול עצמו מסבירה את המנגנון שהמודול עושה בו שימוש חוזר, שתחת מקביליות טנזורית טהורה, מקבילי-שורה all_reduce הוא אלגברית reduce_scatter ואחריו all_gather. מכיוון ששני הקולקטיבים הללו מעבירים בדיוק את אותם בייטים כמו ה-all_reduce שהם מחליפים, פיצול הפעולה בדרך זו לא עולה בנפח תקשורת נוסף כלל. מה שזה קונה הוא החופש לאפשר לאזורי הנרמול והשאריים לרוץ על sequence-sharded אקטיבציות — כל דרגה טנזורית-מקבילית מחזיקה באחד-1/tp מהשורות של הטוקנים — מה שמקצץ את זיכרון האקטיבציה הזמני ש-prefill ארוך-הקשר צריך להשאיר בחיים.
מה שבקשת המשיכה המסוימת הזו עושה הוא להרחיב את הנתיב הקיים הזה מהארכיטקטורה שעליה הוא אומת לארכיטקטורת Qwen4Exp. במהלך ה-prefill, האקטיבציות של Gated Residual ו-Per-Layer Embedding נשארות מפוצלות לאורך ממד הטוקנים ברחבי קבוצת ה-TP. לפני קשב, לפני GDN, לפני QSA, ולפני שהבלוק Mixture-of-Experts רץ, שורות הטוקנים המלאות נאספות מחדש, החישוב tensor-parallel הקיים על שורות מלאות רץ ללא שינוי מאחורי fallback משותף, ואז reduce-scatter מסכם את התרומות החלקיות ומשחזר את ה-shard של כל rank. ה-Decode אף פעם לא נוגע בנתיב החדש בכלל. התכונה נגישה דרך האפשרות שכבר קיימת — --enable-layernorm-sp — ללא דגל ספציפי ל-Qwen4Exp, וכאשר הדגל חסר הקוד מתנהג בדיוק כפי שהתנהג קודם.
מדוע Qwen4Exp היא הארכיטקטורה שזקוקה לזה
הסיבה שזה חשוב ספציפית ל-Qwen4Exp, ולא באותה מידה לכל מודל, טמונה בתכנון של הארכיטקטורה עצמה. Qwen3.8-Flash-Next מחיל הטלות Gated Residual על כל שורות הטוקנים בכל שכבת מפענח — התצורה מצהירה על ארבעה זרמי שאריות ודרגת צוואר בקבוק של 320 לאורך 48 שכבות — ו-Per-Layer Embedding מוסיף על כך הטלה שנייה ומשוכפלת, שורה-אחר-שורה של טוקנים. תחת מקבילות טנזורים, שתי הפעולות הללו משוכפלות באופן זהה בכל דרג, מכיוון שאין להן מטריצת משקלים מפוצלת ל-TP משלהן כדי לכפות פיצול. פיצול ממד הטוקנים שלהן מסיר את העבודה המשוכפלת ישירות, וכפי שמנסח זאת סעיף המוטיבציה של ה-PR, זה קורה תוך שמירה על פריסת מקבילות הטנזורים הקיימת ועל סמנטיקת ההפחתה של קשב, GDN/QSA ו-MoE — וזה החלק שהופך את השינוי לבטוח ולא לחכם.
כדאי לומר בפשטות מה זה אומר עבור הקורא. הדבר המעניין ב-PR הזה אינו ש-SGLang נעשה מהיר יותר. העניין הוא שארכיטקטורת Qwen4 נושאת עלויות לכל שכבה שמשתנות עם מספר הטוקנים ולא עם מספר הפרמטרים, והעלויות האלה הן אלה שנושכות בפריפילים ארוכים. זו טביעת אצבע תכנונית, וזה מסוג הדברים שדף מפרט אף פעם לא מזכיר.
הדלתאות הנמדדות
ההשוואה של המחבר מקבעת תצורה אחת ומחליפה את הדגל בין מצבים: ארבעה מעבדים גרפיים NVIDIA H20, Qwen3.8-Flash-Next-FP8, פרלליות טנזורית 4 ופרלליות מומחים 4, גודל prefill מקוטע 8192, מנגנוני prefill ו-decode של קשב ליניארי ב-FlashInfer, אותה תצורת שרת עבור OFF ו-ON, הפעלות מחדש של השירות לסירוגין OFF → ON → OFF → ON, וקלטי טוקנים קבועים עם בקשות חימום. כל נתון שלהלן מגיע מאותה תצורה ולא עבר ביקורת:
• קלט 32K, גודל אצווה 1 — TTFT השתפר ב-17.72–18.36%, השהיה מקצה לקצה כ-16%, תפוקת קלט כ-20%
• קלט של 235K, גודל אצווה 1 — TTFT השתפר ב-14.63–14.71%, השהיה מקצה לקצה כ-14%, תפוקת קלט כ-17%
• קלט של 32K, גודל אצווה 4 — TTFT השתפר ב-18.74%, השהיה מקצה לקצה 18.14%, תפוקת קלט 22.14%
• זיכרון שיא — ירידה של כ־1.0 GiB לכל GPU
• פענוח, גודל אצווה 1 — זמן לכל טוקן פלט למעשה ללא שינוי
השורה האחרונה היא זו שכדאי לקרוא פעמיים, והמחבר גלוי לב לגבי הסיבה: האופטימיזציה הזו מופעלת רק עבור prefill, כך ש-decode בזרם בודד לא מרוויח ממנה דבר. השיפור בזמן-לכל-טוקן ב-batch-4, היכן שהוא מופיע, משקף הפחתה בהשהיות תזמון הנובעות מ-prefill ארוכים במקביל, ולא קרנל decode מהיר יותר כלשהו. אם קיוויתם שזהו סיפור של throughput, זה לא כך — זהו סיפור של השהיה עד לטוקן הראשון ושל זיכרון, ואלה שתי המגבלות שמכריעות אם בקשה של 235K טוקנים ניתנת לשירות בכלל.

הבאג בפריסה שהם היו צריכים לתקן תחילה
החלק האינפורמטיבי ביותר בבקשת המשיכה אינו טבלת ההאצה. זה הקטע על פריסת השורות הפיזיות של PLE, כי הוא מראה מה סטאק ההגשה של Qwen4Exp עדיין עושה לא נכון.
Per-Layer Embedding פועל על דלי CUDA-graph פיזי קבוע, בעוד שרק קידומת של השורות בדלי הזה עשויה להכיל טוקנים אמיתיים. לכן הריפוד חייב להיות מיושם לפני שהרצף מפוצל ל-shards, לא אחרי. בנתח האחרון של בקשה של 235K טוקנים, המספרים של המחבר הם 5,624 טוקנים מעובדים בתוך דלי פיזי בן 8,192 שורות ב-TP 4, והפריסה הנכונה היחידה היא דירוג 0 מחזיק 2,048 שורות תקפות, דירוג 1 מחזיק 2,048 שורות תקפות, דירוג 2 מחזיק 1,528 שורות תקפות ועוד 520 שורות ריפוד, ודירוג 3 מחזיק 2,048 שורות של ריפוד. פיצול 5,624 השורות המעובדות תחילה — המימוש המובן מאליו — מכניס ריפוד בין טווחים תקפים רציפים גלובלית ומשבש את התוצאה. המחבר מתעד שבדיקת OFF/ON אמיתית של 235K הניבה רק פלט חמדני זהה של 16 טוקנים אחרי שפריסה זו תוקנה.
זהו פרט קטן עם השלכה גדולה. נתיב ה-PLE ב-SGLang נוסף לאחרונה מספיק כדי שניתן היה להגיע לבאג p-ordering מהצורה הזו, והאדם שמצא אותו עבד על הרחבת ה-sequence-parallel. שירות ה-day-zero לארכיטקטורה הזו לא הושלם; הוא נבנה באופן פעיל, בפומבי, בידי תורמים, layout אחד בכל פעם.
מה זה עולה לך: האילוצים
דגל שעוזר רק לחלק מהפריסות הוא מועיל רק אם יודעים לאילו מהן. ה-PR מפרט את דרישותיו במפורש, ותצורות שמחוץ להן נכשלות במהלך אימות הארגומנטים במקום להתדרדר בשקט:
• גודל ה-Tensor parallel חייב להיות גדול מ-1 — פריסה על GPU בודד לא מרוויחה דבר, כי אין rank שעל פניו ניתן לפצל
• גודל ה-Expert Parallel חייב להיות שווה לגודל ה-Tensor Parallel
• גודל ה-Pipeline המקביל חייב להיות שווה ל-1
• יש להשבית data-parallel attention
• יש להשבית פענוח ספקולטיבי
האילוץ האחרון הוא זה שיש מאחוריו החלטה אמיתית. עבור מודל דליל שמפעיל בסביבות 6B פרמטרים לכל טוקן, פענוח ספקולטיבי הוא אחד המנופים הבודדים שמאיצים פענוח, והתכונה הזו מבטלת במפורש את המנוף הזה בתמורה ליתרון בפריפיל. אם עומס העבודה שלך הוא פרומפט ארוך ופלט קצר — ניתוח מסמכים ובסיסי קוד, סיכום וידאו, הקשר גדול שנקרא פעם אחת — העסקה טובה באופן ברור. אם עומס העבודה שלך הוא פרומפט קצר ויצירה ארוכה, אתה מוותר על הדבר שעזר לך וקונה מספר שלא חל עליך. הדרישה ש-expert-parallel שווה ל-tensor-parallel היא האילוץ האחר שכדאי לשים לב אליו: היא אומרת שגיאומטריית השרדינג של moe חייבת להתיישר בדיוק עם גיאומטריית ה-TP, מה שפוסל כמה פריסות מרובות-צמתים שהיו סבירות אחרת.
מה זה אומר על לוח הזמנים של Qwen 4
קראו את ה-diff בדרך אחרת ותקבלו לוח שנה. מודול LayerNorm-SP של SGLang בענף הראשי כיום נושא רשימת היתרים מפורשת של ארכיטקטורות שעבורן התכונה אומתה, ונכון לכתיבת שורות אלה הרשימה מכילה בדיוק ערך אחד, Qwen3ForCausalLM — כל ארכיטקטורה אחרת נדחית בזמן הבנייה אם תעבירו את הדגל. לפיכך, הוספת Qwen4Exp לנתיב הזה אינה כוונון של הפשטה בוגרת; זהו הפעם הראשונה שארכיטקטורת Qwen4 מובאת לאופטימיזציה שקדמה לה בדורות.
הצב זאת אל מול הרשומה הציבורית והתמונה קוהרנטית. הספק הודיע ב-2026-09-22 כי Qwen 4 נמצא באימון וחשף בתצוגה מקדימה ארבעה שמות דרגים — Qwen 4 Max, Qwen 4 Flash, Qwen 4 Plus ו-Qwen 4 27B — ללא מפרטים מצורפים לאף אחד מהם. התצוגה המקדימה במשקולות פתוחות שחולקת את הארכיטקטורה, Qwen3.8-Flash-Next, זמינה להורדה מאז 2026-08-26. מה שקורה בשלושת השבועות מאז הוא בדיוק מה שהייתם מצפים לו בין "באימון" ל"השקה": מחברי מנועים שמבצעים הרצה ראשונית של זמן הריצה כך שתמיכת יום-אפס תהיה אמיתית ולא סמלית. בקשת משיכה שגורמת לאופטימיזציית הגשה לעבוד על הארכיטקטורה, שנפתחה בבוקר 2026-10-08 ועדיין בטיוטה, היא אות טוב יותר לגבי עד כמה Qwen 4 קרוב להיות בר-הגשה מאשר כל תאריך שמישהו הציע. זה גם, באופן מודגש, לא תאריך שחרור — הדגל כבוי כברירת מחדל, השינוי לא מוזג, והמודל שעליו הוא מריץ בנצ'מרק הוא התצוגה המקדימה, לא Qwen 4.
מה שאתה יכול להתקשר אליו היום
שום דבר מכל זה לא משנה את מה שבאמת זמין אחר הצהריים. Qwen3.8-Flash-Next הוא אמיתי, המשקולות שלו נמצאות ב-Hugging Face, ואפשר לארח אותו בעצמכם — אבל הוא לא בקטלוג שלנו, ולא נעמיד פנים אחרת. השכבה שאנחנו כן מספקים היא qwen/qwen3.8-flash, האח המנוהל שמריץ את אותה ארכיטקטורת Qwen4-preview עם חלון הקשר של מיליון טוקנים וקלט של טקסט, תמונה וווידאו, במחיר של 0.15 דולר למיליון טוקני קלט, 0.47 דולר למיליון טוקני פלט ו-0.0184 דולר למיליון קריאות מהמטמון. זהו מחיר מחירון שעובר הלאה בתוספת של 0%, כך שכאשר הספק משנה אותו, המספר בחשבונית שלכם משתנה באותו יום, ולא בכל פעם שמתווך מפרסם מחדש טבלה.

יש סיבה שנייה, פחות ברורה, להתעניין כאן בשכבת ניתוב. כל מה שבמאמר הזה עוסק בתצוגה מקדימה שאינה מוכחת בתוספת טלאי טיוטה — מהסוג שאתה רוצה לבדוק בלי להמר על נתיב פרודקשן על סמך זה. לשם כך נועד failover: הצב את התצוגה המקדימה מאחורי אותו מפתח כמו המודל שאתה כבר סומך עליו, עקוב אחרי האופן שבו היא מתנהגת בתעבורה שלך, ותן לבקשה ליפול לנתיב הידוע כטוב כאשר ספק מתערער או שנקודת הקצה אינה שם. API אחד ל-200+ מודלים, סט אחד של אישורי גישה, בלי לחתום על חוזה שני כדי לגלות אם ארכיטקטורה חדשה שווה את תשומת הלב שלך.
שני דברים שכדאי לשים לב אליהם מכאן, שאת אף אחד מהם איננו יכולים לחזות. הראשון הוא האם הפאצ' הזה יתמזג בכלל: זוהי טיוטה עם שלוש הרצות CI שנכשלו על שינוי של שישה קבצים מחשבון תורם ללא היסטוריה קודמת במאגר, והנזילות של עבודת פריסת השורות של PLE מרמזת שהמחבר עדיין מבצע איטרציות. השני הוא האם רשימת ההיתרים תגדל — אם Qwen4Exp יצטרף אל Qwen3ForCausalLM כארכיטקטורה מאומתת, אז זה מפסיק להיות דליפה והופך לדרך ברירת המחדל שבה מוגש מודל ממשפחת Qwen4 בהקשר ארוך. עד שאחד מאלה יקרה, התייחסו ל-18% כאל הבטחה לאן שה-runtime הולך, לא כמספר שאפשר לשכור.
