
SGLang-Diffusion מגיש את Qwen-Image-2.1 ביום אפס: יצירות ב-2.75 שניות על B200 אחד
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1 יצא לציבור ב-20 בספטמבר 2026, ולצוות SGLang-Diffusion היה מסלול שירות מוכן עבורו. תמיכת יום-אפס מכסה את שלוש המשימות שהמודל מבצע — יצירת תמונות מטקסט, עריכת מספר תמונות, ופלט RGBA שקוף — והיא מגיעה עם משהו נדיר יותר מבקשת משיכה ממוזגת: השהיה מדודה על חומרה מזוהה, שפורסמה יחד עם התצורה שהפיקה אותה. על NVIDIA B200 בודד, ברזולוציית 1024×1024 עם 40 צעדים, מספרי SGLang עומדים על 2.748 שניות ליצירה ו-3.358 שניות לעריכה. בקשת המשיכה התומכת, sgl-project/sglang#39983, נפתחה ב-17 בספטמבר — שלושה ימים לפני שהמשקלים היו ניתנים להורדה — וזו הסיבה שהמספרים קיימים בכלל, ולא הובטחו למועד מאוחר יותר.
מה המשמעות של "יום אפס" כאן, ולמה התזמון הוא החלק המעניין
תמיכת פריימוורקים מוכרזת בדרך כלל באותה נשימה עם שחרור מודל, ומסופקת שבועות לאחר מכן. המקרה של SGLang הוא הפוך. המימוש נכתב מול צ'קפוינט שעדיין לא היה ציבורי, מה שמאלץ את המחברים להתמודד עם הארכיטקטורה האמיתית במקום עם דף מפרט: טרנספורמר הדיפוזיה, VAE RGBA בעל 64 ערוצים, התניה של Qwen3-VL, קלט של תמונות ייחוס מרובות, ו-RGBA בכניסה וביציאה.
זו הסיבה לתת אמון בטבלת השהיה יותר מאשר ברשימת יכולות. למודל שמעולם לא הוגש אין מספרים מדודים, ומספר שמגיע עם החומרה, הרזולוציה, מספר הצעדים והדיוק שלו מצורפים יכול להיבדק על ידי כל מי שיש לו את אותו כרטיס. הנתונים של SGLang מסומנים כתצורה ספציפית, לא כטענה כללית על המודל.
שאר הכלים נחתו באותו חלון זמן. ComfyUI סיפקה תמיכה נייטיבית, Diffusers מיזגה QwenImage21Pipeline, vLLM-Omni הוסיפה הרצה שלב אחר שלב וכימות FP8, ו-LightX2V הוסיפה האצה עם תמיכה ב-AMD Radeon דרך ROCm. הפריימוורקים הם החלק בשחרור שמכריע אם מישהו מחוץ למעבדה יכול להשתמש בו.

המספרים, ומה שהם אינם אומרים
העבודה של SGLang מפרסמת השהיה לכל בקשה, לא תפוקה. ההבחנה הזו חשובה אם אתם מתאימים את גודלו של שירות ולא מריצים הדגמה: יצירה אחת בת 2.7 שניות אומרת לכם את זמן ההלוך-חזור, לא כמה משתמשים בו-זמנית כרטיס אחד סופג. התצורות שפורסמו, כולן ב-1024×1024 ו-40 צעדים:
• B200, משקלים שנשארים בזיכרון, FlashAttention — 2.748 s יצירה, 3.358 s עריכה, לאחר תיקון Q/K-norm ושינוי LayerNorm שכל אחד חסך כמה אחוזים.
• RTX PRO 6000 Blackwell, 96 GB, בזיכרון — 8.23 s יצירה, 9.85 s עריכה עם טביעת זיכרון שיא של 40.1 GiB; 10.28 s ו-10.66 s כאשר טרנספורמר הדיפוזיה מועבר החוצה, מה שמוריד את השיא ל-26.1 GiB.
• DGX Spark, 1× GB10, eager, פענוח VAE מלא — 35.36 s יצירה, 42.23 s עריכה, 35.49 s ו-42.21 s עבור הווריאנטים השקופים. אלה כוללים סריאליזציה של PNG. גרפי CUDA Breakable הפיקו פיקסלים זהים ללא תועלת מהירות מדידה (35.96 s לעומת 35.64 s), ועיבוד באצוות ומערכי multi-Spark לא נבדקו כלל.
• RTX 4090, 24 GB, offload לפי שכבות, denoise בלבד — 26.69 s ב-BF16 בסיסי עם SDPA, 10.31 s עם Cache-DiT (2.59×), 5.59 s עם Cache-DiT בתוספת ערכת קרנלים INT8 (4.77×), 4.74 s בהוספת Sage attention (5.63×).
שתי הסתייגויות כנות נלוות לשורות האלה. ראשית, אלו השהיות של בקשה בודדת, ושורת ה-4090 מודדת הסרת רעש בלבד — מקודד הטקסט וה-VAE נמצאים מחוץ למדידה. שנית, מחברי SGLang מציגים את האימות הרחב יותר כפונקציונלי, לא כהערכתי: פלט BF16 אינו זהה ברמת הביט בין מיקומים שונים, וכימות או מקביליות טנסורים משנים את המספרים. מהיר ושונה אינו אותו דבר כמו מהיר וטוב יותר.

למה נתיב הפלט השקוף הוא זה שכדאי לשים לב אליו
RGBA הוא המקום שבו המודל הזה נבדל מנקודות הקצה לתמונות שרוב הצוותים כבר קוראים להן, וגם המקום שבו ההגשה נעשית מסורבלת. Qwen-Image-2.1 מסיר רעש במרחב סמוי שבו ערוץ אלפא הוא רכיב ממדרגה ראשונה, דרך VAE RGBA עם 64 ערוצים ודחיסה מרחבית של פי 16. שקיפות אינה עיבוד בדיעבד שמחברים עם מודל סגמנטציה; היא מה שהדוגם פולט.
לשרת זאת היטב קשה יותר מלשרת RGB. הפלט גדול יותר, ל-VAE יש יותר ערוצים לפענח, והבקשה נושאת ביט מצב נוסף שהמתזמן צריך לנתב. האימות של SGLang מכסה בדיוק את התחום הזה — פלט PNG שקוף, אלפא נשמרת על פני כל הטווח 0–255, ו-RGBA PSNR של 60.69 dB בדגימה בודדת, כאשר תצורות FP8 עוברות גם יצירה שקופה. זהו מבחן נכונות ולא מדד איכות, והמחברים אומרים זאת. זה מבסס שערוץ האלפא אמיתי ושורד קוונטיזציה; אין בכך כדי לומר דבר על האם הקצוות נקיים בשיער, בפרווה או בזכוכית.
הערך המעשי של סטאק הגשה עם נתיב שקיפות נבדק הוא בכך שהוא הופך פייפליין של שלושה כלים לקריאה אחת. יצירה עם אלפא, עריכה בתוך תמונה שכבר יש בה אלפא, וחילוץ נושא מתוך תצלום RGB רגיל אל שכבה שקופה — כולם עוברים דרך אותה נקודת קצה.
איפה זה משתלב אם אתה לא מריץ את ה-GPU בעצמך
החלק המביך בשחרור של Qwen-Image-2.1 הוא שאין נקודת קצה מתארחת שאליה אפשר לפנות. המשקולות הן הורדה של כ-33 GB, רכיב היצירה הוא שנאי דיפוזיה של 7B המשודך למקודד טקסט Qwen3-VL 8B, וכל העניין מופץ תחת הסכם רישיון Qwen Research License Agreement מתאריך 20 בספטמבר 2026 — שימוש לא-מסחרי בלבד, כאשר פריסה מסחרית מחייבת רישיון נפרד מהספק. אז המתכון של SGLang אינו חלופה ל-API. הוא ה-API, ואתה המפעיל.
זה משנה לשם מה נועדה שכבת ניתוב. OrcaRouter מציג 200+ מודלים מאחורי נקודת קצה אחת תואמת OpenAI במחיר מחירון של הספק ללא תוספת, מעבר אוטומטי בין ספקים, DSL לניתוב להרכבת נסיגות, ומיזוג מודלים לקריאות בסגנון פאנל — אבל הוא לא מנתב שום מודל Qwen-Image מאף גרסה, ו-Qwen-Image-2.1 לעולם לא יהיה נתיב שתוכל לקרוא לו שם. הארכיטקטורה הריאלית היא מפוצלת: הפעל את Qwen-Image-2.1 על החומרה שלך דרך SGLang עבור העבודה השקופה ורבת-ההפניות, ושלח את כל השאר למודלי תמונות מתארחים במפתח אחד. הקטלוג שלנו כולל את קו OpenAI GPT-Image, את דרגות Imagen 4 של Google ותצוגות מקדימות של תמונות Gemini, ואת נקודת הקצה של Grok Imagine של xAI, הכול במחיר מחירון מועבר הלאה, כך ששינוי מחיר של ספק באחד מהם יהיה פעיל אצלנו באותו יום.
איך נראית פריסה בפועל
תיעוד SGLang מגיע עם ספר מתכונים (cookbook) עבור מודל זה, הכולל פקודות לכל GPU, והפעלת השרת המומלצת היא שורה אחת — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speedבקשות טקסט-לתמונה תומכות באצוות דינמי שנבחר באופן מפורש; בקשות לעריכת תמונה מטופלות בנתיב נפרד, ובקשה אחת יכולה להחזיר מספר פלטים.
התצורות שאומתו בפועל צרות יותר ממה שמשתמע מטבלת התאימות. H200, B200, RTX PRO 6000 96 GB, RTX 5090 ו-RTX 4090 מכוסים עבור יצירה ועריכה ב-1024×1024 ב-40 צעדים, כולל הווריאנטים השקופים שלהם, ובנוסף מקביליות טנזורית מרובת GPUs, קשב Ulysses ו-Ring, פריקה שכבתית, פענוח VAE אריחי-במקביל, Cache-DiT, גרפי CUDA, וכימות FP8 מקוון ומסודר. מתכוני ריבוי-GPU ו-NVFP4 על ה-RTX PRO 6000 נותרו לא מאומתים, ותפקידים מפורקים של ריבוי מארחים ב-RDMA וריבוי-rank אינם מכוסים. אם התוכנית שלך כוללת ארבעה כרטיסים ו-fabric, אתה מקדים את הראיות שפורסמו.

שני דברים שכדאי לשים לב אליהם בהמשך. הראשון הוא אם מישהו מפרסם תפוקה ולא השהיה — מספרי מקביליות הם מה שהופכים נתון של 2.7 שניות לתוכנית קיבולת. השני הוא הרישיון: אין מחיר מפורסם או גיליון תנאים לשימוש מסחרי ב-Qwen-Image-2.1, ועד שיהיה כזה, ההגבלה הלא-מסחרית היא כל הסיפור עבור כל דבר שנשלח ללקוח.
