כרטיס הירו שנוצר עבור המאמר 'Qwen-Image 2.1 שוחרר בשקט' המציג כרטיס מעוגל עם התווית 'Qwen-Image 2.1' וסמן פרמטרים של 7B, לצד שני כרטיסים קטנים יותר עם התוויות 'PE-T2I' ו-'PE-I2I' המסומנים ב-9B, וסרט שעליו כתוב 'שוחרר בשקט, לא ללא הודעה'.
Engineering & Research

Qwen-Image 2.1 שוחרר בשקט: מבט פנימה אל Qwen/Qwen-Image-2.1-PE-I2I

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-20 בספטמבר 2026, צוות Qwen-Image העלה Qwen-Image 2.1 ל-Hugging Face ול-ModelScope — משקלים, קובץ רישיון, כרטיס מודל ופוסט בבלוג, הכול באותו יום, כמעט בלי הכנה מוקדמת. הנתון המרכזי הוא 7B פרמטרים ברכיב יצירת התמונות. החלק שכמעט אף אחד עוד לא פתח הוא Qwen/Qwen-Image-2.1-PE-I2I, אחד משתי נקודות ביקורת לשכתוב פרומפטים שיצאו יחד עם מודל התמונות. זה לא מודל התמונות. זה הדבר שקובע מה המשמעות של ההוראה שלך לפני שמודל התמונות בכלל רואה אותה — ובמהדורה הזו זה הרכיב שקובע בשקט באיזו שפה הפלט שלך חוזר.

מה המשמעות האמיתית של "שוחרר בשקט" כאן

הניסוח חשוב, כי קל להגזים לכאן או לכאן. Qwen-Image 2.1 לא הודלף, והוא גם לא יצא בלי הכרזה. יש פוסט בבלוג של ספק מתוארך ל-20 בספטמבר 2026, מאגר GitHub עם מדור חדשות מתוארך לאותו יום, והורדת משקולות פעילה. מה שלא היה לו היה היערכות מוקדמת: האות המוקדם היחיד היה הודעה מ-17 בספטמבר שהציעה 50 מקומות לגישה מוקדמת דרך ModelScope, כשמבודקים נבחרים התבקשו לפרסם דוגמה או ביקורת עד 29 בספטמבר. שלושה ימים לאחר מכן המשקולות היו פומביות. לא הרצאה מרכזית, לא אמברגו על מבחני ביצועים, לא סבב תקשורתי.

זהו סוג מסוים של שחרור, וכדאי לתת לו שם מדויק. הספק הכריז עליו. הספק לא קידם אותו. עבור כל מי ששוקל לבנות עליו, ההשלכה המעשית היא שאין עדיין הערכה עצמאית להישען עליה — רק החומר של הספק עצמו וכל מה שבודקי גישה מוקדמת יפרסמו במהלך השבוע הקרוב. התייחסו לכל טענת איכות במאמר הזה ככזו שמגיעה מכרטיס המודל ומהפוסט בבלוג עד שמישהו מחוץ לאליבאבא יריץ אותו בפומבי.

למה הצ'קפוינט PE-I2I הוא המעניין

הגרסה Qwen-Image 2.1 כוללת שלושה חלקים להורדה, ולא אחד:

Qwen/Qwen-Image-2.1 — מודל התמונות עצמו. DiT חד-זרימתי בעל 32 שכבות עם 7B פרמטרים ברכיב יצירת החזות, מקודד טקסט Qwen3-VL 8B, ו-VAE בעל 64 ערוצים מסוג RGBA עם דחיסה מרחבית של 16×. כ-33 GB בשלושת הרכיבים.

Qwen/Qwen-Image-2.1-PE-T2I — משכתב פרומפטים ליצירת תמונה מטקסט. מודל Qwen3.5-VL 9B שעבר כיוונון עדין, כ-18.8 GB.

Qwen/Qwen-Image-2.1-PE-I2I — משכתב פרומפטים לעריכת תמונה-לתמונה. כמו כן, מודל Qwen3.5-VL 9B שעבר כיוונון עדין, גם הוא כ-18.8 GB, הועלה ל-Hugging Face בשעה 08:46 UTC ב-20 בספטמבר.

"PE" הוא שיפור פרומפט. גרסת ה-I2I מקבלת הוראת עריכה מעורפלת יחד עם תמונת קלט אחת או יותר ומשכתבת אותה להנחיית עריכה מדויקת וחד-משמעית עבור מודל הדיפוזיה במורד הזרם. התיאור של המאגר עצמו הוא בוטה לגבי צורת הקלט: תמונת קלט תמיד קיימת, כך שזו תמיד משימת עריכת תמונה ולעולם לא טקסט-לתמונה מאפס. קוד השכתוב נמצא בתיקיית prompt_rewrite/ שמשרתת את שני הצ'ק-פוינטים — --task t2i או --task edit — עם נתיב transformers, נתיב vLLM, serve.sh בתוספת client.py לשירות מתמשך, ו-pe_core.py עבור הלוגיקה המשותפת.

הנה למה זה חשוב יותר ממה שזה נשמע. למודל התמונות אין מושג למה התכוונתם. יש לו מושג מה הפרומפט שלכם אומר באופן מילולי, משוקלל לפי מה שמקודד הטקסט עושה איתו. רשן (rewriter) שיושב לפניו הוא המקום שבו העמימות נפתרת — או נפתרת באופן שגוי, בעקביות, בכל תמונה שאתם יוצרים. במודל מאוחד של יצירה ועריכה עם עד 10 תמונות ייחוס, לשלב ההכרעה הזה יש יותר הזדמנויות לטעות מהרגיל.

הפרומפט של המערכת הוא המקום שבו נמצאת ההחלטה לגבי השפה.

מאגר PE-I2I מגיע עם system_prompt.txt לצד המשקלים, והוא מפורש באופן יוצא דופן לגבי דבר אחד: שפה. בקריאה ישירה שלו, המנסח מחדש מונחה לקבל שתי החלטות נפרדות בשפה, ולשמור עליהן נפרדות.

שפת התיאור. הטקסט שהמשכתב כותב כדי לתאר את העריכה עוקב אחר שפת ההוראה של המשתמש — הוראה בסינית, תיאור בסינית; הוראה באנגלית, תיאור באנגלית; הוראה ביפנית, בקוריאנית, בצרפתית, בתאית או בכל שפה אחרת מקבלת תיאור באנגלית.

שפת הטקסט המרונדר. הטקסט שאכן יצויר בתמונת הפלט, המופיע בתוך מרכאות כפולות, נקבע לפי סדר עדיפויות קפדני: ראשית, אם המשתמש מציין את הטקסט המדויק או את שפת היעד, יש לציית לכך כלשונו; שנית, אם בתמונת הקלט כבר קיים טקסט, יש להתאים לשפה השלטת של אותו טקסט קיים — גם כאשר ההוראה כתובה בשפה אחרת; שלישית, אם אין טקסט בתמונה ולא צוינה שפה, יש להשתמש בשפת ההוראה עצמה, ובאופן מפורש לא לכפות עליה אנגלית.

ההנחיה מחזקת את הכלל השני בעזרת דוגמה מעובדת — תמונה שרובה תאית, שנערכה עם הנחיה באנגלית שאינה מציינת שפה, חייבת להציג טקסט תאי — ומוסיפה שני אילוצים: הטקסט המוצג חייב להיות חד-לשוני ולא זוג של סינית/אנגלית, וז'אנר ויזואלי של "דף מפרט" או "סטוריבורד" מושג באמצעות פריסה וטיפוגרפיה, ולעולם לא על ידי החלפת התוויות המוצגות לאנגלית.

זהו פריט הנדסי קטן עם רדיוס השפעה גדול. אם מייצרים תמונות מוצר עבור שוק שטקסט האריזה חשוב בו, ההבדל בין "המשכתב משמר את שפת התווית הקיימת" לבין "המשכתב מתרגם באדיבות הכול לאנגלית" הוא ההבדל בין נכס שמיש לנכס שנדחה. ומכיוון שההתנהגות הזו מוגדרת בהנחיית מערכת שמגיעה עם המאגר, אפשר לקרוא אותה, לעשות לה דיף ולעקוף אותה — מה שאי אפשר לומר על אותו שלב בתוך מודל מתארח סגור.

מה מאומת, ומה לא

להיות מדויקים לגבי הגבול כאן הוא כל העניין של מאמר "מה שאנחנו יודעים".

מאומת מהמאגר ומכרטיס המודל — נתון ה-DiT החד-זרימי בעל 7B / 32 שכבות; מקודד הטקסט Qwen3-VL 8B; ה-VAE מסוג RGBA בעל 64 ערוצים בדחיסה מרחבית של פי 16; קשב סיבתי-בלוקי עם מסכת סיבתית ברמת הטוקן עבור טקסט ומסכה דו-כיוונית ברמת המקטע עבור יצירת תמונות; שימוש חוזר במטמון KV של קידומת, אשר לפי הכרטיס מופעל כאשר נקודת השמירה נושאת causal_condition: true (והיא אכן נושאת אותו); התאמת זרימה עם תזמון אוילר בדיד; פלט מקורי ברזולוציית 2K עם 2048×2048 כברירת מחדל ב-40 צעדי הסקה; שבע הגדרות קבועות מראש של יחסי גובה-רוחב מתועדות; תמיכה בעד 10 תמונות ייחוס; עריכה מקומית באמצעות עיגול, הערת צבע או מסכה נפרדת; ויצירת RGBA, עריכת שכבות שקופות וחילוץ נושא מתמונות RGB.

מאושר לגבי הרישיון, וזה ההיבט המסוכן — השחרור הוא תחת הסכם Qwen Research License Agreement, מתאריך 20 בספטמבר 2026, אשר מעניק זכויות "למטרות לא־מסחריות בלבד" ומציין ששימוש מסחרי מחייב רישיון נפרד שיש לבקש מהספק. זהו שינוי מהותי מסדרת Qwen-Image הקודמת, שהופצה תחת Apache 2.0. קראו את קובץ הרישיון לפני שאתם בונים על זה מוצר, לא אחרי.

לא מאומת — עדיין אין ציוני בנצ'מרק בלתי־תלויים. הפוסט בבלוג מפנה לתרשים השוואה של Qwen-Image-Bench, אך המספרים שבו הם של הספק עצמו ולא שוחזרו בידי שום צד שלישי בזמן הכתיבה. אין מחיר מפורסם לנקודת קצה מתארחת עבור Qwen-Image 2.1, ואין תנאים מוצהרים לרישיון המסחרי. ועדיין אין מידע אם יגיע בעקבותיו וריאנט ברישיון מתירני.

נקודת הנתונים העצמאית היחידה שקיימת היא סקירה מעשית של גישה מוקדמת מבודק שקיבל גישה דרך תוכנית Qwen Ambassador והריץ את משקולות הגרסה הסופית דרך ממשק ModelScope Studio. הסקירה דיווחה על זמני יצירה של בערך 10–15 שניות עבור טקסט לתמונה ו-18–23 שניות עבור עריכה, ביצועים חזקים על קביעות מיקום מצלמה והקצאת תפקידים מרובי דמויות, ומצב כשל ספציפי שראוי לדעת עליו: עקביות מרובת אזכורים התדרדרה החל משלוש תמונות קלט ואילך, כאשר הצבת קוקו צדדי קרסה לקוקו מרכזי בזוויות פרופיל. זהו מבקר אחד, על ממשק גישה מוקדמת, ללא טיימר מוצג. זה אות שימושי. זה לא מבחן השוואתי.

A generated single-column spec scoreboard titled 'Qwen-Image 2.1 — the scoreboard' listing rows: Generation component 7B, 32-layer single-stream DiT; Text encoder Qwen3-VL 8B; Licence Qwen Research License, non-commercial only; Native output 2048 x 2048 at 40 steps; Reference images up to 10; Transparency native RGBA; Independent score none yet. Footer reads 'Figures per the Qwen vendor model card, unaudited; no third-party reproduction at the time of writing.'

תמיכת פריימוורק מיום אפס, שהיא הבשורה הטובה השקטה

המקום שבו מודל נוחת ביום ההשקה שלו אומר לך יותר על היכולת שלך להשתמש בו בפועל מאשר כרטיס המודל, ו-Qwen-Image 2.1 נחת באופן נרחב:

DiffusersQwenImage21Pipeline מוזג ביום האפס, ומאגר המודל נושא את התג diffusers:QwenImage21Pipeline.

ComfyUI — תמיכה מובנית מיום אפס, עם תבניות זרימת עבודה של טקסט-לתמונה ועריכת תמונה, ובנוסף מאגר משקלים נפרד התואם ל-Comfy.

vLLM-Omni — ביצוע שלב-אחר-שלב, מטמון KV של prefix, פענוח CUDA Graph, קוונטיזציה FP8, ומקביליות tensor/Ulysses.

SGLang — בקשת מיזוג לתמיכה מקורית נחתה ב-17 בספטמבר, שלושה ימים לפני המשקלים, ומכסה את ה-DiT, את ה-RGBA VAE, התניה של Qwen3-VL, מספר תמונות ייחוס, וקלט/פלט RGBA, ואומתה על H200, B200, RTX PRO 6000, RTX 5090 ו-RTX 4090.

LightX2V — האצת יום-אפס, בתוספת AMD Radeon באמצעות ROCm ותמיכה בריבוי שבבים דרך FlagOS.

בקשת ה-pull request של SGLang שפורסמה לפני השחרור היא הסימן המסגיר. תמיכת מסגרת שמגיעה לפני המשקלים פירושה שנתיב ההגשה נבדק מול ה-checkpoint, ולא נכתב מכרטיס המודל בדיעבד. עבור רכיב 7B שלצידו יושב מקודד טקסט בנפח 17.5 GB, זה ההבדל בין סוף שבוע של yak-shaving לבין אחר צהריים אחד.

עבור GPUs מוגבלים, כרטיס המודל ממליץ על CPU offload — pipe.enable_model_cpu_offload() — שהוא פתח המילוט הסטנדרטי ולא תיקון. ההורדה של 33 GB נשלטת על ידי מקודד הטקסט, לא על ידי ה-DiT; ה-diffusion transformer עצמו הוא החצי הקטן יותר של החבילה, בסביבות 14 GB.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

הקריאה המעשית

אם אתה רוצה לנסות את Qwen-Image 2.1 היום, העמדה הכנה היא שאתה יכול, באופן מקומי, תחת רישיון מחקר, בלי מדדי ביצוע בלתי תלויים ובלי זכויות מסחריות. זהו חילוף סביר לצורכי הערכה וגרוע עבור צינור ייצור, והפער בין השניים הוא בדיוק מה שקובץ הרישיון קובע.

עבור צוותים שמובילים בנצ'מרק למודלים של תמונות בלי לרצות לחייב מסלול ייצור לנקודת ביקורת בת ימים ספורים, שכבת הניתוב היא המקום שבו הסיכון הזה נבלע. OrcaRouter מציג יותר מ-200 מודלים מאחורי נקודת קצה אחת תואמת OpenAI במחיר המחירון של הספק וללא תוספת, עם מעבר אוטומטי בין ספקים בעת תקלה, כך שמודל שטרם הוכח יכול לשבת מאחורי מסלול לצד מודל שאתם כבר סומכים עליו במקום להחליף אותו — ומכיוון שמחיר המחירון מועבר הלאה, הורדת מחיר מצד ספק על כל מודל מנותב נכנסת לתוקף באותו יום במקום להמתין לשינוי בחוזה. Qwen-Image 2.1 אינו נמנה עם המודלים שאנחנו מנתבים במועד כתיבת שורות אלה, והמאמר הזה לא ירמוז אחרת. מה שאנחנו כן מנתבים הוא קו התמונות הסובב — משפחת GPT-Image של OpenAI, שכבות Imagen 4 של Google ותצוגות מקדימות של תמונות ב-Gemini, ונקודת הקצה Grok Imagine לתמונות של xAI — ומשם יגיע מסלול מעבר לגיבוי בזמן שאתם מעריכים את המצטרף החדש על החומרה שלכם.

השאלה הפתוחה היא זו שהמאגר אינו יכול להשיב עליה. אליבאבא שחררה מודל תמונות פתוח-משקולות בנפח 7B תחת רישיון למחקר בלבד, באותה שנה שבה שחררה את Qwen-Image 3.0 כמודל מתארח סגור וללא משקולות כלל. שני שחרורים, שני הימורים מנוגדים, בהפרש של ארבעה חודשים. איזו משתי הצורות תעצב את מודל Qwen לתמונות הבא — והאם הרישיון למחקר יומר אי-פעם למשהו שעסק יכול להשתמש בו — זה מה שכדאי לעקוב אחריו. המשקולות נמצאות כעת ב-Hugging Face, וכל אחד יכול לקרוא את קובץ הרישיון בעצמו.

A screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured September 20 2026, showing the Like and Follow counts, the tags Text-to-Image, Diffusers, Safetensors, QwenImage21Pipeline, rgba, the qwen-research licence, 7B params, BF16 tensor type, and the notice that the model is not deployed by any inference provider.