
Qwen-Image 2.1 לעומת MAI-Image-2.5-Pro: 6,100 הצבעות עיוורות מול אפס
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
אחד משני המודלים האלה דורג על ידי כ-6,100 השוואות אנושיות בעיוורון. האחר לא דורג על ידי איש מחוץ למעבדה של עצמו. MAI-Image-2.5-Pro, מודל התמונות הפרימיום של מיקרוסופט, ניצב במקום הראשון בזירת עריכת התמונות של Artificial Analysis עם Elo של 1,272 — התוצאה עם מספר ההצבעות הגבוה ביותר בקטגוריה. Qwen-Image 2.1, שאותו שחרר צוות Qwen-Image בקוד פתוח ב-20 בספטמבר 2026, אינו מחזיק בציון עצמאי כלל, וגם לא יהיה לו כזה עד שמספיק אנשים יריצו אותו בפומבי כדי לייצר הצבעות. הפער הזה הוא הנושא האמיתי של ההשוואה הזו, משום שהוא ההבדל היחיד בין שני המודלים שאינו טענה של ספק. כל השאר — הארכיטקטורה, הרזולוציה, המחיר — ידוע אך אינו מוכח, ושני המודלים קרובים מספיק על הנייר עד שפער המדידה הוא זה שצריך להנחות את ההחלטה.
מה שההצבעות בעצם אומרות, ומה שהן אינן אומרות
Artificial Analysis מריצה השוואות זוגיות עיוורות: שני מודלים מקבלים את אותה הנחיה, המצביעים בוחרים את הפלט הטוב יותר, וה-Elo נובע מהתוצאות. זה אינו מכשיר מושלם, אבל זה הדבר הקרוב ביותר שיש לקטגוריה הזו ללוח תוצאות משותף, וגודל המדגם חשוב לא פחות מהמספר.
• MAI-Image-2.5-Pro — מקום #1 בעריכת תמונות עם Elo 1,272 לפי כ-6,100 השוואות. ביצירת תמונות מטקסט הוא נמצא במקום #7 עם Elo 1,292, אחרי GPT Image 2 (high) עם 1,369, Reve 2.1 עם 1,322, Nano Banana 2 עם 1,320, GPT Image 1.5 (high) עם 1,310 ו-MAI-Image-2.5 עם 1,304.
• Qwen-Image 2.1 — אין רשומה באף אחד מהלוחות. לא ציון נמוך; אין ציון כלל. הגרסה בת יום אחד בלבד בזמן כתיבת שורות אלה.
צורתם של המספרים האלה ראויה לקריאה קפדנית, כי היא לא הצורה שהשיווק מרמז עליה. המודל של Microsoft הוא באמת ראשון בעריכה ובאמת שביעי ביצירה. זו עמדה ספציפית וניתנת להגנה — מומחה לעריכה שמוביל את הקטגוריה שלו — וזה משהו שונה מלהיות המודל הטוב ביותר לתמונות, מה שהוא לא. בינתיים, המודל שמנצח אותו בטקסט לתמונה הוא GPT Image 2 (high), שגם הוא לא המודל החדש ביותר של OpenAI בתחום הזה. לוחות דירוג בלתי תלויים מתגמלים את המודל שנמדד הכי הרבה, ובהתמודדות הזו זה באופן חד-משמעי המודל של Microsoft.
המפרט היחיד שבו המודל הפתוח מנצח באופן מוחלט
יש הבדל קונקרטי, לא סובייקטיבי בין שני אלה, והוא רזולוציה.
• Qwen-Image 2.1מייצר באופן מקורי ברזולוציית 2K, כאשר 2048×2048 היא ברירת המחדל המתועדת ב-40 שלבי הסקה, שבעה פריסטים של יחס גובה-רוחב, ופלט RGBA עם ערוץ אלפא אמיתי ולא שכבת מאט.
• MAI-Image-2.5-Proמגביל את הפלט ל-1,048,576 פיקסלים — כמֶגה־פיקסל אחד בערך. מספרי המפרט הבולטים שלו נמצאים במקום אחר: 32,000 טוקנים של קלט טקסט, חלון הקשר של 131 אלף ו-4,096 טוקנים של פלט, וזו הצהרה על כמות ההוראות שהוא מסוגל לקלוט, ולא על כמות התמונה שהוא מסוגל להפיק.
עבור רוב העבודה החברתית והמוצרית, תקרה של מגה-פיקסל אחד אינה מגבלה. עבור דפוס, עבור הרכבה בפורמט גדול, עבור כל דבר שבו חיתוך צריך לשרוד, היא כן. זהו הממד היחיד בכל ההשוואה שבו אפשר להצביע על מספר ולומר שהמודל הפתוח מוביל — ושימו לב שזו עובדה ארכיטקטונית מכרטיס המודל, לא טענת איכות. Qwen-Image 2.1 ירנדר ב-2048×2048 בין אם הוא מרנדר משהו ששווה להסתכל עליו ובין אם לא.
המחיר, וזה המקום שבו ההשוואה נהיית לא נוחה
MAI-Image-2.5-Pro מתומחר כמודל פרימיום, והמספרים אינם מעודנים: 5 דולר למיליון טוקנים של קלט טקסט, 8 דולר למיליון טוקנים של קלט תמונה, ו-106 דולר למיליון טוקנים של פלט תמונה. בפלט של 1024 פיקסלים זה מסתכם בכ-108.50 דולר לאלף תמונות. לשם השוואה, זוהי בערך פי 2.3 מהעלות של MAI-Image-2.5 ופי 5.4 בקירוב מהעלות של MAI-Image-2.5-Flash, כך שמיקרוסופט פילחה במכוון את קו המוצרים שלה במקום לתמחר את דרגת ה-Pro כשדרוג תוספתי.
ל-Qwen-Image 2.1 אין מחיר מתארח, כי אין נקודת קצה מתארחת — הוא הורדת משקולות תחת רישיון מחקרי. העלות שלו היא זמן ה-GPU שלך, והמגבלה שלו היא שאינך יכול למכור באופן חוקי את מה שהוא מייצר. השוואה של 108.50$ לאלף תמונות מול "משקולות חינמיות" היא השוואה בין שירות לבין מכונה, והגרסה הכנה של ההשוואה הזו היא: המחיר הנמדד קונה לך מודל מדוד, נתמך ובעל רישיון מסחרי, והמשקולות קונות לך הורדה של 33 GB וקובץ רישיון שאומר: שימוש לא-מסחרי בלבד.
הפשרה הזו היא בדיוק המקום שבו שכבת ניתוב מצדיקה את קיומה. OrcaRouter מציבה יותר מ-200 מודלים מאחורי נקודת קצה אחת תואמת OpenAI, במחיר המחירון של הספק וללא כל תוספת, עם מעבר אוטומטי בין ספקים בעת כשל — כך שצוות שרוצה להעריך מודל פתוח שטרם נמדד לא נדרש להעביר לשם כך את סביבת הייצור שלו, וכיוון שמחיר המחירון מועבר הלאה כפי שהוא, כל שינוי מחיר של ספק במודל מנותב נוחת על הצד שלנו באותו היום ולא בחידוש החוזה הבא. לא MAI-Image-2.5-Pro ולא Qwen-Image 2.1 נמנים עם המודלים שאנחנו מנתבים כיום, והמאמר הזה לא יטען אחרת. קו מוצרי התמונות שאנחנו כן מציגים כולל את משפחת GPT-Image של OpenAI, את שכבות Imagen 4 של Google ואת תצוגות התמונות של Gemini, ואת נקודת הקצה Grok Imagine של xAI.

היכן מעמדן של טענות הספק, וכמה משקל לייחס להן
שני הספקים מפרסמים נתונים שאף צד שלישי לא שיחזר, ויש לקרוא אותם באותה ספקנות בשני הכיוונים.
• ההצהרות של מיקרוסופט — דיוק של 96.8% ברינדור טקסט באנגלית, סינית, יפנית, קוריאנית וספרדית; עמידה בפרומפט טובה ב-27% לעומת GPT-Image-1.5; עקביות דמויות של 94% על פני מספר תמונות; ועד 84–89% הפחתה בעלות ה-GPU בתרחישים פנימיים ספציפיים של מיקרוסופט. האחרון הוא זה שכדאי להיזהר איתו: הוא מתאר את תצורת ההגשה של מיקרוסופט עצמה, ולא משהו שלקוח יכול לאמת.
• טענותיה של אליבאבא — פוסט הבלוג של Qwen-Image 2.1 כולל תרשים השוואה של Qwen-Image-Bench, והמספרים שבו הם של הספק עצמו. כמו כן, מופץ בסיקור של צדדים שלישיים נתון המתאר את המודל כ-Transformer בעל 20 שכבות, וזאת בסתירה ל-DiT החד-זרימי בעל 32 השכבות שבכרטיס המודל; כרטיס המודל הוא המקור הראשי, והנתון של 32 השכבות הוא זה שיש להשתמש בו.
ההבדל בין שני המצבים אינו ביושר של אף אחד מהספקים. הוא בכך שהמודל של מיקרוסופט נמדד באופן בלתי תלוי וזה של עליבאבא לא, ולכן את הטענות של מיקרוסופט אפשר לבדוק מול משהו ואילו את הטענות של עליבאבא עדיין אי אפשר לבדוק מול שום דבר.
לשם מה כל אחד מיועד
כאשר קוראים אותם יחד, הם אינם מתחרים על אותה משבצת.
• MAI-Image-2.5-Pro הוא מכשיר העריכה. הוא מוביל את לוח העריכה על בסיס הצבעות גדול, הוא מקבל הנחיה ארוכה (32k טוקנים של קלט טקסט, 131k הקשר), יש לו רישיון מסחרי, והוא זמין כעת בתצוגה מקדימה ציבורית ב-Microsoft Foundry וב-MAI Playground. אם העבודה שלך היא תיקון תמונות איטרטיבי ואתה צריך לדעת לפני שאתה מתחייב שהוא הטוב ביותר הזמין למשימה הזאת, זו התשובה הנמדדת, והוא עולה כ-$108.50 לאלף תמונות.
• Qwen-Image 2.1 הוא ארטיפקט המחקר הפתוח. הוא מרנדר בגדלים גדולים יותר, הוא מגיע עם נקודת ביקורת לשכתוב פרומפטים שניתנת לבדיקה לצד מודל התמונות, הוא מקבל עד 10 תמונות ייחוס עם עריכות מקומיות באמצעות עיגול, הערת ציור או מסכה, והוא חינם להורדה ואסור למכור אותו. אם העבודה שלך היא הערכה, השוואת ביצועים, או בנייה על משקולות שאפשר לקרוא, הוא האובייקט המעניין יותר — ואתה עושה את העבודה הזו בלי לוח דירוג שיגיד לך אם הוא שווה משהו.
יש גם אסימטריית תזמון שראויה לציון. MAI-Image-2.6 נכנס לתצוגה מקדימה פרטית ב-19 באוגוסט 2026, מה שאומר שהמודל שבראש לוח העריכה כבר מפגר בדור אחד אחרי מה שמיקרוסופט מתכוננת להשיק. Qwen-Image 2.1, לעומת זאת, נמצא ביום הראשון, עם תוכנית גישה מוקדמת שביקשה מהבודקים שלה לפרסם עד 29 בספטמבר. שני לוחות התוצאות בהשוואה הזו צפויים להיראות שונים בתוך חודש.


מה יפתור את זה?
דבר אחד: Qwen-Image 2.1 מופיע בלוח דירוג. כל דבר במאמר הזה שאינו מגבלת הרזולוציה או המחיר הוא טענה של מעבדה כזו או אחרת, וכל הסיבה לכך שאפשר להמליץ על MAI-Image-2.5-Pro בלי למצמץ היא ש-6,100 אנשים שלא עבדו עבור Microsoft הביטו בפלט שלו לצד משהו אחר והעדיפו אותו. זה הסטנדרט שהמודל הפתוח לא עמד בו, והסטנדרט שצריך לדרוש ממנו.
עד אז, הקריאה המעשית פשוטה. אם אתה צריך היום מודל עריכה, תחת רישיון מסחרי, עם לוח תוצאות מאחוריו, התשובה היא של מיקרוסופט והיא עולה כ-$108.50 לאלף תמונות. אם אתה רוצה לגלות אם מודל 7B במשקולות פתוחות עם פלט 2K מקורי ומשכתב פרומפטים שניתן לבדוק הוא טוב יותר, עליך לבצע את המדידה בעצמך — והדבר המועיל ביותר שתוכל לעשות עם התוצאה הוא לפרסם אותה, כי לקטגוריה כולה חסרה כרגע נקודת נתונים אחת.
