
Ming-Image-0.1-Design לעומת Qwen-Image 3.0: מי מראה לך איך הטקסט מצטייר
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
הדבר המעניין ביותר ב-Ming-Image-0.1-Design אינו נמצא בכרטיס המודל שלו. הוא נמצא בקומיט למסגרת הסקה. בערך בזמן ההעלאה השקטה של המודל ל-Hugging Face ב-17 בספטמבר 2026, vLLM-Omni מיזגה שינוי שכותרתו feat: הוספת תמיכה ב-byte5 עבור Ming שמחבר מקודד גליפים ByT5 אל תוך פייפליין ming_flash_omni חדש — רכיב ייעודי שכל תפקידו הוא להסתכל על התווים שביקשת שיוצגו, ולא על התמונה שביקשת. זהו סוג הפרט שאפשר למצוא רק בקריאת קוד, וזה בדיוק הפרט ש-Qwen-Image 3.0 — מודל התמונה המתארח הסגור של הספק, שהושק ב-21 ביולי 2026 והגיע לזמינות כללית ב-5 באוגוסט — לא מאפשר לאף אחד לקרוא בכלל. שני המודלים מיועדים לעבודת עיצוב שבה טיפוגרפיה קריאה היא החלק הקשה. רק אחד מהם יגיד לך איך הוא עושה זאת.
מה כל אחד מהם אומר על טקסט
סיפור רינדור הטקסט של Qwen-Image 3.0 הוא כולו הצהרת השקה, והיא טובה על הנייר. החומרים של Alibaba מתארים פרומפטים של עד כ-4,500 טוקנים, טקסט קריא עד כ-10 פיקסלים, כיסוי של 12 שפות ביותר מ-20 גופנים, פלט של עד 2048×2048 ועד שש תמונות בכל קריאה, המסופק במהדורות Pro ו-Standard דרך API מתארח יחיד. אין שחרור משקולות, אין רישיון מוצהר, אין כרטיס מודל, אין דוח טכני ואין טבלת בנצ'מרקים מפורסמת שמולה אפשר לבדוק משהו מכל זה. נתון הפרמטרים של כ-20B MMDiT, שמופץ באופן נרחב, מדווח ולא מאושר.
הסיפור של Ming-Image-0.1-Design הוא מאגר. 6,154,901,056 פרמטרים, רישיון MIT, diffusers תג pipeline, כל המשקלים ב-BF16 safetensors, כ-71.5 GB המפוזרים על פני connector/, mllm/, mlp/, scheduler/, transformer/ וגם vae/. ההסקה המומלצת היא 2048×2048 ב-12 צעדי דגימה עם guidance של 1.0 על CUDA GPU אחד של 80 GiB, או 1024 למהירות, כאשר vLLM-Omni מיועד לפריסה ומודל חזותי-לשוני נפרד מיועד לשיפור פרומפט. הכרטיס מתאר אותו כמודל טקסט-לתמונה עבור UI, אינפוגרפיקות, פוסטרים ועיצוב חזותי אחר עשיר בטקסט, עם פלט RGBA לרקעים שקופים.
שתי הפסקאות האלה אינן אותו סוג של הצהרה, וכדאי להיות בוטים לגבי הסיבה. האחת היא תיאור של מוצר שנכתב בידי מי שמוכרים אותו. האחרת היא תיאור של ארטפקט שכל אחד יכול להוריד ולבדוק.
מקודד הגליפים הוא החלק שמסביר את הקטגוריה
רינדור טקסט במודלים של תמונות נכשל בדרך כלל באופן ספציפי: המודל מייצר משהו שנראה כמו כתיבה בלי להיות כתיבה. צורות האותיות סבירות, אבל המילה שגויה. הסיבה היא ארכיטקטונית לפני כל דבר אחר — לרוב מודלי התמונה אין רכיב שרואה תווים כתווים, ולכן כתב משוחזר מנתונים סטטיסטיים חזותיים באותו אופן שבו משוחזר דשא.
ה-commit של vLLM-Omni מעניין בדיוק מפני שהוא מצביע על כך. הקבצים שנוספו — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py ומעבד קלט של שלב — מתארים מסלול שבו מקודד ברמת הבתים ByT5 קורא את הטקסט שאמור להופיע בתמונה, אוצר המילים של הטוקנייזר מורחב בסמני גופן וצבע, והתכונות המתקבלות מתווספות לאורך ממד הרצף כאשר הצד השלילי מקבל אפסים. הפרט האחרון הזה הוא הסימן לכך שזהו החלטת תכנון אמיתית ולא רק חיווט: אם הענף השלילי היה נושא את אותן תכונות גליפים, הנחיה ללא מסווג הייתה נמשכת לרנדר את הטקסט ולהתרחק מהפרומפט, כך שהאפסים קיימים כדי למנוע מהשני יעדים להתנגש. המקודד נטען רק כאשר נקודת הבדיקה אכן מכילה תת-תיקייה byte5/.
שתי הערות כנות. זהו קומיט של מסגרת הסקה של צד שלישי, ולא הצהרה של Ant Group, והפרשנות למשמעותם של אותם קבצים היא שלנו ולא של הספק. והוא מאשש כוונת תכנון, לא תוצאה: עצם נוכחותו של מקודד גליפים מתיישבת עם רינדור טקסט טוב, והיא אינה ראיה לכך שרינדור הטקסט טוב. הראיה הבלתי תלויה היחידה לאיכות היא מיקום בודד בטבלת מובילים, הנדון להלן.

הניגוד עם Qwen-Image 3.0 אינו בכך שהמודל של Alibaba מרנדר טקסט רע — איש מחוץ ל-Alibaba לא יכול לומר עד כמה הוא מרנדר טקסט היטב, וזו הנקודה. אלא שהשאלה "איך המודל הזה מצייר אותיות" יש לה תשובה עבור אחד מהמודלים הללו וטענה שיווקית עבור האחר, והפער בין תשובה לטענה הוא המקום שבו מתקבלות החלטות הנדסיות.
המספר האחד, והלוח שהוא לא נמצא עליו
Ming-Image-0.1-Design מדורג במקום הראשון ב-Artificial Analysis Text to Image Leaderboard for UI/UX Design, בתצוגת open-weights, עם Elo של 1,082 — לפני Ideogram 4.0 (Quality) עם 1,052, Ideogram 4.0 עם 1,015, HunyuanImage 3.0 Instruct עם 1,005, FLUX.2 [dev] עם 1,000, FLUX.2 [dev] Flash עם 999 ו-FLUX.2 [dev] Turbo עם 994. העותק של אותו לוח הוא זה שמשוחזר בכרטיס של המודל עצמו, והוא נושא את המיתוג של Artificial Analysis; איש לא שחזר את הציון באופן עצמאי.
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1124.png)
זהו לוח דירוג במשקלים פתוחים, ולכן ל-Qwen-Image 3.0 אין רשומה, והיעדרותו אינה אומרת דבר על איכותו. מה שזה כן אומר הוא מבני: לוח העדפות עיוור יכול לדרג רק מודלים שהמשקלים שלהם פומביים. זה נותן לשחרור פתוח מיקום מדיד חודשים לפני שיש לו מוצר, וזה נותן לשחרור סגור מספר שיווקי ותו לא. לטענות של Qwen-Image 3.0 — קריאות בגודל 10 פיקסלים, פרומפטים של 4,500 טוקנים, יותר מ-20 גופנים — אין מאחוריהן שום מדידה בלתי תלויה כלל.

איך היית בודק את זה בפועל, וכמה עולה לנסות
אם טיפוגרפיה קריאה היא הסיבה שאתם קוראים את זה, המבחן אינו טבלת דירוג. זה הגופן שלכם, השפה שלכם והמחרוזות שלכם, שמועברים דרך שני המועמדים ונקראים בידי אדם. המבחן הזה דורש שאחד מהמודלים האלה יהיה נגיש וזול, והשני יהיה ניתן להורדה, והם מתומחרים לפי עקרונות מנוגדים.
• Qwen-Image 3.0 — בסביבות $0.04 לתמונה במהדורת Pro ובסביבות $0.03 ב-Standard, כאשר תמחור מקומי לצרכנים מתחיל מכ-¥0.18 לתמונה. אלה נתוני השקה ולא עברו ביקורת. אפשר להריץ מטריצת פרומפטים אחר הצהריים ולשלם לפי קריאה.
• Ming-Image-0.1-Design — אין מחיר מפורסם, כי אין נקודת קצה מתארחת. העלות היא הורדה של 71.5 GB, כרטיס של 80 GiB והזמן שלך, והתועלת היא שאתה יכול לכוון את אותו מבחן אל מסלול מקודד הגליפים ולראות אם הוא הרכיב שמבצע את העבודה.
זה המצב שעבורו נבנתה שכבת ניתוב, וכדאי להיות מדויקים לגבי החלק שבה שרלוונטי. לא Qwen-Image 3.0 ולא Ming-Image-0.1-Design נמצאים בפלטפורמה שלנו, כך ששכבת ניתוב לא יכולה לשים אף אחד מהם מאחורי מפתח היום. מה שהיא כן יכולה לעשות הוא לשמור על השוואה הוגנת בזמן שאתם מריצים אותה: OrcaRouter מציבה 200+ מודלים מאחורי נקודת קצה אחת תואמת OpenAI במחיר המחירון של הספק ללא תוספת, עם מעבר אוטומטי בין ספקים בעת תקלה, כך שהמודל שאתם כבר סומכים עליו יכול להחזיק את מסלול הייצור — והעלות שלו נשארת קשורה למחיר המחירון של הספק, כך ששינוי בתעריף הספק נוחת אצלנו באותו יום — בעוד שמודל עיצוב שטרם נמדד נבחן לצידו ולא לפניו.
שתי מהדורות פתוחות, אחת סגורה, ודפוס.
כדאי לציין למה מהווה השחרור של Ming עדות, מעבר לעצמו. Ant Group פרסמה מודל עיצוב בעל 6.15 מיליארד פרמטרים תחת רישיון MIT ללא הכרזה, לצד מודל שני לפירוק שכבות תחת אותו רישיון. Alibaba פרסמה מודל מתארח סגור ללא רישיון, ללא כרטיס וללא דוח, שמיועד לאותו סוג של עבודה, ותמחרה אותו לפי תמונה.
אלה שני הימורים שונים לגבי היכן שוכן הערך במודלים של עיצוב. האחד אומר שהמודל הוא המוצר והמשקלים הם ערוץ ההפצה. האחר אומר שהמודל הוא שירות והמשקלים הם הדבר שאתה שומר. שני ההימורים יכולים להיות נכונים באותו שוק, והם מייצרים תשובות שונות מאוד לשאלה היחידה שחשובה בזמן הערכה: האם אני יכול לגלות איך זה עובד לפני שאני תלוי בזה?
• אם אתה צריך לדעת כיצד טקסט מוצג, ולמה לפעמים הוא לא — Ming-Image-0.1-Design הוא היחיד מבין השניים שמאפשר לך להסתכל, ורישיון MIT אומר שאתה יכול לפעול לפי מה שתמצא.
• אם אתה צריך נקודת קצה לפרודקשן כבר היום עם מחיר לפי תמונה וללא תשתית — Qwen-Image 3.0 הוא היחיד מבין השניים שמציע כזו, והמרכיבים הפנימיים שלו כלולים במחיר.
• אם אתם זקוקים לראיות בלתי תלויות לפני שאתם מתחייבים — לאף אחד מהם אין מספיק מהן. לאחד יש מיקום בודד בטבלת הדירוג שלא שוחזר; ולשני יש גיליון הצהרות של ספק בלי מספרים מצורפים.
מה שצריך לעקוב אחריו הוא אם התבנית מחזיקה. שחרור לא מוכרז של MIT עם מקודד גליפים בתוכו הוא הצהרה על האופן שבו מחבריו מצפים שהמודל ישמש — ייבדק, ירוץ מקומית, ישונה. אם השחרור הבא של אותו צוות יוכרז, ייבחן בבנצ'מרקים ויאוחסן, זה היה חד-פעמי. אם זה עוד מאגר שקט, לקטגוריית מודלי העיצוב יש מתחרה פתוח שני, ולחצי הסגור של השוק יש בעיית מחירים שלא הייתה לו ביולי.
