
Ming-Image-0.1-Design против Qwen-Image 2.1: настоящая разница — в лицензии
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 177 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1323 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Две открытые модели генерации изображений вышли с разницей в три дня в сентябре 2026 года, и, если судить по спецификации, выглядят как одна и та же покупка. Ming-Image-0.1-Design, созданная командой inclusionAI при Ant Group, выложила свои веса на Hugging Face 17 сентября под лицензией MIT. Qwen-Image 2.1, от команды Qwen из Alibaba, последовала 20 сентября под лицензией Qwen Research License Agreement. Обе выдают нативный RGBA, обе заявляют вывод в 2K и обе нацелены на одного и того же покупателя: команду, которой нужна генерация изображений, которую она может разместить у себя, изучить и доработать самостоятельно. А по-настоящему разделяют их две вещи — как раз те, которые спецификация показывает хуже всего: что вам юридически разрешено делать с результатом и сколько кремния требуется, чтобы получить одно изображение.
Это не риторическая формулировка. Для одной из этих моделей лицензия — жёсткий запрет на коммерческое использование; для другой это вообще не проблема. А количество параметров, которое каждый производитель указывает на коробке, занижает объём загрузки в три-четыре раза. Эти два факта решают вопрос о покупке задолго до того, как это сделает любой бенчмарк, — а бенчмарки, как выясняется, вообще нельзя сравнивать.
Что на самом деле содержит каждый репозиторий
Ни одна из моделей не является единой сетью. Обе — это конвейеры, и именно в конвейере живёт размер:
• Генератор — Ming-Image-0.1-Design поставляется с трансформером для дизайна на 6,15 млрд параметров (12,31 ГБ в BF16); Qwen-Image 2.1 поставляется с 7,1-млрд однопоточным DiT с 32 слоями, блочно-каузальным вниманием и нераскрытым числом активных параметров (около 14,2 ГБ).
• Текстовая часть — Ming-Image-0.1-Design сочетает свой трансформер с 17,01B мультимодальной LLM (34,02 ГБ) и 3,09B коннектором (6,17 ГБ); Qwen-Image 2.1 использует текстовый энкодер Qwen3-VL 8B (около 17,5 ГБ).
• Общее количество параметров — 26.44B у Ming-Image-0.1-Design против примерно 15–16B у Qwen-Image 2.1. Учтите, что ни у одного из производителей число в заголовке не является общим: «6B» и «7B» описывают только генератор.
Размер репозитория — 52,88 ГБ для Ming-Image-0.1-Design (49,25 ГиБ из них — веса); примерно 33 ГБ для Qwen-Image 2.1.
• Прозрачность — обе выводят нативный RGBA напрямую из модели, а не через отдельный этап матирования постфактум. Ming-Image-0.1-Design использует собственный RGBA VAE; Qwen-Image 2.1 использует 64-канальный RGBA VAE с 16-кратным пространственным сжатием.
• Генерация по умолчанию — Ming-Image-0.1-Design валидируется при 2048×2048, 12 шагах, BF16, CFG 1.0; Qwen-Image 2.1 по умолчанию использует 2048×2048 при 40 шагах с семью предустановками соотношения сторон.
• Лицензия — MIT для Ming-Image-0.1-Design; Лицензионное соглашение Qwen Research, некоммерческое, для Qwen-Image 2.1.
Ярлык «6B» делает очень много работы.
Репозиторий Ant Group заявлен как модель с 6 млрд параметров, а сам трансформер действительно содержит 6,15 млрд параметров. Но веса, которые вы скачиваете, занимают 49,25 ГиБ, репозиторий — 52,88 ГБ, а конфигурация, которую проверил поставщик — 2048×2048 при BF16 с полностью резидентным текстовым стеком — рассчитана на одну CUDA-графическую карту с 80 ГиБ. Это не погрешность округления для карты на 48 ГБ; это карта, которую вы не сможете использовать. Ускоритель на 48 ГБ не вместит этот конвейер, и два таких тоже не вместят его без ухищрений с выгрузкой, которые поставщик не документирует.
Qwen-Image 2.1 — это более нетребовательный вариант для скачивания, с той оговоркой, что Alibaba вообще не публикует официальных цифр по объёму видеопамяти. Единственное указание в карточке модели — включать выгрузку на CPU на картах меньшего размера. То, что было измерено после релиза, оказалось полезнее того, что было опубликовано: конвейер int8 занимает в общей сложности около 16 ГиБ и полностью помещается в карту на 24 ГБ, тогда как для полного прогона в BF16 сообщают диапазон от примерно 17 ГБ с выгрузкой на CPU до примерно 40 ГиБ пикового потребления при 1024×1024 — в зависимости от того, как размещён текстовый энкодер. Сообщаемая задержка на одно изображение составляет от нескольких секунд на B200 до менее десяти секунд на актуальной карте для рабочей станции. Воспринимайте каждое из этих чисел как измерение сообщества, а не как спецификацию — они варьируются в зависимости от стратегии выгрузки сильнее, чем сами модели отличаются друг от друга.
Практическое резюме: Qwen-Image 2.1 — это модель класса 3090, если вы готовы к оффлоаду; Ming-Image-0.1-Design — это модель класса дата-центра, не имеющая более компактной конфигурации.
Лицензия — это развилка на дороге
Это та часть, которая действительно остановит проект, и именно её два релиза обрабатывают наиболее по-разному.
Ming-Image-0.1-Design распространяется под лицензией MIT. Поставляйте его в платном продукте, дообучайте, распространяйте веса, оставляйте свои изменения закрытыми — ничего из этого не требует разговора с Ant Group.
Qwen-Image 2.1 — нет. На него распространяется Лицензионное соглашение об исследованиях Qwen (Qwen Research License Agreement) от 20 сентября 2026 года, которое лицензирует веса исключительно для исследований и оценки. Для коммерческого использования требуется отдельное соглашение с Alibaba, и цена такого соглашения не публикуется. Производные модели и материалы при их распространении должны сопровождаться лицензией, уведомлением «Built with Qwen» или «Improved using Qwen» и строкой об авторских правах Hangzhou Tongyi Laboratory, а «Qwen» не может быть основным названием производной модели. Лицензия регулируется китайским законодательством, юрисдикция — Ханчжоу.
Есть один действительно проясняющий момент в собственном разъяснении поставщика: Alibaba заявила, что сгенерированные изображения не являются частью лицензируемых «Материалов», поэтому права на то, что создаёт модель, остаются у вас. Ограничение распространяется на веса и на модель, а не на ваш результат. Это существенная оговорка, и её стоит прочитать внимательно, потому что упрощённая формулировка — «изображения ваши, а модель — нет» — верна.
Это также смена направления. Более ранние релизы Qwen-Image, включая оригинальный Qwen-Image и сборки 2511 и 2512, остаются на условиях Apache 2.0 и разрешают коммерческое использование. Команда, которая в прошлом году выбрала Qwen-Image из-за его лицензии и в этом месяце обновляется до 2.1, наследует ограничение «только для исследований», с которым никогда не соглашалась. Если нужны именно разрешительные условия, то Qwen-Image 2.1 — это не более новая версия того, что у вас было, а другая сделка.
Для чего предназначен каждый из них
Разделение лицензий отражает различие в намерениях, и именно это различие должно определять выбор, когда оба варианта являются для вас законными.
Ming-Image-0.1-Design — это инструмент дизайна. Текстовый стек существует, чтобы разворачивать короткое задание в структурированный промпт на 8K, и вендор поставляет вокруг него «скиллы» — Design Skill, создающий визуальный черновик примерно за 15 секунд, и PPT Skill, нацеленный на вывод в формате слайдов. Его сопутствующий репозиторий Ming-Image-0.1-Design-Layer берёт сведённый в один слой дизайн и возвращает его в виде отдельных слоёв — это единственная возможность здесь, которой не предлагает больше никто в открытом поле. inclusionAI сообщает, что модель Layer работает примерно в 4,3 раза быстрее открытой модели слоёв на 20B при той же задаче (183 секунды против 795) — по данным вендора, без воспроизведения, а цель сравнения указана недостаточно точно, чтобы её можно было проверить.
Qwen-Image 2.1 — это генератор-редактор. Один чекпоинт выполняет как генерацию изображений по тексту, так и редактирование по инструкциям, принимает до 10 референсных изображений для одного редактирования и поддерживает локальные правки, оставляющие остальную часть кадра нетронутой. Он вышел с поддержкой с первого дня в ComfyUI, Diffusers, vLLM-Omni, SGLang-Diffusion и LightX2V — история сервинга, которой у Ming-Image-0.1-Design пока нет, поскольку его собственное руководство по сервингу указывает на vLLM-Omni.
Воспринимайте это как развилку, а не как рейтинг. Если задача — «создать многослойный редактируемый дизайн-актив по брифу», то Ming-Image-0.1-Design — единственный из двух, кто это делает. Если задача — «сгенерировать, а затем итеративно редактировать по референсам», Qwen-Image 2.1 делает это в одной модели, а Ming-Image-0.1-Design не делает этого вовсе.
Бенчмарки нельзя сравнивать, и это честный ответ.
У обоих поставщиков есть цифры. Ни одну из этих цифр нельзя ставить рядом с другой, и любая статья, которая так поступает, выдумывает результат.
Доказательство Ming-Image-0.1-Design — это таблица Artificial Analysis: первое место в Text-to-Image Leaderboard с фильтром по открытым весам для UI/UX-дизайна, с рейтингом Elo 1 082, впереди Ideogram 4.0 Quality с 1 052, Ideogram 4.0 с 1 015, HunyuanImage 3.0 Instruct с 1 005 и FLUX.2 [dev] с 1 000. Вендор также сообщает о процентах побед 67,4 % по компоновке, 67,0 % по сложной композиции и 66,7 % по отрисовке текста, а также о первом месте по 12 метрикам на Crello. Лидерборд — сторонний инструмент, что делает Elo более сильным из двух видов доказательств здесь; проценты побед и победа по всем метрикам на Crello заявлены вендором, и их следует воспринимать как утверждения.

Доказательством для Qwen-Image 2.1 служит Qwen-Image-Bench — бенчмарк, созданный командой Qwen, в котором она набирает 60,28 балла и лидирует среди открытых моделей, опережая Nano Banana 2.0 с 59,82 и GPT Image 1.5 с 59,65. В исходных материалах указано, что бенчмарк создан Qwen, а разрыв между тройкой лидеров составляет менее одного пункта — он вполне укладывается в шум бенчмарка, автор которого также является его участником.
Итак: сторонний Elo на подмножестве задач по UI/UX-дизайну против общей оценки, построенной вендором. Разные инструменты, разные задачи, разные судьи. Никто не опубликовал прямого очного сравнения этих двух моделей друг с другом, и, судя по доступным данным, этого не может сделать никто. Полезная трактовка здесь узкая, и её стоит изложить прямо: Ming-Image-0.1-Design имеет стороннее подтверждение именно по дизайнерской работе, Qwen-Image 2.1 — заявленную вендором сильную сторону в общей генерации и редактировании, а пересечение этих двух утверждений меньше, чем предполагают заголовочные цифры.
Установка любого из них на эндпоинт
Сегодня ни одной из этих моделей нет в каталоге OrcaRouter. Ming-Image-0.1-Design и Qwen-Image 2.1 сейчас обе представляют собой варианты для самостоятельного хостинга: веса можно скачать, а руководства по запуску реальны, но GPU вы поднимаете сами, и в случае Ming это GPU объёмом 80 GiB. Мы перечисляем их здесь как релизы с открытыми весами, а не как маршруты.
Что стоит узнать, прежде чем вы вложитесь в оборудование, — это сколько та же самая нагрузка стоит вам в виде вызова. Наши маршрутизируемые модели изображений включают google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview, google/gemini-3.1-flash-image-preview, три уровня Imagen 4.0 (fast, standard и ultra), grok/grok-imagine-image и семейство GPT-Image — openai/gpt-image-1, openai/gpt-image-1-mini, openai/gpt-image-1.5 и openai/gpt-image-2. Недельный прогон дизайн-брифа через одну из них покажет вам, действительно ли послойный вывод Ming-Image-0.1-Design — это та возможность, которая вам нужна, причём за долю стоимости карты на 80 GiB, и произойдёт это до того, как вы выясните, станет ли блокером лицензия или объём VRAM. Когда вы действительно переведёте модель, размещённую у себя, в продуктивный контур, тот же самый эндпоинт — это то место, где живёт маршрутизация, — один ключ для 200+ моделей, автоматическое переключение между провайдерами при сбое и 0% наценки, так что снижение цены вендором действует на нашей стороне в тот же день, когда о нём объявят.

Кто должен выбирать
Выберите Ming-Image-0.1-Design, если результат должен быть дизайн-активом, а не картинкой: слоистый вывод, структурированное расширение промпта, генерация в формате слайдов и лицензия, позволяющая продавать всё, что вы с её помощью создадите. Заложите бюджет на серьёзную видеокарту и смиритесь с тем, что экосистема обслуживания вокруг неё менее развита, чем у Qwen. Это также более полезный из двух вариантов, если вам нужно предъявить заказчику цифру, потому что его самое сильное доказательство — единственная сторонняя цифра в этом сравнении.
Выбирайте Qwen-Image 2.1, если рабочий процесс строится по принципу «сначала сгенерировать, потом отредактировать», если вам нужна обусловленность референсным изображением или если вы хотите запускать на уже имеющемся у вас оборудовании. Он меньше, лучше обеспечен поддержкой с самого начала, а его лицензия подходит для исследовательской и оценочной работы, которую большинство людей на самом деле выполняет в первую очередь. Он становится неверным выбором, как только результат становится коммерческим, а юридическая проверка — реальной, потому что единственный путь к коммерческой лицензии — прямое соглашение с Alibaba, и нет опубликованной цены, на которую можно ориентироваться при планировании.
Пока не выбирайте ни один из них, если вам нужна генерация изображений в продакшене уже в этом месяце. И то, и другое — это веса, а веса — это аппаратные и юридические обязательства прежде, чем возможность. На вопрос о дизайне — меняет ли многоуровневый вывод то, что может выпускать моя команда, — можно сначала ответить на хостинговом эндпоинте, и именно этот ответ должен решать, покупать ли карту на 80 GiB.
Что посмотреть
Три вещи изменят это сравнение. Получит ли Ming-Image-0.1-Design путь для сервинга помимо собственного руководства по vLLM-Omni — потому что именно в этом сейчас заключается разрыв между ним и списком Qwen-Image 2.1 из пяти фреймворков с поддержкой с первого дня. Назначит ли Alibaba цену на коммерческую лицензию Qwen — потому что отсутствие цены является самой крупной неизвестной в этой паре. И будет ли кто-нибудь — лаборатория, независимый оценщик или вендор, которому нечего терять, — прогонять эти две модели друг против друга на одних и тех же промптах. Пока этого не произойдёт, самое близкое к честному сравнению — вовсе не оценка. Это пункт о лицензии, и Ming-Image-0.1-Design безоговорочно выигрывает по этому пункту.

