Hero-карточка с надписью «Qwen-Image-2.1 против Grok Imagine Image 2.0», подзаголовком «Бесплатные веса против платной среды» и тремя строками: Qwen-Image-2.1 — нулевая стоимость за изображение, некоммерческое использование; Grok Imagine Image 2.0 — около $0,02–$0,06 за изображение; маски редактирования и нативная альфа против референсных изображений, рядом со значком файла и ценника.
Guides & Insights

Qwen-Image-2.1 против Grok Imagine Image 2.0: открытые веса против платной среды

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Один из них не стоит ничего за изображение и поставляется с лицензией, которая запрещает продавать результат. Другой стоит от двух до шести центов за картинку в зависимости от того, где вы его покупаете, не имеет подобных ограничений и занимает позиции в рейтинговых таблицах, которые вы действительно можете посмотреть. Qwen-Image-2.1 стал публично доступен 20 сентября 2026 года как открытые веса под исследовательской лицензией. Grok Imagine Image 2.0 — это платный эндпоинт изображений от вендора, распространяемый через собственный API и ряд сторонних провайдеров. Выбор между ними не в качестве — он в том, хотите ли вы владеть моделью или арендовать среду вокруг неё, а среда делает больше работы, чем предполагает ценник.

Сколько стоит картина с каждой стороны

Цена Qwen-Image-2.1 — ноль за изображение и ненулевая разово. Вы скачиваете примерно 33 ГБ — однопоточный диффузионный трансформер на 7B с 32 слоями объёмом около 14 ГБ плюс текстовый энкодер Qwen3-VL 8B, занимающий бо́льшую часть остального, — и после этого предельная стоимость одного изображения — это электричество на его запуск. На карте с ограниченными ресурсами в карточке модели рекомендуется выгрузка на CPU через pipe.enable_model_cpu_offload(), что является стандартным запасным вариантом и стоит вам скорости, а не денег.

Цена Grok Imagine Image 2.0 имеет противоположную структуру. В собственной документации xAI флагманская модель указана по цене $0.04 за выходное изображение, при этом базовый эндпоинт изображений Grok Imagine стоит $0.02, а уровень качества — $0.05. Сторонние поставщики попадают в аналогичный диапазон со своей собственной градацией: один указывает фиксированные тарифы $0.05 за текст-в-изображение и $0.06 за редактирование независимо от разрешения или настройки качества; другой называет $0.045 фиксированно и для 1K, и для 2K в своём уровне качества; третий рекламирует $0.025 за текст-в-изображение или редактирование по референсу с использованием до пяти входных изображений. По всему рынку это укладывается примерно в $0.02–$0.06 за изображение, при этом потребительский доступ включён в X Premium и SuperGrok, а не оплачивается за каждое изображение.

Модель затрат — Qwen-Image-2.1 — это фиксированные расходы на оборудование и загрузку при нулевых предельных затратах на одно изображение; Grok Imagine Image 2.0 — это чисто предельные затраты, линейно растущие с объёмом и так до бесконечности.
Точка безубыточности — точка перехода — это вопрос объёма, который можно рассчитать, и она смещается всякий раз, когда провайдер меняет тариф. При нескольких тысячах изображений в месяц хостинговый вариант оказывается заведомо дешевле покупки GPU; при высоком стабильном объёме локальный вариант выигрывает по затратам и проигрывает по всем остальным параметрам.
Чего нельзя купить на локальной стороне — лимиты запросов, безотказность работы и чужую команду эксплуатации. А чего нельзя купить на хостинговой стороне — так это весов.

О чём говорят таблицы лидеров, а о чём — нет

У Grok Imagine Image 2.0 есть публичные заявления о рейтинге. В стартовых материалах xAI указывалось второе место в общем зачёте как на доске Text-to-Image, так и на доске Image Edit Arena по состоянию на 7 августа 2026 года, позади GPT Image 2 — это снапшот, на который ссылается вендор и у которого есть временная метка, и именно так его и следует воспринимать. Сторонние трекеры в последующие недели помещали его примерно на второе место в редактировании изображений и на третье в текст-в-изображение, снова позади GPT Image 2, с показателями Elo в районе 1300 с небольшим, а некоторые сайты-трекеры сообщали о значениях ближе к 1 173–1 175. Разброс между этими числами — сам по себе урок: позиции в таблицах лидеров в этой категории меняются от недели к неделе, и рейтинг без привязанной даты не является информацией.

Qwen-Image-2.1 вообще не имеет рейтинга. На момент написания его не было в независимых лидербордах изображений. Его единственный показатель качества — это собственная диаграмма Qwen-Image-Bench от производителя, где указано 60,28 против 59,82 у Nano Banana 2.0 и 59,65 у GPT Image 1.5 — материал производителя, не воспроизведённый ни одной третьей стороной. Единственная по-настоящему независимая точка данных — это функциональная проверка, опубликованная вместе с работой по интеграции SGLang: вывод прозрачных PNG прошёл проверку, альфа-канал сохранялся во всём диапазоне 0–255, а RGBA PSNR составил 60,69 дБ на единственном образце, который авторы явно описывают как проверку корректности, а не как гарантию качества.

Итак, честная картина такая: у одной модели есть публичный рейтинг, который меняется, и привязанное к нему заявление поставщика, а у другой — оценочная карта от поставщика и пройденный интеграционный тест. Это не сравнение, и ни одна статья, утверждающая обратное, не запускала обе модели.

A two-column board for Qwen-Image-2.1 and Grok Imagine Image 2.0 carrying both sides on one line per dimension: Price model, Licence, Transparency, Ranking evidence, Reference images and Distribution. Footer notes that rankings are time-stamped and move week to week, that the vendor claim is unaudited, and that no head-to-head evaluation of the two exists.

Alpha, и почему это единственная техническая асимметрия

Прозрачность в Qwen-Image-2.1 встроена в модель. 64-канальный RGBA VAE с 16-кратным пространственным сжатием означает, что альфа-канал является частью латентного пространства, которое подвергается денойзингу, а это даёт три вещи из одного механизма: генерацию с прозрачностью, редактирование внутри изображения, которое уже имеет прозрачность, без предварительного сведения его в плоское изображение, и извлечение объекта из обычной RGB-фотографии, возвращающее альфа-канал, а не жёсткую маску. Ни узла удаления фона, ни модели матирования, ни очистки краёв — таково заявление вендора, и функциональная проверка SGLang — единственное независимое свидетельство того, что канал реален, а не номинален.

Grok Imagine Image 2.0 не имеет задокументированного эквивалента. Его заявленный функционал — генерация изображений по тексту и редактирование на основе референсов, с уровнями разрешения и качества и до пяти входных изображений у некоторых провайдеров. Если вашему ассету нужен вырезанный объект с чистыми полупрозрачными краями — волосы, стекло, дым, — вы добавляете этап матирования на стороне Grok, а не на стороне Qwen. Стоит ли этот этап дороже, чем головная боль с лицензией на другой стороне, — вот собственно инженерный вопрос, и ответ зависит от вашего предмета съёмки.

Среда редактирования против контрольной точки

Две системы расходятся во мнениях о том, где должна находиться интеллектуальная составляющая редактирования.

Grok Imagine Image 2.0 превращает это в сервис. Вы отправляете референсное изображение и инструкцию, провайдер решает, что это значит, а разрешение и уровни качества выбираются для каждого запроса. Читать нечего, настраивать нечего и ломать нечего — и это настоящее преимущество для команды, которая не хочет владеть пайплайном diffusers. Это также причина, по которой цена у разных провайдеров различается за номинально одну и ту же модель: вы покупаете среду, а не просто веса.

Qwen-Image-2.1 помещает его в чекпоинты, которые можно изучить. Вместе с моделью генерации изображений он поставляет две модели переписывания промптов — PE-T2I и PE-I2I, каждая представляет собой дообученную Qwen3.5-VL 9B объёмом около 18,8 ГБ — с кодом переписывания в папке prompt_rewrite/ и поставляемым system_prompt.txt, в котором, среди прочего, подробно описано, как выбирается язык отображаемого текста. Это уровень прозрачности, которого не предлагает ни один облачный API для работы с изображениями. Это ещё и 37,6 ГБ рерайтера поверх модели — реальные затраты на диск и время загрузки для компонента, который большинство пайплайнов сочтут необязательным.

Поверхность редактирования — Qwen-Image-2.1 поддерживает локальные правки с помощью круга, нарисованной аннотации или отдельной маски, а также редактирование прозрачного слоя и извлечение объекта; документированное редактирование Grok Imagine Image 2.0 выполняется на основе референсного изображения.
Референсные входные данные — Qwen-Image-2.1 принимает до 10 референсных изображений, при этом один из рецензентов с ранним доступом сообщает, что согласованность при нескольких референсах ухудшается начиная примерно с трёх изображений; несколько провайдеров Grok документируют до пяти входных изображений.
Нативное разрешение — Qwen-Image-2.1 выводит нативно в 2K с 2048×2048 по умолчанию при 40 шагах в семи предустановках соотношения сторон; разрешение Grok Imagine Image 2.0 выбирается для каждого запроса и тарифицируется провайдером.

Распространение и лицензия

Именно здесь они расходятся наиболее резко, и это вовсе не техническое различие.

Grok Imagine Image 2.0 доступен через API xAI и через множество независимых сторонних провайдеров, а это означает конкуренцию по ценам, а значит, тариф, который вы платите, — это рыночная ставка, а не цена по прайс-листу. Не нужно ничего скачивать, не нужен GPU, не нужно читать файл лицензии, и нет никаких ограничений на коммерческое использование, кроме собственных условий провайдера.

Qwen-Image-2.1 доступна одним способом: скачать её. Она распространяется по лицензионному соглашению Qwen Research License Agreement от 20 сентября 2026 года, которое предоставляет права только для некоммерческих целей и указывает, что для коммерческого использования требуется отдельная лицензия, запрашиваемая у поставщика. Это ужесточение по сравнению с более ранней линейкой Qwen-Image, которая распространялась под Apache 2.0, и это единственный факт, который определяет большинство реальных решений при выборе между этими двумя. Студия, сравнивающая их по качеству результатов, отвечает не на тот вопрос; студия, которая не может использовать Qwen-Image-2.1 для клиентской работы, вообще их не сравнивает.

OrcaRouter — это то, где живёт арендуемая сторона этой схемы. Мы маршрутизируем более 200 моделей через одну совместимую с OpenAI конечную точку по прейскурантной цене провайдера без наценки, с автоматическим переключением при сбое между провайдерами, DSL маршрутизации и объединение моделей — так что маршрут для изображений может указать основную и резервную модель, а не полагаться на удачу одного провайдера. Мы маршрутизируем конечную точку изображений xAI Grok Imagine, но обратите внимание на версию: в нашем каталоге есть grok/grok-imagine-image, а не Grok Imagine Image 2.0, поэтому более новую модель мы сейчас не можем вам предоставить. Мы также не маршрутизируем ни одну модель Qwen-Image ни одной версии, поэтому Qwen-Image-2.1 доступна только локально. Маршрутизируемая линейка изображений, которую мы поддерживаем, — это семейство GPT-Image от OpenAI, уровни Imagen 4 от Google и предварительные версии изображений Gemini, а также та более старая конечная точка изображений Grok Imagine; поскольку прейскурантная цена передаётся без наценки, снижение цены поставщиком на любую из них вступает в силу в тот же день.

Decision card titled 'The tiebreak' with two panels: 'Own it - Qwen-Image-2.1', zero cost per image with native alpha, masks and local editing under a non-commercial licence, and 'Rent it - Grok Imagine Image 2.0', about $0.02 to $0.06 per image on commercial terms with no documented transparency path.

Что изменило бы этот ответ?

Три вещи, и все три возможны в течение квартала.

Коммерческая лицензия на Qwen-Image-2.1. Если поставщик опубликует условия по цене, которую студия готова платить, преимущество прозрачности и нулевые предельные издержки станут применимы в коммерческой работе, и это сравнение полностью изменит форму. Сегодня опубликованной цены нет, как и заявленных условий.
Независимый бенчмарк Qwen-Image-2.1. Если третья сторона воспроизведёт показатели Qwen-Image-Bench от поставщика или разместит модель на публичном имиджевом борде, единственный оставшийся открытый вопрос — действительно ли она хороша — будет закрыт.
Ценовой ход со стороны Grok. Конкуренция между провайдерами уже породила разброс от $0.02 до $0.06 за номинально одну и ту же модель. Устойчивое снижение сделало бы хостинговый маршрут вариантом по умолчанию для большего числа объёмных диапазонов, чем сейчас.

Пока что-то из этого не выйдет, решающим фактором будет не качество и не цена. Это то, нужна ли вам альфа и готовы ли вы смириться с некоммерческой лицензией, — в этом случае вы скачиваете её и расплачиваетесь железом; или же вам нужно выпускать продукт и вы хотите, чтобы модель запускал кто-то другой, — в этом случае вы платите за каждое изображение и больше никогда не вспоминаете о VAE.

Screenshot of the OrcaRouter catalogue page for the grok/grok-imagine-image endpoint, showing the model listing, the per-request price card, and the OpenAI-compatible code sample.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно