Карточка-герой с надписью «Qwen-Image-2.1 vs GPT Image 2» и подзаголовком «Скачайте бесплатно или арендуйте лучший по рейтингу» и тремя строками: Qwen-Image-2.1 — скачивание 33 ГБ, некоммерческое; GPT Image 2 — только API, оплата за токен; прозрачность — RGBA VAE против параметра запроса, рядом со стрелкой загрузки и значком счётчика.
Guides & Insights

Qwen-Image-2.1 против GPT Image 2: скачать бесплатно или арендовать лучшую?

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen-Image-2.1 — это загрузка на 33 ГБ, которую можно запускать бесплатно, но нельзя продавать. GPT Image 2 — это API, который вообще нельзя скачать: оплата по токенам, четыре месяца в продакшене и первое место в независимых рейтингах генерации изображений. Эти два факта и составляют весь компромисс, а самое интересное в том, что функция прозрачности — то, ради чего на Qwen-Image-2.1 вообще стоит взглянуть, — появилась в обеих системах с разницей в месяц, причём совершенно разными путями. Qwen-Image-2.1 вышла 20 сентября 2026 года с альфа-каналом, встроенным в её латентное пространство. GPT Image 2 получил background: "transparent" в качестве флага API 20 августа 2026 года.

Два пути к одной и той же функции

Прозрачный вывод — вот почему большинство людей в итоге начинают сравнивать эти два варианта, так что начните именно с этого, потому что реализации не эквивалентны, и разница значит больше, чем сам вывод.

Прозрачность в Qwen-Image-2.1 заложена на уровне архитектуры. 64-канальный RGBA VAE с 16-кратным пространственным сжатием означает, что альфа-канал является частью латентного пространства, в котором модель удаляет шум. Тот же механизм обеспечивает генерацию с прозрачностью, редактирование внутри изображения, которое уже имеет прозрачность, без его уплощения, а также извлечение объекта из обычной RGB-фотографии, возвращающее альфа-канал, а не бинарную маску. Это одна возможность с тремя применениями, и сам вендор формулирует это так: не требуется отдельный узел удаления фона, модель матирования или проход очистки краёв.

Прозрачность в GPT Image 2 — это параметр запроса. Добавление background: "transparent" вместе с output_format: "png" возвращает изображение с настоящим альфа-каналом, и это работает при генерации изображения по текстовому описанию, при редактировании изображений и в инструменте генерации изображений в Responses API. Инпейнтинг на основе маски и прозрачный фон можно комбинировать. Функция вышла в Preview, поэтому, согласно собственным рекомендациям OpenAI, результаты могут быть нестабильными, — а редактирование с прозрачностью описывается как перерисовка или удаление фона, а не точное вырезание по контуру. Как минимум два второстепенных источника утверждают, что этот параметр недоступен и что GPT Image 2 вообще не выдаёт прозрачность; это противоречит материалам анонса, зеркалам документации API и сторонним тестам, поэтому их следует считать устаревшими или ошибочными, а не сигналом об обратном. Прозрачность не меняет стоимость в токенах — при заданном качестве и размере прозрачное и непрозрачное изображение расходуют одинаковое количество токенов изображения.

Итак, оба дают альфу. Один делает это потому, что модель была так устроена; другой — потому что параметр запрашивает её у сервиса. Что лучше, полностью зависит от того, должна ли альфа пережить цикл редактирования, и это можно проверить за полдня.

Что вам даёт стартовое преимущество GPT Image 2

Четыре месяца в продакшене — это не маркетинговый аргумент, а разрыв в зрелости, и он проявляется в местах, которые скучны и при этом имеют решающее значение.

Независимое положение — GPT Image 2 находится на вершине независимых рейтингов генерации изображений и держится там достаточно долго, чтобы это можно было считать устойчивым утверждением, а не всплеском недели запуска. Qwen-Image-2.1 в этих рейтингах на момент написания не было вовсе.
Задокументированные режимы отказов — у модели, находящейся в открытом доступе четыре месяца, есть множество известных случаев отказов, о которых можно прочитать до того, как вы с ними столкнётесь. У модели, вышедшей вчера, есть оценочная карточка вендора и один интеграционный тест.
Эксплуатационные возможности — многоуровневые лимиты скорости, выраженные и в токенах в минуту, и в изображениях в минуту (от 100 000 TPM и 5 IPM на начальном уровне до 8 000 000 TPM и 250 IPM на верхнем), плюс поддержка batch-эндпоинтов. Это разница между демо и очередью, размер которой можно планировать.
Показатели качества от третьей стороны — позиция в рейтинге измерена независимо. Единственная цифра Qwen-Image-2.1 — это собственная диаграмма Qwen-Image-Bench от вендора, где указано 60,28 против 59,82 у Nano Banana 2.0 и 59,65 у GPT Image 1.5. Материал вендора, не воспроизведён.

Единственная по-настоящему независимая точка данных о Qwen-Image-2.1 — это функциональная проверка, опубликованная вместе с интеграцией SGLang: вывод прозрачных PNG прошёл проверку, альфа-канал сохранялся во всём диапазоне 0–255, RGBA PSNR составил 60,69 дБ на одном образце, а конфигурации FP8 прошли генерацию прозрачных PNG. Авторы SGLang прямо говорят, что это проверка корректности, а не общая гарантия качества. Это самое сильное из имеющихся свидетельств того, что альфа-канал реален. Оно ничего не говорит о том, хороши ли изображения.

Законопроект, проработанный

GPT Image 2 тарифицируется по токенам, что означает, что стоимость актива зависит от уровня качества и разрешения таким образом, что цена за изображение это скрывает. Опубликованные тарифы: 5,00 долларов за миллион входных текстовых токенов, 8,00 долларов за миллион входных токенов изображений и 30,00 долларов за миллион выходных токенов изображений, при этом тарифы для кэшированных данных составляют 1,25 и 2,00 долларов соответственно. OpenAI не публикует статическую таблицу выходных токенов для этой модели — более старая таблица, охватывающая количество токенов для уровней Low, Medium и High, явно помечена как не относящаяся к GPT Image 2 — поэтому приведённые ниже цифры — это сторонние измерения тарифов для соотношения сторон 1:1, текст-в-изображение:

Вывод 1K — низкое качество $0.0059, среднее $0.053, высокое $0.211 за изображение.
Вывод 2K — низкое $0.012, среднее $0.107, высокое $0.428.
Вывод 4K — низкое $0.020, среднее $0.178, высокое $0.712.

Разрыв между низким и высоким качеством при одном и том же разрешении составляет примерно тридцать пять раз. Именно это и есть реальное решение внутри пайплайна GPT Image 2: не то, какую модель выбрать, а то, какой уровень качества пройдёт проверку при наименьших затратах. И это взаимодействует с редактированием так, что многих застаёт врасплох: input_fidelityнельзя настроить в этой модели, поскольку она автоматически обрабатывает любое входное изображение с высокой точностью, поэтому запрос на редактирование с референсными изображениями расходует больше токенов входных изображений, чем можно предположить исходя из размера выходного результата. Поэтому циклы «генерация — проверка — редактирование» здесь обходятся дороже, чем предполагают показатели на одно изображение.

С другой стороны, предельная стоимость одного изображения у Qwen-Image-2.1 — это электроэнергия. Загвоздка в фиксированных затратах и лицензии. Тридцать три гигабайта для загрузки, DiT примерно на 14 ГБ, а остальное уходит на текстовый энкодер Qwen3-VL 8B, на видеокартах с ограниченными ресурсами рекомендуется выгрузка на CPU, и всё это под лицензионным соглашением Qwen Research License Agreement от 20 сентября 2026 года — только для некоммерческого использования, коммерческие права предоставляются по отдельной договорённости, а опубликованных цен или условий для них нет.

A two-column board for Qwen-Image-2.1 and GPT Image 2 carrying both sides on one line per dimension: Weights, Licence, Transparency, Quality evidence, Pricing and Maturity. Footer separates vendor-reported figures from independently verified ones and notes that per-image API cost moves with quality tier and resolution.

Где находится хостинговый вариант

Есть срединный путь, который обходит и вопрос с GPU, и вопрос с лицензией, и именно его на практике выбирает большинство команд. OrcaRouter маршрутизирует семейство GPT-Image от OpenAI наряду с уровнями Imagen 4 от Google, предпросмотрами изображений Gemini и эндпоинтом генерации изображений Grok Imagine от xAI — более 200 моделей за одним эндпоинтом, совместимым с OpenAI, цена из прайс-листа провайдера передаётся без наценки, автоматическое переключение при сбое между провайдерами, DSL для маршрутизации и объединение моделей. Поскольку цена из прайс-листа передаётся без наценки, а не с ней, снижение цены вендором на любую маршрутизируемую модель вступает в силу в тот же день, а поскольку переключение при сбое происходит автоматически, неудачный день у одного провайдера не превращается в ваш простой. Qwen-Image-2.1 не входит в число моделей, которые мы маршрутизируем, как и любая другая версия Qwen-Image — это предложение только для локального запуска — так что это не реклама новичка. Это честный ответ на вопрос «что использовать, пока я оцениваю новичка».

Decision card titled 'The tiebreak' with two panels: 'Download it - Qwen-Image-2.1', free to run and non-commercial with alpha that is part of the latent space, and 'Rent it - GPT Image 2', independently ranked with a per-image cost from about $0.006 to $0.71 depending on tier and resolution.

Решение, изложенное без обиняков

Выбирайте GPT Image 2, если результат коммерческий, если вам нужен независимо измеренный минимальный уровень качества, если вы хотите прогнозировать и ограничивать затраты на каждый ассет или если вам нужно, чтобы всё заработало на этой неделе без покупки оборудования. Примите, что вы арендуете, что не можете дообучить её, что не можете запускать её офлайн и что стоимость за изображение линейно растёт с объёмом — и так будет всегда.

Выберите Qwen-Image-2.1, если результат — это исследование, оценка или личная работа; если вам особенно нужна альфа, которая выдерживает цикл редактирования, а не альфа, которую параметр создал один раз; если вы хотите прочитать логику переписывания — поставляемые чекпоинты PE-T2I и PE-I2I представляют собой дообученные модели Qwen3.5-VL 9B с читаемым system_prompt.txt, что больше, чем вы получите от любого облачного API для изображений, — или если вы просто хотите узнать, на что способна 7B-модель изображений с открытыми весами в сентябре 2026 года, не платя за каждую картинку, чтобы это выяснить.

Не выбирайте ни то, ни другое, а передайте это дальше, если поставляемый результат коммерческий, а срок реален. Это не отговорка; это вариант, который не требует от вас решать вопрос лицензии, на который вы пока не можете получить ответ.

Screenshot of the OrcaRouter catalogue page for the openai/gpt-image-2 model, showing the model listing, the $8.00 per 1M token input and $30.00 per 1M token output pricing cards, and the LM Arena image-edit Elo figure quoted in the model description.