Сгенерированная hero-карточка с заголовком Qwen-Image-2.1 vs Gemini Omni 1.1 Flash, показывающая карточку с надписью Qwen-Image-2.1 со значком фоторамки и шахматной сеткой прозрачности рядом с карточкой с надписью Gemini Omni 1.1 Flash со значком киноленты, с подписью: одна возвращает файл, другая — клип.
Guides & Insights

Qwen-Image-2.1 против Gemini Omni 1.1 Flash: один возвращает PNG, другой — нет

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самое полезное, что стоит знать о Qwen-Image-2.1 и Gemini Omni 1.1 Flash — это то, что они не конкурируют. Попросите Gemini Omni 1.1 Flash создать статичное изображение — и получите ошибку: в собственной документации производителя генерация изображений, редактирование изображений и чередующийся вывод изображения и текста указаны как неподдерживаемые возможности для этой модели. Попросите Qwen-Image-2.1 создать видео — и получите статичное изображение 2048×2048 с альфа-каналом. Любая таблица сравнения, которая ставит их в две колонки, — это сравнение фотоаппарата с проектором. Настоящий вопрос — тот, который действительно стоит денег, — в том, что происходит, когда вы соединяете их в цепочку, и выдерживает ли эта цепочка встречу с тарифной сеткой. Qwen-Image-2.1 стал общедоступным 20 сентября 2026 года; Gemini Omni 1.1 Flash находится в общем доступе с 27 августа 2026 года.

Что физически возвращает каждая модель

Это и есть всё сравнение, а всё остальное следует из него.

Формат вывода — Qwen-Image-2.1 возвращает неподвижное изображение, нативно — до 2048×2048 при 40 шагах инференса, опционально с настоящим альфа-каналом; Gemini Omni 1.1 Flash возвращает видео длительностью до 40 секунд, собранное из 10-секундных вызовов генерации и продления, и вообще не имеет режима неподвижного изображения.
Прозрачность — Qwen-Image-2.1 выполняет денойзинг в 64-канальном латентном пространстве RGBA, поэтому альфа-канал появляется прямо из сэмплера; Gemini Omni 1.1 Flash не поддерживает вывод с прозрачным фоном, и запрос такого вывода завершается ошибкой.
Референсные входные данные — Qwen-Image-2.1 принимает до 10 референсных изображений для композиции с несколькими объектами; Gemini Omni 1.1 Flash принимает до 10 изображений на промпт как *входные данные* и до трёх 3-секундных референсных видеоклипов.
Потолок разрешения — Qwen-Image-2.1 — это нативный 2K; Gemini Omni 1.1 Flash предлагает 360p, 720p, 1080p и 4K, но 1080p и 4K — это апскейлы нативного рендера 720p, а не нативные генерации.
Сколько это стоит — У Qwen-Image-2.1 нет цены за хостинг, потому что нет хостингового эндпоинта, поэтому затраты — это время вашего собственного GPU; Gemini Omni 1.1 Flash тарифицирует $0.10 в секунду при 720p, с черновым тарифом 360p примерно $0.03 в секунду.
Лицензия — Qwen-Image-2.1 поставляется по Qwen Research License Agreement от 20 сентября 2026 года, только для некоммерческого использования; Gemini Omni 1.1 Flash — это коммерческий API, выходные данные которого по умолчанию несут маркировку SynthID и сведения о происхождении C2PA.

Последняя строка — та, которую люди обычно пропускают. С одной стороны — модель, которую можно скачать и нельзя продавать. С другой — модель, которую нельзя скачать, но можно свободно продавать — с невидимым водяным знаком в каждом кадре.

Почему всё равно продолжает появляться подача через «versus»

Поищите два этих названия вместе — и вы найдёте страницы, где их сравнивают лоб в лоб. Причина в том, что лежащий в основе вопрос реален, даже когда формулировка неверна: обе модели находятся в одном и том же творческом конвейере, и обе — самое новое в нём. На самом деле люди пытаются решить, где заканчивается статика и начинается движение.

Gemini Omni 1.1 Flash заслужил своё место в этом вопросе благодаря независимым цифрам, а не данным производителя. В Artificial Analysis он удерживал первое место как в арене текст-в-видео, так и в арене изображение-в-видео в категории без звука по состоянию на 2 сентября 2026 года, с Elo 1324 и 1364. При включённом звуке он опускается до Elo 1237 и 1180 — второе и четвёртое места. Этот разрыв по звуку — как раз та деталь, которую скрывает спецификация и обнажает таблица лидеров.

Доказательная база Qwen-Image-2.1 более скудная и иного рода. Собственный Qwen-Image-Bench производителя ставит его на 60,28, впереди Nano Banana 2.0 с 59,82 и GPT Image 1.5 с 59,65, и первым среди открытых моделей — но это бенчмарк, проводимый производителем, с разрывом менее одного пункта, и это не воспроизведение третьей стороной. Независимое тестирование на данный момент состоит из оценки людьми в GenAI Showdown с результатом 7/15, что выше 4/15 у оригинального Qwen-Image и позади 8/15 у Ideogram 4. На момент написания модель отсутствовала в рейтингах изображений Artificial Analysis. Не низкий балл — а отсутствие балла.

A generated two-column scoreboard titled Qwen-Image-2.1 vs Gemini Omni 1.1 Flash - the scoreboard. Left column Qwen-Image-2.1 rows: Output still image, 2048 x 2048; Transparency native RGBA; Reference input up to 10 images; Resolution native 2K; Price self-hosted only; Licence non-commercial research only. Right column Gemini Omni 1.1 Flash rows: Output video, up to 40 seconds; Transparency none; Reference input 10 images plus 3 clips; Resolution native 720p, upscaled; Price 0.10 dollars per second at 720p; Licence commercial, SynthID and C2PA. Footer: Qwen figures per the vendor model card, unaudited; Gemini figures per Google documentation and Artificial Analysis.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Передача дел, и чего это на самом деле стоит

Если вы создаёте что-то, для чего нужны и статичное изображение, и клип, конвейер работает только в одном направлении: Qwen-Image-2.1 создаёт кадр, Gemini Omni 1.1 Flash анимирует его. Обратного не существует.

Арифметика неумолима, стоит только взяться за подсчёты. 10-секундный клип в 720p на Gemini Omni 1.1 Flash обходится примерно в $1.00. На черновом уровне 360p те же 10 секунд стоят примерно $0.30, а полноценная 40-секундная сцена в 720p — одна генерация плюс три вызова расширения — обходится почти в $4.00. Между тем статичный кадр, с которого всё начинается, не стоит ничего, кроме электричества на вашей собственной видеокарте. А значит, интересное решение по затратам — не «какая модель», а «сколько дублей». Статичный кадр можно бесплатно переделывать сколько угодно; видео — нет. Команды, которые планируют бюджет на генерацию видео из расчёта на ассет, а не на попытку, и оказываются удивлены, потому что первый кадр бесплатен, а повторные попытки — нет.

В передаче тоже есть ловушка качества. Gemini Omni 1.1 Flash рендерит нативно в 720p и апскейлит до 1080p и 4K. Если ваш стоп-кадр — это кадр Qwen-Image-2.1 размером 2048×2048 с чистым альфа-каналом, то подача его в видеотракт, который рендерит в 720p и выполняет апскейл, выбрасывает большую часть того, что дала вам модель изображений, — а альфа-канал отбрасывается полностью, потому что прозрачного видеовыхода не существует. Прозрачность сохраняется в композиторе, а не в цепочке моделей. Планируйте композитинг после возврата клипа, а не до.

Где место слою маршрутизации

Неловкая часть этой связки в том, что ни одна из моделей не доступна так, как, вероятно, доступна остальная часть вашего стека. Gemini Omni 1.1 Flash — это API вендора с собственным ключом и собственным посекундным счётчиком. Qwen-Image-2.1 — это загрузка объёмом примерно 33 ГБ — диффузионный трансформер на 7B плюс текстовый энкодер Qwen3-VL 8B — которую вы обслуживаете самостоятельно, по лицензии, разрешающей только некоммерческое использование. Две модели оплаты, два пути доступа, один проект.

OrcaRouter существует именно для окружающего слоя: одна конечная точка, совместимая с OpenAI, для 200+ моделей, прайс-лист провайдера транслируется без наценки, автоматический фейловер между провайдерами, DSL маршрутизации для компоновки фолбэков и слияние моделей для вызовов в стиле панели. Здесь важно точно понимать, что именно это покрывает. Мы не маршрутизируем ни одну модель Qwen-Image ни одной версии, поэтому Qwen-Image-2.1 — это не маршрут, который можно вызвать на нашей стороне: она работает на вашем оборудовании или не работает вовсе. Мы также не маршрутизируем Gemini Omni 1.1 Flash. Что мы действительно предоставляем на стороне движения — это линейка видео Kling, включая kling-v3, kling-v3-omni и kling-video-o1, плюс MiniMax H3, — так что анимационная половина этого пайплайна имеет хостинговый маршрут, не требующий второго контракта с вендором, а на стороне изображений мы предоставляем семейство OpenAI GPT-Image, уровни Google Imagen 4 и превью изображений Gemini, а также конечную точку изображений xAI Grok Imagine. Поскольку прайс-лист транслируется, а не наценивается, снижение цены вендором на любую из них становится доступно здесь в тот же день.

Какой из них вам на самом деле нужен

Вам нужны ассеты, а не футаж — Qwen-Image-2.1, и причина тому — альфа-канал. Прозрачные вырезы продуктов, иконки, спрайты и слоистые композиты — вот где сэмплер, выдающий RGBA, экономит целый пайплайн матирования.
Вам нужно движение, и нужно, чтобы его можно было измерить — Gemini Omni 1.1 Flash. Это единственная из двух с независимыми результатами арены на вершине таблицы и единственная с опубликованной ценой за секунду, которую можно заложить в прогноз.
Вам нужно и то, и другое — закладывайте бюджет на видеополовину из расчёта за попытку, а не за ассет, и не рассчитывайте, что альфа-канал дойдёт до конца.
Вам нужно продавать результат — Gemini Omni 1.1 Flash, и только Gemini Omni 1.1 Flash, пока Qwen не опубликует коммерческие условия для Qwen-Image-2.1. На сегодня опубликованной цены или документа с условиями для этой лицензии нет.

Честный итог в том, что сравнение, которое их ранжирует, — это не тот артефакт. Что стоит отслеживать дальше — добавит ли Qwen коммерческие условия к Qwen-Image-2.1 и закроет ли Google разрыв по аудио в таблицах лидеров Omni: именно эти два факта, а не очередная таблица результатов, решают, какая половина этого пайплайна получит бюджет.

A screenshot of the Google Gemini API documentation models index, captured September 21 2026, showing the left navigation listing Nano Banana, Veo and Gemini Omni Flash under the models section, and the main panel opening with the Gemini 3 family of stable models.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно