Сгенерированная главная карточка для статьи «Qwen-Image 2.1 вышел тихо», показывающая скруглённую карточку с надписью «Qwen-Image 2.1» и маркером параметров 7B, рядом с двумя меньшими карточками с надписями «PE-T2I» и «PE-I2I», отмеченными 9B, и лентой с надписью «Вышел тихо, но не без анонса».
Engineering & Research

Qwen-Image 2.1 вышел без шума: внутри Qwen/Qwen-Image-2.1-PE-I2I

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

20 сентября 2026 года команда Qwen-Image опубликовала Qwen-Image 2.1 на Hugging Face и ModelScope — веса, файл лицензии, карточку модели и пост в блоге, всё в один и тот же день, почти без предварительной подготовки. Главная цифра — 7 млрд параметров в компоненте визуальной генерации. Часть, которую почти никто ещё не открыл, — это Qwen/Qwen-Image-2.1-PE-I2I, один из двух чекпоинтов переписывания промптов, выпущенных вместе с моделью изображений. Это не модель изображений. Это то, что решает, что означает ваша инструкция, прежде чем модель изображений вообще её увидит, — и в этом релизе именно этот компонент незаметно задаёт язык, на котором возвращается ваш результат.

Что здесь на самом деле означает «тихий релиз»

Qwen-Image 2.1 не утекла, и её не выпустили без анонса. Есть пост в блоге вендора от 20 сентября 2026 года, репозиторий на GitHub с разделом новостей, датированным тем же днём, и доступная загрузка весов. Чего ей недоставало, так это подготовки: единственным предварительным сигналом была заметка от 17 сентября, предлагавшая 50 мест раннего доступа через ModelScope, при этом отобранных тестировщиков просили опубликовать пример или обзор до 29 сентября. Три дня спустя веса стали публичными. Ни презентации, ни эмбарго на бенчмарки, ни пресс-цикла.

Это особый вид релиза, и его стоит назвать точно. Вендор объявил о нём. Вендор не продвигал его. Для всех, кто решает, строить ли на нём, практическое следствие таково: пока нет независимой оценки, на которую можно опереться — есть только собственные материалы вендора и то, что тестировщики с ранним доступом опубликуют за следующую неделю. Считайте, что все заявления о качестве в этой статье исходят из карточки модели и поста в блоге, пока кто-то за пределами Alibaba не запустит её публично.

Почему чекпоинт PE-I2I представляет особый интерес

В выпуске Qwen-Image 2.1 есть три загружаемых компонента, а не один:

Qwen/Qwen-Image-2.1 — сама модель изображений. 32-слойный однопоточный DiT с 7 млрд параметров в компоненте визуальной генерации, текстовый энкодер Qwen3-VL 8B и 64-канальный RGBA VAE с 16-кратным пространственным сжатием. Примерно 33 ГБ на все три компонента.

Qwen/Qwen-Image-2.1-PE-T2I — рерайтер промптов для генерации изображений по тексту. Дообученная Qwen3.5-VL 9B, около 18,8 ГБ.

Qwen/Qwen-Image-2.1-PE-I2I — инструмент для переписывания промптов при редактировании изображения по изображению. Также дообученная Qwen3.5-VL 9B, тоже около 18,8 ГБ, загружена на Hugging Face в 08:46 UTC 20 сентября.

«PE» — это улучшение промпта. Вариант I2I принимает расплывчатую инструкцию по редактированию вместе с одним или несколькими входными изображениями и переписывает её в точную, однозначную директиву редактирования для нижестоящей диффузионной модели. Собственное описание репозитория прямо говорит о форме входных данных: входное изображение всегда присутствует, поэтому это всегда задача редактирования изображения и никогда — преобразование текста в изображение с нуля. Код переписывания лежит в prompt_rewrite/: этот каталог обслуживает оба чекпоинта — --task t2i или --task edit — с путём transformers, путём vLLM, serve.sh плюс client.py для постоянно работающего сервиса и pe_core.py для общей логики.

Вот почему это важнее, чем кажется. Модель изображений понятия не имеет, что вы имели в виду. У неё есть представление о том, что буквально сказано в вашем запросе, взвешенное с поправкой на то, что с этим делает текстовый энкодер. Переписыватель, стоящий перед ней, — это то место, где неоднозначность разрешается — или разрешается неправильно, причём стабильно, во всех изображениях, которые вы генерируете. В унифицированной модели генерации и редактирования с поддержкой до 10 референсных изображений у этого этапа разрешения больше возможностей ошибиться, чем обычно.

Системный промпт — это место, где принимается решение о языке.

Репозиторий PE-I2I поставляет system_prompt.txt вместе с весами, и он необычно прямо говорит об одной вещи: о языке. Если читать его напрямую, рерайтеру предписывается принимать два отдельных решения о языке и не смешивать их.

Язык описания. Текст, который рерайтер пишет для описания правки, соответствует языку инструкции пользователя — инструкция на китайском, описание на китайском; инструкция на английском, описание на английском; инструкция на японском, корейском, французском, тайском или любом другом языке — описание на английском.

Язык отображаемого текста. Текст, который фактически будет нанесён на выходное изображение, заключённый в двойные кавычки, определяется строгим порядком приоритета: во-первых, если пользователь называет точный текст или целевой язык, следуйте этому буквально; во-вторых, если входное изображение уже содержит текст, используйте доминирующий язык этого существующего текста — даже если инструкция написана на другом языке; в-третьих, если в изображении нет текста и язык не назван, используйте язык самой инструкции и, в частности, не принуждайте его к английскому.

Промпт подкрепляет второе правило разобранным примером — изображение, в основном на тайском языке, отредактированное английской инструкцией, в которой язык не называется, должно воспроизводить тайский текст — и добавляет два ограничения: воспроизводимый текст должен быть одноязычным, а не парой китайский/английский, а визуальный жанр «спецификации» или «раскадровки» достигается за счёт макета и типографики и никогда — переключением отображаемых подписей на английский.

Это небольшое инженерное решение с большим радиусом последствий. Если вы генерируете изображения продуктов для рынка, где важен текст на упаковке, разница между «рерайтер сохраняет существующий язык этикетки» и «рерайтер услужливо переводит всё на английский» — это разница между пригодным для использования ассетом и отклонённым. А поскольку это поведение задано в системном промпте, который распространяется в составе репозитория, вы можете прочитать его, сравнить и переопределить — и этого не скажешь о том же шаге внутри закрытой хостинговой модели.

Что подтверждено, а что нет

Точность в определении границы здесь — в этом весь смысл материала о том, что нам известно.

Подтверждено по репозиторию и карточке модели — конфигурация 7B / 32-слойного однопоточного DiT; текстовый энкодер Qwen3-VL 8B; 64-канальный RGBA VAE с 16-кратным пространственным сжатием; блочно-каузальное внимание с каузальной маской на уровне токенов для текста и двунаправленной маской на уровне чанков для генерации изображений; повторное использование префиксного KV-кэша, который, как указано в карточке, активируется, когда в чекпоинте присутствует causal_condition: true (так и есть); flow matching с дискретным планированием Euler; нативный вывод 2K со значением по умолчанию 2048×2048 при 40 шагах инференса; семь задокументированных пресетов соотношения сторон; поддержка до 10 референсных изображений; локальное редактирование с помощью круга, нарисованной аннотации или отдельной маски; а также генерация RGBA, редактирование прозрачных слоёв и извлечение объекта из RGB-фотографий.

Что касается лицензии, это подтвердилось, и вот в чём острый момент — релиз распространяется по лицензии Qwen Research License Agreement от 20 сентября 2026 года, которая предоставляет права «ТОЛЬКО ДЛЯ НЕКОММЕРЧЕСКИХ ЦЕЛЕЙ» и указывает, что коммерческое использование требует отдельной лицензии, запрашиваемой у поставщика. Это существенное изменение по сравнению с прежней линейкой Qwen-Image, которая поставлялась под Apache 2.0. Прочитайте файл лицензии, прежде чем строить на этом продукт, а не после.

Не подтверждено — независимых результатов бенчмарков пока не существует. В публикации блога упоминается сравнительная диаграмма Qwen-Image-Bench, но приведённые в ней числа принадлежат самому производителю и на момент написания не были воспроизведены ни одной третьей стороной. Для Qwen-Image 2.1 нет опубликованной цены на хостинговый эндпоинт и не указаны условия коммерческой лицензии. Также пока нет сведений о том, появится ли вариант с разрешительной лицензией.

Единственная независимая точка данных, которая действительно существует, — это практический обзор раннего доступа от тестировщика, получившего доступ по программе Qwen Ambassador и прогнавшего финальные весовые параметры релиза через интерфейс ModelScope Studio. В этом обзоре сообщалось о времени генерации примерно 10–15 секунд для текст-в-изображение и 18–23 секунд для редактирования, о сильной производительности на пресетах положения камеры и назначении ролей для нескольких персонажей, а также об одном конкретном режиме отказа, о котором стоит знать: согласованность при нескольких референсах ухудшалась примерно начиная с трёх входных изображений, при этом размещение бокового хвоста схлопывалось в центральный хвост при профильных углах. Это один рецензент, в интерфейсе раннего доступа, без отображаемого таймера. Это полезный сигнал. Это не бенчмарк.

A generated single-column spec scoreboard titled 'Qwen-Image 2.1 — the scoreboard' listing rows: Generation component 7B, 32-layer single-stream DiT; Text encoder Qwen3-VL 8B; Licence Qwen Research License, non-commercial only; Native output 2048 x 2048 at 40 steps; Reference images up to 10; Transparency native RGBA; Independent score none yet. Footer reads 'Figures per the Qwen vendor model card, unaudited; no third-party reproduction at the time of writing.'

Поддержка фреймворков с первого дня — и это тихая хорошая новость

То, где модель оказывается в день запуска, говорит о том, сможете ли вы реально ею пользоваться, больше, чем карточка модели, — а Qwen-Image 2.1 оказалась широко доступна:

DiffusersQwenImage21Pipeline был смёржен в первый же день, а репозиторий модели содержит тег diffusers:QwenImage21Pipeline.

ComfyUI — нативная поддержка с первого дня с шаблонами рабочих процессов для генерации изображений по тексту и редактирования изображений, а также отдельный репозиторий весов, совместимый с Comfy.

vLLM-Omni — пошаговое выполнение, префиксное KV-кэширование, декодирование с CUDA Graph, квантование FP8 и тензорный параллелизм/Ulysses.

SGLang — пул-реквест с нативной поддержкой появился 17 сентября, за три дня до выхода весов; он охватывает DiT, RGBA VAE, кондиционирование Qwen3-VL, несколько референсных изображений, а также ввод/вывод RGBA и проверен на H200, B200, RTX PRO 6000, RTX 5090 и RTX 4090.

LightX2V — ускорение в день выхода, а также AMD Radeon через ROCm и поддержка нескольких чипов через FlagOS.

Предрелизный пул-реквест SGLang — это говорящая деталь. Поддержка фреймворка, которая появляется раньше самих весов, означает, что путь сервинга тестировался на чекпоинте, а не был написан по карточке модели задним числом. Для 7B-компонента, рядом с которым находится 17,5-ГБ текстовый энкодер, это разница между выходными, потраченными на як-шейвинг, и одним днём.

Для GPU с ограниченными ресурсами карточка модели рекомендует выгрузку на CPU — pipe.enable_model_cpu_offload() — что является стандартным обходным путём, а не исправлением. В загрузке объёмом 33 ГБ основную часть занимает текстовый энкодер, а не DiT; сам диффузионный трансформер — меньшая половина пакета, примерно 14 ГБ.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

Практическое прочтение

Если вы хотите попробовать Qwen-Image 2.1 сегодня, честная позиция такова: вы можете, локально, по исследовательской лицензии, без независимых бенчмарков и без коммерческих прав. Это разумный компромисс для оценки и плохой для производственного конвейера, и разрыв между этими двумя как раз и определяется файлом лицензии.

Для команд, которые тестируют модели генерации изображений и не хотят привязывать продакшен-путь к чекпоинту, устаревшему на несколько дней, именно слой маршрутизации позволяет локализовать этот риск. OrcaRouter предоставляет доступ к более чем 200 моделям через одну конечную точку, совместимую с OpenAI, по прейскурантной цене провайдеров без наценки, с автоматическим переключением между провайдерами при сбоях, так что непроверенная модель может стоять за маршрутом рядом с моделью, которой вы уже доверяете, а не заменять её — и поскольку прейскурантная цена передаётся как есть, снижение цены вендором на любую маршрутизируемую модель вступает в силу в тот же день, не дожидаясь изменения договора. На момент написания Qwen-Image 2.1 не входит в число моделей, которые мы маршрутизируем, и эта статья не собирается утверждать обратное. Что мы действительно маршрутизируем, так это окружающую линейку для работы с изображениями — семейство GPT-Image от OpenAI, уровни Imagen 4 и предпросмотры генерации изображений Gemini от Google, а также конечную точку генерации изображений Grok Imagine от xAI — именно оттуда и появился бы путь отказоустойчивости, пока вы оцениваете новичка на собственном оборудовании.

Открытый вопрос — тот, на который репозиторий не может ответить. Alibaba выпустила 7B-модель изображений с открытыми весами под лицензией только для исследовательских целей — в том же году, когда выпустила Qwen-Image 3.0 как закрытую хостируемую модель вообще без весов. Два релиза, две противоположные ставки, с разницей в четыре месяца. Какой из этих двух вариантов определит облик следующей модели изображений Qwen — и превратится ли когда-нибудь исследовательская лицензия в нечто, что сможет использовать бизнес, — вот за чем стоит следить. Веса уже доступны на Hugging Face, и любой может сам прочитать файл лицензии.

A screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured September 20 2026, showing the Like and Follow counts, the tags Text-to-Image, Diffusers, Safetensors, QwenImage21Pipeline, rgba, the qwen-research licence, 7B params, BF16 tensor type, and the notice that the model is not deployed by any inference provider.