
Qwen-Image 2.1 вышел без шума: внутри Qwen/Qwen-Image-2.1-PE-I2I
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
20 сентября 2026 года команда Qwen-Image опубликовала Qwen-Image 2.1 на Hugging Face и ModelScope — веса, файл лицензии, карточку модели и пост в блоге, всё в один и тот же день, почти без предварительной подготовки. Главная цифра — 7 млрд параметров в компоненте визуальной генерации. Часть, которую почти никто ещё не открыл, — это Qwen/Qwen-Image-2.1-PE-I2I, один из двух чекпоинтов переписывания промптов, выпущенных вместе с моделью изображений. Это не модель изображений. Это то, что решает, что означает ваша инструкция, прежде чем модель изображений вообще её увидит, — и в этом релизе именно этот компонент незаметно задаёт язык, на котором возвращается ваш результат.
Что здесь на самом деле означает «тихий релиз»
Qwen-Image 2.1 не утекла, и её не выпустили без анонса. Есть пост в блоге вендора от 20 сентября 2026 года, репозиторий на GitHub с разделом новостей, датированным тем же днём, и доступная загрузка весов. Чего ей недоставало, так это подготовки: единственным предварительным сигналом была заметка от 17 сентября, предлагавшая 50 мест раннего доступа через ModelScope, при этом отобранных тестировщиков просили опубликовать пример или обзор до 29 сентября. Три дня спустя веса стали публичными. Ни презентации, ни эмбарго на бенчмарки, ни пресс-цикла.
Это особый вид релиза, и его стоит назвать точно. Вендор объявил о нём. Вендор не продвигал его. Для всех, кто решает, строить ли на нём, практическое следствие таково: пока нет независимой оценки, на которую можно опереться — есть только собственные материалы вендора и то, что тестировщики с ранним доступом опубликуют за следующую неделю. Считайте, что все заявления о качестве в этой статье исходят из карточки модели и поста в блоге, пока кто-то за пределами Alibaba не запустит её публично.
Почему чекпоинт PE-I2I представляет особый интерес
В выпуске Qwen-Image 2.1 есть три загружаемых компонента, а не один:
• Qwen/Qwen-Image-2.1 — сама модель изображений. 32-слойный однопоточный DiT с 7 млрд параметров в компоненте визуальной генерации, текстовый энкодер Qwen3-VL 8B и 64-канальный RGBA VAE с 16-кратным пространственным сжатием. Примерно 33 ГБ на все три компонента.
• Qwen/Qwen-Image-2.1-PE-T2I — рерайтер промптов для генерации изображений по тексту. Дообученная Qwen3.5-VL 9B, около 18,8 ГБ.
• Qwen/Qwen-Image-2.1-PE-I2I — инструмент для переписывания промптов при редактировании изображения по изображению. Также дообученная Qwen3.5-VL 9B, тоже около 18,8 ГБ, загружена на Hugging Face в 08:46 UTC 20 сентября.
«PE» — это улучшение промпта. Вариант I2I принимает расплывчатую инструкцию по редактированию вместе с одним или несколькими входными изображениями и переписывает её в точную, однозначную директиву редактирования для нижестоящей диффузионной модели. Собственное описание репозитория прямо говорит о форме входных данных: входное изображение всегда присутствует, поэтому это всегда задача редактирования изображения и никогда — преобразование текста в изображение с нуля. Код переписывания лежит в prompt_rewrite/: этот каталог обслуживает оба чекпоинта — --task t2i или --task edit — с путём transformers, путём vLLM, serve.sh плюс client.py для постоянно работающего сервиса и pe_core.py для общей логики.
Вот почему это важнее, чем кажется. Модель изображений понятия не имеет, что вы имели в виду. У неё есть представление о том, что буквально сказано в вашем запросе, взвешенное с поправкой на то, что с этим делает текстовый энкодер. Переписыватель, стоящий перед ней, — это то место, где неоднозначность разрешается — или разрешается неправильно, причём стабильно, во всех изображениях, которые вы генерируете. В унифицированной модели генерации и редактирования с поддержкой до 10 референсных изображений у этого этапа разрешения больше возможностей ошибиться, чем обычно.
Системный промпт — это место, где принимается решение о языке.
Репозиторий PE-I2I поставляет system_prompt.txt вместе с весами, и он необычно прямо говорит об одной вещи: о языке. Если читать его напрямую, рерайтеру предписывается принимать два отдельных решения о языке и не смешивать их.
• Язык описания. Текст, который рерайтер пишет для описания правки, соответствует языку инструкции пользователя — инструкция на китайском, описание на китайском; инструкция на английском, описание на английском; инструкция на японском, корейском, французском, тайском или любом другом языке — описание на английском.
• Язык отображаемого текста. Текст, который фактически будет нанесён на выходное изображение, заключённый в двойные кавычки, определяется строгим порядком приоритета: во-первых, если пользователь называет точный текст или целевой язык, следуйте этому буквально; во-вторых, если входное изображение уже содержит текст, используйте доминирующий язык этого существующего текста — даже если инструкция написана на другом языке; в-третьих, если в изображении нет текста и язык не назван, используйте язык самой инструкции и, в частности, не принуждайте его к английскому.
Промпт подкрепляет второе правило разобранным примером — изображение, в основном на тайском языке, отредактированное английской инструкцией, в которой язык не называется, должно воспроизводить тайский текст — и добавляет два ограничения: воспроизводимый текст должен быть одноязычным, а не парой китайский/английский, а визуальный жанр «спецификации» или «раскадровки» достигается за счёт макета и типографики и никогда — переключением отображаемых подписей на английский.
Это небольшое инженерное решение с большим радиусом последствий. Если вы генерируете изображения продуктов для рынка, где важен текст на упаковке, разница между «рерайтер сохраняет существующий язык этикетки» и «рерайтер услужливо переводит всё на английский» — это разница между пригодным для использования ассетом и отклонённым. А поскольку это поведение задано в системном промпте, который распространяется в составе репозитория, вы можете прочитать его, сравнить и переопределить — и этого не скажешь о том же шаге внутри закрытой хостинговой модели.
Что подтверждено, а что нет
Точность в определении границы здесь — в этом весь смысл материала о том, что нам известно.
• Подтверждено по репозиторию и карточке модели — конфигурация 7B / 32-слойного однопоточного DiT; текстовый энкодер Qwen3-VL 8B; 64-канальный RGBA VAE с 16-кратным пространственным сжатием; блочно-каузальное внимание с каузальной маской на уровне токенов для текста и двунаправленной маской на уровне чанков для генерации изображений; повторное использование префиксного KV-кэша, который, как указано в карточке, активируется, когда в чекпоинте присутствует causal_condition: true (так и есть); flow matching с дискретным планированием Euler; нативный вывод 2K со значением по умолчанию 2048×2048 при 40 шагах инференса; семь задокументированных пресетов соотношения сторон; поддержка до 10 референсных изображений; локальное редактирование с помощью круга, нарисованной аннотации или отдельной маски; а также генерация RGBA, редактирование прозрачных слоёв и извлечение объекта из RGB-фотографий.
• Что касается лицензии, это подтвердилось, и вот в чём острый момент — релиз распространяется по лицензии Qwen Research License Agreement от 20 сентября 2026 года, которая предоставляет права «ТОЛЬКО ДЛЯ НЕКОММЕРЧЕСКИХ ЦЕЛЕЙ» и указывает, что коммерческое использование требует отдельной лицензии, запрашиваемой у поставщика. Это существенное изменение по сравнению с прежней линейкой Qwen-Image, которая поставлялась под Apache 2.0. Прочитайте файл лицензии, прежде чем строить на этом продукт, а не после.
• Не подтверждено — независимых результатов бенчмарков пока не существует. В публикации блога упоминается сравнительная диаграмма Qwen-Image-Bench, но приведённые в ней числа принадлежат самому производителю и на момент написания не были воспроизведены ни одной третьей стороной. Для Qwen-Image 2.1 нет опубликованной цены на хостинговый эндпоинт и не указаны условия коммерческой лицензии. Также пока нет сведений о том, появится ли вариант с разрешительной лицензией.
Единственная независимая точка данных, которая действительно существует, — это практический обзор раннего доступа от тестировщика, получившего доступ по программе Qwen Ambassador и прогнавшего финальные весовые параметры релиза через интерфейс ModelScope Studio. В этом обзоре сообщалось о времени генерации примерно 10–15 секунд для текст-в-изображение и 18–23 секунд для редактирования, о сильной производительности на пресетах положения камеры и назначении ролей для нескольких персонажей, а также об одном конкретном режиме отказа, о котором стоит знать: согласованность при нескольких референсах ухудшалась примерно начиная с трёх входных изображений, при этом размещение бокового хвоста схлопывалось в центральный хвост при профильных углах. Это один рецензент, в интерфейсе раннего доступа, без отображаемого таймера. Это полезный сигнал. Это не бенчмарк.

Поддержка фреймворков с первого дня — и это тихая хорошая новость
То, где модель оказывается в день запуска, говорит о том, сможете ли вы реально ею пользоваться, больше, чем карточка модели, — а Qwen-Image 2.1 оказалась широко доступна:
• Diffusers — QwenImage21Pipeline был смёржен в первый же день, а репозиторий модели содержит тег diffusers:QwenImage21Pipeline.
• ComfyUI — нативная поддержка с первого дня с шаблонами рабочих процессов для генерации изображений по тексту и редактирования изображений, а также отдельный репозиторий весов, совместимый с Comfy.
• vLLM-Omni — пошаговое выполнение, префиксное KV-кэширование, декодирование с CUDA Graph, квантование FP8 и тензорный параллелизм/Ulysses.
• SGLang — пул-реквест с нативной поддержкой появился 17 сентября, за три дня до выхода весов; он охватывает DiT, RGBA VAE, кондиционирование Qwen3-VL, несколько референсных изображений, а также ввод/вывод RGBA и проверен на H200, B200, RTX PRO 6000, RTX 5090 и RTX 4090.
• LightX2V — ускорение в день выхода, а также AMD Radeon через ROCm и поддержка нескольких чипов через FlagOS.
Предрелизный пул-реквест SGLang — это говорящая деталь. Поддержка фреймворка, которая появляется раньше самих весов, означает, что путь сервинга тестировался на чекпоинте, а не был написан по карточке модели задним числом. Для 7B-компонента, рядом с которым находится 17,5-ГБ текстовый энкодер, это разница между выходными, потраченными на як-шейвинг, и одним днём.
Для GPU с ограниченными ресурсами карточка модели рекомендует выгрузку на CPU — pipe.enable_model_cpu_offload() — что является стандартным обходным путём, а не исправлением. В загрузке объёмом 33 ГБ основную часть занимает текстовый энкодер, а не DiT; сам диффузионный трансформер — меньшая половина пакета, примерно 14 ГБ.

Практическое прочтение
Если вы хотите попробовать Qwen-Image 2.1 сегодня, честная позиция такова: вы можете, локально, по исследовательской лицензии, без независимых бенчмарков и без коммерческих прав. Это разумный компромисс для оценки и плохой для производственного конвейера, и разрыв между этими двумя как раз и определяется файлом лицензии.
Для команд, которые тестируют модели генерации изображений и не хотят привязывать продакшен-путь к чекпоинту, устаревшему на несколько дней, именно слой маршрутизации позволяет локализовать этот риск. OrcaRouter предоставляет доступ к более чем 200 моделям через одну конечную точку, совместимую с OpenAI, по прейскурантной цене провайдеров без наценки, с автоматическим переключением между провайдерами при сбоях, так что непроверенная модель может стоять за маршрутом рядом с моделью, которой вы уже доверяете, а не заменять её — и поскольку прейскурантная цена передаётся как есть, снижение цены вендором на любую маршрутизируемую модель вступает в силу в тот же день, не дожидаясь изменения договора. На момент написания Qwen-Image 2.1 не входит в число моделей, которые мы маршрутизируем, и эта статья не собирается утверждать обратное. Что мы действительно маршрутизируем, так это окружающую линейку для работы с изображениями — семейство GPT-Image от OpenAI, уровни Imagen 4 и предпросмотры генерации изображений Gemini от Google, а также конечную точку генерации изображений Grok Imagine от xAI — именно оттуда и появился бы путь отказоустойчивости, пока вы оцениваете новичка на собственном оборудовании.
Открытый вопрос — тот, на который репозиторий не может ответить. Alibaba выпустила 7B-модель изображений с открытыми весами под лицензией только для исследовательских целей — в том же году, когда выпустила Qwen-Image 3.0 как закрытую хостируемую модель вообще без весов. Два релиза, две противоположные ставки, с разницей в четыре месяца. Какой из этих двух вариантов определит облик следующей модели изображений Qwen — и превратится ли когда-нибудь исследовательская лицензия в нечто, что сможет использовать бизнес, — вот за чем стоит следить. Веса уже доступны на Hugging Face, и любой может сам прочитать файл лицензии.

