
Qwen-Image 2.1 vs LLaDA-Image-Turbo: две открытые имидж-модели, две очень разные лицензии
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Две модели изображений с открытыми весами вышли в течение одних и тех же трёх недель. Команда Qwen-Image опубликовала Qwen-Image 2.1 20 сентября 2026 года — веса, файл лицензии, карточку модели и пост в блоге, всё в один день, практически без предварительной подготовки. Шестнадцатью днями ранее, 4 сентября 2026 года, inclusionAI (исследовательская лаборатория Ant Group) опубликовала LLaDA-Image-Turbo без анонсирующего поста, без пресс-релиза и без каких-либо объявлений. Обе сегодня доступны для скачивания. Ни у одной нет ни единой независимой оценки в бенчмарках. И разница, которая на самом деле решит, какую из них вы сможете использовать, не в карточке ни одной из моделей — она в документах. Qwen-Image 2.1 распространяется по исследовательской лицензии, которая прямо запрещает коммерческое использование. LLaDA-Image-Turbo поставляется вообще без лицензии, заявленной хоть в одном из её репозиториев.
Вопрос о лицензии стоит первым, потому что только на него есть однозначный ответ.
Начните здесь, потому что всё остальное в этом сравнении предварительно, а это — нет.
• Qwen-Image 2.1 выпускается по лицензионному соглашению Qwen Research License Agreement от 20 сентября 2026 года, которое предоставляет права «ТОЛЬКО ДЛЯ НЕКОММЕРЧЕСКИХ ЦЕЛЕЙ» и устанавливает, что для коммерческого использования требуется отдельная лицензия, запрашиваемая у поставщика. Это существенное изменение по сравнению с предыдущей линейкой Qwen-Image, которая поставлялась под Apache 2.0. Здесь всё однозначно: вы можете читать её, оценивать, тестировать её производительность и писать о ней. Вы не можете включить её в продукт.
• LLaDA-Image-Turboвообще не заявляет никакой лицензии. Ни разрешительной, ни ограничительной, ни даже заглушки. Репозиторий без лицензии не является «свободным для использования» ни в каком юридическом смысле — по умолчанию в нём действует режим «все права защищены», а это более строгая позиция, чем исследовательская лицензия Qwen, а не более мягкая. Если вы планируете на нём что-то строить, это вопрос к лаборатории, а не к README.
Об этой иронии стоит сказать прямо: модель, появившаяся с официальной, ограничительной лицензией, — это та, с учётом которой вы можете строить планы сегодня, потому что вы точно знаете, на чём стоите. Модель без лицензии — это та, с учётом которой вы этого сделать не можете.

Что на самом деле представляют собой эти две модели
Отбросьте лицензирование, и это два действительно разных дизайна, созданных по разным причинам.
• Архитектура — Qwen-Image 2.1 представляет собой 32-слойный однопоточный диффузионный трансформатор с 7 млрд параметров в компоненте визуальной генерации, текстовый энкодер Qwen3-VL 8B и 64-канальный RGBA VAE с 16-кратным пространственным сжатием, примерно 33 ГБ в составе всего пакета. LLaDA-Image-Turbo — это унифицированная модель генерации и редактирования на 6 млрд параметров: один набор весов выполняет обе задачи, а не базовая модель плюс отдельный путь редактирования.
• Шаги инференса — Qwen-Image 2.1 по умолчанию использует 2048×2048 при 40 шагах с flow matching и дискретным планированием Euler. LLaDA-Image-Turbo дистиллирована с помощью Twin-DMD до 2–4 шагов, рекомендуется 4, и работает при guidance scale 1.0, тогда как у модели Base — 5.0.
• Параметры точности — Qwen-Image 2.1 предоставляет поддержку квантования FP8 через свой путь vLLM-Omni. LLaDA-Image-Turbo поставляется с чекпоинтами BF16 и FP8 в виде отдельных загрузок.
• Управление по референсам — Qwen-Image 2.1 принимает до 10 референсных изображений, поддерживает локальные правки с помощью обводки, нарисованной аннотации или отдельной маски и генерирует нативный RGBA с редактированием прозрачного слоя. В карточке LLaDA-Image-Turbo не указано ограничение на количество референсных изображений.
• Внимание — Qwen-Image 2.1 использует блочно-каузальное внимание: причинную маску на уровне токенов для текста и двунаправленную маску на уровне чанков для генерации изображений, с повторным использованием префиксного KV-кэша, когда контрольная точка содержит causal_condition: true. В карточке LLaDA-Image-Turbo схема маскирования не описана столь же подробно.
• Лицензия — только для исследований и явная, в отличие от необъявленной.
Обратите внимание, что означают значения числа шагов вместе со значениями числа параметров. Qwen-Image 2.1 — это более крупная модель, для которой выполняется в десять раз больше шагов; LLaDA-Image-Turbo — это меньшая модель, дистиллированная до нескольких шагов. Это противоположные ставки на то, где заключена стоимость генерации изображений, и правильный ответ полностью зависит от того, что является вашим узким местом: GPU-секунды на изображение или потолок того, как изображение может выглядеть.
Экономика скорости: 40 шагов против 4
Название Turbo здесь не для красного словца. Дистилляция Twin-DMD сворачивает диффузионную траекторию в несколько крупных скачков — именно поэтому LLaDA-Image-Turbo можно запускать за 4 шага, тогда как его Base-модель требует обычного расписания. При guidance 1.0 он вдобавок пропускает classifier-free guidance, что обычно удваивает число прямых проходов на шаг, — так что фактический разрыв шире, чем можно предположить по одному лишь соотношению 40 против 4.
Что это вам даёт — это пропускную способность и предсказуемость. Модель на 6B при четырёх шагах — как раз то, что помещается на одну потребительскую видеокарту и выдаёт черновое изображение достаточно быстро, чтобы уложиться в интерактивный цикл. Qwen-Image 2.1 при 40 шагах и разрешении 2048×2048 — это конфигурация, ориентированная в первую очередь на качество; собственная рекомендация карточки модели для оборудования с ограничениями — выгрузка на CPU через pipe.enable_model_cpu_offload(), что является скорее запасным выходом, чем решением.
Противовес в том, что дистилляция — это сжатие возможностей, и здесь ничего не измерялось никем за пределами двух лабораторий. Единственная независимая точка данных, существующая для любой из моделей, — это практический обзор раннего доступа Qwen-Image 2.1 от тестировщика в программе Qwen Ambassador, который прогнал финальные веса через интерфейс ModelScope Studio и сообщил примерно 10–15 секунд для текст-в-изображение и 18–23 секунды для редактирования. Это один рецензент, на интерфейсе раннего доступа, без отображения таймера — полезный сигнал, а не бенчмарк. У LLaDA-Image-Turbo вообще нет сопоставимого практического отчёта в открытом доступе.

Именно в редактировании два дизайна расходятся сильнее всего
Обе модели выполняют генерацию изображений по тексту и редактирование, но приходят к этому по-разному, и разница проявляется скорее во внутреннем устройстве, чем в результате.
Qwen-Image 2.1 рассматривает следование инструкциям как отдельный, поддающийся проверке компонент. Вместе с моделью изображений в релиз включены два чекпойнта для переписывания промптов — Qwen/Qwen-Image-2.1-PE-T2I и Qwen/Qwen-Image-2.1-PE-I2I, каждый из которых представляет собой дообученную Qwen3.5-VL 9B размером около 18,8 ГБ, — они берут расплывчатую инструкцию и переписывают её в однозначную директиву, прежде чем её увидит диффузионная модель. У варианта I2I всегда есть входное изображение, поэтому это всегда задача редактирования и никогда — генерация с нуля. Что особенно важно, средство переписывания поставляется с system_prompt.txt, который вы можете прочитать и переопределить, и он необычайно чётко говорит о языке: язык описания следует за вашей инструкцией, тогда как язык текста, наносимого на изображение, определяется строгим порядком приоритетов, который сохраняет существующий язык надписей входного изображения, даже если вы задаёте промпт на другом языке.
Это небольшое инженерное решение с большим радиусом поражения. Если вы создаёте изображения продуктов для рынка, где текст на упаковке имеет значение, «рерайтер сохраняет язык существующих этикеток» и «рерайтер услужливо переводит всё на английский» — это разница между пригодным активом и отклонённым — и, поскольку оно находится в системном промпте, а не внутри размещённого чёрного ящика, вы можете сравнить его версии и изменить его.
LLaDA-Image-Turbo идёт на противоположный компромисс: одна 6B-модель, один набор весов, генерация и редактирование совместно используют всё. Меньше движущихся частей, меньше настроек, и нечего инспектировать или переопределять. В его карточке указаны показатели Qwen-Image-Bench — 53,53 для английского и 53,38 для китайского — с заявлением о SOTA среди open-source: со слов производителя, без независимого воспроизведения; и обратите внимание, что бенчмарк, в котором он побеждает, назван в честь модели, с которой он неявно конкурирует.
То, на чём вы бы их на самом деле запускали
Поддержка экосистемы в день запуска — наименее гламурная часть релиза, но именно она решает, потратите вы полдня или выходные.
• Qwen-Image 2.1 вышел широко: QwenImage21Pipeline влился в Diffusers в день выхода; нативная поддержка ComfyUI с шаблонами рабочих процессов для генерации изображений по тексту и редактирования изображений; vLLM-Omni с пошаговым выполнением, кэшированием префиксов KV, декодированием с CUDA Graph, квантизацией FP8 и тензорным параллелизмом/Ulysses; pull request с нативной поддержкой SGLang, принятый 17 сентября — за три дня до появления весов — охватывающий DiT, RGBA VAE, кондиционирование Qwen3-VL и вход с несколькими референсами, проверенный на H200, B200, RTX PRO 6000, RTX 5090 и RTX 4090; и ускорение в день выхода через LightX2V с AMD Radeon через ROCm и поддержкой нескольких чипов через FlagOS.
• LLaDA-Image-Turboполучил поддержку ComfyUI 7 сентября 2026 года, через три дня после появления весов, а также дистрибутив для Diffusers и Safetensors. Это реальный путь к его запуску, но он менее проработан, и нет аналогичной предрелизной работы по обслуживанию, на которую можно было бы указать.
Предрелизный pull request SGLang — это верный признак Qwen-Image 2.1. Поддержка фреймворка, появившаяся до весов, означает, что кто-то тестировал путь обслуживания на контрольной точке, а не писал его по карточке модели уже после.

Размещённый путь, который вы храните рядом с экспериментом
Ни одна из этих моделей не маршрутизируется через OrcaRouter на момент написания, и эта статья не собирается подразумевать обратное — обе предполагают самостоятельный хостинг: одна под лицензией, исключающей использование в продакшене, а другая вообще без лицензии. Для команды, оценивающей их, важно то, что оценка не обязана находиться на критическом пути.
OrcaRouter открывает доступ к более чем 200 моделям через единый эндпоинт, совместимый с OpenAI, по каталожной цене провайдера без наценки, с автоматическим переключением между провайдерами при сбоях и DSL-маршрутизацией, позволяющей объединять несколько моделей в один вызов. Практическая форма этого для данного решения — маршрут, в котором модель, которой вы уже доверяете, обслуживает продакшн-трафик, а самостоятельно размещённый чекпойнт тестируется рядом с ней, — и поскольку каталожная цена передаётся как есть, без наценки, изменение цены вендором для любой маршрутизируемой модели становится актуальным на нашей стороне в тот же день, а не после ожидания поправки к договору. Модели изображений, которые мы маршрутизируем сегодня, — это семейство GPT-Image от OpenAI, уровни Imagen 4 и предварительные версии генерации изображений Gemini от Google, а также эндпоинт изображений Grok Imagine от xAI. Если вы собираетесь потратить неделю на развёртывание 33-гигабайтного диффузионного трансформера, чтобы выяснить, превосходит ли он размещённую модель, размещённая модель — это контрольная группа, и стоит того, чтобы контрольная группа уже была доступна по ключу.
Что бы изменило это сравнение?
Три вещи, в порядке того, насколько они были бы важны.
Во-первых, независимая оценка в бенчмарке для любой из моделей. Ни у одной из них её нет, и пока это не изменится, любые заявления о качестве с обеих сторон — это лаборатория, которая проверяет собственную домашнюю работу. Во-вторых, лицензия: вариант Qwen-Image 2.1 с разрешительной лицензией сделал бы её очевидным выбором по умолчанию для открытой работы с изображениями на 7B, а хоть какая-нибудь заявленная лицензия на LLaDA-Image-Turbo хотя бы позволила бы планировать её использование. В-третьих, тестировщиков раннего доступа из программы Qwen на ModelScope от 17 сентября попросили опубликовать образцы или обзоры к 29 сентября — через восемь дней. Именно тогда это перестанет быть сравнением двух карточек моделей и станет настоящим сравнением. До тех пор честная сводка такова: Qwen-Image 2.1 — более способная на вид модель, которую нельзя коммерциализировать, LLaDA-Image-Turbo — более быстрая, которую вообще нельзя использовать без разговора, а файл лицензии — единственная часть любого из этих релизов, которая полностью определена.
