Hero-карточка, сравнивающая Qwen-Image-2.1-Turbo с Qwen-Image-2.1: 8 шагов удаления шума против 40, идентичная архитектура DiT 7B с 32 слоями, те же семь предустановок разрешения, та же некоммерческая лицензия Qwen Research Licence и сохранённое расписание сэмплирования, которое не переопределяется параметром num_inference_steps
Engineering & Research

Qwen-Image-2.1-Turbo vs Qwen-Image-2.1: что на самом деле изменилось между базовым чекпоинтом и ускоренной версией

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Тот же компонент визуальной генерации на 7B. Те же 32 однопоточных слоя DiT. Те же семь предустановок разрешения, та же единая поверхность генерации и редактирования, та же некоммерческая лицензия, тот же класс пайплайна для его загрузки. Qwen-Image-2.1-Turbo и Qwen-Image-2.1 — это не две модели, между которыми вы выбираете по возможностям: Turbo-чекпоинт — это файнтюн базовой модели, и репозиторий говорит об этом в собственных метаданных. Их разделяет одна траектория сэмплирования и способ хранения этой траектории. Одна выполняет сорок шагов. Другая — восемь и отказывается слушать иные указания во время вызова. Всё интересное об этой паре заключено во втором предложении.

Начните с частей, которые идентичны

Прежде чем перейти к различиям, стоит очертить сходство, потому что оно обширнее, чем предполагает ярлык «Turbo», и именно оно делает замену привлекательной.

• Архитектура. В карточке Turbo указано, что она «использует ту же 7B-архитектуру визуальной генерации», что и Qwen-Image-2.1. В проекте этот компонент описывается как 7B параметров, распределённых по 32 слоям Single-Stream DiT. Ничто в репозитории Turbo не заявляет об уменьшенном, прореженном или переработанном бэкбоне.

• Возможности.Оба чекпоинта описываются как выполняющие генерацию изображений по текстовому описанию и редактирование изображений. Turbo наследует возможности базовой модели, а не повторяет их: в карточке базовой модели описаны нативная прозрачность RGBA, до 10 референсных изображений и локальные правки, задаваемые кругами, нарисованными аннотациями или отдельными масками, с сохранением идентичности людей и продуктов.

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured in English, showing the Qwen organisation, 3.14k likes, the Text-to-image (diffusers), Diffusers, Safetensors and QwenImage21Pipeline tags, and the introduction text stating that Qwen-Image-2.1 is a unified text-to-image generation and image editing model with 7B parameters in its visual generation component and 32 Single-Stream DiT layers

• Разрешения.В карточке Turbo сказано «использовать те же пресеты разрешения, что и в Qwen-Image-2.1», а затем они перечислены: 1:1 при 2048 × 2048, 4:3 при 2400 × 1792, 3:4 при 1792 × 2400, 3:2 при 2528 × 1696, 2:3 при 1696 × 2528, 16:9 при 2752 × 1536 и 9:16 при 1536 × 2752. В карточке базовой модели указана идентичная таблица. В обеих карточках в примерах используется уровень разрешения 2048.

• Путь загрузки. Оба загружаются через QwenImage21Pipeline в Diffusers. Быстрый старт карточки Turbo — это быстрый старт базовой карточки с изменённым именем чекпоинта и bfloat16, записанным как dtype вместо torch_dtype.

• Бумаги.Обе распространяются по лицензии Qwen-Image-2.1 Research License Agreement, обе имеют license: other с license_name: qwen-research, и в обеих в репозитории рядом с весами лежит файл LICENSE.

Если Qwen-Image-2.1 у вас уже подключён, то объём миграции действительно невелик. Именно поэтому на том единственном аргументе, который ведёт себя не так, как вы ожидаете, стоит остановиться подробнее.

Расписание переместилось из вашего кода в контрольную точку.

На базовой модели количество шагов задаёте вы. В примере текст-в-изображение из карточки Qwen-Image-2.1, в примере редактирования и в примере прозрачности RGBA везде передаётся num_inference_steps=40, и это число — аргумент времени вызова, как обычно в Diffusers. Ничто на этой карточке не говорит о том, что у чекпоинта есть собственное мнение о расписании.

В Turbo расписание — это метаданные чекпойнта. В карточке сказано, что чекпойнт «включает рекомендуемое расписание сэмплирования, поэтому он готов к использованию без ручной настройки планировщика», а затем в разделе о сэмплировании подробно объясняется, что это означает на практике: «Рекомендуемое 8-шаговое расписание сэмплирования сохраняется вместе с чекпойнтом и загружается автоматически. Одна лишь установка num_inference_steps не переопределяет его».

Отсюда следуют две вещи, и в обеих легко ошибиться, причём в противоположных направлениях.

Первое: восемь — это не значение по умолчанию, которое можно увеличивать. Если вы хотите узнать, как Turbo выглядит на двенадцати или двадцати шагах, карточка сообщает, что единственный путь — явно указать аргумент sigmas во время вызова, — а затем закрывает дверь для эксперимента, отмечая, что другие расписания «не были оценены для этого чекпоинта». Это вендор говорит вам, что восьмишаговая конфигурация — та, за которую он отвечает, а всё остальное — неисследованная территория, в которую вы входите в одиночку. Это необычно честная фраза, и её следует читать как границу, а не как приглашение.

Второй — это ловушка воспроизведения, не сопровождаемая сообщением об ошибке. Возьмите пример базовой модели, измените строку репозитория на контрольную точку Turbo, оставьте num_inference_steps=40 на месте — и код запустится. Он не предупредит вас. Он создаст изображение, используя сохранённое расписание из восьми шагов, и это будет не тот результат, который показывает демонстрация Turbo, потому что сорок так и не было прочитано. Это тот режим отказа, когда ничто не выглядит сломанным — рендеринг завершается, изображение выглядит правдоподобно, и единственный способ узнать — начать искать разницу. Рядом с этим скрыта вторая зависимость: контрольной точке нужна сборка Diffusers, которая понимает сигмы сэмплирования, настроенные через пайплайн, добавленные в PR #14950, которая на момент написания находится в дереве исходников Diffusers, а не в помеченном релизе. Указанная установка — это сборка PyTorch, совместимая с CUDA, плюс исходники Diffusers, transformers>=5.17.0, accelerate и pillow.

Что оплачивает 32 шага, которые вы не сделали

В карточке названы два механизма, и оба заслуживают внимания, потому что объясняют, что Turbo checkpoint предполагает относительно того, как вы будете его вызывать.

• CFG 1 по умолчанию.«Генерация по умолчанию использует CFG=1.» При масштабе classifier-free guidance, равном единице, модель не выполняет второй, безусловный проход, который обычно требуется для CFG, — и это во многом объясняет, почему траектория укорачивается, а не просто усекается. Это также означает, что привычка базовой модели настраивать масштаб guidance не переносится: настраивать нечего, и карточка не предлагает рекомендаций по guidance, к которым можно было бы подстроиться.

• Кэширование префиксного KV. В карточке Turbo сказано: «кэширование префиксного KV повторно использует контекст текста и опорного изображения на всех шагах денойзинга». Это унаследованный механизм, а не что-то новое для ускоренного чекпойнта: в анонсе Qwen-Image-2.1 повторное использование префиксного KV-кэша названо одним из четырёх главных улучшений базовой модели, наряду со вниманием смешанной гранулярности, а интеграции для обслуживания базовой модели, появившиеся в день релиза — записи vLLM-Omni и SGLang в списке новостей проекта — прямо указывают кэширование префиксного KV среди поддерживаемых возможностей. В цикле из сорока шагов такое повторное использование — это оптимизация. В цикле из восьми шагов оно значит пропорционально больше, потому что каждый закэшированный шаг составляет бо́льшую долю от общего объёма работы.

Карточка не называет ни одного метода дистилляции. Карточка базовой модели Qwen-Image-2.1 и README проекта описывают архитектуру и возможности; карточка Turbo описывает механику. Если вы пытаетесь рассуждать о том, чего стоят восемь шагов с точки зрения качества, репозиторий не даёт никакого метода для рассуждений — только расписание и набор демонстрационных изображений.

Количество шагов — это не показатель

Это та часть сравнения, где честный ответ заключается в том, что никакого сравнения нет, и стоит прямо сказать, почему.

• У чекпоинта Turbo нет опубликованной оценки. В его карточке нет ни одного числового показателя оценки. Нет результатов Qwen-Image-Bench для Turbo, нет сравнения бок о бок с базовым чекпоинтом, нет абляции по количеству шагов и нет таблицы, показывающей, где качество выходит на плато.

• Оценка базового чекпоинта указана по данным вендора. Единственная ключевая цифра линейки Qwen-Image-2.1 — это результат Qwen-Image-Bench самой базовой модели, который вендор приводит для базового чекпоинта. Это не измерение чекпоинта Turbo, и её не следует переносить на него — ускорение как раз и есть то, что, как следовало бы ожидать, повлияет на такой показатель, а вендор не сообщил, насколько именно.

• Ни одна из карточек не сообщает ни о времени, ни о памяти. Ни для одного из чекпойнтов нет ни показателей задержки, ни пропускной способности, ни объёма потребляемой памяти, и ни одна из карточек не указывает оборудование, на котором выполнялись её примеры. Карточка базовой модели хотя бы содержит раздел об оптимизации памяти; карточка Turbo описывает установку, генерацию, редактирование, сэмплирование и соотношения сторон — и на этом всё.

Итак, довод в пользу Turbo по сравнению с базовым чекпоинтом сейчас — это довод о замысле разработки, а не об измеренных результатах. Восемь шагов при той же архитектуре и том же уровне разрешения 2048 должны обходиться существенно дешевле в расчёте на одно изображение. «Существенно» в этом предложении несёт реальную смысловую нагрузку, и единственный способ заменить его числом — прогнать оба чекпоинта на вашей собственной рабочей нагрузке, что также является единственным способом выяснить, что сокращённая траектория делает с конкретными изображениями, которые вам важны.

Больше ничего не двигалось, включая лицензию.

Две вещи, которые читатель мог бы разумно ожидать изменившимися, но которые не изменились.

Первое — это экосистема. Когда Qwen-Image-2.1 вышел 20 сентября 2026 года, в новостном списке проекта в тот же день было зафиксировано пять отдельных интеграций с поддержкой в день выхода: поддержка Diffusers через PR #14804, нативная поддержка ComfyUI с опубликованными шаблонами рабочих процессов для преобразования текста в изображение и редактирования, поддержка vLLM-Omni с пошаговым выполнением, декодированием через CUDA Graph, квантованием FP8 и тензорным параллелизмом, поддержка SGLang с Cache-DiT и выгрузкой компонентов, а также ускорение от проекта LightX2V. Запись от 9 октября 2026 года, посвящённая Qwen-Image-2.1-Turbo, фиксирует сам чекпойнт и примечание о том, что API Pro и Turbo доступны в Alibaba Cloud Model Studio. Для Turbo нет списка фреймворков с поддержкой в день выхода, и каждая запись о фреймворке в новостном списке по-прежнему относится к базовой модели. Чекпойнт Turbo загружается через уже существовавший класс конвейера; поддержка его сохранённого расписания — единственный новый элемент, и она появляется в исходном коде Diffusers, а не в тегированном релизе.

Второе — это лицензия. Turbo распространяется по Лицензионному соглашению Qwen Research License Agreement — точно так же, как и базовая модель. Ускорение не сопровождалось коммерческим исключением, отдельным уровнем или смягчением условий — некоммерческое ограничение распространяется на файнтюн в той же мере, как и на базовую модель. Собственные метаданные репозитория и файл лицензии рядом с весами служат доказательством; раздел лицензии в карточке — это одно предложение, указывающее на то же соглашение. Если восемь шагов важны для вас потому, что это делает модель достаточно дешёвой для включения в продукт, лицензия стоит прямо на пути, и отвечать за это должен поставщик — а не этот репозиторий.

Хостируемые эндпоинты и где вписывается OrcaRouter

OrcaRouter не маршрутизирует ни Qwen-Image-2.1-Turbo, ни Qwen-Image-2.1. Оба отсутствуют в нашем каталоге, и ничто здесь не является предложением обслуживать любой из них. Если они вам нужны, ваши маршруты — это собственные хостируемые API вендора, несколько сторонних платформ или веса с достаточно свежей сборкой Diffusers, чтобы обработать сохранённое расписание сэмплирования чекпоинта Turbo.

Роль OrcaRouter в этом конкретном сравнении проявляется в тот момент, когда самостоятельный хостинг чекпоинта перестаёт быть правильным решением. Переход от модели с открытыми весами, которую вы запускаете сами, к хостинговому эндпоинту изображений — это не просто смена модели, это смена характера отказов. Локальный процесс отказывает так, что это видно; хостинговый эндпоинт отказывает так, что это зависит от того, какой провайдер ответил, и от того, что происходит, когда один из них деградирует посреди запроса. OrcaRouter ставит более 200 моделей за единый эндпоинт, совместимый с OpenAI, и транслирует прайс-листовую цену провайдера без наценки, поэтому снижение цены поставщиком отражается на нашей стороне в тот же день, а не ждёт пересмотра цен. Вдобавок к этому он добавляет автоматическое переключение при сбое между провайдерами, DSL маршрутизации для указания, какие модели и провайдеры может использовать запрос, и слияние моделей для объединения нескольких моделей в один вызов. Из моделей изображений мы обслуживаем семейство OpenAI GPT-Image, уровни Google Imagen 4, включая варианты fast и ultra, эндпоинты предварительного просмотра изображений Google Gemini и эндпоинт изображений xAI Grok Imagine.

Конкретно: если вы выбираете между двумя чекпоинтами Qwen, это решение о самостоятельном хостинге, и причины предпочесть один другому — это поведение расписания и количество шагов. Если же вам на самом деле нужно изображение в продакшене, не владея GPU, то это то решение, с которым мы можем помочь, и это другое решение.

Краткая версия

• Выберите Qwen-Image-2.1, если вам нужен чекпойнт, поведение сэмплирования которого соответствует его документации, если требуется менять количество шагов или изучать расписания, или если вам нужен релиз, получивший поддержку с первого дня в Diffusers, ComfyUI, vLLM-Omni, SGLang и LightX2V.

• Выберите Qwen-Image-2.1-Turbo, если вам нужны та же архитектура и те же возможности при значительно более короткой траектории, и вы готовы считать восемь шагов фиксированными, а также установить Diffusers из исходного кода, чтобы загрузить её.

Checklist card headed 'Identical across both checkpoints' listing the 7B visual generation component, 32 single-stream DiT layers, seven resolution presets, text-to-image and image editing, the QwenImage21Pipeline load path, and the non-commercial Qwen Research Licence, with a chip reading 'The only differences are the sampling schedule and the step count'

• Лицензия в любом случае будет одна и та же, и не ждите, что для ускоренного чекпоинта опубликуют цифры качества, чтобы сравнить его с базовым. Сокращение числа шагов — вещь реальная и задокументированная. А вот сколько качества изображения это стоит — не задокументировано нигде, и никакое чтение двух карточек вам этого не скажет — ответ существует только на вашем собственном железе, на ваших собственных промптах.