Главная карточка для Qwen-Image-2.1-Turbo, ускоренного чекпоинта Qwen-Image-2.1 с 8 шагами, показывающая расписание из 8 шагов, сохранённое вместе с весами, CFG 1 по умолчанию, переиспользование префиксного KV-кэша и неизменённую Qwen Research Licence
Engineering & Research

Qwen-Image-2.1-Turbo: 8-шаговый чекпоинт, который перенёс расписание в веса

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Репозиторий для Qwen-Image-2.1-Turbo появился на Hugging Face 9 октября 2026 года, и самое интересное в нём — не количество шагов. Там есть веса bfloat16, карточка модели с исполняемым кодом, файл лицензии, восемь демонстрационных изображений и одна строка в списке новостей проекта Qwen-Image-2.1 на GitHub, объявляющая о выпуске. У него нет собственного поста в блоге, нет таблицы бенчмарков, нет пресс-цикла, и никаких изменений в условиях, на которых распространяется Qwen-Image-2.1. Turbo — это ускоренный чекпойнт Qwen-Image-2.1 для генерации изображений по тексту и редактирования изображений, который работает за восемь шагов денойзинга, а не за сорок, которые используются в собственных примерах базовой модели. Он также незаметно меняет то, откуда берётся расписание сэмплирования, — и именно эта часть сломает код.

Что на самом деле находится в репозитории

Карточка короткая и необычно конкретная, что позволяет легко отделить подтверждённое от подразумеваемого.

• Что это: карточка описывает Qwen-Image-2.1-Turbo как «ускоренный чекпоинт Qwen-Image-2.1 для генерации изображений по тексту и редактирования изображений с 8 шагами денойзинга». Это не новая архитектура и не новое семейство моделей. Это тот же 7B-компонент визуальной генерации, переупакованный вокруг гораздо более короткой траектории сэмплирования.

• Как это загружается: через QwenImage21Pipeline в Diffusers — тот же класс пайплайна, который использует базовая модель, только с заменённым именем чекпоинта. Собственные метаданные репозитория объявляют base_model: Qwen/Qwen-Image-2.1 и library_name: diffusers, а также содержат base_model:finetune:Qwen/Qwen-Image-2.1 в качестве второго тега. То есть поставщик описывает это как дообучение базового чекпоинта, а не как родственный чекпоинт.

• Что сохраняется: та же архитектура визуальной генерации 7B, те же семь пресетов разрешения, что и в Qwen-Image-2.1 (квадрат 2048 × 2048, 4:3 при 2400 × 1792, 3:4 при 1792 × 2400, 3:2 при 2528 × 1696, 2:3 при 1696 × 2528, 16:9 при 2752 × 1536 и 9:16 при 1536 × 2752), и те же две возможности — генерация изображений по текстовому описанию и редактирование изображений по инструкции. Витрина карточки организована по категориям: портретная фотография, человеческие позы и движение, генерация прозрачных RGBA, типографика и дизайн постеров, UI и информационная вёрстка, преобразование одного изображения, композиция по нескольким референсам и композиция интерьера из четырёх изображений.

• Чего в ней нет: никаких оценок. На карточке нет оценки Qwen-Image-Bench для чекпоинта Turbo, и нет сравнения с базовой моделью. Единственная оценка где-либо в линейке Qwen-Image-2.1 остаётся собственным результатом базовой модели в Qwen-Image-Bench — это заявленный производителем показатель, измеренный на базовом чекпоинте, а не на этом.

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1-Turbo, captured in English, showing the Text-to-Image, Diffusers, Safetensors and QwenImage21Pipeline tags, 25 likes, the qwen-research licence label, and the introduction text describing it as an accelerated checkpoint of Qwen-Image-2.1 for text-to-image generation and image editing with 8 denoising steps that loads directly with QwenImage21Pipeline in Diffusers

Расписание теперь живёт в весах, и это и есть настоящее изменение.

Вот предложение, которое важнее всего на карточке, и оно скрыто под инструкциями по установке: чекпойнт «включает своё рекомендованное расписание сэмплирования, поэтому он готов к использованию без ручной настройки планировщика».

Затем следствие, прямо изложенное в разделе о сэмплировании: «Рекомендуемое 8-шаговое расписание сэмплирования сохраняется вместе с чекпоинтом и загружается автоматически. Установка одного лишь num_inference_steps не переопределяет его».

Перечитайте это дважды. Согласно привычному для большинства представлению о Diffusers, количество шагов — это аргумент, передаваемый при вызове: вы передаёте num_inference_steps=40 для базовой модели, num_inference_steps=4 для дистиллированного чекпоинта, и пайплайн строит соответствующее расписание. Qwen-Image-2.1-Turbo нарушает это правило. Расписание из восьми шагов — это метаданные чекпоинта, а не параметр запроса. Можно передать другое целое число, и пайплайн всё равно будет использовать сохранённое расписание. В карточке сказано, что единственный способ переопределить его — передать явный аргумент sigmas при вызове, и добавляется, что другие расписания «не оценивались для этого чекпоинта».

Практический итог — ловушка воспроизведения. Код, скопированный из карточки модели Qwen-Image-2.1 и нацеленный на репозиторий Turbo, запустится, не выдаст ошибку и не даст тех результатов, которые показывает витрина Turbo. Ему также понадобится сборка Diffusers, поддерживающая сигмы сэмплирования, задаваемые конфигурацией пайплайна, — поддержка добавлена в Diffusers PR #14950; на момент написания она присутствует в дереве исходного кода, а не в тегированном релизе. Указанная установка — это CUDA-совместимая сборка PyTorch плюс git+https://github.com/huggingface/diffusers.git, transformers>=5.17.0, accelerate и pillow.

Ещё два значения по умолчанию задаёт сама карточка, а не что-либо из настроенного вами: генерация по умолчанию использует CFG 1, а префиксное KV-кэширование «переиспользует контекст текста и референсного изображения на протяжении шагов денойзинга». CFG 1 означает отсутствие прохода classifier-free guidance, и во многом именно за счёт этого траектория сокращается без коллапса — а ещё поэтому карточка не утруждает себя рекомендацией по guidance scale. Префиксный KV-кэш — это наследство базовой модели: тот же механизм, который Qwen-Image-2.1 использует для переиспользования контекста текста и референсного изображения, и он значит больше, а не меньше, когда цикл денойзинга состоит всего из восьми итераций.

Анонсировано в списке изменений, предоставлено в виде репозитория

Формулировка, подходящая этому релизу, — не «запуск» и не «утечка». Это зафиксированный артефакт со строкой с датой в списке новостей. Список новостей GitHub для проекта Qwen-Image-2.1 содержит две записи от 2026.10.09: одну о чекпоинте Turbo и одну, в которой отмечается, что API Qwen-Image-2.1 Pro и Turbo «теперь официально доступны» в Alibaba Cloud Model Studio. Отдельного поста в блоге о Turbo нет; ссылка на блог на карточке ведёт на блог Qwen-Image-2.1 от 20 сентября 2026 года.

Сравните это с тем, как базовая модель появилась тремя неделями ранее. В списке новостей Qwen-Image-2.1 есть датированная запись о весах, а затем ещё пять в тот же день: поддержка Diffusers с первого дня через PR #14804, нативная поддержка ComfyUI с первого дня, поддержка vLLM-Omni с пошаговым выполнением, префиксным кэшированием KV, квантованием FP8 и тензорным параллелизмом, поддержка SGLang с Cache-DiT и CUDA-графами, а также ускорение с первого дня от LightX2V. У чекпоинта Turbo ничего этого нет. Каждая из этих записей об экосистеме относится к Qwen-Image-2.1.

Screenshot of the GitHub repository page for QwenLM/Qwen-Image-2.1, captured in English, showing the file listing with the README and LICENSE and the most recent commit message reading 'docs: announce Qwen-Image-2.1-Turbo and API availability' committed 27 minutes ago

Счётчики репозитория рассказывают одну и ту же историю о зрелости, а не о заслугах, и они — снимок, а не приговор: на момент написания Qwen-Image-2.1 показывает 122 311 загрузок за последний месяц и 3 142 лайка, тогда как Qwen-Image-2.1-Turbo — которому всего несколько часов — показывает 33 лайка. Загрузки — запаздывающий показатель, и число у Turbo изменится. Сегодня это говорит лишь о том, что никто ещё не успел его запустить.

О чём вам не рассказывают восемь шагов

Число шагов — это главная новость и наименее полезное число в релизе, по трём причинам, которые стоит прямо назвать.

• Шаги — это не секунды. Ни карточка, ни репозиторий не публикуют данные о пропускной способности, задержке или памяти для чекпоинта Turbo. Восемь шагов при 2048 × 2048 на модели 7B в формате bfloat16 — это совсем иная нагрузка, чем восемь шагов на меньшей модели, а в карточке не указано, на каком оборудовании проводились измерения, потому что она вообще не сообщает никаких результатов измерений.

• Пока не существует никакого ориентира по качеству.Для Turbo нет опубликованной оценки, нет прямого сравнения с базовым чекпоинтом и нет независимой оценки ни того, ни другого. Изображения в витрине — это отобранные поставщиком результаты при рекомендованных поставщиком настройках. Они свидетельствуют о том, что модель создаёт изображения; они не свидетельствуют о том, сколько качества было принесено в жертву ради сокращения числа шагов, и они не заменяют бенчмарк.

• Указания по работе с памятью отсутствуют. Карточка базовой модели включает раздел об оптимизации памяти; карточка Turbo описывает установку, генерацию, редактирование, сэмплирование, соотношения сторон и стоп-условия. Если вы планируете это обслуживать, планируйте измерения.

Summary card for Qwen-Image-2.1-Turbo with two columns: the left column headed 'Stated in the repository' listing 8 denoising steps, schedule saved with the checkpoint, CFG 1 by default, prefix KV caching across steps, the same seven resolution presets and the Qwen Research Licence; the right column headed 'Not stated anywhere' listing no quality score for this checkpoint, no speed or memory figure and no day-zero framework support

Лицензия не изменилась, и это главная новость для всех, кто выпускает продукт.

Qwen-Image-2.1-Turbo лицензируется в соответствии с Qwen Research License Agreement. В метаданных репозитория указано license: other с license_name: qwen-research и license_link: LICENSE, а в репозитории вместе с весами присутствует файл LICENSE. В разделе лицензии самой карточки сказано одно предложение: модель лицензируется в соответствии с Qwen Research License Agreement.

Ускорение ничего в этом не меняет. Лицензия на некоммерческое исследование для базовой модели не становится коммерческой лицензией только потому, что чекпойнт быстрее, а репозиторий Turbo — это отдельная загрузка на тех же условиях. Если ваш интерес к генерации за восемь шагов вызван тем, что она делает модель достаточно дешёвой для использования в продукте, ограничением является лицензия, а не число шагов. С этим вопросом нужно обращаться к поставщику; нигде в этом репозитории на него не дан ответ.

Размещённый путь, и где в нём находится OrcaRouter

OrcaRouter не маршрутизирует Qwen-Image-2.1-Turbo и не маршрутизирует Qwen-Image-2.1. Ни того, ни другого нет в нашем каталоге, и ничто в этой статье не следует воспринимать как предложение предоставлять их. Если вам нужен любой из них, доступные пути — это собственные API вендора и несколько сторонних платформ либо сами веса со сборкой Diffusers, достаточно новой, чтобы загрузить сохранённое расписание чекпойнта Turbo.

Что мы выводим на первый план — это линейка хостируемых изображений, и стоит знать, что в неё входит, чтобы вы могли сравнить её с экспериментом на собственном хостинге. OrcaRouter объединяет более 200 моделей за одним OpenAI-совместимым эндпоинтом по прайсовой цене провайдера без наценки — поэтому, когда поставщик снижает цену, снижение действует на нашей стороне в тот же день, а не после ожидания пересчёта цен. Он добавляет автоматическое переключение при деградации провайдера, DSL маршрутизации для указания, какие модели и провайдеры может использовать запрос, и слияние моделей для объединения нескольких моделей в один вызов. Модели изображений, которые мы маршрутизируем, — это семейство OpenAI GPT-Image, уровни Google Imagen 4, включая варианты fast и ultra, эндпоинты предпросмотра изображений Google Gemini и эндпоинт изображений xAI Grok Imagine.

Честная суть решения такова: если вам нужна восьмишаговая 7B-модель с открытыми весами, которую можно изучать и изменять, то Turbo — это работа по самостоятельному хостингу, и первым делом нужно решить вопрос с лицензией. Если вам нужен эндпоинт для изображений в продакшене уже на этой неделе, это другая покупка, и именно её мы и продаём.

Что можно сказать, а что нельзя

• Подтверждено самим репозиторием: ускоренный чекпоинт Qwen-Image-2.1 на 7B, который выполняет генерацию текст-в-изображение и редактирование изображений за восемь шагов денойзинга; сохранённое расписание сэмплирования, которое не переопределяется параметром num_inference_steps; CFG 1 по умолчанию; префиксное KV-кэширование для текстового контекста и контекста референсного изображения; те же семь предустановок разрешения, что и у базовой модели; путь загрузки QwenImage21Pipeline; датированная 9 октября 2026 года запись о выпуске в собственном списке новостей проекта; и то же Qwen Research License Agreement, что и у базовой модели.

• Нигде не установлено: никаких измерений качества для чекпоинта Turbo, никаких измерений скорости или памяти, никакой независимой оценки базового чекпоинта, из которого он получен, никаких заявлений о коммерческих условиях помимо исследовательской лицензии и никакой поддержки фреймворков с первого дня, аналогичной той, что была при выпуске Qwen-Image-2.1.

Восемь шагов — это число, которое будут называть. Расписание, перешедшее в веса, — это деталь, которая определяет, воспроизведёт ли ваш первый запуск хоть что-нибудь.