Сгенерированная hero-карточка для статьи с заголовком «SGLang-Diffusion обслуживает Qwen-Image-2.1» и подзаголовком «Day-zero serving, измерено», на которой три скруглённые карточки с подписями «Текст в изображение», «Редактирование нескольких изображений» и «Вывод RGBA» расположены над полосой задержки со значениями 2,75 с на генерацию и 3,36 с на редактирование, а также подписью «1024 x 1024, 40 шагов, один B200».
Engineering & Research

SGLang-Diffusion обслуживает Qwen-Image-2.1 в день релиза: генерации за 2,75 с на одном B200

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Qwen-Image-2.1 стал общедоступным 20 сентября 2026 года, и у команды SGLang-Diffusion уже был готов путь для его обслуживания. Поддержка с первого дня охватывает три задачи, которые выполняет модель, — генерацию изображений по тексту, редактирование нескольких изображений и вывод в прозрачном RGBA, — и сопровождается кое-чем более редким, чем смерженный pull request: измеренной задержкой на конкретно указанном оборудовании, опубликованной вместе с конфигурацией, которая её дала. На одном NVIDIA B200, 1024×1024 при 40 шагах, показатели SGLang составляют 2,748 секунды для генерации и 3,358 секунды для редактирования. Сопутствующий pull request, sgl-project/sglang#39983, был открыт 17 сентября — за три дня до того, как веса стали доступны для скачивания, — и именно поэтому эти числа вообще существуют, а не обещаны на потом.

Что означает «day zero» в данном случае и почему самое интересное — это выбор времени

Поддержка во фреймворке обычно анонсируется одновременно с релизом модели, а поставляется лишь спустя недели. В случае SGLang всё происходит наоборот. Реализация была написана под ещё не опубликованный чекпоинт, что заставляет авторов иметь дело с реальной архитектурой, а не со спецификацией: диффузионный трансформер, 64-канальный RGBA VAE, обусловливание Qwen3-VL, ввод с несколькими референсными изображениями и RGBA на входе и выходе.

Именно поэтому таблице задержек стоит доверять больше, чем списку возможностей. У модели, которую ни разу не обслуживали, нет измеренных чисел, а число, которое приводится вместе с указанием оборудования, разрешения, числа шагов и точности, может проверить любой, у кого такая же карта. Показатели SGLang помечены как конкретная конфигурация, а не как общее утверждение о модели.

Остальной инструментарий вышел в тот же период. ComfyUI выпустила нативную поддержку, Diffusers провёл слияние QwenImage21Pipeline, vLLM-Omni добавил пошаговое выполнение и квантование FP8, а LightX2V добавил ускорение с поддержкой AMD Radeon через ROCm. Фреймворки — это та часть релиза, которая решает, сможет ли кто-то за пределами лаборатории этим воспользоваться.

A screenshot of the SGLang Diffusion cookbook page for Qwen-Image 2.1, captured September 21 2026, showing the Diffusion Models sidebar with Qwen-Image 2.1 marked new, the page heading Qwen-Image 2.1 with a Copy page control, the summary line Run Qwen-Image 2.1 text-to-image and image-conditioned generation with SGLang Diffusion, and the capability tags RGBA image, text-to-image, image editing, multi-image references and block-causal attention.

Цифры, и о чём они не говорят

В работе SGLang публикуется задержка на запрос, а не пропускная способность. Это различие важно, если вы рассчитываете ресурсы для сервиса, а не запускаете демо: одна генерация за 2,7 секунды говорит вам о времени одного цикла запрос—ответ, а не о том, сколько одновременных пользователей выдерживает одна карта. Опубликованные конфигурации — все при 1024×1024 и 40 шагах:

B200, постоянно загруженные веса, FlashAttention — генерация 2,748 с, редактирование 3,358 с, после исправления Q/K-нормы и изменения LayerNorm, каждое из которых дало экономию в несколько процентов.
RTX PRO 6000 Blackwell, 96 ГБ, веса постоянно в памяти — генерация 8,23 с, редактирование 9,85 с при пиковом объёме 40,1 ГиБ; 10,28 с и 10,66 с при выгрузке диффузионного трансформера, что снижает пик до 26,1 ГиБ.
DGX Spark, 1× GB10, eager-режим, полное декодирование VAE — генерация 35,36 с, редактирование 42,23 с, 35,49 с и 42,21 с для прозрачных вариантов. Они включают сериализацию PNG. Разрывные CUDA-графы дали идентичные пиксели без измеримого выигрыша в скорости (35,96 с против 35,64 с), а пакетная обработка и конфигурации с несколькими Spark вообще не тестировались.
RTX 4090, 24 ГБ, послойная выгрузка, только денойзинг — 26,69 с в базовом BF16 с SDPA, 10,31 с с Cache-DiT (2,59×), 5,59 с с Cache-DiT плюс набор ядер INT8 (4,77×), 4,74 с с добавлением Sage attention (5,63×).

Две честные оговорки касаются этих строк. Во-первых, это задержки при одиночных запросах, и строка с 4090 измеряет только шумоподавление — текстовый энкодер и VAE находятся вне таймера. Во-вторых, авторы SGLang представляют более широкую проверку как функциональную, а не оценочную: вывод BF16 не является побитово точным при разных размещениях, а квантование или тензорный параллелизм меняют числа. Быстрее и иначе — не то же самое, что быстрее и лучше.

A generated single-column spec scoreboard titled Qwen-Image-2.1 - the scoreboard, listing Generation component 7B single-stream DiT, Text encoder Qwen3-VL 8B, VAE 64-channel RGBA, Native output 2048 x 2048 at 40 steps, Reference images up to 10, and Hosted price none - self-host only, with a footer reading Qwen architecture per the vendor model card, unaudited; latency figures per SGLang-Diffusion, single request, 1024 x 1024 at 40 steps.

Почему путь прозрачного вывода — это то, за чем стоит следить

RGBA — это то, чем эта модель отличается от эндпоинтов изображений, к которым уже обращается большинство команд, и именно здесь обслуживание становится неудобным. Qwen-Image-2.1 выполняет денойзинг в латентном пространстве, где альфа-канал является полноценным компонентом, через 64-канальный RGBA VAE с 16-кратным пространственным сжатием. Прозрачность — это не постобработка, которую прикручивают с помощью модели сегментации; это то, что выдаёт сэмплер.

Обеспечивать это на должном уровне сложнее, чем обслуживать RGB. Выходные данные больше, у VAE больше каналов для декодирования, а запрос несёт дополнительный бит режима, который планировщику приходится маршрутизировать. Проверка SGLang охватывает именно эту область — прозрачный вывод PNG, сохранение альфа-канала во всём диапазоне 0–255 и RGBA PSNR 60,69 дБ на одном образце, при этом конфигурации FP8 также проходят генерацию с прозрачностью. Это проверка корректности, а не оценка качества, и авторы так и говорят. Она подтверждает, что альфа-канал реален и выживает при квантовании; но ничего не говорит о том, чистые ли края на волосах, мехе или стекле.

Практическая ценность серверного стека с проверенным путём прозрачности заключается в том, что он превращает конвейер из трёх инструментов в один вызов. Генерация с альфа-каналом, редактирование внутри изображения, у которого уже есть альфа-канал, и извлечение объекта из обычной RGB-фотографии в прозрачный слой — всё это проходит через одну и ту же конечную точку.

Куда это вписывается, если вы не запускаете GPU самостоятельно

Неловкая часть выпуска Qwen-Image-2.1 заключается в том, что нет хостируемого эндпоинта, который можно было бы вызвать. Веса — это загрузка объёмом примерно 33 ГБ, компонент генерации — это 7B-диффузионный трансформер в паре с 8B-текстовым энкодером Qwen3-VL, и всё это поставляется под Qwen Research License Agreement от 20 сентября 2026 года — только для некоммерческого использования, при этом коммерческое развёртывание требует отдельной лицензии от поставщика. Так что рецепт SGLang — не альтернатива API. Это и есть API, а вы — оператор.

Это меняет то, для чего вообще нужен слой маршрутизации. OrcaRouter открывает доступ к более чем 200 моделям через одну конечную точку, совместимую с OpenAI, по прайс-листовой цене провайдеров без наценки, с автоматическим переключением при сбоях между провайдерами, DSL маршрутизации для композиции резервных цепочек и слиянием моделей для вызовов в стиле панели — но он не маршрутизирует ни одну модель Qwen-Image ни одной версии, и Qwen-Image-2.1 никогда не станет маршрутом, который можно было бы там вызвать. Реалистичная архитектура — раздельная: запускать Qwen-Image-2.1 на собственном оборудовании через SGLang для задач с прозрачностью и несколькими референсами, а всё остальное отправлять на хостинговые модели изображений по одному ключу. В нашем каталоге представлены линейка OpenAI GPT-Image, уровни Google Imagen 4 и предпросмотры изображений Gemini, а также конечная точка изображений xAI Grok Imagine — всё по прайс-листовой цене с прозрачной передачей, так что изменение цены вендором на любую из них появляется у нас в тот же день.

Как на самом деле выглядит развёртывание

Документация SGLang поставляется с практическим руководством для этой модели с командами для каждого GPU, а рекомендуемый запуск сервера состоит из одной строки — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. Запросы на преобразование текста в изображение поддерживают динамическую пакетную обработку, включаемую по желанию; запросы на редактирование изображений обрабатываются через отдельный путь, и один запрос может возвращать несколько выходных данных.

Фактически проверенные конфигурации уже, чем следует из матрицы совместимости. H200, B200, RTX PRO 6000 96 GB, RTX 5090 и RTX 4090 покрыты для генерации и редактирования 1024×1024 при 40 шагах, включая их прозрачные варианты, а также тензорный параллелизм на нескольких GPU, внимание Ulysses и Ring, послойную выгрузку, параллельное тайловое декодирование VAE, Cache-DiT, CUDA graphs, а также онлайн- и сериализованное квантование FP8. Рецепты с несколькими GPU и NVFP4 на RTX PRO 6000 остаются непроверенными, а многохостовый RDMA и многорэнговые дезагрегированные роли не охвачены. Если ваш план предполагает четыре карты и фабрику, вы опережаете опубликованные данные.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Две вещи, за которыми стоит следить дальше. Первая — опубликует ли кто-нибудь пропускную способность, а не задержку: именно показатели параллелизма превращают цифру в 2,7 секунды в план по мощностям. Вторая — лицензия: для коммерческого использования Qwen-Image-2.1 нет опубликованной цены или документа с условиями, и пока их нет, ограничение на некоммерческое использование — это всё, что имеет значение для всего, что поставляется заказчику.