기사용으로 생성된 히어로 카드로, 헤드라인은 SGLang-Diffusion이 Qwen-Image-2.1을 서빙한다이고 부제는 데이제로 서빙, 측정됨이며, 텍스트-투-이미지, 다중 이미지 편집, RGBA 출력으로 레이블된 세 개의 둥근 카드가 2.75초 생성 및 3.36초 편집을 나타내는 지연 시간 스트립 위에 표시되어 있고, 캡션은 1024 x 1024, 40 스텝, B200 1개입니다.
Engineering & Research

SGLang-Diffusion, 출시 첫날부터 Qwen-Image-2.1 지원: B200 한 대에서 2.75초 생성

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Qwen-Image-2.1은 2026년 9월 20일에 공개되었고, SGLang-Diffusion 팀은 이를 위한 서빙 경로를 준비해 두고 있었습니다. 데이제로 지원은 이 모델이 수행하는 세 가지 작업 — 텍스트-투-이미지 생성, 다중 이미지 편집, 투명 RGBA 출력 — 을 포괄하며, 병합된 풀 리퀘스트보다 더 드문 무언가를 함께 제공합니다. 바로 특정 하드웨어에서 측정된 지연 시간이며, 그 수치를 산출한 구성과 함께 공개됩니다. 단일 NVIDIA B200에서 40스텝 기준 1024×1024로, SGLang 수치는 생성에 2.748초, 편집에 3.358초를 기록했습니다. 이를 뒷받침하는 풀 리퀘스트인 sgl-project/sglang#39983은 9월 17일에 열렸습니다 — 가중치를 다운로드할 수 있게 되기 사흘 전이었습니다 — 덕분에 이 수치들은 나중을 위해 약속된 것이 아니라 실제로 존재할 수 있었습니다.

여기서 "데이 제로"가 무엇을 의미하는지, 그리고 왜 타이밍이 흥미로운 부분인지

프레임워크 지원은 보통 모델 릴리스와 거의 동시에 발표되고 몇 주 뒤에 제공됩니다. SGLang의 경우는 반대입니다. 구현은 아직 공개되지 않은 체크포인트를 대상으로 작성되었으며, 이로 인해 작성자들은 사양서 대신 실제 아키텍처를 다루어야 했습니다: 디퓨전 트랜스포머, 64채널 RGBA VAE, Qwen3-VL 조건화, 다중 참조 이미지 입력, 그리고 RGBA 입력 및 출력.

그것이 기능 목록보다 지연 시간 표를 더 신뢰해야 하는 이유입니다. 한 번도 서빙된 적 없는 모델에는 측정된 수치가 없으며, 하드웨어, 해상도, 스텝 수, 정밀도가 함께 제시된 수치는 같은 카드를 가진 사람이라면 누구나 확인할 수 있습니다. SGLang 수치는 모델에 대한 일반적인 주장이 아니라 특정 구성으로 표시됩니다.

나머지 툴링도 같은 시기에 나왔다. ComfyUI는 네이티브 지원을 출시했고, Diffusers는 QwenImage21Pipeline을 병합했으며, vLLM-Omni는 단계별 실행과 FP8 양자화를 추가했고, LightX2V는 ROCm을 통한 AMD Radeon 지원과 함께 가속 기능을 추가했다. 프레임워크는 연구소 밖의 누구든 이를 사용할 수 있는지를 결정하는 릴리스의 한 부분이다.

A screenshot of the SGLang Diffusion cookbook page for Qwen-Image 2.1, captured September 21 2026, showing the Diffusion Models sidebar with Qwen-Image 2.1 marked new, the page heading Qwen-Image 2.1 with a Copy page control, the summary line Run Qwen-Image 2.1 text-to-image and image-conditioned generation with SGLang Diffusion, and the capability tags RGBA image, text-to-image, image editing, multi-image references and block-causal attention.

숫자들, 그리고 그것들이 말하지 않는 것

SGLang 연구는 처리량이 아니라 요청별 지연 시간을 공개한다. 데모를 실행하는 것이 아니라 서비스 용량을 산정하는 경우라면 이 구분이 중요하다. 2.7초짜리 단일 생성은 왕복 시간을 알려줄 뿐, 카드 한 장이 감당할 수 있는 동시 사용자 수를 알려주지는 않는다. 공개된 구성은 모두 1024×1024 및 40 스텝 기준이다:

B200, 상주 가중치, FlashAttention — Q/K-norm 수정과 LayerNorm 변경으로 각각 몇 퍼센트씩 단축한 후, 생성 2.748초, 편집 3.358초.
RTX PRO 6000 Blackwell, 96GB, 상주 — 40.1GiB 최대 메모리 사용량에서 생성 8.23초, 편집 9.85초; 확산 트랜스포머를 오프로드하면 최대 사용량이 26.1GiB로 낮아지며 10.28초 및 10.66초.
DGX Spark, 1× GB10, eager, 전체 VAE 디코드 — 생성 35.36초, 편집 42.23초, 투명 변형의 경우 35.49초 및 42.21초. 여기에는 PNG 직렬화가 포함됩니다. Breakable CUDA 그래프는 측정 가능한 속도 이점 없이 동일한 픽셀을 생성했으며(35.96초 대 35.64초), 배칭 및 다중 Spark 구성은 전혀 벤치마크되지 않았습니다.
RTX 4090, 24GB, 계층별 오프로드, 디노이즈만 — SDPA를 사용한 기본 BF16에서 26.69초, Cache-DiT로 10.31초(2.59×), Cache-DiT와 INT8 커널 세트로 5.59초(4.77×), Sage 어텐션을 추가해 4.74초(5.63×).

그 행들에는 두 가지 솔직한 단서가 따라붙는다. 첫째, 그것들은 단일 요청 지연 시간이며, 4090 행은 디노이징만 측정한다 — 텍스트 인코더와 VAE는 타이머 범위 밖이다. 둘째, SGLang 저자들은 더 넓은 검증을 평가적이 아니라 기능적인 것으로 규정한다: BF16 출력은 서로 다른 배치에서 비트 단위로 정확히 일치하지 않으며, 양자화나 텐서 병렬 처리는 수치를 바꾼다. 더 빠르면서 다른 것은 더 빠르고 더 나은 것과 같지 않다.

A generated single-column spec scoreboard titled Qwen-Image-2.1 - the scoreboard, listing Generation component 7B single-stream DiT, Text encoder Qwen3-VL 8B, VAE 64-channel RGBA, Native output 2048 x 2048 at 40 steps, Reference images up to 10, and Hosted price none - self-host only, with a footer reading Qwen architecture per the vendor model card, unaudited; latency figures per SGLang-Diffusion, single request, 1024 x 1024 at 40 steps.

왜 투명 출력 경로를 주목해야 하는가

RGBA는 이 모델이 이미 많은 팀이 호출하고 있는 이미지 엔드포인트와 가장 크게 갈리는 지점이며, 동시에 서빙이 까다로워지는 지점이기도 합니다. Qwen-Image-2.1은 알파 채널을 일급 구성 요소로 갖는 잠재 공간에서, 16× 공간 압축을 수행하는 64채널 RGBA VAE를 통해 노이즈를 제거합니다. 투명도는 세그멘테이션 모델로 나중에 덧붙이는 후처리가 아니라, 샘플러가 출력하는 것입니다.

그것을 잘 서빙하는 것은 RGB를 서빙하는 것보다 더 어렵습니다. 출력이 더 크고, VAE가 디코딩해야 할 채널이 더 많으며, 요청에는 스케줄러가 라우팅해야 하는 추가 모드 비트가 포함됩니다. SGLang의 검증은 바로 그 영역을 다룹니다 — 투명 PNG 출력, 전체 0–255 범위에서 유지되는 알파, 그리고 단일 샘플에서 60.69 dB의 RGBA PSNR이며, FP8 구성 역시 투명 생성을 통과했습니다. 이는 품질 벤치마크라기보다 정확성 검사이며, 저자들도 그렇게 말합니다. 이는 알파 채널이 실제이고 양자화 후에도 살아남는다는 것을 입증할 뿐, 머리카락, 털, 유리에서 가장자리가 깨끗한지에 대해서는 아무 말도 하지 않습니다.

검증된 투명도 경로를 갖춘 서빙 스택의 실용적 가치는 세 도구로 구성된 파이프라인을 한 번의 호출로 바꿔준다는 데 있습니다. 알파를 사용한 생성, 이미 알파가 있는 이미지 내부에서의 편집, 그리고 일반 RGB 사진에서 피사체를 투명 레이어로 추출하는 작업이 모두 동일한 엔드포인트를 거칩니다.

GPU를 직접 실행하지 않는 경우 이것이 어디에 해당하는가

Qwen-Image-2.1 출시에서 곤란한 부분은 호출할 수 있는 호스팅 엔드포인트가 없다는 점이다. 가중치는 약 33GB짜리 다운로드 분량이고, 생성 구성 요소는 Qwen3-VL 8B 텍스트 인코더와 짝을 이루는 7B 확산 트랜스포머이며, 전체는 2026년 9월 20일자 Qwen Research License Agreement에 따라 배포된다 — 비상업적 사용만 허용되고, 상업적 배포에는 벤더로부터 별도의 라이선스가 필요하다. 따라서 SGLang 레시피는 API의 대안이 아니다. 그것이 바로 API이며, 운영자는 당신이다.

그것은 라우팅 레이어의 존재 목적 자체를 바꿉니다. OrcaRouter는 200개 이상의 모델을 하나의 OpenAI 호환 엔드포인트 뒤에 제공업체 정가 그대로, 마크업 없이 제공합니다, 제공업체 간 자동 페일오버, 폴백을 조합하기 위한 라우팅 DSL, 그리고 패널 방식 호출을 위한 모델 퓨전까지 갖추고 있습니다 — 하지만 어떤 버전의 Qwen-Image 모델도 라우팅하지 않으며, Qwen-Image-2.1은 그곳에서 호출할 수 있는 라우트가 결코 되지 않을 것입니다. 현실적인 아키텍처는 분리형입니다: 투명 작업과 다중 참조 작업은 SGLang을 통해 자체 하드웨어에서 Qwen-Image-2.1로 실행하고, 나머지 모든 작업은 하나의 키로 호스팅 이미지 모델에 보내는 것입니다. 저희 카탈로그에는 OpenAI GPT-Image 라인, Google의 Imagen 4 등급과 Gemini 이미지 프리뷰, xAI의 Grok Imagine 이미지 엔드포인트가 모두 정가 그대로 전달되어 있으므로, 이들 중 어느 하나에 대한 공급업체 가격 변경이 당일 저희 쪽에 반영됩니다.

실제 배포는 어떤 모습일까

SGLang 문서는 이 모델을 위한 쿡북을 GPU별 명령어와 함께 제공하며, 권장 서버 실행 방법은 단 한 줄입니다 — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. 텍스트-이미지 요청은 선택적 동적 배칭을 지원하며, 이미지 편집 요청은 별도의 경로로 처리되고, 하나의 요청이 여러 개의 출력을 반환할 수 있습니다.

실제로 검증된 구성은 호환성 매트릭스가 시사하는 것보다 더 좁습니다. H200, B200, RTX PRO 6000 96 GB, RTX 5090, RTX 4090은 40스텝의 1024×1024 생성 및 편집에 대해, 투명 변형을 포함해 지원되며, 여기에 멀티 GPU 텐서 병렬 처리, Ulysses 및 Ring 어텐션, 레이어별 오프로드, 병렬 타일드 VAE 디코드, Cache-DiT, CUDA 그래프, 그리고 온라인 및 직렬화 FP8 양자화가 포함됩니다. RTX PRO 6000에서의 멀티 GPU 및 NVFP4 레시피는 아직 검증되지 않았으며, 멀티 호스트 RDMA와 멀티 랭크 분리형 역할은 지원 범위에 포함되지 않습니다. 계획에 네 장의 카드와 패브릭이 포함된다면, 당신은 공개된 증거보다 앞서 있는 것입니다.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

앞으로 지켜봐야 할 두 가지가 있습니다. 첫째는 누군가 지연 시간이 아니라 처리량을 공개하는지 여부입니다. 동시성 수치가 있어야 2.7초라는 숫자를 용량 계획으로 바꿀 수 있습니다. 둘째는 라이선스입니다. Qwen-Image-2.1의 상업적 사용을 위한 가격이나 텀시트는 공개된 것이 없으며, 그것이 나오기 전까지는 고객에게 출시되는 모든 것에 대해 비상업적 제한이 전부입니다.