
SGLang-Diffusion phục vụ Qwen-Image-2.1 ngay từ ngày đầu tiên: Tạo sinh trong 2,75 giây trên một B200
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1 ra mắt công khai vào ngày 20 tháng 9 năm 2026, và đội ngũ SGLang-Diffusion đã có sẵn một đường phục vụ đang chờ đón nó. Hỗ trợ ngay từ ngày đầu bao trùm ba tác vụ mà mô hình này đảm nhận — tạo ảnh từ văn bản, chỉnh sửa nhiều ảnh, và xuất RGBA trong suốt — và đi kèm với một thứ hiếm hoi hơn cả một pull request đã được hợp nhất: độ trễ đo được trên phần cứng có tên cụ thể, được công bố cùng với cấu hình đã tạo ra nó. Trên một chiếc NVIDIA B200 duy nhất, ở 1024×1024 với 40 bước, các con số của SGLang dừng ở 2,748 giây cho một lần tạo ảnh và 3,358 giây cho một lần chỉnh sửa. Pull request hỗ trợ, sgl-project/sglang#39983, được mở vào ngày 17 tháng 9 — ba ngày trước khi có thể tải trọng số về — đó chính là lý do vì sao những con số này tồn tại ngay từ đầu thay vì chỉ được hứa hẹn cho sau này.
“Ngày số 0” ở đây có nghĩa là gì, và tại sao thời điểm lại là phần thú vị
Hỗ trợ framework thường được công bố cùng lúc với bản phát hành mô hình và được cung cấp vài tuần sau đó. Trường hợp SGLang lại đi theo hướng ngược lại. Bản triển khai được viết dựa trên một checkpoint chưa được công khai, điều này buộc các tác giả phải xử lý kiến trúc thực tế thay vì một bảng đặc tả: diffusion transformer, VAE RGBA 64 kênh, điều kiện hóa Qwen3-VL, đầu vào nhiều ảnh tham chiếu, và RGBA ở đầu vào lẫn đầu ra.
Đó là lý do để tin một bảng độ trễ hơn là một danh sách năng lực. Một mô hình chưa từng được phục vụ thì không có số đo nào, và một con số đi kèm với phần cứng, độ phân giải, số bước và độ chính xác của nó thì bất kỳ ai có cùng loại card đều có thể kiểm chứng. Các số liệu của SGLang được ghi rõ là thuộc một cấu hình cụ thể, chứ không phải một khẳng định tổng quát về mô hình.
Phần công cụ còn lại cũng xuất hiện trong cùng khoảng thời gian đó. ComfyUI đã phát hành hỗ trợ gốc, Diffusers đã hợp nhất QwenImage21Pipeline, vLLM-Omni bổ sung thực thi từng bước và lượng tử hóa FP8, còn LightX2V thêm khả năng tăng tốc với hỗ trợ AMD Radeon thông qua ROCm. Các framework chính là phần của một bản phát hành quyết định liệu có ai ngoài phòng thí nghiệm có thể sử dụng nó hay không.

Những con số, và những điều chúng không nói ra
Công trình SGLang công bố độ trễ trên mỗi yêu cầu, không phải thông lượng. Sự khác biệt đó rất quan trọng nếu bạn đang định cỡ một dịch vụ thay vì chạy một bản demo: một lần sinh mất 2,7 giây cho bạn biết thời gian khứ hồi, chứ không cho biết một card có thể đáp ứng được bao nhiêu người dùng đồng thời. Các cấu hình được công bố, tất cả ở 1024×1024 và 40 bước:
• B200, trọng số thường trú, FlashAttention — sinh 2,748 s, chỉnh sửa 3,358 s, sau khi sửa chuẩn hoá Q/K và thay đổi LayerNorm, mỗi thay đổi đều cắt giảm được vài phần trăm.
• RTX PRO 6000 Blackwell, 96 GB, thường trú — sinh 8,23 s, chỉnh sửa 9,85 s với mức sử dụng đỉnh 40,1 GiB; 10,28 s và 10,66 s khi offload diffusion transformer, hạ đỉnh xuống còn 26,1 GiB.
• DGX Spark, 1× GB10, chế độ eager, giải mã VAE đầy đủ — sinh 35,36 s, chỉnh sửa 42,23 s, 35,49 s và 42,21 s cho các biến thể trong suốt. Những con số này bao gồm cả tuần tự hoá PNG. CUDA graph dạng breakable cho ra pixel giống hệt nhau mà không mang lại lợi ích tốc độ nào đo được (35,96 s so với 35,64 s), còn batching và các thiết lập nhiều Spark thì hoàn toàn không được đo hiệu năng.
• RTX 4090, 24 GB, offload theo từng lớp, chỉ khử nhiễu — 26,69 s ở BF16 cơ sở với SDPA, 10,31 s với Cache-DiT (2,59×), 5,59 s với Cache-DiT cùng bộ kernel INT8 (4,77×), 4,74 s khi thêm Sage attention (5,63×).
Có hai lưu ý trung thực gắn với những hàng đó. Thứ nhất, chúng là độ trễ của từng yêu cầu riêng lẻ, và hàng 4090 chỉ đo bước khử nhiễu — bộ mã hóa văn bản và VAE nằm ngoài phép đo thời gian. Thứ hai, các tác giả SGLang mô tả việc kiểm chứng rộng hơn là mang tính chức năng, không phải mang tính đánh giá: đầu ra BF16 không trùng khớp từng bit giữa các cách bố trí khác nhau, và việc lượng tử hóa hoặc song song tensor làm thay đổi các con số. Nhanh hơn và khác biệt không đồng nghĩa với nhanh hơn và tốt hơn.

Vì sao đường dẫn đầu ra trong suốt lại là thứ đáng chú ý
RGBA là điểm mà mô hình này khác biệt so với các endpoint hình ảnh mà hầu hết các nhóm đã gọi, và cũng là chỗ việc phục vụ trở nên khó xử. Qwen-Image-2.1 khử nhiễu trong một không gian latent có kênh alpha như một thành phần hạng nhất, thông qua VAE RGBA 64 kênh với mức nén không gian 16×. Độ trong suốt không phải là một bước hậu xử lý mà bạn gắn thêm bằng mô hình phân đoạn; nó là thứ mà bộ lấy mẫu phát ra.
Phục vụ tốt điều đó khó hơn phục vụ RGB. Đầu ra lớn hơn, VAE có nhiều kênh hơn để giải mã, và yêu cầu mang thêm một bit chế độ mà bộ lập lịch phải định tuyến. Việc xác minh của SGLang bao phủ chính xác bề mặt đó — đầu ra PNG trong suốt, alpha được giữ nguyên trên toàn bộ dải 0–255, và PSNR RGBA là 60.69 dB trong một mẫu duy nhất, với các cấu hình FP8 cũng vượt qua việc tạo trong suốt. Đó là kiểm tra tính đúng đắn chứ không phải là đánh giá chất lượng, và các tác giả nói như vậy. Nó chứng minh rằng kênh alpha là thật và tồn tại qua quá trình lượng tử hóa; nó không nói gì về việc liệu các cạnh có sạch trên tóc, lông thú hay thủy tinh hay không.
Giá trị thực tiễn của một ngăn xếp phục vụ với đường xử lý trong suốt đã được kiểm thử là nó biến một pipeline gồm ba công cụ thành một lệnh gọi duy nhất. Tạo sinh với alpha, chỉnh sửa bên trong một hình ảnh vốn đã có alpha, và tách một chủ thể khỏi một bức ảnh RGB thông thường thành một lớp trong suốt đều đi qua cùng một endpoint.
Vị trí của phần này nếu bạn không tự chạy GPU
Phần khó xử của bản phát hành Qwen-Image-2.1 là không có endpoint được host nào để gọi. Các trọng số là một bản tải xuống khoảng 33 GB, thành phần tạo sinh là một transformer khuếch tán 7B được ghép với bộ mã hóa văn bản Qwen3-VL 8B, và toàn bộ được phát hành theo Thỏa thuận Giấy phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026 — chỉ dùng cho mục đích phi thương mại, với việc triển khai thương mại yêu cầu giấy phép riêng từ nhà cung cấp. Vì vậy, công thức SGLang không phải là một giải pháp thay thế cho API. Nó chính là API, và bạn là người vận hành.
Điều đó thay đổi mục đích tồn tại của một lớp định tuyến. OrcaRouter đặt hơn 200 mô hình phía sau một endpoint tương thích OpenAI với đúng giá niêm yết của nhà cung cấp, không đánh thêm phí, tự động chuyển đổi dự phòng giữa các nhà cung cấp, một DSL định tuyến để tổ hợp các phương án dự phòng, và hợp nhất mô hình cho các lệnh gọi kiểu panel — nhưng nó không định tuyến bất kỳ mô hình Qwen-Image phiên bản nào, và Qwen-Image-2.1 sẽ không bao giờ là một tuyến mà bạn có thể gọi ở đó. Kiến trúc thực tế là kiến trúc tách đôi: chạy Qwen-Image-2.1 trên phần cứng của riêng bạn thông qua SGLang cho các tác vụ minh bạch và đa tham chiếu, còn gửi mọi thứ khác đến các mô hình hình ảnh được lưu trữ bằng một khóa duy nhất. Danh mục của chúng tôi có dòng OpenAI GPT-Image, các bậc Imagen 4 của Google và bản xem trước hình ảnh Gemini, cùng endpoint hình ảnh Grok Imagine của xAI, tất cả đều ở giá niêm yết được chuyển nguyên, nên khi giá của nhà cung cấp thay đổi với bất kỳ mô hình nào trong số đó, phía chúng tôi sẽ cập nhật ngay trong cùng ngày.
Một đợt triển khai thực tế trông như thế nào
Tài liệu SGLang đi kèm một cookbook cho mô hình này với các lệnh riêng cho từng GPU, và cách gọi máy chủ được khuyến nghị chỉ gồm một dòng — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. Các yêu cầu text-to-image hỗ trợ gom lô động dạng tùy chọn; các yêu cầu chỉnh sửa ảnh được xử lý theo một luồng riêng, và một yêu cầu có thể trả về nhiều kết quả.
Các cấu hình thực sự đã được xác minh hẹp hơn so với những gì ma trận tương thích hàm ý. H200, B200, RTX PRO 6000 96 GB, RTX 5090 và RTX 4090 được hỗ trợ cho việc tạo và chỉnh sửa 1024×1024 ở 40 bước, bao gồm cả các biến thể trong suốt của chúng, cùng với song song tensor đa GPU, attention Ulysses và Ring, offload theo từng lớp, giải mã VAE chia ô song song, Cache-DiT, đồ thị CUDA, và lượng tử hóa FP8 trực tuyến và tuần tự hóa. Các công thức đa GPU và NVFP4 trên RTX PRO 6000 vẫn chưa được xác minh, và RDMA đa máy chủ cùng các vai trò phân tách đa rank chưa được đề cập. Nếu kế hoạch của bạn liên quan đến bốn card và một fabric, thì bạn đang đi trước bằng chứng đã công bố.

Hai điều cần theo dõi tiếp theo. Điều đầu tiên là liệu có ai công bố thông lượng thay vì độ trễ hay không — các con số đồng thời chính là thứ biến một con số 2,7 giây thành một kế hoạch dung lượng. Điều thứ hai là giấy phép: không có mức giá hay bản điều khoản nào được công bố cho việc sử dụng thương mại Qwen-Image-2.1, và cho đến khi có, hạn chế phi thương mại là toàn bộ câu chuyện đối với bất cứ thứ gì được giao đến tay khách hàng.
