การ์ดหลักที่สร้างขึ้นสำหรับบทความ หัวเรื่อง SGLang-Diffusion ให้บริการ Qwen-Image-2.1 พร้อมคำโปรยย่อย การให้บริการ Day-zero ที่วัดผลแล้ว แสดงการ์ดมุมโค้งสามใบที่ติดป้ายว่า ข้อความเป็นภาพ การแก้ไขหลายภาพ และเอาต์พุต RGBA เหนือแถบความหน่วงที่ระบุว่า การสร้าง 2.75 s และการแก้ไข 3.36 s พร้อมคำบรรยายภาพ 1024 x 1024, 40 steps, one B200
Engineering & Research

SGLang-Diffusion รองรับ Qwen-Image-2.1 ตั้งแต่วันแรก: สร้างผลลัพธ์ใน 2.75 วินาทีบน B200 เพียงตัวเดียว

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Qwen-Image-2.1 เปิดให้ใช้งานสาธารณะเมื่อวันที่ 20 กันยายน 2026 และทีม SGLang-Diffusion มีเส้นทางการให้บริการที่รอไว้แล้วสำหรับมัน การรองรับตั้งแต่วันแรกครอบคลุมสามงานที่โมเดลนี้ทำ — การสร้างภาพจากข้อความ การแก้ไขภาพหลายภาพ และเอาต์พุต RGBA แบบโปร่งใส — และมาพร้อมกับสิ่งที่หายากกว่าพูลรีเควสต์ที่ถูก merge แล้ว: ความหน่วงที่วัดได้บนฮาร์ดแวร์ที่ระบุชื่อ เผยแพร่พร้อมการกำหนดค่าที่ใช้สร้างผลลัพธ์นั้น บน NVIDIA B200 เครื่องเดียว ที่ 1024×1024 จำนวน 40 สเตป ตัวเลขของ SGLang อยู่ที่ 2.748 วินาทีสำหรับการสร้างหนึ่งภาพ และ 3.358 วินาทีสำหรับการแก้ไขหนึ่งภาพ พูลรีเควสต์ที่รองรับ sgl-project/sglang#39983 ถูกเปิดเมื่อวันที่ 17 กันยายน — สามวันก่อนที่น้ำหนักโมเดลจะดาวน์โหลดได้ — ซึ่งเป็นเหตุผลว่าทำไมตัวเลขเหล่านี้จึงมีอยู่จริง แทนที่จะถูกสัญญาไว้ว่าจะมีในภายหลัง

"day zero" ในที่นี้หมายถึงอะไร และทำไมจังหวะเวลาจึงเป็นส่วนที่น่าสนใจ

การรองรับเฟรมเวิร์กมักถูกประกาศพร้อมกับการเปิดตัวโมเดลในคราวเดียวกัน และเพิ่งส่งมอบจริงในอีกหลายสัปดาห์ถัดมา กรณีของ SGLang กลับตรงกันข้าม การนำไปใช้ถูกเขียนขึ้นโดยอิงกับเช็กพอยต์ที่ยังไม่เปิดเผยต่อสาธารณะ ซึ่งบังคับให้ผู้เขียนต้องจัดการกับสถาปัตยกรรมจริงแทนที่จะเป็นเอกสารสเปก: diffusion transformer, VAE แบบ RGBA 64 แชนเนล, การปรับเงื่อนไขด้วย Qwen3-VL, อินพุตรูปภาพอ้างอิงหลายรูป และ RGBA ทั้งขาเข้าและขาออก

นั่นคือเหตุผลที่ควรเชื่อตารางเวลาแฝงมากกว่ารายการขีดความสามารถ โมเดลที่ไม่เคยถูกให้บริการย่อมไม่มีตัวเลขที่วัดได้ และตัวเลขที่มาพร้อมกับฮาร์ดแวร์ ความละเอียด จำนวนสเต็ป และความแม่นยำที่แนบมาด้วยนั้น ใครก็ตามที่มีการ์ดเดียวกันสามารถตรวจสอบได้ ตัวเลขของ SGLang ถูกระบุว่าเป็นคอนฟิกูเรชันเฉพาะ ไม่ใช่ข้อกล่าวอ้างทั่วไปเกี่ยวกับโมเดล

เครื่องมืออื่น ๆ ที่เหลือก็ลงในช่วงเดียวกัน ComfyUI ปล่อยการรองรับแบบเนทีฟ Diffusers รวม QwenImage21Pipeline, vLLM-Omni เพิ่มการทำงานแบบทีละขั้นและการควอนไทซ์ FP8 และ LightX2V เพิ่มการเร่งความเร็วพร้อมการรองรับ AMD Radeon ผ่าน ROCm เฟรมเวิร์กเป็นส่วนของการเปิดตัวที่กำหนดว่าใครก็ตามที่อยู่นอกห้องแล็บจะสามารถใช้งานมันได้หรือไม่

A screenshot of the SGLang Diffusion cookbook page for Qwen-Image 2.1, captured September 21 2026, showing the Diffusion Models sidebar with Qwen-Image 2.1 marked new, the page heading Qwen-Image 2.1 with a Copy page control, the summary line Run Qwen-Image 2.1 text-to-image and image-conditioned generation with SGLang Diffusion, and the capability tags RGBA image, text-to-image, image editing, multi-image references and block-causal attention.

ตัวเลข และสิ่งที่พวกมันไม่ได้บอก

งานของ SGLang เผยแพร่ความหน่วงต่อคำขอ ไม่ใช่อัตราการประมวลผล ความแตกต่างนี้สำคัญหากคุณกำลังกำหนดขนาดบริการแทนที่จะรันเดโม: การสร้างหนึ่งครั้งที่ใช้เวลา 2.7 วินาที บอกเวลารอบไปกลับให้คุณ ไม่ได้บอกว่าการ์ดหนึ่งใบรองรับผู้ใช้พร้อมกันได้กี่คน คอนฟิกูเรชันที่เผยแพร่ ทั้งหมดอยู่ที่ 1024×1024 และ 40 สเต็ป:

B200, น้ำหนักแบบ resident, FlashAttention — การสร้าง 2.748 วิ, การแก้ไข 3.358 วิ หลังจากแก้ Q/K-norm และปรับเปลี่ยน LayerNorm ซึ่งแต่ละอย่างช่วยลดเวลาได้ไม่กี่เปอร์เซ็นต์
RTX PRO 6000 Blackwell, 96 GB, resident — การสร้าง 8.23 วิ, การแก้ไข 9.85 วิ ที่หน่วยความจำสูงสุด 40.1 GiB; 10.28 วิ และ 10.66 วิ เมื่อ offload diffusion transformer ออกไป ทำให้ค่าสูงสุดลดลงเหลือ 26.1 GiB
DGX Spark, 1× GB10, eager, ถอดรหัส VAE เต็มรูปแบบ — การสร้าง 35.36 วิ, การแก้ไข 42.23 วิ, 35.49 วิ และ 42.21 วิ สำหรับเวอร์ชันโปร่งใส เวลาเหล่านั้นรวมการ serialize เป็น PNG ด้วย Breakable CUDA graphs ให้พิกเซลที่เหมือนกันทุกประการโดยไม่มีความเร็วเพิ่มขึ้นที่วัดได้ (35.96 วิ เทียบกับ 35.64 วิ) และไม่ได้ทำ benchmarking การทำงานเป็นชุด (batching) และการตั้งค่า multi-Spark เลย
RTX 4090, 24 GB, layerwise offload, เฉพาะ denoise — 26.69 วิ ที่ base BF16 กับ SDPA, 10.31 วิ ด้วย Cache-DiT (2.59×), 5.59 วิ ด้วย Cache-DiT ร่วมกับชุดเคอร์เนล INT8 (4.77×), 4.74 วิ เมื่อเพิ่ม Sage attention (5.63×)

มีข้อควรระวังที่ตรงไปตรงมาสองข้อบนแถวเหล่านั้น ประการแรก มันเป็นความหน่วงของคำขอเดี่ยว และแถว 4090 วัดเฉพาะการลดสัญญาณรบกวน — ตัวเข้ารหัสข้อความและ VAE อยู่นอกการจับเวลา ประการที่สอง ผู้เขียน SGLang กำหนดกรอบการตรวจสอบที่กว้างขึ้นว่าเป็นเชิงหน้าที่ ไม่ใช่เชิงประเมิน: เอาต์พุต BF16 ไม่ตรงกันทุกบิตเมื่ออยู่ในการจัดวางที่ต่างกัน และการควอนไทซ์หรือการขนานเทนเซอร์ทำให้ตัวเลขเปลี่ยนไป เร็วขึ้นและแตกต่างไม่ได้หมายความว่าเร็วขึ้นและดีขึ้น

A generated single-column spec scoreboard titled Qwen-Image-2.1 - the scoreboard, listing Generation component 7B single-stream DiT, Text encoder Qwen3-VL 8B, VAE 64-channel RGBA, Native output 2048 x 2048 at 40 steps, Reference images up to 10, and Hosted price none - self-host only, with a footer reading Qwen architecture per the vendor model card, unaudited; latency figures per SGLang-Diffusion, single request, 1024 x 1024 at 40 steps.

ทำไมเส้นทางเอาต์พุตแบบโปร่งใสจึงเป็นสิ่งที่ต้องจับตามอง

RGBA คือจุดที่โมเดลนี้แตกต่างจากเอนด์พอยต์รูปภาพที่ทีมส่วนใหญ่เรียกใช้กันอยู่แล้ว และยังเป็นจุดที่การให้บริการเริ่มยุ่งยากอีกด้วย Qwen-Image-2.1 ขจัดสัญญาณรบกวนใน latent space ที่มีอัลฟาแชนเนลเป็นองค์ประกอบระดับหลัก ผ่าน RGBA VAE จำนวน 64 แชนเนลที่มีการบีบอัดเชิงพื้นที่ 16× ความโปร่งใสไม่ใช่ post-process ที่เอามาต่อพ่วงด้วยโมเดล segmentation หากแต่เป็นสิ่งที่ sampler ส่งออกมา

การให้บริการสิ่งนั้นได้ดีนั้นยากกว่าการให้บริการ RGB เอาต์พุตมีขนาดใหญ่กว่า VAE มีช่องสัญญาณให้ถอดรหัสมากกว่า และคำขอมีบิตโหมดเพิ่มเติมที่ตัวจัดตารางเวลาต้องจัดเส้นทาง การตรวจสอบของ SGLang ครอบคลุมพื้นผิวนั้นพอดี — เอาต์พุต PNG แบบโปร่งใส ค่า alpha ที่คงไว้ตลอดช่วงเต็ม 0–255 และค่า RGBA PSNR ที่ 60.69 dB ในตัวอย่างเดียว โดยที่การกำหนดค่า FP8 ก็ผ่านการสร้างแบบโปร่งใสเช่นกัน นั่นเป็นการตรวจสอบความถูกต้องมากกว่าการวัดประสิทธิภาพด้านคุณภาพ และผู้เขียนก็กล่าวเช่นนั้น มันยืนยันว่าช่อง alpha นั้นมีอยู่จริงและอยู่รอดผ่านการควอนไทซ์; มันไม่ได้บอกอะไรเกี่ยวกับว่าเส้นขอบจะเรียบเนียนบนเส้นผม ขนสัตว์ หรือแก้วหรือไม่

คุณค่าในทางปฏิบัติของสแตกสำหรับให้บริการที่มีเส้นทางความโปร่งใสซึ่งผ่านการทดสอบแล้ว คือการเปลี่ยนไปป์ไลน์แบบสามเครื่องมือให้กลายเป็นการเรียกเพียงครั้งเดียว การสร้างภาพพร้อมอัลฟา การแก้ไขภายในภาพที่มีอัลฟาอยู่แล้ว และการดึงตัวแบบออกจากภาพถ่าย RGB ทั่วไปเข้าสู่เลเยอร์โปร่งใส ล้วนผ่านปลายทางเดียวกัน

สิ่งนี้เหมาะตรงไหนหากคุณไม่ได้รัน GPU ด้วยตัวเอง

ส่วนที่น่าอึดอัดของการเปิดตัว Qwen-Image-2.1 คือไม่มีเอนด์พอยต์ที่โฮสต์ไว้ให้เรียกใช้งาน น้ำหนักโมเดลเป็นไฟล์ดาวน์โหลดขนาดประมาณ 33 GB องค์ประกอบด้านการสร้างเป็นทรานส์ฟอร์เมอร์แบบดิฟฟิวชันขนาด 7B ที่จับคู่กับตัวเข้ารหัสข้อความ Qwen3-VL 8B และทั้งหมดเผยแพร่ภายใต้ Qwen Research License Agreement ลงวันที่ 20 กันยายน 2026 — ใช้เพื่อวัตถุประสงค์ที่ไม่ใช่เชิงพาณิชย์เท่านั้น โดยการนำไปใช้งานเชิงพาณิชย์ต้องมีใบอนุญาตแยกต่างหากจากผู้ขาย ดังนั้นสูตร SGLang จึงไม่ใช่ทางเลือกแทน API มันคือ API เอง และคุณคือผู้ดำเนินการ

นั่นเปลี่ยนจุดประสงค์ของเลเยอร์จัดเส้นทางไปเลย OrcaRouter วางโมเดลกว่า 200 รายการไว้เบื้องหลังปลายทางเดียวที่เข้ากันได้กับ OpenAI ในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม พร้อมการสลับไปยังผู้ให้บริการรายอื่นอัตโนมัติเมื่อเกิดข้อขัดข้อง (automatic failover) ข้ามผู้ให้บริการ, DSL สำหรับจัดเส้นทางเพื่อประกอบ fallback เข้าด้วยกัน และการหลอมรวมโมเดล (model fusion) สำหรับการเรียกแบบ panel — แต่ที่นั่นไม่จัดเส้นทางโมเดล Qwen-Image เวอร์ชันใดเลย และ Qwen-Image-2.1 จะไม่มีวันเป็นเส้นทางที่คุณเรียกใช้ได้ที่นั่น สถาปัตยกรรมที่สมจริงคือแบบแยกส่วน: รัน Qwen-Image-2.1 บนฮาร์ดแวร์ของคุณเองผ่าน SGLang สำหรับงานที่โปร่งใสและงานที่อ้างอิงหลายภาพ แล้วส่งงานอื่น ๆ ทั้งหมดไปยังโมเดลภาพที่โฮสต์ไว้ด้วยคีย์เดียว แค็ตตาล็อกของเรามีไลน์ OpenAI GPT-Image, ระดับต่าง ๆ ของ Imagen 4 จาก Google และ Gemini image previews ตลอดจนปลายทางภาพ Grok Imagine ของ xAI ทั้งหมดในราคาตามรายการที่ส่งผ่านมา ดังนั้นหากผู้จำหน่ายปรับราคารุ่นใดในนั้น ฝั่งเราจะอัปเดตให้ทันทีในวันเดียวกัน

การติดตั้งจริงๆ แล้วมีหน้าตาเป็นอย่างไร

เอกสารประกอบของ SGLang มาพร้อมคู่มือสำหรับโมเดลนี้ซึ่งมีคำสั่งแยกตาม GPU และการเรียกใช้เซิร์ฟเวอร์ที่แนะนำนั้นเป็นบรรทัดเดียว — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed คำขอแบบแปลงข้อความเป็นภาพรองรับการทำ dynamic batching แบบเลือกเปิดใช้ ส่วนคำขอแก้ไขภาพจะจัดการผ่านเส้นทางแยกต่างหาก และหนึ่งคำขอสามารถส่งคืนผลลัพธ์ได้หลายรายการ

คอนฟิกูเรชันที่ได้รับการตรวจสอบยืนยันจริงนั้นแคบกว่าที่เมทริกซ์ความเข้ากันได้บ่งชี้ไว้ H200, B200, RTX PRO 6000 96 GB, RTX 5090 และ RTX 4090 ได้รับการรองรับสำหรับการสร้างและการแก้ไขที่ 1024×1024 จำนวน 40 สเต็ป รวมถึงรูปแบบโปร่งใสของรุ่นเหล่านี้ ตลอดจน tensor parallelism แบบหลาย GPU, Ulysses และ Ring attention, layerwise offload, การถอดรหัส VAE แบบ tiled ขนาน, Cache-DiT, CUDA graphs และการควอนไทซ์ FP8 แบบออนไลน์และแบบซีเรียลไลซ์ สูตร Multi-GPU และ NVFP4 บน RTX PRO 6000 ยังไม่ได้รับการตรวจสอบยืนยัน และ RDMA แบบหลายโฮสต์กับบทบาท disaggregated แบบหลายแรงก์ยังไม่ถูกครอบคลุม หากแผนของคุณเกี่ยวข้องกับการ์ดสี่ใบและแฟบริก คุณก็นำหน้าหลักฐานที่เผยแพร่แล้ว

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

สองสิ่งที่ต้องจับตาต่อไป เรื่องแรกคือมีใครเผยแพร่ปริมาณงานที่ประมวลผลได้ (throughput) แทนที่จะเป็นความหน่วง (latency) หรือไม่ — ตัวเลขการทำงานพร้อมกัน (concurrency) คือสิ่งที่เปลี่ยนตัวเลข 2.7 วินาทีให้กลายเป็นแผนกำลังการผลิต เรื่องที่สองคือสัญญาอนุญาต: ยังไม่มีราคาหรือเอกสารเงื่อนไข (term sheet) ที่เผยแพร่สำหรับการใช้งานเชิงพาณิชย์ของ Qwen-Image-2.1 และจนกว่าจะมี ข้อจำกัดการไม่ใช้เชิงพาณิชย์ก็คือเรื่องทั้งหมดสำหรับสิ่งใดก็ตามที่ส่งมอบให้ลูกค้า

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube