
SGLang-Diffusion รองรับ Qwen-Image-2.1 ตั้งแต่วันแรก: สร้างผลลัพธ์ใน 2.75 วินาทีบน B200 เพียงตัวเดียว
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1 เปิดให้ใช้งานสาธารณะเมื่อวันที่ 20 กันยายน 2026 และทีม SGLang-Diffusion มีเส้นทางการให้บริการที่รอไว้แล้วสำหรับมัน การรองรับตั้งแต่วันแรกครอบคลุมสามงานที่โมเดลนี้ทำ — การสร้างภาพจากข้อความ การแก้ไขภาพหลายภาพ และเอาต์พุต RGBA แบบโปร่งใส — และมาพร้อมกับสิ่งที่หายากกว่าพูลรีเควสต์ที่ถูก merge แล้ว: ความหน่วงที่วัดได้บนฮาร์ดแวร์ที่ระบุชื่อ เผยแพร่พร้อมการกำหนดค่าที่ใช้สร้างผลลัพธ์นั้น บน NVIDIA B200 เครื่องเดียว ที่ 1024×1024 จำนวน 40 สเตป ตัวเลขของ SGLang อยู่ที่ 2.748 วินาทีสำหรับการสร้างหนึ่งภาพ และ 3.358 วินาทีสำหรับการแก้ไขหนึ่งภาพ พูลรีเควสต์ที่รองรับ sgl-project/sglang#39983 ถูกเปิดเมื่อวันที่ 17 กันยายน — สามวันก่อนที่น้ำหนักโมเดลจะดาวน์โหลดได้ — ซึ่งเป็นเหตุผลว่าทำไมตัวเลขเหล่านี้จึงมีอยู่จริง แทนที่จะถูกสัญญาไว้ว่าจะมีในภายหลัง
"day zero" ในที่นี้หมายถึงอะไร และทำไมจังหวะเวลาจึงเป็นส่วนที่น่าสนใจ
การรองรับเฟรมเวิร์กมักถูกประกาศพร้อมกับการเปิดตัวโมเดลในคราวเดียวกัน และเพิ่งส่งมอบจริงในอีกหลายสัปดาห์ถัดมา กรณีของ SGLang กลับตรงกันข้าม การนำไปใช้ถูกเขียนขึ้นโดยอิงกับเช็กพอยต์ที่ยังไม่เปิดเผยต่อสาธารณะ ซึ่งบังคับให้ผู้เขียนต้องจัดการกับสถาปัตยกรรมจริงแทนที่จะเป็นเอกสารสเปก: diffusion transformer, VAE แบบ RGBA 64 แชนเนล, การปรับเงื่อนไขด้วย Qwen3-VL, อินพุตรูปภาพอ้างอิงหลายรูป และ RGBA ทั้งขาเข้าและขาออก
นั่นคือเหตุผลที่ควรเชื่อตารางเวลาแฝงมากกว่ารายการขีดความสามารถ โมเดลที่ไม่เคยถูกให้บริการย่อมไม่มีตัวเลขที่วัดได้ และตัวเลขที่มาพร้อมกับฮาร์ดแวร์ ความละเอียด จำนวนสเต็ป และความแม่นยำที่แนบมาด้วยนั้น ใครก็ตามที่มีการ์ดเดียวกันสามารถตรวจสอบได้ ตัวเลขของ SGLang ถูกระบุว่าเป็นคอนฟิกูเรชันเฉพาะ ไม่ใช่ข้อกล่าวอ้างทั่วไปเกี่ยวกับโมเดล
เครื่องมืออื่น ๆ ที่เหลือก็ลงในช่วงเดียวกัน ComfyUI ปล่อยการรองรับแบบเนทีฟ Diffusers รวม QwenImage21Pipeline, vLLM-Omni เพิ่มการทำงานแบบทีละขั้นและการควอนไทซ์ FP8 และ LightX2V เพิ่มการเร่งความเร็วพร้อมการรองรับ AMD Radeon ผ่าน ROCm เฟรมเวิร์กเป็นส่วนของการเปิดตัวที่กำหนดว่าใครก็ตามที่อยู่นอกห้องแล็บจะสามารถใช้งานมันได้หรือไม่

ตัวเลข และสิ่งที่พวกมันไม่ได้บอก
งานของ SGLang เผยแพร่ความหน่วงต่อคำขอ ไม่ใช่อัตราการประมวลผล ความแตกต่างนี้สำคัญหากคุณกำลังกำหนดขนาดบริการแทนที่จะรันเดโม: การสร้างหนึ่งครั้งที่ใช้เวลา 2.7 วินาที บอกเวลารอบไปกลับให้คุณ ไม่ได้บอกว่าการ์ดหนึ่งใบรองรับผู้ใช้พร้อมกันได้กี่คน คอนฟิกูเรชันที่เผยแพร่ ทั้งหมดอยู่ที่ 1024×1024 และ 40 สเต็ป:
• B200, น้ำหนักแบบ resident, FlashAttention — การสร้าง 2.748 วิ, การแก้ไข 3.358 วิ หลังจากแก้ Q/K-norm และปรับเปลี่ยน LayerNorm ซึ่งแต่ละอย่างช่วยลดเวลาได้ไม่กี่เปอร์เซ็นต์
• RTX PRO 6000 Blackwell, 96 GB, resident — การสร้าง 8.23 วิ, การแก้ไข 9.85 วิ ที่หน่วยความจำสูงสุด 40.1 GiB; 10.28 วิ และ 10.66 วิ เมื่อ offload diffusion transformer ออกไป ทำให้ค่าสูงสุดลดลงเหลือ 26.1 GiB
• DGX Spark, 1× GB10, eager, ถอดรหัส VAE เต็มรูปแบบ — การสร้าง 35.36 วิ, การแก้ไข 42.23 วิ, 35.49 วิ และ 42.21 วิ สำหรับเวอร์ชันโปร่งใส เวลาเหล่านั้นรวมการ serialize เป็น PNG ด้วย Breakable CUDA graphs ให้พิกเซลที่เหมือนกันทุกประการโดยไม่มีความเร็วเพิ่มขึ้นที่วัดได้ (35.96 วิ เทียบกับ 35.64 วิ) และไม่ได้ทำ benchmarking การทำงานเป็นชุด (batching) และการตั้งค่า multi-Spark เลย
• RTX 4090, 24 GB, layerwise offload, เฉพาะ denoise — 26.69 วิ ที่ base BF16 กับ SDPA, 10.31 วิ ด้วย Cache-DiT (2.59×), 5.59 วิ ด้วย Cache-DiT ร่วมกับชุดเคอร์เนล INT8 (4.77×), 4.74 วิ เมื่อเพิ่ม Sage attention (5.63×)
มีข้อควรระวังที่ตรงไปตรงมาสองข้อบนแถวเหล่านั้น ประการแรก มันเป็นความหน่วงของคำขอเดี่ยว และแถว 4090 วัดเฉพาะการลดสัญญาณรบกวน — ตัวเข้ารหัสข้อความและ VAE อยู่นอกการจับเวลา ประการที่สอง ผู้เขียน SGLang กำหนดกรอบการตรวจสอบที่กว้างขึ้นว่าเป็นเชิงหน้าที่ ไม่ใช่เชิงประเมิน: เอาต์พุต BF16 ไม่ตรงกันทุกบิตเมื่ออยู่ในการจัดวางที่ต่างกัน และการควอนไทซ์หรือการขนานเทนเซอร์ทำให้ตัวเลขเปลี่ยนไป เร็วขึ้นและแตกต่างไม่ได้หมายความว่าเร็วขึ้นและดีขึ้น

ทำไมเส้นทางเอาต์พุตแบบโปร่งใสจึงเป็นสิ่งที่ต้องจับตามอง
RGBA คือจุดที่โมเดลนี้แตกต่างจากเอนด์พอยต์รูปภาพที่ทีมส่วนใหญ่เรียกใช้กันอยู่แล้ว และยังเป็นจุดที่การให้บริการเริ่มยุ่งยากอีกด้วย Qwen-Image-2.1 ขจัดสัญญาณรบกวนใน latent space ที่มีอัลฟาแชนเนลเป็นองค์ประกอบระดับหลัก ผ่าน RGBA VAE จำนวน 64 แชนเนลที่มีการบีบอัดเชิงพื้นที่ 16× ความโปร่งใสไม่ใช่ post-process ที่เอามาต่อพ่วงด้วยโมเดล segmentation หากแต่เป็นสิ่งที่ sampler ส่งออกมา
การให้บริการสิ่งนั้นได้ดีนั้นยากกว่าการให้บริการ RGB เอาต์พุตมีขนาดใหญ่กว่า VAE มีช่องสัญญาณให้ถอดรหัสมากกว่า และคำขอมีบิตโหมดเพิ่มเติมที่ตัวจัดตารางเวลาต้องจัดเส้นทาง การตรวจสอบของ SGLang ครอบคลุมพื้นผิวนั้นพอดี — เอาต์พุต PNG แบบโปร่งใส ค่า alpha ที่คงไว้ตลอดช่วงเต็ม 0–255 และค่า RGBA PSNR ที่ 60.69 dB ในตัวอย่างเดียว โดยที่การกำหนดค่า FP8 ก็ผ่านการสร้างแบบโปร่งใสเช่นกัน นั่นเป็นการตรวจสอบความถูกต้องมากกว่าการวัดประสิทธิภาพด้านคุณภาพ และผู้เขียนก็กล่าวเช่นนั้น มันยืนยันว่าช่อง alpha นั้นมีอยู่จริงและอยู่รอดผ่านการควอนไทซ์; มันไม่ได้บอกอะไรเกี่ยวกับว่าเส้นขอบจะเรียบเนียนบนเส้นผม ขนสัตว์ หรือแก้วหรือไม่
คุณค่าในทางปฏิบัติของสแตกสำหรับให้บริการที่มีเส้นทางความโปร่งใสซึ่งผ่านการทดสอบแล้ว คือการเปลี่ยนไปป์ไลน์แบบสามเครื่องมือให้กลายเป็นการเรียกเพียงครั้งเดียว การสร้างภาพพร้อมอัลฟา การแก้ไขภายในภาพที่มีอัลฟาอยู่แล้ว และการดึงตัวแบบออกจากภาพถ่าย RGB ทั่วไปเข้าสู่เลเยอร์โปร่งใส ล้วนผ่านปลายทางเดียวกัน
สิ่งนี้เหมาะตรงไหนหากคุณไม่ได้รัน GPU ด้วยตัวเอง
ส่วนที่น่าอึดอัดของการเปิดตัว Qwen-Image-2.1 คือไม่มีเอนด์พอยต์ที่โฮสต์ไว้ให้เรียกใช้งาน น้ำหนักโมเดลเป็นไฟล์ดาวน์โหลดขนาดประมาณ 33 GB องค์ประกอบด้านการสร้างเป็นทรานส์ฟอร์เมอร์แบบดิฟฟิวชันขนาด 7B ที่จับคู่กับตัวเข้ารหัสข้อความ Qwen3-VL 8B และทั้งหมดเผยแพร่ภายใต้ Qwen Research License Agreement ลงวันที่ 20 กันยายน 2026 — ใช้เพื่อวัตถุประสงค์ที่ไม่ใช่เชิงพาณิชย์เท่านั้น โดยการนำไปใช้งานเชิงพาณิชย์ต้องมีใบอนุญาตแยกต่างหากจากผู้ขาย ดังนั้นสูตร SGLang จึงไม่ใช่ทางเลือกแทน API มันคือ API เอง และคุณคือผู้ดำเนินการ
นั่นเปลี่ยนจุดประสงค์ของเลเยอร์จัดเส้นทางไปเลย OrcaRouter วางโมเดลกว่า 200 รายการไว้เบื้องหลังปลายทางเดียวที่เข้ากันได้กับ OpenAI ในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม พร้อมการสลับไปยังผู้ให้บริการรายอื่นอัตโนมัติเมื่อเกิดข้อขัดข้อง (automatic failover) ข้ามผู้ให้บริการ, DSL สำหรับจัดเส้นทางเพื่อประกอบ fallback เข้าด้วยกัน และการหลอมรวมโมเดล (model fusion) สำหรับการเรียกแบบ panel — แต่ที่นั่นไม่จัดเส้นทางโมเดล Qwen-Image เวอร์ชันใดเลย และ Qwen-Image-2.1 จะไม่มีวันเป็นเส้นทางที่คุณเรียกใช้ได้ที่นั่น สถาปัตยกรรมที่สมจริงคือแบบแยกส่วน: รัน Qwen-Image-2.1 บนฮาร์ดแวร์ของคุณเองผ่าน SGLang สำหรับงานที่โปร่งใสและงานที่อ้างอิงหลายภาพ แล้วส่งงานอื่น ๆ ทั้งหมดไปยังโมเดลภาพที่โฮสต์ไว้ด้วยคีย์เดียว แค็ตตาล็อกของเรามีไลน์ OpenAI GPT-Image, ระดับต่าง ๆ ของ Imagen 4 จาก Google และ Gemini image previews ตลอดจนปลายทางภาพ Grok Imagine ของ xAI ทั้งหมดในราคาตามรายการที่ส่งผ่านมา ดังนั้นหากผู้จำหน่ายปรับราคารุ่นใดในนั้น ฝั่งเราจะอัปเดตให้ทันทีในวันเดียวกัน
การติดตั้งจริงๆ แล้วมีหน้าตาเป็นอย่างไร
เอกสารประกอบของ SGLang มาพร้อมคู่มือสำหรับโมเดลนี้ซึ่งมีคำสั่งแยกตาม GPU และการเรียกใช้เซิร์ฟเวอร์ที่แนะนำนั้นเป็นบรรทัดเดียว — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed คำขอแบบแปลงข้อความเป็นภาพรองรับการทำ dynamic batching แบบเลือกเปิดใช้ ส่วนคำขอแก้ไขภาพจะจัดการผ่านเส้นทางแยกต่างหาก และหนึ่งคำขอสามารถส่งคืนผลลัพธ์ได้หลายรายการ
คอนฟิกูเรชันที่ได้รับการตรวจสอบยืนยันจริงนั้นแคบกว่าที่เมทริกซ์ความเข้ากันได้บ่งชี้ไว้ H200, B200, RTX PRO 6000 96 GB, RTX 5090 และ RTX 4090 ได้รับการรองรับสำหรับการสร้างและการแก้ไขที่ 1024×1024 จำนวน 40 สเต็ป รวมถึงรูปแบบโปร่งใสของรุ่นเหล่านี้ ตลอดจน tensor parallelism แบบหลาย GPU, Ulysses และ Ring attention, layerwise offload, การถอดรหัส VAE แบบ tiled ขนาน, Cache-DiT, CUDA graphs และการควอนไทซ์ FP8 แบบออนไลน์และแบบซีเรียลไลซ์ สูตร Multi-GPU และ NVFP4 บน RTX PRO 6000 ยังไม่ได้รับการตรวจสอบยืนยัน และ RDMA แบบหลายโฮสต์กับบทบาท disaggregated แบบหลายแรงก์ยังไม่ถูกครอบคลุม หากแผนของคุณเกี่ยวข้องกับการ์ดสี่ใบและแฟบริก คุณก็นำหน้าหลักฐานที่เผยแพร่แล้ว

สองสิ่งที่ต้องจับตาต่อไป เรื่องแรกคือมีใครเผยแพร่ปริมาณงานที่ประมวลผลได้ (throughput) แทนที่จะเป็นความหน่วง (latency) หรือไม่ — ตัวเลขการทำงานพร้อมกัน (concurrency) คือสิ่งที่เปลี่ยนตัวเลข 2.7 วินาทีให้กลายเป็นแผนกำลังการผลิต เรื่องที่สองคือสัญญาอนุญาต: ยังไม่มีราคาหรือเอกสารเงื่อนไข (term sheet) ที่เผยแพร่สำหรับการใช้งานเชิงพาณิชย์ของ Qwen-Image-2.1 และจนกว่าจะมี ข้อจำกัดการไม่ใช้เชิงพาณิชย์ก็คือเรื่องทั้งหมดสำหรับสิ่งใดก็ตามที่ส่งมอบให้ลูกค้า
