
Qwen-Image 2.1 vs FLUX 3: สองโมเดลสร้างภาพที่คุณยังใช้ไม่ได้เต็มที่
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image 2.1 และ FLUX 3คือสองการเปิดตัวโมเดลภาพที่น่าสนใจที่สุดในครึ่งหลังของปี 2026 และทั้งคู่ก็ไม่ได้ใช้งานได้อย่างตรงไปตรงมา Qwen-Image 2.1 ซึ่งทีม Qwen-Image เปิดโอเพนซอร์สเมื่อวันที่ 20 กันยายน 2026 เป็นโมเดลแบบรวมการสร้างและการแก้ไขขนาด 7B พารามิเตอร์ที่คุณสามารถดาวน์โหลดได้ในบ่ายวันนี้ แต่ก็ไม่สามารถนำไปใส่ในผลิตภัณฑ์เชิงพาณิชย์ได้อย่างถูกกฎหมาย ส่วน FLUX 3 ซึ่ง Black Forest Labs ประกาศเมื่อวันที่ 23 กรกฎาคม 2026 เป็นโมเดลพื้นฐานมัลติโมดัลแบบรวม ซึ่งระดับภาพของมัน — ส่วนที่คุณจะนำมาเปรียบเทียบกันจริง ๆ — ยังไม่มีเอนด์พอยต์สาธารณะ ไม่มีโมเดล ID ไม่มีราคา และไม่มีผลการวัดประสิทธิภาพ แม้จะผ่านมาสองเดือนหลังการประกาศ ดังนั้นการเปรียบเทียบนี้จึงไม่ใช่ "อันไหนดีกว่ากัน" แต่เป็นว่าอุปสรรคใดในสองอย่างนี้ที่คุณหาทางเลี่ยงได้
ความไม่พร้อมใช้งานสองประเภทที่แตกต่างกัน
มันชวนให้จัดทั้งสองอย่างไว้ในหมวด “ยังไม่พร้อม” แล้วเดินหน้าต่อ การทำเช่นนั้นจะซ่อนการตัดสินใจเดียวที่สำคัญ เพราะอุปสรรคทั้งสองมีรูปร่างที่ตรงกันข้ามกัน
อุปสรรคของ Qwen-Image 2.1 นั้นเป็นเรื่องทางกฎหมาย และมันเป็นเพียงบรรทัดหนึ่งในไฟล์ที่คุณสามารถอ่านได้ก่อนที่จะดาวน์โหลดอะไรก็ตาม น้ำหนักโมเดลอยู่บน Hugging Face และ ModelScope การ์ดโมเดลถูกเขียนขึ้น โค้ดสำหรับการอนุมานถูกเผยแพร่ และเฟรมเวิร์กสำหรับให้บริการสี่ตัวที่แยกจากกันได้รับการรวมการสนับสนุนก่อนหรือในวันเปิดตัว ไม่มีอะไรทางเทคนิคขวางกั้นระหว่างคุณกับโมเดลที่กำลังทำงาน สิ่งที่ขวางกั้นระหว่างคุณกับการนำมันออกใช้งานคือข้อตกลงสิทธิ์การใช้งาน Qwen Research License Agreement ลงวันที่ 20 กันยายน 2026 ซึ่งข้อกำหนดการให้สิทธิ์อนุญาตให้ใช้ "เพื่อวัตถุประสงค์ที่ไม่ใช่เชิงพาณิชย์เท่านั้น" และกำหนดให้ผู้ที่ต้องการสิทธิ์เชิงพาณิชย์ขอใบอนุญาตแยกต่างหากจากผู้ขาย
สิ่งที่สกัดกั้น FLUX 3 คือข้อจำกัดเชิงกายภาพ ไม่มี endpoint รูปภาพให้เรียกใช้ ไม่มีตัวระบุโมเดลให้ส่ง และไม่มีตารางราคาให้ใช้จัดงบประมาณ หน้าตาราคาของ BFL เองครอบคลุมระดับของ FLUX 3 Video และไลน์รูปภาพ FLUX.2 รุ่นเก่า แต่ไม่ครอบคลุมระดับรูปภาพของ FLUX 3 เพราะไม่มีอะไรให้ตั้งราคา การเข้าถึงโมเดลรูปภาพทำได้เฉพาะเมื่อร้องขอเท่านั้น ไม่ใช่ปุ่มเริ่มต้นใช้งาน: หน้า FLUX 3 ของ BFL เองระบุระดับรูปภาพว่า "เร็ว ๆ นี้" และเป็น action tier ที่มีป้าย early-access
ดังนั้น หนึ่งในโมเดลเหล่านี้คือโมเดลที่คุณรันได้คืนนี้ แต่ขายไม่ได้ ส่วนอีกโมเดลหนึ่งคือโมเดลที่คุณขายได้ แต่รันไม่ได้ โมเดลไหนจะมีประโยชน์กับคุณมากกว่ากัน ขึ้นอยู่ทั้งหมดว่าคุณยืนอยู่ฝั่งไหนของประโยคนั้น — ทีมวิจัยภายในและทีมผลิตภัณฑ์เชิงพาณิชย์ควรได้ข้อสรุปที่ตรงกันข้ามจากข้อเท็จจริงสองข้อเดียวกัน
การอ่านทีละมิติ
• สถานะ — เวต สัญญาอนุญาต และการ์ดโมเดลของ Qwen-Image 2.1 เผยแพร่เมื่อวันที่ 20 กันยายน 2026 พร้อมกับโพสต์บล็อกของผู้ให้บริการในวันเดียวกัน FLUX 3 ประกาศเมื่อวันที่ 23 กรกฎาคม 2026; มีเพียงระดับวิดีโอที่วางจำหน่ายแล้ว โดยเปิดให้ใช้งานทั่วไปเมื่อวันที่ 4 สิงหาคม 2026
• สิ่งที่คุณสามารถเรียกใช้งานได้จริงในวันนี้ — Qwen-Image 2.1 ทำงานภายในเครื่องผ่าน Diffusers, ComfyUI, vLLM-Omni, SGLang และ LightX2V หรือผ่าน API ของผู้ให้บริการเองและแพลตฟอร์มของบุคคลที่สามหลายแห่ง FLUX 3 ระบุระดับบริการรูปภาพของตนว่า "เร็ว ๆ นี้" โดยไม่มีเอนด์พอยต์ให้เรียกใช้งาน และมีเอนด์พอยต์วิดีโอที่คิดราคาและพร้อมใช้งานทั่วไป
• สถาปัตยกรรม — Qwen-Image 2.1 เป็น DiT แบบ single-stream 32 เลเยอร์ที่มีพารามิเตอร์ 7B ในส่วนประกอบการสร้างภาพ ตัวเข้ารหัสข้อความ Qwen3-VL 8B และ VAE แบบ RGBA 64 ช่องสัญญาณที่การบีบอัดเชิงพื้นที่ 16× FLUX 3 เป็นโมเดลโฟลว์แบบรวมหนึ่งเดียวที่ฝึกพร้อมกันทั้งภาพ วิดีโอ และเสียง สร้างขึ้นบนวิธี flow-matching แบบ self-supervised ที่ BFL เรียกว่า Self-Flow พร้อมชั้นการทำนายการกระทำที่พัฒนาควบคู่กับ Mimic Robotics
• ความโปร่งใสแบบเนทีฟ — Qwen-Image 2.1 สร้างและแก้ไขภาพ RGBA แก้ไขข้อความภายในเลเยอร์โปร่งใส และแยกวัตถุจากภาพถ่าย RGB ออกมาเป็นเลเยอร์โปร่งใส โดยรวมความสามารถที่ Alibaba เปิดตัวแยกต่างหากในชื่อ Qwen-Image-Layered เมื่อเดือนธันวาคม 2025 เข้าไว้ด้วย ส่วน BFL ไม่ได้ประกาศความสามารถด้านความโปร่งใสใด ๆ สำหรับ FLUX 3 Image
• ภาพอ้างอิง — Qwen-Image 2.1 รองรับภาพอ้างอิงอินพุตได้สูงสุด 10 ภาพ พร้อมการแก้ไขเฉพาะจุดด้วยการวงกลม การวาดคำอธิบาย หรือมาสก์แยกต่างหาก ยังไม่มีตัวเลขที่เผยแพร่สำหรับ FLUX 3 Image
• ความละเอียด — Qwen-Image 2.1 เป็น 2K โดยกำเนิด ค่าเริ่มต้นที่ 2048×2048 ด้วย 40 ขั้นตอนการอนุมาน พร้อมพรีเซ็ตอัตราส่วนภาพที่มีเอกสารระบุไว้เจ็ดแบบ ส่วนความละเอียดของ FLUX 3 Image นั้นในประกาศระบุเพียงว่า "กว้าง" โดยไม่มีข้อมูลใด ๆ เผยแพร่ออกมา
• ราคา — ไม่มีราคาเปิดเผยสำหรับทั้งสองตัว ณ เวลาที่เขียนนี้ Qwen-Image 2.1 ไม่มีอัตราค่าบริการแบบโฮสต์ที่ระบุไว้ ส่วน FLUX 3 Image ไม่มีการ์ดราคาเพราะไม่มีเอนด์พอยต์ ราคาของ FLUX 3 เพียงอย่างเดียวที่มีอยู่คือวิดีโอ โดยอยู่ที่ 0.06 ดอลลาร์ต่อวินาทีสำหรับแบบร่าง 0.17 ดอลลาร์ต่อวินาทีสำหรับ HD และ 0.29 ดอลลาร์ต่อวินาทีสำหรับ FHD
• สัญญาอนุญาต — ข้อตกลงสัญญาอนุญาตเพื่อการวิจัยของ Qwen ใช้ได้เฉพาะที่ไม่ใช่เชิงพาณิชย์เท่านั้น หากต้องการใช้เชิงพาณิชย์ต้องยื่นคำขอแยกต่างหาก ส่วนเงื่อนไขสัญญาอนุญาตของ FLUX 3 สำหรับระดับการสร้างภาพยังไม่มีการเปิดเผยออกมาเลยแม้แต่น้อย
ความไม่สมมาตรหนึ่งอย่างสมควรได้รับบรรทัดของตัวเอง เพราะมันคือกับดักในการเปรียบเทียบคู่นี้ FLUX 3 มีตัวเลข benchmark ที่เผยแพร่จริง — ค่า Elo ภายในที่ 1,135 สำหรับ text-to-video และอัตราการชนะจากความชอบของมนุษย์ที่รายงานไว้เมื่อเทียบกับ Grok Imagine Video, Seedance 2.0, Gemini Omni Flash, Runway Gen-4.5 และ Luma Ray 3.2 ตัวเลขทุกตัวเหล่านี้อธิบายถึงระดับวิดีโอเท่านั้น ไม่มีสักตัวที่ถ่ายทอดไปยังการสร้างภาพได้ และ BFL เองก็ไม่ได้เผยแพร่ benchmark หรืออัตราการชนะด้านภาพใด ๆ การอ้าง Elo ด้านวิดีโอของ FLUX 3 มาเป็นหลักฐานเกี่ยวกับคุณภาพภาพของ FLUX 3 คือความผิดพลาดที่ทำได้ง่ายที่สุดในการเปรียบเทียบนี้

สิ่งที่แต่ละฝ่ายสามารถแสดงให้เห็นได้จริง
วางหลักฐานไว้เคียงข้างกัน แล้วความไม่สมมาตรก็จะพลิกกลับจากหัวข้อก่อนหน้า
FLUX 3 มีผลิตภัณฑ์ที่เปิดตัวแล้ว กำหนดราคาแล้ว และพร้อมใช้งานทั่วไป — เพียงแต่ไม่ใช่ผลิตภัณฑ์ตัวที่อยู่ในชื่อเรื่องของบทความนี้ FLUX 3 Video สร้างคลิปความยาวสูงสุด 20 วินาทีพร้อมเสียงที่ซิงโครไนซ์ในครั้งเดียว รองรับ text-to-video, image-to-video, video-to-video, keyframe-to-video และ generative continuation และกำลังถูกทดสอบโดย Canva, Burda, Magnific, Krea และ Picsart แล้ว นั่นคือระบบจริงที่ถูกนำไปใช้งานแล้ว พร้อมรายชื่อลูกค้าจริง ระดับผลิตภัณฑ์ด้านภาพคือส่วนที่ยังไม่มา และคำแนะนำเดิมของ BFL ที่ว่าจะตามมา "ในอีกไม่กี่สัปดาห์ข้างหน้า" บัดนี้ได้ผ่านเลยสองเดือนเต็มแล้วโดยยังไม่มีเอนด์พอยต์สาธารณะ
Qwen-Image 2.1 มีลักษณะตรงกันข้าม การกล่าวอ้างเรื่องคุณภาพของมันมาจากแผนภูมิเปรียบเทียบ Qwen-Image-Bench ของผู้จำหน่ายเอง และยังไม่มีบุคคลที่สามรายใดทำซ้ำผลเหล่านั้นได้ แต่ตัวผลิตภัณฑ์เองอยู่ในมือคุณแล้ว: เวต 33 GB โครงสร้างที่เก็บแบบสไตล์ Apache พร้อมไฟล์สัญญาอนุญาตที่ตรงไปตรงมาว่าใช้เพื่อการวิจัยเท่านั้น และเส้นทางการให้บริการตั้งแต่วันแรกที่ครอบคลุมห้าเฟรมเวิร์ก นอกจากนี้ยังมีรีวิวทดลองใช้งานแบบ early access หนึ่งชิ้น จากผู้ทดสอบที่รันเวตเวอร์ชันสุดท้ายผ่านอินเทอร์เฟซ ModelScope Studio และรายงานว่าใช้เวลาประมาณ 10–15 วินาทีสำหรับการสร้างภาพจากข้อความ และ 18–23 วินาทีสำหรับการแก้ไข มีพฤติกรรมการตั้งค่าล่วงหน้าของกล้องและการกำหนดบทบาทตัวละครหลายตัวที่แข็งแกร่ง และความสอดคล้องแบบหลายภาพอ้างอิงเริ่มเสื่อมลงเมื่อใช้ภาพอินพุตประมาณสามภาพขึ้นไป ผู้รีวิวหนึ่งราย ไม่มีตัวจับเวลา ไม่มีชุดพรอมป์ที่เผยแพร่ มีประโยชน์ในเชิงทิศทาง แต่ยังไม่ได้รับการตรวจสอบอย่างเป็นทางการ
สรุปหลักฐานตามตรง: Qwen-Image 2.1 มีโมเดลที่รันได้และไม่มีข้อมูลคุณภาพที่เป็นอิสระ ส่วน FLUX 3 Image มีคำกล่าวอ้างจากผู้ขาย และไม่มีทั้งโมเดลที่รันได้และข้อมูลภาพใด ๆ เลย ถ้าคำถามของคุณคือ "ในบรรดาตัวเลือกเหล่านี้ ฉันควรวางแผนไปป์ไลน์โดยยึดตัวไหน" คำตอบวันนี้คือไม่ใช่ทั้งคู่ และเหตุผลก็ต่างกัน

จุดที่วิธีเลี่ยงปัญหาอยู่จริงๆ
สำหรับทีมเชิงพาณิชย์ อุปสรรคของ Qwen-Image 2.1 มีรูปแบบที่คุณสามารถวางแผนรับมือได้ สัญญาอนุญาตชัดเจน ผู้ติดต่อสำหรับสัญญาอนุญาตเชิงพาณิชย์ระบุไว้ในรีโพซิทอรี และโมเดลเล็กพอ — 7B ในส่วนประกอบการสร้าง — จนต้นทุนการประเมินบนฮาร์ดแวร์ของคุณเองนั้นวัดเป็นช่วงบ่าย ไม่ใช่หนึ่งไตรมาส ประเมินก่อน เจรจาทีหลัง และระหว่างนี้เก็บบิลด์สำหรับวิจัยให้ห่างจากเส้นทางที่ลูกค้าเข้าถึง นั่นเป็นปัญหาการจัดซื้อจัดจ้างตามปกติ
อุปสรรคของ FLUX 3 Image ไม่ใช่ปัญหาด้านการจัดซื้อจัดหา เพราะไม่มีอะไรให้จัดหา คุณสามารถเข้าคิว early-access ได้ และคุณสามารถเฝ้ารอให้ endpoint ปรากฏขึ้น และนั่นคือการดำเนินการทั้งหมดที่ทำได้ หากคุณต้องการการสร้างภาพในตระกูล FLUX สำหรับโปรดักชันในวันนี้ ตัวเลือกที่เรียกใช้งานได้คือ FLUX.2 และสาย FLUX Pro/Dev รุ่นเก่ากว่า ซึ่งมีราคาและพร้อมใช้งาน — และเป็นโมเดลต่างเจเนอเรชันจากตัวที่บทความนี้กล่าวถึง
สำหรับทีมที่ต้องการทดสอบทั้งสองตัวเลือกโดยไม่ต้องผูกมัดตัวใดตัวหนึ่งเข้ากับเส้นทางโปรดักชัน นี่คือกรณีที่เลเยอร์การจัดเส้นทางถูกสร้างขึ้นมาเพื่อรองรับOrcaRouter นำโมเดลกว่า 200 รายการมาไว้เบื้องหลังเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI ในราคาตามที่ผู้ให้บริการประกาศ โดยไม่บวกเพิ่ม พร้อมการสลับไปใช้ผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง ดังนั้นโมเดลที่ยังไม่ผ่านการพิสูจน์หรือยังไม่เปิดตัวจึงอยู่เบื้องหลังเส้นทางหนึ่ง เคียงข้างสิ่งที่คุณไว้วางใจอยู่แล้ว แทนที่จะเข้าไปแทนที่มัน — และเนื่องจากราคาตามประกาศถูกส่งต่อผ่านมา การเปลี่ยนแปลงราคาของผู้ขายใด ๆ บนโมเดลที่จัดเส้นทางไว้จึงมีผลทันทีในวันเดียวกัน ขณะที่เขียนนี้ ทั้ง Qwen-Image 2.1 และ FLUX 3 Image ยังไม่สามารถจัดเส้นทางได้ และเราจะไม่แสร้งทำเป็นอย่างอื่น สิ่งที่เราจัดเส้นทางคือสายผลิตภัณฑ์ภาพที่อยู่รอบ ๆ ทั้งสองตัวนั้น ซึ่งรวมถึงตระกูล GPT-Image ของ OpenAI, Imagen 4 ในระดับต่าง ๆ ของ Google, ตัวอย่างภาพของ Gemini และเอนด์พอยต์ภาพ Grok Imagine ของ xAI เหล่านั้นคือโมเดลที่สามารถรองรับภาระงานได้ในระหว่างที่สองตัวนี้ค่อย ๆ คลี่คลายตัวเอง
อีกสิ่งหนึ่งที่ควรจับตาดูโดยเฉพาะในฝั่ง Qwen Alibaba เปิดตัว Qwen-Image 1.0 และ 2.0 เป็นโมเดลน้ำหนักเปิดภายใต้สัญญาอนุญาต Apache-2.0 จากนั้นเปิดตัว Qwen-Image 3.0 ในเดือนกรกฎาคม 2026 เป็นโมเดลโฮสต์แบบปิดสนิท ไม่มีน้ำหนัก ไม่มีสัญญาอนุญาต และไม่มีรายงานทางเทคนิค แล้วจึงเปิดตัว Qwen-Image 2.1 ในเดือนกันยายนเป็นน้ำหนักเปิดภายใต้สัญญาอนุญาตสำหรับการวิจัยเท่านั้น ทิศทางการเคลื่อนไปไม่ใช่เส้นตรง และเงื่อนไขสัญญาอนุญาตของการเปิดตัวครั้งถัดไปเป็นคำถามเปิดที่แท้จริง มากกว่าจะเป็นข้อสันนิษฐานที่ปลอดภัยในทิศทางใดทิศทางหนึ่ง

คำตัดสิน เท่าที่มันเป็น
หากคุณเป็นนักวิจัยหรือทีมประเมินภายใน Qwen-Image 2.1 คือตัวเลือกที่มีประโยชน์มากกว่าในสองตัวนี้ตอนนี้ อย่างมาก — มันดาวน์โหลดได้ มีเอกสารประกอบ ได้รับการสนับสนุนจากเฟรมเวิร์ก และซื่อตรงเกี่ยวกับข้อกำหนดการใช้งาน หากคุณเป็นทีมเชิงพาณิชย์ ทั้งสองตัวถูกบล็อก และการบล็อกนั้นไม่เหมือนกัน: ตัวหนึ่งคือสัญญาที่คุณเริ่มพูดคุยได้ อีกตัวคือผลิตภัณฑ์ที่ยังไม่มีอยู่จริง
ถ้าคุณต้องส่งงานด้านการสร้างภาพให้เสร็จภายในเดือนนี้ ทั้งสองตัวนี้ก็ไม่ใช่คำตอบ และคำถามที่มีประโยชน์คือ โมเดลตัวใดที่คุณ สามารถเรียกใช้แล้วพาคุณเข้าใกล้เป้าหมายได้มากที่สุด นั่นคือการทดสอบวัดประสิทธิภาพ และควรทำด้วยพรอมป์ของคุณเอง มากกว่ากราฟเปิดตัวของใคร ๆ — รวมถึงของเจ้าของผลิตภัณฑ์ด้วย และรวมถึงอันนี้ด้วย
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
