
Qwen-Image 2.1 vs MAI-Image-2.5-Pro: 6,100 โหวตแบบไม่เปิดเผย กับศูนย์
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
หนึ่งในสองโมเดลนี้ได้รับการจัดอันดับจากผลการเปรียบเทียบแบบไม่ระบุตัวตนโดยมนุษย์ราว 6,100 ครั้ง ส่วนอีกโมเดลหนึ่งยังไม่เคยถูกใครที่อยู่นอกห้องแล็บของตัวเองจัดอันดับเลย MAI-Image-2.5-Pro ซึ่งเป็นโมเดลรูปภาพระดับพรีเมียมของ Microsoft ครองอันดับหนึ่งบน Artificial Analysis image editing arena ด้วยคะแนน Elo 1,272 — เป็นผลลัพธ์ที่มีผู้โหวตมากที่สุดในหมวดนี้ Qwen-Image 2.1 ซึ่งทีม Qwen-Image เปิดซอร์สเมื่อวันที่ 20 กันยายน 2026 ยังไม่มีคะแนนอิสระเลย และจะยังไม่มีจนกว่าจะมีคนมากพอที่จะรันมันในที่สาธารณะเพื่อสร้างคะแนนโหวต ช่องว่างตรงนี้แหละคือประเด็นจริงของการเปรียบเทียบครั้งนี้ เพราะมันเป็นความแตกต่างเพียงอย่างเดียวระหว่างสองโมเดลที่ไม่ใช่คำกล่าวอ้างของผู้ขาย ส่วนอื่น ๆ ทั้งหมด — สถาปัตยกรรม ความละเอียด ราคา — ล้วนเป็นสิ่งที่รู้ได้แต่ยังไม่พิสูจน์ และทั้งสองโมเดลใกล้เคียงกันมากบนกระดาษ จนช่องว่างทางการวัดนี้ควรเป็นสิ่งที่กำหนดการตัดสินใจ
สิ่งที่ผลการโหวตบอกจริง ๆ และสิ่งที่ไม่ได้บอก
Artificial Analysis ทำการเปรียบเทียบแบบคู่แบบไม่เปิดเผย: โมเดลสองตัวได้รับพรอมต์เดียวกัน ผู้โหวตเลือกเอาต์พุตที่ดีกว่า และ Elo ก็ได้มาจากผลลัพธ์ มันไม่ใช่เครื่องมือที่สมบูรณ์แบบ แต่เป็นสิ่งที่ใกล้เคียงที่สุดที่หมวดหมู่นี้มีต่อกระดานคะแนนร่วม และขนาดตัวอย่างก็สำคัญพอ ๆ กับตัวเลข
• MAI-Image-2.5-Pro — การแก้ไขภาพอยู่อันดับ #1 ที่ Elo 1,272 จากการเปรียบเทียบราว 6,100 ครั้ง ส่วนด้าน text-to-image อยู่อันดับ #7 ด้วย Elo 1,292 ตามหลัง GPT Image 2 (high) ที่ 1,369, Reve 2.1 ที่ 1,322, Nano Banana 2 ที่ 1,320, GPT Image 1.5 (high) ที่ 1,310 และ MAI-Image-2.5 ที่ 1,304
• Qwen-Image 2.1 — ไม่มีรายการบนบอร์ดจัดอันดับใดเลย ไม่ใช่คะแนนต่ำ แต่เป็นเพราะไม่มีคะแนนเลย ณ เวลาที่เขียน การเปิดตัวนี้เพิ่งผ่านมาได้หนึ่งวัน
รูปแบบของตัวเลขเหล่านั้นควรค่าแก่การอ่านอย่างรอบคอบ เพราะมันไม่ใช่รูปแบบที่การตลาดสื่อออกมา โมเดลของ Microsoft เป็นอันดับหนึ่งในด้านการแก้ไขภาพอย่างแท้จริง และเป็นอันดับเจ็ดในด้านการสร้างภาพอย่างแท้จริง นั่นคือตำแหน่งที่เฉพาะเจาะจงและสามารถป้องกันได้ — ผู้เชี่ยวชาญด้านการแก้ไขภาพที่เป็นผู้นำในหมวดหมู่ของตัวเอง — และมันเป็นสิ่งที่แตกต่างจากการเป็นโมเดลรูปภาพที่ดีที่สุด ซึ่งมันไม่ได้เป็นเช่นนั้น ในขณะเดียวกัน โมเดลที่เอาชนะมันในด้านการสร้างภาพจากข้อความคือ GPT Image 2 (high) ซึ่งก็ไม่ใช่โมเดล OpenAI ที่ใหม่ที่สุดในสาขานี้เช่นกัน ลีดเดอร์บอร์ดอิสระให้รางวัลกับโมเดลที่ถูกวัดมากที่สุด และในการเปรียบเทียบนี้ โมเดลนั้นคือโมเดลของ Microsoft อย่างไม่ต้องสงสัย
สเปกเดียวที่โมเดลเปิดชนะขาดลอย
มีความแตกต่างที่เป็นรูปธรรมและไม่ใช่อัตวิสัยระหว่างสองสิ่งนี้ และนั่นคือ resolution
• Qwen-Image 2.1สร้างภาพที่ความละเอียด 2K ได้โดยตรง โดยมีค่าเริ่มต้นตามเอกสารคือ 2048×2048 ที่ 40 ขั้นตอนการอนุมาน (inference steps) พร้อมพรีเซ็ตอัตราส่วนภาพเจ็ดแบบ และเอาต์พุตแบบ RGBA ที่มีช่องอัลฟาจริงแทนการใช้เลเยอร์พื้นทึบ (matte)
• MAI-Image-2.5-Proจำกัดเอาต์พุตไว้ที่ 1,048,576 พิกเซล — ประมาณหนึ่งเมกะพิกเซล ตัวเลขสเปกที่เป็นจุดขายของมันอยู่ที่อื่นแทน นั่นคือโทเคนอินพุตข้อความ 32,000 โทเคน หน้าต่างบริบท 131k และโทเคนเอาต์พุต 4,096 ซึ่งเป็นข้อความที่บ่งชี้ว่ามันรับคำสั่งได้มากแค่ไหน ไม่ใช่ปล่อยภาพออกมาได้มากแค่ไหน
สำหรับงานโซเชียลและงานผลิตภัณฑ์ส่วนใหญ่ การจำกัดที่หนึ่งล้านพิกเซลไม่ถือเป็นข้อจำกัด แต่สำหรับงานพิมพ์ สำหรับการคอมโพสิตขนาดใหญ่ หรือสำหรับอะไรก็ตามที่การครอปต้องอยู่รอด มันเป็นข้อจำกัด นี่คือมิติเดียวในการเปรียบเทียบทั้งหมดที่คุณชี้ไปที่ตัวเลขและบอกได้ว่าโมเดลเปิดนำอยู่ — และโปรดทราบว่านั่นเป็นข้อเท็จจริงเชิงสถาปัตยกรรมจากโมเดลการ์ด ไม่ใช่การกล่าวอ้างเรื่องคุณภาพ Qwen-Image 2.1 จะเรนเดอร์ที่ 2048×2048 ไม่ว่าจะเรนเดอร์สิ่งใดที่ควรค่าแก่การดูหรือไม่ก็ตาม
ราคา ซึ่งเป็นจุดที่การเปรียบเทียบเริ่มอึดอัด
MAI-Image-2.5-Pro ถูกกำหนดราคาเป็นโมเดลระดับพรีเมียม และตัวเลขก็ไม่ใช่ความแตกต่างเล็กน้อย: 5 ดอลลาร์ต่อโทเค็นอินพุตข้อความหนึ่งล้านโทเค็น, 8 ดอลลาร์ต่อโทเค็นอินพุตรูปภาพหนึ่งล้านโทเค็น และ 106 ดอลลาร์ต่อโทเค็นเอาต์พุตรูปภาพหนึ่งล้านโทเค็น ที่เอาต์พุตความละเอียด 1024 พิกเซล คิดเป็นประมาณ 108.50 ดอลลาร์ต่อภาพหนึ่งพันภาพ เมื่อเทียบเป็นสเกล นั่นคิดเป็นประมาณ 2.3 เท่าของต้นทุน MAI-Image-2.5 และประมาณ 5.4 เท่าของ MAI-Image-2.5-Flash ดังนั้น Microsoft จึงจงใจแบ่งกลุ่มสายผลิตภัณฑ์ของตน แทนที่จะตั้งราคาระดับ Pro เป็นการอัปเกรดแบบเพิ่มขึ้นทีละขั้น
Qwen-Image 2.1 ไม่มีราคาแบบโฮสต์ เพราะไม่มีเอนด์พอยต์แบบโฮสต์ — มันคือการดาวน์โหลดเวตภายใต้สัญญาอนุญาตสำหรับงานวิจัย ค่าใช้จ่ายของมันคือเวลา GPU ของคุณ และข้อจำกัดของมันคือคุณไม่สามารถขายสิ่งที่มันสร้างได้อย่างถูกกฎหมาย การเปรียบเทียบ $108.50 ต่อพันภาพกับ "เวตฟรี" ก็เหมือนการเปรียบเทียบบริการกับเครื่องจักร และเวอร์ชันที่ซื่อสัตย์ของการเปรียบเทียบนั้นคือ: ราคาที่คิดตามการใช้ทำให้คุณได้โมเดลที่วัดผลได้ มีการสนับสนุน และมีสัญญาอนุญาตเชิงพาณิชย์ ส่วนเวตทำให้คุณได้ไฟล์ดาวน์โหลด 33 GB และไฟล์สัญญาอนุญาตที่ระบุว่าใช้เพื่อการค้าไม่ได้เท่านั้น
ข้อแลกเปลี่ยนนั้นคือจุดที่เลเยอร์การจัดเส้นทางได้พิสูจน์คุณค่าของตัวเองพอดี OrcaRouter นำโมเดลกว่า 200 รุ่นมาไว้เบื้องหลังเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงจุดเดียว ในราคาตามรายการของผู้ให้บริการโดยไม่บวกราคาเพิ่ม พร้อมการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดปัญหา — ดังนั้น ทีมที่ต้องการประเมินโมเดลเปิดที่ยังไม่ได้วัดผลไม่จำเป็นต้องย้ายระบบโปรดักชันไปไว้บนโมเดลนั้นเพื่อทำการประเมิน, และเนื่องจากราคาตามรายการถูกส่งผ่าน การเปลี่ยนแปลงราคาของผู้ขายใด ๆ บนโมเดลที่ถูกจัดเส้นทางจะมาถึงฝั่งเราในวันเดียวกัน แทนที่จะรอถึงการต่อสัญญาครั้งถัดไป ทั้ง MAI-Image-2.5-Pro และ Qwen-Image 2.1 ต่างก็ไม่ใช่หนึ่งในโมเดลที่เราจัดเส้นทางในปัจจุบัน และบทความนี้จะไม่เสนอเป็นอย่างอื่น สายผลิตภัณฑ์ภาพที่เรานำมาให้บริการจริงคือตระกูล GPT-Image ของ OpenAI, Imagen 4 ระดับต่าง ๆ ของ Google และตัวอย่างภาพ Gemini และเอนด์พอยต์ภาพ Grok Imagine ของ xAI

คำกล่าวอ้างของผู้ขายอยู่ตรงไหน และควรให้น้ำหนักกับคำกล่าวอ้างเหล่านั้นมากแค่ไหน
ทั้งสองบริษัทเผยแพร่ตัวเลขที่ไม่มีบุคคลที่สามรายใดสามารถทำซ้ำได้ และควรอ่านตัวเลขเหล่านั้นด้วยความสงสัยแบบเดียวกันทั้งสองทาง
• คำกล่าวอ้างของ Microsoft — ความแม่นยำในการเรนเดอร์ข้อความ 96.8% ในภาษาอังกฤษ จีน ญี่ปุ่น เกาหลี และสเปน; การปฏิบัติตามพรอมป์ตดีกว่า GPT-Image-1.5 ถึง 27%; ความสม่ำเสมอของตัวละครในหลายภาพ 94%; และต้นทุน GPU ที่ต่ำลงถึง 84–89% ในสถานการณ์ภายในของ Microsoft ที่เจาะจง ข้อสุดท้ายเป็นข้อที่ต้องระวัง เพราะมันอธิบายการกำหนดค่าการให้บริการของ Microsoft เอง ไม่ใช่สิ่งที่ลูกค้าสามารถตรวจสอบได้
• ข้อกล่าวอ้างของ Alibaba — บทความบล็อก Qwen-Image 2.1 มีแผนภูมิเปรียบเทียบ Qwen-Image-Bench และตัวเลขในแผนภูมินั้นเป็นของผู้ขายเอง นอกจากนี้ยังมีตัวเลขที่เผยแพร่ในการรายงานของบุคคลที่สามซึ่งบรรยายว่าโมเดลนี้เป็น transformer 20 เลเยอร์ ซึ่งขัดแย้งกับโมเดลการ์ดที่ระบุว่าเป็น single-stream DiT 32 เลเยอร์; โมเดลการ์ดเป็นแหล่งข้อมูลปฐมภูมิ และตัวเลข 32 เลเยอร์คือตัวเลขที่ควรใช้
ความแตกต่างระหว่างสองสถานการณ์นี้ไม่ใช่ความซื่อสัตย์ของผู้ขายรายใดรายหนึ่ง แต่เป็นว่าโมเดลของ Microsoft ได้รับการวัดผลอย่างอิสระแล้ว ส่วนของ Alibaba ยังไม่ได้รับการวัดผล ดังนั้นคำกล่าวอ้างของ Microsoft จึงสามารถตรวจสอบเทียบกับสิ่งใดสิ่งหนึ่งได้ ขณะที่คำกล่าวอ้างของ Alibaba ยังไม่สามารถตรวจสอบเทียบกับสิ่งใดได้เลย
แต่ละอันใช้ทำอะไร
เมื่ออ่านรวมกันแล้ว สิ่งเหล่านี้ไม่ได้แย่งช่องเดียวกัน
• MAI-Image-2.5-Pro คือเครื่องมือแก้ไขภาพ มันเป็นอันดับหนึ่งในลีดเดอร์บอร์ดด้านการแก้ไขภาพจากฐานคะแนนโหวตขนาดใหญ่ รองรับคำสั่งยาว (โทเค็นอินพุตข้อความ 32k, บริบท 131k) มีสัญญาอนุญาตใช้งานเชิงพาณิชย์ และพร้อมให้ใช้งานแล้วในฐานะพรีวิวสาธารณะบน Microsoft Foundry และ MAI Playground หากงานของคุณคือการแก้ไขภาพแบบทำซ้ำ และคุณจำเป็นต้องรู้ก่อนตัดสินใจว่ามันเป็นเครื่องมือที่ดีที่สุดที่มีสำหรับงานนั้น นี่คือคำตอบที่ผ่านการวัดแล้ว และมีค่าใช้จ่ายประมาณ $108.50 ต่อพันภาพ
• Qwen-Image 2.1 เป็นชิ้นงานวิจัยแบบเปิด มันเรนเดอร์ได้ใหญ่กว่า มีเช็กพอยต์สำหรับเขียนพรอมป์ต์ใหม่ที่ตรวจสอบได้ให้มาพร้อมกับโมเดลรูปภาพ รับภาพอ้างอิงได้สูงสุด 10 ภาพ พร้อมการแก้ไขเฉพาะจุดด้วยการวงกลม การวาดคำอธิบาย หรือมาสก์ และดาวน์โหลดได้ฟรี แต่การนำไปขายนั้นผิดกฎหมาย ถ้างานของคุณคือการประเมิน การวัดประสิทธิภาพ หรือการสร้างต่อยอดบนเวตที่คุณอ่านได้ มันเป็นสิ่งที่น่าสนใจกว่า — และคุณกำลังทำงานนั้นโดยไม่มีลีดเดอร์บอร์ดมาบอกว่ามันดีแค่ไหน
ยังมีความไม่สมมาตรด้านจังหวะเวลาที่ควรค่าแก่การเอ่ยถึงอีกประการหนึ่ง MAI-Image-2.6 เข้าสู่ช่วงพรีวิวแบบส่วนตัวเมื่อวันที่ 19 สิงหาคม 2026 ซึ่งหมายความว่าโมเดลที่อยู่บนสุดของกระดานจัดอันดับด้านการแก้ไขภาพนั้นล้าหนึ่งรุ่นเมื่อเทียบกับสิ่งที่ Microsoft กำลังเตรียมเปิดตัว ตรงกันข้าม Qwen-Image 2.1 อยู่ในวันแรก โดยมีโปรแกรมเข้าถึงก่อนกำหนดที่ขอให้ผู้ทดสอบเผยแพร่ภายในวันที่ 29 กันยายน กระดานคะแนนทั้งสองแห่งในการเปรียบเทียบนี้จะดูแตกต่างออกไปภายในหนึ่งเดือน


อะไรจะยุติเรื่องนี้ได้
เรื่องหนึ่ง: การที่ Qwen-Image 2.1 ปรากฏอยู่บนลีดเดอร์บอร์ด ทุกอย่างในบทความนี้ที่ไม่ใช่เพดานความละเอียดหรือราคา ล้วนเป็นคำกล่าวอ้างของแล็บใดแล็บหนึ่ง และเหตุผลทั้งหมดที่ทำให้สามารถแนะนำ MAI-Image-2.5-Pro ได้อย่างหน้าตาเฉย คือคน 6,100 คนที่ไม่ได้ทำงานให้ Microsoft ได้ดูผลลัพธ์ของมันเทียบกับสิ่งอื่น แล้วชอบมันมากกว่า นั่นคือมาตรฐานที่โมเดลแบบเปิดยังทำไม่ถึง และเป็นมาตรฐานที่มันควรถูกวัดด้วย
จนกว่าจะถึงตอนนั้น การตีความในทางปฏิบัติก็ง่ายมาก ถ้าคุณต้องการโมเดลสำหรับแก้ไขภาพวันนี้ ภายใต้ใบอนุญาตเชิงพาณิชย์ พร้อมสกอร์บอร์ดรองรับ คำตอบคือของ Microsoft และมีค่าใช้จ่ายประมาณ 108.50 ดอลลาร์ต่อหนึ่งพันภาพ ถ้าคุณอยากรู้ว่าโมเดล 7B open-weights ที่มีเอาต์พุต 2K แบบเนทีฟและตัวเขียนพรอมป์ต์ใหม่ที่ตรวจสอบได้นั้นดีกว่าหรือไม่ คุณต้องวัดด้วยตัวเอง — และสิ่งที่มีประโยชน์ที่สุดที่คุณทำได้กับผลลัพธ์คือเผยแพร่มัน เพราะทั้งหมวดหมู่ในตอนนี้ขาดจุดข้อมูลอยู่หนึ่งจุด
