การ์ดหลักสำหรับการเปรียบเทียบระหว่าง Qwen-Image 2.1 ซึ่งเป็นโมเดลแบบเปิดน้ำหนักที่ไม่มีคะแนนอิสระ กับ MAI-Image-2.5-Pro ผู้นำที่วัดได้ของอารีนาการแก้ไขภาพของ Artificial Analysis ที่ Elo 1,272
Guides & Insights

Qwen-Image 2.1 vs MAI-Image-2.5-Pro: 6,100 โหวตแบบไม่เปิดเผย กับศูนย์

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

หนึ่งในสองโมเดลนี้ได้รับการจัดอันดับจากผลการเปรียบเทียบแบบไม่ระบุตัวตนโดยมนุษย์ราว 6,100 ครั้ง ส่วนอีกโมเดลหนึ่งยังไม่เคยถูกใครที่อยู่นอกห้องแล็บของตัวเองจัดอันดับเลย MAI-Image-2.5-Pro ซึ่งเป็นโมเดลรูปภาพระดับพรีเมียมของ Microsoft ครองอันดับหนึ่งบน Artificial Analysis image editing arena ด้วยคะแนน Elo 1,272 — เป็นผลลัพธ์ที่มีผู้โหวตมากที่สุดในหมวดนี้ Qwen-Image 2.1 ซึ่งทีม Qwen-Image เปิดซอร์สเมื่อวันที่ 20 กันยายน 2026 ยังไม่มีคะแนนอิสระเลย และจะยังไม่มีจนกว่าจะมีคนมากพอที่จะรันมันในที่สาธารณะเพื่อสร้างคะแนนโหวต ช่องว่างตรงนี้แหละคือประเด็นจริงของการเปรียบเทียบครั้งนี้ เพราะมันเป็นความแตกต่างเพียงอย่างเดียวระหว่างสองโมเดลที่ไม่ใช่คำกล่าวอ้างของผู้ขาย ส่วนอื่น ๆ ทั้งหมด — สถาปัตยกรรม ความละเอียด ราคา — ล้วนเป็นสิ่งที่รู้ได้แต่ยังไม่พิสูจน์ และทั้งสองโมเดลใกล้เคียงกันมากบนกระดาษ จนช่องว่างทางการวัดนี้ควรเป็นสิ่งที่กำหนดการตัดสินใจ

สิ่งที่ผลการโหวตบอกจริง ๆ และสิ่งที่ไม่ได้บอก

Artificial Analysis ทำการเปรียบเทียบแบบคู่แบบไม่เปิดเผย: โมเดลสองตัวได้รับพรอมต์เดียวกัน ผู้โหวตเลือกเอาต์พุตที่ดีกว่า และ Elo ก็ได้มาจากผลลัพธ์ มันไม่ใช่เครื่องมือที่สมบูรณ์แบบ แต่เป็นสิ่งที่ใกล้เคียงที่สุดที่หมวดหมู่นี้มีต่อกระดานคะแนนร่วม และขนาดตัวอย่างก็สำคัญพอ ๆ กับตัวเลข

MAI-Image-2.5-Pro — การแก้ไขภาพอยู่อันดับ #1 ที่ Elo 1,272 จากการเปรียบเทียบราว 6,100 ครั้ง ส่วนด้าน text-to-image อยู่อันดับ #7 ด้วย Elo 1,292 ตามหลัง GPT Image 2 (high) ที่ 1,369, Reve 2.1 ที่ 1,322, Nano Banana 2 ที่ 1,320, GPT Image 1.5 (high) ที่ 1,310 และ MAI-Image-2.5 ที่ 1,304

Qwen-Image 2.1 — ไม่มีรายการบนบอร์ดจัดอันดับใดเลย ไม่ใช่คะแนนต่ำ แต่เป็นเพราะไม่มีคะแนนเลย ณ เวลาที่เขียน การเปิดตัวนี้เพิ่งผ่านมาได้หนึ่งวัน

รูปแบบของตัวเลขเหล่านั้นควรค่าแก่การอ่านอย่างรอบคอบ เพราะมันไม่ใช่รูปแบบที่การตลาดสื่อออกมา โมเดลของ Microsoft เป็นอันดับหนึ่งในด้านการแก้ไขภาพอย่างแท้จริง และเป็นอันดับเจ็ดในด้านการสร้างภาพอย่างแท้จริง นั่นคือตำแหน่งที่เฉพาะเจาะจงและสามารถป้องกันได้ — ผู้เชี่ยวชาญด้านการแก้ไขภาพที่เป็นผู้นำในหมวดหมู่ของตัวเอง — และมันเป็นสิ่งที่แตกต่างจากการเป็นโมเดลรูปภาพที่ดีที่สุด ซึ่งมันไม่ได้เป็นเช่นนั้น ในขณะเดียวกัน โมเดลที่เอาชนะมันในด้านการสร้างภาพจากข้อความคือ GPT Image 2 (high) ซึ่งก็ไม่ใช่โมเดล OpenAI ที่ใหม่ที่สุดในสาขานี้เช่นกัน ลีดเดอร์บอร์ดอิสระให้รางวัลกับโมเดลที่ถูกวัดมากที่สุด และในการเปรียบเทียบนี้ โมเดลนั้นคือโมเดลของ Microsoft อย่างไม่ต้องสงสัย

สเปกเดียวที่โมเดลเปิดชนะขาดลอย

มีความแตกต่างที่เป็นรูปธรรมและไม่ใช่อัตวิสัยระหว่างสองสิ่งนี้ และนั่นคือ resolution

Qwen-Image 2.1สร้างภาพที่ความละเอียด 2K ได้โดยตรง โดยมีค่าเริ่มต้นตามเอกสารคือ 2048×2048 ที่ 40 ขั้นตอนการอนุมาน (inference steps) พร้อมพรีเซ็ตอัตราส่วนภาพเจ็ดแบบ และเอาต์พุตแบบ RGBA ที่มีช่องอัลฟาจริงแทนการใช้เลเยอร์พื้นทึบ (matte)

MAI-Image-2.5-Proจำกัดเอาต์พุตไว้ที่ 1,048,576 พิกเซล — ประมาณหนึ่งเมกะพิกเซล ตัวเลขสเปกที่เป็นจุดขายของมันอยู่ที่อื่นแทน นั่นคือโทเคนอินพุตข้อความ 32,000 โทเคน หน้าต่างบริบท 131k และโทเคนเอาต์พุต 4,096 ซึ่งเป็นข้อความที่บ่งชี้ว่ามันรับคำสั่งได้มากแค่ไหน ไม่ใช่ปล่อยภาพออกมาได้มากแค่ไหน

สำหรับงานโซเชียลและงานผลิตภัณฑ์ส่วนใหญ่ การจำกัดที่หนึ่งล้านพิกเซลไม่ถือเป็นข้อจำกัด แต่สำหรับงานพิมพ์ สำหรับการคอมโพสิตขนาดใหญ่ หรือสำหรับอะไรก็ตามที่การครอปต้องอยู่รอด มันเป็นข้อจำกัด นี่คือมิติเดียวในการเปรียบเทียบทั้งหมดที่คุณชี้ไปที่ตัวเลขและบอกได้ว่าโมเดลเปิดนำอยู่ — และโปรดทราบว่านั่นเป็นข้อเท็จจริงเชิงสถาปัตยกรรมจากโมเดลการ์ด ไม่ใช่การกล่าวอ้างเรื่องคุณภาพ Qwen-Image 2.1 จะเรนเดอร์ที่ 2048×2048 ไม่ว่าจะเรนเดอร์สิ่งใดที่ควรค่าแก่การดูหรือไม่ก็ตาม

ราคา ซึ่งเป็นจุดที่การเปรียบเทียบเริ่มอึดอัด

MAI-Image-2.5-Pro ถูกกำหนดราคาเป็นโมเดลระดับพรีเมียม และตัวเลขก็ไม่ใช่ความแตกต่างเล็กน้อย: 5 ดอลลาร์ต่อโทเค็นอินพุตข้อความหนึ่งล้านโทเค็น, 8 ดอลลาร์ต่อโทเค็นอินพุตรูปภาพหนึ่งล้านโทเค็น และ 106 ดอลลาร์ต่อโทเค็นเอาต์พุตรูปภาพหนึ่งล้านโทเค็น ที่เอาต์พุตความละเอียด 1024 พิกเซล คิดเป็นประมาณ 108.50 ดอลลาร์ต่อภาพหนึ่งพันภาพ เมื่อเทียบเป็นสเกล นั่นคิดเป็นประมาณ 2.3 เท่าของต้นทุน MAI-Image-2.5 และประมาณ 5.4 เท่าของ MAI-Image-2.5-Flash ดังนั้น Microsoft จึงจงใจแบ่งกลุ่มสายผลิตภัณฑ์ของตน แทนที่จะตั้งราคาระดับ Pro เป็นการอัปเกรดแบบเพิ่มขึ้นทีละขั้น

Qwen-Image 2.1 ไม่มีราคาแบบโฮสต์ เพราะไม่มีเอนด์พอยต์แบบโฮสต์ — มันคือการดาวน์โหลดเวตภายใต้สัญญาอนุญาตสำหรับงานวิจัย ค่าใช้จ่ายของมันคือเวลา GPU ของคุณ และข้อจำกัดของมันคือคุณไม่สามารถขายสิ่งที่มันสร้างได้อย่างถูกกฎหมาย การเปรียบเทียบ $108.50 ต่อพันภาพกับ "เวตฟรี" ก็เหมือนการเปรียบเทียบบริการกับเครื่องจักร และเวอร์ชันที่ซื่อสัตย์ของการเปรียบเทียบนั้นคือ: ราคาที่คิดตามการใช้ทำให้คุณได้โมเดลที่วัดผลได้ มีการสนับสนุน และมีสัญญาอนุญาตเชิงพาณิชย์ ส่วนเวตทำให้คุณได้ไฟล์ดาวน์โหลด 33 GB และไฟล์สัญญาอนุญาตที่ระบุว่าใช้เพื่อการค้าไม่ได้เท่านั้น

ข้อแลกเปลี่ยนนั้นคือจุดที่เลเยอร์การจัดเส้นทางได้พิสูจน์คุณค่าของตัวเองพอดี OrcaRouter นำโมเดลกว่า 200 รุ่นมาไว้เบื้องหลังเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงจุดเดียว ในราคาตามรายการของผู้ให้บริการโดยไม่บวกราคาเพิ่ม พร้อมการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดปัญหา — ดังนั้น ทีมที่ต้องการประเมินโมเดลเปิดที่ยังไม่ได้วัดผลไม่จำเป็นต้องย้ายระบบโปรดักชันไปไว้บนโมเดลนั้นเพื่อทำการประเมิน, และเนื่องจากราคาตามรายการถูกส่งผ่าน การเปลี่ยนแปลงราคาของผู้ขายใด ๆ บนโมเดลที่ถูกจัดเส้นทางจะมาถึงฝั่งเราในวันเดียวกัน แทนที่จะรอถึงการต่อสัญญาครั้งถัดไป ทั้ง MAI-Image-2.5-Pro และ Qwen-Image 2.1 ต่างก็ไม่ใช่หนึ่งในโมเดลที่เราจัดเส้นทางในปัจจุบัน และบทความนี้จะไม่เสนอเป็นอย่างอื่น สายผลิตภัณฑ์ภาพที่เรานำมาให้บริการจริงคือตระกูล GPT-Image ของ OpenAI, Imagen 4 ระดับต่าง ๆ ของ Google และตัวอย่างภาพ Gemini และเอนด์พอยต์ภาพ Grok Imagine ของ xAI

Two-column scoreboard for Qwen-Image 2.1 and MAI-Image-2.5-Pro: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Editing score none / Text-to-image score none / Output 2048x2048 native, RGBA / Price self-host, no hosted endpoint; MAI-Image-2.5-Pro rows read Announced 23 July 2026 / Licence commercial, via Microsoft / Editing score AA #1, Elo 1,272, about 6,100 votes / Text-to-image score AA #7, Elo 1,292 / Output capped at 1,048,576 pixels / Price about $108.50 per 1,000 images; footer reads 'MAI figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

คำกล่าวอ้างของผู้ขายอยู่ตรงไหน และควรให้น้ำหนักกับคำกล่าวอ้างเหล่านั้นมากแค่ไหน

ทั้งสองบริษัทเผยแพร่ตัวเลขที่ไม่มีบุคคลที่สามรายใดสามารถทำซ้ำได้ และควรอ่านตัวเลขเหล่านั้นด้วยความสงสัยแบบเดียวกันทั้งสองทาง

คำกล่าวอ้างของ Microsoft — ความแม่นยำในการเรนเดอร์ข้อความ 96.8% ในภาษาอังกฤษ จีน ญี่ปุ่น เกาหลี และสเปน; การปฏิบัติตามพรอมป์ตดีกว่า GPT-Image-1.5 ถึง 27%; ความสม่ำเสมอของตัวละครในหลายภาพ 94%; และต้นทุน GPU ที่ต่ำลงถึง 84–89% ในสถานการณ์ภายในของ Microsoft ที่เจาะจง ข้อสุดท้ายเป็นข้อที่ต้องระวัง เพราะมันอธิบายการกำหนดค่าการให้บริการของ Microsoft เอง ไม่ใช่สิ่งที่ลูกค้าสามารถตรวจสอบได้

ข้อกล่าวอ้างของ Alibaba — บทความบล็อก Qwen-Image 2.1 มีแผนภูมิเปรียบเทียบ Qwen-Image-Bench และตัวเลขในแผนภูมินั้นเป็นของผู้ขายเอง นอกจากนี้ยังมีตัวเลขที่เผยแพร่ในการรายงานของบุคคลที่สามซึ่งบรรยายว่าโมเดลนี้เป็น transformer 20 เลเยอร์ ซึ่งขัดแย้งกับโมเดลการ์ดที่ระบุว่าเป็น single-stream DiT 32 เลเยอร์; โมเดลการ์ดเป็นแหล่งข้อมูลปฐมภูมิ และตัวเลข 32 เลเยอร์คือตัวเลขที่ควรใช้

ความแตกต่างระหว่างสองสถานการณ์นี้ไม่ใช่ความซื่อสัตย์ของผู้ขายรายใดรายหนึ่ง แต่เป็นว่าโมเดลของ Microsoft ได้รับการวัดผลอย่างอิสระแล้ว ส่วนของ Alibaba ยังไม่ได้รับการวัดผล ดังนั้นคำกล่าวอ้างของ Microsoft จึงสามารถตรวจสอบเทียบกับสิ่งใดสิ่งหนึ่งได้ ขณะที่คำกล่าวอ้างของ Alibaba ยังไม่สามารถตรวจสอบเทียบกับสิ่งใดได้เลย

แต่ละอันใช้ทำอะไร

เมื่ออ่านรวมกันแล้ว สิ่งเหล่านี้ไม่ได้แย่งช่องเดียวกัน

MAI-Image-2.5-Pro คือเครื่องมือแก้ไขภาพ มันเป็นอันดับหนึ่งในลีดเดอร์บอร์ดด้านการแก้ไขภาพจากฐานคะแนนโหวตขนาดใหญ่ รองรับคำสั่งยาว (โทเค็นอินพุตข้อความ 32k, บริบท 131k) มีสัญญาอนุญาตใช้งานเชิงพาณิชย์ และพร้อมให้ใช้งานแล้วในฐานะพรีวิวสาธารณะบน Microsoft Foundry และ MAI Playground หากงานของคุณคือการแก้ไขภาพแบบทำซ้ำ และคุณจำเป็นต้องรู้ก่อนตัดสินใจว่ามันเป็นเครื่องมือที่ดีที่สุดที่มีสำหรับงานนั้น นี่คือคำตอบที่ผ่านการวัดแล้ว และมีค่าใช้จ่ายประมาณ $108.50 ต่อพันภาพ

Qwen-Image 2.1 เป็นชิ้นงานวิจัยแบบเปิด มันเรนเดอร์ได้ใหญ่กว่า มีเช็กพอยต์สำหรับเขียนพรอมป์ต์ใหม่ที่ตรวจสอบได้ให้มาพร้อมกับโมเดลรูปภาพ รับภาพอ้างอิงได้สูงสุด 10 ภาพ พร้อมการแก้ไขเฉพาะจุดด้วยการวงกลม การวาดคำอธิบาย หรือมาสก์ และดาวน์โหลดได้ฟรี แต่การนำไปขายนั้นผิดกฎหมาย ถ้างานของคุณคือการประเมิน การวัดประสิทธิภาพ หรือการสร้างต่อยอดบนเวตที่คุณอ่านได้ มันเป็นสิ่งที่น่าสนใจกว่า — และคุณกำลังทำงานนั้นโดยไม่มีลีดเดอร์บอร์ดมาบอกว่ามันดีแค่ไหน

ยังมีความไม่สมมาตรด้านจังหวะเวลาที่ควรค่าแก่การเอ่ยถึงอีกประการหนึ่ง MAI-Image-2.6 เข้าสู่ช่วงพรีวิวแบบส่วนตัวเมื่อวันที่ 19 สิงหาคม 2026 ซึ่งหมายความว่าโมเดลที่อยู่บนสุดของกระดานจัดอันดับด้านการแก้ไขภาพนั้นล้าหนึ่งรุ่นเมื่อเทียบกับสิ่งที่ Microsoft กำลังเตรียมเปิดตัว ตรงกันข้าม Qwen-Image 2.1 อยู่ในวันแรก โดยมีโปรแกรมเข้าถึงก่อนกำหนดที่ขอให้ผู้ทดสอบเผยแพร่ภายในวันที่ 29 กันยายน กระดานคะแนนทั้งสองแห่งในการเปรียบเทียบนี้จะดูแตกต่างออกไปภายในหนึ่งเดือน

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing GPT Image 2 (high) first at Elo 1,178 with MAI-Image-2.5-Pro listed at No. 7 with Elo 1,292, and no Qwen-Image 2.1 entry anywhere on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

อะไรจะยุติเรื่องนี้ได้

เรื่องหนึ่ง: การที่ Qwen-Image 2.1 ปรากฏอยู่บนลีดเดอร์บอร์ด ทุกอย่างในบทความนี้ที่ไม่ใช่เพดานความละเอียดหรือราคา ล้วนเป็นคำกล่าวอ้างของแล็บใดแล็บหนึ่ง และเหตุผลทั้งหมดที่ทำให้สามารถแนะนำ MAI-Image-2.5-Pro ได้อย่างหน้าตาเฉย คือคน 6,100 คนที่ไม่ได้ทำงานให้ Microsoft ได้ดูผลลัพธ์ของมันเทียบกับสิ่งอื่น แล้วชอบมันมากกว่า นั่นคือมาตรฐานที่โมเดลแบบเปิดยังทำไม่ถึง และเป็นมาตรฐานที่มันควรถูกวัดด้วย

จนกว่าจะถึงตอนนั้น การตีความในทางปฏิบัติก็ง่ายมาก ถ้าคุณต้องการโมเดลสำหรับแก้ไขภาพวันนี้ ภายใต้ใบอนุญาตเชิงพาณิชย์ พร้อมสกอร์บอร์ดรองรับ คำตอบคือของ Microsoft และมีค่าใช้จ่ายประมาณ 108.50 ดอลลาร์ต่อหนึ่งพันภาพ ถ้าคุณอยากรู้ว่าโมเดล 7B open-weights ที่มีเอาต์พุต 2K แบบเนทีฟและตัวเขียนพรอมป์ต์ใหม่ที่ตรวจสอบได้นั้นดีกว่าหรือไม่ คุณต้องวัดด้วยตัวเอง — และสิ่งที่มีประโยชน์ที่สุดที่คุณทำได้กับผลลัพธ์คือเผยแพร่มัน เพราะทั้งหมวดหมู่ในตอนนี้ขาดจุดข้อมูลอยู่หนึ่งจุด

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube