สร้างการ์ด hero สำหรับบทความ Qwen-Image-2.1 กับ Hy Image3.5 โดยมีพาดหัวว่า Qwen-Image-2.1 vs Hy Image3.5 คำโปรยรองว่า The Boards Rank Them in Opposite Orders ชิปที่ระบุข้อความว่า Editing: Hy Image3.5 leads 1,088 to 1,074 และ Text-to-image: Qwen-Image-2.1 leads 1,034 to 975 และส่วนท้ายระบุว่า Both models scored per Artificial Analysis, September 2026 พร้อมกับโลโก้ OrcaRouter ที่คอมโพสิตไว้มุมขวาล่าง
Guides & Insights

Qwen-Image-2.1 vs Hy Image3.5: คณะกรรมการอิสระจัดอันดับทั้งสองแบบสวนทางกัน

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

จับ Qwen-Image-2.1และ Hy Image3.5มาเทียบกันแบบตัวต่อตัวบนกระดานภาพทั้งสองของ Artificial Analysis และกระดานทั้งสองก็ไม่ตรงกันว่าตัวไหนดีกว่า ในงาน text-to-image Qwen-Image-2.1 นำ Hy Image3.5 อยู่ 59 Elo — 1,034 ต่อ 975 อันดับ 18 ต่ออันดับ 66 ในการแก้ไขภาพ สองโมเดลเดียวกันนี้สลับที่กัน: Hy Image3.5อยู่ที่ 1,088 Elo และอันดับ 14 Qwen-Image-2.1อยู่ที่ 1,074 และอันดับ 18 ห่างกัน 14 คะแนนในทิศทางกลับกัน สองโมเดลนี้เปิดตัวต่อสาธารณะห่างกันสองวัน — Qwen-Image-2.1 ปล่อยเวทแบบเปิดเมื่อวันที่ 20 กันยายน 2026 ส่วน Hy Image3.5 เปิดให้ดูตัวอย่างสาธารณะเมื่อวันที่ 22 กันยายน 2026 — และนี่เป็นครั้งแรกที่ทั้งคู่มีคะแนนบนเครื่องมือเดียวกัน ซึ่งเป็นสิ่งที่ทำให้ความไม่ตรงกันนี้น่าอ่านมากกว่าจะเป็นเพียงแค่การรายงาน

ทางเลือกที่ชัดเจนคือบอกว่าคณะบรรณาธิการมีเสียงอึกทึกแล้วผ่านมันไป นั่นถูกแค่ครึ่งเดียว อีกครึ่งหนึ่งคือสองแถวนั้นไม่ได้หนักแน่นเท่ากัน ราคาบนแถวหนึ่งไม่ใช่ราคาบนอีกแถว และหนึ่งในโมเดลเหล่านี้ถือสิทธิ์ในเวต ขณะที่อีกโมเดลหนึ่งจะไม่มีวันถือ

สองบอร์ด สองคำสั่ง

Artificial Analysis ทำการเปรียบเทียบแบบคู่โดยไม่เปิดเผยชื่อ — ป้อนพรอมป์ต์เดียวกันให้สองโมเดล ผู้ลงคะแนนเลือกผู้ชนะ คะแนน Elo จะสะสม — และเผยแพร่บอร์ดแยกต่างหากสำหรับแต่ละงาน บอร์ด text-to-image มี 166 แถว ส่วนบอร์ด editing มี 97 แถว แถวของทั้งสองโมเดลมาจากสแนปช็อตของผู้ให้บริการรายเดียวกัน ดังนั้นนี่จึงไม่ใช่ความคลาดเคลื่อนของเวอร์ชัน

• การสร้างภาพจากข้อความ — Qwen-Image-2.1 อยู่ที่ 1,034 Elo (ช่วง 1,024 ถึง 1,044) จากการเปรียบเทียบ 5,286 ครั้ง จัดอันดับ 18 จาก 166 Hy Image3.5 อยู่ที่ 975 Elo (ช่วง 966 ถึง 984) จากการเปรียบเทียบ 5,334 ครั้ง จัดอันดับ 66 จาก 166 ช่วงทั้งสองไม่ทับซ้อนกัน ความต่าง 59 คะแนนบนตัวอย่างที่มีขนาดใกล้เคียงกันถือเป็นการจัดลำดับที่แท้จริง ไม่ใช่สิ่งที่เกิดจากการปัดเศษ

• การแก้ไขภาพ — Hy Image3.5 ที่ 1,088 Elo (ช่วง 1,079 ถึง 1,097) จากการเปรียบเทียบ 5,550 ครั้ง อยู่อันดับ 14 จาก 97. Qwen-Image-2.1 ที่ 1,074 Elo (ช่วง 1,065 ถึง 1,083) จากการเปรียบเทียบ 5,536 ครั้ง อยู่อันดับ 18 จาก 97. ช่วงเหล่านั้นทับซ้อนกันในช่วงสี่จุดที่ 1,079 ถึง 1,083. การจัดลำดับเป็นเพียงทิศทาง ยังไม่ถือเป็นข้อสรุปที่ยืนยันแล้ว

• ขนาดตัวอย่างใกล้เคียงกันบนทั้งสองบอร์ด — 5,286 เทียบกับ 5,334 ในงาน text-to-image, 5,536 เทียบกับ 5,550 ในงาน editing — ดังนั้นความแตกต่างของความมั่นใจจึงไม่ใช่เรื่องที่โมเดลหนึ่งได้รับการโหวตน้อยเกินไป

บอร์ดติดป้ายกำกับโมเดลต่างกัน และนั่นสำคัญ: แถวของ Qwen-Image-2.1 มีเครื่องหมาย Open Weights ส่วนแถวของ Hy Image3.5 ไม่มี

ดังนั้นการตีความอย่างตรงไปตรงมาจึงไม่สมมาตร การสร้างภาพจากข้อความ: Qwen-Image-2.1 ชนะอย่างชัดเจน ส่วนการแก้ไขภาพ: Hy Image3.5 น่าจะนำอยู่ โดยมีส่วนต่างที่อยู่ในช่วงความคลาดเคลื่อนของการวัด

ความไม่สมมาตรนั้นมาจากไหน

จุดแข็งด้านการแก้ไขของ Hy Image3.5 ไม่ใช่เรื่องน่าประหลาดใจ เมื่อคุณดูว่าทาง Tencent ส่งมันมาพร้อมอะไรบ้าง ตัวพรีวิวเปิดสู่สาธารณะโดยรองรับภาพอ้างอิงสูงสุดห้าภาพต่อคำขอ ทั้ง text-to-image และ image-to-image ในโมเดลเดียวกัน และการแก้ไขแบบหลายเทิร์น — ความสามารถด้านการแก้ไขคือสิ่งที่ได้รับการเน้นตอนเปิดตัว Qwen-Image-2.1 ถูกสร้างด้วยสแต็กการสร้างและการแก้ไขแบบรวมเป็นหนึ่งซึ่งจัดการภาพอ้างอิงได้เช่นกัน แต่แถวต่างๆ บนบอร์ดของมันแสดงให้เห็นว่าฝั่งการแก้ไขจบที่คะแนน Elo ต่ำกว่า Qwen-Image-3.0-Pro ของ Alibaba เองสองคะแนน ซึ่งเป็นผลลัพธ์ที่แคบกว่าที่กรอบการเปิดตัวบอกเป็นนัยไว้

คำกล่าวอ้างของ Tencent เองก็ไม่ตรงกับสิ่งที่บอร์ดจัดอันดับแสดงเช่นกัน ผู้ให้บริการอ้างว่าเวอร์ชันพรีวิวมีอัตราชนะจากการประเมินแบบไม่เปิดเผยชื่อประมาณ 30% เหนือ Hy Image3.0 ตัวเลขนั้นยังไม่มีใครนอก Tencent ทำซ้ำได้ และบอร์ดจัดอันดับอิสระก็ไม่ยืนยันตัวเลขนี้ในด้านการสร้างภาพจากข้อความ — โดยที่ Hy Image3.5 preview ที่ 975 ต่ำกว่า HunyuanImage 3.0 Instruct แบบเปิดน้ำหนัก ที่ 995 อยู่ 20 Elo ในด้านการแก้ไขภาพ การเปรียบเทียบเดียวกันกลับเป็นผลดีกับผู้ให้บริการ: Hy Image3.5 preview ที่ 1,088 สูงกว่า HunyuanImage 3.0 Instruct ที่ 1,066 อยู่ 22 Elo ความก้าวหน้าหนึ่งรุ่นบนบอร์ดหนึ่ง และการถอยหลังหนึ่งก้าวบนอีกบอร์ดหนึ่ง จากรุ่นสืบทอดของ Tencent เอง

Screenshot of the Artificial Analysis image editing leaderboard, AA-Image-Editing v2.0, captured in English and cropped from the top row down through the Ideogram 4.5 row, showing GPT Image 2.5 Sunburst (max) first at 1,182 Elo from 17,899 samples, the Hunyuanimage 3.5 (Preview) row at rank 14 with 1,088 Elo and 5,550 appearances, the Qwen-Image-2.1 row at rank 18 with 1,074 Elo and 5,536 appearances and a No API available note, and the Hunyuanimage 3.0 Instruct row at 1,066 with No API available

แกนราคา ซึ่งทั้งสองสิ่งนี้ไม่สามารถเปรียบเทียบกันได้เลย

Hy Image3.5 preview เป็น API แบบคิดค่าตามการใช้งาน Tencent Cloud คิดค่าบริการ ¥0.15 สำหรับภาพ 2K บนเอนด์พอยต์จีนแผ่นดินใหญ่ และ US$0.024 บนเอนด์พอยต์ระหว่างประเทศ โดยคิดเฉพาะภาพที่ API ส่งคืนเท่านั้น คอลัมน์ราคาของ Artificial Analysis บันทึกไว้ที่ $24.00 ต่อ 1,000 ภาพ ซึ่งเป็นตัวเลขเดียวกันในหน่วยที่บอร์ดใช้ — และเมื่อเทียบกับ $210.70 ที่แถวบนสุดของบอร์ด text-to-image มีสำหรับหนึ่งพันภาพเดียวกัน มันมีราคาไม่ถึงหนึ่งในเก้าของราคานั้น

Qwen-Image-2.1 ไม่มีบรรทัดราคา เพราะมันไม่มี endpoint แถวบนกระดานทั้งสองแถวของมันมีหมายเหตุ ไม่มี API ให้ใช้งาน ระบุไว้อย่างชัดเจน คุณไม่ได้ซื้อโมเดลนี้ คุณดาวน์โหลดมัน และคุณจ่ายสำหรับมันด้วยชั่วโมง GPU และด้วยคำถามเรื่องสัญญาอนุญาตด้านล่างนี้ คะแนนเสียง 5,286 และ 5,536 ในแถวของมันมาจากผู้ที่รันเวตส์ด้วยตัวเอง ข้อเท็จจริงนี้ยังทำให้การจัดอันดับมีข้อควรระวังที่ควรค่าแก่การจดจำ: Elo อิสระสำหรับโมเดลที่เป็นแบบโฮสต์เองเท่านั้นวัดกลุ่มประชากรที่แตกต่างจาก Elo สำหรับสิ่งที่ใครก็เรียกใช้ได้

หากแผนคือการนำหนึ่งในสองตัวนี้ไปใส่ในผลิตภัณฑ์ การแบ่งแยกที่ใช้ได้จริงตอนนี้ชัดเจนแล้ว และเป็นการแบ่งแยกแบบเดียวกับที่ราคาสื่อออกมา: โมเดลที่ได้คะแนนการแก้ไขดีกว่าคือตัวที่คุณเช่าใช้ และโมเดลที่ได้คะแนน text-to-image ดีกว่าคือตัวที่คุณรันเอง OrcaRouter คือฝั่งการเช่าของเรื่องนี้ — API เดียวครอบคลุมโมเดลกว่า 200+ ตัว โดยส่งผ่านราคาตามรายการของผู้ให้บริการแบบบวกเพิ่มเป็นศูนย์ การสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง และมี routing DSL สำหรับประกอบหลายโมเดลให้เป็นการเรียกครั้งเดียว เราไม่ได้ route Hy Image3.5 preview หรือ Qwen-Image-2.1 ส่วนสายงานภาพบนแพลตฟอร์มคือ Imagen ระดับต่างๆ ของ Google และ Gemini image previews, image endpoint ของ Grok Imagine จาก xAI และตระกูล GPT-Image ของ OpenAI ทั้งสองตัวนี้ไม่ใช่ตัวเลือกแรกจากรายการนั้นหากอาศัยเพียงผลในตารางคะแนน ซึ่งเป็นเหตุผลว่าทำไมคำถามเรื่องสัญญาอนุญาตด้านล่างจึงเป็นสิ่งที่ชี้ขาด

แกนที่ไม่มีบอร์ดใดมีคอลัมน์สำหรับ

Generated comparison scoreboard for Qwen-Image-2.1 and Hy Image3.5, listing editing Elo 1,074 against 1,088 with ranks 18 and 14, editing intervals 1,065 to 1,083 against 1,079 to 1,097, text-to-image Elo 1,034 against 975 with ranks 18 and 66, and the board labels Open Weights, no API for Qwen-Image-2.1 against no Open Weights and $24.00 per 1,000 images for Hy Image3.5

Qwen-Image-2.1 เผยแพร่ภายใต้ข้อตกลงสัญญาอนุญาต Qwen Research License Agreement ลงวันที่ 20 กันยายน 2026 ซึ่งให้สิทธิ์สำหรับวัตถุประสงค์ที่ไม่ใช่เชิงพาณิชย์เท่านั้น และต้องมีสัญญาอนุญาตแยกต่างหากจากผู้ให้บริการสำหรับการใช้งานเชิงพาณิชย์อื่น ๆ ด้วยเหตุนี้ ที่เก็บข้อมูลบน Hugging Face จึงรายงานสัญญาอนุญาตนี้ว่าเป็นเช่นนั้น — มันไม่ใช่สัญญาอนุญาตแบบ OSI และไม่ควรตีความว่าเป็นเช่นนั้น เครื่องหมาย Open Weights ในทั้งสองแถวของบอร์ดนั้นถูกต้อง และไม่ได้บอกอะไรเกี่ยวกับเรื่องนี้เลย

Hy Image3.5 preview ไม่มีเวตให้授权? No.

การเปรียบเทียบที่ตอบคำถามเรื่องน้ำหนักเปิดได้จริงคือรุ่นก่อนหน้าของ Tencent เอง ไม่ใช่โมเดลของ Qwen HunyuanImage 3.0 Instruct อยู่บนทั้งสองกระดานพร้อมเครื่องหมาย Open Weights — 1,066 ด้านการแก้ไข, 995 ด้านการสร้างภาพจากข้อความ Qwen-Image-2.1 เอาชนะได้ทั้งสองด้าน ดังนั้นหากข้อกำหนดคือ "น้ำหนักที่ดาวน์โหลดได้ซึ่งฉันสามารถรันบนฮาร์ดแวร์ของตัวเอง" ตัวเลือกที่ดีที่สุดในการเปรียบเทียบนี้คือของ Alibaba ไม่ว่าจะดูกระดานไหน ภายใต้สัญญาอนุญาตที่ยังห้ามขายผลลัพธ์

ไม่มีเวอร์ชันไหนของเรื่องนี้ที่งานเอกสารจะคลี่คลายไปเอง คุณจะได้อย่างใดอย่างหนึ่ง: คะแนนการแก้ไขที่ดีกว่าโดยไม่มีเวตโมเดลให้ใช้และมีบิลแบบคิดตามปริมาณการใช้งาน หรือคะแนนการแปลงข้อความเป็นภาพที่ดีกว่าด้วยเวตโมเดลที่คุณอาจใช้เชิงพาณิชย์ไม่ได้ เลือกว่าข้อจำกัดไหนที่คุณอยู่ด้วยได้ แล้วไปวัดทั้งสองแบบบนพรอมป์ของคุณเอง — ช่องว่างด้านการแก้ไขระหว่างสองแบบกว้าง 4 จุดภายในช่วงที่ทับซ้อนกัน ซึ่งเป็นส่วนต่างแบบที่ชุดพรอมป์ที่กันไว้สำหรับประเมินเพียงชุดเดียวก็ลบหายได้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube