
Qwen-Image-2.1 vs Hy Image3.5: คณะกรรมการอิสระจัดอันดับทั้งสองแบบสวนทางกัน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 223 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
จับ Qwen-Image-2.1และ Hy Image3.5มาเทียบกันแบบตัวต่อตัวบนกระดานภาพทั้งสองของ Artificial Analysis และกระดานทั้งสองก็ไม่ตรงกันว่าตัวไหนดีกว่า ในงาน text-to-image Qwen-Image-2.1 นำ Hy Image3.5 อยู่ 59 Elo — 1,034 ต่อ 975 อันดับ 18 ต่ออันดับ 66 ในการแก้ไขภาพ สองโมเดลเดียวกันนี้สลับที่กัน: Hy Image3.5อยู่ที่ 1,088 Elo และอันดับ 14 Qwen-Image-2.1อยู่ที่ 1,074 และอันดับ 18 ห่างกัน 14 คะแนนในทิศทางกลับกัน สองโมเดลนี้เปิดตัวต่อสาธารณะห่างกันสองวัน — Qwen-Image-2.1 ปล่อยเวทแบบเปิดเมื่อวันที่ 20 กันยายน 2026 ส่วน Hy Image3.5 เปิดให้ดูตัวอย่างสาธารณะเมื่อวันที่ 22 กันยายน 2026 — และนี่เป็นครั้งแรกที่ทั้งคู่มีคะแนนบนเครื่องมือเดียวกัน ซึ่งเป็นสิ่งที่ทำให้ความไม่ตรงกันนี้น่าอ่านมากกว่าจะเป็นเพียงแค่การรายงาน
ทางเลือกที่ชัดเจนคือบอกว่าคณะบรรณาธิการมีเสียงอึกทึกแล้วผ่านมันไป นั่นถูกแค่ครึ่งเดียว อีกครึ่งหนึ่งคือสองแถวนั้นไม่ได้หนักแน่นเท่ากัน ราคาบนแถวหนึ่งไม่ใช่ราคาบนอีกแถว และหนึ่งในโมเดลเหล่านี้ถือสิทธิ์ในเวต ขณะที่อีกโมเดลหนึ่งจะไม่มีวันถือ
สองบอร์ด สองคำสั่ง
Artificial Analysis ทำการเปรียบเทียบแบบคู่โดยไม่เปิดเผยชื่อ — ป้อนพรอมป์ต์เดียวกันให้สองโมเดล ผู้ลงคะแนนเลือกผู้ชนะ คะแนน Elo จะสะสม — และเผยแพร่บอร์ดแยกต่างหากสำหรับแต่ละงาน บอร์ด text-to-image มี 166 แถว ส่วนบอร์ด editing มี 97 แถว แถวของทั้งสองโมเดลมาจากสแนปช็อตของผู้ให้บริการรายเดียวกัน ดังนั้นนี่จึงไม่ใช่ความคลาดเคลื่อนของเวอร์ชัน
• การสร้างภาพจากข้อความ — Qwen-Image-2.1 อยู่ที่ 1,034 Elo (ช่วง 1,024 ถึง 1,044) จากการเปรียบเทียบ 5,286 ครั้ง จัดอันดับ 18 จาก 166 Hy Image3.5 อยู่ที่ 975 Elo (ช่วง 966 ถึง 984) จากการเปรียบเทียบ 5,334 ครั้ง จัดอันดับ 66 จาก 166 ช่วงทั้งสองไม่ทับซ้อนกัน ความต่าง 59 คะแนนบนตัวอย่างที่มีขนาดใกล้เคียงกันถือเป็นการจัดลำดับที่แท้จริง ไม่ใช่สิ่งที่เกิดจากการปัดเศษ
• การแก้ไขภาพ — Hy Image3.5 ที่ 1,088 Elo (ช่วง 1,079 ถึง 1,097) จากการเปรียบเทียบ 5,550 ครั้ง อยู่อันดับ 14 จาก 97. Qwen-Image-2.1 ที่ 1,074 Elo (ช่วง 1,065 ถึง 1,083) จากการเปรียบเทียบ 5,536 ครั้ง อยู่อันดับ 18 จาก 97. ช่วงเหล่านั้นทับซ้อนกันในช่วงสี่จุดที่ 1,079 ถึง 1,083. การจัดลำดับเป็นเพียงทิศทาง ยังไม่ถือเป็นข้อสรุปที่ยืนยันแล้ว
• ขนาดตัวอย่างใกล้เคียงกันบนทั้งสองบอร์ด — 5,286 เทียบกับ 5,334 ในงาน text-to-image, 5,536 เทียบกับ 5,550 ในงาน editing — ดังนั้นความแตกต่างของความมั่นใจจึงไม่ใช่เรื่องที่โมเดลหนึ่งได้รับการโหวตน้อยเกินไป
บอร์ดติดป้ายกำกับโมเดลต่างกัน และนั่นสำคัญ: แถวของ Qwen-Image-2.1 มีเครื่องหมาย Open Weights ส่วนแถวของ Hy Image3.5 ไม่มี
ดังนั้นการตีความอย่างตรงไปตรงมาจึงไม่สมมาตร การสร้างภาพจากข้อความ: Qwen-Image-2.1 ชนะอย่างชัดเจน ส่วนการแก้ไขภาพ: Hy Image3.5 น่าจะนำอยู่ โดยมีส่วนต่างที่อยู่ในช่วงความคลาดเคลื่อนของการวัด
ความไม่สมมาตรนั้นมาจากไหน
จุดแข็งด้านการแก้ไขของ Hy Image3.5 ไม่ใช่เรื่องน่าประหลาดใจ เมื่อคุณดูว่าทาง Tencent ส่งมันมาพร้อมอะไรบ้าง ตัวพรีวิวเปิดสู่สาธารณะโดยรองรับภาพอ้างอิงสูงสุดห้าภาพต่อคำขอ ทั้ง text-to-image และ image-to-image ในโมเดลเดียวกัน และการแก้ไขแบบหลายเทิร์น — ความสามารถด้านการแก้ไขคือสิ่งที่ได้รับการเน้นตอนเปิดตัว Qwen-Image-2.1 ถูกสร้างด้วยสแต็กการสร้างและการแก้ไขแบบรวมเป็นหนึ่งซึ่งจัดการภาพอ้างอิงได้เช่นกัน แต่แถวต่างๆ บนบอร์ดของมันแสดงให้เห็นว่าฝั่งการแก้ไขจบที่คะแนน Elo ต่ำกว่า Qwen-Image-3.0-Pro ของ Alibaba เองสองคะแนน ซึ่งเป็นผลลัพธ์ที่แคบกว่าที่กรอบการเปิดตัวบอกเป็นนัยไว้
คำกล่าวอ้างของ Tencent เองก็ไม่ตรงกับสิ่งที่บอร์ดจัดอันดับแสดงเช่นกัน ผู้ให้บริการอ้างว่าเวอร์ชันพรีวิวมีอัตราชนะจากการประเมินแบบไม่เปิดเผยชื่อประมาณ 30% เหนือ Hy Image3.0 ตัวเลขนั้นยังไม่มีใครนอก Tencent ทำซ้ำได้ และบอร์ดจัดอันดับอิสระก็ไม่ยืนยันตัวเลขนี้ในด้านการสร้างภาพจากข้อความ — โดยที่ Hy Image3.5 preview ที่ 975 ต่ำกว่า HunyuanImage 3.0 Instruct แบบเปิดน้ำหนัก ที่ 995 อยู่ 20 Elo ในด้านการแก้ไขภาพ การเปรียบเทียบเดียวกันกลับเป็นผลดีกับผู้ให้บริการ: Hy Image3.5 preview ที่ 1,088 สูงกว่า HunyuanImage 3.0 Instruct ที่ 1,066 อยู่ 22 Elo ความก้าวหน้าหนึ่งรุ่นบนบอร์ดหนึ่ง และการถอยหลังหนึ่งก้าวบนอีกบอร์ดหนึ่ง จากรุ่นสืบทอดของ Tencent เอง

แกนราคา ซึ่งทั้งสองสิ่งนี้ไม่สามารถเปรียบเทียบกันได้เลย
Hy Image3.5 preview เป็น API แบบคิดค่าตามการใช้งาน Tencent Cloud คิดค่าบริการ ¥0.15 สำหรับภาพ 2K บนเอนด์พอยต์จีนแผ่นดินใหญ่ และ US$0.024 บนเอนด์พอยต์ระหว่างประเทศ โดยคิดเฉพาะภาพที่ API ส่งคืนเท่านั้น คอลัมน์ราคาของ Artificial Analysis บันทึกไว้ที่ $24.00 ต่อ 1,000 ภาพ ซึ่งเป็นตัวเลขเดียวกันในหน่วยที่บอร์ดใช้ — และเมื่อเทียบกับ $210.70 ที่แถวบนสุดของบอร์ด text-to-image มีสำหรับหนึ่งพันภาพเดียวกัน มันมีราคาไม่ถึงหนึ่งในเก้าของราคานั้น
Qwen-Image-2.1 ไม่มีบรรทัดราคา เพราะมันไม่มี endpoint แถวบนกระดานทั้งสองแถวของมันมีหมายเหตุ ไม่มี API ให้ใช้งาน ระบุไว้อย่างชัดเจน คุณไม่ได้ซื้อโมเดลนี้ คุณดาวน์โหลดมัน และคุณจ่ายสำหรับมันด้วยชั่วโมง GPU และด้วยคำถามเรื่องสัญญาอนุญาตด้านล่างนี้ คะแนนเสียง 5,286 และ 5,536 ในแถวของมันมาจากผู้ที่รันเวตส์ด้วยตัวเอง ข้อเท็จจริงนี้ยังทำให้การจัดอันดับมีข้อควรระวังที่ควรค่าแก่การจดจำ: Elo อิสระสำหรับโมเดลที่เป็นแบบโฮสต์เองเท่านั้นวัดกลุ่มประชากรที่แตกต่างจาก Elo สำหรับสิ่งที่ใครก็เรียกใช้ได้
หากแผนคือการนำหนึ่งในสองตัวนี้ไปใส่ในผลิตภัณฑ์ การแบ่งแยกที่ใช้ได้จริงตอนนี้ชัดเจนแล้ว และเป็นการแบ่งแยกแบบเดียวกับที่ราคาสื่อออกมา: โมเดลที่ได้คะแนนการแก้ไขดีกว่าคือตัวที่คุณเช่าใช้ และโมเดลที่ได้คะแนน text-to-image ดีกว่าคือตัวที่คุณรันเอง OrcaRouter คือฝั่งการเช่าของเรื่องนี้ — API เดียวครอบคลุมโมเดลกว่า 200+ ตัว โดยส่งผ่านราคาตามรายการของผู้ให้บริการแบบบวกเพิ่มเป็นศูนย์ การสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง และมี routing DSL สำหรับประกอบหลายโมเดลให้เป็นการเรียกครั้งเดียว เราไม่ได้ route Hy Image3.5 preview หรือ Qwen-Image-2.1 ส่วนสายงานภาพบนแพลตฟอร์มคือ Imagen ระดับต่างๆ ของ Google และ Gemini image previews, image endpoint ของ Grok Imagine จาก xAI และตระกูล GPT-Image ของ OpenAI ทั้งสองตัวนี้ไม่ใช่ตัวเลือกแรกจากรายการนั้นหากอาศัยเพียงผลในตารางคะแนน ซึ่งเป็นเหตุผลว่าทำไมคำถามเรื่องสัญญาอนุญาตด้านล่างจึงเป็นสิ่งที่ชี้ขาด
แกนที่ไม่มีบอร์ดใดมีคอลัมน์สำหรับ

Qwen-Image-2.1 เผยแพร่ภายใต้ข้อตกลงสัญญาอนุญาต Qwen Research License Agreement ลงวันที่ 20 กันยายน 2026 ซึ่งให้สิทธิ์สำหรับวัตถุประสงค์ที่ไม่ใช่เชิงพาณิชย์เท่านั้น และต้องมีสัญญาอนุญาตแยกต่างหากจากผู้ให้บริการสำหรับการใช้งานเชิงพาณิชย์อื่น ๆ ด้วยเหตุนี้ ที่เก็บข้อมูลบน Hugging Face จึงรายงานสัญญาอนุญาตนี้ว่าเป็นเช่นนั้น — มันไม่ใช่สัญญาอนุญาตแบบ OSI และไม่ควรตีความว่าเป็นเช่นนั้น เครื่องหมาย Open Weights ในทั้งสองแถวของบอร์ดนั้นถูกต้อง และไม่ได้บอกอะไรเกี่ยวกับเรื่องนี้เลย
Hy Image3.5 preview ไม่มีเวตให้授权? No.
การเปรียบเทียบที่ตอบคำถามเรื่องน้ำหนักเปิดได้จริงคือรุ่นก่อนหน้าของ Tencent เอง ไม่ใช่โมเดลของ Qwen HunyuanImage 3.0 Instruct อยู่บนทั้งสองกระดานพร้อมเครื่องหมาย Open Weights — 1,066 ด้านการแก้ไข, 995 ด้านการสร้างภาพจากข้อความ Qwen-Image-2.1 เอาชนะได้ทั้งสองด้าน ดังนั้นหากข้อกำหนดคือ "น้ำหนักที่ดาวน์โหลดได้ซึ่งฉันสามารถรันบนฮาร์ดแวร์ของตัวเอง" ตัวเลือกที่ดีที่สุดในการเปรียบเทียบนี้คือของ Alibaba ไม่ว่าจะดูกระดานไหน ภายใต้สัญญาอนุญาตที่ยังห้ามขายผลลัพธ์
ไม่มีเวอร์ชันไหนของเรื่องนี้ที่งานเอกสารจะคลี่คลายไปเอง คุณจะได้อย่างใดอย่างหนึ่ง: คะแนนการแก้ไขที่ดีกว่าโดยไม่มีเวตโมเดลให้ใช้และมีบิลแบบคิดตามปริมาณการใช้งาน หรือคะแนนการแปลงข้อความเป็นภาพที่ดีกว่าด้วยเวตโมเดลที่คุณอาจใช้เชิงพาณิชย์ไม่ได้ เลือกว่าข้อจำกัดไหนที่คุณอยู่ด้วยได้ แล้วไปวัดทั้งสองแบบบนพรอมป์ของคุณเอง — ช่องว่างด้านการแก้ไขระหว่างสองแบบกว้าง 4 จุดภายในช่วงที่ทับซ้อนกัน ซึ่งเป็นส่วนต่างแบบที่ชุดพรอมป์ที่กันไว้สำหรับประเมินเพียงชุดเดียวก็ลบหายได้
