การ์ดฮีโร่สำหรับการจับคู่ระหว่าง MAI-Image-2.5-Pro ที่ราคาประมาณ $108.50 ต่อ 1,000 ภาพ และ Qwen-Image 3.0 ที่ราคาประมาณ $25 ต่อ 1,000 ภาพ ซึ่งเป็นโมเดลสร้างภาพผ่าน API สองตัวที่ต่างก็เป็นผู้นำด้านการเรนเดอร์ข้อความ
Guides & Insights

MAI-Image-2.5-Pro เทียบกับ Qwen-Image 3.0: ราคาแพงกว่าสี่เท่าเพื่อข้อความที่แตกต่าง

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วาง MAI-Image-2.5-Pro และ Qwen-Image 3.0 ไว้ข้างกัน และสิ่งแรกที่คุณสังเกตเห็นคือราคา: ประมาณ $108.50 ต่อ 1,000 ภาพ สำหรับระดับพรีเมียมของ Microsoft เทียบกับประมาณ $25–30 ต่อ 1,000 สำหรับ Qwen-Image 3.0 ของ Alibaba — อัตราที่ Alibaba กำหนดเองอยู่ใกล้ $25 ขณะที่ตารางจัดอันดับของ Artificial Analysis ระบุไว้ที่ $30 มากกว่าสามเท่าไม่ว่าจะเทียบกับตัวเลขใด สิ่งที่พรีเมียมนั้นให้จริง ๆ คือการทำงานกับข้อความในรูปแบบที่แตกต่าง Qwen-Image 3.0 ซึ่งเปิดตัวโดยทีม Q​wen ของ Alibaba เมื่อวันที่ 21 กรกฎาคม 2026 และเปิดให้บริการผ่าน API ระดับนานาชาติเมื่อวันที่ 4 สิงหาคม ถูกตั้งราคามาเพื่อเป็นตัวเรนเดอร์ข้อความปริมาณมาก — อ่านได้ชัดเจนจนถึง ~10px ในสิบสองภาษา พร้อมหน้าต่างพรอมต์ 4,500 โทเคนสำหรับโจทย์ที่หนาแน่น MAI-Image-2.5-Pro ซึ่งอยู่ในการพรีวิวสาธารณะบน Microsoft Foundry ตั้งแต่วันที่ 23 กรกฎาคม เป็นตัวแก้ไขภาพที่ได้รับการยอมรับมากที่สุดในตารางจัดอันดับอิสระ ด้วยความแม่นยำในการเรนเดอร์ข้อความที่ผู้ขายอ้างสิทธิ์ แต่มีขีดจำกัดเอาต์พุตแบบตายตัวที่ ~1 เมกะพิกเซล ทั้งคู่เป็นโมเดลภาพแบบ API ที่จุดขายหลักคือเรื่องข้อความ พวกมันแข่งขันกันที่ราคาต่อชิ้นงาน ไม่ใช่ที่คะแนนคุณภาพเพียงตัวเดียว

เรื่องเล่าที่เป็นข้อความสองเรื่อง ซึ่งยังไม่ผ่านการยืนยันอย่างสมบูรณ์ทั้งคู่

การต่อสู้ทางด้านข้อความคือเหตุผลที่ทั้งสองโมเดลดำรงอยู่ และยังเป็นจุดที่หลักฐานเบาบางที่สุด — ทุกตัวเลขในส่วนนี้มาจากการรายงานของผู้จำหน่าย และไม่มีตัวเลขใดที่ได้รับการทำซ้ำอย่างอิสระ

Qwen-Image 3.0 — เอกสารเผยแพร่ของ Alibaba อ้างว่าสามารถเรนเดอร์ให้อ่านชัดเจนได้จนถึงประมาณ 10px, รองรับแบบเนทีฟ 12 ภาษา พร้อมฟอนต์กว่า 20 แบบและสไตล์ศิลปะกว่า 100 สไตล์ สัญลักษณ์ทางคณิตศาสตร์ ตัวห้อย ตัวยก และสูตรหลายบรรทัด รวมถึงคุ้นเคยกับอินเทอร์เฟซเว็บ เกม และซอฟต์แวร์ทั่วไป หน้าต่างพรอมต์รองรับได้สูงสุดถึง 4,500 โทเคน ของอินพุต — เพิ่มขึ้น 4.5 เท่าเมื่อเทียบกับรุ่นก่อนหน้า — ซึ่งเป็นสิ่งที่ทำให้มันประมวลผลข้อมูลสรุปที่หนาแน่น เช่น หน้าหนังสือพิมพ์ หรือตารางความรู้ 9 ช่อง ได้ในครั้งเดียว

MAI-Image-2.5-Pro — ไมโครซอฟต์อ้างว่ามีความแม่นยำในการเรนเดอร์ข้อความ 96.8%ในภาษาจีน อังกฤษ ญี่ปุ่น เกาหลี และสเปน ซึ่งเป็นการปฏิบัติตามคำสั่งที่ดีขึ้น 27%เมื่อเทียบกับ GPT-Image-1.5 ในการประเมินภายใน และความสอดคล้องของตัวละครในหลายภาพ 94%. สเปกอินพุตกว้างขึ้นตามเอกสาร — รองรับโทเค็นอินพุตข้อความสูงสุด 32,000 โทเค็นด้วยหน้าต่างบริบท 131k — และเอาต์พุตถูกจำกัดที่ 1,048,576 พิกเซล ซึ่งเทียบเท่า 1024×1024

ข้อกล่าวอ้างทั้งสองยังไม่มีการพิสูจน์ซ้ำ ณ เวลาที่เขียนนี้ ความแตกต่างอยู่ที่รูปแบบของข้อกล่าวอ้าง: ของ Q​wen เน้นเรื่องปริมาณและความอ่านง่ายข้ามระบบอักษร ส่วนของ Microsoft เน้นเรื่องความแม่นยำและความสม่ำเสมอในกลุ่มภาษาที่กำหนดไว้ห้าภาษา ไม่มีผู้ขายรายใดเผยแพร่เกณฑ์มาตรฐานที่ห้องปฏิบัติการอื่นสามารถนำไปรันและตรวจสอบได้

การแก้ไขคือที่ซึ่งความพรีเมียมสถิตอยู่

สิ่งที่แยกทั้งสองออกจากกันคือการแก้ไขภาพ และนี่คือแกนเดียวที่มีหลักฐานอิสระ MAI-Image-2.5-Pro อยู่ที่ อันดับ 1 บน Artificial Analysis Image Editing Arena ที่ Elo 1,272 (โหวตแบบ blind ประมาณ 6,100 เสียง) นำหน้า Reve 2.1, MAI-Image-2.5 และ GPT Image 2 บนกระดานเดียวกัน Qwen-Image-3.0-Pro รุ่นใหม่กว่าอยู่ที่ 1,249 — คะแนนที่แข่งขันได้ โดยตามหลัง 23 Elo และน่าสังเกตสำหรับโมเดลที่เพิ่งเข้าถึง API ระดับนานาชาติได้ในเดือนนี้

นอกเหนือจากโมเดลพื้นฐานแล้ว ชุดเครื่องมือแก้ไขภาพของอาลีบาบาเป็นชุดเทคนิคเฉพาะทางมากกว่าความสามารถเดี่ยว: การบูรณะภาพเขียนโบราณ การสร้างภาพพาโนรามา การแปลงภาพร่างเป็นสไลด์ และการสร้างสตอรีบอร์ดแบบหลายช็อต ส่วนของไมโครซอฟต์เป็นการเดิมพันที่แคบกว่าแต่ลึกกว่า — การแก้ไขที่แม่นยำราวกับศัลยกรรมซึ่งคงความสอดคล้องของเฟรมที่เหลือไว้ (การแทนที่วัตถุ การเปลี่ยนเลย์เอาต์ การอัปเดตข้อความภายในภาพ การล้างภาพเบลอ) ซึ่งเป็นประเภทการแก้ไขที่โมเดลรุ่นเก่ามักสร้างฉากทั้งหมดใหม่แล้วทำให้ตัวแบบหายไป สำหรับเวิร์กโฟลว์แบบ "นำสินทรัพย์ที่มีอยู่ แก้ไขอย่างหนึ่ง แล้วส่งออก" อันดับที่ 1 อิสระของระดับ Pro เป็นสัญญาณที่แข็งแกร่งกว่า ส่วนสำหรับรูปแบบการแก้ไขเชิงสร้างสรรค์ที่หลากหลาย รายการของ Q​wen ครอบคลุมกว่า

Screenshot of the Artificial Analysis Image Editing leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2

ความแตกต่างของสเปก

• ราคา — ~$108.50 ต่อ 1,000 ภาพ (1024×1024, การแปลง AA) เทียบกับ ~$25–30 ต่อ 1,000 ภาพ (ราคาอ้างอิง Alibaba เทียบกับอัตราที่ระบุของ AA)br />• การเปิดตัว — 23 กรกฎาคม 2026 (พรีวิวสาธารณะ, Foundry) เทียบกับ 21 กรกฎาคม 2026, API ระหว่างประเทศ 4 ส.ค.br />• การป้อนข้อความ — 32,000 โทเคน, บริบท 131k เทียบกับหน้าต่างพรอมต์ 4,500 โทเคนbr />• เพดานเอาต์พุต — ~1,048,576 พิกเซล (~1K) เทียบกับสูงสุด 2048×2048br />• จำนวนภาพต่อการเรียก — เอาต์พุตเดียวต่อคำขอ เทียบกับสูงสุดหกภาพต่อการเรียกbr />• อันดับการแก้ไข — อันดับ 1, Elo 1,272 (AA) เทียบกับ 1,249 ของ Qwen-Image-3.0-Pro บนกระดานเดียวกันbr />• แหล่งที่มา — ข้อกล่าวอ้างของ Microsoft ที่ว่า "ไม่มีการกลั่นความรู้จากโมเดลของบุคคลที่สาม" เทียบกับป้ายกำกับแหล่งที่มา AIGC บนเอาต์พุตbr />• น้ำหนัก — ปิด, เฉพาะ API เทียบกับ ปิด, เฉพาะ API

เพดานผลลัพธ์และจำนวนผลลัพธ์ต่อการเรียกมีความสำคัญมากกว่าที่เห็น Qwen-Image 3.0 สามารถเรนเดอร์ภาพขนาด 2048×2048 และคืนภาพได้สูงสุดหกภาพต่อการเรียก ซึ่งเป็นคุณสมบัติที่คุ้มค่าสำหรับการประมวลผลแบบกลุ่ม ขณะที่ระดับ Pro ให้ผลลัพธ์สูงสุดใกล้ 1K และคืนผลลัพธ์เดียวต่อคำขอ หากโจทย์ของคุณคือ "ขอภาพผลิตภัณฑ์ชุดหนึ่งจำนวนหกภาพ" โมเดลของ Alibaba ถูกสร้างมาเพื่อสิ่งนั้น ส่วนโมเดลของ Microsoft ไม่ใช่

Two-column scoreboard for MAI-Image-2.5-Pro and Qwen-Image 3.0 comparing price per 1k images, output ceiling, images per call, prompt window, editing rank, and text-rendering claim

เมื่อเบี้ยประกันคืนทุน

กฎการตัดสินใจเกี่ยวกับว่าภาพใช้ทำอะไร ไม่ใช่ว่าโมเดลไหนจะ'ดีกว่า'

จ่ายค่าพรีเมียมสำหรับ MAI-Image-2.5-Pro เมื่อผลลัพธ์เป็นแอสเซทหลัก — ภาพผลิตภัณฑ์ โปสเตอร์ คีย์เฟรม หรือภาพที่ใช้ในแคมเปญและจะไม่ถูกสร้างขึ้นใหม่ห้าสิบครั้ง อันดับ 1 ด้านการแก้ไขและการอ้างความสม่ำเสมอของตัวละครมีความสำคัญที่สุดเมื่อการแก้ไขต้องถูกต้องในครั้งแรก

ซื้อแบบปริมาณกับ Qwen-Image 3.0เมื่อผลลัพธ์เป็นงานที่ใช้แล้วทิ้งหรือมีจำนวนมาก — โฆษณารูปแบบท้องถิ่น ภาพประกอบชั่วคราว เด็ค PPT จากภาพร่าง เฟรมสตอรีบอร์ด อะไรก็ตามที่คุณจะสร้างใหม่มากกว่าจะปรับแต่ง ที่ $25–30 ต่อ 1k การสร้างที่ล้มเหลวมีค่าใช้จ่ายแค่เศษเล็กน้อย แต่ที่ $108.50 ต่อ 1k ต้นทุนไม่ใช่แค่เศษเล็กน้อย

มีจุดกึ่งกลางที่น่าจะกล่าวถึง: สำหรับงานภาพที่มีข้อความหนาแน่นและหลายภาษา — โมกอัปแลนดิงเพจที่มีข้อความภาษาญี่ปุ่นและสเปน อินโฟกราฟิกที่มีสูตร — ความสามารถอ่านได้ที่ 10px และสิบสองภาษาของ Q​wen เป็นตัวเลือกที่ดีกว่าในทางทฤษฎี และในราคาหนึ่งในสี่ ข้อโต้แย้งของโมเดล Microsoft คือการอ้างความแม่นยำ 96.8% ในห้าภาษา แต่การอ้างนั้นยังไม่ได้รับการยืนยัน และผู้ซื้อที่ต้องเลือกระหว่างการอ้างข้อความที่ยังไม่ยืนยันสองอย่าง น่าจะให้น้ำหนักที่ราคา

Scoreboard for MAI-Image-2.5-Pro: image editing No. 1 at Elo 1,272, text-to-image No. 7 at 1,292, $108.50 per 1k images, 32k text input tokens, 131k context, ~1-megapixel output cap, public preview on Microsoft Foundry

เลเยอร์การกำหนดเส้นทาง เมื่อนำไปใช้

ทั้งสองโมเดลยังไม่สามารถเข้าถึงได้ผ่าน OrcaRouter — Qwen-Image 3.0 อยู่บน API ของ Alibaba เอง (Alibaba Cloud Bailian และแพลตฟอร์ม Q​wen) และแพลตฟอร์มของบริษัทอื่นหลายแห่ง ส่วน MAI-Image-2.5-Pro อยู่บน Microsoft Foundry — ดังนั้นการเปรียบเทียบอย่างตรงไปตรงมาก็บอกชัดเจนว่าทั้งคู่ยังไม่ได้อยู่ฝ่ายเราในวันนี้ เมื่อโมเดลใดโมเดลหนึ่งพร้อมใช้งานผ่านผู้ให้บริการโฮสต์ที่เรียกใช้ได้ หลักการคิดค่าใช้จ่ายแบบส่งผ่านก็จะมีผล: ส่วนเพิ่ม 0% เหนือราคาที่ผู้ให้บริการกำหนด ดังนั้นสิ่งที่คุณจ่ายคืออัตราค่าบริการของผู้ขาย และส่วนลดเปิดตัวหรือการลดราคาจะแสดงในบิลของคุณในวันเดียวกับที่ประกาศ ข้อโต้แย้งเรื่องการสำรองเป็นอีกครึ่งหนึ่ง: Qwen-Image 3.0 เป็น API ระหว่างประเทศที่เพิ่งเปิดตัวได้ไม่กี่สัปดาห์ ซึ่งเป็นโมเดลประเภทที่คุณส่งปริมาณการใช้งานส่วนหนึ่งไป ขณะที่ระบบสำรองที่ผ่านการพิสูจน์แล้วคอยรองรับกรณีพิเศษ — ซึ่งเป็นสิ่งที่เลเยอร์การจัดเส้นทางถูกสร้างขึ้นมาเพื่อจัดการโดยเฉพาะ

คำตัดสิน

Qwen-Image 3.0 และ MAI-Image-2.5-Pro ไม่ใช่สินค้าตัวเดียวกันที่ตั้งราคาต่างกัน แต่เป็นสินค้าคนละตัวที่บังเอิญมีราคาไม่เท่ากัน โมเดลของ Microsoft ครองตำแหน่งแชมป์ด้านการตัดต่อ มีหน้าต่างบริบท (context window) ที่ใหญ่กว่า และอ้างความแม่นยำที่ยังไม่ได้รับการพิสูจน์ในห้าภาษา — สำหรับงานหลักที่ต้องการความโดดเด่นและการแก้ไขอย่างละเอียด ส่วนต่างราคาที่สูงกว่านั้นสมเหตุสมผล โมเดลของ Alibaba เรนเดอร์ฟอนต์ได้หลากหลายกว่าอ่านง่ายกว่า รองรับบรีฟที่หนาแน่นกว่าในแต่ละรอบการสร้างตามเงื่อนไขของตัวเอง ให้ผลลัพธ์ขนาดใหญ่กว่าและทีละหกชิ้น และมีราคาแค่หนึ่งในสี่ — สำหรับงานปริมาณมากและงานข้อความในภาพหลายภาษา มันคือทางเลือกที่สมเหตุสมผลทางเศรษฐกิจ ซื้อรุ่นพรีเมียมเมื่อตัวภาพคือสินค้า ซื้อรุ่นปริมาณเมื่อตัวภาพคือคลังสินค้า

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube