การ์ดหลักสำหรับ MAI-Image-2.5-Pro โมเดลสร้างภาพที่เน้นคุณภาพของไมโครซอฟท์ ซึ่งแสดงอันดับที่ 1 ในการแก้ไขภาพ และอันดับที่ 7 ในการสร้างภาพจากข้อความ บนกระดานผู้นำ Artificial Analysis
Guides & Insights

MAI-Image-2.5-Pro คว้าอันดับ 1 ในด้านการแก้ไขภาพ: ชัยชนะอิสระของ Microsoft พิสูจน์อะไรจริงๆ

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

MAI-Image-2.5-Pro ขณะนี้เป็นโมเดลแก้ไขภาพที่ครองอันดับหนึ่งในลีดเดอร์บอร์ดของ Artificial Analysis ซึ่งเป็นเวทีโหวตอิสระแบบไม่เปิดเผยชื่อผู้สร้าง แต่กลับรั้งอันดับเพียงเจ็ดในการสร้างภาพจากข้อความธรรมดา ความแตกต่างนี้คือเรื่องราว: โมเดลที่เปิดให้สาธารณะทดลองมาไม่ถึงเดือน สร้างโดยทีม Microsoft AI ทั้งหมดภายในองค์กร กลับแซงหน้า GPT Image 2, Reve 2.1 และโมเดลพี่น้องของมันเองอย่าง MAI-Image-2.5 ในลีดเดอร์บอร์ดด้านการแก้ไขภาพ แต่กลับตามหลังโมเดลส่วนใหญ่ในกลุ่มเดียวกันเมื่อได้รับคำสั่งให้ "วาดอะไรบางอย่างจากความว่างเปล่า" เมื่ออ่านตัวเลขทั้งสองควบคู่กัน คุณจะเห็นภาพที่ชัดเจนว่าสิ่งที่ Microsoft ปล่อยออกมาคืออะไร: มันคือผู้เชี่ยวชาญในการปรับเปลี่ยนภาพที่มีอยู่ ไม่ใช่เครื่องมือสร้างภาพอเนกประสงค์

ตัวเลขสองตัวที่อยู่เคียงข้างกัน

จากข้อมูล ณ เดือนสิงหาคม 2026 Image Editing Arena ของ Artificial Analysis จัดให้ MAI-Image-2.5-Pro อยู่ที่ อันดับ 1 ด้วย Elo 1,272 ซึ่งสร้างจากการเปรียบเทียบแบบไม่เห็นโมเดลจำนวนประมาณ 6,100 ครั้ง. กลุ่มที่ตามมานั้นสูสีมาก โดย Reve 2.1 อยู่ที่ 1,262 จากนั้น MAI-Image-2.5 และ GPT Image 2 (high) เสมอกันที่ 1,256, GPT Image 1.5 (high) อยู่ที่ 1,250, Qwen-Image-3.0-Pro อยู่ที่ 1,249 และ Nano Banana 2 ของ Go​gle อยู่ที่ 1,249 ใน Text-to-Image Arena มันอยู่ที่ อันดับ 7 ด้วย Elo 1,292 โดยตามหลัง GPT Image 2 (high) ที่ 1,369, Reve 2.1 ที่ 1,322, Nano Banana 2 ที่ 1,320, GPT Image 1.5 (high) ที่ 1,310, MAI-Image-2.5 ที่ 1,304 และ Nano Banana Pro ที่ 1,296

การแก้ไข: No. 1 — 1,272 Elo, ~6,100 ตัวอย่าง

ข้อความเป็นภาพ: No. 7 — 1,292 Elo, ~11,500 ตัวอย่าง

ระยะห่างจากอันดับ 2 ในด้านการตัดต่อ:10 Elo มากกว่า Reve 2.1

ช่องว่างกับอันดับ 1 ในด้าน text-to-image: 77 Elo ตามหลัง GPT Image 2 (สูง)

สิ่งที่ทำให้อันดับการแก้ไขมีค่ามากกว่าตัวเลขเพื่อโอ้อวดก็คือกลไก สนาม Artificial Analysis คือการจัดอันดับความชอบของมนุษย์แบบไม่เห็นตัวตน ผู้โหวตเห็นภาพต้นทางและคำสั่งเดียวกัน ได้ผลลัพธ์ที่แก้ไขแล้วสองเวอร์ชัน และเลือกเวอร์ชันที่ดีกว่า ไม่มีสคริปต์จากผู้พัฒนามาเขียนคะแนน การได้อันดับ 1 ที่นั่นจึงเป็นสิ่งที่ใกล้เคียงที่สุดที่ตลาดมีต่อคำว่า "ผู้คนชอบผลงานของตัวแก้ไขนี้มากที่สุด" — และมันคือ ล่าสุดการไต่ขึ้น ไม่ใช่แค่การพุ่งชั่วคราวในวันเปิดตัว จงถือว่าทิศทางนี้มั่นคง และถือว่าค่า Elo ที่แน่นอนเป็นเพียงตัวเลขชั่วคราว เพราะกระดานที่มีการโหวตน้อยยังคงขยับได้

Screenshot of the Artificial Analysis Image Editing Leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 and 6,133 samples, ahead of Reve 2.1 at 1,262, MAI-Image-2.5 at 1,256, and GPT Image 2 (high) at 1,256

กระดานจัดอันดับ text-to-image ที่บันทึกในวันเดียวกัน แสดงโมเดลเดียวกันในมุมที่ต่างออกไป — ไม่ได้เป็นผู้นำอีกต่อไป แต่ยังอยู่ในสิบอันดับแรกของกลุ่มที่คะแนนกระจุกตัวจาก 1,290 ถึง 1,370 Elo อย่างสบายๆ

Screenshot of the Artificial Analysis Text to Image Leaderboard showing MAI-Image-2.5-Pro at No. 7 with Elo 1,292 behind GPT Image 2 (high), Reve 2.1, Nano Banana 2, GPT Image 1.5 (high), MAI-Image-2.5, and Nano Banana Pro

MAI-Image-2.5-Pro ที่แท้จริงคืออะไร

MAI-Image-2.5-Pro คือระดับคุณภาพของ Microsoft AI ในตระกูล MAI-Image-2.5 โดยประกาศเมื่อวันที่ 23 กรกฎาคม 2026 พร้อมกับ MAI-Voice-2-Flash และเปิดให้ใช้งานแบบสาธารณะ (public preview) บน Microsoft Foundry (Azure AI Foundry) และ MAI Playground ฟรี Microsoft อธิบายว่านี่คือโมเดลภาพที่มีความเที่ยงตรงสูงสุดเท่าที่เคยมีมา มุ่งเน้นสำหรับภาพหลัก (hero imagery) การแก้ไขรายละเอียด และการเรนเดอร์ข้อความในภาพอย่างแม่นยำ ตระกูลนี้ครอบคลุมระดับต้นทุนที่หลากหลาย: MAI-Image-2.5 สำหรับงานที่สมดุล MAI-Image-2.5-Flash สำหรับปริมาณงานสูง และระดับ Pro สำหรับคุณภาพสูงสุด — โดยมีรุ่นใหม่ในตระกูลเดียวกันคือ MAI-Image-2.6 ที่อยู่ในช่วง private preview แล้วตั้งแต่วันที่ 19 สิงหาคม

ข้อกล่าวอ้างของไมโครซอฟท์เองสำหรับระดับ Pro ทั้งหมดเป็นข้อมูลที่รายงานโดยผู้จำหน่าย และยังไม่มีการพิสูจน์ซ้ำโดยอิสระแต่อย่างใด:

ความแม่นยำในการเรนเดอร์ข้อความ 96.8% — ระบุว่าครอบคลุมภาษาจีน อังกฤษ ญี่ปุ่น เกาหลี และสเปน แม้ว่าเอกสารเดียวกันนี้จะจำกัดเอาต์พุตไว้ที่ประมาณหนึ่งเมกะพิกเซล ดังนั้นถ้อยคำ "8K" ในข้อความดังกล่าวจึงควรถือเป็นเพียงการตลาด

ปฏิบัติตามพรอมต์ได้ดีกว่า GPT-Image-1.5 ถึง 27% ในการประเมินภายในของ Microsoft

94% ความสอดคล้องของตัวละครในหลายภาพตลอดการสร้าง.

ต้นทุน GPU ต่ำลงถึง 84–89% เมื่อเทียบกับโมเดล G​PT ในสถานการณ์เฉพาะของ Microsoft (PowerPoint, OneDrive) ซึ่งไม่ใช่ตัวเลขทั่วไป.

เอกสารข้อมูลจำเพาะที่บันทึกไว้คือสิ่งที่รองรับข้อกล่าวอ้างเหล่านั้น: ป้อนข้อความได้สูงสุด 32,000 โทเค็น, หน้าต่างบริบท 131k, เอาต์พุต 4,096 โทเค็น, รองรับภาพ JPEG/PNG, และจำกัดเอาต์พุตที่ 1,048,576 พิกเซล (เทียบเท่า 1024×1024) ตัวเลขสุดท้ายนั้นสำคัญสำหรับผู้ซื้อ: นี่คือคุณภาพสูง โปรแกรมแก้ไข, ไม่ใช่เครื่องสร้างภาพความละเอียดสำหรับพิมพ์

ที่ที่คุณภาพปรากฏให้เห็น

ความแข็งแกร่งในการแก้ไขที่ลีดเดอร์บอร์ดวัดผลนั้นสอดคล้องกับสิ่งที่ Microsoft เน้นย้ำ: การแก้ไขที่แม่นยำตรงจุดซึ่งคงความสอดคล้องของภาพส่วนที่เหลือไว้ การแทนที่วัตถุตามเป้าหมาย การเปลี่ยนเลย์เอาต์ การอัปเดตข้อความภายในภาพ และการลบสิ่งรบกวนอย่างภาพเบลอจากการเคลื่อนไหว — ประเภทการแก้ไขที่โมเดลรุ่นเก่ามักสร้างฉากใหม่ทั้งหมดแล้วสูญเสียตัวแบบไป เมื่อรวมกับการอ้างสิทธิ์เรื่องความสอดคล้องของตัวละครถึง 94% คุณก็จะได้โมเดลที่ออกแบบมาสำหรับเวิร์กโฟลว์ที่มีความสำคัญในเชิงพาณิชย์: นำแอสเซทที่มีอยู่มาเปลี่ยนสิ่งหนึ่ง แล้วส่งออกไป

อันดับ #7 ในการจัดอันดับ text-to-image คือเครื่องถ่วงดุลที่ซื่อสัตย์ จากพรอมป์เปล่าๆ MAI-Image-2.5-Pro ถือว่าดีแต่ไม่ใช่ผู้นำ — การตามหลัง GPT Image 2 (high) อยู่ 77 Elo คือช่องว่างที่แท้จริงบนกระดานแบบบลายด์ ตอนนี้ Microsoft ไม่ได้อ้างมงกุฎ text-to-image แต่อ้างมงกุฎด้านการแก้ไขภาพ และข้อมูลสนับสนุนการอ้างที่แคบกว่านั้นได้ดีกว่าการอ้างที่กว้างกว่ามาก

ค่าใช้จ่ายเท่าไร

MAI-Image-2.5-Pro บน Foundry มีการคิดค่าใช้จ่ายตามจำนวนโทเคน: $5 ต่อล้านโทเคนสำหรับข้อความนำเข้า, $8 ต่อล้านโทเคนสำหรับรูปภาพนำเข้า, และ $106 ต่อล้านโทเคนสำหรับรูปภาพส่งออก. ไมโครซอฟต์ไม่ได้เผยแพร่จำนวนโทเคนต่อภาพ ดังนั้นต้นทุนต่อภาพจึงเป็นการคำนวณ ไม่ใช่ใบเสนอราคา; โดยใช้การแปลงของ Artificial Analysis รูปภาพขนาด 1024×1024 จะมีต้นทุนใกล้เคียง $108.50 ต่อ 1,000 ภาพ. ซึ่งคิดเป็นประมาณ 2.3 เท่าของ MAI-Image-2.5 ในตระกูลเดียวกัน (~$48 ต่อ 1k) และ 5.4 เท่าของ MAI-Image-2.5-Flash (~$20 ต่อ 1k) — ระดับ Pro เป็นการตั้งราคาพรีเมียมอย่างจงใจ

ราคา Preview ไม่ใช่ราคา GA; เรตการ์ดช่วง Preview อาจมีการเปลี่ยนแปลงก่อนการวางจำหน่ายทั่วไป เมื่อมีการเปลี่ยนแปลงดังกล่าว ชั้นการกำหนดเส้นทางแบบส่งผ่านคือวิธีที่การลดราคาจะถึงบิลของคุณในวันเดียวกัน: บน OrcaRouter ราคารายการของผู้ให้บริการจะถูกส่งผ่านด้วยมาร์กอัป 0% ดังนั้นเมื่อ MAI-Image-2.5-Pro พร้อมใช้งานผ่าน API ของบุคคลที่สามที่เรียกใช้ได้ Microsoft คิดเท่าไร คุณก็จ่ายเท่านั้น — ไม่ต้องเจรจาใหม่ ไม่มีสัญญาฉบับที่สอง

Scoreboard for MAI-Image-2.5-Pro: image editing rank No. 1 at 1,272 Elo, text-to-image rank No. 7 at 1,292 Elo, price about USD 108.50 per 1k images, 32k text input tokens, 131k context window, ~1-megapixel output cap, preview status on Microsoft Foundry

ทำไมอันดับ #1 ถึงเป็นของบริษัท Microsoft ไม่ใช่แค่ตัวโมเดล

ผลการจัดอันดับเกิดขึ้นในช่วงเวลาที่ Microsoft กำลังเปลี่ยนโมเดลภาพของบุคคลที่สามมาเป็นโมเดลของตนเองอย่างเห็นได้ชัด MAI-Image-2.5 เป็นเอนจินเริ่มต้นใน Bing Image Creator แล้ว และทำงานใน PowerPoint, OneDrive และ Dynamics 365 Contact Center; ระดับ Pro เป็นตระกูลเดียวกันที่เน้นงานที่มีความเที่ยงตรงสูงขึ้น Microsoft กล่าวว่าโมเดล MAI ได้รับการฝึกฝนด้วยข้อมูลที่สะอาดและตรวจสอบย้อนกลับได้ "โดยไม่มีการกลั่น (distillation) จากโมเดลของบุคคลที่สาม" ซึ่งเป็นคำตอบโดยตรงต่อคำถามเรื่องการพึ่งพา OpenAI และการอ้างต้นทุน (ต้นทุน GPU ที่ต่ำลงถึง 84% ใน PowerPoint ซึ่งรายงานโดยผู้จำหน่ายและเฉพาะตามสถานการณ์) เป็นส่วนหนึ่งของเรื่องเดียวกัน: โมเดลภายในองค์กรที่ถูกกว่าต่องานเมื่อเทียบกับโมเดลที่แทนที่

หากไม่มีกระดานผู้นำอิสระ สิ่งเหล่านั้นก็ไม่อาจพิสูจน์ให้ผู้ซื้อที่ยังคลางแคลงใจเชื่อได้ ซึ่งเป็นเหตุผลที่อันดับ #1 มีความสำคัญเชิงกลยุทธ์ ไม่ใช่แค่คะแนนเท่านั้น มันเป็นหลักฐานอิสระชิ้นแรกที่แสดงว่าไลน์ภาพภายในของ Microsoft เอาชนะคู่แข่งในงานเฉพาะที่มันถูกสร้างขึ้นมา

สิ่งที่ควรดูต่อไป

เมื่อคะแนนเสียงสะสมเพิ่มขึ้น ผู้นำด้านการแก้ไขจะยังคงอยู่หรือไม่? 1,272 Elo จาก ~6,100 ตัวอย่างถือเป็นผู้นำ ไม่ได้การันตีชัยชนะ; Reve 2.1 ตามหลังอยู่ 10 คะแนน

ความพร้อมใช้งานทั่วไปและอัตราค่าบริการขั้นสุดท้าย — ราคาช่วงพรีวิวไม่ใช่ราคา GA

เพดานความละเอียด ข้อจำกัด 1 เมกะพิกเซลทำให้ Pro ไม่สามารถใช้กับงานพิมพ์ได้ แต่ถ้า Microsoft ยกเลิกข้อจำกัดนี้ สถานการณ์ก็จะเปลี่ยนไป

MAI-Image-2.6 (ตัวอย่างส่วนตัว 19 สิงหาคม) — ก้าวถัดไปของตระกูล ซึ่งครองอันดับ 2 ด้านการสร้างภาพจากข้อความบนเวทีหลักอีกแห่ง

การประเมินอย่างอิสระเกี่ยวกับข้อกล่าวอ้างของผู้จำหน่าย — ความแม่นยำในการแสดงผลข้อความและความสม่ำเสมอของตัวอักษรยังไม่ได้รับการยืนยันนอกเหนือจากไมโครซอฟต์

ข้อสรุปจากกระดานจัดอันดับแบบแยกหมวดไม่ใช่ "ไมโครซอฟต์สร้างโมเดลภาพที่ดีที่สุดในตอนนี้" แต่เป็นอะไรที่เจาะจงกว่าและมีประโยชน์มากกว่า: ไมโครซอฟต์สร้างตัวแก้ไขภาพที่ได้รับการยอมรับดีที่สุดบนลีดเดอร์บอร์ดอิสระ ในราคาพรีเมียม ในช่วงพรีวิว และมีขีดจำกัดความละเอียดแบบตายตัว หากงานของคุณคือการปรับเปลี่ยนภาพที่มีอยู่ — ภาพฮีโร่ ภาพผลิตภัณฑ์ ข้อความในภาพ — นั่นคือโมเดลที่ต้องจับตามอง หากงานของคุณคือการสร้างภาพจากผืนผ้าใบเปล่า อันดับ #7 บอกว่าตัวเลือกที่ดีกว่ายังคงเป็น GPT Image 2 — และนั่นคือการอ่านค่าที่ตรงไปตรงมาจากตัวเลขทั้งสอง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube