การ์ดฮีโร่สำหรับการแข่งขันระหว่าง MAI-Image-2.5-Pro โมเดลแก้ไขภาพระดับพรีเมียมในพรีวิว Microsoft Foundry และ Bernini-Diffusers-v2 ไพพ์ไลน์โอเพนเวต Apache-2.0 ของ ByteDance
Guides & Insights

MAI-Image-2.5-Pro เทียบกับ Bernini-Diffusers-v2: #1 ที่วัดผลแล้ว ปะทะเดิมพันโอเพนเวตส์ที่ยังไม่ถูกวัดผล

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การเปรียบเทียบ MAI-Image-2.5-Pro กับ Bernini-Diffusers-v2ไม่ใช่การเปรียบเทียบโมเดลภาพสองตัวจริงๆ แต่เป็นการเปรียบเทียบคำตอบที่แตกต่างกันสองคำตอบสำหรับคำถามเดียวกัน — “จะทำอย่างไรให้ได้การแก้ไขภาพต้นฉบับที่ดี” — โดยฝ่ายหนึ่งมีคะแนนเสียงแบบ blind จากมนุษย์ 6,100 เสียงหนุนหลังให้ครองอันดับ 1 ด้านการแก้ไขภาพ ส่วนอีกฝ่ายมีเพียง README MAI-Image-2.5-Pro โมเดลภาพระดับคุณภาพของ Microsoft เปิดให้ใช้งานแบบพรีวิวสาธารณะบน Microsoft Foundry เมื่อวันที่ 23 กรกฎาคม 2026 และปัจจุบันครองอันดับ 1 ใน Artificial Analysis Image Editing Arena ส่วน Bernini-Diffusers-v2 เฟรมเวิร์กการสร้างแบบครบวงจรรุ่นที่สองของ ByteDance ถูกปล่อยลงบน Hugging Face เมื่อวันที่ 13 สิงหาคม 2026 ในรูปแบบน้ำหนัก (weights) ภายใต้ใบอนุญาต Apache-2.0 โดยไม่มีการประกาศใดๆ และไม่มีเกณฑ์วัดคุณภาพภาพที่ใครนอกเหนือจาก ByteDance เคยรัน ความแตกต่างเชิงปฏิบัติทุกประการในการเปรียบเทียบครั้งนี้ล้วนเป็นผลมาจากข้อเท็จจริงสองประการนั้น

หนึ่งที่คุณโทร หนึ่งที่คุณวิ่ง

MAI-Image-2.5-Pro — โมเดล API แบบโฮสต์ที่อยู่ในช่วงพรีวิวสาธารณะบน Azure AI Foundry และ MAI Playground เป็นโมเดลลิขสิทธิ์เฉพาะ คิดค่าใช้จ่ายตามจำนวนโทเค็น ไม่รองรับการ fine-tuning และไม่สามารถโฮสต์ด้วยตนเองได้ คุณจะได้รับ endpoint และจ่ายตามจำนวนโทเค็น โดย Microsoft เป็นผู้ดูแลโครงสร้างพื้นฐาน

Bernini-Diffusers-v2 — ค่าน้ำหนัก Apache-2.0 ที่คุณดาวน์โหลดจาก Hugging Face และเรียกใช้ด้วยตัวเอง สแตกนี้ประกอบด้วยตัววางแผนเชิงความหมาย Qwen2.5-VL-7B ที่ขับเคลื่อนตัวเรนเดอร์ DiT ที่ใช้ Wan2.2 และคำแนะนำฮาร์ดแวร์ใน README คือ GPU ระดับ Hopper (H100/H800/H200) พร้อม Python 3.11.2 / PyTorch 2.5.1+cu124 คุณต้องเตรียมคลัสเตอร์เอง

นั่นคือกฎการตัดสินใจในหนึ่งบรรทัด: หากองค์กรของคุณต้องการเป็นเจ้าของสแต็กเอง Bernini คือตัวเลือกหนึ่ง หากองค์กรของคุณต้องการใบแจ้งหนี้และ SLA มีเพียง MAI-Image-2.5-Pro เท่านั้นที่อยู่ในเกณฑ์การพิจารณา พวกมันไม่ใช่สิ่งทดแทนซึ่งกันและกัน

ช่องว่างของหลักฐานคือพาดหัวข่าวที่แท้จริง

โมเดลทั้งสองอยู่คนละฝั่งของปัญหาคุณภาพที่ใหญ่ที่สุดในวงการ AI ภาพ นั่นคือการวัดผลลัพธ์ ทักษะการแก้ไขภาพของ MAI-Image-2.5-Pro ได้รับการให้คะแนนอย่างอิสระ — อันดับ 1 ใน Artificial Analysis Image Editing Arena ที่ Elo 1,272 จากการเปรียบเทียบแบบปกปิดประมาณ 6,100 ครั้งนำหน้า Reve 2.1, GPT Image 2, และ MAI-Image-2.5 ซึ่งเป็นรุ่นน้องของตัวเอง อันดับ text-to-image อยู่อันดับที่เจ็ดที่ Elo 1,292 ซึ่งเป็นตัวถ่วงดุลที่ตรงไปตรงมา: มันเป็นผู้เชี่ยวชาญด้านการแก้ไขภาพ ไม่ใช่ผู้นำด้านการสร้างภาพจากผืนผ้าใบว่างเปล่า ตัวเลขเหล่านี้สามารถตรวจสอบได้โดยใครก็ตามที่มีเบราว์เซอร์

Bernini-Diffusers-v2 ไม่มีคะแนนสาธารณะเทียบเท่าให้อ้างอิงได้ การ์ดโมเดลรายงาน EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 และ VBench 84.46 — ทั้งหมดเป็นข้อมูลที่ผู้ผลิตแจ้งไว้ และเป็นเมตริกฝั่งวิดีโอทั้งสิ้น ไม่มีสิ่งใดบนการ์ดที่ผู้ซื้อภาพจะจดจำได้ว่าเป็นผลลีดเดอร์บอร์ด text-to-image หรือ image-editing การ์ดอ้างว่า Bernini ไปถึง "the first tier" ของโมเดลเชิงพาณิชย์แบบปิดในอารีนาเปรียบเทียบแบบ blind pairwise ภายในของ ByteDance — ซึ่งเป็นประเภทการประเมินตนเองจากผู้ผลิตที่ต้องผ่านการตรวจสอบโดยอิสระก่อนจึงจะมีความหมายใดๆ

MAI-Image-2.5-Pro:Elo การแก้ไขภาพ 1,272 (อิสระ, ~6,100 โหวต); Elo การสร้างภาพจากข้อความ 1,292 (อิสระ, ~11,500 โหวต)

Bernini-Diffusers-v2: ไม่มีเกณฑ์มาตรฐานสำหรับภาพที่เปิดเผยต่อสาธารณะ; มีเฉพาะเมตริกด้านวิดีโอ ซึ่งรายงานโดยผู้จำหน่าย

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

ทฤษฎีการตัดต่อที่แตกต่างกันสองทฤษฎี

โมเดลทั้งสองถูกสร้างขึ้นบนแนวคิดที่ว่าการแก้ไขไม่ควรหมายถึงการสร้างฉากขึ้นมาใหม่ แต่ทั้งคู่ไปถึงจุดนั้นด้วยวิธีที่แตกต่างกัน

MAI-Image-2.5-Pro คือแนวคิด "การแก้ไขที่แม่นยำและสม่ำเสมอ" ของ Microsoft: เปลี่ยนวัตถุหนึ่งชิ้น อัปเดตข้อความในภาพ ลบความเบลอจากการเคลื่อนไหว และคงไว้ซึ่งสิ่งอื่น ๆ ทั้งหมด — ตัวตนของตัวแบบ แสง พื้นผิว — ให้คงเดิม ความสม่ำเสมอนี้คือกลไกเบื้องหลังการอ้างความสม่ำเสมอของตัวละครในหลายภาพที่ 94% (รายงานโดยผู้ผลิต ยังไม่ได้รับการยืนยัน) เป้าหมายของผลิตภัณฑ์คือโมเดลที่ทำงานแก้ไขเฉพาะจุดแล้วหยุด

Bernini-Diffusers-v2 คือไปป์ไลน์แบบวางแผนก่อนแล้วจึงเรนเดอร์: ตัววางแผน Qwen2.5-VL จะแยกย่อยคำสั่งออกเป็นขั้นตอนเชิงความหมาย เช่น เปลี่ยนสภาพอากาศ เปลี่ยนสไตล์ ใส่วัตถุ คงตัวแบบ — จากนั้นตัวเรนเดอร์จะวาดผลลัพธ์ การออกแบบนี้มุ่งเน้นไปที่คำสั่งที่ซับซ้อนและหลายขั้นตอน และน้ำหนักเดียวกันนี้ครอบคลุมทั้งงานข้อความเป็นภาพ ภาพเป็นภาพ และวิดีโอ (t2i, i2i, t2v, v2v, rv2v, r2v) ความกว้างนี้คือข้อดี แต่ต้นทุนที่ยังไม่ได้ถูกวัดคือการที่ตัววางแผนขนาด 7B เป็นคอขวดที่แท้จริงสำหรับการแก้ไขที่ละเอียดอ่อนมาก และไม่มีใครนอก ByteDance ที่สามารถระบุปริมาณได้ว่ามันจัดการกับกรณีเหล่านั้นอย่างไร

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

การเรนเดอร์ข้อความ สมรภูมิในทางปฏิบัติ

ข้อความในภาพคือจุดที่โปรแกรมแก้ไขภาพสมัยใหม่ต้องพิสูจน์ความคุ้มค่า และในจุดนี้ความไม่สมดุลกันนั้นชัดเจนมาก ความสามารถหลักของ MAI-Image-2.5-Pro คือการเรนเดอร์ข้อความที่แม่นยำ โดยไมโครซอฟท์อ้างว่ามีความแม่นยำ 96.8% ในภาษาอังกฤษ จีน ญี่ปุ่น เกาหลี และสเปน (รายงานโดยผู้ผลิต เอกสารเดียวกันระบุว่าเอาต์พุตจำกัดไว้ใกล้หนึ่งเมกะพิกเซล ดังนั้นควรถือว่าตัวเลขนี้เป็นเพียงแนวทาง) ส่วน Bernini-Diffusers-v2 ไม่ได้เผยแพร่ตัวเลขความแม่นยำในการเรนเดอร์ข้อความเลยแม้แต่น้อย สำหรับเวิร์กโฟลว์ที่ต้องสร้างโฆษณาปรับเฉพาะท้องถิ่น บรรจุภัณฑ์ หรืออะไรก็ตามที่มีคำอ่านออกได้อยู่ภายใน ตัวเลือกหนึ่งให้คำกล่าวอ้างที่วัดผลได้ ส่วนอีกตัวเลือกหนึ่งไม่ได้ให้อะไรเลย

ต้นทุนและรูปแบบของบิล

MAI-Image-2.5-Pro — ราคา 5 ดอลลาร์ต่อโทเคนนำเข้าข้อความ 1 ล้านโทเคน, 8 ดอลลาร์ต่อโทเคนนำเข้ารูปภาพ 1 ล้านโทเคน, และ 106 ดอลลาร์ต่อโทเคนส่งออกรูปภาพ 1 ล้านโทเคน ยังไม่มีการเผยแพร่ต้นทุนต่อรูปภาพ การแปลงของ Artificial Analysis ประเมินว่ารูปภาพขนาด 1024×1024 อยู่ที่ประมาณ 108.50 ดอลลาร์ต่อ 1,000 รูป ราคาเวอร์ชันพรีวิว อาจมีการเปลี่ยนแปลงเมื่อเปิดให้ใช้งานทั่วไป (GA)

Bernini-Diffusers-v2 — ตัว weights นั้นฟรี แต่การโฮสต์ด้วยตัวเองหมายถึงต้องมีฮาร์ดแวร์ระดับ H100 (หรือเช่าคลาวด์) มีงานดูแลระบบให้มันทำงานต่อไป และจัดการสเกลด้วยตัวเอง เศรษฐศาสตร์จะสวนทางกับโมเดล API: แพงถ้าใช้งานวันละสิบภาพ แต่ถูกเมื่อใช้งานในปริมาณมาก

สำหรับทีมส่วนใหญ่ การมองอย่างตรงไปตรงมาคือ: ต้นทุนรวมในการเป็นเจ้าของของ Bernini จะคุ้มก็ต่อเมื่อคุณมี GPU fleet อยู่แล้ว และปริมาณงานมีขนาดใหญ่และสม่ำเสมอ มิฉะนั้น การใช้ API แบบคิดค่าตามปริมาณการใช้งานในอัตราระดับพรีเมียมคือความล้มเหลวที่ถูกกว่า

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

เราเตอร์สามารถทำอะไรได้และทำอะไรไม่ได้ที่นี่

ทั้งสองโมเดลไม่สามารถกำหนดเส้นทางผ่าน OrcaRouter ได้ในปัจจุบัน ด้วยเหตุผลที่ตรงข้ามกัน: MAI-Image-2.5-Pro อยู่เบื้องหลังการแสดงตัวอย่างโดยตรงของ Microsoft Foundry ส่วน Bernini-Diffusers-v2 ไม่ใช่เอนด์พอยต์เลย — มันคือค่าน้ำหนัก (weights) สิ่งนี้สำคัญในเชิงหลักการสำหรับการเปรียบเทียบครั้งนี้: รูปแบบเราต์เตอร์ใช้ได้กับเพียงครึ่งหนึ่งของการเปรียบเทียบนี้ซึ่งเป็น API ที่เรียกใช้ได้ เมื่อ MAI-Image-2.5-Pro เข้าถึง API ของบุคคลที่สามที่เรียกใช้ได้ วิธีนำมาใช้โดยไม่เดิมพันเส้นทางโปรดักชันกับโค้ดตัวอย่างคือการกำหนดเส้นทางทราฟิกส่วนหนึ่งไปยังมัน โดยมีโมเดลที่พิสูจน์แล้วเป็นตัวสำรองอัตโนมัติ (automatic failover) — บน OrcaRouter นั่นคือเอนด์พอยต์เดียว ราคาผู้ให้บริการส่งผ่านโดยมีมาร์กอัป 0% และตัวสำรองที่จับสิ่งที่ลีดเดอร์บอร์ดที่มีโหวตต่ำมองไม่เห็น ฝั่งโอเพนเวตไม่มีสิ่งที่เทียบเท่า: คุณต้องรันสแตกของ Bernini เอง หรือไม่ก็ไม่ใช้มันเลย

คำตัดสิน

MAI-Image-2.5-Pro คือเอดิเตอร์แบบโฮสต์ระดับพรีเมียมที่วัดผลได้: อันดับ 1 บนลีดเดอร์บอร์ดอิสระด้านการแก้ไขภาพ เคลมเรื่องการเรนเดอร์ข้อความที่ทำได้จริง และราคาที่สมน้ำสมเนื้อ Bernini-Diffusers-v2 คือไปป์ไลน์โอเพนเวตที่ฟรี ครอบคลุมหลากหลาย ยังไม่ผ่านการพิสูจน์ด้านภาพ และทำวิดีโอได้ด้วย — น่าสนใจจริง ๆ หากคุณโฮสต์เอง และให้คะแนนไม่ได้จริง ๆ จนกว่าจะมีการรันการประเมินภาพแบบสาธารณะ หากเวิร์กโฟลว์ของคุณต้องการ API ที่เรียกใช้ได้และตัวเลขที่คุณปกป้องได้ ทางเลือกคือ MAI-Image-2.5-Pro หรือเอดิเตอร์แบบโฮสต์อื่น ๆ ที่มันเอาชนะ หากเวิร์กโฟลว์ของคุณต้องการความเป็นเจ้าของและคุณรันฮาร์ดแวร์เองได้ Bernini-Diffusers-v2 ก็คุ้มค่าที่จะทดลอง — แต่ซื้อมันในฐานะการเดิมพันศักยภาพที่ยังไม่ได้วัด ไม่ใช่ในฐานะคู่แข่งของอันดับ 1 ที่วัดผลแล้ว

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube