
MAI-Image-2.5-Pro เทียบกับ Bernini-Diffusers-v2: #1 ที่วัดผลแล้ว ปะทะเดิมพันโอเพนเวตส์ที่ยังไม่ถูกวัดผล
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
การเปรียบเทียบ MAI-Image-2.5-Pro กับ Bernini-Diffusers-v2ไม่ใช่การเปรียบเทียบโมเดลภาพสองตัวจริงๆ แต่เป็นการเปรียบเทียบคำตอบที่แตกต่างกันสองคำตอบสำหรับคำถามเดียวกัน — “จะทำอย่างไรให้ได้การแก้ไขภาพต้นฉบับที่ดี” — โดยฝ่ายหนึ่งมีคะแนนเสียงแบบ blind จากมนุษย์ 6,100 เสียงหนุนหลังให้ครองอันดับ 1 ด้านการแก้ไขภาพ ส่วนอีกฝ่ายมีเพียง README MAI-Image-2.5-Pro โมเดลภาพระดับคุณภาพของ Microsoft เปิดให้ใช้งานแบบพรีวิวสาธารณะบน Microsoft Foundry เมื่อวันที่ 23 กรกฎาคม 2026 และปัจจุบันครองอันดับ 1 ใน Artificial Analysis Image Editing Arena ส่วน Bernini-Diffusers-v2 เฟรมเวิร์กการสร้างแบบครบวงจรรุ่นที่สองของ ByteDance ถูกปล่อยลงบน Hugging Face เมื่อวันที่ 13 สิงหาคม 2026 ในรูปแบบน้ำหนัก (weights) ภายใต้ใบอนุญาต Apache-2.0 โดยไม่มีการประกาศใดๆ และไม่มีเกณฑ์วัดคุณภาพภาพที่ใครนอกเหนือจาก ByteDance เคยรัน ความแตกต่างเชิงปฏิบัติทุกประการในการเปรียบเทียบครั้งนี้ล้วนเป็นผลมาจากข้อเท็จจริงสองประการนั้น
หนึ่งที่คุณโทร หนึ่งที่คุณวิ่ง
• MAI-Image-2.5-Pro — โมเดล API แบบโฮสต์ที่อยู่ในช่วงพรีวิวสาธารณะบน Azure AI Foundry และ MAI Playground เป็นโมเดลลิขสิทธิ์เฉพาะ คิดค่าใช้จ่ายตามจำนวนโทเค็น ไม่รองรับการ fine-tuning และไม่สามารถโฮสต์ด้วยตนเองได้ คุณจะได้รับ endpoint และจ่ายตามจำนวนโทเค็น โดย Microsoft เป็นผู้ดูแลโครงสร้างพื้นฐาน
• Bernini-Diffusers-v2 — ค่าน้ำหนัก Apache-2.0 ที่คุณดาวน์โหลดจาก Hugging Face และเรียกใช้ด้วยตัวเอง สแตกนี้ประกอบด้วยตัววางแผนเชิงความหมาย Qwen2.5-VL-7B ที่ขับเคลื่อนตัวเรนเดอร์ DiT ที่ใช้ Wan2.2 และคำแนะนำฮาร์ดแวร์ใน README คือ GPU ระดับ Hopper (H100/H800/H200) พร้อม Python 3.11.2 / PyTorch 2.5.1+cu124 คุณต้องเตรียมคลัสเตอร์เอง
นั่นคือกฎการตัดสินใจในหนึ่งบรรทัด: หากองค์กรของคุณต้องการเป็นเจ้าของสแต็กเอง Bernini คือตัวเลือกหนึ่ง หากองค์กรของคุณต้องการใบแจ้งหนี้และ SLA มีเพียง MAI-Image-2.5-Pro เท่านั้นที่อยู่ในเกณฑ์การพิจารณา พวกมันไม่ใช่สิ่งทดแทนซึ่งกันและกัน
ช่องว่างของหลักฐานคือพาดหัวข่าวที่แท้จริง
โมเดลทั้งสองอยู่คนละฝั่งของปัญหาคุณภาพที่ใหญ่ที่สุดในวงการ AI ภาพ นั่นคือการวัดผลลัพธ์ ทักษะการแก้ไขภาพของ MAI-Image-2.5-Pro ได้รับการให้คะแนนอย่างอิสระ — อันดับ 1 ใน Artificial Analysis Image Editing Arena ที่ Elo 1,272 จากการเปรียบเทียบแบบปกปิดประมาณ 6,100 ครั้งนำหน้า Reve 2.1, GPT Image 2, และ MAI-Image-2.5 ซึ่งเป็นรุ่นน้องของตัวเอง อันดับ text-to-image อยู่อันดับที่เจ็ดที่ Elo 1,292 ซึ่งเป็นตัวถ่วงดุลที่ตรงไปตรงมา: มันเป็นผู้เชี่ยวชาญด้านการแก้ไขภาพ ไม่ใช่ผู้นำด้านการสร้างภาพจากผืนผ้าใบว่างเปล่า ตัวเลขเหล่านี้สามารถตรวจสอบได้โดยใครก็ตามที่มีเบราว์เซอร์
Bernini-Diffusers-v2 ไม่มีคะแนนสาธารณะเทียบเท่าให้อ้างอิงได้ การ์ดโมเดลรายงาน EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 และ VBench 84.46 — ทั้งหมดเป็นข้อมูลที่ผู้ผลิตแจ้งไว้ และเป็นเมตริกฝั่งวิดีโอทั้งสิ้น ไม่มีสิ่งใดบนการ์ดที่ผู้ซื้อภาพจะจดจำได้ว่าเป็นผลลีดเดอร์บอร์ด text-to-image หรือ image-editing การ์ดอ้างว่า Bernini ไปถึง "the first tier" ของโมเดลเชิงพาณิชย์แบบปิดในอารีนาเปรียบเทียบแบบ blind pairwise ภายในของ ByteDance — ซึ่งเป็นประเภทการประเมินตนเองจากผู้ผลิตที่ต้องผ่านการตรวจสอบโดยอิสระก่อนจึงจะมีความหมายใดๆ
• MAI-Image-2.5-Pro:Elo การแก้ไขภาพ 1,272 (อิสระ, ~6,100 โหวต); Elo การสร้างภาพจากข้อความ 1,292 (อิสระ, ~11,500 โหวต)
• Bernini-Diffusers-v2: ไม่มีเกณฑ์มาตรฐานสำหรับภาพที่เปิดเผยต่อสาธารณะ; มีเฉพาะเมตริกด้านวิดีโอ ซึ่งรายงานโดยผู้จำหน่าย

ทฤษฎีการตัดต่อที่แตกต่างกันสองทฤษฎี
โมเดลทั้งสองถูกสร้างขึ้นบนแนวคิดที่ว่าการแก้ไขไม่ควรหมายถึงการสร้างฉากขึ้นมาใหม่ แต่ทั้งคู่ไปถึงจุดนั้นด้วยวิธีที่แตกต่างกัน
MAI-Image-2.5-Pro คือแนวคิด "การแก้ไขที่แม่นยำและสม่ำเสมอ" ของ Microsoft: เปลี่ยนวัตถุหนึ่งชิ้น อัปเดตข้อความในภาพ ลบความเบลอจากการเคลื่อนไหว และคงไว้ซึ่งสิ่งอื่น ๆ ทั้งหมด — ตัวตนของตัวแบบ แสง พื้นผิว — ให้คงเดิม ความสม่ำเสมอนี้คือกลไกเบื้องหลังการอ้างความสม่ำเสมอของตัวละครในหลายภาพที่ 94% (รายงานโดยผู้ผลิต ยังไม่ได้รับการยืนยัน) เป้าหมายของผลิตภัณฑ์คือโมเดลที่ทำงานแก้ไขเฉพาะจุดแล้วหยุด
Bernini-Diffusers-v2 คือไปป์ไลน์แบบวางแผนก่อนแล้วจึงเรนเดอร์: ตัววางแผน Qwen2.5-VL จะแยกย่อยคำสั่งออกเป็นขั้นตอนเชิงความหมาย เช่น เปลี่ยนสภาพอากาศ เปลี่ยนสไตล์ ใส่วัตถุ คงตัวแบบ — จากนั้นตัวเรนเดอร์จะวาดผลลัพธ์ การออกแบบนี้มุ่งเน้นไปที่คำสั่งที่ซับซ้อนและหลายขั้นตอน และน้ำหนักเดียวกันนี้ครอบคลุมทั้งงานข้อความเป็นภาพ ภาพเป็นภาพ และวิดีโอ (t2i, i2i, t2v, v2v, rv2v, r2v) ความกว้างนี้คือข้อดี แต่ต้นทุนที่ยังไม่ได้ถูกวัดคือการที่ตัววางแผนขนาด 7B เป็นคอขวดที่แท้จริงสำหรับการแก้ไขที่ละเอียดอ่อนมาก และไม่มีใครนอก ByteDance ที่สามารถระบุปริมาณได้ว่ามันจัดการกับกรณีเหล่านั้นอย่างไร

การเรนเดอร์ข้อความ สมรภูมิในทางปฏิบัติ
ข้อความในภาพคือจุดที่โปรแกรมแก้ไขภาพสมัยใหม่ต้องพิสูจน์ความคุ้มค่า และในจุดนี้ความไม่สมดุลกันนั้นชัดเจนมาก ความสามารถหลักของ MAI-Image-2.5-Pro คือการเรนเดอร์ข้อความที่แม่นยำ โดยไมโครซอฟท์อ้างว่ามีความแม่นยำ 96.8% ในภาษาอังกฤษ จีน ญี่ปุ่น เกาหลี และสเปน (รายงานโดยผู้ผลิต เอกสารเดียวกันระบุว่าเอาต์พุตจำกัดไว้ใกล้หนึ่งเมกะพิกเซล ดังนั้นควรถือว่าตัวเลขนี้เป็นเพียงแนวทาง) ส่วน Bernini-Diffusers-v2 ไม่ได้เผยแพร่ตัวเลขความแม่นยำในการเรนเดอร์ข้อความเลยแม้แต่น้อย สำหรับเวิร์กโฟลว์ที่ต้องสร้างโฆษณาปรับเฉพาะท้องถิ่น บรรจุภัณฑ์ หรืออะไรก็ตามที่มีคำอ่านออกได้อยู่ภายใน ตัวเลือกหนึ่งให้คำกล่าวอ้างที่วัดผลได้ ส่วนอีกตัวเลือกหนึ่งไม่ได้ให้อะไรเลย
ต้นทุนและรูปแบบของบิล
• MAI-Image-2.5-Pro — ราคา 5 ดอลลาร์ต่อโทเคนนำเข้าข้อความ 1 ล้านโทเคน, 8 ดอลลาร์ต่อโทเคนนำเข้ารูปภาพ 1 ล้านโทเคน, และ 106 ดอลลาร์ต่อโทเคนส่งออกรูปภาพ 1 ล้านโทเคน ยังไม่มีการเผยแพร่ต้นทุนต่อรูปภาพ การแปลงของ Artificial Analysis ประเมินว่ารูปภาพขนาด 1024×1024 อยู่ที่ประมาณ 108.50 ดอลลาร์ต่อ 1,000 รูป ราคาเวอร์ชันพรีวิว อาจมีการเปลี่ยนแปลงเมื่อเปิดให้ใช้งานทั่วไป (GA)
• Bernini-Diffusers-v2 — ตัว weights นั้นฟรี แต่การโฮสต์ด้วยตัวเองหมายถึงต้องมีฮาร์ดแวร์ระดับ H100 (หรือเช่าคลาวด์) มีงานดูแลระบบให้มันทำงานต่อไป และจัดการสเกลด้วยตัวเอง เศรษฐศาสตร์จะสวนทางกับโมเดล API: แพงถ้าใช้งานวันละสิบภาพ แต่ถูกเมื่อใช้งานในปริมาณมาก
สำหรับทีมส่วนใหญ่ การมองอย่างตรงไปตรงมาคือ: ต้นทุนรวมในการเป็นเจ้าของของ Bernini จะคุ้มก็ต่อเมื่อคุณมี GPU fleet อยู่แล้ว และปริมาณงานมีขนาดใหญ่และสม่ำเสมอ มิฉะนั้น การใช้ API แบบคิดค่าตามปริมาณการใช้งานในอัตราระดับพรีเมียมคือความล้มเหลวที่ถูกกว่า

เราเตอร์สามารถทำอะไรได้และทำอะไรไม่ได้ที่นี่
ทั้งสองโมเดลไม่สามารถกำหนดเส้นทางผ่าน OrcaRouter ได้ในปัจจุบัน ด้วยเหตุผลที่ตรงข้ามกัน: MAI-Image-2.5-Pro อยู่เบื้องหลังการแสดงตัวอย่างโดยตรงของ Microsoft Foundry ส่วน Bernini-Diffusers-v2 ไม่ใช่เอนด์พอยต์เลย — มันคือค่าน้ำหนัก (weights) สิ่งนี้สำคัญในเชิงหลักการสำหรับการเปรียบเทียบครั้งนี้: รูปแบบเราต์เตอร์ใช้ได้กับเพียงครึ่งหนึ่งของการเปรียบเทียบนี้ซึ่งเป็น API ที่เรียกใช้ได้ เมื่อ MAI-Image-2.5-Pro เข้าถึง API ของบุคคลที่สามที่เรียกใช้ได้ วิธีนำมาใช้โดยไม่เดิมพันเส้นทางโปรดักชันกับโค้ดตัวอย่างคือการกำหนดเส้นทางทราฟิกส่วนหนึ่งไปยังมัน โดยมีโมเดลที่พิสูจน์แล้วเป็นตัวสำรองอัตโนมัติ (automatic failover) — บน OrcaRouter นั่นคือเอนด์พอยต์เดียว ราคาผู้ให้บริการส่งผ่านโดยมีมาร์กอัป 0% และตัวสำรองที่จับสิ่งที่ลีดเดอร์บอร์ดที่มีโหวตต่ำมองไม่เห็น ฝั่งโอเพนเวตไม่มีสิ่งที่เทียบเท่า: คุณต้องรันสแตกของ Bernini เอง หรือไม่ก็ไม่ใช้มันเลย
คำตัดสิน
MAI-Image-2.5-Pro คือเอดิเตอร์แบบโฮสต์ระดับพรีเมียมที่วัดผลได้: อันดับ 1 บนลีดเดอร์บอร์ดอิสระด้านการแก้ไขภาพ เคลมเรื่องการเรนเดอร์ข้อความที่ทำได้จริง และราคาที่สมน้ำสมเนื้อ Bernini-Diffusers-v2 คือไปป์ไลน์โอเพนเวตที่ฟรี ครอบคลุมหลากหลาย ยังไม่ผ่านการพิสูจน์ด้านภาพ และทำวิดีโอได้ด้วย — น่าสนใจจริง ๆ หากคุณโฮสต์เอง และให้คะแนนไม่ได้จริง ๆ จนกว่าจะมีการรันการประเมินภาพแบบสาธารณะ หากเวิร์กโฟลว์ของคุณต้องการ API ที่เรียกใช้ได้และตัวเลขที่คุณปกป้องได้ ทางเลือกคือ MAI-Image-2.5-Pro หรือเอดิเตอร์แบบโฮสต์อื่น ๆ ที่มันเอาชนะ หากเวิร์กโฟลว์ของคุณต้องการความเป็นเจ้าของและคุณรันฮาร์ดแวร์เองได้ Bernini-Diffusers-v2 ก็คุ้มค่าที่จะทดลอง — แต่ซื้อมันในฐานะการเดิมพันศักยภาพที่ยังไม่ได้วัด ไม่ใช่ในฐานะคู่แข่งของอันดับ 1 ที่วัดผลแล้ว
