
MAI-Image-2.5-Pro Giành Vị Trí Số 1 Trong Chỉnh Sửa Hình Ảnh: Chiến Thắng Độc Lập của Microsoft Thực Sự Chứng Minh Điều Gì
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2658Trí tuệ72Lập trình
- DeepSeekMỚIDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.32026-08-1860Trí tuệ75Lập trình
- obsidianMỚIQwen3.8 27B2026-08-1552Trí tuệ68Lập trình
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1261Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0557Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0358Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2152Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1653Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1560Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Trí tuệ71Lập trình
MAI-Image-2.5-Pro hiện là mô hình chỉnh sửa hình ảnh được xếp hạng cao nhất trên bảng xếp hạng của Artificial Analysis — một bảng xếp hạng bỏ phiếu mù độc lập — trong khi vẫn chỉ xếp thứ bảy ở khả năng tạo ảnh từ văn bản thuần túy. Sự tách biệt đó chính là điểm mấu chốt: một mô hình đã được xem trước công khai chưa đầy một tháng, được xây dựng hoàn toàn nội bộ bởi Microsoft AI, đã vượt qua GPT Image 2, Reve 2.1, và người anh em của chính nó là MAI-Image-2.5 trên bảng xếp hạng chỉnh sửa, nhưng lại xếp sau hầu hết các mô hình cùng lĩnh vực khi được yêu cầu "vẽ cho tôi một thứ gì đó từ con số không." Hãy đọc cả hai con số cùng nhau và bạn sẽ có được một bức tranh chính xác về những gì Microsoft đã phát hành: một chuyên gia trong việc thay đổi hình ảnh hiện có, chứ không phải một công cụ tạo sinh đa năng.
Hai con số, đứng cạnh nhau
Tính đến bản dữ liệu tháng 8 năm 2026, Đấu trường Chỉnh sửa Hình ảnh của Artificial Analysis xếp MAI-Image-2.5-Pro ở vị trí số 1 với Elo 1.272, dựa trên khoảng 6.100 lượt so sánh mù từ người dùng. Nhóm bám đuổi rất sát: Reve 2.1 ở 1.262, sau đó là MAI-Image-2.5 và GPT Image 2 (high) hòa nhau ở 1.256, GPT Image 1.5 (high) ở 1.250, Qwen-Image-3.0-Pro ở 1.249, và Nano Banana 2 của Gogle ở 1.249. Trên Đấu trường Văn bản-thành-Hình ảnh, nó đứng ở vị trí số 7 với Elo 1.292, xếp sau GPT Image 2 (high) ở 1.369, Reve 2.1 ở 1.322, Nano Banana 2 ở 1.320, GPT Image 1.5 (high) ở 1.310, MAI-Image-2.5 ở 1.304, và Nano Banana Pro ở 1.296.
• Chỉnh sửa: Hạng 1 — 1.272 Elo, ~6.100 mẫu
• Chuyển văn bản thành hình ảnh: Hạng 7 — 1.292 Elo, ~11.500 mẫu
• Khoảng cách với vị trí số 2 về chỉnh sửa: 10 Elo hơn Reve 2.1
• Khoảng cách với vị trí số 1 về text-to-image: kém 77 Elo so với GPT Image 2 (cao)
Điều khiến thứ hạng chỉnh sửa đáng giá hơn một con số hư danh chính là cơ chế vận hành. Đấu trường Artificial Analysis dựa trên đánh giá sở thích ẩn danh của con người: người bình chọn xem cùng một ảnh đầu vào và cùng một hướng dẫn, nhận được hai kết quả chỉnh sửa, rồi chọn ra bản tốt hơn. Không có kịch bản nào từ nhà cung cấp ghi điểm. Vì vậy, vị trí số 1 ở đó là thứ gần nhất thị trường có với "mọi người thích đầu ra của trình chỉnh sửa này nhất" — và đó là cú leo hạng gần đây, không phải biến động nhất thời ngay ngày ra mắt. Hãy coi xu hướng là đáng tin cậy còn điểm Elo chính xác chỉ là tạm thời; các bảng xếp hạng ít phiếu bầu sẽ thay đổi.

Bảng xếp hạng chuyển văn bản thành hình ảnh, được ghi nhận cùng ngày, cho thấy cùng một mô hình dưới một góc nhìn khác — không còn dẫn đầu, nhưng vẫn nằm thoải mái trong top mười của một nhóm có Elo dao động từ 1.290 đến 1.370.

Thực chất MAI-Image-2.5-Pro là gì
MAI-Image-2.5-Pro là bậc chất lượng của Microsoft AI trong dòng sản phẩm MAI-Image-2.5, được công bố vào ngày 23 tháng 7 năm 2026 cùng với MAI-Voice-2-Flash và được đưa vào bản xem trước công khai trên Microsoft Foundry (Azure AI Foundry) và MAI Playground miễn phí. Microsoft mô tả đây là mô hình hình ảnh có độ trung thực cao nhất từ trước đến nay, hướng đến hình ảnh hero, chỉnh sửa chi tiết và kết xuất văn bản chính xác trong hình ảnh. Dòng sản phẩm này hiện trải dài toàn bộ đường cong chi phí: MAI-Image-2.5 cho khối lượng công việc cân bằng, MAI-Image-2.5-Flash cho khối lượng lớn và bậc Pro ở phân khúc chất lượng cao nhất — với một sản phẩm anh em mới hơn, MAI-Image-2.6, đã có bản xem trước riêng tư từ ngày 19 tháng 8.
Những tuyên bố của chính Microsoft cho gói Pro, tất cả đều do nhà cung cấp báo cáo và chưa có cái nào được kiểm chứng độc lập:
• Độ chính xác hiển thị văn bản 96.8% — được ghi nhận là hỗ trợ tiếng Trung, tiếng Anh, tiếng Nhật, tiếng Hàn và tiếng Tây Ban Nha, mặc dù tài liệu tương tự giới hạn đầu ra ở khoảng một megapixel, vì vậy cách diễn đạt "8K" trong tuyên bố này tốt nhất nên được coi là tiếp thị.
• tuân thủ prompt tốt hơn 27% so với GPT-Image-1.5 trong các bài đánh giá nội bộ của Microsoft.
• 94% độ nhất quán nhân vật đa hình ảnh qua các lần tạo.
• Chi phí GPU thấp hơn tới 84–89% so với các mô hình GPT trong các tình huống cụ thể của Microsoft (PowerPoint, OneDrive), không phải con số chung.
Bảng thông số kỹ thuật được tài liệu hóa là cơ sở cho những tuyên bố đó: nhập văn bản lên đến 32.000 token, cửa sổ ngữ cảnh 131k, 4.096 token đầu ra, đầu vào hình ảnh JPEG/PNG, và đầu ra giới hạn ở 1.048.576 pixel (tương đương 1024×1024). Con số cuối cùng đó quan trọng với người mua: đây là một cái chất lượng caoTrình chỉnh sửa, không phải là máy tạo ảnh ở độ phân giải in ấn.
Nơi chất lượng thể hiện rõ
Sức mạnh chỉnh sửa mà bảng xếp hạng đang đo lường khớp với điều Microsoft nhấn mạnh: các chỉnh sửa chính xác, mang tính phẫu thuật, giữ cho phần còn lại của hình ảnh nhất quán. Thay thế đối tượng có chủ đích, thay đổi bố cục, cập nhật văn bản trong hình, và dọn dẹp các khiếm khuyết như mờ chuyển động — loại chỉnh sửa mà các mô hình cũ thường tái tạo toàn bộ cảnh và làm mất chủ thể. Kết hợp điều đó với tuyên bố về độ nhất quán nhân vật 94% và bạn có một mô hình được thiết kế cho quy trình làm việc quan trọng về mặt thương mại: lấy một tài sản hiện có, thay đổi một thứ, rồi phát hành nó.
Thứ hạng #7 về text-to-image là đối trọng trung thực. Từ một prompt trống, MAI-Image-2.5-Pro tốt nhưng chưa phải là người dẫn đầu — kém 77 Elo so với GPT Image 2 (high) là một khoảng cách thực sự trên một bảng xếp hạng mù. Microsoft hiện không tuyên bố ngôi vương text-to-image; họ đang tuyên bố ngôi vương chỉnh sửa, và dữ liệu ủng hộ tuyên bố hẹp hơn đó tốt hơn nhiều so với tuyên bố rộng hơn.
Chi phí là bao nhiêu
MAI-Image-2.5-Pro được tính phí theo token trên Foundry: $5 cho mỗi triệu token văn bản đầu vào, $8 cho mỗi triệu token hình ảnh đầu vào, $106 cho mỗi triệu token hình ảnh đầu ra. Microsoft không công bố số token cho mỗi hình ảnh, vì vậy chi phí mỗi hình ảnh là phép tính, không phải báo giá; sử dụng cách quy đổi của Artificial Analysis, một hình ảnh 1024×1024 nằm ở mức gần $108,50 cho mỗi 1.000 hình ảnh. Con số này xấp xỉ 2,3 lần so với bản cùng dòng MAI-Image-2.5 (~$48 mỗi 1k) và 5,4 lần so với MAI-Image-2.5-Flash (~$20 mỗi 1k) — hạng Pro là một mức giá cao cấp có chủ đích.
Giá preview không phải là giá GA; biểu giá preview có thể thay đổi trước khi phát hành chính thức. Khi điều đó xảy ra, một lớp định tuyến chuyển tiếp (pass-through) là cách mức giá giảm được phản ánh trên hóa đơn của bạn ngay trong ngày: trên OrcaRouter, giá niêm yết của nhà cung cấp được chuyển tiếp với mức phụ phí 0%, vì vậy ngay khi MAI-Image-2.5-Pro có thể truy cập thông qua một API bên thứ ba có thể gọi được, bất kỳ khoản phí nào Microsoft tính cũng chính xác là số tiền bạn phải trả — không cần đàm phán lại, không cần hợp đồng thứ hai.

Tại sao vị trí số 1 thuộc về công ty Microsoft, không chỉ riêng mô hình
Kết quả bảng xếp hạng xuất hiện đúng vào thời điểm Microsoft đang công khai thay thế các mô hình tạo ảnh của bên thứ ba bằng mô hình của riêng mình. MAI-Image-2.5 đã là công cụ mặc định trong Bing Image Creator và chạy trong PowerPoint, OneDrive và Dynamics 365 Contact Center; phiên bản Pro thuộc cùng dòng sản phẩm nhắm đến các tác vụ có độ trung thực cao hơn. Microsoft đã cho biết các mô hình MAI được huấn luyện trên dữ liệu sạch, có thể truy xuất nguồn gốc, "không chưng cất từ các mô hình của bên thứ ba" — một câu trả lời trực tiếp cho câu hỏi về sự phụ thuộc vào OpenAI, và các tuyên bố về chi phí (chi phí GPU thấp hơn tới 84% trong PowerPoint, do nhà cung cấp báo cáo và theo từng tình huống cụ thể) cũng nằm trong cùng câu chuyện: một mô hình nội bộ có chi phí mỗi tác vụ rẻ hơn mô hình mà nó thay thế.
Không điều nào trong số đó có thể chứng minh được với người mua hoài nghi nếu không có bảng xếp hạng độc lập, đó là lý do vì sao vị trí #1 có ý nghĩa chiến lược chứ không chỉ là một con số. Đây là bằng chứng độc lập đầu tiên cho thấy dòng sản phẩm hình ảnh nội bộ của Microsoft vượt trội hơn tất cả đối thủ ở đúng tác vụ mà nó được thiết kế để thực hiện.
Xem gì tiếp theo
• Liệu vị trí dẫn đầu về chỉnh sửa có giữ vững khi số phiếu bầu ngày càng tăng không? 1.272 Elo trên ~6.100 mẫu là vị trí dẫn đầu, chưa chắc chắn; Reve 2.1 kém 10 điểm.
• Tính khả dụng chung và bảng giá cuối cùng — giá xem trước không phải là giá GA.
• Trần độ phân giải. Giới hạn 1 megapixel khiến Pro không thể làm công việc in ấn; nếu Microsoft gỡ bỏ giới hạn này, câu chuyện sẽ thay đổi.
• MAI-Image-2.6 (bản xem trước riêng, 19 tháng 8) — bước tiến tiếp theo của dòng sản phẩm, xếp hạng số 2 về khả năng tạo ảnh từ văn bản trên đấu trường chính còn lại.
• Đánh giá độc lập về các tuyên bố của nhà cung cấp — độ chính xác hiển thị văn bản và tính nhất quán của ký tự chưa được xác minh bên ngoài Microsoft.
Điều rút ra từ bảng xếp hạng chia tách không phải là "Microsoft giờ đây tạo ra mô hình hình ảnh tốt nhất." Nó hẹp hơn và hữu ích hơn: Microsoft hiện tạo ra trình chỉnh sửa hình ảnh được đánh giá tốt nhất trên một bảng xếp hạng độc lập, với mức giá cao, đang trong giai đoạn xem trước, có mức trần độ phân giải cứng. Nếu công việc của bạn là chỉnh sửa hình ảnh hiện có — ảnh chính, hình ảnh sản phẩm, văn bản trong hình — thì đó chính xác là mô hình đáng theo dõi. Nếu công việc của bạn là tạo hình ảnh từ đầu, thứ hạng #7 cho thấy lựa chọn tốt hơn vẫn là GPT Image 2 — và đó là cách đọc trung thực mà cả hai con số mang lại.
