Thẻ hero cho cuộc đối đầu giữa MAI-Image-2.5-Pro và Grok Imagine Image 2.0, hai mô hình hình ảnh ưu tiên chỉnh sửa từ Microsoft và xAI.
Guides & Insights

MAI-Image-2.5-Pro so với Grok Imagine Image 2.0: Hai canh bạc ưu tiên chỉnh sửa trong tạo sinh hình ảnh

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai trong số các mô hình hình ảnh thú vị nhất năm nay đồng ý về ý tưởng lớn: chỉnh sửa là tương lai, tạo sinh chỉ là điều kiện cơ bản. MAI-Image-2.5-Pro (Microsoft, bản xem trước công khai trên Foundry từ 23 tháng 7) và Grok Imagine Image 2.0 (x​AI, phát hành ngày 7 tháng 8 với vai trò "Quality Mode" mặc định trong các ứng dụng G​rok) đều tự giới thiệu mình là công cụ chỉnh sửa trước hết. Nhưng họ đã xây dựng những công cụ khác nhau để chứng minh điều đó. Mô hình của Microsoft là một cỗ máy chất lượng — các thao tác chỉnh sửa chính xác, duy trì tính nhất quán, được hỗ trợ bởi thứ hạng số 1 trên Bảng xếp hạng Chỉnh sửa Ảnh Artificial Analysis. Mô hình của x​AI là một môi trường chỉnh sửa — một bộ công cụ hướng tới người dùng (Magic Wand, phân đoạn, xóa phông nền, Smart Resize) bao quanh một bộ sinh ảnh xếp hạng từ 2 đến 3 trên bảng xếp hạng lớn khác. Một bên được đo bằng độ trung thực, bên kia bằng quy trình làm việc. Đó chính là sự khác biệt thực sự giữa chúng.

Các bộ công cụ chỉnh sửa không có cùng hình dạng.

MAI-Image-2.5-Pro — một cỗ máy, không phải một hộp công cụ. Bạn mang đến yêu cầu và hình ảnh; nó thực hiện các chỉnh sửa chính xác như phẫu thuật — thay thế đối tượng có chủ đích, thay đổi bố cục, cập nhật văn bản trong ảnh, dọn dẹp artifact — trong khi vẫn giữ được danh tính đối tượng, ánh sáng và kết cấu nhất quán qua các lần lặp. Tuyên bố 94% tính nhất quán nhân vật đa hình ảnh của Microsoft (con số do nhà cung cấp công bố) chính là toàn bộ điểm nhấn: thay đổi một thứ, giữ nguyên mọi thứ khác.

Grok Imagine Image 2.0 — một môi trường. Nó cung cấp Magic Wand (chỉ chỉnh sửa vùng đã chọn), Segmentation (tô màu lại hoặc thay thế các khu vực chính xác), xóa nền, đầu vào đa tham chiếu (tối đa 5 ảnh trong các ứng dụng dành cho người tiêu dùng, 3 trong API), Smart Resize (tái tạo bố cục một ảnh thành chín tỷ lệ khung hình) và Templates cho chụp ảnh sản phẩm, ảnh chân dung, thương mại điện tử, tài nguyên trò chơi và áp phích tiếp thị.

Đọc danh sách đó và cách định vị trở nên rõ ràng: {{1}}MAI-Image-2.5-Pro{{/1}} là mô hình mà nhà phát triển gọi qua API; {{2}}Grok Imagine Image 2.0{{/2}} là mô hình mà người dùng làm việc trực tiếp trong UI. xAI gọi nó là một "môi trường chỉnh sửa" khi ra mắt, và bộ công cụ đúng là như vậy.

Thứ hạng của từng mục

MAI-Image-2.5-Pro — đứng hạng 1 trên Artificial Analysis Image Editing Arena (Elo 1.272, ~6.100 lượt bình chọn mù); đứng hạng 7 về tạo ảnh từ văn bản (1.292 Elo). Chấm điểm độc lập, dựa trên bình chọn mù theo sở thích.

Grok Imagine Image 2.0 — Tuyên bố ra mắt của xAI là vị trí số 2 toàn cầu trên bảng xếp hạng text-to-image của Arena, sau GPT Image 2; tính đến ảnh chụp ngày 10 tháng 8, mô hình này đứng ở vị trí số 3 (Elo 1.316) sau GPT Image 2 (1.381) và MAI-Image-2.6 (1.336) mới hơn của Microsoft. Thứ hạng này là độc lập và sơ bộ, và cách xAI nói "No. 2 worldwide" nên được gắn nhãn đúng bản chất: một tuyên bố ra mắt từ phía nhà cung cấp mà bảng xếp hạng trực tiếp đã điều chỉnh kể từ đó.

Không mô hình nào dẫn đầu trên sân nhà của mô hình kia, và không mô hình nào giữ vị trí cao nhất trên bảng xếp hạng chính của mô hình kia. Cách đọc đơn giản là: mô hình của Microsoft sở hữu điểm số chỉnh sửa, mô hình của x​AI sở hữu công cụ và nằm gần đầu bảng về khả năng tạo sinh.

Screenshot of the Artificial Analysis Image Editing Leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of the field

Kết xuất văn bản, tính năng quyết định

Văn bản trong hình là điểm hai bên khác biệt rõ rệt nhất, và nơi bằng chứng độc lập chỉ nghiêng về một phía. Microsoft tuyên bố độ chính xác hiển thị văn bản 96,8% cho MAI-Image-2.5-Pro trên tiếng Anh, tiếng Trung, tiếng Nhật, tiếng Hàn và tiếng Tây Ban Nha — do nhà cung cấp công bố, chưa được xác minh, và đi kèm với giới hạn đầu ra megapixel, nhưng là một năng lực được tuyên bố thực sự với phạm vi hỗ trợ đa ngôn ngữ. Kết quả kiểm tra độc lập của Grok Imagine Image 2.0, được công bố qua đánh giá của chính OrcaRouter về mô hình này so với GPT Image 2, cho thấy nó hiển thị văn bản CJK không đáng tin cậy — trong một bài kiểm tra, nó hiển thị tiếng Trung Phồn thể khi được yêu cầu tạo tiếng Trung Giản thể trên tiêu đề áp phích phim, một yếu tố loại trừ nghiêm trọng cho công việc quảng cáo bản địa hóa. Đối với bất kỳ quy trình làm việc nào có từ ngữ dễ đọc trong hình, MAI-Image-2.5-Pro là lựa chọn an toàn hơn trên giấy tờ; chất lượng văn bản của G​rok cần được kiểm tra trên chính tài liệu của bạn trước khi bạn tin tưởng nó.

Giá

MAI-Image-2.5-Pro — tính phí theo token: $5 mỗi triệu token đầu vào văn bản, $8 mỗi triệu token đầu vào hình ảnh, $106 mỗi triệu token đầu ra hình ảnh. Theo quy đổi của Artificial Analysis, một hình ảnh 1024×1024 có giá gần $108.50 cho mỗi 1.000.

Grok Imagine Image 2.0 — giá cố định theo từng ảnh, không tốn token: $0.05 cho mỗi ảnh ở 1K hoặc 2K với gói chất lượng (`grok-imagine-image-quality`), $0.02 cho gói tiêu chuẩn, với các lần chỉnh sửa được tính phí cho cả đầu vào lẫn đầu ra. Ở 1K, số tiền đó là $50 cho 1.000 ảnh chất lượng — gần bằng một nửa mức giá trên mỗi 1k của MAI-Image-2.5-Pro, với chi phí cố định không thay đổi theo độ dài prompt.

Các mô hình định giá khác nhau về mặt triết lý. Việc tính phí theo token của Microsoft gây bất lợi cho các prompt dài và đầu ra lớn; mức giá cố định theo từng ảnh của xAI lại dễ dự đoán và không phụ thuộc vào độ dài prompt. Với khối lượng sử dụng lớn, mức giá cố định dễ dự báo hơn, và mức giá của phân khúc chất lượng cao rẻ hơn so với của MAI-Image-2.5-Pro.

Comparison scoreboard for MAI-Image-2.5-Pro and Grok Imagine Image 2.0: editing rank No. 1 at 1,272 Elo versus Arena text-to-image No. 3 at 1,316 Elo; editing approach surgical engine versus tool environment; text rendering 96.8% claimed versus independent CJK failures; price USD 108.50 per 1k versus USD 50 per 1k quality; billing token-metered versus flat per image; availability Foundry preview versus Grok apps and API

Tính khả dụng và góc định tuyến

Cả hai đều có thể truy cập được, nhưng thông qua các cửa khác nhau. MAI-Image-2.5-Pro là bản xem trước của Microsoft Foundry và MAI Playground — bạn cần có tài khoản Microsoft và bảng giá xem trước được áp dụng. Grok Imagine Image 2.0 ra mắt trong các ứng dụng tiêu dùng của xAI vào ngày 7 tháng 8 và tầng chất lượng của nó có thể gọi thông qua Imagine API của xAI; nó cũng đã có sẵn trên điểm cuối tương thích OpenAI của OrcaRouter từ giữa tháng 8, nơi tầng tiêu chuẩn và tầng chất lượng nằm sau một khóa, với giá của nhà cung cấp được chuyển qua với mức tăng 0% và tự động chuyển sang dự phòng như GPT Image 2.

Sự khác biệt thực tế mà điều này tạo ra: áp dụng Grok Imagine Image 2.0 trong một đường ống sản xuất chỉ là thay đổi chuỗi mô hình trên một endpoint mà bạn có thể đã đang sử dụng, với mức phí cố định rẻ và phương án dự phòng tích hợp sẵn cho những trường hợp nó gặp trục trặc — chính xác là chế độ lỗi mà lớp định tuyến được tạo ra để xử lý. Áp dụng MAI-Image-2.5-Pro nghĩa là phải ký hợp đồng trực tiếp với Foundry ngay lúc này, và lưu ý định tuyến thẳng thắn vẫn giống như một tháng trước: khi bản xem trước của Microsoft có thể được gọi rộng rãi thông qua API của bên thứ ba, đó là lúc mẫu một khóa tương tự mở ra cho nó.

Screenshot of the OrcaRouter model page for grok-imagine-image, showing the xAI image model routable through one API key

Bản án

Chọn MAI-Image-2.5-Pro khi công việc của bạn là chỉnh sửa một hình ảnh có sẵn với độ trung thực cao và đầu ra phải đạt yêu cầu — đây là trình chỉnh sửa số 1 độc lập trên Artificial Analysis, nó đưa ra một tuyên bố thực sự về khả năng hiển thị văn bản đa ngôn ngữ, và giá cả tương xứng. Chọn Grok Imagine Image 2.0 khi bạn muốn một quy trình chỉnh sửa có các công cụ thực sự, một mức giá cố định dễ dự đoán và chỉ khoảng một nửa chi phí cho mỗi hình ảnh, cùng một mô hình mà bạn có thể định tuyến ngay hôm nay với phương án dự phòng. Cách nhìn thẳng thắn không phải là "cái nào tốt hơn" — mà là lựa chọn nào phù hợp với quy trình của bạn: Microsoft đặt cược rằng độ trung thực sẽ thắng trong chỉnh sửa, còn x​AI đặt cược rằng bộ công cụ sẽ giành được người dùng. Cả hai đều có lý; yêu cầu về chất lượng đầu ra và mức độ chấp nhận rủi ro trong hiển thị văn bản của bạn là yếu tố quyết định.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube