Thẻ hero cho trận đối đầu giữa MAI-Image-2.5-Pro với giá khoảng 108,50 USD cho mỗi 1.000 hình ảnh và Qwen-Image 3.0 với giá khoảng 25 USD cho mỗi 1.000 hình ảnh, hai mô hình tạo ảnh qua API đều dẫn đầu về khả năng hiển thị văn bản.
Guides & Insights

MAI-Image-2.5-Pro so với Qwen-Image 3.0: Giá gấp bốn lần cho một loại văn bản khác

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt MAI-Image-2.5-ProQwen-Image 3.0 cạnh nhau và điều đầu tiên bạn nhận thấy là giá: khoảng $108.50 cho mỗi 1.000 hình ảnh cho bậc cao cấp của Microsoft so với khoảng $25–30 cho mỗi 1.000 cho Qwen-Image 3.0 của Alibaba — mức giá niêm yết của chính Alibaba nằm gần $25, trong khi bảng xếp hạng của Artificial Analysis liệt kê $30. Dù tính theo con số nào, số tiền cũng gấp hơn ba lần. Những gì mức giá cao cấp đó thực sự mua được là một loại công việc xử lý văn bản khác. Qwen-Image 3.0, được phát hành bởi đội ngũ Q​wen của Alibaba vào ngày 21 tháng 7 năm 2026 và mở API quốc tế vào ngày 4 tháng 8, được định giá để trở thành trình kết xuất văn bản khối lượng — dễ đọc xuống tới ~10px trên mười hai ngôn ngữ, với cửa sổ prompt 4,500 token cho các bản mô tả dày đặc. MAI-Image-2.5-Pro, đang trong bản xem trước công khai trên Microsoft Foundry kể từ ngày 23 tháng 7, là trình chỉnh sửa được đánh giá cao nhất trên một bảng xếp hạng độc lập, với độ chính xác kết xuất văn bản được nhà cung cấp khẳng định nhưng giới hạn đầu ra cứng ~1 megapixel. Cả hai đều là mô hình hình ảnh API có điểm nhấn là văn bản; chúng cạnh tranh về giá mỗi tác vụ, chứ không phải về một điểm chất lượng duy nhất.

Hai câu chuyện, cả hai đều chưa được kiểm chứng đầy đủ.

Cuộc chiến văn bản là lý do cả hai mô hình tồn tại, và đó cũng là nơi bằng chứng mỏng manh nhất — mọi con số trong phần này đều do nhà cung cấp báo cáo và không có số liệu nào được tái lập một cách độc lập.

Qwen-Image 3.0 — Tài liệu phát hành của Alibaba tuyên bố khả năng hiển thị rõ nét xuống tới khoảng 10px, hỗ trợ tích hợp trên 12 ngôn ngữ với 20+ phông chữ và 100+ phong cách nghệ thuật, ký hiệu toán học, chỉ số dưới, chỉ số trên và công thức nhiều dòng, cũng như quen thuộc với các giao diện web, trò chơi và phần mềm thông thường. Cửa sổ lời nhắc lên tới 4.500 token đầu vào — tăng gấp 4,5 lần so với thế hệ trước — điều này giúp nó tiếp thu các bản tóm tắt dày đặc như trang nhất báo chí hoặc lưới kiến thức chín ô trong một lần gọi.

MAI-Image-2.5-Pro — Microsoft tuyên bố độ chính xác hiển thị văn bản 96,8% trên các ngôn ngữ Trung, Anh, Nhật, Hàn và Tây Ban Nha, một khả năng tuân thủ prompt tốt hơn 27% so với GPT-Image-1.5 trong các đánh giá nội bộ, và độ nhất quán nhân vật đa hình ảnh 94%. Thông số đầu vào rộng rãi hơn trên giấy tờ — lên tới 32.000 token văn bản đầu vào với cửa sổ ngữ cảnh 131k — và đầu ra được giới hạn ở mức 1.048.576 pixel, tương đương 1024×1024.

Cả hai tuyên bố đều chưa được tái lập tính đến thời điểm viết. Sự khác biệt nằm ở hình thức của các tuyên bố: của Q​wen là về khối lượng và độ rõ ràng trên các hệ chữ, còn của Microsoft là về độ chính xác và nhất quán trên một tập hợp năm ngôn ngữ xác định. Không nhà cung cấp nào công bố một benchmark mà phòng thí nghiệm khác có thể chạy và kiểm tra.

Giá trị cao cấp nằm ở khâu biên tập

Điều phân biệt hai mô hình này là khả năng chỉnh sửa ảnh, và đây là khía cạnh duy nhất có bằng chứng độc lập. MAI-Image-2.5-Pro đứng ở vị trísố 1 trên Artificial Analysis Image Editing Arena với Elo 1,272 (khoảng 6,100 phiếu bầu ẩn danh), xếp trên Reve 2.1, MAI-Image-2.5 và GPT Image 2. Trên cùng bảng xếp hạng, Qwen-Image-3.0-Pro mới hơn đạt1,249 — một điểm số cạnh tranh, kém 23 Elo, và đáng chú ý đối với một mô hình chỉ mới có mặt trên API quốc tế trong tháng này.

Ngoài mô hình cơ sở, danh mục chỉnh sửa của Alibaba là một tập hợp các thủ thuật chuyên biệt thay vì một vương miện duy nhất: {{1}}phục hồi tranh cổ, tạo ảnh toàn cảnh, chuyển phác thảo thành PPT và dựng storyboard nhiều cảnh{{/1}}. Microsoft thì đặt cược hẹp hơn nhưng sâu hơn — {{2}}các chỉnh sửa chính xác, tinh tế giữ nguyên sự nhất quán của phần còn lại trong khung hình (thay thế đối tượng, thay đổi bố cục, cập nhật văn bản trong ảnh, làm sạch vùng mờ){{/2}}, loại chỉnh sửa mà các mô hình cũ tái tạo toàn bộ cảnh và làm mất chủ thể. Đối với quy trình làm việc kiểu {{3}}"lấy tài nguyên hiện có, thay đổi một thứ, xuất bản nó,"{{/3}} thứ hạng #1 độc lập của phiên bản Pro là tín hiệu mạnh hơn; còn với một mớ hỗn hợp các định dạng chỉnh sửa sáng tạo, danh sách của Q​wen lại rộng hơn.

Screenshot of the Artificial Analysis Image Editing leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2

So sánh thông số kỹ thuật

• Giá — ~108,50 USD cho mỗi 1k hình ảnh (1024×1024, chuyển đổi AA) so với ~25–30 USD cho mỗi 1k hình ảnh (báo giá Alibaba so với mức niêm yết AA)br />• Phát hành — 23 tháng 7 năm 2026 (bản xem trước công khai, Foundry) so với 21 tháng 7 năm 2026, API quốc tế 4 tháng 8br />• Đầu vào văn bản — 32.000 token, ngữ cảnh 131k so với cửa sổ prompt 4.500 tokenbr />• Trần đầu ra — ~1.048.576 pixel (~1K) so với tối đa 2048×2048br />• Số hình ảnh mỗi lần gọi — đầu ra đơn cho mỗi yêu cầu so với tối đa sáu hình ảnh mỗi lần gọibr />• Thứ hạng chỉnh sửa — Hạng 1, Elo 1.272 (AA) so với 1.249 của Qwen-Image-3.0-Pro trên cùng bảng xếp hạngbr />• Nguồn gốc — tuyên bố của Microsoft "không chưng cất từ mô hình của bên thứ ba" so với nhãn nguồn gốc AIGC trên đầu rabr />• Trọng số — đóng, chỉ qua API so với đóng, chỉ qua API

Giới hạn đầu ra và số lượng ảnh mỗi lần gọi quan trọng hơn so với vẻ ngoài của chúng. Qwen-Image 3.0 có thể tạo ảnh 2048×2048 và trả về tối đa sáu ảnh mỗi lần gọi — một tính năng kinh tế theo mẻ; còn gói Pro chỉ đạt mức tối đa gần 1K và chỉ trả về một ảnh cho mỗi yêu cầu. Nếu yêu cầu của bạn là "cho tôi một loạt sáu ảnh sản phẩm," thì mô hình của Alibaba được xây dựng cho điều đó, còn mô hình của Microsoft thì không.

Two-column scoreboard for MAI-Image-2.5-Pro and Qwen-Image 3.0 comparing price per 1k images, output ceiling, images per call, prompt window, editing rank, and text-rendering claim

Khi khoản phí bảo hiểm tự bù đắp cho chính nó

Quy tắc quyết định là về mục đích của hình ảnh, không phải về việc mô hình nào "tốt hơn."

Trả phí cho MAI-Image-2.5-Pro khi đầu ra là một tài sản chủ lực — một hình ảnh sản phẩm, một tấm poster, một keyframe, một hình ảnh được đưa vào chiến dịch và sẽ không được tạo lại năm mươi lần. Thứ hạng chỉnh sửa số 1 và tuyên bố về tính nhất quán của nhân vật có ý nghĩa nhất khi một bản chỉnh sửa phải đúng ngay từ lần đầu.

Mua hàng loạt với Qwen-Image 3.0 khi đầu ra dùng một lần hoặc số lượng lớn — biến thể quảng cáo bản địa hóa, ảnh minh họa tạm thời, deck sketch-to-PPT, khung storyboard, bất cứ thứ gì bạn sẽ tạo lại thay vì tinh chỉnh. Với giá $25–30 mỗi 1k, một lần tạo thất bại chỉ là một sai số làm tròn; với giá $108.50 mỗi 1k thì không phải vậy.

Có một lựa chọn trung gian đáng nêu ra: với công việc chèn chữ vào ảnh dày đặc và đa ngôn ngữ — bản mock trang đích có nội dung tiếng Nhật và tiếng Tây Ban Nha, một infographic có công thức — độ rõ nét 10px và mười hai ngôn ngữ của Q​wen phù hợp hơn trên lý thuyết, và chỉ với một phần tư giá. Lập luận phản bác của mô hình Microsoft là tuyên bố độ chính xác 96.8% trên năm ngôn ngữ, nhưng tuyên bố đó chưa được xác minh, và người mua đứng trước hai tuyên bố văn bản chưa xác minh có lẽ nên cân nhắc đến giá cả.

Scoreboard for MAI-Image-2.5-Pro: image editing No. 1 at Elo 1,272, text-to-image No. 7 at 1,292, $108.50 per 1k images, 32k text input tokens, 131k context, ~1-megapixel output cap, public preview on Microsoft Foundry

Lớp định tuyến, khi được áp dụng

Hiện chưa mô hình nào trong hai mô hình này truy cập được qua OrcaRouter — Qwen-Image 3.0 nằm trên API của chính Alibaba (Alibaba Cloud Bailian và nền tảng Q​wen) và một số nền tảng bên thứ ba, còn MAI-Image-2.5-Pro nằm trên Microsoft Foundry — vì vậy một so sánh thẳng thắn nói rõ rằng cả hai đều chưa đứng về phía chúng tôi hôm nay. Khi một trong hai mô hình trở nên khả dụng qua một nhà cung cấp hosted có thể gọi được, cơ chế giá chuyển tiếp sẽ áp dụng: 0% phụ phí so với giá niêm yết của nhà cung cấp, nghĩa là bạn trả đúng bảng giá của họ, và ưu đãi ra mắt hay đợt giảm giá sẽ nằm ngay trên hóa đơn cùng ngày công bố. Lập luận về dự phòng là nửa còn lại: Qwen-Image 3.0 là một API quốc tế mới ra mắt vài tuần, loại mô hình mà bạn điều một phần lưu lượng đến trong khi một phương án dự phòng đã được kiểm chứng xử lý các trường hợp ngoại lệ — đây chính xác là thiết lập mà một tầng định tuyến được xây dựng để phục vụ.

Bản án

Qwen-Image 3.0 và MAI-Image-2.5-Pro không phải là cùng một sản phẩm với mức giá khác nhau; chúng là những sản phẩm khác nhau tình cờ được định giá khác nhau. Mô hình của Microsoft giành vương miện về chỉnh sửa, sở hữu cửa sổ ngữ cảnh lớn hơn và đưa ra tuyên bố về độ chính xác chưa được kiểm chứng trên năm ngôn ngữ — đối với tài sản chủ lực và các thao tác chỉnh sửa tinh vi, mức phí cao cấp là hợp lý. Mô hình của Alibaba hiển thị nhiều hệ chữ viết dễ đọc hơn, tiếp nhận các bản tóm tắt yêu cầu dày đặc hơn trong mỗi lần tạo theo điều kiện riêng của nó, xuất ra ảnh lớn hơn với mỗi lô sáu tấm và có chi phí chỉ bằng một phần tư — đối với công việc số lượng lớn và văn bản-trong-hình-ảnh đa ngôn ngữ, đây là lựa chọn kinh tế hợp lý. Hãy chọn gói cao cấp khi hình ảnh là sản phẩm; hãy chọn gói số lượng lớn khi hình ảnh chỉ là hàng tồn kho.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube