Thẻ hero cho so sánh giữa Qwen-Image 2.1, một mô hình trọng số mở không có điểm số độc lập, và MAI-Image-2.5-Pro, mô hình dẫn đầu được đo lường của đấu trường chỉnh sửa hình ảnh Artificial Analysis ở Elo 1.272
Guides & Insights

Qwen-Image 2.1 so với MAI-Image-2.5-Pro: 6.100 lượt bình chọn mù so với con số 0

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một trong hai mô hình này đã được xếp hạng dựa trên khoảng 6.100 so sánh mù của con người. Mô hình còn lại thì chưa được bất kỳ ai ngoài chính phòng thí nghiệm của nó xếp hạng. MAI-Image-2.5-Pro, mô hình hình ảnh cao cấp của Microsoft, đang đứng ở vị trí số một trên đấu trường chỉnh sửa hình ảnh của Artificial Analysis với điểm Elo 1.272 — kết quả có nhiều phiếu bầu nhất trong hạng mục này. Qwen-Image 2.1, mô hình mà nhóm Qwen-Image công bố mã nguồn mở vào ngày 20 tháng 9 năm 2026, hoàn toàn không có điểm số độc lập nào, và sẽ không có cho đến khi đủ người chạy nó công khai để tạo ra phiếu bầu. Khoảng cách đó mới chính là chủ đề thực sự của so sánh này, bởi vì đó là khác biệt duy nhất giữa hai mô hình không phải là lời khẳng định của nhà cung cấp. Mọi thứ còn lại — kiến trúc, độ phân giải, giá cả — đều có thể biết được nhưng chưa được chứng minh, và trên giấy tờ hai mô hình đủ gần nhau đến mức khoảng cách về đo lường mới chính là yếu tố nên quyết định lựa chọn.

Các lá phiếu thực sự nói lên điều gì, và điều gì chúng không nói

Artificial Analysis chạy các so sánh cặp ẩn danh: hai mô hình nhận cùng một prompt, người bình chọn chọn đầu ra tốt hơn, và Elo được rút ra từ kết quả. Đây không phải là một công cụ hoàn hảo, nhưng nó là thứ gần nhất mà hạng mục này có được với một bảng điểm chung, và kích thước mẫu quan trọng không kém gì con số.

MAI-Image-2.5-Pro — chỉnh sửa ảnh #1 với Elo 1.272 trên khoảng 6.100 so sánh. Trong hạng mục text-to-image, nó đứng ở vị trí #7 với Elo 1.292, xếp sau GPT Image 2 (high) ở 1.369, Reve 2.1 ở 1.322, Nano Banana 2 ở 1.320, GPT Image 1.5 (high) ở 1.310 và MAI-Image-2.5 ở 1.304.

Qwen-Image 2.1 — không xuất hiện trên cả hai bảng xếp hạng. Không phải là điểm thấp; mà là không có điểm nào. Bản phát hành này mới chỉ một ngày tuổi tính đến thời điểm viết bài.

Hình dạng của những con số đó đáng để đọc kỹ, bởi vì nó không phải là hình dạng mà tiếp thị ngụ ý. Mô hình của Microsoft thực sự đứng đầu về chỉnh sửa và thực sự đứng thứ bảy về tạo sinh. Đó là một vị thế cụ thể, có thể bảo vệ — một chuyên gia chỉnh sửa dẫn đầu hạng mục của nó — và nó khác với việc trở thành mô hình hình ảnh tốt nhất, mà nó không phải. Trong khi đó, mô hình đánh bại nó ở văn bản thành hình ảnh là GPT Image 2 (high), cũng không phải là mô hình OpenAI mới nhất trong lĩnh vực này. Các bảng xếp hạng độc lập thưởng cho mô hình được đo lường nhiều nhất, và trong cuộc đối đầu này, đó rõ ràng là mô hình của Microsoft.

Thông số duy nhất mà mô hình mở thắng áp đảo

Có một sự khác biệt cụ thể, không mang tính chủ quan giữa hai điều này, và đó chính là độ phân giải.

Qwen-Image 2.1 tạo ảnh gốc ở độ phân giải 2K, với 2048×2048 là mặc định được ghi trong tài liệu ở 40 bước suy luận, bảy cài đặt trước tỷ lệ khung hình, và đầu ra RGBA với kênh alpha thật thay vì một lớp mặt nạ.

MAI-Image-2.5-Progiới hạn đầu ra ở mức 1.048.576 pixel — khoảng một megapixel. Những con số thông số nổi bật của nó lại nằm ở chỗ khác: 32.000 token đầu vào văn bản, cửa sổ ngữ cảnh 131k và 4.096 token đầu ra, điều đó nói lên lượng chỉ dẫn mà nó có thể tiếp nhận, chứ không phải lượng hình ảnh mà nó có thể tạo ra.

Với hầu hết công việc cho mạng xã hội và sản phẩm, giới hạn một megapixel không phải là một ràng buộc. Nhưng với in ấn, với ghép ảnh khổ lớn, với bất cứ thứ gì mà một phần cắt ra phải trụ được, thì nó là ràng buộc. Đây là chiều duy nhất trong toàn bộ so sánh mà bạn có thể chỉ vào một con số và nói rằng mô hình mở đang dẫn trước — và lưu ý rằng đó là một dữ kiện kiến trúc từ model card, chứ không phải một tuyên bố về chất lượng. Qwen-Image 2.1 sẽ kết xuất ở 2048×2048, bất kể nó có kết xuất ra thứ gì đáng nhìn hay không.

Giá, đó là chỗ mà việc so sánh trở nên khó chịu.

MAI-Image-2.5-Pro được định giá như một mô hình cao cấp và những con số không hề tinh tế: 5 USD cho mỗi triệu token đầu vào văn bản, 8 USD cho mỗi triệu token đầu vào hình ảnh và 106 USD cho mỗi triệu token đầu ra hình ảnh. Ở đầu ra 1024 pixel, con số đó tương đương khoảng 108,50 USD cho mỗi nghìn hình ảnh. Để dễ hình dung quy mô, chi phí này cao hơn khoảng 2,3 lần so với MAI-Image-2.5 và khoảng 5,4 lần so với MAI-Image-2.5-Flash, cho thấy Microsoft đã chủ động phân khúc dòng sản phẩm của chính mình thay vì định giá bậc Pro như một nâng cấp gia tăng.

Qwen-Image 2.1 không có giá dịch vụ lưu trữ, vì không có endpoint lưu trữ nào — nó là một bản tải weights theo giấy phép nghiên cứu. Chi phí của nó là thời gian GPU của bạn, và ràng buộc của nó là bạn không thể bán hợp pháp những gì nó tạo ra. So sánh 108,50 đô la cho mỗi nghìn hình ảnh với "weights miễn phí" là đang so sánh một dịch vụ với một cỗ máy, và phiên bản trung thực của phép so sánh đó là: mức giá tính theo sử dụng mua cho bạn một mô hình đã được đo lường, được hỗ trợ, có giấy phép thương mại, còn weights mua cho bạn một bản tải xuống 33 GB và một tệp giấy phép ghi rằng chỉ dùng cho mục đích phi thương mại.

Sự đánh đổi đó chính là lúc một lớp định tuyến chứng minh được giá trị của mình. OrcaRouter đưa hơn 200 mô hình ra phía sau một endpoint tương thích OpenAI duy nhất, ở đúng giá niêm yết của nhà cung cấp, không thêm phụ phí, cùng cơ chế tự động chuyển đổi dự phòng giữa các nhà cung cấp — vì vậy một đội ngũ muốn đánh giá một mô hình mở chưa được đo lường không nhất thiết phải chuyển môi trường production sang nó mới làm được điều đó, và vì giá niêm yết được chuyển thẳng qua, mọi thay đổi giá của nhà cung cấp đối với một mô hình được định tuyến đều về phía chúng tôi ngay trong ngày hôm đó, thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo. Cả MAI-Image-2.5-Pro lẫn Qwen-Image 2.1 đều không nằm trong số các mô hình chúng tôi định tuyến hiện nay, và bài viết này sẽ không ngụ ý điều ngược lại. Dòng mô hình hình ảnh mà chúng tôi thực sự cung cấp là họ GPT-Image của OpenAI, các bậc Imagen 4 và bản xem trước ảnh Gemini của Google, cùng endpoint hình ảnh Grok Imagine của xAI.

Two-column scoreboard for Qwen-Image 2.1 and MAI-Image-2.5-Pro: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Editing score none / Text-to-image score none / Output 2048x2048 native, RGBA / Price self-host, no hosted endpoint; MAI-Image-2.5-Pro rows read Announced 23 July 2026 / Licence commercial, via Microsoft / Editing score AA #1, Elo 1,272, about 6,100 votes / Text-to-image score AA #7, Elo 1,292 / Output capped at 1,048,576 pixels / Price about $108.50 per 1,000 images; footer reads 'MAI figures per Artificial Analysis; Qwen-Image 2.1 has no independent score yet.'

Các tuyên bố của nhà cung cấp nằm ở đâu, và nên coi trọng chúng đến mức nào

Cả hai nhà cung cấp đều công bố những con số mà chưa có bên thứ ba nào tái lập được, và những con số đó cần được đọc với cùng một thái độ hoài nghi theo cả hai hướng.

Tuyên bố của Microsoft — độ chính xác hiển thị văn bản 96,8% trên tiếng Anh, tiếng Trung, tiếng Nhật, tiếng Hàn và tiếng Tây Ban Nha; khả năng tuân thủ prompt tốt hơn 27% so với GPT-Image-1.5; độ nhất quán nhân vật trên nhiều ảnh đạt 94%; và chi phí GPU thấp hơn tới 84–89% trong một số kịch bản nội bộ cụ thể của Microsoft. Điểm cuối cùng là điểm cần thận trọng: nó mô tả cấu hình phục vụ của chính Microsoft, chứ không phải điều gì đó mà khách hàng có thể kiểm chứng.

Tuyên bố của Alibaba — bài đăng blog Qwen-Image 2.1 có kèm một biểu đồ so sánh Qwen-Image-Bench, và các con số trong đó là của chính nhà cung cấp. Ngoài ra, trong các bài đưa tin của bên thứ ba còn lan truyền một con số mô tả mô hình này là transformer 20 lớp, điều này mâu thuẫn với thông tin trong model card là DiT đơn luồng 32 lớp; model card là nguồn chính, và con số 32 lớp mới là con số cần dùng.

Sự khác biệt giữa hai tình huống không nằm ở mức độ trung thực của bên cung cấp nào. Mà là mô hình của Microsoft đã được đo lường một cách độc lập còn của Alibaba thì chưa, nên những tuyên bố của Microsoft có thể được đối chiếu với một cái gì đó, trong khi những tuyên bố của Alibaba thì chưa thể đối chiếu với bất cứ điều gì.

Từng cái dùng để làm gì

Đọc cùng nhau, những điều này không cạnh tranh cho cùng một vị trí.

MAI-Image-2.5-Pro là công cụ chỉnh sửa. Nó dẫn đầu bảng chỉnh sửa trên một lượng lớn phiếu bầu, nó chấp nhận một chỉ dẫn dài (32k token nhập văn bản, ngữ cảnh 131k), nó được cấp phép thương mại và hiện có sẵn dưới dạng bản xem trước công khai trên Microsoft Foundry và MAI Playground. Nếu công việc của bạn là chỉnh sửa hình ảnh lặp đi lặp lại và bạn cần biết trước khi cam kết rằng nó là lựa chọn tốt nhất hiện có cho công việc đó, thì đây là câu trả lời đã được đo lường, và chi phí khoảng $108.50 cho mỗi nghìn hình ảnh.

Qwen-Image 2.1 là sản phẩm nghiên cứu mở. Nó kết xuất với kích thước lớn hơn, nó đi kèm một checkpoint viết lại prompt có thể kiểm tra cùng với mô hình hình ảnh, nó chấp nhận tối đa 10 ảnh tham chiếu với chỉnh sửa cục bộ bằng khoanh tròn, chú thích vẽ hoặc mặt nạ, và nó miễn phí để tải xuống còn việc bán nó là bất hợp pháp. Nếu công việc của bạn là đánh giá, benchmark, hoặc xây dựng dựa trên các trọng số mà bạn có thể đọc, thì nó là đối tượng thú vị hơn — và bạn đang làm công việc đó mà không có bảng xếp hạng nào cho bạn biết liệu nó có tốt hay không.

Cũng có một sự bất đối xứng về thời điểm đáng để gọi tên. MAI-Image-2.6 bước vào bản xem trước riêng tư vào ngày 19 tháng 8 năm 2026, nghĩa là mô hình đứng đầu bảng chỉnh sửa đã chậm hơn một thế hệ so với thứ mà Microsoft đang chuẩn bị phát hành. Ngược lại, Qwen-Image 2.1 đang ở ngày đầu tiên, với một chương trình truy cập sớm yêu cầu những người thử nghiệm của mình công bố trước ngày 29 tháng 9. Cả hai bảng điểm trong so sánh này sẽ trông khác đi trong vòng một tháng.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing GPT Image 2 (high) first at Elo 1,178 with MAI-Image-2.5-Pro listed at No. 7 with Elo 1,292, and no Qwen-Image 2.1 entry anywhere on the boardScreenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Điều gì sẽ giải quyết được nó?

Một điều: việc Qwen-Image 2.1 xuất hiện trên một bảng xếp hạng. Mọi thứ trong bài viết này không phải là giới hạn độ phân giải hay mức giá đều là tuyên bố của phòng thí nghiệm này hoặc phòng thí nghiệm kia, và toàn bộ lý do khiến MAI-Image-2.5-Pro có thể được giới thiệu một cách nghiêm túc là 6.100 người không làm việc cho Microsoft đã xem đầu ra của nó bên cạnh một thứ khác và thích nó hơn. Đó là tiêu chuẩn mà mô hình mở chưa đáp ứng được, và cũng là tiêu chuẩn mà nó cần phải được đánh giá theo.

Cho đến lúc đó, cách hiểu thực tế rất đơn giản. Nếu hôm nay bạn cần một mô hình chỉnh sửa, theo giấy phép thương mại, có bảng điểm phía sau, thì câu trả lời là của Microsoft và nó tốn khoảng 108,50 USD cho mỗi nghìn hình ảnh. Nếu bạn muốn tìm hiểu liệu một mô hình open-weights 7B với đầu ra 2K gốc và trình viết lại prompt có thể kiểm tra được có tốt hơn không, bạn phải tự mình đo lường — và điều hữu ích nhất bạn có thể làm với kết quả là công bố nó, vì toàn bộ hạng mục này hiện đang thiếu một điểm dữ liệu.