
Qwen-Image-2.1 so với MAI-Image-2.6 Preview: Một cái được xếp hạng, một cái có thể tải xuống
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Image-2.6 Preview đang đứng đầu bảng xếp hạng chỉnh sửa hình ảnh độc lập và bạn không thể mua nó. Qwen-Image-2.1 là bản tải xuống 33 GB mà bất kỳ ai cũng có thể chạy ngay hôm nay và hoàn toàn không xuất hiện trên bảng xếp hạng đó. Giữa hai sự thật ấy là toàn bộ phép so sánh, và đó không phải là so sánh về chất lượng — mà là so sánh về bằng chứng. Mô hình của Microsoft có phiếu bầu từ những người xa lạ và không có trang thanh toán. Mô hình kia có bản tải xuống không cần thanh toán và không có phiếu bầu từ người lạ. Quyết định chọn giữa chúng nghĩa là quyết định xem bạn có thể chấp nhận khoảng trống nào. Qwen-Image-2.1 được mã nguồn mở vào ngày 20 tháng 9 năm 2026; MAI-Image-2.6 Preview đã ở chế độ xem trước riêng tư kể từ ngày 19 tháng 8 năm 2026.
Xếp hạng thực sự đo lường điều gì
Artificial Analysis thực hiện các so sánh cặp đôi mù và quy đổi chúng thành điểm Elo. Trên bản chụp tháng 9 năm 2026 của bảng xếp hạng chỉnh sửa hình ảnh do mình vận hành, MAI-Image-2.6 dẫn đầu với khoảng 1,122 — xếp trên GPT Image 2 (high) ở mức khoảng 1,117. Ở mảng text-to-image, nó đứng thứ hai, khoảng 1,149, sau GPT Image 2 (high) ở mức khoảng 1,178. Đó là những lá phiếu thật từ những người thật, so sánh các kết quả đầu ra mà họ không biết nguồn gốc, một loại bằng chứng tốt hơn hẳn về bản chất so với benchmark của chính nhà cung cấp.

Điều cần lưu ý vốn đã nằm trong chính từ “Preview”. Một bản dựng xem trước tích lũy phiếu bầu từ một nhóm người tự chọn tham gia — những người có quyền truy cập qua lời mời — và điểm số của nó có thể thay đổi đáng kể khi bản dựng phát hành rộng rãi thay thế nó. Hãy xem Elo là một tín hiệu mạnh về hướng đi của mô hình và một tín hiệu yếu về mô hình mà cuối cùng bạn sẽ có thể gọi.
Bằng chứng của Qwen-Image-2.1 là hình ảnh phản chiếu. Qwen-Image-Bench của chính nhà cung cấp đặt nó ở mức 60,28, dẫn trước Nano Banana 2.0 ở 59,82 và GPT Image 1.5 ở 59,65, đứng đầu trong số các mô hình mở. Đó là những con số do nhà cung cấp tự chạy, không có bên thứ ba tái lập, và các mức chênh lệch đều dưới một điểm — một khoảng cách sẽ không trụ nổi nếu thay đổi bộ prompt. Điểm dữ liệu độc lập duy nhất là một lượt chấm điểm bởi con người của GenAI Showdown ở mức 7/15, tăng từ 4/15 của Qwen-Image gốc và xếp sau 8/15 của Ideogram 4. Trên các bảng xếp hạng hình ảnh của Artificial Analysis, Qwen-Image-2.1 không hề xuất hiện. Đó không phải là một điểm số tồi. Mà là sự thiếu vắng một điểm số, bởi vì Elo độc lập đòi hỏi đủ số người chạy mô hình một cách công khai để tạo ra phiếu bầu, và một mô hình mới chỉ một ngày tuổi và chỉ được tự host thì chưa có cơ hội.
Nơi hai mô hình thực sự khác biệt trên trang tính
• Truy cập — Qwen-Image-2.1 có trọng số mở, khoảng 33 GB, có thể tải xuống ngay hôm nay; MAI-Image-2.6 Preview chỉ được truy cập bằng lời mời trên MAI Playground và Microsoft Foundry, không có API công khai và không có bảng giá.
• Giới hạn độ phân giải — Qwen-Image-2.1 xuất ra gốc lên tới 2048×2048 ở 40 bước suy luận với bảy cài đặt sẵn tỷ lệ khung hình; dòng MAI-Image-2.5 giới hạn đầu ra ở khoảng 1.048.576 pixel, và Microsoft chưa công bố con số cao hơn cho 2.6 Preview.
• Độ trong suốt — Qwen-Image-2.1 phát alpha từ không gian tiềm ẩn RGBA 64 kênh, và có thể tách một chủ thể từ ảnh chụp thành một lớp trong suốt; chưa từng có đầu ra nền trong suốt nào được ghi nhận cho dòng MAI-Image.
• Ảnh tham chiếu — Qwen-Image-2.1 chấp nhận tối đa 10 ảnh cho bố cục nhiều chủ thể và thử đồ ảo; Microsoft chưa công bố số lượng ảnh tham chiếu cho bản xem trước.
• Điều khiển chỉnh sửa — Qwen-Image-2.1 nhận chỉnh sửa vùng thông qua các vòng tròn màu chú thích nhiều khu vực trong một chỉ dẫn, các nét vẽ tự do, hoặc một cặp ảnh gốc cộng mặt nạ riêng giúp bảo toàn toàn bộ ảnh nguồn; MAI-Image-2.5 được định vị là chuyên gia chỉnh sửa với khả năng chỉnh sửa cục bộ và bảo toàn danh tính khuôn mặt, và 2.6 Preview kế thừa cách định vị đó.
• Giấy phép — Qwen-Image-2.1 được phát hành theo Thỏa thuận Giấy phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026, chỉ dùng cho mục đích phi thương mại; MAI-Image-2.6 Preview là bản xem trước thương mại nhưng chưa công bố điều khoản thương mại nào.
Dòng khiến bạn phải chững lại không phải là bất kỳ dòng nào trong số các dòng về năng lực. Mà là dòng cuối cùng: cả hai mô hình đều không có bản điều khoản thương mại nào được công bố. Một mô hình cấm thẳng việc sử dụng thương mại cho đến khi bạn có được giấy phép riêng. Mô hình còn lại không có giá nào cả, vì vẫn chưa có cách nào để mua nó.

Độ trung thực khi chỉnh sửa là trục mà cả hai đều khẳng định
Cả hai mô hình đều được bán dựa trên cùng một lời hứa: bạn có thể chỉnh sửa một hình ảnh nhiều lần mà không làm chủ thể bị trôi. Cách Microsoft định vị dòng MAI-Image là bảo toàn danh tính khuôn mặt và chỉnh sửa cục bộ với lập luận thị giác đằng sau — mô hình được thiết kế để hiểu bạn đang chỉ vào cái gì, chứ không chỉ ở đâu. Cách Qwen định vị Qwen-Image-2.1 nói rõ về kiểu lỗi mà nó nhắm tới: sự trôi danh tính khuôn mặt và sự biến dạng của văn bản, kết cấu và hình dạng sản phẩm qua các lần chỉnh sửa lặp lại. Cả hai đều là tuyên bố của nhà cung cấp, và cả hai đều mô tả cùng một vấn đề.
Sự khác biệt thực tế nằm ở chỗ bạn có thể tự kiểm nghiệm cái nào ngay chiều nay. Qwen-Image-2.1 là một bản tải về và một pipeline diffusers — QwenImage21Pipeline đã được hợp nhất vào Diffusers, với hỗ trợ ngay từ ngày đầu tại ComfyUI, SGLang, vLLM-Omni và LightX2V. Bạn có thể chạy hai mươi vòng chỉnh sửa trên chính đối tượng của mình và tự đánh giá mức độ sai lệch. MAI-Image-2.6 Preview cần có lời mời, nên với hầu hết mọi người, câu hỏi về độ trung thực vẫn chỉ là một lời khẳng định cho đến khi quyền truy cập được mở.
Còn một khả năng dành riêng cho chỉnh sửa đáng được nêu ra vì nó khá bất thường. Qwen-Image-2.1 có thể nối chuỗi các chỉnh sửa cục bộ thành một hoạt ảnh đơn giản theo từng khung hình — cùng cơ chế trong suốt tạo ra ảnh tách nền cũng cho phép một chuỗi chỉnh sửa theo vùng dựng nên chuyển động. Đây không phải là mô hình video và không nên bị so sánh với một mô hình như vậy, nhưng nó là một cách rẻ để tạo một vòng lặp ngắn mà không cần đụng đến endpoint video.
Chi phí, và tại sao cả hai con số đều không nằm trên trang giá
Qwen-Image-2.1 không có giá dịch vụ hosted vì không tồn tại endpoint hosted. Chi phí chính là thời gian GPU của bạn, và các con số về phục vụ đã được công bố: SGLang-Diffusion đo được 2,748 giây cho một lần sinh ảnh 1024×1024, 40 bước trên một chiếc B200, 8,23 giây trên RTX PRO 6000 Blackwell 96 GB, và 4,74 giây trên RTX 4090 24 GB khi dùng Cache-DiT và các kernel INT8, chỉ tính bước khử nhiễu. Đó là độ trễ của từng yêu cầu đơn lẻ, không phải thông lượng, nhưng cũng đủ để kiểm tra nhanh xem một chiếc card có đáp ứng được khối lượng của bạn hay không.
MAI-Image-2.6 Preview không có mức giá riêng nào được công bố — Microsoft bán nó qua Foundry và Playground, chứ không theo bảng giá công khai. Bảng độc lập thì có liệt kê một mức, và đó là tín hiệu giá duy nhất gắn với mô hình này: 38,9 USD cho 1.000 hình ảnh, được Artificial Analysis ghi nhận cho bản xem trước. Mức này nằm giữa MAI-Image-2.5 tiêu chuẩn ở 48,1 USD/1.000 và MAI-Image-2.6-Flash ở 19,5 USD, tức đại khái là mức mà một mô hình tầm trung nên có. Hãy coi đó là con số của bảng đánh giá hơn là một báo giá bạn có thể mua theo.
Vị trí của OrcaRouter trong một quyết định như thế này nằm ở phía dịch vụ lưu trữ (hosted), và việc nói chính xác về điều đó rất quan trọng. Chúng tôi không định tuyến cả hai mô hình. MAI-Image-2.6 Preview chỉ có thể truy cập thông qua các bề mặt của chính Microsoft khi nó vẫn ở trạng thái chỉ dành cho người được mời, và chúng tôi hoàn toàn không có tuyến hình ảnh nào của Microsoft. Qwen-Image-2.1 chỉ tự lưu trữ (self-hosted), và chúng tôi không định tuyến bất kỳ mô hình Qwen-Image nào thuộc bất kỳ phiên bản nào. Điều chúng tôi cung cấp là dòng hình ảnh mà bạn sẽ ghép cặp với những thứ này: GPT-Image-2, GPT-Image-1.5 và GPT-Image-1-mini của OpenAI, các bậc Imagen 4 và bản xem trước hình ảnh Gemini của Google, và endpoint hình ảnh Grok Imagine của xAI — hơn 200 mô hình phía sau một endpoint tương thích OpenAI, giá niêm yết của nhà cung cấp được chuyển thẳng với mức chênh lệch bằng không, tự động chuyển đổi dự phòng giữa các nhà cung cấp, một DSL định tuyến để kết hợp các phương án dự phòng, và hợp nhất mô hình cho các lệnh gọi kiểu hội đồng. Việc chuyển thẳng giá rất quan trọng đối với một so sánh như thế này: khi một nhà cung cấp trong tập hợp đó thay đổi mức giá, con số của chúng tôi thay đổi cùng ngày, đó là cách duy nhất để giữ cho một lớp định tuyến trung thực so với giá trực tiếp từ nhà cung cấp.
Khoảng cách nào bạn có thể chấp nhận được
• Bạn cần một con số có thể bảo vệ được — MAI-Image-2.6 Preview, nếu bạn có thể tiếp cận được. Những lá phiếu bầu mù độc lập ở vị trí đầu bảng xếp hạng chỉnh sửa đánh bại một benchmark của nhà cung cấp, và nếu quyết định phải được biện minh với người khác, thì đó chính là bằng chứng có thể trụ vững trước sự soi xét.
• Bạn cần giao hàng ngay hôm nay — Qwen-Image-2.1. Trọng số được công khai, các framework đều hỗ trợ nó, và giấy phép cho phép nghiên cứu và đánh giá ngay lập tức. Không lời mời, không danh sách chờ.
• Bạn cần sự minh bạch hoặc 2K — Qwen-Image-2.1, và đây là hàng duy nhất mà bảng so sánh không hề sát nút. Alpha có được từ bộ lấy mẫu, còn dòng MAI-Image thì hoàn toàn không ghi nhận đầu ra trong suốt.
• Bạn cần bán được đầu ra — không cái nào cả, trong tình hình hiện tại. Qwen-Image-2.1 cấm điều đó nếu không có giấy phép riêng, và MAI-Image-2.6 Preview thì không thể mua được. Đối với một quy trình thương mại, hãy tìm đến thứ gì đó có bảng giá công bố và giấy phép thương mại.
Hai điều đáng theo dõi đều xoay quanh cùng một khoảng trống đang được lấp đầy. Nếu Microsoft đưa MAI-Image-2.6 ra khỏi giai đoạn xem trước với một bảng giá công khai, nó sẽ không còn chỉ là một điều gây tò mò trên bảng xếp hạng nữa mà trở thành một lựa chọn có thể mua được với bằng chứng chỉnh sửa độc lập tốt nhất trên bảng. Nếu Qwen công bố các điều khoản thương mại cho Qwen-Image-2.1 và mô hình này bắt đầu xuất hiện trên các bảng độc lập, thì dòng giấy phép sẽ không còn phải gánh toàn bộ phần việc. Cho đến lúc đó, cách đọc trung thực là đây không phải cuộc đối đầu giữa hai sản phẩm — mà là cuộc đối đầu giữa hai kiểu thông tin còn thiếu.

