Thẻ tiêu đề cho phần so sánh Ming-Image-0.1-Design và Qwen-Image 2.1, với phụ đề rằng giấy phép và chi phí phần cứng quyết định sự lựa chọn, một thẻ ghi giấy phép linh hoạt hơn và thẻ kia ghi giấy phép hạn chế hơn.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 2.1: Giấy phép mới là sự khác biệt thực sự

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình ảnh mở ra mắt cách nhau ba ngày vào tháng 9 năm 2026 và, nếu chỉ đọc trên bảng thông số, chúng trông như cùng một thứ để mua. Ming-Image-0.1-Design, do nhóm inclusionAI của Ant Group xây dựng, đã đưa trọng số của mình lên Hugging Face vào ngày 17 tháng 9 theo giấy phép MIT. Qwen-Image 2.1, từ nhóm Qwen của Alibaba, tiếp nối vào ngày 20 tháng 9 theo Qwen Research License Agreement. Cả hai đều xuất RGBA gốc, cùng tuyên bố đầu ra 2K, và cùng nhắm đến một kiểu người mua: một nhóm muốn khả năng tạo ảnh mà họ có thể tự lưu trữ, kiểm tra và sửa đổi. Hai điều thực sự phân biệt chúng lại là hai thứ mà bảng thông số thể hiện kém nhất — bạn được phép làm gì với kết quả về mặt pháp lý, và cần bao nhiêu silicon để tạo ra một kết quả.

Đó không phải là một cách đặt vấn đề chỉ mang tính tu từ. Với một trong hai mô hình này, giấy phép là rào cản tuyệt đối đối với sử dụng thương mại; với mô hình còn lại, đó không phải vấn đề. Và số lượng tham số mà mỗi nhà cung cấp in trên hộp đã nói giảm dung lượng tải xuống đi ba hoặc bốn lần. Hai sự thật đó quyết định việc mua hàng từ rất lâu trước khi bất kỳ benchmark nào có thể quyết định — và thật ra, các benchmark đó hoàn toàn không thể so sánh với nhau.

Mỗi kho lưu trữ thực sự chứa những gì

Không mô hình nào là một mạng duy nhất. Cả hai đều là pipeline, và chính pipeline là nơi chứa đựng kích thước:

Bộ sinh — Ming-Image-0.1-Design phát hành một transformer thiết kế 6,15 tỷ tham số (12,31 GB ở BF16); Qwen-Image 2.1 phát hành một DiT đơn luồng 7,1 tỷ với 32 lớp, attention nhân quả theo khối và số lượng tham số hoạt động không được tiết lộ (khoảng 14,2 GB).

• Phía văn bản — Ming-Image-0.1-Design ghép transformer của nó với một LLM đa phương thức 17,01B (34,02 GB) và một connector 3,09B (6,17 GB); Qwen-Image 2.1 sử dụng bộ mã hóa văn bản Qwen3-VL 8B (khoảng 17,5 GB).

• Tổng số tham số — 26,44B cho Ming-Image-0.1-Design so với khoảng 15–16B cho Qwen-Image 2.1. Lưu ý rằng con số nổi bật của cả hai nhà cung cấp đều không phải là tổng: "6B" và "7B" đều chỉ mô tả riêng phần generator.

• Kích thước kho lưu trữ — 52,88 GB đối với Ming-Image-0.1-Design (49,25 GiB trong đó là trọng số); khoảng 33 GB đối với Qwen-Image 2.1.

• Tính trong suốt — cả hai đều xuất RGBA nguyên bản trực tiếp từ mô hình thay vì thông qua một bước tách nền hậu kỳ. Ming-Image-0.1-Design sử dụng RGBA VAE riêng; Qwen-Image 2.1 sử dụng VAE RGBA 64 kênh với nén không gian 16×.

• Tạo mặc định — Ming-Image-0.1-Design được xác thực ở 2048×2048, 12 bước, BF16, CFG 1.0; Qwen-Image 2.1 mặc định là 2048×2048 qua 40 bước với bảy cấu hình sẵn tỷ lệ khung hình.

• Giấy phép — MIT cho Ming-Image-0.1-Design; Thỏa thuận Cấp phép Nghiên cứu Qwen, phi thương mại, dành cho Qwen-Image 2.1.

Nhãn "6B" đang làm rất nhiều việc.

Kho của Ant Group được đặt tên xoay quanh một mô hình 6 tỷ tham số, và transformer thực sự là 6,15B. Nhưng trọng số bạn tải về là 49,25 GiB, kho chứa là 52,88 GB, và cấu hình mà nhà cung cấp đã kiểm chứng — 2048×2048 ở BF16 với toàn bộ ngăn xếp văn bản thường trú — được chỉ định cho một GPU CUDA 80 GiB. Đó không phải là sai số làm tròn trên một card 48 GB; đó là một card mà bạn không thể dùng. Một bộ tăng tốc 48 GB sẽ không chứa nổi pipeline, và hai cái cũng vậy nếu không có những màn nhào lộn offload mà nhà cung cấp không tài liệu hóa.

Qwen-Image 2.1 là bản tải xuống dễ tính hơn, với lưu ý rằng Alibaba không công bố chút số liệu VRAM chính thức nào. Hướng dẫn duy nhất trên model card là bật CPU offload trên các card nhỏ hơn. Những gì đã được đo đạc kể từ khi ra mắt hữu ích hơn những gì đã được công bố: một pipeline int8 chạy tổng cộng khoảng 16 GiB và vừa vặn thường trú hoàn toàn trên một card 24 GB, trong khi một lần chạy BF16 đầy đủ được báo cáo dao động từ khoảng 17 GB với CPU offload cho tới đỉnh khoảng 40 GiB ở 1024×1024, tùy thuộc vào cách đặt text encoder. Độ trễ một ảnh được báo cáo nằm trong khoảng từ vài giây trên B200 đến dưới mười giây trên một card workstation hiện hành. Hãy coi mọi con số đó là đo đạc từ cộng đồng chứ không phải thông số kỹ thuật — chúng thay đổi theo chiến lược offload còn nhiều hơn mức độ khác biệt giữa các model với nhau.

Tóm tắt thực tế: Qwen-Image 2.1 là mô hình tầm cỡ 3090 nếu bạn sẵn sàng offload; Ming-Image-0.1-Design là mô hình cấp trung tâm dữ liệu không có cấu hình nhỏ hơn.

Giấy phép chính là ngã rẽ trên con đường

Đây là phần thực sự sẽ khiến một dự án dừng lại, và đây cũng là phần mà hai bản phát hành xử lý khác biệt nhau nhất.

Ming-Image-0.1-Design là MIT. Phát hành nó trong một sản phẩm trả phí, tinh chỉnh nó, phân phối lại trọng số, giữ các thay đổi của bạn ở dạng đóng — không điều nào trong số đó đòi hỏi phải trao đổi với Ant Group.

Qwen-Image 2.1 thì không. Nó đi kèm Thỏa thuận Giấy phép Nghiên cứu Qwen đề ngày 20 tháng 9 năm 2026, theo đó các trọng số chỉ được cấp phép cho mục đích nghiên cứu và đánh giá. Việc sử dụng cho mục đích thương mại cần một thỏa thuận riêng với Alibaba, và không có mức giá nào cho thỏa thuận đó được công bố. Các sản phẩm phái sinh và việc phân phối lại phải kèm theo giấy phép, một thông báo "Built with Qwen" hoặc "Improved using Qwen" và dòng bản quyền của Hangzhou Tongyi Laboratory, đồng thời "Qwen" không được là tên chính của một mô hình phái sinh. Giấy phép này được điều chỉnh bởi luật Trung Quốc với thẩm quyền tài phán tại Hàng Châu.

Có một điểm thực sự giúp làm rõ trong phần phản hồi tiếp theo của chính nhà cung cấp: Alibaba đã tuyên bố rằng hình ảnh được tạo ra không thuộc phần "Tài liệu" được cấp phép, nên bạn giữ quyền đối với những gì mô hình tạo ra. Hạn chế này gắn với trọng số và mô hình, chứ không gắn với đầu ra của bạn. Đó là một ngoại lệ đáng kể và đáng để đọc thật chính xác, bởi vì cách tóm tắt đơn giản — "hình ảnh là của bạn, mô hình thì không" — mới là cách đúng.

Đây cũng là một sự thay đổi hướng đi. Các bản phát hành Qwen-Image trước đó, bao gồm Qwen-Image gốc và các bản dựng 2511 và 2512, vẫn giữ Apache 2.0 và cho phép sử dụng thương mại. Một nhóm đã chọn Qwen-Image năm ngoái vì giấy phép của nó và nâng cấp lên 2.1 trong tháng này sẽ thừa hưởng một hạn chế chỉ dành cho nghiên cứu mà họ chưa từng đồng ý. Nếu các điều khoản cho phép là yêu cầu, thì Qwen-Image 2.1 không phải là phiên bản mới hơn của thứ bạn đang có — mà là một thỏa thuận khác.

Mỗi cái được tạo ra để làm gì

Sự phân chia giấy phép phản ánh một khác biệt về ý định, và chính sự khác biệt đó mới là điều nên định hướng lựa chọn khi cả hai đều là lựa chọn hợp pháp cho bạn.

Ming-Image-0.1-Design là một công cụ thiết kế. Chuỗi văn bản tồn tại để mở rộng một bản tóm tắt ngắn thành một prompt có cấu trúc 8K, và nhà cung cấp đi kèm các "skills" quanh nó — một Design Skill tạo bản nháp trực quan trong khoảng 15 giây, và một PPT Skill hướng đến đầu ra dạng slide. Kho lưu trữ đồng hành của nó, Ming-Image-0.1-Design-Layer, nhận một thiết kế đã được làm phẳng và trả lại nó dưới dạng các lớp riêng biệt, đây là khả năng duy nhất ở đây mà không có thứ nào khác trong lĩnh vực mở cung cấp. inclusionAI báo cáo rằng mô hình Layer chạy nhanh hơn khoảng 4,3× so với một mô hình layer mở 20B trong cùng công việc (183 giây so với 795) — do nhà cung cấp báo cáo, chưa được tái lập, và mục tiêu so sánh không được nêu tên đủ chính xác để kiểm chứng.

Qwen-Image 2.1 là một công cụ tạo-và-chỉnh sửa. Một checkpoint duy nhất vừa tạo ảnh từ văn bản vừa chỉnh sửa theo hướng dẫn, nhận tối đa 10 ảnh tham chiếu cho một lần chỉnh sửa và hỗ trợ các chỉnh sửa cục bộ giữ nguyên phần còn lại của khung hình. Nó được phát hành kèm hỗ trợ ngay từ ngày đầu trong ComfyUI, Diffusers, vLLM-Omni, SGLang-Diffusion và LightX2V — một câu chuyện phục vụ mà Ming-Image-0.1-Design vẫn chưa có, vì hướng dẫn phục vụ của chính nó lại chỉ vào vLLM-Omni.

Hãy hiểu đó là một sự phân nhánh thay vì một bảng xếp hạng. Nếu công việc là "tạo ra một tài nguyên thiết kế có phân lớp, có thể chỉnh sửa từ một bản brief", thì Ming-Image-0.1-Design là mẫu duy nhất trong hai mẫu làm được điều đó. Nếu công việc là "tạo sinh rồi chỉnh sửa lặp lại dựa trên các tham chiếu", Qwen-Image 2.1 làm được điều đó trong một mô hình duy nhất, còn Ming-Image-0.1-Design thì hoàn toàn không làm được.

Các benchmark không so sánh được, và đó là câu trả lời trung thực.

Cả hai nhà cung cấp đều có số liệu riêng. Không thể đặt số liệu này cạnh số liệu kia, và bất kỳ bài viết nào làm vậy đều đang tự bịa ra một kết quả.

Bằng chứng của Ming-Image-0.1-Design là một bảng của Artificial Analysis: vị trí đầu tiên trên Bảng xếp hạng Text-to-Image được lọc theo trọng số mở cho Thiết kế UI/UX, với Elo 1.082, xếp trên Ideogram 4.0 Quality ở 1.052, Ideogram 4.0 ở 1.015, HunyuanImage 3.0 Instruct ở 1.005 và FLUX.2 [dev] ở 1.000. Nhà cung cấp cũng báo cáo tỷ lệ thắng 67,4% về bố cục, 67,0% về bố cục phức tạp và 66,7% về kết xuất văn bản, cùng vị trí đầu tiên trên 12 chỉ số trên Crello. Bảng xếp hạng là một công cụ của bên thứ ba, khiến Elo trở thành loại bằng chứng mạnh hơn trong hai loại bằng chứng ở đây; tỷ lệ thắng và việc thắng trọn bộ trên Crello là do nhà cung cấp báo cáo và nên được đọc như những tuyên bố.

Artificial Analysis Text-to-Image Leaderboard filtered to open weights on the UI/UX Design board, showing Ming-Image-0.1-Design first at Elo 1,082 above Ideogram 4.0 Quality at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and FLUX.2 dev at 1,000.

Bằng chứng của Qwen-Image 2.1 là Qwen-Image-Bench, một benchmark do nhóm Qwen xây dựng, trên đó nó đạt 60.28 và dẫn đầu lĩnh vực mã nguồn mở, xếp trên Nano Banana 2.0 với 59.82 và GPT Image 1.5 với 59.65. Tư liệu nguồn ghi rõ benchmark này do Qwen xây dựng, và ba vị trí dẫn đầu chỉ cách nhau trong vòng một điểm — một khoảng cách hoàn toàn nằm trong mức nhiễu của một benchmark mà tác giả của nó cũng là một đối thủ trong đó.

Vậy là: một Elo của bên thứ ba trên một tập con thiết kế UI/UX, đối chiếu với một điểm tổng quát do nhà cung cấp tự xây dựng. Công cụ khác nhau, nhiệm vụ khác nhau, giám khảo khác nhau. Chưa ai công bố một lần chạy đối đầu trực tiếp giữa hai mô hình này với nhau, và với bằng chứng hiện có, không ai có thể làm được. Cách diễn giải hữu ích thì hẹp và đáng được nói thẳng — Ming-Image-0.1-Design có sự xác nhận của bên thứ ba đối với riêng công việc thiết kế, Qwen-Image 2.1 có thế mạnh do nhà cung cấp báo cáo về khả năng tạo và chỉnh sửa tổng quát, và mức chồng lấn giữa hai tuyên bố đó nhỏ hơn những gì các con số nổi bật gợi ý.

Đưa một trong hai lên một endpoint

Hiện tại, cả hai mô hình đều chưa có trong danh mục của OrcaRouter. Ming-Image-0.1-Design và Qwen-Image 2.1 hiện đều là những phương án tự vận hành: các trọng số có thể tải xuống và hướng dẫn phục vụ là có thật, nhưng bạn phải tự dựng GPU, và với Ming thì GPU đó là loại 80 GiB. Chúng tôi liệt kê chúng ở đây như các bản phát hành trọng số mở, không phải dưới dạng các tuyến.

Điều đáng biết trước khi bạn cam kết phần cứng là cùng khối lượng công việc đó tốn bao nhiêu khi gọi qua API. Các mô hình hình ảnh được định tuyến của chúng tôi bao gồm google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview, google/gemini-3.1-flash-image-preview, ba hạng của Imagen 4.0 (fast, standard và ultra), grok/grok-imagine-image và dòng GPT-Image — openai/gpt-image-1, openai/gpt-image-1-mini, openai/gpt-image-1.5 và openai/gpt-image-2. Chạy một bản brief thiết kế với một trong số đó trong một tuần sẽ cho bạn biết liệu đầu ra theo lớp của Ming-Image-0.1-Design có phải là năng lực bạn thực sự cần hay không, với chi phí chỉ bằng một phần nhỏ so với chiếc card 80 GiB, và nó cho bạn biết điều đó trước khi bạn phát hiện ra liệu giấy phép hay VRAM mới là thứ chặn. Khi bạn thực sự đưa một mô hình tự lưu trữ vào luồng production, cùng endpoint đó là nơi định tuyến nằm — một khóa cho hơn 200 mô hình, tự động chuyển đổi dự phòng giữa các nhà cung cấp, và mức markup 0%, nên việc nhà cung cấp giảm giá có hiệu lực phía chúng tôi ngay trong ngày công bố.

The OrcaRouter model page for openai/gpt-image-2, one of the image models actually routable, showing the OpenAI-compatible base URL, the /v1/images/generations endpoint and per-million-token input and output pricing.

Ai nên chọn cái nào

Chọn Ming-Image-0.1-Design nếu sản phẩm bàn giao là một tài sản thiết kế chứ không phải một bức ảnh: đầu ra dạng lớp, mở rộng prompt có cấu trúc, tạo theo dạng slide, và giấy phép cho phép bạn bán bất cứ thứ gì bạn tạo ra bằng nó. Hãy dự trù ngân sách cho một chiếc card nghiêm túc và chấp nhận rằng hệ sinh thái phục vụ xung quanh nó mỏng hơn phía Qwen. Đây cũng là lựa chọn hữu ích hơn trong hai lựa chọn nếu bạn cần đưa ra một con số trước mặt khách hàng, vì bằng chứng mạnh nhất của nó là con số bên thứ ba duy nhất trong so sánh này.

Chọn Qwen-Image 2.1 nếu quy trình là tạo-rồi-chỉnh sửa, nếu bạn cần điều kiện hóa bằng ảnh tham chiếu, hoặc nếu bạn muốn chạy trên phần cứng mà bạn đã sở hữu. Nó nhỏ hơn, được phục vụ tốt hơn ngay từ ngày đầu, và giấy phép của nó phù hợp cho công việc nghiên cứu và đánh giá mà hầu hết mọi người thực sự làm trước tiên. Nó trở thành lựa chọn sai ngay khi đầu ra mang tính thương mại và việc rà soát pháp lý là thật, bởi vì con đường duy nhất để có giấy phép thương mại là thỏa thuận trực tiếp với Alibaba và không có mức giá công bố nào để lập kế hoạch dựa vào.

Hiện giờ, đừng chọn cái nào cả, nếu thứ bạn cần là tạo ảnh trong môi trường production trong tháng này. Cả hai đều là trọng số, và trọng số là một cam kết về phần cứng lẫn pháp lý trước khi chúng trở thành một năng lực. Câu hỏi thiết kế — liệu đầu ra phân lớp có thay đổi thứ mà nhóm tôi có thể tung ra hay không — có thể được trả lời trước tiên trên một endpoint được host, và câu trả lời đó mới là thứ nên quyết định việc có mua card 80 GiB hay không.

Xem gì

Ba điều sẽ làm thay đổi phép so sánh này. Liệu Ming-Image-0.1-Design có nhận được một lộ trình phục vụ vượt ra ngoài hướng dẫn vLLM-Omni của riêng nó hay không, bởi đó hiện là khoảng cách giữa nó và danh sách năm framework hỗ trợ ngay từ ngày đầu của Qwen-Image 2.1. Liệu Alibaba có gắn một mức giá cho giấy phép Qwen thương mại hay không, bởi một mức giá chưa được gắn là ẩn số lớn nhất trong cặp so sánh này. Và liệu có ai — một phòng thí nghiệm, một đơn vị đánh giá độc lập, hay một nhà cung cấp không còn gì để mất — chạy hai mô hình này đối đầu nhau trên cùng các prompt hay không. Cho đến khi điều đó xảy ra, thứ gần nhất với một phép so sánh công bằng không phải là điểm số. Mà là dòng giấy phép, và Ming-Image-0.1-Design thắng hoàn toàn ở mục đó.

Scoreboard comparing Ming-Image-0.1-Design and Qwen-Image 2.1 across weights release date, licence, generator size, total parameters, repository size, validated hardware, default generation, output format and headline benchmark, with a footer separating third-party from vendor-reported figures.