Một thẻ hero được tạo cho bài viết 'Qwen-Image 2.1 vs Qwen-Image 3.0' hiển thị hai thẻ mô hình bo tròn được dán nhãn 'Qwen-Image 2.1' và 'Qwen-Image 3.0' với các nhãn ngày 20 Sep 2026 và 21 Jul 2026, một biểu tượng tải xuống trên một thẻ và một biểu tượng đám mây trên thẻ kia, cùng một dải ruy-băng ghi 'Số nhỏ hơn là mô hình mới hơn'.
Guides & Insights

Qwen-Image 2.1 vs Qwen-Image 3.0: Số nhỏ hơn là mô hình mới hơn

Tác giả

Rowan Sterling

Ngày đăng

Quay lại tất cả bài viết

Hãy bắt đầu với điều khiến tất cả mọi người vấp phải. Qwen-Image 2.1mới hơn Qwen-Image 3.0. Nhà cung cấp đã phát hành Qwen-Image 3.0 vào ngày 21 tháng 7 năm 2026 và đưa nó tới trạng thái sẵn sàng chung vào ngày 5 tháng 8. Họ phát hành Qwen-Image 2.1 vào ngày 20 tháng 9 năm 2026 — muộn hơn bảy tuần, và thấp hơn một phiên bản phụ thấp hơn. Cách đánh số này không phải là một trình tự; đó là hai dòng sản phẩm khác nhau dùng chung một cái tên, và sự thật hữu ích nhất về cả hai là chúng có lập trường đối lập nhau về câu hỏi quyết định liệu bạn có thể xây dựng dựa trên chúng hay không. Qwen-Image 3.0 là đóng và chạy trên máy chủ, không có trọng số, không có giấy phép và không có báo cáo kỹ thuật. Qwen-Image 2.1 là trọng số mở, có thể tải xuống ngay hôm nay, theo một giấy phép nghiên cứu chỉ cho phép sử dụng phi thương mại.

Hai sản phẩm tình cờ có cùng tên

Gia đình Qwen-Image giờ đây đã đưa ra ba lập trường cấp phép khác biệt trong vòng mười bốn tháng, và việc trình bày rõ chúng sẽ xóa tan phần lớn sự nhầm lẫn:

Qwen-Image 1.0 và 2.0 — trọng số mở theo Apache 2.0 trên Hugging Face và ModelScope, báo cáo kỹ thuật ngay trong ngày ra mắt, có thể tự lưu trữ, tinh chỉnh, lượng tử hóa.

Qwen-Image 3.0 — đóng. Không có trọng số, không có giấy phép được nêu rõ, không có model card, không có báo cáo kỹ thuật, không có bảng đánh giá nào được công bố. Chỉ có thể truy cập thông qua API do bên cung cấp vận hành, ở hai phiên bản Pro và Standard.

Qwen-Image 2.1 — lại mở trọng số, nhưng theo Thỏa thuận Giấy phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026, vốn cấp các quyền "FOR NON-COMMERCIAL PURPOSES ONLY" và chuyển việc sử dụng thương mại sang một giấy phép được đàm phán riêng.

Hãy đọc điều đó như một khuôn mẫu thay vì một dòng thời gian, và hình thái sẽ rõ ràng: Alibaba không còn coi "mở" là một thứ nhị phân. Qwen-Image 2.1 không phải là bản phát hành với điều khoản cấp phép thoáng như 1.0 và 2.0 từng là, cũng không phải là bản phát hành đóng như 3.0 từng là. Đó là một vị thế thứ ba — trọng số mà bạn có thể kiểm tra, chạy và sửa đổi, với một cổng thương mại gắn chặt vào phía trước.

Mỗi mô hình thực sự là gì

Qwen-Image 2.1 — một mô hình thống nhất để tạo ảnh từ văn bản và chỉnh sửa ảnh, với 7B tham số trong thành phần tạo hình ảnh, được xây dựng dưới dạng DiT đơn luồng 32 lớp. Một bộ mã hóa văn bản Qwen3-VL 8B và VAE RGBA 64 kênh với độ nén không gian 16× nằm song song với nó; bản tải xuống đầy đủ nặng khoảng 33 GB, trong đó bộ mã hóa văn bản chiếm hơn một nửa. Cơ chế attention nhân quả theo khối với mặt nạ nhân quả cấp token cho văn bản và mặt nạ hai chiều cấp khối cho việc tạo hình ảnh, cùng với việc tái sử dụng bộ nhớ đệm KV tiền tố cho chỉnh sửa nhiều ảnh. 2K gốc, mặc định là 2048×2048 ở 40 bước, với bảy cấu hình tỷ lệ khung hình có sẵn.

Qwen-Image 3.0 — một mô hình đóng dạng hosted ở các phiên bản Pro và Standard, cung cấp khả năng tạo và chỉnh sửa ảnh qua một API duy nhất. Tài liệu ra mắt của Alibaba tuyên bố prompt dài tới khoảng 4.500 token, văn bản đọc được ở kích thước nhỏ tới khoảng 10 pixel, và độ phủ 12 ngôn ngữ trên hơn 20 phông chữ, với đầu ra lên tới 2048×2048 và tối đa sáu ảnh mỗi lần gọi. Không có số lượng tham số nào được công bố; con số ~20B MMDiT được nhắc đi nhắc lại rộng rãi chỉ là thông tin được báo cáo chứ chưa được xác nhận.

Khác biệt về kiến trúc quan trọng nhất trên thực tế không nằm ở kích thước — mà ở chỗ mô hình chạy ở đâu và bạn có thể làm gì với nó. Qwen-Image 2.1 đến dưới dạng các tệp mà bạn có thể kiểm tra, lượng tử hóa, tinh chỉnh trên dữ liệu riêng và chạy trên phần cứng của chính mình, với một pull request hỗ trợ SGLang được hợp nhất ba ngày trước khi trọng số được phát hành. Qwen-Image 3.0 đến dưới dạng một endpoint. Bạn không thể lượng tử hóa nó, bạn không thể tinh chỉnh nó, và bạn không thể chạy nó ở bất kỳ đâu khác ngoài nơi Alibaba chạy nó.

Chỉnh sửa chính là nơi hai thứ ấy tách xa nhau mạnh mẽ nhất

Cả hai mô hình đều thực hiện tạo và chỉnh sửa trong một hệ thống, nên điểm so sánh đáng chú ý nằm ở các chi tiết chỉnh sửa — và ở đây, mô hình mới hơn, nhỏ hơn là mô hình có năng lực hơn trên lý thuyết.

Hình ảnh tham chiếu — Qwen-Image 2.1 chấp nhận tối đa 10 tham chiếu đầu vào. Tài liệu Pro của Qwen-Image 3.0 mô tả khả năng hỗ trợ 1–3 hình ảnh đầu vào.

Kiểm soát chỉnh sửa cục bộ — Qwen-Image 2.1 hỗ trợ khoanh tròn, chú thích vẽ tay và một mask riêng được cung cấp như đầu vào độc lập để ảnh gốc vẫn không bị đánh dấu. Đường chỉnh sửa được tài liệu hóa của Qwen-Image 3.0 bao gồm viết lại cục bộ, mở rộng nội dung, chuyển đổi phong cách và tạo đa góc máy, nhưng không có quy trình dựa trên mask nào được công bố.

Tính trong suốt — Qwen-Image 2.1 tạo và chỉnh sửa ảnh RGBA một cách gốc, chỉnh sửa văn bản bên trong một lớp trong suốt, và tách chủ thể từ một bức ảnh RGB vào một lớp trong suốt. Thông báo của Qwen-Image 3.0 không đưa ra tuyên bố nào về tính trong suốt.

Viết lại prompt — Qwen-Image 2.1 cung cấp hai checkpoint viết lại chuyên dụng, cả hai đều là mô hình Qwen3.5-VL 9B đã được tinh chỉnh, một cho text-to-image và một cho chỉnh sửa, với mã viết lại và system prompt được công bố. Việc xử lý prompt của Qwen-Image 3.0 là một hộp đen phía sau API.

Hệ sinh thái — Qwen-Image 2.1 được hỗ trợ ngay từ ngày đầu trong Diffusers, ComfyUI, vLLM-Omni, SGLang và LightX2V, cùng với các hướng hỗ trợ AMD ROCm và FlagOS. Qwen-Image 3.0 có API.

Dòng cuối cùng đó không phải là một câu nói tu từ hoa mỹ. Đối với một đội mà pipeline nằm trong ComfyUI hoặc có stack suy luận là vLLM, sự khác biệt giữa một mô hình có lớp pipeline đã hợp nhất và một mô hình có endpoint HTTP chính là sự khác biệt giữa một tác vụ tích hợp và một lần viết lại.

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs Qwen-Image 3.0 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Released: 20 Sep 2026; Licence: research, non-commercial; Access: 33 GB open download; Reference images: up to 10; Transparency: native RGBA; Published price: none. Right column 'Qwen-Image 3.0': rows reading Released: 21 Jul 2026, GA 5 Aug; Licence: not published; Access: closed hosted API; Reference images: 1 to 3; Transparency: none claimed; Published price: ~$0.04 Pro, $0.03 Std. Footer reads 'Qwen-Image 2.1 specs per vendor model card, unaudited; Qwen-Image 3.0 pricing is vendor list, unaudited.'

Giá cả, và điều mà giá cả không thể nắm bắt

Qwen-Image 3.0 là bản duy nhất trong hai bản có giá được công bố: trên cloud của nhà cung cấp, Pro được niêm yết ở mức khoảng 0,04 USD mỗi ảnh và Standard khoảng 0,03 USD, với giá dành cho người tiêu dùng nội địa khởi điểm gần 0,18 Nhân dân tệ. Đó là các con số thời điểm ra mắt và chưa được kiểm toán độc lập. Qwen-Image 2.1 không có mức giá nào cho bản chạy trên máy chủ được công bố — nó là bản tải xuống, và chi phí chính là chi phí thời gian GPU của chính bạn.

Hai dòng đó không thể so sánh với nhau, và giả vờ rằng có thể là lỗi phổ biến nhất trong màn so kè này. Giá theo từng ảnh bao gồm mô hình, hạ tầng phục vụ, khả năng mở rộng và thời gian hoạt động của người khác. Một bản tải trọng số không bao gồm bất kỳ điều nào trong số đó. Câu hỏi đúng không phải là con số nào nhỏ hơn; mà là liệu bạn có năng lực vận hành để chạy một ngăn xếp mô hình 33 GB hay không, và liệu giấy phép ở phía rẻ có cho phép những gì bạn dự định làm với nó hay không.

Điều này đưa giấy phép trở lại trung tâm của sự so sánh, đúng như vị trí vốn có của nó. Các điều khoản của Qwen-Image 3.0 không được công bố, và đó là vấn đề riêng của nó đối với công việc trong lĩnh vực có quy định chặt chẽ hoặc công việc agency — không có tài liệu nào để viện dẫn. Các điều khoản của Qwen-Image 2.1 được công bố, và chúng ghi rõ là phi thương mại. Giữa một giấy phép không rõ ràng và một giấy phép hạn chế rõ ràng, giấy phép hạn chế rõ ràng thì dễ lên kế hoạch hơn, vì ít nhất bạn biết mình cần phải trao đổi về điều gì.

A screenshot of the Qwen vendor blog page for Qwen-Image 3.0, captured September 20 2026, showing the launch announcement, the Pro and Standard edition descriptions, the claimed prompt-length and text-rendering figures, and the per-image list pricing.

Bạn nên chọn cái nào

Bạn cần hình ảnh sản xuất thiên về văn bản và muốn giao cho người khác vận hành — Qwen-Image 3.0 là lựa chọn phù hợp, kèm lưu ý rằng các số liệu hiển thị văn bản tiêu đề của nó là tuyên bố của nhà cung cấp, và các bài kiểm tra độc lập hiện có cho thấy văn bản cỡ chữ nhỏ vẫn bị lỗi méo trong một số trường hợp.

Bạn cần tự chạy mô hình, tinh chỉnh nó hoặc giữ dữ liệu trên phần cứng của riêng bạn — Qwen-Image 2.1 là lựa chọn duy nhất trong hai, và giấy phép nghiên cứu chính là cái giá phải trả.

Bạn cần tài nguyên nền trong suốt, ảnh cắt tách sản phẩm, hoặc nhiều hơn ba ảnh tham chiếu — Qwen-Image 2.1, theo thông số kỹ thuật đã công bố, là công cụ mạnh hơn, và xét về số lượng ảnh tham chiếu thì khoảng cách không hề nhỏ.

Bạn cần quyền thương mại và cấp phép permissive — mô hình của bạn không đáp ứng cả hai điều này. Qwen-Image 3.0 không có điều khoản nào được công bố cả, và Qwen-Image 2.1 yêu cầu giấy phép thương mại phải thương lượng. Các bản phát hành Apache-2.0 trong dòng này là Qwen-Image 1.0 và 2.0 trước đó.

Dòng cuối cùng đó là dòng đáng để suy ngẫm kỹ, vì nó mô tả một tập hợp đang thu hẹp dần. Giấy phép đã được cấp không thay đổi theo hồi tố, nên các bản phát hành Qwen-Image theo Apache-2.0 vẫn có thể sử dụng theo các điều khoản ban đầu. Nhưng nếu bạn đang lên kế hoạch cho một pipeline hình ảnh thương mại dựa trên giả định rằng Qwen-Image mới nhất sẽ được cấp phép theo kiểu permissive, thì ba bản phát hành gần nhất là bằng chứng chống lại giả định đó.

Chạy một trong hai mà không đặt cược cả pipeline vào nó

Cả hai mô hình này, vì những lý do khác nhau, đều rất khó để đặt phía sau một luồng vận hành thực tế ngày nay — một cái vì giấy phép, một cái vì hộp đen và số lượng tham số không được công bố. Đó chính xác là tình huống mà một lớp định tuyến được tạo ra để giải quyết. OrcaRouter đặt hơn 200 mô hình phía sau một endpoint tương thích OpenAI với giá niêm yết của nhà cung cấp và không thêm phụ phí, cùng khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp và một DSL định tuyến cho phép bạn kết hợp nhiều mô hình vào một lệnh gọi duy nhất, để một mô hình mới hoặc khó xử có thể nằm cạnh một mô hình đã được kiểm chứng thay vì đứng trước nó. Model fusion đẩy ý tưởng đó đi xa hơn, chạy một nhóm mô hình cùng lúc và cho phép bạn so sánh chúng trên chính prompt của mình thay vì trên một biểu đồ ra mắt.

Cả Qwen-Image 2.1 lẫn Qwen-Image 3.0 đều không nằm trong số các mô hình mà chúng tôi định tuyến hiện nay, và bài viết này sẽ không gợi ý điều ngược lại. Những mô hình hình ảnh mà chúng tôi định tuyến — dòng GPT-Image của OpenAI, các bậc Imagen 4 và bản xem trước hình ảnh Gemini của Google, cùng endpoint hình ảnh Grok Imagine của xAI — chính là những thứ mà một đường dự phòng thực sự sẽ được xây dựng từ đó trong khi bạn đánh giá cặp Qwen theo cách của riêng bạn.

Điều cần theo dõi thì hẹp hơn vẻ ngoài của nó. Alibaba giờ đã chứng minh rằng họ sẽ phát hành trọng số mở, các mô hình đóng được lưu trữ, và các bản tải xuống theo giấy phép nghiên cứu trong cùng một họ mô hình, trong cùng một quý. Bản phát hành tiếp theo sẽ không cho bạn biết mô thức nào đã thắng. Tệp giấy phép sẽ cho bạn biết.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.