
Qwen-Image 2.1 vs LLaDA-Image-Turbo: Hai mô hình hình ảnh mở, hai loại giấy phép rất khác nhau
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Hai mô hình ảnh trọng số mở ra mắt trong cùng ba tuần. Nhóm Qwen-Image đã công bố Qwen-Image 2.1 vào ngày 20 tháng 9 năm 2026 — trọng số, tệp giấy phép, thẻ mô hình và một bài blog, tất cả trong cùng một ngày, gần như không có thời gian chuẩn bị trước đó. Mười sáu ngày trước đó, vào ngày 4 tháng 9 năm 2026, inclusionAI (phòng nghiên cứu của Ant Group) đã công bố LLaDA-Image-Turbo mà không có bài đăng ra mắt, không có thông cáo báo chí và không có bất kỳ hình thức công bố nào. Cả hai đều có thể tải về ngay hôm nay. Không mô hình nào có dù chỉ một điểm đánh giá chuẩn độc lập. Và khác biệt thực sự sẽ quyết định việc bạn có thể dùng mô hình nào không nằm trong thẻ mô hình của bên nào — mà nằm ở giấy tờ. Qwen-Image 2.1 phát hành theo một giấy phép nghiên cứu cấm thẳng việc sử dụng cho mục đích thương mại. LLaDA-Image-Turbo phát hành mà hoàn toàn không khai báo giấy phép trên bất kỳ kho lưu trữ nào của nó.
Câu hỏi về giấy phép phải được đặt lên trước, vì đó là câu hỏi duy nhất có câu trả lời rõ ràng.
Bắt đầu từ đây, bởi vì mọi thứ khác trong sự so sánh này chỉ là tạm thời, còn điều này thì không.
• Qwen-Image 2.1 được phát hành theo Thỏa thuận Cấp phép Nghiên cứu Qwen, ngày 20 tháng 9 năm 2026, theo đó cấp các quyền "CHỈ DÀNH CHO MỤC ĐÍCH PHI THƯƠNG MẠI" và nêu rõ rằng việc sử dụng cho mục đích thương mại đòi hỏi phải có một giấy phép riêng được yêu cầu từ nhà cung cấp. Đây là một thay đổi mang tính trọng yếu so với dòng Qwen-Image trước đó, vốn được phát hành theo Apache 2.0. Điều này không hề mập mờ: bạn có thể đọc, đánh giá, đo kiểm chuẩn và viết về nó. Bạn không thể đưa nó vào một sản phẩm.
• LLaDA-Image-Turbo không công bố giấy phép nào cả. Không phải giấy phép cấp phép tự do, không phải giấy phép hạn chế, cũng không phải một giấy phép giữ chỗ tạm thời. Một kho lưu trữ không có giấy phép thì không phải là “được tự do sử dụng” theo bất kỳ nghĩa pháp lý nào — theo mặc định, mọi quyền đều được bảo lưu, đây là lập trường chặt chẽ hơn giấy phép nghiên cứu của Qwen, chứ không phải lỏng lẻo hơn. Nếu bạn định xây dựng dựa trên nó, đó là câu hỏi dành cho phòng thí nghiệm, không phải cho một tệp README.
Điều trớ trêu đáng được nói thẳng ra: mô hình ra đời với một giấy phép chính thức, mang tính hạn chế lại chính là mô hình mà bạn có thể lên kế hoạch dựa vào ngay hôm nay, vì bạn biết chính xác mình đang đứng ở đâu. Còn mô hình không có giấy phép lại là mô hình mà bạn không thể.

Hai mô hình thực sự là gì
Bỏ qua phần giấy phép đi, thì đây là hai thiết kế thực sự khác biệt, được tạo ra vì những lý do khác nhau.
• Kiến trúc — Qwen-Image 2.1 là một transformer khuếch tán đơn luồng 32 lớp với 7B tham số trong thành phần tạo hình ảnh, một bộ mã hóa văn bản Qwen3-VL 8B và một VAE RGBA 64 kênh với độ nén không gian 16×, khoảng 33 GB trên toàn bộ gói. LLaDA-Image-Turbo là một mô hình hợp nhất 6B vừa tạo vừa chỉnh sửa — một bộ trọng số đảm nhiệm cả hai công việc thay vì một mô hình nền cộng với một nhánh chỉnh sửa riêng.
• Số bước suy luận — Qwen-Image 2.1 mặc định 2048×2048 ở 40 bước với flow matching và lập lịch Euler discrete. LLaDA-Image-Turbo được chưng cất qua Twin-DMD xuống 2–4 bước, khuyến nghị 4 bước, và chạy ở guidance scale 1.0 so với 5.0 của mô hình Base.
• Tùy chọn độ chính xác — Qwen-Image 2.1 cung cấp hỗ trợ lượng tử hóa FP8 thông qua đường dẫn vLLM-Omni của nó. LLaDA-Image-Turbo phát hành cả checkpoint BF16 và FP8 dưới dạng các bản tải xuống riêng biệt.
• Điều kiện tham chiếu — Qwen-Image 2.1 chấp nhận tối đa 10 ảnh tham chiếu, hỗ trợ chỉnh sửa cục bộ bằng cách khoanh vùng, chú thích vẽ tay hoặc mặt nạ riêng, và tạo RGBA gốc với khả năng chỉnh sửa lớp trong suốt. Thẻ của LLaDA-Image-Turbo không công bố giới hạn số ảnh tham chiếu.
• Attention — Qwen-Image 2.1 sử dụng attention nhân quả theo khối: mặt nạ nhân quả ở cấp token cho văn bản và mặt nạ song hướng ở cấp khối (chunk) cho việc sinh ảnh, cùng với việc tái sử dụng bộ nhớ đệm KV tiền tố khi checkpoint mang causal_condition: true. Card của LLaDA-Image-Turbo không mô tả chi tiết cơ chế mặt nạ của nó như vậy.
• Giấy phép — chỉ dành cho nghiên cứu và được nêu rõ, so với không được khai báo.
Lưu ý ý nghĩa của số bước khi đặt cạnh số tham số. Qwen-Image 2.1 là một mô hình lớn hơn được chạy với số bước gấp mười lần; LLaDA-Image-Turbo là một mô hình nhỏ hơn được chưng cất xuống chỉ còn một vài bước. Đó là những đặt cược trái ngược về việc chi phí tạo ảnh nằm ở đâu, và câu trả lời đúng phụ thuộc hoàn toàn vào việc nút thắt cổ chai của bạn là số giây GPU cho mỗi ảnh hay mức trần về việc một hình ảnh có thể trông ra sao.
Kinh tế tốc độ: 40 bước so với 4
Cái tên Turbo ở đây thực sự đang phát huy tác dụng. Chưng cất Twin-DMD nén một quỹ đạo diffusion thành vài bước nhảy lớn, đó là lý do LLaDA-Image-Turbo có thể chạy chỉ với 4 bước trong khi mô hình Base của nó cần một lịch trình thông thường. Ở guidance 1.0, nó cũng bỏ qua classifier-free guidance, thứ thường nhân đôi số lượt truyền xuôi mỗi bước — nên khoảng cách hiệu dụng còn lớn hơn mức mà con số 40 so với 4 tự nó gợi ra.
Điều đó mang lại cho bạn là thông lượng và tính dự đoán được. Một mô hình 6B chỉ với bốn bước là kiểu thứ vừa vặn trên một card tiêu dùng duy nhất và tạo ra ảnh nháp đủ nhanh để nằm trong một vòng lặp tương tác. Qwen-Image 2.1 ở 40 bước và 2048×2048 là một cấu hình ưu tiên chất lượng; khuyến nghị của chính thẻ mô hình dành cho phần cứng bị hạn chế là CPU offload thông qua pipe.enable_model_cpu_offload(), đây là một lối thoát tình thế chứ không phải là một giải pháp khắc phục.
Điểm cân bằng lại là việc chưng cất thực chất là một sự nén khả năng, và không có gì ở đây được bất kỳ ai ngoài hai phòng thí nghiệm đo lường. Điểm dữ liệu độc lập duy nhất tồn tại cho mỗi mô hình là một bài đánh giá trải nghiệm thực tế trong giai đoạn truy cập sớm về Qwen-Image 2.1 từ một người thử nghiệm trong chương trình Đại sứ Qwen, người đã chạy các trọng số cuối cùng qua giao diện ModelScope Studio và báo cáo khoảng 10–15 giây cho text-to-image và 18–23 giây cho chỉnh sửa. Đó chỉ là một người đánh giá, trên một giao diện truy cập sớm, không hiển thị đồng hồ bấm giờ — một tín hiệu hữu ích, chứ không phải một phép đo chuẩn. LLaDA-Image-Turbo hoàn toàn không có báo cáo trải nghiệm thực tế tương đương nào được công bố rộng rãi.

Chỉnh sửa là điểm mà hai thiết kế khác biệt nhiều nhất
Cả hai mô hình đều thực hiện được việc tạo hình ảnh từ văn bản và chỉnh sửa, nhưng chúng đạt được điều đó theo những cách khác nhau, và sự khác biệt thể hiện ở phần cơ chế bên trong chứ không phải ở đầu ra.
Qwen-Image 2.1 coi việc tuân thủ chỉ dẫn là một thành phần riêng biệt, có thể kiểm tra được. Cùng với mô hình hình ảnh, bản phát hành bao gồm hai checkpoint viết lại prompt — Qwen/Qwen-Image-2.1-PE-T2I và Qwen/Qwen-Image-2.1-PE-I2I, mỗi checkpoint là một Qwen3.5-VL 9B được tinh chỉnh ở khoảng 18,8 GB — nhận một chỉ dẫn mơ hồ và viết lại thành một chỉ thị rõ ràng, không nhập nhằng trước khi mô hình khuếch tán nhìn thấy nó. Biến thể I2I luôn có ảnh đầu vào, nên nó luôn là tác vụ chỉnh sửa và không bao giờ là sinh từ hư không. Điều quan trọng là, trình viết lại đi kèm với một system_prompt.txt mà bạn có thể đọc và ghi đè, và nó đặc biệt rõ ràng về ngôn ngữ: ngôn ngữ mô tả tuân theo chỉ dẫn của bạn, trong khi ngôn ngữ của văn bản được vẽ vào hình ảnh được quyết định bởi một thứ tự ưu tiên nghiêm ngặt, thứ tự này giữ nguyên ngôn ngữ nhãn hiện có của ảnh đầu vào ngay cả khi bạn nhập prompt bằng một ngôn ngữ khác.
Đó là một phần kỹ thuật nhỏ nhưng có phạm vi ảnh hưởng lớn. Nếu bạn đang tạo hình ảnh sản phẩm cho một thị trường mà văn bản trên bao bì quan trọng, thì "trình viết lại giữ nguyên ngôn ngữ nhãn hiện có" và "trình viết lại dịch mọi thứ sang tiếng Anh một cách hữu ích" chính là khác biệt giữa một tài nguyên dùng được và một tài nguyên bị loại bỏ — và vì nó nằm trong prompt hệ thống thay vì bên trong một hộp đen được host, bạn có thể diff nó và thay đổi nó.
LLaDA-Image-Turbo thực hiện sự đánh đổi ngược lại: một mô hình 6B, một bộ trọng số, sinh và chỉnh sửa dùng chung mọi thứ. Ít bộ phận vận hành hơn, ít thứ phải cấu hình hơn, và không có gì để kiểm tra hay ghi đè. Thẻ của nó dẫn các số liệu Qwen-Image-Bench là 53,53 tiếng Anh và 53,38 tiếng Trung với tuyên bố SOTA mã nguồn mở — do nhà cung cấp báo cáo, chưa được tái lập, và lưu ý rằng benchmark mà nó đang thắng được đặt tên theo mô hình mà nó đang ngầm cạnh tranh.
Những gì bạn thực sự sẽ chạy chúng trên đó
Hỗ trợ hệ sinh thái trong ngày ra mắt là phần kém hào nhoáng nhất của một bản phát hành, và là phần quyết định bạn sẽ dành một buổi chiều hay cả một cuối tuần.
• Qwen-Image 2.1 đã ra mắt rộng rãi: một QwenImage21Pipeline được hợp nhất vào Diffusers ngay từ ngày đầu tiên; hỗ trợ ComfyUI gốc với các mẫu quy trình text-to-image và image-edit; vLLM-Omni với thực thi từng bước, bộ đệm KV tiền tố, giải mã CUDA Graph, lượng tử hóa FP8 và song song tensor/Ulysses; một pull request hỗ trợ SGLang gốc đã được hợp nhất vào ngày 17 tháng 9 — ba ngày trước khi các trọng số ra mắt — bao gồm DiT, RGBA VAE, điều kiện hóa Qwen3-VL và đầu vào đa tham chiếu, được kiểm chứng trên H200, B200, RTX PRO 6000, RTX 5090 và RTX 4090; và tăng tốc ngay từ ngày đầu thông qua LightX2V với AMD Radeon qua ROCm cùng hỗ trợ đa chip thông qua FlagOS.
• LLaDA-Image-Turbođã có hỗ trợ ComfyUI vào ngày 7 tháng 9 năm 2026, ba ngày sau khi phát hành trọng số, cùng với bản phân phối Diffusers và Safetensors. Đó là một con đường thực sự để chạy nó, nhưng là một con đường mỏng manh hơn, và không có công việc phục vụ tiền phát hành tương đương nào để chỉ ra.
Pull request SGLang trước phát hành là dấu hiệu nhận biết cho Qwen-Image 2.1. Việc hỗ trợ framework được hợp nhất trước cả trọng số nghĩa là ai đó đã kiểm thử đường phục vụ với checkpoint, chứ không phải viết nó từ thẻ mô hình sau đó.

Đường dẫn được lưu trữ mà bạn giữ song song với thử nghiệm
Không mô hình nào trong hai mô hình này có thể được định tuyến qua OrcaRouter tại thời điểm viết bài, và bài viết này sẽ không ngụ ý điều ngược lại — cả hai đều là phương án tự triển khai (self-host), một mô hình theo một giấy phép loại trừ khả năng dùng cho production và một mô hình không có giấy phép nào cả. Điều quan trọng đối với một nhóm đang đánh giá chúng là việc đánh giá không nhất thiết phải nằm trên đường tới hạn.
OrcaRouter đặt hơn 200 mô hình phía sau một endpoint tương thích OpenAI, với mức giá niêm yết của nhà cung cấp và không cộng thêm, cùng khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp và một DSL định tuyến cho phép bạn kết hợp nhiều mô hình vào một lệnh gọi duy nhất. Hình hài thực tế của điều đó đối với quyết định này là một tuyến trong đó mô hình bạn đã tin cậy đảm nhận lưu lượng sản xuất, trong khi một checkpoint tự vận hành được thử nghiệm song song — và vì giá niêm yết được chuyển nguyên thay vì cộng thêm, thay đổi giá từ nhà cung cấp đối với bất kỳ mô hình nào được định tuyến sẽ có hiệu lực phía chúng tôi ngay trong cùng ngày, thay vì phải chờ sửa đổi hợp đồng. Các mô hình hình ảnh mà chúng tôi định tuyến hiện nay là dòng GPT-Image của OpenAI, các bậc Imagen 4 và bản xem trước hình ảnh Gemini của Google, và endpoint hình ảnh Grok Imagine của xAI. Nếu bạn định dành một tuần để dựng một diffusion transformer 33 GB nhằm tìm hiểu xem liệu nó có vượt qua một mô hình được host hay không, mô hình được host chính là nhóm đối chứng, và việc nhóm đối chứng đã sẵn có trên một khóa là điều đáng làm.
Điều gì sẽ thay đổi sự so sánh này?
Ba điều, theo thứ tự mức độ quan trọng của chúng.
Thứ nhất, một điểm chuẩn độc lập cho một trong hai mô hình. Cả hai đều không có, và cho đến khi điều đó thay đổi, mọi tuyên bố về chất lượng từ cả hai phía đều chỉ là việc một phòng thí nghiệm tự chấm bài của chính mình. Thứ hai, giấy phép: một biến thể cấp phép thoáng của Qwen-Image 2.1 sẽ khiến nó trở thành lựa chọn mặc định hiển nhiên cho công việc hình ảnh mở ở quy mô 7B, và bất kỳ giấy phép nào được công bố trên LLaDA-Image-Turbo cũng ít nhất sẽ khiến nó có thể lên kế hoạch được. Thứ ba, những người thử nghiệm truy cập sớm từ chương trình ModelScope ngày 17 tháng 9 của Qwen được yêu cầu công bố các mẫu hoặc bài đánh giá trước ngày 29 tháng 9 — tám ngày kể từ bây giờ. Đó là lúc việc này không còn là so sánh hai thẻ mô hình nữa mà bắt đầu trở thành một so sánh thực sự. Cho đến lúc đó, tóm tắt trung thực nhất là: Qwen-Image 2.1 là mô hình trông có vẻ mạnh mẽ hơn mà bạn không thể thương mại hóa, LLaDA-Image-Turbo là mô hình nhanh hơn mà bạn hoàn toàn không thể dùng nếu không có một cuộc trao đổi, và tệp giấy phép là phần duy nhất trong cả hai bản phát hành đã hoàn toàn ngã ngũ.
