Thẻ hero được tạo cho bài viết 'Qwen-Image 2.1 ra mắt âm thầm', hiển thị một thẻ bo tròn mang nhãn 'Qwen-Image 2.1' với dấu đánh dấu tham số 7B, bên cạnh hai thẻ nhỏ hơn mang nhãn 'PE-T2I' và 'PE-I2I' được đánh dấu 9B, cùng một dải ruy-băng ghi 'Ra mắt âm thầm, chứ không phải không được công bố'.
Engineering & Research

Qwen-Image 2.1 âm thầm ra mắt: Khám phá bên trong Qwen/Qwen-Image-2.1-PE-I2I

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 20 tháng 9 năm 2026, đội ngũ Qwen-Image đã đưa Qwen-Image 2.1lên Hugging Face và ModelScope — trọng số, tệp giấy phép, thẻ mô hình và một bài blog, tất cả trong cùng một ngày, gần như không có khoảng thời gian chuẩn bị nào trước đó. Con số được chú ý nhất là 7B tham số trong thành phần tạo hình ảnh. Phần mà gần như chưa ai mở ra là Qwen/Qwen-Image-2.1-PE-I2I, một trong hai checkpoint viết lại prompt được phát hành cùng với mô hình hình ảnh. Đây không phải là mô hình hình ảnh. Đây là thứ quyết định ý nghĩa chỉ thị của bạn trước khi mô hình hình ảnh nhìn thấy nó — và trong bản phát hành này, nó chính là thành phần âm thầm ấn định ngôn ngữ mà đầu ra của bạn trả về.

"Âm thầm ra mắt" thực sự có nghĩa gì ở đây

Cách diễn đạt rất quan trọng, vì rất dễ nói quá theo bất kỳ hướng nào. Qwen-Image 2.1 không bị rò rỉ, và cũng không phải được công bố mà không báo trước. Có một bài đăng blog của nhà cung cấp đề ngày 20 tháng 9 năm 2026, một kho GitHub với mục tin tức đề cùng ngày, và một bản tải trọng số đang hoạt động. Điều nó không có là một giai đoạn chuẩn bị: tín hiệu báo trước duy nhất là một ghi chú ngày 17 tháng 9 mời 50 suất truy cập sớm thông qua ModelScope, với các tester được chọn được yêu cầu công bố một mẫu hoặc một bài đánh giá trước ngày 29 tháng 9. Ba ngày sau, trọng số được công khai. Không có bài phát biểu chính, không có lệnh cấm công bố kết quả đánh giá, không có chu kỳ báo chí.

Đó là một kiểu phát hành cụ thể, và đáng được gọi tên chính xác. Nhà cung cấp đã công bố nó. Nhà cung cấp không quảng bá nó. Đối với bất kỳ ai đang cân nhắc xây dựng dựa trên nó, hệ quả thực tế là chưa có đánh giá độc lập nào để dựa vào — chỉ có tài liệu của chính nhà cung cấp và bất cứ thứ gì mà những người thử nghiệm quyền truy cập sớm công bố trong tuần tới. Hãy coi mọi tuyên bố về chất lượng trong bài viết này là đến từ thẻ mô hình và bài đăng blog cho đến khi ai đó bên ngoài Alibaba chạy nó công khai.

Tại sao checkpoint PE-I2I lại là điểm thú vị

Bản phát hành Qwen-Image 2.1 bao gồm ba phần có thể tải xuống, chứ không phải chỉ một:

Qwen/Qwen-Image-2.1 — bản thân mô hình hình ảnh. Một DiT đơn luồng 32 lớp với 7B tham số trong thành phần tạo sinh hình ảnh, một bộ mã hóa văn bản Qwen3-VL 8B, và một VAE RGBA 64 kênh với mức nén không gian 16×. Khoảng 33 GB cho cả ba thành phần.

Qwen/Qwen-Image-2.1-PE-T2I — một công cụ viết lại prompt cho text-to-image. Một Qwen3.5-VL 9B đã được tinh chỉnh, khoảng 18,8 GB.

Qwen/Qwen-Image-2.1-PE-I2I — một công cụ viết lại prompt cho chỉnh sửa ảnh sang ảnh. Cũng là một Qwen3.5-VL 9B được tinh chỉnh, cũng khoảng 18,8 GB, được tải lên Hugging Face lúc 08:46 UTC ngày 20 tháng 9.

"PE" là tăng cường gợi ý. Biến thể I2I nhận một chỉ dẫn chỉnh sửa mơ hồ cùng một hoặc nhiều ảnh đầu vào và viết lại nó thành một chỉ thị chỉnh sửa chính xác, không mập mờ cho mô hình khuếch tán phía sau. Mô tả của chính kho mã nói thẳng về dạng đầu vào: ảnh đầu vào luôn hiện diện, nên đây luôn là tác vụ chỉnh sửa ảnh và không bao giờ là text-to-image từ hư vô. Mã viết lại nằm trong thư mục prompt_rewrite/ phục vụ cả hai checkpoint — --task t2i hoặc --task edit — với một đường dẫn transformers, một đường dẫn vLLM, một serve.sh cộng với client.py cho một dịch vụ thường trực, và pe_core.py cho logic dùng chung.

Đây là lý do tại sao điều đó quan trọng hơn vẻ ngoài của nó. Mô hình hình ảnh không hề biết bạn muốn nói gì. Nó chỉ có một ý niệm về những gì prompt của bạn nói theo nghĩa đen, được đánh trọng số bởi bất cứ điều gì mà bộ mã hóa văn bản làm với nó. Một trình viết lại nằm trước nó chính là nơi sự mơ hồ được giải quyết — hoặc bị giải quyết sai, một cách nhất quán, xuyên suốt mọi hình ảnh bạn tạo ra. Trong một mô hình tạo và chỉnh sửa hợp nhất với tối đa 10 hình ảnh tham chiếu, bước giải quyết đó có nhiều thứ để làm sai hơn bình thường.

Lời nhắc hệ thống là nơi chứa quyết định về ngôn ngữ

Kho lưu trữ PE-I2I đi kèm một system_prompt.txt cùng với các trọng số, và nó rõ ràng một cách bất thường về một điều: ngôn ngữ. Đọc trực tiếp nó, trình viết lại được hướng dẫn đưa ra hai quyết định ngôn ngữ riêng biệt, và giữ chúng tách biệt.

Ngôn ngữ mô tả. Phần văn xuôi mà trình viết lại dùng để mô tả chỉnh sửa sẽ tuân theo ngôn ngữ chỉ dẫn của người dùng — chỉ dẫn tiếng Trung thì mô tả tiếng Trung; chỉ dẫn tiếng Anh thì mô tả tiếng Anh; chỉ dẫn bằng tiếng Nhật, tiếng Hàn, tiếng Pháp, tiếng Thái hay bất kỳ ngôn ngữ nào khác sẽ nhận được mô tả bằng tiếng Anh.

Ngôn ngữ của văn bản được kết xuất. Văn bản thực sự sẽ được vẽ vào ảnh đầu ra, được đặt trong dấu ngoặc kép, được quyết định theo một thứ tự ưu tiên nghiêm ngặt: thứ nhất, nếu người dùng nêu rõ văn bản chính xác hoặc ngôn ngữ đích, hãy tuân theo đúng nguyên văn; thứ hai, nếu ảnh đầu vào đã chứa văn bản, hãy khớp với ngôn ngữ chiếm ưu thế của văn bản hiện có đó — ngay cả khi chỉ dẫn được viết bằng một ngôn ngữ khác; thứ ba, nếu không có văn bản trong ảnh và không có ngôn ngữ nào được nêu tên, hãy dùng ngôn ngữ của chính chỉ dẫn, và đặc biệt không được ép buộc chuyển sang tiếng Anh.

Prompt củng cố quy tắc thứ hai bằng một ví dụ minh họa — một hình ảnh chủ yếu là tiếng Thái, được chỉnh sửa bằng một hướng dẫn tiếng Anh không nêu tên ngôn ngữ, phải render văn bản tiếng Thái — và bổ sung hai ràng buộc: văn bản được render phải đơn ngữ thay vì một cặp tiếng Trung/tiếng Anh, và thể loại hình ảnh "spec sheet" hoặc "storyboard" đạt được thông qua bố cục và kiểu chữ, chứ không bao giờ bằng cách chuyển các nhãn được render sang tiếng Anh.

Đây là một phần kỹ thuật nhỏ nhưng có phạm vi ảnh hưởng lớn. Nếu bạn đang tạo hình ảnh sản phẩm cho một thị trường nơi văn bản trên bao bì quan trọng, thì sự khác biệt giữa “trình viết lại giữ nguyên ngôn ngữ nhãn hiện có” và “trình viết lại dịch mọi thứ sang tiếng Anh một cách hữu ích” chính là sự khác biệt giữa một tài nguyên dùng được và một tài nguyên bị loại bỏ. Và vì hành vi này được quy định trong một prompt hệ thống đi kèm trong kho mã, bạn có thể đọc nó, chạy diff trên nó, và ghi đè nó — điều mà bạn không thể nói như vậy đối với cùng bước đó bên trong một mô hình đóng được lưu trữ.

Điều gì đã được xác nhận, và điều gì chưa được xác nhận?

Việc nói chính xác về ranh giới ở đây chính là toàn bộ mục đích của một bài viết dạng “những gì chúng ta biết”.

Được xác nhận từ kho mã nguồn và thẻ mô hình — con số DiT đơn luồng 7B / 32 lớp; bộ mã hóa văn bản Qwen3-VL 8B; VAE RGBA 64 kênh với mức nén không gian 16×; attention nhân quả theo khối với mặt nạ nhân quả cấp token cho văn bản và mặt nạ song hướng cấp chunk cho việc sinh ảnh; tái sử dụng prefix KV cache, mà theo thẻ mô hình thì được kích hoạt khi checkpoint mang causal_condition: true (đúng là có); flow matching với lịch trình Euler rời rạc; đầu ra 2K gốc với 2048×2048 là mặc định ở 40 bước suy luận; bảy preset tỷ lệ khung hình đã được ghi nhận; hỗ trợ tối đa 10 ảnh tham chiếu; chỉnh sửa cục bộ bằng khoanh tròn, chú thích vẽ tay hoặc mặt nạ riêng; và sinh RGBA, chỉnh sửa lớp trong suốt cùng việc tách chủ thể từ ảnh RGB.

Đã xác nhận về giấy phép, và đây chính là điểm mấu chốt — bản phát hành này thuộc Qwen Research License Agreement, đề ngày 20 tháng 9 năm 2026, cấp quyền "FOR NON-COMMERCIAL PURPOSES ONLY" và nêu rõ rằng mục đích thương mại đòi hỏi một giấy phép riêng phải yêu cầu từ nhà cung cấp. Đó là một thay đổi đáng kể so với dòng Qwen-Image trước đó, vốn được phát hành theo Apache 2.0. Hãy đọc tệp giấy phép trước khi bạn xây dựng sản phẩm dựa trên thứ này, chứ đừng đọc sau.

Chưa được xác nhận — chưa tồn tại điểm chuẩn đánh giá độc lập nào. Bài đăng trên blog có nhắc đến một biểu đồ so sánh Qwen-Image-Bench, nhưng các con số trong đó là của chính nhà cung cấp và chưa được bất kỳ bên thứ ba nào tái lập vào thời điểm viết bài. Không có mức giá công bố nào cho endpoint được lưu trữ của Qwen-Image 2.1, và cũng không có điều khoản nào được nêu cho giấy phép thương mại. Và vẫn chưa có thông tin nào về việc liệu một biến thể được cấp phép theo kiểu tự do (permissive) có ra đời sau đó hay không.

Điểm dữ liệu độc lập duy nhất thực sự tồn tại là một bài đánh giá trải nghiệm thực tế thời kỳ truy cập sớm từ một người thử nghiệm, người được cấp quyền truy cập qua chương trình Qwen Ambassador và đã chạy các trọng số của bản phát hành cuối cùng qua giao diện ModelScope Studio. Bài đánh giá đó báo cáo thời gian tạo khoảng 10–15 giây cho tạo ảnh từ văn bản và 18–23 giây cho chỉnh sửa, hiệu suất mạnh trên các cài đặt sẵn vị trí camera và gán vai trò cho nhiều nhân vật, cùng một kiểu lỗi cụ thể đáng biết: độ nhất quán đa tham chiếu suy giảm từ khoảng ba ảnh đầu vào trở đi, với vị trí tóc đuôi ngựa buộc lệch bên bị thu gọn thành tóc đuôi ngựa giữa ở các góc nghiêng. Đó là một người đánh giá, trên một giao diện truy cập sớm, không hiển thị đồng hồ bấm giờ. Đó là tín hiệu hữu ích. Đó không phải là một bài kiểm chuẩn.

A generated single-column spec scoreboard titled 'Qwen-Image 2.1 — the scoreboard' listing rows: Generation component 7B, 32-layer single-stream DiT; Text encoder Qwen3-VL 8B; Licence Qwen Research License, non-commercial only; Native output 2048 x 2048 at 40 steps; Reference images up to 10; Transparency native RGBA; Independent score none yet. Footer reads 'Figures per the Qwen vendor model card, unaudited; no third-party reproduction at the time of writing.'

Hỗ trợ framework ngay từ ngày đầu, đó chính là tin tốt thầm lặng

Một mô hình được phát hành rộng rãi đến đâu trong ngày ra mắt cho bạn biết nhiều hơn về việc liệu bạn có thực sự dùng được nó hay không so với thẻ mô hình, và Qwen-Image 2.1 đã ra mắt rộng khắp:

Diffusers — một QwenImage21Pipeline đã được hợp nhất ngay từ ngày đầu tiên, và kho lưu trữ mô hình mang thẻ diffusers:QwenImage21Pipeline.

ComfyUI — hỗ trợ gốc ngay từ ngày đầu với các mẫu quy trình text-to-image và chỉnh sửa hình ảnh, cùng một kho trọng số tương thích Comfy riêng.

vLLM-Omni — thực thi từng bước, bộ nhớ đệm KV tiền tố, giải mã CUDA Graph, lượng tử hóa FP8 và song song tensor/Ulysses.

SGLang — một yêu cầu kéo hỗ trợ gốc đã được hợp nhất vào ngày 17 tháng 9, ba ngày trước khi các trọng số ra mắt, bao gồm DiT, RGBA VAE, điều kiện hóa Qwen3-VL, nhiều ảnh tham chiếu và đầu vào/đầu ra RGBA, đã được xác thực trên H200, B200, RTX PRO 6000, RTX 5090 và RTX 4090.

LightX2V — tăng tốc ngay từ ngày đầu, cùng với AMD Radeon qua ROCm và hỗ trợ đa chip thông qua FlagOS.

Chi tiết mách bảo chính là pull request SGLang trước khi phát hành. Việc hỗ trợ framework được đưa vào trước cả trọng số có nghĩa là đường phục vụ đã được kiểm thử dựa trên checkpoint, chứ không phải được viết từ model card sau đó. Với một thành phần 7B cùng một bộ mã hóa văn bản 17,5 GB nằm ngay bên cạnh, đó là sự khác biệt giữa cả một cuối tuần cặm cụi xử lý việc lặt vặt và một buổi chiều.

Đối với những GPU bị hạn chế, model card khuyến nghị offload lên CPU — pipe.enable_model_cpu_offload() — đây là lối thoát tiêu chuẩn chứ không phải một cách khắc phục. Bản tải xuống 33 GB chủ yếu đến từ text encoder, chứ không phải DiT; bản thân diffusion transformer chỉ chiếm nửa nhỏ hơn của gói, vào khoảng 14 GB.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

Cách hiểu thực tế

Nếu bạn muốn dùng thử Qwen-Image 2.1 ngay hôm nay, quan điểm trung thực là bạn có thể, chạy cục bộ, theo một giấy phép nghiên cứu, không có benchmark độc lập và không có quyền thương mại. Đó là một sự đánh đổi hợp lý để đánh giá và là một sự đánh đổi tồi cho một pipeline sản xuất, và khoảng cách giữa hai điều đó chính xác là điều mà tệp giấy phép quyết định.

Với các nhóm đang đánh giá hiệu năng các mô hình hình ảnh mà không muốn đưa một checkpoint mới chỉ vài ngày tuổi vào đường chạy production, lớp định tuyến chính là nơi rủi ro đó được khoanh vùng. OrcaRouter đưa hơn 200 mô hình ra sau một endpoint tương thích OpenAI duy nhất, với đúng giá niêm yết của nhà cung cấp và không cộng thêm phụ phí, kèm khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, nhờ đó một mô hình chưa được kiểm chứng có thể nằm sau một route song song với một mô hình bạn đã tin dùng, thay vì thay thế nó — và vì giá niêm yết được chuyển nguyên, việc nhà cung cấp giảm giá với bất kỳ mô hình nào được định tuyến sẽ có hiệu lực ngay trong cùng ngày, thay vì phải chờ một thay đổi hợp đồng. Tại thời điểm viết bài, Qwen-Image 2.1 không nằm trong số các mô hình mà chúng tôi định tuyến, và bài viết này sẽ không ngụ ý điều ngược lại. Những gì chúng tôi định tuyến là dòng hình ảnh xung quanh — họ GPT-Image của OpenAI, các bậc Imagen 4 của Google cùng bản xem trước hình ảnh Gemini, và endpoint hình ảnh Grok Imagine của xAI — đó chính là nguồn cho một đường dự phòng trong khi bạn đánh giá mô hình mới trên phần cứng của riêng mình.

Câu hỏi bỏ ngỏ là câu hỏi mà kho lưu trữ không thể trả lời. Alibaba đã phát hành một mô hình hình ảnh 7B trọng số mở theo giấy phép chỉ dành cho nghiên cứu, trong cùng năm họ phát hành Qwen-Image 3.0 dưới dạng mô hình đóng chạy trên máy chủ của họ và không có trọng số nào cả. Hai bản phát hành, hai canh bạc trái ngược, cách nhau bốn tháng. Mô hình hình ảnh Qwen tiếp theo sẽ đi theo hướng nào trong hai hướng đó — và liệu giấy phép nghiên cứu có bao giờ chuyển thành thứ mà doanh nghiệp có thể dùng được hay không — là điều cần theo dõi. Các trọng số hiện đã có trên Hugging Face, và bất kỳ ai cũng có thể tự đọc tệp giấy phép.

A screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured September 20 2026, showing the Like and Follow counts, the tags Text-to-Image, Diffusers, Safetensors, QwenImage21Pipeline, rgba, the qwen-research licence, 7B params, BF16 tensor type, and the notice that the model is not deployed by any inference provider.