
Qwen-Image 2.1 vs FLUX 3: Hai mô hình hình ảnh mà bạn không thể dùng một cách trọn vẹn
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image 2.1 và FLUX 3 là hai bản phát hành hình ảnh thú vị nhất của nửa cuối năm 2026, và cả hai đều không thể dùng một cách đơn giản. Qwen-Image 2.1, được nhóm Qwen-Image mã nguồn mở vào ngày 20 tháng 9 năm 2026, là mô hình thống nhất 7 tỷ tham số vừa tạo vừa chỉnh sửa, bạn có thể tải về ngay chiều nay nhưng không thể đưa vào một sản phẩm thương mại một cách hợp pháp. FLUX 3, được Black Forest Labs công bố vào ngày 23 tháng 7 năm 2026, là một mô hình nền tảng đa phương thức thống nhất mà tầng hình ảnh của nó — phần mà bạn thực sự sẽ đem ra so sánh — vẫn chưa có endpoint công khai, chưa có model ID, chưa có giá và chưa có kết quả đánh giá chuẩn, hai tháng sau khi công bố. Vì vậy, phép so sánh ở đây không phải là "cái nào tốt hơn". Mà là bạn có thể xoay xở vượt qua trở ngại nào trong hai trở ngại đó.
Hai kiểu không khả dụng khác nhau
Thật dễ cám dỗ khi xếp cả hai vào mục “chưa sẵn sàng” rồi đi tiếp. Điều đó sẽ che mất quyết định duy nhất thực sự quan trọng, bởi hai rào cản này có hình dạng trái ngược nhau.
Rào cản đối với Qwen-Image 2.1 là vấn đề pháp lý, và nó là một dòng trong tệp bạn có thể đọc trước khi tải xuống bất cứ thứ gì. Các trọng số có trên Hugging Face và ModelScope, thẻ mô hình đã được viết, mã suy luận đã được công bố, và bốn framework phục vụ riêng biệt đã có hỗ trợ được hợp nhất trước hoặc vào ngày phát hành. Không có rào cản kỹ thuật nào giữa bạn và một mô hình đang chạy. Điều cản trở bạn phát hành nó là Thỏa thuận Cấp phép Nghiên cứu Qwen, ngày 20 tháng 9 năm 2026, có điều khoản cấp quyền cho phép sử dụng "CHỈ DÀNH CHO MỤC ĐÍCH PHI THƯƠNG MẠI" và quy định rằng bất kỳ ai muốn có quyền thương mại phải yêu cầu một giấy phép riêng từ nhà cung cấp.
Rào cản của FLUX 3 mang tính vật lý. Không có endpoint hình ảnh nào để gọi, không có mã định danh mô hình nào để truyền, và không có bảng giá nào để dự trù ngân sách. Trang báo giá của chính BFL bao gồm các hạng Video của FLUX 3 và dòng hình ảnh FLUX.2 cũ hơn; trang này không bao gồm hạng hình ảnh FLUX 3, vì không có gì để định giá. Quyền truy cập vào mô hình hình ảnh chỉ theo yêu cầu thay vì một nút bắt đầu: trang FLUX 3 của chính BFL liệt kê hạng hình ảnh là “sắp ra mắt”, và chính hạng hành động mới mang nhãn truy cập sớm.
Vậy một trong hai là mô hình bạn có thể chạy ngay tối nay và không thể bán, còn cái kia là mô hình bạn có thể bán và không thể chạy. Cái nào hữu ích hơn với bạn hoàn toàn phụ thuộc vào việc bạn đang đứng ở phía nào của câu đó — một nhóm nghiên cứu nội bộ và một nhóm sản phẩm thương mại nên đi đến những kết luận trái ngược nhau từ cùng hai sự thật.
Đọc theo từng chiều
• Trạng thái — Trọng số, giấy phép và thẻ mô hình của Qwen-Image 2.1 được công bố ngày 20 tháng 9 năm 2026, cùng với một bài đăng blog của nhà cung cấp trong cùng ngày hôm đó. FLUX 3 được công bố ngày 23 tháng 7 năm 2026; chỉ có hạng video đã phát hành, đạt mức sẵn có chung vào ngày 4 tháng 8 năm 2026.
• Điều bạn thực sự có thể gọi ngay hôm nay — Qwen-Image 2.1 chạy cục bộ thông qua Diffusers, ComfyUI, vLLM-Omni, SGLang và LightX2V, hoặc thông qua API của chính nhà cung cấp và một số nền tảng bên thứ ba. FLUX 3 liệt kê hạng mục hình ảnh của mình là "sắp ra mắt" với không có endpoint nào để gọi, và cung cấp một endpoint video có tính phí, đã chính thức khả dụng.
• Kiến trúc — Qwen-Image 2.1 là một DiT đơn luồng 32 lớp với 7B tham số trong thành phần tạo sinh hình ảnh, một bộ mã hóa văn bản Qwen3-VL 8B, và một VAE RGBA 64 kênh với mức nén không gian 16×. FLUX 3 là một mô hình flow hợp nhất duy nhất được huấn luyện đồng thời trên hình ảnh, video và âm thanh, được xây dựng trên phương pháp flow-matching tự giám sát mà BFL gọi là Self-Flow, với một tầng dự đoán hành động được phát triển song song với Mimic Robotics.
• Tính trong suốt gốc — Qwen-Image 2.1 tạo và chỉnh sửa ảnh RGBA, chỉnh sửa văn bản bên trong các lớp trong suốt và tách chủ thể từ ảnh chụp RGB thành các lớp trong suốt, tích hợp khả năng mà Alibaba đã phát hành riêng dưới tên Qwen-Image-Layered vào tháng 12 năm 2025. BFL chưa công bố tuyên bố nào về tính trong suốt cho FLUX 3 Image.
• Ảnh tham chiếu — Qwen-Image 2.1 chấp nhận tối đa 10 ảnh tham chiếu đầu vào, với khả năng chỉnh sửa cục bộ bằng cách khoanh tròn, chú thích vẽ tay hoặc mặt nạ riêng. Không có số liệu nào được công bố cho FLUX 3 Image.
• Độ phân giải — Qwen-Image 2.1 có độ phân giải 2K gốc, mặc định là 2048×2048 ở 40 bước suy luận, với bảy cài đặt sẵn tỷ lệ khung hình đã được tài liệu hóa. Độ phân giải của FLUX 3 Image chỉ được mô tả trong thông báo là "broad", không có gì được công bố.
• Giá — không có giá niêm yết cho cả hai. Qwen-Image 2.1 không có mức giá lưu trữ nào được liệt kê tại thời điểm viết bài; FLUX 3 Image không có bảng giá vì không có endpoint. Mức giá FLUX 3 duy nhất hiện có là dành cho video, ở mức $0.06 mỗi giây cho bản nháp, $0.17 mỗi giây cho HD và $0.29 mỗi giây cho FHD.
• Giấy phép — Thỏa thuận Cấp phép Nghiên cứu Qwen, chỉ dành cho mục đích phi thương mại, việc sử dụng cho mục đích thương mại phải được yêu cầu riêng. Các điều khoản cấp phép của FLUX 3 dành cho hạng mục hình ảnh vẫn hoàn toàn chưa được công bố.
Có một sự bất đối xứng xứng đáng được dành riêng một dòng, bởi vì nó chính là cái bẫy trong cuộc so tài này. FLUX 3 thực sự có các con số benchmark được công bố — Elo nội bộ là 1.135 cho text-to-video và tỷ lệ thắng dựa trên sở thích của con người được báo cáo so với Grok Imagine Video, Seedance 2.0, Gemini Omni Flash, Runway Gen-4.5 và Luma Ray 3.2. Mỗi một con số trong đó đều mô tả hạng mục video. Không con số nào trong đó chuyển được sang việc tạo hình ảnh, và bản thân BFL cũng chưa công bố bất kỳ benchmark hay tỷ lệ thắng nào về hình ảnh. Trích dẫn Elo video của FLUX 3 làm bằng chứng về chất lượng hình ảnh của FLUX 3 là sai lầm dễ mắc nhất trong phép so sánh này.

Mỗi bên thực sự có thể cho thấy điều gì
Đặt các bằng chứng cạnh nhau và sự bất đối xứng đảo ngược so với phần trước.
FLUX 3 có một sản phẩm đã được phát hành, đã định giá và sẵn có rộng rãi — chỉ có điều không phải sản phẩm trong tiêu đề của bài viết này. FLUX 3 Video tạo các clip dài tối đa 20 giây với âm thanh đồng bộ trong một lần chạy, hỗ trợ text-to-video, image-to-video, video-to-video, keyframe-to-video và tiếp nối tạo sinh, đồng thời đang được Canva, Burda, Magnific, Krea và Picsart thử nghiệm. Đó là một hệ thống thực sự, đã được triển khai với danh sách khách hàng thực sự. Phân khúc hình ảnh là phần vẫn chưa xuất hiện, và thông tin định hướng ban đầu của BFL rằng nó sẽ ra mắt “trong vài tuần tới” giờ đã vượt qua hai tháng trọn vẹn mà không có endpoint công khai.
Qwen-Image 2.1 có đặc điểm ngược lại. Các tuyên bố về chất lượng của nó đến từ biểu đồ so sánh Qwen-Image-Bench của chính nhà cung cấp, và chưa có bên thứ ba nào tái tạo chúng. Nhưng bản thân nó đã nằm trong tay bạn: 33 GB trọng số, bố cục kho kiểu Apache với tệp giấy phép trung thực về việc chỉ dành cho nghiên cứu, và lộ trình phục vụ ngay từ ngày đầu trên năm framework. Cũng có một bài đánh giá trải nghiệm sớm, từ một người thử nghiệm đã chạy các trọng số cuối cùng qua giao diện ModelScope Studio và báo cáo khoảng 10–15 giây cho text-to-image và 18–23 giây cho chỉnh sửa, hành vi mạnh mẽ với cài đặt trước máy ảnh và gán vai trò nhiều nhân vật, và tính nhất quán đa tham chiếu bắt đầu giảm từ khoảng ba ảnh đầu vào. Một người đánh giá, không có đồng hồ bấm giờ, không có bộ prompt được công bố. Hữu ích về mặt định hướng, chưa được xác minh chính thức.
Tóm tắt trung thực về các bằng chứng: Qwen-Image 2.1 có một mô hình chạy được và không có dữ liệu chất lượng độc lập; FLUX 3 Image chỉ có những tuyên bố từ nhà cung cấp, và không có mô hình chạy được lẫn bất kỳ dữ liệu hình ảnh nào. Nếu câu hỏi của bạn là "nên lên kế hoạch xây dựng pipeline quanh cái nào trong số này", thì câu trả lời ngày hôm nay là không cái nào cả, và lý do thì mỗi bên một khác.

Nơi giải pháp tạm thời thực sự nằm
Đối với một đội ngũ thương mại, trở ngại Qwen-Image 2.1 có một hình hài mà bạn có thể lên kế hoạch xoay quanh. Giấy phép rõ ràng, đầu mối liên hệ về giấy phép thương mại được nêu trong kho mã, và mô hình đủ nhỏ — 7B ở thành phần sinh — đến mức chi phí đánh giá nó trên phần cứng của riêng bạn chỉ tính bằng một buổi chiều, không phải một quý. Đánh giá trước, đàm phán sau, và trong lúc đó hãy giữ bản dựng nghiên cứu tránh xa mọi lộ trình tiếp xúc với khách hàng. Đó là một bài toán mua sắm bình thường.
Rào cản của FLUX 3 Image không phải là vấn đề mua sắm, vì không có gì để mua. Bạn có thể tham gia hàng đợi truy cập sớm, và bạn có thể theo dõi để endpoint xuất hiện, và đó là toàn bộ hành động khả dụng. Nếu bạn cần tạo hình ảnh thuộc dòng FLUX trong môi trường production ngay hôm nay, các tùy chọn có thể gọi được là các dòng FLUX.2 và FLUX Pro/Dev cũ hơn, vốn đã được định giá và có sẵn — và là một thế hệ mô hình khác với thế hệ mà bài viết này nói đến.
Với một đội ngũ muốn thử nghiệm cả hai ứng viên mà không cam kết đưa bất kỳ mô hình nào vào lộ trình production, đây chính là tình huống mà lớp định tuyến ra đời để giải quyết. OrcaRouter đưa hơn 200 mô hình về sau một endpoint tương thích OpenAI duy nhất, với đúng giá niêm yết của nhà cung cấp và không cộng thêm phí, kèm khả năng tự động chuyển đổi dự phòng giữa các nhà cung cấp, nhờ đó một mô hình chưa được kiểm chứng hoặc chưa phát hành sẽ nằm sau một tuyến đường bên cạnh thứ bạn đã tin tưởng, thay vì thay thế nó — và vì giá niêm yết được chuyển nguyên, mọi thay đổi giá từ nhà cung cấp đối với một mô hình đã được định tuyến đều có hiệu lực ngay trong cùng ngày. Tại thời điểm viết bài, cả Qwen-Image 2.1 lẫn FLUX 3 Image đều chưa thể định tuyến, và chúng tôi sẽ không giả vờ rằng điều đó không đúng; thứ chúng tôi định tuyến là dòng mô hình hình ảnh xoay quanh chúng, bao gồm họ GPT-Image của OpenAI, các bậc Imagen 4 của Google cùng các bản xem trước hình ảnh Gemini, và endpoint hình ảnh Grok Imagine của xAI. Đó là những mô hình có thể gánh vác công việc trong lúc hai cái tên kia tự thu xếp ổn thỏa.
Một điều nữa đáng để theo dõi, đặc biệt ở phía Qwen. Alibaba đã phát hành Qwen-Image 1.0 và 2.0 dưới dạng trọng số mở theo Apache-2.0, rồi phát hành Qwen-Image 3.0 vào tháng 7 năm 2026 dưới dạng một mô hình lưu trữ hoàn toàn đóng với không trọng số, không giấy phép và không báo cáo kỹ thuật, sau đó phát hành Qwen-Image 2.1 vào tháng 9 dưới dạng trọng số mở theo giấy phép chỉ dành cho nghiên cứu. Hướng đi không phải là một đường thẳng, và các điều khoản giấy phép cho bản phát hành tiếp theo thực sự là một câu hỏi mở chứ không phải một giả định an toàn theo bất kỳ hướng nào.

Phán quyết, dù sao đi nữa
Nếu bạn là nhà nghiên cứu hoặc một nhóm đánh giá nội bộ, Qwen-Image 2.1 là lựa chọn hữu dụng hơn trong hai lựa chọn ở thời điểm hiện tại, với khoảng cách rất lớn — nó có thể tải xuống, có tài liệu, được các framework hỗ trợ và trung thực về các điều khoản của mình. Nếu bạn là một nhóm thương mại, cả hai đều bị chặn và các rào cản không tương đương: một cái là hợp đồng mà bạn có thể bắt đầu trao đổi, cái còn lại là một sản phẩm vẫn chưa tồn tại.
Nếu bạn cần triển khai tính năng tạo ảnh trong tháng này, thì không cái nào trong số này là câu trả lời, và câu hỏi hữu ích là mô hình nào trong số những mô hình mà bạn có thể gọi sẽ đưa bạn đến gần đích nhất. Đó là một bài tập đánh giá chuẩn, và đáng để thực hiện bằng chính các prompt của bạn thay vì biểu đồ ra mắt của bất kỳ ai — kể cả của nhà cung cấp, và kể cả biểu đồ này.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
