Một thẻ hero được tạo tự động với tiêu đề Qwen-Image-2.1 vs Gemini Omni 1.1 Flash, hiển thị một thẻ được dán nhãn Qwen-Image-2.1 với biểu tượng khung ảnh và nền caro trong suốt bên cạnh một thẻ được dán nhãn Gemini Omni 1.1 Flash với biểu tượng dải phim, kèm chú thích một cái trả về tệp, cái kia trả về clip.
Guides & Insights

Qwen-Image-2.1 so với Gemini Omni 1.1 Flash: Một bên trả về PNG, bên kia thì không

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điều hữu ích nhất cần biết về Qwen-Image-2.1Gemini Omni 1.1 Flash là chúng không cạnh tranh với nhau. Yêu cầu Gemini Omni 1.1 Flash tạo một ảnh tĩnh, bạn sẽ nhận được lỗi: tài liệu của chính nhà cung cấp liệt kê tạo ảnh, chỉnh sửa ảnh và đầu ra xen kẽ ảnh-văn bản là những khả năng không được mô hình này hỗ trợ. Yêu cầu Qwen-Image-2.1 tạo video, bạn sẽ nhận được một ảnh tĩnh 2048×2048 kèm kênh alpha. Bất kỳ bảng so sánh nào xếp chúng vào hai cột đều là đang so sánh một chiếc máy ảnh với một chiếc máy chiếu. Câu hỏi thực sự — câu hỏi thực sự tốn tiền — là điều gì xảy ra khi bạn ghép chuỗi chúng lại, và liệu chuỗi đó có trụ nổi khi chạm mặt bảng giá hay không. Qwen-Image-2.1 ra mắt công chúng vào ngày 20 tháng 9 năm 2026; Gemini Omni 1.1 Flash đã được phát hành rộng rãi từ ngày 27 tháng 8 năm 2026.

Mỗi mô hình thực sự trả về những gì

Đây là toàn bộ sự so sánh, và mọi thứ khác đều theo sau từ đó.

Định dạng đầu ra — Qwen-Image-2.1 trả về ảnh tĩnh, tối đa 2048×2048 nguyên bản ở 40 bước suy luận, tùy chọn có kênh alpha thực; Gemini Omni 1.1 Flash trả về video, tối đa 40 giây được ghép từ các lệnh gọi tạo và mở rộng 10 giây, hoàn toàn không có chế độ ảnh tĩnh.
Độ trong suốt — Qwen-Image-2.1 khử nhiễu trong không gian tiềm ẩn RGBA 64 kênh, nên alpha đi ra từ bộ lấy mẫu; Gemini Omni 1.1 Flash không có đầu ra nền trong suốt, và việc yêu cầu một đầu ra như vậy sẽ thất bại.
Đầu vào tham chiếu — Qwen-Image-2.1 chấp nhận tối đa 10 ảnh tham chiếu để tổng hợp nhiều chủ thể; Gemini Omni 1.1 Flash chấp nhận tối đa 10 ảnh cho mỗi prompt như *đầu vào* và tối đa ba clip video tham chiếu 3 giây.
Giới hạn độ phân giải — Qwen-Image-2.1 là 2K nguyên bản; Gemini Omni 1.1 Flash cung cấp 360p, 720p, 1080p và 4K, nhưng 1080p và 4K là bản nâng cấp từ kết xuất 720p nguyên bản chứ không phải tạo nguyên bản.
Chi phí — Qwen-Image-2.1 không có giá dịch vụ chạy trên máy chủ vì không có endpoint chạy trên máy chủ, nên chi phí là thời gian GPU của riêng bạn; Gemini Omni 1.1 Flash tính phí $0.10 mỗi giây ở 720p, với hạng nháp 360p khoảng $0.03 mỗi giây.
Giấy phép — Qwen-Image-2.1 được phát hành theo Thỏa thuận Cấp phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026, chỉ dùng phi thương mại; Gemini Omni 1.1 Flash là API thương mại có đầu ra mang SynthID và thông tin xuất xứ C2PA theo mặc định.

Hàng cuối cùng là hàng mà mọi người thường lướt qua. Một bên là mô hình bạn có thể tải xuống nhưng không thể bán. Bên kia là mô hình bạn không thể tải xuống nhưng có thể bán tự do — với một hình mờ vô hình trong từng khung hình.

Vì sao cách đặt vấn đề “versus” vẫn cứ xuất hiện dù sao đi nữa

Hãy tìm kiếm hai cái tên cùng nhau và bạn sẽ thấy những trang xếp hạng chúng đối đầu trực tiếp. Lý do là câu hỏi cốt lõi vẫn có thật ngay cả khi cách đặt vấn đề là sai: cả hai mô hình đều nằm trong cùng một quy trình sáng tạo, và cả hai đều là thứ mới nhất trong đó. Điều mọi người thực sự đang cố quyết định là nơi ảnh tĩnh kết thúc và chuyển động bắt đầu.

Gemini Omni 1.1 Flash đã khẳng định được vị trí của mình ở câu hỏi đó bằng những con số độc lập chứ không phải số liệu từ nhà cung cấp. Trên Artificial Analysis, nó giữ vị trí dẫn đầu ở cả đấu trường text-to-video và image-to-video trong hạng mục không âm thanh tính đến ngày 2 tháng 9 năm 2026, với Elo 1324 và 1364. Khi bật âm thanh, nó tụt xuống Elo 1237 và 1180 — vị trí thứ hai và thứ tư. Khoảng cách về âm thanh đó là kiểu chi tiết mà bảng thông số kỹ thuật che giấu và bảng xếp hạng phơi bày.

Bằng chứng của Qwen-Image-2.1 mỏng hơn và thuộc một loại khác. Qwen-Image-Bench của chính nhà cung cấp đưa nó đạt 60,28, cao hơn Nano Banana 2.0 ở 59,82 và GPT Image 1.5 ở 59,65, và đứng đầu trong số các mô hình mở — nhưng đó là một benchmark do nhà cung cấp thực hiện với khoảng cách dưới một điểm, và nó không phải là bản tái lập của bên thứ ba. Các thử nghiệm độc lập cho đến nay chỉ gồm một lượt chấm điểm bởi con người trên GenAI Showdown với 7/15, tăng từ 4/15 của Qwen-Image gốc và xếp sau 8/15 của Ideogram 4. Mô hình không có mục nào trên bảng xếp hạng hình ảnh của Artificial Analysis vào thời điểm viết bài. Không phải là điểm thấp — mà là không có điểm.

A generated two-column scoreboard titled Qwen-Image-2.1 vs Gemini Omni 1.1 Flash - the scoreboard. Left column Qwen-Image-2.1 rows: Output still image, 2048 x 2048; Transparency native RGBA; Reference input up to 10 images; Resolution native 2K; Price self-hosted only; Licence non-commercial research only. Right column Gemini Omni 1.1 Flash rows: Output video, up to 40 seconds; Transparency none; Reference input 10 images plus 3 clips; Resolution native 720p, upscaled; Price 0.10 dollars per second at 720p; Licence commercial, SynthID and C2PA. Footer: Qwen figures per the vendor model card, unaudited; Gemini figures per Google documentation and Artificial Analysis.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Việc bàn giao, và cái giá thực sự của nó

Nếu bạn đang xây dựng thứ gì đó cần cả ảnh tĩnh lẫn clip, quy trình chỉ có một chiều: Qwen-Image-2.1 tạo khung hình, Gemini Omni 1.1 Flash làm nó chuyển động. Chiều ngược lại không tồn tại.

Khi bạn thực sự tính toán, con số chẳng hề nhân nhượng. Một clip 720p dài 10 giây trên Gemini Omni 1.1 Flash tính phí khoảng $1.00. Ở bậc nháp 360p, cùng 10 giây đó chỉ vào khoảng $0.30, còn một cảnh trọn vẹn 40 giây ở 720p — một lần tạo cộng ba lần gọi mở rộng — rơi vào khoảng $4.00. Trong khi đó, ảnh tĩnh khởi nguồn cho toàn bộ quy trình chẳng tốn gì ngoài tiền điện trên card của chính bạn. Điều đó nghĩa là quyết định chi phí đáng quan tâm không phải là "mô hình nào" mà là "bao nhiêu lần thử". Với ảnh tĩnh, bạn có thể thử đi thử lại miễn phí; với video thì không. Các nhóm lập ngân sách tạo video theo từng sản phẩm đầu ra thay vì theo từng lần thử chính là những người dễ bị bất ngờ, bởi khung hình đầu tiên miễn phí còn những lần thử lại thì không.

Cũng có một cái bẫy chất lượng trong khâu bàn giao. Gemini Omni 1.1 Flash kết xuất gốc ở 720p và nâng cấp lên 1080p và 4K. Nếu ảnh tĩnh của bạn là một khung 2048×2048 Qwen-Image-2.1 với kênh alpha sạch, việc đưa nó vào một luồng video vốn kết xuất ở 720p rồi nâng cấp sẽ vứt bỏ phần lớn những gì mô hình ảnh đã cung cấp cho bạn — và kênh alpha bị loại bỏ hoàn toàn, vì không có đầu ra video trong suốt. Độ trong suốt tồn tại trong bộ tổng hợp, không phải trong chuỗi mô hình. Hãy lập kế hoạch tổng hợp sau khi clip được trả về, không phải trước đó.

Lớp định tuyến phù hợp ở đâu

Phần khó xử của sự kết hợp này là cả hai mô hình đều không thể truy cập theo cách mà phần còn lại trong stack của bạn có lẽ đang được truy cập. Gemini Omni 1.1 Flash là một API của nhà cung cấp với khóa riêng và đồng hồ đo theo giây riêng. Qwen-Image-2.1 là một bản tải xuống khoảng 33 GB — một diffusion transformer 7B cộng với một text encoder Qwen3-VL 8B — mà bạn tự vận hành, theo một giấy phép chỉ cho phép sử dụng phi thương mại. Hai mô hình tính phí, hai đường truy cập, một dự án.

OrcaRouter tồn tại chính xác cho bề mặt xung quanh: một endpoint tương thích OpenAI trên hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên, không đội giá, tự động chuyển đổi dự phòng giữa các nhà cung cấp, một DSL định tuyến để tổ hợp các phương án dự phòng, và model fusion cho các lời gọi kiểu panel. Việc nói chính xác về những gì được bao phủ ở đây là điều quan trọng. Chúng tôi không định tuyến bất kỳ mô hình Qwen-Image nào thuộc bất kỳ phiên bản nào, nên Qwen-Image-2.1 không phải là tuyến bạn có thể gọi ở phía chúng tôi — nó chạy trên phần cứng của bạn hoặc không chạy chút nào. Chúng tôi cũng không định tuyến Gemini Omni 1.1 Flash. Điều chúng tôi thực sự cung cấp ở phía chuyển động là dòng video của Kling, bao gồm kling-v3, kling-v3-omni và kling-video-o1, cùng với MiniMax H3 — nên nửa hoạt hình của pipeline này có một tuyến được lưu trữ mà không cần hợp đồng nhà cung cấp thứ hai, và ở phía hình ảnh chúng tôi cung cấp dòng OpenAI GPT-Image, các bậc Imagen 4 của Google và bản xem trước hình ảnh Gemini, cùng endpoint hình ảnh Grok Imagine của xAI. Vì giá niêm yết được chuyển nguyên thay vì bị đội giá, việc nhà cung cấp giảm giá đối với bất kỳ mô hình nào trong số đó sẽ có hiệu lực ở đây ngay trong cùng ngày.

Cái nào bạn thực sự cần

Bạn cần tài nguyên, không phải cảnh quay — Qwen-Image-2.1, và kênh alpha chính là lý do. Ảnh cắt sản phẩm trong suốt, biểu tượng, sprite và ảnh tổng hợp nhiều lớp là nơi một sampler xuất RGBA tiết kiệm cả một quy trình tách nền.
Bạn cần chuyển động và bạn cần nó được đo lường — Gemini Omni 1.1 Flash. Nó là cái duy nhất trong hai có kết quả arena độc lập ở vị trí đầu bảng, và là cái duy nhất có mức giá theo giây được công bố mà bạn có thể đưa vào dự báo.
Bạn cần cả hai — hãy dự trù ngân sách cho phần video theo mỗi lần thử, không phải theo mỗi tài nguyên, và đừng giả định kênh alpha sẽ được giữ nguyên.
Bạn cần bán đầu ra — Gemini Omni 1.1 Flash, và chỉ Gemini Omni 1.1 Flash, cho đến khi Qwen công bố điều khoản thương mại cho Qwen-Image-2.1. Hiện nay không có giá hoặc bảng điều khoản nào được công bố cho giấy phép đó.

Tóm tắt trung thực là: phép so sánh xếp hạng chúng chính là một sản phẩm sai lầm. Điều đáng để theo dõi tiếp theo là liệu Qwen có gắn các điều khoản thương mại vào Qwen-Image-2.1 hay không, và liệu Google có thu hẹp khoảng cách âm thanh trên các bảng xếp hạng Omni hay không — hai sự thật đó, chứ không phải một bảng điểm khác, sẽ quyết định nửa nào của pipeline này được nhận ngân sách.

A screenshot of the Google Gemini API documentation models index, captured September 21 2026, showing the left navigation listing Nano Banana, Veo and Gemini Omni Flash under the models section, and the main panel opening with the Gemini 3 family of stable models.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày