
Qwen-Image-2.1 so với Gemini Omni 1.1 Flash: Một bên trả về PNG, bên kia thì không
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Điều hữu ích nhất cần biết về Qwen-Image-2.1 và Gemini Omni 1.1 Flash là chúng không cạnh tranh với nhau. Yêu cầu Gemini Omni 1.1 Flash tạo một ảnh tĩnh, bạn sẽ nhận được lỗi: tài liệu của chính nhà cung cấp liệt kê tạo ảnh, chỉnh sửa ảnh và đầu ra xen kẽ ảnh-văn bản là những khả năng không được mô hình này hỗ trợ. Yêu cầu Qwen-Image-2.1 tạo video, bạn sẽ nhận được một ảnh tĩnh 2048×2048 kèm kênh alpha. Bất kỳ bảng so sánh nào xếp chúng vào hai cột đều là đang so sánh một chiếc máy ảnh với một chiếc máy chiếu. Câu hỏi thực sự — câu hỏi thực sự tốn tiền — là điều gì xảy ra khi bạn ghép chuỗi chúng lại, và liệu chuỗi đó có trụ nổi khi chạm mặt bảng giá hay không. Qwen-Image-2.1 ra mắt công chúng vào ngày 20 tháng 9 năm 2026; Gemini Omni 1.1 Flash đã được phát hành rộng rãi từ ngày 27 tháng 8 năm 2026.
Mỗi mô hình thực sự trả về những gì
Đây là toàn bộ sự so sánh, và mọi thứ khác đều theo sau từ đó.
• Định dạng đầu ra — Qwen-Image-2.1 trả về ảnh tĩnh, tối đa 2048×2048 nguyên bản ở 40 bước suy luận, tùy chọn có kênh alpha thực; Gemini Omni 1.1 Flash trả về video, tối đa 40 giây được ghép từ các lệnh gọi tạo và mở rộng 10 giây, hoàn toàn không có chế độ ảnh tĩnh.
• Độ trong suốt — Qwen-Image-2.1 khử nhiễu trong không gian tiềm ẩn RGBA 64 kênh, nên alpha đi ra từ bộ lấy mẫu; Gemini Omni 1.1 Flash không có đầu ra nền trong suốt, và việc yêu cầu một đầu ra như vậy sẽ thất bại.
• Đầu vào tham chiếu — Qwen-Image-2.1 chấp nhận tối đa 10 ảnh tham chiếu để tổng hợp nhiều chủ thể; Gemini Omni 1.1 Flash chấp nhận tối đa 10 ảnh cho mỗi prompt như *đầu vào* và tối đa ba clip video tham chiếu 3 giây.
• Giới hạn độ phân giải — Qwen-Image-2.1 là 2K nguyên bản; Gemini Omni 1.1 Flash cung cấp 360p, 720p, 1080p và 4K, nhưng 1080p và 4K là bản nâng cấp từ kết xuất 720p nguyên bản chứ không phải tạo nguyên bản.
• Chi phí — Qwen-Image-2.1 không có giá dịch vụ chạy trên máy chủ vì không có endpoint chạy trên máy chủ, nên chi phí là thời gian GPU của riêng bạn; Gemini Omni 1.1 Flash tính phí $0.10 mỗi giây ở 720p, với hạng nháp 360p khoảng $0.03 mỗi giây.
• Giấy phép — Qwen-Image-2.1 được phát hành theo Thỏa thuận Cấp phép Nghiên cứu Qwen ngày 20 tháng 9 năm 2026, chỉ dùng phi thương mại; Gemini Omni 1.1 Flash là API thương mại có đầu ra mang SynthID và thông tin xuất xứ C2PA theo mặc định.
Hàng cuối cùng là hàng mà mọi người thường lướt qua. Một bên là mô hình bạn có thể tải xuống nhưng không thể bán. Bên kia là mô hình bạn không thể tải xuống nhưng có thể bán tự do — với một hình mờ vô hình trong từng khung hình.
Vì sao cách đặt vấn đề “versus” vẫn cứ xuất hiện dù sao đi nữa
Hãy tìm kiếm hai cái tên cùng nhau và bạn sẽ thấy những trang xếp hạng chúng đối đầu trực tiếp. Lý do là câu hỏi cốt lõi vẫn có thật ngay cả khi cách đặt vấn đề là sai: cả hai mô hình đều nằm trong cùng một quy trình sáng tạo, và cả hai đều là thứ mới nhất trong đó. Điều mọi người thực sự đang cố quyết định là nơi ảnh tĩnh kết thúc và chuyển động bắt đầu.
Gemini Omni 1.1 Flash đã khẳng định được vị trí của mình ở câu hỏi đó bằng những con số độc lập chứ không phải số liệu từ nhà cung cấp. Trên Artificial Analysis, nó giữ vị trí dẫn đầu ở cả đấu trường text-to-video và image-to-video trong hạng mục không âm thanh tính đến ngày 2 tháng 9 năm 2026, với Elo 1324 và 1364. Khi bật âm thanh, nó tụt xuống Elo 1237 và 1180 — vị trí thứ hai và thứ tư. Khoảng cách về âm thanh đó là kiểu chi tiết mà bảng thông số kỹ thuật che giấu và bảng xếp hạng phơi bày.
Bằng chứng của Qwen-Image-2.1 mỏng hơn và thuộc một loại khác. Qwen-Image-Bench của chính nhà cung cấp đưa nó đạt 60,28, cao hơn Nano Banana 2.0 ở 59,82 và GPT Image 1.5 ở 59,65, và đứng đầu trong số các mô hình mở — nhưng đó là một benchmark do nhà cung cấp thực hiện với khoảng cách dưới một điểm, và nó không phải là bản tái lập của bên thứ ba. Các thử nghiệm độc lập cho đến nay chỉ gồm một lượt chấm điểm bởi con người trên GenAI Showdown với 7/15, tăng từ 4/15 của Qwen-Image gốc và xếp sau 8/15 của Ideogram 4. Mô hình không có mục nào trên bảng xếp hạng hình ảnh của Artificial Analysis vào thời điểm viết bài. Không phải là điểm thấp — mà là không có điểm.


Việc bàn giao, và cái giá thực sự của nó
Nếu bạn đang xây dựng thứ gì đó cần cả ảnh tĩnh lẫn clip, quy trình chỉ có một chiều: Qwen-Image-2.1 tạo khung hình, Gemini Omni 1.1 Flash làm nó chuyển động. Chiều ngược lại không tồn tại.
Khi bạn thực sự tính toán, con số chẳng hề nhân nhượng. Một clip 720p dài 10 giây trên Gemini Omni 1.1 Flash tính phí khoảng $1.00. Ở bậc nháp 360p, cùng 10 giây đó chỉ vào khoảng $0.30, còn một cảnh trọn vẹn 40 giây ở 720p — một lần tạo cộng ba lần gọi mở rộng — rơi vào khoảng $4.00. Trong khi đó, ảnh tĩnh khởi nguồn cho toàn bộ quy trình chẳng tốn gì ngoài tiền điện trên card của chính bạn. Điều đó nghĩa là quyết định chi phí đáng quan tâm không phải là "mô hình nào" mà là "bao nhiêu lần thử". Với ảnh tĩnh, bạn có thể thử đi thử lại miễn phí; với video thì không. Các nhóm lập ngân sách tạo video theo từng sản phẩm đầu ra thay vì theo từng lần thử chính là những người dễ bị bất ngờ, bởi khung hình đầu tiên miễn phí còn những lần thử lại thì không.
Cũng có một cái bẫy chất lượng trong khâu bàn giao. Gemini Omni 1.1 Flash kết xuất gốc ở 720p và nâng cấp lên 1080p và 4K. Nếu ảnh tĩnh của bạn là một khung 2048×2048 Qwen-Image-2.1 với kênh alpha sạch, việc đưa nó vào một luồng video vốn kết xuất ở 720p rồi nâng cấp sẽ vứt bỏ phần lớn những gì mô hình ảnh đã cung cấp cho bạn — và kênh alpha bị loại bỏ hoàn toàn, vì không có đầu ra video trong suốt. Độ trong suốt tồn tại trong bộ tổng hợp, không phải trong chuỗi mô hình. Hãy lập kế hoạch tổng hợp sau khi clip được trả về, không phải trước đó.
Lớp định tuyến phù hợp ở đâu
Phần khó xử của sự kết hợp này là cả hai mô hình đều không thể truy cập theo cách mà phần còn lại trong stack của bạn có lẽ đang được truy cập. Gemini Omni 1.1 Flash là một API của nhà cung cấp với khóa riêng và đồng hồ đo theo giây riêng. Qwen-Image-2.1 là một bản tải xuống khoảng 33 GB — một diffusion transformer 7B cộng với một text encoder Qwen3-VL 8B — mà bạn tự vận hành, theo một giấy phép chỉ cho phép sử dụng phi thương mại. Hai mô hình tính phí, hai đường truy cập, một dự án.
OrcaRouter tồn tại chính xác cho bề mặt xung quanh: một endpoint tương thích OpenAI trên hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên, không đội giá, tự động chuyển đổi dự phòng giữa các nhà cung cấp, một DSL định tuyến để tổ hợp các phương án dự phòng, và model fusion cho các lời gọi kiểu panel. Việc nói chính xác về những gì được bao phủ ở đây là điều quan trọng. Chúng tôi không định tuyến bất kỳ mô hình Qwen-Image nào thuộc bất kỳ phiên bản nào, nên Qwen-Image-2.1 không phải là tuyến bạn có thể gọi ở phía chúng tôi — nó chạy trên phần cứng của bạn hoặc không chạy chút nào. Chúng tôi cũng không định tuyến Gemini Omni 1.1 Flash. Điều chúng tôi thực sự cung cấp ở phía chuyển động là dòng video của Kling, bao gồm kling-v3, kling-v3-omni và kling-video-o1, cùng với MiniMax H3 — nên nửa hoạt hình của pipeline này có một tuyến được lưu trữ mà không cần hợp đồng nhà cung cấp thứ hai, và ở phía hình ảnh chúng tôi cung cấp dòng OpenAI GPT-Image, các bậc Imagen 4 của Google và bản xem trước hình ảnh Gemini, cùng endpoint hình ảnh Grok Imagine của xAI. Vì giá niêm yết được chuyển nguyên thay vì bị đội giá, việc nhà cung cấp giảm giá đối với bất kỳ mô hình nào trong số đó sẽ có hiệu lực ở đây ngay trong cùng ngày.
Cái nào bạn thực sự cần
• Bạn cần tài nguyên, không phải cảnh quay — Qwen-Image-2.1, và kênh alpha chính là lý do. Ảnh cắt sản phẩm trong suốt, biểu tượng, sprite và ảnh tổng hợp nhiều lớp là nơi một sampler xuất RGBA tiết kiệm cả một quy trình tách nền.
• Bạn cần chuyển động và bạn cần nó được đo lường — Gemini Omni 1.1 Flash. Nó là cái duy nhất trong hai có kết quả arena độc lập ở vị trí đầu bảng, và là cái duy nhất có mức giá theo giây được công bố mà bạn có thể đưa vào dự báo.
• Bạn cần cả hai — hãy dự trù ngân sách cho phần video theo mỗi lần thử, không phải theo mỗi tài nguyên, và đừng giả định kênh alpha sẽ được giữ nguyên.
• Bạn cần bán đầu ra — Gemini Omni 1.1 Flash, và chỉ Gemini Omni 1.1 Flash, cho đến khi Qwen công bố điều khoản thương mại cho Qwen-Image-2.1. Hiện nay không có giá hoặc bảng điều khoản nào được công bố cho giấy phép đó.
Tóm tắt trung thực là: phép so sánh xếp hạng chúng chính là một sản phẩm sai lầm. Điều đáng để theo dõi tiếp theo là liệu Qwen có gắn các điều khoản thương mại vào Qwen-Image-2.1 hay không, và liệu Google có thu hẹp khoảng cách âm thanh trên các bảng xếp hạng Omni hay không — hai sự thật đó, chứ không phải một bảng điểm khác, sẽ quyết định nửa nào của pipeline này được nhận ngân sách.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
