Một thẻ hero được tạo có tiêu đề 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash' dưới dòng eyebrow 'Đối đầu - hai công việc khác nhau', với phụ đề 'Một mô hình đọc một giờ cảnh quay. Mô hình kia tạo ra bốn mươi giây cảnh quay.' và bốn chip: 'Điểm chung: hiểu video', 'Đầu vào: âm thanh + video so với prompt', 'Đầu ra: văn bản so với video', 'Có thể định tuyến ở đây: không cái nào'. Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Qwen3.8-Omni-Flash so với Gemini Omni 1.1 Flash: Một bên xem video, một bên tạo ra video

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Câu trả lời ngắn: hai thứ này không thể thay thế cho nhau, và so sánh chỉ có ý nghĩa khi bạn ngừng coi "omni" là một hạng mục. Qwen3.8-Omni-Flash, mẫu mà nhà cung cấp đã mở cho khách hàng API vào ngày 18 tháng 9 năm 2026, nhận văn bản, hình ảnh, âm thanh và video đầu vào rồi trả về văn bản — đây là mẫu để đọc một giờ họp hay một giờ cảnh quay và cho bạn biết đã diễn ra chuyện gì. Gemini Omni 1.1 Flash, mẫu mà nhà cung cấp phát hành vào ngày 27 tháng 8 năm 2026, nhận câu lệnh dạng văn bản hoặc hình ảnh rồi trả về video có âm thanh đồng bộ — đây là mẫu để tạo ra cảnh quay. Một bên tiêu thụ phương tiện, bên kia sản xuất ra nó. Nếu quy trình của bạn cần cả hai, bạn cần cả hai, và câu hỏi trung thực không phải là cái nào thắng mà là bạn đang thực sự thiếu cái nào.

Không mô hình nào trong hai mô hình có trọng số mở, cũng không mô hình nào định tuyến được qua OrcaRouter, và cả hai đều được định giá trên những trục không thể quy đổi lẫn nhau — token ở một bên, số giây video được tạo ra ở bên kia. Điểm chúng thực sự chồng lấn hẹp hơn so với cách đóng khung "omni vs omni" gợi ý, và vùng chồng lấn đó đáng để xác định rõ trước khi đi vào phép tính giá, vì phép tính giá chính là nơi hai mô hình thường bị so sánh sai nhất.

Sai lầm phạm trù cần được làm rõ trước tiên

Tài liệu ra mắt của Alibaba đánh giá Qwen3.8-Omni-Flash so với Gemini 3.8 Flash, và rất nhiều bài đưa tin sau đó đã thu gọn điều đó thành "vượt qua Gemini". Đó là một mô hình Google khác với Gemini Omni 1.1 Flash, và hai mô hình này không thể thay thế cho nhau làm điểm tham chiếu: Gemini 3.8 Flash là mô hình đa phương thức đa dụng, còn Gemini Omni 1.1 Flash là mô hình tạo video với bảng giá riêng và giao diện API riêng. Mọi con số Qwen-so-với-Gemini đang được lan truyền từ buổi ra mắt — WildClawBench-MM 71,0 so với 58,9, SpotSoundBench 67,2 so với 39,7, AgenticVBench 36,8 so với 45,0 — đều là so với Gemini 3.8 Flash, chứ không phải so với mô hình video Omni, và dù sao thì không có con số nào là độc lập cả. Nếu bạn đến đây với một bảng điểm đặt hai mô hình trong bài viết này lên cùng một trục, thì gần như chắc chắn đó là nhầm mô hình Google ở cột bên phải rồi.

Mỗi thứ thực sự làm gì

• Nó tiếp nhận những gì — Qwen3.8-Omni-Flash chấp nhận văn bản, hình ảnh, âm thanh và video, bao gồm âm thanh không gian stereo và bốn kênh; Gemini Omni 1.1 Flash chấp nhận lời nhắc dạng văn bản và hình ảnh cùng tối đa ba giây video tham chiếu.

• Những gì nó trả về — Qwen3.8-Omni-Flash chỉ trả về văn bản; Gemini Omni 1.1 Flash trả về video với âm thanh được đồng bộ hóa nguyên bản, trong các cảnh có thể kéo dài đến 40 giây theo từng mười giây một.

• Bề mặt điều khiển — Qwen3.8-Omni-Flash cung cấp ngữ cảnh, lấy mẫu và một chế độ tác nhân tự quyết định xem cần nhìn vào đâu; Gemini Omni 1.1 Flash cung cấp điều khiển khung đầu và khung cuối, khả năng nhìn lại mười giây để đảm bảo tính liên tục, cùng một hạng phác thảo 360p mà Google mô tả là chỉ tốn khoảng một phần ba chi phí và nhanh hơn khoảng 60%.

• Độ phân giải và mức độ hoàn thiện — Qwen3.8-Omni-Flash không có độ phân giải đầu ra vì nó không tạo ra phương tiện nào; Gemini Omni 1.1 Flash xuất ra ở 720p, 1080p và 4K.

• Ngữ cảnh và thời lượng — Qwen3.8-Omni-Flash mang một triệu token và tối đa một giờ âm thanh-video liên tục trong một lần gọi; Gemini Omni 1.1 Flash bị giới hạn bởi clip mà nó đang tạo, chứ không phải bởi cửa sổ đầu vào.

• Cách bạn thanh toán — Qwen3.8-Omni-Flash được tính phí theo token: 0,15 USD cho mỗi triệu token đầu vào, 0,016 USD cho token đã lưu trong bộ nhớ đệm, 0,47 USD cho token đầu ra theo bảng giá quốc tế; Gemini Omni 1.1 Flash được tính phí theo từng giây video được tạo, với mức giá công bố của Google là 0,10 USD mỗi giây cho độ phân giải 720p.

• Tính mở — đóng ở cả hai phía. Không có trọng số cho mô hình nào, và cả hai đều không khả dụng để định tuyến qua API của chúng tôi trong hôm nay.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Input: text, image, audio, video', 'Output: text only', 'Context: 1M tokens', 'Max media: 1 hour per call', 'Billing: per token', 'Price: $0.15 / $0.47 per M'; right column Gemini Omni 1.1 Flash: 'Input: text and image prompts', 'Output: video with audio', 'Context: clip-bound', 'Max media: 40s scenes', 'Billing: per second', 'Price: $0.10 per second at 720p'. The footer reads 'Qwen figures vendor-reported; Google rates per its published list.' The OrcaRouter logo is composited in the bottom-right corner.

Sự giao thoa là hiểu video, và nó mang tính bất đối xứng.

Nơi duy nhất người mua có thể đặt hai thứ này cạnh nhau một cách hợp lý là một pipeline phải vừa hiểu vừa tạo ra cảnh quay — chẳng hạn, một trợ lý biên tập đọc một bản ghi dài, tìm ra những khoảnh khắc đáng giữ lại và tạo ra một bản cắt. Ở phần hiểu, Qwen3.8-Omni-Flash được xây dựng chính xác cho việc này: một giờ âm thanh và video liên tục mỗi lần gọi, tách người nói, và một chế độ agentic giúp nâng độ chính xác trên OmniVideoBench của nhà cung cấp từ 63,4 lên 67,8 đồng thời giảm token mỗi truy vấn từ 145.736 xuống 79.117. Ở phần sản xuất, Gemini Omni 1.1 Flash là mô hình có thể tạo ra clip kết quả với âm thanh đồng bộ, còn mô hình của Qwen hoàn toàn không thể tạo ra một khung hình video nào.

Sự bất đối xứng cũng diễn ra theo chiều ngược lại, và điều này còn dễ bị bỏ sót hơn. Khả năng hiểu của một mô hình tạo video chỉ mang tính công cụ — nó cần đủ thông tin về một cảnh để giữ cho một cú máy nhất quán khi kéo dài thêm mười giây, một yêu cầu khác với việc trả lời câu hỏi về những gì đã được nói ở giờ thứ ba của một cuộc họp. Mô hình của Google có thành tích dài hơn về chất lượng tạo sinh và ngắn hơn về phân tích dài; mô hình của Alibaba thì ngược lại. Nếu nhiệm vụ của bạn là "tìm ra ba phút quan trọng trong bản ghi này", thì mô hình tạo sinh không phải là công cụ phù hợp. Nếu nhiệm vụ của bạn là "tạo một clip ba mươi giây khớp với đề bài này", thì mô hình hiểu cũng không phải là công cụ phù hợp.

Tại sao việc so sánh giá cứ tiếp tục sai

Mức giá theo giây và mức giá theo token không thể quy đổi cho nhau, và việc cố quy đổi chúng tạo ra hai lỗi chi phối toàn bộ so sánh này. Lỗi thứ nhất là đem cả một clip được tạo ra ra so với mức giá đầu vào theo token rồi kết luận mô hình video đắt gấp hàng trăm lần — điều đó đúng nhưng vô nghĩa, vì chúng không bán cùng một thứ. Lỗi thứ hai là chỉ so sánh giá đầu vào mà bỏ qua việc mức cắt giảm 98% cho âm thanh của Alibaba áp dụng cho số giờ âm thanh đầu vào, trong khi mức giá của Google áp dụng cho số giây video đầu ra, nên hai "mức cắt giảm" đó thậm chí không nằm cùng một phía của đồng hồ đo.

Điều có thể nói một cách trung thực là thế này. Theo phương pháp luận của chính Alibaba — một mẫu hai phút nhân với ba mươi, video ở 720p và một khung hình mỗi giây — một giờ đầu vào âm thanh và video kết hợp cho Qwen3.8-Omni-Flash được báo giá khoảng $0,20, giảm từ $3,27 so với thế hệ trước. Việc tạo bốn mươi giây video 720p bằng Gemini Omni 1.1 Flash với mức $0,10 mỗi giây do Google công bố tốn $4,00, và tạo bản nháp cho cùng bốn mươi giây đó ở 360p rơi vào khoảng $1,20 theo cách tính chi phí bằng một phần ba của Google. Cả hai bộ số liệu đều do nhà cung cấp báo cáo và chưa bộ nào được tái lập độc lập. Kết luận hữu ích không phải là con số nào nhỏ hơn, mà là việc phân tích một giờ cảnh quay và tạo ra bốn mươi giây trong số đó nằm trong cùng một bậc độ lớn — đó mới là lý do thực sự khiến một quy trình sản xuất làm cả hai việc cần một mô hình chi phí, chứ không phải một bên thắng.

Đó cũng là lập luận cho việc giữ cả hai trên một khóa thay vì hai hợp đồng. Hiện nay, không mô hình omni nào có thể định tuyến qua OrcaRouter: Qwen3.8-Omni-Flash chỉ chạy trên các nền tảng của chính Alibaba, và Google chưa mở API video Omni cho định tuyến của bên thứ ba, nên chúng tôi không lưu trữ cái nào trong hai và sẽ không giả vờ là có. Điều đang có sẵn trong danh mục của chúng tôi là phiên bản cùng dòng của mỗi dòng sản phẩm — Qwen3.8-FlashGemini 3.8 Flash — cả hai đều có thể gọi ngay hôm nay qua một endpoint ở mức giá niêm yết của nhà cung cấp với 0% markup, và đó là điều khiến việc A/B đối chiếu với số liệu của chính từng nhà cung cấp chỉ còn là vấn đề thay đổi cấu hình thay vì phải tích hợp thêm lần nữa.

A headless screenshot of the OrcaRouter model page for Gemini 3.8 Flash at www.orcarouter.ai/models/google/gemini-3.8-flash, showing the model header, the input-modality and capability row (text, image, video, audio, tools, JSON, reasoning), the published pricing and the p50 TTFT figure.

Mỗi cái mạnh ở đâu, nói thẳng ra

Qwen3.8-Omni-Flash thắng ở mọi thứ được đo bằng giờ đầu vào: chép lời và phân tách người nói trong cuộc họp, tóm tắt bản ghi dài, sử dụng công cụ tác tử nặng về âm thanh, và chi phí trên mỗi giờ phương tiện được xử lý. Kết quả âm thanh do nhà cung cấp báo cáo rất mạnh và điểm yếu của nó nằm ở nơi mô hình chưa từng nhắm tới — các bảng thiên về suy luận, nơi những lần chạy của bên thứ ba đầu tiên xếp nó ở bách phân vị 28 về suy luận với chỉ số tốc độ ở bách phân vị 21, trên một mẫu đủ nhỏ để những con số đó nên được coi là gợi ý để kiểm chứng thay vì một phán quyết.

Gemini Omni 1.1 Flash thắng về đầu ra: tạo cảnh quay với âm thanh đồng bộ, tính liên tục xuyên suốt các cảnh dài, khả năng kiểm soát ở cấp độ khung hình, và bản hoàn thiện 4K mà một quy trình phân phối có thể đơn giản là yêu cầu. Lợi thế của nó không phải là điểm chuẩn đánh giá — mà là việc mô hình kia hoàn toàn không thể làm được công việc đó. Điểm yếu của nó nằm ở bất cứ thứ gì đòi hỏi phải giữ ngữ cảnh trong một giờ, vì nó không được xây dựng để làm điều đó.

Quyết định, và điều cần theo dõi

Nếu bạn đang cân nhắc giữa chúng, câu hỏi là nửa nào của pipeline đang không được phục vụ. Một nhóm đã tạo video và cần hiểu các bản ghi dài nên thử Qwen3.8-Omni-Flash trên chính âm thanh của mình trong tuần này; một nhóm phân tích media và cần sản xuất nó nên thử Gemini Omni 1.1 Flash. Một nhóm cần cả hai đang phải xem xét hai nhà cung cấp, hai mô hình tính phí và hai tích hợp, và đây là tình huống mà một lớp định tuyến duy nhất không còn chỉ là tiện ích nữa mà trở thành thứ giữ cho mô hình chi phí dễ đọc.

Hai điều sẽ thay đổi nhận định này. Một đánh giá độc lập về Qwen3.8-Omni-Flash sẽ thay thế mọi con số từ nhà cung cấp ở trên bằng một con số có thể so sánh được — hiện chưa có con số nào như vậy, và sự thiếu hụt đó là khoảng trống lớn nhất trong so sánh này. Và một mức giá được công bố cho đầu ra 1080p và 4K từ Google sẽ khiến phép tính ở phân khúc cao cấp có thể kiểm chứng được; hiện nay những con số đó chỉ lưu hành dưới dạng ước tính từ thị trường chứ không phải danh sách của chính Google.

A headless screenshot of Google's Gemini API documentation page for Gemini Omni Flash at ai.google.dev/gemini-api/docs/omni, showing the docs navigation, the model identifier gemini-omni-1.1-flash, and the description of its native multimodality and conversational editing.

Một lưu ý kết về cách định khung. “Omni” đã không còn mang nghĩa chính xác nào nữa — nó giờ bao hàm cả một mô hình đọc một giờ âm thanh cuộc họp lẫn một mô hình kết xuất một clip bốn mươi giây kèm âm thanh, và việc coi từ đó như một hạng mục chính là cách người mua rốt cuộc so sánh đơn giá theo token với đơn giá theo giây và rút ra kết luận từ đó. Các mô hình này bổ trợ cho nhau với mức chồng lấn hẹp, và cách tiếp cận đúng đắn với cả hai, năm ngày và bốn tuần sau các bản phát hành tương ứng, là như nhau: hãy đo chúng trên chất liệu của chính bạn, và giữ một con đường thứ hai luôn mở.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày