一張生成的 hero card,標題為「Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash」,上方眉標為「正面交鋒——兩項不同的工作」,副標題為「一個能讀取一小時的影片素材。另一個則能生成四十秒的影片。」,並有四張標籤:「重疊:影片理解」、「輸入:音訊 + 影片 vs 提示詞」、「輸出:文字 vs 影片」、「此處可路由:皆非」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Qwen3.8-Omni-Flash 對決 Gemini Omni 1.1 Flash:一個觀看影片,一個製作影片

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

簡短回答:這兩者不能互相替代,只有當你不再把「omni」當成一個類別來看待時,這個比較才有意義。Qwen3.8-Omni-Flash是廠商於 2026 年 9 月 18 日開放給 API 客戶的模型,它接受文字、圖像、音訊和影片輸入並回傳文字——它是用來讀取一小時的會議或影片素材,然後告訴你發生了什麼事的模型。Gemini Omni 1.1 Flash則是廠商於 2026 年 8 月 27 日推出的模型,它接受文字或圖像提示並回傳帶有同步音訊的影片——它是用來製作影片素材的模型。一個消耗媒體,另一個產出媒體。如果你的流程兩者都需要,那你就兩者都要,而真正該問的問題不是哪個勝出,而是你實際上缺的是哪一個。

這兩個模型都不是開放權重的,也都無法透過 OrcaRouter 路由,而且兩者的計價軸線無法互相換算——一邊是 token,另一邊則是生成影片的秒數。它們真正重疊的範圍,比「omni 對 omni」這種框架所暗示的還要窄;而在做價格計算之前,先把這個重疊範圍弄清楚是值得的,因為價格計算正是最常讓兩者被錯誤比較的地方。

首先值得釐清的範疇錯誤

阿里巴巴的發表資料將Qwen3.8-Omni-FlashGemini 3.8 Flash進行基準比較,而後續大量報導把這件事濃縮成「擊敗 Gemini」。那與Gemini Omni 1.1 Flash是不同的 Google 模型,兩者並非可互換的參照基準:Gemini 3.8 Flash 是通用型多模態模型,Gemini Omni 1.1 Flash 則是影片生成模型,有各自的價目表和各自的 API 介面。發表後流傳的每一組 Qwen 對 Gemini 數字——WildClawBench-MM 71.0 對 58.9、SpotSoundBench 67.2 對 39.7、AgenticVBench 36.8 對 45.0——都是對上 Gemini 3.8 Flash,而不是對上 Omni 影片模型,而且無論如何,這些數字全都不是獨立來源。如果你帶著一張把本文這兩個模型放在同一軸線上的計分板來到這裡,那麼右欄幾乎肯定是放錯了 Google 模型。

每一個實際上在做什麼

• 它能接收的輸入 — Qwen3.8-Omni-Flash 接受文字、圖像、音訊和影片,包括立體聲與四聲道空間音訊;Gemini Omni 1.1 Flash 接受文字和圖像提示,以及最多三秒的參考影片。

• 回傳內容 — Qwen3.8-Omni-Flash 僅回傳文字;Gemini Omni 1.1 Flash 則回傳搭載原生同步音訊的影片,場景可延長至 40 秒,並以 10 秒為單位遞增。

• 控制介面 — Qwen3.8-Omni-Flash 提供上下文、取樣與一種代理模式,會自行決定要查看什麼;Gemini Omni 1.1 Flash 提供首幀與末幀控制、用於維持連貫性的十秒回看,以及 Google 形容為成本約三分之一、速度快約 60% 的 360p 草稿等級。

• 解析度與輸出成品 — Qwen3.8-Omni-Flash 沒有輸出解析度,因為它不產生任何媒體;Gemini Omni 1.1 Flash 則可輸出 720p、1080p 與 4K。

• 上下文與時長 — Qwen3.8-Omni-Flash 單次呼叫即可承載一百萬個 token,以及長達一小時的連續影音;Gemini Omni 1.1 Flash 則受其正在生成的片段所限,而非輸入視窗。

• 付費方式 — Qwen3.8-Omni-Flash 按 token 計費:國際價目表為每百萬輸入 $0.15、快取 $0.016、輸出 $0.47;Gemini Omni 1.1 Flash 則按生成影片的秒數計費,Google 公布的 720p 費率為每秒 $0.10。

• 開放性 — 雙方皆封閉。兩個模型都沒有提供權重,且目前都無法透過我們的 API 進行路由。

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Input: text, image, audio, video', 'Output: text only', 'Context: 1M tokens', 'Max media: 1 hour per call', 'Billing: per token', 'Price: $0.15 / $0.47 per M'; right column Gemini Omni 1.1 Flash: 'Input: text and image prompts', 'Output: video with audio', 'Context: clip-bound', 'Max media: 40s scenes', 'Billing: per second', 'Price: $0.10 per second at 720p'. The footer reads 'Qwen figures vendor-reported; Google rates per its published list.' The OrcaRouter logo is composited in the bottom-right corner.

重疊之處在於影片理解,而且它是不對稱的。

買家能合理地把這兩者放在一起比較的唯一場景,是一條既得理解影片素材、又得產出影片的流程——比如一個剪輯助理,它會讀取一段長錄影,找出值得保留的片段,並生成一份剪輯。在理解這一半,Qwen3.8-Omni-Flash正是為此而打造:每次呼叫可處理一小時的連續音訊與視訊、支援講者分離,還有一種代理模式,能將該廠商 OmniVideoBench 上的準確率從 63.4 提升到 67.8,同時把每次查詢的 token 數從 145,736 降到 79,117。在產出這一半,Gemini Omni 1.1 Flash才是能生成帶有同步音訊之成品片段的那一方,而 Qwen 的模型根本連一幀影片都產不出來。

這種不對稱也存在於相反方向,而且更容易被忽略。影片生成模型對理解力的掌握是工具性的——它需要對場景有足夠掌握,才能在延長十秒時讓鏡頭保持一致,這與回答會議第三個小時說了什麼這類問題是截然不同的需求。Google 的模型在生成品質上有較久的實績紀錄,在長篇分析上則較短;阿里巴巴的模型則相反。如果你的任務是「找出這段錄音中關鍵的三分鐘」,生成模型不是合適工具。如果你的任務是「產出符合這份需求簡報的三十秒短片」,理解模型也不是合適工具。

為什麼價格比較一直出錯

按秒計費的費率與按 token 計費的費率無法互相換算,而試圖換算會產生主導這場對決的兩個錯誤。第一個錯誤是把一整段生成的影片片段拿來跟按 token 的輸入費率相比,然後得出影片模型貴上數百倍的結論——這雖然屬實,卻毫無意義,因為兩者賣的並不是同一種東西。第二個錯誤是只比較輸入價格,卻忽略了 Alibaba 98% 的音訊降價適用於輸入音訊時數,而 Google 的費率適用於輸出影片秒數,因此這兩個「降價」甚至不在計量器的同一側。

坦白說,能講的是這個。按照阿里巴巴自家的方法論——取兩分鐘樣本再乘以三十、影片為 720p 且每秒一格——將一小時的混合音訊與視訊輸入Qwen3.8-Omni-Flash,報價約為 0.20 美元,相較前一代的 3.27 美元有所下降。以Gemini Omni 1.1 Flash生成四十秒的 720p 影片,按 Google 公布的每秒 0.10 美元計算,成本為 4.00 美元;若以 360p 試作同樣的四十秒,依 Google 三分之一成本的說法則落在約 1.20 美元。這兩組數字皆為廠商自行提報,且都未經獨立複現。有用的結論不在於哪個數字比較小,而在於分析一小時素材與生成其中四十秒,其實處於同一個數量級——這才是同時做這兩件事的製作流程真正需要的是成本模型、而非贏家的原因。

這也是主張把兩者放在同一組金鑰、而非拆成兩份合約的論據。這兩個 omni 模型目前都無法透過 OrcaRouter 路由:Qwen3.8-Omni-Flash只能在阿里巴巴自家的平台上運行,而 Google 尚未將 Omni 影片 API 開放給第三方路由,因此我們兩者都不代管,也不會佯稱有代管。我們目錄中實際上線的是各家族的同系列型號——Qwen3.8-FlashGemini 3.8 Flash——兩者今天都能透過單一端點以供應商定價、0% 加成呼叫,這正是為什麼要與任一供應商自家數據做 A/B 測試,只需改動設定,而不必再進行第二次整合。

A headless screenshot of the OrcaRouter model page for Gemini 3.8 Flash at www.orcarouter.ai/models/google/gemini-3.8-flash, showing the model header, the input-modality and capability row (text, image, video, audio, tools, JSON, reasoning), the published pricing and the p50 TTFT figure.

各自勝出之處,直言不諱

Qwen3.8-Omni-Flash在任何以輸入時數衡量的項目上都勝出:會議逐字稿與發言者分離、長錄音摘要、音訊比重高的代理式工具運用,以及每處理一小時媒體的成本。其供應商報告的音訊成果相當亮眼,而它的弱點正落在這款模型從未被鎖定的領域——偏重推理的排行榜上,首批第三方測試在推理方面把它排在第 28 百分位,速度指標則落在第 21 百分位,而樣本數小到這些數字應被視為值得一測的提示,而非定論。

Gemini Omni 1.1 Flash在輸出方面勝出:具備同步音訊的鏡頭生成、長場景之間的連貫性、影格級控制,以及交付管線可能單純就是需要的 4K 成品。它的優勢不在於跑分成績——而在於另一個模型根本做不到這份工作。它較弱的地方,在於任何需要維持一小時上下文的工作,因為它並非為此而打造。

這項決定,以及值得留意的事

如果你正在兩者之間做選擇,問題在於這條流程的哪一半還沒有被服務。已經在生成影片、又需要理解長錄音的團隊,本週就該用自己的音訊測試Qwen3.8-Omni-Flash;而負責分析媒體、又需要產製媒體的團隊,則應該測試Gemini Omni 1.1 Flash。兩者都需要的團隊,面對的是兩家供應商、兩套計費模式和兩套整合,這種情況下,單一路由層就不再只是便利,而是讓成本模型維持清晰可讀的關鍵。

有兩件事會改變這個判讀。對Qwen3.8-Omni-Flash進行獨立評估,就能把上方每一項廠商提供的數字,換成可資比對的數字——但這種評估目前並不存在,而它的缺席正是這份比較中最大的單一缺口。此外,若 Google 公布 1080p 與 4K 輸出的價格,高階部分的計算結果就能受到檢驗;目前這些數字僅以市場行情估算的形式流傳,而非 Google 自家公布的價目。

A headless screenshot of Google's Gemini API documentation page for Gemini Omni Flash at ai.google.dev/gemini-api/docs/omni, showing the docs navigation, the model identifier gemini-omni-1.1-flash, and the description of its native multimodality and conversational editing.

關於定位的最後一點說明。「Omni」已經不再具有任何精確的意義——如今它既涵蓋能讀取一小時會議音訊的模型,也涵蓋能生成四十秒帶聲音短片的模型,而把這個詞當成一個類別來看待,正是買家最後會拿每 token 費率去比每秒費率、並從中得出結論的原因。這些模型是互補的,只有極小的重疊;而面對兩者——在各自發布五天與四週之後——正確的姿態都一樣:用自己的素材去衡量它們,並保留第二條路徑。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新