用於「Qwen3.8-Omni-Flash vs Qwen 3.8」比較的主視覺標題卡,眉標為「正面交鋒——同一個家族,截然不同的任務設定」,副標為「專為數小時媒體內容打造的專家模型,對上擁有 2.4 兆參數、為每個 token 深度而生的開放核心」,以及三枚數據標籤,分別寫著「每百萬 token 價格:相差 13 倍」、「上下文:兩者皆為 1M」,和「開放權重:僅單邊提供」。
Guides & Insights

Qwen3.8-Omni-Flash 對比 Qwen 3.8:專科帳單 vs 旗艦帳單

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

如果你想聽簡短版:Qwen3.8-Omni-Flash大約每 token 便宜十三倍,相較於Qwen 3.8,而且是這兩者中唯一為了能處理長達一小時的影音內容而不會卡死而打造的——而Qwen 3.8,作為 Qwen3.8 系列頂端、擁有 2.4 兆參數的開放核心,則是當答案必須正確而不是便宜時,你會採用的那一個,也是兩者中唯一能下載權重的一個。它們共享相同的上下文長度、同一個家族名稱,以及八月到九月的發布窗口。它們不是彼此的替代品,而這項比較的全部價值,就在於知道自己實際上問的是哪個問題。

先把名稱說清楚,因為這個家族實在太擁擠了。Qwen 3.8這裡指的是 2.4T-A95B 的混合專家(MoE)開放核心——也就是 Qwen3.8-Max 端點背後的模型,阿里巴巴於 2026 年 8 月 3 日發表,並在 8 月 12 日公布權重,Artificial Analysis 則將它列為40在其 Intelligence Index 上。Qwen3.8-Omni-Flash則是阿里巴巴於 2026 年 9 月 18 日推出 API 服務的原生全模態模型,建構在 Qwen3.8-Flash 架構系列之上,可接收文字、圖像、音訊與影片,並回傳文字。如前所述,關於這款旗艦模型的一切,不是廠商自行公布,就是由獨立機構評測所得;而關於這款全模態模型的一切則僅有廠商說法,因為它才問世幾個小時,阿里巴巴以外的任何人都還沒實測過它。

兩款型號,同一系列,相反的設計理念

人們很容易把這解讀成同一代的大型模型與小型模型,就像你會把 Qwen3.8-Max 與 Qwen3.8-Flash 相互對照那樣解讀。這種解讀是錯的,而且會讓你付出金錢代價。Qwen 3.8 核心是一個推理引擎,只是剛好也能接受圖像與影片;其吞吐量是以在困難問題上每秒可處理的符元數來衡量,其定價反映的是 950 億個活躍參數的前向傳遞所需運算成本,而其評估表上列的是一系列推理與程式設計的榜單。Qwen3.8-Omni-Flash 是一個感知與行動引擎,只是剛好也會推理;其定價是對照吸收數小時媒體內容的成本來設定,而其評估表上列的是一系列音訊、影片與工具呼叫的榜單。一個是為了每個符元的深度而最佳化;另一個則是為了每小時內容可處理的符元數而最佳化。

這個差異最鮮明地顯現在一個行銷文案不會提及的地方。兩款模型都接受大約一百萬個 token,也都能接受影片。但Qwen3.8-Omni-Flash則是明確圍繞時長問題進行設計——單次呼叫可處理長達一小時的連續音訊與視訊,並具備 Agentic Understanding 模式;在該模式下,模型會自行選擇要取樣哪些內容,而非逐格處理每個畫面,將每次查詢的 token 數從 145,736 降至 79,117,同時把 OmniVideoBench 上的準確率從 63.4 提升到 67.8。Qwen 3.8則沒有同等且已公開的機制。理論上,餵給它兩小時的影片是可行的;但要以能通過財務團隊審核的價格做到這件事,則是另一回事,而這正是這款 omni 模型被打造出來要回答的問題。

真正決定它的維度

• 價格 — Qwen3.8-Omni-Flash 每百萬輸入 $0.15、每百萬輸出 $0.47,相較之下 Qwen 3.8 為 $2.00 與 $6.00。快取讀取:$0.016,相較於 $0.25。

• 開放權重——Qwen 3.8 於 2026 年 8 月 12 日以自訂授權條款發布權重;Qwen3.8-Omni-Flash 僅提供 API,阿里巴巴尚未表示會將其釋出。

• 上下文 — 兩側皆為一百萬個 token;omni 模型的最大輸入為 991K,最大輸出為 131K,推理預算為 262K。

• 媒體時長 — 單次全模態通話可支援長達一小時的連續音訊與視訊;旗艦機種有支援視訊輸入的記載,但並未附帶任何按小時計費的成本說明。

• 輸出模態 — 兩側都是文字。儘管承襲 omni 模型的血統,兩者都不會生成語音。

• 獨立評分——Qwen 3.8 在 Artificial Analysis Intelligence Index 上得分為 40。Qwen3.8-Omni-Flash 目前尚未有任何形式的獨立評分。

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen 3.8 - the scoreboard'. Left column Qwen3.8-Omni-Flash: Price per M $0.15 in / $0.47 out, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Open weights not released, Independent score none yet. Right column Qwen 3.8: Price per M $2.00 in / $6.00 out, Context 1M tokens, Media per call video input with no per-hour price, Output text only, Open weights published 12 Aug 2026, Independent score AA Index 40. The footer reads 'Qwen 3.8 pricing and Index score per Artificial Analysis and Alibaba; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

為什麼基準測試表無法解決這個問題

目前沒有正面對決的比較表,短期內也不會有。阿里巴巴為Qwen3.8-Omni-Flash發布的資料中,僅將其與Qwen3.5-Omni-Plus(即其直接前代)以及 Gemini 3.8 Flash 進行基準比較;而旗艦款的數據則完全來自另一組推理與程式編寫評測。這兩份表格沒有任何一列是共通的。任何發布把兩者並列於同一軸線之表格的人,都是自行打造了那條軸線。

可以誠實地說的是,這些都只是方向性的。就廠商自家公布的數字而言,omni 模型相較於它所取代的 omni 系列是一大躍進——在約三十項評測中平均提升超過 26%,其中 WildClawBench-MM 為 71.0、UniClawBench 為 69.6、LongAudioSpan 為 82.7——而相對於 Gemini 3.8 Flash 則是真實但局部的進步:它在以音訊為主的榜單上領先,例如 SpotSoundBench(67.2 對 39.7)與 MMAU(81.8 對 76.9),但在純影片推理的 AgenticVBench 上落後(36.8 對 45.0)。在旗艦產品方面,Qwen 3.8 的 Index 分數 40 是一項獨立量測,價值高於上述任何一項。這些是不同類型的證據,不應被平均在一起。

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

一個已列明假設的成本比較

以一個長文件與影片分析工作為例:300,000 個輸入 token 與 20,000 個輸出 token,這對於一場九十分鐘、附有投影片的錄影會議來說是合理的規模。在 Qwen3.8-Omni-Flash 上,那就是 300,000 × 每百萬 $0.15 = $0.045 的輸入,以及 20,000 × 每百萬 $0.47 = $0.0094 的輸出,所以大約是 5.4 美分。在 Qwen 3.8 上,同樣的呼叫為 300,000 × 每百萬 $2.00 = $0.60,以及 20,000 × 每百萬 $6.00 = $0.12,或者大約 72 美分。在相同的 token 數量下,成本略高於十三倍。

改變決策的數字不是比率,而是用量。一天有一百件這類工作時,那是每天約 5 美元對上每天約 72 美元——這就是「能出貨的功能」與「必須縮減範圍的功能」之間的差別。但如果任務是從一份 30 萬個 token 的合約中做一次艱難的擷取,而答錯一次就要耗掉一小時的人工複核,那麼 13 倍的溢價就無關緊要,推理能力更強的模型會靠它沒犯下的第一個錯誤勝出。在你查看價目之前就先設定好假設,而不是之後。

各自真正勝出之處

Qwen3.8-Omni-Flash在任何以小時計量的任務上都勝出。具語者分離與後續任務擷取的會議轉錄、長影片摘要、影音研究報告、字幕產製流程,以及任何必須自行判斷錄音中哪一分鐘重要的代理。廠商回報的語者分離改善——AliMeeting 語者錯誤率從 88.11 降至 3.35——正是能把需人工審查的流程轉為自動化流程的那種差距,不過一篇針對此次發布的中文技術分析主張,這項增益大多來自圍繞模型的前端與語者分離工程,而非模型本身,因此在淘汰人工審查步驟之前,請先用自己的音訊對它進行基準測試。對於任何其文字品質足以勝任的大量文字工作負載,這個 omni 模型也直接在價格上勝出;阿里巴巴聲稱其文字品質可與同尺寸的純文字模型相媲美——這是一項未經重現的聲明,值得測試而非逕自假設。

Qwen 3.8凡是產出需要被評判而非計數的場景,它都勝出:高難度推理、長時程的代理式工作、大規模程式碼工作,以及百萬 token 的文件分析——在這些場景中,綜合彙整本身就是成果。它也在一個與基準測試毫無關係的維度上勝出——它是開放權重如果你的限制條件是資料落地、地端部署、微調,或單純不想讓供應商處於推論路徑之中,那麼 omni 模型根本不在候選之列,而任何價格優勢都無法彌補這個落差。這個單一限制條件所決定的真實部署案例,比上述所有數字加起來還多。

在沒有兩份合約的情況下執行它們

像這樣的比較,實際上的摩擦很少來自模型選擇本身;真正的問題在於,你得先整合兩家供應商、兩套帳務關係和兩套用戶端程式碼,才能弄清楚自己到底想要哪一個。Qwen3.8-Max——承載 2.4 兆參數開放核心的那個端點——已在 OrcaRouter 上線,模型 ID 為qwen/qwen3.8-max,每百萬輸入 token 收費 2.00 美元、每百萬輸出 token 收費 6.00 美元,具備一百萬 token 的上下文,並支援文字、圖像與影片輸入,同時還能搭配用一把金鑰存取超過 200 個其他模型,以供應商定價提供、零加成,且當某個端點效能下降時,會自動跨供應商容錯移轉。Qwen3.8-Omni-Flash並不在該目錄中——它是在阿里巴巴自家平台上執行——所以現今最誠實的配置方式,就是旗艦模型走我們的路由、omni 模型直接呼叫,而路由層則讓你在跑完測試後,有地方安置輸掉的那一方。

A screenshot of the OrcaRouter model page for Qwen3.8 Max at www.orcarouter.ai/models/qwen/qwen3.8-max (captured 18 September 2026, English UI), showing the model id qwen/qwen3.8-max with a FEATURED badge and a byline date of 2026-08-03, a spec panel reading ctx 1M tokens, Input text + image + video, Output text, p50 TTFT 10.00s, and a metrics row reading INPUT $2.00 / 1M tokens, OUTPUT $6.00 / 1M tokens, TRAFFIC 84.0M tokens / 7d, above OpenAI- and Anthropic-compatible SDK code samples.

裁決結果

選擇Qwen3.8-Omni-Flash的時機是:輸入很長、輸出很短,而且用量讓單價成為關鍵限制條件。而當Qwen 3.8的輸入密集、輸出本身就是產品,且正確性或部署掌控權不容妥協時,就選擇它。兩者重疊的區域——影片理解——是唯一真正能正面對決的地方;在那個區域裡,全模態模型握有成本與耗時的論據,旗艦模型則握有推理與開放權重的論據。在你下定決心之前,請先用自己的資料把兩者都跑一遍;全模態模型目前還沒有獨立評測,而上市首日的價格優勢,正是那種值得用帳單、而不是用發表會來確認的事。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新