
Qwen3.8-Omni-Flash 登場:100 萬 Token 上下文、音訊成本降低 98%、僅輸出文字
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
此次發布Qwen3.8-Omni-Flash於今日,2026 年 9 月 18 日,向 API 客戶開放,而它率先端出的數字是帳單,而非分數。Qwen 表示,每小時音訊輸入,新模型的成本少了 98%,比其前代Qwen3.5-Omni-Plus;每小時的合併音訊與視訊,少了 93%。公告中的其他一切,都由此一框架衍生而來。Qwen3.8-Omni-Flash 是一款原生全模態模型——文字、圖像、音訊與視訊輸入,一百萬個 token 的上下文,單次呼叫中最多可處理長達整整一小時的連續音訊與視訊——而 Alibaba 推銷它的方式,不是把它當成更出色的媒體描述器,而是首個 Qwen 模型,專為能對其採取行動而打造。其標語是「全方位感知。代理式交付。」同樣在這些資料中直白指出的問題是:該模型只以文字回應:它聽、它看,但它不說話。
以下內容沒有任何一項經過獨立重現。該模型才發布幾小時,尚未有第三方對其進行評估,而發布資料中的每一項基準測試和價格數據都是阿里巴巴自己的。若某個數字是廠商提供的,本文會在包含該數字的句子中註明;若某個解讀來自評論者而非廠商,則會標明出處。唯一一件事是今天可以獨立查證的——該模型已在阿里巴巴的平台上線,且不在其他任何人的目錄中——,而這正是發布會最不感興趣談論的事。
實際發佈的內容
對一次全模態(omni-modal)發表而言,這份規格表異常簡潔,而這本身就是重點:這個系列上一代的全模態模型,是把各自獨立的感知編碼器硬接到文字 LLM 上拼湊而成,而這一代則直接建構在 Qwen3.8-Flash 架構系列之上,各種模態皆以原生方式處理,而非事後嫁接。
• 輸入 — 文字、圖像、音訊與視訊,可接受立體聲與四聲道空間音訊;輸出僅限文字。
• 上下文 — 一百萬個 token,最大輸入約為 991K(在思考模式下約 983K),最大輸出為 131K,推理預算可達 262K。
• 時長 — 每次通話最多可連續傳輸一小時的音訊或影音,這個數字讓會議與長影片使用情境得以在不分塊的情況下實現。
• 語音涵蓋範圍 — 周邊工具支援 74 種語言的辨識,以及 29 種語言的語音生成;一份關於該發布的中文報導指出,音訊輸入支援 113 種語言和方言。
• 可用性 — 千問 AI 平台與阿里雲百鍊模型工作室(百鍊),API 識別碼為 qwen3-8-omni-flash。權重不會釋出。即時(Realtime)版本被描述為首個具備音源定位能力的全模態模型。

98% 是一項成本主張,而它背後的計算方式值得一看
每小時音訊成本降低 98%,這個數字遠比每個 token 價格降低 98% 要來得大,而這兩者之間的落差,正是這則公告發揮作用的地方。每小時的數字是這樣推算出來的:以兩分鐘的樣本計價,再乘以三十,影片則以720p、每秒一格取樣。這是引用生產工作負載的一種合理方式,同時也描述了模型被要求觀看的究竟是什麼:每秒一格足以知道說了什麼、螢幕上大致發生了什麼,卻遠遠不足以檢視逐格的運算、評判剪輯品質,或捕捉單一畫格的瑕疵。這裡其實是把兩項變動相乘——一項是實實在在的單價調降,另一項則是激進得多的取樣策略——而只有第一項算是模型的改進。
單價本身是明確具體的。國際定價的報價為每百萬個輸入 Token 0.15 美元、每百萬個快取輸入 Token 0.016 美元,以及每百萬個輸出 Token 0.47 美元。中國國內百鍊的定價則為每百萬 ¥0.8的多模態輸入,低於原本約 ¥18 的價格。請注意,國際與中國大陸的計費系統各自獨立,兩者的數字無法互通;直接拿來比較的人只會得到錯誤的答案。
這是本次發佈中,路由比平常更為關鍵的部分。OrcaRouter 以0% 加成將供應商的定價原價轉嫁,因此這類廠商降價在生效當天就能反映到我們的客戶身上,而不必等到下一次續約。我們的自家目錄中已經有一個確實可供驗證的比較:Qwen3.8-Flash,這款與其並肩打造的多模態模型,目前即可透過路由使用,價格為每百萬輸入 token 0.15 美元、每百萬輸出 0.47 美元——與阿里巴巴為這款全新 omni 模型所開出的定價相同——而截至本文撰寫前的七天內,它已透過我們的 API 承載了 24.7 億 token 的流量,這足以合理衡量該層級客戶目前已有多大的需求意願。這款 omni 模型本身尚未納入我們的目錄,在納入之前,它只在阿里巴巴自家平台上運行,別無其他。我們不會假裝不是如此。
這次發布中的每一項基準測試都只比較一件事
標題數字是平均提升 在約 30 項評測中超過 26%——而這每一項評測的比較對象都是 Qwen3.5-Omni-Plus。對一次產品發表而言,這是正確的基準,卻也是狹隘的基準:它只告訴你這個系列往前移動了,而沒有告訴你,相對於你可能早已付費使用的其他方案,它究竟落在什麼位置。
各項個別數據,皆為廠商自行提報:WildClawBench-MM 71.0,上升 36.5 分,是整組中幅度最大的一項;UniClawBench 69.6;AgenticVBench上升 22.3 分至 36.8;LongAudioSpan 82.7,上升 8.3;OmniVideoBench 63.4,上升 9.6;OmniCap-IF 28.2。最引人注目的是一組 AliMeeting 上的說話人分離(diarisation)數據,其錯誤率從88.11 降至 3.35,而 cpWER 則從89.61 降至 17.18——這樣的躍升幅度之大,值得審視而非掌聲。一篇針對此次發布的中文技術分析正是如此主張,認為這項進步在很大程度上應歸因於圍繞該模型的前端與說話人分離工程,而非模型自身的推理能力,並警告該系統讀來像是專精於聽覺,深度影片推理則相對較弱。這是評論者的解讀,並非經實測複現,但差距之大,正是值得記在心裡的理由。

另一個值得記住的數字根本不是分數。在 Alibaba 所謂的 Agentic Understanding 模式中,模型自行決定要看什麼、聽什麼,而不是處理每一幀,並以由粗到細的輪次收集證據。在 OmniVideoBench 上,該模式將準確率從 63.4 提升到 67.8,同時削減每次查詢的 token 數,從 145,736 到 79,117——減少了 45.7%。準確率上升與成本下降同時發生,是此次發布中最強而有力的主張,也是最直接支持 agentic 賣點的一點。
Gemini 的比較比涵蓋範圍所暗示的還要狹隘。
阿里巴巴的定位是,其音訊與視訊能力「接近」Gemini 3.8 Flash,而整體音訊表現則超越對方。撇開這些包裝不談,廠商自行報告的比較結果如下。WildClawBench-MM:71.0 對 58.9。SpotSoundBench:67.2 對 39.7。MMAU:81.8 對 76.9。DailyOmni:85.1 對 84.0。這些是音訊及以音訊為核心的工具使用上的真實差距。它們同樣是經過挑選的。在AgenticVBench這個純視訊推理榜單上,排名卻反了過來——Gemini 為 45.0,Qwen 為 36.8——而阿里巴巴自家的說法也承認,Gemini 在數項視訊理解測試中仍居領先。合理的總結是,Qwen 拿下了 omni 的音訊那一半,在視訊那一半仍落後,這與新聞標題所傳達的說法是兩回事。
「Qwen 首個全模態模型」需要一個限定語
今天廣泛流傳著一個說法:Qwen3.8-Omni-Flash是 Qwen 首個全模態模型,這事值得說個精確,因為這個系列早就有另一位成員同樣有資格冠上這個頭銜。Qwen2.5-Omni是 2025 年 3 月以 Thinker-Talker 架構發表的 7B 開放權重模型,同樣以文字、圖像、音訊與影片為輸入——而且它不只產生文字,還能生成語音。這裡真正首見的是原生全模態:一個建立在 Qwen3.8-Flash基礎之上的單一模型,而非外掛感知編碼器的文字 LLM,再加上代理優先的設計綱要。兩種說法都成立;只是被反覆傳述的只有其中一種。如果你在評估這個模型時,假設本週之前不存在任何 Qwen 全模態模型,你就會錯估從 Qwen2.5-Omni 升級的路徑,而這正是我們另行撰文比較的部分。
工具鏈才是代理式宣稱真正所在之處。
有兩項東西與模型一同發布,而它們的重要性遠超出模型卡所暗示的,因為正是它們把感知轉化為交付。Qwen-MM-Plugins是一套供代理框架使用的多模態外掛套件,讓外部代理具備影像、音訊、視訊與文件理解能力,外加長視訊記憶與影片剪輯;它宣稱支援 Codex、Claude Code、Qwen Code、Gemini CLI 及其他數種工具,並隨附多項具名工具,包括可將數小時影片化為圖文並茂 PDF 筆記的 Video2Note。Qwen-Live Harness是一套開源的執行環境,用於持續的即時全模態互動,扮演排程層的角色,讓使用者即時對話並把較繁重的工作交由背景代理處理。發布日報導中有一點須留意:Gigazine 查核時,Qwen-Live Harness 的 GitHub 頁面回傳 404,因此在各儲存庫能正常存取之前,這些工具應視為已宣布而非已驗證。
發表會所埋葬的那句話:它不說話
對於一個前代版本能夠生成語音的模型來說,Qwen3.8-Omni-Flash屬於「多模態輸入、文字輸出」這件事,是規格中最具關鍵影響的一行,而在相關資料中,它大致上卻只以註腳的形式出現。這意味著這個模型無法單靠自己就嵌進語音對語音的產品裡。任何以它為基礎打造的配音、語音代理或即時對話,都需要一個外部的文字轉語音階段,若涉及影片,還需要外部的渲染器——這正是外掛套件與即時測試框架存在的原因。實務上的後果是:整條管線的活動零件比「單一全方位模型」多得多,而延遲也必須在所有這些環節之間分配編列。
發布內容中藏著一個巧妙的示範,既展現了這道落差,也說明了這個模型的長處。在一項「模型優化模型」的實驗中,Qwen3.8-Omni-Flash 自主改善了Qwen2.5-Omni-3B的四川方言辨識能力,將字元錯誤率從25.79% 降至 15.30%,全程僅花十二小時,並透過四輪訓練建立起 3,413 個訓練樣本。一個能診斷並修復較小同類模型方言處理能力的模型,正在做轉錄 API 做不到的事。這一點,而非基準測試表,才是對「代理式」(agentic)在此應該代表什麼最清楚的論證。

什麼會改變我們的看法
老實說,目前的情況是:這是一次規格明確的發布,具備極具吸引力的價格論述,卻沒有獨立評估,而且至少有一項結構性限制,而公告對此刻意輕描淡寫。有三件事能讓此事塵埃落定。若能登上 Artificial Analysis 或 LMArena,就能把廠商數字變成可比較的數字,但目前還沒有任何一個。第三方對 45.7% token 縮減量的測試——也就是準確率上升而成本下降這項說法——將能證實此次發布中最實用、最不花俏的結果。而對 AliMeeting 語者分離的獨立量測,將顯示那 88 點的下降是屬於模型本身,還是屬於其周邊的流程。
在那之前,合理的態度就是對任何模型在第一天都適用的態度:值得測試,但不值得把正式生產流程押在它身上。如果你已經透過 OrcaRouter 進行路由,實際的做法就是讓工作負載繼續留在你已經實測過的模型上,並把Qwen3.8-Omni-Flash當作候選,用你自己的音訊與影片來試鏡,而不是拿兩家廠商的基準測試表來比較。如果你的使用情境是中文與英文的長篇會議或媒體分析,這裡的 token 經濟效益已經強到足以正當化現在就進行測試。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
