用於「Qwen3.8-Omni-Flash vs Qwen2.5-Omni」比較的主視覺標題卡,眉標為「相隔十八個月——2025年3月至2026年9月」,副標題為「三十倍的上下文,一小時的媒體內容而非幾秒——以及舊款模型能做、新款卻做不到的那一件事」,以及三個數據標籤,分別寫著「上下文:32K 到 1M」、「每次呼叫的媒體:從幾秒到 1 小時」和「語音輸出:僅限 2025 年模型」。
Guides & Insights

Qwen3.8-Omni-Flash 對比 Qwen2.5-Omni:時隔 18 個月,升級版卻失去了聲音

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

以下是讓這個比較比單純的世代更新更有趣的事實。較舊的模型能說話,較新的卻不能。Qwen2.5-Omni於 2025 年 3 月發布,接受文字、圖像、音訊與視訊作為輸入,並以文字回覆,或以串流自然語音回覆,全都在一個你可下載的單一端到端模型中完成。Qwen3.8-Omni-Flash於 2026 年 9 月 18 日發布,在大了三十倍的上下文窗口中處理同樣這四種模態,能吞下一小時的連續影音,而其前身只能處理幾秒,且僅回傳文字。十八個月的努力換來了大幅拓寬的輸入範圍,卻放棄了輸出通道。這究竟是進步還是取捨,完全取決於你過去用舊模型做什麼——而答案會乾淨俐落地一分為二。

的數據Qwen2.5-Omni來自廠商,出自其 2025 年 3 月的發布資料,而十八個月的廣泛部署已部分印證了這些數字。至於Qwen3.8-Omni-Flash的數據同樣出自阿里巴巴,來自本文撰寫前數小時才發布的上市資料,其中沒有任何內容經過獨立重現。凡是指控來自批評者而非廠商,都會如實標明出處。有一個無需驗證的結構性事實,同時也是最關鍵的一點:Qwen2.5-Omni是開放權重且可供下載的,而Qwen3.8-Omni-Flash則不是。

Qwen2.5-Omni 是什麼,以及它為何如此重要

當它於 2025 年 3 月 26 日推出時,Qwen2.5-Omni是該系列中首個端到端全模態模型——發布時將其定位為對「專才動物園」問題的解答,其中轉錄、視覺與語音各自都需要一個獨立模型和一層獨立黏合層。7B 模型處理全部四種輸入模態,以及文字與語音兩種輸出,宣稱在 OmniBench 融合基準測試上取得領先 Gemini-1.5-Pro 的最先進成果,並報告語音生成品質分數達 4.51,Alibaba 稱之為人類水準。3B 變體沿用相同架構。

讓它得以運作的工程設計值得點名,因為新模型並未採用它。Thinker-Talker把工作拆成兩部分:Thinker 轉換器融合了音訊與影像編碼器,並產生語意與文字,而 Talker 則從 Thinker 的隱藏狀態串流語音詞元,共享完整的對話歷史。時間對齊的多模態 RoPE(TMRoPE)交錯排列影片與音訊位置,讓這兩條串流保持同步。分塊串流讓編碼器負責感知,而語言模型處理長序列,這正是低延遲口語回覆得以實現的原因。它隨附了兩個固定聲音:Chelsie 與 Ethan。

這些限制同樣真實。上下文為 32,768 個 token。記憶體才是真正的限制所在,遠比運算資源更為關鍵:阿里巴巴自家的表格指出,15 秒的影片以 BF16 推論搭配 FlashAttention-2 約需 31GB 的 GPU 記憶體,30 秒需 42GB,整整一分鐘則需 60GB。一分鐘的影片,用 7B 模型,跑在你所能租到最大的單一 GPU 之一上。這個數字必須謹記在心,因為它正是 2026 年的模型被打造來摧毀的數字。

Qwen3.8-Omni-Flash 是什麼

這款新模型是原生全模態,而非拼裝而成——直接建構於Qwen3.8-Flash架構系列之上,而不是在文字 LLM 上外掛感知編碼器,這是結構性差異,而不只是世代標籤。它接受文字、圖像、音訊與視訊,包括立體聲與四聲道空間音訊,並在百萬詞元上下文中回傳文字,最大輸入約 991K、最大輸出 131K,推理預算為 262K。它可處理每次呼叫最多一小時的連續影音。語音辨識涵蓋 74 種語言,而 29 種語言的語音生成則由周邊工具處理,而非由模型本身負責。它可在千問 AI 平台與阿里雲百鍊上取得,ID 為qwen3-8-omni-flash,每百萬輸入詞元 0.15 美元、每百萬輸出 0.47 美元,快取輸入則為 0.016 美元。

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni - the scoreboard'. Left column Qwen3.8-Omni-Flash: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Weights API only, Hardware hosted endpoint. Right column Qwen2.5-Omni: Released 26 Mar 2025, Context 32,768 tokens, Media per call seconds and GPU-bound, Output text + streaming speech, Weights open and downloadable, Hardware roughly 60GB GPU for 60s of video. The footer reads 'Qwen2.5-Omni figures per Alibaba's March 2025 release materials; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

十八個月,一個維度接著一個維度

• 上下文 — Qwen2.5-Omni 為 32,768 個 token,對比 Qwen3.8-Omni-Flash 的一百萬,大約增加了三十倍。

• 媒體時長 — 影片秒數,受 GPU 記憶體限制,相較於單一託管通話中長達一小時的連續影音。

• 輸出 — 舊模型提供文字加上串流自然語音;新模型則僅提供文字。

• 部署 — Qwen2.5-Omni 為開放權重,採用 Apache-2.0 授權,可從 Hugging Face 與 ModelScope 下載;Qwen3.8-Omni-Flash 僅提供 API,未宣布釋出權重。

• 硬體 — 7B 參數,處理一分鐘影片最多需要約 60GB 的 GPU 記憶體,相較之下,託管端點則完全不需要你自行佈建。

• 價格——舊模型要你付出一顆 GPU 的代價;新模型每百萬輸入詞元只要 0.15 美元,而阿里巴巴聲稱每小時的音訊輸入成本,比它所取代的 Qwen3.5-Omni-Plus 世代便宜了 98%。

• 語音生成——2025 年僅有兩種固定語音,而 2026 年的工具則支援 29 種語言的語音生成,且這些全都不是由模型本身產生的。

無人宣傳的交易

把這兩份規格表放在一起讀,過去十八個月的整體形勢就清晰可見。阿里巴巴在這段期間都在解決吸納——一個模型能吸收多少媒體、成本多低,以及能自行做多少決定。Qwen3.8-Omni-Flash在這條軸線上是一大勝利。代理式理解模式讓模型自行選擇要取樣什麼,而非處理每一幀,將每次查詢的 token 數從 145,736 降到 79,117,同時把 OmniVideoBench 準確率從 63.4 提高到 67.8;供應商也報告 AliMeeting 上的語者分離錯誤率從 88.11 驟降到 3.35。

這段間隔期並未優先考量的是輸出。2025 年模型的招牌本領——單一模型能聽見你並出聲回答,端到端,無須另設語音合成器——在此並無後繼者。如果你曾基於 Qwen2.5-Omni 的 Talker 打造語音代理、配音流程或無障礙工具,2026 年模型並不是它的升級版;它是一個你得在其上外掛新文字轉語音階段的元件,為原本兩者皆無的流程增添延遲與一個供應商。若你仔細閱讀模態規格那行,發表資料對此是誠實的,但這並非標題重點;而任何抱持「omni 在兩個版本中意義相同」的假設而遷移的人,都會在正式環境中發現差異。

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

為什麼 2025 年的模型仍然有工作

三個理由,而且沒有一個是懷舊。第一個是聲音,如上所述。第二個是開放權重:32K 的上下文與 7B 的規模,能在你自己掌控的硬體上離線運行,資料不離開公司,也沒有按 token 計費的計量表——如果你的音訊受資料存放地規則約束,或延遲預算不允許往返傳輸,這是唯一的選擇。第三個是極低用量下的成本。你已經擁有的 GPU 在邊際上等於免費;託管模型每百萬 token 0.15 美元雖便宜,卻不是零,而對於每週只跑兩次的工作負載,為它預留資源的固定成本卻是真實存在的。

反駁論點在於,舊模型的限制每年都咬得更緊。一分鐘的影片、32K 的上下文,以及在代理人已成為預設部署形態的世界裡卻不支援工具呼叫或結構化輸出,是一個狹隘的範圍。對於必須匯入會議錄音的管線而言,Qwen3.8-Omni-Flash不僅僅是更好——而是可能與不可能之間的差別,因為 2025 年的模型在實體上根本無法容納該輸入。

值得具體談談這些舊權重還剩下多少生命力,因為「legacy」這個詞低估了它們。該Qwen2.5-Omni-7B儲存庫記錄了過去一個月 343,676 次下載——這是我們在 2026 年 9 月 18 日查看時的數字,而建構於其上的還有約一百個社群 Spaces,以及數十個微調版本、轉接器與量化模型。無論旗艦模型表現如何,仍有大批人持續以這款 2025 年的模型出貨;而且值得注意的是,Hugging Face 並未列出任何部署該模型的推論服務供應商,這意味著幾乎所有這些使用量都是自行架設的。

新模型改進了舊模型。

這次發布中最奇特、也最具說服力的細節,藏在資料接近尾聲的地方。在一項阿里巴巴形容為「模型優化模型」的實驗中,Qwen3.8-Omni-Flash自主提升了Qwen2.5-Omni-3B的四川話語音辨識能力——也就是它名義上將取代的那個模型的小型同門版本——將字元錯誤率從25.79% 降至 15.30%,全程只花了十二小時,並透過四輪建立起 3,413 個訓練樣本。

這是比此次發布中任何基準測試都更能支持較新模型的論點,也重新界定了兩者之間的關係。2026 年模型不僅是 2025 年模型的替代品;它還是一種能讓 2025 年權重變得更好的工具。若你在正式環境中運行 Qwen2.5-Omni,處理某個它表現不佳的語言或方言,實際可行的做法可能是保留現有部署,並用新模型來建立訓練資料,而非遷移工作負載。不過請注意,這是供應商自行報告的示範,並未公布方法論,應將其視為令人鼓舞的軼事,而非可重現的配方。

A screenshot of the Hugging Face model card for Qwen/Qwen2.5-Omni-7B (captured 18 September 2026), showing the Apache-2.0 licence tag, a 'Downloads last month' figure of 343,676, a Safetensors model size of 11B params, 100 Spaces using the model, 57 adapters, 67 finetunes and 24 quantisations, a note that the model is not deployed by any Inference Provider, and the model card text describing the Thinker-Talker architecture and TMRoPE position embedding.

如果您正在移轉

這項決定很少只取決於單一模型。一個準備離開自架全模態(omni)模型的團隊,實際上是在三種形態之間做選擇:留在開放權重上並繼續自行供應資源、轉向廠商 API 並交出控制權,或是把工作負載拆開,只讓需要百萬 token 輸入量的那部分交給託管模型。第三個選項通常才是對的,卻也正是大家最常跳過的,因為它聽起來比實際更費工——你花了一個月微調的方言模型,不必因為會議摘要這個環節搬了家就得整個丟掉。

路由真正能幫上忙的地方,在於接縫處。OrcaRouter 讓你用一把金鑰就能存取超過 200 個模型,供應商標價零加成,而且當端點效能下滑時會自動容錯移轉,這表示拆分式管線中由代管服務負責的那一半,在你還不知道這項工作負載是否值得投入這一切之前,不必先擁有自己的合約、自己的用戶端程式碼,以及自己的監控。說清楚我們不做什麼:兩個 omni 模型都不在我們的目錄中——兩者都跑在阿里巴巴的平台上,或你自己的硬體上——所以這是你繞著這些模型所做的路由決策,而不是透過我們來做的決策。

誰應該搬家,誰不應該

如果你的工作負載是長篇音訊或視訊、如果 32K 的上下文正是讓某條管線無法成立的原因、如果你需要對媒體進行代理式(agentic)行為,或者如果你面對的問題是大規模的語者分段(diarisation),那就轉移。如果你需要模型開口說話、如果你的音訊無法離開你的基礎架構、如果你依賴你已經調校過的特定 Qwen2.5-Omni 權重,或者你的呼叫量低到你自己擁有的 GPU 比按量計費更划算,那就留下。

令人不安的總結是,這與其說是替代品,不如說是產品線的一次分岔。Alibaba 花了十八個月打造出它能做到最好的輸入模型,卻沒有為輸出那一半打造後繼者。如果你的工作位於輸入端,這次升級幾乎是強制性的。如果位於輸出端,2025 年的模型仍舊是能滿足你需求的最新事物——而在你規劃一場會悄悄刪掉你所依賴能力的遷移之前,這點值得知道。