
Qwen3.8-Omni-Flash 上線五天:一道門、沒有權重,以及首批不是 Alibaba 的評分
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
在供應商向 API 客戶開放Qwen3.8-Omni-Flash的五天後,這款模型仍然只有一個落腳處。它運行於供應商自家的千問平台,以及其百鍊雲端服務上;自發布以來出現的第三方列表,只是位於這些相同端點前方的代理,而不是模型棲身的第二個地方。權重並未釋出。發布當日的數據——每小時音訊成本降低 98%、相較Qwen3.5-Omni-Plus平均提升 26%、一百萬個 token 的上下文、僅有文字輸出——仍然出自供應商自家,且未經重現。五天內真正改變的並非模型,而是它周遭的地面:一層薄薄的第三方評分已經出現,框架支援在第一天就到位,而大家爭相拿來對比的對象是Gemini 3.8 Flash,而非這款模型當初與之並肩打造的Qwen3.8-Flash。這當中的每一項,都值得比發布報導所給予的更仔細審視。
這扇門是一扇好門,而它是唯一的一扇。
可用性已經擴大,但並未變成多個供應來源。該模型會原樣回應 OpenAI 形式的請求,這表示現有的用戶端程式碼大多能運作;真正會出問題的是端點,因為國際主機與中國大陸主機是各自計費的獨立服務。指向預設端點的程式碼不是會失敗,就是以錯誤的幣別計費,而且每小時價格的說法只有在國際站才成立。開源用戶端函式庫在該模型推出首日就提供了支援,這確實很實用,但也不構成第二個供應商:能與 Bailian 溝通的函式庫,只是同一個單一供應來源的便利封裝。
這是值得點明的結構性風險。單一來源的模型沒有容錯移轉路徑。如果端點限流、效能衰退,或某個區域中斷,就無處可去,再多的用戶端函式庫支援也改變不了這一點。這也是我們選擇直白說明自身立場、而不是暗示其他可能的原因:Qwen3.8-Omni-Flash並不在我們的目錄中。我們並未託管它,若讀者註冊時期待能路由該模型,將會被誤導。可路由的是這個家族的其他成員——Qwen3.8-Flash與Qwen3.8-Max都已在我們的 API上線——而 OrcaRouter 以 0% 加成直接轉嫁供應商定價,因此當阿里巴巴的 omni 定價變動,或 omni 模型可供路由的那一天到來時,變更會當天送達客戶,而不是等到下一次合約續約。

第一批不屬於 Alibaba 的評分為數不多,而且並不怎麼好看。
在 Artificial Analysis 上,這個模型沒有任何資料,而這種缺席就是五天過去後最誠實的頭條:大家為相鄰模型引用的排行榜,還沒有為這個 omni 模型留下列。這個缺口已被其他東西填補。一個第三方評估平台已開始發布針對該模型的評測結果,而它的摘要值得一讀,正是因為它沒說的部分有多少。它回報電子郵件分類準確率 99.0%(第 86 百分位)、倫理 95.0%(第 23 百分位),以及推理 56.0%,並將其列在第 28 百分位,稱之為明顯弱點;速度落在第 21 百分位,成本在第 58 百分位,整體成功率為 89%。
對這些結果要非常謹慎,而且不只是因為樣本很小。同一個頁面將該模型的發布日期標為9月20日,比阿里巴巴實際推出晚了兩天,所有結果都沒有提供執行日期,還在摘要下方呈現出一個空白的基準測試表,而摘要描述的卻是表中並不存在的數字。這是早期、監督鬆散的測試框架的特徵,而非經過嚴謹衡量的評估;誠實的解讀是,這些是首批非廠商提供的數據點,而不是首批可靠的數據點。它們是你自己測試該模型的理由,而不是得出任何結論的理由。不過,這個方向與廠商自家資料以省略所暗示的內容一致:這是一個感知與長媒體模型,而那些偏重推理的榜單並不是它的目標所在。
搜尋結果裡也藏著一個陷阱,接下來幾週內會讓不少人上當。Qwen 3.8這款文字模型在 Artificial Analysis Intelligence Index 的分數落在四十幾,而這個數字已被不只一份摘要引用,彷彿它描述的是全模態模型。但事實並非如此。它們是不同模型,負責不同工作,而全模態模型目前根本還沒有任何指數。

這份基準測試表仍然只是同一家廠商自己跟自己比較
發布數據——在約三十項評估中平均提升超過 26%——完全是以 Qwen3.5-Omni-Plus 為基準測得的。這說明了這個系列確實有所推進,卻沒有說明這款模型相較於你可能早已付費使用的其他方案究竟位居何處,而隨之流傳的選擇性比較也同樣填補不了這個缺口。廠商所呈現、與 Gemini 3.8 Flash 對比的概況是:在音訊類榜單上確實勝出,在衡量代理式影片工作的榜單上則落敗——一邊是 WildClawBench-MM 71.0 對 58.9、SpotSoundBench 67.2 對 39.7,另一邊是 AgenticVBench 36.8 對 45.0、OmniGAIA 74.0 對 78.6。阿里巴巴自家的總結措辭——音視訊表現「接近」Gemini,整體音訊表現超越它——比它衍生出的那些標題更為審慎,而審慎的版本才是準確的版本。
• 上下文 — 1M token,最大輸入約 991K(思考模式約 983K),最大輸出 131K。
• 模態 — 輸入可為文字、圖像、音訊與影片;僅輸出文字。基礎模型不具備語音生成功能。
• 時長 — 每次通話可連續處理長達一小時的音訊或影音,這正是讓會議與長篇媒體作業無需分段切割也能進行的關鍵。
• 語言涵蓋範圍——發布資料中載明可辨識 74 種語言,加上 39 種中文方言;其他資料則針對語音輸入引用更廣泛的數字(113 種語言和方言)。
• 輸入細節 — 接受立體聲與四聲道空間音訊,其中 Realtime 版本被描述為首個能藉由聲音定位目標的全模態模型。
價格 — 國際方面每百萬輸入符元為 $0.15、快取 $0.016、輸出 $0.47,另有無法相提並論的獨立中國大陸價目表。
這 98% 是真的,而且那不是你的帳單。
以阿里巴巴自己的方法論——兩分鐘樣本乘以三十、影片以 720p 取樣且每秒一個影格——一小時音訊輸入從 $0.28 降到不到 $0.01,而一小時音訊加影片的合併輸入則從 $3.27 降到 $0.20。這些都是供應商回報、幅度大且具體的降幅,而且只是單一計費項目的降幅。真正重要的算術是:該計費項目占你工作負載多大比例。如果一條管線把大多數 token 花在輸出、快取上下文,或取樣密度高於每秒一個影格的影片畫面上,那麼帳單上看到的百分比降幅會遠小於標題所承諾的,而且那個標題講的是輸入音訊,不是總額。再加上純文字輸出,落差又會再次擴大:任何必須回話的東西都需要第二個模型,而那個模型是另行計費的。
這正是路由得以證明自身價值的一環。直通式路由器的價值不在於折扣——而在於你付的就是供應商自家的價目表,而且在於工作負載可以分散到多個模型上,讓單一來源的模型成為一個元件,而不是一項依賴。一個你唯一能呼叫的全能模型,在可用性與定價兩個層面上都是單點故障。

五天的製作實際上能告訴你什麼
有三件事能釐清這些懸而未決的問題。對 AliMeeting 語者分離(diarisation)結果的獨立量測——錯誤率從 88.11 降至 3.35,cpWER 從 89.61 降至 17.18——將能顯示這究竟應歸屬於模型本身,還是環繞其外的語者分離與前端工程,而至少有一份中文技術分析把大部分增益歸因於後者。重現代理模式的 token 縮減測試——在 OmniVideoBench 上準確率從 63.4 升至 67.8,而每次查詢的 token 數從 145,736 降至 79,117——將可證實此次發布中最有用的一項主張:該模型能同時變得更強且更便宜。而一筆 Artificial Analysis 或競技場(arena)的排名資料,將能把上述每一項廠商數字轉化為可相互比較的指標,這正是模型能被選用而非僅被試用的先決條件。
在那之前,合理的態度就是對任何一個推出僅五天、只有單一託管服務商、且尚無獨立評估的模型所該採取的態度:值得用你自己的音訊與影片來衡量,但不值得讓它成為你管線中唯一的必經路徑。如果你的工作負載是中文或英文的長篇會議或媒體分析,而成本主要來自輸入時數而非輸出 token,這裡的成本效益已足以值得你本週就做一次測試。如果你的工作負載需要語音輸出,或需要在供應商服務品質下降時有備援,那麼以這款模型今天的現況來說,它不可能成為完整解答——而且再多的首日框架支援也改變不了這點。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
