標題卡寫著「Qwen3.8-LiveTranslate vs Qwen 3.8」,副標題為「一場名稱衝突,而非公平對決」。
Guides & Insights

Qwen3.8-LiveTranslate 對上 Qwen 3.8:命名衝突,而非公平對決

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

搜尋其中一個模型,你就會看到另一個。Qwen3.8-LiveTranslate,於 2026 年 9 月 19 日發布,以及Qwen3.8-Max——大多數人在不帶後綴寫下「Qwen 3.8」時所指的模型,自 2026 年 8 月 3 日起正式推出,並於 9 月 2 日更新為 Qwen3.8-Max-0902——兩者共享同一個世代前綴,除此之外幾乎沒有共同點。一個是同步口譯系統,接收音訊輸入,並輸出翻譯後的音訊與文字,透過 WebSocket 計費,ID 為 qwen3.8-livetranslate-flash-realtime。另一個是擁有 2.4 兆參數的稀疏混合專家(MoE)通用模型,具備 100 萬個 token 的上下文視窗,卻完全聽不見任何聲音。把兩者拿來正面對決是範疇錯誤,而這麼多人會落入這個錯誤,正是這裡真正值得一談的故事:該供應商如今以 Qwen 3.8 之名推出至少四種截然不同的東西,而這套命名方式並不會告訴你該選哪一個。

每一個實際上是什麼

Qwen 3.8 世代在 2026 年下半年分層推出,而各層之間無法互換。

Qwen3.8-Max 是託管的旗艦模型:一款稀疏 MoE 模型,總參數量約 2.4 兆,每次前向傳遞約有 950 億個活躍參數,具備 100 萬個字符的上下文,並支援文字、圖像與影片輸入,僅輸出文字。其定價為每百萬輸入字符 $2.00、每百萬輸出字符 $6.00,快取讀取則為每百萬 $0.250。廠商回報的成績顯示,它在 Terminal-Bench 2.1 上為 86.6,在 GPQA Diamond 上為 92.6,在 SWE-bench Pro 上為 67.7,在 Humanity's Last Exam 上為 43.6。

Qwen3.8-2.4T-A95B是同一世代的開放權重版本,於 2026 年 8 月 12 日發布:橫跨 92 層的 512 個路由專家,其中 69 層採用線性注意力,權重約 4.89 TB。當人們談的是自己實際跑模型、而不是呼叫 API 時,多數人所說的「Qwen 3.8」指的就是這個模型。

Qwen3.8-27B是同一系列中的小型開放權重檢查點,而Qwen3.8-LiveTranslate則是專門版本——採用 Hybrid MoE Thinker–Talker 設計的 Interleave 架構口譯模型,可辨識 60 種源語言,並提供 29 種語言的語音輸出。

區隔它們的軸線不是規模,而是模態。Qwen3.8-Max 完全沒有音訊輸入路徑,也沒有任何音訊輸出。要求它解讀一場即時對話,並不是把提示詞寫得更好就能解決的事;這項能力根本不在這個模型裡。

規格對比

並排放在一起看,這兩款型號在買家關心的任何面向上幾乎毫無重疊:

主要用途 — Qwen3.8-LiveTranslate:同步語音對語音口譯。Qwen3.8-Max:通用推理、程式編寫、代理式任務與多模態文字作業。

輸入模態 — Qwen3.8-LiveTranslate:音訊與圖像。Qwen3.8-Max:文字、圖像與影片。

輸出模態 — Qwen3.8-LiveTranslate:文字與合成語音。Qwen3.8-Max:僅文字。

上下文視窗 — Qwen3.8-LiveTranslate:53,248 個詞元(輸入 49,152/輸出 4,096)。Qwen3.8-Max:1,000,000 個詞元。

權重 — Qwen3.8-LiveTranslate:封閉、僅提供 API。Qwen3.8-Max:託管,同代亦發布了開放同系列模型 Qwen3.8-2.4T-A95B。

速率限制 — Qwen3.8-LiveTranslate:每分鐘 10 次請求與 100,000 個權杖。Qwen3.8-Max:標準託管輸送量,無每請求即時上限。

上下文落差正是最令人訝異的地方。Qwen3.8-Max 擁有百萬個 token,而即時口譯模型只有其中約百分之五。但即時口譯並不需要長上下文——它需要的是又短又極快的記憶。它 49,152 個 token 的輸入上限,是為了把對話前幾分鐘的內容往後帶,以維持名稱與術語的一致,而這正是「長上下文消歧」所做的事。用上下文數字來評斷口譯模型,就像用油箱大小來評斷賽車引擎一樣。

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: primary job live interpretation, input audio plus image, output text plus audio, context 53,248 tokens, weights closed and API-only, audio in and out $7.50 and $30.00. Qwen3.8-Max column: primary job general reasoning, input text plus image plus video, output text only, context 1,000,000 tokens, weights hosted with the open sibling 2.4T-A95B, text in and out $2.00 and $6.00. Footer reads 'LiveTranslate per Alibaba Cloud; Qwen3.8-Max per OrcaRouter. Neither independently audited.'

為什麼價格比較是個陷阱

以每百萬個 token 為單位來看,這個口譯器比旗艦模型貴得多:每百萬個音訊輸入 token 為 7.50 美元,對比每百萬個文字輸入 token 的 2.00 美元;每百萬個音訊輸出為 30.00 美元,對比每百萬個文字輸出的 6.00 美元。

那個比較毫無意義,而且這是人們對這類模型最常犯的單一錯誤。音訊 token 與文字 token 並非同一種單位。語音會以某種密度編碼成音訊 token,而這個密度與相同內容寫成文字時毫無關係——一分鐘的對話所耗用的音訊 token,遠多於其逐字稿所耗用的文字 token,而且輸出音訊還在其上再加一道串流。把這兩種速率並排呈現,暗示了一種實務上並不存在的成本比例。

結構性差異比價格差異更重要。Qwen 是按 token 向口譯服務計費,而即時語音市場的很大一部分是按工作階段的分鐘數計費。當你的音訊變得更安靜、工作階段變得更短,或說話者停頓時,這兩種定價模式的行為完全不同——按分鐘計費的計量方式會為沉默收費,而按 token 計費的則不會。如果你正在建立成本模型,問題不在於哪個費率較低,而在於哪種計量方式會懲罰你的使用型態。並請注意地區差異:北京定價為每百萬音訊輸入 ¥40、圖像輸入 ¥3.3、文字輸出 ¥100、音訊輸出 ¥160,明顯低於新加坡費率,而這種差異只有在你逐項比較兩者時才會顯現。

在成本方面,還有一點對這個口譯工具有利:Qwen 讓這些費率相較於 Qwen3.5-LiveTranslate 大致持平,北京維持不變,新加坡則略為便宜。新一代產品問世卻沒有漲價,在這個市場中並非常態。

開放權重與純 API 之間,才是真正的分界線

如果你是在這兩者之間基於原則而非能力做選擇,那麼決定性的事實就是授權條款。

Qwen3.8-Max 提供託管版本,而這一代的 Max 級權重已於八月以 Qwen3.8-2.4T-A95B 之名開源。這條路確實存在,但並非隨手可走的途徑:4.89 TB 的權重屬於資料中心硬體,而開放權重授權條款要求過去十二個月內營收超過 5,000 萬美元的組織,必須向阿里雲取得商業授權。

Qwen3.8-LiveTranslate 沒有這種路徑。它是封閉權重且僅提供 API,可透過 WebSocket Realtime API 存取,而該 API 要求target_language必須在任何音訊開始傳輸之前,於session.update事件中設定;它不支援函式呼叫、不支援結構化輸出、不支援上下文快取、不支援批次推論,也不支援微調。如果你的需求是在自己的硬體上執行這套翻譯器,這個模型無法滿足此需求,而且再多的工程也無法改變這點。

這對某一類特定的買家來說很重要:就是無法將音訊傳送給第三方的那種買家——醫院、律師事務所、政府承包商。對其他所有人來說,實際的問題是這個口譯工具是否夠好到足以證明這種依賴關係是合理的,而這個問題的答案,是一項 Qwen 尚未允許任何人進行的衡量。

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint, the required target_language session parameter, and the published per-million-token rates.

依職務挑選,而非依名稱

「Qwen3.8-LiveTranslate 還是 Qwen 3.8」的正確答案是:你需要的答案,大概得換個問題才找得到。

• 如果任務是即時口譯——一場會議、一通電話、一場廣播——這些之中只有一個能做到,而且不是旗艦款。

• 如果任務是總結所說的內容、擷取待辦事項、回答關於逐字稿的問題,或撰寫後續追蹤——只有旗艦版能做到,而且它不是口譯員。

• 如果這項工作兩者兼具,你就是在建立一條管道,而且除非你刻意整合,否則你將要付錢給兩家供應商,還得應付兩份合約和兩套憑證。

第三種情況最為常見,而正是在這裡,把兩半都放在單一端點後方執行,不再只是圖個方便,而是開始成為一種架構。Qwen3.8-Max 在 OrcaRouter 上以供應商定價提供,每百萬輸入權杖 $2.00、每百萬輸出權杖 $6.00,並零加價直接轉嫁,因此 Qwen 一旦降價,當天就會反映在你的帳單上,而不是等到下一次合約續約;自動容錯移轉也意味著當某家供應商出了狀況的那一個小時,這條管線中負責摘要的那一半不會就此停擺。

為了把另一半說明白,因為這個區別很重要:Qwen3.8-LiveTranslate 並不在我們的目錄中。它可透過 Alibaba 自家的 Model Studio API,以及供應商在 omni.qwen.ai/live-translate 的試用端點取得;而我們不會暗示我們會路由一個我們並未提供的模型。你今天能用單一金鑰接上的,是下游堆疊——也就是取用該口譯器產出內容的那些模型。

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

命名問題本身就是真正的發現

四個模型、一個前綴,卻沒有讀者能仰賴的後綴慣例。「Qwen 3.8」究竟指向託管的旗艦模型、開源的 2.4T 檢查點、27B 小模型,還是即時翻譯器,取決於輸入的人是誰、以及他上一次讀到的是什麼。已發表的基準測試表也幫不上忙,因為旗艦模型有這些數據,翻譯器大多沒有:Qwen3.8-Max 可以放上 Terminal-Bench 或 GPQA Diamond 的位置,而 Qwen3.8-LiveTranslate 的佐證則是平均延遲 2.3 秒、廠商自行報告在 FLEURS 上的 85.7 xCOMET-XXL,以及自行報告的 9.7% 語者分離錯誤率,且沒有獨立重現。

所以,這個頁面存在是為了回答的那個比較,其實是一則警告。在你把 Qwen 3.8 與任何東西比較之前,先確定你指的是哪一個 Qwen 3.8。如果它接收音訊,它就是口譯器,是你為了一項工作而買的專才。如果它接收視訊,它就是旗艦,是你為了另外二十項工作而買的通才。任何把它們混為一談的評估,產出的結論都不會是針對其中任何一個。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新