Gemini 3.8 Live 對上 GLM-4-Voice 的主視覺標題卡,引題為「OrcaRouter · model radar — head to head」,副標題為「21 個月的語音 AI 發展,究竟換來了什麼。」兩張卡片分別寫著「Gemini 3.8 Live — 2026 年 9 月,託管式、工具、97 種語言」與「GLM-4-Voice — 2024 年 12 月,開放權重、9B、中文與英文」,並附上「相隔 21 個月」、「Apache-2.0 程式碼」與「自訂權重授權」的標籤。OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 3.8 Live 對決 GLM-4-Voice:語音 AI 的 21 個月究竟換來了什麼

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

GLM-4-Voice於 2024 年 12 月 3 日推出。Gemini 3.8 Live則於 2026 年 9 月 15 日發表。這中間相隔 21 個月,而這是這項比較中最重要的一項事實——比任何基準測試都更重要,因為它決定了你實際上問的是什麼樣的問題。

這兩個模型並非競爭對手。在 2026 年大規模部署語音的人,沒有人是根據品質在兩者之間做選擇。真正的問題,是 GLM-4-Voice 提出、而 Gemini 3.8 Live 無法回答的那個問題:要擁有這項技術,而不是租用它,需要付出什麼代價?這個問題有一個真實的答案,而且它在 21 個月內的變化,比你想像的還要小。

Google 發布了什麼,以及智譜發布了什麼

Gemini 3.8 Live是一款代管、封閉權重的即時對話模型。它能處理近乎即時的視覺輸入,在對話過程中自動偵測並切換 97 種支援的語言,並在對話持續進行的同時於背景執行工具與 API 呼叫。開發人員可透過 Gemini API 和 Google AI Studio 使用,並在 Gemini Enterprise 中提供非公開預覽,以及在 Search Live 中提供。公布的定價為音訊輸入每分鐘 $0.005、音訊輸出每分鐘 $0.018(透過 Live API);Artificial Analysis 的每小時輸入音訊成本圖表獨立估算其為每小時 $1.50。其同系列產品 Gemini 3.8 Live Extended Thinking 目前以 82.6 位居同一指數榜首,而 Gemini 3.8 Live 本身則為 76.0。

GLM-4-Voice是智譜AI首個端到端語音模型,而且是一個可下載的檢查點。它由三部分組成:一個以Whisper-large-v3編碼器為基礎、在約4億參數處設有向量量化瓶頸的語音分詞器;一個自迴歸語言模型(GLM-4-Voice-9B,從GLM-4-9B初始化),約有90億參數;以及一個從CosyVoice重新訓練的流匹配解碼器。它能說中文和英文,支援指令控制的情緒、語氣、語速與方言——包括粵語、重慶普通話、北京話等——並以12.5 Hz將語音標記化為單一碼本串流,速率約175 bps,比典型的神經音訊編解碼器低了一個數量級。

尺寸並排對照:

• 發布 — Gemini 3.8 Live:2026年9月15日。GLM-4-Voice:2024年12月3日。

• 權重—— 封閉、僅提供託管服務 vs 可下載,Apache-2.0 程式碼搭配自訂權重授權條款。

• 語言 — 97 種支援對話中切換,相較於中文與英文。

• 視覺 — 近乎即時的視覺輸入 vs 無。

• 工具呼叫 — 對話中途的背景工具與 API 執行,對比完全沒有工具通道。

• 上下文— Google 未公佈,對比 8K 上下文、4K 最大輸出。

• 自架設最低門檻 — 不適用;官方需求為 32 GB RAM 加上一張 CUDA GPU;在 int4 下約需 12 GB VRAM。

• 浮水印 — 所有生成的音訊皆套用 SynthID,相較之下未提及任何相關描述。

A two-column scoreboard comparing Gemini 3.8 Live and GLM-4-Voice. Released Sep 15 2026 vs Dec 3 2024; weights closed and hosted vs open with a custom licence; languages 97 vs Chinese and English; tool calling background execution vs none; self-host floor not applicable vs 32 GB RAM plus a GPU or about 12 GB VRAM at int4; cost $1.50 per hour of input audio vs no per-minute bill. Footer reads 'GLM-4-Voice VoiceBench and UTMOS figures self-reported or third-party, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

21 個月換來的是能力,不只是品質

最簡單的說法是,2026 年的前沿模型勝過 2024 年的開放檢查點。確實如此,而且差距很大——但更有用的觀察是,這個類別改變了形態,而不是沿著單一軸線移動。

在智譜自家的技術報告中,GLM-4-Voice 在 Topic-StoryCloze 上取得 93.6% 的語音轉文字準確率、82.9% 的語音轉語音表現,UTMOS 自然度為 4.45,語音問答則是一般項目 5.40/10、知識項目 5.20/10——全數為自行提報且未經重現。獨立評測則更為稀少,且評價不那麼好看:在 VoiceBench 上,它錄得總體 56.48,在一份統計中約排在 42 個中的第 29 位,在另一份中則是 40 個中的第 30 位,且多輪理解在兩種語言中都被描述為偏弱。在 C³ 多輪對話理解基準上,它的中文成績為 11.09%,英文為 33.22%。VCB Bench 發現它在情緒控制上領先,中文 SIF 子指標達 93.0,文字—語音對齊也表現強勁,但在 TELEVAL 中,若無明確指令,方言處理僅有 4.57%。

那些數字描述的,是一個擅長聲音表達、卻不擅長持續理解的模型。這就是 2024 年語音模型的一句話總結。

Gemini 3.8 Live 在 Artificial Analysis 的 Speech to Speech Index 上拿下的 76.0,是一項涵蓋語音推理、代理能力表現、競技場偏好與任務成功率的綜合分數。這並不是說新模型在同一項任務上以更大的倍數勝出,而是這項綜合指標如今終於納入了代理能力表現與任務成功——這些是 GLM-4-Voice 無法參與競爭的類別,因為它沒有工具通道。這款 2024 年的模型,正被拿來在一場它從未被打造來玩的遊戲中評分。

Screenshot of the OrcaRouter models catalogue, showing hosted models listed with provider names and per-million-token pricing behind a single API key.

授權條款是大家會略過的部分。

如果你正因為 GLM-4-Voice 是開放的而關注它,請在權重下載完成之前先閱讀條款。這個落差是真實的,而且很容易誤讀:

• 程式碼 — Apache-2.0。確實寬鬆。

• 權重 — 一種自訂授權條款,要求商業使用時須註明出處並向 Zhipu 註冊。

「開放權重」與「Apache-2.0」並非同一種主張,而許多關於這個模型的二手報導把兩者混為一談。如果你打算以 GLM-4-Voice 推出商業產品,註冊要求是一項法律步驟,而不是形式手續,且應列入關鍵路徑。有一份追蹤報告更進一步,將該模型描述為專有,並附帶條件式商業使用。無論如何,沒有按分鐘計費的帳單,並不等於沒有商業關係。

成本算術,誠實計算

自架的理由在於:用量大時,固定月費勝過按分鐘計費。這個理由確實成立,但一旦把你實際要營運的東西算進去,它就比表面上看起來更小。

GLM-4-Voice 官方要求 32 GB 的記憶體,以及一張 CUDA GPU。社群推出的 int4 量化版本大約可在 12 GB 的 VRAM 中運行,實務上約 10–11 GB,屬於 RTX 3060 的範疇,而每一輪的語音長度實際上限約為 30 秒。雲端的 A10 每小時約 0.50–1.00 美元,換算下來,若執行個體持續運行,每月大約介於 350 至 700 美元之間——而這還是在你服務任何一位使用者之前,而且沒有容錯移轉、沒有突發容量,凌晨三點解碼器產生雜訊時,也沒有人會收到通知。

相較之下,Gemini 3.8 Live 以每小時輸入音訊 $1.50 計算,意味著 $350 大約能買到 233 小時的語音。這顯然並不更差,而且還附帶了你未預先配置的容量。交叉點確實存在;它比表面上的比較所暗示的更高,而且會隨著你的流量是穩定或突發而移動。突發流量正是按分鐘計價決定性勝出的情況,因為閒置的 GPU 計費與忙碌的 GPU 完全相同。

花同樣的錢,你能得到的東西也有差異。社群對量化版 GLM-4-Voice 部署的報告指出,連續對話延遲為 38–120 毫秒,不過這些數字來自第三方文章,而非智譜。Google 完全沒有公布 Gemini 3.8 Live 的延遲數據。如果低延遲是你的硬性要求,這兩者都沒有可供你據以規劃的數字——一個有第三方社群的實測數據,另一個只有合作夥伴的見證,而沒有任何數字。

Screenshot of Google's official blog post titled 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated Sep 15, 2026 and credited to Tom Ouyang and Malini Jaganathan of the Gemini Audio Team, with the summary describing the models as Google's most advanced live dialogue models with major upgrades in intelligence and parallel reasoning.

中間選項:掌握邏輯,租用能力

把這說成是自架與託管之爭,忽略了大多數團隊實際上最終採用的安排。GLM-4-Voice 沒有工具通道,因此任何以它為基礎打造的產品都需要一個獨立的文字模型來負責查詢——這表示,自架的語音模型無論如何都會位在託管文字模型的前面。部署決策與能力決策是可以分開的。

這個分界點正是路由器真正發揮作用的地方。OrcaRouter 在單一金鑰後方承載190 個模型,以供應商定價提供且不加價,因此你語音前端後方的委派目標可以在實際流量中隨時替換,無須重建任何東西,而上游降價也能在同一天反映到你這裡,而不是等到下一次續約。自動容錯移轉在自架環境中比平常更為重要,因為當出問題的是你自己的 GPU 執行個體時,後端模型仍然可以連線,工作階段也不必跟著一起中斷。兩點澄清,因為這項比較容易引起混淆:我們不代管 GLM-4-Voice,而 Gemini 3.8 Live 端點也不在我們的路由器上——那些是由其供應商提供的。路由器上提供的是這兩者都會把工作交派過去的文字層。

這項決定,以及其背後的教訓

選擇GLM-4-Voice的時機如下:你需要在自己的硬體上運行這個模型、你的流量確實穩定且量大、你只以中文或英文開發,而且你需要修改模型而非只是呼叫它。請把授權註冊當成一項真正的工作來規劃時間,並且預期你得自行解決多輪理解的問題——這是該模型有文獻記載的弱點,而無論再怎麼針對 4K 輸出上限進行微調,都無法完全掩蓋這一點。

選擇 Gemini 3.8 Live如果您的需求包括視覺、工具呼叫、超過兩種語言,或任何您會形容為突發尖峰的流量模式,就選它。這是一個預覽模型,其上下文與延遲數據尚未公布,這是真實的規劃風險,但它也是兩者之中唯一能在句子中途查詢資料的模型。

這個普遍的教訓比任何一方的判決都更有價值。二十一個月的語音 AI 發展,催生出的模型主要並非更好的語音模型——而是接入代理的語音介面。如果你想要開放權重的原因是成本,那麼這筆帳比「免授權」的說法所暗示的更接近。如果你的原因是控制權,那這一點根本尚未被商品化,而 GLM-4-Voice 依然是某個 Gemini 3.8 Live 並未觸及的問題的正當答案。