為文章〈Gemini 3.8 Live vs ElevenLabs〉生成的主視覺卡片,標題兩側各有一張圓角卡片。左側卡片在雲朵與波形圖示上方寫著「Gemini 3.8 Live」,下方一行寫著「語音轉語音,一次處理,按分鐘計費」;右側卡片在標示「STT - LLM - TTS」的三段式管線圖示上方寫著「ElevenLabs Agents」,下方一行寫著「組裝而成,按代理分鐘計費」。副標題寫著「你租用的元件 vs 會租用元件的系統」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 3.8 Live 對上 ElevenLabs:模型對決管線

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

打開 ElevenLabs 代理平台的文件,就會看到中間放著一個 Gemini 模型。ElevenLabs Agents 是一套串接式架構——前端是語音辨識、中間是語言模型、後端是文字轉語音——而官方公布架構中的語言模型就是 Gemini 的。這正是展開 Gemini 3.8 Live 與 ElevenLabs 比較的恰當起點,因為被拿來比較的這兩者並不是同一類物件。Gemini 3.8 Live是語音轉語音模型,於 2026 年 9 月 15 日在 Live API 上推出,以每分鐘音訊計價。ElevenLabs Eleven v3是語音平台的旗艦合成模型,該平台同時也販售 ElevenLabs Agents,而它是以每個字元計價,不是按對話計價。一個是你可租用的元件。另一個則是會租用元件的系統——至少在一種公布的配置中,它租用的元件之一正是 Gemini 模型。

這種不對稱性解決了人們在比較這兩者時真正提出的大多數問題。如果你問的是該選哪一個,誠實的答案是:它們並不是替代品——一個是有價目表、沒有電話通訊功能的模型,另一個是有電話通訊功能、併發限制,且同時有三個計量器在運轉的產品。哪一個更便宜、更好或更快,完全取決於你的應用程式原本已經是哪一種形態。

一個模型,或依序三個模型

Gemini 3.8 Live 是原生語音對語音的系統。音訊進、音訊出,而推理就發生在產生語音的同一次前向傳遞中——一個模型、一份延遲預算、一張帳單。Google 於 2026 年 9 月 15 日推出兩種版本:gemini-3.8-live適用於大規模的對話式作業,以及 gemini-3.8-live-extended-thinking提供相同介面,但背後具備多步驟推理能力。兩者都支援 97 種語言並可在對話途中切換,兩者都能近乎即時地處理視覺輸入,兩者都能在對話持續進行的同時於背景執行工具與 API 呼叫,且兩者都會以 SynthID 為每一秒生成的音訊加上浮水印。公布的費率為每分鐘音訊輸入 $0.005、每分鐘音訊輸出 $0.018。

ElevenLabs Agents 並不是那樣。它是一條管線,而這條管線本身就是產品。即時語音辨識模型負責將來電者的話轉成文字,語言模型決定要說什麼,而合成模型——在 ElevenLabs 文件所述的配置中為 Eleven Flash v2——則說出答案。每個階段分別計量計費,每個階段都可以替換,而整個架構位於一個受管理的層之後,由該層處理電話通訊、對話輪替偵測與並行處理。ElevenLabs 的旗艦合成模型 Eleven v3 又是另一款不同的產品:一款每百萬字元定價 100 美元的文字轉語音模型,銷售用途是旁白、配音和聲音設計,而非用來進行對話。

所以,首先要弄清楚的是,「Gemini 3.8 Live vs ElevenLabs Eleven v3」並不是兩個語音模型之間的正面對決。Eleven v3 不接受音訊輸入,也不進行對話。真正有意義的比較,是 Gemini 3.8 Live 對上 ElevenLabs Agents,而 Eleven v3 在其中只是作為該平台所圍繞打造的合成品質上限。

每一個實際上在棋盤上所在的位置

沒有任何排行榜將這兩者相互排名,而箇中原因頗具啟發性:它們總是出現在衡量不同事物的不同排行榜上。

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

在 Artificial Analysis 的語音對語音指數(Speech to Speech Index)上——該指數將語音推理、代理式任務完成、競技場偏好與任務成功率融合成單一數字——Gemini 3.8 Live 得分 76.0,而 Extended Thinking 變體以 82.6 位居第一。這些是 Artificial Analysis 在其自家測試框架下所做的測量,並非 Google 公布的數字,儘管 Google 自家的公告也引用了來自相同組成項目的數據。

ElevenLabs 完全沒有出現在那個排行榜上,因為它並未推出可供測量的語音轉語音模型。它真正現身的地方是 Speech Agent Arena,那裡評估的是組裝而成的代理,而非模型本身,而該處的情況確實好壞參半:ElevenLabs Agents 的實測成績為 937 Elo,任務成功率為 90.5%,相較之下,以先前一代 Gemini Live 為基礎所建構的代理則為 1,046 Elo、任務成功率 74.6%,且該 Gemini 代理能在 0.96 秒內輸出第一個音訊。仔細看這兩組數字。以 Gemini 為後端的代理在偏好度與速度上勝出;ElevenLabs 代理則在完成任務上勝出。這是一個串接式架構在可靠性上擊敗原生模型,而這並不是架構圖會預測出的結果。

關於那些數字有兩點但書,而兩者都很重要。該項比較中的 Gemini 一方採用的是 2026 年初的 Gemini Live 世代,而非 3.8 Live,因此這並不是針對本文所探討之模型的評讀。而場上第三個榜單——Artificial Analysis 的 Provider Voices 語音競技場,其排名對象為語音合成模型——將ElevenLabs Eleven v3 列於 1,177 Elo,而對話變體ElevenLabs v3 Conversational 則為 1,219 Elo,對照之下,領先者 Cartesia Sonic 3.6 為 1,283。該榜單衡量的是語音聽起來有多好,而非代理運作得有多好,而把兩者混為一談,正是人們最終拿語音合成分數當作對話系統佐證的緣由。

規格對比

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• 架構 — Gemini 3.8 Live 是單一原生語音轉語音模型,而 ElevenLabs Agents 則是語音辨識、語言模型與語音合成的串接組合

• 輸入與輸出 — Gemini 3.8 Live 接收音訊並以單一流程直接回傳音訊,而 ElevenLabs 則透過 Scribe v2 Realtime 接收音訊,再經由 Eleven Flash v2 回傳,中間還夾著一份文字轉錄稿

• 你能替換什麼 —— Gemini 3.8 Live 什麼都不能替換,模型就是模型;相較之下,ElevenLabs 的每個階段都能獨立替換,包括語言模型,而在文件所述的技術堆疊中,該語言模型是 Google 的

• 語言 — Gemini 3.8 Live 97,具備對話中途切換功能,對比 ElevenLabs Eleven v3 74

• 音訊定價 — Gemini 3.8 Live 每分鐘輸入 $0.005、每分鐘輸出 $0.018,對比 ElevenLabs 以代理分鐘計價,語言模型 token 則另行計量並額外收費

• 電話語音 — Gemini 3.8 Live 無第一方,你自備電信業者與工作階段管理;對比 ElevenLabs 代管、第一方

• 並行量 — Gemini 3.8 Live 取決於你的 Live API 配額允許多少,對比 ElevenLabs 以並行層級計價販售

• 代理工具 — Gemini 3.8 Live 的背景工具與模型內部的 API 執行,對比 ElevenLabs 具備輪次偵測、工作流程與語音庫的受管代理層

• 開放式產物——兩者皆非。兩者都是封閉、僅限雲端且專有的

• 延遲 —— 標準模型下,Gemini 3.8 Live 首次輸出音訊為 1.18 秒,Extended Thinking 則為 1.35 秒;根據 Artificial Analysis 的資料,相較之下 ElevenLabs 並未以單一數字公布,因為串聯式架構的延遲是三階段相加的總和

最後一列最能解釋架構選擇,勝過其他任何一列。原生模型只有一個延遲預算。串接式架構則有三個,而團隊仍然選擇串接式架構的原因,就在於它上方的所有一切:可以記錄的逐字稿、可以替換的階段,以及直接就能用的電話號碼。

一分鐘的代價,雙向皆是

Gemini 3.8 Live 的算術格外簡單,因為只有一個計費單位。一分鐘的對話大約是一分鐘的來電者音訊加上一分鐘的模型音訊:$0.005 加上 $0.018,因此按公布費率計算約為每分鐘 2.3 美分。Artificial Analysis 的每小時成本欄位會把完成一組固定音訊推理題目的成本標準化為每小時數字,據此標準模型為每小時輸入音訊 $0.84——是該榜單上最便宜的付費費率——而 Extended Thinking 變體則為 $3.50。

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

ElevenLabs 的算式更複雜,而這正是重點所在,而非批評。一個代理分鐘並不是單一價格:其中有代理分鐘本身的平台費用、中間環節所消耗的語言模型 token,以及底層的電信業者分鐘數──三種計量方式,最壞情況下是三家供應商,而且只要其中任何一方變動,帳單就會跟著變動。合成端則較為清楚易懂:ElevenLabs Eleven v3 每百萬字元收費 100 美元,在一般語速下約等於每小時 8 美元的連續旁白,而同一競技場上最便宜的同級開源權重競爭者約為 2.70 美元。ElevenLabs 為其語音收取溢價,而在那個排行榜上,這個溢價是真實的──它整體排名第四。

兩種成本結構在實務上意味著,Gemini 3.8 Live 每分鐘對話成本較低,每小時音訊成本更是低得多,而 ElevenLabs 則較昂貴,但營運上的可預測性高得多。一個沒有機器學習工程師、卻得開通一支電話號碼的團隊,第一個月在 ElevenLabs 上的花費會較少,因為替代方案是自行打造 ElevenLabs 早已打造好的東西。一個已經自行運行工作階段管理與自家電信業者的團隊,則會在原始模型上花費較少,因為他們不必為自己已經擁有的管線付費。

ElevenLabs 真正更擅長什麼?

人們很容易把價格差距解讀成一種定論。但它並不是,而背後的原因,正是價目表永遠不會顯示的那些。

• 電信。ElevenLabs 販售電話號碼、SIP 中繼,以及接聽來電所需的並行處理能力。Google 販售的是一個會說話的模型。如果你的產品是一條電話線,這兩句話之間的落差,就是好幾個月的工程。

• 聲音身分。語音庫、聲音複製流程與配音工作室是成熟的產品介面。Gemini 3.8 Live 給你一個模型;它不會給你授權語音的型錄,也不會提供將現有錄音本地化成九種語言的工作流程。

• 預設就會有一份逐字稿。由於串接式系統會先轉錄再推理,你就能免費取得每通通話的文字紀錄——這對法規遵循、評估,以及找出代理為何出錯這種不起眼的工作很有用。原生語音轉語音模型則沒有這類產物,除非你自己打造一個。

• 可替換的元件。當更好的語言模型推出時,ElevenLabs 串聯架構不必重新訓練任何東西就能採用它。這正是為什麼有文件記載的技術堆疊會在中間採用 Google 模型——而這也是支持串聯架構最強而有力的單一論據。

原始模型能為你帶來什麼

反駁的重點不在於價格,而在於單次前向傳遞能做到三階段做不到的事。

Gemini 3.8 Live 直接聽見韻律、語調和猶豫,而不是透過一份早已把這些丟棄的逐字稿,這就是為什麼它能在句子中途切換語言,也是為什麼它的對話動態分數——標準模型為 96.1%,根據 Artificial Analysis——是它勝過自家以推理見長的同門模型的那個環節。它還能在持續說話的同時於背景執行工具和 API 呼叫,因此查詢不會造成冷場。而 Extended Thinking 版本是真正不同的能力,而非同一種能力的放大版:它在 τ-Voice 客服情境中解決了 68.6%,標準模型則為 30.1%,這 38 個百分點的差距是此次發布中最大的單一數字,也是 Google 將產品線一分為二的原因。

如果你的代理的工作是完成多步驟任務,而不是進行愉快的對話,那麼那 38 分的差距就是整個決策的關鍵,而且它每小時要花 3.50 美元,而不是 0.84 美元——仍低於它在該排行榜上擊敗的每一個模型。

中間那條腿才是你真正能移動的。

這裡有一個值得點名的接縫,因為正是這裡,架構問題會變成採購問題。在串接式架構中,中間那一段——負責決定要說什麼、呼叫工具,以及進行推理的部分——只是普通的文字推論。它也是最具有成本變異、最容易造成鎖定,且最沒有理由被綁定到任何單一供應商的一段。ElevenLabs 文件所述的技術堆疊恰好在那裡使用了 Gemini 模型。但它不一定非得如此。

OrcaRouter 涵蓋的是那一段,而不是外圍的那兩段。我們不託管 Gemini 3.8 Live 語音端點——那些來自 Google 自家的 Live API——我們也不託管 ElevenLabs,其語音合成與代理層是它自己的產品。我們承載的是底下的文字層:200 多個模型,只需一組金鑰,以供應商定價提供、不加任何加成,因此上游實驗室的降價當天就會反映到你的帳單上,而不是等到下一次續約。就語音堆疊而言,其中三項特性特別能發揮價值。自動容錯切換能在後端出錯或在一句話說到一半時逾時的情況下讓通話維持不中斷,而這正是來電者會立刻察覺的故障。路由 DSL 可將多個模型組成單一次呼叫,因此便宜的模型可以處理確認回應的輪次,較強的模型則負責實際交易。而模型融合則讓一組模型在單一模型的判斷不足以獨自採信的輪次上共同作答。要更換串接架構中間的模型,只需變更設定,而不是重新建置——這正是串接架構存在的全部理由。

該選哪一個

如果你要上線電話線路,又不想自己建構語音技術堆疊,就選 ElevenLabs。你買到的是電信功能、語音目錄、逐字稿、並行處理能力和支援合約,而每分鐘的溢價正是這些東西的代價。你還買到中途更換模型、其他一切都不用改的能力,這比聽起來更有價值。

如果你已經在經營某項產品或服務,而語音只是其中一項功能,那就選 Gemini 3.8 Live。你能取得目前市面上公開的最低價、且表現稱職的語音對語音費率,支援 97 種語言並可在對話中途切換,工具執行能在模型持續說話時同步進行,而且——如果你的代理必須完成任務,而不只是對話——Extended Thinking 版本能以約四倍的每小時音訊成本,換來 38 分的代理能力差距。電信業者、工作階段生命週期與日誌,則由你自行提供。

值得關注的是:ElevenLabs 是否會為代管代理的每一分鐘公布單一延遲數字,因為那才是能讓這項比較從結構性轉為量化的數據;以及當以 3.8 Live 打造的代理在 Speech Agent Arena 上受測時,該結果是否依然成立,因為串接式方案目前在任務成功率上勝過原生模型,是這場對決中最有趣卻也最缺乏解釋的一點。