为文章《Gemini 3.8 Live vs ElevenLabs》生成的一张主视觉卡片,展示了标题两侧各有一张圆角卡片。左侧卡片在云朵与波形图标上方显示“Gemini 3.8 Live”,并有一行文字“语音到语音,单次通过,每分钟”;右侧卡片在标有“STT - LLM - TTS”的三段式流水线图标上方显示“ElevenLabs Agents”,并有一行文字“组装而成,按每个代理分钟”。副标题为“一个你租用的组件 vs 一个租用组件的系统”。OrcaRouter 标志合成在右下角。
Guides & Insights

Gemini 3.8 Live 对决 ElevenLabs:一个模型对抗一条流水线

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

打开 ElevenLabs 智能体平台的文档,你会发现中间赫然坐着一个 Gemini 模型。ElevenLabs Agents 是一条级联链路——语音识别前端、语言模型、文本转语音后端——而公开技术栈中所用的语言模型正是一个 Gemini 模型。这正是开启 Gemini 3.8 Live 与 ElevenLabs 对比的恰当起点,因为被比较的两者并非同一类事物。Gemini 3.8 Live是语音到语音模型,于 2026 年 9 月 15 日在 Live API 上线,按音频分钟数计费。ElevenLabs Eleven v3是语音平台 ElevenLabs 的旗舰合成模型,该平台同时也销售 ElevenLabs Agents,它按字符计费,而非按对话计费。一个是你可以租用的组件,另一个则是租用组件的系统——至少在一种公开配置中,它租用的正是一个 Gemini 模型的组件。

这种不对称性解决了人们在这个对比中实际提出的大部分问题。如果你问的是该调用哪一个,诚实的答案是它们并非替代品:一个是带有价目表、没有电话功能的模型,另一个是具备电话功能、并发限制以及三个同时运转的计量表的产品。哪一个更便宜、更好或更快,完全取决于你的应用已经属于这两种形态中的哪一种。

一个模型,或依次三个模型

Gemini 3.8 Live 是一个原生语音到语音系统。音频输入,音频输出,而推理过程就发生在生成语音的同一次前向传播中——一个模型、一份延迟预算、一张账单。Google 于 2026 年 9 月 15 日推出了它的两个版本:gemini-3.8-live 用于大规模对话场景,而 gemini-3.8-live-extended-thinking 则在相同接口背后加入了多步推理能力。两者都支持 97 种语言并可在对话中途切换,都能近乎实时地处理视觉输入,都能在对话继续进行的同时在后台运行工具和 API 调用,也都会用 SynthID 为每一秒生成的音频打上水印。公布的价格为每分鐘音频输入 $0.005,每分鐘音频输出 $0.018。

ElevenLabs Agents 并不是那样。它是一条流水线,而流水线本身就是产品。实时语音识别模型转写来电者的语音,语言模型决定该说什么,合成模型——在 ElevenLabs 文档所述配置中为 Eleven Flash v2——说出回答。每个阶段都单独计费,每个阶段都可以替换,而整个系统位于一个托管层之后,由该层处理电话接入、轮次检测和并发。ElevenLabs 的旗舰合成模型 ElevenLabs Eleven v3 又是另一款产品:一个按每百万字符 100 美元计价的文本转语音模型,面向旁白、配音和声音设计销售,而非用于进行对话。

所以首先要弄清楚的是,“Gemini 3.8 Live vs ElevenLabs Eleven v3”并不是两个语音模型之间的正面交锋。Eleven v3 不接受音频输入,也不进行对话。真正有意义的比较是 Gemini 3.8 Live 与 ElevenLabs Agents 之间的比较,而 Eleven v3 在这里只是作为该平台所围绕构建的合成质量上限出现。

每一个在棋盘上实际所处的位置

没有任何排行榜会将这两者放在一起一较高下,而这其中的原因颇具启发性:它们总是出现在衡量不同事物的不同榜单上。

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

在 Artificial Analysis 的 Speech to Speech Index 上——它把语音推理、智能体任务完成、竞技场偏好和任务成功融合为一个数字——Gemini 3.8 Live 得分为 76.0,而 Extended Thinking 变体以 82.6 位居第一。这些是 Artificial Analysis 在其自有测试框架下运行得到的测量结果,并非 Google 公布的数字,不过 Google 自己的公告引用了来自相同组成部分的数字。

ElevenLabs 完全没有出现在那张榜单上,因为它并未推出可供测量的语音到语音模型。它出现的地方是 Speech Agent Arena——该榜单评估的是组装而成的智能体,而非模型本身——而那里的情况确实喜忧参半:ElevenLabs Agents 的实测成绩为 937 Elo,任务成功率达 90.5%,相比之下,基于上一代 Gemini Live 构建的智能体为 1,046 Elo、任务成功率 74.6%,且该 Gemini 智能体在 0.96 秒内即可输出首个音频。请仔细审视这一对数据。Gemini 驱动的智能体在偏好度和速度上胜出;ElevenLabs 智能体则在完成任务上更胜一筹。这是一种级联方案在可靠性上击败原生模型的情况,而这并非架构图所能预测的结果。

关于这些数字有两点需要注意,而这两点都很重要。该对比中 Gemini 一方用的是 2026 年初的 Gemini Live 代际,而不是 3.8 Live,因此它并不能反映本文所讨论的这款模型。而且,还有第三个上榜的榜单——Artificial Analysis 的 Provider Voices 语音竞技场,它对合成模型进行排名——其中ElevenLabs Eleven v3 为 1,177 Elo,而对话版本ElevenLabs v3 Conversational 为 1,219 Elo,相比之下,领先者 Cartesia Sonic 3.6 为 1,283。那个榜单衡量的是声音听起来有多好,而不是智能体表现得有多好,而把两者混为一谈,正是人们最终会拿合成分数当作对话系统证据来引用的原因。

规格对比

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• 架构 — Gemini 3.8 Live 是一个原生的语音到语音模型,而 ElevenLabs Agents 则是语音识别、语言模型与语音合成的级联组合

• 输入与输出 — Gemini 3.8 Live 单次处理即可接收音频并返回音频,而 ElevenLabs 则先将音频经 Scribe v2 Realtime 处理,再通过 Eleven Flash v2 返回,中间还包含文本转录

• 你能替换什么——Gemini 3.8 Live:什么都换不了,模型就是模型;相比之下,ElevenLabs 的每个环节都可独立替换,包括语言模型,而在文档所述的技术栈中,该语言模型是 Google 的。

• 语言 — Gemini 3.8 Live 97,支持对话中途切换,对比 ElevenLabs Eleven v3 74

• 音频定价 — Gemini 3.8 Live 每分钟输入 $0.005、每分钟输出 $0.018,而 ElevenLabs 按智能体分钟数计价,语言模型 token 另行单独计量收费

• 电话通信 — Gemini 3.8 Live 无第一方方案,需自带运营商和会话管理;对比 ElevenLabs 的托管式第一方方案

• 并发 — Gemini 3.8 Live:你的 Live API 配额允许多少就多少,而 ElevenLabs 按并发层级出售

• 代理工具链 — Gemini 3.8 Live 的后台工具与模型内 API 执行 vs ElevenLabs 带有轮次检测、工作流和语音库的托管代理层

• 开放制品——两者都不是。两者都是封闭的、仅限云端且专有的

• 延迟 — 根据 Artificial Analysis,Gemini 3.8 Live 标准模型首次音频输出为 1.18 秒,Extended Thinking 为 1.35 秒;而 ElevenLabs 未公布单一数字,因为级联的延迟是三个阶段之和

最后一行比任何其他行都更能说明架构选择。原生模型只有一个延迟预算。级联有三个,而团队仍然选择级联的原因,是它上面的所有内容:你可以记录的转录文本、你可以替换的阶段,以及那个拿来就能用的电话号码。

一分钟的成本,双向计算

Gemini 3.8 Live 的算术格外简单,因为只有一项计量。一分钟对话大致相当于一分钟通话方音频加一分钟模型音频:$0.005 加 $0.018,因此约为每分钟 2.3 美分,按公布费率计算。Artificial Analysis 的每小时成本栏将完成一组固定音频推理任务所需的成本归一化为小时数值,其中标准模型为输入音频每小时 $0.84——是该榜单上最便宜的付费费率——而 Extended Thinking 变体则为 $3.50。

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

ElevenLabs 的算术更复杂,而这正是重点所在,而非批评。一个智能体分钟并非单一价格:有智能体分钟本身的平台费用、中间环节消耗的语言模型 token,以及底层的运营商分钟——在最坏情况下是三个计费表、三个供应商,而且其中任何一个变动,账单都会随之变动。合成侧则更容易看清:ElevenLabs Eleven v3 每百万字符 100 美元按普通语速连续旁白约合每小时 8 美元,而在同一竞技场中,最便宜的开放权重竞品约为 2.70 美元。ElevenLabs 为音色收取溢价,而在那个榜单上,这一溢价是实实在在的——它总体排名第四。

这两种成本结构在实际中的含义是:Gemini 3.8 Live 每分钟对话更便宜,每小时音频更是便宜得多;而 ElevenLabs 更贵,但运营起来可预测性高得多。一个没有 ML 工程师、却要搭建一个电话号码的团队,头一个月在 ElevenLabs 上花的钱会更少,因为替代方案就是去构建 ElevenLabs 已经构建好的东西。一个已经在运行自己的会话管理和自己的运营商的团队,则为原始模型花的钱会更少,因为他们不必为自己已经拥有的流水线付费。

ElevenLabs真正更擅长的是什么

很容易把价格差距当成一种定论。其实并非如此,原因恰恰是价目表永远不会显示的。

• 电话通信。ElevenLabs 出售电话号码、SIP 中继,以及接听电话所需的并发能力。Google 出售的是一个能说话的模型。如果你的产品是一条电话线,那么这两句话之间的差距就是数月的工程开发。

• 声音身份。Voice Library、克隆流程和配音工作室是一套成熟的产品界面。Gemini 3.8 Live 给你的是一个模型;它不会给你一份已授权声音的目录,也不会给你一套把现有录音本地化成九种语言的工作流。

• 默认情况下会生成转录文本。因为级联模型在推理之前会先转录,所以你可以免费获得每次调用的文本日志——这对于合规、评估以及找出智能体出错原因这类不起眼的工作很有用。原生语音到语音模型则没有这样的产物,除非你自己构建一个。

• 可替换的组件。当更好的语言模型发布时,ElevenLabs 级联无需重新训练任何东西就能采用它。这正是文档所述技术栈中间会有一个 Google 模型的原因——也是支持级联架构的最强有力的单一论据。

原始模型能为你带来什么

反对的理由不在于价格,而在于单次前向传递能做到三阶段做不到的事。

Gemini 3.8 Live 直接聆听韵律、语气和犹豫,而不是通过一份早已把这些丢弃的转录文本,因此它能够在句子中途切换语言,也因此它的对话动态得分——据 Artificial Analysis 称,标准模型为 96.1%——是它唯一胜过自家那个偏重推理的兄弟型号的组成部分。它还能在持续说话的同时在后台运行工具和 API 调用,所以一次查询不会造成沉默。而 Extended Thinking 变体是一种真正不同的能力,而非同一能力的更大版本:它能解决 68.6% 的 τ-Voice 客服场景,而标准模型为 30.1%,38 个百分点的差距是本次发布中最大的单一数字,也是 Google 将该产品线一分为二的原因。

如果你的智能体(agent)的任务是完成一个多步骤任务,而不是进行一场愉快的对话,那么这 38 分的差距就是决定性的全部理由,而且它每小时花费 3.50 美元,而不是 0.84 美元——仍然低于它在该榜单上击败的每一个模型。

中间那条腿才是你真正能移动的那条

值得点明的接缝就在这里,因为正是在这一点上,架构问题变成了采购问题。在级联架构中,中间那一段——决定说什么、调用工具并进行推理的部分——只是普通的文本推理。它也是成本差异最大、锁定风险最高、最没有理由绑定任何单一供应商的一段。ElevenLabs 所记录的这套技术栈恰好在那里使用了 Gemini 模型。但它并非必须如此。

OrcaRouter 覆盖的是那一段,而不是外侧的两段。我们不托管 Gemini 3.8 Live 语音端点——它们来自 Google 自家的 Live API——我们也不托管 ElevenLabs,其合成层与智能体层都是它自己的产品。我们承载的是底下的文本层:200+ 个模型集中在单个密钥之后,按提供商列表价提供,不加价,因此上游实验室的降价当天就能反映到你的账单上,而不必等到下一次续费。具体到语音技术栈,其中三项特性尤其能发挥作用。自动故障转移能在后端出错或在一句话中间超时时保持通话不中断,而这类故障通话方立刻就能察觉。路由 DSL 可将多个模型组合进一次调用,因此便宜的模型可以处理应答轮次,更强的模型则负责交易环节。而模型融合则让一组模型在单个模型的判断不足以单独信赖的轮次上共同作答。改变级联中间坐的是哪个模型只是一次配置变更,而不是重建——这正是级联架构存在的根本原因。

该选哪一个

如果你要上线一条电话线路,又不想自己搭建语音技术栈,那就选 ElevenLabs。你买的是电话通信、语音库、转写、并发和支持合同,而每分钟的溢价正是这些的成本。你还买到了中途更换模型而无需改动其他任何东西的能力,这比听起来更有价值。

如果语音是你已在运营的某项功能的一部分,那就选 Gemini 3.8 Live。你能拿到目前公开报价中最便宜的合格语音到语音费率、支持对话中途切换的 97 种语言、在模型持续说话时仍可运行的工具执行,而且——如果你的智能体必须完成任务而不只是交谈——还能获得 Extended Thinking 变体以约四倍的每小时音频成本换来的 38 分智能体能力差距。运营商、会话生命周期和日志都由你自己提供。

值得关注的是:ElevenLabs 是否会为一个托管智能体分钟发布单一的延迟数值,因为正是这个数字能让这项比较从结构性变为定量;以及当基于 3.8 Live 构建的智能体在 Speech Agent Arena 上接受测量时,该结果是否依然成立,因为一个级联方案目前在任务成功率上击败原生模型,是这场对决中最有趣、也最缺乏解释的一点。