
Eleven v4 对比 Simba 3.2:79 分的差距,成本却是十二倍
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 982 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 197 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
在 Artificial Analysis 的 Provider Voice Arena 上,ElevenLabs Eleven v4以 1,319 的 Elo 排名第一,而SpeechifyAI Simba 3.2以 1,240 排名第七——相差 79 分,而在这个榜单上,前十名之间的分差不过 113 分。价格却远没有这么接近:ElevenLabs 于 2026 年 9 月 28 日发布的新旗舰模型为每百万字符 80.00 美元,而 Simba 3.2 为 6.58 美元。这大约相差十二倍,并且是前十名中任意两个模型之间最大的价格与质量落差。这个差距是划算还是陷阱,完全取决于你正在替换的是两者中的哪一个。
董事会,正确解读
真正值得带入决策的,不只是那两个头条数字。偏好榜上的排名是个不断变动的目标;每个估计值周围的区间,才能告诉你排序中有多少是信号。
• ElevenLabs Eleven v4 — 排名第 1,Elo 1,319,±19,1,674 次亮相,八种竞技场音色,每百万字符 80.00 美元,发布于 2026 年 9 月 28 日
• SpeechifyAI Simba 3.2 — 排名第 7,Elo 1,240,±14,2,535 次登场,八个竞技场语音,每百万字符 6.58 美元,发布于 2026 年 7 月 1 日
• SpeechifyAI Simba 3.0 — Elo 1,123,每百万字符 6.58 美元,发布于 2026 年 2 月 19 日

由此可以得出两点。第一,Eleventh v4 的区间大约在 1,300 到 1,338,而 Simba 3.2 的区间约为 1,226 到 1,254;两个范围之间隔着约 46 点的明显空档,所以这个排序并非五五开。第二,也更有用的是,Simba 3.2 在相同标价下,比 Simba 3.0 恰好提升了 100 Elo 点(1,240 对 1,140)。SpeechifyAI 实现了代际提升,却没有提高费率,这与 ElevenLabs 在这次发布中的做法正好相反。

十二倍的价格具体能买到什么
Elo 分数是抽象的部分。下面这部分可以写进预算条目。每月五百万字符——约 100 小时的成品语音——对比情况如下:
• 发布窗口期内的 Eleven v4,每 1,000 个字符 $0.022——每月 $110
• Eleven v4 按标价,10 月 12 日之后每 1,000 个字符 $0.08 —— 每月 $400
• Simba 3.2,按董事会标准化的每百万 6.58 美元计算——约合每月 33 美元
• ElevenLabs Eleven v3,即此前的旗舰产品,每 1,000 个字符 $0.08 —— 每月 $400
在两周内,这一差距是三倍。10月12日之后,差距变为十二倍,并一直保持下去,因为公示的每百万80.00美元是标价,而不是促销价。本周撰写的任何比较,只要把促销价当作标准价格来引用,到10月中旬就会出错,而且错在会让ElevenLabs显得便宜的方向上。
在 Simba 3.2 是正确答案的情况下
榜单上排名第七并不是一个差劲的模型。它高于 Google 的 Gemini 3.1 Flash TTS,高于 ElevenLabs 自家的 v3 Conversational(1,197),也高于 Cartesia 上一代的 Sonic 3.5(1,185)。有三类工作负载让它成为显而易见的选择。

长篇内容的规模是首要考量。有声书历史书目、播客存档和无障碍朗读按字符计费,衡量标准是数小时而非数秒,而在每百万字符 6.58 美元的价位上,多出一百小时的边际成本微不足道——在 80.00 美元的价位上,这绝无可能。79 个百分点的偏好差距,是听众并排对比时能察觉到的差异;而在长达六小时的旁白中,大多数听众反而更不在意账单。
默认配音工作负载属于第二类,而榜单的构建方式在这里至关重要。Provider Voice 使用各供应商自己的音色来评估该供应商,因此 Simba 3.2 的排名是靠八个承载其自身特色的竞技场音色赢得的。如果你的产品随附的是供应商所选定的音色,那么你买到的正是榜单所评测的东西,而且是以排名最高的替代方案七分之一的价格买到它。
已经完成集成的 Simba 部署是第三种。如果你使用的是 Simba 3.0,升级到 3.2 能在费率零变化的情况下获得 100 Elo 分,而且想必集成方式也不会变。这是整个对比中性价比最高的单一举措,并且它既不涉及 ElevenLabs,也不涉及我们。
在额外十二倍并非可选的情况下
Simba 3.2 未能弥合的差距,正是竞技场无法评分的那一项。这两个模型之间存在两项能力差异。
脚本指导是最明确的。Eleven v4 记录了内联音频标签,让你能把表演写进文本中——[笑声]、[耳语]、[用法国口音愤怒地说]——以及自然语言指导提示,还有为自定义发音而改进的国际音标支持。在没有该功能的模型上复现这一点,意味着要重录一次、请人工编辑,或者换一个不同的声音。这些每小时的成本都比字符差价更高。
语言覆盖范围是第二点。Eleven v4 标称支持 90 多种语言,输入上限为 10,000 个字符。SpeechifyAI 没有公布我们能够核实的 Simba 3.2 的同等数量,因此这一比较只能算是对 ElevenLabs 有利但尚未证实,而非已经证实:如果你的产品面向二十多个语言区域发布,在假定任一模型都能为这些区域提供语音之前,请先对照自己的清单确认覆盖情况。
第三个差异值得点明,因为它在榜单上根本看不出来:Eleven v4 的即时克隆只需十秒音频即可运行。如果你的工作流依赖克隆特定人物,而不是使用厂商提供的配音阵容,那么样本时长的门槛比 79 个 Elo 分更重要,而且这是每个模型各自的事实,需要你逐一核实,而非语音 API 的通用属性。
路由问题,如实作答
SpeechifyAI Simba 3.2 和任何 ElevenLabs 模型都不在 OrcaRouter 目录中。这里没有可通过我们调用的东西,而要接入这两者,正确的途径是供应商自家的 API——Simba 走 SpeechifyAI 的,Eleven v4 走 ElevenLabs 的。与其把一份对比包装成推销话术,我们宁愿把这话直说。
单个密钥真正物有所值的地方,是上线后的那两周——那时工程上最合理的答案就是"用我们自己的脚本把两者都跑一遍,再据此决定"。跨两家供应商来做这件事,通常意味着在你拿到第一个可对比的基准点之前,就得先应付两个账户、两套结算关系和两种请求格式。而一把 API 密钥就能覆盖200 多个模型,供应商的标价以 0% 加价原样透传,省下了这笔配置成本,而自动故障转移意味着你正在试用的模型可以挂在生产路径之后,又不会成为这条路径的单点故障。
谁应该切换,谁又完全不该动
如果语音质量就是产品本身,那就切换到 Eleven v4:如果用户听到的是你并未选择的默认音色,如果你需要把表演指导写进脚本,或者如果你的克隆工作流是以源音频的秒数来衡量的。79 分的差距是真实存在的,而它背后的能力落差比这个数字所暗示的还要大。请按每 1,000 字符 0.08 美元来做预算,而不是 0.022 美元。
如果你追求的是产量,就继续用 Simba 3.2:长篇旁白、档案类内容,以及任何按字符计费、会随着数小时音频不断累积收益的场景。你放弃的是榜首位置,却能保住大约十二分之十一的收入。而如果你还在用 Simba 3.0,先升级到 3.2 再重新评估——白拿 100 Elo 点,比这场对比中任何一方给出的回报都更划算。
你不该做的,是仅凭这篇文章就下结论。以上所有内容的诚实局限在于:竞技场衡量的是某一时间点上各家厂商语音的盲测偏好,而 ElevenLabs 的价目表会在 10 月 12 日变动。在那个日期之后,用你自己的月度字符数重新算一遍,再迁移生产路径。
