
GPT-Live-1 對決 ElevenLabs:一個會傾聽的模型,一間什麼都賣的公司
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
The most useful number in this comparison is 90.5%. That is the task success rate Artificial Analysis measured for ElevenLabs Agents in its Speech Agent Arena — the highest in the top six of that board, achieved by a system that is not a single model at all but a cascade of speech recognition, a language model and a synthesiser stitched together by ElevenLabs' own turn-taking logic. GPT-Live-1, OpenAI's end-to-end full-duplex model, does not appear on that board, because it competes on a different one: the Speech to Speech Index, where it sits joint sixth of fourteen at 70.3%. Meanwhile ElevenLabs Eleven v3 remains the most widely deployed production voice in the industry, with more than 10,000 voices in its library and 70-plus languages.
這個簡略說法是:一方賣給你一場對話,另一方賣給你一間公司。這個簡略說法大致正確,卻也掩蓋了底下更有意思的發現:在完成任務上,精心設計的串接式系統依然勝過原生全雙工模型。
兩種架構,而差異在於接縫的位置
GPT-Live-1 is a single model that takes audio and text in and produces audio and text out. It handles interruption natively — OpenAI's own testing, published with September's API release and unreproduced outside the company, reports 80.1% interactivity on Full Duplex Bench v1.5 against 45.4% for GPT-Realtime-2.1, and turn-taking latency of 0.798 seconds against 1.41. There are no seams, because there is nothing to seam together.
ElevenLabs Agents is the opposite bet, deliberately. ElevenLabs' documentation describes a pipeline: tuned speech recognition, a language model you choose or bring yourself, a low-latency synthesiser — typically something from the Flash line — and a proprietary turn-taking model on top. Barge-in is a per-agent configuration exposing turn eagerness and timeouts rather than a property of the model. In Artificial Analysis's benchmarked default configuration the stack reads Scribe v2 Realtime for speech recognition, a Gemini model for reasoning, and Eleven Flash v2 for synthesis.
那個設計有一個巨大優勢,也有一項結構性成本。優勢在於每個階段都可替換:簡單的輪次用便宜模型,困難的輪次用前沿模型,不同地區則用不同的合成器。成本在於延遲會在每個接縫處累積,而且輪替決策必須從外部做出。
逐維度地
• 架構 — GPT-Live-1:單一端到端模型,音訊輸入與音訊輸出;對比 ElevenLabs Agents:串接式語音辨識、語言模型與語音合成,並搭配專有的輪替發言層
• 獨立證據 — GPT-Live-1:在 Artificial Analysis Speech to Speech Index 上達 70.3%,於十四家中並列第六;對比 ElevenLabs Agents:在 Speech Agent Arena 上 Elo 937,涵蓋 676 個樣本的任務成功率為 90.5%,為該排行榜前六名中最高的成功率
• 品質榜單 — GPT-Live-1:未列入文字轉語音競技場的排名,因為它與 ElevenLabs 屬於不同類型的模型:Eleven v3 Conversational 在 Provider Voice 榜單上以 1,194 Elo 名列,Eleven v3 則為 1,166,兩者定價分別為每百萬字元 $50 和 $100。
• 定價 — GPT-Live-1:每語音分鐘 $0.05,按秒計費,後端推理另行計量;對比 ElevenLabs:Eleven v3 Conversational 每百萬字元約 $50,Eleven v3 約 $100,代理程式據報約每分鐘 $0.08,超過併發上限後會上升,且語言模型與電話通訊費用另行計費
• 延遲 — GPT-Live-1:未公布模型層級的首次音訊時間;供應商測試中的輪替發言延遲為 0.798 秒,相較於 ElevenLabs:Flash v2.5 約為 75 毫秒,Eleven v3 Conversational 約為 280 毫秒,而供應商指引為代理層級首次音訊低於 800 毫秒
• 語音與複製 — GPT-Live-1:十二種 API 預設,設計上不支援複製;對比 ElevenLabs:語音庫中有超過 10,000 種語音,可從簡短樣本即時複製,並可透過 30 至 180 分鐘的音訊進行專業複製,附自我驗證
• 語言 — GPT-Live-1:主要語言支援良好,但在推出涵蓋範圍中,其他語言的流暢度不一;相較之下,ElevenLabs Eleven v3:70 多種語言,而 Flash 系列為 32 種,其語音辨識則有 90 多種
• 廣度 — GPT-Live-1:一個端點、一個模型 ID,並發層級從 25 到 500 個工作階段,且沒有免費層級;對比 ElevenLabs:語音合成、語音辨識、配音、音效、音樂、語音市集與代理平台,全部納入單一合約,並提供一個不附帶商業授權的免費層級


ElevenLabs 不僅領先,更是無人能及
那份清單中的三個差距並不接近,任何把它們放在同一個句子裡相提並論的比較,對現任者都不公平。
複製功能是第一項。GPT-Live-1 內建十二種預設,而且刻意完全不提供複製功能——這是刻意採取的安全立場,而非功能缺失。ElevenLabs 提供從簡短參考樣本進行的即時複製,以及以 30 至 180 分鐘音訊訓練的專業級複製,但需依方案層級開放,並須通過自我驗證步驟。如果你的產品語音是其身分認同的一部分,這並不是 GPT-Live-1 能競爭的面向。
語音庫是第二項。超過一萬種嗓音,再加上一個授權市集,網羅來自遺產管理方與表演者的經典聲音,這是任何模型發布都無法複製的資產。這也是買家最常低估的一點:挑選嗓音是語音產品的最後一哩路,而有一萬種聲音可供選擇,能把一場品牌塑造工程壓縮成一個下午。
第三是廣度。語音辨識、配音、音效、音樂、代理平台——一個需要其中四項的團隊,只需簽一份合約,而不是四份。那是策略上的優勢,不是品質上的優勢,而且就算對手在某項基準測試中勝出,這項優勢依然成立。
Both companies carry governance questions that belong in a procurement review rather than a footnote. ElevenLabs' professional cloning requires self-verification and its terms prohibit cloning another person's voice even with consent; the company also faces a set of class actions filed in May 2026 over training-data consent, in which the claims are unproven. OpenAI's position is simpler because it removed the feature that generates the risk.

級聯稅,以及在哪些情況下值得支付
級聯的成本會以延遲和編排的形式顯現。ElevenLabs 的官方指引指出,代理的首次音訊時間中位數低於 800 毫秒,第 95 百分位數則低於 1.5 秒——這些數字描述的是整個流程,而非合成器的 75 毫秒。在此之上還疊加了語言模型的生成時間與網路傳輸。其中有些可透過審慎選擇各階段來彌補;但沒有一項是不用付出代價的。
編排成本比較不明顯,但確實存在。每一個額外階段,都是另一個呼叫可能失敗的地方、另一個要調整的逾時設定、另一個要與之核對發票的供應商。而這正是原生端到端模型完全消除的部分:只有一件事可能出錯,而它要嘛回應,要嘛不回應。
串接式架構真正回本的地方,在於中間那個階段。語音代理背後的語言模型,是所有元件中品質進步最快、成本變動也最大的一環,而能在不動到語音層的前提下替換它,對一款產品的生命週期來說值上真金白銀。大約 來自十一家上游供應商的 190 個模型都掛在單一 OrcaRouter 金鑰之下,以供應商牌價計費、零加成,因此供應商調價當天就會反映到這一層,而自動容錯移轉則能避免後端逾時導致通話中斷。無論是 ElevenLabs 的 agents 堆疊,還是 GPT-Live-1 的 Live Sessions 端點,都無法以這種方式取用——語音層屬於各自的供應商,而這是它們底下那一層。
該選哪一個
若對話機制本身就是產品,而你想要單一合約、單一失效模式,就選 GPT-Live-1。適合來電者會搶話打斷代理的電話線路,適合自然交接比完美嗓音更重要的情境,也適合十二種好嗓音就已足夠的場合。你得接受封閉式託管模型、不支援聲音複製、獨立評測表現中等,而且沒有免費方案可供原型開發。
如果限制條件在於語音品質、複製能力或廣度,就選擇 ElevenLabs。旁白、配音、多語言產品、任何語音本身就是品牌的情況,以及任何需要在同一份合約中涵蓋語音辨識的需求。你得接受以串接式系統來運作、價格大約是 GPT-Live-1 每單位語音的十到二十倍,以及中斷邏輯得由你自己設定、也由你自己承擔設錯的後果。
90.5% 是值得帶走的部分。它說明:一家組裝了三個模型和一層輪替機制的公司,在與通話是否成功最接近的指標上,勝過一家訓練單一模型來包辦全部工作的公司。全雙工是真正的架構進步,但就目前證據而言,它不是決定來電者能否得到想要結果的關鍵。
