
GPT-Live-1 vs Sesame Preview:在這場比較中,最好的聲音是你買不到的那一個
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式

問任何兩者都用過的人,高下之分毫無懸念:Sesame Preview 是多數人交談過最有說服力的語音助理。它同時也是你無法在其上開發的那一款。GPT-Live-1 與 Sesame Preview 經常被拿來比較——兩者都能對話,兩者都能處理插話,兩者聽起來都像真人,而非電話語音選單——但它們的提供方式卻截然相反。GPT-Live-1 是託管模型,按分鐘租用,自 2026 年 9 月 10 日起可公開呼叫。Sesame Preview 則是免費的消費者應用程式,完全沒有 API,而讓大家驚豔的那把聲音,跑在一個從未發布的正式版模型上。
每一個實際上是什麼
• GPT-Live-1 — OpenAI 的全雙工語音模型,自 2026 年 7 月 8 日起於 ChatGPT 提供,自 9 月 10 日起於 API 提供,每語音分鐘 0.05 美元。十二種 API 語音,不支援聲音複製,不支援圖像或影片輸入,每次工作階段都會回傳逐字稿與回應文字。
• Sesame Preview — Sesame 的消費級語音助理。自 2026 年 5 月起在 iOS 上免費提供,自 2026 年 8 月初起在 Android 上廣泛提供,另有一個語音優先的網頁預覽版。四個代理——Maya、Miles、Simone 和 Charlie——僅支援英文,通話上限為 30 分鐘,登出時則降至 5 分鐘。
• CSM-1B —— Sesame 中開放的部分:一個以 Apache 2.0 授權、於 2026 年 4 月 23 日釋出的 1B 對話語音模型,建構於 Llama 架構主幹上,搭配獨立的解碼器與 Kyutai 的 Mimi 編解碼器,可從約 4K 個詞元的上下文產生 24 kHz 單聲道英語語音。
上面這三行就是這個決定的全貌。一家公司按分鐘出售模型。另一家則免費送出一個應用程式,並將一個較小的模型開源,而那並不是應用程式裡所用的那個模型。
試用版與下載版之間的差距
Sesame 對這件事異常直白,而對任何評估這對組合的人來說,這是最重要的一項事實。Preview 應用程式裡的那個聲音——也就是產出那些爆紅片段與「業界最佳語音模式」好評的聲音——是一個規模更大、封閉的正式生產模型。CSM-1B 則是出自同一實驗室的 1B 參數開放檢查點,而根據兩者都實際運行過的人的評估,它的聲音明顯較弱。Preview 上的工作階段也有上限,且僅限英文,而且沒有任務執行能力:這些代理只會交談,不會預訂、購買或歸檔任何東西。
這讓開發者拿到的是一個真實但更狹窄的選項:一個可自行託管的對話語音檢查點,免授權費,由一家第三方推論服務供應商代管,每百萬字元收費 7 美元——相當於每小時合成音訊約 0.35 美元——或是在自家硬體上免費執行。目前沒有人發表過 Preview 語音或 CSM-1B 的獨立基準測試,所以無論是哪一方的品質說法,都只是聆聽印象,而不是實測數據。Sesame 也未公布公開定價、沒有企業級方案,也沒有獲利計畫;該公司自述的方向是研究合作夥伴關係,以及一款規劃中的硬體產品。

每分鐘 0.05 美元能買到什麼,而免費版買不到
GPT-Live-1 對開發者的賣點,並不是它聽起來更出色,因為面對一個沒人能衡量的封閉模型,這種論點根本贏不了。它的賣點在於:這東西可被呼叫,而且有定價。具體來說,當計費錶開始跑,你能得到的是:
• 由你掌控的工作階段 —— 一個模型 ID、一個 Live Sessions 端點、一個透過 WebRTC 執行的已發佈整合範例,以及一個由你以指示、語音和委派區塊設定的工作階段。
• 中斷處理作為一項有文件記載的行為——在 Full Duplex Bench v1.5 上有 80.1% 的互動性,相較於 GPT-Realtime-2.1 的 45.4%,並具有 0.798 秒的輪替延遲及 87% 的工具呼叫成功率。這三項都是 OpenAI 自己的數字,在發布時一併公布,且在撰寫本文時尚未被任何人重現。
• 你選擇的推理後端——語音層會透過非同步邊界,把繁重的工作交給工作階段設定中指定的一個獨立模型,該模型會在對話持續進行的同時繼續運作。在 OpenAI 的文件範例中,那個後端是 GPT-5.6 Terra;在七月的消費者版本發布時,它是 GPT-5.5。
• 轉錄內容、回應文字與電話形式的計費——持續開通線路每小時 $3.00,按秒計費,並將 15 秒的 session 初始化時間以抵扣方式計算,而非額外加計。
Sesame 給你更好的對話,而那些它全都沒有。如果你正在打造產品,「更好的對話、沒有 API、沒有價格、沒有基準測試、僅限英文、30 分鐘上限」並不是一種比較——而是一份等候名單。
GPT-Live-1 現在有一個數字,是它消費者版上市時還不存在的,而這個數字是對上述一切最誠實的平衡點。Artificial Analysis 的 Speech to Speech Index 給 GPT-Live-1 的評分是 69.8%——在十一個模型中排名第七,落後於 GPT-Realtime-2.1 的 73.9%,也落後於 Grok Voice Think Fast 2.0 的 79.0%。所以,你能買到的模型在獨立排行榜上也不是最好的那一個。排行榜無法評分的那一點,正是 Sesame 真正勝出的地方:那份指數上的十一個模型,沒有任何一個被評比過「跟它說話的感覺如何」,而 Sesame Preview 的聲音在任何地方都沒有任何一列紀錄。

堆疊中不屬於任何一家公司的那一塊
這裡是兩個選項交會之處,也是決策不再是非此即彼的地方。Sesame Preview 和 GPT-Live-1 都不是完整的代理。Sesame 的代理不執行任務;GPT-Live-1 則明確把任何需要推理、檢索或工具的環節交給後端模型處理。在兩種設計中,真正有趣的工作都發生在語音背後,落在一次純文字模型呼叫上,而這一層的可攜性並非語音層所能比擬——你可以更換後端,卻不必為語音模型重新錄製任何一句提示詞。
那個後端也是 OrcaRouter 發揮作用的地方,而我們究竟承載了什麼、又不承載什麼,值得說得精確一點。我們不路由 GPT-Live-1:Live Sessions 端點是 OpenAI 的,而那裡頭的語音層我們碰不到。我們也不路由 Sesame 的正式生產模型,原因更簡單:它從未以 API 的形式提供過。我們路由的,是這兩款產品都會把工作交棒過去的那一層。來自十一家上游供應商的約 190 個模型,在一把金鑰、以供應商定價、零加成之下運行,具備跨供應商的自動故障轉移,以及能把多個模型組合成單次呼叫的路由 DSL。對於正在打造未經市場驗證的語音前端的團隊來說,這才是真正要緊的避險:語音層可以被換掉或棄置,而不會把推理層一起拖下水;而你三月押注的模型,六月只要改一行就能替換。
看什麼
有三件事會改變這項比較,而目前這些都還不在任何人手中。一套 Sesame API——即使是付費的——會立刻把這個類別中最強的聲音變成可打造的選項,並在 GPT-Live-1 的 $0.05 旁邊擺上一個真實的價格。一份公開發表的 Preview 語音基準測試,會把聆聽印象轉換成數字,而獨立評測往往對那些只在示範中比試過的語音不太友善。而首次由外部重現 OpenAI 的互動性與延遲數據,將會判定全雙工究竟是真正的能力落差,還是精心挑選的評估方式。
在那之前,老實說的分界是這樣。如果你是為自己挑選語音,就用 Sesame Preview——它免費、更好,而且偏好它對你毫無成本。如果你是為一個必須出貨、銷售並支援的產品挑選語音,GPT-Live-1 是兩者中唯一你真正能買到的,而它不是聲音更好聽的那一個,這就是入場的代價。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
