「GPT-Live-1 對上 Sesame Preview」主視覺標題卡,副標為「這裡最棒的聲音,是那個沒有 API 的」,並有一枚徽章寫著「一個免費且封閉,一個付費且可呼叫」,還有三張卡片:「Sesame Preview —— 免費應用程式,沒有 API,正式版語音尚未釋出」、「GPT-Live-1 —— 每語音分鐘 $0.05,自 2026 年 9 月 10 日起提供公開 API」,以及「Sesame 可自行打造的部分 —— CSM-1B,Apache-2.0,10 億參數,每 100 萬字元 $7,或可自架」,上方則有一條頁尾帶寫著「Sesame 的正式版語音沒有公開的基準測試數據;GPT-Live-1 的語音數據為 OpenAI 自行回報。」OrcaRouter 標誌合成於右下角。
Guides & Insights

GPT-Live-1 vs Sesame Preview:在這場比較中,最好的聲音是你買不到的那一個

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章
A two-column scoreboard titled 'GPT-Live-1 vs Sesame Preview - the scoreboard'. Left column GPT-Live-1: 'Access: public API since September 10, 2026', 'Price: $0.05 per voice minute', 'Voices: 12 API voices, no cloning', 'Duplex: full duplex, barge-in native', 'Weights: closed', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Sesame Preview: 'Access: free consumer app, no API', 'Price: $0 to the user, no paid tier', 'Voices: four agents, one production voice', 'Duplex: conversational, interruptible', 'Weights: CSM-1B open, production model closed', 'Independent score: none, no public benchmark of the Preview voice'. Footer: 'The Sesame Preview production voice is unreleased; CSM-1B is a separate, smaller open checkpoint.'

問任何兩者都用過的人,高下之分毫無懸念:Sesame Preview 是多數人交談過最有說服力的語音助理。它同時也是你無法在其上開發的那一款。GPT-Live-1 與 Sesame Preview 經常被拿來比較——兩者都能對話,兩者都能處理插話,兩者聽起來都像真人,而非電話語音選單——但它們的提供方式卻截然相反。GPT-Live-1 是託管模型,按分鐘租用,自 2026 年 9 月 10 日起可公開呼叫。Sesame Preview 則是免費的消費者應用程式,完全沒有 API,而讓大家驚豔的那把聲音,跑在一個從未發布的正式版模型上。

每一個實際上是什麼

• GPT-Live-1 — Ope​nAI 的全雙工語音模型,自 2026 年 7 月 8 日起於 ChatGPT 提供,自 9 月 10 日起於 API 提供,每語音分鐘 0.05 美元。十二種 API 語音,不支援聲音複製,不支援圖像或影片輸入,每次工作階段都會回傳逐字稿與回應文字。

• Sesame Preview — Sesame 的消費級語音助理。自 2026 年 5 月起在 iOS 上免費提供,自 2026 年 8 月初起在 Android 上廣泛提供,另有一個語音優先的網頁預覽版。四個代理——Maya、Miles、Simone 和 Charlie——僅支援英文,通話上限為 30 分鐘,登出時則降至 5 分鐘。

• CSM-1B —— Sesame 中開放的部分:一個以 Apache 2.0 授權、於 2026 年 4 月 23 日釋出的 1B 對話語音模型,建構於 Llama 架構主幹上,搭配獨立的解碼器與 Kyutai 的 Mimi 編解碼器,可從約 4K 個詞元的上下文產生 24 kHz 單聲道英語語音。

上面這三行就是這個決定的全貌。一家公司按分鐘出售模型。另一家則免費送出一個應用程式,並將一個較小的模型開源,而那並不是應用程式裡所用的那個模型。

試用版與下載版之間的差距

Sesame 對這件事異常直白,而對任何評估這對組合的人來說,這是最重要的一項事實。Preview 應用程式裡的那個聲音——也就是產出那些爆紅片段與「業界最佳語音模式」好評的聲音——是一個規模更大、封閉的正式生產模型。CSM-1B 則是出自同一實驗室的 1B 參數開放檢查點,而根據兩者都實際運行過的人的評估,它的聲音明顯較弱。Preview 上的工作階段也有上限,且僅限英文,而且沒有任務執行能力:這些代理只會交談,不會預訂、購買或歸檔任何東西。

這讓開發者拿到的是一個真實但更狹窄的選項:一個可自行託管的對話語音檢查點,免授權費,由一家第三方推論服務供應商代管,每百萬字元收費 7 美元——相當於每小時合成音訊約 0.35 美元——或是在自家硬體上免費執行。目前沒有人發表過 Preview 語音或 CSM-1B 的獨立基準測試,所以無論是哪一方的品質說法,都只是聆聽印象,而不是實測數據。Sesame 也未公布公開定價、沒有企業級方案,也沒有獲利計畫;該公司自述的方向是研究合作夥伴關係,以及一款規劃中的硬體產品。

A screenshot of the Sesame homepage as of September 2026, headed 'Curiosity, met' with the subline 'Personal intelligence with a point of view', and a section titled 'A collection of personal agents' reading 'Think out loud. Follow a thread. Discover something unexpected.' with a 'Get the Preview' button. The navigation offers only Blog, Team, Mobile Preview and Research Preview — no pricing, no documentation and no developer or API link.

每分鐘 0.05 美元能買到什麼,而免費版買不到

GPT-Live-1 對開發者的賣點,並不是它聽起來更出色,因為面對一個沒人能衡量的封閉模型,這種論點根本贏不了。它的賣點在於:這東西可被呼叫,而且有定價。具體來說,當計費錶開始跑,你能得到的是:

• 由你掌控的工作階段 —— 一個模型 ID、一個 Live Sessions 端點、一個透過 WebRTC 執行的已發佈整合範例,以及一個由你以指示、語音和委派區塊設定的工作階段。

• 中斷處理作為一項有文件記載的行為——在 Full Duplex Bench v1.5 上有 80.1% 的互動性,相較於 GPT-Realtime-2.1 的 45.4%,並具有 0.798 秒的輪替延遲及 87% 的工具呼叫成功率。這三項都是 OpenAI 自己的數字,在發布時一併公布,且在撰寫本文時尚未被任何人重現。

• 你選擇的推理後端——語音層會透過非同步邊界,把繁重的工作交給工作階段設定中指定的一個獨立模型,該模型會在對話持續進行的同時繼續運作。在 Ope​nAI 的文件範例中,那個後端是 GPT-5.6 Terra;在七月的消費者版本發布時,它是 GPT-5.5

• 轉錄內容、回應文字與電話形式的計費——持續開通線路每小時 $3.00,按秒計費,並將 15 秒的 session 初始化時間以抵扣方式計算,而非額外加計。

Sesame 給你更好的對話,而那些它全都沒有。如果你正在打造產品,「更好的對話、沒有 API、沒有價格、沒有基準測試、僅限英文、30 分鐘上限」並不是一種比較——而是一份等候名單。

GPT-Live-1 現在有一個數字,是它消費者版上市時還不存在的,而這個數字是對上述一切最誠實的平衡點。Artificial Analysis 的 Speech to Speech Index 給 GPT-Live-1 的評分是 69.8%——在十一個模型中排名第七,落後於 GPT-Realtime-2.1 的 73.9%,也落後於 Grok Voice Think Fast 2.0 的 79.0%。所以,你能買到的模型在獨立排行榜上也不是最好的那一個。排行榜無法評分的那一點,正是 Sesame 真正勝出的地方:那份指數上的十一個模型,沒有任何一個被評比過「跟它說話的感覺如何」,而 Sesame Preview 的聲音在任何地方都沒有任何一列紀錄。

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%. No Sesame model appears on the index.

堆疊中不屬於任何一家公司的那一塊

這裡是兩個選項交會之處,也是決策不再是非此即彼的地方。Sesame Preview 和 GPT-Live-1 都不是完整的代理。Sesame 的代理不執行任務;GPT-Live-1 則明確把任何需要推理、檢索或工具的環節交給後端模型處理。在兩種設計中,真正有趣的工作都發生在語音背後,落在一次純文字模型呼叫上,而這一層的可攜性並非語音層所能比擬——你可以更換後端,卻不必為語音模型重新錄製任何一句提示詞。

那個後端也是 OrcaRouter 發揮作用的地方,而我們究竟承載了什麼、又不承載什麼,值得說得精確一點。我們不路由 GPT-Live-1:Live Sessions 端點是 OpenAI 的,而那裡頭的語音層我們碰不到。我們也不路由 Sesame 的正式生產模型,原因更簡單:它從未以 API 的形式提供過。我們路由的,是這兩款產品都會把工作交棒過去的那一層。來自十一家上游供應商的約 190 個模型,在一把金鑰、以供應商定價、零加成之下運行,具備跨供應商的自動故障轉移,以及能把多個模型組合成單次呼叫的路由 DSL。對於正在打造未經市場驗證的語音前端的團隊來說,這才是真正要緊的避險:語音層可以被換掉或棄置,而不會把推理層一起拖下水;而你三月押注的模型,六月只要改一行就能替換。

看什麼

有三件事會改變這項比較,而目前這些都還不在任何人手中。一套 Sesame API——即使是付費的——會立刻把這個類別中最強的聲音變成可打造的選項,並在 GPT-Live-1 的 $0.05 旁邊擺上一個真實的價格。一份公開發表的 Preview 語音基準測試,會把聆聽印象轉換成數字,而獨立評測往往對那些只在示範中比試過的語音不太友善。而首次由外部重現 OpenAI 的互動性與延遲數據,將會判定全雙工究竟是真正的能力落差,還是精心挑選的評估方式。

在那之前,老實說的分界是這樣。如果你是為自己挑選語音,就用 Sesame Preview——它免費、更好,而且偏好它對你毫無成本。如果你是為一個必須出貨、銷售並支援的產品挑選語音,GPT-Live-1 是兩者中唯一你真正能買到的,而它不是聲音更好聽的那一個,這就是入場的代價。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新