GPT-Live-1 語音轉語音指數文章的標題卡,顯示前三高分:GPT-Live-1 搭配 GPT-6 Astra 於中等努力程度為 81.5、Grok Voice Think Fast 2.0 High 為 81.3,以及 GPT-Live-1 搭配 GPT-5.6 Sol 於低努力程度為 80.1
Guides & Insights

GPT-Live-1 以 81.5 登上 Speech to Speech Index 榜首——但這排名應歸功於其後端。

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-Live-1 是於 2026 年 7 月 8 日首次在 ChatGPT 內推出的全雙工語音模型,如今在 Artificial Analysis Speech to Speech Index 上以 81.5 分排名第一——這一列之所以存在,完全是因為該模型被指定由 GPT-6 Astra 負責思考。若以相同的語音前端,改搭 GPT-5.6 Sol 作為委派後端並採低推理強度,得分為 80.1,排名第三。第二名為 81.3 分,屬於 Grok Voice Think Fast 2.0 High。

在數字之前,先坦白兩件事。這款模型並不新:GPT-Live-1 於 2026 年 9 月 10 日登上開發者 API,此前已擔任 ChatGPT 的預設語音兩個月。真正新的是,以 9 月 15 日來衡量,有外部評測機構為它打了分——這是迄今關於這款模型的每一篇報導都缺少的一件事,包括我們自己的報導,因為當時唯一可得的數字,是 OpenAI 自己發布的關於自身的數據。而領先第二名 0.2 個百分點的差距,比 GPT-Live-1 自身兩種配置之間 1.4 個百分點的落差還要小——而後者才是榜單上最有用的數字。

所以,標題「GPT-Live-1 是最佳語音模型」並不完全符合該指數的說法。它說的是,GPT-Live-1 搭配以中等努力運作的 GPT-6 Astra,以零點二分之差勝出,而且後端的選擇比任何競爭模型更能左右結果。

指數實際上衡量什麼

Artificial Analysis 將 Speech to Speech Index 建構為由四個部分等權重組成的綜合指標:語音推理(Speech Reasoning),以 Big Bench Audio 衡量;代理效能(Agentic Performance),以 τ-Voice 衡量;Arena Preference,一種成對人類偏好的 Elo;以及任務成功率(Task Success Rate)。只有四項元件皆可取得的模型才會獲得指數值——其他所有項目都顯示為破折號,這就是為什麼表格的列數遠多於分數。該指數本身於 2026 年 6 月 23 日推出,此後已修訂兩次,最近一次是將 Conversational Dynamics 替換為 Task Success,因此某一次修訂的分數與另一次修訂的分數並非嚴格可比。

當你閱讀排名時,還有兩個方法論細節很重要。Arena Elo 會凍結在模型首次可發布時的水準,因此偏好成分獎勵的是早到,而不是今天最好。而這個指數評分的是整個系統,而非單一模型:對 GPT-Live-1 而言,這個數字涵蓋語音前端,以及它將工作交派給的任何後端模型。這是刻意的設計選擇,也是同一個模型會以不同分數出現兩次的原因。

該領域的頂尖名單,如已發布:

• GPT-Live-1 (Astra, medium) — 指數 81.5,第一

• Grok Voice Think Fast 2.0 High — 指數 81.3,第二名

• GPT-Live-1(Sol,低)— 指數 80.1,第三

• GPT-Realtime-2.1 High — 指數 73.9,第四

• GPT-Realtime-2 High — 指數 73.6,第五

• Grok Voice Think Fast 1.0 — 指數 72.3,第六名

• Gemini 3.1 Flash Live High — 指數 71.5,第七

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

作為參照,GPT-Live-1 所取代的模型比它低 7.6 分。這是實實在在的世代差距,而且這點無庸置疑。

這 0.2 分的勝出,正好來自一個元件。

將綜合指標拆開來看,這兩位領先者就不再像是同一類模型。就各組成部分而言,根據 Artificial Analysis:

• 代理式效能(τ-Voice)— GPT-Live-1 67.9%,對比 Grok Voice Think Fast 2.0 High 的 56.5%

• 語音推理(Big Bench Audio)— 90% 對 97%

• 任務成功率 — 87.4% 對 94.6%

• Arena Elo — 1048 對 1011

• 首次音訊時間 — 1.34 秒對比 0.70 秒

• 每小時成本,包含後端 — $5.83 對比 $4.80

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

GPT-Live-1 在六個項目中贏了兩項、輸了四項,卻拿下指數首位。這道算術並不神祕:τ-Voice 差距為 11.4 分,遠大於表中任何其他差距,而在等權重下,它把綜合分數硬是拖過了門檻。簡單來說,GPT-Live-1 是更好的代理,Grok Voice Think Fast 2.0 High 則是更好的聆聽者,也是更快的一方——而這個指數恰好對 GPT-Live-1 擅長的能力賦予足夠大的權重,讓它排名第一。

如果你的產品是能預約、解決問題或完成交易的語音代理,τ-Voice 領先 11.4 個百分點就是預示你使用體驗的那個數字。如果你的產品是一段必須讓人感覺即時、且絕不能打斷使用者的對話,0.70 秒的首次音訊時間就是預示你使用體驗的那個數字,而 Grok 在這方面以大約兩倍的差距勝出。在受監管的任務執行方面,還有第二個警訊:Grok 的 94.6% 任務成功率是可見表格中最高的,而 GPT-Live-1 的 87.4% 意味著大約每八項任務就有一項無法完成。兩者相較前一代都有所改善。但兩者都還不是已解決的問題。

第 1 行是路由設定,不是模型

真正值得比排行榜名次更多關注的是這一塊。GPT-Live-1 是一個全雙工語音層,能自行處理聆聽、說話、打斷與輪替發言,並在對話持續進行的同時,把推理、工具呼叫與搜尋交給另一個後端模型。Artificial Analysis 將其中兩組配對列為獨立項目評分。Astra 在中等投入程度下得到 81.5 分。Sol 在低投入程度下得到 80.1 分。

那 1.4 分的差距才是重點。第一名與第二名之間的差距是 0.2 分。GPT-Live-1 的兩個受評配置之間的差距,則是七倍大。那些列之間,語音模型本身沒有任何改變——改變的只有是哪個模型在負責思考,以及以什麼樣的努力程度思考。一個為系統排名的排行榜,正準確地告訴你:配置才是產品。

這也修正了我們自己的報導。在 2026 年 9 月 11 日,我們在此指數上記錄到 GPT-Live-1 為 69.8%,落後於 GPT-Realtime-2.1 與 Grok 兩者。那是當時可得的讀數,且支持了一個合理的結論——OpenAI 打造出最佳的對話機制,而非最佳的語音代理。該指數現在列有兩個委派式 GPT-Live-1 配置,分別為 81.5 與 80.1。Artificial Analysis 不發布變更日誌,且它在 8 月修訂了指數的組成部分,因此我們無法確切得知較早的數字是未計分或部分計分的配置,還是在較舊加權方式下的一次執行;可觀察到的是,這些委派配對現在以各自的完整資料列出現,而且答案在它們出現時隨之改變。

實際的結論是:「哪個語音模型」是錯誤的問題,而「哪個語音模型加上哪個後端、以何種投入程度運作」才是正確的問題。那是個路由問題,而這正是我們自家產品存在的目的——來回答這個問題。OrcaRouter 透過與其他 200 多個模型相同的 OpenAI 相容端點,公開 GPT-Live-1 的委派後端 GPT-6 Astra,因此替換思考層只是變更模型 ID,而非進行整合。路由 DSL能將多個模型組合成單一呼叫,而自動容錯移轉意味著未經實證的配對不是生產環境的賭注——若後端效能下降,請求會落到其他地方,而不是失敗。準確說明我們不做什麼:GPT-Live-1 本身不在我們的型錄中,我們也不提供它。它所委派的後端則是另一回事。

這個每小時的費用是多少

GPT-Live-1 的前端以每語音分鐘 0.05 美元計費,按秒計費,開通線路一小時為 3.00 美元。這並非全部帳單:委派推理、工具呼叫與網路搜尋會依後端模型的收費標準另行計量。Artificial Analysis 測量的是全包總額,因此應採用其成本欄位:

• GPT-Live-1(Sol,低)— 每小時 $4.47

• Grok Voice Think Fast 2.0 High — 每小時 $4.80

• GPT-Live-1(Astra,中型)— 每小時 $5.83

• GPT-Realtime-2.1 High — 每小時 $10.75

排行榜冠軍是目前三個選項中最貴的,而勝出的配置每小時比排名第三的配置貴 30%。換個角度解讀,這個拆分很說明問題:每小時有 $3.00 是語音層,其餘——Sol 上的 $1.47、Astra 上的 $2.83——則是後端 token。思考層大約佔你帳單的三分之一到一半,而對於一個排行榜視為註腳的元件來說,這是相當大的佔比。

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

然而,相較於它所取代的模型,整個系列大約只要半價——每分鐘 0.05 美元的前端價格是真正的降價,而非重新包裝。由於後端 token 按後端費率計費,GPT-Live-1 部署的成本主要取決於你路由到哪個推理模型,而後端可以是 OpenAI 自家的模型或第三方模型。在 OrcaRouter 上,這些後端以供應商定價、0% 加價直接傳遞,因此思考層的供應商價格變動當天就會生效,而不是等到下一個計費週期。

指數未能解決的事項

三項但書,是由來源明確指出的,而非推論而來。GPT-Live-1 的兩個項目與 Grok Voice Think Fast 2.0 High 都被標註為僅基於單次試驗,這對一個 0.2 分的決策來說相當單薄——重新跑一次就可能讓第一與第二名互換,而兩個模型本身都不會有任何改變。Arena Elo 如所述,是凍結在每個模型首次可發布的測量值上。而這份指數也沒有記錄這些系統在長時間通話中的表現:其組成元件在設計上本就是短時距的,而真正會終結語音代理程式在生產環境中運作的失效模式,是二十分鐘對話過程中的漂移。

另外,而且是來自供應商而非索引的資訊:GPT-Live-1 的 API 推出時不支援圖像或影片輸入,不支援結構化輸出,也沒有免費方案,其速率限制是以並行工作階段計算,而非每分鐘請求數。那些是推出當日的限制,可能已經變動;在依此進行設計之前,請先確認。

這該怎麼處理?

如果你這週要挑的是架構而不是模型,這份索引在代理式工作上肯定委派模式,在延遲表現上則肯定級聯模式。GPT-Live-1 的 81.5 是目前最有力的證據,顯示將對話與推理分離,是任務完成型語音代理的正確形態。Grok Voice Think Fast 2.0 High 的 81.3,首個音訊僅需 0.70 秒、任務成功率達 94.6%,則是最有力的證據,說明委派形態並非唯一可行的架構——而且它還不是最快的。

從這些數字得出的決定,代價比表面上看起來低。GPT-Live-1 的兩種配置,以及在六項元件中有四項勝過它的那個模型,彼此每小時的差距都在 $1.36 以內。在這樣的差距下,正確做法是別再讀排行榜,而是拿你自己的逐字稿分別跑過兩者。這個指數能告訴你取捨的形狀;卻無法告訴你,你的使用者落在它的哪一側。

數字所引發的問題

GPT-Live-1 現在是最好的語音模型嗎?

以綜合分數來看,是的——領先 0.2 分,而且背後只有一次試驗。若按各組成部分來看,則完全取決於你正在打造什麼:它在代理式效能與競技場偏好上領先,但在語音推理、任務成功率與首次音訊時間上落後。一個建立在單一 11.4 分元件優勢之上的 0.2 分綜合領先,是站得住腳的第一名,而非決定性的第一名。

你必須使用 GPT-6 Astra 才能獲得 81.5 嗎?

就那個特定列而言,是的——81.5 是屬於以中等推理強度搭配 Astra 設定的 GPT-Live-1。Sol 在低強度下是有紀錄的替代方案,分數為 80.1,而且每小時便宜 $1.36,而 OpenAI 支援將第三方模型作為後端,因此排行榜上的項目只是曲線上的兩個點,而非唯一的選項。哪種搭配最適合你的工作負載,並不是公開索引能替你回答的事。

為什麼同一個模型在我們先前的報導中得分是 69.8,而現在卻是 81.5?

這兩張圖涵蓋的內容不同。先前的讀值將 GPT-Live-1 以單一項目列入該指數;目前的表格則把它那兩個委派配置列為各自獨立、完整計分的列,其中 Astra 配對為 81.5,Sol 配對為 80.1。Artificial Analysis 在八月修訂了該指數的組成要素,且不發布變更紀錄,因此請把這個差異視為「所測量的內容」有所改變,而非模型有所改善的證據——並且請把任何針對委派型模型的單一綜合分數,視為對某個配置的陳述。