
GPT-Live-1 以 81.5 登上 Speech to Speech Index 榜首——但這排名應歸功於其後端。
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-Live-1 是於 2026 年 7 月 8 日首次在 ChatGPT 內推出的全雙工語音模型,如今在 Artificial Analysis Speech to Speech Index 上以 81.5 分排名第一——這一列之所以存在,完全是因為該模型被指定由 GPT-6 Astra 負責思考。若以相同的語音前端,改搭 GPT-5.6 Sol 作為委派後端並採低推理強度,得分為 80.1,排名第三。第二名為 81.3 分,屬於 Grok Voice Think Fast 2.0 High。
在數字之前,先坦白兩件事。這款模型並不新:GPT-Live-1 於 2026 年 9 月 10 日登上開發者 API,此前已擔任 ChatGPT 的預設語音兩個月。真正新的是,以 9 月 15 日來衡量,有外部評測機構為它打了分——這是迄今關於這款模型的每一篇報導都缺少的一件事,包括我們自己的報導,因為當時唯一可得的數字,是 OpenAI 自己發布的關於自身的數據。而領先第二名 0.2 個百分點的差距,比 GPT-Live-1 自身兩種配置之間 1.4 個百分點的落差還要小——而後者才是榜單上最有用的數字。
所以,標題「GPT-Live-1 是最佳語音模型」並不完全符合該指數的說法。它說的是,GPT-Live-1 搭配以中等努力運作的 GPT-6 Astra,以零點二分之差勝出,而且後端的選擇比任何競爭模型更能左右結果。
指數實際上衡量什麼
Artificial Analysis 將 Speech to Speech Index 建構為由四個部分等權重組成的綜合指標:語音推理(Speech Reasoning),以 Big Bench Audio 衡量;代理效能(Agentic Performance),以 τ-Voice 衡量;Arena Preference,一種成對人類偏好的 Elo;以及任務成功率(Task Success Rate)。只有四項元件皆可取得的模型才會獲得指數值——其他所有項目都顯示為破折號,這就是為什麼表格的列數遠多於分數。該指數本身於 2026 年 6 月 23 日推出,此後已修訂兩次,最近一次是將 Conversational Dynamics 替換為 Task Success,因此某一次修訂的分數與另一次修訂的分數並非嚴格可比。
當你閱讀排名時,還有兩個方法論細節很重要。Arena Elo 會凍結在模型首次可發布時的水準,因此偏好成分獎勵的是早到,而不是今天最好。而這個指數評分的是整個系統,而非單一模型:對 GPT-Live-1 而言,這個數字涵蓋語音前端,以及它將工作交派給的任何後端模型。這是刻意的設計選擇,也是同一個模型會以不同分數出現兩次的原因。
該領域的頂尖名單,如已發布:
• GPT-Live-1 (Astra, medium) — 指數 81.5,第一
• Grok Voice Think Fast 2.0 High — 指數 81.3,第二名
• GPT-Live-1(Sol,低)— 指數 80.1,第三
• GPT-Realtime-2.1 High — 指數 73.9,第四
• GPT-Realtime-2 High — 指數 73.6,第五
• Grok Voice Think Fast 1.0 — 指數 72.3,第六名
• Gemini 3.1 Flash Live High — 指數 71.5,第七

作為參照,GPT-Live-1 所取代的模型比它低 7.6 分。這是實實在在的世代差距,而且這點無庸置疑。
這 0.2 分的勝出,正好來自一個元件。
將綜合指標拆開來看,這兩位領先者就不再像是同一類模型。就各組成部分而言,根據 Artificial Analysis:
• 代理式效能(τ-Voice)— GPT-Live-1 67.9%,對比 Grok Voice Think Fast 2.0 High 的 56.5%
• 語音推理(Big Bench Audio)— 90% 對 97%
• 任務成功率 — 87.4% 對 94.6%
• Arena Elo — 1048 對 1011
• 首次音訊時間 — 1.34 秒對比 0.70 秒
• 每小時成本,包含後端 — $5.83 對比 $4.80

GPT-Live-1 在六個項目中贏了兩項、輸了四項,卻拿下指數首位。這道算術並不神祕:τ-Voice 差距為 11.4 分,遠大於表中任何其他差距,而在等權重下,它把綜合分數硬是拖過了門檻。簡單來說,GPT-Live-1 是更好的代理,Grok Voice Think Fast 2.0 High 則是更好的聆聽者,也是更快的一方——而這個指數恰好對 GPT-Live-1 擅長的能力賦予足夠大的權重,讓它排名第一。
如果你的產品是能預約、解決問題或完成交易的語音代理,τ-Voice 領先 11.4 個百分點就是預示你使用體驗的那個數字。如果你的產品是一段必須讓人感覺即時、且絕不能打斷使用者的對話,0.70 秒的首次音訊時間就是預示你使用體驗的那個數字,而 Grok 在這方面以大約兩倍的差距勝出。在受監管的任務執行方面,還有第二個警訊:Grok 的 94.6% 任務成功率是可見表格中最高的,而 GPT-Live-1 的 87.4% 意味著大約每八項任務就有一項無法完成。兩者相較前一代都有所改善。但兩者都還不是已解決的問題。
第 1 行是路由設定,不是模型
真正值得比排行榜名次更多關注的是這一塊。GPT-Live-1 是一個全雙工語音層,能自行處理聆聽、說話、打斷與輪替發言,並在對話持續進行的同時,把推理、工具呼叫與搜尋交給另一個後端模型。Artificial Analysis 將其中兩組配對列為獨立項目評分。Astra 在中等投入程度下得到 81.5 分。Sol 在低投入程度下得到 80.1 分。
那 1.4 分的差距才是重點。第一名與第二名之間的差距是 0.2 分。GPT-Live-1 的兩個受評配置之間的差距,則是七倍大。那些列之間,語音模型本身沒有任何改變——改變的只有是哪個模型在負責思考,以及以什麼樣的努力程度思考。一個為系統排名的排行榜,正準確地告訴你:配置才是產品。
這也修正了我們自己的報導。在 2026 年 9 月 11 日,我們在此指數上記錄到 GPT-Live-1 為 69.8%,落後於 GPT-Realtime-2.1 與 Grok 兩者。那是當時可得的讀數,且支持了一個合理的結論——OpenAI 打造出最佳的對話機制,而非最佳的語音代理。該指數現在列有兩個委派式 GPT-Live-1 配置,分別為 81.5 與 80.1。Artificial Analysis 不發布變更日誌,且它在 8 月修訂了指數的組成部分,因此我們無法確切得知較早的數字是未計分或部分計分的配置,還是在較舊加權方式下的一次執行;可觀察到的是,這些委派配對現在以各自的完整資料列出現,而且答案在它們出現時隨之改變。
實際的結論是:「哪個語音模型」是錯誤的問題,而「哪個語音模型加上哪個後端、以何種投入程度運作」才是正確的問題。那是個路由問題,而這正是我們自家產品存在的目的——來回答這個問題。OrcaRouter 透過與其他 200 多個模型相同的 OpenAI 相容端點,公開 GPT-Live-1 的委派後端 GPT-6 Astra,因此替換思考層只是變更模型 ID,而非進行整合。路由 DSL能將多個模型組合成單一呼叫,而自動容錯移轉意味著未經實證的配對不是生產環境的賭注——若後端效能下降,請求會落到其他地方,而不是失敗。準確說明我們不做什麼:GPT-Live-1 本身不在我們的型錄中,我們也不提供它。它所委派的後端則是另一回事。
這個每小時的費用是多少
GPT-Live-1 的前端以每語音分鐘 0.05 美元計費,按秒計費,開通線路一小時為 3.00 美元。這並非全部帳單:委派推理、工具呼叫與網路搜尋會依後端模型的收費標準另行計量。Artificial Analysis 測量的是全包總額,因此應採用其成本欄位:
• GPT-Live-1(Sol,低)— 每小時 $4.47
• Grok Voice Think Fast 2.0 High — 每小時 $4.80
• GPT-Live-1(Astra,中型)— 每小時 $5.83
• GPT-Realtime-2.1 High — 每小時 $10.75
排行榜冠軍是目前三個選項中最貴的,而勝出的配置每小時比排名第三的配置貴 30%。換個角度解讀,這個拆分很說明問題:每小時有 $3.00 是語音層,其餘——Sol 上的 $1.47、Astra 上的 $2.83——則是後端 token。思考層大約佔你帳單的三分之一到一半,而對於一個排行榜視為註腳的元件來說,這是相當大的佔比。

然而,相較於它所取代的模型,整個系列大約只要半價——每分鐘 0.05 美元的前端價格是真正的降價,而非重新包裝。由於後端 token 按後端費率計費,GPT-Live-1 部署的成本主要取決於你路由到哪個推理模型,而後端可以是 OpenAI 自家的模型或第三方模型。在 OrcaRouter 上,這些後端以供應商定價、0% 加價直接傳遞,因此思考層的供應商價格變動當天就會生效,而不是等到下一個計費週期。
指數未能解決的事項
三項但書,是由來源明確指出的,而非推論而來。GPT-Live-1 的兩個項目與 Grok Voice Think Fast 2.0 High 都被標註為僅基於單次試驗,這對一個 0.2 分的決策來說相當單薄——重新跑一次就可能讓第一與第二名互換,而兩個模型本身都不會有任何改變。Arena Elo 如所述,是凍結在每個模型首次可發布的測量值上。而這份指數也沒有記錄這些系統在長時間通話中的表現:其組成元件在設計上本就是短時距的,而真正會終結語音代理程式在生產環境中運作的失效模式,是二十分鐘對話過程中的漂移。
另外,而且是來自供應商而非索引的資訊:GPT-Live-1 的 API 推出時不支援圖像或影片輸入,不支援結構化輸出,也沒有免費方案,其速率限制是以並行工作階段計算,而非每分鐘請求數。那些是推出當日的限制,可能已經變動;在依此進行設計之前,請先確認。
這該怎麼處理?
如果你這週要挑的是架構而不是模型,這份索引在代理式工作上肯定委派模式,在延遲表現上則肯定級聯模式。GPT-Live-1 的 81.5 是目前最有力的證據,顯示將對話與推理分離,是任務完成型語音代理的正確形態。Grok Voice Think Fast 2.0 High 的 81.3,首個音訊僅需 0.70 秒、任務成功率達 94.6%,則是最有力的證據,說明委派形態並非唯一可行的架構——而且它還不是最快的。
從這些數字得出的決定,代價比表面上看起來低。GPT-Live-1 的兩種配置,以及在六項元件中有四項勝過它的那個模型,彼此每小時的差距都在 $1.36 以內。在這樣的差距下,正確做法是別再讀排行榜,而是拿你自己的逐字稿分別跑過兩者。這個指數能告訴你取捨的形狀;卻無法告訴你,你的使用者落在它的哪一側。
數字所引發的問題
GPT-Live-1 現在是最好的語音模型嗎?
以綜合分數來看,是的——領先 0.2 分,而且背後只有一次試驗。若按各組成部分來看,則完全取決於你正在打造什麼:它在代理式效能與競技場偏好上領先,但在語音推理、任務成功率與首次音訊時間上落後。一個建立在單一 11.4 分元件優勢之上的 0.2 分綜合領先,是站得住腳的第一名,而非決定性的第一名。
你必須使用 GPT-6 Astra 才能獲得 81.5 嗎?
就那個特定列而言,是的——81.5 是屬於以中等推理強度搭配 Astra 設定的 GPT-Live-1。Sol 在低強度下是有紀錄的替代方案,分數為 80.1,而且每小時便宜 $1.36,而 OpenAI 支援將第三方模型作為後端,因此排行榜上的項目只是曲線上的兩個點,而非唯一的選項。哪種搭配最適合你的工作負載,並不是公開索引能替你回答的事。
為什麼同一個模型在我們先前的報導中得分是 69.8,而現在卻是 81.5?
這兩張圖涵蓋的內容不同。先前的讀值將 GPT-Live-1 以單一項目列入該指數;目前的表格則把它那兩個委派配置列為各自獨立、完整計分的列,其中 Astra 配對為 81.5,Sol 配對為 80.1。Artificial Analysis 在八月修訂了該指數的組成要素,且不發布變更紀錄,因此請把這個差異視為「所測量的內容」有所改變,而非模型有所改善的證據——並且請把任何針對委派型模型的單一綜合分數,視為對某個配置的陳述。
