用於 Gemini 3.8 Live Extended Thinking 與 GPT-Live-1 的主視覺標題卡,顯示這兩款語音模型相差 1.1 個指數點,且採用不同的計費模式。
Guides & Insights

Gemini 3.8 Live Extended Thinking 對決 GPT-Live-1:1.1 分的平手與兩張不同的帳單

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在綜合評分上,這是平手。 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Index 上為 82.6; GPT-Live-1 搭配其中等推理強度的 Astra 後端時為 81.5。在底層的代理式元件——τ-Voice 任務完成度——上,差距為 0.7 個百分點,68.6% 對 67.9%。在推理元件上,差距更大且方向相反:Gemini 模型在 Big Bench Audio 上為 97.7%,GPT-Live-1 為 90.1%。這些差距沒有一項禁得起第二次基準測試的考驗,而且它們都不是你該據以做決定的依據。

這兩者的分野不在品質,而在於它們對於什麼是語音代理、由誰負責思考,以及——最先衝擊預算科目的那部分——工作階段如何計費,看法分歧。Gemini 3.8 Live Extended Thinking 依音訊 token 計費,並在負責說話的同一個模型中進行推理。GPT-Live-1 則對工作階段時間收取固定費率,無論是否有人在說話,並把實際的思考交給另一個由你選擇、另行付費的文字模型。這是兩個不同產品披著相同的基準測試分數,而哪一個合適,取決於排行榜從不問的一個問題:在你的線路上,一通平均通話長什麼樣子?

1.1 分的平手,以及它實際上在哪裡瓦解

先從數字開始,因為標題的單薄正是重點:

語音轉語音指數 — Gemini 3.8 Live 擴展思考(高)82.6 對 GPT-Live-1(Astra 後端,中等強度)81.5

代理式效能(τ-Voice 任務完成率) — 68.6% 對比 67.9%;而 GPT-Live-1 在以低強度執行 Sol 後端時為 59.3%

語音推理(Big Bench Audio) — 97.7% 對 90.1%,這是唯一一個差距並非雜訊的元件

複雜銀行作業流程(Sierra τ³-Banking,供應商回報) — 35.1% 對 32.0%

首次音訊時間 — 1.35 秒,相較於透過 API 的 1.24–1.34 秒

實測每小時成本——$3.50,相較之下 Astra 配置為 $5.83,兩者均依據 Artificial Analysis 的輸入音訊測量

誠實的解讀是,這兩個模型在綜合指標上難分軒輊,在語音推理上則可明顯區分,Gemini 模型領先近八分,而在成本上也可明顯區分,領先約 40%。GPT-Live-1 勝出之處,在於基準測試難以評分的體驗部分:它真正是全雙工,邊說邊聽,發出簡短應答,每秒多次決定要開口還是讓出發言權。Gemini 3.8 Live Extended Thinking 則是回合制。它改用敘述來解決同樣的根本問題——代理運作時,來電者被留在沉默中——一邊推理一邊說話,並在任務執行期間使用「讓我查一下……」之類的提示語。

兩種做法都能讓這條線繼續運作。它們給人的感覺不同。但只有其中一種會出現在索引上。

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

兩種計費模式,以及費率表為何會誤導人

這是決定大多數部署成敗的部分,而這正是涵蓋範圍所略過的環節。

Gemini 3.8 Live Extended Thinking的計費方式與符元(token)模型的計費方式相同。透過 Live API,公布的費率為每百萬音訊輸入符元 $3.00——相當於每分鐘音訊輸入約 $0.005——以及每百萬音訊輸出符元 $12.00,相當於每分鐘約 $0.018,其中思考符元會計入該輸出量。你只需為有音訊流動的部分付費。來電者若暫停、思考或處於保留等候狀態,在他們安靜無聲時不會向你收取任何費用。

GPT-Live-1的計費方式就像電話線一樣。每分鐘工作階段時間固定收費 0.05 美元,並按秒計費,無論是誰在說話,或是否有人在說話都一樣。推理後端不包含在內:負責思考的文本模型,以及它呼叫的任何工具,都會另行計費並加在上面。這就是為什麼 0.05 美元的表面價格,會變成 Sol 後端每小時約 4.47 美元、Astra medium 每小時約 5.83 美元的總體費用,由 Artificial Analysis 測得。

把這些並排放到一起,那種天真的比較——每分鐘 $0.018 對上 $0.05,2.8 倍的差距——在兩個方向上都是錯的。實測的每小時數字顯示,真正的差距是 $3.50 對上 $5.83,更接近 1.7 倍。但工作階段計時模型改變的不只是帳單金額的高低,還有它的形狀:在 GPT-Live-1 上,你的成本跟著通話時長走,所以一條充滿冗長、安靜、低內容通話的線路——客服佇列、驗證步驟、IVR 轉接——付的錢和一條密集通話的線路一樣。在 Gemini 這邊,成本跟著音訊走,所以沉默免費,而冗長不是。先拿你自己的平均通話長度來算,再拿每分鐘費率來算,因為那才是決定這兩者中哪個對你更便宜的數字,而且預約專線和分流專線不會得到相同答案。

思考發生的地方

第二個結構性差異是委派,而它決定了你實際上能替換這套堆疊的多少部分。

GPT-Live-1 是一個前端。它負責處理雙工音訊,而當查詢需要真正的推理時,會把工作交給另一個後端模型——GPT-5.5GPT-6 Astra 都被記載為後端——並附有推理強度選擇器,讓你選擇要購買多少該後端的能力。這就是為什麼排行榜把 GPT-Live-1 列出兩次、分數不同:在 Astra 上以中等強度得到 81.5,在 Sol 上以低強度得到 80.1。它自身這兩種配置之間 1.4 分的差距,比這場對決中兩個模型之間 1.1 分的差距還大,這告訴你:在 OpenAI 這邊,你選擇的配置比你選擇的廠商更重要。

Gemini 3.8 Live Extended Thinking 是在同一個負責發話的模型中進行推理。沒有另一個後端可供選擇,也不會為此另計費用;代價是你要在同一個模型上透過思考層級——低、中、高——來調整深度,而 82.6 與 68.6 這兩個數字是 (高) 配置。背景工具與 API 執行在兩側皆以非同步方式運作,因此兩個模型都不會在運作時停擺。

一個實際後果是:由於 GPT-Live-1 的智慧是語音前端背後一個外購的文字模型,它的品質上限會在 OpenAI 推出文字模型時變動,而不是在它推出語音模型時。Gemini 3.8 Live Extended Thinking 的上限則會在 Google 重新訓練音訊模型時變動。如果你要對一個語音平台下為期兩年的賭注,這種升級節奏的差異,比 1.1 個指數點更值得深思。

無論你選擇哪條路,{{1}}轉換成本{{/1}}是什麼

這兩者都不是單純換個模型 ID 那麼簡單,把它們當成如此看待的團隊,最終都會在正式環境中吃到苦頭。轉換到 Gemini 3.8 Live Extended Thinking,意味著要接受一套不同的回合契約:函式呼叫一律是非同步的,因此宣告為阻塞式的工具會直接回傳硬錯誤,而不是排入佇列;此外,用戶端必須讀取 interaction_status 欄位——IN_PROGRESS 代表仍在推理或工具仍在執行,IDLE 則要等到整個任務完成才會出現——而不是再信任 turnComplete 代表工作已經做完。轉換到 GPT-Live-1,則意味著要採用它的後端選擇機制與另一套計費介面,並忍受一個直到 2026 年 9 月 10 日才正式開放給開發者使用、且早在 7 月 8 日就先在 ChatGPT 亮相的 API——因此圍繞它的第三方工具、SDK 與可觀測性都只有幾個月、而非幾年的成熟度。無論你往哪個方向遷移,都要在 token 帳單之外,額外編列整合工作的預算。在成熟的語音技術堆疊上,重構所需的成本通常比兩者中任何一項都還高。

如何在不押注於它的情況下進行這樣的比較

要解決一個 1.1 分的問題,明智的做法是在你自己的流量上同時跑這兩者,而棘手之處在於,這麼做通常代表兩套整合、兩份合約和兩組憑證。但它不一定要代表兩套架構。在這兩個系統中,語音前端都只是普通文字模型呼叫上的一層薄薄包裝——對 GPT-Live-1 來說這是明確的,而就 Gemini 這邊而言,背景工具執行也以相同方式解析——而那個文字層正是成本差異所在,也是切換真正便宜的地方。

OrcaRouter 提供190 個模型,只要一組金鑰,價格為供應商定價且不加價,因此上游價格變動當天就會在我們這邊生效,而不是等到下一次合約續約。對語音堆疊而言,真正重要的兩個特性是:委派目標可以在不觸及語音整合的情況下,於即時流量上切換;以及當後端發生錯誤或逾時時,自動容錯移轉能讓通話維持不中斷——這正是讓你能在真實流量上試用未經驗證的設定,而不必讓正式生產線也跟著承受風險的原因。為了精確說明我們有託管與沒有託管哪些服務:我們的 router 上既沒有 Gemini 3.8 Live Extended Thinking 端點,也沒有 GPT-Live-1 端點——那些來自 Google 和 OpenAI 自家的 API。它們委派使用的文字模型往往就在我們這裡,Gemini 3.8 Flash 便是其中之一。

排行榜的頂端,以及它有多麼難以穩定下來

下方的截圖拍攝於 2026 年 9 月 16 日:

Gemini 3.8 Live Extended Thinking (High) — 82.6,第一名

GPT-Live-1(Astra 後端,中等力度)— 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1(Sol 後端,低投入)— 80.1

• Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

有三件事值得注意。首先,第一名和第三名相差 1.3 分,第一名和第五名相差 6.6 分,所以這個排行榜的頂端是一場混戰,而不是一份排名。其次,這場對戰標題中的模型不是排名第五的 Gemini 條目——那是標準版 Gemini 3.8 Live,是不同且便宜得多的產品,不應與這裡所比較的推理變體混為一談。第三,對於把任何單一指數數字視為暫時性數據,已有先例:xAI 在七月回報 Grok Voice Think Fast 2.0 為 82.9,而該模型在這個排行榜上顯示為 81.3。廠商回報的指數分數,不見得碰上即時排行榜還能站得住腳。68.6% 和 67.9% 的 τ-Voice 數字現在位於由 Artificial Analysis 自家測試框架運作的公開排行榜上,因此它們是獲得佐證,而不只是宣稱——但同一個測試框架上兩個模型之間 0.7 分的差距,並不算差異。用你的流量驗證它,否則就忽略它。

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

還有一個數字值得納入決策考量,因為它是這番比較中最令人不安的數字:Google 回報,在 Sierra 的 τ³-Banking 排行榜上,Gemini 3.8 Live Extended Thinking 為 35.1%,而 GPT-Live-1 Astra 為 32.0%。這些數字由廠商自行提報、未經重現,而且它們描述的是這樣一個世界:該排行榜上領先的語音代理,在每三次真實銀行任務嘗試中,大約有兩次會失敗。如果你的代理必須完成受監管的多步驟工作,那麼這兩個模型都還稱不上完成——而在該基準上領先 3.1 個百分點,並不是選擇某家廠商的理由,而是必須讓人類留在流程中的理由。

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

所以:如果對話自然度是產品本身,而你的通話簡短又密集,那麼 GPT-Live-1 的全雙工行為就是指標看不見的真正優勢,而在那樣的通話長度下,以工作階段時長計費也還算可接受。如果通話很長、很安靜或長度不一,或者語音推理與每小時成本是主要考量,那麼 Gemini 3.8 Live Extended Thinking 在真正重要的元件上領先,而且同時每小時還便宜約 40%——但要注意,它是回合制的、企業版仍處於預覽階段,而且需要先重構用戶端,才能執行你的工具。這一切都不能正當化只因 1.1 個指標點就選擇其中一個。就現有證據而言,在這兩者之間做選擇的誠實理由,是計費模式及其底層架構,而這兩者都是你這週就能在自己的流量上測量的東西。

在 OrcaRouter 上,自動容錯移轉能讓通話保持暢通,即使後端發生錯誤或逾時。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新