Gemini 3.8 Live Extended Thinking 對比 Gemini 3.8 Live 的主視覺標題卡,顯示兩款模型以每小時音訊成本 4 倍差距區隔,分別為 $3.50 對上 $0.84。
Guides & Insights

Gemini 3.8 Live Extended Thinking 對比 Gemini 3.8 Live:為關鍵的 38 分支付 4 倍代價

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩個模型、一場發表、一份價目表,以及一個大多數報導都朝同一個方向搞錯的抉擇。Gemini 3.8 Live Extended ThinkingGemini 3.8 Live於 2026 年 9 月 15 日一同推出,兩者皆以 Gemini 3 Pro 為基礎打造,都支援 97 種語言並能在對話中途自動切換,都接受近乎即時的視覺輸入,也都以 SynthID 為生成的音訊加上浮水印。在 Artificial Analysis 公布的綜合 Speech to Speech Index 上,兩者相差 6.6 分——82.6 對 76.0。在同一份榜單所衡量的每小時音訊成本上,兩者則相差略超過四倍。

那兩個都不是應該決定你架構的數字。應該決定的是 38:也就是兩者在 τ-Voice 上的差距;τ-Voice 是代理式任務完成元件,其中推理變體可解決 68.6% 的模擬客服情境,而標準變體可解決 30.1%。你不是在一個好模型與一個更好的模型之間做選擇。你是在一個對話式介面,以及一個剛好會說話的推理系統之間做選擇,而價格差異是這個選擇中最不有趣的一點。

價格分岔,以你實際被計費的單位表示。

先從帳單談起,因為這是人們會正確理解、卻又過度重視的部分。兩個模型透過 Live API 都採用相同的公開費率:音訊輸入每分鐘 $0.005,音訊輸出每分鐘 $0.018;而在 Extended Thinking 方面,那些輸出 token 包含思考內容。同一張價目卡、相同費率,推理並沒有另外的進階付費層級。

一旦你衡量的是工作量而不是分鐘,差異就會顯現。Artificial Analysis 的每小時輸入音訊成本欄位——完成固定的 40 題 Big Bench Audio 子集、再標準化為每小時數字的成本——會把這兩個模型歸入完全不同的級距:

Gemini 3.8 Live Extended Thinking(高)——每小時輸入音訊 $3.50,根據 Artificial Analysis 自身的測量

Gemini 3.8 Live — 每小時 $0.84,是該看板上最低的付費費率

• GPT-Live-1(Astra 後端,中等強度)—— 每小時 $5.83,因此推理版本仍比它所擊敗的模型便宜約 40%

Grok Voice Think Fast 2.0 High — 每小時 $4.80

• GPT-Realtime-2.1 High — 每小時 $10.75

這就是分歧所在:在相同的公開每分鐘費率下,每小時音訊成本卻是四倍,因為推理版本在進行相同份量的聆聽時會耗用更多 token。標準模型的 $0.84 並不是折扣,而是整個價目表的最低價。

這38點能換來什麼

把這個複合體拆開,這兩個模型就不再像是一對了:

語音轉語音指數 — Gemini 3.8 Live Extended Thinking (High) 82.6 對比 Gemini 3.8 Live 76.0

代理式效能(τ-Voice 任務完成率) — 68.6% 對比 30.1%

語音推理(Big Bench Audio) — 98% vs 92%

對話動態 — 91.9% 對 96.1%

Arena 偏好(Elo) — 990 對 1083

任務成功率 — 89.1% 對比 93.2%

首次音訊時間 — 1.35 秒 vs 1.18 秒

每小時輸入音訊的成本 — $3.50 vs $0.84

老實讀下來,較便宜的模型在八條項目中贏了四項。它首次音訊更快、更受競技場青睞、更可能完成淺層任務,並在對話動態上獲得更高評價——最後這一項並不是安慰獎,因為來電者注意到的正是對話動態。它做不到的,是完成有步驟的工作。30.1% 對 68.6% 是本次發布中任何地方最大的單一差距,而且它落在區分代理與介面的那條軸線上。

關於這些列有兩點但書。索引內的競技場偏好數值是凍結在模型符合發布資格的那一刻,因此它是快照而非持續更新的 Elo——請把它讀成某一時點的評分,而不是即時更新的 Speech Agent Arena 圖表。而 τ-Voice 排行榜的頂端十分逼近:推理變體的 68.6% 以 0.7 個百分點領先 GPT-Live-1 的 67.9%(Astra 後端、medium effort),其後是 GPT-Live-1(Sol、low effort)的 59.3% 與 Grok Voice Think Fast 2.0 High 的 56.5%。領先 GPT-Live-1 的這 0.7 個百分點在雜訊範圍內。但這一對內部的 38 個百分點差距則不然。

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

另一個 4x:推理層級在程式碼上讓你付出的代價

這個版本還有第二個分支,而它並未出現在任何排行榜上。這兩個模型並非可直接互換,因為推理變體改變了你的用戶端必須遵守的合約。

在標準模型上,Gemini 3.8 Live的表現符合 Live API 用戶端的預期:背景工具與 API 呼叫會在模型持續說話的同時執行,而 turnComplete: true仍會標示一個回合的結束。沒有思考層級設定可選,因為並沒有什麼需要另外設定的東西——模型會回答,而當它回答完畢,這個回合就結束了。

Gemini 3.8 Live Extended Thinking上,有三件事會同時改變:

函式呼叫一律是非同步的。 阻塞式工具宣告不會客氣地排隊——它會直接傳回硬性錯誤。你為標準模型撰寫的任何工具結構描述,都必須重新宣告為非阻塞式。

新的狀態欄位承載真正的狀態。用戶端必須讀取 interaction_status,而不是信任 turnComplete:當模型仍在推理,或工具仍在執行時,該欄位會顯示 IN_PROGRESS,只有在整個任務完成時才會穩定為 IDLE。一個回合可以結束,但任務卻可能還沒結束。

思考深度是一個可調的旋鈕。模型提供可設定的推理層級——低、中、高——而看板上的 82.6 與 68.6 這兩個數字,屬於(High)組態。降到低會同時改變品質與 token 帳單,而索引上沒有任何資訊告訴你,低設定在任務完成度上要付出什麼代價。

第三點是遷移陷阱。因為在涉及工具呼叫之前,Extended Thinking 在傳輸層面上的回應方式與標準模型相同,團隊可以替換模型 ID、看到可運作的示範,卻只有在正式環境中,當預訂工具回傳錯誤而非結果時,才發現非同步契約。為客戶端重構編列預算,並連同 4× 音訊費率一起考量;在成熟的整合中,這是兩者中較大的成本。

您的工作負載實際需要的是哪一個

最乾淨俐落的決定方式,是問這個工作階段是要用來做什麼,而不是你想要它有多聰明。

當對話本身就是交付成果時,就選 Gemini 3.8 Live。接聽應答、記住對話脈絡、代接留言、篩選來電者,而且態度親切、反應快、成本低。輸入音訊每小時 0.84 美元,是目前市面上所有已發布的語音模型中,最能勝任又最便宜的一款;它在競技場中較受青睞,在淺層任務上更可靠,首次音訊輸出還快上 170 毫秒——這是來電者感受得到的差異。唯一要接受的是它的上限:多步驟任務完成率 30.1%,意味著它無法完成有步驟的工作,而再怎麼做提示工程也改變不了這個數字。

採用Gemini 3.8 Live Extended Thinking,當工作階段有任務時:預訂、更改、取消、解決帳戶問題、在來電者等待時引導他們走完多步驟流程。這就是那條 38 分的門檻,而它每小時要價 3.50 美元——請注意,這仍比它在綜合評分上勝過的兩個模型都便宜。你還獲得了讓等待變得可以忍受的旁白行為:這個模型一邊推理一邊說話,所以它查資料時不會一片沉默,來電者會聽到「讓我查一下……」,以及一路進行中的進度。這正是全雙工架構以永不停止音訊所解決的同一問題;Google 的答案是持續以說話覆蓋工作過程。

還有兩列數據值得權衡。Google 也回報,Extended Thinking 模型在 Sierra 的 τ³-Banking 排行榜上取得 35.1%,而 GPT-Live-1 Astra 為 32.0%——這是供應商自行回報的數字,背後沒有獨立評測佐證,而且就絕對值而言令人警醒,因為 35.1% 意味著該排行榜上最好的模型,在每三次貼近現實的銀行任務嘗試中,大約有兩次會失敗。而標準模型在 Speech Agent Arena 中排名第二,這是 Google 在自己的資料中引用的結果,是在另一個衡量偏好而非任務完成度的排行榜上取得的真實成績。兩種說法都成立。合在一起看,它們說明便宜的那個模型很擅長與人對話,而兩者之中只有昂貴的那個模型能被指派工作。

同時執行兩者,不需兩項整合

對這一切最實際的反對意見是:依工作負載來選擇,就意味著得維護兩條路徑。其實未必。這兩種變體都位於同一類後端之前——背景工具執行與多步驟規劃,最終都會化成一般文字模型的呼叫——而那一層正是你的成本差異所在,也是切換成本低廉之處。

OrcaRouter 讓你用單一金鑰就能取用 190 個模型,並以供應商定價計費、不加收任何費用,因此供應商調整價格時,我們這邊當天就會同步生效,而不必等到下一次合約續約。對於要在便宜的對話層級與昂貴的推理層級之間進行路由的技術堆疊來說,真正關鍵的兩個特性是:委派目標可以在不更動語音整合的情況下,於實際流量中即時替換,以及當後端發生錯誤或逾時時,自動容錯移轉能讓工作階段持續運作。為精確說明我們有託管與沒有託管的內容:Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 端點並不在我們的路由器上——那些來自 Google 自家的 API,也就是 Gemini API、Live API 與 Google AI Studio。而這些代理交派工作的對象,往往正是文字模型,Gemini 3.8 Flash 便是其中之一。

每個模型在排行榜上的位置

下方的擷取畫面攝於 2026 年 9 月 16 日,而 Speech to Speech Index 的頂部顯示如下:

Gemini 3.8 Live Extended Thinking (High) — 82.6,第一名

• GPT-Live-1(Astra 後端,中等投入)— 81.5

• Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1(Sol 後端,低投入)— 80.1

Gemini 3.8 Live — 76.0,第五名

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

在您閱讀那份清單時,有一點命名上的說明:(High)在相關報導中附加於此模型名稱的後綴,代表的是推理投入程度的組態標籤,而非另一款獨立的發布版本。這與該排行榜為 Grok Voice Think Fast 2.0 High 及 GPT-Realtime-2.1 High 所採用的慣例相同。

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

還有什麼尚未提交

關於這兩個模型,有一點很容易被誤讀,因此值得直說:儘管兩者都已定價並有文件說明,但就合約意義而言,兩者都並非一般可用。

開發人員可在Gemini 3.8 Live取得 Gemini API、Live API 和 Google AI Studio 中的功能,ID 為gemini-3.8-live;企業可在 Gemini Enterprise 中取得私人預覽,而 Gemini Enterprise for Customer Experience 則列為即將推出;消費者則可在 Search Live 中使用。Gemini 3.8 Live Extended Thinkinggemini-3.8-live-extended-thinking下提供相同的開發人員介面,此外還有更廣泛的消費者途徑——Gemini Live、為 Google AI Pro 和 Ultra 訂閱者提供的 Docs Live,以及為所有 Google AI 訂閱者提供的 Gmail Live 和 Keep Live。Workspace 企業客戶則列為即將推出。

目前欠缺的,正是企業要把這項服務列為營收項目之前所需要的:正式推出(GA)承諾、公開的可用率數字,以及 Google 承諾維持的價格。價格雖已公布,但預覽版定價向來有變動的習性。現在先做原型,規劃好後續移轉,但千萬別簽下一個你還沒拿到手的可用性目標。

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

這對選項實際呈現的決策,比指標所顯示的更狹窄,而且它並不是一條品質階梯。如果你的代理職責是交談,便宜的模型並不是妥協——它是以更低價格提供更好的產品,而便宜四倍的費率是額外好處,而不是論點本身。如果你的代理職責是完成某件事,推理版本是兩者中唯一能被交派這項任務的,而每小時 $3.50 相對於一筆否則會失敗的預訂,只是零頭。要避免的錯誤是折衷取中:為了一個只需要良好對話的工作負載,付出推理深度的費用;當團隊讀到 6.6 分的綜合差距,卻從不向下滑到 38 時,就會發生這種事。