Gemini 3.8 Live 對 GPT-Live-1 的英雄標題卡,副題為「OrcaRouter · 模型雷達——正面對決」,副標為「全雙工對上輪替式——重新解讀架構之爭。」兩張卡片分別寫著「Gemini 3.8 Live——輪替式、今日已支援視覺、97 種語言、每分鐘成本更低」與「GPT-Live-1——全雙工、背景搭話、委派給前沿後端」,並附上指數 76.0 對 81.5、每分鐘 $0.018 對 $0.05 的標籤,以及 OpenAI 即將推出影片的提示。OrcaRouter 標誌合成於右下角。
Guides & Insights

Gemini 3.8 Live 對上 GPT-Live-1:全雙工 vs 邊說邊思考的模型

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

大約兩個月來,這場爭論是由架構定奪的。GPT-Live-1是真正的全雙工——它一邊說話一邊聆聽,會發出「嗯哼」和「知道了」之類的附和語,並且每秒好幾次決定要繼續說還是讓出發言權。Gemini 3.8 Live於 2026 年 9 月 15 日發布,是回合制模型。在舊的框架下,這讓比較變得輕而易舉,而如今這樣解讀已是錯誤的方式。

改變的不是 Google 做到了全雙工。而是 Google 出貨了全雙工原本要用來補償的那樣東西:一個能在多步驟任務於背景執行時仍維持對話的語音模型,以及一個在工作時會把推理過程說出來、邊想邊講的第二版本。架構上的差異是真實存在的。只是它已不再是可以決定購買的那條軸線。

讓對話保持熱絡的兩種方法

全雙工的賭注在於:對話品質本身就是產品。GPT-Live-1 在單一模型內持續且同步地處理輸入與輸出音訊,而不是把語音轉文字串接進語言模型、再串接到文字轉語音。這消除了各階段之間的資訊流失,也帶來人們真正會注意到的行為:你可以在它回答到一半時插話,而它會隨之調整;它不會把停頓或背景噪音誤認為是你這輪發言的結束;在你叫它之前,它會保持安靜。

Gemini 3.8 Live 所下的回合制賭注是:對話只是工作的鷹架。它的功能著重於讓工作階段保持高效率,而非讓節奏保持自然:近乎即時的視覺輸入處理、在對話進行中自動於 97 種支援語言之間切換,以及背景工具與 API 執行——先確認請求,並在呼叫完成期間繼續交談。

兩個模型在思考時都不肯掛你電話。它們只是拒絕的方式不同。GPT-Live-1 是靠永不停止音訊串流來做到這點。Google 則是靠在工作進行時不停說話來做到這點。

A two-column scoreboard comparing Gemini 3.8 Live and GPT-Live-1. Index score 76.0 vs 81.5; architecture turn-based vs full-duplex; video and screen available today vs not at launch; agentic tau-Voice not published vs 67.9%; languages 97 vs a narrower set; voice price $0.005 in and $0.018 out per minute vs $0.05 per minute plus backend tokens. Footer reads 'Index figures per Artificial Analysis, Sep 16 2026; GPT-Live-1 all-in measured at $4.47-$5.83 per hour.' The OrcaRouter logo is composited in the bottom-right corner.

指數到底說了什麼

Artificial Analysis 維護一個 Speech to Speech Index——一個由語音推理、代理式表現、競技場偏好與任務成功率加權構成的綜合指標。請仔細閱讀 2026 年 9 月 16 日擷取的排行榜,因為標題掩蓋了其結構:

Gemini 3.8 Live Extended Thinking — 82.6(第一名)

• GPT-Live-1(Astra 後端,中等投入)— 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1(Sol 後端,低投入)— 80.1

Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

從那個排名可以得出三件事。第一,Google 佔據了榜首,但靠的是昂貴的版本,而不是大多數人會部署的那一款。第二,GPT-Live-1 出現了兩次,因為 Artificial Analysis 評分的是整個系統,而非語音前端——而它兩種配置之間 1.4 分的差距,是第一名與第二名之間 0.2 分差距的七倍。第三,這場對決標題中的模型 Gemini 3.8 Live 排名第五,低於 GPT-Live-1 的兩種配置。

若你是同級比較——標準版對標準版——GPT-Live-1 在綜合指數上贏得這場對決,而且差距不小。82.6 是屬於 Gemini 3.8 Live Extended Thinking 的,那是不同產品、不同價格、不同推出方案的東西。

Screenshot of the Artificial Analysis Speech to Speech leaderboard page, captured September 16, 2026. The AA-Speech to Speech Index bar chart shows Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 (Astra) at 81.5, Grok Voice Think Fast 2.0 at 81.3, GPT-Live-1 (Sol) at 80.1 and Gemini 3.8 Live at 76.0, alongside speed and cost-per-hour-of-input-audio panels.

GPT-Live-1 仍然領先的地方

全雙工不是行銷上的區別,而基準測試的拆分顯示出它在何處轉化為真正的優勢:

代理式效能 — GPT-Live-1 在 τ-Voice 上以 67.9% 決定性地領先 Grok 的 56.5%。Google 並未公布 Gemini 3.8 Live 可相比的 τ-Voice 數據,僅有 Extended Thinking 變體的 68.6%。

對話動態 — 全雙工的輪替發言仍是自然度的基準,而回合式模型在這方面歷來落後。

委派深度 — GPT-Live-1 會將困難的查詢交給前沿文字模型處理,文件中記載 GPT-5.5GPT-6 Astra 皆為其後端,並提供推理強度選擇器。

引用來源——ChatGPT 的語音逐字稿會附上引用連結,這在一般語音互動中仍相當罕見。

制衡點在於,GPT-Live-1 在原始語音推理上落後:在 Big Bench Audio 上為 90.1%,而 Grok 為 97.2%。此外,它在 Full Duplex Bench 上 0.798 秒的頭條延遲數字,與 API 的首次音訊時間是不同的量測方式,後者為 1.24–1.34 秒。

Gemini 3.8 Live 領先之處

Google 的優勢較不在於對話,而在於工作階段能做些什麼:

視覺,今日——Gemini 支援相機輸入與螢幕分享已有一段時間。GPT-Live-1 推出時並未提供視訊或螢幕分享功能,OpenAI 表示這些功能即將推出,並以較舊的 Advanced Voice Mode 作為權宜之計。Gemini 3.8 Live 則在此之上加入了近乎即時的視覺輸入處理。

語言涵蓋範圍 — 支援 97 種語言,並可在對話中途自動切換,相較之下 OpenAI 陣營的涵蓋範圍窄得多。

成本 — 公告費率為每分鐘音訊輸入 $0.005、每分鐘音訊輸出 $0.018。GPT-Live-1 僅前端部分即按每語音分鐘 $0.05 計費,計入後端權杖後,實測整體成本約為每小時 $4.47–$5.83。

會出聲推理的第二層級——Gemini 3.8 Live Extended Thinking 會以「讓我確認一下……」這類提示來描述進度,這是對沉默問題的另一種解答,與全雙工不同。

真正重要的成本比較

前端費率看起來像一場潰敗——每分鐘 $0.018 對上 $0.05——而每小時的數字更加懸殊。Artificial Analysis 的每小時輸入音訊成本圖表顯示 Gemini 3.8 Live 為 每小時 $1.50,相較之下 GPT-Realtime-2 High 為 $4.14,GPT-Realtime-2.1 High 為 $10.75。Grok Voice Think Fast 2.0 則是 $4.80。

問題在於,這兩個數字都不是真正的帳單。GPT-Live-1 每分鐘 0.05 美元只涵蓋語音前端;實際負責推理的後端文字模型則另行計費,這就是為什麼帳面上 0.05 美元的價格,全部算下來會變成每小時 4.47 至 5.83 美元。Gemini 3.8 Live 的結構如出一轍——背景工具執行屬於文字模型的工作——而 Google 並未公布這部分的成本。

所以,誠實的解讀是:Gemini 3.8 Live 在入門價格上便宜得多,而就總體成本比較而言,除非你衡量過自身的工作負載,否則兩者都是未知數。這不是推託;這就是資訊目前的實際狀態。

他們兩者都委派到的層

以下是讓這個對決不像表面上看起來那樣屬於鎖定式決策的結構性事實。兩個模型都會委派工作。GPT-Live-1 在設計上會把困難查詢交給後端文字模型,而 Gemini 那邊的背景工具執行則會化為一般的模型呼叫。在兩種情況下,語音前端都只是薄薄一層,架在負責推理的文字模型之上——而那個文字層正是成本變異所在,也是切換成本低廉之處。

OrcaRouter 提供190 個模型,只需單一金鑰,價格依供應商定價、不加收任何費用,因此上游一旦降價,當天就會反映到我們這邊,而不必等到下一次合約續約。就語音技術堆疊而言,真正重要的兩項特性是:委派目標可在即時流量中切換,且無須更動語音整合;以及當後端發生錯誤或逾時時,自動容錯移轉能讓通話維持不中斷。有一點必須澄清,因為很容易讓人以為相反:我們並不代管 Gemini 3.8 Live 或 GPT-Live-1 語音端點——那些來自供應商自家的 API。至於它們把工作交派處理的文字模型,一般都在路由器上。

Screenshot of the OrcaRouter model page for google/gemini-3.8-flash, showing the 1M-token context window, 65K max output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and p50 time to first token of 3.35 seconds.

如何選擇

選擇GPT-Live-1,如果對話品質就是產品本身——自然的插話處理、附和回應,以及那種你是在和某個東西對話,而不是在操作它的感覺——而且你能吸收總成本,這比表面費率所暗示的高出許多。請注意,它的 API 直到 2026 年 9 月才推出,因此環繞它的第三方工具生態還很年輕。

選擇Gemini 3.8 Live,如果你現在就需要視覺能力、需要超過二十幾種語言,或每分鐘成本是你模型選擇的主導考量。但要接受你買的是標準層級,它在綜合指數上排名第五而非第一,而且大家會引用的 82.6 是屬於 Extended Thinking 變體的數字。

Gemini 3.8 Live Extended Thinking——但先確認它的推出狀況,因為它經由 Gemini Live、Docs、Gmail 和 Keep 的發布途徑比標準模型更廣,而且企業版可用性仍處於私人預覽階段。

下一季值得關注的是,全雙工是否仍是一道護城河。回合制模型正透過另一條途徑縮小對話落差——在工作進行的同時,用旁白讓音訊保持忙碌——如果這在真實流量下依然成立,那麼一年來定義這個類別的架構差異,將不再是買家會追問的事。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新