一張主視覺標題卡寫著「GPT-Live-1 vs SeedRealtime」,副標為「你無法呼叫、更具野心的模型」,並有一行「在 API 中正式可用,對比僅限 Doubao 應用程式」,其下方有兩個面板:左側顯示一扇敞開的門,帶有 API 括號字符與「API」徽章;右側顯示同一扇門,門上橫掛著掛鎖,並帶有「NO API」徽章;兩者各有一個音訊與相機圖示,將波形與光圈配對,角落則合成 OrcaRouter 標誌。
Guides & Insights

GPT-Live-1 對比 SeedRealtime:SeedRealtime 是更有野心的模型,而你買不到它

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

比較 GPT-Live-1 與 SeedRealtime 在能力上的表現,會得出一個令人不安的答案,因為這兩個模型並非在同一套標準下競爭。GPT-Live-1 是 OpenAI 的全雙工語音模型,於 2026 年 7 月 8 日在 ChatGPT 內推出,並於 2026 年 9 月 10 日透過 Live Sessions API 開放給開發者使用,具備 12 種語音、公開的每分鐘費率,以及一個明顯的缺口:明確不支援圖像與影片輸入。由字節跳動 Seed 團隊於 2026 年 8 月 5 日發布的 SeedRealtime,則完全圍繞這個缺口打造。它是一個原生音視訊全雙工模型,在單一端到端架構中同時觀看、聆聽與說話——而且它僅能在豆包消費者應用程式內使用,沒有公開 API、沒有開放權重、沒有技術報告,也沒有公布參數數量。

每一個實際上能感知到什麼

看清這個落差最簡潔的方法,就是問每個模型對自己所在的房間了解多少。

GPT-Live-1 聽得見。這就是它的全部輸入介面。音訊和文字進得去,音訊和文字出得來,而 OpenAI 的文件把圖像和影片列為不支援。它把「聽」的對話機制處理得極好——它每秒會決定好幾次是要繼續聆聽、暫停、打斷還是呼叫工具,而且它維持全雙工,所以在說話的同時仍會持續處理進來的音訊。它也會在音訊之外一併回傳語音辨識逐字稿,這種不起眼的細節,正是能省下一週整合工作的地方。

SeedRealtime 能聽也能看,靠的是單一模型,而不是層層串接的管線。ByteDance 描述了一套統一架構,能同時處理音訊、視訊與文字,並藉由視覺脈絡消解歧義——區分同音詞,從場景、手勢、目光與先前行動理解「這個」指的是什麼——同時讓感知、理解、決策與表達平行運行,而非依序進行。ByteDance 公開的展示案例包括:一場嘈雜的多人聚餐,模型必須把聲音與身分對應起來;一次博物館參訪;修正濃縮咖啡的沖煮流程;以及在機場中抑制干擾,同時保有鏡頭外的記憶並進行線上查詢。

• 輸入 — GPT-Live-1 僅支援音訊與文字,明確不支援圖像與影片;相較之下,SeedRealtime 將音訊、影片與文字融合於單一模型之中

• 輪替發言 — GPT-Live-1 每秒多次在內部自行決定,而 SeedRealtime 則將輪替發言移入模型內部,並完全移除外部語音活動偵測器

• 主動行為 — GPT-Live-1 會回應、委派並呼叫工具,而 SeedRealtime 則被描述為在目標物件出現在視野中時會未經提示地主動發言

• 可用性 —— GPT-Live-1 已在 Ope​nAI 的 API 中正式推出,每分鐘收費 0.05 美元;相較之下,SeedRealtime 在 Doubao 內免費提供,且沒有 API,也沒有推出 API 的時間表

A two-column comparison scoreboard titled 'GPT-Live-1 vs SeedRealtime - the scoreboard'. The GPT-Live-1 column lists Availability GA, published rate; Price $0.05 / minute; Inputs audio and text; Video understanding not supported; Tool calling delegated to backend model; Evidence vendor benchmarks, unreproduced. The SeedRealtime column lists Availability Doubao app only, no API; Price free in app, no developer price; Inputs audio, video and text; Video understanding core capability; Tool calling tool calls woven into responses; Evidence one human-eval claim, no methodology. A footer reads 'SeedRealtime has no published parameter count, no technical report and no independent benchmarks.'

證據品質與野心恰恰背道而馳。

這裡正是這種比較不再對 ByteDance 有利的地方。

Ope​nAI 公佈了數字。這些是他們自家的數字,他們是拿 GPT-Live-1 與 GPT-Realtime-2.1 相比,而不是與競爭對手相比,而且沒有獨立實驗室重現過這些數字——全雙工互動性為 80.1%,對比 45.4%;輪流發言延遲從 1.4 秒降至 0.8 秒;工具呼叫準確率從 60% 提升至 87%。由廠商自行執行且未經重現是一個真實的警語,而這至少是一個你可以附在某個數字上的警語。

字節跳動幾乎什麼都不發表。關於 SeedRealtime 的核心說法是,一項端到端的人工評估顯示,相較於串接式 ASR、視覺與 TTS 系統,它能將音視訊對話節奏問題減半——句子講到一半被打斷的情況更少、停頓後回覆遲緩的情況更少、背景雜談造成的誤觸發更少。但沒有樣本數、沒有方法論、沒有改善幅度的確切數字,也完全沒有延遲數據。此外也沒有參數量,也沒有技術報告。

結果是,架構更有趣的那個模型,反而是你最難以評估的。這並不等於說它表現較差——那些演示確實令人驚豔,而圍繞分塊音視覺輸入與串流生成所寫的工程說明,也顯示出這是一個真正的系統,而非單純的演示——但這確實意味著,目前要比較這兩者在品質上的高下,其實是在比較一個有文件記錄的模型與一段令人印象深刻的影片。

為什麼 API 落差不是細節

SeedRealtime 自 2026 年 8 月 5 日起已在豆包內全面推出,涵蓋語音與視訊,且完全免費。它沒有火山引擎或 BytePlus 端點,沒有付費方案,沒有公布配額,也沒有任何開放開發者取用的時間表。字節跳動的路線圖提到更低的延遲、更精準的發言者追蹤,以及可連接工具的任務;但並未提及日期。

有一項使用限制讓情況雪上加霜。Doubao 是中國大陸優先的產品,通常需要中國大陸手機號碼才能註冊,且未宣布推出在地化英文版。對中國境外的團隊而言,SeedRealtime 不只是尚未以 API 形式推出——連作為產品也無法觸及。

將這點與 GPT-Live-1 自身的整合負擔放在一起衡量,取捨就變得具體了。OpenAI 的 API 在若干方面狹窄得出乎人們意料:只有一個模型 ID、一個位於 v1/live/sessions 的端點、以 WebRTC 傳輸並在資料通道上處理事件,而且無法透過 Chat Completions、Responses、Realtime、Batch 或微調端點來使用。速率限制以並行工作階段計——Tier 1 為 25,一路提升至 50、200、300 和 500——而非以每分鐘請求數計,而 Free 方案則完全無法呼叫該模型。那是一項新的整合,而且仍是一項你今天下午就能開始的整合。

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

同一個委派問題的兩個答案

兩款模型都否定了舊有的串接式設計,也就是語音辨識、語言模型與語音合成依序運作,對話輪替之間約有 1.7 秒的寂靜空檔。它們否定的方式不同,而這個差異正說明了哪一款是為電話通話而生,哪一款是為室內空間而生。

GPT-Live-1 以垂直方式切分工作。一個快速的語音層負責維持對話;任何更吃重的工作——網頁搜尋、更深度的推理、代理式作業——都會在對話持續進行的同時,透過 Responses API 交給另一個獨立的推理模型處理。OpenAI 公開的 WebRTC 範例,就是把這個後端接上 GPT-5.6 Terra。結果是,負責思考的那一半不過是一次普通的文字模型呼叫,按 token 計價,因此你可以獨立於語音層之外去選擇、替換與路由它。對客服專線來說,這樣的形態是對的:語音是介面,推理才是產品。

SeedRealtime 把所有東西都放在同一個網路裡,這正是讓它能在話說到一半時查看手勢的原因。這同樣是它無法被拆解的原因——你無法替換推理的那一半,因為根本沒有推理的那一半;你也無法在任何地方執行它,因為根本沒有地方可以執行它。

如果你今天正在打造語音代理,這個區別就是全盤的決定。這兩者中只有一個是能夠放進架構裡的元件。GPT-5.6 Terra——也就是 OpenAI 委派範例中的後端——是透過 OrcaRouter 提供服務,價格為每百萬輸入詞元 2.00 美元、每百萬輸出詞元 12.00 美元,具備 1M 詞元的上下文,並同時提供 /v1/chat/completions 與 /v1/responses——此外還有同一把金鑰可使用約 190 個其他模型,因此語音代理背後的推理層級可以拆分、定價並進行容錯移轉,而不必更動音訊路徑。GPT-Live-1 與 SeedRealtime 都不是由 OrcaRouter 提供服務;它們各自來自自家供應商的單一來源,沒有任何路由器能改變這一點。

A screenshot of ByteDance Seed's official SeedRealtime product page in its English locale, showing the date August 5, 2026, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM', the description that it can jointly understand audio, visual and temporal information to deliver a watch, listen and speak experience, and an EN language toggle active in the header.

什麼會改變答案?

三件事,按可能性排序。

• 一個字節跳動的開發者 API。如果 SeedRealtime 出現在火山引擎或 BytePlus 上並公布價格,它就不再只是個案例研究,而會成為真正具差異化的產品——影音全雙工,且在西方沒有任何提供託管服務的競爭對手。這就是值得觀察的訊號,而它尚未出現。

• 視覺功能即將登陸託管語音 API。GPT-Live-1 的文件明確指出不支援圖像和影片,這與其說是疏忽,不如說是有意劃下的首發界線。如果 Ope​nAI 推出它一直在 ChatGPT 其他方面展示的影片介面,那麼讓 SeedRealtime 顯得有趣的能力差距就會大幅縮小。

• 任何對 SeedRealtime 的獨立測量。第三方的延遲數據或參數量,將能讓這兩者得以在野心以外的基礎上相互比較。

對現在想打造產品的人來說,實際結論很簡短。GPT-Live-1 是這兩者中唯一能部署的;以每秒計費、每分鐘 0.05 美元,具備十二種聲音與有文件記載的端點,對對話式語音而言是合理的預設選擇。SeedRealtime 是更有趣的模型,也很可能是能力更強的那個;但就目前而言,它更像是融合式影音架構樣貌的示範,而不是能直接推到客戶面前的產品。把它歸在「值得關注」,而非「可據以開發」。