
GPT-Live-1 對比 SeedRealtime:SeedRealtime 是更有野心的模型,而你買不到它
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百萬 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
比較 GPT-Live-1 與 SeedRealtime 在能力上的表現,會得出一個令人不安的答案,因為這兩個模型並非在同一套標準下競爭。GPT-Live-1 是 OpenAI 的全雙工語音模型,於 2026 年 7 月 8 日在 ChatGPT 內推出,並於 2026 年 9 月 10 日透過 Live Sessions API 開放給開發者使用,具備 12 種語音、公開的每分鐘費率,以及一個明顯的缺口:明確不支援圖像與影片輸入。由字節跳動 Seed 團隊於 2026 年 8 月 5 日發布的 SeedRealtime,則完全圍繞這個缺口打造。它是一個原生音視訊全雙工模型,在單一端到端架構中同時觀看、聆聽與說話——而且它僅能在豆包消費者應用程式內使用,沒有公開 API、沒有開放權重、沒有技術報告,也沒有公布參數數量。
每一個實際上能感知到什麼
看清這個落差最簡潔的方法,就是問每個模型對自己所在的房間了解多少。
GPT-Live-1 聽得見。這就是它的全部輸入介面。音訊和文字進得去,音訊和文字出得來,而 OpenAI 的文件把圖像和影片列為不支援。它把「聽」的對話機制處理得極好——它每秒會決定好幾次是要繼續聆聽、暫停、打斷還是呼叫工具,而且它維持全雙工,所以在說話的同時仍會持續處理進來的音訊。它也會在音訊之外一併回傳語音辨識逐字稿,這種不起眼的細節,正是能省下一週整合工作的地方。
SeedRealtime 能聽也能看,靠的是單一模型,而不是層層串接的管線。ByteDance 描述了一套統一架構,能同時處理音訊、視訊與文字,並藉由視覺脈絡消解歧義——區分同音詞,從場景、手勢、目光與先前行動理解「這個」指的是什麼——同時讓感知、理解、決策與表達平行運行,而非依序進行。ByteDance 公開的展示案例包括:一場嘈雜的多人聚餐,模型必須把聲音與身分對應起來;一次博物館參訪;修正濃縮咖啡的沖煮流程;以及在機場中抑制干擾,同時保有鏡頭外的記憶並進行線上查詢。
• 輸入 — GPT-Live-1 僅支援音訊與文字,明確不支援圖像與影片;相較之下,SeedRealtime 將音訊、影片與文字融合於單一模型之中
• 輪替發言 — GPT-Live-1 每秒多次在內部自行決定,而 SeedRealtime 則將輪替發言移入模型內部,並完全移除外部語音活動偵測器
• 主動行為 — GPT-Live-1 會回應、委派並呼叫工具,而 SeedRealtime 則被描述為在目標物件出現在視野中時會未經提示地主動發言
• 可用性 —— GPT-Live-1 已在 OpenAI 的 API 中正式推出,每分鐘收費 0.05 美元;相較之下,SeedRealtime 在 Doubao 內免費提供,且沒有 API,也沒有推出 API 的時間表

證據品質與野心恰恰背道而馳。
這裡正是這種比較不再對 ByteDance 有利的地方。
OpenAI 公佈了數字。這些是他們自家的數字,他們是拿 GPT-Live-1 與 GPT-Realtime-2.1 相比,而不是與競爭對手相比,而且沒有獨立實驗室重現過這些數字——全雙工互動性為 80.1%,對比 45.4%;輪流發言延遲從 1.4 秒降至 0.8 秒;工具呼叫準確率從 60% 提升至 87%。由廠商自行執行且未經重現是一個真實的警語,而這至少是一個你可以附在某個數字上的警語。
字節跳動幾乎什麼都不發表。關於 SeedRealtime 的核心說法是,一項端到端的人工評估顯示,相較於串接式 ASR、視覺與 TTS 系統,它能將音視訊對話節奏問題減半——句子講到一半被打斷的情況更少、停頓後回覆遲緩的情況更少、背景雜談造成的誤觸發更少。但沒有樣本數、沒有方法論、沒有改善幅度的確切數字,也完全沒有延遲數據。此外也沒有參數量,也沒有技術報告。
結果是,架構更有趣的那個模型,反而是你最難以評估的。這並不等於說它表現較差——那些演示確實令人驚豔,而圍繞分塊音視覺輸入與串流生成所寫的工程說明,也顯示出這是一個真正的系統,而非單純的演示——但這確實意味著,目前要比較這兩者在品質上的高下,其實是在比較一個有文件記錄的模型與一段令人印象深刻的影片。
為什麼 API 落差不是細節
SeedRealtime 自 2026 年 8 月 5 日起已在豆包內全面推出,涵蓋語音與視訊,且完全免費。它沒有火山引擎或 BytePlus 端點,沒有付費方案,沒有公布配額,也沒有任何開放開發者取用的時間表。字節跳動的路線圖提到更低的延遲、更精準的發言者追蹤,以及可連接工具的任務;但並未提及日期。
有一項使用限制讓情況雪上加霜。Doubao 是中國大陸優先的產品,通常需要中國大陸手機號碼才能註冊,且未宣布推出在地化英文版。對中國境外的團隊而言,SeedRealtime 不只是尚未以 API 形式推出——連作為產品也無法觸及。
將這點與 GPT-Live-1 自身的整合負擔放在一起衡量,取捨就變得具體了。OpenAI 的 API 在若干方面狹窄得出乎人們意料:只有一個模型 ID、一個位於 v1/live/sessions 的端點、以 WebRTC 傳輸並在資料通道上處理事件,而且無法透過 Chat Completions、Responses、Realtime、Batch 或微調端點來使用。速率限制以並行工作階段計——Tier 1 為 25,一路提升至 50、200、300 和 500——而非以每分鐘請求數計,而 Free 方案則完全無法呼叫該模型。那是一項新的整合,而且仍是一項你今天下午就能開始的整合。

同一個委派問題的兩個答案
兩款模型都否定了舊有的串接式設計,也就是語音辨識、語言模型與語音合成依序運作,對話輪替之間約有 1.7 秒的寂靜空檔。它們否定的方式不同,而這個差異正說明了哪一款是為電話通話而生,哪一款是為室內空間而生。
GPT-Live-1 以垂直方式切分工作。一個快速的語音層負責維持對話;任何更吃重的工作——網頁搜尋、更深度的推理、代理式作業——都會在對話持續進行的同時,透過 Responses API 交給另一個獨立的推理模型處理。OpenAI 公開的 WebRTC 範例,就是把這個後端接上 GPT-5.6 Terra。結果是,負責思考的那一半不過是一次普通的文字模型呼叫,按 token 計價,因此你可以獨立於語音層之外去選擇、替換與路由它。對客服專線來說,這樣的形態是對的:語音是介面,推理才是產品。
SeedRealtime 把所有東西都放在同一個網路裡,這正是讓它能在話說到一半時查看手勢的原因。這同樣是它無法被拆解的原因——你無法替換推理的那一半,因為根本沒有推理的那一半;你也無法在任何地方執行它,因為根本沒有地方可以執行它。
如果你今天正在打造語音代理,這個區別就是全盤的決定。這兩者中只有一個是能夠放進架構裡的元件。GPT-5.6 Terra——也就是 OpenAI 委派範例中的後端——是透過 OrcaRouter 提供服務,價格為每百萬輸入詞元 2.00 美元、每百萬輸出詞元 12.00 美元,具備 1M 詞元的上下文,並同時提供 /v1/chat/completions 與 /v1/responses——此外還有同一把金鑰可使用約 190 個其他模型,因此語音代理背後的推理層級可以拆分、定價並進行容錯移轉,而不必更動音訊路徑。GPT-Live-1 與 SeedRealtime 都不是由 OrcaRouter 提供服務;它們各自來自自家供應商的單一來源,沒有任何路由器能改變這一點。

什麼會改變答案?
三件事,按可能性排序。
• 一個字節跳動的開發者 API。如果 SeedRealtime 出現在火山引擎或 BytePlus 上並公布價格,它就不再只是個案例研究,而會成為真正具差異化的產品——影音全雙工,且在西方沒有任何提供託管服務的競爭對手。這就是值得觀察的訊號,而它尚未出現。
• 視覺功能即將登陸託管語音 API。GPT-Live-1 的文件明確指出不支援圖像和影片,這與其說是疏忽,不如說是有意劃下的首發界線。如果 OpenAI 推出它一直在 ChatGPT 其他方面展示的影片介面,那麼讓 SeedRealtime 顯得有趣的能力差距就會大幅縮小。
• 任何對 SeedRealtime 的獨立測量。第三方的延遲數據或參數量,將能讓這兩者得以在野心以外的基礎上相互比較。
對現在想打造產品的人來說,實際結論很簡短。GPT-Live-1 是這兩者中唯一能部署的;以每秒計費、每分鐘 0.05 美元,具備十二種聲音與有文件記載的端點,對對話式語音而言是合理的預設選擇。SeedRealtime 是更有趣的模型,也很可能是能力更強的那個;但就目前而言,它更像是融合式影音架構樣貌的示範,而不是能直接推到客戶面前的產品。把它歸在「值得關注」,而非「可據以開發」。
