
GPT-Live-1 对比 SeedRealtime:SeedRealtime 是更雄心勃勃的模型,而你买不到它
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百万 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
在能力上比较 GPT-Live-1 和 SeedRealtime,会得出一个令人不安的答案,因为这两个模型并非在同一套条件下竞争。GPT-Live-1 是 OpenAI 的全双工语音模型,于 2026 年 7 月 8 日在 ChatGPT 内上线,并于 2026 年 9 月 10 日通过 Live Sessions API 向开发者开放,提供 12 种声音、已公布的每分钟费率,以及一个明显的缺口:明确不支持图像和视频输入。SeedRealtime 由字节跳动 Seed 团队于 2026 年 8 月 5 日发布,完全围绕这一缺口构建。它是一个原生音视频全双工模型,在单一端到端架构中同时观看、聆听和说话——而且它仅在豆包消费端应用内提供,没有公开 API,没有开源权重,没有技术报告,也没有公布参数规模。
每一个实际上能感知到什么
看清这一差距最简洁的方法,就是问每个模型对它所在的房间了解多少。
GPT-Live-1 能听。这就是全部的输入面。音频和文本输入,音频和文本输出,而 OpenAI 的文档将图像和视频列为不支持。它极其出色地处理了听觉的对话机制——它每秒多次决定是继续聆听、暂停、打断还是调用工具,并且它保持全双工,因此在说话时仍持续处理输入的音频。它还会在返回音频的同时返回语音识别转录文本,这是那种不起眼却能省下一周集成工作的细节。
SeedRealtime 能听也能看,靠的是单一模型而非流水线。ByteDance 描述了一种统一架构,将音频、视频与文本一并处理,并借助视觉语境消解歧义——区分同音词,从场景、手势、目光和先前的动作中理解“this”究竟指什么——同时让感知、理解、决策与表达并行运转,而非依次串行。ByteDance 公布的演示包括:一场嘈杂的群体晚餐,模型必须把声音与身份对应起来;一次博物馆参观;纠正一段浓缩咖啡的制作流程;以及在机场抑制干扰,同时保有屏幕外的记忆并进行在线查询。
• 输入 — GPT-Live-1 仅支持音频和文本,图像和视频明确不支持,而 SeedRealtime 将音频、视频和文本融合在一个模型中
• 话轮转换 —— GPT-Live-1 在内部自行决策,每秒多次;而 SeedRealtime 将话轮转换移入模型内部,并彻底移除了外部的语音活动检测器
• 主动行为 — {{1}}GPT-Live-1 会做出响应、委派任务并调用工具{{/1}};相比之下,{{2}}SeedRealtime 被描述为在目标物体出现在视野中时会主动发声{{/2}}
• 可用性 — GPT-Live-1 已在 OpenAI 的 API 中全面可用,每分钟 0.05 美元;而 SeedRealtime 在 Doubao 内免费,但没有 API,也没有推出 API 的时间表

证据质量与雄心呈反向关系
正是在这一点上,这种比较不再对字节跳动有利了。
OpenAI 公布了数字。这些数字是它自家的,比较的是 GPT-Live-1 与 GPT-Realtime-2.1,而不是与竞争对手对比,也没有任何独立实验室复现过——全双工交互性为 80.1% 对 45.4%,对话轮次切换延迟从 1.4 秒降至 0.8 秒,工具调用准确率从 60% 升至 87%。由厂商自行运行且未经复现,这确实是一个实打实的保留意见,而且至少是一个你能把它挂到某个具体数字上的保留意见。
ByteDance 几乎不公开任何内容。关于 SeedRealtime 的核心说法来自一项端到端人工评估,称其相比级联的 ASR 加视觉加 TTS 系统,将音视频对话节奏问题减半——更少在句子中途打断,更少在停顿后回复迟缓,更少因背景说话声而误触发。但没有样本量,没有方法论,没有改进幅度的确切数字,也完全没有延迟数据。同样没有参数规模,也没有技术报告。
结果是,那个架构更有意思的模型,恰恰是你最无法评估的那个。这并不等于说它表现更差——那些演示确实令人印象深刻,围绕分块音视频输入和流式生成的工程说明也表明,这是一个真实的系统,而不是一个演示——但这确实意味着,目前对这两者做任何质量上的比较,都是在拿一个有文档记录的模型和一个令人印象深刻的视频作比较。
为什么 API 缺口不是细节
SeedRealtime 自 2026 年 8 月 5 日起已在 Doubao 内全面上线,语音和视频均支持,且免费。它没有 Volcano Engine 或 BytePlus 端点,没有付费层级,没有公布配额,也没有公布开放开发者访问的时间表。ByteDance 的路线图提到更低延迟、更精准的说话人跟踪和工具连接型任务;但没有提到具体日期。
还有一个访问限制,使问题更加严重。Doubao 是一款中国大陆优先的产品,通常需要中国大陆手机号才能注册,且尚未公布本地化的英文版本。对于中国境外的团队来说,SeedRealtime 不仅尚未作为 API 推出——它作为产品也无法访问。
把这一点与 GPT-Live-1 自身的集成负担放在一起权衡,取舍就变得具体了。OpenAI 的 API 在某些方面范围之窄会令人意外:只有一个模型 ID,一个位于 v1/live/sessions 的端点,使用 WebRTC 传输并在数据通道上处理事件,而且无法通过 Chat Completions、Responses、Realtime、Batch 或微调端点接入。速率限制以并发会话数计——Tier 1 为 25,之后依次升至 50、200、300 和 500——而不是每分钟请求数,并且 Free 层级根本无法调用该模型。这是一种新的集成,而且仍然是你今天下午就能开始做的集成。

同一委托问题的两个答案
两个模型都否定了旧的级联设计——语音识别、语言模型和语音合成依次运行,每轮之间约有 1.7 秒的静默空白。它们否定它的方式不同,而这种差异会告诉你,哪一个是为电话通话打造的,哪一个是为房间打造的。
GPT-Live-1 按垂直方向拆分工作。一个快速的语音层负责维持对话;任何更重的任务——网页搜索、更深入的推理、智能体工作——都会通过 Responses API 交给一个独立的推理模型处理,而对话仍在继续。OpenAI 发布的 WebRTC 示例将该后端接入 GPT-5.6 Terra。这样一来,负责思考的那一半就是一次普通的文本模型调用,按 token 定价,因此你可以独立于语音层对其进行选择、替换和路由。对于客服热线而言,这样的形态正合适:语音是界面,推理是产品。
SeedRealtime 把所有东西都放在一个网络里,这正是它能在一个手势还处于句子中途时就去观察它的原因。也正是这一点让它无法被拆解——你没法替换推理的那一半,因为根本不存在推理的那一半;你也没法把它放到任何地方运行,因为没有任何地方可供运行。
如果你今天要构建一个语音智能体,这一区别就是全部决策所在。这两者中只有一个是可以放进架构里的组件。GPT-5.6 Terra——OpenAI 委派示例中的后端——通过 OrcaRouter 提供服务,价格为每百万输入 token 2.00 美元、每百万输出 token 12.00 美元,拥有 100 万 token 的上下文窗口,并同时开放 /v1/chat/completions 和 /v1/responses 接口——此外还可在同一把密钥下访问约 190 个其他模型,因此语音智能体背后的推理层可以拆分、定价和故障转移,而无需触动音频路径。GPT-Live-1 和 SeedRealtime 均不由 OrcaRouter 提供服务;它们是各自供应商的单一来源,任何路由器都无法改变这一点。

什么会改变答案
三件事,按可能性从高到低排列。
• 一个字节跳动的开发者 API。如果 SeedRealtime 出现在火山引擎或 BytePlus 上并公布定价,它就不再只是一个案例研究,而会成为一款真正具备差异化的产品——音视频全双工,且在西方没有任何托管竞争对手。这就是值得关注的信号,而它至今尚未出现。
• 视觉能力登陆托管式语音 API。GPT-Live-1 的文档明确指出图像和视频不受支持,这与其说是疏忽,不如说是有意划定的首发边界。如果 OpenAI 把它一直在 ChatGPT 其他场景中演示的视频功能正式推出,那么让 SeedRealtime 显得有趣的能力差距就会大幅收窄。
• 任何对 SeedRealtime 的独立测量。一个第三方的延迟数据或参数量,就能让两者在雄心之外的东西上进行比较。
对现在要动手开发的人来说,实际结论很简短。GPT-Live-1 是这两者中唯一可以部署的;按秒计费、每分钟 0.05 美元,提供十二种音色和一个有文档说明的端点,对于对话式语音来说,它是一个合理的默认选择。SeedRealtime 是更有趣的模型,也很可能是能力更强的那个;但就目前而言,它展示的是融合音视频架构可以是什么样子,而不是一个能直接放到客户面前的产品。把它归入“值得关注”之列,而不是“可以基于其构建”之列。
