一张主视觉标题卡,标题为“GPT-Live-1 对比 SeedRealtime”,副标题为“更雄心勃勃却无法调用的模型”,还有一行文字“在 API 中全面可用 对比 仅限豆包 App”,其上方是两个面板:左侧展示一个敞开的门洞,带有 API 方括号字形和“API”徽章,右侧展示同样的门洞,但横着一把挂锁,并带有“NO API”徽章;每个面板都带有一个音频和摄像头图标,将波形与光圈配对,角落还合成有 OrcaRouter 标志。
Guides & Insights

GPT-Live-1 对比 SeedRealtime:SeedRealtime 是更雄心勃勃的模型,而你买不到它

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在能力上比较 GPT-Live-1 和 SeedRealtime,会得出一个令人不安的答案,因为这两个模型并非在同一套条件下竞争。GPT-Live-1 是 OpenAI 的全双工语音模型,于 2026 年 7 月 8 日在 ChatGPT 内上线,并于 2026 年 9 月 10 日通过 Live Sessions API 向开发者开放,提供 12 种声音、已公布的每分钟费率,以及一个明显的缺口:明确不支持图像和视频输入。SeedRealtime 由字节跳动 Seed 团队于 2026 年 8 月 5 日发布,完全围绕这一缺口构建。它是一个原生音视频全双工模型,在单一端到端架构中同时观看、聆听和说话——而且它仅在豆包消费端应用内提供,没有公开 API,没有开源权重,没有技术报告,也没有公布参数规模。

每一个实际上能感知到什么

看清这一差距最简洁的方法,就是问每个模型对它所在的房间了解多少。

GPT-Live-1 能听。这就是全部的输入面。音频和文本输入,音频和文本输出,而 OpenAI 的文档将图像和视频列为不支持。它极其出色地处理了听觉的对话机制——它每秒多次决定是继续聆听、暂停、打断还是调用工具,并且它保持全双工,因此在说话时仍持续处理输入的音频。它还会在返回音频的同时返回语音识别转录文本,这是那种不起眼却能省下一周集成工作的细节。

SeedRealtime 能听也能看,靠的是单一模型而非流水线。ByteDance 描述了一种统一架构,将音频、视频与文本一并处理,并借助视觉语境消解歧义——区分同音词,从场景、手势、目光和先前的动作中理解“this”究竟指什么——同时让感知、理解、决策与表达并行运转,而非依次串行。ByteDance 公布的演示包括:一场嘈杂的群体晚餐,模型必须把声音与身份对应起来;一次博物馆参观;纠正一段浓缩咖啡的制作流程;以及在机场抑制干扰,同时保有屏幕外的记忆并进行在线查询。

• 输入 — GPT-Live-1 仅支持音频和文本,图像和视频明确不支持,而 SeedRealtime 将音频、视频和文本融合在一个模型中

• 话轮转换 —— GPT-Live-1 在内部自行决策,每秒多次;而 SeedRealtime 将话轮转换移入模型内部,并彻底移除了外部的语音活动检测器

• 主动行为 — {{1}}GPT-Live-1 会做出响应、委派任务并调用工具{{/1}};相比之下,{{2}}SeedRealtime 被描述为在目标物体出现在视野中时会主动发声{{/2}}

• 可用性 — GPT-Live-1 已在 Ope​nAI 的 API 中全面可用,每分钟 0.05 美元;而 SeedRealtime 在 Doubao 内免费,但没有 API,也没有推出 API 的时间表

A two-column comparison scoreboard titled 'GPT-Live-1 vs SeedRealtime - the scoreboard'. The GPT-Live-1 column lists Availability GA, published rate; Price $0.05 / minute; Inputs audio and text; Video understanding not supported; Tool calling delegated to backend model; Evidence vendor benchmarks, unreproduced. The SeedRealtime column lists Availability Doubao app only, no API; Price free in app, no developer price; Inputs audio, video and text; Video understanding core capability; Tool calling tool calls woven into responses; Evidence one human-eval claim, no methodology. A footer reads 'SeedRealtime has no published parameter count, no technical report and no independent benchmarks.'

证据质量与雄心呈反向关系

正是在这一点上,这种比较不再对字节跳动有利了。

OpenAI 公布了数字。这些数字是它自家的,比较的是 GPT-Live-1 与 GPT-Realtime-2.1,而不是与竞争对手对比,也没有任何独立实验室复现过——全双工交互性为 80.1% 对 45.4%,对话轮次切换延迟从 1.4 秒降至 0.8 秒,工具调用准确率从 60% 升至 87%。由厂商自行运行且未经复现,这确实是一个实打实的保留意见,而且至少是一个你能把它挂到某个具体数字上的保留意见。

ByteDance 几乎不公开任何内容。关于 SeedRealtime 的核心说法来自一项端到端人工评估,称其相比级联的 ASR 加视觉加 TTS 系统,将音视频对话节奏问题减半——更少在句子中途打断,更少在停顿后回复迟缓,更少因背景说话声而误触发。但没有样本量,没有方法论,没有改进幅度的确切数字,也完全没有延迟数据。同样没有参数规模,也没有技术报告。

结果是,那个架构更有意思的模型,恰恰是你最无法评估的那个。这并不等于说它表现更差——那些演示确实令人印象深刻,围绕分块音视频输入和流式生成的工程说明也表明,这是一个真实的系统,而不是一个演示——但这确实意味着,目前对这两者做任何质量上的比较,都是在拿一个有文档记录的模型和一个令人印象深刻的视频作比较。

为什么 API 缺口不是细节

SeedRealtime 自 2026 年 8 月 5 日起已在 Doubao 内全面上线,语音和视频均支持,且免费。它没有 Volcano Engine 或 BytePlus 端点,没有付费层级,没有公布配额,也没有公布开放开发者访问的时间表。ByteDance 的路线图提到更低延迟、更精准的说话人跟踪和工具连接型任务;但没有提到具体日期。

还有一个访问限制,使问题更加严重。Doubao 是一款中国大陆优先的产品,通常需要中国大陆手机号才能注册,且尚未公布本地化的英文版本。对于中国境外的团队来说,SeedRealtime 不仅尚未作为 API 推出——它作为产品也无法访问。

把这一点与 GPT-Live-1 自身的集成负担放在一起权衡,取舍就变得具体了。Ope​nAI 的 API 在某些方面范围之窄会令人意外:只有一个模型 ID,一个位于 v1/live/sessions 的端点,使用 WebRTC 传输并在数据通道上处理事件,而且无法通过 Chat Completions、Responses、Realtime、Batch 或微调端点接入。速率限制以并发会话数计——Tier 1 为 25,之后依次升至 50、200、300 和 500——而不是每分钟请求数,并且 Free 层级根本无法调用该模型。这是一种新的集成,而且仍然是你今天下午就能开始做的集成。

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

同一委托问题的两个答案

两个模型都否定了旧的级联设计——语音识别、语言模型和语音合成依次运行,每轮之间约有 1.7 秒的静默空白。它们否定它的方式不同,而这种差异会告诉你,哪一个是为电话通话打造的,哪一个是为房间打造的。

GPT-Live-1 按垂直方向拆分工作。一个快速的语音层负责维持对话;任何更重的任务——网页搜索、更深入的推理、智能体工作——都会通过 Responses API 交给一个独立的推理模型处理,而对话仍在继续。OpenAI 发布的 WebRTC 示例将该后端接入 GPT-5.6 Terra。这样一来,负责思考的那一半就是一次普通的文本模型调用,按 token 定价,因此你可以独立于语音层对其进行选择、替换和路由。对于客服热线而言,这样的形态正合适:语音是界面,推理是产品。

SeedRealtime 把所有东西都放在一个网络里,这正是它能在一个手势还处于句子中途时就去观察它的原因。也正是这一点让它无法被拆解——你没法替换推理的那一半,因为根本不存在推理的那一半;你也没法把它放到任何地方运行,因为没有任何地方可供运行。

如果你今天要构建一个语音智能体,这一区别就是全部决策所在。这两者中只有一个是可以放进架构里的组件。GPT-5.6 Terra——OpenAI 委派示例中的后端——通过 OrcaRouter 提供服务,价格为每百万输入 token 2.00 美元、每百万输出 token 12.00 美元,拥有 100 万 token 的上下文窗口,并同时开放 /v1/chat/completions 和 /v1/responses 接口——此外还可在同一把密钥下访问约 190 个其他模型,因此语音智能体背后的推理层可以拆分、定价和故障转移,而无需触动音频路径。GPT-Live-1 和 SeedRealtime 均不由 OrcaRouter 提供服务;它们是各自供应商的单一来源,任何路由器都无法改变这一点。

A screenshot of ByteDance Seed's official SeedRealtime product page in its English locale, showing the date August 5, 2026, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM', the description that it can jointly understand audio, visual and temporal information to deliver a watch, listen and speak experience, and an EN language toggle active in the header.

什么会改变答案

三件事,按可能性从高到低排列。

• 一个字节跳动的开发者 API。如果 SeedRealtime 出现在火山引擎或 BytePlus 上并公布定价,它就不再只是一个案例研究,而会成为一款真正具备差异化的产品——音视频全双工,且在西方没有任何托管竞争对手。这就是值得关注的信号,而它至今尚未出现。

• 视觉能力登陆托管式语音 API。GPT-Live-1 的文档明确指出图像和视频不受支持,这与其说是疏忽,不如说是有意划定的首发边界。如果 OpenAI 把它一直在 ChatGPT 其他场景中演示的视频功能正式推出,那么让 SeedRealtime 显得有趣的能力差距就会大幅收窄。

• 任何对 SeedRealtime 的独立测量。一个第三方的延迟数据或参数量,就能让两者在雄心之外的东西上进行比较。

对现在要动手开发的人来说,实际结论很简短。GPT-Live-1 是这两者中唯一可以部署的;按秒计费、每分钟 0.05 美元,提供十二种音色和一个有文档说明的端点,对于对话式语音来说,它是一个合理的默认选择。SeedRealtime 是更有趣的模型,也很可能是能力更强的那个;但就目前而言,它展示的是融合音视频架构可以是什么样子,而不是一个能直接放到客户面前的产品。把它归入“值得关注”之列,而不是“可以基于其构建”之列。