
Muse Realtime Avatar 对比 SeedRealtime:两款只能观看的模型
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 180 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
这两者都没有价目表。Muse Realtime Avatar由 Meta 于 2026 年 9 月 23 日在 Meta Connect 上发布,没有 API、没有端点、没有价格,也没有发布日期——它只是 Meta 的 Muse 智能体的一项能力,在一篇题为“Bringing Your Muse to Life”的研究文章中进行了展示。SeedRealtime由字节跳动 Seed 于 2026 年 8 月 5 日发布,没有 API、没有权重、没有技术报告,也没有参数规模——它只存在于字节跳动自家的豆包 App 之中,而字节跳动的公告只说它已“全面上线”。全球最大的两家消费级 AI 公司在相隔七周内先后推出了音视频实时系统,而这两者都买不到。这才是值得比较的地方,而且它比那张谁也造不出来的基准测试表格有趣得多。
二者的区别在于视频流动的方向。SeedRealtime 负责观看、聆听,并谈论它所看到的内容——音频、视频和文本输入同一个端到端网络,轮流发言机制从外部语音活动检测器移入模型本身。Muse Realtime Avatar 负责生成:你交给它一张参考图像——一张照片、一幅插画或一个物体——它便会在整段对话期间以连续视频渲染那个对象说话和做手势。SeedRealtime 的视频是输入。Muse Realtime Avatar 的视频是输出。两者都被描述为全双工,两者都是音视频,却用同一个标签做着相反的工作。
每一部分是什么,以及它位于何处
六行,而真正起决定作用的是最后两行。
• 视频 —— 它由 Muse Realtime Avatar 生成,采用 448×768 竖屏分辨率和每秒 25 帧,并叠加透明水印,以便观看者能看出这并非摄像头画面;SeedRealtime 则负责感知它,将帧流式传输到处理音频的同一网络中。
• 架构层面的押注——Muse Realtime Avatar 让语音与视频共用同一条 token 流,因此由音频驱动的 Diffusion Transformer 直接消费 Muse Realtime Voice 的语音 token,事后无需再做任何唇形同步;SeedRealtime 则把话轮转换内化进模型本身,谁在何时开口不再由外部的语音活动检测器来裁定。
• 运行位置 —— Muse Realtime Avatar 是 Meta 旗下 Muse 智能体中的一项能力;SeedRealtime 则内置于 ByteDance 的 Doubao 应用中。
• 开发者访问——两者都没有 API。两者都不公开模型权重。既没有无服务器方案,也没有托管端点,更没有承载其中任何一个的第三方平台。
• 价格 — 双方均未公布,因为两边都没有商业报价。
• 独立评估——两个系统均无。两家公司发布的关于各自模型的每一个数字都是第一方数据,没有任何外部评估者运行过其中任何一个。
两个证据基础,均为第一方,而且其中一个要单薄得多
到这里,比较就不再对称了。Meta 为 Muse Realtime Avatar 公布了四项数字,全部由公司自己报告,对照的是 Meta 自行选择的基线,没有一项在公司外部得到复现:从你这一轮结束到同步语音与视频回复首字节为 870 毫秒;448×768 竖屏视频,25 帧/秒;模型评估次数比其自身基线少 60 倍;以及单块 NVIDIA GB200 上 12 路并发实时会话——借助 4 位量化感知训练和延迟感知动态批处理,相比 Meta 的两步 BF16 基线实现了 8 倍容量提升。Meta 还发布了一项与两个商业虚拟形象系统的偏好比较——对一个为 78/22,对另一个为 88/12——并披露在举止神态方面,与其中一个的结果在统计上与持平无法区分。这一披露比那些胜出更有价值;这是大多数发布帖都会略去的那类结果。
SeedRealtime 已公布的证据只有一项端到端人工评估。ByteDance 表示,相较于级联系统——将视觉模型连接到 ASR 模型,再连接到 LLM,再连接到文本转语音声音——SeedRealtime 将音视频对话节奏问题减半,截断更少、误触发更少,回复更慢、更自然。ByteDance 未公布的是样本量、方法论、标注员人数、以毫秒计的延迟数据、基准名称或分数。一份二手报告援引称,相较于该团队此前的模型,对话流畅度提升了 12%。这就是整个公开证据基础。
所以,对可验证性进行诚实排名,结果如下:两者都没有独立运行;Meta 的是一组测量结果,带有已声明的基线,并披露了一个负面结果;ByteDance 的则是一个单一的偏好声明,其设计未被描述。两者都不可复现,但只有一个具体到足以进行辩驳。

各自做出的举动
这两个系统是同一个问题的答案,而看到这两个答案不同,是值得的。
对于一个持续观察的系统而言,最难的部分是知道何时开口。一个持续接收摄像头画面和音频的模型,必须在没有外部触发的情况下判断:面前的人是否已经说完、自己是否被搭话,以及刚刚进入画面的物体是否相关。这正是 SeedRealtime 搬进模型内部去解决的问题,而 ByteDance 是在三种模态、而非两种模态上完成了这一跨越——相比 Google、OpenAI 和 NVIDIA 各自仅针对音频所做的,这是更难的一个版本。演示中的种种行为也由此而来:在多人对话中把某个声音与某张脸对应起来,在有东西进入画面时不待提示便主动开口,引导某人参观博物馆或进行维修。
对于一个进行渲染的系统来说,最难的部分是保持连贯。以简短的因果片段生成视频意味着每个片段都以上一个片段为条件,而失败模式是漂移——到了第三分钟,角色已经悄然变成了另一个人。Meta 对近期视频潜变量采用的滚动窗口正是对此的解答,而共享的 token 流则是对另一种失败的解答,即先生成音频、再在其上运行口型同步模型时得到的配音感。
这两种做法在另一个系统中都不可行。SeedRealtime 没有需要忠实还原的参考图像,因为它并不渲染任何人。Muse Realtime Avatar 没有需要追踪的外部世界,因为它的全部工作就是生成一张与声音匹配的脸。

为什么一个无法调用的模型仍然是一个路由问题
这两个系统都进行委托。Muse Realtime Avatar 构建在 Muse Realtime Voice 之上,而后者是一个智能体的对话层,该智能体的推理运行在 Muse Spark 上——模型负责渲染,而不是思考。SeedRealtime 的设计让对话在后台工作发生的同时继续进行,这意味着超出其内联处理能力的工作会转到别处,然后再回来。在这两种架构中,用户与之交互的都是一个前端,而智能则是其背后的一个独立文本模型。
那个独立的文本模型就是普通推理,而且它是整套技术栈中你真正能买到的部分。在 OrcaRouter 上,它是一个端点,覆盖 来自 15 家提供商的 196 个模型,按提供商标价原样透传、零加价,并且当你选择的模型出错或超时时会自动故障转移。我们不托管 SeedRealtime——它属于 ByteDance,在 Doubao 内部,没有什么可路由的。我们也不托管 Muse Realtime Avatar,其他任何人也不托管。我们承载的,是这两个系统将其繁重工作交给的那一层,也就是当你希望由另一个模型来思考时会发生变化的那一层。
什么会改变答案
对于 SeedRealtime 而言,缺失的一环并不是某项功能——而是证据。一份包含参数量、基准测试套件以及有详细描述的人类评估的技术报告,会把它从“应用内的一个演示”提升为团队可以据此进行判断的东西。ByteDance 的帖子还链接到泛泛的“Try Dola”和“Try in Playground”目标页面,却没有声称提供模型权重或一套有文档记录的 API,这属于产品功能的模式,而不是模型发布的模式。
对于 Muse Realtime Avatar,缺失的一环在于商业层面:一份价目表、一个端点、一个日期,以及 Meta 尚未完全明确的地区和年龄条款。Meta 的帖子指出,其演示并不都反映 Muse 应用中可用的虚拟形象,而这句话应当成为任何围绕此制定的计划的准绳。
在其中一项发生改变之前,这个比较的形式短得出奇。两个模型都是视听模型,都是全双工,都是真正令人惊叹的工程作品,而且正在读这段话的人都无法从终端调用其中任何一个。区别在于,如果你能调用它们,你会拿它们做什么:一个给你一个会说话的角色,另一个给你一个会察觉的系统。

