
Muse 实时虚拟形象:Meta 为旗下 Muse 智能体赋予面孔,每轮仅需 870 毫秒
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 180 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
Meta 选择用来打头阵的数字是 870 毫秒。这就是 Muse Realtime Avatar按照 Meta 自己的测量所需的时长:从你停止说话的那一刻,到一段同步语音与视频回复的第一个字节抵达的那一刻。对于一个必须生成视频的系统来说,这是一个确实激进的数字,而且它值得被精确解读——因为关于 Meta 这个新的具身模型,几乎所有有趣之处,都存在于这个数字所衡量的内容与人们会以为它所衡量的内容之间的落差之中。
Muse Realtime Avatar 于 2026 年 9 月 23 日在 Meta Connect 上发布,Meta Superintelligence Labs 当天在一篇题为“Bringing Your Muse to Life”的研究文章中对其进行了介绍。它扩展了Muse Realtime Voice,即 Meta 的 Muse 智能体内部的对话层,并赋予其一个身体。它并非一个配备通用头像的聊天机器人:你交给它一张参考图像——一张照片、一幅全身插画、一只动物、一件家居物品——它便能在整段对话期间以连续视频渲染出那个对象说话、做手势、变换姿态。Zuckerberg 在台上表示,他自己的 Muse 所附带的虚拟形象名叫 Jolly。
一个共享的令牌流,而非一次口型同步处理
架构是最值得理解的部分,因为它解释了为什么 Meta 一直说“具身化”而不是“虚拟化身”。Muse Realtime Voice 会生成一串语音 token——帖子称其为 VQs——这些 token 既承载所说内容,也承载其韵律:节奏、强调、起伏。Muse Realtime Avatar 消费同一串流。它是一个由音频驱动的 Diffusion Transformer,以那些语音 token、你提供的参考媒体,以及近期视频潜变量的滚动窗口为条件,并以短小的因果块生成视频,将每个新的潜变量向前传递,作为下一个潜变量的运动上下文。
共享同一个 token 流,正是让语音、唇部动作与表情紧密锁定在一起的关键。另一种做法——先生成音频,再用一个独立的唇形同步模型套上去——是大多数虚拟人行业的通行方式,也正是为什么那么多虚拟人看起来像是在被配音。Meta 的设计从构造上就消除了这道接缝。滚动潜变量窗口是这个思路的另一半:没有它,基于分块的生成器会发生漂移,到第三分钟时,你的角色已经悄然变成了另一个人。

四个已公布的数字,以及每个数字实际衡量的内容
Meta 发布的数据比通常附在一项消费级功能上的研究文章要多。下面四项均为公司自行报告,由 Meta 按照其自行选择的基准进行衡量;其中没有任何一项在公司外部得到复现。
• 从一轮发言结束到首字节为 870 毫秒。这是一个响应启动指标。它不是完成整条回复所需的时间,也不是整通通话其余部分的持续传输延迟。一个系统即使首字节达到 870 毫秒,到了第 12 秒仍可能让人感觉迟钝。Meta 的帖子明确指出这是首字节指标;省略这一限定的报道把它当成了端到端响应能力,而事实并非如此。
• 448×768 竖屏视频,每秒 25 帧。这是一个竖长手机形状的画幅,而非横向画幅,且 25 fps 具有电影感而非流畅感——这是电影的标准帧率,低于原生摄像头画面所能提供的 30 fps 或 60 fps。Meta 表示,演示画面会叠加一层透明水印,以便接收者能看出自己看到的并非普通摄像头画面。
• 模型评估次数减少 60 倍。下文将对此作恰当说明,因为这是最容易被误读的数字。
• 单块 NVIDIA GB200 即可支持 12 个并发实时会话。Meta 报告称,其服务工作——持久化 KV 缓存、缓存感知路由、延迟感知动态批处理、4 位量化感知训练、融合内核和 CUDA Graph 捕获,这些均与 NVIDIA 共同开发——将容量提升至其自身两步 BF16 基线的 8 倍。背后的算术很清晰:每个生成步骤产生八帧,即 320 毫秒的播放时长,而模型耗时为 20 毫秒,也就是每帧 2.5 毫秒。无论是 12 还是 8 倍,都是相较于 Meta 指定的基线,而不是与其他厂商的硬件做对比。
为什么60×不是快60倍
这个压缩说法将被重复得最多,也被理解得最少。Meta 的教师模型是一个带三路无分类器引导的 40 步扩散模型——每一步三次传递,因此生成一段视频需要 120 次模型评估。学生模型是一个无引导的两步因果模型,带有固定长度的 KV 缓存,通过蒸馏和自我强制训练,同一段视频只需要两次评估。用 Meta 的话说,这相当于每段视频的评估次数减少了 60 倍,同时质量接近教师模型。
这是按块进行的计算量削减。评估次数只有原来的六十分之一,并不意味着用户的等待时间也会缩短到六十分之一,因为在蒸馏之前,延迟就有其他贡献因素,蒸馏之后依然如此。Meta 自己帖子中的图表显示了这种削减在质量方面换来了什么:人类偏好从 45% 上升到 55%。这才是这个故事诚实的版本——蒸馏的目的是让系统至少能够实时运行,而质量代价被控制在约十个百分点的偏好差距,而不是被消除。
评估,包括那个结果却相反的情况
Meta 针对两个商用虚拟形象系统进行了测试,Runway Characters和HeyGen LiveAvatar,测试中使用了相匹配的虚拟形象身份,以便评分者比较的是动画本身,而非角色设计。评分者与每个系统进行了两到三分钟的实时对话,随后比较了视觉质量、同步性、角色一致性和举止神态。
Meta 报告称,相较 Runway Characters 以 78% 对 22% 更受青睐,相较 HeyGen LiveAvatar 以 88% 对 12% 更受青睐,并且在每一个评估维度上都更受青睐。随后,这篇文章做了一件大多数供应商评估不会做的事:它披露,与 Runway Characters 的举止神态对比在统计上与持平无法区分。一场全面胜出中的一次打平是件小事,但正是这个细节告诉你,这场全面胜出是如实报告的,而非被刻意挑选出来的。
测试的局限比平局本身更重要。两三分钟不过是一段简短的对话。评分者是 Meta 的人。而且帖子本身也提醒说,其演示“展示的是模型能力,并不都反映 Muse 应用中可用的虚拟形象”——这等于研究团队直白地表示,你观看的视频并不一定就是你将获得的产品。
你不能用它做什么
Muse Realtime Avatar 没有 API。没有价格,没有费率表,没有等候名单,也没有发布日期。Meta 没有说明用户或开发者何时能够使用它。18 岁及以上的 Muse 应用是它唯一将要登陆的界面,而这个虚拟形象正与 Muse 的其他一系列功能一同到来——语音定制、Muse 电子邮件地址、Mac 电脑控制、眼镜集成——这些功能各有各的时间表,其中一些被称为“未来几个月”。
这里真正重要的比较,并不是与 Runway 或 HeyGen 比,而是与 Muse 技术栈中的其余部分比。Muse Spark,也就是该智能体所运行的推理模型,自 Meta 通过 Meta Model API 将其开放以来,就一直可供开发者使用;而 Muse Spark 1.2 通过 OrcaRouter 以 meta/muse-spark-1.2 的形式提供服务,价格为每百万输入 token 1.25 美元、每百万输出 token 4.25 美元,供应商标价,零加价,处于一个已经接受文本、图像、视频、音频和文件的百万 token 上下文窗口内。这是 Muse 中你今天就能调用的部分。而门面那部分,则是你无法调用的。
如果你正在筹划任何事情,这种不对称就值得你好好琢磨。一个在视频通话中进行推理的智能体,和一个出现在视频通话中的智能体,是约束条件各不相同的两种产品,而其中只有一种会出现在价目表上。

接下来看什么
三件事将把它从一项公告变成一项决定。第一是 Muse 内该虚拟形象的发布日期,因为 Meta 发布的一切都关于一个模型,而它发布的没有任何内容是关于一个你可以在某个星期四使用的产品。第二是在长时间对话中而非首字节时测得的延迟——870 ms 是发令枪,而真实通话提出的问题是第十分钟时会发生什么。第三是系统在对抗性条件下是否保持角色:用户故意改变话题、语速很快,或给它输入一张被设计成看起来像真人的参考图像。
在那之前,诚实的总结正是那篇研究文章暗示却未明说的那一个。Muse Realtime Avatar 是一项真正的工程成果,背后有真实的压缩结果,在受控环境中进行了演示,由构建它的公司进行评估,对话时长不过点一杯咖啡的工夫。它不是雾件。它也不是你能购买、路由或拿来做基准测试的东西——而这些是不同的说法。

