为“Muse Realtime Avatar”生成的一张主视觉卡片,带有上方标注“Meta AI Research - 2026年9月23日”、标题,以及三张带标签的卡片,文字分别为“Muse Realtime Voice - 对话层,流式语音 token”、“Muse Realtime Avatar - 构建于其上的具身层,仅供研究”和“Muse Spark 1.2 - 如今可在 OrcaRouter 上路由的 Muse 模型”。OrcaRouter 标志合成在右下角。
Engineering & Research

Muse Realtime Avatar:Meta 构建了什么,它运行在什么之上,以及为什么你仍然无法调用它

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Muse Realtime Avatar是 Meta 的具身化技术。它接收Muse Realtime Voice生成的语音流,并渲染出与之匹配的表演:把它对准一张照片肖像,脸部便会以细微的表情变化作出回应;把它对准一幅全身插画,人物便会一边说话一边做手势、变换姿态。Meta AI Research 于 2026 年 9 月 23 日在一篇题为“Bringing Your Muse to Life”的文章中介绍了它。这是一项研究成果,而非一款产品——Meta 自己的页面没有提供 API、没有价格、没有等候名单,也没有公布日期——所以,对于“我今天能用它吗”,诚实的回答是不能。你今天可以调用的 Muse 模型是另一个,Meta Muse Spark 1.2。

那个答案值得放在第一段而不是最后一段来陈述,因为搜索这个名字的读者通常正在决定是否要围绕它做规划。要围绕研究来规划,而不是围绕某个终点。

有一件事必须先直说,因为本博客通常是在模型发布的那几天写它们。Muse Realtime 是在这个页面上线一周前公布的,所以严格按新鲜度窗口来理解,这条内容本会被跳过。这不是一篇关于某个已发生事件的新闻报道。它是为一个如今仍在产品目录讨论中活跃的模型而设的参考页面:读者输入该模型自身名称后到达的那个页面,其依据是我们自己测得的持续搜索需求,而不是一次发布的新鲜度。这里提到九月的公告,是把它作为给该模型标注日期的事实,而不是作为要报道的事件,并且下文没有任何内容是第二次公告。我们对那一天的报道是一篇独立文章,而且会保持独立。

它在Muse家族中的定位

Meta 明确表示,这是同一个系统的两层,而不是两个产品。用 Meta 的话说,“Muse Realtime Voice 和 Muse Realtime Avatar 构成一个单一的流式系统,将智能、语音和具身化连接在一起。”语音层提供对话智能,并输出一串语音 token——Meta 称之为 VQ——它们同时承载了说了什么以及如何说出。音频解码器将这些 token 转换为声音,而化身层则消费同一串流来生成画面。共享同一 token 流正是让语音、唇部动作和表情保持同步的原因;事后并没有额外附加一个单独的口型同步环节。

那么:Muse Realtime Voice 是对话层。Muse Realtime Avatar 是构建在其之上的具身层。两者都不是你可以直接调用的东西。

同样要小心一个相邻的名称,因为它最容易被误认为二者中的任何一个。Muse Voice Transcribe 是一个转录端点,而且是一个真正不同的产品。Meta 的开发者文档说得毫不含糊:“它仅支持语音转文本;它不合成语音,也不提供语音到语音的对话 API。”它返回的是轮次级时间戳,而不是词级时间戳,并且 Meta 在该页面上将其标价为每小时 0.18 美元。它是一个真实存在、有定价的端点。它不是语音,当然也不是虚拟形象。

实际可调用的是 Muse 模型是 Meta Muse Spark 1.2,这是 Meta 推出的推理模型,具备百万 token 上下文,并支持文本、图像、视频、文件和音频输入。该模型目前可在此处路由调用,按提供商标价、零加价提供,使用与目录中其他所有内容相同的密钥,其实时卡片载有完整规格。我们不提供 Muse Realtime Avatar。撰写本文时我们再次查看了实时模型列表,其中仅有的 Muse 条目是两个 Spark 检查点:1.2 及其前代 1.1。任何比这更委婉的说法——比如称该系列“部分可用”——都会暗示我们路由了实际上并未路由的内容。

A screenshot of Meta's research post 'Bringing Your Muse to Life' as published, showing the headline, the reading time of 10 minutes, a vertical portrait video player, and the opening paragraph introducing Muse Realtime Avatar as an embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

这项技术,以 Meta 自己的话来说

Meta 对这套架构的描述足够凝练,直接引用即可,无需转述。Muse Realtime Avatar 是“一个由音频驱动、以语音 token 流、参考媒体以及近期视频 latent 滑动窗口为条件的 Diffusion Transformer”,并且它“以短小的因果分块生成视频”。这句话的后半句才是真正的承重点:每当一个分块生成完毕,其中最新生成的 latent 就成了下一个分块的动作上下文。Meta 给出的理由是连贯性——数字人的外貌与举止能够跨轮次延续,而计算量始终有界;正因如此,生成才能随着对话持续多久就进行多久,而不会发生漂移或耗尽预算。

来源溯源机制应写入同一段落,因为 Meta 将其呈现为系统的一部分,而非事后追加的补丁:生成的视频带有经由 Meta Video Seal 施加的持久、不可见水印,Meta 称这不会给实时路径带来任何延迟。

Meta 对这件事进行了测量,并为此公布了四项数据。那些数据——以及每项数据各自所需的特定限定说明,包括那条读起来像是提速、实则并非提速的说明——都属于发布稿,发布稿会连同其上下文完整地呈现它们。我们不会在这里复述那些光秃秃的数字,因为光秃秃的数字正是带限定说明的版本所要防止出现的东西。

我们在当天的 Muse Realtime Avatar 发布文章中报道了该公告,那里仍是完整阅读这些有分寸的说法的地方。

这个名字不是什么

三个假近邻值得逐一排除,因为仅凭名称来看,每一个都是合理的猜测。

• 它不是 Muse Voice Transcribe。该端点将语音转换为文本,而且按照 Meta 自己的描述,它在相反方向上什么也不做。如果你需要的是转录文本,Meta 有卖的,而那是另一回事,价格也不同。

• 这不是一项语音克隆服务。Meta 的页面上没有任何内容描述合成某个特定人物的声音、出售声音模型或接受来自用户的声音样本。语音层被描述为生成 token 流;虚拟形象层则被描述为消费一个 token 流。那个说法通常暗示的产品形态——上传一个样本,得到一个克隆——并非此处所描述的内容,而 Meta 确实发布的演示材料也被表述为对模型能力的展示。

• 它不是 Meta 自家应用中的消费者虚拟形象。Meta 为其示例附上了一条容易被忽略、却值得记住的说明:这些演示“展示的是模型能力,并不都反映 Muse 应用中可用的虚拟形象”,而且 Muse 面向 18 岁及以上用户。请按字面理解这一点。该帖子展示的部分内容体现的是能力,而不是实际可用的存量。

第四个名称值得出于不同原因单独区分。Muse Realtime Avatar 不是 Muse Video,后者是今年大部分时间都挂在公开排行榜上却迟迟没有上线的视频生成模型。我们关于这一情况的自家页面——Muse Video: Release Date, API Access, and What Meta Connect Might Change——带有一条限制,我们在此逐字重复,而不是加以润色:任何在没有更新的 Meta 公告的情况下引用 Muse Video 具体发布日或价格的页面,都是在猜测。同样的准则也适用于本页的主题,因此本页两者都不引用。那篇文章还提供了不该由我们混淆的日期:Muse Video 于 2026 年 7 月 7 日预览,尚未发布,这就是为什么搜索这一系列会搜到属于另一个模型的日期。

A generated reference card titled 'Muse Realtime Avatar - what is reachable' with six rows: 'Muse Realtime Avatar: research result, no API, no price, no waitlist, no published date'; 'Muse Realtime Voice: the conversational layer it renders, no API announced'; 'Muse Voice Transcribe: a different product, speech-to-text only'; 'Muse Spark 1.2: the Muse model callable today'; 'Muse Video: previewed, not released'; and 'Routable on OrcaRouter: Muse Spark 1.2 and 1.1 only'. A footer reads 'Status per Meta's own pages, read September 29, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

本页面的用途,以及什么会改变它

参考页在这里之所以是合适的形态,是有可衡量依据的。在截至2026年9月25日的28天内,这个精确词条在我们的搜索资源中获得了164次展示、零点击,最佳排名为9.3。我们有五十多个页面都在某处提到过这个片段,而几乎所有这些流量都落在一篇公告文章上。一个拥有真实且持续需求、排名刚好在第一页之外却无人转化的词条,不是需求问题,也不是质量问题——而是页面问题。此前并没有哪个页面的主题就是这个模型本身。这个页面就是。

这个定位也解释了为什么这里没有任何内容被包装成新闻。通过名称搜索而来的读者想按顺序知道三件事:这是什么、它是否可用,以及它建立在什么之上。上文已按这个顺序回答了这些问题,没有编造日期,也没有提及任何竞争对手。

A screenshot of our own model list filtered to the search term 'muse', showing two results, both under the Meta provider: meta/muse-spark-1.2 and meta/muse-spark-1.1, with Muse Spark 1.2 marked as having a 4M-token context window at $1.25 per million input tokens and $4.25 per million output tokens.

能改变这个页面的,是一则公告。如果 Meta 公布 Muse Realtime Avatar 的端点、价格、候补名单或发布日期,可用性部分就不再是一个“否”,而会变成一份规格说明,这个页面也会被重写,而不是在其后追加内容。如果 Meta 发布 Muse Video,上面那段内容也会随之改变。在这两种情况之一发生之前,对开发者来说,有用的做法并不光鲜:让你已有的接口继续指向你真正能访问到的模型。目录中的每一个模型,包括 Meta Muse Spark 1.2,都位于一个兼容 OpenAI 的端点和一个密钥之后,这意味着尝试验证这个家族中已存在的那部分,只需要改一个模型字符串,而不是签一份新合同。当具身层变得可调用时,切换成本也应该只是一个字符串。