'Muse Realtime Avatar'용으로 생성된 히어로 카드로, 상단 문구 'Meta AI Research - 2026년 9월 23일', 제목, 그리고 'Muse Realtime Voice - 대화 계층, 스트리밍 음성 토큰', 'Muse Realtime Avatar - 그 위에 구축된 구현 계층, 연구 전용', 'Muse Spark 1.2 - 오늘 OrcaRouter에서 라우팅할 수 있는 Muse 모델'이라고 적힌 세 개의 레이블이 붙은 카드가 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Engineering & Research

Muse Realtime Avatar: 메타가 무엇을 만들었고, 무엇으로 구동되며, 왜 여전히 통화할 수 없는가

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Muse Realtime Avatar는 Meta의 구현(embodiment) 기술입니다. 이 기술은 Muse Realtime Voice가 생성하는 음성 스트림을 받아 이에 맞는 퍼포먼스를 렌더링합니다: 사진 초상화를 향하게 하면 얼굴이 표정의 작은 변화로 응답하고, 전신 일러스트를 향하게 하면 그 인물이 말하는 동안 몸짓을 하고 자세를 바꿉니다. Meta AI Research는 2026년 9월 23일 "Bringing Your Muse to Life"라는 글에서 이를 소개했습니다. 이는 제품이 아니라 연구 성과입니다 — Meta 자체 페이지에는 API도, 가격도, 대기자 명단도, 공개 날짜도 없습니다 — 그러니 "오늘 바로 사용할 수 있나요?"에 대한 솔직한 답은 '아니요'입니다. 오늘 호출할 수 있는 Muse 모델은 다른 것으로, Meta Muse Spark 1.2.

그 답은 마지막 문단이 아니라 첫 문단에서 밝힐 가치가 있다. 왜냐하면 이 이름을 검색하는 독자는 보통 그것을 기준으로 계획을 세울지 판단하는 중이기 때문이다. 엔드포인트가 아니라 연구를 기준으로 계획하라.

무엇보다 먼저 분명히 말할 것이 하나 있습니다. 이 페이지는 스스로 인정해야 할 규칙을 어기고 있기 때문입니다. 이 블로그는 보통 모델이 출시된 주에 그 모델에 대해 글을 씁니다. Muse Realtime Avatar는 이 페이지가 올라오기 일주일 전에 발표되었으므로, 신선도 기준을 엄격하게 해석하면 이 항목은 건너뛰어져야 합니다. 이것은 날짜가 지난 사건에 관한 뉴스 기사가 아닙니다. 이것은 오늘날 카탈로그 대화에서 살아 있는 모델을 위한 참조 페이지입니다: 독자가 모델 이름을 직접 입력한 뒤 도달하는 페이지이며, 그 근거는 출시의 신선도가 아니라 우리가 직접 측정한 상시 검색 수요에 있습니다. 9월 발표는 여기서 보고할 사건이 아니라 모델의 날짜를 알려주는 사실로서 언급되며, 아래의 어떤 내용도 두 번째 발표가 아닙니다. 그날에 대한 우리의 보도는 별개의 글이며, 별개로 남아 있습니다.

Muse 패밀리에서의 위치

Meta는 이것이 두 제품이 아니라 하나의 시스템을 이루는 두 계층임을 분명히 밝힙니다. Meta의 표현을 빌리면, "Muse Realtime Voice와 Muse Realtime Avatar는 지능과 음성, 그리고 구현을 연결하는 하나의 스트리밍 시스템을 이룹니다." 음성 계층은 대화 지능을 제공하고, 말해지는 내용과 그것이 전달되는 방식을 모두 담은 음성 토큰 스트림을 내보냅니다. Meta는 이를 VQs라고 부릅니다. 오디오 디코더가 그 토큰을 소리로 바꾸고, 아바타 계층은 동일한 스트림을 사용해 영상을 생성합니다. 하나의 토큰 스트림을 공유하는 것이 음성, 입 움직임, 표정을 동기화된 상태로 유지하는 비결이며, 나중에 덧붙이는 별도의 립싱크 패스는 없습니다.

그래서: Muse Realtime Voice는 대화 계층입니다. Muse Realtime Avatar는 그 위에 구축된 구현 계층입니다. 둘 중 어느 것도 당신이 호출할 수 있는 그 대상은 아닙니다.

이웃한 이름도 똑같이 주의하세요. 그 이름이 둘 중 어느 쪽으로든 혼동되기 가장 쉬운 이름이기 때문입니다. Muse Voice Transcribe는 전사 엔드포인트이며, 진정으로 다른 제품입니다. Meta의 개발자 문서는 명확합니다: "이것은 음성-텍스트 변환 전용이며, 음성을 합성하거나 음성-대-음성 대화 API를 제공하지 않습니다." 이것은 단어 수준이 아니라 턴 수준 타임스탬프를 반환하며, Meta는 해당 페이지에서 이를 시간당 $0.18로 명시해 두었습니다. 이것은 실제로 가격이 책정된 엔드포인트입니다. 음성이 아니며, 확실히 아바타도 아닙니다.

실제로 호출 가능한 Muse 모델은 Meta Muse Spark 1.2이며, Meta가 백만 토큰 컨텍스트와 텍스트, 이미지, 비디오, 파일 및 오디오 입력을 제공하는 추론 모델입니다. 그것은 오늘 여기에서 라우팅 가능하며, 제공업체의 정가에 마크업 없이, 카탈로그의 다른 모든 것과 동일한 키로 제공되고, 라이브 카드에는 전체 사양이 포함되어 있습니다. 우리는 Muse Realtime Avatar를 제공하지 않습니다. 이 글을 쓰는 동안 라이브 모델 목록을 다시 확인했으며, 그 목록에 있는 유일한 Muse 항목은 두 개의 Spark 체크포인트, 1.2와 그 이전 버전인 1.1입니다. 그보다 더 부드럽게 말하는 것 — 즉, 그 제품군이 "부분적으로 사용 가능"하다고 하는 것 — 은 우리가 라우팅하지 않는 것을 라우팅한다는 의미가 됩니다.

A screenshot of Meta's research post 'Bringing Your Muse to Life' as published, showing the headline, the reading time of 10 minutes, a vertical portrait video player, and the opening paragraph introducing Muse Realtime Avatar as an embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

메타 자신의 표현으로 설명된 그 기술

메타의 아키텍처 설명은 요약하기보다 그대로 인용할 만큼 간결하다. Muse Realtime Avatar는 "오디오로 구동되며, 음성 토큰 스트림, 참조 미디어, 최근 비디오 잠재값의 롤링 윈도우에 조건화된 Diffusion Transformer"이고, "짧은 인과적 청크 단위로 비디오를 생성한다." 그 문장의 후반부가 핵심을 떠받치는 부분이다. 각 청크가 완료될 때마다 그 청크에서 새로 생성된 최신 잠재값이 다음 청크의 모션 컨텍스트가 된다. 메타가 밝힌 이유는 연속성이다. 아바타의 외형과 몸짓은 턴을 넘어 이어지는 반면 계산은 한정된 범위에 머무르며, 이것이 생성이 표류하거나 예산이 바닥나는 대신 대화가 이어지는 만큼 계속 생성될 수 있게 해 준다.

출처 표시 메커니즘은 같은 문단에 속하는데, 메타가 이를 나중에 덧붙인 것이 아니라 시스템의 일부로 제시하기 때문이다: 생성된 영상에는 Meta Video Seal을 통해 적용된 지속적이고 보이지 않는 워터마크가 포함되며, 메타는 이것이 실시간 경로에 지연을 추가하지 않는다고 말한다.

Meta는 이것을 측정해 네 가지 수치를 발표했다. 그 수치들 — 그리고 각 수치에 필요한 구체적인 주의사항들, 그중에는 속도 향상처럼 읽히지만 실제로는 그렇지 않은 것도 포함된다 — 은 출시 관련 글에 속하며, 그 글은 그것들을 맥락을 그대로 유지한 채 담고 있다. 우리는 여기서 숫자만 달랑 다시 말하지 않겠다. 숫자만 달랑 제시하는 것은 바로 주의사항이 붙은 버전이 막으려는 바로 그것이기 때문이다.

우리는 발표 당일 Muse Realtime Avatar 출시 기사에서 이 내용을 다뤘으며, 그곳은 여전히 신중하게 검증된 주장을 전문으로 읽을 수 있는 곳입니다.

그 이름이 아닌 것

세 가지 거짓 이웃은 하나씩 배제해 볼 가치가 있다. 왜냐하면 각각은 이름만으로도 충분히 합리적인 추측이기 때문이다.

• 그것은 Muse Voice Transcribe가 아닙니다. 그 엔드포인트는 음성을 텍스트로 변환하며, Meta 자체 설명에 따르면 반대 방향으로는 아무것도 하지 않습니다. 필요한 것이 녹취록이라면 Meta는 그것을 판매하고 있으며, 그것은 다른 가격의 별개 제품입니다.

• 이는 음성 복제 서비스가 아니다. Meta의 페이지 어디에도 특정 개인의 음성을 합성하거나, 음성 모델을 판매하거나, 사용자로부터 음성 샘플을 받는다고 설명하지 않는다. 음성 레이어는 토큰 스트림을 생성하는 것으로, 아바타 레이어는 이를 소비하는 것으로 설명된다. 그 표현이 보통 암시하는 제품 형태—샘플을 업로드하면 복제본을 얻는—는 여기에서 설명하는 바가 아니며, Meta가 실제로 공개하는 데모 자료 역시 모델 역량을 예시하기 위한 것으로 제시된다.

• 이는 Meta 자체 앱의 소비자용 아바타가 아니다. Meta는 그 예시들에 놓치기 쉽지만 기억해 둘 만한 주의사항을 덧붙인다. 그 시연들은 "모델 역량을 보여주며 Muse 앱에서 이용 가능한 아바타를 모두 반영하는 것은 아니다"라는 것이고, Muse는 만 18세 이상 사용자용이다. 그 말을 문자 그대로 읽어라. 그 게시물이 보여주는 것 중 일부는 실제 제공되는 것이 아니라 역량이다.

네 번째 이름은 다른 이유로 분리할 가치가 있다. Muse Realtime Avatar는 올해 대부분 동안 출시되지 않은 채 공개 리더보드에 머물러 있는 비디오 생성 모델인 Muse Video가 아니다. 그 상황에 관한 우리 자체 페이지인 — Muse Video: 출시일, API 접근, 그리고 Meta Connect가 바꿀 수 있는 것 — 은 여기서 개선하기보다 그대로 반복할 제약을 담고 있다: 더 새로운 Meta 발표 없이 Muse Video의 특정 출시일이나 가격을 인용하는 모든 페이지는 추측이다. 같은 원칙이 이 페이지의 주제에도 적용되므로, 이 페이지는 어느 것도 인용하지 않는다. 그 글은 또한 우리가 혼동해서는 안 되는 날짜를 제공한다: Muse Video는 2026년 7월 7일에 미리보기되었으며 출시되지는 않았고, 이것이 이 계열을 검색하면 다른 모델에 속하는 날짜가 나오는 이유다.

A generated reference card titled 'Muse Realtime Avatar - what is reachable' with six rows: 'Muse Realtime Avatar: research result, no API, no price, no waitlist, no published date'; 'Muse Realtime Voice: the conversational layer it renders, no API announced'; 'Muse Voice Transcribe: a different product, speech-to-text only'; 'Muse Spark 1.2: the Muse model callable today'; 'Muse Video: previewed, not released'; and 'Routable on OrcaRouter: Muse Spark 1.2 and 1.1 only'. A footer reads 'Status per Meta's own pages, read September 29, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

이 페이지의 목적과 이를 바꿀 수 있는 것

여기서 레퍼런스 페이지가 적절한 형태인 이유는 측정이 가능합니다. 2026년 9월 25일까지의 28일 동안, 정확한 검색어는 우리 검색 속성에서 164회 노출되고 클릭은 0회였으며, 최고 순위는 9.3위였습니다. 우리 페이지 중 50개 이상이 어딘가에서 그 조각을 언급하고 있으며, 그 트래픽은 거의 전부 하나의 공지 게시물로 유입됩니다. 실제로 지속적인 수요가 있으면서 1페이지 바로 밖에 랭크되고 아무도 전환시키지 못하는 검색어는 수요 문제도 품질 문제도 아닙니다 — 페이지 문제입니다. 모델 자체를 주제로 한 페이지가 없었습니다. 이 페이지가 바로 그 페이지입니다.

이 입장은 또한 이곳의 어떤 내용도 뉴스인 것처럼 포장되지 않은 이유이기도 합니다. 이름 검색을 통해 들어온 독자는 세 가지를 순서대로 알고 싶어 합니다: 이것이 무엇인지, 이용 가능한지, 무엇을 기반으로 만들어졌는지. 그 답은 위에서 같은 순서로 제시되며, 날짜를 지어내지 않고 경쟁사 이름도 언급하지 않습니다.

A screenshot of our own model list filtered to the search term 'muse', showing two results, both under the Meta provider: meta/muse-spark-1.2 and meta/muse-spark-1.1, with Muse Spark 1.2 marked as having a 4M-token context window at $1.25 per million input tokens and $4.25 per million output tokens.

페이지를 바꿀 수 있는 것은 단 하나의 발표입니다. Meta가 Muse Realtime Avatar를 위한 엔드포인트, 가격, 대기자 명단 또는 날짜를 공개한다면, 가용성 섹션은 더 이상 "아니오"가 아니라 사양이 되고, 이 페이지는 내용이 덧붙여지는 것이 아니라 다시 작성됩니다. Meta가 Muse Video를 출시한다면, 위 문단도 그에 맞춰 바뀝니다. 둘 중 하나가 실현되기 전까지 개발자에게 유용한 행보는 화려하지 않은 쪽입니다. 이미 가지고 있는 인터페이스를 실제로 접근할 수 있는 모델에 계속 겨냥해 두는 것입니다. 카탈로그의 모든 모델은 Meta Muse Spark 1.2를 포함해 하나의 OpenAI 호환 엔드포인트와 하나의 키 뒤에 있으므로, 이 제품군에서 존재하는 부분을 시험해 보는 데 드는 비용은 새 계약이 아니라 모델 문자열 변경입니다. 구현 계층이 호출 가능해지면, 전환 비용 역시 문자열이어야 합니다.