
Muse Realtime Avatar: Meta가 자사의 Muse 에이전트에 얼굴을 부여하다, 턴당 870밀리초로
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 180 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
Meta가 앞세우기로 선택한 숫자는 870밀리초입니다. 그 숫자가 나타내는 시간은 Muse Realtime Avatar가 Meta 자체 측정 기준으로, 당신이 말을 멈춘 순간부터 동기화된 음성 및 영상 응답의 첫 바이트가 도착하는 순간까지 걸리는 시간입니다. 이는 영상을 생성해야 하는 시스템으로서는 정말로 공격적인 수치이며, 정확히 읽을 가치가 있습니다 — Meta의 새로운 체화 모델에 관한 흥미로운 점은 거의 모두 그 숫자가 측정하는 것과 사람들이 그 숫자가 측정한다고 가정할 것 사이의 간극에 있기 때문입니다.
Muse Realtime Avatar는 2026년 9월 23일 Meta Connect에서 발표되었으며, 같은 날 Meta Superintelligence Labs가 "Bringing Your Muse to Life"라는 제목의 연구 글로 정리했습니다. 이는 Muse Realtime Voice, 즉 Meta의 Muse 에이전트 내부에 있는 대화 레이어에 몸을 부여함으로써 이를 확장한 것입니다. 정형화된 아바타를 가진 챗봇이 아닙니다. 참조 이미지 — 사진, 전신 일러스트, 동물, 생활용품 — 를 넘기면 대화가 이어지는 동안 연속 영상으로 그 대상이 말하고 몸짓하며 자세를 바꾸는 모습을 렌더링합니다. 저커버그는 무대에서 자신의 Muse에 붙은 아바타의 이름이 Jolly라고 말했습니다.
립싱크 패스가 아닌 공유 토큰 스트림
아키텍처는 이해할 가치가 있는 부분입니다. 왜냐하면 Meta가 왜 "avatar" 대신 "embodiment"를 계속 말하는지 설명해 주기 때문입니다. Muse Realtime Voice는 음성 토큰 스트림을 생성합니다 — 게시물에서는 이를 VQs라고 부릅니다 — 이 토큰은 말해지는 내용과 그 운율, 즉 속도, 강조, 억양의 오르내림을 모두 담고 있습니다. Muse Realtime Avatar는 바로 그 동일한 스트림을 소비합니다. 이는 해당 음성 토큰, 사용자가 제공한 참조 미디어, 그리고 최근 비디오 잠재값의 롤링 윈도우에 조건화된 오디오 기반 Diffusion Transformer이며, 비디오를 짧은 인과적 청크로 생성하면서 각각의 새로운 잠재값을 다음 것을 위한 모션 컨텍스트로 앞으로 전달합니다.
하나의 토큰 스트림을 공유하는 것이 음성, 입 모양 움직임, 표정을 서로 단단히 묶어 두는 비결입니다. 대안, 즉 오디오를 생성한 뒤 별도의 립싱크 모델을 그 위에 돌리는 방식은 대부분의 아바타 업계가 일하는 방식이며, 그렇게 만든 아바타가 더빙된 것처럼 보이는 이유이기도 합니다. Meta의 설계는 구조적으로 그 이음새를 제거합니다. 롤링 잠재 윈도(rolling latent window)는 이 아이디어의 나머지 절반입니다. 이것이 없으면 청크 기반 생성기는 표류하고, 3분쯤 지나면 여러분의 캐릭터는 조용히 다른 누군가가 되어 있습니다.

공개된 네 가지 수치, 그리고 각각이 실제로 측정하는 것
Meta는 소비자 기능에 딸린 연구 글에서는 이례적일 만큼 많은 수치를 공개했다. 아래 네 가지는 모두 회사가 보고한 수치이며, Meta가 스스로 선택한 기준선에 대해 Meta가 측정한 것이다. 그중 어느 것도 회사 외부에서 재현된 적이 없다.
• 턴 종료부터 첫 바이트까지 870ms. 이것은 응답 시작 수치입니다. 완전한 답변까지 걸리는 시간이 아니며, 통화의 나머지 구간 동안 계속되는 전달 지연도 아닙니다. 시스템이 첫 바이트까지 870ms를 달성하고도 12초 시점에는 여전히 느리게 느껴질 수 있습니다. 메타의 게시물은 이것이 첫 바이트 측정치임을 분명히 밝힙니다. 이 한정 조건을 생략한 보도는 이를 엔드투엔드 응답성으로 읽고 있지만, 그렇지 않습니다.
• 25fps의 448×768 세로형 영상입니다. 이는 가로가 아니라 세로로 긴 휴대폰 모양의 프레임이며, 25fps는 매끄럽기보다 영화적인데, 영화의 표준 프레임 레이트로, 기본 카메라 피드에서 얻을 수 있는 30 또는 60fps보다 낮습니다. 메타에 따르면 데모에는 투명 오버레이로 워터마크가 표시되어 수신자가 일반 카메라 피드가 아님을 알 수 있다고 합니다.
• 모델 평가 횟수가 60배 더 적습니다. 이 수치는 잘못 해석될 가능성이 가장 높은 숫자이므로, 아래에서 제대로 다룹니다.
• 하나의 NVIDIA GB200에서 12개의 동시 실시간 세션. 메타는 NVIDIA와 함께 개발한 자사의 서빙 작업 — 영구 KV 캐시, 캐시 인식 라우팅, 지연 인식 동적 배칭, 4비트 양자화 인식 학습, 융합 커널 및 CUDA Graph 캡처 — 이 자체적인 2단계 BF16 베이스라인 대비 용량을 8배로 끌어올렸다고 보고했다. 그 이면의 산술은 명확하다. 각 생성 단계는 8개의 프레임을 만들어내는데, 이는 320ms 분량의 재생이며 모델 시간으로는 20ms, 즉 프레임당 2.5ms에 해당한다. 12와 8배 모두 다른 벤더의 하드웨어가 아니라 메타가 명시한 베이스라인을 기준으로 한 것이다.
왜 60×가 60× 더 빠른 게 아닌가
압축 주장은 가장 많이 반복되면서도 가장 적게 이해될 주장이다. 메타의 교사 모델은 3방향 분류기 없는 가이던스를 사용하는 40단계 확산 모델이었다. 단계당 3회 패스이므로, 비디오 한 청크를 생성하는 데 120회의 모델 평가가 필요했다. 학생 모델은 고정 길이 KV 캐시를 사용하는 가이던스 없는 2단계 인과 모델로, 증류와 자기 강제(self-forcing)를 통해 훈련되며, 같은 청크를 위해 2회의 평가만 필요로 한다. 이는 메타의 표현대로 교사 모델에 근접한 품질을 유지하면서 청크당 평가 횟수를 60배 줄인 것이다.
이는 청크 단위의 연산 감소입니다. 평가 횟수가 60분의 1로 줄어든다고 해서 사용자가 기다리는 시간도 60분의 1로 줄어드는 것은 아닙니다. 증류 이전에도, 이후에도 지연 시간에는 다른 기여 요인들이 있었기 때문입니다. Meta 자체 게시물의 차트는 이 감소가 품질 측면에서 무엇을 가져왔는지 보여줍니다. 인간 선호도가 45%에서 55%로 상승한 것입니다. 이것이 이 이야기의 정직한 버전입니다. 증류의 요점은 실시간으로 실행될 수 있는 시스템을 만드는 것이었고, 품질 비용은 제거되기보다 약 10포인트의 선호도로 억제되었습니다.
반대로 나온 결과까지 포함한 평가
Meta는 두 상용 아바타 시스템인 Runway Characters 및 HeyGen LiveAvatar와 비교 테스트했으며, 서로 맞춘 아바타 정체성을 사용해 평가자들이 캐릭터 디자인이 아니라 애니메이션을 비교하도록 했습니다. 평가자들은 각 시스템과 2~3분간 실시간 대화를 나눈 뒤 시각적 품질, 동기화, 캐릭터 일관성 및 몸짓을 비교했습니다.
Meta는 Runway Characters보다 78% 대 22%로, HeyGen LiveAvatar보다 88% 대 12%로 선호된다고 보고하며, 평가된 모든 차원에서 선호된다. 그런 다음 이 글은 대부분의 벤더 평가가 하지 않는 일을 한다: Runway Characters와의 몸짓 비교가 통계적으로 무승부와 구분되지 않았다는 점을 공개한다. 전면적 우위 속의 무승부는 사소한 일이지만, 그 전면적 우위가 유리한 것만 골라 보고된 것이 아니라 정직하게 보고되고 있음을 알려주는 세부 사항이다.
테스트의 한계가 동점보다 더 중요하다. 2~3분은 짧은 대화다. 평가자들은 Meta 소속이었다. 그리고 게시물 자체도 그 시연들은 "모델의 능력을 보여줄 뿐 Muse 앱에서 사용할 수 있는 아바타를 모두 반영하지는 않는다"라고 경고한다 — 이는 연구팀이 당신이 본 영상이 반드시 당신이 받게 될 제품은 아니라고 분명히 말하는 것이다.
그것으로 할 수 없는 것
Muse Realtime Avatar를 위한 API는 없습니다. 가격도, 요금표도, 대기자 명단도, 공개 날짜도 없습니다. Meta는 사용자나 개발자가 언제 이를 사용할 수 있을지 밝히지 않았습니다. 18세 이상용 Muse 앱이 유일한 적용 대상이며, 이 아바타는 다른 Muse 기능들 — 음성 사용자 지정, Muse 이메일 주소, Mac 컴퓨터 제어, 안경 통합 — 과 함께 제공될 예정인데, 이러한 기능들은 각자 일정이 있고 일부는 "앞으로 몇 달"이라고 언급되었습니다.
여기서 중요한 비교 대상은 Runway나 HeyGen이 아닙니다. 그것은 나머지 Muse 스택입니다. 에이전트가 실행되는 추론 모델인 Muse Spark는 Meta가 Meta Model API를 통해 개방한 이래 개발자들이 사용할 수 있었고, Muse Spark 1.2는 OrcaRouter를 통해 meta/muse-spark-1.2로 입력 토큰 100만 개당 $1.25, 출력 토큰 100만 개당 $4.25의 마크업 없는 제공사 정가로 제공되며, 이미 텍스트, 이미지, 동영상, 오디오, 파일을 받아들이는 100만 토큰 컨텍스트 윈도우 안에서 이루어집니다. 그것이 오늘 여러분이 호출할 수 있는 Muse의 부분입니다. 얼굴은 여러분이 호출할 수 없는 부분입니다.
그 비대칭성은 당신이 무엇이든 계획하고 있다면 곱씹어 볼 가치가 있다. 화상 통화를 통해 추론하는 에이전트와 화상 통화에 등장하는 에이전트는 서로 다른 제약을 지닌 다른 제품이며, 둘 중 하나만 요금표에 올라 있다.

다음에 볼 콘텐츠
세 가지가 이것을 발표에서 결정으로 바꿀 것이다. 첫째는 Muse 내부의 아바타 출시일이다. 왜냐하면 Meta가 공개한 모든 것은 모델에 관한 것이고, 공개한 것 중 목요일에 사용할 수 있는 제품에 관한 것은 아무것도 없기 때문이다. 둘째는 첫 바이트가 아니라 긴 대화 동안 측정된 지연 시간이다. 870 ms는 출발 신호일 뿐이며, 실제 통화가 묻는 질문은 10분에 무슨 일이 일어나는가이다. 셋째는 시스템이 적대적 조건에서 캐릭터를 유지하는지 여부이다: 의도적으로 주제를 바꾸거나, 빠르게 움직이거나, 실제 사람처럼 보이도록 설계된 참조 이미지를 제공하는 사용자.
그때까지, 정직한 요약은 연구 글이 말하지 않은 채 암시하는 바로 그것이다. Muse Realtime Avatar는 실제 압축 결과가 뒷받침하는 진짜 엔지니어링 성과이며, 통제된 환경에서 시연되었고, 그것을 만든 회사가 평가했으며, 대화는 커피 주문이 걸리는 시간만큼 지속되었다. 이것은 베이퍼웨어가 아니다. 또한 이것은 구매하거나, 라우팅하거나, 벤치마킹할 수 있는 대상도 아니다 — 그리고 그것들은 서로 다른 주장이다.

