‘Tavus Griffin vs Muse Realtime Avatar’의 히어로 타이틀 카드, 부제 ‘2026년의 두 얼굴, 두 가지 다른 문제’, 그 위에 네 개의 칩: Griffin 48% 인간으로 인식됨; Griffin 오디오→비디오 0.43초; Muse Realtime Avatar 첫 바이트까지 870ms; Muse Realtime Avatar 448x768, 25fps.
Engineering & Research

Tavus Griffin vs Muse Realtime Avatar: 2026년의 두 얼굴, 두 가지 다른 문제

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Tavus Griffin과 Muse Realtime Avatar는 둘 다 말은 할 수 있지만 얼굴은 없는 언어 모델이라는, 같은 민망한 문제를 해결하기 위해 존재하며, 서로 반대쪽 끝에서 그 문제를 공략한다. Griffin은 카메라를 통해 참가자를 지켜보고 대화의 상대편을 실시간으로 생성하는 비디오-투-비디오 Human Interaction Model이며, Tavus가 2026년 10월 선별된 테스터를 위한 연구 프리뷰로 발표했다. Muse Realtime Avatar는 2026년 9월 23일 Meta Connect에서 발표된, Meta의 Muse 에이전트를 위한 구현 계층으로, 오디오를 받아 동기화된 말하는 초상으로 바꾼다. 둘 다 구매할 수는 없다. 차이는 각 모델이 무엇을 제대로 해내려는지에 있으며, 각 모델이 실제로 입력으로 무엇을 받는지 묻는 순간 드러난다.

간략 버전

• Griffin의 입력은 반대편에 있는 사람, 즉 라이브 참가자의 영상과 오디오이며, Griffin은 이를 읽고 응답하고 방해받아야 하는 대상이다.

• Muse Realtime Avatar의 입력은 에이전트 자체의 음성 — 즉 Muse Realtime Voice에서 나오는 토큰 스트림이며, 이를 이에 맞는 얼굴로 변환합니다.

• Tavus는 사람들이 Griffin을 믿는지 여부로 Griffin을 측정하며, 1분짜리 화상 통화에서 48%라는 수치를 발표한다.

• Meta는 Muse Realtime Avatar가 속도를 따라가는지를 기준으로 측정하며, 발화 종료부터 첫 바이트까지 870밀리초를 공개한다.

• 둘 다 공개 API도, 공개된 가격도, 정식 출시일도 없습니다.

그 네 개의 행을 함께 읽어 보면, 이견의 윤곽이 명백해진다. Tavus는 상대방의 믿음을 향해 최적화하고 있다. Meta는 시계를 향해 최적화하고 있다.

Board titled 'Two Faces, Two Measurements'. Tavus Griffin column: input the live participant, video and audio; optimises for whether the other person believes it; headline figure 48% of 54 participants in a one-minute video call; output 720p duplex video at 25 fps; latency 0.43 s average audio to video on H100s; access research preview, selected testers only. Muse Realtime Avatar column: input Muse Realtime Voice's own speech tokens; optimises for the clock, end of turn to first frame; headline figure 870 ms from end of turn to first byte; output 448x768 portrait at 25 fps; capacity 12 concurrent sessions on one NVIDIA GB200; access research post only, no API.

그리핀: 믿어야만 하는 모델

Tavus의 프레이밍은 Griffin이 최초의 Human Interaction Model이라는 것이며, 이 주장 뒤의 아키텍처는 Continuous Conversational Modeling과 Audio-Visual Generation을 결합한 두 부분 시스템이다. 첫 번째 부분은 행동적이다: 보고 들을 수 있는 것을 활용해 페르소나가 다음 순간에 무엇을 해야 하는지 결정한다. 두 번째 부분은 렌더링이며, Tavus는 이를 다시 스트리밍 음성 생성과 스트리밍 비디오 생성으로 나눈다.

Tavus가 앞세우는 숫자들은 처리량 수치가 아니다. 이 회사가 런던 퀸메리 대학교와 함께 진행한 연구에서, 54명의 참가자 중 26명, 즉 48%가 1분짜리 화상 통화 후 Griffin을 실제 인물로 믿었다. 이전 스택인 Phoenix-4.5 얼굴 생성, Sparrow-2 턴테이킹, Raven-1 비전의 경우에는 41명 중 1명(2.4%)이 그랬다. 속지 않은 참가자들은 대개 처음 20초 이내에 의심했다. 2026년 9월에 채점된 NVIDIA의 VideoFDB 벤치마크에서 Tavus는 Griffin이 대면 AI 부문 1위라고 보고한다. 생성 점수는 3.83으로, 보고된 가장 강력한 기준선 2.80 및 인간 참조 3.92와 비교되며, 지각 점수는 3.73으로, 보고된 최고 기준선 3.44 및 인간 참조 4.20과 비교된다. 이 수치들은 공급업체가 보고한 것이고 특정 벤치마크에 한정된 것이지만, 흥미로운 것은 인간 비교 수치들이다.

그 수치들의 바탕이 되는 엔지니어링은 Tavec이라는 코덱과 자기회귀 확산 트랜스포머입니다. Tavec은 48kHz에서 프레임당 40개 값, 초당 100프레임으로 작동하며, 코드북이 없고 완전 인과적 디코더와 10밀리초까지 작은 패킷을 사용합니다 — 문장이 끝나기 전에 얼굴이 움직이기 시작할 수 있도록 설계되었습니다. 비디오 경로는 720p를 320밀리초 청크로 전송하는데, 여기서 하나의 잠재 변수는 25fps에서 8프레임에 해당하고, 잠재 변수당 3번의 확산 단계와 VAE에서 8배의 시간 압축이 이루어집니다. 3단계 증류 과정(분포 매칭, 그다음 교사 강제 자기회귀, 그다음 자기 강제)이 바로 그 세 단계를 실시간으로 실행할 수 있게 해줍니다. 대표적인 지연 시간 주장은 H100에서 오디오에서 비디오까지 평균 0.43초이며, Tavus는 이것이 자사가 측정한 다음으로 가장 빠른 방법의 약 절반이라고 말합니다. 음성 복제에는 대략 10초짜리 샘플이 필요합니다.

이 모든 것의 대가는 Tavus가 그것을 출시할 수 없다는 점이다. 연구 프리뷰인 Griffin-Lite는 엄선된 소수의 얼리 테스터에게만 제공된다. 이번 발표에 대해 쓰면서, 회사는 Griffin-Lite가 현재로서는 고객 사용을 위해 제공되지 않을 것이라고 분명히 밝히며, 특정 안전 문제가 해결된 직후 Griffin을 출시할 것으로 예상한다고 말한다. Griffin은 Tavus 플랫폼에 없으며, "안전하게 출시할 방법을 알아낸 후에" 그곳에 등장할 것이다. 1분 통화에서 48%의 확률로 설득력 있는 모델은, 배포 관점에서 보면, 1분 통화에서 48%의 확률로 설득력 있는 모델이다.

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Muse Realtime Avatar: 속도를 따라가야 하는 모델

Muse Realtime Avatar는 2026년 9월 23일 Meta Connect에서 발표되었고, 같은 날 Meta Superintelligence Labs에 의해 "당신의 Muse에게 생명을 불어넣기"라는 제목으로 기사화되었다. Meta의 설명은 Tavus의 것보다 더 좁고 기계적이다: Muse 에이전트는 이미 Muse Realtime Voice 덕분에 목소리를 가지고 있었고, 아바타는 그 목소리에 몸을 부여하는 계층이다.

공개된 수치는 턴 종료부터 첫 바이트까지 870밀리초입니다. 즉, 사용자가 말을 멈춘 순간부터 아바타의 첫 비디오 바이트가 준비되는 순간까지입니다. 아바타는 448×768 세로형 화면을 초당 25프레임으로 렌더링합니다. 메타에 따르면 이 시스템은 청크당 평가 횟수가 기준 구현보다 약 60배 적으며, 단일 NVIDIA GB200으로 12개의 동시 실시간 세션을 처리할 수 있고, 이는 2단계 BF16 구현 대비 8배의 용량 이점을 제공합니다.

Griffin과의 아키텍처적 차이는 정보가 어디서 오는가에 있습니다. Muse Realtime Avatar는 Muse Realtime Voice를 확장하며 음성 토큰 스트림을 공유합니다. 즉, 참가자에 대한 별도의 시각적 이해가 아니라, 음성 모델이 생성하는 동일한 VQ 표현이 얼굴을 구동합니다. 따라서 이는 오디오 기반 DiT 구현 계층입니다. 효율적이고, 자체 음성 모델과 긴밀하게 결합되어 있으며, 통화 상대방의 사람을 전혀 읽으려고 하지 않습니다. 그것은 에이전트를 위한 입과 얼굴이지, 당신을 지켜보는 대화 상대가 아닙니다.

Meta는 Muse Realtime Avatar에 관한 API도, 가격도, 출시일도 공개하지 않았다. 연구 게시물이 공개된 기록의 전부다.

두 디자인이 실제로 갈리는 지점

그 구분을 가장 명확하게 확인하는 방법은 사용자가 인터럽트할 때 무슨 일이 일어나는지 물어보는 것이다.

Griffin은 풀 듀플렉스이며 발화 중간에 방해받도록 설계되었다 — 말하면서도 지켜보고 들을 수 있다. 그래서 Tavus의 마케팅은 Griffin이 영상이 아니라 대화 행동을 학습한다는 발상에 기댄다. 또한 이것이 Griffin의 벤치마크 스위트가 지각과 반응을 중심으로 구성된 이유이며, 즉각 반응하는 능력에서 차선 시스템보다 37% 앞선다는 점이 회사가 공을 들여 내세우는 주장인 이유이기도 하다.

Muse Realtime Avatar의 870밀리초 턴 종료 수치는 정반대의 이야기를 들려줍니다. 그것은 턴이 끝나고, 오디오 토큰이 해결된 다음, 얼굴이 따라잡는 파이프라인입니다. 빠르긴 합니다. 870ms는 초상 렌더러로서 좋은 수치입니다. 그러나 그 측정 자체가 턴 경계가 존재한다고 가정하고 있으며, 바로 그 가정이야말로 양방향 모델이 버리도록 만들어진 것입니다.

그것은 두 설계 중 어느 것에 대한 비판도 아니다. Meta는 Meta 자체의 어시스턴트 표면 안에 존재하는 에이전트를 위한 얼굴을 만들고 있다. 그곳에서는 깔끔한 턴 경계가 상호작용을 모델링하기에 합리적이다. Tavus는 낯선 사람이 20초 안에 화면 속 인물이 진짜인지 판단하는 상황을 견뎌야 하는 무언가를 만들고 있다.

둘 중 어느 것도 가격표에 없으며 — Muse의 한 부분만 호출할 수 있습니다.

현재 Tavus Griffin과 Muse Realtime Avatar는 둘 다 프로덕션에 투입할 수 없습니다. Griffin은 선별된 테스터에게만 제한되어 있고, Muse Realtime Avatar에는 API도, 가격도, 출시일도 없습니다. 빌드를 계획 중이라면 이 두 가지 사실 모두 계획에 포함되어야 합니다.

주목할 만한 점은 Muse 스택에서 접근할 수 있는 부분이라는 것입니다. Meta의 Muse 제품군에는 Muse Spark가 포함되어 있으며, 그중 하나의 체크포인트인 meta/muse-spark-1.2는 우리 카탈로그에서 100만 입력 토큰당 $1.25, 100만 출력 토큰당 $4.25로, 마크업 없이 Meta의 정가에 라이브로 제공됩니다. 그것은 아바타가 아닙니다: 텍스트, 이미지, 동영상, 오디오, PDF 입력을 받아 텍스트를 반환하며, 100만 토큰 컨텍스트 창과 설정 가능한 추론 강도를 갖추고 있습니다. 하지만 이것은 Muse 라인에서 실제로 호출할 수 있는 부분이며, 언젠가 아바타 뒤에 자리할 에이전트를 만들고 있다면 언어 부분이 바로 시작할 수 있는 부분입니다. OrcaRouter는 제공업체의 정가를 0% 마크업으로 그대로 전달하므로, Meta의 가격 변경은 다음 청구 주기가 아니라 같은 날 우리 카드에 반영되며, 한 제공업체에서 실패한 요청은 타임아웃으로 나타나는 대신 정상 제공업체로 재시도됩니다.

Screenshot of the OrcaRouter model page for Muse Spark 1.2, showing the model id meta/muse-spark-1.2, a 1M-token context window, text, image, video, file and audio inputs producing text output, a p50 time to first token of 10.00 s, input pricing of $1.25 per million tokens and output pricing of $4.25 per million tokens, and 6.2M tokens of traffic over seven days.

비디오 쪽 세계에도 같은 논리가 적용됩니다. 우리는 Muse Realtime Avatar를 라우팅하지 않고 Tavus Griffin도 라우팅하지 않으며, 그렇지 않다고 주장하지도 않을 것입니다. 우리가 라우팅하는 것은 200개가 넘는 모델로 이루어진, 동일한 모달리티 전반에 걸친 카탈로그입니다. 따라서 텍스트 에이전트, 음성 모델, 비디오 생성기 사이를 전환하는 프로토타입은 하나의 키를 계속 사용하는 반면, 이 글에 등장하는 두 모델은 출시되지 않은 상태로 남습니다.

어느 쪽이 배송에서 더 먼가요?

공개된 기록상, Muse Realtime Avatar는 더 멀리 있습니다. 연구 게시물만 있고 API도, 가격도, 날짜도 없습니다. Griffin 역시 API와 가격은 없지만, 명시적인 출시 의도—"이러한 안전 우려가 해결된 아주 직후에"—가 있고, 현재 선별된 테스터를 위해 존재하는 이름 붙은 프리뷰 티어, 그리고 독립적인 테스트 하네스에서 나온 공개 벤치마크 결과 여러 건을 갖추고 있습니다. 이는 해당 모델이 고객에게 넘겨줄 만큼 안전하지 않다는 인정을 수반하지만, 더 앞선 위치입니다.

이 둘을 비교할 때의 함정은 870밀리초라는 수치를 0.43초라는 수치와 직접 비교할 수 있는 것으로 취급하는 것이다. 이 둘은 서로 다른 것을 측정한다: Meta는 한 턴이 끝난 시점부터 포트레이트의 첫 바이트까지를 측정하고, Tavus는 턴이 명확한 이벤트가 아닌 연속적인 양방향 스트림 내부에서 오디오-비디오 지연 시간을 측정한다. 두 수치는 모두 실제지만 같은 측정값이 아니며, 이 둘을 한 열에 제시하는 사람은 독자에게 해를 끼치는 셈이다.

결론

Muse Realtime Avatar는 구현 계층입니다: 오디오 입력, 초상 출력, 턴 종료부터 첫 바이트까지 870밀리초, 25fps에서 448×768, API도 없고 날짜도 없습니다. Tavus Griffin은 양방향 Human Interaction Model입니다: 참가자 입력, 반응하는 얼굴 출력, H100에서 평균 오디오-비디오 지연 시간 0.43초, 그리고 48%의 사람들이 그것을 인간이라고 생각했다는 사실을 공개하려는 동시에 고객은 그것을 사용할 수 없다고도 밝히는 벤더입니다. Meta는 따라잡는 무언가를 만들고 있습니다. Tavus는 통과하는 무언가를 만들고 있습니다. 둘 다 구매할 수 없습니다. 즉, 오늘 선택할 수 있는 유일한 결정은 문제의 어느 절반부터 시작할지이며 — 대부분의 팀에게 그 절반은 그 아래에 있는 언어 모델입니다.