'Muse Realtime Avatar vs SeedRealtime' 기사를 위해 생성된 히어로 카드로, 헤드라인 양옆에 두 개의 둥근 카드가 표시됩니다. 왼쪽 카드에는 나가는 비디오 프레임 아이콘 위에 'Muse Realtime Avatar'가 있고, '비디오를 생성함'과 'Meta, 9월 23일 발표'라는 줄이 있습니다. 오른쪽 카드에는 화면과 눈 아이콘 위에 'SeedRealtime'이 있고, '비디오를 시청함'과 'ByteDance, 8월 5일 출시'라는 줄이 있습니다. 부제목에는 '둘 다 요금표가 없습니다.'라고 적혀 있습니다. OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Muse Realtime Avatar vs SeedRealtime: 오직 지켜볼 수밖에 없는 두 모델

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이들 중 어느 것도 요금표가 없다. Muse Realtime Avatar는 2026년 9월 23일 Meta Connect에서 Meta가 발표했지만 API도, 엔드포인트도, 가격도, 날짜도 없다 — 이는 Meta의 Muse 에이전트의 기능이며, "Bringing Your Muse to Life"라는 제목의 연구 게시물에서 시연되었다. SeedRealtime은 2026년 8월 5일 ByteDance Seed가 출시했지만 API도, 가중치도, 기술 보고서도, 파라미터 수치도 없다 — 이는 ByteDance 자체의 Doubao 앱 안에 존재하며, ByteDance의 게시물은 그것이 "전면 출시"되었다고만 밝히고 있다. 세계에서 가장 큰 소비자 AI 기업 두 곳이 7주 간격을 두고 오디오-비주얼 실시간 시스템을 내놓았지만, 둘 다 구매할 수 없다. 그것이 바로 이 비교이며, 아무도 만들 수 없는 벤치마크 표보다 훨씬 흥미로운 비교다.

이 둘을 구분하는 것은 영상이 흐르는 방향입니다. SeedRealtime은 보고 듣고, 자신이 보는 것에 대해 말합니다. 즉 오디오, 비디오, 텍스트를 하나의 엔드투엔드 네트워크로 받아들이며, 발화 순서 교대를 외부 음성 활동 감지기에서 모델 자체로 옮겼습니다. Muse Realtime Avatar는 생성합니다. 참조 이미지, 사진이나 일러스트레이션 또는 사물을 넘겨주면, 대화가 이어지는 시간 동안 그 대상이 말하고 몸짓하는 모습을 연속 영상으로 렌더링합니다. SeedRealtime의 영상은 입력입니다. Muse Realtime Avatar의 영상은 출력입니다. 둘 다 전이중(full-duplex)이라고 설명되며, 둘 다 시청각적이지만, 같은 라벨을 달고 정반대의 일을 하고 있습니다.

각각 무엇인지, 그리고 어디에 있는지

여섯 줄, 그리고 무엇이든 결정하는 건 마지막 두 줄이다.

비디오 — Muse Realtime Avatar가 448×768 세로 해상도와 초당 25프레임으로 이를 생성하며, 시청자가 카메라 피드가 아님을 알 수 있도록 투명 오버레이로 워터마크가 표시됩니다. SeedRealtime이 이를 인식하여 프레임을 오디오를 처리하는 동일한 네트워크로 스트리밍합니다.

아키텍처에 건 승부수 — Muse Realtime Avatar는 음성과 영상 사이에서 하나의 토큰 스트림을 공유하므로, 오디오로 구동되는 Diffusion Transformer가 Muse Realtime Voice의 음성 토큰을 직접 소비하며 그 이후에 립싱크되는 것은 아무것도 없습니다. SeedRealtime은 발화 순서 교대를 모델 안에 녹여 넣어, 누가 언제 말하는지가 더 이상 외부 음성 활동 감지기의 결정이 아닙니다.

실행 위치 — Muse Realtime Avatar는 Meta의 Muse 에이전트 내부 기능이며, SeedRealtime은 ByteDance의 Doubao 앱 내부에 있습니다.

개발자 액세스 — 두 제품 모두 API가 없습니다. 두 제품 모두 가중치를 공개하지 않습니다. 서버리스 옵션도, 호스팅된 엔드포인트도, 둘 중 어느 하나를 제공하는 제3자 플랫폼도 없습니다.

가격 — 양측 모두 비공개, 어느 쪽에도 상업적 제안이 없기 때문입니다.

독립적 평가 — 두 시스템 모두 해당 없음. 두 회사가 자사 모델에 관해 공개한 모든 수치는 자체 발표 자료이며, 외부 평가자가 어느 쪽도 실행한 적이 없습니다.

두 개의 근거 자료, 둘 다 자사 데이터이며, 그중 하나는 훨씬 빈약하다

여기서 비교는 더 이상 대칭적이지 않다. Meta는 Muse Realtime Avatar에 대해 네 가지 수치를 발표했는데, 모두 회사가 자체 보고한 것이고 Meta가 선택한 기준선과 비교해 측정한 것이며, 회사 밖에서 재현된 것은 하나도 없다. 사용자의 발화가 끝난 시점부터 동기화된 음성·영상 응답의 첫 바이트까지 870ms, 448×768 세로형 영상 초당 25프레임, 자체 기준선 대비 60분의 1로 줄어든 모델 평가 횟수, 그리고 단일 NVIDIA GB200에서의 동시 실시간 세션 12개다. 이는 4비트 양자화 인식 학습과 지연 인식 동적 배칭을 통해 Meta의 2단계 BF16 기준선 대비 8배의 용량 향상을 이룬 것이다. Meta는 또한 두 상용 아바타 시스템과의 선호도 비교도 발표했는데, 한쪽에는 78/22, 다른 쪽에는 88/12였으며, 몸짓 측면에서는 둘 중 하나에 대한 결과가 통계적으로 동등과 구별되지 않는다는 점도 공개했다. 그 공개는 승리보다 더 가치가 있다. 그것은 대부분의 출시 글이 빼먹는 종류의 결과다.

SeedRealtime의 공개된 증거는 하나의 엔드투엔드 인간 평가다. ByteDance는 캐스케이드 시스템 — 비전 모델을 ASR 모델에, ASR 모델을 LLM에, LLM을 텍스트 음성 변환 음성에 연결한 시스템 — 에 대비해 SeedRealtime이 시청각 대화 페이스 문제를 절반으로 줄이며, 끊김이 더 적고, 잘못된 트리거가 더 적으며, 더 느리고 더 자연스러운 응답을 제공한다고 말한다. ByteDance가 공개하지 않은 것은 표본 크기, 방법론, 주석자 수, 밀리초 단위 지연 시간 수치, 벤치마크 이름, 점수다. 한 2차 보고서는 팀의 이전 모델들보다 대화 유창성이 12% 향상되었다고 언급한다. 그것이 전체 공개 증거 기반이다.

그러니까 검증 가능성에 대한 정직한 순위는 이렇다: 둘 중 어느 쪽도 독립적인 실행이 없다. Meta의 것은 명시된 기준선과 공개된 부정적 결과를 갖춘 일련의 측정값이고, ByteDance의 것은 설계가 설명되지 않은 단일 선호 주장이다. 둘 다 재현 가능하지 않지만, 그중 하나만이 논쟁할 수 있을 만큼 구체적이다.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

각자가 한 움직임

두 체계 모두 같은 문제에 대한 답이며, 그 두 답이 서로 다르다는 점을 확인하는 것은 가치가 있다.

지켜보는 시스템에서 어려운 부분은 언제 말할지를 아는 것이다. 카메라 프레임과 오디오를 연속적으로 입력받는 모델은 외부 트리거 없이, 앞에 있는 사람이 말을 끝냈는지, 자신이 호명되었는지, 방금 프레임에 들어온 물체가 관련이 있는지를 스스로 판단해야 한다. 이것이 SeedRealtime이 모델 내부로 옮긴 문제이며, ByteDance는 이를 두 가지가 아닌 세 가지 모달리티에 걸쳐 해냈다 — Google, OpenAI, NVIDIA가 각각 오디오만을 대상으로 한 것의 더 어려운 버전이다. 데모 동작들은 여기에서 나온다: 그룹 대화에서 목소리를 얼굴에 연결하기, 무언가가 프레임에 들어오면 요청 없이 먼저 말하기, 누군가를 박물관이나 수리 과정에서 안내하기.

렌더링하는 시스템에서 어려운 점은 일관성을 유지하는 것입니다. 비디오를 짧은 인과적 청크로 생성한다는 것은 각 청크가 이전 청크에 조건화된다는 뜻이며, 실패 모드는 드리프트입니다. 3분쯤 되면 캐릭터가 어느새 다른 사람이 되어 있죠. 최근 비디오 잠재값에 대한 Meta의 롤링 윈도가 그에 대한 해답이고, 공유 토큰 스트림은 또 다른 실패, 즉 오디오를 먼저 생성한 뒤 립싱크 모델을 그 위에 실행할 때 생기는 더빙된 듯한 느낌에 대한 해답입니다.

어느 쪽 접근법도 다른 시스템에서는 사용할 수 없다. SeedRealtime은 충실히 따라야 할 참조 이미지가 없다. 누구도 렌더링하지 않기 때문이다. Muse Realtime Avatar는 추적할 외부 세계가 없다. 그것의 임무 전체가 음성에 맞는 얼굴을 만들어내는 것이기 때문이다.

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

호출할 수 없는 모델이 여전히 라우팅 문제인 이유

이 두 시스템은 모두 위임합니다. Muse Realtime Avatar는 Muse Realtime Voice 위에 올라가 있으며, Muse Realtime Voice는 추론이 Muse Spark에서 실행되는 에이전트의 대화 계층입니다 — 모델은 사고가 아니라 렌더링을 담당합니다. SeedRealtime의 설계는 백그라운드 작업이 진행되는 동안에도 대화를 계속 이어가며, 이는 인라인으로 처리할 수 있는 범위를 넘는 작업이 다른 곳으로 갔다가 다시 돌아온다는 뜻입니다. 두 아키텍처 모두에서 사용자가 상호작용하는 것은 프런트 엔드이며, 지능은 그 뒤에 있는 별도의 텍스트 모델입니다.

그 별도의 텍스트 모델은 평범한 추론이며, 스택에서 실제로 구매할 수 있는 부분입니다. OrcaRouter에서는 이것이 하나의 엔드포인트로, 15개 제공업체의 196개 모델을 아우르며, 제공업체 정가 그대로 마크업 없이 전달되고, 선택한 모델이 오류를 내거나 시간 초과되면 자동으로 장애 조치됩니다. 우리는 SeedRealtime을 호스팅하지 않습니다 — 그것은 ByteDance의 것으로 Doubao 내부에 있고, 라우팅할 대상이 없습니다. Muse Realtime Avatar도 호스팅하지 않으며, 다른 누구도 마찬가지입니다. 우리가 제공하는 것은 두 시스템이 각자의 어려운 작업을 넘겨주는 계층이며, 바로 사고를 담당할 다른 모델을 원할 때 바뀌는 계층입니다.

답을 바꾸는 것은 무엇인가?

SeedRealtime에서 빠진 조각은 기능이 아니라 증거입니다. 파라미터 수, 벤치마크 스위트, 기술된 인간 평가를 담은 기술 보고서가 있다면 그것은 "앱 내부의 데모"에서 팀이 검토하고 추론할 수 있는 무언가로 나아갈 것입니다. ByteDance의 게시물 또한 가중치나 문서화된 API를 내세우지 않은 채 일반적인 "Try Dola" 및 "Try in Playground" 목적지로 연결하는데, 이는 모델 릴리스보다는 제품 기능의 패턴입니다.

Muse Realtime Avatar의 경우, 빠진 조각은 상업적 측면입니다: 요금표, 엔드포인트, 날짜, 그리고 Meta가 아직 완전히 명시하지 않은 지역 및 연령 조건입니다. Meta의 게시물은 자사의 데모가 Muse 앱에서 제공되는 아바타를 모두 반영하지는 않는다고 언급하는데, 이 문장이 이와 관련해 세워지는 모든 계획을 좌우해야 합니다.

그중 하나가 바뀌기 전까지는, 이 비교는 유난히 짧은 형태를 띤다. 두 모델 모두 오디오비주얼이고, 둘 다 전이중 방식이며, 둘 다 정말 인상적인 엔지니어링이지만, 이 글을 읽는 누구도 터미널에서 이 둘 중 어느 것도 호출할 수 없다. 차이는, 그럴 수 있다면 그것들로 무엇을 하겠느냐에 있다: 하나는 말하는 캐릭터를 주고, 다른 하나는 알아차리는 시스템을 준다.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.