기사 'Muse Realtime Avatar vs Realtime-Venus'를 위해 생성된 히어로 카드로, 헤드라인 양옆에 두 개의 둥근 카드가 표시됩니다. 왼쪽 카드에는 송신 비디오 프레임 아이콘 위에 'Muse Realtime Avatar'가 적혀 있고, '비디오를 생성함'과 '448x768, 25 fps, 클로즈드'라는 줄이 있습니다. 오른쪽 카드에는 수신 카메라 아이콘 위에 'Realtime-Venus'가 적혀 있고, '비디오를 읽음'과 '2 x 9B, Apache-2.0, 다운로드 가능'이라는 줄이 있습니다. 부제목은 '하나는 얼굴을 렌더링합니다. 다른 하나는 그 얼굴을 지켜봅니다.'라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Muse Realtime Avatar vs Realtime-Venus: 비디오 출력 대 비디오 입력

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

9일 간격을 두고 발표된 두 시스템은 모두 스스로를 실시간이라고 부르고 둘 다 오디오비주얼이라는 라벨을 내세우며, 같은 축을 따라 서로 반대 방향을 가리킨다. Muse Realtime Avatar는 2026년 9월 23일 Meta가 발표한 시스템으로, 사진 한 장을 받아 생성한다 — 말하는 영상을. 이 시스템의 영상은 출력이다 — 초당 25장의 448×768 세로 프레임이며, Muse Realtime Voice와 토큰 스트림을 공유하는 오디오 기반 Diffusion Transformer가 만들어낸다. Realtime-Venus는 2026년 9월 12일 Ant Group의 Venus Team이 Tsinghua University와 함께 arXiv에 업로드된 시스템으로, 소비한다 — 영상을: Realtime-Venus-Omni 체크포인트는 카메라 프레임을 SigLIP2 인코더를 통해 스트리밍하고 보이는 것에 대해 이야기하는 반면, Realtime-Venus-Audio 체크포인트는 로드 시점에 비전을 꺼둔 동일한 백본이다. 하나는 얼굴을 렌더링한다. 다른 하나는 얼굴을 바라본다. 둘 다 호출할 수 없고, 둘 중 하나만 다운로드할 수 있다 — 이것이 결국 더 중대한 차이로 드러난다.

가용성 역전은 다른 무엇보다 먼저 분명히 짚고 넘어갈 가치가 있다. 그것은 메타 제품과 연구실 릴리스에 관한 모든 기대에 정면으로 배치되기 때문이다. 메타의 시스템은 닫혀 있다. Connect에서 발표되었고, 연구 포스트에서 시연되었으며, Muse 에이전트에 내장되었지만, API도, 가중치도, 가격도, 날짜도 없다. 앤트 그룹의 시스템은 열려 있다. 두 개의 9B 체크포인트가 Apache-2.0 아래 BF16 safetensors로, inclusionAI/Realtime-Venus라는 이름으로 Hugging Face에 공개되어 있으며, 커스텀 Transformers 코드, requirements 파일, 레퍼런스 보이스, 프로젝트 페이지, 그리고 동반 GitHub 저장소가 함께 제공된다. 소비자 제품을 가진 회사는 손에 쥘 수 있는 것을 아무것도 내놓지 않았다. 연구팀은 모든 것을 내놓았다.

각각이 프레임으로 하는 일

영상의 방향성이 전체적인 구조적 차이이며, 그것은 강조의 문제가 아닙니다.

비디오 — Muse Realtime Avatar가 음성 토큰, 참조 이미지, 최근 비디오 잠재값의 롤링 윈도우를 조건으로 이를 생성합니다. Realtime-Venus-Omni가 이를 인식하며, SigLIP2 비전 인코더가 오디오와 함께 프레임을 모델로 스트리밍합니다.

오디오 — Muse Realtime Avatar는 콘텐츠와 운율을 함께 담고 있는 Muse Realtime Voice의 음성 토큰으로부터 생성을 수행하며, Realtime-Venus는 별도의 텍스트 음성 변환 모델을 끝에 덧붙이는 대신 스트리밍 플로 매칭 디코더로 디코딩되는 이산적 S3 토큰으로 음성을 생성합니다.

백본 — Meta의 아키텍처는 크기가 공개되지 않은 오디오 기반 Diffusion Transformer이며, Realtime-Venus는 Whisper-Medium 오디오 인코더와 함께 Qwen3-8B 언어 백본을 기반으로 구축되었고, 해당 모델 카드에는 Omni 체크포인트가 MiniCPM-o 4.5에서 개조되었음을 명시하고 있습니다.

가중치 — Muse Realtime Avatar의 가중치는 공개되지 않았으며 공개될 조짐도 없습니다. Realtime-Venus는 9B 체크포인트 두 개를 제공하는데, 둘 모두 BF16에 40,960 토큰 컨텍스트를 지원하며 Apache-2.0 라이선스입니다.

접근 — Muse Realtime Avatar는 API도 없고 날짜도 없으며, Realtime-Venus 역시 API가 없고, 해당 카드에는 어떤 추론 제공업체에 의해서도 배포되지 않는다고 분명히 명시되어 있습니다.

실행 위치 — Muse Realtime Avatar는 Meta가 아직 명단에 올리지 않은 사용자들을 위해 18세 이상 조건으로 Muse 앱 안에서 실행되며, Realtime-Venus는 하드웨어와 의욕만 갖추고 있다면 오늘 바로 여러분의 GPU에서 실행됩니다.

마지막 두 줄을 나란히 읽어 보면 실질적인 차이가 드러난다. 두 시스템 중 어느 것도 호출할 수 없다. 그중 하나는 실행할 수 있다.

9B 다운로드는 진짜입니다. 그리고 그것이 당신에게 치르게 하는 대가도 진짜입니다.

Realtime-Venus는 저장소 스텁이 아닙니다. 가중치도 있고, 사용자 지정 로딩 코드도 있으며, 최상위 라이선스는 Apache-2.0입니다. 이를 기준으로 계획을 세우기 전에 알아 둘 만한 두 가지가 있습니다.

첫 번째는 가중치에 없는 것입니다. 아키텍처를 독특하게 만드는 이중 루프 런타임 — 1초 상호작용 루프와 논문에서 Realtime-Venus-Harness라고 부르는 백그라운드 스케줄러(이 스케줄러는 격리된 대화 상태 스냅샷에 대해 위임된 작업을 실행하여 장시간 실행되는 작업이 대화가 진행됨에 따라 손상되지 않도록 한다) — 은 GitHub 저장소에 별도 구성 요소로 존재합니다. 보고서에서 진정으로 새로운 아이디어인 위임 설계는 여러분이 직접 조립하고 신뢰해야 하는 부분입니다.

두 번째는 계보다. 카드에는 Omni 체크포인트가 2026년 초 OpenBMB가 오픈소스로 공개한 9B 옴니모달 모델인 MiniCPM-o 4.5에서 적응된 것이라고 적혀 있다. 그것은 각주가 아니다. 이는 Ant Group의 기여가 다른 누군가의 스트리밍 백본 위에 얹힌 포스트트레이닝, 런타임, 위임 설계라는 뜻이다. 이는 "새로운 9B 옴니 모델"보다 더 좁고 더 구체적인 주장이며 — 더 유용한 주장이다. 왜냐하면 시각 인코더에 문제가 생겼을 때 어디를 살펴봐야 하는지 알려주기 때문이다.

그 숫자들, 그리고 그것이 정확히 누구의 것인지

이 지점에서 두 시스템은 도움이 되지 않는 방식으로 수렴합니다. 어느 쪽도 단 하나의 독립적인 평가도 가지고 있지 않습니다. Meta의 네 가지 수치는 Meta가 선택한 기준선에 대해 회사가 보고한 것입니다. Realtime-Venus의 수치는 기술 보고서에서 저자가 보고한 것으로, 제3자가 실행 결과를 공개한 적도 없고 대조해 볼 수 있는 리더보드 항목도 없습니다. 두 시스템 모두 이를 만든 사람이 아닌 누구에 의해서도 공개적으로 측정된 적이 없습니다.

Meta가 공개한 네 가지 수치는 다음과 같습니다: 사용자의 발화가 끝난 시점부터 동기화된 음성·영상 응답의 첫 바이트까지 870ms; 초당 25프레임의 448×768 세로형 영상; 자체 베이스라인보다 60배 적은 모델 평가 횟수; 그리고 NVIDIA GB200 한 대에서 동시 실시간 세션 12개로, Meta의 2단계 BF16 베이스라인 대비 8배의 용량 향상입니다. Meta는 또한 두 상용 아바타 시스템과의 선호도 결과도 공개하는데, 그중 하나는 몸짓에서 통계적으로 동등성과 구분되지 않는다고 보고합니다 — 이는 대부분의 출시 글이 생략하는 종류의 결과라는 점에서 인정할 만한 공개입니다.

Ant Group이 공개한 내용에 따르면: 보고서가 사용하는 8개 비디오 벤치마크 중 6개에서 최고 점수를 기록했으며, Omni 체크포인트의 경우 StreamingBench 70.2, OVO-Bench 64.7, Daily-Omni 81.3이 포함됩니다. Audio 체크포인트의 경우 MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8, 그리고 보고서가 최고 비교 수치와 일치한다고 설명하는 VoiceBench AlpacaEval 점수 4.81을 기록했습니다.

증거에서 한 가지 비대칭성은 짚고 넘어갈 가치가 있습니다. Ant Group의 수치는 이름이 붙은 테스트 세트를 사용한 벤치마크 점수입니다. 원칙적으로는 가중치를 내려받아 그 테스트 스위트를 실행하려는 사람이라면 누구나 재현할 수 있습니다. Meta의 대표 수치는 Meta 자체 서빙 스택에서의 지연 시간 측정값인데, Meta 외부에는 그 시스템이 없으므로 Meta 밖의 누구도 재현할 수 없습니다. 다시 말해, 공개 릴리스는 더 검증 가능한 쪽이기도 합니다.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

왜 이 두 가지 모두 사실은 라우팅 문제인가

어느 시스템도 완전한 에이전트가 아니며, 이는 두 시스템 모두에게 같은 방식으로 해당된다. Muse Realtime Avatar는 Muse Realtime Voice에 결합된 렌더 레이어이며, Muse Realtime Voice는 추론이 Muse Spark에서 실행되는 에이전트의 대화 레이어이다. Realtime-Venus는 인라인으로 할 수 있는 범위를 초과하는 모든 것 — 검색, 도구 호출, 고난도 추론 — 을 대화의 스냅샷을 기준으로 백그라운드에서 작업을 실행하는 하네스로 위임한다. 두 설계 모두에서 사용자가 대화하는 대상은 프런트 엔드이며, 사고는 별도의 텍스트 모델에서 일어난다.

그 별도의 텍스트 모델이 바로 라우팅할 수 있는 부분입니다. OrcaRouter에서는 다음을 위한 하나의 엔드포인트입니다: 15개 제공업체의 196개 모델, 제공업체 정가 그대로 마크업 없이 전달되며, 모델에 오류가 발생하거나 시간 초과될 때 자동 페일오버됩니다 — 이는 반대편에 있는 것이 아무도 독립적으로 평가하지 않은 자체 호스팅 체크포인트일 때 평소보다 더 중요합니다. 우리는 Realtime-Venus를 호스팅하지 않습니다: 그것은 다운로드이며, 우리는 그것을 제공하지 않습니다. Muse Realtime Avatar도 호스팅하지 않습니다, 아무도 호스팅하지 않기 때문입니다. 우리가 제공하는 것은 두 아키텍처가 각자의 어려운 작업을 넘겨주는 계층이므로, 대화의 어느 쪽에 있든 검증되지 않은 구성 요소는 프로덕션에 대한 베팅이 아니라 설정 한 줄입니다.

이 중에서 실제로 더 진행된 것은 어느 것인가요?

본능적으로는 Meta의 것이라고 말하게 된다. Meta에는 제품과 데모 영상이 있기 때문이다. 증거는 더 흥미로운 것을 말해준다. Meta의 시스템은 더 나은 프로덕션 엔지니어링을 갖췄다 — GB200에서의 동시 세션 12개는 서빙 성과이며, 출시된 아바타 제품을 대상으로 공개된 선호도 테스트는 두 시스템 중 어느 쪽이든 보유한 유일한 직접 비교 수치다. Ant Group의 시스템은 더 나은 검증 가능성을 갖췄다: 이름이 명시된 벤치마크, 공개된 가중치, Apache-2.0 라이선스, 그리고 누구나 재현을 시도할 수 있는 보고서.

둘 다에게 없는 것은 그것을 지불할 방법이다. 그리고 실제로 사용 가능해지기에 더 가까운 쪽은 소비자용 앱을 가진 쪽이 아니다. 그것은 오늘 밤 내려받아 자신의 하드웨어에서, 자신의 데이터로, 아무런 발표도 필요 없이 직접 알아볼 수 있는 쪽이다.

선택하는 입장이라면, 문제는 어느 모델이 더 나은가가 아니다. 부를 수 없는 얼굴을 원하는지, 직접 돌릴 수 있는 카메라를 원하는지의 문제다.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.