'Muse Realtime Avatar vs GPT-Live-1' 기사를 위한 생성된 히어로 카드로, 헤드라인 양쪽에 두 개의 둥근 카드가 배치되어 있습니다. 왼쪽 카드에는 인물 아바타 아이콘 위에 'Muse Realtime Avatar'가 적혀 있고, '비디오 + 음성, 하나의 스트림'과 'API 없음, 가격 없음, 날짜 없음'이라는 줄이 있습니다. 오른쪽 카드에는 말풍선 아이콘 위에 'GPT-Live-1'이 적혀 있고, '분당 $0.05, 초 단위 청구'와 '동시 세션, WebRTC'라는 줄이 있습니다. 부제는 '하나는 분을 팔고, 다른 하나는 존재감을 판다.'라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Muse Realtime Avatar vs GPT-Live-1: 대화에 맞선 프레즌스

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

과금 단위는 각 회사가 자신이 무엇을 팔고 있다고 생각하는지를 알려준다. GPT-Live-1, Open​AI의 전이중 음성 모델은 음성 1분당 0.05달러 정액으로 청구되며, 초 단위로 과금된다. 또한 속도 제한은 동시 세션을 단위로 하며 — 티어 1에서는 25개, 티어 5에서는 500개까지 증가한다. 그것이 전화 회선의 단위다. Muse Realtime Avatar, Meta가 2026년 9월 23일에 발표한 이 모델에는 청구 단위가 없다. 청구할 것이 없기 때문이다: API도, 엔드포인트도, 가격도, 날짜도 없다. 대신 공개된 단위는 하드웨어 수치다 — NVIDIA GB200 한 대에서 동시 실시간 세션 12개. 한 회사는 대화를 분 단위로 팔고 있다. 다른 회사는 얼굴을 렌더링하는 데 드는 비용을 보여주고 있으며, 아직 그것을 팔기로 결정하지 않았다.

두 모델 모두 비교적 최신이고, 어느 쪽도 흔히 그 단어가 지니는 의미의 ‘출시’는 아니다. GPT-Live-1은 2026년 7월 8일 ChatGPT 안에서 출시되었고 개발자 API에는 9월 10일에야 도달했다 — 그 두 달 동안 그것은 소비자 제품의 기본 음성이었으며, 무언가를 만드는 누구도 사용할 수 없었다. Muse Realtime Avatar는 2026년 9월 23일 Meta Connect에서 발표되었고, Meta 자체 연구 게시물에서 시연되었으며, 제품이라기보다 Muse agent의 기능으로 남아 있다. 이 둘을 비교하는 것은 같은 아이디어의 서로 다른 두 단계를 비교하는 것이다: 대화형 모델이 충분히 좋아져서 다음 질문이 ‘말하는 동안 사용자가 무엇을 보고 있는가’가 되는 순간에 무슨 일이 일어나는가.

OpenAI가 구축한 것: 결코 멈추지 않는 대화

GPT-Live-1은 운영상 중요한 의미에서 전이중입니다 — 작업을 시작하기 전에 사용자가 끝내기를 기다리지 않습니다. 개발자 API에는 정확히 하나의 엔드포인트, 즉 Live Sessions 엔드포인트를 통해서만 접근하며, 정확히 하나의 모델 ID인 gpt-live-1를 사용하고, 고정할 날짜 지정 스냅샷도 없고 활성화된 형제 엔드포인트도 없습니다. Chat Completions도, Responses도, Realtime도, 파인튜닝도, 오디오 전사나 음성 엔드포인트도 없습니다. 이미지와 비디오 입력은 명시적으로 지원되지 않습니다.

다운스트림의 모든 것을 좌우하는 설계 결정은 위임이다. GPT-Live-1은 스스로 어려운 사고를 하지 않는다. Open​AI의 문서는 음성 계층을 별도의 추론 백엔드와 짝지으며, 공개된 WebRTC 예제에서 그 백엔드는 GPT-5.6 Terra다. 따라서 GPT-Live-1 세션은 동시에 작동하는 두 개의 미터기다: 음성에 분당 $0.05, 그리고 위임하는 모든 도구 호출, 검색, 추론 단계마다 백엔드 모델의 일반 토큰 요금이 더해진다. Speech to Speech Index에서 이런 이중 인격은 같은 모델이 두 번 점수를 받는 것으로 나타난다 — 중간 수준의 노력으로 GPT-6 Astra가 사고를 맡을 때 81.5, 낮은 수준의 노력으로 GPT-5.6 Sol일 때 80.1. 이 두 구성 사이의 1.4점 격차는 GPT-Live-1의 최고 구성을 1위에 올려놓는 0.2점 차이보다 더 크다.

그것이 바로 이 모델의 솔직한 형태입니다. 음성 프런트 엔드는 고정되어 있고, 지능은 당신이 설정하는 매개변수이며, 그것은 어떤 경쟁 모델보다도 점수를 더 많이 움직입니다.

What Meta built: 목소리를 따라 움직이는 얼굴

Muse Realtime Avatar는 GPT-Live-1에는 없는 문제를 공략한다 — 생성된 비디오를 생성된 음성과 정확히 동기화된 상태로 유지하는 것이다. Meta의 해법은 둘을 동일한 스트림으로 만드는 것이다: Muse Realtime Voice는 콘텐츠와 운율을 모두 담은 음성 토큰을 내보내고, 아바타는 바로 그 토큰을 소비하는 오디오 기반 Diffusion Transformer로서 참조 이미지와 최근 비디오 잠재값의 롤링 윈도우를 조건으로 받는다. 사후에 립싱크되는 것은 아무것도 없다. "사후"라는 게 존재하지 않기 때문이다 — 목소리, 입모양, 표정이 하나의 프로세스에서 나온다.

공개된 수치는 Meta 자체의 것이며, Meta가 선택한 기준선에 대해 측정되었고, 회사 외부에서는 재현된 바 없습니다. 사용자의 발언이 끝난 때부터 동기화된 음성 및 영상 응답의 첫 바이트까지 870ms. 448×768 세로형 비디오를 초당 25프레임으로, 시청자가 카메라가 아님을 알 수 있도록 투명 오버레이로 워터마크 처리. GB200 하나에서 12개의 동시 세션, Meta 자체의 2단계 BF16 기준선 대비 8배 용량 증가, 4비트 양자화 인식 학습, 영구 KV 캐시 및 지연 인식 동적 배칭을 통해. 그리고 Meta가 보고한 선호도 결과는 해당 기준선 대비 45%에서 55%로 상승했으며, 상용 아바타 시스템에 대해 두 가지 공개된 승리를 거두었습니다. 또한, 매너리즘에 관해서는 그중 하나에 대한 결과가 동등성과 통계적으로 구분되지 않는다는 점도 공개했습니다.

그 목록에 있는 어느 것도 요금이나 엔드포인트, 날짜가 아닙니다.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

2미터짜리 청구서, 그리고 라우팅이 진가를 발휘하는 곳

GPT-Live-1의 비용 구조는 하나의 숫자가 아니며, 이를 하나의 숫자로 취급하는 것이 바로 저렴하게 들리는 음성 모델이 비싼 한 달을 만들어내는 방식이다. 음성은 분당 $0.05이며, 올림 없이 초 단위로 청구되고, 세션의 처음 15초는 선불로 청구되지만 나중 통화 시간에 대해 크레딧으로 반영될 뿐 그 위에 추가로 쌓이지는 않는다. 세션이 위임하는 모든 것 — 추론, 도구 호출, 모든 검색 — 은 백엔드 모델 자체의 요율로 별도 청구된다. 위임 대상을 프런티어 추론 모델로 지정하고 매 턴마다 검색하게 하면, 뒤에 프리미엄 모델을 둔 시간당 $3의 오픈 라인을 만들어낸 것이다.

그 두 번째 계량기가 바로 라우팅할 수 있는 절반입니다. OrcaRouter에서 GPT-Live-1 세션의 백엔드는 그저 또 하나의 모델 호출일 뿐입니다: 단일 키 하나로 15개 제공업체의 196개 모델, 제공업체 정가 그대로 마진 제로로 전달되며, 선택한 모델에서 오류가 나거나 타임아웃되면 자동 페일오버가 작동합니다. 음성 레이어는 라우팅할 수 없습니다 — Live Sessions는 Open​AI의 엔드포인트 전용입니다 — 하지만 음성 레이어가 위임하는 모든 것은 하나의 키 위에 올라가며, 이는 발신자가 얼마나 깊이 생각하느냐에 따라 늘어나는 청구서의 부분이 곧 계약 없이 바꿀 수 있는 부분이라는 뜻입니다.

이와 달리 Muse Realtime Avatar에는 라우팅할 미터가 없습니다. 이는 앱의 기능입니다.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

음성 에이전트의 용도에 관한 두 가지 베팅

사양을 걷어내면 두 회사는 제품에 대해 서로 다른 의견을 갖는다. OpenAI의 베팅은 대화가 바로 제품이라는 것이다 — 음성 에이전트는 전화선이고, 해야 할 일은 그것을 전화선처럼 느껴지게 만드는 것이다: 결코 멈추지 않고, 어려운 사고는 뒤에 있는 모델에 넘기고, 분 단위로 과금하고, 동시 통화 수에 따라 확장한다. GPT-Live-1의 API 표면에서의 모든 선택은 여기서 비롯된다. 동시성 기반 속도 제한, WebRTC 전용 전송, 의도적으로 좁은 단일 엔드포인트, 영상 입출력 없음.

메타의 베팅은 존재감이 곧 제품이라는 것이다 — 즉, 에이전트를 볼 수 있는 사용자는 대화에 머무는 사용자이며, 흥미로운 엔지니어링은 턴테이킹이 아니라 통화가 이어지는 동안 렌더링된 캐릭터를 일관되게 유지하는 것이다. 이러한 선택은 GPU에서 프레임 레이트와 세션 밀도에 최적화된 시스템을 낳으며, 상업적 접점은 전혀 없다.

둘 다 맞고 그 둘이 결합될 실질적인 가능성은 충분히 있다. 제품은 대화를 전이중(full-duplex) 음성 모델에서 돌리고 시각 레이어는 아바타 렌더러에서 돌릴 수 있으며, 오늘날 이를 막는 유일한 것은 아바타 렌더러에 엔드포인트가 없다는 점이다. 그럴듯하지 않은 것은 그 둘을 같은 구매의 두 가지 버전으로 취급하는 일이다.

누가 행동해야 하고, 누가 기다려야 하는가

지금 음성 제품을 만들고 있다면, GPT-Live-1은 호출할 수 있고 Muse Realtime Avatar는 호출할 수 없으며, 그것으로 결정은 끝난다. GPT-Live-1 안에서 흥미로운 선택은 위임할 백엔드인데, 점수와 청구 금액이 실제로 움직이는 곳이 바로 거기이며, 음성 통합을 건드리지 않고도 라우팅하고 교체하고 장애 조치할 수 있는 스택의 유일한 부분이기 때문이다.

당신이 원하는 것이 아바타라면, 기다림은 수동적인 것이 아니다. 주목할 만한 것들은 구체적이다: Meta가 요금표와 엔드포인트를 공개하는지, 명시된 날짜가 나타나는지, 그리고 870ms가 Connect 데모가 아니라 셀룰러 연결 상태의 휴대폰과 맞닥뜨렸을 때도 버텨내는지. Meta 자체 게시물은 자사의 데모가 모두 Muse 앱에서 사용 가능한 아바타를 반영하지는 않는다고 언급하는데, 이것이 붙잡아야 할 문장이다.

그중 하나가 바뀌기 전까지, 이 비교에는 한 줄짜리 답이 있습니다. GPT-Live-1은 당신이 두뇌를 고르는 전화선입니다. Muse Realtime Avatar는 전화번호가 없는 얼굴입니다.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.