흰색 배경에 부드러운 파란색-청록색 그라데이션 악센트가 있는 'Gemini 3.8 Live with Live Avatar'용 생성된 히어로 카드입니다. 세 장의 겹쳐진 카드에는 '2026년 9월 15일 — Gemini 3.8 Live와 3.8 Live Extended Thinking이 Live API에 출시됩니다', '2026년 9월 24일 — Live Avatar 발표, Gemini Enterprise', '오늘 — 아바타는 모델 ID가 아니라 엔터프라이즈 기능입니다'라고 적혀 있습니다. 바닥글에는 '날짜는 Google DeepMind 기준입니다.'라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Gemini 3.8 Live with Live Avatar: Google, 자사 음성 모델에 얼굴을 부여하다

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 15일, Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking이 출시되었습니다. Google이 공급업체의 API에 공개한 두 가지 네이티브 라이브 대화 엔드포인트로, 하나는 지연 시간에 최적화되었고 다른 하나는 숙고에 최적화되었습니다. 9월 24일, 회사는 Gemini 3.8 Live with Live Avatar를 발표했습니다. 이는 거의 실시간에 가까운 영상 생성과 동일한 음성 루프를 결합하여 모델이 말하는 동안 얼굴을 갖도록 해줍니다. 두 모델 ID와 관련해서는 달라진 것이 없습니다. 달라진 것은 대화가 어떤 모습을 띨 수 있는지, 그리고 — 더 중대하게는 — 대화가 아직 진행 중일 때 모델이 대화에 무엇을 할 수 있도록 허용되는지입니다.

9월 24일에 실제로 출시된 것

DeepMind의 게시물은 짧고 구체적이며, 그것이 주장하는 것과 그것이 의미하는 바를 구분해 볼 가치가 있다. Live Avatar는 Google 스스로의 표현에 따르면 실시간 비디오 생성과 기존 음성 스택을 결합하여 "Gemini의 대화형 AI에 거의 실시간에 가까운 시각적 현존감을 부여한다." 회사는 정밀한 립싱크, 자연스러운 표정, 매끄러운 발화 순서 전환을 설명하고 고객 서비스와 대화형 워크스루라는 두 가지 배포 사례를 제시한다. 그리고 나서 빌드를 계획하는 누구에게나 가장 중요한 문장을 말한다 — "오늘부터 Gemini 3.8 Live with Live Avatar를 Gemini Enterprise에서 사용할 수 있습니다."

그것이 가용성에 관한 전부입니다. Live Avatar는 Gemini API 모델 ID가 아닙니다. API의 오디오 모델 목록에는 여전히 gemini-3.8-live와 gemini-3.8-live-extended-thinking이 있으며 아바타 행은 없고, 요금표에는 아바타 항목이 없습니다. 이 기능은 Gemini Enterprise 안에 들어갑니다. 즉, 이 발표의 대상은 기업 구매자와 그들을 대신해 통합하는 개발자이지, 오늘 키로 Live API를 호출하는 개별 개발자가 아닙니다.

게시물의 두 가지 주장은 정확히 인용할 가치가 있다. 둘 다 일반적인 출시 문구보다 강하기 때문이다. 첫째: Live Avatar는 "네이티브 다국어 음성-대-음성 동기화를 지원하며" "비디오 충실도를 저하시키거나 시각적 드리프트를 일으키지 않고 97개 언어를 매끄럽게 전환할 수 있다"고 한다. 97이라는 수치는 9월 15일 출시가 기반 라이브 대화 모델에 대해 내세운 것과 동일한 언어 수이므로, 이는 기존의 다국어 주장에 새로운 제약이 덧붙여 다시 제시된 것이다 — 문장 중간에 언어가 바뀔 때 립싱크와 얼굴 애니메이션이 따라가야 한다는 것이다. 둘째: 모든 출력에는 SynthID가 워터마크로 삽입되어 "오디오와 비디오 출력에 직접 짜여 들어간다." 음성만이 아니라 두 트랙 모두.

진정으로 새로운 기능은 중간에 있는 것입니다.

시각 자료는 넘어가고 읽어 보면, 가장 흥미로운 문단은 도구 호출에 관한 문단이다. Goog​le은 Live Avatar가 "비동기 도구 호출"을 기반으로 하며, 이 기능이 "활발한 대화를 계속하면서 백그라운드에서 도구 호출을 트리거하고 데이터를 가져오며, 중단 없는 대화 흐름을 보장하면서 복잡한 작업을 처리할 수 있다"고 말한다. 제시된 예시는 호텔 투숙객 체크인으로, 모델이 백그라운드에서 도구를 호출하면서 계속 말을 이어가는 상황이다.

그것은 대부분의 음성 통합이 기반으로 삼는 요청-응답 구조와는 실질적으로 다른 아키텍처적 차이이며, 비용이 따르는 부분이기도 합니다. 비동기 실행은 모델이 대화 기록에는 드러나지 않는 작업을 수행하고 있다는 뜻입니다. 텍스트 파이프라인에서는 도구 호출이 하나의 턴으로 보였을 것입니다. 여기서는 그것이 아직 진행 중인 대화 아래에서 일어나며, 이는 모든 동시 실행이 제기하는 것과 같은 질문을 불러일으킵니다: 도구 호출이 문장 중간에 조용히 실패하면 어떻게 되는가, 그리고 호출자는 그것을 어떻게 아는가? Goog​le의 글에는 이에 대한 언급이 없으며, 그 답을 찾아볼 곳은 모델 카드입니다. "끊김 없는 대화 흐름"이라는 주장은 공급업체가 보고한 것으로 취급하고, 우리가 찾을 수 있는 어떤 제3자에 의해서도 검증되지 않은 것으로 보십시오.

프리셋 아바타, 그리고 흥미로운 절반을 제한하는 허용 목록

커스터마이징은 두 계층으로 나뉘며, 그중 하나만 일반적으로 사용할 수 있습니다. 모든 엔터프라이즈 배포에는 "다양한 사전 설정 아바타 라이브러리"가 제공됩니다. "고품질 참조 이미지"에서 생성되며 "참조 대상의 유사성, 브랜드 스타일링 또는 캐릭터 정체성을 유지"하는 사용자 지정 아바타는 별도 게이트 뒤에 있으며, Google은 이를 분명히 밝힙니다: "사용자 지정 아바타 생성은 현재 엔터프라이즈 허용 목록 등록을 통해서만 사용할 수 있습니다."

그래서 대부분의 팀이 실제로 원하게 될 기능, 즉 아바타가 브랜드나 이름이 지정된 캐릭터에 맞춰지게 하는 기능은 바로 셀프서비스로 이용할 수 없는 기능이다. 계획이 마스코트처럼 보이는 합성 발표자에 달려 있다면, 모델 출시가 아니라 허용 목록 결정을 기다리고 있는 것이다. 이는 기술적인 사실이 아니라 조달상의 사실이며, 조용히 한 분기를 밀리게 만드는 종류의 일이다.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

나머지 줄을 기준으로 어디에 위치하는지

Live Avatar는 빈 제품군 속에서 등장한 것이 아니며, 그것이 차지하는 위치는 같은 2주 동안 출시된 형제 제품들과 견줄 때 가장 쉽게 드러난다.

• 제공 방식 — Live Avatar가 포함된 Gemini 3.8 Live는 Gemini Enterprise 내부의 엔터프라이즈 기능인 반면, Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking은 모델 ID와 공개된 분당 요금이 있는 Gemini API 엔드포인트입니다
• 개발자 호출 가능 — Live Avatar는 불가, 모델 ID도 요금표 항목도 없음 vs 두 Live 엔드포인트는 가능, gemini-3.8-live 및 gemini-3.8-live-extended-thinking
• 출력 — Live Avatar는 오디오와 동기화된 비디오 vs Live 엔드포인트는 오디오만
• 언어 관련 주장 — Live Avatar는 립싱크와 표정 연속성을 갖춘 97개 언어 vs Live 엔드포인트는 대화 중 자동 전환을 지원하는 97개 언어
• 워터마크 — Live Avatar는 오디오와 비디오 트랙 모두에 SynthID vs Live 엔드포인트는 생성된 오디오에 SynthID

두 Live 엔드포인트 자체는 잘 문서화된 한 쌍입니다. 독립적인 측정에서는 이 둘이 일부 축에서는 크게 벌어져 있고 다른 축에서는 가깝습니다. Artificial Analysis Speech to Speech Index에서 Gemini 3.8 Live Extended Thinking (High)은 82.6으로 Gemini 3.8 Live의 76.0과 맞서는데, 이 격차는 대화 역동성보다는 주로 추론 품질에서 비롯된 것이며, 대화 역동성에서는 순위가 뒤집힙니다. Google 자체 수치로는 τ-Voice 작업 완료율에서 68.6%와 30.1%, Big Bench Audio에서 98%와 92%입니다. Live Avatar는 그 아래에 어느 것을 호출하든 그 모델을 상속하며, 가격도 함께 상속합니다. 아바타는 동일한 대화 루프 위의 프레젠테이션 계층이기 때문입니다.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

이것이 바꾸지 않는 것

그것은 모델을 더 낫게 만들지 않는다. Live Avatar는 프레젠테이션 및 오케스트레이션 계층이다. Gemini 3.8 Live의 품질 수치는 9월 15일 당시와 같으며, 두 변형 중 더 강력한 쪽이 필요한 사람은 여전히 Extended Thinking을 선택하고 그 지연 시간을 감수해야 한다. 그것은 API에 비디오를 넣지 않는다. 또한 모델과 대화하는 가격을 바꾸지 않는다. 여전히 Live API의 분당 오디오 요금으로 청구된다 — 오디오 입력은 분당 $0.005, 오디오 출력은 분당 $0.018 — 아바타의 비디오 생성은 별도로 판매되지 않기 때문에 공개적으로 가격이 책정되어 있지 않다.

그것이 바꾸는 것은 별도의 렌더링 계층 없이 만들 수 있는 제품들의 집합이다. 이전에는 말을 하고 나서 화면에 빈 패널을 남겨 두던 지원 에이전트가 이제는 작업하는 동안에도 얼굴을 유지할 수 있고, 백그라운드에서 수행 중인 작업이 더 이상 방송 공백처럼 드러나지 않는다. 이는 인터페이스의 형태에 의미 있는 변화이자 기반 모델에는 소소한 변화다. 이 둘은 동시에 사실일 수 있다.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

주목할 사항, 그리고 라우팅 관련 참고 사항 하나

세 가지가 갖춰져야 이것이 발표에서 빌드 결정으로 넘어갈 수 있습니다. 커스텀 아바타 허용 목록 등록이 열려야 합니다. 프리셋 아바타는 데모이고 커스텀 아바타는 제품이기 때문입니다. 비디오 트랙에는 가격이 붙어야 합니다. 가격이 없는 결과물로는 아무도 단위 경제성을 모델링할 수 없기 때문입니다. 그리고 아바타 엔드포인트가 API의 모델 목록에 나타나야 합니다. 그것이 엔터프라이즈 기능과 개발자가 오늘 밤 바로 호출할 수 있는 것의 차이이기 때문입니다.

우리 쪽과 관련해서 한 가지는 정확히 짚고 넘어갈 만합니다. 다르게 짐작하기 쉬운 부분이니까요. OrcaRouter는 Gemini 3.8 Live 엔드포인트나 Live Avatar를 라우팅하지 않으며, 여기 어떤 내용도 그렇게 한다는 주장으로 읽혀서는 안 됩니다. 우리가 실제로 제공하는 것은 Google의 3.8 라인 가운데 나머지 — google/gemini-3.8-flash를 포함해 — 와 함께 마크업 없이 공급자 정가로 단일 키에서 이용할 수 있는 200개 이상의 모델을 담은 카탈로그입니다. Live Avatar가 여러분의 아키텍처를 고객이 한 말을 추론해야 하는 에이전트 쪽으로 이끈다면, 그 스택에서 추론을 맡는 절반이 바로 오늘 통합할 수 있는 절반입니다.