'Gemini 3.8 Live vs Gemini 3.8 TTS'를 위한 생성된 히어로 카드가 흰색 배경에 부드러운 파란색과 청록색 그라데이션 액센트를 가지고 있습니다. 'Live API에서 제공됨'이라는 제목의 왼쪽 열에는 'gemini-3.8-live', '듣고 말함', '오디오 입력, 오디오 출력'이 나열되어 있고, 'TTS 엔드포인트에서 제공됨'이라는 제목의 오른쪽 열에는 'gemini-3.8-flash-tts', '작성된 텍스트를 읽음', '텍스트 입력, 오디오 출력'이 나열되어 있습니다. 하단 줄에는 '어느 것도 Gemini 3.8 TTS라고 불리지 않습니다.'라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 하단 모서리에 합성되어 있습니다.
Guides & Insights

Gemini 3.8 Live vs Gemini 3.8 TTS: 대화 루프와 낭독 음성이 한 세대 이름을 공유한다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Gemini 3.8 Live는 2026년 9월 15일에 gemini-3.8-live 및 gemini-3.8-live-extended-thinking으로 출시된 음성-음성 모델입니다. "Gemini 3.8 TTS"는 전혀 모델이 아닙니다 — 그것은 2026년 9월 23일에 gemini-3.8-flash-tts 및 gemini-3.8-flash-lite-tts으로 등장한 텍스트-음성 변환 엔드포인트 쌍을 가리키기 위해, Google 자체 게시물 제목을 포함한 출시 보도에서 사용하는 포괄적인 용어입니다. 그렇다면 이것은 두 제품이 한 가지 작업을 놓고 경쟁하는 일반적인 대결 페이지가 아닙니다. 이것은 하나의 세대 번호를 공유하는 두 가지 작업에 관한 페이지이며, 사람들이 "Live"와 "TTS"라는 단어를 같은 것의 두 가지 변형으로 취급할 때 저지르는 특정 실수에 관한 페이지입니다.

공유 세대 번호가 숨기는 포크

Google의 음성 생성 문서는 스스로 경계를 긋고 있으며, 그 문장은 대충 읽고 넘어가기 쉽다: "TTS 기능은 Live API를 통해 제공되는 음성 생성과는 다릅니다." 같은 구절이 그 이유를 설명하는데, 그 이유는 품질의 문제라기보다 구조적인 문제다. Live API는 "상호작용적이고 비정형적인 오디오, 그리고 멀티모달 입력과 출력"을 위해 만들어졌다. Gemini API를 통한 TTS는 "정밀한 제어를 통해 정확한 텍스트 낭독이 필요한 시나리오에 맞춰져 있다." 이후의 설명은 입력 형태를 명시한다: TTS 모델은 텍스트만 받고 오디오만 반환한다.

그 단 하나의 제약 조건 — 텍스트 입력, 오디오 출력, 오디오 입력 없음 — 이 비교의 전부입니다. Gemini 3.8 Live 모델은 자신에게 말하는 사람의 말을 듣습니다. Gemini 3.8 Flash TTS 또는 Flash-Lite TTS 모델은 누구의 말도 듣지 않습니다. 문자열을 읽고 그것을 수행할 뿐입니다. 나머지는 모두 여기에서 따라옵니다. 한쪽에 존재하는 벤치마크는 다른 쪽에는 무의미하고, 요금은 서로 다른 단위로 부과되며, 실패 모드는 전혀 비교할 수 없습니다.

이것이 중요한 이유는 두 사용 사례가 외부에서 보기에는 완전히 똑같아 보이기 때문입니다. 음성 에이전트와 내레이션 파이프라인은 결국 둘 다 사람처럼 들리는 음성을 출력합니다. 하지만 중단될 수 있는 것은 그중 하나뿐입니다.

"Gemini 3.8 TTS"가 실제로 해석되는 위치

Gemini API의 음성 생성용 지원 모델 표를 열면 TTS 항목이 네 개 있고 Gemini 3.8 TTS라는 항목은 없습니다. 그중 두 개가 이 세대입니다: Gemini 3.8 Flash TTS, 모델 ID gemini-3.8-flash-tts, 130개 언어를 지원하며, 그리고 Gemini 3.8 Flash-Lite TTS, 모델 ID gemini-3.8-flash-lite-tts, 101개 언어를 지원합니다. 나머지 두 개 — Gemini 3.1 Flash TTS Preview와 Gemini 2.5 Pro Preview TTS — 는 Flash-Lite가 대체하는 프리뷰 세대입니다.

그래서 누군가 "Gemini 3.8 TTS"라고 말할 때, 보통은 Flash 티어를 가리킨다. 왜냐하면 그것이 출시 게시물에서 가장 앞세우는 것이고 Arena 보드에서 가장 높은 순위에 올린 것이기 때문이다. 라이브 음성 에이전트에 대해 그렇게 말할 때는, 아무것도 가리키는 것이 아니다. 왜냐하면 그들이 원하는 것은 다른 이름과 다른 입력 계약을 가진 다른 엔드포인트에 있기 때문이다.

세 번째로 언급할 가치가 있는 충돌이 있는데, 그것이 최악의 조언을 만들어내기 때문이다. Gemini 3.8 Live는 추가 기능이 붙은 텍스트 음성 변환 모델이 아니다. 그것은 음성 대 음성 모델이며, 단위당 비용이 더 드는 이유는 단위당 더 많은 작업을 수행하기 때문이다: 듣기, 발화 도중 추론하기, 끼어들기 처리하기, 그리고 Extended Thinking 변형에서는 답하기 전에 숙고하기.

진정으로 비교되는 유일한 숫자

품질 점수는 이 두 계열 사이에서 전이되지 않는다; 내레이터와 대화자를 같은 축으로 채점하는 단일 보드는 없다. 돈은 전이된다, 단위를 정직하게 고르기만 하면, 그리고 음성에 관한 모든 것에서 정직한 단위는 오디오-아워다.

• 입력 기준 과금 — Gemini 3.8 Live는 오디오 분당으로 청구하며, 입력 분당 $0.005, 출력 분당 $0.018인 반면, Gemini 3.8 Flash TTS는 백만 오디오 토큰당 청구하며, 2026년 12월 31일까지 $9.00, 이후 $18.00
• 출력 기준 과금 — Gemini 3.8 Live 양방향 오디오는 정가 기준으로 동시 입력과 출력 1시간에 약 $1.38이며, 프롬프트 캐싱을 적용하기 전 기준인 반면, Gemini 3.8 Flash TTS는 단방향 스트림이고, 완성된 내레이션 백만 자는 Artificial Analysis의 표준화 기준으로 $16.5에 달합니다
• 텍스트 입력 — Gemini 3.8 Live는 텍스트와 오디오를 별도 항목으로 청구하며, 백만 텍스트 토큰당 입력 $0.75, 출력 $4.50인 반면, TTS 엔드포인트는 텍스트 입력을 백만 토큰당 $0.50로 청구합니다
• Flash-Lite 등급 — Gemini 3.8 Live에는 더 저렴한 형제 모델이 없습니다. 선택지는 Live 또는 Extended Thinking인 반면, Gemini 3.8 Flash-Lite TTS는 백만 오디오 토큰당 $6.00, 이후 $12.00로 책정되어 있으며, Artificial Analysis 기준으로는 백만 자당 $11.0입니다
• 입력 형태 — Gemini 3.8 Live는 오디오, 비디오, 텍스트를 입력받고 오디오를 출력하는 반면, TTS 엔드포인트는 텍스트를 입력받고 오디오를 출력합니다

Live 수치는 Google이 공개한 분당 요금을 바탕으로 우리가 계산한 값이며, Google이 공개한 시간당 수치가 아닙니다. 문자(character) 수치는 Artificial Analysis의 정규화 결과이며, 합성 티어를 비교할 때 인용해야 하는 값입니다. Artificial Analysis 자체의 Speech to Speech 보드에는 Live 모델용으로 입력 오디오의 시간당 비용 열이 별도로 있습니다. — Gemini 3.8 Live는 약 $3.50, Extended Thinking 변형은 $0.84입니다. — 이는 또 다른 정규화이며, 두 값이 같은 측정치인 것처럼 분당 요금표와 나란히 놓아서는 안 됩니다.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

잘못 고르면 무엇이 망가질까요?

이 실패 양상들은 서로 그토록 다르기에 교훈적이다.

대화 루프가 필요할 때 TTS 엔드포인트를 호출하면 오류는 발생하지 않습니다. 요청은 유효한 오디오를 반환합니다. 고정된 문자열에 대한 유창하고 잘 읽힌 응답을 받고 나면 침묵이 이어집니다. 애초에 듣고 있는 것이 없었기 때문입니다. 팀들은 첫 번째 barge-in 테스트를 구축할 때 이 문제를 발견하게 되며, '사용자'가 다음 턴을 시작하기 전에 전체 클립이 끝날 때까지 기다려야 한다는 사실을 알게 됩니다. 합성 엔드포인트에 대화 기능을 나중에 추가한다는 것은 음성 인식, 턴 테이킹 정책, 중단 메커니즘을 그 주위에 추가하는 것을 의미합니다. 그 시점에서 여러분은 캐스케이드를 다시 구축한 것이며, 하나의 모델 대신 두 개의 모델에 비용을 지불하게 됩니다.

나레이션이 필요할 때 Live 엔드포인트를 호출하면 사용하지도 않는 기능에 비용을 지불하게 됩니다. Live 모델은 양방향으로 과금됩니다. 양방향을 기대하기 때문입니다. 오디오북이나 교육용 비디오 보이스오버의 경우, 입력 측은 절대 변하지 않는 대본이며 모델은 아무것도 들을 필요가 없습니다. 문서를 소리 내어 읽기 위해 대화 루프를 구매하는 셈입니다.

선택이 진정으로 어려운 단 하나의 경우는 캐스케이드입니다: 인식, 그다음 추론, 그다음 합성. 그 아키텍처는 구식이 아니며, 많은 프로덕션 시스템에서 여전히 올바른 선택입니다. 각 단계를 독립적으로 교체하고 단계마다 다른 공급업체를 고를 수 있게 해주기 때문입니다. 그 대가는 지연 시간이며, 단일 엔드투엔드 모델이 턴 경계를 넘어 유지하는 운율을 잃는 대가이기도 합니다. 이 트레이드오프는 양방향 모두 실재합니다.

경로가 이미 존재하는 경우

OrcaRouter는 Gemini 3.8 Live 엔드포인트나 3.8 TTS 엔드포인트를 제공하지 않으며, 이 점은 라우팅에 관해 무엇보다 먼저 짚고 넘어갈 만합니다. 이렇게 폭넓은 카탈로그를 보면 오히려 그 반대라고 짐작하기 쉽기 때문입니다. 카탈로그에 실제로 담겨 있는 것은 같은 제품군의 나머지입니다 — google/gemini-3.8-flash구글 모델 28개와 전체 200여 개 모델, 키 하나로 공급사 정가 그대로, 마크업 없이 이용할 수 있습니다.

이는 특히 캐스케이드에 중요합니다. 아키텍처가 인식, 그다음 추론, 그다음 합성이라면, 추론 단계는 여러 공급업체에 걸쳐 단일 키를 사용하는 것이 이득을 보는 단계입니다. 왜냐하면 이 단계는 가장 자주 교체하는 단계이며, 공급업체의 가격 인하가 다음 계약 갱신 시점이 아니라 같은 날 청구서에 반영되어야 하는 단계이기 때문입니다. 또한 자동 페일오버가 진가를 발휘하는 단계이기도 합니다: 캐스케이드에는 고장 날 수 있는 곳이 세 군데 있고, 가운데 지점이 이중화하기 가장 저렴합니다.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

간단한 의사결정 규칙

모델이 아직 텍스트로 가지고 있지 않은 것에 응답해야 한다면 Gemini 3.8 Live가 필요하며, Goog​le의 분당 오디오 요금을 기준으로 예산을 잡고 두 변형 중 어느 것이 필요한지 생각해야 합니다. 텍스트가 이미 작성되어 있고 그것을 수행하는 것이 작업이라면 Gemini 3.8 Flash TTS 또는 Flash-Lite TTS가 필요하며, 백만 자당 예산을 잡고 언어 지원 범위와 품질 격차가 가격 격차를 정당화할 만한지에 따라 등급을 선택해야 합니다.

그리고 "Gemini 3.8 Live와 Gemini 3.8 TTS"를 마치 두 개의 제품인 것처럼 비교하라는 요청을 받는다면, 가장 먼저 유용하게 할 수 있는 일은 어느 엔드포인트인지 묻는 것입니다. 브리프에 적힌 이름은 하나의 엔드포인트로 귀결되지 않으며, 그 답은 단지 청구서가 아니라 아키텍처를 바꿉니다.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.