흰색 배경에 부드러운 파란색-청록색 그라데이션 악센트를 더한 'Gemini 3.8 Flash TTS says hello'용 생성형 히어로 카드. 넓은 둥근 카드에는 파형 아이콘 옆에 '30 studio voices', '130 languages', 'per audio token'이 표시되고, 오른쪽의 두 번째 카드에는 'Flash-Lite TTS - 101 languages'라고 적혀 있습니다. 하단 줄에는 'Gemini API, 23 September 2026. Vendor figures.'가 표시됩니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Gemini 3.8 Flash TTS가 인사를 건넨다: Google, 음성 제품 라인을 둘로 나누고 가격을 인하

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 공급업체는 2026년 9월 23일 두 개의 음성 모델을 출시했는데, 발표문은 마치 헤드라인이 음성 품질인 것처럼 쓰여 있다. 그렇지 않다. Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS는 이 공급업체가 Gemini Developer API에 내놓은 첫 텍스트 음성 변환 모델이며, 자신들이 대체하는 프리뷰 모델보다 낮은 가격이다. 그리고 다른 곳에서 글자당 요금을 지불해 온 사람이라면 바로 이 부분이 예산 항목을 바꾸는 지점이다. Gemini 3.8 Flash TTS의 오디오 출력 요금은 2026년 말까지 백만 토큰당 $9.00이다. 오디오는 초당 25토큰으로 청구되며, 이는 생성된 음성 1초당 약 0.02센트에 해당한다. 이 모델이 대체하는 Gemini 3.1 Flash TTS Preview는 백만 오디오 토큰당 $20.00으로 책정되었다.

이야기의 후반부는 이제 모델이 하나가 아니라 둘이라는 것입니다. Google은 라인을 나눴습니다. Flash TTS는 전체 언어 세트와 더 높은 오디오 요금을 갖추고, Flash-Lite TTS는 더 짧은 언어 목록과 더 저렴한 요금을 갖춥니다. 이는 4월부터 API에 있어 온 단일 프리뷰 모델 구성과는 다른 형태이며, Google이 시장을 어떻게 보는지 보여줍니다 — 130개 언어와 음성 복제가 필요한 소수의 애플리케이션, 그리고 고객 지원 봇을 위한 쓸 만한 영어 음성만 있으면 되고 그 외에는 아무것도 필요로 하지 않는 훨씬 더 많은 애플리케이션입니다.

9월 23일에 실제로 출시된 것은 무엇이었나요?

발표 시점 기준으로 두 모델은 Gemini API와 AI Studio에서 일반 제공되며, 대기자 명단으로 제한되지 않습니다. API에서의 이름은 gemini-3.8-flash-ttsgemini-3.8-flash-lite-tts입니다.

• Flash TTS — 130개 언어, 텍스트에서 언어 자동 감지, Kore와 Puck을 포함한 30개의 사전 제작된 스튜디오 음성.

• Flash-Lite TTS — 101개 언어, 동일한 음성 디자인 인터페이스, 대용량 티어로 포지셔닝.

• 둘 다 — 자연어 설명을 통한 음성 디자인, 줄 단위 전달 연출, 두 화자 장면 구성, 그리고 대본에 바로 적어 넣는 비언어적 신호까지.

• 출력 — unary 엔드포인트에서는 WAV 24kHz 모노 16비트 부호 있는 PCM; 스트리밍 엔드포인트에서는 헤더 없는 PCM(audio/l16); audio/mulaw 및 audio/alaw도 허용되며, 샘플 레이트는 설정 가능합니다.

백만 토큰당 요금표는 전체를 읽어볼 가치가 있습니다. 각 등급이 대표 숫자 이상으로 차이가 나기 때문입니다:

• Flash TTS Standard — 텍스트 입력 $0.50 / 오디오 출력 $9.00, 2026년 12월 31일 이후 $1.00 / $18.00으로 인상.

• Flash TTS Batch 및 Flex — $0.25 / $4.50.

• Flash TTS Priority — $0.90 / $16.20

• Flash-Lite TTS Standard — $0.50 / $6.00, 2026년 12월 31일 이후 $1.00 / $12.00으로 인상

• Flash-Lite TTS Batch 및 Flex — $0.25 / $3.00.

• Flash-Lite TTS Priority — $0.90 / $10.80.

• 비교용 Gemini 3.1 Flash TTS Preview — $1.00 / $20.00, 배치 $0.50 / $10.00.

프로모션 기간이 주목해야 할 점이다. Google은 두 신규 모델 모두를 연말까지 반값으로 책정했고, 프로모션 종료 후 수치를 같은 표에 공개했다. 1,000분당 비용을 모델링하는 사람이라면 9월 수치가 아니라 1월 수치를 사용해야 한다.

A generated scoreboard for Gemini 3.8 Flash TTS with six rows — Arena Elo 1,260 at rank 2, audio out $9.00 per 1M tokens, 130 languages on Flash against 101 on Flash-Lite, 30 prebuilt studio voices plus voice design, cloning from a 30-second sample with SynthID, and GA availability on the Gemini API — over the footer 'Price per Google rate card; Elo per Artificial Analysis Provider Voice Arena, Sept 2026.'

보이스 디자인은 진정으로 새로운 역량입니다

사전 제작된 음성은 이제 기본 요건입니다. Google이 3.8에서 추가한 것은 음성을 말로 설명하면 그대로 얻을 수 있는 방법과, 동의 확인 절차가 함께 제공되는 짧은 샘플로 음성을 복제하는 방법입니다.

음성 디자인은 속도, 음색, 억양처럼 원래라면 오후 내내 오디션하듯 들어봐야 했을 요소를 자연어 프롬프트로 받아들이고, 참조 녹음 없이도 사용 가능한 음성을 반환합니다. 음성 복제는 반대 방식입니다. 30초 샘플을 제공하면 시스템이 동의 여부를 확인하고, 생성된 오디오에는 결과 음성에 대한 SynthID 워터마크와 C2PA 자격 증명이 표시됩니다. 기존 맞춤 음성을 혼합하거나 수정할 수 있게 해 주는 음성 리믹싱은 출시된 것이 아니라 곧 제공될 예정으로 표시되어 있습니다.

사용자 지정 음성에는 두 가지 종류가 있으며, 그 동작 방식은 프로덕션에서 중요한 차이가 될 만큼 서로 다릅니다. 상태 유지(stateful) 사용자 지정 음성은 프로젝트에 저장되며 프로젝트당 최대 200개로 제한되고 TTL은 1년입니다. 상태 비유지(stateless) 음성은 voicekey_... 핸들로 주소가 지정되며 7일 후에 만료됩니다. 애플리케이션이 고객별로 음성을 프로비저닝하는 경우, 상한과 TTL이라는 두 숫자가 자체 스토리지 계층이 필요한지 여부를 결정합니다.

전달 제어는 '새로움'의 나머지 절반입니다. 목소리를 하나 골라놓고 잘 되기를 바라는 데 그치는 대신, 배우를 연출하듯 대사를 연출할 수 있습니다 — 속도, 강조, 감정의 결까지. 두 화자 장면은 한 번의 호출 안에서 연출할 수 있습니다. 그리고 비언어적 발성은 일급 대본 요소입니다: <laughs>, <sigh> 그리고 <gasp>가 인라인 큐로 쓰이고, 여기에 |mhm||yeah|가 더해져 합성 대화를 실제 대화처럼 들리게 하는 작은 맞장구 소리를 냅니다. 장편 낭독은 최소한의 드리프트로 화자 정체성을 유지한다고 하는데, 이는 40분짜리 오디오북 챕터를 생성할 때 가장 먼저 드러나는 실패 유형입니다.

벤치마크, 그리고 누가 이를 실행했는지

Google의 출시 자료는 두 건의 외부 평가와 일련의 아레나 순위에 기대고 있습니다. 이들은 모두 벤더가 보고한 것으로 — Google이 이를 인용하고 있으며, 기반이 되는 실행 결과는 공개되지 않았습니다 — 따라서 측정치가 아니라 주장으로 취급하십시오.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', captured in English and dated Sep 23, 2026, showing the header credited to Leland Rechis and Alan Cowen, the 'Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS' hero card, and the opening bullets describing the two models.

• Hume AI 음성 디자인 벤치마크 — Gemini 3.8 Flash TTS가 71.4로 1위를 차지했으며, 억양 모델링에서 60.8로 1위를 차지했습니다.

• Hume 종합 품질 지수 — Flash TTS 1위, Flash-Lite TTS 2위

• Speech Arena의 블라인드 선호도 — 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어 및 힌디어에서 최상위권을 차지했습니다.

• Gemini 3.1 Flash TTS 대비 — Google은 장편 일관성과 2인 화자 시나리오 제어에서의 향상을 주장하는데, 이는 바로 전달 지시 기능이 위해 만들어진 두 가지 요소입니다.

문서에 기록된 한 가지 불일치는 짚고 넘어갈 가치가 있습니다. 출처를 비교하는 사람이라면 누구나 혼란스러울 테니까요. 블로그 게시물은 실제 제작에 바로 사용할 수 있는 음성 2,000개 이상의 라이브러리를 설명합니다. 개발자 문서는 30개의 미리 제작된 스튜디오 음성과 함께 Extended Voice Library에 "수백 개"의 음성이 있다고 설명합니다. 제3자 보도에서는 다시 그보다 10배 더 높은 수치를 인용했습니다. 외부에서는 이 수치들을 서로 맞출 수 없습니다. 솔직하게 해석하자면, 기본적으로 제공되는 미리 제작된 세트는 30개이고, Extended Voice Library는 더 크지만 모호하게 설명되며, 큰 숫자들은 사용자 제작 음성을 포함하는 카탈로그를 가리킵니다. 음성 개수가 당신의 결정에 결정적이라면, 세 수치 중 어느 것도 믿지 말고 필요한 특정 음성을 직접 테스트하세요.

그 위에 구축하고 있다면 그것이 의미하는 것

실질적인 변화는 텍스트 음성 변환이 전문가용 별도 항목에서, 언어 토큰과 동일한 비용 모델에 넣을 수 있는 항목으로 이동했다는 점입니다. 초당 25토큰 기준으로, 1시간 분량의 생성 오디오는 90,000 오디오 토큰이며, 프로모션 Flash-Lite 요금으로는 약 54센트입니다. 이는 충분히 저렴해서, 흥미로운 질문은 "합성 음성을 감당할 수 있는가"에서 "이 화면에는 두 티어 중 어느 것이 필요한가"로 바뀝니다.

두 번째 실질적인 변화는, 완전히 새로운 TTS 모델이란 프로덕션 경로를 걸고 도박하지 않고도 한번 시도해 보고 싶은 바로 그런 대상이라는 점입니다. 새 모델을 직접 연결하기보다 라우터 뒤에 두는 것이 바로 이런 이유에서 타당합니다. OrcaRouter는 단일 키 하나로 200개 이상의 모델을 공급자 정가에 마크업 없이 제공하며, 자동 장애 조치 덕분에 부하를 받으면 흔들리는 새 음성 엔드포인트도 통화가 끊기는 대신 이미 신뢰하는 모델로 폴백됩니다. 우리는 Gemini 3.8 TTS 엔드포인트를 호스팅하지 않습니다. 그것은 Google 자체 API에서 제공됩니다. 다만 음성 아래의 텍스트 계층, 그리고 합성 호출이 실패할 때의 폴백 경로야말로 라우터가 실제로 필요한 부분입니다.

아직 무엇이 빠졌나요?

출시에는 세 가지가 빠져 있으며, 각각은 사소한 트집이 아니라 실질적인 제약이다.

공개된 독립 평가는 없다. Google의 Hume 수치는 공급업체가 제3자의 벤치마크를 인용한 것으로, 아무것도 없는 것보다는 낫고 감사보다는 못하다. Artificial Analysis나 이에 준하는 기관이 동일 모델에 대한 자체 실행 결과를 공개할 때까지, 이 글의 모든 품질 주장은 주장으로 읽어야 한다.

오픈 가중치 옵션은 없습니다. 두 모델 모두 비공개이며 API 전용이므로, 같은 분야에 속속 등장해 온 오픈 음성 모델들과는 다른 범주에 속합니다. 배포 환경에서 모델을 직접 실행해야 한다면, 이번 출시는 여러분을 위한 것이 아닙니다.

그리고 프로모션 가격은 종료됩니다. Flash TTS의 2027년 1월 요금은 9월 요금의 두 배이며, 출시 당시 수치를 바탕으로 세운 비즈니스 케이스는 1분기에 다시 작성해야 합니다. 이는 비판이 아닙니다. 두 수치를 미리 모두 공개하는 것은 대부분보다 더 정직한 일입니다. 하지만 스프레드시트에 들어가야 할 수치는 바로 그 수치입니다.

Google은 Gemini 3.1 Flash TTS Preview가 지원 중단될지 여부는 밝히지 않았고, Flash-Lite TTS가 그 주력 대체 모델로 자리 잡았다고만 밝혔다. 아직 프리뷰 모델을 사용 중인 사람은 종료 공지를 기다리기보다 마이그레이션을 계획해야 한다.

A generated summary card titled 'Gemini 3.8 TTS: what changed in five lines', listing the split into Flash TTS and Flash-Lite TTS, the audio-out cut to $9.00 per 1M tokens, voice design and 30-second cloning, 130 languages on Flash against 101 on Flash-Lite, and half price until December 31, 2026.