
Gemini 3.8 Flash TTS로 맞춤형 오디오 생성 및 배포: 음성 디자인, 복제, 그리고 결정하는 두 개의 시계
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 506 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 184 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS는 모두 목록에서 하나를 고르는 대신 작성된 설명으로 음성을 만들어 낼 수 있게 해주며, 둘 다 2026년 9월 23일 Gemini API에서 정식 출시되었습니다. 사람들이 반복해서 말하는 헤드라인은 음성 디자인입니다. 계획을 세울 가치가 있는 부분은 디자인된 음성이 이후에 어떻게 되는가입니다. 공급업체가 음성을 유지하는 두 가지 방법을 제공하고 각각 다른 수명을 부여하기 때문입니다. 잘못된 방법을 선택하면 제품이 의존하는 음성이 일주일 만에 만료됩니다.
지금까지의 출시 보도에서 빠져 있는 부분이 바로 이것입니다. 발표 게시물들은 프롬프트로 음성을 만들어낼 수 있다고 설명하며, 그중 몇몇은 30초 샘플로 복제하는 방법을 언급합니다. 하지만 어느 게시물도 저장 모델을 자세히 다루지 않습니다. 저장 모델은 음성 파이프라인이 구성 파일에서 재현 가능한지, 아니면 일정에 따라 다시 프로비저닝해야 하는지를 결정하는 요소입니다. 이 글은 Google이 공개한 가격과 할당량을 바탕으로 설계, 저장, 호출, 결제까지 전체 경로를 다룹니다.
9월 23일에 무엇이 출시되었나요?
두 개의 모델, 하나의 API 스키마. 식별자는 gemini-3.8-flash-tts 및 gemini-3.8-flash-lite-tts, 그리고 Google의 문서는 두 모델 모두 "완전히 동일한 API 스키마와 프롬프트 형식"을 사용한다고 명확히 밝히고 있습니다 — 둘 사이를 이동하는 것은 재작성이 아니라 하나의 매개변수를 변경하는 것입니다.
• 입력 — 텍스트 전용. 두 모델 모두 텍스트를 받아 오디오를 반환합니다. 멀티모달이 아니며 텍스트를 다시 생성하지 않습니다.
• 출력 — 단항 엔드포인트에서 WAV, 24 kHz 모노 16비트 부호 있는 PCM; 헤더 없는 PCM (audio/l16)는 스트리밍 엔드포인트에서; audio/mulaw 및 audio/alaw는 구성 가능한 샘플 레이트로 허용됩니다.
• 언어 — Flash TTS에서는 130개, Flash-Lite TTS에서는 101개, 요청에서 선언하는 대신 텍스트에서 자동으로 감지됩니다.
• 보이스 — 문서에 나열된 30개의 엄선된 스튜디오 보이스(Kore와 Puck 포함), voices 엔드포인트를 통해 쿼리할 수 있는 "수백 개"의 추가 보이스로 구성된 Extended Voice Library, 그리고 아래의 두 가지 생성 경로.
• 연출 — 줄 단위 전달 제어, 단일 대본으로 연출되는 2인 화자 장면, 그리고 <laughs>, <sigh>, |mhm| 같은 비언어적 큐를 트랜스크립트에 바로 적어 넣기.
두 계층이 존재하는 이유는 워크로드가 분화되었기 때문입니다. Flash TTS는 최대한의 음향 충실도와 복잡한 연기를 위해 포지셔닝되었고, Flash-Lite TTS는 Google이 직접 gemini-3.1-flash-tts-preview의 "주력 대체 모델"이라고 표현한 것으로, 대량 더빙, 낭독 기능, 음성 에이전트 캐스케이드를 겨냥합니다. 둘 모두 2026년 4월부터 API에 있던 단일 프리뷰 모델을 대체하므로, 프리뷰를 사용 중이었다면 마이그레이션은 버전 업그레이드가 아니라 계층 선택입니다.

목소리를 디자인하는 일은 하나의 프롬프트이며, 이는 검토 단계를 바꿉니다.
이 세대에서 진정으로 새로운 것은 생성 인터페이스입니다. 프롬프트된 음성은 자연어 설명(역할, 억양, 음성 특성)을 바탕으로 만들어지며, 재사용할 수 있는 식별자를 반환합니다. API에서는 이것이 store: true와 프롬프트 입력을 사용하는 음성 생성 호출입니다. Google의 자체 예시에서 설명은 고에너지 멜버른 DJ부터 일본 드래곤까지 이어집니다. 일단 생성되면, 음성은 식별자로 음성 요청에서 참조되며, 요청별 스타일 지침은 그때 최소화되거나 비어 있을 수 있습니다. 왜냐하면 캐릭터가 이미 음성에 반영되어 있기 때문입니다.
실질적인 결과는 단지 기능이 아니라 워크플로 변화입니다. 음성 캐스팅은 예전에는 라이선스 협상이나 스튜디오 예약이었고, 이는 음성 선택이 초기에 한 번 이루어진 뒤 변경 비용이 비쌌기 때문에 검토를 통과하면 그대로 유지된다는 뜻이었습니다. 음성이 한 단락의 텍스트가 되면, 캐스팅은 디자인 토큰이 됩니다. 제품 관리자가 화요일에 다시 뽑아달라고 요청할 수 있는 무언가가 되는 것이죠. 설명 문자열을 소스 제어에 넣고 생성된 음성 ID를 빌드 아티팩트로 취급하는 팀은 환경 전반에서 일관된 출력을 얻게 될 것입니다. AI Studio에서 수동으로 음성을 만드는 팀은 그렇지 않으며, 그 실패는 스테이징과 프로덕션 오디오 사이의 설명할 수 없는 차이처럼 보일 것입니다.
두 시계는
이것이 출시 게시물들이 건너뛰는 부분입니다. Google에서는 디자인하거나 복제한 음성을 두 가지 상태 중 하나로 유지할 수 있게 해 주며, 두 상태의 만료 속도는 크게 다릅니다.
• 저장된 음성 — 저장 기능을 활성화하여 생성되며, 프로젝트에 저장되고 프로젝트당 200개 음성 할당량과 1년의 보존 기간(TTL)이 적용됩니다.
• 상태 비저장 키 — 음성 복제는 저장된 식별자 대신 클라이언트가 관리하는 키(voicekey_… 형식)를 반환할 수 있으며, 해당 키의 수명은 7일입니다.
함께 읽으면, 그 쌍은 설계 지침입니다. 저장된 음성은 1년 약정이고 프로젝트당 200개라는 하드 상한선이 있습니다. 이는 고정된 캐스트가 있는 제품에는 넉넉하지만, 고객마다 새로운 음성을 생성하는 제품에는 쓸모가 없습니다. 상태 비저장 키는 그 반대입니다. 할당량 압박은 없지만, 매주 재발급해야 하는 키입니다. 즉, 애플리케이션에는 갱신 경로가 필요하고 인프라에는 교체되는 자격 증명을 저장해야 합니다. 어느 쪽도 틀리지 않았습니다. 자신이 어느 것을 선택했는지 알아차리지 못한 채 선택하는 것이 바로 음성 에이전트가 8일째에 침묵하게 되는 방식입니다.
복제에는 두 가지 속성이 더 따라붙는데, 법무팀에 무언가를 약속하기 전에 알아 둘 가치가 있다. 복제된 음성을 만들려면 음성 소유자의 구두 동의 녹음이 필요하며, 이는 참조 화자와 일치해야 한다. 체크박스가 아니라 말로 하는 확인인 것이다. 그리고 출력물에는 출처가 담긴다. 모든 클립에는 SynthID 워터마크가 삽입되고, 복제된 음성에는 추가로 C2PA 콘텐츠 자격 증명이 붙는다. 설계 경로는 의도적으로 악용하기 더 어려운 쪽이며, 두 장벽은 모두 정책 선언이 아니라 구조적인 것이다.
해결하기보다는 짚어 둘 만한 불일치가 하나 있습니다. Google의 지원 모델 표에는 음성 디자인과 음성 복제가 두 3.8 TTS 모델 모두에서 사용 가능한 것으로 나와 있습니다. 대부분의 출시 보도에서는 복제를 특히 Flash TTS 관련 내용의 일부로 설명합니다. 복제가 티어 간 결정에 중요하다면, 어느 요약도 그대로 믿지 말고 실제로 출시하려는 티어의 문서에서 확인하세요.
오디오 한 시간에 드는 비용
구글은 음성을 문자나 초가 아니라 토큰 단위로 과금하며, 그 환산 기준은 공개되어 있습니다. 오디오는 출력 1초당 25토큰으로 측정되는데, 이는 시간당 90,000토큰입니다. 덕분에 계산이 유난히 깔끔해지며, 예산에 넣어야 할 숫자는 백만 토큰당 요율이 아니라 바로 이 숫자입니다.
• Flash TTS standard — 백만 텍스트 토큰 입력당 $0.50, 백만 오디오 토큰 출력당 $9.00, 2026년 12월 31일까지, 이후에는 $1.00 및 $18.00. Batch와 Flex는 $0.25 및 $4.50; Priority는 $0.90 및 $16.20.
• Flash-Lite TTS 표준 — 같은 날짜까지 $0.50 및 $6.00, 그 이후 $1.00 및 $12.00. Batch 및 Flex는 $0.25 및 $3.00; Priority는 $0.90 및 $10.80.
• 초 단위로 — Flash TTS는 프로모션 기간 동안 생성된 오디오 1시간당 약 $0.81, 프로모션 이후에는 약 $1.62입니다; Flash-Lite TTS는 약 $0.54, 그다음 $1.08입니다.
• 대체하는 모델과 비교하면 — gemini-3.1-flash-tts-preview는 백만 개당 $1.00 및 $20.00로 책정되어, 오디오 출력 항목은 Flash TTS에서 55퍼센트, Flash-Lite TTS에서 70퍼센트 하락했습니다.
프로모션 요금을 기준으로 계획하지 마세요. Google은 같은 표에 두 열을 모두 게시합니다. 즉 1월 요금은 나중에나 밝혀질 소문이 아니라 오늘 요금표에 올라 있는 것이며, $0.81로 산정한 1,000분당 추정치는 두 배가 되더라도 견뎌야 합니다.
독립적인 숫자 하나, 그리고 그렇지 않은 여러 개
Google의 발표는 벤치마크 결과로 시작하며, 이는 있는 그대로 읽어야 합니다. 회사 측은 Flash TTS가 Hume AI의 Voice Design Benchmark에서 71.4로 1위를 차지했고, 악센트 모델링에서 60.8로 선두를 달렸으며, Flash TTS와 Flash-Lite TTS가 Hume의 Overall Quality Index에서 1위와 2위를 기록했고, Voice Arena에서 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어 및 힌디어에 대해 강력한 블라인드 선호 순위를 얻었다고 밝혔습니다. 모두 벤더가 보고한 내용이며, 공개된 실행 결과는 하나도 없습니다.
그 목록에는 눈여겨볼 만한 세부 사항이 하나 있다. Google의 발표문 작성자 중 한 명으로 이름을 올린 Alan Cowen은 Hume AI의 창립자다. 바로 그 연구소의 Voice Design Benchmark가 대표 수치를 제공했다. 그렇다고 해서 그 수치가 틀린 것은 아니며, Hume의 벤치마크는 실제로 존재하는 것이지만, 이 둘은 서로 독립적이지 않다. 71.4라는 수치를 제3자 검증으로서 인용하기 전에, 이를 따져보는 독자라면 이 점을 알아야 한다.
독립적으로 수집된 수치는 Artificial Analysis의 Provider Voice Arena에 있으며, 2026년 9월 24일 이 기사를 위해 캡처되었습니다: Gemini 3.8 Flash TTS는 1,999개 샘플에서 17포인트 구간으로 Elo 1,260을 기록하며 2위이고, 1,273의 Cartesia Sonic 3.6 뒤에 있습니다. Gemini 3.8 Flash-Lite TTS는 1,235로 6위입니다. 대체되는 모델인 Gemini 3.1 Flash TTS는 3,430개 샘플에서 1,199로 10위입니다. 블라인드 청취자 선호도이며, 연구소 자체 평가가 아닙니다 — 그리고 여기서 Google이 의뢰하지 않은 유일한 품질 수치입니다.

어디에서 실행할 수 있는지, 그리고 아직 어디에서는 안 되는지
두 모델 모두 오늘부터 Gemini API와 Google AI Studio에서 대기자 명단 없이 사용할 수 있습니다. 소비자 및 기업용 인터페이스는 출시된 것이 아니라 준비 단계에 있습니다: Flash TTS는 Gemini Notebook에, Flash-Lite TTS는 Google Vids에 제공될 예정이며, Gemini Enterprise 액세스는 곧 제공될 예정이라고 설명되어 있고, 음성 리믹싱 — 기존 음성의 음색, 피치, 속도 및 악센트를 조정하는 것 — 은 현재 기능이 아닌 향후 기능으로 나열되어 있습니다. 리믹싱에 의존하는 계획이라면, 아직 존재하지 않습니다.
우리 쪽부터 솔직하게 말하자면: Gemini 3.8 TTS 엔드포인트는 OrcaRouter의 라우팅 테이블에 없습니다. 그것들이 대체하는 세대는 있습니다 — google/gemini-3.1-flash-tts-preview는 Google이 공표한 것과 동일한 백만 토큰당 $1.00 및 $20.00에 카탈로그에 있는데, 그 이유는 공급자 정가가 마크업 없이 그대로 전달되기 때문입니다. 그리고 여러분의 OpenAI 호환 SDK가 이미 대상으로 삼고 있는 동일한 /v1/audio/speech 엔드포인트에서 응답합니다. 이는 음성 워크로드에서 들리는 것보다 더 중요합니다. 왜냐하면 여러분이 실제로 구매하는 것은 그 배후의 모델이 바뀌는 동안에도 여러분의 애플리케이션이 호출할 수 있는 안정적인 엔드포인트이기 때문입니다. 여러분의 코드는 모델 문자열을 들고 있고, 카탈로그는 라우팅을 들고 있습니다. Google의 프로모션 기간이 12월 31일에 끝나고 Flash TTS 가격이 두 배가 되면, 라우팅된 모델의 가격은 다음 계약 갱신 때가 아니라 같은 날 바로 움직입니다 — 그리고 다운된 모델은 여러분의 내레이션 큐를 함께 끌고 가지 않고 페일오버됩니다.

커밋하기 전에 이 생성 결과를 평가하고 있다면, 저렴한 실험은 두 단계로 나눠 하는 것입니다. 동일한 스크립트를 Flash TTS와 Flash-Lite TTS로 실행해 보세요. 스키마는 동일하고 차이는 매개변수 하나이기 때문입니다. 그런 다음 벤치마크 차트가 아니라 직접 들어 본 오디오로 판단하고, 프리미엄을 지불하기 전에 Artificial Analysis에서 품질 격차가 오차 범위를 넘어서도 유지되는지 확인하세요. 대규모 낭독 프로젝트에서는 프리미엄이 실제 비용이지만, 전화번호를 소리 내어 읽는 지원 봇에서는 청자가 들을 수 있는 무언가를 분명히 사 주는 것은 아닙니다.
