흰색 배경에 부드러운 파란색과 청록색 그라데이션 악센트가 들어간 'Gemini 3.8 TTS: 두 마리 펠리컨, 두 가지 모델'용 생성형 히어로 카드입니다. 세 장의 카드에는 'Gemini 3.8 Flash TTS — Elo 1,260, 순위 2, 아레나 보이스 8개, 오디오 토큰 100만 개당 $9.00', 'Gemini 3.8 Flash-Lite TTS — Elo 1,235, 순위 6, 오디오 토큰 100만 개당 $6.00', '2인 화자 대화 — 지원됨, 보이스 디자인, 30초 복제'라고 적혀 있습니다. 하단에는 'Elo는 Artificial Analysis Provider Voice Arena, 2026년 9월 기준; 정가는 Google 기준.'이라는 문구가 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Gemini 3.8 TTS: 두 마리 펠리컨, 두 모델, 그리고 1월에 두 배가 되는 가격

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 23일에 벤더가 무엇을 내놓았는지 가장 빠르게 이해하는 방법은 그와 함께 돌아다닌 데모를 보는 것입니다. 두 마리의 펠리컨이 퍼시피카 피어로 이사할지 놓고 다투는 데모로, 새마다 목소리가 하나씩이고 대본에 따라 차례차례 진행됩니다. Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS는 그 데모에 쓰인 두 모델이며, 둘 다 Gemini API에서 일반 제공되고, 펠리컨은 단순한 눈속임이 아닙니다. 이들은 이 세대에서 이전 Gemini 음성 모델이 전혀 할 수 없었던 첫 번째 기능입니다. 두 명의 화자, 한 번의 생성, 누가 무엇을 말하는지 제어하는 대본.

가격은 이야기의 나머지 절반이며, 바로 여기서 두 모델이 갈린다. Flash TTS는 2026년 12월 31일까지 입력 텍스트 토큰 100만 개당 $0.50, 출력 오디오 토큰 100만 개당 $9.00를 청구하고, 그 이후에는 $18.00를 청구한다. Flash-Lite TTS는 같은 일정으로 $0.50와 $6.00를 청구하고, 그 이후에는 $12.00를 청구한다. 이는 Google 자체 요금이다. Artificial Analysis가 다른 모든 업체와 같은 순위표에 올릴 수 있도록 100만 문자당 기준으로 환산하면, 각각 $16.50와 $11.00이 된다 — Lite 모델은 약 3분의 1 더 저렴하고, 둘 다 그 순위표 최상위가 부과하는 요금보다 훨씬 낮다.

그래서 흥미로운 질문은 모델들이 좋은지 여부가 아니다. 두 모델 중 어느 것을 기반으로 해야 하는가이다. 왜냐하면 둘 사이의 격차는 이름에서 짐작할 수 있는 격차가 아니기 때문이다.

9월 23일 발표가 실제로 담고 있는 것

하나가 아닌 두 개의 모델이며, Google은 이것이 같은 것의 작은 버전과 큰 버전이 아니라 분할된 것임을 분명히 밝혔다. 발표에서는 이들이 출시되는 다섯 곳을 명시했다 — Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook 그리고 Google Vids — 그리고 API 식별자는 단순하다: gemini-3.8-flash-tts 및 gemini-3.8-flash-lite-tts.

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

기능 목록은 헤드라인이 시사하는 것보다 더 깁니다. Google의 발표와 Gemini API 음성 생성 문서에서:

• Voice design — 고정된 목록에서 고르는 대신, 말로 음성을 설명하면 맞춤형 voice ID를 받을 수 있습니다.

• 음성 복제 — 30초 샘플이 {{1}}음성 ID{{/1}}를 생성하며, 이는 대부분의 팀이 브랜드 음성이나 내레이터를 위해 실제로 사용하게 될 경로입니다.

• 두 화자 대화 — 펠리컨 사례. 대본은 하나의 산문 덩어리 대신 화자 교대를 담고 있습니다.

• 턴 수준 스타일링 — 문서에서는 전체 요청이 아니라 특정 턴에 디렉션을 붙이는 speech_metadata 어노테이션을 설명합니다.

• 사전 구축된 음성과, GET /v1beta/voices에서 접근할 수 있는 확장 음성 라이브러리.

• 세 가지 오디오 인코딩 — 기본값은 WAV이며, 텔레포니 형태의 파이프라인에는 mulaw와 alaw를 사용할 수 있습니다.

텍스트만 입력, 오디오만 출력. 문서는 이 점을 분명히 밝힌다. TTS 모델은 다른 입력 양식을 받지 않으며 다른 출력도 생성하지 않는다. 그리고 제한 사항을 나열한 별도의 Limitations 섹션이 있다.

발표문에 없는 것은 용량 계획 담당자에게 필요한 수치들이다. 속도 제한, 할당량, 그리고 설계된 음성의 저장 수명은 모두 문서와 가격 페이지에 있고, 출시 게시물에는 없다. 이는 출시 주간에 데모는 매끄럽게 돌아가고 프로덕션은 나쁘게 되는 흔한 이유다.

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

펠리컨들이 진짜 뉴스다.

단일 화자 TTS는 지난 2년 동안 충분히 해결된 문제였다. 빠져 있던 것은 긴 대본 전체에서 두 정체성을 흐트러짐 없이 분리해 유지하는 모델이었고, 그것이 바로 이 데모가 실제로 시험하는 것이다 — 목소리가 사람처럼 들리는지가 아니라, 4분이 지난 시점에도 화자 A가 여전히 화자 A인지를 말이다.

그로부터 두 가지가 따라 나오며, 그것이 이 일이 팟캐스트 장난감을 넘어서 중요한 이유다.

첫 번째는 작업 단위가 바뀐다는 점입니다. 단일 화자 모델에서는 20분짜리 대화가 두 번의 독립 실행에서 이어 붙이는 20분 분량의 오디오이며, 모든 이음매는 운율이 초기화되는 지점입니다. 2인 화자 모델에서는 한 번의 호출, 하나의 컨텍스트이며, 모델은 바로 앞의 대사에 반응할 수 있습니다. 이는 후처리로는 되살릴 수 없는 품질 차이입니다.

두 번째는 스크립트 형식이 인터페이스가 된다는 점이다. 여러분의 파이프라인이 이미 SSML 형태의 무언가, 즉 구문마다의 주석을 출력하고 있다면, 이 생성 방식은 거의 그대로 끼워 넣을 수 있다. 파이프라인이 모델에 텍스트 한 덩어리를 넘겨놓고 기대기만 한다면, 이제는 구조를 바꿔야 할 이유가 있다. 예전에는 암묵적이었던 스타일링을 이제는 직접 소리 내어 말해야 하기 때문이다. 이는 업계의 나머지가 각기 다른 방식으로 감수하고 있는 것과 같은 트레이드오프이며, 이 두 Google 모델이 판 위의 다른 모든 것과 경쟁하는 축이다.

두 펠리컨 오디오 한 시간의 비용은 얼마인지

토큰 계산은 한 번쯤 해볼 가치가 있습니다. 백만 오디오 토큰당 수치가 시간당 수치가 아니고, 그 차이 때문에 사람들이 놀라왔기 때문입니다.

오디오 토큰은 출력 1초당 고정된 비율로 생성되므로, 비용은 스크립트 길이가 아니라 완성된 오디오 길이에 따라 달라집니다. Google 자체의 Flash TTS 요율 — 백만 오디오 출력 토큰당 $9.00 — 을 적용하면, 1시간짜리 완성물의 계산은 표준 티어에서 한 자릿수 달러에 들어오며, Lite 모델은 그 2/3입니다. Batch 및 Flex 가격은 Flash TTS의 경우 입력 $0.25, 출력 $4.50이고 Flash-Lite TTS는 $0.25 및 $3.00으로, 온디맨드로 생성할 필요가 없는 작업에서는 비용을 더 낮춰 줍니다. Priority는 $0.90 및 $16.00으로, 그럴 필요가 있는 작업을 위한 것입니다.

세 가지 실질적인 결과:

• 문단 하나를 다시 생성하는 것은 저렴하지만, 시리즈를 다시 생성하는 것은 결정이다. 이 요율에서는 음성 파이프라인에서 비싼 부분이 추론이 아니라 테이크를 승인하는 사람으로 다시 돌아간다.

• 텍스트 입력 요율은 노이즈에 불과합니다. 수천 단어 분량의 대본에서 텍스트 토큰 100만 개당 $0.50은 오디오 쪽에 비하면 반올림 오차입니다. 대본을 길이에 맞춰 최적화하지 마세요.

• 12월 31일 절벽은 실재하며, 오디오 요율을 두 배로 만듭니다. 2027년 출시를 계획하고 있다면 출시 시점의 수치가 아니라 프로모션 이후 수치로 예산을 잡으세요. 그렇지 않으면 1월에 다시 계획을 세우게 될 것입니다.

독립적인 수, 그리고 그렇지 않은 수들

이번 출시에서 한 수치는 Google이 아닌 다른 곳에서 나온 것이다. 2026년 9월 24일에 캡처된 Artificial Analysis Provider Voice Arena에서 Gemini 3.8 Flash TTS는 1,999개 샘플과 8개 아레나 보이스에 걸쳐 Elo 1,260으로 2위에 올라 있고, Gemini 3.8 Flash-Lite TTS는 2,000개 샘플에서 1,235로 6위에 올라 있다. 둘 다 각각 ±16과 ±17의 서로의 신뢰구간 안에 있으므로, 이 보드는 두 모델이 선호도에서 통계적으로 구분되지 않는다고 말해주는 셈이다. 이는 정말 유용한 결과인데, 더 저렴한 쪽이 청취자에게 측정 가능할 만큼 더 나쁘지 않다는 뜻이기 때문이다.

나머지는 모두 구글의 자체 주장이므로 그렇게 받아들여야 합니다. 표현력에 관한 표현, 언어 수, 복제 품질 같은 것들이죠. 아레나는 선호도 순위만 알려줄 뿐 그 이상은 아닙니다. 두 모델이 40분짜리 대본을 흔들림 없이 처리하는지, 한 번도 본 적 없는 고유명사를 어떻게 다루는지, 디자인한 음성이 일주일 뒤에 어떻게 되는지는 알려주지 않습니다.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

Lite 모델은 또한 이 두 모델이 마케팅 등급이 아니라 실제로 분리된 제품이라는 점을 뒷받침하는 더 나은 근거이기도 하다. 오차 범위 안에 들어오는 25포인트 Elo 격차가 33%의 가격 격차와 맞서는 구도는, 가격에 민감한 파이프라인이라면 거의 항상 Lite를 선택해야 하는 결정의 형태이며 — 지연 시간에 민감한 파이프라인이라면 반대 방향으로 선택해야 하는 결정의 형태이다. 두 모델은 비용뿐 아니라 속도에서도 차이가 나기 때문이다.

어디서 실행할지, 그리고 그 답변의 솔직한 버전

OrcaRouter는 Gemini 3.8 TTS 엔드포인트를 호스팅하지 않습니다. 이를 다르게 암시하기보다 분명히 말할 가치가 있습니다. 왜냐하면 이 두 모델에 관해 우리가 할 수 있는 유용한 말은 우리가 이들을 제공한다는 것이 아니라 — 제공하지 않습니다 — 12월 31일 변경과 같은 벤더 가격 인하가 바로 라우팅을 갖출 가치가 있게 만드는 종류의 사건이라는 점이기 때문입니다.

OrcaRouter는 200개 이상의 모델을 단일 API 키 하나로 공급자 정가에 마크업 없이 이용할 수 있게 해 주므로, 벤더의 요율표가 곧 여러분이 지불하는 가격이며 요율표가 바뀌면 다음 청구 주기가 아니라 같은 날 우리 쪽에 반영됩니다. 마이그레이션 중간 단계에 있는 음성 파이프라인에서는 페일오버 계층이 카탈로그보다 더 중요합니다. 아직 평가 중인 모델에 요청 경로를 두더라도 프로덕션 경로를 그 모델에 걸지 않아도 되는데, 실패한 호출이 이미 검증된 무언가로 넘어갈 수 있기 때문입니다. 라우팅 DSL은 단일 음성으로 충분하지 않은 경우를 위해 여러 모델을 하나의 호출로 구성하며, 모델 퓨전은 지연 시간보다 답변이 더 중요할 때 패널로 프롬프트에 응답합니다.

Gemini 3.8 TTS 모델 자체의 경우, 이를 호출할 곳은 Google 자체 API, 그리고 Google이 9월 23일에 명명한 접점들입니다. 이 둘이 여러분의 아키텍처에 미치는 영향 — 두 화자를 위한 한 번의 호출, 주석으로서의 스타일링, 선택하는 대신 설명할 수 있는 목소리 — 은 출시 할인보다 더 오래 남는 부분입니다.

다음에 볼 콘텐츠

세 가지가 이 세대가 도약적 변화인지 아니면 하나의 기능인지를 결정할 것이다.

첫 번째는 드리프트입니다. 두 화자 경로가 한 시간 내내 정체성을 유지하는지에 대한 장기적인 평가를 발표한 사람은 아무도 없으며, 누군가 그렇게 하기 전까지 pelican 데모는 데모일 뿐입니다. 두 번째는 음성 수명입니다. 일주일 만에 만료되는 설계된 음성은 프로토타입이고, 저장된 구성에서 다시 파생될 수 있는 음성은 제품입니다. 그리고 그 답은 두 식별자 중 어떤 것을 유지하느냐에 달려 있습니다. 세 번째는 12월 31일 이후에 일어나는 일입니다. 프로모션 요금이 종료되면 음성 파이프라인의 시간당 비용이 하룻밤 사이에 두 배로 오릅니다.

그중 어느 것도 출시 게시물에서는 보이지 않습니다. 세 가지 모두 문서에서는 보이는데, 출시 보도가 읽기를 멈추는 곳이 바로 그 문서입니다.