
Gemini 3.8 TTS vs ElevenLabs: 세 배 가격이 주는 것
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
동일한 사용량에서 ElevenLabs의 플래그십 합성 모델은 해당 공급업체의 새 모델보다 약 세 배의 비용이 듭니다. ElevenLabs Eleven v3은 1,000자당 $0.10 — 100만 자당 $100 —을 청구하고, Gemini 3.8 Flash TTS는 오디오 토큰 100만 개당 $9.00를 청구하는데, Artificial Analysis는 이를 100만 자당 $33.00으로 정규화합니다. 이는 요금 기준으로 3.0배 격차이며, 이 비교에서 가장 큰 단일 사실입니다. 흥미로운 질문은 그 격차가 실제인지가 아니라, 100만 자당 추가로 드는 67달러가 실제로 무엇을 사는가입니다. 왜냐하면 그 답은 "더 나은 음성"이 아니기 때문입니다.

3미터, 1미터가 아니라
먼저 분명히 해야 할 점은 이 두 제품은 같은 것을 측정하지 않으며, 공개된 요율표는 그 사실을 숨기고 있다는 것입니다.
• ElevenLabs는 글자당 과금합니다. Eleven v3는 1,000자당 $0.10이며, 요청당 5,000자로 제한됩니다. Eleven v3 Conversational은 1,000자당 $0.05이고, Flash 및 Turbo 모델도 1,000자당 $0.05이지만 요청 제한이 40,000자이며 v3 Conversational의 약 280ms에 비해 약 75ms의 지연 시간을 주장합니다.
• Google은 토큰 단위로 청구하며, 오디오 토큰은 텍스트 토큰과 다릅니다. Gemini 3.8 Flash TTS는 입력 텍스트 토큰 100만 개당 $0.50, 출력 오디오 토큰 100만 개당 $9.00를 청구하며, 생성된 음성 1초당 25개의 오디오 토큰으로 계량됩니다. 요청당 문자 수 상한은 공개된 바 없습니다.

• Artificial Analysis는 어느 쪽에도 요금을 청구하지 않는다. 단지 정규화할 뿐이다. 자사의 Provider Voice Arena 리더보드에 있는 백만 자당 $100.00와 $33.00은 리더보드가 가격으로 순위를 매길 수 있도록 하기 위해 도출된 공통 분모다. 비율을 보는 데는 유용하지만, 견적용은 아니다.
그러니까 3.0x라는 수치의 솔직한 버전은 이렇습니다: 이용 가능한 유일한 동등 비교 기준에서 Google은 가격이 약 3분의 1입니다. 그것이 여러분의 스프레드시트에서 의미하는 바는 여러분의 워크로드가 짧은 문자열 위주인지 긴 문자열 위주인지에 따라 달라집니다 — 발화가 길어질수록 초당 오디오 미터와 문자당 텍스트 미터는 급격히 벌어집니다. 침묵, 휴지, 운율적 패딩은 모두 오디오 토큰만 소모하고 문자는 소모하지 않기 때문입니다.
작업한 달
백만 자의 텍스트, 대략 중간 길이 소설 정도 분량을 한 번 음성으로 변환한다고 해 보세요.
• ElevenLabs Eleven v3 — 합성 비용은 $100.00이며, 여기에 동시성 수준에 맞춰 실행하는 데 필요한 요금제 등급이 추가됩니다. 공개된 요금제는 Starter가 $6, Creator가 $22, Pro가 $99, Scale이 $299, Business가 $990이고, 캐릭터 허용량은 별도로 청구되지 않고 해당 요금제에 포함됩니다.
• Gemini 3.8 Flash TTS — $33.00 상당, 작업을 배치 처리할 수 있다면 약 $16.50입니다. Batch 및 Flex 티어가 오디오 요금을 백만 토큰당 $4.50로 절반으로 낮추기 때문입니다. 우선순위 서비스는 이를 백만 토큰당 $16.20, 즉 약 $59.40 상당으로 올리지만, 그래도 ElevenLabs보다 훨씬 저렴합니다.
• Gemini 3.8 Flash-Lite TTS — 오디오 토큰 100만 개당 $6.00, 동일한 정규화 기준으로 약 $22.10에 해당하며, 130개 대신 101개 언어라는 대가를 치릅니다.
동일한 100만 자를 Google의 프로모션 가격에 넣어 보면 격차는 더 벌어집니다. 두 신규 Gemini TTS 모델 모두 2026년 12월 31일까지는 절반 요금이고 그 이후에는 두 배가 되기 때문입니다. 9월 수치를 토대로 비즈니스 케이스를 세우는 사람은 만료일이 공표된 할인 위에 그것을 세우는 셈입니다.

비교가 뒤집히는 단 한 곳은 아주 짧은 발화입니다. 문자당 과금 방식은 세 단어짜리 확인 문구에는 거의 요금을 부과하지 않습니다. 초당 오디오 과금 방식은 그 확인 문구를 말하는 데 걸리는 1초에, 주변의 침묵까지 포함해 요금을 부과합니다. 제품이 한 문장 응답으로 구성된 음성 인터페이스라면 계산은 ElevenLabs 쪽으로 기웁니다. 내레이션, 오디오북, 장문 현지화처럼 텍스트가 길고 오디오가 더 긴 경우라면 Google 쪽으로 크게 기웁니다.
품질 문제, 솔직히 말해서
Artificial Analysis Provider Voice Arena에서 — 각 제공업체의 자체 네이티브 음성을 대상으로 한 블라인드 쌍대 투표에서 — 두 모델의 격차는 크며, Google이 앞서고 있습니다.
• Gemini 3.8 Flash TTS — 2위, Elo 1,260, 17점 구간, 1,999개 샘플, 8개 아레나 보이스, 2026년 9월 출시.
• ElevenLabs Eleven v3 — 17위, Elo 1,167, 11점 구간, 4,345개 샘플, 아레나 음성 8개, 보드에 2026년 2월로 표기됨.
둘 사이에는 93 Elo 점이 벌어져 있고, 그 순위표의 상위 세 개 사이의 격차와 달리 이 차이는 실제이다: Eleven v3의 구간은 1,156에서 1,178이고 Gemini의 구간은 1,243에서 1,277로, 겹치는 부분이 없다. Eleven v3의 표본 수는 Gemini의 두 배 이상이므로 추정치도 빈약하지 않다.
그것은 가격 논거에 있어 정말로 곤란한 결과이며, 당연한 결론에 반하는 것입니다. ElevenLabs는 세 배의 비용을 청구하면서도 블라인드 선호도에서는 열일곱 계단이나 낮은 순위에 올랐습니다. 추가로 지불하는 67달러가 무엇을 사들이든, 일대일 비교에서 더 좋게 들리는 목소리를 사는 것은 아닙니다.
ElevenLabs가 실제로 판매하고 있는 것
ElevenLabs는 주로 합성 엔드포인트를 파는 게 아니며, 마치 그런 것처럼 가격을 매기는 것이 대부분의 비교가 잘못되는 지점이다. 그 돈으로 사는 것:
• 음성 라이브러리. ElevenLabs의 공유 음성 라이브러리는 수백 개의 음성으로 구성되어 있으며, 이는 실질적인 제품 접점입니다 — 사람들이 ElevenLabs를 찾는 이유는 종종 어딘가에서 들은 특정 음성 자체이지, 그 뒤에 있는 모델이 아닙니다. Gemini 3.8 Flash TTS는 미리 제작된 스튜디오 음성 30개, 자연어 설명으로 음성을 생성하는 음성 디자인 경로, 그리고 동의 확인, SynthID 워터마크 및 C2PA 자격 증명이 첨부된 30초 샘플에서 복제하는 복제 경로를 제공합니다. 기본 카탈로그는 더 작지만, 특정 음성을 만들 수 있는 능력은 비슷합니다.
• 지연 시간 등급은 별도 제품입니다. 약 75ms와 40,000자 제한의 Flash 및 Turbo는 약 280ms와 5,000자의 v3와는 다른 제품이며, 둘 다 v3보다 저렴합니다. 애플리케이션에 100ms 미만의 지연 시간이 필요하다면 ElevenLabs는 이를 명시적으로 판매하고 있으며, Google의 출시 자료에는 두 신규 TTS 모델 어느 쪽에 대해서도 이에 필적하는 지연 시간 주장이 없습니다.
• 하나의 생태계. 더빙, 음성 에이전트, 대화형 엔드포인트, 동시성이 결부된 요금제 구조 — Cartesia가 텔레포니를 판매하는 것과 같은 이유다. 그것은 모델이 아니라 스택이다.
스택을 구매한다면, 3.0x는 그것을 직접 조립하지 않는 데 대한 가격입니다. 합성 호출을 구매한다면, 그 비용은 음성 라이브러리와 레이턴시 티어에 지불하는 것입니다.
구글이 실제로 팔고 있는 것
반대 논거는 '더 저렴하다'보다 범위가 좁고 더 강력하다.
• 언어 지원 범위 — Flash TTS의 130개 언어와 Flash-Lite TTS의 101개 언어는 텍스트에서 자동 감지되며, ElevenLabs가 Eleven v3에 대해 문서화한 70개 이상의 언어와 대비됩니다. 현지화 작업에서 그 차이는 기능 비교가 아니라 지원 범위의 격차입니다.
• 연출 — 줄 단위 발화 제어, 단일 호출 내에서의 2인 화자 장면 구성, 그리고 대본에 비언어적 신호를 <laughs>, <sigh>, <gasp>, |mhm| 및 |yeah|처럼 명시하는 것. Google은 3.8 세대가 Gemini 3.1 Flash TTS보다 장편 일관성과 이중 화자 제어를 개선했다고 주장하는데, 이는 바로 그런 기능들이 존재하는 이유다. 공급사 주장, 미재현.
• 음성 상태 모델 — 프로젝트당 1년 TTL을 가진 상태 저장형 사용자 지정 음성 200개 또는 voicekey_... 핸들로 주소가 지정되는 상태 비저장 음성으로, 7일 후 만료됩니다. 이는 미리 계획할 수 있는 인프라 결정입니다.
• 출력 제어 — unary 엔드포인트에서는 WAV 24kHz 모노 16비트 부호 있는 PCM, 스트리밍 엔드포인트에서는 헤더 없는 PCM(audio/l16), 그리고 구성 가능한 샘플 레이트의 audio/mulaw 및 audio/alaw.
Google의 출시 벤치마크는 공급업체가 보고한 것이므로 그렇게 읽어야 합니다. Hume AI Voice Design Benchmark에서 71.4로 1위, 악센트 모델링에서 60.8로 1위, Hume Overall Quality Index에서는 Flash와 Flash-Lite가 각각 1위와 2위를 기록했으며, 일본어, 브라질 포르투갈어, 베트남어, 현대 표준 아랍어, 멕시코 스페인어, 힌디어에서 최상위 블라인드 선호도 순위를 주장했습니다. 그 실행 결과 중 공개된 것은 없습니다. 위의 아레나 Elo는 이 기사에서 독립적으로 수집된 유일한 수치이며, 우연히도 공급업체 주장의 방향과 일치합니다.
스위치 계산법
워크로드가 장편, 다국어, 또는 3.0x가 개별 항목으로 잡힐 만큼 충분히 대용량이고, 기본 음성 카탈로그가 더 작으며 공개된 100ms 미만 등급이 없어도 감수할 수 있다면 전환하세요. 이는 내레이션, 더빙, 접근성, 그리고 대부분의 제품 내장형 음성을 포괄합니다.
스택, 즉 음성 라이브러리, 지연 시간 등급, 더빙 및 에이전트 제품을 구매 중이거나, 초당 오디오 미터가 당신에게 불리하게 작용하는 아주 짧은 발화가 워크로드의 대부분을 차지한다면 계속 사용하세요. 또한 사용자가 알아볼 수 있는 음성 정체성을 ElevenLabs에서 이미 파인튜닝해 두었다면 계속 사용하세요. 음성 연속성은 제품 기능이고, 이를 새 모델에서 다시 만드는 일은 프로젝트이기 때문입니다.
어느 쪽이든 현명한 방법은 실제 트래픽으로 한 달 동안 둘 다 돌려본 뒤에 결정하는 것이고, 그게 바로 둘 중 어느 것도 코드베이스에 직접 연결하지 않는 이유입니다. OrcaRouter는 200개 이상의 모델을 단일 키로, 공급자 정가에 마크업 없이 제공하므로, 어느 연구소의 가격 변동이든 갱신 시점이 아니라 같은 날 청구서에 반영되고, 자동 장애 조치가 프로덕션 음성 경로를 살려줍니다 완전히 새로운 엔드포인트가 오작동할 때도 말이죠. 우리는 ElevenLabs를 호스팅하지 않습니다 — 그 합성 및 에이전트 계층은 자체 제품입니다 — 그리고 Google API에서 오는 Gemini 3.8 TTS 엔드포인트도 호스팅하지 않습니다. 우리가 담당하는 것은 그 아래의 텍스트 계층과 그 위의 라우팅입니다.
다음 리더보드 개정판에서 주목할 숫자는 Eleven v3의 Elo입니다. 세 배나 비싼 값을 받는 모델에게 93점은 큰 뒤처짐이며, 구간이 좁아져도 격차가 줄지 않는다면 가격 논거는 더 이상 절충이 아니라 평결이 됩니다.
