
Gemini 3.8 Live vs ElevenLabs: 모델 대 파이프라인
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ElevenLabs의 에이전트 플랫폼 문서를 열어 보면 그 한가운데에 Gemini 모델이 자리 잡고 있다. ElevenLabs Agents는 음성 인식 프런트 엔드, 언어 모델, 텍스트 음성 변환 백엔드가 이어지는 캐스케이드 구조인데, 공개된 스택에 들어간 언어 모델은 Gemini 모델이다. Gemini 3.8 Live 대 ElevenLabs 비교를 시작하기에 딱 알맞은 지점이 바로 여기다. 비교하는 두 가지가 같은 종류의 객체가 아니기 때문이다. Gemini 3.8 Live는 음성 대 음성 모델로, 2026년 9월 15일 Live API로 출시되었으며 오디오 분당으로 가격이 매겨진다. ElevenLabs Eleven v3는 ElevenLabs Agents도 판매하는 음성 플랫폼의 대표 합성 모델이며, 대화당이 아니라 문자당으로 가격이 매겨진다. 하나는 빌려 쓸 수 있는 구성 요소다. 다른 하나는 구성 요소를 빌려 쓰는 시스템이다 — 적어도 하나의 공개된 구성에서는 Gemini 모델의 것까지 포함해서.
그 비대칭성은 사람들이 실제로 이 맞대결에 던지는 대부분의 질문을 정리해 줍니다. 어느 쪽을 호출해야 하는지 묻는다면, 솔직한 답은 그것들이 대체재가 아니라는 것입니다. 하나는 요금표는 있지만 전화 통신 기능이 없는 모델이고, 다른 하나는 전화 통신, 동시성 한도, 그리고 동시에 돌아가는 세 가지 미터를 갖춘 제품입니다. 어느 쪽이 더 저렴한지, 더 나은지, 더 빠른지는 전적으로 여러분의 애플리케이션이 이미 그 두 형태 중 어느 쪽인지에 달려 있습니다.
하나의 모델, 아니면 순차적인 세 개의 모델
Gemini 3.8 Live는 네이티브 음성-대-음성 시스템입니다. 오디오가 입력되고 오디오가 출력되며, 추론은 음성을 생성하는 동일한 순방향 패스에서 이루어집니다 — 하나의 모델, 하나의 지연 예산, 하나의 청구서. Google은 2026년 9월 15일에 두 가지 변형으로 출시했습니다: gemini-3.8-live는 대규모 대화 작업용이고, gemini-3.8-live-extended-thinking는 동일한 인터페이스에 다단계 추론이 뒷받침되는 버전입니다. 둘 다 대화 중 전환을 지원하며 97개 언어를 처리하고, 둘 다 시각 입력을 거의 실시간으로 처리하며, 둘 다 대화가 계속되는 동안 백그라운드에서 도구 및 API 호출을 실행하고, 둘 다 생성된 오디오의 매초에 SynthID 워터마크를 넣습니다. 공개 요금은 오디오 입력 1분당 $0.005, 오디오 출력 1분당 $0.018입니다.
ElevenLabs Agents는 그런 것이 아니다. 그것은 파이프라인이며, 파이프라인이 곧 제품이다. 실시간 음성 인식 모델이 발신자의 말을 받아쓰고, 언어 모델이 무엇을 말할지 결정하며, 합성 모델 — ElevenLabs가 문서화한 구성의 Eleven Flash v2 — 이 답변을 말한다. 각 단계는 별도로 과금되고, 각 단계는 교체할 수 있으며, 전체는 전화 통신, 턴 감지, 동시성을 처리하는 관리형 레이어 뒤에 있다. 회사의 대표 합성 모델인 ElevenLabs Eleven v3는 또 다른 제품이다. 백만 자당 100달러로 책정된 텍스트 음성 변환 모델로, 대화를 나누기보다는 내레이션, 더빙, 보이스 디자인을 위해 판매된다.
그래서 가장 먼저 제대로 짚어야 할 점은 "Gemini 3.8 Live vs ElevenLabs Eleven v3"가 두 음성 모델 간의 맞대결이 아니라는 것입니다. Eleven v3는 오디오 입력을 받지 않으며 대화를 나누지도 않습니다. 의미 있는 비교는 Gemini 3.8 Live 대 ElevenLabs Agents이며, Eleven v3는 플랫폼이 그 수준을 중심으로 구축된 합성 품질의 상한선 역할로만 등장합니다.
각각이 실제로 보드에서 어디에 위치하는지
이 둘을 서로 겨루어 순위를 매기는 리더보드는 없는데, 그 이유는 시사하는 바가 크다: 이들은 서로 다른 것을 측정하는 서로 다른 보드에 계속해서 등장한다.

Artificial Analysis의 Speech to Speech Index에서 — 음성 추론, 에이전트 작업 완수, 아레나 선호도, 작업 성공률을 하나의 숫자로 합산한 지표 — Gemini 3.8 Live는 76.0점을 기록했으며, Extended Thinking 변형은 82.6으로 1위를 차지했습니다. 이는 Google이 공개한 수치가 아니라 Artificial Analysis가 자체 하네스에서 측정한 값이지만, Google의 자체 발표도 동일한 구성 요소에서 나온 수치를 인용하고 있습니다.
ElevenLabs는 그 리더보드에 아예 나타나지 않습니다. 측정할 음성-대-음성 모델을 출시하지 않기 때문입니다. ElevenLabs가 등장하는 곳은 Speech Agent Arena로, 이곳은 모델이 아니라 조립된 에이전트를 평가하는 곳이며, 그곳의 그림은 진짜로 엇갈립니다: ElevenLabs Agents는 937 Elo와 90.5%의 작업 성공률로 측정되었고, 이전 Gemini Live 세대를 기반으로 구축된 에이전트는 1,046 Elo와 74.6%의 작업 성공률을 기록했으며, Gemini 에이전트는 0.96초 만에 첫 오디오에 도달했습니다. 이 한 쌍을 주의 깊게 읽어 보십시오. Gemini 기반 에이전트는 선호도와 속도에서 이기고, ElevenLabs 에이전트는 작업을 완수하는 데서 이깁니다. 즉, 캐스케이드가 신뢰성에서 네이티브 모델을 이기는 것으로, 이는 아키텍처 다이어그램이 예측했을 결과가 아닙니다.
그 수치들에 관해 두 가지 짚고 넘어갈 점이 있는데, 둘 다 중요한 사항입니다. 그 비교에서 Gemini 쪽은 3.8 Live가 아니라 2026년 초의 Gemini Live 세대를 사용했기 때문에, 이 기사에서 다루는 모델에 대한 측정치가 아닙니다. 그리고 세 번째로 등장하는 순위표, 즉 합성 모델의 순위를 매기는 Artificial Analysis의 Provider Voices 음성 아레나에서는 ElevenLabs Eleven v3를 1,177 Elo에, 그리고 대화형 변형인 ElevenLabs v3 Conversational을 1,219 Elo에 올려놓는데, 선두 주자인 Cartesia Sonic 3.6은 1,283 Elo입니다. 그 순위표는 에이전트가 얼마나 잘 수행하는지가 아니라 목소리가 얼마나 좋게 들리는지를 측정하며, 이 둘을 뒤섞는 것이 바로 사람들이 합성 점수를 대화형 시스템에 대한 근거로 인용하게 되는 이유입니다.
사양 대비

• 아키텍처 — Gemini 3.8 Live는 하나의 네이티브 음성-음성 모델인 반면, ElevenLabs Agents는 음성 인식, 언어 모델, 합성이 이어지는 캐스케이드입니다
• 입력 및 출력 — Gemini 3.8 Live는 오디오를 받아 단일 패스로 오디오를 반환하는 반면, ElevenLabs는 Scribe v2 Realtime을 통해 오디오를 받고 Eleven Flash v2를 통해 반환하며 그 사이에 텍스트 트랜스크립트가 있습니다
• 교체할 수 있는 것 — Gemini 3.8 Live에서는 아무것도, 모델이 곧 모델이다 vs ElevenLabs에서는 언어 모델을 포함한 모든 단계를 독립적으로, 문서화된 스택에서는 언어 모델이 Google의 것이다
• 언어 — 대화 중 전환 지원 Gemini 3.8 Live 97 대 ElevenLabs Eleven v3 74
• 오디오 가격 — Gemini 3.8 Live는 분당 입력 $0.005, 분당 출력 $0.018인 반면, ElevenLabs는 에이전트 분을 기준으로 가격이 책정되고 언어 모델 토큰은 그 위에 별도로 과금됩니다.
• 전화 통신 — Gemini 3.8 Live는 퍼스트파티 없음, 사용자가 자체 통신사와 세션 관리를 직접 준비 vs ElevenLabs는 관리형, 퍼스트파티
• 동시성 — Live API 할당량이 허용하는 만큼인 Gemini 3.8 Live vs 동시성 등급으로 판매되는 ElevenLabs
• 에이전트 툴링 — Gemini 3.8 Live 백그라운드 도구 및 모델 내부의 API 실행 vs 턴 감지, 워크플로, 음성 라이브러리를 갖춘 ElevenLabs의 관리형 에이전트 계층
• 오픈 아티팩트 — 어느 쪽도 아니다. 둘 다 폐쇄형이고 클라우드 전용이며 독점적이다
• 지연 시간 — Gemini 3.8 Live는 표준 모델의 경우 첫 오디오까지 1.18초, Extended Thinking의 경우 1.35초(Artificial Analysis 기준)인 반면, ElevenLabs는 단일 수치로 공개되지 않음. 캐스케이드의 지연 시간은 세 단계의 합이기 때문.
마지막 행은 다른 어떤 행보다 아키텍처 선택을 더 잘 설명해 주는 행입니다. 네이티브 모델에는 지연 시간 예산이 하나뿐입니다. 캐스케이드에는 세 개가 있으며, 팀들이 여전히 캐스케이드를 선택하는 이유는 그 위에 있는 모든 것 때문입니다: 기록할 수 있는 트랜스크립트, 교체할 수 있는 단계, 그리고 그냥 작동하는 전화번호.
1분에 드는 비용, 양방향 모두
Gemini 3.8 Live의 요금 계산은 측정 기준이 하나뿐이라 유난히 간단하다. 대화 1분은 대략 발신자 오디오 1분에 모델 오디오 1분을 더한 것으로, $0.005 더하기 $0.018이므로 약 분당 2.3센트 (공개된 요율 기준)이다. Artificial Analysis의 시간당 비용 열은 고정된 오디오 추론 세트를 완료하는 비용을 시간당 수치로 정규화하는데, 표준 모델을 입력 오디오 시간당 $0.84 — 해당 순위표에서 가장 저렴한 유료 요율 — 로, Extended Thinking 변형을 $3.50으로 산정한다.

ElevenLabs의 셈법은 더 까다롭다. 그리고 그것은 비판이라기보다 오히려 핵심이다. 에이전트 1분은 하나의 가격이 아니다. 에이전트 1분 자체에 대한 플랫폼 요금, 중간 구간에서 소모되는 언어 모델 토큰, 그 밑에 깔린 통신사 분(分) — 계량기가 셋, 최악의 경우 공급업체가 셋이며, 그중 하나만 움직여도 요금이 달라진다. 합성 쪽은 더 읽기 쉽다: ElevenLabs Eleven v3는 100만 자당 100달러로, 일반적인 말하기 속도로 연속 낭독하면 시간당 약 8달러인 반면, 같은 아레나에서 가장 저렴한 오픈 웨이트 경쟁 모델은 약 2.70달러다. ElevenLabs는 목소리에 프리미엄을 붙이는데, 그 순위표에서 그 프리미엄은 실재한다 — 전체 4위에 올라 있다.
두 비용 구조가 실제로 의미하는 바는 Gemini 3.8 Live가 대화 1분당 더 저렴하고 오디오 1시간당 훨씬 더 저렴한 반면, ElevenLabs는 더 비싸고 운영하기 훨씬 더 예측 가능하다는 것입니다. ML 엔지니어가 없고 전화번호를 개설해야 하는 팀은 첫 달에 ElevenLabs에 더 적은 비용을 지출하게 됩니다. 왜냐하면 대안은 ElevenLabs가 이미 구축한 것을 직접 구축하는 것이기 때문입니다. 이미 자체 세션 관리와 자체 통신사를 운영하고 있는 팀은 모델 자체에 더 적은 비용을 지출하게 됩니다. 왜냐하면 이미 가지고 있는 파이프라인에 비용을 지불하지 않기 때문입니다.
ElevenLabs가 진정으로 더 뛰어난 점
가격 격차를 하나의 판정으로 읽어내기는 쉽다. 하지만 그것은 판정이 아니며, 그 이유는 요율표가 결코 보여주지 않는 것들에 있다.
• 전화 통신. ElevenLabs는 전화번호, SIP 트렁킹, 그리고 통화를 받을 동시 처리 능력을 판매한다. Google은 말을 하는 모델을 판매한다. 당신의 제품이 전화선이라면, 그 두 문장 사이의 격차는 몇 달에 걸친 엔지니어링이다.
• 보이스 아이덴티티. 보이스 라이브러리, 클로닝 파이프라인, 더빙 스튜디오는 성숙한 제품 영역입니다. Gemini 3.8 Live는 모델을 제공하지만, 라이선스된 보이스 카탈로그나 기존 녹음을 9개 언어로 현지화하는 워크플로를 제공하지는 않습니다.
• 기본적으로 트랜스크립트가 제공됩니다. 캐스케이드는 추론하기 전에 전사하기 때문에, 모든 통화의 텍스트 로그를 무료로 얻을 수 있습니다 — 컴플라이언스, 평가, 그리고 에이전트가 왜 뭔가를 잘못했는지 알아내는 이 눈에 띄지 않는 작업에 유용합니다. 네이티브 음성-대-음성 모델에는 직접 만들지 않는 한 그러한 산출물이 없습니다.
• 교체 가능한 구성 요소. 더 나은 언어 모델이 출시되면, ElevenLabs 캐스케이드는 아무것도 재학습할 필요 없이 그것을 도입할 수 있습니다. 문서화된 스택의 중간에 Google 모델이 있는 이유가 바로 이것이며, 이는 캐스케이드 아키텍처를 지지하는 가장 강력한 단 하나의 논거입니다.
원시 모델이 당신에게 주는 것
반론은 가격에 관한 것이 아니다. 단일 순방향 패스가 세 단계로는 할 수 없는 무엇을 할 수 있는지에 관한 것이다.
Gemini 3.8 Live는 이미 그것들을 버려버린 트랜스크립트를 거치지 않고 운율, 어조, 망설임을 직접 듣는다. 그래서 문장 중간에 언어를 바꿀 수 있고, 대화 역동성 점수—Artificial Analysis에 따르면 표준 모델의 경우 96.1%—가 자체의 추론 중심 형제 모델을 능가하는 유일한 구성 요소인 이유이기도 하다. 또한 계속 말하는 동안 백그라운드에서 도구 및 API 호출을 실행하므로, 조회가 침묵을 낳지 않는다. 그리고 Extended Thinking 변형은 같은 능력의 더 큰 버전이 아니라 진정으로 다른 능력이다. τ-Voice 고객 서비스 시나리오의 68.6%를 해결하는 반면 표준 모델은 30.1%를 해결하며, 이 38포인트 격차는 이번 출시에서 가장 큰 단일 수치이자 Google이 이 라인을 둘로 나눈 이유다.
에이전트의 임무가 즐거운 대화를 나누는 것이 아니라 여러 단계로 이루어진 작업을 끝내는 것이라면, 그 38점 격차가 결정의 전부이며, 시간당 $0.84 대신 $3.50이 들지만 — 그 리더보드에서 앞서는 모든 모델보다 여전히 저렴합니다.
가운데 다리는 실제로 움직일 수 있는 다리다
여기에는 이름 붙일 가치가 있는 이음매가 있다. 왜냐하면 바로 이 지점에서 아키텍처 질문이 조달 질문으로 바뀌기 때문이다. 캐스케이드에서 가운데 다리 — 무엇을 말할지 결정하고, 도구를 호출하며, 추론을 수행하는 부분 — 는 평범한 텍스트 추론이다. 이는 또한 비용 변동이 가장 크고, 락인이 가장 심하며, 단일 벤더에 묶여 있을 이유가 가장 적은 다리이기도 하다. ElevenLabs가 문서화한 스택은 마침 그 자리에서 Gemini 모델을 사용한다. 꼭 그럴 필요는 없다.
OrcaRouter는 그 구간만 담당하며 바깥쪽 두 구간은 담당하지 않습니다. 우리는 Gemini 3.8 Live 음성 엔드포인트를 호스팅하지 않습니다. 그것은 Google 자체 Live API에서 제공됩니다. 또한 합성과 에이전트 계층이 자체 제품인 ElevenLabs도 호스팅하지 않습니다. 우리가 제공하는 것은 그 아래의 텍스트 계층입니다: 단일 키로 200개 이상의 모델을 마크업 없이 공급자 정가에 이용 따라서 상류 연구소의 가격 인하가 다음 갱신 때가 아니라 같은 날 청구서에 반영됩니다. 특히 음성 스택의 경우, 그 속성 중 세 가지가 제값을 합니다. 자동 페일오버는 백엔드가 문장 중간에 오류를 내거나 타임아웃될 때 통화를 계속 살려 두는데, 이는 발신자가 즉시 알아차리는 실패입니다. 라우팅 DSL은 여러 모델을 하나의 호출로 구성하므로, 저렴한 모델이 확인 응답 턴을 처리하고 더 강력한 모델이 실제 거래를 맡을 수 있습니다. 그리고 모델 퓨전은 단일 모델의 판단만으로는 신뢰하기 어려운 턴에서 패널이 함께 답하도록 해 줍니다. 캐스케이드 중간에 어떤 모델이 들어가는지 바꾸는 것은 재구축이 아니라 구성 변경입니다 — 캐스케이드 아키텍처가 존재하는 이유가 바로 그것입니다.
어느 걸 고를까?
전화선을 출시하려는데 음성 스택을 직접 구축하고 싶지 않다면 ElevenLabs를 선택하세요. 여러분은 전화 통신, 음성 카탈로그, 트랜스크립트, 동시 처리, 지원 계약을 구매하는 것이며, 분당 프리미엄은 바로 그 비용입니다. 또한 다른 것은 아무것도 바꾸지 않고 도중에 모델을 교체할 수 있는 능력도 구매하는 것인데, 이는 들리는 것보다 더 가치가 큽니다.
음성이 이미 운영 중인 무언가의 기능이라면 Gemini 3.8 Live를 선택하세요. 현재 공개된 것 중 가장 저렴하면서도 제대로 작동하는 음성-대-음성 요금, 대화 중 전환을 지원하는 97개 언어, 모델이 계속 말하는 동안 실행되는 도구 실행을 얻을 수 있으며 — 에이전트가 단순히 대화하는 것이 아니라 작업을 완수해야 한다면 — Extended Thinking 변형이 시간당 오디오 비용의 약 4배를 지불하고 확보하는 38포인트의 에이전트 격차도 얻을 수 있습니다. 통신사, 세션 수명 주기, 로그는 직접 제공해야 합니다.
지켜볼 점: ElevenLabs가 관리형 에이전트 1분에 대해 단일 지연 시간 수치를 공개할지 여부, 왜냐하면 그 수치가 이 비교를 구조적 비교가 아니라 정량적 비교로 만들어 줄 숫자이기 때문이다; 그리고 3.8 Live로 구축한 에이전트를 Speech Agent Arena에서 측정했을 때 그 결과가 유지될지 여부, 왜냐하면 현재 캐스케이드가 작업 성공률에서 네이티브 모델을 앞서는 것은 이 맞대결에서 가장 흥미롭고 가장 설명이 부족한 부분이기 때문이다.
