Um cartão de destaque gerado para o artigo 'Gemini 3.8 Live vs ElevenLabs', mostrando dois cartões arredondados de cada lado do título. O cartão da esquerda traz 'Gemini 3.8 Live' acima de um ícone de nuvem e forma de onda e a linha 'fala para fala, uma passagem, por minuto'; o cartão da direita traz 'ElevenLabs Agents' acima de um ícone de pipeline de três blocos rotulado 'STT - LLM - TTS' e a linha 'montado, por minuto de agente'. Um subtítulo diz 'Um componente que você aluga vs um sistema que aluga componentes'. O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Gemini 3.8 Live vs ElevenLabs: Um Modelo Contra um Pipeline

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Abra a documentação da ElevenLabs para sua plataforma de agentes e há um modelo Gemini bem no meio dela. O ElevenLabs Agents é uma cascata — um front-end de reconhecimento de fala, um modelo de linguagem e um back-end de conversão de texto em fala — e o modelo de linguagem na pilha publicada é um Gemini. Esse é o lugar certo para começar uma comparação entre Gemini 3.8 Live e ElevenLabs, porque as duas coisas comparadas não são o mesmo tipo de objeto. Gemini 3.8 Live é o modelo de fala para fala, lançado na Live API em 15 de setembro de 2026, com preço por minuto de áudio. ElevenLabs Eleven v3 é o modelo de síntese principal de uma plataforma de voz que também vende o ElevenLabs Agents, e seu preço é por caractere, não por conversa. Um é um componente que você pode alugar. O outro é um sistema que aluga componentes — incluindo, em pelo menos uma configuração publicada, o de um modelo Gemini.

Essa assimetria resolve a maioria das perguntas que as pessoas realmente trazem para essa comparação. Se você está perguntando qual dos dois chamar, a resposta honesta é que eles não são substitutos: um é um modelo com uma tabela de preços e sem telefonia, o outro é um produto com telefonia, limites de concorrência e três medidores funcionando ao mesmo tempo. Qual deles é mais barato, melhor ou mais rápido depende inteiramente de qual dessas duas formas sua aplicação já é.

Um modelo, ou três modelos em sequência

O Gemini 3.8 Live é um sistema nativo de fala para fala. O áudio entra, o áudio sai, e o raciocínio acontece na mesma passagem direta que produz a fala — um modelo, um orçamento de latência, uma fatura. O Google o lançou em duas variantes em 15 de setembro de 2026: gemini-3.8-live para trabalho conversacional em escala, e gemini-3.8-live-extended-thinking para a mesma interface com raciocínio de várias etapas por trás. Ambos lidam com 97 idiomas com troca no meio da conversa, ambos processam entrada visual em tempo quase real, ambos executam chamadas de ferramentas e de API em segundo plano enquanto a conversa continua, e ambos aplicam marca d'água com SynthID em cada segundo do áudio gerado. A tarifa publicada é de US$ 0,005 por minuto de áudio de entrada e US$ 0,018 por minuto de áudio de saída.

ElevenLabs Agents não é isso. É um pipeline, e o pipeline é o produto. Um modelo de reconhecimento de fala em tempo real transcreve o chamador, um modelo de linguagem decide o que dizer, e um modelo de síntese — Eleven Flash v2 na configuração que a ElevenLabs documenta — fala a resposta. Cada etapa é medida separadamente, cada etapa pode ser trocada, e o conjunto todo fica atrás de uma camada gerenciada que lida com telefonia, detecção de turnos e concorrência. ElevenLabs Eleven v3, o principal modelo de síntese da empresa, é ainda outro produto: um modelo de texto para fala com preço de US$ 100 por milhão de caracteres, vendido para narração, dublagem e design de voz, e não para manter uma conversa.

Então, a primeira coisa que precisamos acertar é que "Gemini 3.8 Live vs ElevenLabs Eleven v3" não é um confronto direto entre dois modelos de fala. O Eleven v3 não recebe entrada de áudio e não mantém uma conversa. A comparação que faz sentido é Gemini 3.8 Live contra ElevenLabs Agents, com o Eleven v3 presente apenas como o teto de qualidade de síntese em torno do qual a plataforma é construída.

Onde cada um realmente fica em um tabuleiro

Não existe nenhuma tabela de classificação que coloque esses dois um contra o outro, e o motivo disso é instrutivo: eles continuam aparecendo em tabelas diferentes, que medem coisas diferentes.

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

No Speech to Speech Index da Artificial Analysis — que combina raciocínio de fala, conclusão de tarefas agênticas, preferência na arena e sucesso em tarefas em um único número — o Gemini 3.8 Live pontua 76,0, com a variante Extended Thinking em primeiro lugar, com 82,6. Essas são medições que a Artificial Analysis executa em seu próprio ambiente de avaliação, não números divulgados pelo Google, embora o anúncio do próprio Google cite números dos mesmos componentes.

O ElevenLabs não aparece nesse quadro de forma alguma, porque não lança um modelo de fala para fala para ser medido. Onde ele aparece é na Speech Agent Arena, que avalia agentes montados em vez de modelos, e o cenário ali é genuinamente misto: O ElevenLabs Agents foi medido em 937 Elo com uma taxa de sucesso de tarefas de 90,5%, contra 1.046 Elo e 74,6% de taxa de sucesso de tarefas para um agente construído na geração anterior do Gemini Live, com o agente Gemini alcançando o primeiro áudio em 0,96 segundos. Leia esse par com atenção. O agente com suporte do Gemini vence em preferência e velocidade; o agente ElevenLabs vence em concluir a tarefa. Isso é uma cascata superando um modelo nativo em confiabilidade, o que não é o resultado que os diagramas de arquitetura preveriam.

Duas ressalvas sobre esses números, e ambas importam. O lado do Gemini nessa comparação usou a geração do Gemini Live do início de 2026, não o 3.8 Live, então não se trata de uma leitura sobre o modelo de que este artigo fala. E o terceiro ranking em jogo — o Provider Voices speech arena da Artificial Analysis, que classifica modelos de síntese — coloca ElevenLabs Eleven v3 com 1.177 de Elo e a variante conversacional, ElevenLabs v3 Conversational, com 1.219 de Elo, contra 1.283 do líder, Cartesia Sonic 3.6. Esse ranking mede quão boa a voz soa, não quão bem o agente se sai, e misturar as duas coisas é como as pessoas acabam citando uma pontuação de síntese como evidência sobre um sistema conversacional.

Contraste de especificação

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• Arquitetura — O Gemini 3.8 Live é um único modelo nativo de fala para fala, enquanto o ElevenLabs Agents é uma cascata de reconhecimento de fala, um modelo de linguagem e síntese

• Entrada e saída — Gemini 3.8 Live recebe áudio e retorna áudio em uma única passagem, enquanto ElevenLabs recebe áudio através do Scribe v2 Realtime e o retorna através do Eleven Flash v2, com uma transcrição de texto no meio

• O que você pode trocar — Gemini 3.8 Live: nada, o modelo é o modelo, versus ElevenLabs: cada etapa de forma independente, incluindo o modelo de linguagem, que, na stack documentada, é um da Google

• Idiomas — Gemini 3.8 Live 97 com troca no meio da conversa vs ElevenLabs Eleven v3 74

• Preços de áudio — Gemini 3.8 Live: US$ 0,005 por minuto de entrada e US$ 0,018 por minuto de saída, versus ElevenLabs, cobrado por minutos de agente, com tokens de modelo de linguagem medidos separadamente além disso

• Telefonia — Gemini 3.8 Live: nenhuma de primeira parte; você traz sua própria operadora e gerenciamento de sessão vs. ElevenLabs gerenciado, de primeira parte

• Concorrência — Gemini 3.8 Live, conforme o que sua cota da Live API permitir, vs. ElevenLabs vendido em níveis de concorrência

• Ferramentas de agente — ferramenta em segundo plano do Gemini 3.8 Live e execução de API dentro do modelo vs. ElevenLabs, uma camada de agente gerenciada com detecção de turno, fluxos de trabalho e uma biblioteca de vozes

• Artefato aberto — nenhum. Ambos são fechados, exclusivos da nuvem e proprietários.

• Latência — Gemini 3.8 Live 1,18 segundos até o primeiro áudio para o modelo padrão e 1,35 para o Extended Thinking, segundo a Artificial Analysis, enquanto a ElevenLabs não publica como um único número, porque a latência de uma cascata é a soma de três estágios

A última linha é a que explica a escolha de arquitetura melhor do que qualquer uma das outras. Um modelo nativo tem um único orçamento de latência. Uma cascata tem três, e a razão pela qual as equipes ainda escolhem a cascata é tudo o que está acima dela: a transcrição que você pode registrar, a etapa que você pode substituir e o número de telefone que simplesmente funciona.

Quanto custa um minuto, nos dois sentidos

A aritmética do Gemini 3.8 Live é incomumente fácil porque há apenas um medidor. Um minuto de conversa é aproximadamente um minuto de áudio do chamador mais um minuto de áudio do modelo: $0,005 mais $0,018, portanto cerca de 2,3 centavos por minuto à tarifa publicada. A coluna de custo por hora da Artificial Analysis, que normaliza o custo de concluir um conjunto fixo de raciocínio de áudio para um valor por hora, coloca o modelo padrão em $0,84 por hora de áudio de entrada — a tarifa paga mais barata desse quadro — e a variante Extended Thinking em $3,50.

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

A aritmética da ElevenLabs é mais difícil, e esse é o ponto em vez de uma crítica. Um minuto de agente não tem um preço único: há a cobrança da plataforma pelo próprio minuto de agente, os tokens do modelo de linguagem consumidos na perna intermediária e os minutos da operadora por baixo — três medidores, três fornecedores no pior caso, e uma fatura que muda quando qualquer um deles muda. O lado da síntese é mais legível: ElevenLabs Eleven v3 a US$ 100 por milhão de caracteres custa cerca de US$ 8 por hora de narração contínua em ritmos de fala comuns, contra cerca de US$ 2,70 do concorrente open-weights mais barato na mesma arena. A ElevenLabs cobra um prêmio pela voz, e nesse ranking o prêmio é real — ela ocupa o quarto lugar no geral.

O que as duas estruturas de custo significam na prática é que o Gemini 3.8 Live é mais barato por minuto de conversa e muito mais barato por hora de áudio, enquanto o ElevenLabs é mais caro e muito mais previsível de operar. Uma equipe sem engenheiros de ML e com um número de telefone para colocar de pé vai gastar menos com o ElevenLabs no primeiro mês, porque a alternativa é construir o que o ElevenLabs já construiu. Uma equipe que já opera seu próprio gerenciamento de sessões e sua própria operadora vai gastar menos com o modelo bruto, porque não está pagando por um pipeline que já tem.

Em que a ElevenLabs é genuinamente melhor

Seria fácil interpretar a diferença de preço como um veredito. Não é, e as razões são aquelas que uma tabela de preços nunca mostra.

• Telefonia. A ElevenLabs vende números de telefone, troncalização SIP e a simultaneidade necessária para atender chamadas. O Google vende um modelo que fala. Se o seu produto é uma linha telefônica, a lacuna entre essas duas frases representa meses de engenharia.

• Identidade de voz. O Voice Library, o pipeline de clonagem e o estúdio de dublagem são uma superfície de produto madura. O Gemini 3.8 Live dá-lhe um modelo; não lhe dá um catálogo de vozes licenciadas nem um fluxo de trabalho para localizar uma gravação existente em nove idiomas.

• Uma transcrição por padrão. Como uma cascata transcreve antes de raciocinar, você obtém registros de texto de cada chamada de graça — útil para conformidade, para avaliação e para o trabalho pouco glamouroso de descobrir por que o agente errou em algo. Um modelo nativo de fala para fala não tem esse artefato, a menos que você construa um.

• Peças substituíveis. Quando surge um modelo de linguagem melhor, uma cascata da ElevenLabs pode adotá-lo sem precisar treinar nada de novo. É exatamente por isso que a pilha documentada tem um modelo do Google no meio dela — e é o argumento mais forte a favor da arquitetura em cascata.

O que o modelo bruto lhe oferece

O contra-argumento não é sobre preço. É sobre o que uma única passagem direta pode fazer que três estágios não podem.

O Gemini 3.8 Live ouve prosódia, tom e hesitação diretamente, em vez de por meio de uma transcrição que já os descartou, e é por isso que consegue alternar idiomas no meio da frase e por que sua pontuação de dinâmica conversacional — 96,1% para o modelo padrão, segundo a Artificial Analysis — é o único componente em que ele supera seu próprio modelo irmão mais voltado ao raciocínio. Ele também executa chamadas de ferramentas e de API em segundo plano enquanto continua falando, de modo que uma consulta não gera silêncio. E a variante Extended Thinking é uma capacidade genuinamente diferente, e não uma versão maior da mesma capacidade: ela resolve 68,6% dos cenários de atendimento ao cliente do τ-Voice, contra 30,1% do modelo padrão, uma diferença de 38 pontos que é o maior número único do lançamento e o motivo pelo qual o Google dividiu a linha em duas.

Se o trabalho do seu agente é concluir uma tarefa de várias etapas, em vez de manter uma conversa agradável, essa diferença de 38 pontos é o fator decisivo, e custa US$ 3,50 por hora em vez de US$ 0,84 — ainda abaixo de todos os modelos que ele supera nesse ranking.

A perna do meio é a que você pode realmente mover.

Eis a costura que vale a pena nomear, porque é onde a questão de arquitetura se transforma em uma questão de compras. Em uma cascata, a etapa do meio — a parte que decide o que dizer, chama as ferramentas e faz o raciocínio — é inferência de texto comum. É também a etapa com a maior variação de custo, o maior lock-in e o menor motivo para estar atrelada a um único fornecedor. A stack que a ElevenLabs documenta, por acaso, usa um modelo Gemini ali. Não precisa ser assim.

O OrcaRouter cobre essa etapa, e não as duas externas. Não hospedamos os endpoints de voz do Gemini 3.8 Live — eles vêm da própria Live API do Google — nem hospedamos a ElevenLabs, cujas camadas de síntese e de agente são produto próprio dela. O que nós oferecemos é a camada de texto por baixo: mais de 200 modelos atrás de uma única chave pelo preço de tabela do provedor, sem markup, de modo que um corte de preço de um laboratório upstream chega à sua fatura no mesmo dia, e não na próxima renovação. Para uma stack de voz especificamente, três dessas propriedades se justificam. O failover automático mantém uma chamada ativa quando um backend dá erro ou estoura o tempo limite no meio de uma frase — uma falha que o chamador percebe na hora. A DSL de roteamento compõe vários modelos em uma única chamada, então um modelo barato pode cuidar dos turnos de confirmação e um mais forte pode assumir a transação. E a fusão de modelos permite que um painel responda em conjunto nos turnos em que o julgamento de um único modelo não é bom o bastante para ser confiado sozinho. Mudar qual modelo fica no meio de uma cascata é uma alteração de configuração, não uma reconstrução — que é exatamente a razão de a arquitetura em cascata existir.

Qual escolher

Escolha a ElevenLabs se você vai colocar uma linha telefônica no ar e não quer construir uma stack de voz. Você está comprando telefonia, um catálogo de vozes, transcrições, concorrência e um contrato de suporte, e o prêmio por minuto é o que isso custa. Você também está comprando a capacidade de trocar o modelo no meio do caminho sem mudar mais nada, o que vale mais do que parece.

Escolha o Gemini 3.8 Live se a voz for uma funcionalidade de algo que você já opera. Você obtém a tarifa de fala para fala competente mais barata que qualquer um publica atualmente, 97 idiomas com troca no meio da conversa, execução de ferramentas que roda enquanto o modelo continua falando e — se seu agente tiver que concluir tarefas, e não apenas conversar — a lacuna agêntica de 38 pontos que a variante Extended Thinking compra por cerca de quatro vezes o custo horário de áudio. Você fornece a operadora, o ciclo de vida da sessão e os logs.

O que observar: se a ElevenLabs publica um único valor de latência para um minuto de agente gerenciado, porque é esse o número que tornaria esta comparação quantitativa em vez de estrutural; e se o resultado da Speech Agent Arena se sustenta quando um agente construído sobre o 3.8 Live é medido nele, porque uma cascata que atualmente supera um modelo nativo em sucesso de tarefa é a coisa mais interessante deste confronto e a menos explicada.