Um cartão hero gerado para o ElevenLabs Eleven v4 com dois painéis: à esquerda, um bloco de script exibindo tags de áudio inline como [laughs], [whispers] e [said angrily in French accent]; à direita, um painel que exibe classificação 1, Elo 1.319, $80,00 por 1M de caracteres e 1.674 aparições no Provider Voice Arena da Artificial Analysis, com um rodapé que diz 'Classificação do Provider Voice, Elo e preço segundo a Artificial Analysis, setembro de 2026; sintaxe de tags e latência documentadas pelo fornecedor.' O logotipo da OrcaRouter fica no canto inferior direito.
Engineering & Research

Tags de Áudio e Clones de Dez Segundos do Eleven v4: O Que Muda no Seu Pipeline

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A coisa mais importante sobre ElevenLabs Eleven v4 não é o seu Elo. É que o modelo lê direções escritas no roteiro — [ri], [sussurra], [suspira], [dito com raiva em sotaque francês], até mesmo [chuva leve] — e que ElevenLabs Eleven v4 Turbo, o irmão de baixa latência lançado no mesmo dia, segue as mesmas tags em um tempo mediano até a primeira fala que o fornecedor estima em cerca de 150 ms. Ambos entraram em disponibilidade geral em 28 de setembro de 2026. O Provider Voice Arena da Artificial Analysis já tem o Eleven v4 na posição 1 com um Elo de 1.319 em 1.674 aparições, a um preço de tabela de US$ 80,00 por milhão de caracteres. A classificação é a manchete. A sintaxe de direção e o clone de dez segundos são a parte que muda o que você precisa construir.

A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.

Dois modelos, um lançamento, funções diferentes

A ElevenLabs lançou dois endpoints em 28 de setembro de 2026, e não são o mesmo produto com um seletor de velocidade. ElevenLabs Eleven v4 é o modelo expressivo: mais de 90 idiomas, limite de 10.000 caracteres por solicitação, suporte aprimorado ao Alfabeto Fonético Internacional para pronúncias personalizadas e diálogo com vários falantes que, segundo a empresa, preserva a identidade dos falantes ao longo de uma cena. ElevenLabs Eleven v4 Turbo mantém os mais de 90 idiomas e o limite de 10.000 caracteres, mas é ajustado para agentes — o anúncio cita uma latência mediana de inferência de cerca de 100 ms e um tempo mediano até a primeira fala de cerca de 150 ms, medidos pela ElevenLabs em setembro de 2026.

A screenshot of the ElevenLabs models documentation page, flagship Text to Speech section. Eleven v4 is described as the most emotive, high quality speech synthesis model, with exceptional voice cloning capabilities, 90+ languages supported, a 10,000 character limit and support for natural multi-speaker dialogue. Eleven v4 Turbo is described as the most emotive, real-time speech synthesis model, with ultra-low latency (median inference latency of ~100ms), exceptional voice cloning capabilities, 90+ languages supported and audio tags for fine-grained control. Below them the page lists Eleven v3, Eleven v3 Conversational, Eleven Multilingual v2 and Eleven Flash v2.5.

A pergunta reativa — o modelo principal é rápido o suficiente para um agente telefônico — não tem resposta publicada. A ElevenLabs fornece números de latência para o Turbo, não para o próprio Eleven v4, e os dois são endpoints distintos, e não um único modelo sob dois nomes. Se o orçamento do seu agente for de 200 ms para o primeiro áudio, o Turbo é o endpoint na documentação e o modelo principal não é.

As tags são uma interface real, e uma dependência real.

Tags de áudio inline não são novidade para a síntese de fala, mas a mudança útil aqui é a precisão da adesão. O anúncio afirma que o Eleven v4 segue tags de áudio e prompts de direção em linguagem natural com mais precisão do que modelos anteriores, e que é assim que você comanda uma risada, um sussurro ou uma locução com um sotaque específico sem editar o áudio depois.

Seguem-se três consequências práticas, e elas importam mais do que os vídeos de demonstração:

• Seu roteiro se torna um artefato com template, não uma string. Uma tag é um token no seu pipeline de conteúdo: ela precisa ser escapada se texto não confiável algum dia passar por ela, e precisa sobreviver ao seu CMS, à sua camada de tradução e à sua revisão de diff. Um tradutor que omite [sussurra] alterou uma performance, silenciosamente.

• A adesão a tags é uma alegação do fornecedor com uma versão associada. A alegação de que esta geração segue tags melhor do que a anterior é da própria ElevenLabs, testada pela ElevenLabs, e não se manterá de forma idêntica entre idiomas. Valide com seus próprios scripts e seus próprios locales antes de construir um guia de estilo com base nisso.

• Etiquetas de efeitos sonoros como [chuva leve] ou [telefone vibrando] transferem um pouco do trabalho da pós-produção de áudio para o prompt de texto. Trata-se de um deslocamento de custo que vale a pena medir: se uma etiqueta substitui uma passagem de foley, ela é barata; se não substitui nada e apenas adiciona variação, é um novo modo de falha no seu controle de qualidade.

Dez segundos é o número que muda o onboarding

O Instant Voice Cloning nesta versão captura uma voz com alta fidelidade a partir de dez segundos de áudio, com o nível de clonagem profissional ainda disponível acima dele. Dez segundos é curto o suficiente para eliminar uma etapa do fluxo de trabalho: a captura de consentimento, o upload da amostra e a primeira síntese podem acontecer numa única sessão, em um celular, sem um estúdio.

O problema do consentimento não diminui com a amostra. Ele cresce, porque o critério para produzir um clone convincente caiu para um clipe que qualquer pessoa pode gravar. Se você está clonando vozes que não são suas, a questão de conformidade agora é inteiramente sua para responder antes da chamada à API — o modelo fará o que você pedir. Trate o número de dez segundos como um limiar operacional, não como uma autorização.

Quanto custa enquanto a janela está aberta

A ElevenLabs reajustou os preços no lançamento, e a tarifa promocional é a que está na página hoje. Na tabela de preços da API, o Eleven v4 está listado a $0.022 por 1.000 caracteres contra um preço de tabela declarado de $0.08, e o Eleven v4 Turbo a $0.011 contra $0.04. Ambos carregam o mesmo rótulo: 72% de desconto até 12 de outubro. A mesma página define o preço do antigo carro-chefe, o Eleven v3, em $0.08 por 1.000 caracteres.

• Preço no quadro da arena, por milhão de caracteres — Eleven v4 $80,00, o mais alto entre os dez primeiros daquele quadro.

• Tabela de preços do fornecedor, por mil caracteres — $0,022 até 12 de outubro, depois $0,08.

• O que isso significa na prática — um mês com uso intensivo de scripts, de cinco milhões de caracteres, custa US$ 110 durante a janela e US$ 400 depois dela, no mesmo endpoint com o mesmo código.

A screenshot of the ElevenLabs API pricing page filtered to ElevenAPI. Four Text to Speech columns are shown: v4 at $0.022 with $0.08 struck through, v4 Turbo at $0.011 with $0.04 struck through, both carrying a '72% off until Oct 12' badge, Eleven v3 at $0.08 and Eleven v3 Conversational at $0.04 per 1K characters. The v4 column lists audio tags for fine-grained control and 90+ languages supported; the Turbo column lists ultra-low latency (~100ms) and v4 expressiveness tuned for latency; the v3 column lists 70+ languages and a 5,000 character limit. The cost calculator below prices a Starter plan at $6 per month with 272.727k characters of TTS (v4) included.

Quem está orçando o Q1 com base no número que está na página hoje está orçando com base em um número que expira em duas semanas. Use $0.08.

Onde um router conquista o seu lugar num lançamento como este

A OrcaRouter não hospeda a ElevenLabs, portanto não há nada neste lançamento para chamar através de nós, e não vamos dar a entender o contrário — o lugar para chamar o Eleven v4 é a própria API da ElevenLabs. Aquilo para que uma única chave é genuinamente útil nas duas semanas seguintes a um lançamento é a comparação. Se você está decidindo se o novo topo de linha supera o que você já executa, você quer fazer o A/B dos dois nos seus próprios scripts, em vez de em um ranking, e fazer isso entre dois fornecedores significa duas contas, duas relações de cobrança e dois caminhos de integração antes de você ter uma resposta.

É esse o caso que tratamos: uma chave de API para mais de 200 modelos com preços de lista dos provedores repassados a 0% de markup, portanto, uma alteração de preço do fornecedor — incluindo uma janela promocional com data de validade — está ativa do nosso lado no mesmo dia, em vez de no próximo ciclo de faturação. Quando um caminho de voz é voltado para o cliente, failover automático move o tráfego para um upstream saudável quando um endpoint se degrada, que é como você testa um modelo totalmente novo sem apostar um lançamento nele.

O que testar primeiro, e o que ignorar

Três verificações lhe dirão mais do que qualquer ranking. Primeiro, passe seu roteiro realista mais longo pelo limite de 10.000 caracteres e veja onde as emendas caem — o limite é por solicitação, e o diálogo com vários falantes é o recurso com maior probabilidade de ser dividido por ele. Segundo, coloque cinco das suas próprias frases com tags tanto no v4 quanto no v4 Turbo e ouça se há desvio de aderência entre o endpoint expressivo e o de baixa latência; são modelos separados, e uma tag que funciona em um pode não funcionar de forma idêntica no outro. Terceiro, precifique seu volume mensal real de caracteres a $0.08 em vez de $0.022, porque é esse o número com que seu próximo trimestre vai operar.

O valor de ~75% de preferência cega no anúncio é uma medição do fornecedor, e não vamos transformá-lo em outra coisa. O número independente neste lançamento é o que está no ranking: primeiro lugar com 1.319 Elo em 1.674 aparições, e um intervalo de aproximadamente ±19 pontos em torno dele. Esse é um resultado forte em um ranking de verdade. Não é uma especificação, e não vai lhe dizer se a sua sintaxe de tags sobrevive a uma passagem de tradução.