![Um cartão hero gerado para o ElevenLabs Eleven v4 com dois painéis: à esquerda, um bloco de script exibindo tags de áudio inline como [laughs], [whispers] e [said angrily in French accent]; à direita, um painel que exibe classificação 1, Elo 1.319, $80,00 por 1M de caracteres e 1.674 aparições no Provider Voice Arena da Artificial Analysis, com um rodapé que diz 'Classificação do Provider Voice, Elo e preço segundo a Artificial Analysis, setembro de 2026; sintaxe de tags e latência documentadas pelo fornecedor.' O logotipo da OrcaRouter fica no canto inferior direito.](https://cms.orcarouter.ai/api/media/file/1-1462.png)
Tags de Áudio e Clones de Dez Segundos do Eleven v4: O Que Muda no Seu Pipeline
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 982 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 197 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
A coisa mais importante sobre ElevenLabs Eleven v4 não é o seu Elo. É que o modelo lê direções escritas no roteiro — [ri], [sussurra], [suspira], [dito com raiva em sotaque francês], até mesmo [chuva leve] — e que ElevenLabs Eleven v4 Turbo, o irmão de baixa latência lançado no mesmo dia, segue as mesmas tags em um tempo mediano até a primeira fala que o fornecedor estima em cerca de 150 ms. Ambos entraram em disponibilidade geral em 28 de setembro de 2026. O Provider Voice Arena da Artificial Analysis já tem o Eleven v4 na posição 1 com um Elo de 1.319 em 1.674 aparições, a um preço de tabela de US$ 80,00 por milhão de caracteres. A classificação é a manchete. A sintaxe de direção e o clone de dez segundos são a parte que muda o que você precisa construir.
![A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.](https://cms.orcarouter.ai/api/media/file/2-1397.png)
Dois modelos, um lançamento, funções diferentes
A ElevenLabs lançou dois endpoints em 28 de setembro de 2026, e não são o mesmo produto com um seletor de velocidade. ElevenLabs Eleven v4 é o modelo expressivo: mais de 90 idiomas, limite de 10.000 caracteres por solicitação, suporte aprimorado ao Alfabeto Fonético Internacional para pronúncias personalizadas e diálogo com vários falantes que, segundo a empresa, preserva a identidade dos falantes ao longo de uma cena. ElevenLabs Eleven v4 Turbo mantém os mais de 90 idiomas e o limite de 10.000 caracteres, mas é ajustado para agentes — o anúncio cita uma latência mediana de inferência de cerca de 100 ms e um tempo mediano até a primeira fala de cerca de 150 ms, medidos pela ElevenLabs em setembro de 2026.

A pergunta reativa — o modelo principal é rápido o suficiente para um agente telefônico — não tem resposta publicada. A ElevenLabs fornece números de latência para o Turbo, não para o próprio Eleven v4, e os dois são endpoints distintos, e não um único modelo sob dois nomes. Se o orçamento do seu agente for de 200 ms para o primeiro áudio, o Turbo é o endpoint na documentação e o modelo principal não é.
As tags são uma interface real, e uma dependência real.
Tags de áudio inline não são novidade para a síntese de fala, mas a mudança útil aqui é a precisão da adesão. O anúncio afirma que o Eleven v4 segue tags de áudio e prompts de direção em linguagem natural com mais precisão do que modelos anteriores, e que é assim que você comanda uma risada, um sussurro ou uma locução com um sotaque específico sem editar o áudio depois.
Seguem-se três consequências práticas, e elas importam mais do que os vídeos de demonstração:
• Seu roteiro se torna um artefato com template, não uma string. Uma tag é um token no seu pipeline de conteúdo: ela precisa ser escapada se texto não confiável algum dia passar por ela, e precisa sobreviver ao seu CMS, à sua camada de tradução e à sua revisão de diff. Um tradutor que omite [sussurra] alterou uma performance, silenciosamente.
• A adesão a tags é uma alegação do fornecedor com uma versão associada. A alegação de que esta geração segue tags melhor do que a anterior é da própria ElevenLabs, testada pela ElevenLabs, e não se manterá de forma idêntica entre idiomas. Valide com seus próprios scripts e seus próprios locales antes de construir um guia de estilo com base nisso.
• Etiquetas de efeitos sonoros como [chuva leve] ou [telefone vibrando] transferem um pouco do trabalho da pós-produção de áudio para o prompt de texto. Trata-se de um deslocamento de custo que vale a pena medir: se uma etiqueta substitui uma passagem de foley, ela é barata; se não substitui nada e apenas adiciona variação, é um novo modo de falha no seu controle de qualidade.
Dez segundos é o número que muda o onboarding
O Instant Voice Cloning nesta versão captura uma voz com alta fidelidade a partir de dez segundos de áudio, com o nível de clonagem profissional ainda disponível acima dele. Dez segundos é curto o suficiente para eliminar uma etapa do fluxo de trabalho: a captura de consentimento, o upload da amostra e a primeira síntese podem acontecer numa única sessão, em um celular, sem um estúdio.
O problema do consentimento não diminui com a amostra. Ele cresce, porque o critério para produzir um clone convincente caiu para um clipe que qualquer pessoa pode gravar. Se você está clonando vozes que não são suas, a questão de conformidade agora é inteiramente sua para responder antes da chamada à API — o modelo fará o que você pedir. Trate o número de dez segundos como um limiar operacional, não como uma autorização.
Quanto custa enquanto a janela está aberta
A ElevenLabs reajustou os preços no lançamento, e a tarifa promocional é a que está na página hoje. Na tabela de preços da API, o Eleven v4 está listado a $0.022 por 1.000 caracteres contra um preço de tabela declarado de $0.08, e o Eleven v4 Turbo a $0.011 contra $0.04. Ambos carregam o mesmo rótulo: 72% de desconto até 12 de outubro. A mesma página define o preço do antigo carro-chefe, o Eleven v3, em $0.08 por 1.000 caracteres.
• Preço no quadro da arena, por milhão de caracteres — Eleven v4 $80,00, o mais alto entre os dez primeiros daquele quadro.
• Tabela de preços do fornecedor, por mil caracteres — $0,022 até 12 de outubro, depois $0,08.
• O que isso significa na prática — um mês com uso intensivo de scripts, de cinco milhões de caracteres, custa US$ 110 durante a janela e US$ 400 depois dela, no mesmo endpoint com o mesmo código.

Quem está orçando o Q1 com base no número que está na página hoje está orçando com base em um número que expira em duas semanas. Use $0.08.
Onde um router conquista o seu lugar num lançamento como este
A OrcaRouter não hospeda a ElevenLabs, portanto não há nada neste lançamento para chamar através de nós, e não vamos dar a entender o contrário — o lugar para chamar o Eleven v4 é a própria API da ElevenLabs. Aquilo para que uma única chave é genuinamente útil nas duas semanas seguintes a um lançamento é a comparação. Se você está decidindo se o novo topo de linha supera o que você já executa, você quer fazer o A/B dos dois nos seus próprios scripts, em vez de em um ranking, e fazer isso entre dois fornecedores significa duas contas, duas relações de cobrança e dois caminhos de integração antes de você ter uma resposta.
É esse o caso que tratamos: uma chave de API para mais de 200 modelos com preços de lista dos provedores repassados a 0% de markup, portanto, uma alteração de preço do fornecedor — incluindo uma janela promocional com data de validade — está ativa do nosso lado no mesmo dia, em vez de no próximo ciclo de faturação. Quando um caminho de voz é voltado para o cliente, failover automático move o tráfego para um upstream saudável quando um endpoint se degrada, que é como você testa um modelo totalmente novo sem apostar um lançamento nele.
O que testar primeiro, e o que ignorar
Três verificações lhe dirão mais do que qualquer ranking. Primeiro, passe seu roteiro realista mais longo pelo limite de 10.000 caracteres e veja onde as emendas caem — o limite é por solicitação, e o diálogo com vários falantes é o recurso com maior probabilidade de ser dividido por ele. Segundo, coloque cinco das suas próprias frases com tags tanto no v4 quanto no v4 Turbo e ouça se há desvio de aderência entre o endpoint expressivo e o de baixa latência; são modelos separados, e uma tag que funciona em um pode não funcionar de forma idêntica no outro. Terceiro, precifique seu volume mensal real de caracteres a $0.08 em vez de $0.022, porque é esse o número com que seu próximo trimestre vai operar.
O valor de ~75% de preferência cega no anúncio é uma medição do fornecedor, e não vamos transformá-lo em outra coisa. O número independente neste lançamento é o que está no ranking: primeiro lugar com 1.319 Elo em 1.674 aparições, e um intervalo de aproximadamente ±19 pontos em torno dele. Esse é um resultado forte em um ranking de verdade. Não é uma especificação, e não vai lhe dizer se a sua sintaxe de tags sobrevive a uma passagem de tradução.
