
Eleven v4 vs OpenAI TTS-1 HD: Dois anos de deriva em um único quadro
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 982 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 197 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
O OpenAI TTS-1 HD tem data de lançamento em 6 de novembro de 2023. ElevenLabs Eleven v4tem a sua em 28 de setembro de 2026. No Provider Voice Arena da Artificial Analysis, essas duas datas estão separadas por 216 pontos de Elo — o TTS-1 HD ocupa a 35ª posição, com 1.104 em 3.500 aparições a US$ 30,00 por milhão de caracteres, enquanto o Eleven v4 ocupa a 1ª posição, com 1.319 em 1.674 aparições a US$ 80,00. Ambos os números trazem intervalos estreitos, ±12 e ±19, de modo que a ordenação não está em dúvida. A pergunta interessante não é qual modelo é melhor, porque isso já estava decidido antes de este artigo existir. É por que um endpoint de 2023 ainda tem 3.500 aparições em um quadro no qual um modelo de cinco dias tem 1.674, e o que isso lhe diz sobre a migração que estão pedindo que você considere.
O placar, e a única linha em que a OpenAI vence
Cinco dimensões decidem este confronto, e vale a pena ler os dois lados de cada uma lado a lado.
• Preferência cega, vozes de fornecedores — Eleven v4 em 1º lugar, Elo 1.319 (±19, 1.674 aparições) vs TTS-1 HD em 35º lugar, Elo 1.104 (±12, 3.500 aparições). Uma diferença de 216 pontos que sobrevive às barras de erro.
• Preço de tabela, por milhão de caracteres — Eleven v4 US$ 80,00 vs TTS-1 HD US$ 30,00. A OpenAI é 62% mais barata na tabela, e ainda mais barata durante a promoção da ElevenLabs.
• Vozes — O Eleven v4 documenta a clonagem instantânea a partir de dez segundos de áudio, além de um nível profissional de clonagem; o TTS-1 HD traz um conjunto fixo de vozes, nove para a família tts-1 na própria documentação da OpenAI (alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer) e sem clonagem.
• Direção de performance — o Eleven v4 documenta tags de áudio inline e prompts de direção em linguagem natural; o TTS-1 HD aceita texto simples, e o parâmetro steerable-instructions da OpenAI pertence ao seu modelo TTS mais recente, e não a este.
• Data de lançamento — Eleven v4, 28 de setembro de 2026 vs. TTS-1 HD, 6 de novembro de 2023.

O preço é a linha em que a OpenAI vence, e é uma vitória maior do que parece, porque a promoção da ElevenLabs é temporária. A US$ 0,022 por 1.000 caracteres, o Eleven v4 custa US$ 22 por milhão até 12 de outubro — pura e simplesmente mais barato que o TTS-1 HD. Depois de 12 de outubro, custa US$ 80 por milhão contra os US$ 30 da OpenAI, e permanece assim.
Por que um modelo de 2023 tem o dobro da contagem de amostras
Esse número é a coisa mais útil neste placar, e é fácil interpretá-lo mal. As aparições na Arena se acumulam com o tráfego, e o tráfego se acumula com integrações que foram criadas uma vez e nunca revisadas. O TTS-1 HD tem 3.500 aparições atrás de si porque tem sido o endpoint de fala padrão para toda equipe que já chama a OpenAI para chat completions: mesma chave, mesmo SDK, mesma linha de cobrança, mais uma chamada. Nada nessa frase tem a ver com a qualidade da voz, e o déficit de 216 pontos não o impediu.

É assim que a dívida de migração se parece em um quadro de classificação. Não é um sinal de que o modelo mais antigo é competitivo; é um sinal de que trocar custa algo, e de que um grande número de equipes decidiu que esse algo vale mais do que 216 pontos Elo. Essa é uma conclusão legítima para uma leitura de notificações e ruim para um produto em que a voz é o que o cliente ouve.
A razão para permanecer no TTS-1 HD
Três coisas o mantêm defensável, e nenhuma delas é qualidade.
O determinismo vem em primeiro lugar. Um conjunto fixo de nove vozes produz uma saída consistente entre versões de uma forma que um pipeline de clonagem não produz, e uma saída consistente é o que se quer num caminho utilitário onde ninguém está à espera de arte. Não há clone que possa sofrer deriva, nem amostra de referência para regravar, nem artefacto de consentimento para manter.
O custo de integração é o segundo, e é aquele que a arena não consegue precificar. Adicionar um segundo fornecedor de fala significa uma nova conta, uma nova tabela de tarifas, um novo modo de falha e mais uma coisa para monitorizar. Para uma equipa que já está dentro do stack da OpenAI, isso é tempo real de engenharia, e 216 pontos Elo não pagam por isso.
O volume de baixo custo é o terceiro. A $30 por milhão de caracteres, a fatura mensal inteira de voz de um produto pequeno é um erro de arredondamento, e não há nada a otimizar. Este é o regime em que a resposta barata e a resposta preguiçosa são a mesma resposta, e isso é ótimo.
O argumento a favor da mudança, e o contra-argumento a ele
Migre quando a voz for voltada ao cliente. Clonagem em dez segundos, direcionamento de performance inline, mais de 90 idiomas e um limite de entrada de 10.000 caracteres por requisição não são diferenças cosméticas em relação a um conjunto fixo de nove vozes de 2023, e a diferença de 216 pontos da arena é a versão comprimida de uma lacuna de capacidade muito maior. Se você está construindo um agente, um assistente de marca ou qualquer coisa em que um ouvinte forme uma opinião sobre seu produto já na primeira frase, o endpoint mais antigo é o padrão errado.
O contra-argumento é que "mudar para o Eleven v4" não é a única opção. Desde então, a OpenAI lançou um modelo TTS mais recente com um parâmetro de instruções controlável, e o Gemini 3.8 Flash TTS, do Google, ocupa o terceiro lugar no mesmo ranking, com 1.267 e um valor normalizado de US$ 16,49 por milhão — um ganho de 163 pontos em relação ao TTS-1 HD, a aproximadamente metade do preço no ranking. Se a sua restrição é permanecer no seu fornecedor atual, essa é a atualização mais barata. Se for permanecer na sua nuvem atual, é a única.
Onde o OrcaRouter realmente se posiciona nesta comparação
This is the rare article in this series where we host one of the two models, so let us be precise about which. openai/tts-1-hd is live in the OrcaRouter catalogue at OpenAI's list rate passed through at 0% markup: $30 per million, model ID openai/tts-1-hd, served on the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1 with a POST /v1/audio/speech route and the voice, speed and response_format parameters. Our own page reports a median latency of 2,461 ms and a 95th percentile of 4,769 ms, which is the honest reason not to put it in front of a live conversation — that is a batch-shaped number, not an agent-shaped one.

O ElevenLabs Eleven v4 não está no nosso catálogo, e não há nada a chamar através de nós: ele é acessado pela própria API da ElevenLabs, com a tabela de preços da própria ElevenLabs. O que uma única chave muda é a forma da migração. Se o motivo de você não ter testado o novo líder é que isso significa uma segunda integração de fornecedor, o custo de descobrir é uma única chamada de API usando uma chave que você já possui, em vez de um ciclo de compras. Os preços de lista dos fornecedores são repassados com 0% de margem, então um reajuste de preço de um fornecedor — incluindo a reversão da ElevenLabs em 12 de outubro — fica ativo do nosso lado no dia em que acontece, e failover automático significa que um caminho de fala em avaliação não precisa se tornar uma dependência de produção enquanto você decide.
A aritmética que deveria resolver isso
Cinco milhões de caracteres por mês, o que corresponde a um produto de médio porte e aproximadamente 100 horas de fala. O TTS-1 HD custa US$ 150. O Eleven v4 custa US$ 110 durante a janela promocional e US$ 400 após 12 de outubro. O Gemini 3.8 Flash TTS, segundo a normalização do conselho, custa cerca de US$ 82,50.
Repita aqueles quatro números e a decisão divide-se de forma clara. Durante a janela, o modelo mais recente e mais bem classificado do ranking é também o segundo mais barato — mais barato do que o endpoint de 2023, que ele supera em 216 pontos de Elo. Depois de 12 de outubro, é a opção mais cara da lista, por um fator de quase cinco. Nada nos modelos muda nessa data; apenas a fatura muda.
Então: se você estiver avaliando este mês, avalie com o preço promocional e inclua o preço de tabela no caso de negócio. Se você estiver lançando no próximo trimestre, planeje com base em $0,08 por 1.000 caracteres e trate qualquer comparação que cite $0,022 como um documento com data de validade impressa nele. E se você estiver no TTS-1 HD e o motivo honesto for inércia de integração, o primeiro passo útil não é um plano de migração — é um único teste A/B nos seus próprios scripts, com preço pela tarifa que você realmente estará pagando em novembro.
