Um cartão de destaque para 'ElevenLabs Eleven v4 vs Cartesia Sonic 3.6' com dois cartões de pontuação: ElevenLabs Eleven v4 com Elo 1.319, classificação 1 e $80,00 por 1M de caracteres; Cartesia Sonic 3.6 com Elo 1.276, classificação 2 e $49,00 por 1M de caracteres; com a legenda '43 pontos de Elo contra uma voz 39% mais barata'. Rodapé: 'Provider Voice Arena, segundo a Artificial Analysis, setembro de 2026.' O logotipo da OrcaRouter fica no canto inferior direito.
Guides & Insights

Eleven v4 vs Cartesia Sonic 3.6: Uma diferença de 43 pontos no Elo contra uma voz 39% mais barata

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

ElevenLabs Eleven v4 fica 43 pontos Elo acima de Cartesia Sonic 3.6 na Provider Voice Arena da Artificial Analysis — 1.319 a 1.276 — e também vence o ranking Controlled Voice, ficando em segundo, contra o quarto lugar do Sonic 3.6. Ele perde no preço por uma margem ampla na direção oposta: US$ 80,00 por milhão de caracteres contra US$ 49,00, e cerca de nove vezes a tarifa por caractere nas tabelas de preços dos próprios fornecedores durante a janela de lançamento. Este é o raro confronto em que o placar é claro e a decisão ainda não é, porque os dois modelos não estão realmente competindo pelo mesmo trabalho.

A two-column scoreboard for ElevenLabs Eleven v4 and Cartesia Sonic 3.6. Eleven v4: Provider Voice rank 1 Elo 1,319; Controlled Voice rank 2 Elo 1,157; $80.00 per 1M chars; $0.022 per 1K until Oct 12; 90-plus languages; latency not stated for v4. Sonic 3.6: Provider Voice rank 2 Elo 1,276; Controlled Voice rank 4 Elo 1,138; $49.00 per 1M chars; $0.049 per 1K; 44 languages; sub-90 ms. Footer: 'Elo and board prices per Artificial Analysis; rate cards and specs vendor-reported.'

O que cada modelo é, em um parágrafo cada

O ElevenLabs Eleven v4 foi lançado em 28 de setembro como o modelo de síntese de fala carro-chefe da empresa, ao lado do Eleven v4 Turbo. A documentação informa que ele oferece mais de 90 idiomas, um limite de entrada de 10.000 caracteres por solicitação, diálogo com vários locutores com identidade de locutor estável, suporte aprimorado a fonemas IPA e diretivas inline que permitem escrever a interpretação no roteiro. A clonagem de voz parte de dez segundos de áudio para clones instantâneos, com um nível profissional acima disso.

Cartesia Sonic 3.6 é o lançamento atual de uma linha de modelos que a Cartesia posiciona com foco em velocidade e naturalidade. Sua própria página de produto o descreve como o modelo de texto para fala mais rápido e mais natural, afirma latência inferior a 90 ms, operação nativamente multilíngue em 44 idiomas, clonagem de voz a partir de dez segundos de áudio, dicionários de pronúncia personalizados e um conjunto de conformidade que abrange HIPAA, SOC 2 Type 2, GDPR e PCI. Ambos os fornecedores publicam números de latência para seus próprios modelos; nenhum dos conjuntos é verificado de forma independente, e eles não são medidos da mesma forma.

O placar, dimensão por dimensão

• Preferência cega, com as próprias vozes de cada fornecedor — Eleven v4 em 1º lugar, Elo 1.319 vs. Sonic 3.6 em 2º lugar, Elo 1.276. Uma diferença de 43 pontos.

• Preferência cega, vozes clonadas emparelhadas — Eleven v4 rank 2, Elo 1.157 vs Sonic 3.6 rank 4, Elo 1.138. Uma diferença de 19 pontos, menor que a primeira.

• Normalização de preços da Arena, por milhão de caracteres — Eleven v4 $80,00 vs Sonic 3.6 $49,00. O Sonic é 39% mais barato no denominador comum do ranking.

• Tabela de tarifas do fornecedor, por mil caracteres — Eleven v4 $0,022 promocional, $0,08 após 12 de outubro vs. Sonic 3.6 $0,049. O Sonic é 39% mais barato assim que a promoção terminar.

• Cobertura de idiomas, documentada pelo fornecedor — Eleven v4, mais de 90 vs Sonic 3.6, 44. Aproximadamente o dobro.

• Limite de entrada por solicitação — Eleven v4 10.000 caracteres vs Sonic 3.6 não informado em sua página de produto.

• Latência, segundo o fornecedor — Eleven v4 Turbo cerca de 150 ms de mediana até a primeira fala vs. Sonic 3.6 abaixo de 90 ms. Novamente, testes diferentes.

• Clonagem de voz — ambos a partir de dez segundos de áudio, ambos com um nível profissional superior.

• Controles de enumeração — Eleven v4 documenta entrada de fonemas IPA e um nível profissional de clonagem; Sonic 3.6 documenta dicionários de pronúncia personalizados.

• Postura de conformidade — Sonic 3.6 declara HIPAA, SOC 2 Type 2, GDPR e PCI. A ElevenLabs declara sua conformidade separadamente da página do modelo e não coloca uma lista correspondente ao lado do v4.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, Cartesia Sonic 3.6 second at Elo 1,276 with $49.0, and Google Gemini 3.8 Flash TTS third at Elo 1,267 with $16.5, each with its sample count, confidence interval, arena voice count and release month.

Duas dessas linhas são as que decidem projetos reais. A diferença de Elo é de 43 pontos no quadro de vozes de fornecedores e de 19 no quadro de vozes clonadas — a distância da linha Sonic diminui em mais da metade quando os falantes são mantidos constantes. Essa é a assinatura de um modelo cujo ajuste é competitivo e cujo elenco de vozes padrão não é, e isso mostra que o problema da Sonic neste confronto é de apresentação, e não de qualidade de síntese.

Por que a diferença de preço é menor do que parece

A comparação de tarifas em destaque é enganosa em ambas as direções. Os $0,022 por mil caracteres do Eleven v4 são um valor promocional com data de término em 12 de outubro; o número que sobrevive a essa janela é $0,08, mais de 60% acima da tabela de preços do Sonic 3.6. Mas a normalização da arena não se importa com a promoção: ela precifica os modelos pelos seus preços de lista e chega a $80,00 contra $49,00, que é a comparação que ainda continuará verdadeira em novembro.

Há uma segunda complicação. A Cartesia não publica uma tarifa por caractere na página do produto, então o valor de $0.049 vem da normalização da arena, e não do fornecedor, e as duas medições podem não coincidir exatamente — a normalização faz suposições sobre como um provedor cobra. Considere a ordenação como confiável e as porcentagens exatas como aproximadas.

Um mês de uso com cinco milhões de caracteres: o Eleven v4 na tarifa promocional custa US$ 110, e US$ 400 depois de 12 de outubro. O Sonic 3.6 custa US$ 245. Assim, nas próximas duas semanas, o Eleven v4 custa menos da metade do custo do Sonic e, depois disso, custa 63% mais. Quem escrever uma comparação de compras hoje e publicá-la no mês que vem vai chegar à conclusão oposta, a menos que diga qual tarifa usou.

O trecho em que Sonic 3.6 é a resposta correta

Existem cargas de trabalho de voz em produção para as quais os placares da arena não medem o que realmente importa, e o Sonic 3.6 foi feito exatamente para elas.

Agentes conversacionais em tempo real são o caso mais claro. Uma latência abaixo de 90 ms não é um número de marketing em um agente telefônico; é a diferença entre uma interrupção parecer bem tratada e parecer que a chamada caiu, e a ElevenLabs não publica nenhum número equivalente para o próprio Eleven v4 — apenas para o nível Turbo, com mediana de cerca de 150 ms até a primeira fala. Se o orçamento de socket do seu agente estiver apertado, os 43 pontos de Elo podem valer menos para você do que os milissegundos, e seus próprios testes de barge-in vão definir isso mais rápido do que qualquer ranking.

A implantação regulamentada é o segundo ponto. A Cartesia declara HIPAA, SOC 2 Type 2, GDPR e PCI na página do produto. Uma lista de conformidade não é um Elo e não pode ser substituída por um; se um revisor de saúde ou de pagamentos estiver no seu caminho de lançamento, essa linha do placar pesa mais que as outras nove.

A screenshot of Cartesia's Sonic product page, captured in English, headed 'Sonic: The fastest and most natural text to speech model' with the claim 'Ranked #1 for naturalness, sub-90ms latency, and natively multilingual across 44 languages', a 'Try Sonic-3.6' button, an 'American English / Jacqueline' voice picker over a support-call sample, a 'Ranked #1 in Speech Arena leaderboard & Speech to Text leaderboard by Artificial Analysis' panel, and a 'Built for Voice Agents' tab strip spanning Naturalness, Reliability, Speed, Scalability, Multilingual, Consistency and Cost.

A pronúncia determinística é a terceira, e é mais sutil. A entrada documentada de fonemas IPA do Eleven v4 é um ponto forte, mas os dicionários de pronúncia personalizados do Sonic 3.6 são o fluxo de trabalho que equipes com grandes vocabulários de nomes de produtos tendem a já ter construído. Portar um dicionário dá trabalho de verdade; o modelo que consome o artefato que você possui tem uma vantagem inicial.

Onde o Eleven v4 é simplesmente o melhor modelo

Dito tudo isso, os rankings medem algo, e o Eleven v4 venceu ambos. No Provider Voice, ele está 43 pontos à frente do Sonic 3.6, com 1.674 amostras por trás da estimativa, e o antigo carro-chefe — ElevenLabs Eleven v3, com 1.169 — fica 107 pontos atrás do Sonic 3.6, o que significa que a ElevenLabs fechou uma lacuna real em uma geração em vez de defender uma liderança.

A contagem de idiomas é a segunda vitória inequívoca. 90 e tantos contra 44 é aproximadamente o dobro e, para um produto que vai além do inglês e de um punhado de línguas europeias, isso é uma questão de cobertura, não de qualidade — o Sonic 3.6 pode não ter voz alguma para alguns dos seus locales. E o tratamento de diálogos com vários falantes mais as diretivas de locução inline são uma diferença real de capacidade: escrever uma risada no roteiro é um fluxo de trabalho que o Sonic 3.6 não documenta, e reproduzir esse efeito num modelo sem isso significa pós-processamento ou uma segunda tomada, o que custa mais do que a diferença de Elo sugere.

Executando qualquer um dos dois, e a parte com a qual não podemos ajudar.

O OrcaRouter não hospeda nenhum desses modelos. ElevenLabs e Cartesia não estão no nosso catálogo, então nada nesta comparação pode ser chamado através de nós, e a resposta honesta para "como faço para obter isso no OrcaRouter" é que você não pode — você vai ao fornecedor. O que nós tratamos é o caso em que uma stack de voz acaba abrangendo vários provedores, em vez de um só: uma única chave de API para mais de 200 modelos, com os preços de lista dos provedores repassados com 0% de markup para que uma mudança de preço do fornecedor esteja ativa do nosso lado no mesmo dia em que entrar em vigor. Para uma decisão que depende de você pagar US$ 110 ou US$ 400 pelos caracteres do mesmo mês, esse timing não é pouca coisa.

Quando um caminho de voz é voltado ao cliente e não pode cair, o failover automático move o tráfego para um upstream saudável quando um deles se degrada. Esse é o padrão que faz valer a pena aproveitar uma janela promocional de duas semanas: você pode apontar a produção para o modelo mais barato por duas semanas sem reescrever a integração, e voltar quando a tarifa voltar ao normal.

Quem deve mudar e quem deve esperar

Mude para o Eleven v4 se o seu produto for avaliado pela forma como soa, se você lançar em mais de duas dúzias de idiomas, ou se os seus usuários ouvirem a voz que o fornecedor escolheu para eles — esse último grupo é exatamente quem o painel Provider Voice representa, e a lacuna aí é a maior de qualquer linha.

Fique no Sonic 3.6 se você estiver rodando conversas em tempo real dentro de um orçamento de latência, se um revisor de conformidade aprovar sua stack, ou se você tiver um dicionário de pronúncia que não pode se dar ao luxo de reconstruir. Nessas três linhas, o Sonic não está atrás; é a única opção com uma resposta publicada.

Espere, em qualquer dos casos, se a sua decisão depende do preço. Daqui a duas semanas, a tabela de preços do Eleven v4 muda por um fator de quase quatro, e a do Sonic 3.6 não, e uma comparação escrita hoje parecerá errada em meados de outubro. A ordenação do Elo ainda se manterá. O dinheiro, não.