Um cartão hero gerado para ElevenLabs Eleven v4 vs VoxCPM2 com dois painéis: ElevenLabs Eleven v4 como endpoint hospedado com Elo 1.319, posição 1 e US$ 80,00 por 1 milhão de caracteres; VoxCPM2 como checkpoint Apache-2.0 com 2B parâmetros, saída de 48 kHz e sem linha na arena. Rodapé: "Posição e preço do Eleven v4 segundo a Artificial Analysis, setembro de 2026; especificações do VoxCPM2 segundo o model card da OpenBMB." O logotipo da OrcaRouter fica no canto inferior direito.
Guides & Insights

Eleven v4 vs VoxCPM2: Um modelo ranqueado contra um checkpoint que você não consegue alugar

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O fato mais útil neste confronto é uma linha que não existe. ElevenLabs Eleven v4 ocupa o 1º lugar no Provider Voice Arena da Artificial Analysis, com um Elo de 1.319 em 1.674 aparições, a US$ 80,00 por milhão de caracteres. VoxCPM2, o checkpoint da OpenBMB lançado em abril de 2026, não aparece em lugar nenhum em nenhum dos dois rankings de fala — nem classificado, nem não classificado, nem como entrada de prévia. Isso não é um veredito sobre a qualidade. Significa que, qualquer que seja o número que você esperava comparar com 1.319, ninguém o produziu, e a comparação tem de ser feita com base em algo que não seja preferência. O que resta é propriedade, ajuste fino e uma questão de licenciamento que um endpoint hospedado não permite que você faça.

O que cada lado realmente lhe entrega

Estas são classes diferentes de produto, e a diferença não é cosmética.

• Acesso — O Eleven v4 é um endpoint hospedado, acessado pela própria API da ElevenLabs, com cobrança por caractere. O VoxCPM2 é um checkpoint no Hugging Face sob openbmb/VoxCPM2; você o baixa e o executa, e não há nenhum endpoint oficial para chamar.

• Licença — O VoxCPM2 é distribuído sob a Apache 2.0, explicitamente livre para uso comercial. O Eleven v4 é uma API comercial cujos termos são os da ElevenLabs. Essa diferença importa se a sua revisão jurídica perguntar se você pode fazer fine-tuning, redistribuir ou distribuir os pesos; com o checkpoint, a resposta está registrada e é estática.

• Tamanho e hardware — VoxCPM2 tem 2B de parâmetros em um backbone MiniCPM-4 e a ficha técnica indica aproximadamente 8 GB de VRAM em bfloat16, com um comprimento máximo de sequência de 8.192 tokens. A ElevenLabs não publica contagem de parâmetros para o Eleven v4, e a pegada de hardware de um modelo hospedado não é algo que você gerencia.

• Cadeia de saída — VoxCPM2 aceita áudio de referência de 16 kHz e emite 48 kHz por meio da super-resolução integrada do AudioVAE V2, sem nenhum upsampler externo no caminho. O TTS hospedado entrega a você um stream em qualquer taxa que o fornecedor escolher.

• Pontuação independente — Eleven v4 tem uma, e está em primeiro lugar. VoxCPM2 não tem nenhuma. A ausência não é uma pontuação baixa; é um modelo sem pontuação, e nunca se deve falar dos dois na mesma frase como se o segundo fosse um número.

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

O número que substitui o Elo ausente

Se você não pode comparar preferência, compare o que você pode calcular, e para um modelo auto-hospedado isso é throughput. A ficha técnica do VoxCPM2 cita um fator de tempo real de cerca de 0,30 em PyTorch padrão em uma RTX 4090, caindo para cerca de 0,13 sob Nano-VLLM. O fator de tempo real é segundos de computação por segundo de áudio, então esses dois números significam que uma hora de GPU produz cerca de 3,3 horas de fala finalizada no primeiro caso e cerca de 7,7 horas no segundo.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

Duas consequências decorrem imediatamente. A pilha de serviço importa mais do que o modelo: o mesmo checkpoint na mesma placa mais do que dobra sua saída quando você troca o motor de inferência, então qualquer modelo de custo que use o valor 0,30 está superestimando seu custo de auto-hospedagem por um fator de cerca de 2,3. E a utilização é tudo: uma placa que fica ociosa não supera uma API por caractere a preço nenhum, porque a fatura da API escala com o que você diz, enquanto a fatura da placa escala com quando você a comprou.

É por isso que a versão honesta desta decisão não é "qual soa melhor". É "quantas horas de áudio você produz por mês, e o hardware está ocupado". Abaixo do volume em que uma placa permanece carregada, a API vence e não é por pouco. Acima dele, em hardware que você já possui, o custo marginal do checkpoint por milésima de hora é o mesmo que o custo pela primeira hora — e isso é uma vantagem estrutural que nenhuma tabela de preços consegue igualar.

A capacidade que um endpoint hospedado não venderá a você

É aqui que a comparação deixa de ser uma imagem espelhada, porque há uma coisa que o VoxCPM2 faz e que o Eleven v4 fundamentalmente não consegue: você pode retreiná-lo. O cartão do modelo documenta tanto o SFT completo quanto o ajuste fino com LoRA com apenas cinco a dez minutos de áudio, com um script de treinamento e uma configuração fornecidos para cada um.

Isso muda a forma de um programa de voz. Uma API hospedada oferece um modelo fixo mais qualquer clonagem que o fornecedor exponha — dez segundos de áudio de referência no caso do Eleven v4 para clones instantâneos, com um nível profissional acima. Um checkpoint ajustável por LoRA oferece um modelo que nunca viu os dados de mais ninguém e cujo comportamento você pode fixar por versão. Para uma voz de marca, um domínio regulado ou um idioma que o elenco do fornecedor trata mal, essa é uma categoria diferente de solução, não uma mais barata.

O trade-off é explícito e vale a pena declarar: com o VoxCPM2, você aceita que nenhum terceiro jamais avaliou o modelo, que as garantias de qualidade são aquelas que você mesmo mede, e que o limite de sequência de 8.192 tokens e o próprio aviso do card — de que o design de voz e o controle de estilo variam entre execuções e que de uma a três são — agora são seu problema de QA.

O que o Eleven v4 oferece que o checkpoint não consegue

No sentido inverso, as vantagens do modelo hospedado são aquelas que aparecem em um calendário de lançamentos, e não em uma ficha técnica.

• Uma classificação medida — em primeiro lugar numa tabela com 1.674 amostras por trás da estimativa, e um intervalo de cerca de ±19 pontos em torno dela. Seja o que for que essa tabela meça, ela é independente de ambos os fornecedores e é o único sinal de qualidade de terceiros nesta comparação.

• Direção de performance no texto — tags de áudio em linha, como [risadas], [sussurros] e [dito com raiva em sotaque francês], além de instruções de entrega em linguagem natural e suporte aprimorado ao Alfabeto Fonético Internacional. Obter uma mudança de humor de um modelo auto-hospedado significa uma regeneração ou um ajuste fino; aqui, é um token no roteiro.

• Cobertura que você não precisa verificar — mais de 90 idiomas contra os 30 do VoxCPM2, com a ressalva de que a lista do checkpoint é explícita e nomeada (incluindo dialetos chineses), enquanto o "mais de 90" do fornecedor é uma contagem sem lista.

• Sem superfície de operações — sem GPU, sem stack de serving, sem desvio de versão, e uma tarifa promocional de $0,022 por 1.000 caracteres até 12 de outubro, em vez do preço de tabela de $0,08 após essa data.

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

Nenhum destes dois é nosso, e esse é o objetivo desta seção.

O OrcaRouter não hospeda nenhum dos dois modelos. Não há endpoint da ElevenLabs nem endpoint do VoxCPM2 em nosso catálogo, e a resposta honesta de roteamento é que o Eleven v4 é acessado pela própria API da ElevenLabs, enquanto o VoxCPM2 é algo que você implanta no seu próprio hardware. Não vamos insinuar o contrário só para deixar uma comparação mais arrumada.

Onde uma única chave realmente ajuda é na decisão antes da decisão. A razão pela qual as conversas sobre auto-hospedagem travam é que a alternativa nunca é avaliada: uma API é uma única chamada e um checkpoint é uma pilha de serving, então a API vence por padrão em vez de por aritmética. A contribuição do OrcaRouter é que a metade hospedada dessa comparação é barata de testar — mais de 200 modelos por trás de uma única chave de API, com os preços de tabela dos provedores repassados a 0% de margem, de modo que a opção hospedada é avaliada pela sua tarifa real em vez de uma estimada, com failover automático se você colocar um candidato atrás de um caminho ativo antes de terminar de decidir.

Como decidir, em uma única passagem

Escolha o Eleven v4 se a voz tiver que ser boa já na primeira tomada e você quiser isso pronto esta semana. Você obtém o primeiro lugar em um ranking independente, uma sintaxe de direção documentada, a maior contagem documentada de idiomas nesta comparação e zero infraestrutura. Você paga US$ 0,08 por 1.000 caracteres a partir de 13 de outubro, e aceita que não pode retreiná-lo, fixar a versão dele ou manter o áudio no seu próprio hardware.

Escolha o VoxCPM2 se o modelo tiver de ser seu. Apache 2.0, 2B parâmetros em cerca de 8 GB de VRAM, saída de 48 kHz sem upsampler na cadeia, e um caminho de fine-tuning que funciona com cinco a dez minutos de áudio — essas são capacidades que um endpoint hospedado não oferece a preço algum, e a ausência de uma linha na arena é o custo delas. Meça os números de throughput na sua própria placa antes de se comprometer, porque os fatores de tempo real de 0,30 e 0,13 são medições da própria ficha técnica do modelo e a sua stack de serving não os reproduzirá exatamente.

E se a resposta honesta for que você não sabe seu volume de áudio mensal, esse é o número que você precisa descobrir. É ele que decide esta comparação. Nenhuma das duas placas vai lhe dizer isso.