
Eleven v4 vs VoxCPM2: Um modelo ranqueado contra um checkpoint que você não consegue alugar
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 982 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 197 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
O fato mais útil neste confronto é uma linha que não existe. ElevenLabs Eleven v4 ocupa o 1º lugar no Provider Voice Arena da Artificial Analysis, com um Elo de 1.319 em 1.674 aparições, a US$ 80,00 por milhão de caracteres. VoxCPM2, o checkpoint da OpenBMB lançado em abril de 2026, não aparece em lugar nenhum em nenhum dos dois rankings de fala — nem classificado, nem não classificado, nem como entrada de prévia. Isso não é um veredito sobre a qualidade. Significa que, qualquer que seja o número que você esperava comparar com 1.319, ninguém o produziu, e a comparação tem de ser feita com base em algo que não seja preferência. O que resta é propriedade, ajuste fino e uma questão de licenciamento que um endpoint hospedado não permite que você faça.
O que cada lado realmente lhe entrega
Estas são classes diferentes de produto, e a diferença não é cosmética.
• Acesso — O Eleven v4 é um endpoint hospedado, acessado pela própria API da ElevenLabs, com cobrança por caractere. O VoxCPM2 é um checkpoint no Hugging Face sob openbmb/VoxCPM2; você o baixa e o executa, e não há nenhum endpoint oficial para chamar.
• Licença — O VoxCPM2 é distribuído sob a Apache 2.0, explicitamente livre para uso comercial. O Eleven v4 é uma API comercial cujos termos são os da ElevenLabs. Essa diferença importa se a sua revisão jurídica perguntar se você pode fazer fine-tuning, redistribuir ou distribuir os pesos; com o checkpoint, a resposta está registrada e é estática.
• Tamanho e hardware — VoxCPM2 tem 2B de parâmetros em um backbone MiniCPM-4 e a ficha técnica indica aproximadamente 8 GB de VRAM em bfloat16, com um comprimento máximo de sequência de 8.192 tokens. A ElevenLabs não publica contagem de parâmetros para o Eleven v4, e a pegada de hardware de um modelo hospedado não é algo que você gerencia.
• Cadeia de saída — VoxCPM2 aceita áudio de referência de 16 kHz e emite 48 kHz por meio da super-resolução integrada do AudioVAE V2, sem nenhum upsampler externo no caminho. O TTS hospedado entrega a você um stream em qualquer taxa que o fornecedor escolher.
• Pontuação independente — Eleven v4 tem uma, e está em primeiro lugar. VoxCPM2 não tem nenhuma. A ausência não é uma pontuação baixa; é um modelo sem pontuação, e nunca se deve falar dos dois na mesma frase como se o segundo fosse um número.

O número que substitui o Elo ausente
Se você não pode comparar preferência, compare o que você pode calcular, e para um modelo auto-hospedado isso é throughput. A ficha técnica do VoxCPM2 cita um fator de tempo real de cerca de 0,30 em PyTorch padrão em uma RTX 4090, caindo para cerca de 0,13 sob Nano-VLLM. O fator de tempo real é segundos de computação por segundo de áudio, então esses dois números significam que uma hora de GPU produz cerca de 3,3 horas de fala finalizada no primeiro caso e cerca de 7,7 horas no segundo.

Duas consequências decorrem imediatamente. A pilha de serviço importa mais do que o modelo: o mesmo checkpoint na mesma placa mais do que dobra sua saída quando você troca o motor de inferência, então qualquer modelo de custo que use o valor 0,30 está superestimando seu custo de auto-hospedagem por um fator de cerca de 2,3. E a utilização é tudo: uma placa que fica ociosa não supera uma API por caractere a preço nenhum, porque a fatura da API escala com o que você diz, enquanto a fatura da placa escala com quando você a comprou.
É por isso que a versão honesta desta decisão não é "qual soa melhor". É "quantas horas de áudio você produz por mês, e o hardware está ocupado". Abaixo do volume em que uma placa permanece carregada, a API vence e não é por pouco. Acima dele, em hardware que você já possui, o custo marginal do checkpoint por milésima de hora é o mesmo que o custo pela primeira hora — e isso é uma vantagem estrutural que nenhuma tabela de preços consegue igualar.
A capacidade que um endpoint hospedado não venderá a você
É aqui que a comparação deixa de ser uma imagem espelhada, porque há uma coisa que o VoxCPM2 faz e que o Eleven v4 fundamentalmente não consegue: você pode retreiná-lo. O cartão do modelo documenta tanto o SFT completo quanto o ajuste fino com LoRA com apenas cinco a dez minutos de áudio, com um script de treinamento e uma configuração fornecidos para cada um.
Isso muda a forma de um programa de voz. Uma API hospedada oferece um modelo fixo mais qualquer clonagem que o fornecedor exponha — dez segundos de áudio de referência no caso do Eleven v4 para clones instantâneos, com um nível profissional acima. Um checkpoint ajustável por LoRA oferece um modelo que nunca viu os dados de mais ninguém e cujo comportamento você pode fixar por versão. Para uma voz de marca, um domínio regulado ou um idioma que o elenco do fornecedor trata mal, essa é uma categoria diferente de solução, não uma mais barata.
O trade-off é explícito e vale a pena declarar: com o VoxCPM2, você aceita que nenhum terceiro jamais avaliou o modelo, que as garantias de qualidade são aquelas que você mesmo mede, e que o limite de sequência de 8.192 tokens e o próprio aviso do card — de que o design de voz e o controle de estilo variam entre execuções e que de uma a três são — agora são seu problema de QA.
O que o Eleven v4 oferece que o checkpoint não consegue
No sentido inverso, as vantagens do modelo hospedado são aquelas que aparecem em um calendário de lançamentos, e não em uma ficha técnica.
• Uma classificação medida — em primeiro lugar numa tabela com 1.674 amostras por trás da estimativa, e um intervalo de cerca de ±19 pontos em torno dela. Seja o que for que essa tabela meça, ela é independente de ambos os fornecedores e é o único sinal de qualidade de terceiros nesta comparação.
• Direção de performance no texto — tags de áudio em linha, como [risadas], [sussurros] e [dito com raiva em sotaque francês], além de instruções de entrega em linguagem natural e suporte aprimorado ao Alfabeto Fonético Internacional. Obter uma mudança de humor de um modelo auto-hospedado significa uma regeneração ou um ajuste fino; aqui, é um token no roteiro.
• Cobertura que você não precisa verificar — mais de 90 idiomas contra os 30 do VoxCPM2, com a ressalva de que a lista do checkpoint é explícita e nomeada (incluindo dialetos chineses), enquanto o "mais de 90" do fornecedor é uma contagem sem lista.
• Sem superfície de operações — sem GPU, sem stack de serving, sem desvio de versão, e uma tarifa promocional de $0,022 por 1.000 caracteres até 12 de outubro, em vez do preço de tabela de $0,08 após essa data.

Nenhum destes dois é nosso, e esse é o objetivo desta seção.
O OrcaRouter não hospeda nenhum dos dois modelos. Não há endpoint da ElevenLabs nem endpoint do VoxCPM2 em nosso catálogo, e a resposta honesta de roteamento é que o Eleven v4 é acessado pela própria API da ElevenLabs, enquanto o VoxCPM2 é algo que você implanta no seu próprio hardware. Não vamos insinuar o contrário só para deixar uma comparação mais arrumada.
Onde uma única chave realmente ajuda é na decisão antes da decisão. A razão pela qual as conversas sobre auto-hospedagem travam é que a alternativa nunca é avaliada: uma API é uma única chamada e um checkpoint é uma pilha de serving, então a API vence por padrão em vez de por aritmética. A contribuição do OrcaRouter é que a metade hospedada dessa comparação é barata de testar — mais de 200 modelos por trás de uma única chave de API, com os preços de tabela dos provedores repassados a 0% de margem, de modo que a opção hospedada é avaliada pela sua tarifa real em vez de uma estimada, com failover automático se você colocar um candidato atrás de um caminho ativo antes de terminar de decidir.
Como decidir, em uma única passagem
Escolha o Eleven v4 se a voz tiver que ser boa já na primeira tomada e você quiser isso pronto esta semana. Você obtém o primeiro lugar em um ranking independente, uma sintaxe de direção documentada, a maior contagem documentada de idiomas nesta comparação e zero infraestrutura. Você paga US$ 0,08 por 1.000 caracteres a partir de 13 de outubro, e aceita que não pode retreiná-lo, fixar a versão dele ou manter o áudio no seu próprio hardware.
Escolha o VoxCPM2 se o modelo tiver de ser seu. Apache 2.0, 2B parâmetros em cerca de 8 GB de VRAM, saída de 48 kHz sem upsampler na cadeia, e um caminho de fine-tuning que funciona com cinco a dez minutos de áudio — essas são capacidades que um endpoint hospedado não oferece a preço algum, e a ausência de uma linha na arena é o custo delas. Meça os números de throughput na sua própria placa antes de se comprometer, porque os fatores de tempo real de 0,30 e 0,13 são medições da própria ficha técnica do modelo e a sua stack de serving não os reproduzirá exatamente.
E se a resposta honesta for que você não sabe seu volume de áudio mensal, esse é o número que você precisa descobrir. É ele que decide esta comparação. Nenhuma das duas placas vai lhe dizer isso.
