Cartão de título principal para 'GPT-Live-1 vs VoxCPM2', com o subtítulo 'Uma conversa alugada ou uma GPU que você possui', com um selo que diz 'Um é duplex completo, o outro é síntese de voz - trabalhos diferentes' e três cartões: 'GPT-Live-1 — $0,05 por minuto de voz, somente API, nada para instalar', 'VoxCPM2 — Apache-2.0, 2B parâmetros, ~8 GB de VRAM, nenhum provedor de inferência o implanta' e 'Taxa de transferência auto-hospedada — cerca de 7,7 horas de áudio por hora de GPU a RTF 0,13, 393.079 downloads nos últimos 30 dias', acima de uma faixa de rodapé que diz 'Benchmarks do VoxCPM2 reportados pela OpenBMB; números de voz do GPT-Live-1 reportados pela OpenAI e não reproduzidos.' O logotipo da OrcaRouter é composto no canto inferior direito.
Engineering & Research

GPT-Live-1 vs VoxCPM2: Um custa US$ 0,05 por minuto, o outro custa uma GPU de 24 GB

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A maneira mais limpa de comparar o GPT-Live-1 com o VoxCPM2 é perceber que eles só parecem concorrentes até você colocar um número no hardware. O GPT-Live-1 é o modelo de voz full-duplex da OpenAI, na API desde 10 de setembro de 2026, a US$ 0,05 por minuto de voz, sem nada para instalar. O VoxCPM2 é o modelo de síntese de fala de pesos abertos da OpenBMB, com 2 bilhões de parâmetros, lançado sob a licença Apache 2.0 em abril de 2026, que roda com cerca de 8 GB de VRAM e não é disponibilizado por nenhum provedor de inferência — então, se você quiser, a máquina é sua. Um é uma conversa que você aluga por segundo; o outro é um sintetizador que você opera. A questão não é qual é melhor, e sim qual deles a sua carga de trabalho consegue de fato absorver.

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

Dois modelos, dois trabalhos, cada um com uma linha de especificação honesta

• Função — GPT-Live-1 mantém uma conversa: ouve e fala simultaneamente, alterna turnos, lida com interrupções e backchannels, e retorna transcrições. VoxCPM2 converte texto em fala. Ele nunca ouve nada.

• Acesso — GPT-Live-1 é hospedado e fechado, um ID de modelo por trás do endpoint Live Sessions, com o exemplo de integração publicado rodando via WebRTC. VoxCPM2 é um checkpoint baixável no Hugging Face e no ModelScope, Apache 2.0, gratuito para uso comercial.

• Preço — GPT-Live-1 custa US$ 0,05 por minuto de voz, cobrado por segundo, com o backend de delegação medido separadamente. VoxCPM2 custa US$ 0 por chamada, mais uma GPU, e a hospedagem de código aberto é todo o modelo de custos.

• Pegada — o GPT-Live-1 não precisa de nenhum hardware seu. O VoxCPM2 precisa de aproximadamente 8 GB de VRAM (6–8 GB em Q4), Python 3.10+, PyTorch 2.5+ e CUDA 12+.

• Benchmarks — cada número de voz do GPT-Live-1 é da OpenAI, não reproduzido; o único painel independente o coloca em sétimo de onze. Os números publicados do VoxCPM2 são da OpenBMB, e as medições independentes que existem sobre suas alegações multilíngues apontam no sentido oposto.

A questão dos 24 GB, precificada

Os números de serving do VoxCPM2 são os que decidem se a auto-hospedagem é um hobby ou uma arquitetura. Em uma única RTX 4090, o modelo roda com um fator de tempo real de cerca de 0,30 em PyTorch puro e cerca de 0,13 com o caminho Nano-VLLM — ou seja, aproximadamente 7,7 horas de áudio gerado por hora de tempo de GPU na configuração mais rápida. Esses são os próprios números do model card, e não uma medição externa; uma receita de serving independente, validada em uma 4090 com CUDA 12.9, relata fatores de tempo real em regime estacionário de cerca de 0,120 para síntese zero-shot e 0,139 para clonagem, com pico de memória de GPU perto de 22 GB de 24 GB. Ambos os conjuntos são de regime estacionário, não de partida a frio — a primeira requisição em um processo novo é muito mais lenta, e é esse o número que as pessoas citam quando dizem que o modelo é inutilizável.

Coloque isso ao lado da API. O GPT-Live-1, a US$ 0,05 por minuto, custa US$ 3,00 por uma hora de conversa contínua. Uma placa de 24 GB alugada no mercado aberto fica na casa dos poucos dólares por hora, e possuir uma acaba por amortizar-se em algo semelhante quando se contabiliza a utilização. Então a comparação termina onde essas comparações costumam terminar, com uma assimetria desconfortável: a fatura da GPU chega, quer alguém fale com o seu produto, quer não, e a fatura da API escala para zero num dia calmo e para cinco dígitos num dia movimentado. A síntese em lote de um catálogo fixo é um encaixe perfeito para a GPU. Uma linha telefônica sempre ativa encaixa perfeitamente na medição.

O que o VoxCPM2 faz que nada mais aberto faz

A razão pela qual o VoxCPM2 merece tanta atenção não é que ele ganhe benchmarks — na maioria das vezes, não ganha —, mas que ele projeta uma voz a partir de uma descrição textual sem nenhum áudio de referência. Essa é uma capacidade genuinamente nova em pesos abertos, e muda o fluxo de trabalho de qualquer pessoa que precise de uma voz que ainda não existe: experimentá-la em prosa, iterar em prosa e só então decidir se vale clonar. Em torno disso, ele reúne 30 idiomas, além de nove dialetos chineses, saída em 48 kHz por meio de um estágio de super-resolução integrado e ajuste fino com apenas 5 a 10 minutos de áudio.

A base de evidências é mais fraca do que a lista de recursos. O próprio relatório da OpenBMB apresenta uma taxa de erro de palavras em inglês de 1,84% e uma taxa de erro de caracteres em chinês de 0,97%, além de um erro médio de 1,68% em 30 idiomas, medido em seu próprio conjunto de 500 enunciados por idioma e avaliado pelo modelo de outro fornecedor. Onde existe um teste independente, a diferença é grande: no conjunto de testes multilíngue da MiniMax, avaliado com Whisper-large-v3, o híndi fica em 19,70 e o árabe em 13,05 — várias vezes pior do que os números autorrelatados. A OpenBMB também alerta que o design de voz e o controle de estilo produzem resultados variáveis entre execuções e sugere gerar de uma a três vezes para obter o resultado que você queria, o que é uma forma discreta de dizer que o custo por chamada de um resultado utilizável não é o de uma única chamada.

A taxa de integração que ninguém coloca na comparação

Um detalhe nada glamouroso decide se o VoxCPM2 é uma semana de trabalho ou um mês. Seu repositório no Hugging Face está marcado como voxcpm em vez de transformers, o que significa que a biblioteca com a qual quase todo o resto daquele site é carregado não consegue carregar este modelo. O pull request para corrigir isso foi aberto em 4 de agosto de 2026 e ainda não havia sido mesclado quando verificamos pela última vez. Pull requests para adicioná-lo a outras pilhas de serving foram mesclados, e a adoção não está em questão: 393,079 downloads nos últimos trinta dias até o momento desta captura, com 27 adaptadores, 30 finetunes, 12 quantizações e 100 Spaces construídos sobre o checkpoint.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

O custo equivalente do GPT-Live-1 é uma reescrita do transporte. Suas sessões são construídas em torno de uma conexão ao vivo, em vez de um endpoint de áudio de requisição-resposta, e a cobrança com dois medidores significa que cada chamada de raciocínio delegada, invocação de ferramenta e pesquisa na web é cobrada pelas tarifas do próprio modelo de backend, além do minuto de voz. Equipes que migram de uma integração em tempo real medida por tokens devem orçar a mudança como uma tarefa de engenharia, não como uma troca de ID de modelo.

Onde uma camada de roteamento realmente ajuda

O OrcaRouter não disponibiliza nem o GPT-Live-1 nem o VoxCPM2, e vale a pena dizer isso com clareza em vez de deixar que o resto desta seção sugira o contrário. A camada de voz do GPT-Live-1 está por trás do endpoint próprio da Ope​nAI; o VoxCPM2 não tem nenhum provedor hospedado. Nenhum dos dois pode ser chamado com a nossa chave.

A razão pela qual a questão do roteamento ainda surge é que ambos os modelos ficam na borda de um pipeline cujo meio é texto. Uma implantação do VoxCPM2 normalmente responde a algo — um gerador de roteiro, uma etapa de tradução, um normalizador de texto, um modelo de diálogo que decide o que será falado em seguida — e essas são chamadas de modelo comuns. Uma sessão do GPT-Live-1 delega seu raciocínio a um modelo de backend nomeado na configuração da sessão e, na própria documentação da OpenAI, esse backend é o GPT-5.6 Terra, disponível pelo OrcaRouter ao preço de tabela da OpenAI. A delegação pelo cliente vai ainda mais longe, permitindo que sua própria aplicação forneça o backend, o que significa que o modelo por trás da voz pode ser qualquer endpoint que você controle. Cerca de 190 modelos de onze provedores upstream ficam atrás de uma única chave, a preço de tabela e sem markup — então, quando um provedor reduz um preço, a redução já vale aqui no mesmo dia, e não apenas na renovação — com failover automático entre provedores e uma DSL de roteamento para compor vários modelos em uma única chamada. Um seguro barato para a metade da stack que muda com mais frequência.

Um alerta pertence a esta secção em vez de ficar enterrado nela, porque é o detalhe que torna a metade GPT-Live-1 desta comparação menos definida do que sugerem os benchmarks do seu fornecedor. No índice independente Artificial Analysis Speech to Speech Index, o GPT-Live-1 obtém 69,8% — sétimo de onze, atrás do GPT-Realtime-2.1 com 73,9% e do Gr​ok Voice Think Fast 2.0 com 79,0%. O modelo é o mais barato daquele quadro por hora de áudio de entrada, a $4,42, e não é o melhor. Considere a possibilidade de a camada de voz que padronizar não ser a que vai manter.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

Qual deles, para quê?

Escolha o VoxCPM2 quando o texto existir antes do áudio. Narração, audiolivros, dublagem, acessibilidade, falas de personagens de jogos, um produto que precise de uma voz que ninguém gravou ainda — e especialmente qualquer carga de trabalho em que o volume seja alto, previsível e valha um custo de capital fixo. Aceite que você mesmo vai executá-lo, que as ferramentas ao redor dele ainda estão se estabilizando e que as alegações de qualidade multilíngue merecem seu próprio teste de escuta antes de chegarem a um cliente.

Use o GPT-Live-1 se houver uma pessoa do outro lado. Agentes de voz, suporte telefônico, fluxos de triagem inicial, qualquer coisa em que o modelo precise decidir em tempo real se a pessoa terminou de falar. Pague a tarifa por minuto pelo privilégio de não ser dono do problema e inclua o backend delegado como uma rubrica separada no orçamento, porque é aí que a chamada fica barata ou cara.

O erro é tratá-los como alternativas numa comparação direta. Para a maioria das equipes que precisa dos dois, eles são duas camadas do mesmo produto, e a única resposta genuinamente errada é escolher a opção auto-hospedada porque a licença diz que é gratuita, sem contabilizar a GPU que torna isso verdade.