
GPT-Live-1 vs VoxCPM2: Um custa US$ 0,05 por minuto, o outro custa uma GPU de 24 GB
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
A maneira mais limpa de comparar o GPT-Live-1 com o VoxCPM2 é perceber que eles só parecem concorrentes até você colocar um número no hardware. O GPT-Live-1 é o modelo de voz full-duplex da OpenAI, na API desde 10 de setembro de 2026, a US$ 0,05 por minuto de voz, sem nada para instalar. O VoxCPM2 é o modelo de síntese de fala de pesos abertos da OpenBMB, com 2 bilhões de parâmetros, lançado sob a licença Apache 2.0 em abril de 2026, que roda com cerca de 8 GB de VRAM e não é disponibilizado por nenhum provedor de inferência — então, se você quiser, a máquina é sua. Um é uma conversa que você aluga por segundo; o outro é um sintetizador que você opera. A questão não é qual é melhor, e sim qual deles a sua carga de trabalho consegue de fato absorver.

Dois modelos, dois trabalhos, cada um com uma linha de especificação honesta
• Função — GPT-Live-1 mantém uma conversa: ouve e fala simultaneamente, alterna turnos, lida com interrupções e backchannels, e retorna transcrições. VoxCPM2 converte texto em fala. Ele nunca ouve nada.
• Acesso — GPT-Live-1 é hospedado e fechado, um ID de modelo por trás do endpoint Live Sessions, com o exemplo de integração publicado rodando via WebRTC. VoxCPM2 é um checkpoint baixável no Hugging Face e no ModelScope, Apache 2.0, gratuito para uso comercial.
• Preço — GPT-Live-1 custa US$ 0,05 por minuto de voz, cobrado por segundo, com o backend de delegação medido separadamente. VoxCPM2 custa US$ 0 por chamada, mais uma GPU, e a hospedagem de código aberto é todo o modelo de custos.
• Pegada — o GPT-Live-1 não precisa de nenhum hardware seu. O VoxCPM2 precisa de aproximadamente 8 GB de VRAM (6–8 GB em Q4), Python 3.10+, PyTorch 2.5+ e CUDA 12+.
• Benchmarks — cada número de voz do GPT-Live-1 é da OpenAI, não reproduzido; o único painel independente o coloca em sétimo de onze. Os números publicados do VoxCPM2 são da OpenBMB, e as medições independentes que existem sobre suas alegações multilíngues apontam no sentido oposto.
A questão dos 24 GB, precificada
Os números de serving do VoxCPM2 são os que decidem se a auto-hospedagem é um hobby ou uma arquitetura. Em uma única RTX 4090, o modelo roda com um fator de tempo real de cerca de 0,30 em PyTorch puro e cerca de 0,13 com o caminho Nano-VLLM — ou seja, aproximadamente 7,7 horas de áudio gerado por hora de tempo de GPU na configuração mais rápida. Esses são os próprios números do model card, e não uma medição externa; uma receita de serving independente, validada em uma 4090 com CUDA 12.9, relata fatores de tempo real em regime estacionário de cerca de 0,120 para síntese zero-shot e 0,139 para clonagem, com pico de memória de GPU perto de 22 GB de 24 GB. Ambos os conjuntos são de regime estacionário, não de partida a frio — a primeira requisição em um processo novo é muito mais lenta, e é esse o número que as pessoas citam quando dizem que o modelo é inutilizável.
Coloque isso ao lado da API. O GPT-Live-1, a US$ 0,05 por minuto, custa US$ 3,00 por uma hora de conversa contínua. Uma placa de 24 GB alugada no mercado aberto fica na casa dos poucos dólares por hora, e possuir uma acaba por amortizar-se em algo semelhante quando se contabiliza a utilização. Então a comparação termina onde essas comparações costumam terminar, com uma assimetria desconfortável: a fatura da GPU chega, quer alguém fale com o seu produto, quer não, e a fatura da API escala para zero num dia calmo e para cinco dígitos num dia movimentado. A síntese em lote de um catálogo fixo é um encaixe perfeito para a GPU. Uma linha telefônica sempre ativa encaixa perfeitamente na medição.
O que o VoxCPM2 faz que nada mais aberto faz
A razão pela qual o VoxCPM2 merece tanta atenção não é que ele ganhe benchmarks — na maioria das vezes, não ganha —, mas que ele projeta uma voz a partir de uma descrição textual sem nenhum áudio de referência. Essa é uma capacidade genuinamente nova em pesos abertos, e muda o fluxo de trabalho de qualquer pessoa que precise de uma voz que ainda não existe: experimentá-la em prosa, iterar em prosa e só então decidir se vale clonar. Em torno disso, ele reúne 30 idiomas, além de nove dialetos chineses, saída em 48 kHz por meio de um estágio de super-resolução integrado e ajuste fino com apenas 5 a 10 minutos de áudio.
A base de evidências é mais fraca do que a lista de recursos. O próprio relatório da OpenBMB apresenta uma taxa de erro de palavras em inglês de 1,84% e uma taxa de erro de caracteres em chinês de 0,97%, além de um erro médio de 1,68% em 30 idiomas, medido em seu próprio conjunto de 500 enunciados por idioma e avaliado pelo modelo de outro fornecedor. Onde existe um teste independente, a diferença é grande: no conjunto de testes multilíngue da MiniMax, avaliado com Whisper-large-v3, o híndi fica em 19,70 e o árabe em 13,05 — várias vezes pior do que os números autorrelatados. A OpenBMB também alerta que o design de voz e o controle de estilo produzem resultados variáveis entre execuções e sugere gerar de uma a três vezes para obter o resultado que você queria, o que é uma forma discreta de dizer que o custo por chamada de um resultado utilizável não é o de uma única chamada.
A taxa de integração que ninguém coloca na comparação
Um detalhe nada glamouroso decide se o VoxCPM2 é uma semana de trabalho ou um mês. Seu repositório no Hugging Face está marcado como voxcpm em vez de transformers, o que significa que a biblioteca com a qual quase todo o resto daquele site é carregado não consegue carregar este modelo. O pull request para corrigir isso foi aberto em 4 de agosto de 2026 e ainda não havia sido mesclado quando verificamos pela última vez. Pull requests para adicioná-lo a outras pilhas de serving foram mesclados, e a adoção não está em questão: 393,079 downloads nos últimos trinta dias até o momento desta captura, com 27 adaptadores, 30 finetunes, 12 quantizações e 100 Spaces construídos sobre o checkpoint.

O custo equivalente do GPT-Live-1 é uma reescrita do transporte. Suas sessões são construídas em torno de uma conexão ao vivo, em vez de um endpoint de áudio de requisição-resposta, e a cobrança com dois medidores significa que cada chamada de raciocínio delegada, invocação de ferramenta e pesquisa na web é cobrada pelas tarifas do próprio modelo de backend, além do minuto de voz. Equipes que migram de uma integração em tempo real medida por tokens devem orçar a mudança como uma tarefa de engenharia, não como uma troca de ID de modelo.
Onde uma camada de roteamento realmente ajuda
O OrcaRouter não disponibiliza nem o GPT-Live-1 nem o VoxCPM2, e vale a pena dizer isso com clareza em vez de deixar que o resto desta seção sugira o contrário. A camada de voz do GPT-Live-1 está por trás do endpoint próprio da OpenAI; o VoxCPM2 não tem nenhum provedor hospedado. Nenhum dos dois pode ser chamado com a nossa chave.
A razão pela qual a questão do roteamento ainda surge é que ambos os modelos ficam na borda de um pipeline cujo meio é texto. Uma implantação do VoxCPM2 normalmente responde a algo — um gerador de roteiro, uma etapa de tradução, um normalizador de texto, um modelo de diálogo que decide o que será falado em seguida — e essas são chamadas de modelo comuns. Uma sessão do GPT-Live-1 delega seu raciocínio a um modelo de backend nomeado na configuração da sessão e, na própria documentação da OpenAI, esse backend é o GPT-5.6 Terra, disponível pelo OrcaRouter ao preço de tabela da OpenAI. A delegação pelo cliente vai ainda mais longe, permitindo que sua própria aplicação forneça o backend, o que significa que o modelo por trás da voz pode ser qualquer endpoint que você controle. Cerca de 190 modelos de onze provedores upstream ficam atrás de uma única chave, a preço de tabela e sem markup — então, quando um provedor reduz um preço, a redução já vale aqui no mesmo dia, e não apenas na renovação — com failover automático entre provedores e uma DSL de roteamento para compor vários modelos em uma única chamada. Um seguro barato para a metade da stack que muda com mais frequência.
Um alerta pertence a esta secção em vez de ficar enterrado nela, porque é o detalhe que torna a metade GPT-Live-1 desta comparação menos definida do que sugerem os benchmarks do seu fornecedor. No índice independente Artificial Analysis Speech to Speech Index, o GPT-Live-1 obtém 69,8% — sétimo de onze, atrás do GPT-Realtime-2.1 com 73,9% e do Grok Voice Think Fast 2.0 com 79,0%. O modelo é o mais barato daquele quadro por hora de áudio de entrada, a $4,42, e não é o melhor. Considere a possibilidade de a camada de voz que padronizar não ser a que vai manter.

Qual deles, para quê?
Escolha o VoxCPM2 quando o texto existir antes do áudio. Narração, audiolivros, dublagem, acessibilidade, falas de personagens de jogos, um produto que precise de uma voz que ninguém gravou ainda — e especialmente qualquer carga de trabalho em que o volume seja alto, previsível e valha um custo de capital fixo. Aceite que você mesmo vai executá-lo, que as ferramentas ao redor dele ainda estão se estabilizando e que as alegações de qualidade multilíngue merecem seu próprio teste de escuta antes de chegarem a um cliente.
Use o GPT-Live-1 se houver uma pessoa do outro lado. Agentes de voz, suporte telefônico, fluxos de triagem inicial, qualquer coisa em que o modelo precise decidir em tempo real se a pessoa terminou de falar. Pague a tarifa por minuto pelo privilégio de não ser dono do problema e inclua o backend delegado como uma rubrica separada no orçamento, porque é aí que a chamada fica barata ou cara.
O erro é tratá-los como alternativas numa comparação direta. Para a maioria das equipes que precisa dos dois, eles são duas camadas do mesmo produto, e a única resposta genuinamente errada é escolher a opção auto-hospedada porque a licença diz que é gratuita, sem contabilizar a GPU que torna isso verdade.
