
GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B: Uma cobrança por minuto ou uma GPU de 80 GB
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
A escolha entre o GPT-Live-1 e o NVIDIA Nemotron VoiceChat 11B não é uma escolha entre dois modelos de voz. É uma escolha entre dois modelos de negócios disfarçados de modelos de voz. O GPT-Live-1 é uma API hospedada que a OpenAI disponibilizou para acesso de desenvolvedores em 10 de setembro de 2026, cobrada a US$ 0,05 por minuto de áudio, sem envolver nenhum hardware seu. O NVIDIA Nemotron VoiceChat 11B — publicado como NVIDIA-NemotronLabs-VoiceChat-11B, com um contêiner NGC datado de 21 de julho de 2026 e um checkpoint do Hugging Face junto — é um modelo de fala full-duplex de pesos abertos com 11 bilhões de parâmetros que não roda em nada menos que uma GPU de 80 GB. Um deles custa dinheiro por minuto de conversa; o outro custa dinheiro, quer alguém ligue, quer não.
O ponto de equilíbrio é mais simples do que os decks dos fornecedores sugerem
Comece pelo único número com que ambos os lados concordam. O GPT-Live-1 a $0.05 por minuto dá $3.00 por uma hora de linha aberta contínua. Esse é o preço de uma conversa de voz sempre ativa.
Agora, ponha preço na alternativa. O Nemotron VoiceChat 11B precisa de uma GPU com pelo menos 80 GB de VRAM — uma placa das classes A100, H100, H200, B100, B200 ou RTX 6000, no Linux. Alugar uma delas no mercado aberto fica na casa dos poucos dólares por hora, e possuir uma amortiza para um valor semelhante depois de levar em conta a utilização. Portanto, uma única linha de voz sempre ativa dá praticamente no mesmo: a GPU alugada custa aproximadamente o que custa a API, antes de você ter pago por qualquer coisa que esteja rodando nela.
Essa é a comparação errada, e é a que a maioria das análises de construir vs. comprar deixa por aí. A comparação correta é por GPU, não por linha, e depende de um número que a NVIDIA não publicou.
GPT-Live-1 numa conta Tier 1 — 25 sessões simultâneas, o que dá $1,25 por minuto, ou $75 por hora, quando as 25 linhas estão ativas
• Nemotron VoiceChat 11B em uma única GPU de 80 GB — pelo número de sessões simultâneas que um modelo híbrido Mamba/Transformer de 11B conseguir acomodar em 80 GB, a aproximadamente o custo de aluguel da placa
Um modelo 11B num acelerador de 80 GB é muita folga, e 80 GB é um requisito que, na prática, compra uma enorme capacidade de batching. Se um único cartão suporta até seis conversas simultâneas, a auto-hospedagem é drasticamente mais barata do que a API a plena carga. Se suporta uma e meia, não é. Até que alguém faça benchmarking de concorrência com tráfego real, a posição honesta é que o ponto de equilíbrio provavelmente favorece a auto-hospedagem em volume e que nenhum dos fornecedores lhe deu o número para provar isso.

Onde o modelo aberto é genuinamente melhor, não apenas mais barato
A comparação de latência merece mais cuidado do que a de preço, porque, nesse eixo, o modelo aberto tem melhores evidências.
• Latência de troca de turno — O Nemotron VoiceChat 11B reporta 448 ms para troca de turno fluida no Full-Duplex-Bench 1.0, com latência de 480 ms para interromper e ceder o turno e taxa de retomada de 1,00 após interrupção do usuário. O valor do GPT-Live-1 é de 0,8 segundo, abaixo de 1,4, segundo a OpenAI.
Leia esses dois números lado a lado com a fonte anexada e o quadro se inverte. Os números da NVIDIA vêm de um conjunto de benchmarks publicado e especificado publicamente. Os da OpenAI vêm da OpenAI, comparando seu novo modelo com sua própria geração anterior, e não foram reproduzidos de forma independente. Com as evidências disponíveis, o modelo de pesos abertos é mensuravelmente mais rápido naquilo que faz um agente de voz parecer humano, e o modelo hospedado é mais rápido apenas de acordo com seus próprios materiais de imprensa.
A NVIDIA também reivindica uma primazia: o Nemotron VoiceChat 11B é descrito como o primeiro modelo full-duplex aberto que oferece suporte a chamadas de ferramentas em tempo real durante a conversa, usando um canal de saída separado e frases de espera predefinidas para que o agente possa continuar falando enquanto espera por uma API externa. O model card inclui três amostras de áudio, convidando você a ouvir exatamente isso — tomada de turno natural descrita como resposta de cerca de 450 ms, barge-in em que o modelo cede instantaneamente, e ferramentas chamadas ao vivo no meio da conversa. Essas amostras são do fornecedor e corroboram o número de 448 ms, em vez de testá-lo de forma independente, mas são, pelo menos, evidência audível anexada a um checkpoint baixável, em vez de um número em um post de lançamento. Esse é o mesmo problema arquitetural que o GPT-Live-1 resolve com delegação, respondido de forma diferente — o modelo aberto segura a linha sozinho; o modelo hospedado passa a tarefa para um modelo de raciocínio separado e deixa a camada de voz manter a conversa viva.
As semelhanças são tão instrutivas quanto as diferenças. Ambos fazem full duplex, ou seja, ambos escutam enquanto falam, em vez de alternar turnos. Ambos suportam interrupção e barge-in. Ambos foram treinados em fala numa escala que faz os antigos pipelines em cascata ASR-depois-LLM-depois-TTS parecerem três produtos separados parafusados juntos — o checkpoint da NVIDIA viu cerca de 550.000 horas de fala.

Aquilo de que você abre mão, e não é só dinheiro.
A primeira coisa de que você abre mão com o modelo aberto é a voz. O checkpoint disponibilizado usa uma única voz fixa, chamada Aria, e não oferece suporte a clonagem de voz nem a uma biblioteca de vozes. O GPT-Live-1 traz doze vozes que abrangem diferentes sotaques, dialetos e idiomas, e a OpenAI as remasterizou especificamente para este modelo. Se a voz do seu produto faz parte da identidade dele, ou se você precisa atender a vários mercados com agentes de vozes diferentes a partir de uma única implantação, isso é quase eliminatório por si só — e é a limitação menos visível em uma comparação de especificações, porque parece uma contagem de recursos, e não uma decisão de produto.
A segunda coisa da qual você abre mão é o teto de contexto. O modelo carrega um limite de enunciado no treinamento de cerca de 142 segundos e uma limitação prática quanto a manter mais de aproximadamente dois minutos de contexto de áudio. Uma chamada telefônica de vinte minutos não é um contexto contínuo único para este checkpoint; é uma sequência de segmentos que o sistema ao redor precisa gerenciar. Modelos hospedados geralmente absorvem essa gestão para você.
O terceiro é o que você tem permissão para fazer com ele. O cartão de modelo do Hugging Face traz a licença openmdw-1.1, enquanto parte da cobertura do lançamento o descrevia como de uso exclusivo para pesquisa, e a página do contêiner NGC apresenta os componentes como prontos para uso comercial ou não comercial. Três fontes, três leituras diferentes, e apenas o texto da licença rege. Essa discrepância é o tipo de coisa que aparece numa revisão jurídica três semanas antes do lançamento. Resolva isso antes de construir, não depois.
O quarto é operações. Uma GPU de 80 GB não é um item de linha que você pode desligar num domingo tranquilo: mesmo com tráfego zero, você continua pagando pela placa, e você é responsável pela curva de escalabilidade, pelas atualizações de driver, pelo planejamento de capacidade e pela escala de plantão de um caminho de áudio em tempo real em que uma conexão perdida é um cliente perdido. Também não há uma alternativa hospedada com a qual contar enquanto você chega lá — a linha de provedor de inferência do card do Hugging Face afirma claramente que o modelo não é implantado por nenhum provedor de inferência, então não existe uma versão paga por minuto desse checkpoint para prototipar. Ou você o auto-hospeda, ou não o usa. Esse trabalho é invisível na comparação por minuto e muito visível em um plano de contratação.
O híbrido que a maioria das equipes deveria realmente considerar
A forma de encarar isto que torna esta decisão tratável é que os dois modelos não têm de ser uma escolha binária. Um agente de voz normalmente tem uma camada de voz e uma camada de raciocínio, e é na camada de raciocínio que reside a flexibilidade.
O GPT-Live-1 é construído dessa forma por design. Sua camada de voz mantém a conversa viva enquanto o raciocínio é delegado, por meio da Responses API, a um modelo de texto comum — o próprio exemplo WebRTC publicado da OpenAI conecta esse backend ao GPT-5.6 Terra. Essa metade da sua stack é uma chamada de API normal, com preço por token e uma escolha real de fornecedores. O GPT-5.6 Terra é servido pelo OrcaRouter a $2,00 por milhão de tokens de entrada e $12,00 por milhão de tokens de saída, com um contexto de 1M de tokens e tanto /v1/chat/completions quanto /v1/responses expostos, ao lado de cerca de 190 outros modelos acessíveis com uma única chave.
Isso importa especificamente para um projeto de auto-hospedagem porque altera o perfil de risco. Se você subir o Nemotron VoiceChat 11B e ele não aguentar o seu tráfego, a metade de voz é um custo de GPU afundado — mas a metade de raciocínio pode ser movida, passar por failover ou ser dividida entre um modelo barato para turnos rotineiros e um modelo forte para escalonamentos, sem tocar na trajetória de áudio. Failover automático entre provedores upstream é a diferença entre uma tarde ruim e um trimestre ruim quando uma dependência de fonte única cai.
Registre claramente o que está e o que não está disponível onde: nem o GPT-Live-1 nem o Nemotron VoiceChat 11B são servidos pelo OrcaRouter. Cada um vem de sua própria origem — o endpoint Live Sessions da OpenAI, em um caso, e sua própria GPU, no outro. A vantagem de roteamento está inteiramente a jusante do áudio.

Em qual basear-se
• Escolha o GPT-Live-1 se quiser lançar neste trimestre, se precisar de mais de uma voz, se as suas conversas costumarem ultrapassar dois minutos de contexto contínuo, ou se o volume ainda não for suficientemente elevado para justificar uma GPU que cobra enquanto está inativa.
• Escolha o NVIDIA Nemotron VoiceChat 11B se você já usa GPUs de 80 GB, se precisa de alternância de turnos abaixo de 500 ms com base em evidências, e não em afirmações, se precisa que o áudio permaneça dentro da sua própria infraestrutura por razões de residência de dados, ou se está em um volume de chamadas em que o medidor por minuto da API é a maior linha da fatura.
• Crie um protótipo na API e faça o benchmark do checkpoint. A decisão depende de um número não publicado — sessões simultâneas por placa de 80 GB — e a única forma de obtê-lo é medi-lo no formato do seu próprio tráfego. Isso é uma semana de trabalho, e é a diferença entre uma decisão de infraestrutura defensável e um palpite disfarçado de decisão.
