Um cartão de título de destaque com o texto 'GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B', com o subtítulo 'Uma fatura por minuto ou uma GPU de 80 GB' e a linha '$0,05 por minuto vs um acelerador de 80 GB', acima de dois painéis: o da esquerda mostrando o contorno de uma nuvem com um mostrador de medição e um ícone de moeda; o da direita mostrando uma placa aceleradora de servidor com um ícone de chip e o rótulo '80 GB VRAM', com o logotipo da OrcaRouter composto no canto.
Guides & Insights

GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B: Uma cobrança por minuto ou uma GPU de 80 GB

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A escolha entre o GPT-Live-1 e o NVIDIA Nemotron VoiceChat 11B não é uma escolha entre dois modelos de voz. É uma escolha entre dois modelos de negócios disfarçados de modelos de voz. O GPT-Live-1 é uma API hospedada que a OpenAI disponibilizou para acesso de desenvolvedores em 10 de setembro de 2026, cobrada a US$ 0,05 por minuto de áudio, sem envolver nenhum hardware seu. O NVIDIA Nemotron VoiceChat 11B — publicado como NVIDIA-NemotronLabs-VoiceChat-11B, com um contêiner NGC datado de 21 de julho de 2026 e um checkpoint do Hugging Face junto — é um modelo de fala full-duplex de pesos abertos com 11 bilhões de parâmetros que não roda em nada menos que uma GPU de 80 GB. Um deles custa dinheiro por minuto de conversa; o outro custa dinheiro, quer alguém ligue, quer não.

O ponto de equilíbrio é mais simples do que os decks dos fornecedores sugerem

Comece pelo único número com que ambos os lados concordam. O GPT-Live-1 a $0.05 por minuto dá $3.00 por uma hora de linha aberta contínua. Esse é o preço de uma conversa de voz sempre ativa.

Agora, ponha preço na alternativa. O Nemotron VoiceChat 11B precisa de uma GPU com pelo menos 80 GB de VRAM — uma placa das classes A100, H100, H200, B100, B200 ou RTX 6000, no Linux. Alugar uma delas no mercado aberto fica na casa dos poucos dólares por hora, e possuir uma amortiza para um valor semelhante depois de levar em conta a utilização. Portanto, uma única linha de voz sempre ativa dá praticamente no mesmo: a GPU alugada custa aproximadamente o que custa a API, antes de você ter pago por qualquer coisa que esteja rodando nela.

Essa é a comparação errada, e é a que a maioria das análises de construir vs. comprar deixa por aí. A comparação correta é por GPU, não por linha, e depende de um número que a NVIDIA não publicou.

GPT-Live-1 numa conta Tier 1 — 25 sessões simultâneas, o que dá $1,25 por minuto, ou $75 por hora, quando as 25 linhas estão ativas

• Nemotron VoiceChat 11B em uma única GPU de 80 GB — pelo número de sessões simultâneas que um modelo híbrido Mamba/Transformer de 11B conseguir acomodar em 80 GB, a aproximadamente o custo de aluguel da placa

Um modelo 11B num acelerador de 80 GB é muita folga, e 80 GB é um requisito que, na prática, compra uma enorme capacidade de batching. Se um único cartão suporta até seis conversas simultâneas, a auto-hospedagem é drasticamente mais barata do que a API a plena carga. Se suporta uma e meia, não é. Até que alguém faça benchmarking de concorrência com tráfego real, a posição honesta é que o ponto de equilíbrio provavelmente favorece a auto-hospedagem em volume e que nenhum dos fornecedores lhe deu o número para provar isso.

A two-column comparison scoreboard titled 'GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B - the scoreboard'. The GPT-Live-1 column lists Shape hosted API; Cost $0.05 / minute; Turn-taking 0.8 s, vendor-reported; Voices 12; Tool calling delegated to backend model; Ops burden none, vendor runs it. The Nemotron VoiceChat 11B column lists Shape open weights; Cost one 80 GB GPU, billed while idle; Turn-taking 448 ms on Full-Duplex-Bench 1.0; Voices 1 fixed voice, Aria; Tool calling in-session, separate output channel; Ops burden you run the GPU on Linux. A footer reads 'Nemotron turn-taking figure is a published benchmark; GPT-Live-1 latency is OpenAI's own and unreproduced.'

Onde o modelo aberto é genuinamente melhor, não apenas mais barato

A comparação de latência merece mais cuidado do que a de preço, porque, nesse eixo, o modelo aberto tem melhores evidências.

• Latência de troca de turno — O Nemotron VoiceChat 11B reporta 448 ms para troca de turno fluida no Full-Duplex-Bench 1.0, com latência de 480 ms para interromper e ceder o turno e taxa de retomada de 1,00 após interrupção do usuário. O valor do GPT-Live-1 é de 0,8 segundo, abaixo de 1,4, segundo a OpenAI.

Leia esses dois números lado a lado com a fonte anexada e o quadro se inverte. Os números da NVIDIA vêm de um conjunto de benchmarks publicado e especificado publicamente. Os da Ope​nAI vêm da Ope​nAI, comparando seu novo modelo com sua própria geração anterior, e não foram reproduzidos de forma independente. Com as evidências disponíveis, o modelo de pesos abertos é mensuravelmente mais rápido naquilo que faz um agente de voz parecer humano, e o modelo hospedado é mais rápido apenas de acordo com seus próprios materiais de imprensa.

A NVIDIA também reivindica uma primazia: o Nemotron VoiceChat 11B é descrito como o primeiro modelo full-duplex aberto que oferece suporte a chamadas de ferramentas em tempo real durante a conversa, usando um canal de saída separado e frases de espera predefinidas para que o agente possa continuar falando enquanto espera por uma API externa. O model card inclui três amostras de áudio, convidando você a ouvir exatamente isso — tomada de turno natural descrita como resposta de cerca de 450 ms, barge-in em que o modelo cede instantaneamente, e ferramentas chamadas ao vivo no meio da conversa. Essas amostras são do fornecedor e corroboram o número de 448 ms, em vez de testá-lo de forma independente, mas são, pelo menos, evidência audível anexada a um checkpoint baixável, em vez de um número em um post de lançamento. Esse é o mesmo problema arquitetural que o GPT-Live-1 resolve com delegação, respondido de forma diferente — o modelo aberto segura a linha sozinho; o modelo hospedado passa a tarefa para um modelo de raciocínio separado e deixa a camada de voz manter a conversa viva.

As semelhanças são tão instrutivas quanto as diferenças. Ambos fazem full duplex, ou seja, ambos escutam enquanto falam, em vez de alternar turnos. Ambos suportam interrupção e barge-in. Ambos foram treinados em fala numa escala que faz os antigos pipelines em cascata ASR-depois-LLM-depois-TTS parecerem três produtos separados parafusados juntos — o checkpoint da NVIDIA viu cerca de 550.000 horas de fala.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the openmdw-1.1 license tag, a model size of 11B params, 3,630 downloads last month, an inference-providers row stating the model isn't deployed by any Inference Provider, a model tree descending from NVIDIA-Nemotron-Nano-12B-v2-Base, three audio samples labelled natural turn-taking at roughly 450 ms response, barge-in where the model yields instantly, and tool calling live, and the description that NVIDIA NemotronLabs VoiceChat is an 11B end-to-end real-time speech full duplex model and the first open full-duplex model to support tool calling.

Aquilo de que você abre mão, e não é só dinheiro.

A primeira coisa de que você abre mão com o modelo aberto é a voz. O checkpoint disponibilizado usa uma única voz fixa, chamada Aria, e não oferece suporte a clonagem de voz nem a uma biblioteca de vozes. O GPT-Live-1 traz doze vozes que abrangem diferentes sotaques, dialetos e idiomas, e a Ope​nAI as remasterizou especificamente para este modelo. Se a voz do seu produto faz parte da identidade dele, ou se você precisa atender a vários mercados com agentes de vozes diferentes a partir de uma única implantação, isso é quase eliminatório por si só — e é a limitação menos visível em uma comparação de especificações, porque parece uma contagem de recursos, e não uma decisão de produto.

A segunda coisa da qual você abre mão é o teto de contexto. O modelo carrega um limite de enunciado no treinamento de cerca de 142 segundos e uma limitação prática quanto a manter mais de aproximadamente dois minutos de contexto de áudio. Uma chamada telefônica de vinte minutos não é um contexto contínuo único para este checkpoint; é uma sequência de segmentos que o sistema ao redor precisa gerenciar. Modelos hospedados geralmente absorvem essa gestão para você.

O terceiro é o que você tem permissão para fazer com ele. O cartão de modelo do Hugging Face traz a licença openmdw-1.1, enquanto parte da cobertura do lançamento o descrevia como de uso exclusivo para pesquisa, e a página do contêiner NGC apresenta os componentes como prontos para uso comercial ou não comercial. Três fontes, três leituras diferentes, e apenas o texto da licença rege. Essa discrepância é o tipo de coisa que aparece numa revisão jurídica três semanas antes do lançamento. Resolva isso antes de construir, não depois.

O quarto é operações. Uma GPU de 80 GB não é um item de linha que você pode desligar num domingo tranquilo: mesmo com tráfego zero, você continua pagando pela placa, e você é responsável pela curva de escalabilidade, pelas atualizações de driver, pelo planejamento de capacidade e pela escala de plantão de um caminho de áudio em tempo real em que uma conexão perdida é um cliente perdido. Também não há uma alternativa hospedada com a qual contar enquanto você chega lá — a linha de provedor de inferência do card do Hugging Face afirma claramente que o modelo não é implantado por nenhum provedor de inferência, então não existe uma versão paga por minuto desse checkpoint para prototipar. Ou você o auto-hospeda, ou não o usa. Esse trabalho é invisível na comparação por minuto e muito visível em um plano de contratação.

O híbrido que a maioria das equipes deveria realmente considerar

A forma de encarar isto que torna esta decisão tratável é que os dois modelos não têm de ser uma escolha binária. Um agente de voz normalmente tem uma camada de voz e uma camada de raciocínio, e é na camada de raciocínio que reside a flexibilidade.

O GPT-Live-1 é construído dessa forma por design. Sua camada de voz mantém a conversa viva enquanto o raciocínio é delegado, por meio da Responses API, a um modelo de texto comum — o próprio exemplo WebRTC publicado da OpenAI conecta esse backend ao GPT-5.6 Terra. Essa metade da sua stack é uma chamada de API normal, com preço por token e uma escolha real de fornecedores. O GPT-5.6 Terra é servido pelo OrcaRouter a $2,00 por milhão de tokens de entrada e $12,00 por milhão de tokens de saída, com um contexto de 1M de tokens e tanto /v1/chat/completions quanto /v1/responses expostos, ao lado de cerca de 190 outros modelos acessíveis com uma única chave.

Isso importa especificamente para um projeto de auto-hospedagem porque altera o perfil de risco. Se você subir o Nemotron VoiceChat 11B e ele não aguentar o seu tráfego, a metade de voz é um custo de GPU afundado — mas a metade de raciocínio pode ser movida, passar por failover ou ser dividida entre um modelo barato para turnos rotineiros e um modelo forte para escalonamentos, sem tocar na trajetória de áudio. Failover automático entre provedores upstream é a diferença entre uma tarde ruim e um trimestre ruim quando uma dependência de fonte única cai.

Registre claramente o que está e o que não está disponível onde: nem o GPT-Live-1 nem o Nemotron VoiceChat 11B são servidos pelo OrcaRouter. Cada um vem de sua própria origem — o endpoint Live Sessions da Ope​nAI, em um caso, e sua própria GPU, no outro. A vantagem de roteamento está inteiramente a jusante do áudio.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Em qual basear-se

• Escolha o GPT-Live-1 se quiser lançar neste trimestre, se precisar de mais de uma voz, se as suas conversas costumarem ultrapassar dois minutos de contexto contínuo, ou se o volume ainda não for suficientemente elevado para justificar uma GPU que cobra enquanto está inativa.

• Escolha o NVIDIA Nemotron VoiceChat 11B se você já usa GPUs de 80 GB, se precisa de alternância de turnos abaixo de 500 ms com base em evidências, e não em afirmações, se precisa que o áudio permaneça dentro da sua própria infraestrutura por razões de residência de dados, ou se está em um volume de chamadas em que o medidor por minuto da API é a maior linha da fatura.

• Crie um protótipo na API e faça o benchmark do checkpoint. A decisão depende de um número não publicado — sessões simultâneas por placa de 80 GB — e a única forma de obtê-lo é medi-lo no formato do seu próprio tráfego. Isso é uma semana de trabalho, e é a diferença entre uma decisão de infraestrutura defensável e um palpite disfarçado de decisão.