
NVIDIA NemotronLabs VoiceChat 11B: O Modelo de Voz Full-Duplex que a NVIDIA Lançou sem Anunciar
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
Dois cartões de modelo estão no mesmo repositório do Hugging Face e discordam entre si. O que é exibido na página chama o modelo NVIDIA NemotronLabs VoiceChat 11B, define a data de lançamento como 3 de agosto de 2026 e lista 11 bilhões de parâmetros. O segundo, um arquivo chamado overview.md que ninguém vê a menos que abra a aba Files, chama o mesmo modelo de 12B, data o lançamento em 16 de julho, traz uma seção de benchmarks que o cartão público deixa de fora, e ainda tem a palavra TODO no lugar onde deveria estar uma descrição de resultados. Nenhum dos cartões foi acompanhado de um post de lançamento, uma nota à imprensa, um relatório técnico ou um tweet da NVIDIA.
O que está ali não é um placeholder, no entanto. É um checkpoint de 44 GB que ouve e fala ao mesmo tempo: uma pilha única que recebe áudio do microfone e emite fala sintetizada, sem o habitual encadeamento de reconhecimento de fala para um modelo de linguagem e, em seguida, para text-to-speech. É construído sobre o backbone Nemotron Nano 9B v2; ele pode chamar ferramentas no meio da frase enquanto continua falando, e a NVIDIA afirma que é o primeiro modelo full-duplex aberto capaz de fazer isso.
Tudo abaixo é lido diretamente desse repositório — os dois cards, o config.json, e o índice de tensores dentro do arquivo de pesos, que nós mesmos parseamos para resolver a questão 11B versus 12B. Cada número de desempenho que a NVIDIA publica para este modelo é da própria NVIDIA, medido pela NVIDIA e não reproduzido. Existe exatamente uma medição independente dessa linhagem disponível publicamente, feita pela Artificial Analysis, e ela está registrada sob um nome diferente e uma contagem de parâmetros diferente — o que acaba sendo o aspecto mais interessante do lançamento.
O que está realmente no repositório
O repositório foi criado em 29 de julho de 2026 e modificado pela última vez em 4 de agosto. Ele contém dezessete arquivos: os dois cartões de modelo concorrentes, uma licença, um config.json, um model.safetensors de 44,4 GB, um diagrama de arquitetura, um diretório de tokenizador RNN-T, quatro breves notas de política sobre viés, segurança, privacidade e explicabilidade, e três arquivos .wav — uma demo de troca de turno, uma demo de interrupção (barge-in) e uma demo de chamada de ferramentas — incorporados como players de áudio no topo do cartão, para que você ouça o modelo antes de ler sobre ele.
Várias coisas estão ausentes, e elas importam mais do que a lista de arquivos.
• Não há paper para este modelo. O card cita cinco: VoiceBench, Full-Duplex-Bench 1.0, Full-Duplex-Bench v3, SALM-Duplex, Audio Flamingo 3, além do pré-print PersonaPlex, da própria NVIDIA. Nenhum deles é um relatório técnico do NemotronLabs VoiceChat. A arquitetura é descrita em cerca de três parágrafos e um diagrama, e essa é toda a descrição pública de como o modelo foi construído.
• Não há como chamá-lo. A página do Hugging Face afirma claramente que o modelo "não está implantado por nenhum Inference Provider." Não há endpoint hospedado, nem da NVIDIA nem de mais ninguém. A única thread aberta da comunidade no repositório é de um usuário pedindo à NVIDIA para adicionar um handler.py para que o checkpoint possa ser implantado nos Hugging Face Inference Endpoints — alguém que tentou executá-lo do jeito fácil e descobriu que não existe.
• Não há pipeline_tag nem library_name. É por isso que a página não tem widget de inferência nem rótulo de tarefa, e isso é um sintoma do problema mais profundo: config.json não é uma configuração do Transformers. É uma configuração de treinamento do NeMo de 32 KB, completa com um bloco AdamW, um agendador de taxa de aprendizado, intervalos de buckets do dataloader e uma divisão de validação. Você não pode apontar AutoModel.from_pretrained para isso. Você clona um branch específico do repositório de Speech da NVIDIA — nemotron-labs-voicechat —, cria um ambiente conda fixado em Python 3.12, PyTorch 2.10 e Transformers 4.56, compila causal-conv1d e mamba-ssm sem isolamento de build e executa o script deles.
O contador de downloads reflete tudo isso. 107 curtidas contra 80 downloads no primeiro mês do modelo é a assinatura de um lançamento que as pessoas salvaram nos favoritos e não executaram.

Contamos os parâmetros, e 11B vence
Um arquivo safetensors carrega um cabeçalho JSON que lista cada tensor, sua forma e seu dtype, então a contagem de parâmetros não é uma questão de opinião. Extraímos o cabeçalho e somamos: 11.095 milhões de parâmetros em 1.626 tensores float32, ocupando 44,38 GB. Portanto, o cartão renderizado está correto e overview.md está desatualizado — este é um modelo de 11B, e o valor 12B é um resquício.
A árvore de modelos da Hugging Face explica onde um 12B pode ter se infiltrado. A linhagem que ela traça é: Nemotron Nano 12B v2 Base, depois Nemotron Nano 12B v2, depois Nemotron Nano 9B v2 e, só então, este modelo. A própria família de backbones de texto da NVIDIA contém um 12B e um 9B, sendo o 9B o descendente podado do 12B, e o VoiceChat é construído sobre o 9B. Uma ficha redigida mais cedo nessa cadeia naturalmente teria carregado o número maior.
O cabeçalho também se divide claramente entre as duas metades da arquitetura:
• Lado de compreensão — 10.098B. Desse total, 7.714B correspondem à pilha de transformadores do Nemotron Nano v2, 0.609B ao codificador de fala, e três matrizes separadas de 131,072 × 4,480 ocupam 0.587B cada.
• Lado da fala — 0,997B. Um backbone de texto-para-fala com 28 camadas e 1.152 de largura a 0,595B, uma cabeça de saída de mistura de gaussianas a 0,159B e um codec de áudio neural cujo codificador e decodificador têm 0,092B cada.
Duas consequências práticas decorrem do dtype. A primeira é que o download de 44 GB não é um modelo grande; é um modelo comum enviado em float32; converta-o para bfloat16 e os pesos ficam com cerca de 22 GB. A segunda é que o limite mínimo declarado pela NVIDIA de uma GPU de 80 GB é uma consequência dessa escolha, e não do tamanho do modelo, e qualquer pessoa com uma placa de 48 GB que esteja disposta a converter o checkpoint por conta própria não está obviamente excluída — embora ninguém tenha publicado uma execução confirmada nessa configuração, então trate isso como aritmética, não como uma promessa.
Como ele ouve e fala ao mesmo tempo
"Full duplex" é o ponto central do lançamento, e a configuração mostra como ele é obtido. Três escolhas de design fazem o trabalho.
• O codificador de fala não pode olhar adiante. É um Conformer de 24 camadas e 8 cabeças cujo contexto de atenção é definido para [70, 0] — setenta quadros de contexto à esquerda e zero quadros de contexto à direita. Um reconhecedor convencional espreita o áudio após o momento atual para desambiguar o que acabou de ouvir; este é proibido de fazê-lo, o que custa precisão e compra a capacidade de emitir uma decisão no instante em que um quadro chega.
• Tudo é quantizado em 80 ms. A duração do quadro na configuração é de 0,08 segundos, correspondendo ao tamanho de chunk de 80 ms que a NVIDIA descreveu em outros lugares para essa linha de trabalho. O modelo decide, a cada 80 ms, se continua ouvindo ou se começa a falar. Esse ritmo é o que faz a interrupção parecer imediata, e não apenas educada.
• As chamadas de ferramenta saem da própria boca deles. Lembre-se daquelas três matrizes com formato idêntico e vocabulário de 131.072. Uma é o embedding de entrada, uma é a cabeça comum do modelo de linguagem — e a terceira é nomeada function_head. O "canal de saída separado para scripts de chamada de ferramenta" na descrição do card é uma terceira projeção de saída literal, com 587 milhões de parâmetros, rodando em paralelo com a geração de fala. Essa é a razão arquitetural pela qual o modelo pode despachar uma chamada de ferramenta sem interromper a conversa, e é um compromisso real de design, e não uma convenção de prompt.
A jusante, o decodificador de texto-para-fala prevê códigos para um codec de quantização vetorial residual com 31 quantizadores e taxas de subamostragem de 7, 7 e 9 — uma redução de 441× que coloca a taxa de tokens de áudio em 50 quadros por segundo, com saída de 22,05 kHz. A entrada é de 16 kHz. Há também um decodificador RNN-T e uma rede conjunta no checkpoint, e é por isso que as saídas declaradas do modelo incluem uma transcrição do usuário juntamente com seu próprio texto e áudio: a transcrição é uma verdadeira cabeça de reconhecimento, não um subproduto. A voz padrão se chama Aria, e um clipe de referência de três segundos condiciona o locutor.
Um detalhe adicional da configuração merece destaque porque corrobora uma limitação declarada: o dataloader de treinamento limita as utterances a 142,39 segundos. O aviso na ficha do modelo de que ele não suporta mais do que dois minutos de contexto de áudio é visível no pipeline de dados que o produziu.
As pontuações, e quem realmente as mediu.
As principais alegações da NVIDIA são latência e ranking. No Full-Duplex-Bench 1.0, ela relata 448 ms para assumir um turno suave e 480 ms para ceder quando interrompida, com uma taxa de tomada de turno de 0,82 na alternância suave de turnos e 1,0 na interrupção do usuário, e uma pontuação do avaliador GPT-4o de 4,33 no tratamento de interrupções. Ela alega a posição #2 entre os modelos full-duplex abertos no VoiceBench e #2 entre os modelos abertos no Full-Duplex-Bench. Todas essas são execuções da própria NVIDIA.
Alinhe-os com o mundo exterior e duas lacunas se abrem.
• Em raciocínio de fala, o número do fornecedor está cerca de oito pontos acima.não renderizadooverview.mdrelata 37,0% no Big Bench Audio. A Artificial Analysis mediu independentemente essa linhagem em 29,2%. Mesmo benchmark, mesma família, uma diferença grande o suficiente para mudar onde o modelo se posiciona no ranking.
• No VoiceBench, o número informado pelo fornecedor é modesto demais. A ficha técnica afirma o #2 entre os modelos full-duplex abertos; o leaderboard público do VoiceBench coloca este modelo em 58.10, que é o topo do grupo full-duplex aberto, à frente do Freeze-Omni em 55.20 e do Moshi em 29.51. A própria minuta da NVIDIA relata 55.1 para si — abaixo do número que o leaderboard agora lista.
Há também uma pequena peculiaridade: a própria tabela comparativa da NVIDIA avalia seus rivais de forma mais generosa do que a Artificial Analysis. A ficha preliminar coloca o Freeze-Omni em 33,4% e o PersonaPlex 7B em 19,1% no Big Bench Audio; a Artificial Analysis mede 33,9% e 12,6%. A ordem dos concorrentes se mantém de qualquer forma, o que é tranquilizador, mas é um lembrete de que a plataforma de um fornecedor e uma independente não retornam os mesmos números nem mesmo para terceiros.

O gráfico torna inevitável a manchete honesta. Entre os modelos full-duplex abertos, este é um avanço genuíno — mais que duplica o PersonaPlex em raciocínio falado e coloca o Moshi em uma categoria completamente diferente. Medido em relação ao que você pode comprar, não chega nem perto: Step-Audio R1.1 a 96%, Voice Agent do Grok 4.5 e Gemini 2.5 Flash (Thinking) a 92%, Nova 2.0 Sonic a 87%. Isso é uma diferença de aproximadamente três para um em raciocínio a partir de entrada falada.
A maneira mais limpa de ver o que o full duplex custa atualmente está no próprio catálogo da NVIDIA. No VoiceBench, o NVIDIA Nemotron 3 Nano Omni 30B A3B — um modelo maior que não é full duplex — pontua 89,39, contra 58,10 do VoiceChat. Aproximadamente trinta pontos de qualidade de assistente é o preço do tratamento de interrupções e da troca de turnos abaixo de 500 ms, pelo menos nesta geração. Se o seu produto não precisa de um modelo que possa ser interrompido no meio de uma palavra, você está pagando muito por um recurso que não vai usar.
A chamada de ferramentas é o destaque, e também a parte mais fraca.
"Primeiro modelo full-duplex aberto a suportar chamada de ferramentas" é a afirmação sobre a qual o lançamento se sustenta, e os números por trás dela são desiguais. Em uma conversão por voz do BFCL-v3, a NVIDIA relata uma média de 56,1%: 58,5% simples, 62,5% múltiplas, 42,5% paralelas, 27,5% paralelas-múltiplas e 89,6% em recusar corretamente chamadas irrelevantes. No Full-Duplex-Bench v3, a divisão é ainda mais acentuada.
• Seleção de ferramentas — 82,5%. Escolher a função certa da lista, o que a NVIDIA descreve com justiça como competitivo com modelos de fronteira.
• Precisão dos argumentos — 44.2%. Preencher os parâmetros dessa função corretamente a partir do que o usuário disse.
• Pass@1 — 33%. Acertar a chamada inteira na primeira tentativa.
Um modelo que sabe qual ferramenta quer com dois terços mais de confiabilidade do que consegue preencher os argumentos da ferramenta é um modelo que consultará com confiança o clima da cidade errada. Em um agente de texto, você pegaria isso com uma camada de validação e uma nova tentativa; em uma chamada de voz ao vivo, a nova tentativa é audível, e o cartão observa que o modelo não deve tentar novamente uma chamada com falha — ele é instruído a dizer ao usuário que a API tem um problema.
As restrições operacionais em torno disso são rigorosas, e a NVIDIA as lista sem muito alarde: no máximo cinco ferramentas por sessão antes que a qualidade se degrade, sem chamadas simultâneas confiáveis de múltiplas ferramentas, sem forma de o usuário interromper enquanto uma ferramenta está em execução, e uma tendência, em conversas mistas, de responder com base no próprio conhecimento em vez de chamar a ferramenta que deveria. Respostas longas de ferramentas travam o agente, que é o que o recurso de "mensagem de espera" existe para encobrir — você pré-escreve uma frase que o agente fala no momento em que uma chamada é disparada, para que o silêncio tenha algo nele.
Uma peculiaridade que vai custar uma tarde a alguém: prompts do sistema e respostas de ferramentas devem ser somente ASCII. Sem travessões, sem aspas curvas, sem símbolos de grau, sem emojis. A saída da ferramenta precisa ser achatada em frases ASCII simples e adequadas para fala antes de chegar ao modelo, o que significa que uma resposta de API JSON não pode ser passada crua.
Quanto custa para executar, e a licença que impede você
Comece pelo hardware. A documentação do branch da NVIDIA pede uma GPU com pelo menos 80 GB de memória, o que aponta para uma H100 ou H200, e a configuração testada é uma H100 com vLLM. A capacidade sob demanda de H100 custa aproximadamente US$ 2–3 por hora nas nuvens de GPU comuns, então uma instância em execução contínua custa algo em torno de US$ 1.500–2.200 por mês, antes de você escrever qualquer código de aplicação, contratar alguém para mantê-la ou atender a uma segunda conversa simultânea.
Agora a comparação. A Artificial Analysis normaliza o preço de fala-para-fala hospedado para custo por hora de áudio de entrada, e a faixa atual vai de cerca de US$ 1,42/hora na extremidade barata a US$ 10,75/hora para o nível premium mais caro, com uma opção bem avaliada de mercado intermediário como o Grok Voice Think Fast 2.0 chegando a US$ 4,80/hora — isso dá US$ 0,08 por minuto de áudio.

Leia esses dois parágrafos em conjunto e a defesa do self-hosting é mais fraca do que parece. Um H100 dedicado só é mais barato do que um endpoint hospedado de preço médio se você o mantiver verdadeiramente ocupado, e é mais caro do que o segmento mais barato do mercado hospedado quase independentemente da utilização — ao mesmo tempo em que você também absorve a engenharia, o plantão e um modelo que pontua 29,2% onde as opções hospedadas pontuam 87–96%.
E então há o muro. A licença é o OpenMDW License Agreement v1.1, e o cartão afirma em seu próprio bloco de citação que o modelo "está pronto apenas para fins de pesquisa." O código no branch do GitHub é Apache-2.0; os pesos não são. Você pode baixá-lo, estudá-lo, ajustá-lo finamente, avaliá-lo e escrever sobre ele. Você não pode colocá-lo diante de clientes. Portanto, todo argumento econômico acima é acadêmico para uma empresa que tenta lançar um produto de voz — a questão nunca foi se a matemática da GPU funcionava.
É também por isso que diremos o óbvio claramente: NemotronLabs VoiceChat 11B não é invocável por meio do OrcaRouter, porque não é invocável por meio de nada. O que uma chave realmente lhe dá é a linha de base contra a qual ele deve ser medido — os modelos hospedados de voz e áudio ficam atrás de uma única API com margem de 0%, o que significa que repassamos o preço de tabela do provedor diretamente. Portanto, quando um fornecedor reduz sua tarifa de áudio, o valor menor é o que você paga naquele dia, em vez de após um ciclo de contrato. Se você está precificando um agente de voz, esse valor por minuto é o número que uma GPU de 80 GB precisa superar, e vale a pena saber exatamente antes de se comprometer com um rack.
O problema do nome: 11B, 12B, NemotronLabs, Nemotron 3
É aqui que a maior parte da cobertura inicial errou, então vale a pena ter cuidado sobre o que está estabelecido e o que não está.
Quatro dos próprios canais da NVIDIA descrevem este trabalho sob três rótulos diferentes. A Hugging Face publica "NVIDIA NemotronLabs VoiceChat 11B" com pesos abertos e licença somente para pesquisa. O blog de desenvolvedores da NVIDIA, em março de 2026, descreveu "Nemotron 3 VoiceChat" como um modelo full-duplex de 12B parâmetros em acesso antecipado, visando menos de 300 ms de latência ponta a ponta em chunks de 80 ms, com um programa de acesso antecipado que oferece containers de referência, resultados de benchmark e um caminho de fine-tuning, e prometendo "pesos abertos e inspecionáveis para implantação empresarial." O leaderboard público do VoiceBench e a Artificial Analysis registram suas entradas como "Nemotron 3 VoiceChat (V1)", 12B.
O que é possível saber: as descrições da arquitetura correspondem componente por componente — codificador Fast Conformer, espinha dorsal Nemotron Nano v2 9B, decodificador de texto para fala da NVIDIA, canal separado de chamada de ferramentas, quadros de 80 ms, uma pilha unificada. O cartão não renderizado no repositório do Hugging Face usa o valor de 12B que as outras superfícies usam. É a mesma linha de trabalho, e as entradas de terceiros quase certamente estão medindo esta família.
O que não está confirmado: que o checkpoint que você pode baixar hoje é bit por bit o que a Artificial Analysis e a VoiceBench avaliaram, ou o que o programa de acesso antecipado disponibiliza. Dois detalhes argumentam contra essa suposição. As contagens de parâmetros diferem — 11,095B medidos contra 12B conforme registrado. E as metas de latência diferem acentuadamente — a proposta empresarial do blog é inferior a 300 ms de ponta a ponta, enquanto a ficha técnica publicada indica 448 ms e 480 ms no Full-Duplex-Bench. Esses podem ser pontos de medição diferentes no mesmo modelo, ou modelos diferentes. A NVIDIA não disse, porque a NVIDIA não disse absolutamente nada sobre este lançamento.
A conclusão prática: se você citar um número para este modelo, cite de qual superfície ele veio. Coberturas que atribuem os 29,2% da Artificial Analysis à ficha do modelo no Hugging Face, ou os 37,0% da NVIDIA a um teste independente, mesclaram duas coisas que a própria NVIDIA mantém em documentos separados com contagens de parâmetros diferentes.
Onde quebra.
A seção de limitações do cartão de rascunho é excepcionalmente franca, e o branch do GitHub adiciona mais. Coletado:
• Somente inglês, e nenhum roadmap multilíngue no repositório.
• Memória de dois minutos. Conversas além de uma janela de áudio de dois minutos podem não ser retidas — um limite rígido para chamadas de suporte ou qualquer coisa que precise lembrar o que foi acordado há quatro minutos.
• Mais burro que seu próprio backbone. A NVIDIA afirma que ele pode ter desempenho inferior ao Nemotron Nano 9B v2 em conhecimento, seguimento de instruções e segurança, porque foi ajustado para naturalidade conversacional. Não foi explicitamente treinado para raciocínio ou alinhamento; raciocínio em múltiplas etapas e aritmética são apontados como pontos fracos.
• Nenhum backchanneling confiável. O "mm-hm" que sinaliza que um humano ainda está ouvindo não é tratado sistematicamente.
• Ele vai cortá-lo no meio da frase. As notas da ramificação listam interromper o usuário em uma pausa no meio da frase e "continuação descontrolada / fala consigo mesmo" entre os modos de falha conhecidos — o custo direto de um codificador com zero contexto à direita.
• Apenas ambientes silenciosos. Explicitamente inadequado para ambientes ruidosos ou reverberantes, especialmente onde há fala ao fundo. Isso descarta a maioria dos ambientes de call center e a maioria dos carros.
Quem deveria realmente baixar isto
Pesquisadores que trabalham com modelagem de fala duplex são os que mais se beneficiam aqui, e devem avançar: um checkpoint aberto de 11B com um canal funcional de chamada de ferramentas, treinado em aproximadamente 550.000 horas de áudio mesclado entre real e sintético, é um ponto de partida muito melhor do que reimplementar a partir do artigo SALM-Duplex. A licença de pesquisa não é uma restrição para esse trabalho.
Equipes que estão construindo agentes de voz devem ler o cartão e pular o download. Nada que você aprender com um checkpoint float32 de 44 GB que você não pode enviar vai mudar sua arquitetura, e a lição honesta dos benchmarks é que full duplex de ponta a ponta ainda não é competitivo com um bom modelo hospedado no que os usuários mais notam, que é se o assistente os entendeu. Enquanto isso, a movimentação sensata é construir contra um endpoint hospedado e manter a troca barata — uma chave em mais de 200 modelos com failover automático significa que um incidente no provedor não derruba sua linha telefônica no meio de uma chamada, e significa que migrar para um modelo full duplex aberto mais tarde é uma mudança de configuração, não uma reescrita.
Empresas que se preocupam especificamente com isso devem solicitar o acesso antecipado ao Nemotron 3 VoiceChat em vez de construir com base nos pesos do Hugging Face. É nesse programa que estão a licença implantável, os contêineres de referência e a alegação de latência inferior a 300 ms. O checkpoint público é uma prévia de pesquisa da mesma ideia, publicada sem a documentação que permitiria o seu uso.
Três perguntas que este repositório vai continuar recebendo
Posso usá-lo comercialmente se eu fizer um fine-tuning pesado? Não. O OpenMDW v1.1, juntamente com a declaração de "somente para fins de pesquisa" do card, rege os pesos e qualquer coisa derivada deles; a licença Apache-2.0 no branch do GitHub cobre o código de inferência, não o checkpoint. O fine-tuning não "lava" uma licença. Se direitos comerciais são o que você precisa, o programa de acesso antecipado é o caminho que a NVIDIA realmente criou para isso.
Este é o mesmo modelo que está nos leaderboards? Mesma família, quase certamente; artefato idêntico, não confirmado. As entradas no leaderboard e no Artificial Analysis estão registradas como "Nemotron 3 VoiceChat (V1)" em 12B, o checkpoint para download mede 11.095B, e a NVIDIA não publicou nada que os concilie. Use os números do leaderboard como a melhor leitura independente disponível sobre a linhagem, não como uma medição verificada do arquivo no Hugging Face.
Funcionará em algo menor que um cartão de 80 GB? Provavelmente, com trabalho, e ninguém publicou uma prova. Os pesos são float32, então uma conversão para bfloat16 deve reduzir aproximadamente 44 GB de parâmetros para cerca de 22 GB, o que deixa margem real em um cartão de 48 GB antes de considerar o cache KV, o codec e os buffers de streaming. Mas o caminho suportado é vLLM em um H100 de 80 GB, o contêiner de implantação é feito para isso, e a única configuração testada que a NVIDIA reporta é essa. Reserve tempo, não apenas VRAM.
O que assistir
Três coisas mudariam, cada uma, a leitura deste lançamento. {{1}}Um relatório técnico, ou mesmo um model card que pare de se contradizer, nos diria se o checkpoint de 11B é o artefato que os leaderboards mediram.{{/1}} {{2}}Uma reprodução independente de latência — alguém de fora da NVIDIA confirmando 448 ms de alternância de turno em seu próprio hardware — transformaria a alegação mais atraente do lançamento de marketing em fato.{{/2}} {{3}}E uma licença comercial, ou um endpoint hospedado por qualquer pessoa, moveria isso de uma curiosidade que só existe no papel para uma opção real para as muitas equipes que trocariam de bom grado um pouco da qualidade de raciocínio por um agente de voz que pode ser interrompido.{{/3}}
Até que uma dessas chegue, a descrição precisa é limitada, mas genuinamente notável: a NVIDIA publicou o checkpoint de voz full-duplex de código aberto mais forte já medido, concedeu a ele o primeiro canal funcional de chamada de ferramentas nessa categoria, licenciou-o de modo que ninguém possa distribuí-lo e não mencionou que tudo isso aconteceu.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
