Cartão de título principal para o artigo sobre o vazamento do Nemotron 4: manchete 'Nemotron 4', subtítulo 'Família de pesos abertos de 1 trilhão de parâmetros da NVIDIA — divulgada, não lançada', e dois chips rotulados 'divulgado' e 'não lançado'. Logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Vazamento do Nemotron 4: a resposta da NVIDIA à fronteira com 1 trilhão de parâmetros e pesos abertos

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

1 trilhão de parâmetros. Esse é o piso relatado para o maior modelo do Nemotron 4, o carro-chefe da próxima família de pesos abertos da NVIDIA — e o número só parece grande até você compará-lo com o que já foi lançado. No último mês, a Moonshot AI lançou o Kimi K3 com 2,8 trilhões de parâmetros totais, a Alibaba revelou o Qwen3.8-Max com 2,4 trilhões, e o atual carro-chefe da própria NVIDIA, o Nemotron 3 Ultra, está em 550 bilhões. O The Information noticiou em 11 de agosto de 2026 — citando vários funcionários que trabalham no projeto — que o Nemotron 4 é a resposta da NVIDIA: uma família de pesos abertos cujo maior modelo deve começar em cerca de 1 trilhão de parâmetros, aproximadamente o dobro do Nemotron 3 Ultra.

Nada aqui foi lançado. A NVIDIA reconheceu que está construindo uma família Nemotron 4, mas não confirmou o alvo de parâmetros, o orçamento, o cronograma ou os detalhes da aliança que The Information atribui a funcionários não identificados. Trate todos os números neste artigo como "relatados", não "especificados". O objetivo de um texto sobre vazamento é separar o pequeno núcleo confirmado do halo maior relatado — e dizer quais partes importam quando a ficha técnica real chegar.

O vazamento de uma linha, detalhado

Primeiro, o nome, porque vai confundir você nos resultados de busca: a NVIDIA já lançou um modelo chamado Nemotron-4-340B em junho de 2024. O novo Nemotron 4 é uma família diferente e maior — a sucessora da linha Nemotron 3 (Nano, Super, Ultra) lançada este ano — reutilizando o nome "Nemotron 4" para a geração seguinte. Este artigo é sobre o novo.

O que The Information realmente noticiou: a NVIDIA está desenvolvendo o Nemotron 4 como uma família de modelos de código aberto voltados para o topo do ranking de pesos abertos, e espera-se que o modelo principal tenha "pelo menos 1 trilhão de parâmetros". A NVIDIA não definiu uma data de lançamento, não iniciou a execução final do treinamento — um processo que os funcionários esperam que leve meses — e definiu apenas os dados de pré-treinamento e a arquitetura; a especificação ainda está em aberto. Dois funcionários disseram que a família pode ficar pronta já no final do outono; outros esperam que seja mais tarde.

O mesmo relatório anexa um orçamento: cerca de US$ 28 bilhões em acordos plurianuais de serviços de nuvem vigentes até o início de 2031, aproximadamente três vezes o que a NVIDIA divulgou um ano antes, com cerca de US$ 7 bilhões destinados ao atual ano fiscal. Ele também observa que o artigo de pesquisa do principal modelo anterior listava 570 autores, e o Nemotron 4 envolve ainda mais — um ex-funcionário disse ao The Information que "todos querem participar". Tudo isso não foi divulgado pela NVIDIA.

Comparison scoreboard 'Nemotron 3 Ultra vs Nemotron 4 — shipped vs reported': Parameters 550B total / 55B active vs at least 1T total / TBD active; Release June 4, 2026 vs no date set; Weights open now vs not yet; Status shipped and verifiable vs employee-reported; License OpenMDW-1.1 vs not announced; Price ~$0.68 / $2.68 per 1M vs nothing hosted yet. Footer: Nemotron 3 Ultra figures per NVIDIA and Artificial Analysis; Nemotron 4 per The Information, unconfirmed.

Por que o número do tamanho é a parte menos interessante

A história óbvia é: "A NVIDIA está indo para trilhões de parâmetros." A menos óbvia é que a fronteira de pesos abertos chegou lá primeiro. A Kimi K3 abriu seus pesos em 27 de julho com 2,8 trilhões de parâmetros totais — cerca de 104 bilhões ativos por token em uma configuração de mistura de especialistas — e a Qwen3.8-Max da Alibaba, revelada em 19 de julho, é um modelo de 2,4 trilhões totais com aproximadamente 95 bilhões ativos. Diante disso, um modelo principal Nemotron 4 com "pelo menos 1 trilhão" dobraria o Nemotron 3 Ultra, mas ainda ficaria atrás dos líderes em tamanho, e ambos os líderes são chineses.

Screenshot of the Artificial Analysis models page comparing intelligence index, price per 1M tokens, output speed, and context window across frontier models, with Claude Opus 5 leading the intelligence highlights.

Isso torna a contagem total de parâmetros a lente errada por completo. Em um modelo de mistura de especialistas, o que determina custo e velocidade é a contagem de parâmetros ativos por token, não o total divulgado. Um Nemotron 4 com 1 trilhão de parâmetros totais poderia ter cerca de 100 bilhões de ativos — exatamente na faixa do Kimi K3 e do Qwen3.8-Max — ou metade disso. O próximo número a vazar é o que importa, e ele ainda não vazou.

Infographic 'The trillion-parameter open frontier' listing four models with total-parameter counts: Kimi K3 2.8T (Moonshot AI), Qwen3.8-Max 2.4T (Alibaba), Nemotron 4 at least 1T total, reported (NVIDIA), Nemotron 3 Ultra 550B (NVIDIA), with footer 'Total-parameter counts; Nemotron 4 per The Information, unconfirmed.'

A outra direção também é digna de nota: o DeepSeek V4-Flash, lançado em 31 de julho sob licença MIT, seguiu o caminho oposto — 284 bilhões no total, posicionado pelo preço em vez da escala, com um custo estimado em cerca de US$ 0,14 por milhão de tokens de entrada. O mercado está recompensando ambos os extremos. Escala não é a estratégia; é uma estratégia.

A posição da NVIDIA explica a mudança. A The Information reporta que o Nemotron 3 Ultra ocupa o segundo lugar entre os modelos de pesos abertos dos EUA — atrás do Inkling, da Thinking Machines — e fora do nível superior do ranking global de modelos abertos. O Nemotron 4 é a tentativa de voltar à conversa de fronteira, e os próprios executivos da NVIDIA a enquadram como uma jogada de soberania: a VP de IA generativa Kari Briski disse que a NVIDIA investe no Nemotron porque "toda empresa e todo país precisa de modelos abertos de fronteira acessíveis para fortalecer a segurança e a proteção, acelerar a inovação e fornecer uma base na qual possam confiar de uma geração para a outra." Jensen Huang tem feito o mesmo argumento no X, defendendo que modelos abertos "fortalecem a segurança e a cibersegurança, aceleram a inovação e a difusão, e permitem soberania." A tensão estrutural é real — a NVIDIA supostamente possui cerca de US$ 30 bilhões da OpenAI — mas a aposta é que modelos abertos expandem o bolo de GPUs em vez de encolhê-lo. Como disse o CEO da LMArena, Anastasios Angelopoulos: "Não importa qual empresa crie um ótimo modelo de código aberto, a NVIDIA vence."

A Coalizão Nemotron é a parte a observar.

O Nemotron 4 não é um projeto solo, e esse é o detalhe que a maioria das coberturas ignora. Na GTC de 16 de março de 2026, a NVIDIA anunciou a Nemotron Coalition — oito membros fundadores: Black Forest Labs, Cursor, LangChain, Mistral AI, Perplexity, Reflection AI, Sarvam e Thinking Machines Lab — organizada para reunir pesquisa, dados e computação em prol dos "modelos abertos de fronteira". Seu primeiro projeto é um modelo base co-desenvolvido pela Mistral AI e pela NVIDIA, treinado no NVIDIA DGX Cloud, que, segundo a coalizão, será de código aberto e servirá de base para a família Nemotron 4.

O The Information acrescenta os detalhes do trabalho: Reflection, Cursor, Thinking Machines e Mistral são colaboradores confirmados; a Prime Intellect contribuiu com 300.000 ambientes de simulação para treinamento; a Cognition discutiu o fornecimento de dados de treinamento de código. O CEO da Prime Intellect, Vincent Weisser, enquadrou a aliança como uma ação coletiva contra o que ele chamou de monopólio de um único modelo "semelhante a um deus". O que isso significa na prática: o Nemotron 4 pode ser lançado como uma base de consórcio que cada membro ajusta para seu próprio produto, em vez de um checkpoint de um único fornecedor. Isso tornaria "modelo NVIDIA de pesos abertos" a categoria errada — a base é o artefato interessante.

Confirmado, relatado, desconhecido

• Confirmado — a NVIDIA está trabalhando em uma família Nemotron 4 (declaração da empresa). A Coalizão Nemotron existe e está construindo um modelo base aberto com a Mistral AI (NVIDIA, março de 2026).

• Reportado, não confirmado — a meta principal de "pelo menos 1 trilhão"; o cronograma do final do outono; o compromisso de nuvem de ~US$ 28 bilhões com ~US$ 7 bilhões neste ano fiscal; quais membros da coalizão contribuem com o quê.

• Desconhecido — contagem de parâmetros ativos, comprimento do contexto, combinação de modalidades, termos de licença, preço, quais checkpoints são lançados primeiro e se a base co-desenvolvida com a Mistral realmente se torna o alicerce da família.

Linha do tempo e o que assistir

Não há data de lançamento. A execução final do treinamento ainda não começou; funcionários a descrevem como algo que levará meses, e as estimativas variam de "final do outono" (duas fontes) a mais tarde. Enquanto isso, a NVIDIA manteve a linha em movimento: lançou o Nemotron 3.5 Lightning, um agente trabalhador de 31,6B parâmetros publicado em 11 de agosto — no mesmo dia em que o relatório do Nemotron 4 veio a público — junto com o NeMo Switchyard, o software de roteamento de código aberto da própria NVIDIA. Em outras palavras, a NVIDIA está iterando ativamente a linha enquanto o carro-chefe ainda está na prancheta.

O que assistir, em ordem aproximada de importância:

• Parâmetros ativos — o total é o destaque; a contagem de ativos decide custo e velocidade. Uma MoE de ~1T no total com ~100B ativos muda completamente o cenário em comparação com uma de ~50B.

• Pontuações independentes — não existe avaliação de terceiros para um modelo que não foi treinado. Acompanhe o Artificial Analysis Intelligence Index quando um checkpoint hospedado aparecer.

• Termos de licença — Nemotron 3 Ultra é distribuído sob OpenMDW-1.1, permissivo, mas não MIT ou Apache 2.0. Se o Nemotron 4 segue ou endurece ainda não foi decidido, e para uma empresa que constrói sobre os pesos, isso decide tudo.

• {{1}}Quais tamanhos serão lançados primeiro — a Nemotron 3 chegou como uma família (Nano, Super, Ultra). Espere uma variedade de tamanhos da Nemotron 4, e espere os menores antes do carro-chefe.{{/1}}

A base Mistral — se o modelo base da coalizão realmente se torna o alicerce da família é a questão estrutural por trás de toda a conversa sobre parâmetros.

• Preço — nada é hospedado, então nada é precificado. Quando um parceiro de hospedagem lista o Nemotron 4, o preço de repasse é o que você realmente pagará.

O que isso significa para sua camada de inferência

Você não pode chamar o Nemotron 4 hoje — ninguém pode — então a questão prática é o quanto da sua stack deve mudar para acomodar um modelo cuja ficha técnica ainda está em movimento. A resposta é a mesma que para qualquer modelo de fronteira ainda não lançado: mantenha a camada de inferência agnóstica em relação ao modelo. Se você rotear por uma única API que atende 200+ modelos, uma nova família Nemotron é uma mudança de configuração, não uma reescrita. O OrcaRouter repassa o preço de tabela do provedor com margem de 0%, então o que quer que um host eventualmente cobre pelo Nemotron 4 é exatamente o que você paga, e um corte de preço do fornecedor entra em vigor no mesmo dia em que é feito. O failover automático é a ferramenta para um primeiro lançamento não comprovado: direcione o tráfego inicial para o novo modelo, recorra a uma alternativa estável quando ele estagnar ou apresentar erros, e promova-o para produção somente depois que ele conquistar suas cargas de trabalho. Nada disso exige apostar um caminho de produção em um vazamento — o que é exatamente a postura correta quando a ficha técnica é tão provisória.

Perguntas Frequentes

Quando o Nemotron 4 será lançado?

Nenhuma data foi definida. Funcionários disseram ao The Information que a execução final do treinamento ainda não começou e levará meses; dois disseram que o final do outono de 2026 é possível, e outros esperam que seja mais tarde. Trate o "final do outono" como uma estimativa otimista vinda de dentro do projeto, não como um cronograma.

O Nemotron 4 será de código aberto?

A intenção declarada da NVIDIA é {{1}}pesos abertos{{/1}}, e o primeiro projeto da Coalizão Nemotron — o modelo base codesenvolvido com a Mistral — tem o compromisso de ser {{2}}de código aberto{{/2}}. Mas {{3}}"pesos abertos"{{/3}} não é "código aberto": o Nemotron 3 Ultra é distribuído sob a licença {{4}}OpenMDW-1.1{{/4}}, que é mais permissiva que os termos antigos da NVIDIA, mas ainda não é MIT ou Apache 2.0. A licença específica do Nemotron 4 não foi anunciada.

"Pelo menos 1 trilhão de parâmetros" é uma especificação real?

É uma meta com origem em funcionários, noticiada pelo The Information, não uma especificação confirmada, e o mesmo relatório diz que o número pode mudar. Mesmo com 1 trilhão no total, ficaria atrás do Kimi K3 (2,8 T) e do Qwen3.8-Max (2,4 T) em tamanho bruto; a contagem de parâmetros ativos — que não vazou — é o número que determinará custo e velocidade.

Devo esperar pelo Nemotron 4 antes de escolher um modelo?

Não. Está a meses de distância, na melhor das hipóteses, e não está comprovado. Escolha o melhor modelo disponível para a tarefa agora e mantenha a camada de roteamento flexível; quando o Nemotron 4 for de fato lançado, avalie-o da mesma forma que avaliaria qualquer novo modelo — parâmetros ativos, benchmarks independentes, licença e preço — em vez do total alardeado.

Conclusão

A família é real; os números são estimativas. A NVIDIA confirmou que está construindo o Nemotron 4, e a estrutura de coalizão ao redor dele é a parte mais interessante da história — mas cada número de destaque no vazamento, do piso de 1 trilhão ao cronograma do final do outono até o orçamento de US$ 28 bilhões, vem de funcionários não identificados e pode mudar. A fronteira de pesos abertos já ultrapassou a marca de trilhão de parâmetros, liderada por laboratórios chineses, e a resposta da NVIDIA é um modelo-base de consórcio mais uma promessa. Para um leitor que escolhe modelos hoje, isso significa uma coisa: não planeje com base no vazamento. Mantenha a camada de inferência flexível, avalie o que for lançado com base nos números reais e deixe o roteamento fazer o que o roteamento faz — experimentar a novidade sem apostar o caminho de produção nela.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube