Cartão de título gerado para Step 5 Preview vs NVIDIA Nemotron 3 Ultra 550B A55B com o texto 'vinte e um pontos de índice por vinte centavos', com três chips de estatísticas: Índice de Inteligência da Artificial Analysis 44 contra 23, preço de saída US$ 2,70 contra US$ 2,50 por milhão de tokens, e custo por tarefa de índice US$ 1,03 contra US$ 0,60. O logotipo da OrcaRouter fica em uma faixa branca no canto inferior direito.
Guides & Insights

Step 5 Preview vs Nemotron 3 Ultra: Vinte e Um Pontos de Índice por Vinte Centavos

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Um destes modelos você pode baixar hoje à tarde, e é justamente o que perde por vinte e um pontos. Step 5 Preview, o carro-chefe fechado da StepFun, abriu sua API em 20 de setembro de 2026 e não tem arquivo de licença que você possa pegar em mãos; NVIDIA Nemotron 3 Ultra 550B A55Bestá no Hugging Face desde 4 de junho de 2026 sob uma licença permissiva, com suas receitas de treinamento anexadas. No Índice de Inteligência da Artificial Analysis, a dupla marca 44 contra 23. No preço de saída, marca US$ 2,70 contra US$ 2,50 por milhão de tokens. Vinte e um pontos por vinte centavos não é uma comparação que se resolva de forma clara em nenhuma direção, e é por isso que vale a pena fazê-la direito, em vez de passar os olhos pelas duas colunas de destaque e escolher um lado.

Nenhum destes é um lançamento desta semana, e isso é importante para a forma como lê os números abaixo. Ambos estão disponíveis para chamada há meses, ambos passaram pelo mesmo harness independente, e nenhum deles sofreu alterações de tabela de preços nesse período. O que mudou é mais pequeno e mais interessante: o índice pelo qual são pontuados foi reconstruído em setembro, e os dois estão agora a ser avaliados face a duas medianas diferentes, extraídas de duas populações diferentes. É aqui que esta comparação se decide, na realidade.

Dois tipos de produto muito diferentes

Leia as fichas técnicas lado a lado e a primeira coisa que se nota é que mal são da mesma categoria de coisa.

• Parâmetros — o Step 5 Preview tem cerca de 600 bilhões no total, com 27 bilhões ativos por token, segundo a documentação da própria StepFun; o Nemotron 3 Ultra tem 550 bilhões no total, com 55 bilhões ativos, conforme o número que o conselho independente registra em relação à sua configuração.

• Arquitetura — A StepFun não publica uma descrição do funcionamento interno do Step 5 Preview. A ficha da NVIDIA documenta um híbrido: camadas Mamba-2 intercaladas, camadas de atenção selecionadas, um arranjo LatentMoE e cabeças de Previsão Multi-Token.

• Janela de contexto — 1M de tokens na tabela de especificações do Step 5 Preview, com uma saída máxima de 64.000 tokens, também documentada pela StepFun. O Nemotron 3 Ultra é registrado com 262.144 tokens pelo avaliador que o executou; o cartão do fornecedor anuncia até 1M, alcançável por meio de uma configuração de serving, e não por padrão.

• Entrada — texto, imagens e vídeo no Step 5 Preview, até 60 imagens por solicitação e arquivos MP4 com menos de 128 MB. Somente texto no Nemotron 3 Ultra.

• Controle de raciocínio — uma configuração documentada de esforço baixo, médio e alto do lado da StepFun; um sinalizador de template de chat do lado da NVIDIA que ativa ou desativa o traço de pensamento.

• Pesos — nenhum publicado para o Step 5 Preview, que é proprietário e somente via API, com um checkpoint BF16 que a StepFun afirmou que virá em 15 de outubro de 2026. O Nemotron 3 Ultra é distribuído em builds BF16 e NVFP4 e com um modelo de recompensa GenRM no Hugging Face sob a OpenMDW-1.1.

• Piso de implantação — não aplicável para o modelo de API; oito GPUs da classe B200 ou da classe GB200, ou dezesseis H100s, no modelo aberto, conforme a linha mínima do fornecedor.

• Tabela de preços — US$ 1,00 de entrada, US$ 0,10 em um acerto de cache e US$ 2,70 de saída para o Step 5 Preview, da página de preços em inglês da StepFun. Cerca de US$ 0,60 de entrada, US$ 0,16 em um acerto de cache e US$ 2,50 de saída para o Nemotron 3 Ultra, e observe atentamente de onde vem esse par: a NVIDIA não publica tabela de preços, então é o preço de provedor observado que o painel independente registra, não um número do fornecedor.

A linha que a maioria das pessoas considera decisiva é a primeira, e é a menos informativa das oito. Os dois totais ficam a menos de nove por cento de diferença entre si, enquanto os parâmetros ativos diferem por um fator de dois, e são os parâmetros ativos que determinam o custo computacional de cada token gerado. Nenhum dos valores prevê uma diferença de vinte e um pontos.

Generated two-column comparison scoreboard for Step 5 Preview and NVIDIA Nemotron 3 Ultra 550B A55B across six shared rows: Artificial Analysis Intelligence Index 44 against 23; output price $2.70 against $2.50 per million tokens; cost per index task $1.03 against $0.60; output speed 87 against 135.6 tokens per second; weights, 'none, BF16 checkpoint promised 15 October' against 'BF16 and NVFP4 on Hugging Face today'; and input, 'text, image and video' against 'text only'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and that the Nemotron rate is the recorded provider listing rather than a vendor rate card. The OrcaRouter logo sits in a white strip at the bottom right.

A mediana é uma escolha feita antes de você ler a pontuação.

O conselho independente não pontua os modelos com base em um único campo. Ele os agrupa em faixas — e a faixa em que um modelo se encaixa altera a frase impressa abaixo de sua pontuação, sem alterar a pontuação.

O Step 5 Preview está na categoria de raciocínio geral, que o ranking contabiliza em 227 modelos, e sua mediana de modelos comparáveis é 26. O Nemotron 3 Ultra está na categoria de pesos abertos, contabilizada em 117 modelos, onde a mediana é 18. Assim, o mesmo ranking descreve 44 como "bem acima da média" e 23 como "acima da média", e ambas as descrições são verdadeiras, porque 44 está dezoito pontos à frente da sua mediana e 23 está cinco pontos à frente da sua própria.

Isto não é um truque e não é o ranking sendo injusto. É a forma correta de apresentar um modelo aberto — você compara um checkpoint baixável com outros checkpoints baixáveis, porque uma equipe que só pode baixar não está escolhendo entre os 227. Mas isso significa que qualquer pessoa que cite "acima da média" sobre o Nemotron 3 Ultra e "acima da média" sobre um 44 está comparando duas frases diferentes entre si. Se você quer um número único para o par, use o índice bruto e aceite a diferença de vinte e um pontos; se você quer a decisão, use a classe e admita que já escolheu seu campo.

Screenshot of the Artificial Analysis model page for Nemotron 3 Ultra 550B A55B (Reasoning), showing an Intelligence Index of 23 in a class of 117 open-weights models with a comparable-model median of 18, pricing of $0.60 per million input tokens and $2.50 per million output tokens with a 73 percent cache discount, an average cost of $0.60 per index task, 110 million output tokens generated during the run against a 140 million median, 135.6 output tokens per second, and a 262,144-token context window.

O que um arnês mediu em ambos

As tabelas de fornecedores não podem ser subtraídas umas das outras, porque a StepFun e a NVIDIA executaram suítes diferentes em dias diferentes, e os materiais da NVIDIA não incluem todos os benchmarks que a StepFun relata. O terreno honesto é a interseção: aquilo que um único avaliador executou em ambos.

No Artificial Analysis Intelligence Index, essa interseção é de 44 contra 23. No custo por tarefa de índice concluída, é de US$ 1,03 contra US$ 0,60. Na velocidade de saída, a relação se inverte, e de forma acentuada: 87 tokens por segundo para o Step 5 Preview contra 135,6 para o Nemotron 3 Ultra, de modo que o modelo que pontua quase o dobro é justamente o que responde com cerca de meio segundo a mais de geração por token.

A linha isolada mais contundente é a do Terminal-Bench 4.0. O Step 5 Preview marca 33,3% ali. O Nemotron 3 Ultra marca 0,5%. Isso não é um artefato de arredondamento de nenhum dos lados e não é uma diferença sutil — nessa suíte específica de terminal agêntico, o carro-chefe de pesos abertos, na prática, não pontua. A armadilha é que o mesmo placar também lista o mesmo modelo com 53,9% no Terminal-Bench 2.1. Dois benchmarks com nomes quase iguais, duas gerações diferentes da mesma família de tarefas, e um modelo que aparece com 53,9 no mais antigo e 0,5 no mais novo. Se você já viu um número do Nemotron na casa dos cinquenta sendo citado para você, é daí que ele veio — e não é da suíte atual.

Uma concordância merece menção justamente por ser rara. A própria ficha da NVIDIA afirma 87,0 por cento no GPQA sem ferramentas; a execução independente mediu 86,7 por cento. Um número do fornecedor e um número externo separados por três décimos de ponto é o que uma tabela de avaliação confiável deve parecer, e isso torna os 0,5 por cento no Terminal-Bench 4.0 mais fáceis de aceitar como reais, e não como um erro do avaliador.

Para onde o dinheiro realmente vai em uma corrida de índice

Os preços por token predizem muito pouco sobre o custo de uma carga de trabalho, e este par demonstra isso melhor do que a maioria. O painel publica a decomposição de custos da execução completa do índice de cada modelo, e, para ambos, o item dominante não é a geração.

O valor de $1.03 por tarefa do Step 5 Preview divide-se em $0.85 de entrada e $0.17 de saída. Dentro do valor de entrada, $0.62 são cache, $0.22 são gravações de cache e apenas $0.014 é entrada nova, não armazenada em cache. Dentro do valor de saída, $0.12 são o traço de raciocínio e $0.06 é a resposta final.

Os $0,60 por tarefa do Nemotron 3 Ultra dividem-se em $0,53 de entrada e $0,07 de saída, e a composição dentro da linha de entrada é quase a imagem espelhada — $0,48 de gravações em cache contra apenas $0,04 de leituras de cache.

Duas conclusões decorrem daí. A primeira é que, numa avaliação de horizonte longo com forte reutilização de prefixo, cerca de oitenta por cento do que você paga fica do lado da entrada do balanço, o que faz da sua taxa de acerto de cache e da sua disciplina de contexto os números a otimizar, e não o comprimento da sua saída. A segunda é que os dois modelos chegam às suas contas de maneiras diferentes: o Step 5 Preview está pagando para reler um grande prefixo compartilhado, enquanto o Nemotron 3 Ultra está pagando para gravar conteúdo distinto no cache desde o início. Custo nominal semelhante, duas faturas diferentes — e, se a sua carga de trabalho se parecer mais com um desses padrões do que com o outro, a ordenação em $1,03 e $0,60 pode se inverter.

Os números de verbosidade explicam o resto da linha de saída. O Step 5 Preview gerou cerca de 160 milhões de tokens de saída em toda a suíte de índices, contra uma mediana de 82 milhões, o que o painel descreve categoricamente como muito verboso. O Nemotron 3 Ultra gerou 110 milhões, contra uma mediana de 140 milhões, o que ele chama de razoavelmente conciso. O modelo mais barato é o conciso, e é conciso na direção que importa para uma fatura.

Screenshot of StepFun's English documentation page for Step 5 Preview showing the specification table - model ID step-5-preview, a 1M-token context window, text, image and video input with text output, a 1M maximum input and a 64k maximum output - together with the input and video format notes listing JPG, JPEG, PNG, WebP and static GIF at up to 60 images per request and MP4, QuickTime and Matroska video under 128MB per file.

O que o download traz, e o que custa manter

O preço do Nemotron 3 Ultra não é US$ 2,50 por milhão de tokens de saída se você pegar o checkpoint. Esse é o preço de alugar a implantação dele feita por outra pessoa. Faça o download e você terá comprado um conjunto diferente de custos e um conjunto diferente de direitos.

Os direitos são concretos e são a parte que um modelo apenas de API não consegue igualar por preço algum. O OpenMDW-1.1 vem com os pesos, e a NVIDIA publica as coleções de dados de pré-treinamento e pós-treinamento e as receitas de treinamento junto com eles. Há uma versão NVFP4 que tem aproximadamente metade do tamanho para o mesmo modelo, e os pesos Ultra foram pré-treinados com uma receita NVFP4 em vez de quantizados depois — e é por isso que a versão pequena é um artefato de primeira classe na placa, e não um experimento da comunidade. A posição comercial é declarada de forma clara: pronta para uso comercial e não comercial.

Os custos são igualmente concretos. A implantação mínima é de oito GPUs da classe B200 ou dezesseis H100, e esse é o piso que a ficha técnica informa, e não uma sugestão. A janela de contexto que você realmente obtém depende de como você configura o serviço, com 256K como padrão e 1M atrás de uma configuração explícita. Uma equipe que não pode dedicar um rack não está escolhendo entre esses dois modelos a $1.00 e $0.60 de entrada; está escolhendo entre um modelo e um pedido de compra.

Existe uma versão dessa comparação em que o modelo aberto vence no eixo que as pessoas dizem se importar e raramente precificam — a dependência. O Step 5 Preview é um endpoint que você chama e um fornecedor em quem você confia, com um checkpoint prometido em vez de entregue. Se a StepFun revisar sua tabela de preços, apertar seus limites, descontinuar o ID ou tiver uma semana ruim, sua única alavanca é o seu próprio tratamento de erros. Os pesos do Nemotron 3 Ultra já estão no disco no cluster de alguém, e isso vale algo real mesmo enquanto o mesmo modelo está perdendo por vinte e um pontos de índice.

Vale a pena ser preciso sobre o que "prometido" significa do outro lado, porque o cenário é mais confuso do que qualquer um dos lados admite. Vários espelhos de terceiros de uma build BF16 apareceram no Hugging Face em 20 de setembro, no dia em que a API abriu, alguns deles com bem mais de um terabyte de safetensors. Esses são reuploads da comunidade, não um lançamento do fornecedor, e a StepFun não publicou nenhum anúncio de pesos abertos junto com eles. O que eles estabelecem é que os pesos estão circulando e que o checkpoint prometido para 15 de outubro seria uma formalização, e não uma divulgação.

Um número que se moveu enquanto o líamos

Um número neste texto mudou entre duas leituras da mesma página, e vale a pena nomeá-lo, porque é exatamente assim que uma comparação fica desatualizada silenciosamente.

O conselho independente mostrou um custo de US$ 0,71 por tarefa do índice para o Step 5 Preview na cobertura datada de 9 de outubro de 2026. Relida em 10 de outubro, a mesma página diz US$ 1,03. Nada mudou no modelo nesse intervalo, porque nada pode mudar nos pesos de um modelo exclusivo de API da noite para o dia. O que mudou foi a contabilização da avaliação: quando o preço de cache de um fornecedor muda, quando o avaliador revisa suas premissas de leitura de cache, ou quando uma execução é recalculada com uma mistura diferente de tokens, o valor por tarefa muda e a pontuação do índice não.

Portanto, trate o custo por tarefa como um número dinâmico com uma data carimbada, em vez de uma propriedade do modelo. Cada valor por tarefa neste artigo é a leitura de 10 de outubro e está identificado como tal. Se você estiver montando um orçamento a partir desta página, monte-o a partir de um valor que você mesmo obtenha no dia em que assumir o compromisso — e, se estiver comparando dois textos de semanas diferentes, verifique as datas de captura antes de concluir que um modelo ficou mais barato.

Qual delas você realmente chamaria

Diga primeiro a parte desconfortável: o OrcaRouter não roteia nenhum desses dois modelos. O Step 5 Preview é acessível pela própria API da StepFun e por algumas plataformas de terceiros, e o Nemotron 3 Ultra é servido pelos próprios endpoints da NVIDIA e por vários provedores, e você pode verificar ambas as afirmações no nosso catálogo no mesmo minuto em que as lê.

O que isso deixa é a forma da dependência em vez da escolha do modelo, e é o único lugar onde uma camada de roteamento se justifica aqui. Uma prévia somente de API em um único caminho de fornecedor é exatamente o arranjo em que uma tarde ruim no provedor se torna sua indisponibilidade, e o seguro barato é um plano de controle que pode transferir uma solicitação para um fallback qualificado no momento em que um caminho de fornecedor se degrada. É para isso que serve o failover automático: não como substituto para Step 5 Preview, mas como a coisa que você coloca na frente dos modelos que você pode realmente chamar, de modo que um endpoint específico de fornecedor nunca seja a única estrada para a produção. O mesmo catálogo que faz isso carrega mais de 200 modelos atrás de uma única chave e uma única fatura, com o preço de tabela do fornecedor repassado a 0 por cento de markup — que é a outra metade do argumento, porque uma mudança na tabela de preços em qualquer lugar a montante fica ativa do nosso lado no mesmo dia, em vez de na próxima renovação de contrato.

Se nenhum dos modelos for aquele que você vai chamar, a versão curta funciona assim. Escolha o Step 5 Preview quando você quiser a pontuação, a entrada de vídeo e imagem e o desconto de 90 por cento no cache, e aceite que está alugando uma prévia sem licença para os pesos e com um checkpoint de outubro que você ainda não viu. Escolha o Nemotron 3 Ultra quando os pesos importarem mais do que a pontuação — por restrições on-premise, por ajuste fino, por uma licença que você pode ler — e faça o orçamento do rack antes do orçamento dos tokens, porque a $0,60 por milhão de tokens de entrada uma implantação de 550 bilhões de parâmetros só é barata se outra pessoa já estiver pagando pelas GPUs.

O que é preciso acompanhar é 15 de outubro. Se a StepFun publicar o checkpoint BF16 que prometeu, a assimetria central deste artigo — de que apenas um destes dois é um download — deixa de ser verdade, e os vinte e um pontos do índice tornam-se consideravelmente mais difíceis de rebater. Se a data escorregar, o argumento a favor do modelo de pesos abertos reforça-se por omissão, o que é uma forma estranha de uma lacuna de capacidade se fechar — e uma muito comum.