Um cartão de destaque gerado intitulado 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base' com o antetítulo 'O MAIS BARATO NÃO CONSEGUE RESPONDER A UMA PERGUNTA' e chips exibindo US$ 0,10 vs US$ 0,06 por milhão de tokens de entrada, AA Index 43 contra 13, e pronto para responder contra o checkpoint base.
Guides & Insights

Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: O mais barato não consegue responder a uma pergunta

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Nas duas métricas com que uma planilha de compras mais se importa, o modelo mais barato e mais rápido vence. O Nemotron 3.5 Lightning 30B A3B roda a 298,9 tokens por segundo, o mais rápido de 142 modelos monitorados independentemente, e custa $0,06 por milhão de tokens de entrada, contra $0,10 do Claude Haiku 5.5. Ele também, como a palavra "Base" em seu nome está avisando, não é um assistente. É um ajuste fino supervisionado, sem aprendizado por reforço, sem chat que mereça o nome — publicado sob a licença OpenMD-1.1 em 11 de agosto de 2026 para que outras pessoas possam construir sobre ele. O Haiku 5.5, lançado em 11 de agosto de 2026, é um produto acabado para o qual você pode enviar um prompt. Compará-los em preço é comparar o custo da farinha com o custo do pão, e a parte interessante dessa comparação é descobrir qual deles o seu caso de uso realmente precisa.

Ninguém na cobertura do lançamento diz essa parte claramente, porque "mais barato e mais rápido que o Claude Haiku 5.5" é uma manchete melhor do que "mais barato, mais rápido e não utilizável sem uma execução de fine-tuning". Ambas as afirmações são verdadeiras. Apenas uma delas é útil.

O que cada modelo realmente é

Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, lançado em 7 de outubro de 2026. Entrada de texto e imagem, saída de texto. Contexto de 1M tokens, saída máxima de 128.000 tokens (300.000 com um cabeçalho beta na Batch API), data de corte de treinamento em junho de 2026, descontinuação não antes de 7 de outubro de 2027. Esforço ajustável entre Low, Medium, High, Xhigh e Max, com Medium como padrão, e pensamento adaptativo ativado por padrão. API com medição, leituras de cache a US$ 0,01 por milhão, Batch com metade da tarifa. Disponível por meio da API da Anthropic e, a partir dela, onde quer que os modelos da Anthropic sejam revendidos.

Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, anunciado em 11 de agosto de 2026. Um checkpoint híbrido de mistura de especialistas com 30 bilhões de parâmetros e cerca de 3 bilhões de parâmetros ativos por token, construído sobre uma pilha de Mamba-2 mais MoE mais atenção, destilado do Nemotron 3 Ultra e que acompanha decodificação especulativa MTP, DFlash e DSpark. O contexto chega a 1M de tokens, embora cerca de 256.000 seja o teto prático em uma única H100. É somente texto. Os pesos são abertos sob a OpenMDW-1.1. E é um checkpoint base: pesos pré-treinados brutos, sem ajuste por instruções, o que significa que ele completa texto em vez de seguir instruções.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base — the scoreboard'. Claude Haiku 5.5 reads output speed 243.4 tokens per second, AA Index 43, proprietary weights, instruction-tuned yes, $0.10 per million input and $0.21 per task; the Nemotron column reads output speed 298.9 tokens per second, AA Index 13, weights open under OpenMDW-1.1, instruction-tuned no — base checkpoint, $0.06 per million input and $0.09 per task. A footer notes the Artificial Analysis figures are independently run and the NVIDIA figures are vendor-reported and unreproduced.

• As dimensões, uma por linha

• Preço de entrada — Claude Haiku 5.5 US$ 0,10 por milhão até 100 mil tokens, depois US$ 0,50; Nemotron 3.5 Lightning 30B A3B Base US$ 0,06 por milhão.

• Preço de saída — US$ 0,50 por milhão até 100 mil tokens, depois US$ 2,50, contra US$ 0,20 por milhão.

• Custo por tarefa concluída — US$ 0,21 por tarefa de índice independente para o Claude Haiku 5.5, contra US$ 0,09 para o Nemotron — o modelo mais barato é mais barato por tarefa, não apenas por token.

• Velocidade de saída — 243,4 tokens por segundo para Claude Haiku 5.5, 9º de 182; 298,9 tokens por segundo para Nemotron, 1º de 142.

• Tempo até o primeiro token — cerca de 0,3 segundos para o Claude Haiku 5.5, contra 0,54 segundos para o Nemotron.

• Pontuação independente — Artificial Analysis Intelligence Index 43 para Claude Haiku 5.5, segundo de 182, com a configuração Max em 43,40; Índice 13 para Nemotron, vigésimo nono de 142.

• Janela de contexto — 1.000.000 de tokens cada, com cerca de 256.000 práticos para o Nemotron em uma única H100.

• Modalidades — texto e imagem de entrada para Claude Haiku 5.5; apenas texto para Nemotron.

• Pesos — proprietário versus aberto sob a OpenMDW-1.1, um MoE híbrido com 30B no total e 3B ativos.

• Ajuste por instruções — presente no Claude Haiku 5.5, ausente no checkpoint Base.

O problema "Base", declarado claramente

Um checkpoint base prevê o próximo token. Faça uma pergunta a ele e, muitas vezes, ele continuará o texto no estilo de um documento que poderia conter tal pergunta, em vez de responder. Peça-lhe "Resuma este contrato" e um modelo base pode produzir uma continuação plausível de um documento de treinamento jurídico em vez de um resumo do seu. A NVIDIA publica um checkpoint BF16 separado e irmãos separados ajustados por instruções precisamente porque os pesos base são matéria-prima.

Na própria ficha técnica do modelo da NVIDIA — com dados informados pelo fornecedor, não reproduzidos de forma independente —, o checkpoint base pontua 78,59 no MMLU, 67,94 no MMLU-Pro, 91,28 no GSM8K, 77,44 no HumanEval e 69,62 no RULER em 1M de tokens. A ficha técnica Lightning do irmão ajustado informa MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 e 86% no PinchBench, com inferência aproximadamente 30% mais rápida do que o modelo que substituiu. Até mesmo os números ajustados são da própria NVIDIA, e os números base são os que se aplicam ao checkpoint citado no título deste artigo. Em comparação com eles, os 43,40 medidos de forma independente do Claude Haiku 5.5 — segundo de 182 no índice da Artificial Analysis, um índice diferente que mede coisas diferentes — não são diretamente comparáveis, e a leitura honesta é que um checkpoint base de 30B e um modelo pequeno finalizado estão sendo avaliados por instrumentos diferentes para finalidades diferentes.

O que pode ser dito sem ressalvas é a forma da lacuna. Um checkpoint base que precisa de um pipeline de ajuste fino, uma pilha de serviço e uma estrutura de avaliação antes de responder a qualquer coisa não é substituto para um modelo hospedado a US$ 0,10 por milhão. É um ponto de partida para quem quer possuir o modelo.

Onde o Nemotron realmente vence, e não é um prêmio de consolação

Velocidade em primeiro lugar. 298,9 tokens de saída por segundo colocam-no no topo de um ranking de 142 modelos — 23% mais rápido que os 243,4 do Claude Haiku 5.5. Para um pipeline sensível à latência, essa é uma diferença real e mensurável, e é a razão pela qual o nome "Lightning" está na caixa.

Pesos abertos em segundo lugar, e este é o mais importante. Sob a OpenMDW-1.1, você pode baixar o checkpoint, fazer fine-tuning nele com seus próprios dados e servi-lo por conta própria. O Claude Haiku 5.5 não pode receber fine-tuning de forma alguma e não pode ser auto-hospedado a preço algum. Para uma equipe com uma tarefa proprietária, uma distribuição de entrada incomum ou um requisito de conformidade de que o tráfego nunca saia de sua própria infraestrutura, essa diferença é decisiva, independentemente do que digam as páginas de benchmark. Um modelo de 30B no total com 3B ativos também é pequeno o suficiente para ser servido de forma economicamente viável — a arquitetura foi projetada exatamente para isso.

Terceiro preço: US$ 0,06 de entrada e US$ 0,20 de saída por milhão, com 17% de desconto de cache e US$ 0,09 por tarefa de indexação, é aproximadamente metade dos US$ 0,21 do Claude Haiku 5.5. Ambos os modelos são baratos; o Nemotron é mais barato.

Onde o Claude Haiku 5.5 vence, o que corresponde a todas as dimensões que exigem uma resposta

Seguimento de instruções, porque ele foi treinado para isso. Capacidade independente, no Índice 43 contra 13 — uma diferença de trinta pontos em um placar que avaliou ambos, a maior diferença desse tipo neste conjunto de comparações. Entrada de imagem, que o Nemotron não aceita de forma alguma. Saída máxima de 128.000 tokens contra um número não divulgado, com um caminho beta de 300.000 tokens no Batch. E o ajuste de esforço, que permite recuperar custo reduzindo o esforço de raciocínio em vez de reconstruir o modelo.

A ressalva sobre a verbosidade corta para os dois lados aqui. Na suíte da Artificial Analysis, o Claude Haiku 5.5 emite cerca de 440 milhões de tokens de saída, contra uma mediana de aproximadamente 100 milhões — ele pensa bastante. O Nemotron emite cerca de 120 milhões, o que a mesma fonte descreve como um tanto verboso para o seu tamanho. O custo por tarefa do Haiku 5.5 é, ainda assim, de US$ 0,21, contra US$ 0,09 do Nemotron, de modo que mesmo o modelo tagarela não é o caro. O que isso lhe diz é que os preços por token enganam nas duas direções, e é com o número por tarefa que se deve fazer o orçamento.

Auto-hospedagem versus um endpoint

O Nemotron 3.5 Lightning 30B A3B Base é distribuído como pesos abertos e servido por vários provedores de inferência; a NVIDIA também publica os modelos irmãos ajustados. O Claude Haiku 5.5 está disponível através da API da Anthropic e, a partir daí, onde quer que os modelos da Anthropic sejam revendidos. Nenhum dos dois está no catálogo da OrcaRouter, e não vamos fingir o contrário — o que encaminhamos desta vizinhança é anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 e anthropic/claude-fable-5.1, o nível acima do tema deste artigo.

Os dois caminhos que esta comparação descreve têm mecânicas genuinamente diferentes, e vale a pena nomeá-los. O caminho auto-hospedado significa uma GPU, um framework de serving, uma decisão de quantização e um rodízio de operações. O caminho hospedado significa uma chave e uma string de modelo. O OrcaRouter existe para o segundo caminho: uma API para mais de 200 modelos, uma chave e uma fatura, preço de lista do provedor repassado com 0% de markup, para que um corte do fornecedor entre em vigor no mesmo dia, com failover automático nos bastidores. Ele não é um caminho para um checkpoint base de 30B, e comprar uma máquina da classe DGX não é um caminho para um modelo pequeno hospedado.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

Quem deve escolher qual?

Se sua tarefa estiver bem definida, seus dados de treinamento forem grandes o suficiente para importar e seu tráfego não puder sair da sua própria infraestrutura, o Nemotron 3.5 Lightning 30B A3B Base é o objeto mais interessante: o mais rápido entre 142 em velocidade de saída, metade do preço por token e seu para modificar. Reserve orçamento para a execução de ajuste fino e o custo de serving antes de contar a economia, porque a taxa de entrada de $0.06 pressupõe que alguém já fez o trabalho que transforma um checkpoint em um assistente.

Se você quiser enviar um prompt e receber uma resposta nesta tarde, o Claude Haiku 5.5 é o que dá conta — 43 no índice independente contra 13, entrada de imagem, um teto de saída de 128.000 tokens e um preço que é realmente baixo. A comparação só parece equilibrada numa tabela de preços. Ela deixa de parecer equilibrada no momento em que a tarefa é responder a uma pergunta, e não continuar um documento.

A capture of the Artificial Analysis page for Nemotron 3.5 Lightning showing its Intelligence Index of 13 and rank of 29 of 142, the $0.06 per-million input and $0.20 output pricing, the $0.09 cost per index task, the 298.9 tokens-per-second output speed ranked first of 142, the 0.54-second time to first token, the 1M-token context window, text-only input and open weights.