Um cartão hero gerado para "Taxas idênticas, três vezes a conta", com o selo "MESMO ADESIVO", o antetítulo "DOIS MODELOS, $0,10 E $0,50, UMA PERGUNTA" e o subtítulo "Claude Haiku 5.5 contra GPT-6 Luna: os mesmos dois números e limiares muito diferentes." Quatro chips dizem "$0,10 / $0,50 ambos", "100K vs 272K", "$0,21 vs $0,07" e "43,40 vs 38,12". Os dois cartões abaixo estão etiquetados "O MESMO" ("$0,10 de entrada e $0,50 de saída no primeiro escalão, e uma janela de 1M tokens em ambos") e "NÃO O MESMO" ("o degrau situa-se em 100 000 tokens contra 272 000, e o custo por tarefa difere em três vezes"). Um rodapé diz "Taxas de tabela publicadas pelos fornecedores; medições independentes da Artificial Analysis, consultadas em 8 de outubro de 2026." O logótipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Claude Haiku 5.5 vs GPT-6 Luna: Mesmo Preço de Etiqueta, Três Vezes a Conta

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Claude Haiku 5.5 e GPT-6 Luna têm o mesmo preço no papel: US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de tokens de saída, os mesmos dois números até o centavo, vindos de dois fornecedores que raramente concordam em alguma coisa. O post de lançamento da Anthropic chega a imprimir as pontuações do Luna na coluna ao lado das suas próprias, o que não é algo que fornecedores fazem com modelos que consideram não ameaçadores.

Os dois cartões divergem em tudo o que a etiqueta esconde. A Luna mantém essa tarifa até 272.000 tokens antes de subir; o Claude Haiku 5.5 sobe aos 100.000. O Claude Haiku 5.5 marca 43,40 no Artificial Analysis Intelligence Index v4.3.2, contra 38,12 da Luna — e custa US$ 0,21 por tarefa do Index concluída, contra US$ 0,07 da Luna. Mesmo preço, o triplo na conta, cinco pontos a mais de inteligência. É toda a troca, e é mais limpa do que a maioria dos confrontos diretos nessa faixa.

Dois cartões, lado a lado

Por milhão de tokens em dólares americanos, com base nas tarifas publicadas da Anthropic e da OpenAI, conforme refletidas em nosso próprio catálogo, com medições independentes atribuídas à Artificial Analysis. Em cache em 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs GPT-6 Luna - two cards, side by side'. Claude Haiku 5.5 reads input $0.10 under the first tier and $0.50 past 100,000, output $0.50 and $2.50 past 100,000, maximum output 128,000 tokens, Intelligence Index v4.3.2 43.40, cost per task $0.21, output speed 241.9 tokens per second. GPT-6 Luna reads input $0.10 under the first tier and $0.20 past 272,000, output $0.50 and $0.75, maximum output 128,000 tokens, Intelligence Index v4.3.2 38.12, cost per task $0.07, output speed 129.4 tokens per second. A footer reads 'Vendors' published list rates; independent measurements from Artificial Analysis.'

• Entrada — Claude Haiku 5.5 $0,10 até 100.000 tokens, $0,50 acima disso. GPT-6 Luna $0,10 até 272.000 tokens, $0,20 acima disso.

• Saída — Claude Haiku 5.5 US$ 0,50 até 100.000 tokens, US$ 2,50 acima disso. GPT-6 Luna US$ 0,50 até 272.000 tokens, US$ 0,75 acima disso.

• Entrada e gravações em cache — ambas a $0,01 e $0,125 abaixo do primeiro limite, com Claude Haiku 5.5 passando para $0,05 e $0,625 após 100.000 tokens, e GPT-6 Luna para $0,02 e $0,25 após 272.000.

• Contexto e saída — 1M tokens para ambos; 128.000 de saída máxima para ambos. Esses dois são genuinamente do mesmo formato.

• Pensamento — adaptativo em ambos, ambos com um parâmetro de esforço. O esforço padrão do Claude Haiku 5.5 é médio; nem todas as pontuações publicadas estão nessa configuração.

• Pontuação independente — Claude Haiku 5.5 (Max) 43,40, segundo de 182 modelos. GPT-6 Luna (Max) 38,12, oitavo de 182.

• Custo independente por tarefa — US$ 0,21 contra US$ 0,07.

• Velocidade — 241,9 tokens de saída por segundo contra 129,4, medidos pelo mesmo avaliador.

O limiar é onde está a diferença

Ambos os fornecedores criaram uma tabela de preços de dois níveis. Fizeram-no em pontos bastante diferentes, e a posição importa muito mais do que o número no topo.

O patamar da Anthropic fica em 100.000 tokens. Abaixo dele, você paga US$ 0,10 e US$ 0,50; acima dele, cinco vezes e cinco vezes — US$ 0,50 e US$ 2,50. A Anthropic diz que prompts abaixo do limite representaram cerca de 90% das requisições ao seu modelo Haiku anterior, o que reflete a própria composição de tráfego do fornecedor e é uma descrição razoável de cargas de trabalho de chamadas curtas em geral.

O degrau da OpenAI fica em 272.000 tokens. Abaixo dele, US$ 0,10 e US$ 0,50 — idênticos aos da Anthropic. Acima dele, US$ 0,20 e US$ 0,75, o dobro e um aumento de 50%. Esse é um degrau muito mais suave e começa quase três vezes mais adiante.

Considere um prompt de 200.000 tokens, que é um tamanho plausível para um pipeline de documentos longos e totalmente razoável para uma janela de 1M de tokens. No Claude Haiku 5.5, essa requisição é cobrada na segunda faixa: US$ 0,50 de entrada, US$ 2,50 de saída. No GPT-6 Luna, ainda é a primeira faixa: US$ 0,10 de entrada, US$ 0,50 de saída. Cinco vezes a taxa de entrada e cinco vezes a taxa de saída, na mesma requisição, entre dois modelos com o mesmo preço anunciado. Isso não é uma nuance — para uma carga de trabalho com prompts longos, é a comparação inteira.

Por que a mesma tarifa gera uma conta três vezes maior

O custo por tarefa é o número que deve decidir um pipeline de alto volume e, aqui, os dois modelos divergem de uma forma que a tabela de preços não consegue explicar.

A Artificial Analysis coloca o GPT-6 Luna (Max) a US$ 0,07 por tarefa do Intelligence Index e o Claude Haiku 5.5 (Max) a US$ 0,21 — um fator de três, com preços de tabela idênticos, para uma diferença de 5,28 pontos na pontuação. A causa está na mesma página e não é sutil. O Claude Haiku 5.5 gerou 440 milhões de tokens de saída ao executar o Index, contra uma mediana de 100 milhões, e o avaliador o classifica como muito prolixo. O GPT-6 Luna gerou 140 milhões contra a mesma mediana de 100 milhões, descrito como um tanto prolixo. Três vezes os tokens de saída são três vezes a conta quando a saída é o medidor que domina.

Os próprios números da Anthropic apontam na mesma direção. Os gráficos de custo versus precisão do fornecedor traçam o Haiku 5.5 ao longo de toda a faixa de esforço, e a citação de destaque do lançamento é que Sonnet 5.5 e Opus 5.5 continuam sendo as melhores escolhas para trabalho complexo de codificação agêntica, com o Haiku 5.5 posicionado para compactação, sumarização e subagentes. Quanto menor a tarefa, menos desse problema de verbosidade você compra — que é precisamente a carga de trabalho para a qual o modelo foi criado, e precisamente a carga de trabalho em que uma diferença de custo de três vezes vale a pena ser conferida nos seus próprios registros, e não nos de um ranking.

Mais um registro no livro-razão, vindo da documentação da Ant​hropic e não da do avaliador: o Claude Haiku 5.5 usa o tokenizador mais recente, compartilhado com o Claude 4.7 e versões posteriores, então o mesmo texto equivale a cerca de 30% mais tokens do que no Haiku anterior. A tarifa é a mesma da Luna; o tokenizador, não.

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table, with the per-million-token input, output and cache rates and the 100,000-token threshold at which the second tier begins.

O que a própria tabela da Ant​hropic diz sobre Luna

A página de lançamento da Ant​hropic inclui o GPT-6 Luna como uma coluna em sua tabela de benchmark, e a maneira honesta de reportar isso é com a devida atribuição: estas são avaliações da Ant​hropic, executadas no harness da Ant​hropic, contra o modelo de um concorrente. São resultados relatados pelo fornecedor, não reproduzidos de forma independente, e um fornecedor executando sua própria suíte contra as pontuações de um rival é uma comparação a ponderar, e não a aceitar.

• Trabalho do conhecimento — GDPval-AA v2.1 com 1620 para Claude Haiku 5.5, contra 1437 para GPT-6 Luna. AA-Briefcase v1.1 com 1578 contra 1336.

• Uso de computador — subconjunto offline do OSWorld 2.1 com 72,4% contra 48,9%.

Codificação agêntica — Terminal-Bench 4.0 com 39,2% contra 16,4%; FrontierCode 1.1 (Main) com 46,4% contra 42,4%.

• Raciocínio visual — Chartography a 46,4% sem ferramentas contra 29,1%.

No harness próprio do fornecedor, o Claude Haiku 5.5 lidera todas as linhas. No ranking independente, ele lidera por uma margem menor — 43,40 contra 38,12 —, que é a relação habitual entre a tabela de um fornecedor e a de um terceiro, e o motivo pelo qual ambas são apresentadas aqui. As duas concordam na direção e discordam no tamanho.

O projeto de lei é o voto decisivo.

Coloque os quatro fatos que realmente importam frente a frente e a escolha deixa de ser tão equilibrada para a maioria das cargas de trabalho.

GPT-6 Luna é mais barato por tarefa concluída por um fator de três na medição independente, seu primeiro nível de preço alcança dezoito vezes mais longe na janela de contexto, suas taxas de ultrapassagem do limite são menores nos dois medidores, e é o único dos dois cuja penalidade de contexto longo é uma duplicação, e não um aumento de cinco vezes. Claude Haiku 5.5 está à frente em inteligência medida por uma margem que é real e modesta, é mais rápido por um fator de quase dois na saída e — no próprio harness do fornecedor, onde a diferença é mais ampla — está à frente em todas as linhas de benchmark publicadas.

Se suas chamadas forem curtas, se a vazão for a restrição, ou se a diferença de qualidade aparecer na sua própria avaliação, pague o triplo. Se suas chamadas forem longas, se forem geradas por máquina e nunca lidas por um humano, ou se você estiver executando uma camada de classificação que dispara um milhão de vezes por dia, os mesmos US$ 0,10 e US$ 0,50 lhe renderão, do outro lado, uma fatura de um terço do tamanho, e a capacidade de que você abre mão equivale a cinco pontos em um ranking em que ambos os modelos ficam perto do topo.

Chamar qualquer um deles a partir de um só lugar

O aspecto útil de uma comparação tão próxima é que você não deveria precisar confiar na palavra de ninguém, incluindo a nossa. GPT-6 Luna está no catálogo da OrcaRouter hoje à taxa do provedor com 0% de markup — a mesma estrutura de taxas impressa acima, repassada em vez de combinada — e o mesmo vale para Claude Sonnet 5.5 e Claude Opus 5.5, o que torna um teste de escalonamento de um trecho barato para um nível intermediário uma configuração em vez de um projeto. Uma chave, um SDK, failover automático por baixo, e o DSL de roteamento se o escalonamento pertence à rota em vez de à sua aplicação.

O Claude Haiku 5.5 ainda não está no catálogo. Dizer isso sem rodeios é mais útil do que sugerir o contrário: o lado Luna desta comparação pode ser invocado por nós esta manhã, e o lado da Ant​hropic tem de ser obtido junto da Ant​hropic até que não seja mais.

A screenshot of the OrcaRouter catalogue page for GPT-6 Luna, showing the model identifier openai/gpt-6-Luna, the provider OpenAI, a 1M-token context window, 128,000 maximum output, the release date September 22 2026, the $0.10 per million input and $0.50 per million output rates and a p50 time to first token of 1.49 seconds.

O que mudaria a resposta

Duas coisas, e ambas vale a pena observar em vez de estimar.

A primeira é se a verbosidade muda. O custo por tarefa do Claude Haiku 5.5 é função de quantos tokens ele gasta por resposta no esforço máximo, e o parâmetro de esforço é a alavanca para isso. Uma equipe que fixa o esforço mais baixo — o padrão do próprio modelo é médio, não máximo — verá um valor de custo por tarefa mais próximo do da Luna e uma pontuação mais próxima da da Luna também. O trade-off está disponível; quanto ele vale é uma questão sobre sua avaliação, não sobre o modelo.

A segunda é se os números independentes de custo por tarefa se sustentam à medida que ambos os modelos acumulam mais execuções medidas. Uma única posição no placar é um instantâneo, e uma diferença de três vezes que aparece em um instantâneo vale a pena confirmar na sua própria fatura antes que um pipeline seja reconstruído com base nela. É para isso que serve o endpoint compartilhado.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente