Um cartão de título comparando GPT-5.6 Luna e Claude Haiku 4.5, mostrando Luna com um Índice de Inteligência de 38, uma janela de contexto de 1M tokens e preço de $0,20 de entrada e $1,20 de saída por milhão de tokens, contra Haiku 4.5 com um Índice de Inteligência de 18, um contexto de 200K tokens e preço de $1,00 de entrada e $5,00 de saída.
Guides & Insights

GPT-5.6 Luna vs Claude Haiku 4.5: Nível Barato, Duas Faturas Muito Diferentes

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GPT-5.6 Luna e Claude Haiku 4.5 são os níveis baratos de duas famílias de fronteira diferentes, e a diferença entre eles depende inteiramente de qual número você observa. No preço de tabela, isso é uma goleada: $0,20 por milhão de tokens de entrada contra $1,00. No custo por tarefa concluída do Intelligence Index da Artificial Analysis, é $0,18 contra $0,21 — uma diferença de cerca de 14%. Os mesmos dois modelos, duas respostas honestas, e o motivo pelo qual eles divergem é a coisa mais útil de se entender antes de escolher um.

A versão curta: Luna é o modelo mais forte no papel e o mais rápido em throughput, mas pensa longamente — e cobra por isso. Haiku 4.5 é mais antigo, com escopo menor e consideravelmente mais previsível quanto ao custo de uma requisição. Qual dessas características importa mais é uma propriedade da sua carga de trabalho, não dos modelos.

Num relance

FornecedorOpenAI vs Anthropic

Lançado — 9 de julho de 2026 vs 15 de outubro de 2025

Janela de contexto — 1M tokens vs 200K tokens

Saída máxima — 128K tokens vs 64K tokens

Entrada — texto, imagem e arquivo vs texto, imagem e PDF

Preço por milhão de tokens — $0,20 de entrada / $1,20 de saída vs $1,00 de entrada / $5,00 de saída

Artificial Analysis Intelligence Index — 38, 4º de 177 vs 18, 138º de 200 (ambos em configuração de raciocínio)

Custo por tarefa do Intelligence Index — $0,18 vs $0,21

Velocidade de saída — 109,4 tokens/seg vs 84,7 tokens/seg

Controle de raciocínio — um ajuste de esforço de nenhum a máximo vs pensamento estendido ativado manualmente, sem parâmetro de esforço

Data limite de conhecimento confiável — fevereiro de 2026 vs. fevereiro de 2025 (dados de treinamento até julho de 2025)

Compromisso de aposentadoria — nenhum publicado vs. não antes de 15 de outubro de 2026

Onde o GPT-5.6 Luna realmente vence

Screenshot of an Artificial Analysis head-to-head between GPT-5.6 Luna (max) and Claude 4.5 Haiku (Reasoning). The Intelligence Index row reads 38 against 18, AA-Briefcase 1339 against 614, GDPval-AA v2 1489 against 854, AutomationBench-AA 50% against 3%, Terminal-Bench v4.0 12% against 0%, SciCode 54% against 42%, Humanity's Last Exam 39% against 10%, GDPpdf 24% against 4%, CritPt 21% against 0%, AA-Omniscience -10 against -4, and AA-LCR v1.1 84% against 74%. The Cost section shows a blended price per 1M tokens of $0.174 against $0.77.

Capacidade, por uma margem ampla. Um Índice de Inteligência de 38 contra 18 não é uma disputa acirrada. A Luna fica à frente do Haiku no composto que a Artificial Analysis monta a partir de avaliações de raciocínio, conhecimento, matemática e programação, e o faz sendo o modelo mais barato por token. Quem comparou essas duas famílias pela última vez no índice anterior a setembro — em que a Luna aparecia com 51 e 52 — deve observar que toda a escala foi repontuada em setembro de 2026, e a vantagem da Luna sobreviveu à repontuação.

Contexto, cinco vezes maior. Uma janela de 1M de tokens contra 200K decide sozinha uma categoria de trabalho: varreduras de repositório inteiro, conjuntos extensos de documentos, transcrições longas de agentes que precisariam de sumarização no Haiku. Se a sua aplicação é definida pela quantidade de contexto que precisa manter, a comparação termina aqui.

Margem de saída, em dobro. Um máximo de 128K tokens de saída contra 64K faz diferença para geração de conteúdo longo e para loops agênticos que retornam planos estruturados em vez de respostas de uma linha.

Vazão. 109,4 tokens de saída por segundo contra 84,7 é uma diferença real para interfaces de streaming, embora não seja a mesma coisa que responsividade — consulte a seção de latência abaixo.

Preço, na etiqueta.Cinco vezes mais barato na entrada e cerca de quatro vezes mais barato na saída não é um erro de arredondamento e, para trabalhos com saída curta, é a decisão inteira.

Onde o Claude Haiku 4.5 ainda conquista seu lugar

Custo previsível. O raciocínio do Haiku 4.5 é um pensamento estendido que você ativa manualmente. Quando desativado, ele responde diretamente e cobra de forma previsível. O botão de esforço do GPT-5.6 Luna vai até o máximo, e cada nível acima significa mais tokens de saída à tarifa de saída. Uma equipe que quer um teto de custo que possa declarar de antemão achará o Haiku mais fácil de entender, mesmo com um preço de etiqueta mais alto.

A configuração sem raciocínio é genuinamente barata de executar. A Artificial Analysis atribui à configuração sem raciocínio do Claude 4.5 Haiku uma pontuação de 15 no Intelligence Index, sem nenhum valor publicado de custo por tarefa, e ela é uma opção razoável para trabalhos em que o critério é simplesmente "processar isto corretamente" — classificação de intenção, extração de campos, decisões de roteamento, triagem de moderação. Nessas tarefas, a diferença no índice entre 15 e 38 é praticamente irrelevante, porque não se pede que nenhum dos modelos pense.

O cache e os descontos por lote já são maduros. O Haiku 4.5 oferece um desconto de 90% na leitura do cache de prompts e um desconto de 50% na Batch API. O Luna tem uma economia de cache comparável, então isso está mais para um empate do que para uma vantagem — mas, se o seu pipeline já processa em lotes por meio das ferramentas da Anthropic, o custo de migração para sair do Haiku é um custo real, e ele não aparecerá em nenhum benchmark.

Um histórico operacional comprovado. O Haiku 4.5 está em produção desde outubro de 2025 e tem um compromisso publicado de descontinuação não antes de 15 de outubro de 2026. Luna tem dois meses. Para uma carga de trabalho em que o modelo é um detalhe, e não o produto, um histórico de produção de onze meses vale algo que um benchmark não consegue expressar.

É o modelo mais fiel à verdade, no único eixo que mede isso.A comparação direta da Artificial Analysis coloca o Luna à frente em quase todas as linhas de capacidade — AA-Briefcase 1.339 contra 614, GDPval-AA v2 1.489 contra 854, AutomationBench-AA 50% contra 3%, Humanity's Last Exam 39% contra 10%, GDPpdf 24% contra 4%. A exceção é o AA-Omniscience, que penaliza respostas erradas dadas com confiança em perguntas de conhecimento: o Luna pontua -10 nesse quesito, contra -4 do Haiku. Uma pontuação negativa significa que a penalidade por alucinação supera o crédito por precisão, e a penalidade do Luna é maior. Um índice composto mais alto não é a mesma coisa que uma resposta mais confiável, e na única avaliação criada para separar essas duas coisas, o modelo mais antigo se sai melhor.

O cálculo de custos em uma carga de trabalho real

Considere um pipeline que consome 100 milhões de tokens de entrada e emite 20 milhões de tokens de saída por mês.

GPT-5.6 Luna — 100 × $0.20 = $20, mais 20 × $1.20 = $24. Total de $44 por mês.

Claude Haiku 4.5 — 100 × $1,00 = $100, mais 20 × $5,00 = $100. Total de $200 por mês.

Nessas proporções, a Luna é cerca de 4,5x mais barata, e é esse o cálculo que a maioria das comparações publica. Agora mude uma premissa. Se o esforço de raciocínio da Luna for aumentado, seus tokens de saída crescem, e a saída é o lado caro — a $1,20, custa seis vezes o que a entrada custa. Leve a Luna ao ponto em que ela emite 150M de tokens de saída para o mesmo volume de trabalho, como faz no conjunto de avaliação da Artificial Analysis, e os $44 passam confortavelmente de $180. O fator de 4,5x colapsa rumo à paridade.

A lição não é que a Luna seja cara. É que a vantagem de preço da Luna é função do quanto ela fala, o que é um parâmetro que você controla. Reduza o raciocínio para extração e classificação e o desconto é real. Deixe-o no máximo para tudo e você comprou um modelo mais capaz a um preço que já não se parece com o preço de etiqueta.

Latência, e um número em que você não deveria confiar

Os números publicados de tempo até o primeiro token para esses dois modelos são praticamente inúteis, e vale a pena entender por quê. No Artificial Analysis, as configurações de raciocínio de ambos os modelos mostram latências do primeiro token na casa das dezenas ou até das centenas de segundos, porque o ambiente de avaliação não emite um token até que o modelo termine o raciocínio. Esse número mede a configuração da avaliação, não a capacidade de resposta do modelo.

A telemetria de roteamento é uma fonte melhor, porque mede o modelo em produção. Os próprios números da OrcaRouter colocam o GPT-5.6 Luna em uma mediana de 1,83 segundo até o primeiro token e um percentil 95 de 10,00 segundos, contra o Claude Haiku 4.5 com 3,81 segundos de mediana e 9,47 segundos no percentil 95. Lido corretamente, isso diz que os dois estão mais próximos do que os rankings sugerem: Luna vence na solicitação típica, e as caudas ficam a cerca de meio segundo uma da outra. Se sua preocupação é o pior caso, e não a média, há muito pouco entre eles.

Qual escolher

Escolha o GPT-5.6 Luna se você estiver lidando com contexto longo, se a tarefa se beneficiar de raciocínio real, se a saída for longa ou estruturada, ou se quiser o modelo mais forte disponível na parte mais baixa da faixa de preço. Também é a escolha mais natural se o restante da sua stack já funcionar com o comportamento da família Open​AI.

Escolha o Claude Haiku 4.5 se o seu trabalho for de saída curta e alto volume, se você precisar de um teto de custo que possa declarar antes da execução da solicitação, se o seu pipeline já estiver construído em torno do batching e do caching da Anthropic, ou se você valorizar um modelo com histórico de produção e ciclo de vida publicado em vez de um que tem apenas dois meses.

Não escolha nenhum dos dois para uma tarefa em que um pequeno modelo de raciocínio ou um classificador ajustado finamente dariam conta. Grande parte do tráfego que esses dois níveis absorvem é classificação e extração que rodariam mais barato em algo mais específico — e o modelo mais barato é sempre aquele que você não precisou.

Executando ambos em uma única chave

Screenshot of the OrcaRouter model page for Claude Haiku 4.5, showing the model identifier anthropic/claude-haiku-4.5, a release date of 2025-10-15, a 200K-token context window, 64K maximum output, input pricing of $1.00 per million tokens, output pricing of $5.00, a median time to first token of 3.81 seconds and a 95th percentile of 9.47 seconds.

A disputa deixa de ser exclusiva quando ambos ficam acessíveis por um único endpoint. Na OrcaRouter, Claude Haiku 4.5 e GPT-5.6 Luna ficam atrás da mesma URL base compatível com Open​AI — uma API para mais de 200 modelos, uma chave, uma linha de cobrança, nenhum segundo contrato e nenhuma alteração de código além do identificador do modelo. Para uma decisão de tier sobre a qual você ainda não tem certeza, isso transforma uma migração em um valor de configuração.

Dois recursos fazem trabalho de verdade aqui. O failover automático entre provedores significa que uma camada de baixo custo pode carregar tráfego de produção sem dependência de um único fornecedor — útil quando o modelo é barato o bastante para você enviar milhares de chamadas por hora em vez de uma única chamada importante. E a DSL de roteamento permite compor uma chamada a partir de vários modelos: encaminhe a maioria simples das requisições para o Luna, escale o restante para o GPT-5.6 Terra e mantenha o Haiku 4.5 no pool como fallback para quando você quiser a resposta de um segundo fornecedor em vez de uma nova tentativa.

Verifique a taxa por token em tempo real do GPT-5.6 Luna e do Claude Haiku 4.5 antes de comprometer qualquer um dos dois com um caminho de produção — ambas as taxas são repassadas com 0% de acréscimo, então mudam no mesmo dia em que o fornecedor as altera, e os rastreadores de preços de terceiros ficam defasados de dias a semanas.

Perguntas que valem realmente a pena responder

A GPT-5.6 Luna é realmente cinco vezes mais barata que o Claude Haiku 4.5? Em tokens de entrada, sim — US$ 0,20 contra US$ 1,00. No custo de concluir a mesma tarefa avaliada, não: US$ 0,18 contra US$ 0,21. A diferença entre essas duas afirmações está na verbosidade da Luna. Ela produz aproximadamente o dobro dos tokens de saída que o Haiku produz para concluir o mesmo trabalho, e tokens de saída custam seis vezes o que custam os tokens de entrada. Para respostas curtas, o preço de etiqueta é amplamente honesto. Para trabalho com uso intenso de raciocínio, não é.

Posso ajustar o custo da mesma forma nos dois? Não, e esta é a diferença mais subnotificada entre eles. O Luna expõe um controle de esforço de raciocínio com configurações que vão de none até max, de modo que custo e qualidade são negociados explicitamente a cada requisição. O pensamento estendido do Haiku 4.5 ou está habilitado, com um orçamento de tokens, ou não está — não existe parâmetro de esforço. Se o controle de custo por requisição é importante para você, apenas um desses dois oferece essa alavanca.

E quanto a um classificador de alto volume fazendo alguns milhões de chamadas por dia?Nenhum dos modelos precisa de raciocínio para isso. Execute o Haiku 4.5 com extended thinking desligado, ou o Luna com effort definido como none, e compare em latência e comprimento de saída em vez do índice composto — nesse ponto, as perguntas relevantes são com que rapidez o primeiro token chega e quantos tokens a resposta consome, e os benchmarks de inteligência deixam de diferenciar entre eles.

A two-column comparison scoreboard for GPT-5.6 Luna and Claude Haiku 4.5. Luna's column reads Intelligence Index 38, context window 1M tokens, price $0.20/$1.20, cost per index task $0.18, output speed 109.4 tokens per second, reasoning control an effort dial from none to max. Haiku 4.5's column reads Intelligence Index 18, context window 200K tokens, price $1.00/$5.00, cost per index task $0.21, output speed 84.7 tokens per second, reasoning control extended thinking on or off.

Qual deles ainda estará aqui daqui a um ano? O Claude Haiku 4.5 tem um compromisso publicado de não ser descontinuado antes de 15 de outubro de 2026. A Open​AI não publica uma data equivalente para o GPT-5.6 Luna, e a linha GPT-5.6 já tem uma geração mais recente acima dela, o GPT-6 Astra. Nenhum dos dois é motivo para evitar o Luna, mas se o seu roadmap pressupõe um horizonte de planejamento de onze meses, é motivo para manter o identificador do modelo na configuração, em vez de fixo no código.

Taxa ao vivo por token para GPT-5.6 Luna na mesma chave, repassada com 0% de margem e sem uma segunda relação de cobrança.

Taxa por token ao vivo para o Claude Haiku 4.5 no mesmo endpoint, para que os dois níveis possam ser comparados sem um segundo contrato.