
GPT-5.6 Luna vs Claude Haiku 4.5: Nível Barato, Duas Faturas Muito Diferentes
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
GPT-5.6 Luna e Claude Haiku 4.5 são os níveis baratos de duas famílias de fronteira diferentes, e a diferença entre eles depende inteiramente de qual número você observa. No preço de tabela, isso é uma goleada: $0,20 por milhão de tokens de entrada contra $1,00. No custo por tarefa concluída do Intelligence Index da Artificial Analysis, é $0,18 contra $0,21 — uma diferença de cerca de 14%. Os mesmos dois modelos, duas respostas honestas, e o motivo pelo qual eles divergem é a coisa mais útil de se entender antes de escolher um.
A versão curta: Luna é o modelo mais forte no papel e o mais rápido em throughput, mas pensa longamente — e cobra por isso. Haiku 4.5 é mais antigo, com escopo menor e consideravelmente mais previsível quanto ao custo de uma requisição. Qual dessas características importa mais é uma propriedade da sua carga de trabalho, não dos modelos.
Num relance
• Fornecedor — OpenAI vs Anthropic
• Lançado — 9 de julho de 2026 vs 15 de outubro de 2025
• Janela de contexto — 1M tokens vs 200K tokens
• Saída máxima — 128K tokens vs 64K tokens
• Entrada — texto, imagem e arquivo vs texto, imagem e PDF
• Preço por milhão de tokens — $0,20 de entrada / $1,20 de saída vs $1,00 de entrada / $5,00 de saída
• Artificial Analysis Intelligence Index — 38, 4º de 177 vs 18, 138º de 200 (ambos em configuração de raciocínio)
• Custo por tarefa do Intelligence Index — $0,18 vs $0,21
• Velocidade de saída — 109,4 tokens/seg vs 84,7 tokens/seg
• Controle de raciocínio — um ajuste de esforço de nenhum a máximo vs pensamento estendido ativado manualmente, sem parâmetro de esforço
• Data limite de conhecimento confiável — fevereiro de 2026 vs. fevereiro de 2025 (dados de treinamento até julho de 2025)
• Compromisso de aposentadoria — nenhum publicado vs. não antes de 15 de outubro de 2026
Onde o GPT-5.6 Luna realmente vence

Capacidade, por uma margem ampla. Um Índice de Inteligência de 38 contra 18 não é uma disputa acirrada. A Luna fica à frente do Haiku no composto que a Artificial Analysis monta a partir de avaliações de raciocínio, conhecimento, matemática e programação, e o faz sendo o modelo mais barato por token. Quem comparou essas duas famílias pela última vez no índice anterior a setembro — em que a Luna aparecia com 51 e 52 — deve observar que toda a escala foi repontuada em setembro de 2026, e a vantagem da Luna sobreviveu à repontuação.
Contexto, cinco vezes maior. Uma janela de 1M de tokens contra 200K decide sozinha uma categoria de trabalho: varreduras de repositório inteiro, conjuntos extensos de documentos, transcrições longas de agentes que precisariam de sumarização no Haiku. Se a sua aplicação é definida pela quantidade de contexto que precisa manter, a comparação termina aqui.
Margem de saída, em dobro. Um máximo de 128K tokens de saída contra 64K faz diferença para geração de conteúdo longo e para loops agênticos que retornam planos estruturados em vez de respostas de uma linha.
Vazão. 109,4 tokens de saída por segundo contra 84,7 é uma diferença real para interfaces de streaming, embora não seja a mesma coisa que responsividade — consulte a seção de latência abaixo.
Preço, na etiqueta.Cinco vezes mais barato na entrada e cerca de quatro vezes mais barato na saída não é um erro de arredondamento e, para trabalhos com saída curta, é a decisão inteira.
Onde o Claude Haiku 4.5 ainda conquista seu lugar
Custo previsível. O raciocínio do Haiku 4.5 é um pensamento estendido que você ativa manualmente. Quando desativado, ele responde diretamente e cobra de forma previsível. O botão de esforço do GPT-5.6 Luna vai até o máximo, e cada nível acima significa mais tokens de saída à tarifa de saída. Uma equipe que quer um teto de custo que possa declarar de antemão achará o Haiku mais fácil de entender, mesmo com um preço de etiqueta mais alto.
A configuração sem raciocínio é genuinamente barata de executar. A Artificial Analysis atribui à configuração sem raciocínio do Claude 4.5 Haiku uma pontuação de 15 no Intelligence Index, sem nenhum valor publicado de custo por tarefa, e ela é uma opção razoável para trabalhos em que o critério é simplesmente "processar isto corretamente" — classificação de intenção, extração de campos, decisões de roteamento, triagem de moderação. Nessas tarefas, a diferença no índice entre 15 e 38 é praticamente irrelevante, porque não se pede que nenhum dos modelos pense.
O cache e os descontos por lote já são maduros. O Haiku 4.5 oferece um desconto de 90% na leitura do cache de prompts e um desconto de 50% na Batch API. O Luna tem uma economia de cache comparável, então isso está mais para um empate do que para uma vantagem — mas, se o seu pipeline já processa em lotes por meio das ferramentas da Anthropic, o custo de migração para sair do Haiku é um custo real, e ele não aparecerá em nenhum benchmark.
Um histórico operacional comprovado. O Haiku 4.5 está em produção desde outubro de 2025 e tem um compromisso publicado de descontinuação não antes de 15 de outubro de 2026. Luna tem dois meses. Para uma carga de trabalho em que o modelo é um detalhe, e não o produto, um histórico de produção de onze meses vale algo que um benchmark não consegue expressar.
É o modelo mais fiel à verdade, no único eixo que mede isso.A comparação direta da Artificial Analysis coloca o Luna à frente em quase todas as linhas de capacidade — AA-Briefcase 1.339 contra 614, GDPval-AA v2 1.489 contra 854, AutomationBench-AA 50% contra 3%, Humanity's Last Exam 39% contra 10%, GDPpdf 24% contra 4%. A exceção é o AA-Omniscience, que penaliza respostas erradas dadas com confiança em perguntas de conhecimento: o Luna pontua -10 nesse quesito, contra -4 do Haiku. Uma pontuação negativa significa que a penalidade por alucinação supera o crédito por precisão, e a penalidade do Luna é maior. Um índice composto mais alto não é a mesma coisa que uma resposta mais confiável, e na única avaliação criada para separar essas duas coisas, o modelo mais antigo se sai melhor.
O cálculo de custos em uma carga de trabalho real
Considere um pipeline que consome 100 milhões de tokens de entrada e emite 20 milhões de tokens de saída por mês.
• GPT-5.6 Luna — 100 × $0.20 = $20, mais 20 × $1.20 = $24. Total de $44 por mês.
• Claude Haiku 4.5 — 100 × $1,00 = $100, mais 20 × $5,00 = $100. Total de $200 por mês.
Nessas proporções, a Luna é cerca de 4,5x mais barata, e é esse o cálculo que a maioria das comparações publica. Agora mude uma premissa. Se o esforço de raciocínio da Luna for aumentado, seus tokens de saída crescem, e a saída é o lado caro — a $1,20, custa seis vezes o que a entrada custa. Leve a Luna ao ponto em que ela emite 150M de tokens de saída para o mesmo volume de trabalho, como faz no conjunto de avaliação da Artificial Analysis, e os $44 passam confortavelmente de $180. O fator de 4,5x colapsa rumo à paridade.
A lição não é que a Luna seja cara. É que a vantagem de preço da Luna é função do quanto ela fala, o que é um parâmetro que você controla. Reduza o raciocínio para extração e classificação e o desconto é real. Deixe-o no máximo para tudo e você comprou um modelo mais capaz a um preço que já não se parece com o preço de etiqueta.
Latência, e um número em que você não deveria confiar
Os números publicados de tempo até o primeiro token para esses dois modelos são praticamente inúteis, e vale a pena entender por quê. No Artificial Analysis, as configurações de raciocínio de ambos os modelos mostram latências do primeiro token na casa das dezenas ou até das centenas de segundos, porque o ambiente de avaliação não emite um token até que o modelo termine o raciocínio. Esse número mede a configuração da avaliação, não a capacidade de resposta do modelo.
A telemetria de roteamento é uma fonte melhor, porque mede o modelo em produção. Os próprios números da OrcaRouter colocam o GPT-5.6 Luna em uma mediana de 1,83 segundo até o primeiro token e um percentil 95 de 10,00 segundos, contra o Claude Haiku 4.5 com 3,81 segundos de mediana e 9,47 segundos no percentil 95. Lido corretamente, isso diz que os dois estão mais próximos do que os rankings sugerem: Luna vence na solicitação típica, e as caudas ficam a cerca de meio segundo uma da outra. Se sua preocupação é o pior caso, e não a média, há muito pouco entre eles.
Qual escolher
Escolha o GPT-5.6 Luna se você estiver lidando com contexto longo, se a tarefa se beneficiar de raciocínio real, se a saída for longa ou estruturada, ou se quiser o modelo mais forte disponível na parte mais baixa da faixa de preço. Também é a escolha mais natural se o restante da sua stack já funcionar com o comportamento da família OpenAI.
Escolha o Claude Haiku 4.5 se o seu trabalho for de saída curta e alto volume, se você precisar de um teto de custo que possa declarar antes da execução da solicitação, se o seu pipeline já estiver construído em torno do batching e do caching da Anthropic, ou se você valorizar um modelo com histórico de produção e ciclo de vida publicado em vez de um que tem apenas dois meses.
Não escolha nenhum dos dois para uma tarefa em que um pequeno modelo de raciocínio ou um classificador ajustado finamente dariam conta. Grande parte do tráfego que esses dois níveis absorvem é classificação e extração que rodariam mais barato em algo mais específico — e o modelo mais barato é sempre aquele que você não precisou.
Executando ambos em uma única chave

A disputa deixa de ser exclusiva quando ambos ficam acessíveis por um único endpoint. Na OrcaRouter, Claude Haiku 4.5 e GPT-5.6 Luna ficam atrás da mesma URL base compatível com OpenAI — uma API para mais de 200 modelos, uma chave, uma linha de cobrança, nenhum segundo contrato e nenhuma alteração de código além do identificador do modelo. Para uma decisão de tier sobre a qual você ainda não tem certeza, isso transforma uma migração em um valor de configuração.
Dois recursos fazem trabalho de verdade aqui. O failover automático entre provedores significa que uma camada de baixo custo pode carregar tráfego de produção sem dependência de um único fornecedor — útil quando o modelo é barato o bastante para você enviar milhares de chamadas por hora em vez de uma única chamada importante. E a DSL de roteamento permite compor uma chamada a partir de vários modelos: encaminhe a maioria simples das requisições para o Luna, escale o restante para o GPT-5.6 Terra e mantenha o Haiku 4.5 no pool como fallback para quando você quiser a resposta de um segundo fornecedor em vez de uma nova tentativa.
Verifique a taxa por token em tempo real do GPT-5.6 Luna e do Claude Haiku 4.5 antes de comprometer qualquer um dos dois com um caminho de produção — ambas as taxas são repassadas com 0% de acréscimo, então mudam no mesmo dia em que o fornecedor as altera, e os rastreadores de preços de terceiros ficam defasados de dias a semanas.
Perguntas que valem realmente a pena responder
A GPT-5.6 Luna é realmente cinco vezes mais barata que o Claude Haiku 4.5? Em tokens de entrada, sim — US$ 0,20 contra US$ 1,00. No custo de concluir a mesma tarefa avaliada, não: US$ 0,18 contra US$ 0,21. A diferença entre essas duas afirmações está na verbosidade da Luna. Ela produz aproximadamente o dobro dos tokens de saída que o Haiku produz para concluir o mesmo trabalho, e tokens de saída custam seis vezes o que custam os tokens de entrada. Para respostas curtas, o preço de etiqueta é amplamente honesto. Para trabalho com uso intenso de raciocínio, não é.
Posso ajustar o custo da mesma forma nos dois? Não, e esta é a diferença mais subnotificada entre eles. O Luna expõe um controle de esforço de raciocínio com configurações que vão de none até max, de modo que custo e qualidade são negociados explicitamente a cada requisição. O pensamento estendido do Haiku 4.5 ou está habilitado, com um orçamento de tokens, ou não está — não existe parâmetro de esforço. Se o controle de custo por requisição é importante para você, apenas um desses dois oferece essa alavanca.
E quanto a um classificador de alto volume fazendo alguns milhões de chamadas por dia?Nenhum dos modelos precisa de raciocínio para isso. Execute o Haiku 4.5 com extended thinking desligado, ou o Luna com effort definido como none, e compare em latência e comprimento de saída em vez do índice composto — nesse ponto, as perguntas relevantes são com que rapidez o primeiro token chega e quantos tokens a resposta consome, e os benchmarks de inteligência deixam de diferenciar entre eles.

Qual deles ainda estará aqui daqui a um ano? O Claude Haiku 4.5 tem um compromisso publicado de não ser descontinuado antes de 15 de outubro de 2026. A OpenAI não publica uma data equivalente para o GPT-5.6 Luna, e a linha GPT-5.6 já tem uma geração mais recente acima dela, o GPT-6 Astra. Nenhum dos dois é motivo para evitar o Luna, mas se o seu roadmap pressupõe um horizonte de planejamento de onze meses, é motivo para manter o identificador do modelo na configuração, em vez de fixo no código.
Taxa ao vivo por token para GPT-5.6 Luna na mesma chave, repassada com 0% de margem e sem uma segunda relação de cobrança.
Taxa por token ao vivo para o Claude Haiku 4.5 no mesmo endpoint, para que os dois níveis possam ser comparados sem um segundo contrato.
