
Claude Haiku 5.5 vs GPT-6 Luna Pro: Um Modelo Contra um Modo
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Um lado desta comparação é um modelo, e o outro é uma configuração. Claude Haiku 5.5 entrou em disponibilidade geral em 7 de outubro de 2026 a $0,10 por milhão de tokens de entrada e $0,50 por milhão de saída, na Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry e Claude Platform on AWS. GPT-6 Luna Pro não é um modelo de forma alguma: a maneira de alcançá-lo é chamar GPT-6 Luna — ativo desde 22 de setembro de 2026 pelos mesmos $0,10 e $0,50 — com reasoning.mode definido como pro em vez de standard. Não há identificador gpt-6-luna-pro na página de modelos da OpenAI. Portanto, o enquadramento honesto desta disputa não é "qual modelo vence", mas "qual é a melhor maneira de gastar dez centavos por milhão de tokens de entrada": um modelo pequeno com um ajuste de esforço, ou um modelo maior executado em um modo que faz mais trabalho e cobra pelos tokens que não lhe mostra. Para trabalhos curtos e de alto volume, a resposta geralmente é a primeira. Para trabalhos difíceis e ocasionais, pode ser a segunda — e o número que decide isso, a OpenAI não publicou.
O que "pro" é, mecanicamente
O guia de raciocínio da OpenAI afirma que os modelos GPT-5.6 e GPT-6 suportam dois modos na Responses API, standard (o padrão) e pro, selecionados por reasoning.mode. O modo é um controle diferente de reasoning.effort: o modo decide quanto trabalho o modelo faz antes de se comprometer com uma resposta, o esforço decide quanto raciocínio acontece dentro do modo que você escolher. Os valores de esforço documentados do GPT-6 Luna são none, low, medium (o padrão), high, xhigh e max, e qualquer um deles pode ser combinado com o modo pro.
Sobre cobrança, o guia é explícito e ligeiramente contraintuitivo. O modo Pro agrega todo o trabalho do modelo por trás da resposta final e cobra esses tokens "às taxas de tokens padrão do modelo selecionado". Não há prêmio Pro na tabela de tarifas. O custo aparece como volume, porque o modo Pro "executa mais trabalho de modelo do que o modo padrão, aumentando o uso de tokens e o custo" — e os tokens de raciocínio são cobrados como tokens de saída, embora apareçam apenas no objeto de uso em output_tokens_details.reasoning_tokens. Se você não ler esse campo, o aumento fica invisível até a fatura chegar.
Duas comparações decorrem disso e vale a pena mantê-las separadas. Em relação ao GPT-6 Luna no modo padrão, o modo pro é o mesmo modelo com um multiplicador desconhecido no consumo de tokens. Em relação ao Claude Haiku 5.5, também é um modelo diferente numa escala diferente — 1.050.000 tokens de contexto contra 1M, um teto de entrada de 922.000 tokens e um corte de conhecimento em 18 de maio de 2026, num nível que a própria documentação de lançamento da Anthropic posiciona um pouco acima do Haiku em trabalho agêntico difícil. As duas diferenças puxam na mesma direção quanto ao custo e em direções opostas quanto à capacidade, e é por isso que nenhuma delas pode ser lida a partir de uma lista de preços.
As tabelas de tarifas, lado a lado
Ambos os modelos são cobrados em dois níveis, e os limites de cada um estão em pontos diferentes — o que importa mais do que a tarifa anunciada, porque ambas as tarifas anunciadas são idênticas.
• Entrada — Claude Haiku 5.5 $0,10 por milhão até 100.000 tokens, $0,50 acima disso. GPT-6 Luna $0,10 até 272.000 tokens, $0,20 acima disso.
• Saída — Claude Haiku 5.5 $0,50 até 100.000 tokens, $2,50 acima disso. GPT-6 Luna $0,50 até 272.000 tokens, $0,75 acima disso.
• Cache — No Claude Haiku 5.5, as leituras de cache custam $0.01 e as gravações $0.125 abaixo da linha, e $0.05 e $0.625 acima dela. No GPT-6 Luna, as leituras de cache custam $0.01 e as gravações $0.125 até 272.000 tokens, e $0.02 e $0.25 acima disso.
• Contexto e saída — 1M de tokens e 128.000 de saída máxima para o Claude Haiku 5.5; 1.050.000 tokens com um limite de entrada de 922.000 tokens e saída máxima de 128.000 para o GPT-6 Luna.
• Pensamento — adaptativo em ambos. Claude Haiku 5.5 tem como padrão o nível médio de esforço; GPT-6 Luna tem como padrão o nível médio de esforço e modo padrão, com o modo pro como opção adicional.
• Descontos para batch e cache — O Claude Haiku 5.5 concede 50% de desconto na Message Batches API; o GPT-6 Luna concede 50% de desconto em Batch e Flex, cobra o dobro no modo Fast e adiciona um prêmio de 10% para processamento regional.
A única linha que não tem o mesmo formato é o tokenizador. A documentação da Anthropic observa que o Claude Haiku 5.5 usa o tokenizador mais recente compartilhado com o Claude 4.7 e versões posteriores, então o mesmo texto conta como aproximadamente 30% mais tokens do que no Claude Haiku 4.5. Isso não altera a tarifa; altera a rapidez com que um prompt atinge a faixa de 100.000 tokens, e é uma diferença real de custo que nenhuma tabela de preços mostra. Um prompt de 90.000 tokens é medido como aproximadamente 117.000 e paga US$ 0,50 por milhão de tokens de entrada, em vez de US$ 0,10 — uma tarifa cinco vezes maior em um prompt que parece estar confortavelmente abaixo do limite.
Quanto custa o modo pro, nas únicas unidades que qualquer pessoa pode usar
Como o multiplicador não foi publicado, o útil a declarar é quanto custa cada token adicional e, depois, o que as faixas plausíveis fazem em volume.
• Com o preço de US$ 0,50 por milhão de tokens de saída do GPT-6 Luna, cada 10.000 tokens de saída extras por tarefa custa US$ 0,005. Execute 100.000 tarefas por dia e esse incremento será de um bilhão de tokens extras — cerca de US$ 500 por dia, ou US$ 15.000 por mês, em um modelo cujo preço anunciado é de dez centavos por milhão de tokens de entrada.
• Para dar uma ideia de escala, o GPT-6 Luna, no esforço máximo, já consome 140 milhões de tokens de saída ao rodar o Intelligence Index, contra uma mediana de 100 milhões, o que o avaliador descreve como um tanto prolixo. A tabela de lançamento da Anthropic, executada no harness da própria Anthropic, coloca o GPT-6 Luna em 16,4% no Terminal-Bench 4.0 e 42,4% no FrontierCode 1.1, contra 39,2% e 46,4% do Claude Haiku 5.5 — números reportados pelo fornecedor, a suíte de um fornecedor, o modelo de um concorrente.
• No ranking independente, a ordenação é mais estreita. A Artificial Analysis atribui ao Claude Haiku 5.5, com esforço máximo, 43 no Intelligence Index v4.3.2, segundo de 182, e ao GPT-6 Luna (Max), 38, oitavo de 182. Ambos os números são do modo padrão, com esforço máximo. Não há avaliação independente do GPT-6 Luna no modo pro: sua página não traz uma entrada pro, e a Artificial Analysis não lista nenhuma.
O problema estrutural para o pro mode é a interação entre esses dois últimos pontos. Toda a vantagem de custo do GPT-6 Luna sobre o Claude Haiku 5.5 vem da eficiência de tokens — 140 milhões de tokens de saída contra 440 milhões para o mesmo conjunto, a taxas idênticas, e é por isso que a mesma avaliação custa $0,07 por tarefa de um lado e $0,21 do outro. O pro mode é, por definição, um modo que emite mais tokens. Ativá-lo é desligar aquilo que tornou o modelo barato nesta comparação, e o multiplicador que indicaria em quanto não é publicado. Isso não é um argumento de que o pro mode seja um mau negócio — em tarefas difíceis, mais trabalho geralmente é trabalho melhor — é um argumento de que o pro mode compete por capacidade, não por preço, e deve ser avaliado em relação aos modelos de nível intermediário com preços próximos, e não em relação ao nível barato no qual ele se insere.

Onde cada um realmente se destaca
Reduza-o à decisão e a divisão fica clara, embora nenhum dos lados esteja livre de ressalvas.
O Claude Haiku 5.5 domina a faixa mais barata. É mais rápido nos dois sentidos que importam: 241,9 tokens de saída por segundo medidos pela Artificial Analysis, contra 123,0 do GPT-6 Luna, e um tempo até o primeiro token de 295 segundos na execução do Index, que é resultado de quanto tempo ele pensa antes de responder no esforço Max, e não uma métrica de rede. Sua tabela de preços atinge a segunda faixa em 100.000 tokens, e seu tokenizador infla os prompts em cerca de 30%, então cargas de trabalho com prompts longos pagam mais do que o preço de etiqueta sugere nos dois aspectos. O que ele entrega em troca é uma vantagem de cinco pontos de inteligência no índice independente e um dial de esforço — de Low a Max — que é o controle de custos mais útil que qualquer um dos fornecedores incluiu nesses lançamentos. Fixar o esforço é como você troca parte dessa liderança de cinco pontos por um custo por tarefa mais próximo do de GPT-6 Luna.
O GPT-6 Luna Pro domina a extremidade difícil, com uma conta não quantificada. O modelo por baixo é mais barato por token acima de 272.000 tokens de entrada do que o Claude Haiku 5.5 acima de 100.000, por um fator de dois e meio na entrada e três e um terço na saída, e seu primeiro nível alcança dezoito vezes mais longe na janela de contexto. O modo padrão é mensuravelmente mais barato por tarefa concluída. O modo Pro troca isso por mais trabalho por resposta nas mesmas tarifas, e se ele supera o Claude Haiku 5.5 no Max effort ou um modelo de nível intermediário em uma determinada tarefa é uma questão que nenhum número publicado responde. A maneira de responder a isso é executar a tarefa das duas formas e ler o campo de tokens de raciocínio.

Experimentar qualquer um dos dois sem apostar nisso
A parte incómoda desta comparação é que o seu número mais importante — o custo real do modo pro — só pode ser produzido ao encaminhar o seu próprio tráfego por ele, e o custo efetivo do modelo menor depende de onde os seus prompts ficam em relação a uma linha de 100 000 tokens após a re-tokenização. Ambos são problemas de medição, e ambos são mais baratos num endpoint partilhado do que em dois clientes de fornecedores.
O GPT-6 Luna está hoje no catálogo do OrcaRouter pelo preço de tabela do fornecedor, com 0% de mark-up repassado, pelo que a linha de base do modo padrão para esta comparação pode ser chamada a partir de uma única chave, e uma alteração de preço do fornecedor chega ao nosso lado no mesmo dia, e não no próximo ciclo de faturação. O Claude Haiku 5.5 ainda não está no catálogo; o nível da Anthropic que roteamos hoje é o Claude Haiku 4.5, o Claude Sonnet 5.5 e o Claude Opus 5.5, o que faz de um teste de escalonamento de uma perna barata até um nível intermédio uma regra de encaminhamento, e não uma alteração de código. O failover automático por baixo é o que permite que um modelo com dois dias de vida suporte tráfego de produção enquanto ainda o está a medir: um fornecedor que começa a falhar passa a ser contornado em vez de deixar cair o pedido, o que é a diferença entre um piloto que pode executar esta semana e uma migração que tem de agendar.
O que resolve isso
Três coisas, em ordem de quanto elas mudariam a resposta. A OpenAI publicar um multiplicador de tokens do modo pro, ou um slug pro com sua própria linha de preço, converteria a incógnita central em aritmética. O Artificial Analysis rodar novamente o GPT-6 Luna em modo pro com esforço equiparado faria isso pelo lado independente. E uma segunda execução independente do Claude Haiku 5.5 em medium em vez de Max diria a você quanto o modelo realmente custa na sua configuração padrão, que é a configuração que a maioria das pessoas vai usar — os US$ 0,21 por tarefa no quadro é um valor de esforço Max, e Max não é o padrão.
Até então, o resumo preciso é restrito. Claude Haiku 5.5 é um modelo que você pode chamar, precificar e testar em benchmark hoje, e, nos volumes para os quais sua camada foi projetada, ele é a resposta mais barata, com uma forma documentada de ficar ainda mais barato. GPT-6 Luna Pro é uma configuração de um modelo que você pode chamar; sua tabela de preços não é o problema, seu consumo de tokens não é auditado, e todo o argumento a favor dele se baseia em tarefas difíceis o suficiente para que gastar mais tokens seja o objetivo. Compre-o para essas tarefas, meça-o antes de comprá-lo, e não o coloque em um fluxo de alto volume até que alguém publique o multiplicador.

