Cartão de título principal para GPT-6 Luna vs GPT-5.6 Luna, com o selo "GA 22 Sep 2026", o título "GPT-6 Luna vs GPT-5.6 Luna", o subtítulo "O mesmo nome, metade do preço, um entregável pior", e três cartões de estatísticas com os textos "Entrada: $0,10 vs $0,20 por MTok", "Saída: $0,50 vs $1,20 por MTok" e "Índice AA: 37,26 vs 37,32", com o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

GPT-6 Luna vs GPT-5.6 Luna: O Mesmo Nome, Metade do Preço e um Entregável Pior

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois modelos, uma palavra em comum, e uma pontuação independente que é efetivamente idêntica. GPT-6 Luna atinge 37,26 no Artificial Analysis Intelligence Index; GPT-5.6 Luna atingiu 37,32. Uma diferença de 0,07 ponto não é uma medição, é ruído, e é o fato mais importante deste par. O que separa os dois modelos não é a capacidade — é $0,0681 por tarefa concluída do índice contra $0,1783, e um conjunto de regressões em trabalho de conhecimento que o corte de preço não menciona.

As datas importam para a leitura dos números. O GPT-5.6 Luna foi lançado em 9 de julho de 2026 a $0,20 por milhão de tokens de entrada e $1,20 por milhão de tokens de saída. O GPT-6 Luna foi lançado em 22 de setembro de 2026 a $0,10 e $0,50 — exatamente metade da tarifa de entrada e 58% de desconto na tarifa de saída, que a OpenAI descreveu como permanente, e não promocional. Essa é uma redução genuína, e também é a metade menor da história. A metade maior é que o modelo mais novo é um modelo diferente, não o mesmo com preço reajustado.

Two-column comparison scoreboard titled 'GPT-6 Luna vs GPT-5.6 Luna - the scoreboard'. Left column 'GPT-6 Luna': Input per MTok $0.10; Output per MTok $0.50; Cost per index task $0.0681; Hallucination rate 76.7%; AA-Briefcase Elo 1,299.23; AA Intelligence Index 37.26. Right column 'GPT-5.6 Luna': Input per MTok $0.20; Output per MTok $1.20; Cost per index task $0.1783; Hallucination rate 92.6%; AA-Briefcase Elo 1,345.38; AA Intelligence Index 37.32. Footer reads 'Vendor price lines per OpenAI; independent figures per Artificial Analysis.' OrcaRouter logo composited bottom-right.

O que uma migração realmente rende, em números

Alinhe os dois nas dimensões que decidem uma migração e o quadro é desigual. Algumas linhas melhoram, algumas regridem, e uma melhora consideravelmente.

• Preço — GPT-6 Luna $0,10 de entrada / $0,50 de saída por milhão de tokens vs GPT-5.6 Luna $0,20 / $1,20. Metade no custo de entrada, 58% de desconto na saída.

• Entrada em cache — $0,01 por milhão contra $0,02. O mesmo desconto de 90% sobre uma base reduzida pela metade, então um prefixo repetido custa metade do que custava em julho.

Custo por tarefa concluída — US$ 0,0681 contra US$ 0,1783 na mesma suíte. Uma redução de 62%, maior do que o corte no preço dos tokens porque a composição de tarefas não é idêntica.

• Tokens de saída por tarefa — 50.537 contra 41.235. O novo modelo é 23% mais verboso por trabalho concluído, e 78% de sua saída é raciocínio que nunca aparece na resposta.

• Janela de contexto — 1.050.000 tokens contra 1.000.000. O mesmo teto prático; ambos limitam a saída a 128.000 tokens.

• Abstenção — uma taxa de alucinação de 76,7% no AA-Omniscience contra 92,6%. Esta é a maior melhoria individual do conjunto, e não se trata de um ganho de conhecimento: a precisão passa de 42,7% para 43,8%, essencialmente estável. O modelo mais recente recusa em vez de inventar, o que constitui uma mudança de comportamento e não de capacidade.

• Entregáveis de trabalho do conhecimento — AA-Briefcase v1.1 cai de 1.345,38 Elo para 1.299,23, e GDPval-AA v2.1 cai de 1.443,14 para 1.367,09. Ambos em queda, de aproximadamente 46 e 76 pontos.

• Codificação e trabalho de longo horizonte — Terminal-Bench 4.0 passa de 11,6% para 12,6% e SciCode de 53,6% para 54,6%, as duas linhas aqui que sobem. Em contrapartida, o Coding Agent Index cai de 43 para 41 e as avaliações agênticas no estilo SWE seguem a mesma direção.

• AutomationBench-AA — 53,2% contra 50,2%. Aumentou, e por uma margem maior do que qualquer outra medida agêntica do conjunto.

Screenshot of the Artificial Analysis page for GPT-6 Luna (max), dated September 2026, showing a proprietary model that accepts text and image input and outputs text with a 1M-token context window, an Artificial Analysis Intelligence Index score of 37, pricing of $0.10 per million input tokens and $0.50 per million output tokens, a 90% cache discount, and a cost rank of 20th of 183 models in its class.

A regressão está no artefato, não no raciocínio.

Vale nomear o padrão dessas duas últimas linhas, porque é ele que define a decisão. O novo modelo é melhor em ações agênticas de uma única etapa e pior em entregar um documento finalizado. A Artificial Analysis atribui o declínio no trabalho do conhecimento à qualidade de apresentação e a entregáveis que deixaram de fora elementos obrigatórios da rubrica, e não a falhas factuais ou de raciocínio — que é precisamente o tipo de regressão que passa em um smoke test e falha em uma revisão.

Reúna os dois fatos e a migração se divide claramente pelo que consome a saída. Se o seu pipeline lê saída estruturada — JSON, uma classificação, um campo extraído, uma decisão de roteamento —, a regressão de apresentação não custa nada, a melhoria na abstenção é um ganho real, e a redução de 62% no custo por tarefa se concretiza integralmente. Se uma pessoa lê o entregável — um relatório, um memorando, um documento voltado ao cliente —, o modelo mais novo é mensuravelmente pior exatamente naquilo pelo que você está pagando, e a economia está comprando um revisor.

O número de abstenção merece o mesmo tratamento. Um modelo que passa de inventar em 93% daquilo que não sabe para inventar em 77% é um objeto substancialmente diferente para uma barreira de proteção, uma triagem de conformidade ou qualquer pipeline em que uma resposta errada dada com confiança se propague. Essa melhoria é real, é medida de forma independente e é o argumento mais forte — que não depende de preço algum — para migrar trabalho para o novo modelo.

O que muda no seu código, e o que não muda

Menos do que um corte de preço desse tamanho sugere, o que é a boa notícia. A janela de contexto é da mesma classe, a saída máxima é idêntica em 128.000 tokens, e a cláusula de reajuste de preços para contexto longo da família permanece inalterada: solicitações acima de 272.000 tokens de entrada são cobradas com tarifas de entrada e cache de 2x e de saída de 1,5x, para a solicitação inteira, e não para a parte acima do limite. Uma solicitação que era cara com 300.000 tokens no GPT-5.6 Luna também é cara no GPT-6 Luna — metade da tarifa, o mesmo precipício, então uma carga de trabalho que deveria ter sido dividida em julho ainda deveria ser dividida agora.

A escada de esforço é onde o comportamento muda, e não o custo. O GPT-6 Luna expõe none, low, medium (o padrão), high, xhigh e max, e o padrão importa: um pipeline que foi ajustado para o esforço padrão de um modelo não fica automaticamente ajustado para o de outro. Equipes que fixaram uma configuração explicitamente não são afetadas. Equipes que usaram o padrão estão executando uma configuração diferente da que usavam em julho, e o sintoma visível será o volume de tokens, e não a qualidade.

Vale a pena repetir uma armadilha, porque ela não desaparece com o novo modelo. No endpoint Chat Completions, a chamada de funções só funciona quando o esforço de raciocínio está definido como none; todos os outros níveis de esforço, e todas as ferramentas integradas, exigem a Responses API. Uma equipe que portar um loop de chamada de ferramentas apenas alterando a string do modelo descobrirá que suas ferramentas ficam silenciosamente indisponíveis no esforço medium padrão, e a correção é reescrever a superfície de chamada, e não um parâmetro.

O que você pode rotear hoje, e o que não pode

Esta é a parte da migração que não tem nada a ver com benchmarks. O GPT-5.6 Luna está no OrcaRouter pelo preço de tabela — US$ 0,20 por milhão de tokens de entrada, US$ 1,20 por milhão de tokens de saída, uma janela de contexto de 1.000.000 de tokens, uma saída máxima de 128.000 tokens e um tempo p50 até o primeiro token de 1,60 segundos, medido em tráfego real na nossa própria página do modelo. Repassamos os preços de tabela dos provedores sem nenhum acréscimo, então no dia em que a OpenAI reajustou os preços desta família, a mudança já estava no ar do nosso lado, em vez de no próximo ciclo de faturamento.

Screenshot of the OrcaRouter model page for openai/gpt-5.6-luna, showing GPT-5.6 Luna by OpenAI dated 2026-07-09, Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 128K maximum output, text, image and file input, pricing of $0.20 input and $1.20 output per million tokens, a p50 time to first token of 1.60 seconds and a p95 of 10.00 seconds, and the description 'GPT-5.6 Luna is the fast, cost-efficient model in OpenAI's GPT-5.6 series — tuned for high-volume, latency-sensitive workloads while retaining genuinely capable reasoning.'

O GPT-6 Luna não é roteável pelo OrcaRouter a partir de 23 de setembro de 2026. A disponibilidade está na API própria da OpenAI e nos catálogos de nuvem que oferecem essa família, e não listamos um modelo que não podemos atender. A consequência prática é que uma equipe que planeja essa migração pode migrar a precificação hoje e não pode migrar o roteamento hoje — as duas metades da mudança acontecem em datas diferentes.

O que isso torna possível, entretanto, é o arranjo que a maioria das equipes acabará querendo de qualquer forma. Mantenha o GPT-5.6 Luna nos caminhos em que o entregável é o produto, rode o GPT-6 Luna onde a saída for consumida por código e trate a fronteira como um nível, e não como uma reescrita. Como os modelos que você consegue alcançar ficam atrás de um único endpoint, com mais de 200 modelos na mesma chave e failover automático entre provedores, adicionar ou remover um nível é uma entrada de configuração, e não uma segunda integração — e o caminho de escalonamento deixa de depender de qualquer modelo individual estar disponível.

A decisão de migração, dita sem rodeios

Mova o trabalho para onde a saída é lida por máquina e a condição de sucesso é verificável. Classificação, extração, decisões de roteamento, chamadas de guardrail, passagens de transformação em massa e ações de agente de etapa única se qualificam: o composto permanece inalterado, o comportamento de abstenção é materialmente melhor e o custo da tarefa caiu cerca de 62%. Com o Batch à metade das tarifas padrão e a entrada em cache a um décimo de uma base já reduzida pela metade, um pipeline que era marginal em julho pode ser descomplicado agora.

Não migre o trabalho em que uma pessoa aprova o artefacto, e não migre caminhos de agentes de programação às cegas. Uma queda de 46 pontos no AA-Briefcase e uma queda de 76 pontos no GDPval são números pequenos que apontam na mesma direção que uma queda de dois pontos no Coding Agent Index, e o modo de falha que a Artificial Analysis descreve — elementos da rubrica ignorados, apresentação mais fraca — é invisível para uma verificação automatizada. Mantenha o modelo anterior onde o acabamento é o entregável.

E trate o empate de 0,07 ponto no índice como o achado que ele é. Este não é um modelo mais inteligente a um preço menor. É um modelo com formato diferente a um preço menor, e a pergunta que um plano de migração precisa responder é qual formato a sua carga de trabalho consome — não qual pontuação é mais alta, porque no registro independente essas duas pontuações são o mesmo número.