
GPT-6 Luna vs GPT-5.6 Luna: O Mesmo Nome, Metade do Preço e um Entregável Pior
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Dois modelos, uma palavra em comum, e uma pontuação independente que é efetivamente idêntica. GPT-6 Luna atinge 37,26 no Artificial Analysis Intelligence Index; GPT-5.6 Luna atingiu 37,32. Uma diferença de 0,07 ponto não é uma medição, é ruído, e é o fato mais importante deste par. O que separa os dois modelos não é a capacidade — é $0,0681 por tarefa concluída do índice contra $0,1783, e um conjunto de regressões em trabalho de conhecimento que o corte de preço não menciona.
As datas importam para a leitura dos números. O GPT-5.6 Luna foi lançado em 9 de julho de 2026 a $0,20 por milhão de tokens de entrada e $1,20 por milhão de tokens de saída. O GPT-6 Luna foi lançado em 22 de setembro de 2026 a $0,10 e $0,50 — exatamente metade da tarifa de entrada e 58% de desconto na tarifa de saída, que a OpenAI descreveu como permanente, e não promocional. Essa é uma redução genuína, e também é a metade menor da história. A metade maior é que o modelo mais novo é um modelo diferente, não o mesmo com preço reajustado.

O que uma migração realmente rende, em números
Alinhe os dois nas dimensões que decidem uma migração e o quadro é desigual. Algumas linhas melhoram, algumas regridem, e uma melhora consideravelmente.
• Preço — GPT-6 Luna $0,10 de entrada / $0,50 de saída por milhão de tokens vs GPT-5.6 Luna $0,20 / $1,20. Metade no custo de entrada, 58% de desconto na saída.
• Entrada em cache — $0,01 por milhão contra $0,02. O mesmo desconto de 90% sobre uma base reduzida pela metade, então um prefixo repetido custa metade do que custava em julho.
Custo por tarefa concluída — US$ 0,0681 contra US$ 0,1783 na mesma suíte. Uma redução de 62%, maior do que o corte no preço dos tokens porque a composição de tarefas não é idêntica.
• Tokens de saída por tarefa — 50.537 contra 41.235. O novo modelo é 23% mais verboso por trabalho concluído, e 78% de sua saída é raciocínio que nunca aparece na resposta.
• Janela de contexto — 1.050.000 tokens contra 1.000.000. O mesmo teto prático; ambos limitam a saída a 128.000 tokens.
• Abstenção — uma taxa de alucinação de 76,7% no AA-Omniscience contra 92,6%. Esta é a maior melhoria individual do conjunto, e não se trata de um ganho de conhecimento: a precisão passa de 42,7% para 43,8%, essencialmente estável. O modelo mais recente recusa em vez de inventar, o que constitui uma mudança de comportamento e não de capacidade.
• Entregáveis de trabalho do conhecimento — AA-Briefcase v1.1 cai de 1.345,38 Elo para 1.299,23, e GDPval-AA v2.1 cai de 1.443,14 para 1.367,09. Ambos em queda, de aproximadamente 46 e 76 pontos.
• Codificação e trabalho de longo horizonte — Terminal-Bench 4.0 passa de 11,6% para 12,6% e SciCode de 53,6% para 54,6%, as duas linhas aqui que sobem. Em contrapartida, o Coding Agent Index cai de 43 para 41 e as avaliações agênticas no estilo SWE seguem a mesma direção.
• AutomationBench-AA — 53,2% contra 50,2%. Aumentou, e por uma margem maior do que qualquer outra medida agêntica do conjunto.

A regressão está no artefato, não no raciocínio.
Vale nomear o padrão dessas duas últimas linhas, porque é ele que define a decisão. O novo modelo é melhor em ações agênticas de uma única etapa e pior em entregar um documento finalizado. A Artificial Analysis atribui o declínio no trabalho do conhecimento à qualidade de apresentação e a entregáveis que deixaram de fora elementos obrigatórios da rubrica, e não a falhas factuais ou de raciocínio — que é precisamente o tipo de regressão que passa em um smoke test e falha em uma revisão.
Reúna os dois fatos e a migração se divide claramente pelo que consome a saída. Se o seu pipeline lê saída estruturada — JSON, uma classificação, um campo extraído, uma decisão de roteamento —, a regressão de apresentação não custa nada, a melhoria na abstenção é um ganho real, e a redução de 62% no custo por tarefa se concretiza integralmente. Se uma pessoa lê o entregável — um relatório, um memorando, um documento voltado ao cliente —, o modelo mais novo é mensuravelmente pior exatamente naquilo pelo que você está pagando, e a economia está comprando um revisor.
O número de abstenção merece o mesmo tratamento. Um modelo que passa de inventar em 93% daquilo que não sabe para inventar em 77% é um objeto substancialmente diferente para uma barreira de proteção, uma triagem de conformidade ou qualquer pipeline em que uma resposta errada dada com confiança se propague. Essa melhoria é real, é medida de forma independente e é o argumento mais forte — que não depende de preço algum — para migrar trabalho para o novo modelo.
O que muda no seu código, e o que não muda
Menos do que um corte de preço desse tamanho sugere, o que é a boa notícia. A janela de contexto é da mesma classe, a saída máxima é idêntica em 128.000 tokens, e a cláusula de reajuste de preços para contexto longo da família permanece inalterada: solicitações acima de 272.000 tokens de entrada são cobradas com tarifas de entrada e cache de 2x e de saída de 1,5x, para a solicitação inteira, e não para a parte acima do limite. Uma solicitação que era cara com 300.000 tokens no GPT-5.6 Luna também é cara no GPT-6 Luna — metade da tarifa, o mesmo precipício, então uma carga de trabalho que deveria ter sido dividida em julho ainda deveria ser dividida agora.
A escada de esforço é onde o comportamento muda, e não o custo. O GPT-6 Luna expõe none, low, medium (o padrão), high, xhigh e max, e o padrão importa: um pipeline que foi ajustado para o esforço padrão de um modelo não fica automaticamente ajustado para o de outro. Equipes que fixaram uma configuração explicitamente não são afetadas. Equipes que usaram o padrão estão executando uma configuração diferente da que usavam em julho, e o sintoma visível será o volume de tokens, e não a qualidade.
Vale a pena repetir uma armadilha, porque ela não desaparece com o novo modelo. No endpoint Chat Completions, a chamada de funções só funciona quando o esforço de raciocínio está definido como none; todos os outros níveis de esforço, e todas as ferramentas integradas, exigem a Responses API. Uma equipe que portar um loop de chamada de ferramentas apenas alterando a string do modelo descobrirá que suas ferramentas ficam silenciosamente indisponíveis no esforço medium padrão, e a correção é reescrever a superfície de chamada, e não um parâmetro.
O que você pode rotear hoje, e o que não pode
Esta é a parte da migração que não tem nada a ver com benchmarks. O GPT-5.6 Luna está no OrcaRouter pelo preço de tabela — US$ 0,20 por milhão de tokens de entrada, US$ 1,20 por milhão de tokens de saída, uma janela de contexto de 1.000.000 de tokens, uma saída máxima de 128.000 tokens e um tempo p50 até o primeiro token de 1,60 segundos, medido em tráfego real na nossa própria página do modelo. Repassamos os preços de tabela dos provedores sem nenhum acréscimo, então no dia em que a OpenAI reajustou os preços desta família, a mudança já estava no ar do nosso lado, em vez de no próximo ciclo de faturamento.

O GPT-6 Luna não é roteável pelo OrcaRouter a partir de 23 de setembro de 2026. A disponibilidade está na API própria da OpenAI e nos catálogos de nuvem que oferecem essa família, e não listamos um modelo que não podemos atender. A consequência prática é que uma equipe que planeja essa migração pode migrar a precificação hoje e não pode migrar o roteamento hoje — as duas metades da mudança acontecem em datas diferentes.
O que isso torna possível, entretanto, é o arranjo que a maioria das equipes acabará querendo de qualquer forma. Mantenha o GPT-5.6 Luna nos caminhos em que o entregável é o produto, rode o GPT-6 Luna onde a saída for consumida por código e trate a fronteira como um nível, e não como uma reescrita. Como os modelos que você consegue alcançar ficam atrás de um único endpoint, com mais de 200 modelos na mesma chave e failover automático entre provedores, adicionar ou remover um nível é uma entrada de configuração, e não uma segunda integração — e o caminho de escalonamento deixa de depender de qualquer modelo individual estar disponível.
A decisão de migração, dita sem rodeios
Mova o trabalho para onde a saída é lida por máquina e a condição de sucesso é verificável. Classificação, extração, decisões de roteamento, chamadas de guardrail, passagens de transformação em massa e ações de agente de etapa única se qualificam: o composto permanece inalterado, o comportamento de abstenção é materialmente melhor e o custo da tarefa caiu cerca de 62%. Com o Batch à metade das tarifas padrão e a entrada em cache a um décimo de uma base já reduzida pela metade, um pipeline que era marginal em julho pode ser descomplicado agora.
Não migre o trabalho em que uma pessoa aprova o artefacto, e não migre caminhos de agentes de programação às cegas. Uma queda de 46 pontos no AA-Briefcase e uma queda de 76 pontos no GDPval são números pequenos que apontam na mesma direção que uma queda de dois pontos no Coding Agent Index, e o modo de falha que a Artificial Analysis descreve — elementos da rubrica ignorados, apresentação mais fraca — é invisível para uma verificação automatizada. Mantenha o modelo anterior onde o acabamento é o entregável.
E trate o empate de 0,07 ponto no índice como o achado que ele é. Este não é um modelo mais inteligente a um preço menor. É um modelo com formato diferente a um preço menor, e a pergunta que um plano de migração precisa responder é qual formato a sua carga de trabalho consome — não qual pontuação é mais alta, porque no registro independente essas duas pontuações são o mesmo número.
