
GPT-5.6 Luna Max: Como os desenvolvedores realmente o usam no Codex — e onde ele quebra
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Em 1 de agosto, um arquivo de configuração de quatro linhas começou a circular no X. Ele cria um agente Codex chamado luna_worker, define o modelo como gpt-5.6-luna, define o esforço de raciocínio como max, e entrega a ele a metade entediante do seu trabalho enquanto o GPT-5.6 Sol mantém o plano. Em poucos dias, a mesma receita foi republicada em inglês, chinês, japonês, coreano, espanhol e árabe, e um plugin construído sobre a mesma ideia passou de 1.300 estrelas no GitHub em quatro dias. Também é, mais ou menos no dia em que viralizou, a maneira errada de conectá-lo: o autor desse plugin removeu o GPT-5.6 Luna do próprio projeto em 48 horas, publicamente, porque um colega lhe disse que ele não funciona como subagente do Codex — e o colocou de volta dois dias depois, conectado de uma maneira completamente diferente.
Todo esse arco aconteceu em uma semana, e é a coisa mais útil que alguém já publicou sobre este modelo. Ele mostra que o padrão do trabalhador barato é real, que a forma óbvia de conectá-lo é a errada, e que a diferença entre as duas é a maior parte do valor. Tudo neste artigo que diz respeito à técnica vem de profissionais publicando seus próprios resultados entre 30 de julho e 5 de agosto de 2026 — não da documentação da empresa, que descreve o GPT-5.6 Luna como um modelo para "cargas de trabalho sensíveis a custos e de alto volume" e não menciona nada disso. Quando um número é medido por um terceiro independente, dizemos isso; quando é o log de sessão de um desenvolvedor, também dizemos, inclusive quando eles se contradizem. E eles se contradizem, e muito.
O que é "Luna Max" e por que a maioria das pessoas nunca o vê
Não existe um modelo chamado Luna Max. Há dois seletores, e Luna Max é uma combinação deles: o nível mais barato da família GPT-5.6, executado na configuração de raciocínio mais profunda. O seletor de nível escolhe entre GPT-5.6 Sol, GPT-5.6 Terra e GPT-5.6 Luna. O seletor de esforço tem seis posições — none, low, medium, high, xhigh e max — e controla o quanto o modelo pensa antes de responder.
Quase ninguém estava combinando o nível barato com a configuração profunda, por um motivo banal: max está oculto por padrão. No app de desktop do ChatGPT/Codex, max fica em Configurações → Configuração → Esforços de raciocínio disponíveis, onde a lista vem com a primeira opção desmarcada. Seis desenvolvedores diferentes postaram a mesma correção de três cliques na primeira semana de agosto, o que é um bom indicador de quantas pessoas estavam rodando Luna na profundidade padrão e avaliando o modelo com base nisso. Do lado da API, não há nenhum interruptor para encontrar: você passa o ID do modelo gpt-5.6-luna e define o esforço de raciocínio para max no corpo da requisição, e essa é toda a mudança.
Uma consequência que vale a pena internalizar antes de ler qualquer benchmark: quando a Artificial Analysis publica uma pontuação de inteligência para este modelo, a página é intitulada GPT-5.6 Luna (max). O número independente que todos citam para a Luna é a configuração de esforço máximo. Se você tem usado a configuração padrão e se pergunta por que sua experiência não corresponde ao leaderboard, é por isso.
O ajuste que ninguém explica: o esforço muda a contagem de tokens, não o preço do token.
Aumentar o esforço de raciocínio não o move para um nível de preço mais caro. O GPT-5.6 Luna custa $0,20 por milhão de tokens de entrada e $1,20 por milhão de tokens de saída em qualquer configuração de esforço. O que muda é quantos tokens o modelo gasta para chegar a uma resposta — e no máximo, gasta muitos.
A Artificial Analysis mediu isso no decorrer da execução de seu Intelligence Index, e os números são a confirmação independente mais clara do que os profissionais estavam reclamando:
• Pontuação — 51 no Artificial Analysis Intelligence Index, contra uma mediana de 17 para os modelos avaliados nessa classe.
• Verbosidade — 130M tokens de saída gerados ao longo da execução do índice, versus uma mediana de 61M. A Artificial Analysis classifica o modelo como "muito verboso".
• Velocidade bruta — 182.5 tokens de saída por segundo, 16º de 163 modelos. Rápido por token.
• Tempo até o primeiro token — aproximadamente 136 segundos no esforço máximo, o que a Artificial Analysis observa estar no limite superior até mesmo para modelos de raciocínio nessa faixa de preço.
• Gasto total — $174.06 para avaliar o modelo em todo o índice.
Leia a terceira e a quarta linhas juntas, porque esse par é toda a experiência do usuário. A Luna no máximo transmite tokens rapidamente, mas leva minutos para iniciar e, em seguida, produz aproximadamente o dobro de tokens que um modelo típico produz no mesmo trabalho. É por isso que a reclamação mais comum nos relatórios de campo não é "está errado", é "está lento" — e por que o preço baixo não se traduz em uma sessão proporcionalmente barata. Você está comprando uma taxa baixa sobre uma contagem alta de tokens.
Para contraste: na nossa própria página do modelo GPT-5.6 Luna, o tempo mediano observado até o primeiro token em sete dias de tráfego real é de 1.78 segundos, com um percentil 95 de 9.26 segundos. Isso não é uma contradição do valor de 136 segundos — é o mesmo modelo medido em uma mistura de configurações de esforço, a maioria das quais não é a máxima. A latência que você obtém é uma propriedade do seletor que você define, não do endpoint que você chama.

Será que Luna Max é realmente "Sol Medium por um sexto do custo"?
Esta é a afirmação que fez o padrão viralizar, e ela se origina com Dan McAteer, que a classificou como Luna com raciocínio máximo, chegando perto do GPT-5.6 Sol no médio, ou do Claude Opus 5 no médio, por cerca de um sexto do custo. Foi repetida por muitas contas, às vezes com as ressalvas removidas, e vale a pena separar o que é medido do que é vibração.
O placar independente apoia enfaticamente a metade do custo da alegação e apenas parcialmente a metade da capacidade. Executando o mesmo conjunto de benchmarks com esforço máximo entre os níveis, a Artificial Analysis registrou Luna no índice 51 por US$ 174, Terra em 55 por US$ 1.403, Kimi K3 em 57 por US$ 2.437 e Sol em 59 por US$ 2.824. Luna cede oito pontos de índice para Sol e custa cerca de um dezesseis avos do valor para realizar o mesmo trabalho.

O placar independente ficou mais rigoroso em 13 de agosto, quando a DeepSWE lançou a v1.1 — uma revisão de seu benchmark de engenharia de longo horizonte que mantém 113 tarefas originais extraídas de 91 repositórios em cinco linguagens, mas agora avalia cada correção executando o diff commitado em um contêiner isolado, o que é mais difícil de burlar. No placar atualizado, os três níveis do GPT-5.6 com esforço máximo ficam onde o artigo de julho os colocou: Luna Max em 67,2% de pass@1 e US$ 0,61 por tarefa, Terra Max em cerca de 70%, Sol Max em 73% por US$ 8,39 — seis pontos percentuais de taxa de sucesso por aproximadamente catorze vezes o dinheiro.
A comparação que merece uma segunda olhada está abaixo da Luna, não acima dela. O Claude Sonnet 5 Max pontua 54% nas mesmas 113 tarefas — cerca de treze pontos atrás do Luna Max — a US$ 26,40 por tarefa, o que é aproximadamente 44 vezes o que a Luna pagou pela mesma resolução. O Luna Max também supera o Gemini 3.7 Flash (65% para a configuração de alto esforço no mesmo painel); a publicação da comunidade que sinalizou esta rodada coloca a diferença para o Gemini 3.7 Flash Medium em cerca de 1,7 pontos. O DeepSWE é o harness independente da Datacurve, não uma avaliação da empresa — a afirmação da própria empresa de que a família GPT-5.6 estabeleceu resultados de estado da arte no Terminal-Bench 2.1 e no DeepSWE permanece como uma declaração separada, reportada pelo fornecedor.
Depois, há as evidências de campo, que estão genuinamente divididas. Pawel Huryn conduziu seu próprio benchmark de correção de bugs — 105 bugs plantados em dois codebases reais, julgamento cego, uma rodada por modelo — e relatou que a Luna no esforço máximo corrigiu 33 bugs por US$ 1,80, contra 24 por US$ 68 do Claude Fable 5. No sentido oposto, Diego Haz passou dois dias executando sessões pareadas e se posicionou contra o padrão: a Luna custou em média US$ 1,20 por sessão, enquanto a Sol custou em média US$ 29, mas ele teve de refazer a maior parte da saída da Luna e não obteve nada aproveitável para seus casos de uso, o que torna a economia uma ilusão, e não um desconto. Outro desenvolvedor, usando o mesmo harness, relatou que a Sol no nível médio produziu um resultado claramente melhor do que a Luna no nível máximo em cerca de metade do tempo. Um comparativo em chinês sobre uma única tarefa de cena 3D colocou números nesse cenário: a Sol Medium terminou em 21m30s com a maior nota de qualidade e o menor número de tokens; a Luna Max levou 40m55s, consumiu cerca de 130 mil tokens, obteve a menor nota em qualidade e usou metade da cota da assinatura semanal.
O resumo honesto da posição da comunidade após uma semana: Luna Max não é Sol Medium. É bem mais barato que o Sol Medium e é pior, e se essa troca é boa depende inteiramente de se a tarefa é especificada de forma suficientemente restrita para que "pior" não importe. Que é exatamente para isso que servem os padrões de fiação abaixo.
O padrão que sobreviveu ao contato: Sol planeja, Luna implementa, um novo Sol revisa.
Ninguém que continuou usando o Luna Max o está usando como um agente de codificação de uso geral. A configuração que funciona, em todas as versões em que os praticantes convergiram, tem quatro papéis:
• Orquestrador — GPT-5.6 Sol com alto esforço, permanecendo na thread principal. Ele é responsável pelos requisitos, arquitetura, decomposição de tarefas e aceitação final. Ele não escreve o código.
• Implementador de rotina — GPT-5.6 Luna com esforço máximo, em trabalho limitado e totalmente especificado: refatorações mecânicas, escrita de testes, análise de módulos, passagens de documentação, o tipo de tarefa em que o destino é inequívoco.
• Implementador hardcore — GPT-5.6 Terra no esforço máximo, para builds com muito contexto onde a deriva de instruções da Luna se torna dispendiosa.
• Revisor — uma instância nova e somente leitura do GPT-5.6 Sol que vê o diff final e nada mais. O objetivo de "nova" é que um revisor que carrega o contexto da implementação tende a aprovar o próprio raciocínio.
A implementação de referência é o sol-advisor, um plugin do Codex licenciado sob MIT por Dan McAteer que alcançou cerca de 1.400 estrelas na primeira semana. Você o instala pelo marketplace de plugins do Codex adicionando o DannyMac180/sol-advisor como repositório e depois adicionando o sol-advisor como plugin. Sua forma atual é instrutiva: a trilha nativa designa um implementador Terra/High seguido por um novo revisor Sol/High, enquanto Luna no máximo é uma trilha de adesão explícita que roda como uma tarefa separada visível ao usuário, com a sessão Sol primária revisando e aceitando o trabalho dela diretamente, em vez de encaminhá-lo pelo revisor nativo.
Se você preferir não instalar nada, a versão mínima amplamente copiada é uma definição de agente personalizado em ~/.codex/agents/luna-worker.toml com duas configurações — model = "gpt-5.6-luna" e model_reasoning_effort = "max" — além de uma descrição e instruções que o restringem a trabalho delegado com limites claros, o proíbem de alterar o objetivo geral ou ampliar o próprio escopo e enviam decisões de arquitetura e requisitos ambíguos de volta ao agente principal. O conselho que circula é pedir ao Sol que escreva esse arquivo para você, o valide em relação à sua versão instalada do Codex e mostre o diff antes que você o aceite, o que é sensato, quer você confie ou não na receita.
A armadilha do subagente, e a solução em que a comunidade convergiu
É aqui que a versão viral deste padrão e a versão funcional se separam.
O sistema de subagentes nativo do Codex não trata a GPT-5.6 Luna como um cidadão de primeira classe. McAteer esbarrou em uma barreira dura — Luna não é permitida como subagente — e contornou isso declarando-a como um agente personalizado, depois sinalizou publicamente o custo dessa solução alternativa: um agente personalizado não compartilha contexto com o agente principal da mesma forma que um subagente nativo. Dias depois, ele removeu a trilha Luna de sol-advisor por completo, citando a descoberta de outro desenvolvedor focado em Codex de que Luna se comporta mal no papel de subagente, partindo do pressuposto de que ela não foi pós-treinada para o protocolo v2 de multiagentes. Diego Haz descreveu de forma independente a mesma barreira do outro lado: Sol não pode gerar Luna como subagente, então Luna precisa viver em uma thread de nível superior, o que torna a coordenação complicada.
A resolução, que agora é a posição majoritária, é parar de lutar contra isso:
• Dê ao Luna Max sua própria thread, não um slot no grafo de subagentes. Instrua o orquestrador Sol a iniciar uma tarefa Codex de nível superior separada no Luna, monitorá-la e trazer o resultado de volta. Foi isso que McAteer readicionou ao sol-advisor em 4 de agosto, e o que vários outros haviam descoberto de forma independente.
• Aceite o isolamento de contexto como o preço. Uma thread separada significa um histórico separado. Esse é o imposto que você paga, e é também por isso que a transferência abaixo importa mais aqui do que em uma configuração de subagente nativo.
• Se você precisar forçá-lo para o multi-agent v2, o catálogo é o motivo pelo qual ele é filtrado. Um desenvolvedor rastreou a exclusão até o catálogo de modelos padrão que marca Luna como v1, e relatou uma solução alternativa: copie ~/.codex/models_cache.json, defina em Luna o multi_agent_version para v2, aponte model_catalog_json para sua cópia, reinicie o Codex, e então faça o orquestrador gerar Luna no máximo com um nível de serviço rápido e desative o fork. Trate isso como o hack não oficial de uma pessoa em um arquivo interno — é exatamente o tipo de coisa que uma atualização do Codex quebra.
O pacote de transferência: cinco perguntas que resolvem a reclamação mais comum
A falha mais relatada do Luna Max é que ele não segue instruções de perto, principalmente quando você fornece um fluxo de trabalho específico ou um loop de iteração para executar. Essa reclamação aparece tanto de desenvolvedores que gostam do modelo quanto daqueles que o abandonaram. A mitigação em que os profissionais continuam chegando não é um prompt melhor no sentido de estilo de escrita; é um contrato mais rígido. Antes de o tópico da Luna começar, responda cinco coisas:
• Qual tarefa exata este agente deve concluir? Não a área de trabalho — o estado final.
• Quais arquivos, documentos ou sistemas estão no escopo? Enumerados, não implícitos.
• O que ele não deve mudar? As interfaces, migrações, configurações e contratos públicos que estão fora dos limites.
• Que evidência comprova a conclusão? Um teste nomeado, a saída de um comando específico, um diff que altera apenas os arquivos listados.
• Qual decisão ausente deveria fazê-lo parar? O gatilho para voltar em vez de adivinhar — é este que impede um modelo barato precipitado de inventar uma arquitetura.
É também aqui que vale a pena incorporar as próprias orientações de prompt da empresa, com o rótulo que merecem: a empresa relata que, em suas avaliações internas de agentes de codificação, prompts de sistema mais enxutos melhoraram as pontuações de avaliação em 10–15%, ao mesmo tempo em que reduziram o total de tokens em 41–66% e o custo em 33–67%, e aconselha auditar prompts herdados do GPT-5.5 ou GPT-5.4 em vez de portá-los adiante. Esses são números relatados pelo fornecedor. Mas a direção corresponde ao que o campo descobriu: descreva o destino com precisão e elimine a narração de cada passo. Note a tensão com o parágrafo anterior — precisão sobre escopo e restrições não é o mesmo que verbosidade, e o consenso da comunidade é que o Luna Max precisa mais da primeira e menos da segunda.
Modos de falha a considerar no planejamento
• Deriva de instruções. Corroborada por vários desenvolvedores: ela ignora partes do briefing inicial, e é pior quando o briefing é um procedimento a seguir em vez de um resultado a alcançar.
• Lentidão de relógio de parede. Repetidamente relatada e consistente com o tempo até o primeiro token de ~136 segundos que a Artificial Analysis mediu com esforço máximo. Aceitável para trabalhos que você pode deixar rodando; doloroso em um loop interativo.
• Consumo de contexto. Um desenvolvedor relatou que o Luna Max consumiu uma janela de thread de 258k do Codex alarmantemente rápido, e suspeitou que o consumo de cota dispara quando o Codex começa a compactar perto do limite. A parte da compactação é uma impressão dele, não um resultado medido — mas a taxa de consumo é a consequência esperada da verbosidade que a Artificial Analysis mediu de forma independente. No lado da API, fique de olho na etapa de contexto longo: a tabela de preços de repasse para este modelo passa de $0.20/$1.20 para $0.40/$1.80 quando uma solicitação ultrapassa cerca de 272k tokens. Assim, um thread que continua crescendo fica mais caro por token, e não apenas mais caro no total.
• Qualquer coisa visual. Esta é a fronteira mais nítida nos relatórios de campo. Um profissional amplamente lido, ao cancelar uma assinatura de programação do Kimi K3 em favor da Luna Max, avaliou-a como tão boa quanto a que estava abandonando e muito mais barata — com uma exceção explícita para frontend. Outro foi mais direto: não use a Luna para executar trabalhos de design, gráficos, formatação ou slides; a divisão entre planejar com Sol e executar com Luna é para tarefas de instrução passo a passo, não para tarefas estéticas.
• O catálogo de subagentes. Coberto acima — se a Luna nunca for selecionada silenciosamente em uma execução multiagente, ela está sendo filtrada, não falhando.
• Falsa economia. O único modo de falha que não aparece em nenhum benchmark: uma sessão que custou $1.20 em vez de $29 e produziu um trabalho que você reescreveu à mão custou-lhe $1.20 mais sua tarde.
Quando não recorrer ao max
Max não é uma atualização gratuita, e a orientação que se manteve é uma escada em vez de uma configuração:
• Transformações simples — uma renomeação de campo, uma extração mecânica, uma passada de formatação. Esforço baixo ou médio na Luna. Condicione-o à aprovação de um teste nomeado.
• Implementação de rotina — high ou xhigh. O padrão da comunidade para um worker Luna é xhigh, não max, precisamente porque max custa tempo e tokens em tarefas que nunca foram difíceis.
• Delimitado, mas genuinamente difícil — este é o verdadeiro trabalho de max. O pacote precisa ser ao mesmo tempo difícil e rigorosamente especificado para que o raciocínio adicional se converta em um resultado melhor.
• Investigação ambígua — mude o nível, não o dial. Se o modelo está julgando mal em vez de subplanejar, pensar mais em um modelo mais barato não vai resolver; essa é uma tarefa do Sol.
• Brief vago — corrija o contrato, não o modelo. Nenhuma configuração de esforço compensa um critério de aceitação não declarado.
Uma ressalva específica sobre assinaturas, de um guia de terceiros e fácil de errar: as taxas de crédito que a Codex cobra por modelo não têm as mesmas proporções que os preços de tabela da API, então você não pode pegar uma proporção de preço da API e usá-la como regra de roteamento de assinatura. As cotas de mensagens de cinco horas reportadas no nível Plus ilustram o ponto — aproximadamente 15–90 mensagens locais em Sol, 20–110 em Terra, 50–280 em Luna, com faixas tão amplas porque uma "mensagem" não é uma unidade fixa de trabalho. Se suas decisões de roteamento forem orientadas por um limite de assinatura em vez de uma fatura, meça em relação ao limite.
Além do Codex: para que mais as pessoas estão apontando isso
A combinação de raciocínio profundo e barato mostra-se útil fora de agentes de codificação, e estes são os usos com comprovantes:
• Agentes de navegador. Um desenvolvedor executou uma stack de automação de navegador no GPT-5.6 Luna para abrir os 15 principais posts do Hacker News, ler cada página vinculada e escrever um relatório — custo total, 3 centavos. Longo horizonte, baixo risco, alto consumo de tokens: exatamente o perfil para o qual este modelo foi precificado.
• Cadeias de habilidades. Dois profissionais relataram, de forma independente, ter conduzido um pipeline de duas habilidades — geração de imagem em um conversor de imagem para Three.js — a partir de um único objetivo Luna Max para obter um objeto 3D low-poly interativo, cada um observando que isso mal moveu seu contador de uso semanal. Vale a pena ler junto com o aviso "não use Luna para trabalho visual": a Luna estava orquestrando ferramentas que faziam o trabalho visual, não julgando a estética em si mesma.
• Manter uma sessão ativa. O custo de entrada em cache neste modelo é de $0,02 por milhão de tokens, contra $0,20 para entrada nova — um desconto de 90% que a Artificial Analysis lista em seu painel de preços — e a janela de cache é de cerca de 30 minutos. A implicação prática que vários guias concluem de forma independente: uma sessão de longa duração que continua relendo o mesmo código é drasticamente mais barata do que uma sessão nova para cada tarefa.
• Arbitragem de cota. A afirmação mais agressiva de todo o conjunto, e claramente rotulada como afirmação: um desenvolvedor relata que, como o esforço é quase gratuito enquanto o multiplicador de nível é grande, rodar com esforço máximo no nível barato permitiu que ele processasse 4,9 bilhões de tokens ao longo de três semanas em um plano de US$ 200 — seis dígitos nas tarifas de API — e que ele mantém os modelos Kimi K3, Grok e DeepSeek no mesmo seletor atrás de um roteador local, de modo que atingir o limite de um provedor não interrompe o trabalho. Ninguém reproduziu de forma independente o número de tokens. O hábito de roteamento por trás disso, no entanto, é a parte que vale a pena copiar.
Executando a mesma divisão sem uma assinatura do Codex.
Tudo acima é uma história em formato de assinatura: a razão pela qual as pessoas se importam com a Luna Max é que ela amplia um limite semanal. No lado da API, a mesma arquitetura é mais simples de construir e mais fácil de entender, porque você está pagando uma fatura em vez de gerenciar uma cota — e a divisão orquestrador/worker deixa de ser um plugin e se torna roteamento comum.
O GPT-5.6 Luna está disponível através do OrcaRouter por $0,20 por milhão de tokens de entrada e $1,20 por milhão de tokens de saída — o preço de tabela do provedor, repassado com margem de 0%, razão pela qual a redução de preço de 30 de julho já estava ativa do nosso lado no dia em que a empresa a anunciou, em vez de um ciclo de faturamento depois. Ele é servido por meio de uma API compatível em /v1/chat/completions e /v1/responses, então o campo de esforço de raciocínio segue no corpo da requisição exatamente como aconteceria em uma chamada direta, e o ID do modelo é openai/gpt-5.6-luna. O GPT-5.6 Sol e o GPT-5.6 Terra estão atrás da mesma chave, que é o que importa nesse padrão: um orquestrador em uma camada e um worker em outra são dois IDs de modelo em uma integração, não dois contratos de fornecedor. O DSL de roteamento permite expressar essa divisão como uma única chamada, em vez de emendar threads manualmente, e o failover automático cobre o caso que o pessoal de arbitragem de cotas resolve com um roteador local — quando um provedor degrada, a requisição cai em outro lugar em vez de parar.

Duas ressalvas honestas. O maquinário específico do Codex — o grafo de subagentes, o mercado de plugins, o catálogo de modelos, a cota semanal — é da empresa, e nada disso vem com uma chave de API; se o padrão que você quer é sol-advisor dentro do aplicativo Codex, você quer uma assinatura do Codex. E os modos de falha acima são propriedades do modelo, não do transporte: o roteamento muda o custo de uma chamada e o que acontece quando um provedor cai, não se a Luna segue suas instruções.
Quem deveria copiar isto, e quem não deveria.
Se o seu trabalho é de alto volume e mecanicamente especificável — refatorações, scaffolding de teste, extração, documentação, passadas de análise sobre um grande repositório — ative o max, coloque a Luna em sua própria thread com um handoff de cinco perguntas, mantenha uma instância do Sol à frente dela para planejamento e atrás para revisão, e espere gastar uma ordem de grandeza a menos. As pessoas que relatam os maiores ganhos estão todas fazendo alguma versão disso, e os números de custo independentes apoiam a direção, mesmo onde não apoiam o enquadramento de "tão bom quanto o Sol".
Se o seu trabalho é exploratório, estético ou chega como um briefing vago que vai ficando mais claro conforme você avança, os relatórios de campo dizem claramente que você vai gastar as economias em dobro refazendo o resultado. E se você for interativo — sentado ali observando — a inicialização a frio de dois minutos no esforço máximo vai incomodá-lo mais do que o preço agrada.
O que observar: se a empresa faz pós-treinamento da Luna para o protocolo de subagente v2. Cada parte estranha do playbook atual — o thread separado, o contexto compartilhado perdido, o hack do catálogo, todo o episódio de retrair e religar — existe por causa dessa única lacuna. Feche-a e a melhor versão desse padrão fica vários passos mais simples.
Perguntas que merecem uma resposta real
O esforço máximo de raciocínio custa mais por token do que o padrão?
Não, e esse é o mal-entendido mais comum sobre essa configuração. A GPT-5.6 Luna cobra $0,20 por milhão de tokens de entrada e $1,20 por milhão de tokens de saída, independentemente do esforço. O que o máximo muda é o número de tokens gastos — o modelo planeja mais, verifica a si mesmo e revisa antes de responder. A Artificial Analysis mediu esse modelo emitindo 130 milhões de tokens de saída em uma suíte de benchmarks onde o modelo mediano emite 61 milhões. Então, uma sessão com esforço máximo custa mais do que uma com esforço médio na mesma tarefa, inteiramente por volume, e também leva mais tempo para produzir o primeiro token. Esforço é um controle de contagem de tokens usando um rótulo de qualidade.
O GPT-5.6 Luna já pode rodar como um subagente nativo do Codex?
Em 5 de agosto de 2026, não — e a comunidade parou de tentar. O caminho nativo de subagente do Codex não aceita Luna; a solução alternativa de agente personalizado a faz funcionar, mas perde o contexto compartilhado com o agente principal; e o desenvolvedor por trás do plugin mais conhecido para esse padrão removeu Luna e a readicionou como uma tarefa de nível superior gerada separadamente, que o orquestrador monitora. Se você vir uma execução multiagente em que Luna nunca é selecionada, provavelmente ela está sendo filtrada porque o catálogo padrão de modelos a marca como v1 em vez de v2, algo que um desenvolvedor corrigiu manualmente por conta própria e risco. Este é o item da lista com maior probabilidade de mudar com uma atualização do Codex, então verifique-o na sua versão instalada em vez de confiar em qualquer receita, inclusive esta.
Será que é bom o suficiente para substituir uma assinatura de codificação do Claude ou do Kimi K3?
Vários desenvolvedores cancelaram publicamente um plano de US$ 200/mês exatamente por causa disso. A postagem que trouxe a questão à tona veio de um imunologista que programa diariamente: ele abandonou sua assinatura de codificação do Kimi K3 não porque era ruim, mas porque não conseguia justificá-la quando a GPT-5.6 Luna era, em sua experiência, tão boa para o seu trabalho e muito mais barata — exceto para frontend. Os números de custo independentes tornam o argumento difícil de descartar: no mesmo conjunto de benchmarks, a Kimi K3 com esforço máximo marcou 57 por US$ 2.437, enquanto a GPT-5.6 Luna no máximo marcou 51 por US$ 174. Mas leia a opinião contrária antes de cancelar qualquer coisa. Os desenvolvedores que mediram sessões pareadas e obtiveram resultados negativos não estavam testando um modelo diferente; estavam testando um tipo diferente de tarefa — aberta, visual ou vagamente especificada — e nesse tipo de tarefa o modelo mais barato perdeu feio o suficiente para eliminar a economia. A resposta defensável é que a Luna Max substitui uma grande fração do seu trabalho de codificação, não necessariamente o seu melhor modelo de codificação, e que os profissionais que mais se beneficiam dela são aqueles que mantiveram um nível de ponta à mão para planejar e verificar.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
