Card de título principal com o texto 'Decisions API da OpenAI', com o subtítulo 'GPT-6 Luna deixa de conversar e escolhe uma resposta', com três cards arredondados com os textos 'Uma resposta de uma lista que você define', '~150 ms declarados pelo fornecedor' e 'Ainda sem preço publicado', um rodapé com o texto 'Números da OpenAI informados pelo fornecedor; ainda sem medição independente.', e o logo da OrcaRouter composto no canto inferior direito.
Guides & Insights

API Decisions da OpenAI: GPT-6 Luna para de conversar e escolhe uma única resposta

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GPT-6 Luna foi lançado em 22 de setembro de 2026 como o degrau barato da escada GPT-6 da OpenAI. O que há de novo em 29 de setembro é uma tarefa para ele que não tem nada a ver com conversa. A Decisions API da OpenAI recebe uma pergunta que você escreveu, uma lista finita de respostas que você permite e um trecho de contexto — texto ou uma imagem — e retorna uma dessas respostas. Não prosa. Não um parágrafo para analisar e torcer. Uma única escolha, para que um ticket de suporte vá para uma de cinco filas, uma imagem caia em uma categoria de moderação, ou um agente escolha seu próximo movimento a partir de uma política que você definiu. Ela foi anunciada no DevDay 2026 e está em prévia limitada agora, com a OpenAI dizendo que um lançamento amplo está planejado para os próximos dias.

A maior parte do que uma equipe precisa antes de construir sobre isso ainda não foi publicada. Não há preço por chamada, nem limite declarado sobre quantas respostas candidatas uma requisição pode conter, nem declaração sobre se você pode ajustá-lo com seus próprios dados e — em 30 de setembro — nenhum registro dele em lugar algum do índice de documentação para desenvolvedores, do changelog ou da referência da API da própria OpenAI. Verificamos todos os três. O recurso atualmente existe no resumo do DevDay da OpenAI e no que um porta-voz da OpenAI disse a repórteres no dia do lançamento. Assim, o restante deste artigo mantém três níveis visivelmente separados: o que a OpenAI confirmou, o que uma medição do dia do lançamento afirma e o que ninguém pode saber ainda.

O que uma decisão restrita realmente é

Duas abordagens existentes fazem esse trabalho mal, e a Decisions API visa a lacuna entre elas. A primeira é fazer prompting a um modelo de chat: você escreve uma instrução cuidadosa pedindo que ele escolha de uma lista, ele escreve uma frase para você e, se você tiver sorte, consegue extrair probabilidades de tokens da resposta para obter algo que se assemelha a uma pontuação de confiança. Funciona, consome tokens, e o número de confiança é um palpite aproximado. A segunda é treinar um classificador pequeno: rápido, barato, e precisa de dados rotulados mais uma nova rodada de treinamento toda vez que o conjunto de rótulos muda.

Um modelo de decisão fica entre esses dois. Ele aceita novos rótulos no prompt — da mesma forma que um prompt faz — mas retorna uma pontuação ou uma escolha sobre a qual um desenvolvedor pode ramificar sem precisar fazer parsing, que é a propriedade que um classificador tinha e um modelo de chat nunca teve. A OpenAI não é novata nesse formato: sua Moderation API retorna pontuações por categoria em vez de texto há anos, com uma diferença que importa aqui. As categorias da Moderation são da OpenAI. As categorias da Decisions API são suas.

A restrição é o produto, e vale a pena ser preciso sobre o que ela proporciona e o que não proporciona. Um espaço de saída finito significa que todo valor permitido é conhecido de antemão, de modo que sua aplicação pode rejeitar uma resposta que não definiu, atribuir um nível de permissão diferente a cada ramificação e recorrer a um humano quando a confiança ou o contexto forem insuficientes. Isso também torna viável a avaliação offline, porque todo caso de teste tem uma classe-alvo e um custo mensurável quando está errado. O que ela não proporciona é correção. Um modelo restrito ainda pode selecionar a resposta válida errada, ser conduzido por um contexto enganoso ou herdar o viés das categorias que você escreveu.

A alegação de 150 milissegundos, e o número que a OpenAI não publicou

OpenAI diz que a Decisions API toma decisões cerca de dez vezes mais rápido do que o GPT-6 Luna através da API regular — na ordem de 150 milissegundos contra cerca de 1,6 segundos. Esse número é declarado pelo fornecedor e não foi reproduzido; não há medição independente dele nos dois dias desde o lançamento, e o próprio resumo da OpenAI diz apenas "tomada de decisão em tempo real". Nenhuma distribuição de latência, nenhuma região, nenhum tamanho de entrada, nenhum nível de concorrência e nenhum acordo de nível de serviço acompanha o número.

Nossos próprios dados de tráfego não substituem esse teste, mas explicam por que a distribuição ausente importa. Nos sete dias até 30 de setembro, o GPT-6 Luna servido pela rota normal de chat-completions do OrcaRouter apresenta uma mediana de 699 milissegundos e um p95 de 7,6 segundos em 3,23 bilhões de tokens de carga mista — uma dispersão de mais de uma ordem de magnitude entre o meio e a cauda. Esse é um formato de solicitação diferente de uma decisão restrita, então não é uma comparação com a afirmação de 150 ms. É o motivo pelo qual um único p50 de manchete é o número errado para se projetar um prazo em torno. Se você testar a prévia, registre mediana, p95 e p99 separadamente para entradas de texto e imagem, inclua o tempo de rede e as tentativas, e meça o prazo que seu produto realmente tem — uma decisão de roteamento para uma fila assíncrona e uma que fica entre um clique e um pagamento não compartilham um orçamento de latência.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

Preços: quanto custa o modelo subjacente e por que isso não é o preço da API

A OpenAI não publicou nenhuma tarifa para a Decisions API. Também não é seguro presumir que as tarifas de tokens da Luna se apliquem, porque a Decisions API tem seu próprio pacote — um endpoint diferente com limites diferentes, e a OpenAI disse que compartilhará mais detalhes "no lançamento amplo". Qualquer pessoa que lhe cite um custo por decisão neste momento está inferindo isso.

O que é publicado é a tabela de preços do modelo no qual ele se baseia, lida na página de preços da OpenAI em 30 de setembro de 2026:

• Entrada — $0,10 por milhão de tokens, passando para $0,20 acima de 272.000 tokens de entrada
• Saída — $0,50 por milhão de tokens, passando para $0,75 acima de 272.000 tokens de entrada
• Entrada em cache — $0,01 por milhão de tokens; gravações no cache são cobradas a $0,125, um acréscimo de 25% sobre a tarifa sem cache
• Processamento Batch e Flex — 50% das tarifas padrão; modo Fast — 2x as tarifas aplicáveis

A linha de contexto longo é a que pega as pessoas de surpresa, e funciona da mesma forma que em toda a família GPT-6: ultrapassar 272.000 tokens de entrada reprecifica toda a solicitação na faixa mais alta, não apenas o excedente. Uma API de decisão que entrega um documento longo ou um grande conjunto de imagens ao modelo é exatamente o tipo de chamada que pode cruzar essa linha, o que é mais uma coisa que os limites não publicados da prévia deixam em aberto.

GPT-6 Luna nos seus próprios termos

Deixe a API de lado e o modelo subjacente é um modelo de raciocínio na base de uma família de três níveis — abaixo do GPT-6 Sol a $2,00/$10,00 e do carro-chefe GPT-6 Astra a $10,00/$50,00 — com uma janela de contexto de 1.050.000 tokens, um teto de saída de 128.000 tokens, um corte de conhecimento em 18 de maio de 2026, e esforço de raciocínio configurável em seis valores, de none até max. Ele aceita entrada de texto e imagem e retorna texto e, na própria documentação para desenvolvedores da OpenAI, o padrão de esforço é medium. Uma ressalva prática da mesma página, não relacionada à Decisions API, mas relevante se você estiver integrando a Luna como fallback: no Chat Completions, a chamada de funções só funciona quando o esforço de raciocínio está definido como none. As ferramentas em qualquer outra configuração de esforço precisam da Responses API.

Em termos de qualidade, o número independente é o Intelligence Index da Artificial Analysis, com 37,3 para o Luna em esforço máximo, contra 47,5 para o GPT-6 Sol — uma diferença de cerca de dez pontos, que é a forma honesta de ler a diferença de preço de vinte vezes na entrada. Nenhum dos valores diz respeito à Decisions API, cuja tarefa restrita é uma medição totalmente diferente e não tem pontuação publicada.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev, Laya e o enquadramento "system one"

A API Decisions não chegou a um campo vazio. Da TypeSafe AI, o Jev, lançado em 15 de setembro de 2026 por Diogo Almeida e disponível para todos desde 21 de setembro, é o modelo que tornou esta categoria legível para desenvolvedores: ele não gera texto algum, retornando, em vez disso, respostas tipadas com valores de confiança, a US$ 0,042 por milhão de tokens de entrada, com a saída cobrada a zero. O primeiro teste independente do Jev, realizado pela Every, fez 777 julgamentos em 37 documentos em menos de 0,7 segundo por cerca de um quarto de centavo, e um segundo teste o cronometrou em uma mediana de 0,35 segundo por passagem, contra 8,83 segundos de Claude Fable 5.1 em esforço alto — cerca de 25 vezes mais rápido a aproximadamente 1/580 do custo, enquanto identificou seis de sete defeitos plantados deliberadamente, ao passo que o Fable 5 identificou todos os sete. "Bom, mas não perfeito" foi o veredito da Every, e é a leitura correta em uma frase. Laya é o terceiro participante no mesmo formato, um modelo de decisão que responde sem escrever um token.

Se a OpenAI criou a Decisions API por causa da Jev é especulação. The New Stack, ao noticiar isso no dia do lançamento, chamou uma reação à TypeSafe de “provável” e observou que a OpenAI provavelmente apressou o anúncio antes do DevDay; a OpenAI não disse nada desse tipo, e o timing — disponibilidade geral da Jev em 21 de setembro, DevDay em 29 de setembro — é sugestivo, mas não é evidência. O que não é especulação é que as duas ainda não são comparáveis no eixo que importa para os compradores. A Jev publica um preço, um formato por chamada e uma data de GA. A Decisions API não publica nenhum desses três.

Onde ele roda, e o que manter aquecido ao lado dele

A Decisions API é um empacotamento da própria OpenAI. Não é um modelo do nosso catálogo e não o roteamos, portanto, se você quiser esse endpoint específico, é na OpenAI que ele está. O modelo no qual ela se baseia é outra questão: GPT-6 Luna é uma rota ativa no OrcaRouter ao preço de tabela da OpenAI, sem qualquer markup repassado — US$ 0,10 de entrada e US$ 0,50 de saída por milhão de tokens, com a faixa acima de 272K a US$ 0,20/US$ 0,75 — e, nos sete dias até 30 de setembro, processou 3,23 bilhões de tokens por meio de nós com uma taxa de erro de 0,18%.

Isso importa para a forma como você reduz o risco de uma prévia. A maneira sensata de testar um endpoint de decisão restrita é manter o caminho baseado em prompt aquecido como fallback, porque uma prévia pode mudar limites ou preços sem aviso, e uma decisão que está num caminho crítico precisa de algum lugar para onde ir. Manter esse fallback na mesma chave dos seus outros modelos significa que não há um segundo contrato nem alteração de código no caminho de fallback: uma API para mais de 200 modelos, com failover automático entre provedores quando um deles vacila. E se a sua decisão for um passo de uma cadeia mais longa, a DSL de roteamento compõe modelos numa única chamada, que é exatamente o padrão orquestrador-mais-decisor que a cobertura do Jev popularizou — um modelo maior a planear, um modelo pequeno a escolher cada passo. Esse padrão é construível hoje a partir dos modelos que servimos; a própria Decisions API ficaria fora dele até que a OpenAI a abra.

Quem deve se mover e quem deve esperar

Se o seu problema é uma tarefa de classificação ou encaminhamento de alto volume em que um ramo errado é barato e reversível, o preview vale um formato de requisição e um conjunto rotulado esta semana — a capacidade é real, a restrição é uma melhoria genuína em relação a analisar texto corrido, e um preview é o momento mais barato possível para descobrir onde recaem os custos dos seus erros. Se a sua decisão autoriza dinheiro, envia uma mensagem a um cliente ou fica entre um usuário e um pagamento, nada nesta semana muda o seu cálculo: não há preço publicado para modelar, nem limite publicado para projetar em torno, nem SLA, e nenhuma palavra sobre se você pode ajustar a ferramenta com os seus próprios dados. Essas quatro lacunas são o que o "lançamento amplo" tem de preencher e, até que a OpenAI as nomeie, a leitura honesta da Decisions API é a de uma interface promissora com um prazo rápido declarado pelo fornecedor e nenhuma fatura anexada.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente