
Onde a Decisions API da OpenAI termina e o Jev começa: o que o primeiro cliente externo revela
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 145 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 296 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Às 23:05 UTC de 6 de outubro de 2026, um plugin chamado llm-openai-decisions chegou ao PyPI, e seu próprio README contém a frase que a cobertura do lançamento nunca publicou: "Ao contrário do Jev, o novo modelo de decisão gpt-6-luna oferece suporte a entrada de imagem além de texto." O autor é Simon Willison, que também escreveu o primeiro cliente para o modelo de decisão da TypeSafe, e a comparação que ele faz é entre GPT-6 Luna — o modelo por trás da Decisions API da OpenAI — e Jev 1.13, o modelo System One, apenas de texto, da TypeSafe. O mesmo post do blog observa que o próprio plugin foi escrito pelo GPT-6 Astra enquanto lia a documentação da OpenAI.
É isso que há de útil num cliente lançado uma semana depois de uma API: é escrito contra a forma do pedido, não contra o discurso de apresentação, pelo que expõe as diferenças que o texto de marketing suaviza. Nada aqui é uma fuga de informação e nada aqui está por confirmar — todos os números abaixo provêm de uma página publicada pela OpenAI, pela TypeSafe ou pelo próprio repositório do plugin, todos consultados em 2026-10-07. O que ainda falta é uma medição independente do próprio endpoint, e essa lacuna é declarada no final em vez de ser disfarçada.
As três superfícies, mantidas separadas
A primeira coisa a deixar clara é que estas são três camadas diferentes, e a cobertura da imprensa as confunde.
• Os endpoints. O da OpenAI é POST /v1/decisions, uma rota dedicada em vez de um modo na API Responses. O da TypeSafe é POST /v1/systemone. Ambos recebem um conjunto de evidências mais uma lista de perguntas tipadas e retornam uma resposta por pergunta, indexada pelo nome que você atribuiu a ela.
• Os modelos. A Decisions API aceita exatamente um modelo hoje, gpt-6-luna, que também é a camada barata da linha geral GPT-6 da OpenAI e foi lançado em 2026-09-22 como um modelo comum de texto e imagem. O Jev 1.13 é um modelo de decisão de ponta a ponta — ele não consegue emitir texto livre de forma alguma. A TypeSafe o lançou em 2026-09-15 e ele está disponível de forma geral desde 2026-09-21.
• Os clientes.Os próprios SDKs da OpenAI oferecem suporte ao endpoint desde que ele entrou em beta público em 2026-10-06, portanto o plugin não é a primeira forma de chamá-lo. É o primeiro cliente fora dos próprios SDKs da OpenAI que conseguimos verificar, e o primeiro escrito para uma ferramenta de linha de comando em vez de uma biblioteca de aplicação.
Os dois metros, lado a lado
É aqui que o README do cliente vale mais do que o anúncio, porque os números ficam ao lado do texto.
• Preço — a Decisions API cobra $0,10 por milhão de tokens de entrada, sem cobrança de saída, sem cobrança de leitura de cache e sem cobrança de gravação de cache. Jev 1.13 cobra $0,042 por milhão de tokens de entrada, com saída gratuita. Ambos cobram pelo que você envia e nada pelo que retorna, então uma decisão custa uma fração de centavo em qualquer um dos preços e a diferença entre eles é um fator de 2,4, não um modelo de cobrança diferente.
• Entrada — a Decisions API aceita texto, ou mensagens do usuário que misturam texto com imagens, e o README do plugin afirma que anexos PNG, JPEG, WebP e GIF são compatíveis, com no máximo 128 imagens por requisição. As imagens devem ser inseridas como URLs de dados base64 inline; URLs de imagens hospedadas em HTTP ou HTTPS e entradas file_id não são aceitas pelo endpoint, então o plugin converte uma URL ou um caminho local antes de enviar. A documentação do Jev 1.13 é categórica no sentido oposto: "Nenhuma entrada de imagem, áudio ou vídeo", e entradas que não sejam texto devem ser pré-processadas para texto ou campos estruturados antes de chegarem ao estado.
• Tipos de pergunta — A OpenAI documenta três: predicate (uma probabilidade de 0 a 1 de que uma condição declarada seja verdadeira), choice (um valor da sua lista, mais uma distribuição e um campo de confiança separado), e score (uma média ponderada por probabilidade entre níveis ordenados). Os três da TypeSafe são as mesmas três ideias sob nomes diferentes: noul para sim/não, choice, e score. "Noul" é abreviação de Bernoulli, e o nome é um bom marcador da diferença cultural — um fornecedor entrega um substantivo em linguagem simples, o outro entrega uma piada de estatística.
• Aritmética de pontuação — os dois coincidem exatamente, o que é o sinal mais forte de que se trata de uma única categoria de produto, e não de duas. A documentação da OpenAI alimenta três níveis de severidade com probabilidades de 0,1, 0,7 e 0,2 e recebe de volta uma pontuação de 1,1 — deliberadamente entre dois níveis, em vez de se ajustar ao mais próximo. Os níveis da TypeSafe são indexados a zero da mesma forma, e o plugin para Jev aceita entre dois e dez níveis ordenados. A página da OpenAI não declara nenhum teto; isso é uma ausência na documentação deles, não um limite que possamos afirmar.
• Orçamentos — Jev documenta sua janela com precisão: cerca de 64.000 tokens por solicitação, cerca de 32.000 deles cobrindo o estado mais a pergunta única mais longa, em contraste com o contexto de 1.050.000 tokens que nosso próprio catálogo traz para o GPT-6 Luna como modelo geral. A página de decisões da OpenAI não publica orçamento de tokens algum, apenas a observação de que sobretaxas regionais de processamento e multiplicadores de entrada de contexto longo ainda se aplicam à tarifa.
O que o cliente revela que o anúncio não revelou
Três detalhes no plugin e no README dele merecem destaque, porque cada um muda a forma como você configuraria o endpoint.
A primeira é que uma decisão pode voltar como uma recusa. A documentação da OpenAI nunca explica isso em prosa, mas cada exemplo de SDK cria uma ramificação com base nisso — answer.type === "refusal" em JavaScript, um OpenAI::Models::Decision::Answer::Refusal que é um caso em Ruby — e o README do plugin explicita que uma pergunta recusada é preservada como {"name":"...","type":"refusal"}. Portanto, na prática, o tipo de resposta tem quatro valores, não três, e qualquer loop em produção tem que lidar com um quarto ramo que nenhum anúncio mencionou.
O segundo é o que está faltando no plugin, e não algo presente nele. O próprio post de Willison enquadra o trabalho como fazer o GPT-6 Astra ler a nova documentação e construir o cliente a partir dela — da documentação ao cliente, em uma única passada, sem tutorial humano. Hoje isso é uma forma normal de se escrever um cliente, e significa que a questão de saber se a documentação de um endpoint é completa o suficiente para gerar um cliente funcional a partir dela tornou-se prática, e não editorial. Para este endpoint, a resposta é em grande parte sim, com o tipo de recusa como a emenda visível.
O terceiro é o formato do array de perguntas. A OpenAI permite colocar perguntas independentes em uma única requisição sobre uma entrada compartilhada — verificar se há danos em uma foto de produto e classificar sua categoria na mesma chamada —, mas exige requisições separadas quando uma pergunta posterior depende de uma resposta anterior. A Jev assume a mesma posição pelo mesmo motivo: suas perguntas são avaliadas em paralelo em relação a um único estado, então qualquer coisa sequencial precisa se tornar duas chamadas. Os dois fornecedores foram projetados para fan-out, e ambos estão dizendo a mesma coisa sobre onde vai o orçamento de latência.
A categoria agora tem três ocupantes, e dois deles não são modelos gerais
Vale a pena nomear o terceiro, porque a estrutura de endpoint de decisão só faz sentido com todos os três em vista. A Perplexity disponibiliza uma API Decisions própria, servida por pplx-decider-v1-27b — um modelo de decisão de 27 bilhões de parâmetros lançado sob Apache 2.0 com pesos no Hugging Face em 2026-10-01. Isso dá à categoria um formato genuinamente diferente do da OpenAI: o Jev 1.13 é fechado e apenas de texto, o decider da Perplexity tem pesos abertos e aceita imagens, e a entrada do GPT-6 Luna é um harness em torno de um modelo geral, e não um modelo criado para decidir.
Para um leitor que escolhe hoje, a divisão prática é mais estreita do que o marketing. Se a sua evidência é uma frase ou um registo e quer o custo por chamada mais baixo com a menor variação de comportamento, o Jev 1.13 é o especialista e a sua tarifa de $0,042 é a mais baixa dos três preços publicados que conseguimos verificar. Se a sua evidência incluir uma fotografia, ou se quiser uma decisão de um modelo que já conhece de tarefas comuns, a Decisions API é a única das duas opções fechadas que aceita imagens. A opção de pesos abertos responde a uma pergunta diferente — controlo e auto-hospedagem — e não a testámos.
O que podemos realmente medir, e o que ninguém tem
A alegação da OpenAI para o endpoint é que ele “avalia texto, imagens ou ambos e retorna respostas tipadas cerca de 10x mais rápido que a Responses API”. Isso é declarado pelo fornecedor e não reproduzido: sem região, sem tamanho de entrada, sem nível de concorrência, sem acordo de nível de serviço, e a linha de base é a Responses API em geral, e não uma carga de trabalho específica. Um único número de aceleração é o número errado para basear um prazo.
O que podemos colocar ao lado disso é a nossa própria janela de serviço de sete dias, terminando em 2026-10-07, nos dois modelos abaixo, a partir do tráfego do nosso playground — e é importante dizer o que esses números não são. Eles descrevem solicitações comuns de geração, não decisões.
• GPT-6 Luna, todos os formatos de requisição: uma mediana de 1.448 ms e um p95 de 4.912 ms, uma taxa de erro de 1,31% em 643.394.111 tokens em sete dias, que é o que uma vazão de cerca de 125 tokens de saída por segundo parece quando o modelo está escrevendo.
• Jev 1.13: uma mediana de 149 ms e um p95 de 245 ms, uma taxa de erro de 0,10% em 110.193.080 tokens. Esse é um endpoint genuinamente rápido, e é rápido porque não gera uma resposta — ele calcula números para um estado que é ingerido uma vez.
Lidas em confronto uma com a outra, essas duas linhas são um alerta, não uma comparação. Uma requisição de decisão emite um punhado de tokens, então, na API de Decisions, a métrica de vazão de saída que domina o perfil geral da Luna deixa de ser a restrição determinante, e o número que passa a importar é quanto tempo o modelo leva para ler as evidências. Não medimos isso no endpoint de decisions e, pelo que conseguimos apurar, ninguém fora da OpenAI publicou essa medição.
A questão mais profunda que não está sendo medida é a calibração, e é ela que decide se algo disto é utilizável. Uma probabilidade de 0,92 para dano visível só vale a pena para encaminhar com base nela se, em todo o seu tráfego, as fotos com pontuação próxima de 0,92 estiverem danificadas cerca de 92% das vezes. A documentação da OpenAI diz para você definir limiares a partir de exemplos rotulados e escolhê-los pelo custo dos falsos positivos em relação aos falsos negativos. Esse é um conselho correto, e também é uma admissão de que a calibração desses números é algo que você mesmo precisa estabelecer. Para uma primeira passagem, meça a distribuição das probabilidades retornadas em uma amostra cujas respostas você já conhece. Se tudo voltar como 0,99 ou 0,01, o limiar não está fazendo trabalho nenhum e o endpoint é um booleano muito caro.
Como testar qualquer um dos dois sem arriscar um caminho de produção nisso
Fontes, de forma clara: o contrato de endpoint, as regras de preço e imagem neste texto vêm da própria documentação da Decisions API da OpenAI e do README do plugin, ambos lidos em 2026-10-07; a especificação Jev 1.13 vem da própria documentação de modelo da TypeSafe; os números de serving são dados do nosso próprio playground ao longo da janela de sete dias que termina em 2026-10-07; os carimbos de data/hora dos pacotes vêm do PyPI e do histórico Git do projeto. A alegação de velocidade 10x é da OpenAI e está rotulada como tal. A licença e a data de lançamento do decisor open-weight vêm do repositório do seu modelo.
A própria Decisions API é o empacotamento da OpenAI e nós não a roteamos; se você quiser esse endpoint específico, é na OpenAI que ele fica. Os modelos por trás são outra questão. GPT-6 Luna é uma rota ativa no OrcaRouter pelo preço de tabela da OpenAI, com zero markup repassado, e typesafe/jev-1.13 a preço de tabela está na mesma chave, o que torna a comparação deste artigo algo que você pode executar em vez de ler: o mesmo estado, as mesmas perguntas, dois endpoints, um contrato para gerenciar e nenhuma segunda fatura.
Essa também é a forma sensata de adotar uma superfície não comprovada. Coloque a decisão atrás de um fallback para que uma recusa, um timeout ou um limite beta que muda debaixo de você degrade para uma chamada baseada em prompt em vez de uma indisponibilidade, e mantenha esse fallback na mesma chave que a primária para que não haja nada a reconfigurar quando o endpoint avançar para a disponibilidade geral. A OpenAI diz que a GA é esperada nas próximas semanas e que o gpt-6-luna é o único modelo disponível nesse meio-tempo; ambos são motivos para construir com base no formato e instrumentá-lo agora, e nenhum deles é motivo para colocar uma autorização de pagamento por trás disso ainda.

O que assistir em seguida
Três coisas resolveriam as questões que este texto não consegue. Um orçamento de tokens publicado para o endpoint de decisões, para que uma requisição possa ser dimensionada em vez de adivinhada. Qualquer anúncio de GA, que é o ponto em que a tarifa apenas de entrada deixa de ser uma promessa beta. E uma medição independente de latência e calibração no próprio endpoint — a primeira pessoa a passar alguns milhares de pares rotulados por ele e publicar a curva de confiabilidade fará mais pela categoria do que qualquer um dos dois posts de lançamento fez.
Até então, o resumo honesto é restrito e útil: se a coisa que você precisa decidir é texto, o Jev 1.13 é mais barato e retorna números em cerca de 150 milissegundos no nosso tráfego. Se a coisa que você precisa decidir inclui uma imagem, a Decisions API da OpenAI é a que vai olhar para ela, a 2,4 vezes o preço de entrada, com um rótulo beta na caixa. Ambos podem ser chamados a partir de uma linha de comando desde esta semana, e essa é uma posição melhor do que qualquer um dos dois tinha sete dias atrás.


