
Jev se recusa a escrever uma única palavra: o que o Modelo de Decisão da TypeSafe AI faz, e o que ninguém verificou ainda
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
O Jev é o primeiro modelo da TypeSafe AI que um leitor provavelmente encontrará por meio de uma tabela de custos, e não de uma caixa de chat, porque não existe caixa de chat. Lançado em 15 de setembro de 2026 por Diogo Almeida — coautor do artigo do InstructGPT, o trabalho que fez o ChatGPT se comportar como um assistente —, o Jev não gera texto de forma alguma. Ele recebe um pedaço de estado (um e-mail, uma linha de log, um tíquete de suporte, um blob JSON de coordenadas de jogo) mais uma lista de perguntas tipadas e retorna respostas tipadas: uma escolha de um conjunto que você forneceu, uma pontuação em uma rubrica ou uma probabilidade sim/não, cada uma com seu próprio valor de confiança. Sem prosa, sem código, sem explicação. O argumento de venda da TypeSafe é que esse foco estreito é o produto, porque isso proporciona uma velocidade e um preço que um modelo generativo não consegue igualar — 20 a 200 vezes mais rápido e 40 a 400 vezes mais barato do que “LLMs comparáveis” nos próprios materiais de lançamento da empresa, a US$ 0,042 por milhão de tokens de entrada, com a saída cobrada a zero.
O número mais útil publicado nas primeiras 48 horas não é um daqueles. Ele vem da Every, cujo chefe de avaliações rodou o Jev em 27 artigos publicados da Every mais 10 equivalentes com estilo de IA, fazendo 21 perguntas a todos os 37 documentos de uma só vez: 777 julgamentos em menos de 0,7 segundos, por cerca de um quarto de centavo. Um segundo teste, realizado pelo CEO da Every, colocou 12 trechos sintéticos — seis limpos, seis com defeitos deliberadamente introduzidos — contra quatro verificações de escrita. O Jev retornou uma mediana de 0,35 segundos por trecho, contra 8,83 segundos do Claude Fable 5.1 em alto esforço: cerca de 25 vezes mais rápido a aproximadamente 1/580 do custo. Ele detectou seis dos sete defeitos introduzidos. O Claude Fable 5.1 detectou todos os sete. O veredito da Every foi "bom, mas não perfeito", e essa é a leitura honesta em uma linha do Jev a partir do único teste independente que alguém publicou até agora — as alegações de velocidade e custo resistem ao contato com uma terceira parte, a alegação de precisão fica um degrau abaixo da fronteira, e a amostra é pequena o suficiente para que ninguém deva tirar uma conclusão para produção a partir dela.
Uma nota sobre o tipo de evidência com que este artigo trabalha, porque os níveis estão invulgarmente distantes para um modelo tão novo. O Jev é real e invocável: existe um endpoint documentado, um SDK de Python, um alias de modelo e um preço publicado. O lançamento foi anunciado pelo fornecedor, não vazado, e ninguém está especulando se ele existe. Mas todas as alegações de desempenho que a TypeSafe apresenta como principais são da própria TypeSafe, a arquitetura não foi publicada, os pesos não foram disponibilizados, e o painel de benchmarks por trás do destaque de 20-200x é um conjunto de avaliações internas de fluxos de trabalho, e não uma tabela de classificação pública. Uma entidade externa testou-o. Este artigo mantém os números do fornecedor, os números independentes e as questões em aberto visivelmente separados, em vez de fazer a média entre eles para formar um consenso que não existe.
O que a TypeSafe realmente lançou
Jev é o primeiro do que a TypeSafe chama de modelos System One — o nome tomado por empréstimo da metade rápida e intuitiva da cognição de Daniel Kahneman, em oposição ao modo deliberativo mais lento que os chatbots imitam. O contraste que a TypeSafe traça é com o padrão habitual de forçar um gerador de texto a emitir saída estruturada e depois analisar esse texto de volta para algo em que o código possa confiar. Jev dispensa o texto por completo. A própria documentação da TypeSafe afirma o caso sem rodeios: "Os grandes modelos de linguagem (LLMs) são projetados para produzir texto para humanos lerem. Quando você precisa que um modelo faça um julgamento que seu código irá consumir, isso cria uma incompatibilidade."
A superfície de saída é composta por três primitivas, e não há mais nada. Toda pergunta que você fizer deve ser uma delas:
• Escolha — escolha uma opção de uma lista que você fornece, retornando a opção selecionada, além de uma probabilidade para cada candidato e uma confiança. As opções são limitadas a 255 por campo; além disso, a TypeSafe documenta um padrão de dois estágios: pontuar candidatos independentemente e depois escolher.
• Pontuar — posicionar o estado em uma rubrica ordenada, retornando o nível, uma probabilidade por nível e um valor de confiança. Risco de churn em uma escala de 0 a 1 é o exemplo na documentação.
• Noul — uma palavra-valise de "no" e "null" — uma única afirmação de sim/não, retornando a probabilidade calibrada de que seja verdadeira.

A propriedade interessante não é nenhuma primitiva isolada, mas sim como elas se compõem. Todas as três podem ser misturadas em uma única chamada de API, e cada pergunta é avaliada em paralelo com base em uma leitura compartilhada do mesmo estado. A documentação da TypeSafe diz que adicionar perguntas "quase não altera o tempo de resposta", e o teste independente confirma isso na prática — 21 perguntas em 37 documentos ficaram dentro dos mesmos 0,7 segundos. É isso que faz o preço por julgamento desabar: você não está pagando por uma geração mais longa; está pagando por uma única passagem.
O envelope prático, conforme documentado e conforme relatado por usuários iniciais: um orçamento de requisição de aproximadamente 32.000 tokens, descrito na documentação da TypeSafe como cerca de 150.000 caracteres em inglês; nenhuma entrada de imagem ou áudio no lançamento; e um formato de requisição e resposta que não é a convenção chat-completions da OpenAI, de modo que chamá-lo exige um cliente sob medida em vez de uma simples troca de URL base. O acesso se dá por uma lista de espera de acesso antecipado mais um playground no navegador, com code>jev-latest/code> como alias do modelo.
RLCD significa calibrado, não preferido
A TypeSafe treina o Jev com um método que chama de RLCD — Reinforcement Learning for Calibrated Decisions, de acordo com a documentação da própria empresa. A sigla é nova o suficiente para que a cobertura inicial a tenha expandido de forma inconsistente, então vale a pena definir com precisão o que ela realmente nomeia, porque a distinção é toda a alegação da pesquisa.
RLHF otimiza para saída preferida por humanos. RLVR otimiza para correção verificável, do tipo que passa no caso de teste. RLCD otimiza para calibração: um modelo que diz estar 70% confiante deve estar certo cerca de 70% das vezes. Esse é um alvo diferente de estar certo, e é a razão pela qual toda resposta do Jev vem acompanhada de uma distribuição de probabilidade, em vez de apenas uma resposta. O modo de falha pretendido é um modelo que sabe quando não sabe, para que seu código possa decidir o que fazer a respeito.
O que isso lhe proporciona na prática é uma superfície de controle. O padrão documentado consiste em três faixas de confiança — agir automaticamente no topo, sinalizar ou confirmar no meio, encaminhar para um humano na base — com os limiares residindo no seu código, e não no modelo. Se as faixas são honestas é uma questão empírica sobre os seus dados, e é uma que a TypeSafe diz explicitamente para você responder por conta própria, observando que os limiares de confiança são específicos de cada caso de uso e devem ser testados com os seus próprios exemplos rotulados. Essa instrução é a frase mais importante da documentação e a razão pela qual a próxima seção existe.
Os números, ordenados por quem os produziu
É aqui que a maioria da cobertura do Jev fica vaga, por isso vale a pena ser explícito quanto à proveniência. Aqui está o que vem do fornecedor, o que veio de um testador independente e o que é simplesmente desconhecido.
• Relatado pelo fornecedor, não reproduzido — as principais alegações de velocidade e custo. Latência ponta a ponta de 70-500 ms em comparação com 3-329 segundos para chamadas de LLM de fronteira; 20-200x mais rápido e 40-400x mais barato; um único resultado de fluxo de trabalho no melhor cenário anunciado como 193,6x mais rápido e 444,6x mais barato. A TypeSafe reconhece que estes são números do melhor cenário, e não valores universais.
• Informado pelo fornecedor e verificável na tabela de preços — US$ 0,042 por milhão de tokens de entrada, o que dá US$ 42 por bilhão, com saída gratuita. O motivo de a saída ser gratuita é mecânico, não promocional: não há decodificação autorregressiva para medir, portanto não há tokens de saída a cobrar. Para se ter uma ideia da escala, os mesmos materiais de lançamento indicam que o preço típico de entrada de modelos de fronteira fica entre US$ 0,20 e US$ 10 por milhão, com a saída geralmente cerca de cinco vezes o preço da entrada.
• Relatado pelo fornecedor, com base em um benchmark interno — o próprio painel de fluxo de trabalho da TypeSafe, 711 casos em quatro tarefas, com respostas de referência derivadas do julgamento médio do GPT-6 Astra e do Claude Fable 5.1, em vez da verdade de base. Nesse painel, o Jev atinge uma pontuação agregada de 67,8%, contra 74,1% do melhor comparador. Detalhando: incidentes de segurança 61,7% contra 66,2% do Opus 5; observabilidade de rastreamento de agentes 71,6% contra 76,6%; processamento de faturas 61,8% contra 79,1%; atendimento ao cliente 76,0% contra 78,3%. O Jev vence nas colunas de custo e latência desse gráfico e perde na coluna de precisão. O próprio painel observa um possível viés do harness, e a TypeSafe afirmou que deliberadamente deixou de lado os rankings públicos em favor de avaliações pontuais vinculadas a atualizações de produto.
• Medido de forma independente, amostra pequena — os testes da Every descritos acima: 777 julgamentos em menos de 0,7 segundos por cerca de um quarto de centavo; 1.709 julgamentos em 11 experimentos por menos de um centavo no total; aproximadamente 25x mais rápido e 1/580 do custo do Claude Fable 5.1 em uma tarefa de classificação de 12 passagens, embora tenha deixado passar um dos sete defeitos plantados que o comparador detectou. A própria Every concluiu que gostaria de uma verificação de precisão muito mais minuciosa antes de colocá-lo em produção.
• Desconhecida — a arquitetura. Nenhum artigo no lançamento, nenhuma contagem de parâmetros, nenhuma divulgação da computação de treinamento, nem pesos. A TypeSafe disse que os detalhes estão sendo mantidos "em segredo por enquanto", com um artigo possivelmente mais tarde.

O padrão entre esses níveis é consistente, e não é o padrão que a manchete de 200x sugere. Todos os números independentes e de fornecedores concordam que o Jev é drasticamente mais barato e drasticamente mais rápido. Nenhum número em lugar algum, incluindo os da própria TypeSafe, mostra que ele seja mais preciso do que os modelos de fronteira com os quais ele compete em preço. No próprio painel do fornecedor, ele fica em torno do nível de um bom modelo intermediário. A comparação que se sustenta não é "tão inteligente quanto um modelo de fronteira por um centésimo do preço" — é "próximo do julgamento de um modelo intermediário a uma fração de centavo por chamada, rápido o suficiente para rodar a cada turno."
O que "alucinação zero" significa e não significa
Os materiais de lançamento da TypeSafe incluem um gráfico que mostra uma taxa de erro de 0% em chamadas de ferramentas para o Jev, contra uma taxa diferente de zero para os modelos de comparação, e a expressão "resistente a alucinações" acompanha o modelo. Ambas são verdadeiras e ambas são mais restritas do que aparentam.
A garantia é estrutural. Todas as respostas possíveis são enumeradas antes de o modelo ser executado — você forneceu a lista de opções, a rubrica ou a afirmação de verdadeiro/falso —, portanto não há espaço para emitir um valor fora do tipo declarado. Uma chamada de ferramenta malformada não é algo que o Jev possa produzir. Isso é uma propriedade de engenharia genuína e, para quem já passou uma semana escrevendo lógica de novas tentativas em torno de falhas de análise de JSON, vale dinheiro de verdade.
Não é uma afirmação sobre estar correto. Uma resposta válida em termos de esquema ainda pode estar errada: Jev pode encaminhar com confiança uma reclamação de cobrança para a fila técnica, e a saída será perfeitamente bem formada, ainda que inútil. O próprio Almeida já disse isso, reconhecendo que é possível estar confiantemente errado. A maneira útil de conciliar os dois fatos é que Jev elimina a classe de erro que vem da formatação da saída e não faz absolutamente nada quanto à classe que vem do julgamento. O que significa que a questão da precisão é inteiramente uma questão de calibração, e calibração é exatamente a coisa que você mesmo precisa medir.
Como testar a afirmação de calibração nos seus próprios dados
Calibração é uma das poucas propriedades de modelo que você consegue verificar adequadamente com algumas centenas de exemplos e nenhuma infraestrutura de ML, e é o único teste que importa antes de Jev tocar em um caminho de produção. O procedimento é curto.
Pegue algumas centenas de casos para os quais você já tem rótulos. Faça a Jev a pergunta que importa — a decisão de roteamento, a pontuação de risco, a verificação de defeitos — e agrupe as respostas pela confiança que ele reportou. Depois, verifique se a faixa de confiança de 0,9 acerta cerca de 90% das vezes, a faixa de 0,7 cerca de 70%, e assim por diante. Um modelo bem calibrado traça uma linha diagonal. Um modelo que é apenas confiante agrupa tudo acima de 0,9 e acerta 70% das vezes, e é esse o formato que quebra silenciosamente um pipeline automatizado.
O mesmo teste diz quais limiares usar. Se a faixa de 0,9 for realmente 90% precisa nos seus dados, você pode automatizá-la. Se a sua faixa intermediária for confusa, você a encaminha para um humano ou a entrega a um modelo generativo e deixa o caminho caro lidar com a ambiguidade. Essa divisão — modelo barato na maioria confiante, modelo caro no restante incerto — é a arquitetura real que Jev está defendendo, e é a razão pela qual o modelo é melhor entendido como um componente, e não como um substituto.
O que custa, explicado em detalhe
A precificação é simples o bastante para se raciocinar sobre ela, o que é raro. A entrada custa US$ 0,042 por milhão de tokens. A saída é gratuita. No orçamento de requisição documentado de aproximadamente 150.000 caracteres, uma única chamada de tamanho máximo custa bem menos de um centavo.
Duas cifras relatadas dão uma ideia da escala. Um usuário inicial fez cerca de 5.000 requisições por aproximadamente US$ 2. A demonstração do Doom — Jev pilotando um bot usando uma descrição textual do estado do jogo em vez de pixels brutos — rodou a cerca de 10 chamadas por segundo por aproximadamente US$ 7 por hora. E as 777 avaliações da Every em 37 documentos ficaram em cerca de um quarto de centavo, que é o número que torna compreensível o caso de uso interessante: a esse preço, verificar cada turno de um loop de agente deixa de ser uma decisão de custo e passa a ser o padrão.
Esse é o verdadeiro argumento a favor do Jev. Uma verificação por turno — esta chamada de ferramenta contradisse a anterior, esta saída é consistente com a intenção declarada pelo usuário, isto deveria acionar um alerta — sempre foi tecnicamente possível com um modelo de fronteira e economicamente absurda em escala. A US$ 0,042 por milhão de tokens, sem cobrança pela saída, a mesma verificação se torna financeiramente viável a cada turno. O valor aqui não está no fato de o Jev pensar melhor que um modelo de fronteira, porque não pensa melhor. O valor está em ele pensar a baixo custo e com rapidez suficiente para ser consultado constantemente.
Vale dizer com clareza, porque é a próxima pergunta óbvia: o OrcaRouter não disponibiliza o Jev. O modelo da TypeSafe está em acesso antecipado, com lista de espera, e usa seu próprio formato de requisição, então quem quiser testá-lo passa diretamente pela TypeSafe. Onde uma camada de roteamento realmente se encaixa é na outra metade do fluxo de trabalho. O padrão para o qual o Jev foi projetado envolve dois modelos, não um — o Jev toma a decisão tipada, e um modelo generativo cuida da parte que precisa de texto, código ou uma explicação. É essa metade generativa que o OrcaRouter cobre: 197 modelos em 15 provedores atrás de uma única chave compatível com OpenAI, pelo preço de tabela do provedor repassado com 0% de markup, então um corte de preço de um fornecedor chega ao nosso lado no mesmo dia em que é lançado. As duas metades de um fluxo de trabalho no formato do Jev podem ser testadas sem um segundo contrato, e quando o componente de decisão ainda não tem comprovação, o caminho de failover é o que impede que um resultado ruim de calibração se torne um incidente de produção.

Onde o Jev não se encaixa
As limitações são declaradas de forma incomumente clara pelo fornecedor, o que torna esta seção fácil de escrever com honestidade. O Jev não consegue gerar texto livre. Não consegue escrever código. Não consegue manter uma conversa. Não tem interface de chat, nem entrada de imagem, e tem um orçamento de contexto de cerca de 32.000 tokens — uma ordem de magnitude abaixo dos modelos de contexto longo com os quais está sendo comparado em termos de preço. Os campos de escolha têm no máximo 255 opções. E a propriedade de "não alucinação", como acima, diz respeito ao formato da saída, e não à veracidade.
A rede é uma opção bastante restrita. Bom: classificação e roteamento de alto volume, passagens de guardrail e verificação, decisões críticas em termos de latência, pontuação de grandes conjuntos de documentos em paralelo, sempre que a resposta correta for genuinamente uma escolha, um número numa escala ou um booleano. Ruim: geração aberta de qualquer tipo, raciocínio de contexto longo, diálogo multiturno ou qualquer tarefa cuja resposta correta seja uma frase. Se o seu problema não se reduz a uma pergunta tipada, Jev não é uma forma mais barata de resolvê-lo — não é forma alguma de resolvê-lo.
Há também uma crítica justa ao enquadramento que vale a pena levar adiante. Chamar o Jev de modelo de fronteira toma emprestada uma credibilidade que o modelo não conquistou: ele não consegue programar, conversar nem escrever uma frase, e os gráficos de comparação se apoiam em modelos de fronteira como linha de base, enquanto a coluna de precisão conta uma história diferente. A afirmação mais defensável, e a que as evidências de fato sustentam, é que a TypeSafe empurrou a fronteira de velocidade e custo para decisões estruturadas muito mais para frente. Isso é algo substancial de se ter feito. É algo diferente de construir um modelo que rivalize com o GPT-6 Astra ou o Claude Fable 5.1.
O que mudaria esta imagem
Três coisas, em ordem aproximada de quanto importariam.
• Um artigo de arquitetura publicado ou pesos abertos. Tudo sobre como Jev alcança sua velocidade atualmente é uma caixa preta, e a alegação de que a avaliação paralela é o mecanismo — a analogia que Almeida traça é substituir a computação sequencial da mesma forma que os transformers substituíram as redes recorrentes — é uma afirmação, e não um resultado demonstrado. Até que o design seja publicado, a velocidade é um fato e a explicação é marketing.
• Uma segunda avaliação independente com uma amostra maior. Os testes da Every são a evidência mais forte disponível e cobrem 12 passagens sobre a questão decisiva da precisão. Mais uma execução independente, em algumas centenas de casos rotulados, resolveria se deixar passar um defeito em cada sete era ruído ou a taxa de erro real.
• Uma auditoria de calibração com entradas realistas e bagunçadas. Tudo o que foi publicado até agora usa ambientes de teste limpos. A questão em aberto para um modelo cuja proposta de valor inteira se baseia em pontuações de confiança confiáveis é o que essas pontuações fazem nos casos genuinamente ambíguos — aqueles em que um revisor humano também hesitaria. Esse é o número que determina se é seguro automatizar com o Jev, e ninguém o publicou.
Até lá, a postura razoável é específica, e não geral. Jev é um modelo real, já lançado, excepcionalmente barato, com uma vantagem estrutural genuína na confiabilidade da saída, um perfil de precisão situado na faixa intermediária e uma alegação de calibração que é plausível, explicitamente recomendada para autoteste pelo próprio fornecedor e validada de forma independente apenas em uma pequena amostra. Se seu fluxo de trabalho tem uma etapa que se resume a uma pergunta digitada feita com frequência suficiente para que um modelo de ponta seria desperdício, esta é uma das formas mais baratas de fazê-la — e o valor de confiança que ele retorna é a parte que se deve testar antes de confiar, não a velocidade.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
