
Onde o Jev 1.13 quebra: a própria lista de limites da TypeSafe
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 349 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 208 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Jev 1.13 (typesafe/jev-1.13) foi lançado em 2026-09-15, o que o coloca duas semanas fora dos últimos sete dias, então seu lançamento não é a história. O evento datado é 2026-09-24: esse é o dia em que a OrcaRouter adicionou typesafe/jev-1.13 ao seu catálogo e abriu um cartão de modelo para ele — o primeiro suporte de serving para o Jev em um gateway de terceiros, depois de duas semanas em que a única forma de chamá-lo era o endpoint da própria TypeSafe. Isso importa aqui por um motivo específico. Jev é incomum porque seu fornecedor publica uma lista das maneiras pelas quais ele falha, e uma lista que você só pode ler é muito mais fácil de ignorar do que um modelo que você pode de fato chamar.
Esta página é essa lista, limitada ao que a própria TypeSafe diz, além dos limites operacionais e da conta.
TypeSafe publica sua própria lista de irregularidades

docs.typesafe.ai traz uma página intitulada Irregularidades do Jev 1.13Ela se aplica explicitamente ao jev-1.13, traz uma data de revisão de 2026-09-17 e começa com a caracterização do próprio fornecedor: "O Jev não é perfeito. Aqui estão algumas arestas irregulares das quais temos conhecimento no jev-1.13. Muitas delas serão corrigidas em versões posteriores." Seguem-se nove modos nomeados, cada um com um caso concreto e uma solução do tipo "Instead:". Nada do que segue é inferido, e nada é amenizado — o texto é da TypeSafe e, quando a empresa dá seu próprio exemplo, os números nele são dela.
{{1}}Leitura literal{{/1}}: ela responde à questão que você escreveu
Palavras de escopo, palavras de negação e condições implícitas são interpretadas ao pé da letra. Uma pergunta é respondida com base nas palavras da instrução, "ao passo que uma pessoa pode ter lido a intenção por trás das instruções."
O diagnóstico do fornecedor é a parte útil: quando você olha para uma resposta errada e se pega explicando o que realmente quis dizer, essa explicação é a metade que faltava da instrução. As soluções são enunciar a condição exata nas instruções, colocar casos-limite nos critérios e, onde a interpretação for genuinamente inevitável, dividir a pergunta em duas perguntas literais e combiná-las em código.
Matemática e números: não é uma calculadora
TypeSafe diz claramente para implementar lógica matemática em código. Três falhas específicas estão por trás disso:
• A contagem não é confiável. Isso abrange caracteres em uma palavra, ocorrências de um termo em uma passagem e itens em uma lista longa. "O modelo reconhece a forma de uma resposta em vez de contabilizar, e o erro cresce com o tamanho da coisa que está sendo contada." O próprio teste do fornecedor para decidir se deve perguntar: se uma expressão regular ou um parser consegue encontrar a unidade, a contagem pertence ao código e o modelo não acrescenta nada.
• Representações numéricas têm desempenho inferior às semânticas. Perguntas sobre cores que usam valores hexadecimais são piores do que as mesmas perguntas que usam nomes de cores em inglês; dados triplos RGB ou hex, Jev não consegue julgar de forma confiável se dois valores estão próximos um do outro. A mesma lacuna aparece em código de baixo nível — assembly, ou instruções codificadas em binário — em comparação com linguagens de alto nível. Converta ou agrupe em buckets no código, e mantenha o modelo para a parte que é genuinamente um julgamento.
• As saídas de pontuação não carregam magnitudes exatas. O fornecedor afirma que os níveis de pontuação do Jev são fracos em calibração numérica. Uma esperança pode ser usada para testar se algo ultrapassa um limiar; ela não pode ser usada para reconstruir o número interpolando entre os dois níveis mais próximos. Isso é um não categórico a toda uma classe de uso indevido — ler uma pontuação como uma medição.
Data e hora: as datas são lidas como texto, não como quantidades
Ordenar duas datas, medir a distância entre elas ou decidir se uma delas cai dentro de uma janela não é confiável, e isso piora ainda mais com formatos mistos, referências relativas e limites de domínio, como trimestres, janelas de liquidação e períodos de competência.
A divisão recomendada é limpa. A extração é uma questão de julgamento, então entregue-a ao modelo. Cada componente de uma data é um pequeno conjunto fechado — doze meses, trinta e um dias possíveis, um intervalo limitado de anos — o que transforma a extração em uma escolha entre opções enumeradas, em vez de uma análise sintática livre, e lhe dá um lugar para colocar um "não declarado" explícito, de modo que uma parte ausente seja relatada em vez de adivinhada. O código monta as partes e é responsável por tudo depois disso, incluindo ordenação, duração, deslocamento e dia da semana.
Indireção: negativas duplas e saltos extras custam precisão.
Instruções que contêm negativas duplas ou indireção em camadas são respondidas com menos confiabilidade. Uma pergunta sobre uma propriedade de uma propriedade, ou uma que exija vários saltos de raciocínio, custa precisão. O remédio é escrever instruções o mais diretamente possível e nomear as partes relevantes do estado em vez de descrevê-las.
Um estado grande, cheio de detalhes irrelevantes, custa precisão.
A precisão cai à medida que o estado cresce com conteúdo não relacionado à decisão. Detalhes não relacionados atuam como distratores, e um estado grande dificulta identificar qual parte da entrada produziu uma resposta errada. O próprio lembrete da TypeSafe na nota final é taxativo: "Jev sofre de deterioração do contexto, então material não relacionado no estado faz você perder precisão."
Recupere e filtre primeiro no código, e envie apenas os campos de que a pergunta precisa. Onde a filtragem antes da solicitação não for possível, o fornecedor sugere usar um noul para filtrar por relevância e, em seguida, avaliar os sobreviventes.
Conteúdo adversarial no estado move a resposta
Estado é dado, e o jev-1.13 não o trata como hostil por padrão. Uma instrução injetada, um enquadramento deliberadamente enganoso ou um texto que defende sua própria classificação pode alterar o resultado. Este é o único modo em que o fornecedor enquadra explicitamente a correção como trabalho futuro — "We expect to improve on this in the future" — e a orientação provisória é ser explícito nos critérios e testar a integração minuciosamente antes de colocá-la diante de muitos usuários.
Instruções e critérios contraditórios confundem-no
Quando as instruções e os critérios pedem coisas diferentes, o modelo pode ficar confuso. O exemplo da TypeSafe é um nulo em que verdadeiro mapeia para não e falso mapeia para sim, o que tem desempenho pior do que a mesma pergunta formulada de forma consistente. A instrução é tratar os critérios como uma extensão da instrução e alinhar os dois em uma linguagem que uma pessoa comum consiga ler e entender.
Invariantes estruturais que ele não garante
Este é o modo mais propenso a quebrar um sistema que foi construído sobre uma suposição que ninguém anotou. Jev é extremamente consistente no sentido comum — entradas semanticamente semelhantes produzem saídas quantitativamente semelhantes —, mas as identidades estruturais que você poderia esperar que se mantivessem não são garantidas. O fornecedor publica dois casos resolvidos.
• Uma pergunta, dois tipos de pergunta. "O cliente está pedindo reembolso?" feita como um noul e feita como uma escolha sim/não, no ticket "Não estou satisfeito com o caimento. Quais são as minhas opções aqui?" retorna um noul de 0,22, e uma escolha de sim 0,01, não 0,99, confiança 0,97. Essas são respostas para a mesma pergunta.
• Uma pergunta e sua negação. "O cliente está pedindo um reembolso?" e "O cliente está pedindo algo diferente de um reembolso?", feitas como dois nouls no chamado "Fui cobrado duas vezes pelo mesmo pedido. Alguém pode verificar isso?", retornam 0,72 e 0,47. A soma é 1,19.
As soluções são operacionais, não retóricas: não conte com a invariância estrutural esperada, não transporte um limiar ajustado em um noul para uma escolha e não exija do modelo identidades aritméticas entre perguntas separadas. A razão é que uma escolha é relativa — ela decide qual opção — enquanto cada noul é absoluto e pode retornar baixo para todas elas.
Geração: não foi treinada para escrever
jev-1.13 não é treinado para gerar texto. Você pode forçar a saída encadeando escolhas, e a TypeSafe diz diretamente que isso "não funcionará bem e será muito lento". Para extração, a orientação é extrair valores candidatos com uma expressão regular ou um modelo generativo e deixar o Jev escolher o correto, ou — quando o espaço de respostas é limitado — transformar a extração em uma escolha entre as opções, em vez de pedir o próprio valor.
O teto de 255 opções em perguntas de escolha

Uma questão de escolha: uma integração Jev não é uma aresta serrilhada, é a forma do produto. Vale a pena separar esses pontos porque nenhuma quantidade de trabalho de prompt os muda:
• Sem geração de texto. Ele retorna uma decisão, não prosa. Isso é o design, não um defeito.
• Sem conversa. Jev é um modelo de decisão estruturado, e não um modelo de chat. Você envia um estado e um conjunto de perguntas nomeadas; ele retorna uma resposta estruturada por pergunta. Não há troca de turnos para se levar em conta no design.
• Não há entrada multimodal. A entrada é apenas texto — string, objeto JSON ou array de valores de texto, sem imagem, áudio ou vídeo. Material não textual deve ser pré-processado em texto ou campos estruturados antes de se tornar parte do estado.
• Respostas sem streaming. Há uma única resposta estruturada e nenhum modo de streaming. A razão pela qual esta não importa é a mesma pela qual vale a pena afirmá-la: não há nada para transmitir. Uma decisão tipada — um booleano com uma probabilidade, um rótulo de um conjunto ou um nível numa escala — não tem forma parcial que valha a pena revelar token a token.
• O inglês é o idioma principal. Outros idiomas, incluindo escritas CJK, são tratados, mas não igualmente bem. O conselho da TypeSafe é testar com o seu próprio conteúdo antes de confiar no Jev para uma carga de trabalho em outro idioma, e usar a confiança ao fazer o roteamento.
O teto de 255 opções em perguntas de escolha
Uma pergunta de escolha seleciona uma entre até 255 opções rotuladas, e esse teto é rígido. A TypeSafe também explica por que conjuntos grandes de opções são mais lentos, nas palavras do próprio fornecedor: "Para escolhas de cardinalidade mais alta, usamos um sistema de 2 estágios: pontuamos de forma independente e depois fazemos uma escolha explícita; daí a lentidão ocasional." Portanto, o custo de latência de um grande conjunto de opções é estrutural, e não acidental, e é o fornecedor quem está dizendo de onde ele vem.
Nossa própria janela de serviço para o typesafe/jev-1.13, obtida do model card em 2026-09-30, mostra como isso se parece na prática ao longo de sete dias do nosso próprio tráfego: uma mediana de 151 ms e um p95 de 247 ms, 348 tokens de saída por segundo e uma taxa de erro de 0,49% em 76,2 milhões de tokens servidos. As medianas diárias se movem em uma faixa estreita — 175, 170, 163, 161, 170, 147 e 143 ms de 2026-09-24 a 2026-09-30 —, mas o p95 diário de 2026-09-28 é de 2.448 ms, cerca de dez vezes os dias imediatamente antes e depois. Não podemos atribuir esse outlier de um único dia à cardinalidade de escolhas, e não vamos fazer isso; a leitura honesta é que a cauda existe, e um fluxo de trabalho sensível à latência deve ser projetado para a cauda, e não para a mediana.
A fatura de entrada é a fatura inteira.
A saída é cobrada a zero no Jev, o que às vezes é interpretado como "o Jev é gratuito". Não é, porque a entrada é medida e um estado grande não é gratuito só porque não há nada do lado da saída. O preço do fornecedor é US$ 0,042 por milhão de tokens de entrada — o mesmo número que a TypeSafe declara como US$ 42 por bilhão — e o OrcaRouter repassa o preço de tabela do provedor com 0% de margem, então um corte de preço do fornecedor chega aqui no mesmo dia.
Aqui está o que isso faz com uma forma realista, usando a própria taxa do fornecedor:
• Um pequeno pedido. Um ticket de suporte de 1.200 tokens, mais cerca de 300 tokens de rubrica e perguntas, dá 1.500 tokens de entrada, o que custa $0,000063 por chamada.
• Uma requisição grande. Um contrato de 55.000 tokens mais perguntas que elevam a requisição a 60.000 tokens representa 40 vezes os tokens, então US$ 0,0025 por chamada — ainda é pequeno por chamada, e 40 vezes maior que o primeiro caso para a mesma única resposta.
• Em volume. 60.000 tokens por chamada e 10.000 chamadas por dia são 600 milhões de tokens de entrada por dia, o que é 0,6 bilhão, portanto US$ 25,20 por dia e cerca de US$ 756 em um mês de 30 dias. O mesmo número de chamadas com a solicitação de 1.500 tokens é 15 milhões de tokens por dia: US$ 0,63 por dia, cerca de US$ 18,90 por mês.
A diferença entre essas duas últimas linhas não é um truque de preços, é o estado medido. É por isso que a recomendação de filtragem na seção de context-rot não é apenas uma medida de precisão — enxugar o estado também é a única alavanca que mexe na fatura.
Os limites operacionais publicados, para que ninguém precise adivinhar

A página de modelos da TypeSafe publica números concretos, para que um planejador não precise inferi-los:
• Vazão e taxa. 100 mil tokens por segundo e 40 requisições por segundo, conforme docs.typesafe.ai/models.md. Uma requisição que ultrapasse qualquer um dos limites retorna 429 Too Many Requests; os SDKs de cliente do fornecedor tentam novamente com backoff por padrão e respeitam o cabeçalho retry-after quando a resposta o inclui.
• Os limites mudam. O fornecedor afirma que os limites de taxa estão se ajustando dinamicamente e "podem mudar sem aviso prévio" à medida que a capacidade entra em operação, com limites mais altos disponíveis em planos personalizados e empresariais. Considere 100K/40 como o número atual, e não como um contrato.
• Orçamento de contexto. O orçamento da requisição é de aproximadamente 64.000 tokens considerando o estado combinado e todas as perguntas — o cartão do modelo informa 65.536 — e a página de modelos do fornecedor limita separadamente o estado mais a única pergunta mais longa a 32.000 tokens. Esse segundo número é o orçamento do estado, não uma versão menor do primeiro; ambos são reais e nenhum contradiz o outro.
• Os aliases mudam sob seus pés. jev-latest e jev-preview ambos resolvem para jev-1.13.0 hoje, e o fornecedor observa que não há build de pré-visualização disponível no momento. Um alias muda quando uma nova versão é lançada, então, se você ajustou limites de confiança para uma versão específica, fixe o ID versionado e siga seu próprio cronograma.
Como o seu caso de uso precisa se parecer
Lida de ponta a ponta, a lista do próprio fornecedor descreve uma ferramenta útil e de escopo estreito. Jev é adequado quando o julgamento é delimitado e a aritmética não é tarefa do modelo: este registro está de acordo com a política, qual destes quarenta rótulos se aplica, como isto se lê em uma escala de cinco níveis — perguntado sobre estado que você mesmo filtrou, com uma instrução literal e critérios que concordam com ela, e com toda contagem, comparação e medição de data feitas em código ao redor.
Não é adequado quando a tarefa exige contagem, ordenação ou aritmética de datas, quando exige vários saltos de raciocínio, quando o material de entrada não é texto, quando o estado é um palheiro e a pergunta é uma agulha, ou quando qualquer aspecto da fonte é hostil. Essas não são lacunas em um prompt; são lugares onde o modelo não funciona, e a TypeSafe é quem está dizendo isso.
Mais uma coisa que vale a pena saber antes de integrá-lo: a diferença honesta na forma como o Jev é chamado. No OrcaRouter, o catálogo alcança o Jev por meio do endpoint systemone dedicado, POST /v1/systemone, em vez de pelo formato chat-completions da OpenAI. Essa é uma diferença real na requisição que você escreve, e é a versão correta da alegação mais antiga de que o Jev "fala seu próprio formato de requisição". Todo o resto é igual a qualquer outro modelo na conta —uma chave para 200+ modelos, sem taxas por token da nossa parte, e failover automático se uma rota der problema. A TypeSafe removeu a lista de espera em 2026-09-21; a própria página inicial do fornecedor ainda descreve o Jev como acesso antecipado, e a própria página de benchmark do fornecedor ainda está marcada como pendente, então os únicos números de desempenho nesta página são os números de serving que nós mesmos medimos e as próprias alegações do fornecedor, rotuladas como sendo dele.
