
Jev vs Kev: um fine-tune de $95 que supera Jev em tickets de suporte
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 578 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 182 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Jared Palmer lançou o Kev em 20 de setembro de 2026, cinco dias depois de a TypeSafe AI lançar o Jev, e o número importante não está na tabela de benchmarks. Está no README: a coisa toda custou cerca de $95 em tempo de H100 na Modal, mais três centavos de chamadas à API do Jev usadas para gerar dados de avaliação. O Kev é Apache-2.0, auto-hospedável e vem em três tamanhos construídos sobre os pesos base do Qwen3.5 — aproximadamente 0,8B, 4B e 9B — com um adaptador LoRA de rank 16 e uma cabeça de ponteiro acoplada a uma base congelada, em vez de um modelo de decisão criado do zero. Ele espelha exatamente a API de decisão tipada do Jev: Choice, Score e Noul, próximos o suficiente para serem compatíveis com o próprio SDK Python da TypeSafe. O Jev, por sua vez, foi lançado em 15 de setembro de 2026 como o modelo System One fechado e hospedado da TypeSafe AI, retorna respostas tipadas com confiança calibrada e nenhum texto, e nunca publicou sua arquitetura, contagem de parâmetros, computação de treinamento ou pesos. A comparação, portanto, não é realmente uma comparação de modelos. É um teste de quanto do valor do Jev sobrevive ao ser reproduzido em uma tarde pelo preço de um laptop usado.
O que os benchmarks realmente dizem

A manchete é que Kev chega perto e, numa tarefa estreita, vence. No conjunto de teste travado de novas fontes do Kev, Kev-9B marcou 0,837 contra 0,857 do Jev. No roteamento de tickets de suporte em 900 tickets — o conjunto scienthoon —, Kev-9B marcou 0,952 contra 0,897 do Jev, que é o único resultado publicado em que a reprodução aberta supera o modelo que reproduz. Kev também fica ligeiramente à frente em algumas tarefas de reconhecimento lógico. Nos conjuntos de decisão SemiF, um conjunto estruturado de 144 perguntas, Jev leva por 0,965 a 0,917 do Kev-9B.
Quando Kev perde, perde feio. Acurácia fora do domínio: Kev-8B com 79,6% contra os 85,7% do Jev. MMLU: 70% contra 90%. MMLU-Pro: 0,515 contra 0,840. Aritmética de datas com precisão de dia: 60% contra 93%. O padrão é consistente — Kev é competitivo em roteamento e classificação restritos, onde o conjunto de rótulos é pequeno e o domínio é fixo, e desmorona em qualquer coisa que precise de conhecimento de mundo ou aritmética de múltiplas etapas, porque um adaptador de rank 16 sobre um modelo base pequeno congelado não é onde mora o conhecimento de mundo.
Cada um desses números vem do próprio harness do Kev ou de rastreadores de terceiros, e o README do Palmer diz claramente que não se trata de uma comparação controlada — os dados de treinamento do Jev não são divulgados, então não há como construir uma. O README também afirma que nenhuma saída do Jev foi usada para treinamento. Ambas as ressalvas são do tipo que tornam os números mais confiáveis, e não menos: quem publica a comparação é justamente quem está dizendo o que ela não pode provar.
O que você recebe por $95 que não consegue obter do Jev a nenhum preço

A comparação de custos é onde os dois produtos deixam de ser comparáveis por completo. O Jev custa US$ 0,042 por milhão de tokens de entrada, com saída gratuita, o que é barato de uma forma genuinamente difícil de superar numa base por chamada — mas é uma API hospedada, de acesso antecipado, com lista de espera, e a TypeSafe afirmou que os limites de taxa podem mudar sem aviso. O Kev são pesos que você baixa. O custo marginal da décima milionésima classificação é a sua própria energia elétrica.
Quatro coisas decorrem disso, e nenhuma delas diz respeito a pontuações de benchmark.
• Nenhum dado sai da sua infraestrutura. O Jev é um endpoint hospedado; cada estado que você envia a ele — o ticket de suporte, a linha de log, o registro médico — vai para a TypeSafe. O Kev executa na sua própria GPU, o que, para cargas de trabalho reguladas, não é uma preferência, mas o fator decisivo.
• Sem limites de taxa, sem lista de espera, sem risco de descontinuação. A própria documentação da TypeSafe observa que os limites de taxa podem mudar sem aviso prévio. Um checkpoint local não tem essa cláusula.
• Você pode ajustá-lo. Kev é uma base para especialização, e a receita LoRA que o produziu é pública. Se sua taxonomia de roteamento tem 40 classes que nenhum modelo geral lida bem, você pode treinar com seus próprios rótulos — que é exatamente o que Palmer fez, a um custo medido em dezenas de dólares, em vez de em uma equipe de ML.
• O teto de contexto cabe a você mudar. O orçamento de requisições documentado do Jev é de aproximadamente 32.000 tokens, e os campos Choice têm limite de 255 opções. Kev herda a janela do Qwen3.5, que é muito maior, e o limite de opções é um detalhe de implementação da sua própria pilha de serving, e não um limite do fornecedor.
O que o Jev ainda tem que o Kev não tem
A alegação de calibração é a que não se transfere de forma limpa, e é o cerne do argumento de venda da TypeSafe. O Jev é treinado com um método que a TypeSafe chama de RLCD — Reinforcement Learning for Calibrated Decisions —, que otimiza para que o valor de confiança seja honesto, em vez de otimizar para que a resposta seja preferida. Toda resposta do Jev vem com uma distribuição de probabilidade sobre as opções, para que seu código possa definir limites: agir automaticamente na faixa superior, sinalizar na intermediária e escalar na inferior.
Kev produz a mesma forma tipada e as mesmas saídas de probabilidade, porque a API é deliberadamente compatível. Se essas probabilidades estão calibradas é uma questão diferente, e a resposta honesta é que ninguém publicou um diagrama de confiabilidade para nenhum dos dois modelos. Uma auditoria de calibração separada relatou que o Jev obteve 44,7% de precisão com um erro de calibração esperado de 0,325 em uma tarefa de prioridade de política oculta, o que sugere que a calibração do Jev varia acentuadamente conforme a tarefa, em vez de ser uma propriedade universal — e a própria TypeSafe diz aos usuários para testarem limites de confiança com seus próprios exemplos rotulados, em vez de confiarem no comportamento publicado.
A outra coisa que o Jev tem é que ele não foi treinado no Qwen3.5. Um modelo de 9B com um adaptador de rank 16 tem um teto de conhecimento, e a lacuna no MMLU-Pro de 0,515 contra 0,840 é esse teto tornado visível. Se sua decisão de roteamento ocasionalmente exige saber o que uma coisa é, a arquitetura maior e não divulgada do Jev está fazendo um trabalho que o adaptador do Kev não consegue.
Latência e o formato de implantação
A latência ponta a ponta documentada do Jev é de 70–500 ms, em comparação com 3–329 segundos para chamadas de LLM de fronteira na própria comparação da TypeSafe, e adicionar perguntas a uma chamada quase não a altera, porque cada pergunta é avaliada em paralelo com base em uma única leitura compartilhada do estado. O Kev-9B em uma H100 ficará na mesma ordem de magnitude para um único forward pass, mas a comparação não é equivalente em nenhuma das direções: um 9B auto-hospedado em uma GPU compartilhada sob carga não tem a mesma latência que um endpoint hospedado, e um endpoint hospedado não é o mesmo que uma máquina no seu próprio rack. O que pode ser dito sem hesitação é que ambos são rápidos o suficiente para uso por turno em um loop de agente, e que a latência do Kev é uma função do hardware que você controla, e não de um nível de serviço que lhe é prometido.
A leitura honesta sobre a reprodução
O simples fato de Kev existir já é evidência sobre Jev, e vale a pena dar nome a isso. Um modelo fechado cujo comportamento pode ser aproximado em cinco dias por US$ 95, por uma pessoa, a partir de pesos-base públicos, está lhe dizendo algo sobre quanto de sua vantagem é arquitetura e quanto vem de dados de treinamento e serving. Não se segue daí que Jev seja fácil de construir — a superfície da API é fácil de copiar, mas a calibração não é. Mas isso significa que o fosso não é a interface, e qualquer pessoa que esteja avaliando Jev para um caminho de produção deve considerar no cálculo a possibilidade de que um ajuste fino de uma base aberta a leve a maior parte do caminho por uma fração do comprometimento.
O que também é o argumento para ainda não apostar um caminho de produção em nenhum dos dois. Se você está avaliando o Jev, a postura sensata é experimentá-lo sem se comprometer com ele — e o OrcaRouter não serve o Jev, porque o modelo da TypeSafe está em acesso antecipado e fala seu próprio formato de requisição. O que nós cobrimos é a metade generativa do fluxo de trabalho no qual esses modelos de decisão se inserem: mais de 200 modelos por trás de uma única chave compatível com OpenAI, ao preço de tabela do provedor repassado com 0% de margem, com failover automático. Uma arquitetura de dois modelos, em que uma camada de decisão barata classifica o tráfego e um modelo generativo cuida do restante, é testável do nosso lado sem um segundo contrato com fornecedor, e se o componente de decisão se revelar mal calibrado nos seus dados, o caminho de failover é o que impede que isso se torne um incidente.
O veredito
Se a sua tarefa de decisão é restrita, de domínio fixo, de grande volume e sensível à privacidade, o Kev é a escolha mais defensável hoje e não é por pouco — você é dono dos pesos, você controla o caminho dos dados, você pode fazer ajuste fino com os seus próprios rótulos e, no encaminhamento de tickets de suporte, o checkpoint de 9B já supera o Jev nos próprios números publicados. Se a sua tarefa de decisão precisa de conhecimento de mundo, aritmética de vários passos ou um valor de confiança com base no qual pretende automatizar, o modelo maior e não divulgado do Jev e o seu treino RLCD estão a fazer trabalho real e o adaptador do Kev não substitui nenhum dos dois.
A única coisa que nenhuma das duas comparações resolve é a calibração, porque ninguém publicou um diagrama de confiabilidade para nenhum dos dois modelos. Teste isso nos seus próprios casos rotulados antes de automatizar com base em qualquer um deles — o valor de confiança é a parte de ambos os produtos que precisa ser conquistada a cada implantação, e a velocidade é a parte que já é uma commodity.

