Um cartão de título gerado com o texto "Jev vs Kev" sobre o subtítulo "Um ajuste fino de US$ 95 que supera o Jev em tickets de suporte", contrastando o Jev (fechado, hospedado, arquitetura não divulgada, US$ 0,042 por milhão de tokens de entrada, saída gratuita) contra o Kev (Apache 2.0, base Qwen3.5, 0,8B a 9B, cerca de US$ 95 em tempo de H100).
Engineering & Research

Jev vs Kev: um fine-tune de $95 que supera Jev em tickets de suporte

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Jared Palmer lançou o Kev em 20 de setembro de 2026, cinco dias depois de a TypeSafe AI lançar o Jev, e o número importante não está na tabela de benchmarks. Está no README: a coisa toda custou cerca de $95 em tempo de H100 na Modal, mais três centavos de chamadas à API do Jev usadas para gerar dados de avaliação. O Kev é Apache-2.0, auto-hospedável e vem em três tamanhos construídos sobre os pesos base do Qwen3.5 — aproximadamente 0,8B, 4B e 9B — com um adaptador LoRA de rank 16 e uma cabeça de ponteiro acoplada a uma base congelada, em vez de um modelo de decisão criado do zero. Ele espelha exatamente a API de decisão tipada do Jev: Choice, Score e Noul, próximos o suficiente para serem compatíveis com o próprio SDK Python da TypeSafe. O Jev, por sua vez, foi lançado em 15 de setembro de 2026 como o modelo System One fechado e hospedado da TypeSafe AI, retorna respostas tipadas com confiança calibrada e nenhum texto, e nunca publicou sua arquitetura, contagem de parâmetros, computação de treinamento ou pesos. A comparação, portanto, não é realmente uma comparação de modelos. É um teste de quanto do valor do Jev sobrevive ao ser reproduzido em uma tarde pelo preço de um laptop usado.

O que os benchmarks realmente dizem

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability returned with every answer, free output, and the roughly 32,000-token request budget with a 255-option Choice cap.

A manchete é que Kev chega perto e, numa tarefa estreita, vence. No conjunto de teste travado de novas fontes do Kev, Kev-9B marcou 0,837 contra 0,857 do Jev. No roteamento de tickets de suporte em 900 tickets — o conjunto scienthoon —, Kev-9B marcou 0,952 contra 0,897 do Jev, que é o único resultado publicado em que a reprodução aberta supera o modelo que reproduz. Kev também fica ligeiramente à frente em algumas tarefas de reconhecimento lógico. Nos conjuntos de decisão SemiF, um conjunto estruturado de 144 perguntas, Jev leva por 0,965 a 0,917 do Kev-9B.

Quando Kev perde, perde feio. Acurácia fora do domínio: Kev-8B com 79,6% contra os 85,7% do Jev. MMLU: 70% contra 90%. MMLU-Pro: 0,515 contra 0,840. Aritmética de datas com precisão de dia: 60% contra 93%. O padrão é consistente — Kev é competitivo em roteamento e classificação restritos, onde o conjunto de rótulos é pequeno e o domínio é fixo, e desmorona em qualquer coisa que precise de conhecimento de mundo ou aritmética de múltiplas etapas, porque um adaptador de rank 16 sobre um modelo base pequeno congelado não é onde mora o conhecimento de mundo.

Cada um desses números vem do próprio harness do Kev ou de rastreadores de terceiros, e o README do Palmer diz claramente que não se trata de uma comparação controlada — os dados de treinamento do Jev não são divulgados, então não há como construir uma. O README também afirma que nenhuma saída do Jev foi usada para treinamento. Ambas as ressalvas são do tipo que tornam os números mais confiáveis, e não menos: quem publica a comparação é justamente quem está dizendo o que ela não pode provar.

O que você recebe por $95 que não consegue obter do Jev a nenhum preço

A screenshot of the Kev repository page for jaredpalmer/kev, showing the Apache-2.0 licence, the Qwen3.5 base weights, the rank-16 LoRA and pointer-head recipe, the about-$95 H100 training cost, and the README statement that no Jev outputs were used for training.

A comparação de custos é onde os dois produtos deixam de ser comparáveis por completo. O Jev custa US$ 0,042 por milhão de tokens de entrada, com saída gratuita, o que é barato de uma forma genuinamente difícil de superar numa base por chamada — mas é uma API hospedada, de acesso antecipado, com lista de espera, e a TypeSafe afirmou que os limites de taxa podem mudar sem aviso. O Kev são pesos que você baixa. O custo marginal da décima milionésima classificação é a sua própria energia elétrica.

Quatro coisas decorrem disso, e nenhuma delas diz respeito a pontuações de benchmark.

• Nenhum dado sai da sua infraestrutura. O Jev é um endpoint hospedado; cada estado que você envia a ele — o ticket de suporte, a linha de log, o registro médico — vai para a TypeSafe. O Kev executa na sua própria GPU, o que, para cargas de trabalho reguladas, não é uma preferência, mas o fator decisivo.

• Sem limites de taxa, sem lista de espera, sem risco de descontinuação. A própria documentação da TypeSafe observa que os limites de taxa podem mudar sem aviso prévio. Um checkpoint local não tem essa cláusula.

• Você pode ajustá-lo. Kev é uma base para especialização, e a receita LoRA que o produziu é pública. Se sua taxonomia de roteamento tem 40 classes que nenhum modelo geral lida bem, você pode treinar com seus próprios rótulos — que é exatamente o que Palmer fez, a um custo medido em dezenas de dólares, em vez de em uma equipe de ML.

• O teto de contexto cabe a você mudar. O orçamento de requisições documentado do Jev é de aproximadamente 32.000 tokens, e os campos Choice têm limite de 255 opções. Kev herda a janela do Qwen3.5, que é muito maior, e o limite de opções é um detalhe de implementação da sua própria pilha de serving, e não um limite do fornecedor.

O que o Jev ainda tem que o Kev não tem

A alegação de calibração é a que não se transfere de forma limpa, e é o cerne do argumento de venda da TypeSafe. O Jev é treinado com um método que a TypeSafe chama de RLCD — Reinforcement Learning for Calibrated Decisions —, que otimiza para que o valor de confiança seja honesto, em vez de otimizar para que a resposta seja preferida. Toda resposta do Jev vem com uma distribuição de probabilidade sobre as opções, para que seu código possa definir limites: agir automaticamente na faixa superior, sinalizar na intermediária e escalar na inferior.

Kev produz a mesma forma tipada e as mesmas saídas de probabilidade, porque a API é deliberadamente compatível. Se essas probabilidades estão calibradas é uma questão diferente, e a resposta honesta é que ninguém publicou um diagrama de confiabilidade para nenhum dos dois modelos. Uma auditoria de calibração separada relatou que o Jev obteve 44,7% de precisão com um erro de calibração esperado de 0,325 em uma tarefa de prioridade de política oculta, o que sugere que a calibração do Jev varia acentuadamente conforme a tarefa, em vez de ser uma propriedade universal — e a própria TypeSafe diz aos usuários para testarem limites de confiança com seus próprios exemplos rotulados, em vez de confiarem no comportamento publicado.

A outra coisa que o Jev tem é que ele não foi treinado no Qwen3.5. Um modelo de 9B com um adaptador de rank 16 tem um teto de conhecimento, e a lacuna no MMLU-Pro de 0,515 contra 0,840 é esse teto tornado visível. Se sua decisão de roteamento ocasionalmente exige saber o que uma coisa é, a arquitetura maior e não divulgada do Jev está fazendo um trabalho que o adaptador do Kev não consegue.

Latência e o formato de implantação

A latência ponta a ponta documentada do Jev é de 70–500 ms, em comparação com 3–329 segundos para chamadas de LLM de fronteira na própria comparação da TypeSafe, e adicionar perguntas a uma chamada quase não a altera, porque cada pergunta é avaliada em paralelo com base em uma única leitura compartilhada do estado. O Kev-9B em uma H100 ficará na mesma ordem de magnitude para um único forward pass, mas a comparação não é equivalente em nenhuma das direções: um 9B auto-hospedado em uma GPU compartilhada sob carga não tem a mesma latência que um endpoint hospedado, e um endpoint hospedado não é o mesmo que uma máquina no seu próprio rack. O que pode ser dito sem hesitação é que ambos são rápidos o suficiente para uso por turno em um loop de agente, e que a latência do Kev é uma função do hardware que você controla, e não de um nível de serviço que lhe é prometido.

A leitura honesta sobre a reprodução

O simples fato de Kev existir já é evidência sobre Jev, e vale a pena dar nome a isso. Um modelo fechado cujo comportamento pode ser aproximado em cinco dias por US$ 95, por uma pessoa, a partir de pesos-base públicos, está lhe dizendo algo sobre quanto de sua vantagem é arquitetura e quanto vem de dados de treinamento e serving. Não se segue daí que Jev seja fácil de construir — a superfície da API é fácil de copiar, mas a calibração não é. Mas isso significa que o fosso não é a interface, e qualquer pessoa que esteja avaliando Jev para um caminho de produção deve considerar no cálculo a possibilidade de que um ajuste fino de uma base aberta a leve a maior parte do caminho por uma fração do comprometimento.

O que também é o argumento para ainda não apostar um caminho de produção em nenhum dos dois. Se você está avaliando o Jev, a postura sensata é experimentá-lo sem se comprometer com ele — e o OrcaRouter não serve o Jev, porque o modelo da TypeSafe está em acesso antecipado e fala seu próprio formato de requisição. O que nós cobrimos é a metade generativa do fluxo de trabalho no qual esses modelos de decisão se inserem: mais de 200 modelos por trás de uma única chave compatível com OpenAI, ao preço de tabela do provedor repassado com 0% de margem, com failover automático. Uma arquitetura de dois modelos, em que uma camada de decisão barata classifica o tráfego e um modelo generativo cuida do restante, é testável do nosso lado sem um segundo contrato com fornecedor, e se o componente de decisão se revelar mal calibrado nos seus dados, o caminho de failover é o que impede que isso se torne um incidente.

O veredito

Se a sua tarefa de decisão é restrita, de domínio fixo, de grande volume e sensível à privacidade, o Kev é a escolha mais defensável hoje e não é por pouco — você é dono dos pesos, você controla o caminho dos dados, você pode fazer ajuste fino com os seus próprios rótulos e, no encaminhamento de tickets de suporte, o checkpoint de 9B já supera o Jev nos próprios números publicados. Se a sua tarefa de decisão precisa de conhecimento de mundo, aritmética de vários passos ou um valor de confiança com base no qual pretende automatizar, o modelo maior e não divulgado do Jev e o seu treino RLCD estão a fazer trabalho real e o adaptador do Kev não substitui nenhum dos dois.

A única coisa que nenhuma das duas comparações resolve é a calibração, porque ninguém publicou um diagrama de confiabilidade para nenhum dos dois modelos. Teste isso nos seus próprios casos rotulados antes de automatizar com base em qualquer um deles — o valor de confiança é a parte de ambos os produtos que precisa ser conquistada a cada implantação, e a velocidade é a parte que já é uma commodity.

A generated two-column scoreboard comparing Jev and Kev across the same six labelled dimensions, with a footer reading "Kev figures per its own README and harness; not a controlled comparison."