Um cartão de título gerado para a comparação entre Laya e Kev, trazendo o próprio subtítulo deste artigo e uma linha de rodapé que indica de qual lado os números são informados pelo fornecedor e de qual são de terceiros.
Engineering & Research

Laya vs Kev: Duas Receitas para um Modelo de Decisão Local

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O número mais útil na comparação entre Laya e Kev é um recibo. Jared Palmer treinou a família Kev por cerca de US$ 95 em tempo de H100 no Modal, mais cerca de três centavos de chamadas de API para dados de avaliação, e publicou a receita junto com os pesos. A Convai Innovations seguiu o outro caminho com a Laya: lançada em 18 de setembro de 2026, três dias depois do Jev da TypeSafe AI, Apache 2.0, pesos no Hugging Face, um pip install laya ponto de entrada, e nenhum pipeline de treinamento — um checkpoint de 421M ModernBERT-large em inglês, um de 322M mmBERT-base multilíngue, e um roteador que escolhe entre eles. Kev é uma família de três modelos pequenos, de 0,8B, 4B e 9B, cada um uma base congelada mais um adaptador LoRA de rank 16 e uma pequena cabeça de apontamento. Ambos respondem a perguntas tipadas em um único forward pass e nenhum dos dois gera texto. A decisão entre eles é, na verdade, uma decisão sobre qual artefato você quer possuir: um checkpoint ou uma receita.

O que cada projeto está de fato entregando

Laya oferece inferência. O checkpoint em inglês é um codificador bidirecional com uma janela de 512 tokens; o multilíngue cobre mais de 100 idiomas em uma janela de 1.024 tokens e é cerca de duas vezes mais rápido; o roteador detecta o script em menos de meio milissegundo. Ele responde escolha, pontuação e noul — uma escolha de uma lista, um nível esperado em uma rubrica ordenada, e uma probabilidade calibrada de que uma afirmação seja verdadeira. Há um terceiro checkpoint, laya-typed-decisions, que é o mesmo backbone de 421M ajustado no split de treinamento do benchmark typed-decisions. O próprio model card da Convai traz a frase que deve orientar como você lê cada número da Laya: “Laya é uma base rápida para especializar, não um motor de decisão zero-shot.”

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Kev repository on GitHub, showing the description "tiny Jev-like family of decision models built on top of Qwen3.5 you can train and run on your own", the Apache-2.0 licence, and the Kev-0.8B, Kev-4B and Kev-9B releases.

Kev entrega um método. O repositório documenta o decision-v7: duas épocas sobre 10.000 exemplos extraídos de dez conjuntos de dados públicos, 896 exemplos de política gerados e 1.680 exemplos construídos a partir de 60 estruturas de regras geradas. A head pontua cada opção fornecida em relação ao decide token da pergunta e aplica softmax ao resultado. Como os checkpoints do Qwen3.5 misturam atenção com camadas recorrentes Gated DeltaNet que ignoram máscaras de atenção, cada pergunta é executada como sua própria linha, com o estado compartilhado calculado uma vez e armazenado em cache — é assim que o modelo mantém as perguntas isoladas umas das outras sem pagar por um novo prefill por pergunta. O Kev espelha o contrato público /v1/systemone do TypeSafe, então um cliente SDK do TypeSafe existente pode apontar para um servidor Kev local alterando a URL base. O README afirma que nenhuma saída do Jev foi usada no treinamento.

Os dois modos de falha são diferentes, e essa é a verdadeira história.

Ambos os modelos perdem para Jev nas tarefas que exigem saber coisas, mas perdem de maneiras que exigem mitigações diferentes.

As fraquezas publicadas da Laya dizem respeito à forma da entrada. No benchmark typed-decisions da TypeSafe, Laya obtém 0,362 zero-shot, contra 0,318 para chute aleatório e 0,461 para o baseline da classe majoritária — mais perto do acaso do que da resposta trivial. Acima de aproximadamente vinte opções, o desempenho desmorona: 0,425 no Banking77 contra 0,870 do Jev. É tão sensível à ordem que uma simples inversão da ordem das opções derrubou a acurácia em 13,75 pontos em um teste de terceiros, deixando uma taxa de 42,5% de respostas iguais. E os checkpoints distribuídos chegam com temperaturas inválidas — a biblioteca avisa na importação, o que significa que o número de calibração no cartão, um erro de calibração esperado de 0,466, é o valor que você realmente obtém antes de reajustar. O reajuste por tipo de pergunta o leva a 0,081, mas isso é trabalho que você faz, não trabalho que o download faz. Há uma falha multilíngue publicada que vale a pena ler na íntegra: em scripts não latinos, o checkpoint em inglês é catastroficamente superconfiante, com um exemplo em khmer mostrando 0,000 de acurácia com 0,952 de confiança média.

As fraquezas publicadas do Kev dizem respeito a conhecimento e aritmética. O Kev-9B pontua 0,837 em seu próprio teste bloqueado de novas fontes — 0,832 para o 4B e 0,668 para o 0,8B — e cerca de 0,822 fora do domínio na divisão de dev contra os 0,857 do Jev. A diferença se abre onde conhecimento de mundo é exigido: MMLU cerca de 70% contra 90% do Jev, MMLU-Pro 0,515 contra 0,840, e aritmética de datas com precisão de dia 60% contra 93%. Em um conjunto restrito de roteamento com rótulos fixos, ele vence — uma avaliação de roteamento de tickets de suporte colocou o Kev-9B em 0,952 contra os 0,897 do Jev — mas o autor deixa explícito que esta é a sua própria bancada de testes, que os dados de treinamento do Jev não são divulgados e que, portanto, nenhuma comparação controlada pode ser construída. O Kev também continua excessivamente confiante em novas fontes; definir KEV_TEMPERATURE=2.0 reduziu os erros com alta confiança de 8,7% para 4,4% nos próprios testes do projeto, o que mostra que o padrão não é a configuração segura.

A tradução prática: a falha da Laya é desencadeada pelo seu conjunto de opções e pela formatação do seu prompt, e você a corrige com ajuste fino e reajuste. A falha do Kev é desencadeada por perguntas que precisam de fatos, e você a corrige limitando o escopo do modelo a roteamento e classificação e mantendo as chamadas dependentes de conhecimento em outro lugar. Nenhuma das correções é uma flag de configuração.

O que é preciso para servi-los

• Hardware — Laya: codificadores de 421M/322M, confiáveis em CPU para baixo throughput e abaixo de um gigabyte residente para o porte do MLX em Apple silicon. Kev: 0,8B a 9B, precisando de uma GPU CUDA BF16 para o 9B, com a arquitetura Qwen3.5 exigindo flash-linear-attention em CUDA e ROCm.

• Latência — Laya: 32,8 ms p50 por decisão em uma Tesla T4, 7,2 ms por pergunta com lote 10. Kev: cerca de 300 ms para cinco perguntas digitadas de um modelo 4B em um Mac de 32 GB em bf16, aproximadamente 40 ms em uma H100.

• Tetos — Laya: janela de 512 tokens em inglês, 1.024 multilíngue. Kev: escolha entre 1–255 opções, pontuação entre 2–255 níveis, 384 tokens de estado de treinamento com 8.192 em serviço.

• Servidor — Laya: Python em processo, além de portes comunitários para ONNX, Go e Apple MLX. Kev: um servidor local vinculado a 127.0.0.1 sem autenticação, um SDK npm e adaptadores LangChain e LlamaIndex.

• Licença — Apache 2.0 para ambos.

Duas notas operacionais que não aparecem nos números de destaque. O servidor do Kev é de requisição única e sem autenticação por design — é um sidecar local, não algo que você exponha. E a latência do Mac do Kev é materialmente pior do que a sua latência no H100 porque os kernels rápidos do DeltaNet ainda não existem para o MLX, que é exatamente o tipo de detalhe que transforma uma afirmação de "roda localmente" em uma afirmação de "roda localmente no hardware certo".

A metade generativa do padrão

Ambos estes modelos existem para substituir uma chamada específica: a invocação do LLM que fazias puramente para obter de volta um rótulo ou uma probabilidade. Não substituem as chamadas em que precisas realmente de texto corrido. Um sistema de suporte que usa o Kev-9B para encaminhar um ticket continua a precisar de um modelo para resumir o tópico e redigir a resposta, e esse modelo não vai ser um LoRA de 9B com uma cabeça de ponteiro.

Essa é a lacuna em que o OrcaRouter se encaixa, e não uma alegação de que hospedamos qualquer um dos dois. Nem Laya nem Kev estão na nossa lista de modelos — são pesos que você baixa — e o artigo seria enganoso se sugerisse o contrário. O que está na lista são os mais de 200 modelos generativos por trás de uma única chave compatível com OpenAI a preço de tabela do provedor repassado com 0% de markup. Se você está usando o Kev para decidir em qual de três níveis de sumarização uma requisição se encaixa, ou usando o Laya para avaliar se uma resposta em rascunho é aceitável, o lado generativo de ambos os ciclos é um único endpoint com failover automático, em vez de um segundo contrato e um segundo SDK. A DSL de roteamento é a peça que se encaixa mais naturalmente em uma arquitetura de modelo de decisão: combine um modelo barato e um caro em uma única chamada e deixe a saída do modelo de decisão escolher o ramo.

O que assistir em seguida

A lacuna nas evidências é a mesma para ambos, e não será fechada por nenhum dos dois projetos. Ninguém executou Laya e Kev com entradas idênticas byte a byte, com os mesmos prompts, a mesma ordenação de opções e a mesma varredura de limiar de confiança. As principais vitórias da Laya vêm do seu próprio arcabouço de avaliação; as alegações de quase paridade do Kev vêm do arcabouço de avaliação de seu autor; a auditoria de calibração que constatou que a calibração do Jev variava acentuadamente conforme a tarefa — 44,7% de acurácia e 0,325 de erro de calibração esperado em uma tarefa de prioridade de política oculta — foi de terceiros, e nem Laya nem Kev receberam esse tratamento. Até que alguém o faça, os números acima são os melhores disponíveis e não são comparáveis entre si.

Se está a decidir hoje: escolha o Kev se quiser um modelo de encaminhamento a funcionar esta semana numa GPU que já aluga, e aceite que ele não vai saber coisas. Escolha o Laya se as suas entradas forem multilingues ou se o seu orçamento de hardware for um portátil, e inclua o ajuste fino no orçamento como parte do projeto, em vez de o deixar para uma otimização posterior. De qualquer forma, avalie com os seus próprios dados rotulados antes de colocar um limiar de confiança à frente do tráfego de produção — ambos os projetos, na sua própria documentação, dizem-lhe para o fazer.

A generated two-column scoreboard comparing Laya and Kev across backbone, context window, latency, benchmark accuracy, many-option performance and licence, with a footer reading "Kev figures are the author's own harness; Laya figures per its model card."