Uma cartela de título gerada com os dizeres "Jev vs Laya", acima do subtítulo "33 milissegundos em uma T4 e uma linha de base aleatória", contrastando Jev (fechado, hospedado, mecanismo de decisão zero-shot, 0,727) com Laya (Apache 2.0, ModernBERT de 421M, executa localmente, 0,362 zero-shot).
Engineering & Research

Jev vs Laya: 33 Milissegundos em um T4, e uma Linha de Base Aleatória

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O cartão de modelo da Laya contém a frase que decide esta comparação, e foi escrita pelas pessoas que criaram a Laya. "A Laya é uma base rápida para especializar, não um motor de decisão zero-shot." A Convai Innovations lançou a Laya em 18 de setembro de 2026, três dias depois de a TypeSafe AI lançar a Jev, sob a Apache 2.0, com pesos no Hugging Face e um ponto de entrada pip install laya. Ela responde a perguntas tipadas numa única passagem direta, sem descodificação token a token, que é a mesma aposta arquitetural que a Jev faz. A alegação principal é uma latência p50 de 32,8 milissegundos por decisão numa Tesla T4, apresentada como cerca de 7,8 vezes mais rápida do que os 236–276ms p50 publicados da Jev através da sua API alojada. A alegação é real e também está a medir duas coisas diferentes — uma GPU local contra uma chamada de rede — e o panorama de precisão subjacente é a parte que deve determinar se a descarrega. Em zero-shot, a Laya obtém 0,362 no benchmark de decisões tipadas da TypeSafe. O palpite aleatório obtém 0,318. A linha de base da classe maioritária obtém 0,461. A Laya, tal como vem de fábrica, está mais próxima do aleatório do que da linha de base trivial.

O que Laya realmente é

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability per answer, free output, and the roughly 32,000-token request budget.

Laya vem como dois checkpoints por trás de um roteador integrado que encaminha cada entrada para o correto. O checkpoint em inglês é o ModernBERT-large, com 421M parâmetros e contexto de 512 tokens. A variante multilíngue é o mmBERT-base, com 322M parâmetros e uma janela de 1.024 tokens em mais de 100 idiomas. Ambos são não autorregressivos: uma única passada forward retorna a resposta, então não há loop de decodificação, nem JSON para analisar, nem espaço no qual emitir texto fora do tipo declarado. Essa última propriedade é a mesma garantia estrutural que o Jev oferece, alcançada a partir de uma direção diferente, e é genuinamente valiosa para qualquer pessoa que já tenha escrito lógica de retentativa em torno de um modelo que ocasionalmente esquece de fechar uma chave.

Jev é a contraparte fechada: o primeiro modelo System One da TypeSafe AI, lançado em 15 de setembro de 2026, hospedado e em acesso antecipado, com três primitivas tipadas — Choice, a partir de uma lista fornecida por você; Score, em uma rubrica ordenada; e Noul, uma afirmação de sim/não com probabilidade calibrada. Todas as perguntas são avaliadas em paralelo em relação a uma leitura compartilhada do estado, a saída é gratuita porque não há tokens de saída, e a entrada custa US$ 0,042 por milhão de tokens. Sua arquitetura, contagem de parâmetros e computação de treinamento não são divulgadas, e a TypeSafe disse que os detalhes estão sendo mantidos em segredo, com um artigo possivelmente mais tarde.

A alegação de latência, medida corretamente

O p50 de 32,8 ms da Laya em uma T4 é um número real e um bom número. É na comparação de 7,8x com os 236–276 ms da Jev que é preciso cuidado, e a própria ficha da Laya é incomumente honesta sobre o motivo: os números da Jev são dados publicados por terceiros que a Convai nunca mediu por conta própria, e a comparação coloca uma passagem direta local em GPU contra uma chamada a uma API hospedada que inclui ida e volta pela rede e enfileiramento. Tire a rede da equação e a comparação arquitetural fica entre dois modelos de passagem única, um com 421M de parâmetros e outro com um tamanho não divulgado que a TypeSafe nunca publicou.

Há também um número de processamento em lote que vale a pena conhecer: em um lote de dez, a Laya reporta 7,2 ms por pergunta. Essa é a forma do produto. A Laya foi criada para ser executada localmente em escala, e portes comunitários no dispositivo, como o laya-mlx, estendem isso ao Apple Silicon. Alegações virais de "50x mais rápido que o Jev" não são respaldadas pelos benchmarks publicados do próprio projeto, e o enquadramento honesto é uma grande lacuna entre local e nuvem que é em parte arquitetural e em parte apenas a diferença entre a sua GPU e a API de outra pessoa.

O que os números de precisão dizem, em ordem

É aqui que a comparação deixa de ser lisonjeira, e vale a pena expô-la em sequência porque a ordem importa.

• Zero-shot no benchmark typed-decisions da TypeSafe — Laya 0,362, aleatório 0,318, classe majoritária 0,461, Jev 0,727. Laya está acima do acaso e abaixo da linha de base trivial.

• Com ajuste fino na própria divisão de treino do benchmark — Laya 0,766 contra 0,727 de Jev. Laya vence, e a vitória vem de um checkpoint que já viu os dados de treino do benchmark, o que faz disso uma afirmação sobre ajuste fino, não sobre o modelo base.

• Classificação de intenção do Banking77, em que o conjunto de opções é grande — Laya 0,425 contra os 0,870 de Jev. A Laya degrada-se acentuadamente após cerca de 20 opções, e os campos Choice de Jev estão documentados para lidar com até 255 antes que o padrão de pontuação em dois estágios seja necessário.

• Calibração — Laya vem com um erro de calibração esperado médio de 0,466, melhorando para 0,081 somente após reajuste de temperatura por tipo de pergunta. Jev é treinado com um método que a TypeSafe chama de RLCD, Reinforcement Learning for Calibrated Decisions, e entrega cada resposta com uma distribuição de probabilidade — embora a TypeSafe também oriente os usuários a validar limiares em seus próprios dados rotulados, e uma auditoria independente tenha constatado que a calibração do Jev varia drasticamente conforme a tarefa.

O padrão é inequívoco. Laya é uma base forte para ajuste fino e um motor de decisão zero-shot fraco, e ela mesma diz isso. Jev é um motor de decisão zero-shot forte cuja calibração ainda precisa ser verificada a cada implantação. São produtos diferentes com estruturas de preço diferentes, e escolher entre eles é, em grande parte, uma questão de saber se você tem dados rotulados e um ciclo de treinamento.

A aritmética de custos não tem o mesmo formato que a de Jev

Jev custa US$ 0,042 por milhão de tokens de entrada, com saída gratuita, o que equivale a US$ 42 por bilhão, e uma chamada de tamanho máximo dentro do orçamento documentado de ~32.000 tokens por requisição custa bem menos de um centavo. O teste independente da Every submeteu 777 julgamentos em 37 documentos a aproximadamente um quarto de centavo.

O custo por chamada da Laya é zero na margem e não nulo no agregado, e o agregado não é pequeno. Um modelo de 421 M de parâmetros numa T4 é barato de executar e ainda assim custa uma GPU, e a etapa de fine-tuning que torna a Laya competitiva é onde está o gasto real — a rotulagem de dados, a execução de treino, a estrutura de avaliação e o reajuste de temperatura por tipo de pergunta, que faz o erro de calibração passar de 0,466 para 0,081. Para uma taxonomia fixa que nunca muda, esse é um custo único que se paga em volume. Para uma taxonomia que sofre deriva, é um custo recorrente, e a linha de base zero-shot do Jev, de 0,727, torna-se um negócio muito melhor.

Há um terceiro custo fácil de ignorar: o checkpoint em inglês da Laya tem uma janela de contexto de 512 tokens. Isso não é um modelo de decisão com um orçamento de contexto pequeno — é um modelo de decisão dimensionado para um parágrafo. O orçamento de requisição de aproximadamente 32.000 tokens do Jev é sessenta vezes maior, e mesmo assim está uma ordem de magnitude abaixo dos modelos generativos com os quais ambos são comparados em preço. Se o seu estado for uma thread de suporte em vez de uma mensagem de suporte, a janela de nenhum dos modelos é a restrição em relação à qual você deveria estar otimizando.

A questão da implantação é a verdadeira diferença

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window and the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 on a T4, and the pip install entry point.

O argumento mais forte da Laya não é a latência. É que pesos sob Apache 2.0 no Hugging Face significam que a decisão nunca sai da sua infraestrutura e o endpoint nunca tem limite de taxa. Para uma decisão de roteamento feita com base em um registro médico, um documento jurídico ou o histórico de conta de um cliente, isso não é uma preferência — é o fator decisivo, e nenhum endpoint hospedado, a qualquer preço, vence esse argumento. O Jev da TypeSafe está em acesso antecipado e com lista de espera, e a própria documentação dele observa que os limites de taxa podem mudar sem aviso.

O contra-argumento é aquilo de que você abre mão. A arquitetura maior não divulgada de Jev está fazendo o trabalho que os 421M parâmetros da Laya não conseguem: a lacuna zero-shot de 0,727 contra 0,362 e a lacuna do Banking77 de 0,870 contra 0,425 são ambas medidas de quanto conhecimento existe dentro do modelo antes de você treiná-lo. A resposta da Laya é que você mesmo fornece esse conhecimento por meio de fine-tuning e, em um domínio fixo e estreito, essa resposta funciona — o resultado de 0,766 com fine-tuning é a prova.

Onde a camada de decisão se situa em uma stack real

Nenhum dos modelos gera texto, portanto nenhum deles é o todo de qualquer fluxo de trabalho. O padrão para o qual ambos foram concebidos é de dois modelos: uma camada de decisão que faz a chamada tipada e um modelo generativo que cuida da parte que precisa de prosa, código ou explicação. O OrcaRouter não serve o Jev nem o Laya — o Jev é o endpoint de acesso antecipado da TypeSafe e o Laya são pesos que você mesmo executa —, mas a metade generativa desse padrão é exatamente o que cobrimos: mais de 200 modelos por trás de uma única chave compatível com a OpenAI, ao preço de tabela do fornecedor repassado com 0% de margem, de modo que uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia. A arquitetura de dois modelos é testável sem um segundo contrato com fornecedor e, com failover automático, o caminho generativo não se torna um ponto único de falha enquanto você decide se a camada de decisão barata está calibrada o suficiente para automatizar com base nela.

O veredito

Se você tem uma taxonomia fixa e estreita, exemplos rotulados e um requisito de privacidade ou latência que exclui uma API hospedada, a Laya é a escolha mais defensável e os números do ajuste fino a apoiam. Se você precisa que a decisão funcione sem configuração, se os seus conjuntos de opções ultrapassarem vinte categorias, ou se o estado for maior que um parágrafo, o próprio cartão de modelo da Laya diz que ela não é o produto para essa tarefa — e a pontuação zero-shot de 0,362 contra uma linha de base de maioria de 0,461 é o número a ter em vista quando alguém lhe apresentar o valor de latência de 7,8x.

O que os dois têm em comum é mais útil do que o que os separa. Ambos eliminam a classe de erro que vem da formatação da saída e não fazem nada quanto à classe que vem do julgamento. Ambos entregam probabilidades, e nenhum dos dois tem um diagrama de confiabilidade publicado em que você possa confiar sem verificar. Teste a calibração nos seus próprios casos rotulados antes de automatizar com base em qualquer um dos dois — a latência já está comoditizada e o valor de confiança é a parte que precisa ser conquistada em cada implantação.

A generated two-column scoreboard comparing Jev and Laya across the same six labelled dimensions, with a footer reading "Laya zero-shot vs random 0.318 and majority baseline 0.461; per Laya's own model card."