Um cartão de título gerado para a comparação Laya-versus-von, contendo o próprio subtítulo deste artigo e uma linha de rodapé indicando de qual lado os números são reportados pelo fornecedor e de qual são de terceiros.
Engineering & Research

Laya vs von: Quando o Benchmark de Fornecedor Não se Transfere

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Uma tarefa de classificação de tipo de commit com seis rótulos possíveis, em que chutar rende 8,3% e o von pontua 26,7%. Uma tarefa de roteamento de arquivos em que o mesmo modelo pontua 8,8%, pouco acima do acaso. Uma tarefa binária de amplitude de mudança com AUC de 0,513, que é um cara ou coroa. Esses números vêm de uma avaliação de terceiros do von — o modelo System One de código aberto da wfzyx, um encoder ModernBERT-Large de 395M lançado sob a licença Apache 2.0 em 18 de setembro de 2026, no mesmo dia que o Laya da Convai Innovations. No próprio benchmark jabr v2 do von, o cenário é o oposto: 71,5% de acurácia macro em 49 tarefas e 869 casos, roteamento de escolha em 83,4%, e um resultado no ViZDoom de 9,38 abates em média em menos de 18 ms contra o Jev da TypeSafe AI, com 5,62 abates e cerca de 115 ms. Os dois conjuntos de números são reais. A distância entre eles é a coisa mais útil que alguém já publicou sobre esta categoria de modelo, e também se aplica ao Laya.

Dois modelos, dois backbones, um modo de falha compartilhado

von e Laya são vizinhos próximos em termos arquiteturais, e é por isso que o problema de transferência é a lente certa para compará-los. Ambos são encoders não autorregressivos construídos sobre o ModernBERT: von com 395M de parâmetros, e o checkpoint em inglês do Laya com 421M. Ambos expõem as mesmas três primitivas — choice a partir de uma lista fornecida, score sobre uma rubrica ordenada, noul como uma probabilidade calibrada de sim — e ambos implementam o /v1/systemone formato de transmissão, de modo que um cliente escrito para o Jev da TypeSafe pode, em vez disso, apontar para um servidor local. Ambos são Apache 2.0. Ambos retornam probabilidades em vez de texto, e nenhum tem um loop de decodificação no qual alucinar.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

As diferenças estão na história de treinamento. von foi pré-treinado em 2 trilhões de tokens de texto geral da web, literatura técnica e código, e depois ajustado em um corpus multidomínio balanceado de aproximadamente 290.000 exemplos, abrangendo fluxos de trabalho operacionais e corporativos, segurança e DevOps, segurança e moderação de políticas, linguística, triagem e raciocínio adversarial. O pós-treinamento usou aprendizado por reforço com distribuição de calibração, minimizando um composto de entropia cruzada e escore de Brier com lambda em 0,5, e o escalonamento de temperatura convergiu em T=1,1692. O checkpoint em inglês da Laya é o ModernBERT-large ajustado para o formato de decisão tipada, com uma janela de 512 tokens, ao lado de um checkpoint multilíngue mmBERT-base de 322M que cobre mais de 100 idiomas atrás de um roteador, e um p50 publicado de 32,8 ms por decisão em uma Tesla T4.

O modo de falha compartilhado é que ambos são encoders treinados para produzir uma leitura, não raciocinadores. O próprio README da von é explícito ao dizer que ela se destina a pipelines sensíveis à latência, nos quais modelos autorregressivos introduzem 500–2,000 ms de atraso e erros não determinísticos de análise de esquema. Esse enquadramento diz para que serve: classificação rápida, determinística e estatisticamente calibrada. Ele não diz que funcionará na sua classificação, e o benchmark independente é o que acontece quando alguém verifica.

Lendo honestamente o benchmark do próprio von

Os resultados do jabr v2 são publicados pelo proprietário e não foram auditados de forma independente, e o formato do benchmark importa tanto quanto a pontuação. Quarenta e nove tarefas e 869 casos é uma amplitude razoável para uma avaliação de modelo de decisão, e 71,5% de precisão macro é um número forte para um encoder de 395M. O detalhamento por domínio é onde fica informativo: triagem de sintomas em 100,0%, serviços domésticos em 95,7%, roteamento urbano em 94,7%, roteamento de escolha em geral em 83,4%. Essas são as tarefas em torno das quais o corpus de treinamento foi construído — o README descreve os dados de fine-tuning como fluxos de trabalho operacionais e empresariais, segurança e DevOps, segurança e moderação de políticas, linguística, triagem e raciocínio adversarial. Uma pontuação alta em triagem de sintomas é uma afirmação de que o modelo aprendeu o domínio de triagem, não que aprendeu a classificar.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

O resultado do ViZDoom é o mais citado, e merece uma leitura atenta. Média de 9,38 abates em "Defend the Center", oito sementes, zero-shot a partir de texto estruturado de cena, com latência abaixo de 18 ms, contra os 5,62 abates do Jev a cerca de 115 ms — uma melhoria de +66,9%. É um resultado impressionante e também é um ambiente de jogo movido por texto estruturado, no qual uma política reflexiva rápida tem exatamente o formato certo. O enquadramento do projeto para o paradigma System One — reflexivo, paralelo, determinístico, estatisticamente calibrado — é uma descrição justa daquilo que essa tarefa recompensa.

Então a avaliação de terceiros testou o von na classificação de tipos de commit, no roteamento de arquivos, na detecção de funcionalidades e na pontuação de amplitude de mudanças, e ele perdeu para baselines de palavras-chave e regex em alguns desses itens. Uma AUC de 0,513 na tarefa binária é o número mais contundente: um cara ou coroa, de um modelo cuja calibração foi ajustada para T=1,1692 e cujo README afirma erro de calibração esperado quase ideal. As duas coisas podem ser verdade. Um modelo pode estar bem calibrado na distribuição em que foi treinado e ser inútil em uma distribuição que nunca viu — e, de fato, uma boa calibração na distribuição errada é pior do que uma calibração obviamente ruim, porque os números de confiança parecem confiáveis.

O mesmo teste aplicado à Laya

A Laya passou por uma versão desse tratamento, e os resultados são consistentes com os de von. No benchmark typed-decisions da TypeSafe, a Laya pontua 0,362 zero-shot contra 0,318 para aleatório e 0,461 para a baseline da classe majoritária — mais próxima do acaso do que da resposta trivial. O próprio model card dela declara a conclusão: "A Laya é uma base rápida para especializar, não um motor de decisão zero-shot." Depois de aproximadamente vinte opções, ela se degrada acentuadamente, pontuando 0,425 no Banking77 contra os 0,870 de Jev. Em 100 mensagens de urgência do Mars-base em um teste de terceiros, Jev marcou 100/100 e Laya 53/100. Em um benchmark de agente de navegador, ela concluiu 0 de 50 tarefas, declarando que havia concluído prematuramente em 33 tentativas, 17 delas antes de tomar qualquer ação — embora os autores do benchmark observem que ela foi treinada para trabalho de julgamento, como tickets de suporte e faturas, e não para navegação, o que é uma declaração de escopo, e não um veredito.

No que a Laya difere da von é naquilo que ela reivindica para si. A Convai publicou no card o número zero-shot pouco lisonjeiro e o erro de calibração esperado de 0,466, ao lado do 0,081 que o reajuste de temperatura por tipo de pergunta produz. O README da von publica o número lisonjeiro do jabr v2 e a vitória no ViZDoom. Ambos os projetos são honestos quanto ao que fizeram; apenas um deles abre com um benchmark em que o modelo se sai mal. Isso é uma observação sobre fontes, não uma acusação — mas, se você está escolhendo entre os dois com base em evidências publicadas, note que está comparando um projeto que lhe mostrou seu número fraco com outro cujo número fraco você teve de procurar em outro lugar.

O contraste da especificação, dimensão por dimensão

• Backbone — Laya: ModernBERT-large 421M inglês, mmBERT-base 322M multilíngue. de: ModernBERT-Large 395M.

• Idiomas — Laya: 100+ via o checkpoint multilíngue e um roteador. von: inglês, sem checkpoint multilíngue publicado.

• Janela de contexto — Laya: 512 tokens em inglês, 1.024 em multilíngue. von: não publicado nos mesmos termos; os casos jabr v2 são decisões curtas e estruturadas.

• Latência — Laya: 32,8 ms p50 em uma T4, 7,2 ms por pergunta em lote de 10. von: alegado de menos de 15 ms a menos de 25 ms, menos de 18 ms na execução do ViZDoom.

• Acurácia relatada — Laya: 0,362 zero-shot, 0,766 com fine-tuning na divisão do próprio benchmark, 0,425 no Banking77. von: 71,5% de macro nas 49 tarefas do jabr v2, 83,4% de roteamento por escolha e 26,7% em tipo de commit em um teste independente.

• Calibração — Laya: ECE 0,466 na versão entregue, 0,081 após reajuste de temperatura por tipo de pergunta. von: temperatura escalada para T=1,1692 durante o pós-treinamento do RLCD, alegou ECE quase ideal na própria distribuição.

• Serviço — Laya: pip install laya, além de portes comunitários para ONNX, Go e Apple MLX. von: SDKs em Python e TypeScript, um servidor HTTP via von serve, predefinições pré-empacotadas para triagem de tickets, segurança de e-mail, moderação e triagem de eventos de segurança.

• Hardware — Laya: CPU, CUDA e Apple MPS. de: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS e CPU multithread.

• Licença — Apache 2.0 para ambos.

A parte de von que é genuinamente distintiva

Os padrões componíveis da von são a coisa menos discutida em seu repositório. O controle por confiança, o despacho de rotas, a pontuação composta e o roteamento em dois estágios são disponibilizados como padrões nomeados junto com os presets — triagem de tickets, segurança de e-mail, moderação, triagem de eventos de segurança — e codificam a arquitetura de que um modelo de decisão realmente precisa em produção. Uma única chamada de escolha raramente é o sistema inteiro; a forma útil é um roteador de primeiro estágio barato que despacha para um segundo estágio especializado, com um portão de confiança que escala os casos incertos. A von disponibiliza isso como um padrão documentado, em vez de deixar isso por sua conta.

Isso corresponde exatamente ao que o OrcaRouter faz no lado generativo, o que vale dizer com clareza porque as duas metades do padrão costumam ser construídas por equipes diferentes. Nem von nem Laya estão hospedados no OrcaRouter — ambos são pesos que você baixa e executa — e nada aqui deve ser lido como uma afirmação de que nós os servimos. O que está na nossa lista é a outra metade: mais de 200 modelos generativos por trás de uma única chave compatível com a OpenAI a preço de tabela do provedor repassado com 0% de markup, de modo que um corte de preço do fornecedor chega à sua fatura no mesmo dia, e não na renovação. Se o gate de confiança do von decidir que 4% das requisições precisam de um modelo de fronteira, o DSL de roteamento é o que compõe essa decisão em uma única chamada, em vez de dois contratos e dois SDKs, e o failover automático é o que impede que o ramo caro se torne um ponto único de falha.

O que fazer com dois modelos que ambos falham fora de sua distribuição de treinamento

A conclusão prática da avaliação do von não é que o von seja um modelo ruim. É que a precisão publicada de um modelo de decisão é uma afirmação sobre sua distribuição de treinamento, e a única maneira de saber se o seu problema está dentro dessa distribuição é testá-lo. A própria tabela de benchmark do README do von compara-o com o GLiNER2, um Qwen3.5 4B ajustado, o Laya e o Jev da TypeSafe em tamanho, precisão, latência e hospedagem — o que é uma tabela útil, e também uma tabela em que todas as entradas de precisão, exceto uma, vêm do próprio harness do autor.

Entre os dois: escolha o von se quiser um conjunto mais amplo de domínios publicados, uma pegada ligeiramente menor, padrões de serviço pré-construídos para triagem e moderação, e a evidência do ViZDoom de que lida bem com decisões rápidas em texto estruturado. Escolha a Laya se precisar de entrada multilíngue — o von não tem checkpoint multilíngue e a variante mmBERT de 322M da Laya cobre mais de 100 idiomas — ou se um valor de 32,8 ms numa T4 e uma janela de 512 tokens em inglês se adequarem à sua carga de trabalho. Não escolha nenhum dos dois sem passar uma tarde a rotular algumas centenas de exemplos do seu próprio tráfego e a executar ambos contra eles. A documentação de ambos os projetos aponta para esse teste, e o resultado de terceiros do von é o que acontece quando ninguém o executa.

A única coisa que mudaria esta comparação é uma avaliação emparelhada sobre entradas idênticas, com um diagrama de confiabilidade para cada modelo. Ela não existe. Até que exista, a classificação honesta é pela qualidade da evidência, e não pela pontuação: Laya publicou seu pior número, von publicou seu melhor, e o teste independente de von é o mais próximo que qualquer um dos dois tem de uma verificação externa.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."