
Laya vs Nimble: Dados Contrastivos Versus um Codificador Mais Rápido
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Laya e Nimble são os dois modelos de decisão de pesos abertos cujos autores fizeram mais para explicar como foram construídos, e suas explicações divergem sobre onde reside a dificuldade. A Convai Innovations lançou o Laya em 18 de setembro de 2026 sob a licença Apache 2.0 — um checkpoint em inglês de 421M do ModernBERT-large, um checkpoint multilíngue de 322M do mmBERT-base cobrindo mais de 100 idiomas, um roteador de menos de um milissegundo entre eles e um p50 publicado de 32,8 ms por decisão em uma Tesla T4. A Bespoke Labs criou o Nimble como um fine-tune LoRA sobre o Qwen3.5-9B, Apache 2.0, e o descreve como "o Jev de código aberto" — inspirado no Jev da TypeSafe AI, mas sem usar nem seus pesos, nem sua arquitetura, nem uma destilação de suas saídas. A resposta da Convai ao problema de acurácia é a velocidade e uma base ajustável por fine-tuning. A resposta da Bespoke são os dados de treinamento. Essa diferença merece mais atenção do que a lacuna de três pontos de acurácia que aparece nas tabelas de destaque.
A afirmação que cada projeto está de fato fazendo
A afirmação da Laya é arquitetural. Ela é não autorregressiva no sentido estrito — um codificador bidirecional, sem loop de decodificação, sem JSON para analisar, sem espaço no qual emitir texto fora do tipo declarado. Essa garantia estrutural é a mesma que a Jev oferece, alcançada a partir de uma direção diferente, e é genuinamente valiosa para qualquer pessoa que já tenha escrito lógica de retentativas em torno de um modelo que ocasionalmente esquece de fechar uma chave. O custo é que um codificador de 421M com uma janela de 512 tokens e sem pré-treinamento generativo por trás não sabe muito. A Convai diz isso no cartão do modelo: "A Laya é uma base rápida para especializar, não um mecanismo de decisão zero-shot."


A afirmação da Nimble é sobre os dados. O método da Bespoke é a curadoria contrastiva, adaptada do trabalho anterior da equipe com o Bespoke-MiniCheck: escrever dois exemplos quase idênticos que diferem em um “fato focal”, de modo que o rótulo correto se inverta. O pipeline tem quatro etapas declaradas — verificar se as regras de decisão poderiam genuinamente levar a respostas diferentes, construir o par alterando no máximo oito palavras, verificar ambos os exemplos com chamadas separadas ao modelo, além de uma checagem de remoção de cada frase, e gerar rótulos em código, mantendo apenas os pares cujos rótulos de fato diferem. O objetivo não são mais exemplos, mas exemplos mais incisivos: forçar o modelo a aprender quais evidências devem mudar a decisão. Essa é uma teoria diferente de por que pequenos modelos de decisão falham, e é mais interessante do que mais um ponto de acurácia.
O que os números publicados realmente sustentam
A Nimble relata 90,12% de concordância com rótulos de referência em 324 amostras reservadas, em comparação com 93,21% para o Jev, 66,36% para o Qwen3.5-9B base sem ajuste fino e 84,88% para um Qwen3.8 de 27B sem ajuste fino. Ela relata aproximadamente 106 ms de mediana em uma H100 e 444 ms de mediana em um M5 Pro com 64 GB. Esses são números do próprio arcabouço de avaliação da Bespoke. O conjunto de avaliação de 324 amostras é a parte a ser ponderada com cuidado, e o próprio projeto explica o motivo: as amostras abrangem seis das dez famílias de origem de treinamento, foram geradas e validadas por modelos sem revisão humana, e a generalização para categorias não vistas, portanto, não está comprovada. Quando um modelo é treinado com um método de curadoria de dados e depois avaliado em uma divisão reservada dessa mesma distribuição curada, o número de acurácia é uma afirmação sobre a consistência interna do método, não sobre o seu tráfego.
Os números da Laya vêm do outro extremo. No benchmark de decisões tipadas da TypeSafe, ela pontua 0,362 zero-shot — aleatório é 0,318, a linha de base da classe majoritária é 0,461 — e 0,766 quando ajustada finamente na própria divisão de treinamento do benchmark. No Banking77, 77 rótulos, ela pontua 0,425 contra 0,870 do Jev, o que é a ilustração mais nítida do seu teto de muitas opções. No AG News com quatro rótulos, ela pontua 0,950 contra 0,910 do Jev; no DAIR Emotion com seis rótulos, 0,595 contra 0,480. Seu erro de calibração é entregue em 0,466 e cai para 0,081 após reajuste de temperatura por tipo de pergunta. Um teste de terceiros com 100 mensagens de urgência do Mars-base teve Jev em 100/100 e Laya em 53/100. E em uma avaliação independente de chamada de ferramenta de agente, Laya alcançou 100% de recall de recusa em chamadas perigosas, mas apenas sinalizando tudo, o que é uma falha de precisão disfarçada de vitória de segurança.
Coloque os dois conjuntos de números lado a lado e a leitura honesta é que eles foram medidos em coisas diferentes. A taxa de 90,12% da Nimble é a concordância com seus próprios rótulos de referência curados. O 0,362 da Laya é um benchmark que ela não criou. Nenhum dos números se transfere.
Calibração: o único lugar onde ambos os projetos são excepcionalmente francos.
É aqui que os dois projetos estão mais próximos em espírito e mais distantes em resultado.
O README do Bespoke alerta explicitamente que as probabilidades do Nimble são logits normalizados por softmax sobre os candidatos fornecidos, não taxas de acerto calibradas — um 0,9 não significa 90% de acerto. Ele recomenda adicionar uma opção "nenhuma das opções acima", porque, se a resposta certa não estiver entre os candidatos, um deles ainda vence. Em uma avaliação mais recente de 3.880 registros abrangendo 13 subconjuntos, o Jev teve menor erro de calibração relatado em 11 dos 13 subconjuntos e uma pontuação Brier mais baixa em 10 dos 13. Portanto, concordância de rótulos semelhante não implica qualidade probabilística semelhante, e o Bespoke diz isso.
A divulgação da Convai é a imagem espelhada: o erro de calibração esperado de 0,466 está no cartão, ao lado do 0,081 que o reajuste de temperatura por tipo de pergunta produz. Nenhum dos projetos entrega um modelo cuja confiança você possa usar sem trabalho adicional. Ambos dizem isso por escrito. Se você está construindo um limite de confiança — liberação automática acima de 0,95, escalonamento abaixo de 0,7 —, a documentação de ambos os autores está lhe dizendo a mesma coisa: ajuste o limite com seus próprios dados rotulados primeiro.
A comparação, dimensão por dimensão
• Backbone — Laya: codificador ModernBERT-large 421M, bidirecional, sem pré-treinamento generativo. Nimble: Qwen3.5-9B com ajuste fino LoRA, base generativa mantida.
• Idiomas — Laya: mais de 100 por meio do checkpoint multilíngue de 322M. Nimble: inglês.
• Orçamento de prompt — Laya: 512 tokens em inglês, 1.024 multilíngue. Nimble: 2.048 tokens no máximo por prompt, apenas esquemas planos, enums limitados a 26 opções por campo.
• Velocidade — Laya: 32,8 ms p50 em uma T4, 7,2 ms por pergunta em lote de 10. Nimble: cerca de 106 ms de mediana em uma H100, 444 ms em um M5 Pro de 64 GB.
• Hardware — Laya: CPU, CUDA e Apple MPS; menos de um gigabyte residente na versão MLX. Nimble: GPU CUDA BF16 para os números informados, com suporte a caminhos MLX e CUDA.
• Acurácia relatada — Laya: 0,362 zero-shot, 0,766 com ajuste fino, 0,425 no Banking77. Nimble: 90,12% em 324 amostras curadas reservadas, contra 93,21% do Jev.
• Método — Laya: arquitetura primeiro, ajuste fino por implantação. Nimble: curadoria contrastiva de dados, publicada como uma receita.
• Licença — Apache 2.0 para ambos.
Duas restrições nessa lista merecem ser lidas duas vezes antes de você se comprometer. O limite de 26 opções por enum do Nimble e o teto de 2.048 tokens por prompt são limites rígidos de esquema, não uma degradação de desempenho — se sua taxonomia tem quarenta rótulos ou seu prompt carrega um documento longo, o Nimble é a ferramenta errada, independentemente da precisão dele. E o Nimble pontua cada campo de forma independente, então qualquer regra de consistência entre campos — “se A for verdadeiro, então B deve ser falso” — precisa estar no seu código, não no modelo.
Por que a receita de dados é o artefato mais portável
Aqui está o argumento a favor da Nimble que as tabelas de precisão deixam escapar. A Bespoke publicou o pipeline de curadoria, não apenas os pesos. Se o seu problema de decisão tem uma taxonomia fixa e você consegue escrever as regras, o método contrastivo é algo que você pode executar nos seus próprios dados com os seus próprios fatos de foco, sobre qualquer modelo base que você preferir. O LoRA de 9B é uma demonstração do método tanto quanto um produto.
A portabilidade de Laya é diferente e complementar. Porque é pequeno, porque roda em CPU e porque existem ports para ONNX e MLX, Laya é o modelo que você pode colocar dentro de um processo que não tem GPU nem rede. Em um benchmark de agente de navegador de terceiros, Laya concluiu 0 de 50 tarefas e declarou conclusão prematuramente em 33 tentativas — mas os autores do benchmark observam que o modelo foi treinado para trabalho de julgamento, como tickets de suporte, faturas e revisão de traces de agente, não para navegação. Leia esse resultado como uma declaração de escopo, e não como um veredito, e ele é consistente com o enquadramento de ambos os projetos: são componentes para uma classe específica de decisão, não agentes gerais.
Nem o Laya nem o Nimble são modelos hospedados no OrcaRouter. Ambos são pesos que você mesmo executa, e nada neste texto deve ser interpretado como uma alegação de que nós os disponibilizamos. O motivo pelo qual o produto de roteamento é mencionado é o mesmo motivo pelo qual ele aparece em qualquer arquitetura de modelo de decisão: o modelo de decisão responde a uma única chamada, e a aplicação ao seu redor ainda precisa de texto. Um pipeline que usa o Nimble para avaliar se um rascunho está em conformidade e o Laya para encaminhar a exceção ainda vai precisar de um modelo generativo para escrever o rascunho. Manter essa metade generativa em um único endpoint compatível com a OpenAI — mais de 200 modelos, preço de tabela do provedor repassado com 0% de margem para que um corte de preço do fornecedor entre em vigor no mesmo dia, com failover automático entre provedores — significa que a camada de decisão pode ser trocada sem mexer no contrato da camada generativa.
O veredito, e o experimento que o mudaria
Escolha o Nimble se sua taxonomia for fixa e estreita, suas entradas forem em inglês e curtas, você tiver uma GPU e quiser a receita de dados tanto quanto o modelo. Escolha o Laya se precisar de entrada multilíngue, de um orçamento inferior a 40ms ou de um processo sem GPU alguma — e inclua o ajuste fino no orçamento desde o início, porque o checkpoint zero-shot está abaixo da linha de base trivial e o cartão do modelo diz isso.
O experimento que resolveria essa questão é uma avaliação pareada em tráfego real: mesmas entradas, mesmos conjuntos de opções, mesmos limiares de confiança, avaliada em relação a rótulos humanos, com um diagrama de confiabilidade para cada um. A própria documentação da Nimble adverte que suas probabilidades não são taxas de acerto, e o cartão da Laya relata um erro de calibração de 0,466 antes do reajuste, então esse diagrama é o artefato que realmente diria qual modelo colocar diante da produção. Nenhum dos projetos publicou um, e nenhum publicou o do outro. Construa-o com seus próprios dados antes de definir um limiar.

