
Laya vs Decider: Um Codificador de 421M Contra uma Mistura de 35B
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Laya e Decider são ambos modelos de decisão de pesos abertos e não autorregressivos que respondem a perguntas tipadas — uma escolha de uma lista fornecida, uma pontuação em uma rubrica ordenada, uma probabilidade sim/não — em uma única passagem direta, e ficam em extremos opostos do espectro de tamanho. A Convai Innovations lançou o Laya em 18 de setembro de 2026 sob a licença Apache 2.0: um encoder ModernBERT-large de 421M para inglês com uma janela de 512 tokens, um checkpoint multilíngue mmBERT-base de 322M com uma janela de 1.024 tokens cobrindo mais de 100 idiomas, e um roteador que detecta o sistema de escrita e encaminha para o correto. A família Decider da Mapika vai de decider-0.8b e decider-2b, em pequenas bases generativas, até decider-35b-a3b, uma mistura de especialistas de 35B com aproximadamente 3B parâmetros ativos. Ambos são gratuitos para baixar e ambos retornam probabilidades em vez de texto. A razão pela qual não são intercambiáveis não é o número de precisão com que a maioria dos textos abre.
Duas famílias, uma aposta arquitetônica

A aposta compartilhada é que uma decisão não precisa de um ciclo de decodificação. Um modelo generativo ao qual se pergunta "este ticket é um pedido de reembolso?" precisa emitir tokens, e no momento em que emite tokens você fica responsável por parsing, validação de esquema e um caminho de retry para a uma vez em duzentas em que ele esquece uma chave. Laya e Decider evitam isso lendo a resposta diretamente de uma única passagem forward — Laya de um codificador bidirecional, Decider dos logits de tokens de opções com letras em um slot de resposta dedicado no prompt.
É aí que a semelhança acaba. A Laya é dois pequenos encoders atrás de um roteador de linguagem, e é isso que lhe garante uma janela de 512 tokens para inglês e uma multilíngue de 1.024 tokens, com contagem de parâmetros de 421M e 322M. O Decider mantém um backbone generativo e adiciona um readout por cima: decider-2b é um ajuste fino supervisionado do Qwen3.5-2B-Base, seguido por uma passada de reforço sensível à calibração em tarefas de navegador ao vivo e jogos exatos, enquanto decider-35b-a3b congela os especialistas roteados e treina matrizes de blocos com Muon. A consequência prática é que o Decider herda o conhecimento de mundo de um modelo de linguagem, e a Laya não. A outra consequência é que o Decider herda a pegada de um modelo de linguagem.

A documentação do próprio Mapika indica o decider-2b a 18 ms de mediana por decisão num B300 em bf16, lote de um, sem CUDA graphs nem compilação, e o decider-35b-a3b a 41 ms na mesma configuração. Num GH200 com contextos de tickets de suporte de cerca de 230 tokens e três a cinco perguntas tipadas, o mesmo projeto reporta 49 ms em modo eager, 4,0 ms com CUDA graphs e torch.compile, e cerca de 1.370 decisões por segundo com lote 32. Esses são números publicados pelo fornecedor, do próprio texto do projeto, e não uma medição independente. O número de destaque da Laya também é publicado pelo fornecedor: 32,8 ms p50 por decisão numa Tesla T4, e 7,2 ms por pergunta com tamanho de lote 10.
A questão da calibração, à qual os dois projetos respondem em escalas diferentes
A calibração é o número que mais importa para um modelo de decisão, porque o objetivo de devolver uma probabilidade é precisamente que alguém a jusante defina um limiar sobre ela. É também aqui que comparar diretamente a Laya e o Decider o vai induzir em erro.
Laya é distribuído com um erro de calibração esperado de 0,466 em sua própria ficha de modelo, e a ficha declara claramente que reajustar uma temperatura por tipo de pergunta reduz esse valor para 0,081. Essa é uma divulgação incomumente honesta, e também significa que o checkpoint distribuído não é o artefato calibrado. O número que você obtém pronto para uso é o 0,466.
O Decider reporta resultados de um instrumento completamente diferente. O Decision Index — um ranking aberto que rodou todas as reproduções abertas do Jev em mais de 132.422 requisições — coloca o decider-35b-a3b em quarto lugar geral com 54,3, atrás do 59,5 do Jev, e o reporta como o melhor calibrado das 32 entradas, com um erro de calibração de 3,1 pontos e 0,4% de respostas erradas a 95%+ de confiança declarada. O decider-2b reporta 8,8 pontos e 0,9%. Esses são números publicados no ranking, e 3,1 pontos no ECE de dez bins do Index não é a mesma medição que o 0,466 da Laya em sua própria avaliação. Colocá-los lado a lado em uma tabela seria um erro de comparar alhos com bugalhos disfarçado de rigor. O que se pode dizer é que o autor do Decider escolheu ser medido em um ranking de terceiros e o autor da Laya escolheu publicar seu número de calibração mais fraco por conta própria; nenhum dos dois foi auditado pelo harness do outro.
Onde cada um vence, dimensão por dimensão
• Backbone — Laya: codificador ModernBERT-large de 421M, bidirecional. Decisor: bases generativas Qwen3.5, de 0,8B a 35B-A3B.
• Idiomas — Laya: mais de 100 via um checkpoint multilíngue de 322M por trás de um roteador. Decider: apenas inglês, declarado como uma limitação.
• Janela de contexto — Laya: 512 tokens em inglês, 1.024 em multilíngue. Decider: entradas de até 32k aceitas, treinado para 16k na geração v6, testado até 30k.
• Teto do conjunto de opções — Laya: degrada drasticamente após cerca de 20 opções, 0,425 no Banking77 contra 0,870 do Jev. Decisor: Escolha entre 2 e 255 opções nomeadas, Pontuação entre 2 e 10 níveis descritos.
• Acurácia zero-shot — Laya: 0,362 no benchmark typed-decisions, abaixo da linha de base de classe majoritária de 0,461. Decider: não foi publicado como um número zero-shot; em vez disso, o projeto relata resultados específicos de tarefa.
• Calibração — Laya: ECE 0,466 na versão original, 0,081 após reajuste de temperatura por tipo de pergunta. Decisor: 3,1 pontos no Índice de Decisão para o 35B, melhor entre 32 entradas.
• Raciocínio — Laya: nenhum, por construção. Decider: nenhum, declarado explicitamente — é uma leitura por correspondência de padrões, não um raciocinador.
• Licença — Apache 2.0 para ambos.
Mais um detalhe do Decider que vale a pena saber antes de escolhê-lo: o projeto avisa que escolher um registro de um array JSON longo pela posição é um caso frágil e recomenda acessar os registros por chave. Esse é o tipo de limitação que você só aprende ao executá-lo.
Quanto custa para você executar qualquer um dos dois
O perfil de custo da Laya é um projeto de ajuste fino. O modelo é pequeno o suficiente para rodar em uma CPU de laptop para trabalho de baixo throughput, mas a pontuação zero-shot do checkpoint em inglês distribuído fica abaixo da linha de base trivial, o que significa que adotar a Laya é adotar a tarefa de construir um conjunto rotulado, fazer o ajuste fino e reajustar a temperatura por tipo de pergunta. A recompensa é que, depois de fazer isso, o artefato tem 421M parâmetros e responde em dezenas de milissegundos em uma T4. O checkpoint ajustado fino da própria Convai, laya-typed-decisions, alcança 0,766 na divisão de treino do benchmark — um número que diz mais sobre o ajuste fino do que sobre o modelo base, e o card diz isso.
O perfil de custo do Decider é uma decisão de serving. Você está escolhendo quanta GPU alugar, e a família oferece um ajuste de verdade: 18ms em um 2B versus 41ms em um 35B-A3B, com o modelo maior garantindo conhecimento e folga de raciocínio em GPQA, GSM8K, CRUXEval e MMLU que os pequenos não têm. Se sua tarefa é específica e seus rótulos são fixos, o decider-2b é a máquina mais barata. Se sua tarefa precisa que o modelo saiba coisas, você paga pela mistura.
Onde o OrcaRouter se encaixa — e onde não se encaixa
Nem Laya nem Decider são modelos hospedados no OrcaRouter. Você baixa os pesos e os executa por conta própria, e nada aqui muda isso. O que muda é a outra metade do padrão. Um modelo de decisão tipado quase nunca é a aplicação inteira: algo precisa ler o ticket, resumir a thread ou redigir a resposta que a decisão libera. Essa metade é uma chamada generativa, e é a metade para a qual o OrcaRouter foi criado — mais de 200 modelos atrás de uma única chave compatível com OpenAI ao preço de tabela do provedor repassado com 0% de markup, então uma redução de preço do fornecedor chega à sua fatura no mesmo dia, em vez de na próxima renovação de contrato. Se você está fazendo fine-tuning de um checkpoint Laya a partir das saídas de um modelo de fronteira, ou roteando entre o decider-2b para triagem e um modelo grande para os 4% difíceis, manter o lado generativo em um único endpoint significa que o lado da decisão e o lado da geração não precisam de dois contratos e dois SDKs. O failover automático cobre o caso em que o modelo grande é a parte que cai.
Qual escolher
Escolha o Laya se suas entradas forem multilíngues, seus rótulos forem poucos, seu orçamento de latência for de dezenas de milissegundos em hardware modesto, e você estiver preparado para fazer ajuste fino — porque você terá que fazer. Escolha o Decider se suas entradas forem em inglês, você precisar que o modelo carregue algum conhecimento de mundo para a decisão, e você preferir escolher um tamanho de modelo a executar um pipeline de treinamento. Se seus conjuntos de opções ultrapassarem vinte rótulos, leia o número do Banking77 do Laya antes de se comprometer; se suas entradas forem documentos JSON longos que você endereça por posição, leia a limitação declarada do Decider antes de se comprometer.
A comparação que realmente resolveria isso — ambos os modelos com entradas idênticas byte a byte, os mesmos prompts, a mesma ordenação de opções, a mesma varredura de limiar — ainda não existe. Até que exista, a posição honesta é que o Laya tem a melhor curva de custo e o Decider tem a melhor evidência de calibração, e que ambos estão num estágio tão inicial que a avaliação que você construir com seus próprios dados valerá mais do que os números publicados de qualquer um dos projetos.

