Uma placa de título gerada para Microsoft-Decision-1 vs Laya, com o subtítulo "cobertura de idiomas em relação ao comprimento do contexto", com etiquetas indicando 25 idiomas suportados vs 100+ idiomas, um contexto de 32.768 tokens vs uma janela de 1.024 tokens, apenas API hospedada vs pesos Apache-2.0, e um rodapé observando que os números de ambos os fornecedores são autodeclarados.
Engineering & Research

Microsoft-Decision-1 vs Laya: 25 idiomas por trás de uma API, 100+ por trás de um download de 322 MB

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Conte os idiomas e a comparação parece decidida. Microsoft-Decision-1, disponível em geral no Microsoft Foundry desde 8 de outubro de 2026, lista 25 idiomas com suporte e declara claramente que cobertura, qualidade e calibração "podem variar por idioma", apontando idiomas que não são inglês e, especialmente, idiomas com poucos recursos como uma área de baixo desempenho. Laya, publicado pela Convai Innovations em 18 de setembro de 2026 sob a licença Apache 2.0, descreve-se como multilíngue em mais de 100 idiomas e relata que 45 dos 51 idiomas testados permanecem utilizáveis com roteamento, contra 23 dos 51 de sua versão irmã apenas em inglês. Um é um modelo 9B por trás de um endpoint do Azure com um contexto de 32.768 tokens; o outro é um classificador de 421 milhões de parâmetros executado a 32,8 milissegundos por decisão em uma única Tesla T4, gratuitamente. Ambos se recusam a escrever um token e ambos retornam probabilidades sobre as opções que você define.

Mas leia os dois cartões de modelo na íntegra e a contagem de idiomas deixa de ser o número interessante. É a história de calibração por trás disso, e os dois projetos contam essa história em direções opostas.

Laya publica o número que torna seu próprio marketing constrangedor

O cartão de modelo da Laya afirma, na sua própria secção de limites, que os checkpoints base obtêm 0,362 zero-shot no benchmark de decisões tipadas — abaixo da linha de base de classe maioritária de 0,461. Isso é um cartão a dizer que o seu modelo é pior do que adivinhar "a resposta mais comum" nesse teste. Afirma também que os checkpoints base estão perto do acaso zero-shot, que o valor de destaque de 0,766 para decisões tipadas requer fine-tuning na própria divisão desse benchmark, que ordinal pontuação perguntas são a primitiva mais fraca (SST-5 0,372), que as perguntas de escolha de alta cardinalidade sofrem porque 77 opções deixam aproximadamente três ou quatro tokens cada, que noul podem seguir os seus próprios rótulos, e que o action.act_probability campo "não transporta ainda sinal utilizável" em AUROC 0,30. A própria frase de resumo da Convai é a que deve ser levada para qualquer avaliação: a Laya é uma base rápida para especializar, não um motor de decisão zero-shot.

Essa franqueza é mais valiosa do que parece, porque diz exatamente para que serve Laya. É um encoder que você faz ajuste fino com seus próprios rótulos — toda a arquitetura é construída para que novos esquemas não precisem de retreinamento, mas desempenhar bem em uma tarefa, sim. Usado dessa forma, os números publicados são fortes: 0,766 contra os 0,727 do Jev em decisões tipadas após ajuste fino, AG News 0,950 contra 0,910, DAIR Emotion 0,595 contra 0,480, e ECE 0,081 contra os 0,246 do Jev — com a observação honesta de que ele vem excessivamente confiante e precisa de reajuste de temperatura, o que faz o ECE médio passar de 0,466 para 0,081.

A Microsoft publica a metodologia e retém o resultado.

A página do Foundry do Microsoft-Decision-1 faz o mesmo exercício na direção oposta. Ela descreve a avaliação em detalhes — benchmarks de decisão públicos e da comunidade, além de conjuntos internos reservados, métricas incluindo acurácia e erro de calibração, ordem das opções variada, testes estatísticos pareados, ambiente de avaliação idêntico para os modelos comparados — e relata que o modelo "tem desempenho equivalente ao de modelos de decisão líderes e está à frente de outros modelos de decisão abertos avaliados com a mesma metodologia". Ela nomeia seus pontos fortes (raciocínio, aplicação de regras, robustez à formatação de prompts) e seus pontos fracos (conhecimento especializado de domínio, idiomas que não sejam o inglês).

E então não imprime nada. Nenhuma métrica de precisão, nenhum erro de calibração, nenhuma tabela por benchmark. As limitações autorrelatadas são reais e úteis — as pontuações mudam com a formulação e a ordem das opções, uma pergunta mal formulada ainda retorna uma pontuação, a calibração é mais forte em tipos de tarefas familiares, nenhuma explicação é produzida — mas uma lista de limitações não é uma medição. Então a troca é excepcionalmente limpa: a Laya fornece números que você pode tentar falsificar com seus próprios dados, e a Microsoft fornece uma postura de conformidade e um contexto de 32K no qual você pode colocar um documento longo.

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

O que a diferença de tamanho realmente oferece

O tamanho reduzido de Laya não é uma concessão aqui, é o design. Como cada opção é pontuada em seu próprio [MASK] token e passa por softmax sobre as opções daquela pergunta, o espaço de respostas é montado no momento da requisição, em vez de embutido em uma cabeça de vocabulário — e é por isso que um esquema que você inventa hoje à tarde não precisa de retreinamento, e por que o modelo cabe em 322 a 421 milhões de parâmetros. O checkpoint multilíngue roda cerca de 2,2 vezes mais rápido que o em inglês, o roteador detecta o sistema de escrita em menos de meio milissegundo, e a vazão em lote chega a 103 a 332 perguntas por segundo em uma T4. Para uma carga de trabalho que pontua cada ticket, cada documento recuperado ou cada ação proposta, essa vazão é o diferencial, não a contagem de parâmetros.

Os custos desse design são igualmente específicos e vale a pena enunciá-los frente ao contraponto da Microsoft. O checkpoint em inglês usa uma janela de 512 tokens; o multilíngue, 1.024, extensível até 8K. O Microsoft-1 usa 32.768. Um longo tópico de suporte, um contrato completo ou um documento de política de várias páginas não cabe de forma alguma na janela da Laya, e nenhuma quantidade de velocidade compensa o truncamento. A Laya responde a um conjunto de perguntas por passagem direta com um orçamento de tokens documentado por opção; a Microsoft documenta uma única invocação de até 32K tokens sem um teto por pergunta. E o ponto fraco competitivo da Laya como classificador vale a pena conhecer: ela obtém 0,425 no Banking77 contra 0,870 do Jev, que é o tipo de problema de intenção de granularidade fina e alta cardinalidade em que um passe de especialização é mais importante.

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

A comparação de custos que não é por token

Laya é gratuita no ponto de uso — auto-hospedada, Apache 2.0, listada com um custo de auto-hospedagem de "$0" — e seu preço real é a execução de ajuste fino que você deve a ela antes que ela seja boa na sua tarefa. Microsoft-Decision-1 é uma API Foundry hospedada com uma taxa por token que não está impressa na página do modelo, sem pesos para baixar, sem caminho de ajuste fino e inferência em lote desativada. Uma é um projeto inicial de rotulagem de dados, o outro é uma chamada medida. Qual é mais barato depende inteiramente do volume, e o ponto de equilíbrio é alto: um codificador de 421M pontuando 300 itens por segundo em uma T4 alugada é muito difícil de superar por decisão depois que ele for treinado.

É aqui que o OrcaRouter conquista seu lugar num pipeline construído sobre qualquer um dos dois modelos, e é somente o lado generativo. Não hospedamos nem o Microsoft-Decision-1 nem o Laya: ambos retornam probabilidades em vez de texto, nenhum dos dois está no nosso catálogo, e um endpoint de pontuação não é um alvo de chat-completions. O que oferecemos é o modelo que produz aquilo que está sendo pontuado — a resposta preliminar, a chamada de ferramenta proposta, a resposta candidata que a cabeça ajustada da Laya então avalia. São mais de 200 modelos por trás de uma única chave compatível com OpenAI ao preço de tabela do provedor repassado com 0% de margem, com failover automático quando um caminho de serving se degrada. Num loop que pontua tudo o que gera, a chamada de geração é a parte que pode falhar, e o failover é o que mantém a fila de pontuação alimentada.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

Qual escolher

Escolha Laya se suas decisões chegam em muitos idiomas, se seu volume é alto o suficiente para que a precificação por token importe, se você tem rótulos e uma semana para fazer fine-tuning, ou se precisa executar a pontuação em hardware dentro do seu próprio limite. Aceite a janela de 512 a 1.024 tokens e o fato de que o checkpoint base ficará próximo do aleatório até que você o especialize, e você obtém um modelo de decisão que é honesto quanto a ser um ponto de partida.

Escolha Microsoft-Decision-1 se suas entradas forem documentos longos em vez de tickets, se o seu critério de implantação for autenticação do Azure, cobrança unificada e um pacote de IA Responsável, em vez de um download, se 25 idiomas cobrirem o seu tráfego, ou se você preferir não ser dono do modelo de jeito nenhum. Aceite que você mesmo vai traçar a primeira curva de calibração dele e reserve uma tarde com uma amostra rotulada para fazer isso — porque, ao contrário de Laya, este não vai lhe entregar um número ECE para contestar.