Um cartão de título gerado com o texto 'Intern-Decision-4B vs Laya', com o subtítulo 'dois modelos que respondem sem gerar um token', com três chips: '4.54B vs 421M', 'ambos em uma única passagem forward' e 'ambos Apache-2.0'. O logotipo do OrcaRouter é composto no canto inferior direito.
Engineering & Research

Intern-Decision-4B vs Laya: Dois modelos que se recusam a escrever uma resposta, com dez vezes de diferença em tamanho

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há uma linha na ficha do modelo Intern-Decision-4B que diz "Laya — 57,77". Qualquer pessoa que tenha lido a documentação da própria Laya reconhecerá o significado do número: convaiinnovations/laya é um modelo de decisão não autorregressivo de 421 milhões de parâmetros, e 57,77 é a média que ele obtém quando é usado em zero-shot no benchmark de outra pessoa. A própria ficha do modelo diz a mesma coisa de forma mais direta — os checkpoints base ficam abaixo da linha de base da classe majoritária no benchmark de decisões tipadas, em 0,362 contra 0,461. Enquanto isso, internlm/Intern-Decision-4B é um modelo de 4,54 bilhões de parâmetros construído exatamente para o mesmo trabalho: receber um estado e um conjunto de perguntas tipadas, executar um único forward pass, retornar probabilidades calibradas, nunca gerar um token. Mesma aposta arquitetural, mesmo formato de saída, mesma licença Apache-2.0, dez vezes mais parâmetros — e um deles é uma base para fine-tune, enquanto o outro afirma ser um motor zero-shot pronto.

Eles concordam com a premissa, o que é a parte rara.

Ambos os cards defendem o mesmo argumento, e vale a pena afirmá-lo porque a maior parte do setor defende o oposto. Se o seu problema é escolher entre um conjunto conhecido de respostas, gerar prosa é a operação errada: você paga por tokens que descarta, precisa de um parser, e recebe uma explicação que não pediu em vez de uma probabilidade que pode usar como limiar. O card da Laya coloca assim: "nunca gera texto, então não há nada para parsear e nada para alucinar." O card do Intern-Decision-4B diz que sua API "realiza pontuação estruturada de candidatos. Ela não chama generate() nem faz amostragem de texto em formato livre."

Os mecanismos diferem de uma maneira instrutiva. Laya alimenta perguntas tipadas para uma cabeça classificadora e retorna respostas tipadas com probabilidades calibradas em uma única passagem forward, com uma camada de roteamento que detecta escrita e idioma em menos de meio milissegundo antes da passagem. Intern-Decision-4B mapeia as opções de cada pergunta para símbolos de token único, renderiza um esqueleto JSON de assistente com um placeholder por campo, lê os logits imediatamente antes de cada placeholder e aplica softmax apenas sobre os símbolos permitidos daquele campo. O de Laya é um problema de classificação; o da InternLM é um problema de próximo token que ele se recusa a deixar virar um problema de geração.

A screenshot of the convaiinnovations/laya model card on Hugging Face, showing the title 'Laya', the description of it as a multilingual non-autoregressive System 1 decision model returning typed answers with calibrated probabilities in a single forward pass across 100+ languages, the pip install laya line, and the long-documents note about laya-multilingual reading up to 8,192 tokens with max_len=8192.

A diferença de tamanho, e o que ela proporciona

Pedir a dois modelos que façam a mesma tarefa com 421M e 4,54B parâmetros produz o resultado que você preveria, e então uma surpresa.

A parte prevista é a capacidade em perguntas difíceis. O Intern-Decision-4B tem média de 90,02 em sete conjuntos de avaliação, com uma pontuação de Brier de 0,347 e um erro de calibração esperado de 0,065 na própria medição da InternLM, e roda em média 44,16 ms por consulta em uma única RTX 4090. O checkpoint base em inglês do Laya tem 0,362 de acurácia no benchmark de decisões tipadas com 2.000 decisões, que o próprio cartão dele sinaliza como abaixo da linha de classe majoritária de 0,461 e pouco acima da linha de base aleatória de 0,318. Quando o mesmo checkpoint passa por fine-tuning na própria divisão de treino desse benchmark, o número salta para 0,766. O cartão do Laya tira a própria conclusão: "O Laya é uma base rápida para especializar, não um motor de decisão zero-shot."

A surpresa é que o modelo menor vence duas dimensões de forma absoluta. Velocidade: Laya responde de 103 a 332 perguntas por segundo em lote numa única T4, e a sua ficha técnica afirma ser cerca de seis a oito vezes mais rápido do que o TypeSafe J no valor de p50 de 236–276 ms medido independentemente que cita. Ter dez vezes os parâmetros não compra dez vezes o throughput na direção oposta — os 44,16 ms do Intern-Decision-4B são por consulta numa 4090 sem qualquer história de batching publicada. E linguagem: Laya reporta 45 de 51 idiomas avaliados utilizáveis em mais de três vezes o aleatório, com um routed 0,451 em MASSIVE intent em treze idiomas não ingleses contra 0,306 para o seu checkpoint apenas em inglês. O Intern-Decision-4B não faz qualquer afirmação multilíngue.

Placar

• Parâmetros — 4,54B BF16 para o Intern-Decision-4B, torre de texto mais torre de visão mais projetor; 421M para o Laya, uma única pilha compacta da classe encoder.

• Limite de entrada — 8.192 tokens para ambos, e ambos recusam em vez de truncar; observe que o 8.192 da Laya se aplica ao checkpoint multilíngue, cujo padrão de distribuição é 1.024.

• Multiplicidade — Intern-Decision-4B aceita de 1 a 16 perguntas e até 62 opções cada uma, e 62 não é arbitrário: é exatamente o número de símbolos de token único que seu contrato de inferência consegue endereçar. Laya também aceita várias perguntas tipadas, mas sua ficha documenta um colapso acentuado depois de cerca de 50 opções, em que uma pergunta com 77 rótulos recebe apenas três ou quatro tokens de orçamento por rótulo, e a precisão cai para 0,425.

• Imagens — até oito para o Intern-Decision-4B, contabilizadas no orçamento de 8.192 tokens; sem caminho multimodal para Laya.

• Calibração — Intern-Decision-4B vem com uma temperatura ajustada de 1,99241824, selecionada por minimização de NLL em 1.728 casos, e reporta ECE 0,065 em sua própria suíte; Laya vem com excesso de confiança, e sua ficha diz que reajustar uma temperatura por tipo de pergunta e número de opções move a ECE média de 0,466 para 0,081.

• Postura zero-shot — um checkpoint finalizado alegando uma média de 90,02 contra uma base documentada que pontua abaixo da linha da classe majoritária.

• Latência — 44,16 ms de média e 44,03 ms de mediana em uma RTX 4090, contra 103 a 332 perguntas por segundo processadas em lote em uma única T4.

• Idiomas — nenhuma alegação publicada contra 45 de 51 idiomas utilizáveis quando roteados.

• Licença — Apache-2.0, com a licença Qwen upstream preservada, enquanto a Apache-2.0 é explicitamente marcada para uso comercial.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs Laya'. The left column reads: Parameters: 4.54B BF16; Output: probabilities, no text; Options per question: up to 62; Latency: 44.16 ms mean on one RTX 4090; Zero-shot: 90.02 average reported; Images: up to eight; License: Apache-2.0. The right column reads: Parameters: 421M; Output: typed answers, no text; Options per question: degrades past ~50; Latency: 103-332 q/s batched on one T4; Zero-shot: below majority class, 0.362; Images: none; License: Apache-2.0, commercial use tagged. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.

Dois cartões, duas ideias muito diferentes de divulgação

É aqui que a comparação deixa de ser uma ficha técnica e passa a ser uma decisão subjetiva, porque os dois fornecedores documentam os seus modelos em estilos opostos.

O cartão da Laya publica suas próprias falhas em detalhe. Ele relata que o checkpoint de inglês obtém 0,000 de precisão em khmer com 0,952 de confiança — confiante mesmo estando errado, o que torna a filtragem por confiança inútil ali. Ele relata que action.act_probability não carrega nenhum sinal utilizável, registrando 1,0 para quase toda entrada com um AUROC de 0,30 em 396 decisões rotuladas, e diz para você filtrar com base em confiança, em vez disso, que alcança 0,77 nos mesmos itens. Ele classifica questões de pontuação ordinal como "a primitiva mais fraca", citando 0,372 no SST-5. Um cartão que informa quais de suas próprias saídas devem ser ignoradas está fazendo algo que a maioria dos fornecedores não tenta.

O card do Intern-Decision-4B publica uma tabela limpa e nenhum caso de falha. Suas ressalvas são reais e determinantes — a seção de calibração é excepcionalmente explícita ao afirmar que a coluna "antes" do seu piloto não é o que qualquer usuário veria, e que os rótulos do conjunto de testes não foram usados para selecionar a temperatura —, mas a seção de avaliação é sete vitórias e nenhuma admissão de falha. Ele também traz linhas para cinco sistemas concorrentes que a InternLM executou no harness da InternLM, incluindo a linha da Laya que abre este artigo. Esses não são os números dos próprios projetos, e lê-los como tal seria um erro.

Portanto, a linha de origem deste confronto é assimétrica de uma forma que favorece o modelo menor: as evidências da Laya incluem defeitos que ela própria documentou, e as evidências do Intern-Decision-4B nunca foram submetidas a um conjunto de testes que seus autores não tenham escolhido.

Em qual formato de problema cada um se encaixa

Dado um estado curto e estruturado em inglês, um conjunto fechado de respostas e a necessidade de uma probabilidade confiável, o Intern-Decision-4B é o objeto mais capaz no papel e o mais caro na prática — quatro shards de safetensors, PyTorch 2.9.1 e Transformers 5.14.1 sob Python 3.12, um motor residente, e um wrapper que você mesmo escreve se quiser um endpoint HTTP. Dada uma decisão de roteamento ou de guardrail de alto volume em dezenas de idiomas, em que a taxa de transferência é a restrição vinculante, o Laya tem o melhor formato: pip install laya, um modelo de 421M, e um card que já avisou para fazer ajuste fino antes de confiar nas probabilidades.

A única coisa em que os dois cards concordam é que não se deve confiar em nenhum dos modelos em zero-shot sem verificar a calibração nos seus próprios dados — Laya porque os seus checkpoints base ficam próximos do acaso em tipos de decisão não familiares, Intern-Decision-4B porque o seu ECE de 0,065 vem de uma suíte que os próprios autores montaram.

O que um roteador muda e o que não muda aqui

Nenhum destes modelos está no catálogo do OrcaRouter, e vale a pena dizê-lo claramente em vez de insinuar o contrário: as nossas páginas de modelos retornam 404 tanto para o Intern-Decision-4B quanto para o Laya, e nenhum deles é uma rota que se possa chamar hoje. O que isso significa para os dois projetos não é a mesma coisa. A licença Apache-2.0 da Laya com uma etiqueta de uso comercial significa que o obstáculo é puramente de empacotamento — é um pacote Python local com uma pegada pequena, o tipo de coisa que poderia plausivelmente ser servida. O obstáculo do Intern-Decision-4B também é de empacotamento, mas os seus pesos BF16 de 4,54B e o teto de recusa de 8.192 tokens fazem dele um componente, e não um serviço.

Onde o OrcaRouter realmente ajuda é depois que a decisão foi tomada. Se, afinal, o seu problema de decisão estruturada precisar de uma etapa de raciocínio, os modelos gerais capazes de fazê-lo estão em uma única chave para mais de 200 modelos, com o preço de tabela do provedor repassado com 0% de margem e failover automático entre provedores — assim, o modelo que você combina com um scorer está a um endpoint de distância, não a um segundo contrato.

A versão curta

Esses dois projetos chegaram à mesma conclusão sobre como as decisões devem ser tomadas e depois divergiram sobre quase todo o resto. A Laya aposta que 421M de parâmetros, roteamento linguístico rigoroso e honestidade implacável sobre seus próprios defeitos formam uma base rápida que você especializa. O Intern-Decision-4B aposta que dez vezes os parâmetros e um contrato de pontuação de token único cuidadosamente projetado formam um motor zero-shot pronto. O experimento decisivo é um que nenhum dos dois executou em público: pegue um conjunto de decisões com respostas computáveis, execute os dois e verifique se as probabilidades significam alguma coisa. A Laya publicou esse experimento pela metade e mostrou onde ele falha. O Intern-Decision-4B não o publicou de forma alguma.

A generated comparison card titled 'Same bet, ten times the parameters'. The left side, 'Intern-Decision-4B', lists: 4.54B BF16; a finished zero-shot checkpoint claiming a 90.02 average across seven sets; fitted temperature 1.99241824; 44.16 ms mean per query on one RTX 4090; Apache-2.0 with the upstream Qwen license preserved. The right side, 'Laya', lists: 421M; a documented base below the majority-class line at 0.362, rising to 0.766 once fine-tuned on the benchmark's own training split; refitting one temperature per question type moves mean ECE from 0.466 to 0.081; 103 to 332 questions per second batched on one T4; Apache-2.0 tagged for commercial use. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.