
Intern-Decision-2B vs Laya: 2,2 bilhões de parâmetros contra 421 milhões, ambos se recusando a escrever uma resposta
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 584 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
internlm/Intern-Decision-2B e convaiinnovations/laya são os dois modelos mais semelhantes no nicho dos pequenos modelos de decisão, e o fato mais útil sobre a comparação é que eles chegam lá por caminhos opostos. O checkpoint de 2.213.241.664 parâmetros do InternLM lê o logit em uma posição fixa antes de um placeholder e nunca chama generate(). O checkpoint de 421 milhões de parâmetros da Convai alimenta perguntas tipadas para uma cabeça de decisão sobre um backbone ModernBERT-large e retorna probabilidades calibradas em uma única passagem direta. Nenhum dos dois escreve um token, ambos prometem probabilidades, ambos ficam limitados a cerca de oito mil tokens de entrada, e o menor deles é cinco vezes menor e aproximadamente mil vezes mais popular. O que os separa não é tanto a capacidade quanto o empacotamento, e a lacuna de empacotamento decide a compra para a maioria dos leitores.
Intern-Decision-2B surgiu no Hugging Face às 05:36 UTC de 26 de setembro de 2026, a do meio de três tamanhos que a InternLM enviou em quarenta segundos sem nenhum anúncio, com fine-tuning a partir de Qwen/Qwen3.5-2B sob a Apache-2.0. Laya foi publicada pela primeira vez em 18 de setembro de 2026 e, desde então, acumulou cerca de 3.700 curtidas, um pacote pip, um servidor HTTP compatível com Jev, integrações com ONNX e LangChain e um notebook de fine-tuning. O contraste de maturidade é o artigo.
A premissa que eles compartilham, e os mecanismos que diferem
Ambos os cards defendem que, se o seu problema é escolher entre respostas conhecidas, gerar prosa é a operação errada. A formulação de Laya é: "nunca gera texto, então não há nada para analisar e nada para alucinar". A do Intern-Decision-2B é que sua API "realiza pontuação estruturada de candidatos. Não chama generate() nem faz amostragem de texto livre."
Os mecanismos são onde eles se separam.
Laya é um classificador. Um codificador ModernBERT-large (395M, bidirecional, com ajuste fino completo) alimenta uma cabeça de decisão treinada do zero — duas camadas transformer, um pontuador de marcadores de opção e uma cabeça de ação/escalonamento — para um total de 421M. As opções compartilham um orçamento fixo de tokens (head_max_len, 192 tokens no checkpoint em inglês, 256 no multilíngue), e o roteador detecta o sistema de escrita e o idioma em menos de meio milissegundo antes da passada.
Intern-Decision-2B é um modelo de próximo token ao qual foi proibido de se tornar um gerador. Ele mapeia as opções de cada pergunta para símbolos de token único A–Z, a–z, 0–9; renderiza um esqueleto JSON completo de assistente com um placeholder <decision> por campo; executa uma passagem forward causal; lê os logits imediatamente antes de cada placeholder; aplica softmax sobre os símbolos válidos daquele campo; e aplica uma temperatura ajustada de 2,100509348278. Por baixo, há um Qwen3_5ForConditionalGeneration padrão — 24 camadas, três camadas de atenção linear para cada camada de atenção completa, uma camada retida de previsão de múltiplos tokens, um teto de embeddings de 262.144 posições — além de uma torre de visão e um projetor.
A consequência prática da diferença é a capacidade de opções. O orçamento fixo por opção do Laya entra em colapso em espaços de rótulos amplos; sua própria ficha técnica documenta uma pergunta com 77 rótulos obtendo 0,425 contra 0,870 do TypeSafe Jev na mesma tarefa, porque 77 opções recebem cerca de três ou quatro tokens cada. O Intern-Decision-2B aceita até 62 opções por pergunta e até dezesseis perguntas, e 62 não é uma preferência, mas a contagem exata de símbolos de token único que seu contrato consegue endereçar. Nenhum dos dois é confortável além de algumas dezenas de opções; as formas de falha diferem.

Placar

• Parâmetros — Intern-Decision-2B com 2.213.241.664 em BF16, além de uma torre de visão e um projetor, cerca de 4,46 GB em disco; Laya 421M, um único arquivo safetensors de 842 MB, com um checkpoint multilíngue separado de 644 MB.
• Teto de entrada — 8.192 tokens para ambos, com ambos recusando em vez de truncar; observe que o 8.192 do Laya se aplica ao laya-multilingual e exige max_len=8192, já que o padrão de fábrica é 1.024.
• Imagens — até oito para o Intern-Decision-2B, contabilizadas no mesmo orçamento de tokens; nenhum caminho multimodal para Laya.
• Velocidade — 33,28 ms de média, 33,15 ms P50, 33,55 ms P95 por requisição em uma RTX 4090 para o Intern-Decision-2B; Laya relata aproximadamente 33 ms por requisição e 103–332 perguntas por segundo em lote em uma única T4.
• Idiomas — Intern-Decision-2B não faz nenhuma reivindicação multilíngue; Laya faz roteamento em mais de 100 idiomas, relatando que 45 dos 51 idiomas avaliados são utilizáveis com desempenho mais de três vezes superior ao aleatório, e 0,451 em intenção no MASSIVE em treze idiomas não ingleses, contra 0,306 do seu checkpoint apenas em inglês.
• Precisão zero-shot — o Intern-Decision-2B apresenta 84,68 em média em sete conjuntos de fornecedores, com Brier 0,437 e ECE 0,100, todos não reproduzidos; o checkpoint base em inglês do Laya obtém 0,362 no benchmark de 2.000 decisões tipadas, que o próprio cartão do modelo assinala como estando abaixo da linha de 0,461 da classe maioritária.
• Empacotamento — um checkpoint, um inference.py e um repositório GitHub recém-tornado público com código de treinamento e avaliação, versus pip install laya, um servidor HTTP compatível com Jev, caminhos rápidos do ONNX Runtime e do TileLang, integrações com MCP e LangChain, e um notebook de ajuste fino que roda em GPUs de camada gratuita.
A comparação mais justa não é aquela que a ficha técnica estabelece
Colocar 84,68 ao lado de 0,362 beira a desonestidade, e vale a pena dizer por quê, em vez de deixar os números como estão.
O 0,362 de Laya é um checkpoint base medido zero-shot em um benchmark para o qual não foi ajustado. O próprio card de Laya tira a conclusão explicitamente: "Laya é uma base rápida para especializar, não um motor de decisão zero-shot." Com fine-tuning na própria divisão de treino desse benchmark, ele alcança 0,766, superando o teto do professor de 0,735 e batendo o 0,727 publicado do TypeSafe Jev nas mesmas decisões. O 84,68 do Intern-Decision-2B, por sua vez, é uma média do fornecedor em sete suítes cujos conjuntos de teste não são os que Laya cita, produzida pelo laboratório que criou o modelo, sem que nenhum terceiro o tenha executado — o checkpoint mostra uma curtida e zero downloads. Comparar um resultado com fine-tuning a um resultado zero-shot, ou uma média de fornecedor a um painel independente, não é uma comparação. São duas medições diferentes que compartilham a mesma fonte tipográfica.
O que é genuinamente comparável: ambos são pequenos, ambos são baratos de executar, e ambos não podem ser ajustados por fine-tuning para o seu domínio. O repositório que a InternLM publicou esta manhã torna essa última parte materialmente mais fácil do que era ontem, porque ele disponibiliza o lançador de treinamento, o objetivo de próximo token mascarado, um pacote verificado por hash de 10.751 linhas de teste em sete suítes, e os scripts de ajuste de temperatura e de replay. Um laboratório que disponibiliza um gerador de calibração determinístico e afirma que o replay não muda nenhuma decisão está convidando exatamente o tipo de adaptação que o card da Laya recomenda.
Como você realmente chamaria qualquer um dos dois
Nenhum dos dois modelos está no OrcaRouter. A página de modelo do OrcaRouter para o Intern-Decision-2B retorna 404 e também não há rota para o Laya; nada aqui constitui uma afirmação de disponibilidade. Intern-Decision-2B significa baixar o checkpoint e executar seu engine integrado na sua própria GPU. Laya significa pip install laya e, se você quiser a interface compatível com Jev, laya-serve em POST /v1/systemone.
A questão subjacente, em formato Orchestrator, é se você quer uma segunda superfície operacional para um scorer. O Laya foi projetado para ser incorporado — o mesmo formato de requisição e resposta que o TypeSafe Jev, de modo que um cliente existente altera apenas uma URL base e nada mais. O Intern-Decision-2B foi projetado para ser reproduzido, e hoje são cerca de um dia de trabalho de ambiente antes que a primeira decisão retorne. Se a decisão de conjunto fechado que você está tomando for semelhante em formato a qualquer uma dessas, a alternativa hospedada em relação à qual os dois cards fazem benchmark é TypeSafe Jev 1.13, que de fato tem uma rota: US$ 0,042 por milhão de tokens de entrada, um contexto de 65K e um P50 de tempo até o primeiro token de 178 ms, acessível na mesma chave que mais de 200 outros modelos com preço de tabela do provedor repassado com 0% de markup.

Onde cada um vence
A Laya ganha em tudo o que é operacional. Um pacote pip contra o download de um checkpoint. Um router para mais de cem línguas contra nenhuma alegação de multilinguismo. Débito em lote medido em centenas de perguntas por segundo contra um valor por pedido sem qualquer estratégia de lotes. Dois anos de força no ecossistema — ONNX, TileLang, LangChain, MCP — contra um repositório que está público há duas horas.
O Intern-Decision-2B vence em três aspectos restritos. Ele aceita imagens, o que o Laya não faz. Ele não carrega dívida de ajuste fino: seu 84,68 é uma alegação zero-shot do fornecedor, enquanto o 0,766 de destaque do Laya pertence a um checkpoint ajustado com fine-tuning na própria divisão de treinamento do benchmark. E ele é documentado com um kit de reprodução — um pacote de avaliação verificável e uma stack de treinamento pública — o que vale mais do que uma linha em leaderboard para qualquer um que precise justificar o modelo a outra pessoa.
O empate é a premissa. Ambos se recusam a gerar, ambos dão a você probabilidades às quais você pode aplicar um limiar, e ambos estão abaixo do comprimento de entrada em que a maioria dos documentos reais se situa. Se o seu estado for um ticket, um e-mail ou um formulário, qualquer um dos dois serve, e Laya o levará até lá mais rápido. Se o seu estado tiver uma captura de tela anexada ou sua organização precisar que a reprodução seja auditável, o checkpoint intermediário do InternLM é o que responde a essa objeção específica — e, segundo os próprios números do InternLM, ele é o menos bem calibrado de seus três irmãos, com ECE 0,100 contra 0,066 e 0,065, então ajuste sua própria temperatura antes de confiar na confiança que ele relata.
