Um cartão de título gerado com os dizeres 'Intern-Decision-2B vs Qwen 3.8', com o subtítulo 'Uma mesma espinha dorsal, dois trabalhos bem diferentes', com os selos 'classificador de 2,2B, 33 ms' e 'carro-chefe de 2,4T, contexto de 1M', com o logotipo do OrcaRouter composto no canto.
Guides & Insights

Intern-Decision-2B vs Qwen 3.8: Um Backbone, Duas Tarefas Muito Diferentes

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Abra a configuração de internlm/Intern-Decision-2B e a configuração de Qwen/Qwen3.5-2B lado a lado e quase nada difere. As mesmas 24 camadas, o mesmo tamanho oculto de 2.048, as mesmas 8 cabeças de consulta contra 2 cabeças de chave-valor, a mesma dimensão de cabeça de 256, o mesmo teto de embedding de 262.144 posições, o mesmo vocabulário de 248.320 tokens, o mesmo padrão repetitivo de três camadas de atenção linear para uma camada de atenção completa. O Intern-Decision-2B não é uma arquitetura nova. É aquele backbone com sua capacidade de gerar texto removida e sua confiança calibrada — e é essa única subtração que faz com que a comparação com Qwen3.8-Max, o carro-chefe de 2,4 trilhões de parâmetros a que todo o nome da família "Qwe​n 3.8" se refere no extremo superior, valha mais do que uma contagem regressiva de parâmetros.

Os dois não são concorrentes e o confronto não é uma disputa. O Intern-Decision-2B é um fine-tune de 2.213.241.664 parâmetros do Qwen3.5-2B, enviado ao Hugging Face às 05:36 UTC de 26 de setembro de 2026, entre três irmãos não anunciados, e não emite tokens: ele recebe um estado e perguntas tipadas, executa um forward pass causal, lê os logits em posições fixas de placeholder e retorna uma distribuição calibrada por campo. O Qwen3.8-Max é o carro-chefe hospedado da Alibaba, um modelo esparso de mistura de especialistas com cerca de 95 bilhões de parâmetros ativos por token, uma janela de contexto multimodal de 1 milhão de tokens e preço de tabela de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída. Um é um componente. O outro é um serviço. A pergunta útil é onde fica a fronteira entre eles em um pipeline pelo qual você já está pagando.

A subtração, precisamente

Vale a pena enunciar com exatidão o que o ajuste de decisão mudou, porque isso esclarece o que o modelo base já carregava.

A tarefa é denominada no repositório como modelagem de linguagem mascarada autorregressiva. A entrada do assistente contém um esqueleto JSON completo com um token <decision> por campo; os símbolos de resposta de referência aparecem apenas nos rótulos, nunca na entrada. O treinamento usa alinhamento causal comum de próximo token, em que o logit imediatamente antes de um marcador prevê a resposta desse campo, e todos os campos compartilham uma única passagem direta. Na inferência, os logits são restritos aos símbolos de resposta válidos de token único — A–Z, a–z, 0–9, que é de onde vem o teto de 62 opções — depois passam por softmax e são mapeados de volta para seus rótulos.

Então, o mecanismo de próximo token do modelo base está intacto e inalterado. O que foi treinado é uma preferência por ocupar uma entre um punhado de posições de resposta em vez de continuar uma frase, além de uma temperatura específica do checkpoint de 2,100509348278, ajustada por log-verossimilhança negativa sobre 1.728 casos de calibração designados, com 1.693 mantidos de fora. O cartão é inequívoco quanto a geração estar fora de questão: a API "executa pontuação estruturada de candidatos. Ela não chama generate() nem faz amostragem de texto de forma livre."

O repositório também registra o que o ajuste não tocou: ele "faz fine-tuning do backbone de linguagem do Qwen3.5 enquanto congela a torre de visão e o projetor". O shard de visão de 612.517.440 bytes no 2B tem a mesma contagem de bytes que no checkpoint de decisão 4B, o que se encaixa em componentes herdados, e não treinados. O caminho da imagem funciona; simplesmente não foi aquilo em que a etapa de decisão gastou seu orçamento.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

O que 2,2 bilhões de parâmetros não conseguem fazer, e o que os 2,4 trilhões fazem em vez disso

Tudo se separa num único eixo: se a tua resposta já existe como uma lista.

Intern-Decision-2B responde a um conjunto fechado. De uma a dezesseis perguntas, até 62 opções cada, até oito imagens, tudo dentro de um orçamento de 8.192 tokens que o motor prefere recusar a truncar. Retornado como probabilidades. A 33,28 ms de média por solicitação em uma única RTX 4090, com P95 de 33,55 ms, e nada cobrado por chamada, porque não há saída para cobrar.

Qwen3.8-Max escreve. Um contexto de 1 milhão de tokens, entrada de texto, imagem e vídeo, raciocínio com um modo de pensamento, chamada nativa de ferramentas, saídas estruturadas, até 131.000 tokens de saída na build datada de 0902. Ele também pode, em princípio, tomar a mesma decisão de roteamento que o Intern-Decision-2B toma — você pode instruí-lo via prompt a escolher entre opções e retornar JSON. Três coisas dão errado quando você faz isso. Você paga pelos tokens que ele gasta decidindo. Você recebe uma string cujo parse pode ou não ter sucesso. E o número dentro dessa string é o que quer que o sampler tenha produzido, não um softmax que você possa limitar em 0,8 e usar para agir.

Ambos os relatos são verdadeiros e nenhum cancela o outro. O carro-chefe de 2,4 trilhões de parâmetros existe porque a maioria dos problemas não são conjuntos fechados. O pontuador de 2,2 bilhões existe porque o subconjunto que é merece um instrumento mais barato.

Placar

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• Parâmetros — Intern-Decision-2B 2.213.241.664 em BF16, além de uma torre de visão e um projetor, cerca de 4,46 GB em disco; Qwen3.8-Max aproximadamente 2,4 trilhões no total, com cerca de 95 bilhões ativos por token, servido, não baixado.

• Contexto — 8.192 tokens, rejeitado acima; 1.000.000 de tokens com 131.000 de saída máxima na build 0902.

• Saída — probabilidades calibradas e um argmax, sem texto gerado; texto gerado incluindo um traço de raciocínio.

• Modalidades de entrada — texto mais até oito imagens; texto, imagem e vídeo.

• Custo — sem cobrança por chamada, e você é dono da GPU; US$ 2,00 por milhão de tokens de entrada, US$ 6,00 por milhão de saída, com leituras de cache a US$ 0,25 e gravações de cache a US$ 2,50.

• Evidência publicada — uma tabela de fornecedor com sete suítes, com média de 84,68, Brier 0,437 e ECE 0,100 em 10.751 linhas de teste, não reproduzida por ninguém fora da InternLM, em um checkpoint com uma curtida e zero downloads; um Artificial Analysis Intelligence Index de 45,4 na posição 15 de 145 e um AA Coding index de 76,2 na posição 9 de 138, ambos medidos de forma independente.

• Latência — média de 33,28 ms por solicitação em uma RTX 4090, diminuindo à medida que o processamento em lote é adicionado; 2,655 segundos de P50 até o primeiro token, conforme o catálogo reporta, aumentando com a carga.

As linhas de evidência não são equivalentes e não deveriam ser impressas como se fossem. O carro-chefe da Alibaba tem por trás uma pontuação de índice independente. O checkpoint da InternLM tem uma tabela produzida pelos próprios autores, e o valor de calibração, em especial, deveria ser lido como uma intenção bem documentada até encontrar os dados de outra pessoa — tanto mais aqui, porque este tamanho específico apresenta o pior erro de calibração esperado dos três que a InternLM lançou, 0,100 contra 0,066 para o modelo com metade do seu tamanho e 0,065 para o que tem quase o dobro do seu.

The seam, and how to run it

O pipeline que faz sentido não é uma escolha entre esses dois, mas uma divisão: o scorer cuida das decisões enumeradas, e um modelo de fronteira cuida de tudo cuja resposta não é uma lista. Uma triagem de suporte que encaminha para uma de seis equipes e classifica a urgência numa escala de três pontos não precisa de 95 bilhões de parâmetros ativos; precisa de uma probabilidade e um limiar. Já o caminho de escalonamento que acaba escrevendo uma resposta ao cliente, esse sim precisa.

Essa divisão tem uma forma operacional. O Intern-Decision-2B não está no OrcaRouter — nossa página de modelo para ele retorna 404 e não há nenhuma rota hospedada em lugar algum que tenhamos conseguido encontrar —, então ele roda no seu próprio hardware, o que significa que é um componente que você opera e monitora. O Qwen3.8-Max é uma rota: uma chave para mais de 200 modelos, com o preço de lista do provedor repassado sem margem, o que significa que uma mudança de preço do fornecedor no modelo carro-chefe chega à sua fatura no mesmo dia em que acontece. Colocar a etapa hospedada do pipeline por trás dessa única superfície é o que mantém barata a etapa mais barata: o classificador mantém o volume de chamadas baixo, e o modelo de fronteira só é acionado para os casos que realmente precisam dele.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

Se você ainda está avaliando qual pontuador pertence a essa posição — este não tem avaliação independente, e sua calibração é a mais fraca de sua própria família — failover automático entre provedores é a forma de experimentá-lo em um caminho que já tenha uma alternativa funcional por trás, em vez de substituir essa alternativa de imediato.

O veredicto honesto

Se o seu problema é uma decisão sobre um conjunto de respostas que você consegue enumerar, e o estado cabe em oito mil tokens, o Intern-Decision-2B fará isso em trinta e três milissegundos de graça por chamada, e nenhum modelo de fronteira vai superá-lo nesse eixo, não importa quantos parâmetros você alugue. Coloque sua própria calibração nele antes de depender da confiança que ele relata.

Se o seu problema for qualquer outra coisa — raciocínio, contexto longo, uso de ferramentas, vídeo, um documento de um milhão de tokens, ou simplesmente uma resposta que ainda não foi escrita — o Qwen3.8-Max não é apenas melhor. É o único dos dois que consegue fazer o trabalho.

E se você ainda não consegue dizer qual desses dois você tem, a resposta provavelmente é que você tem ambos, no mesmo pipeline, que é a arquitetura que as contagens de parâmetros vinham silenciosamente lhe dizendo o tempo todo.