
Intern-Decision-2B vs Qwen 3.8: Um Backbone, Duas Tarefas Muito Diferentes
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 584 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Abra a configuração de internlm/Intern-Decision-2B e a configuração de Qwen/Qwen3.5-2B lado a lado e quase nada difere. As mesmas 24 camadas, o mesmo tamanho oculto de 2.048, as mesmas 8 cabeças de consulta contra 2 cabeças de chave-valor, a mesma dimensão de cabeça de 256, o mesmo teto de embedding de 262.144 posições, o mesmo vocabulário de 248.320 tokens, o mesmo padrão repetitivo de três camadas de atenção linear para uma camada de atenção completa. O Intern-Decision-2B não é uma arquitetura nova. É aquele backbone com sua capacidade de gerar texto removida e sua confiança calibrada — e é essa única subtração que faz com que a comparação com Qwen3.8-Max, o carro-chefe de 2,4 trilhões de parâmetros a que todo o nome da família "Qwen 3.8" se refere no extremo superior, valha mais do que uma contagem regressiva de parâmetros.
Os dois não são concorrentes e o confronto não é uma disputa. O Intern-Decision-2B é um fine-tune de 2.213.241.664 parâmetros do Qwen3.5-2B, enviado ao Hugging Face às 05:36 UTC de 26 de setembro de 2026, entre três irmãos não anunciados, e não emite tokens: ele recebe um estado e perguntas tipadas, executa um forward pass causal, lê os logits em posições fixas de placeholder e retorna uma distribuição calibrada por campo. O Qwen3.8-Max é o carro-chefe hospedado da Alibaba, um modelo esparso de mistura de especialistas com cerca de 95 bilhões de parâmetros ativos por token, uma janela de contexto multimodal de 1 milhão de tokens e preço de tabela de US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída. Um é um componente. O outro é um serviço. A pergunta útil é onde fica a fronteira entre eles em um pipeline pelo qual você já está pagando.
A subtração, precisamente
Vale a pena enunciar com exatidão o que o ajuste de decisão mudou, porque isso esclarece o que o modelo base já carregava.
A tarefa é denominada no repositório como modelagem de linguagem mascarada autorregressiva. A entrada do assistente contém um esqueleto JSON completo com um token <decision> por campo; os símbolos de resposta de referência aparecem apenas nos rótulos, nunca na entrada. O treinamento usa alinhamento causal comum de próximo token, em que o logit imediatamente antes de um marcador prevê a resposta desse campo, e todos os campos compartilham uma única passagem direta. Na inferência, os logits são restritos aos símbolos de resposta válidos de token único — A–Z, a–z, 0–9, que é de onde vem o teto de 62 opções — depois passam por softmax e são mapeados de volta para seus rótulos.
Então, o mecanismo de próximo token do modelo base está intacto e inalterado. O que foi treinado é uma preferência por ocupar uma entre um punhado de posições de resposta em vez de continuar uma frase, além de uma temperatura específica do checkpoint de 2,100509348278, ajustada por log-verossimilhança negativa sobre 1.728 casos de calibração designados, com 1.693 mantidos de fora. O cartão é inequívoco quanto a geração estar fora de questão: a API "executa pontuação estruturada de candidatos. Ela não chama generate() nem faz amostragem de texto de forma livre."
O repositório também registra o que o ajuste não tocou: ele "faz fine-tuning do backbone de linguagem do Qwen3.5 enquanto congela a torre de visão e o projetor". O shard de visão de 612.517.440 bytes no 2B tem a mesma contagem de bytes que no checkpoint de decisão 4B, o que se encaixa em componentes herdados, e não treinados. O caminho da imagem funciona; simplesmente não foi aquilo em que a etapa de decisão gastou seu orçamento.

O que 2,2 bilhões de parâmetros não conseguem fazer, e o que os 2,4 trilhões fazem em vez disso
Tudo se separa num único eixo: se a tua resposta já existe como uma lista.
Intern-Decision-2B responde a um conjunto fechado. De uma a dezesseis perguntas, até 62 opções cada, até oito imagens, tudo dentro de um orçamento de 8.192 tokens que o motor prefere recusar a truncar. Retornado como probabilidades. A 33,28 ms de média por solicitação em uma única RTX 4090, com P95 de 33,55 ms, e nada cobrado por chamada, porque não há saída para cobrar.
Qwen3.8-Max escreve. Um contexto de 1 milhão de tokens, entrada de texto, imagem e vídeo, raciocínio com um modo de pensamento, chamada nativa de ferramentas, saídas estruturadas, até 131.000 tokens de saída na build datada de 0902. Ele também pode, em princípio, tomar a mesma decisão de roteamento que o Intern-Decision-2B toma — você pode instruí-lo via prompt a escolher entre opções e retornar JSON. Três coisas dão errado quando você faz isso. Você paga pelos tokens que ele gasta decidindo. Você recebe uma string cujo parse pode ou não ter sucesso. E o número dentro dessa string é o que quer que o sampler tenha produzido, não um softmax que você possa limitar em 0,8 e usar para agir.
Ambos os relatos são verdadeiros e nenhum cancela o outro. O carro-chefe de 2,4 trilhões de parâmetros existe porque a maioria dos problemas não são conjuntos fechados. O pontuador de 2,2 bilhões existe porque o subconjunto que é merece um instrumento mais barato.
Placar

• Parâmetros — Intern-Decision-2B 2.213.241.664 em BF16, além de uma torre de visão e um projetor, cerca de 4,46 GB em disco; Qwen3.8-Max aproximadamente 2,4 trilhões no total, com cerca de 95 bilhões ativos por token, servido, não baixado.
• Contexto — 8.192 tokens, rejeitado acima; 1.000.000 de tokens com 131.000 de saída máxima na build 0902.
• Saída — probabilidades calibradas e um argmax, sem texto gerado; texto gerado incluindo um traço de raciocínio.
• Modalidades de entrada — texto mais até oito imagens; texto, imagem e vídeo.
• Custo — sem cobrança por chamada, e você é dono da GPU; US$ 2,00 por milhão de tokens de entrada, US$ 6,00 por milhão de saída, com leituras de cache a US$ 0,25 e gravações de cache a US$ 2,50.
• Evidência publicada — uma tabela de fornecedor com sete suítes, com média de 84,68, Brier 0,437 e ECE 0,100 em 10.751 linhas de teste, não reproduzida por ninguém fora da InternLM, em um checkpoint com uma curtida e zero downloads; um Artificial Analysis Intelligence Index de 45,4 na posição 15 de 145 e um AA Coding index de 76,2 na posição 9 de 138, ambos medidos de forma independente.
• Latência — média de 33,28 ms por solicitação em uma RTX 4090, diminuindo à medida que o processamento em lote é adicionado; 2,655 segundos de P50 até o primeiro token, conforme o catálogo reporta, aumentando com a carga.
As linhas de evidência não são equivalentes e não deveriam ser impressas como se fossem. O carro-chefe da Alibaba tem por trás uma pontuação de índice independente. O checkpoint da InternLM tem uma tabela produzida pelos próprios autores, e o valor de calibração, em especial, deveria ser lido como uma intenção bem documentada até encontrar os dados de outra pessoa — tanto mais aqui, porque este tamanho específico apresenta o pior erro de calibração esperado dos três que a InternLM lançou, 0,100 contra 0,066 para o modelo com metade do seu tamanho e 0,065 para o que tem quase o dobro do seu.
The seam, and how to run it
O pipeline que faz sentido não é uma escolha entre esses dois, mas uma divisão: o scorer cuida das decisões enumeradas, e um modelo de fronteira cuida de tudo cuja resposta não é uma lista. Uma triagem de suporte que encaminha para uma de seis equipes e classifica a urgência numa escala de três pontos não precisa de 95 bilhões de parâmetros ativos; precisa de uma probabilidade e um limiar. Já o caminho de escalonamento que acaba escrevendo uma resposta ao cliente, esse sim precisa.
Essa divisão tem uma forma operacional. O Intern-Decision-2B não está no OrcaRouter — nossa página de modelo para ele retorna 404 e não há nenhuma rota hospedada em lugar algum que tenhamos conseguido encontrar —, então ele roda no seu próprio hardware, o que significa que é um componente que você opera e monitora. O Qwen3.8-Max é uma rota: uma chave para mais de 200 modelos, com o preço de lista do provedor repassado sem margem, o que significa que uma mudança de preço do fornecedor no modelo carro-chefe chega à sua fatura no mesmo dia em que acontece. Colocar a etapa hospedada do pipeline por trás dessa única superfície é o que mantém barata a etapa mais barata: o classificador mantém o volume de chamadas baixo, e o modelo de fronteira só é acionado para os casos que realmente precisam dele.

Se você ainda está avaliando qual pontuador pertence a essa posição — este não tem avaliação independente, e sua calibração é a mais fraca de sua própria família — failover automático entre provedores é a forma de experimentá-lo em um caminho que já tenha uma alternativa funcional por trás, em vez de substituir essa alternativa de imediato.
O veredicto honesto
Se o seu problema é uma decisão sobre um conjunto de respostas que você consegue enumerar, e o estado cabe em oito mil tokens, o Intern-Decision-2B fará isso em trinta e três milissegundos de graça por chamada, e nenhum modelo de fronteira vai superá-lo nesse eixo, não importa quantos parâmetros você alugue. Coloque sua própria calibração nele antes de depender da confiança que ele relata.
Se o seu problema for qualquer outra coisa — raciocínio, contexto longo, uso de ferramentas, vídeo, um documento de um milhão de tokens, ou simplesmente uma resposta que ainda não foi escrita — o Qwen3.8-Max não é apenas melhor. É o único dos dois que consegue fazer o trabalho.
E se você ainda não consegue dizer qual desses dois você tem, a resposta provavelmente é que você tem ambos, no mesmo pipeline, que é a arquitetura que as contagens de parâmetros vinham silenciosamente lhe dizendo o tempo todo.
