Um card de título para um artigo de comparação com o texto Intern-Decision-4B vs Qwen 3.8, com o subtítulo Uma passagem direta de 44 milissegundos contra 2,4 trilhões de parâmetros, com três ícones de linha plana sugerindo um pequeno e rápido pontuador, um grande modelo de raciocínio e uma comparação de custos.
Engineering & Research

Intern-Decision-4B vs Qwen 3.8: Uma passagem direta de 44 milissegundos contra 2,4 trilhões de parâmetros

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

InternLM publicou o Intern-Decision-4B no Hugging Face na manhã de 26 de setembro de 2026 — sem post de lançamento, sem entrada de blog, um link do GitHub no próprio model card que retorna 404 e um Space de demonstração que retorna 401. Os pesos são reais e baixáveis; o anúncio não está lá. E o modelo por trás deles é um ajuste fino do Qwen3.5-4B, e é isso que faz a comparação com o modelo principal hospedado valer mais do que uma ficha técnica. Esses dois não são rivais. São as duas pontas de um mesmo pipeline, e toda a questão é onde cai a linha entre eles. O núcleo subjacente é o modelo de 2,4 trilhões de parâmetros que o fornecedor publicou em agosto e agora serve como Qwen3.8-Max, cobrado a US$ 2,00 e US$ 6,00 por milhão de tokens; o Intern-Decision-4B é uma reconstrução de 4,54 bilhões de parâmetros daquele modelo base de sete meses, que não emite nenhum token, responde a até dezesseis perguntas tipadas em uma única passagem direta, e não custa nada por chamada porque não há saída para cobrar.

A resposta em uma linha: se sua tarefa é uma decisão com um conjunto fechado de respostas, o Intern-Decision-4B é cerca de cinquenta vezes mais rápido por decisão e estruturalmente mais barato, e nenhum modelo de fronteira vai superá-lo nesse eixo estreito. Se sua tarefa for qualquer outra coisa — raciocínio, contexto longo, uso de ferramentas, qualquer coisa em que a resposta não já esteja enumerada no seu prompt — o Qwen 3.8 não é apenas melhor, é o único dos dois que consegue fazer o trabalho. Tudo abaixo trata de encontrar essa linha com precisão.

O que está realmente confirmado e o que não está

Comece pelas evidências, porque o enquadramento importa. Não há anúncio do fornecedor para o Intern-Decision-4B. Nenhum comunicado à imprensa, nenhum artigo, nenhuma descrição de repositório para ler. O que existe hoje é um repositório do Hugging Face publicado esta manhã sob a internlm organização — Intern Large Models, o grupo do Shanghai AI Laboratory — com a licença Apache 2.0 e a licença Qwen upstream preservada ao lado dela como LICENSE-QWEN. Dois checkpoints irmãos surgiram com quarenta segundos de diferença: Intern-Decision-0.8B com 853 milhões de parâmetros e Intern-Decision-2B com 2,21 bilhões. Todos os três carregam as mesmas tags — tomada de decisão, multimodal, predição estruturada — e todos os três ficam sob uma coleção de modelos que ainda não resolve publicamente.

O que não está confirmado: se esta é a versão final ou um push antecipado. O repositório foi criado às 05:36 UTC e modificado novamente antes das 08:00 UTC do mesmo dia, e mais atividade pública nos checkpoints irmãos continuou depois das 09:00. A InternLM não disse qual é o plano de implantação pretendido, não publicou o repositório que referencia e não disse se um endpoint hospedado está por vir. Trate todas as métricas de benchmark neste artigo como informadas pelo fornecedor e não reproduzidas — porque, no momento em que escrevo, literalmente nada mais foi escrito sobre este modelo em lugar nenhum. Três caminhos de busca separados não retornam nada sobre o nome.

Screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the internlm organization, the image-text-to-text and transformers tags, 5B params, and the model card opening line describing a multimodal structured decision model fine-tuned from Qwen3.5-4B.

A aposta arquitetural: um pontuador, não um gerador

A frase mais importante na própria documentação do Intern-Decision-4B é uma negativa: o caminho de inferência "não chama generate() nem amostra texto de forma livre." Isso não é um detalhe de implementação, é o design inteiro, e é o que separa isso de chamar Qwen3.8-Max com um esquema JSON e torcer para que a chave feche.

Aqui está o mecanismo, como o cartão o descreve. Você entrega ao modelo um estado compartilhado, um esquema de perguntas nomeadas e, opcionalmente, até oito imagens. Cada pergunta é de um dos três tipos: escolha (escolher uma de um conjunto ordenado de opções), pontuação (avaliar em uma escala ordinal, retornada como um valor esperado ponderado por probabilidade), ou noul (um binário não/sim). O prompt do sistema, o estado, o esquema e um esqueleto JSON completo do assistente são renderizados com um marcador de posição por campo. Então — e este é o truque — o modelo executa uma passagem direta causal, e os logits são lidos na posição imediatamente antes de cada marcador de posição. Uma softmax é calculada apenas sobre os símbolos candidatos permitidos daquele campo, a calibração do checkpoint é aplicada, e os símbolos são mapeados de volta para os valores originais das suas opções.

As consequências são concretas. Como o espaço de resposta de cada campo é montado a cada requisição, em vez de embutido em uma cabeça de vocabulário, um esquema que você inventa hoje à tarde não exige retreinamento — adicione uma pergunta, e as opções se tornam símbolos candidatos para esse campo. Como não há loop de decodificação, não há token de saída, nem chave para esquecer, nem lógica de repetição em torno de JSON malformado. E como todas as perguntas são pontuadas a partir da mesma leitura do estado, dezesseis perguntas custam uma passagem direta, não dezesseis.

Os limites são igualmente concretos, e o card os declara sem rodeios. De uma a dezesseis perguntas, até 62 opções por pergunta, até oito imagens. Um máximo padrão de 8.192 tokens — e entradas que o excedem são rejeitadas sem truncamento. Essa última cláusula é uma decisão de projeto que vale a pena considerar com calma: o truncamento silencioso é justamente como um classificador passa discretamente a responder a uma pergunta diferente da que você fez, e a InternLM optou por falhar de forma ruidosa. É a decisão certa, e também é uma armadilha operacional, porque uma longa sequência de tickets somada a um schema e a imagens vai ultrapassar 8.192 mais cedo do que você imagina e não há caminho elegante — você recebe um erro.

Onde o Intern-Decision-4B vence, e não é por pouco

Dois eixos, e ambos são estruturais em vez de incrementais.

• Latência por decisão — 44,16 ms de média, 44,03 ms de mediana, 44,60 ms no p95, medidas em uma única RTX 4090 através do caminho local do Hugging Face. Em comparação com o Qwen3.8-Max, cuja janela ativa de sete dias em nosso próprio playground mostra um p50 de 2.474 ms e um p95 de 9.789 ms a 55,4 tokens de saída por segundo. Isso é aproximadamente 56× na mediana, e a comparação não é tanto injusta quanto é entre duas operações diferentes: um modelo classifica, o outro raciocina e depois escreve. A diferença é real e o motivo dela também.

• Custo por decisão — e este é um cálculo aritmético, não uma opinião. Considere uma chamada realista de triagem de suporte: 800 tokens de entrada de estado e esquema, e 150 tokens de saída de JSON estruturado. No Qwen3.8-Max, isso é 800 × $2,00/M mais 150 × $6,00/M, ou cerca de $0,0025 por decisão, antes mesmo de um único token de raciocínio — e o Qwen3.8-Max é um modelo de raciocínio, então o lado da saída é otimisticamente pequeno. Um milhão de decisões custa aproximadamente $2.500. O mesmo milhão de decisões no Intern-Decision-4B custa zero em tokens e cerca de 12,3 horas de tempo de RTX 4090. O Intern-Decision-4B não tem preço de saída porque não tem saída.

A troca é honesta e óbvia: o 4B precisa de uma GPU que você possui ou aluga, ele ocupa essa GPU e só consegue fazer uma única coisa. Mas, se essa única coisa é o que seu produto faz milhões de vezes por dia, a aritmética acima é o caso de negócio inteiro, e nenhuma capacidade de modelo de fronteira muda isso.

O número que o Qwen 3.8 não publica: calibração

Este é o diferencial silencioso, e é o que a maioria das comparações vai deixar passar porque não se parece com um benchmark.

O Intern-Decision-4B retorna uma distribuição sobre os valores das suas opções, e não apenas um rótulo — mais uma medida de confiança e, para perguntas noul, a probabilidade calibrada de "sim". O InternLM reporta uma pontuação de Brier de 0,347 e um erro de calibração esperado de 0,065 na sua própria suite, e inclui a temperatura ajustada no checkpoint: 1,99241824, ajustada separadamente para este tamanho por minimização da log-verossimilhança negativa em 1.728 casos de calibração designados, com 1.693 casos de validação reservados. Os rótulos do conjunto de testes não foram utilizados para a selecionar. Existe um segundo diagnóstico independente de 96 casos no cartão, que recorre a distribuições de referência exatas em vez de rótulos amostrados, e mostra o Brier/ECE global a passar de 0,628 / 0,213 antes da calibração para 0,550 / 0,089 depois — com o passo de calibração a reduzir o erro esperado em bem mais de metade.

Agora procure o mesmo número do lado do Qwen 3.8. Ele não está lá. A Alibaba publica pontuações do Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking e recall de contexto longo — todas medidas de capacidade. Não publica nenhuma métrica de calibração para nenhum membro da família Qwen 3.8, porque a confiança de um modelo generativo não é uma quantidade que o fornecedor entrega. Se o seu sistema precisa de uma probabilidade que possa servir de limiar ou de base para roteamento, em vez de uma resposta em que precise confiar, essa diferença não é uma questão de grau. Um modelo fornece um número com uma taxa de erro documentada; o outro fornece texto, e você constrói sua própria estimativa de confiança em torno dele.

Onde o Qwen 3.8 vence, e não é nem de perto

Coloque os dois lado a lado quanto ao que se pode pedir que façam e as fronteiras deixam de ser sutis.

• Contexto — Qwen3.8-Max possui uma janela de 1.000.000 de tokens. Intern-Decision-4B rejeita qualquer coisa além de 8.192. Isso é um fator de 122, e não há contorno, porque o limite de entrada é imposto em vez de truncado.

• Modalidade de entrada — o Qwen3.8-Max aceita texto, imagem e vídeo. O Intern-Decision-4B aceita texto e imagens, até oito, e os tokens de imagem contam para o mesmo orçamento de 8.192.

• Raciocínio e ferramentas — O Qwen3.8-Max inclui uso de ferramentas, modo JSON e raciocínio entre suas capacidades declaradas, e registra um Artificial Analysis Intelligence Index de 45,4, ficando em décimo quinto entre 145 modelos indexados, com uma pontuação AA Coding de 76,2, na nona posição entre 138. Esses são números independentes publicados pela Artificial Analysis, não alegações do fornecedor. O Intern-Decision-4B não tem entrada na Artificial Analysis, nenhuma pontuação independente de qualquer tipo e nenhuma capacidade de raciocinar, planejar ou chamar qualquer coisa.

• Saída aberta — Qwen3.8-Max escreve. Intern-Decision-4B não consegue produzir um parágrafo, uma justificativa ou um plano. Só consegue pontuar as opções que você já pensou em listar.

Vale a pena observar também no lado dos pesos abertos: se você quer o próprio núcleo do Qwen 3.8 e não a rota hospedada, o Qwen3.8-27B é o irmão denso — 27,8 bilhões de parâmetros, Apache 2.0, um contexto de 262.144 tokens e aproximadamente US$ 0,33 / US$ 2,40 por milhão de tokens onde é servido. Ele pontua 33,7 no AA Intelligence Index. Ainda é uma ordem de magnitude maior que o Intern-Decision-4B, ainda é generativo e ainda é a ferramenta errada para uma decisão de conjunto fechado em volume — mas é a opção intermediária honesta, e a única das três que é genuinamente barata e genuinamente capaz ao mesmo tempo.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the on-page navigation for code samples, pricing, performance, public benchmarks, community buzz, how it compares and FAQ, with the model name and vendor breadcrumb at the top.

Lendo honestamente a própria tabela de benchmarks da InternLM

O card do Intern-Decision-4B traz uma tabela comparativa, e o que está ausente dela é mais informativo do que o que está nela. As linhas são Jev, Laya, SemIf, Kev, JevK5 e os próprios 0.8B e 2B do InternLM. Cada uma delas é outra entrada de System One ou de modelo de decisão — Jev da TypeSafe AI, Laya da Convai Innovations, e três outras. Todos os números são informados pelos fornecedores nos próprios harnesses da InternLM. Não há absolutamente nenhum modelo de fronteira na tabela.

Isso não é um descuido. É o escopo honesto da alegação. A média principal do Intern-Decision-4B de 90,02 em sete suítes — Jevbench-Easy 100,00, Jevbench-Original 98,61, Jevbench-Hard 73,87, Typed Decision 80,55, ToolACE 96,45, AG News 90,82, WildJailBreak 89,86 — é uma alegação de liderar a categoria de modelos de decisão, o que ele faz nesta tabela, superando o 88,74 do Jev e o 57,77 do Laya. Não é uma alegação de competir com o Qwen 3.8, e a InternLM não faz essa alegação em lugar nenhum. O cartão do modelo está restrito à sua própria categoria, e ler uma vitória de categoria como uma vitória de capacidade é o erro que esta seção existe para prevenir.

Mais duas ressalvas. Os números de latência — média de 44 ms numa 4090 — são medidos pelo fornecedor, dependem da carga de trabalho e do hardware, e um forward pass em uma única GPU não é a mesma medição que uma chamada a uma API hospedada, que inclui ida e volta pela rede e enfileiramento. E o piloto de calibração tem 96 casos: é um diagnóstico, não um benchmark, e o card diz isso.

A questão da implantação, que é a verdadeira bifurcação.

Esqueça os benchmarks por um momento e pergunte o que cada um exige de você operacionalmente.

O Intern-Decision-4B ocupa aproximadamente 9,1 GB em disco em bf16 — dois shards de linguagem de 4,26 GB e 4,15 GB, uma torre de visão de 612 MB e um projetor de 54 MB. Ele carrega por meio de um inference.py de 16 KB fornecido no próprio repositório, com uma classe DecisionEngine que você instancia uma vez e reutiliza. Um dict Python de entrada, um dict de resposta de saída, com requisito de Python 3.12+. Ele roda em 44 ms em uma 4090, e o irmão de 0,8B é pequeno o suficiente para raciocinar sobre ele com muito menos. Mas o módulo é a interface — não há servidor, nem endpoint compatível com OpenAI, nem API hospedada. Você está construindo o serviço ao redor dele, e se precisar de dois deles para failover, também está construindo isso.

O lado generativo do mesmo pipeline é uma decisão completamente diferente, e é para isso que um roteador realmente serve. Qwen3.8-Max e Qwen3.8-27B podem ambos ser chamados no OrcaRouter por trás da mesma chave compatível com a OpenAI, a preço de tabela do provedor, com 0% de markup repassado — por isso, quando a Alibaba altera o preço de um Qwen, ele entra em vigor do nosso lado no mesmo dia, e não no próximo ciclo de faturamento. O Intern-Decision-4B não é uma das nossas rotas e não será até que a InternLM o hospede em algum lugar; não vamos fingir o contrário. O que cobrimos é a metade deste pipeline que é uma chamada de rede: uma chave para mais de 200 modelos, failover automático se o Qwen3.8-Max se degradar — a sua taxa de erro ao vivo de sete dias é de 1,78% — e a capacidade de fazer A/B entre os dois níveis do Qwen 3.8 no mesmo caminho de requisição antes de se comprometer com qualquer um deles.

Esse é o padrão que vale a pena levar. Execute o scorer localmente, porque ele é barato e rápido e faz bem uma única coisa específica. Encaminhe a etapa de raciocínio, porque é onde o churn de fornecedores, os cortes de preço e as indisponibilidades realmente acontecem.

A two-column comparison scoreboard titled Intern-Decision-4B vs Qwen 3.8 — the scoreboard, contrasting 44 ms per decision, about $0 in tokens per million decisions, an 8,192-token context, text plus 8 images, a published Brier of 0.347 and no open-ended output on the left against 2,474 ms p50 hosted, about $2,500 per million, a 1,000,000-token context, text, image and video, no published calibration and open-ended reasoning on the right.

Qual deles você deveria realmente escolher

Escolha o Intern-Decision-4B se a sua decisão for de conjunto fechado, se as suas respostas forem enumeráveis em um prompt, se você executar a mesma decisão em grande volume e se você se importar com a probabilidade tanto quanto com o rótulo. Roteamento de tickets, moderação de conteúdo com base em uma taxonomia fixa, extração estruturada para um esquema que você controla, rubricas de avaliação, portões binários — qualquer coisa em que um humano pudesse ter escrito a lista de opções de antemão. Os 4,54 bilhões de parâmetros são honestos quanto ao teto: o próprio card mostra o 4B em 73,87 no Jevbench-Hard contra 100,00 no Easy, então quanto mais difícil o formato da decisão, mais o modelo pequeno deixa a desejar.

Escolha o Qwen 3.8 — ou seja, Qwen3.8-Max se você quiser o núcleo hospedado, Qwen3.8-27B se quiser pesos que você pode manter — se a resposta não for enumerável de antemão, se a entrada tiver mais de 8.192 tokens, se você precisar de uma justificativa que possa mostrar a um humano, se precisar de chamadas de ferramentas ou se precisar de vídeo. Escolha-o também se você simplesmente não quiser operar uma GPU: 12,3 horas de uso de 4090 por milhão de decisões só é barato se você já tiver a 4090 e algo mais para fazer com ela nos outros 363 dias.

Escolha ambos se o seu pipeline tiver o formato que a maioria dos pipelines realmente tem — um classificador barato de conjunto fechado na frente, um modelo de fronteira atrás dele para os casos em que o classificador estiver em dúvida. É para essa configuração que a confiança calibrada do Intern-Decision-4B foi criada, e é por isso que o número de ECE acima importa mais do que a média principal.

O que assistir

Três perguntas em aberto, todas respondíveis em poucos dias. O InternLM publica o repositório do GitHub para o qual seu próprio card aponta — atualmente um 404 — e, com ele, uma descrição de treinamento? Um anúncio vem depois dos pesos, convertendo um push discreto em um lançamento documentado? E algo independente reproduz a média de 90,02, ou o 0,347, em hardware que é da InternLM?

Há uma pequena inconsistência a observar enquanto você espera, porque é o tipo de coisa que importa quando você está dimensionando uma implantação. O modelo se chama 4B. A contagem de parâmetros é 4.539.265.536 — 4,54 bilhões. O irmão 0.8B tem 853 milhões e o irmão 2B tem 2,21 bilhões, ambos arredondando para cima ou para baixo por um triz. Só o 4B arredonda para baixo em mais de meio bilhão. Não é um problema. É um lembrete de que, em um lançamento não anunciado, a documentação é a única especificação que você tem, e até a documentação ainda está sendo editada.