
Intern-Decision-0.8B vs Qwen 3.8: 853 Milhões de Parâmetros e um Conjunto Fechado de Respostas
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 592 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
O Intern-Decision-0.8B é o menor de três modelos de decisão que a InternLM publicou no Hugging Face na manhã de 26 de setembro de 2026, e não é o mais rápido deles. Essa é a primeira coisa que vale a pena saber. Nas medições do próprio laboratório, o modelo irmão de 2B roda marginalmente mais rápido — 33,28 ms contra 33,98 ms — e marca seis pontos a mais na mesma média de sete suítes, de modo que a razão habitual para recorrer a um checkpoint abaixo de um bilhão de parâmetros, a velocidade bruta, não se aplica aqui. O que se aplica é o tamanho: 852.985.920 parâmetros, 1,71 GB de pesos bf16, pequeno o bastante para permanecer permanentemente na folga de uma máquina que tem outra coisa a fazer. Compare isso com o Qwen3.8-Max — a versão hospedada do núcleo esparso de mistura de especialistas de 2,4 trilhões de parâmetros que o fornecedor publicou em agosto, com preço de US$ 2,00 e US$ 6,00 por milhão de tokens — e os dois não competem pelo mesmo trabalho. Um retorna uma distribuição de probabilidade sobre opções que você forneceu de antemão. O outro escreve.
A resposta curta: o Intern-Decision-0.8B vale a pena se você precisa de uma decisão de conjunto fechado pontuada em hardware que você já possui, e se 1,71 GB em vez de 4,43 GB for a diferença entre lançar e não lançar. Ele não vale a pena se você quer o scorer pequeno mais preciso que a InternLM lançou esta semana — que é o 4B — ou se a sua resposta ainda não estiver enumerada no seu prompt, caso em que nenhum desses dois é a ferramenta certa, e o Qwen 3.8 é o único do par que consegue, de fato, fazer o trabalho.
O que o repositório diz, e o que nada mais diz
Comece pelas evidências, porque há muito poucas. A InternLM não fez nenhum anúncio para este modelo. Nenhuma postagem de lançamento, nenhum artigo, nenhuma descrição de repositório. O cartão do Hugging Face traz links para um Space de demonstração e um repositório do GitHub e, no momento em que escrevo, o Space retorna 401 e o link do GitHub retorna 404 — os dois lugares que o cartão indica para mais informações estão fechados. Três checkpoints apareceram com quarenta segundos de diferença entre si, por volta de 05:36 UTC de 26 de setembro: Intern-Decision-0.8B, Intern-Decision-2B e Intern-Decision-4B, todos com as mesmas tags — tomada de decisão, multimodal, predição estruturada — e todos são fine-tunes de checkpoints do Qwen, neste caso Qwen3.5-0.8B.
O que é possível saber a partir do repositório é excepcionalmente preciso para um lançamento não anunciado, porque o laboratório enviou seu próprio módulo de inferência junto com os pesos. O 0.8B carrega por meio de um arquivo de 16 KB, inference.py, no diretório do modelo, exige Python 3.12 ou mais recente e torch 2.9.1 com transformers 5.14.1, e expõe uma classe DecisionEngine que você instancia uma vez e reutiliza. Um dict Python na entrada, um dict de resposta na saída. O que não é possível saber: se este é um lançamento finalizado ou um envio antecipado, se um endpoint hospedado está por vir, e se os dois checkpoints entre os quais ele se encontra devem ser o mesmo produto em tamanhos diferentes ou três produtos diferentes que por acaso compartilham um nome. Ninguém fora da InternLM executou nenhum deles.

O problema do irmão: o 2B é mais rápido e melhor
Aqui está a parte da própria tabela publicada da InternLM que torna o 0.8B difícil de posicionar. Lendo os três tamanhos pelas mesmas sete suítes:
• Velocidade — 0.8B: 33,98 ms de média, 33,44 ms de mediana, 37,50 ms no p95. 2B: 33,28 ms, 33,15 ms, 33,55 ms. 4B: 44,16 ms, 44,03 ms, 44,60 ms. Todas medidas por consulta em uma única RTX 4090 pelo caminho local do Hugging Face.
• Média das sete suítes — 0,8B: 79,38. 2B: 84,68. 4B: 90,02.
• Calibração — 0.8B: Brier 0.530, ECE 0.066. 2B: Brier 0.437, ECE 0.100. 4B: Brier 0.347, ECE 0.065.
• Ocupação em disco em bf16 — 0,8B: 1,71 GB. 2B: 4,43 GB. 4B: 9,08 GB.
O 2B é mais rápido na média, tem uma cauda dramaticamente mais estreita e é mais preciso — tudo ao mesmo tempo. Portanto, "menor significa mais rápido" é falso nesta família — duas vezes, já que o 4B é mais lento que ambos. O único eixo em que o 0.8B vence de forma absoluta é aquele que ninguém mede em benchmarks: 1,71 GB contra os 4,43 GB do 2B e os 9,08 GB do 4B. Se você está colocando um scorer em um orçamento fixo de memória — uma pequena máquina sempre ligada, uma GPU compartilhada, um nó de borda com um modelo de linguagem já ocupando a maior parte da placa — esse é todo o argumento, e é um argumento real.
O restante da tabela é um estudo de onde modelos pequenos falham de forma desigual. A pontuação do 0,8B em Typed Decision é 77,35 contra os 80,55 do 4B — três pontos de diferença com um quinto da contagem de parâmetros. Mas o Jevbench-Original cai de 98,61 para 80,56, e o WildJailBreak despenca de 89,86 para 64,48. Seja lá o que essas duas suítes estejam medindo — o card não diz, e o card não fornece nenhuma definição de suíte —, são elas que punem mais duramente o checkpoint pequeno. Um modelo que se sustenta em um eixo e cai de um penhasco em dois outros não é um modelo uniformemente mais fraco. É um modelo com uma fronteira de competência específica, e você iria querer saber onde sua carga de trabalho se situa antes de comprometer a frota com ele.
Mais uma ressalva sobre a linha de calibração. O ECE de 0,066 do 0.8B é seu melhor número — melhor que o 0,095 de Jev na mesma suíte —, enquanto seu escore de Brier de 0,530 é pior que o 0,358 de Jev. Erro calibrado e erro quadrático médio de probabilidade não são a mesma medida, e uma tabela que mostra um parecendo forte e o outro parecendo fraco está dizendo que a distribuição é bem formada perto de seus picos de confiança e mais gorda do que deveria ser no meio. Se seu sistema aplica limiares com base na confiança, essa distinção importa mais do que a média.
O que 1,71 GB realmente compra
O caminho de inferência neste modelo é um pontuador, não um gerador, e a diferença de custo é estrutural, não incremental. Você fornece a ele um estado compartilhado, um esquema de perguntas nomeadas e, opcionalmente, até oito imagens. Cada pergunta é uma de três tipos: escolha (uma de um conjunto ordenado de opções), pontuação (uma escala ordinal, retornada como um valor esperado ponderado por probabilidade), ou noul (binário não/sim). O estado, o esquema e um esqueleto JSON completo do assistente são renderizados com um placeholder por campo, o modelo executa uma única passagem direta causal, e os logits são lidos na posição imediatamente antes de cada placeholder. Uma softmax é aplicada apenas sobre os símbolos candidatos permitidos daquele campo, a calibração ajustada do checkpoint é aplicada, e os símbolos são mapeados de volta para os valores das suas opções.
Três consequências decorrem disso. Não há token de saída e, portanto, não há preço de saída — um milhão de decisões não custa nada em tokens. Não há laço de decodificação nem chave para esquecer, então JSON malformado não é um modo de falha. E, como o espaço de respostas de cada campo é montado a cada requisição, um esquema que você inventa hoje à tarde não precisa de retreinamento: adicione uma pergunta e suas opções se tornam símbolos candidatos para esse campo.
Os limites são declarados de forma igualmente direta. De uma a dezesseis perguntas, até 62 opções cada, até oito imagens, e um limite padrão de 8.192 tokens — com entradas que o ultrapassam sendo rejeitadas em vez de truncadas. Essa última cláusula é uma decisão de projeto sobre a qual vale a pena refletir, pois o truncamento silencioso é como um classificador começa, sem alarde, a responder a uma pergunta diferente da que você fez. O InternLM, em vez disso, falha de forma ruidosa, o que é correto e também uma armadilha operacional: uma longa thread de tickets mais um esquema mais imagens ultrapassarão 8.192 mais cedo do que você espera, e não há caminho elegante quando isso acontece.
E os 1,71 GB compram uma economia de tempo de execução que você pode calcular. A 33,98 ms por decisão, um milhão de decisões equivale a 9,44 horas de uma RTX 4090. O 4B precisa de 12,3 horas para o mesmo milhão e abre mão de dez pontos e meio de acurácia em troca dos 7,37 GB que você não tinha. Nenhum dos dois números inclui o custo da máquina, e nenhum inclui a parte que as pessoas esquecem: você está operando um serviço, e não há servidor no repositório.

O Qwen 3.8 não é um único modelo, e o mais barato é o que merece atenção
Qwen 3.8, considerado como um nome autônomo, é o Qwen3.8-2.4T-A95B: o núcleo esparso de mistura de especialistas com 2,4 trilhões de parâmetros que a Alibaba publicou como pesos abertos em 12 de agosto de 2026, com cerca de 95 bilhões de parâmetros ativos por token e uma licença personalizada em vez da Apache 2.0. A entrega hospedada desse mesmo núcleo é o Qwen3.8-Max, disponível em geral em uma API paga desde 3 de agosto e atualizada como um snapshot datado de 2 de setembro. Eles são um cérebro vendido de duas maneiras, e a segunda entrega é a que a maioria das pessoas realmente chamará.
Em números independentes, a Artificial Analysis mede o snapshot de setembro do Qwen3.8-Max com um Intelligence Index de 45,4 — décimo quinto de 145 modelos indexados — com uma pontuação AA Coding de 76,2 em nono lugar entre 138, GPQA Diamond em 92,8, Humanity's Last Exam em 43,1 e uma pontuação de recall de contexto longo de 80,3. O checkpoint aberto fica atrás da API da qual foi destilado, em 39,9. Na nossa própria janela de playground de sete dias, o Qwen3.8-Max fica em um p50 de 2.578 ms e um p95 de 9.539 ms a 55,5 tokens de saída por segundo, com uma taxa de erro de 1,57%. O Qwen3.8-Max pode ser chamado no OrcaRouter ao preço de tabela do provedor com 0% de markup adicionado, portanto, uma mudança de preço da Alibaba entra em vigor do nosso lado no mesmo dia, em vez de no próximo ciclo de cobrança.
O irmão denso é aquele que deve ser medido em relação a um checkpoint local de 1,71 GB, no entanto, porque é a forma mais barata de adquirir capacidade geral nesta família. O Qwen3.8-27B é Apache 2.0, tem um contexto nativo de 262.144 tokens, e o Qwen3.8-27B custa $0,33 e $2,40 por milhão de tokens no nosso catálogo. O seu Artificial Analysis Intelligence Index é 33,7. Tem aproximadamente trinta e duas vezes a contagem de parâmetros do Intern-Decision-0.8B, continua a ser generativo e continua a ser o instrumento errado para uma decisão de conjunto fechado em volume — mas é a opção intermédia honesta, e o único membro desta comparação que é genuinamente barato e genuinamente geral ao mesmo tempo.
Pontuador contra gerador, dito de forma simples
• Contexto — Qwen3.8-Max carrega uma janela de 1.000.000 de tokens. Intern-Decision-0.8B rejeita qualquer coisa além de 8.192. Um fator de 122, imposto em vez de truncado.
• Entrada — Qwen3.8-Max aceita texto, imagem e vídeo. Intern-Decision-0.8B aceita texto e até oito imagens, e os tokens de imagem são contabilizados no mesmo limite de 8.192.
Saída — Qwen3.8-Max escreve, raciocina, chama ferramentas e emite JSON quando solicitado. O Intern-Decision-0.8B não consegue produzir um parágrafo, uma justificativa ou um plano. Ele só consegue pontuar as opções que você já pensou em listar.
• Custo por chamada — uma chamada de triagem realista de 800 tokens de entrada e 150 tokens de saída custa cerca de US$ 0,0025 no Qwen3.8-Max, antes de quaisquer tokens de raciocínio, e o volume de saída é otimisticamente pequeno, porque é um modelo de raciocínio. Um milhão dessas chamadas custa aproximadamente US$ 2.500. O Intern-Decision-0.8B não tem absolutamente nenhum preço por token: um milhão de decisões equivale a 9,44 horas de uma 4090 que você possui ou aluga.
• Latência — 2.578 ms na mediana no Qwen3.8-Max nos últimos sete dias, incluindo rede e enfileiramento. Os 33,98 ms do Intern-Decision-0.8B são um forward pass puro em uma placa local e não são a mesma medição; a comparação honesta é de uma ordem de grandeza, não oitenta vezes.
• Evidência — cada número do Intern-Decision-0.8B aqui é informado pelo fornecedor nas próprias estruturas de avaliação da InternLM e não foi reproduzido por ninguém, inclusive a latência. Todos os números do Qwen 3.8 são ou da própria Alibaba ou medições da Artificial Analysis, e estão rotulados separadamente acima.
• Pontuação independente — o Qwen3.8-Max tem uma. O Intern-Decision-0.8B não tem nenhuma de qualquer tipo, e nenhum provedor de inferência o implanta.

Duas maneiras de executar este pipeline
A bifurcação operacional é mais acentuada do que a bifurcação de benchmark. O Intern-Decision-0.8B é um módulo, não um serviço. Não há endpoint compatível com OpenAI, nem servidor de processamento em lote, nem verificação de saúde, nem política de retentativa, nem segunda réplica, a menos que você construa uma. Ele carrega em um único processo e responde a um dict por vez, e, se você precisar de failover, o failover é você. Essa é uma descrição justa de um checkpoint de pesquisa de 853 milhões de parâmetros publicado sem uma nota de lançamento, e isso deve ser devidamente ponderado na decisão.
A metade generativa do mesmo pipeline é uma chamada de rede, e é para isso que serve um roteador. Tanto o Qwen3.8-Max quanto o Qwen3.8-27B estão acessíveis por trás de uma única chave compatível com OpenAI, e o failover automático significa que um upstream degradado não se torna o seu incidente — vale mencionar aqui porque a taxa de erro ao vivo de sete dias do Qwen3.8-Max do nosso lado é de 1,57%, o que é baixa até ser a sua requisição. O padrão que faz sentido é o que este pareamento vem descrevendo discretamente: executar localmente o scorer barato de conjunto fechado, porque é rápido e não custa nada por chamada, e rotear a etapa de raciocínio, porque é aí que os cortes de preço, a rotatividade de modelos e as indisponibilidades realmente acontecem.
Duas coisas que não vamos afirmar. O Intern-Decision-0.8B não é uma das nossas rotas e não será até que a InternLM o hospede em algum lugar — não vamos insinuar o contrário. E hoje não hospedamos absolutamente nenhum modelo InternLM, então nada neste artigo é uma proposta para fazer o assunto passar por nós.
O que mudaria a resposta
Três perguntas em aberto, todas respondíveis em poucos dias. A InternLM publica o repositório do GitHub para o qual o próprio card dela aponta e, com ele, uma descrição de como esses pesos foram ajustados? Uma publicação de lançamento acompanha os checkpoints, convertendo um push discreto em um lançamento documentado com uma história de implantação declarada? E alguém independente reproduz a média de 79,38 ou o erro de calibração de 0,066 em hardware que não seja da InternLM?
Até que um desses chegue, a leitura honesta do Intern-Decision-0.8B é restrita e específica: ele é o pontuador de conjunto fechado mais barato de uma família de três, em um footprint que cabe onde seu próprio irmão mais rápido e mais preciso não cabe, publicado sem anúncio e sem o único artefato que diria para que ele foi ajustado. Se sua decisão é de conjunto fechado, suas respostas são enumeráveis em um prompt, e 1,71 GB é o número do qual sua implantação realmente depende, ele é a escolha certa e não há nada igual nesse tamanho. Se sua resposta não for enumerável de antemão, ou seu estado ultrapassar 8.192 tokens, ou você precisar de uma justificativa que possa mostrar a um humano, então a comparação nunca foi equilibrada — e o modelo que você quer nunca foi o de 853 milhões de parâmetros.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
