
Intern-Decision-4B: InternLM lançou um modelo de decisão que responde sem escrever um token
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 592 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 187 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Três repositórios de modelos surgiram na página da InternLM no Hugging Face em quarenta segundos, no dia 26 de setembro de 2026: Intern-Decision-0.8B às 05:35:57 UTC, Intern-Decision-2B às 05:36:19, e internlm/Intern-Decision-4B às 05:36:37. O 4B é o mais interessante. É um ajuste fino do Qwen3.5-4B que aceita um estado compartilhado, um esquema de perguntas nomeadas e imagens opcionais, e retorna uma distribuição de respostas calibrada para cada pergunta em uma única passagem direta. Ele nunca gera texto. Suas próprias notas de versão dizem isso explicitamente: "Esta API realiza pontuação estruturada de candidatos. Ela não chama generate() nem faz amostragem de texto livre." Quarenta segundos de uploads e nem uma linha de anúncio em lugar nenhum — nenhum post de blog, nenhum tweet, nenhum changelog, nenhuma página de lançamento. O que existe é um cartão de modelo, um inference.py, e quatro shards de safetensors.

O que foi entregue e o que não foi
A família é a primeira coisa a acertar, porque o card do 4B a carrega discretamente. Sua tabela de benchmark publica linhas para Intern-Decision-0.8B e Intern-Decision-2B ao lado das suas, e todos os três checkpoints chegaram ao hub no mesmo minuto. O repositório do 2B nunca é vinculado a partir do card do 4B — você precisa encontrá-lo pelo feed de uploads da organização.
O que não foi lançado é quase tudo o que um lançamento normalmente traz:
• Sem anúncio — zero cobertura na web, nenhuma declaração do fornecedor em qualquer idioma que conseguimos encontrar.
• Sem demo — o card aponta para um Space em huggingface.co/spaces/internlm/intern-decision; esse endpoint responde HTTP 401, o que significa que ele não é público, e não que esteja quebrado.
• Nenhuma coleção — a coleção de modelos anunciada em huggingface.co/collections/internlm/intern-decision também retorna 401.
• Nenhum repositório de código — o link do GitHub do cartão, github.com/internlm/Intern-Decision, retorna erro 404, e a lista de repositórios da organização InternLM não contém nenhum projeto com esse nome.
• Sem adoção — no momento em que escrevo, o 4B mostra uma curtida e zero downloads.
Essa é toda a superfície cognoscível. Trate cada número abaixo como sendo do próprio fornecedor, porque mais ninguém executou isso ainda.

O contrato de inferência é o produto
A maior parte do cartão é dedicada a um procedimento de cinco passos, o que revela onde foi investido o trabalho de engenharia. As perguntas e as opções mantêm a sua ordem. As opções de cada pergunta são mapeadas para símbolos de token único — A a Z, depois a a z, depois 0 a 9. São 62 símbolos, e é exatamente por isso que o cartão limita uma pergunta a 62 opções. O prompt é gerado a partir do prompt de sistema original, do estado, do esquema de decisão e de um esqueleto JSON completo do assistente com um <decision> placeholder por campo, mantendo o template de chat do checkpoint e um bloco de pensamento vazio. Depois, uma passagem forward causal. Os logits são lidos na posição imediatamente antes de cada placeholder, uma softmax é executada apenas sobre os logits dos símbolos candidatos permitidos desse campo, a calibração é aplicada, e os símbolos são mapeados de volta para os valores das suas opções.
A consequência é uma forma fixa: sem loop de decodificação, sem amostragem, sem parser, sem superfície de alucinação e um teto rígido de uma decisão por pergunta por passagem. Três tipos de pergunta são suportados — choice com um mapa ordenado de critérios, score com uma lista ou mapa com chaves numéricas, e noul, um binário não/sim.
O detalhe da ficha técnica que mais importa
O model card deixa explícito que as entradas são "rejeitadas sem truncamento" acima de DecisionEngine(max_length=8192). Leia isso ao lado da configuração e algo estranho vem à tona: a torre de texto subjacente declara max_position_embeddings de 262.144. O backbone consegue endereçar um quarto de milhão de tokens; o wrapper disponibilizado recusa tudo além de 8.192. Este não é um modelo de contexto longo com uma predefinição conservadora — é um modelo de pontuação de decisões cujo próprio harness limita a evidência que lhe pode entregar. Se a sua questão de encaminhamento depender de mais de aproximadamente oito mil tokens de estado, este checkpoint tal como é distribuído não a responderá, e recusará em vez de truncar a sua entrada.
São permitidas até oito imagens, e o cartão observa que os tokens de imagem contam para esse mesmo limite de 8.192.

Dentro dos pesos
Quatro shards, 4,54 bilhões de parâmetros BF16 e uma configuração que explica o nome do tamanho: há uma torre de texto, uma torre de visão de cerca de duas dúzias de camadas com tamanho de patch de 16 pixels, e um projetor entre elas. O lado do texto tem 32 camadas com tamanho oculto 2.560, com 16 cabeças de atenção contra 4 cabeças de chave/valor, um vocabulário de 248.320 tokens e embeddings atrelados. Os tipos de camada se alternam em um intervalo fixo — três camadas de atenção linear, depois uma camada de atenção completa, repetidamente. Somente as camadas de atenção completa carregam atenção global, e o embedding rotativo é parcial com um fator de 0,25. Carregá-lo exige Python 3.12 ou mais recente, PyTorch 2.9.1 e Transformers 5.14.1, e a lista de arquivos ainda inclui o tokenizer, os merges e os arquivos de vocabulário em vez de depender de um tokenizer do lado do hub.
Os números, e quem os produziu
Tudo nesta seção foi medido pela InternLM e publicado no cartão do modelo. Nada disso foi reproduzido por terceiros, e não há registro no Artificial Analysis, nem avaliação de arena, nem linha em tabela de classificação para este modelo em lugar nenhum.
Em sete conjuntos de avaliação, o 4B tem média de 90,02, com um escore de Brier de 0,347 e um erro de calibração esperado de 0,065. A mesma tabela lista o Intern-Decision-0.8B com 79,38 e o Intern-Decision-2B com 84,68, de modo que a família apresenta uma curva ascendente conforme o tamanho aumenta — 4,7 pontos de 0,8B para 2B, depois mais 5,3 até o 4B. A tabela também traz cinco linhas que o fornecedor não treinou: Jev com 88,74, JevK5 com 85,16, SemIf com 84,23, Kev com 79,56 e Laya com 57,77. Essas foram executadas pela InternLM no harness da InternLM contra o checkpoint da InternLM. Elas não são os números dos próprios projetos, e lê-las como se fossem é o erro mais fácil de cometer aqui.
A latência é medida em uma única RTX 4090 pelo caminho local do Hugging Face, e o card sinaliza os valores como dependentes da carga de trabalho e do hardware. O 4B roda com 44,16 ms de média, 44,03 ms de mediana e 44,60 ms no P95 — uma variação bem abaixo de um milissegundo entre a mediana e a cauda, que é exatamente o que se espera de um forward pass de forma fixa. Os dois checkpoints menores ficam ambos em torno de 33 ms, com o 2B ligeiramente à frente do 0,8B na média e na mediana, o que vale a pena notar em vez de deixar passar: esses dois estão próximos o suficiente para estarem dentro do ruído de medição um do outro.
Calibração, e as ressalvas honestas que ela contém
O checkpoint vem com uma temperatura padrão de 1,99241824, ajustada separadamente para este modelo por minimização da log-verossimilhança negativa em 1.728 casos de calibração designados, com 1.693 reservados para validação. O cartão afirma que os rótulos da suíte de testes não foram usados para escolhê-la. A implementação é calibração de probabilidade de candidato, não uma temperatura de amostragem: ela altera a confiança, a probabilidade binária e a pontuação esperada, enquanto deixa a decisão do argmax intacta.
Um diagnóstico separado de 96 casos então relata o efeito. Nas próprias colunas de antes e depois da InternLM, o Brier e o ECE gerais do 4B passam de 0,628 / 0,213 para 0,550 / 0,089, contra 0,595 / 0,130 do Jev. Duas leituras honestas dessa tabela: a calibração claramente funciona, e a coluna “antes” não é o que qualquer usuário jamais veria, já que o padrão enviado é a temperatura ajustada. Também vale destacar — duas das seis categorias de diagnóstico são piores para o 4B do que para o Jev, e a pior delas, evidência diária e viés de observação, melhora para 0,575 / 0,210, embora ainda fique atrás dos 0,603 / 0,114 do Jev. Nesse recorte, a calibração reduz a diferença sem eliminá-la.
Onde um roteador se encaixa, e onde ainda não.
O obstáculo prático para usar este modelo não é a precisão, é o empacotamento. O lançamento traz uma classe Python que você importa depois de baixar quatro fragmentos, e não um endpoint HTTP que você possa chamar. É exatamente essa lacuna que uma camada de roteamento existe para fechar — uma única chave para mais de 200 modelos, preço de tabela do provedor repassado com 0% de margem e failover automático quando um provedor oscila — mas devemos ser francos: a OrcaRouter atualmente não oferece o Intern-Decision-4B nem qualquer modelo do tipo. Nosso catálogo não o lista, e nada aqui deve ser interpretado como uma alegação de disponibilidade. O que podemos oferecer é a decisão mais barata: se você quiser testar um pontuador de decisão de 4,5 bilhões de parâmetros na frente de um caminho de produção, pode integrá-lo a um roteador com fallback para um modelo geral, de modo que um dia de calibração ruim custe uma nova tentativa em vez de uma indisponibilidade.
O que mudaria o cenário?
Três coisas, em ordem de importância. Alguém fora da InternLM precisa reproduzir a média de 90,02 e o erro de calibração esperado de 0,065 — alegações de calibração que nunca encontraram um conjunto de teste externo são os números menos transferíveis do aprendizado de máquina. A própria pegada do card precisa aparecer: o Space, a coleção, o repositório no GitHub. E o fornecedor precisa dizer se isto é um produto ou um artefato de artigo, porque uma licença apenas para pesquisa e uma licença Apache-2.0 não são o mesmo compromisso, e o 4B escolheu Apache-2.0 com a licença Qwen preservada ao lado dela. Até lá, o enquadramento correto é o que o próprio upload sugere: este é um checkpoint real com um contrato de inferência real e um scorecard completamente não verificado, publicado sem que ninguém tenha sido avisado.
Por ora, o resumo honesto é restrito e útil. Se o seu problema é "escolher um entre cinco rótulos de roteamento e me dizer o quão certo você está", um modelo de 4,5B que emite 62 logits e nenhuma prosa é um formato defensável de avaliar. Se o seu problema envolve um documento longo, mais de oito imagens, ou qualquer necessidade de explicar a resposta em palavras, este checkpoint como entregue é a ferramenta errada, e nenhuma quantidade de polimento de benchmark de fornecedor muda isso.
