Um cartão de título gerado com o texto 'Intern-Decision-4B vs ContextPilot-8B', com o subtítulo 'um recusa contexto longo, o outro lida com ele', com três etiquetas: 'nenhuma avaliação independente para qualquer um dos dois', 'ambos lançados sem anúncio' e 'nenhum dos dois tem roteamento disponível hoje'. O logotipo da OrcaRouter está composto no canto inferior direito.
Engineering & Research

Intern-Decision-4B vs ContextPilot-8B: Um Modelo Que Encolhe o Contexto Contra um Modelo Que o Gerencia

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Escolha o seu veneno: internlm/Intern-Decision-4B recusa-se a ler mais de 8.192 tokens, e tencent/ContextPilot-8B existe especificamente para sobreviver a contextos que crescem sem limite. São da mesma classe de tamanho, ambos são fine-tunes de uma base Qwen e ambos chegaram ao Hub sem qualquer anúncio do fornecedor e sem qualquer avaliação independente de qualquer tipo — ContextPilot-8B a 27 de agosto de 2026, Intern-Decision-4B a 26 de setembro de 2026 — e resolvem problemas opostos. O Intern-Decision-4B é um modelo de decisão estruturada de 4,5 mil milhões de parâmetros que faz um único forward pass, lê os logits e devolve uma probabilidade calibrada para cada pergunta que lhe fez; nunca escreve um token. O ContextPilot-8B é um gerador de texto de 8,19 mil milhões de parâmetros treinado para planear, memorizar e descarregar o seu próprio contexto de trabalho durante uma longa execução de agente. Compará-los não é propriamente uma questão de benchmark. É uma questão sobre qual metade do seu problema prefere que o modelo engula.

Primeiro, aquilo que eles genuinamente compartilham

Nenhum dos dois modelos tem um único número que alguém fora do próprio laboratório tenha verificado. Isso é incomum o suficiente para ser dito antes de qualquer outra coisa, porque a maioria das comparações neste blog pode pelo menos se apoiar em um ranking independente para um dos lados.

O Intern-Decision-4B publica uma tabela completa de avaliação em seu model card — uma média de 90,02 em sete conjuntos, uma pontuação Brier de 0,347 e um erro de calibração esperado de 0,065 — tudo medido pelo InternLM no harness do próprio InternLM. O ContextPilot-8B não publica tabela alguma. Seu model card afirma que o framework "supera consistentemente as baselines existentes em diversos modelos base e benchmarks" e aponta para um artigo e um pipeline de avaliação para os detalhes. Portanto, para este confronto, a linha de proveniência honesta é curta: um lado é informado pelo fornecedor e não reproduzido, o outro é alegado pelo fornecedor e não publicado, e nada nesta página é independente.

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

As duas apostas, ditas claramente

A aposta do Intern-Decision-4B é que a parte difícil de uma decisão não é raciocinar, é se comprometer. Dê a ele um estado, um esquema de perguntas nomeadas e até oito imagens, e ele retorna uma distribuição sobre suas próprias strings de opção. O procedimento de inferência é determinístico e com formato fixo: mapeia as opções para símbolos de token único, renderiza um esqueleto JSON de assistente com um placeholder por campo, executa uma passagem forward causal, lê os logits imediatamente antes de cada placeholder, aplica softmax apenas sobre os candidatos daquele campo, aplica a temperatura ajustada. Não há loop de decodificação, então não há parser nem superfície de alucinação de texto livre. O preço dessa aposta é um teto rígido de entrada — o cartão diz que entradas acima de DecisionEngine(max_length=8192) são "rejeitadas sem truncamento".

A aposta do ContextPilot-8B é a imagem espelhada: manter o agente escrevendo tokens, mas ensiná-lo a editar o que ele está carregando. Ele adiciona planejamento, memória de longo prazo estruturada, recuperação e offloading de contexto suave ao conjunto de ferramentas do agente, depois treina o checkpoint com uma receita de RL que amostra ramificações em torno das decisões de edição de contexto que importam e atribui crédito no nível da ação, em vez do nível da trajetória. O card é franco quanto à consequência de empacotamento: carregar o checkpoint não lhe dá gerenciamento de contexto. As definições de ferramentas, o runtime do agente e o pipeline de avaliação ficam em outro lugar e precisam ser trazidos junto.

Placar, dimensão por dimensão

• Saída — Intern-Decision-4B não emite texto algum, apenas probabilidades sobre os valores das suas opções; ContextPilot-8B gera normalmente e as suas respostas são prosa e chamadas de ferramentas que você precisa interpretar.

• Teto de entrada — o Intern-Decision-4B recusa qualquer coisa além de 8.192 tokens; o ContextPilot-8B herda o limite de posição de 40.960 tokens do Qwen3-8B e foi projetado para continuar funcionando à medida que o contexto efetivo cresce.

• Parâmetros — 4,54B BF16 para o Intern-Decision-4B, distribuídos por uma torre de texto, uma torre de visão e um projetor; 8,19B BF16 para o ContextPilot-8B, um modelo de linguagem causal Qwen3 denso comum.

• Latência — o Intern-Decision-4B atinge 44,16 ms de média e 44,60 ms no P95 em uma única RTX 4090, conforme seu próprio cartão de modelo; o ContextPilot-8B não publica nenhum valor de latência, e seu custo é fundamentalmente diferente porque está gerando tokens em vez de pontuá-los.

• Imagens — o Intern-Decision-4B aceita até oito, e os tokens de imagem contam para o teto de 8.192; a ficha do ContextPilot-8B descreve um checkpoint de geração de texto sem caminho multimodal.

• Licença — O Intern-Decision-4B é Apache-2.0, com a licença upstream do Qwen preservada ao lado dela; a licença do ContextPilot-8B abre com a Seção 0, "disponibilizado exclusivamente para fins de pesquisa científica e desenvolvimento. Você não deverá utilizá-lo para qualquer outra finalidade."

• Evidências publicadas — de um lado, uma tabela de sete conjuntos com diagnósticos de calibração; do outro, um resumo de artigo e uma referência a um repositório de avaliação.

• Histórico — ambos discretos. O Intern-Decision-4B mostra uma curtida e zero downloads desde 26 de setembro de 2026; o ContextPilot-8B tem 11 curtidas e cerca de mil downloads desde 27 de agosto de 2026, o que é mais atenção, mas ainda nenhuma avaliação de terceiros.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

Onde cada um realmente falha

O modo de falha do Intern-Decision-4B é estrutural, e vale a pena ser concreto sobre isso. Se as evidências para uma decisão não couberem em 8.192 tokens, o modelo não degrada de forma gradual — ele rejeita a solicitação. Essa é uma escolha de engenharia defensável e um encaixe terrível para exatamente a carga de trabalho para a qual o ContextPilot-8B foi criado. A própria configuração do card torna a tensão mais aguda: a torre de texto sob o wrapper declara um limite de posição de 262.144 tokens. O backbone consegue endereçar um quarto de milhão de tokens, e o wrapper lançado não aceitará mais de oito mil.

O modo de falha do ContextPilot-8B é que ele não é um substituto plug-and-play de coisa alguma. Ele é um checkpoint dentro de um framework, e é no framework que o comportamento reside. Se você pegar os pesos sem as definições de ferramentas e o runtime do agente, terá um fine-tune do Qwen3-8B cuja capacidade distintiva é inerte. Some a isso a Seção 0 da licença, e a resposta prática para uma implantação comercial é que você não pode usá-lo de forma alguma como fornecido — o que também significa que ele não é uma rota candidata para nós, agora ou em breve.

Fazendo o deploy de cada um, se você fosse fazer isso

O Intern-Decision-4B quer uma GPU pequena e nenhuma stack de serving que mereça esse nome: instale PyTorch 2.9.1 e Transformers 5.14.1 em Python 3.12, carregue os quatro shards uma vez, mantenha o motor residente e pontue. Como a passagem direta tem formato fixo, P50 e P95 ficam dentro de seis décimos de milissegundo um do outro, então o planejamento de capacidade é sobre concorrência, e não sobre latência de cauda. A parte incômoda é que ele é distribuído como uma classe Python importável em vez de um serviço HTTP, então colocá-lo diante de um chamador de produção significa envolvê-lo você mesmo.

ContextPilot-8B quer o tratamento oposto: um caminho real de serving, um executor de ferramentas, armazenamentos de memória e um ambiente de rollout com suporte a ramificações, caso você algum dia pretenda retreiná-lo ou avaliá-lo conforme projetado. Este não é um modelo que você testa em uma tarde; é uma estrutura de pesquisa que você adota.

Um roteador ajuda aqui?

Em parte, e a versão honesta é mais restrita do que o habitual. O OrcaRouter não lista o Intern-Decision-4B, o ContextPilot-8B nem qualquer checkpoint comparável de pontuação de decisões no seu catálogo — as nossas páginas de modelos dão 404 para ambos, e nada neste artigo deve ser lido como uma afirmação de disponibilidade. O que um endpoint unificado lhe oferece é a capacidade de colocar uma experiência falhada atrás de um fallback: uma única chave para mais de 200 modelos, preço de tabela do fornecedor repassado com 0% de margem, e failover automático para que um scorer que ainda está a avaliar nunca se torne um ponto único de falha. Isto é um benefício real para o lado do Intern-Decision desta comparação, em que o modelo é de facto executado de forma barata e localmente. Para o ContextPilot-8B é irrelevante, porque uma licença apenas para investigação e desenvolvimento exclui qualquer via comercial, independentemente do que qualquer router suporte.

Qual, então?

Se a sua pergunta tem um conjunto fechado de respostas, chega com as evidências anexadas e precisa de uma probabilidade em vez de uma explicação, o Intern-Decision-4B é o objeto mais interessante — barato, de forma fixa, calibrado por construção e honesto quanto à entrada que não aceitará. Se o seu problema é que as evidências não param de chegar, nenhum pontuador de decisão vai ajudá-lo, e o ContextPilot-8B está apontado ao alvo certo, com a ressalva de que você está adotando uma estrutura e uma licença de pesquisa, e não um modelo.

O que resolveria a questão é um teste que nenhum dos fornecedores realizou: submeter os dois à mesma decisão curta e estruturada, com a resposta calculável a partir do estado, e verificar se a média de 90,02 do avaliador se sustenta fora do seu próprio ambiente de avaliação. Até que alguém faça isso, a leitura correta deste confronto é que os dois modelos não estão competindo pela mesma vaga.

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.