Um cartão de título gerado com o texto 'FrogNano-4B-2609 vs Intern-Decision-4B', com o subtítulo 'o mesmo ancestral Qwen3.5-4B, duas saídas opostas', três chips com os textos 'chamadas de ferramentas e patches', 'um símbolo por campo' e 'nenhum dos dois pontuado de forma independente', um rodapé com o texto 'Ambos os placares são informados pelos fornecedores; nenhuma terceira parte reproduziu nenhum dos dois', e o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

FrogNano-4B-2609 vs Intern Decision 4B: Um Modelo Base, Duas Apostas Totalmente Diferentes

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois laboratórios pegaram o mesmo checkpoint, Qwen3.5-4B, e o levaram em direções que não se parecem entre si. microsoft/FrogNano-4B-2609 foi pós-treinado com aprendizado por reforço em cerca de 1.500 ambientes sintéticos de engenharia de software até conseguir emitir chamadas de ferramentas estruturadas e patches de múltiplos arquivos por meio de uma estrutura de cinco ferramentas. internlm/Intern-Decision-4B foi ajustado para não emitir texto algum — ele recebe um estado mais um esquema de perguntas nomeadas e retorna uma probabilidade calibrada para cada opção em uma única passagem direta. Um escreve código. O outro se recusa a escrever qualquer coisa e retorna uma distribuição. Compará-los quanto à qualidade é inútil; compará-los quanto ao que custam para executar e com o que se pode confiar neles é o exercício honesto.

Ambos foram lançados sem anúncio, que é a outra coisa que têm em comum. Nenhum dos dois tem uma entrada no Artificial Analysis, uma classificação em arena ou uma única avaliação independente. Todos os números abaixo — a escada do SWE-bench de um lado, as linhas de calibração Brier e ECE do outro — foram produzidos pelo laboratório que treinou o modelo, no próprio harness desse laboratório, e nunca encontrou um conjunto de teste que não tivesse vindo dele.

O fork aconteceu antes de qualquer um dos dois modelos existir.

O checkpoint base é um modelo denso híbrido de 32 camadas de Gated DeltaNet e atenção com gate, e ambos os derivados herdam seu esqueleto. Depois disso, os dois pipelines de pós-treinamento não têm nada em comum.

O pipeline da Microsoft é um ciclo fechado. O TaskPilot gera tarefas candidatas de repositório a partir de instantâneos reais, executa rollouts a partir do checkpoint atual para encontrar aquelas que a política às vezes resolve, mantém essas e treina. Cinco iterações, cada uma calibrada em relação à política da iteração anterior, terminando em 61,5% no SWE-bench Verified e 37,6% no SWE-bench Pro. Sem destilação — a ficha afirma que nenhuma trajetória, ação ou traço de raciocínio de modelos mais fortes foi usada como alvo.

O pipeline do InternLM é um único objetivo supervisionado sobre um formato de tarefa fixo. O modelo recebe um prompt de sistema, um estado, um esquema de decisão e um esqueleto JSON completo do assistente com um placeholder por campo. Ele executa uma única passagem forward causal, lê os logits em cada posição de placeholder e aplica um softmax apenas sobre os símbolos candidatos permitidos daquele campo. O card do InternLM diz isso abertamente: esse caminho "não chama generate() nem faz amostragem de texto de formato livre."

Essa diferença não é uma diferença de escala. É uma diferença no que o artefato é, na própria natureza dele. FrogNano-4B-2609 é um agente que pode estar errado de cem maneiras interessantes e ser corrigido por testes. Intern-Decision-4B é um pontuador cujo modo de falha é um número confiante.

Dois contratos, e nenhum deles é "enviar um prompt"

O contrato do FrogNano é um loop. O modelo emite chamadas para Read, Write, Edit, Glob e Bash; o harness Leaf executa-as dentro de um sandbox de repositório isolado e retorna a saída; o loop continua até que o modelo pare de chamar. As avaliações foram executadas em 150 passos dentro de aproximadamente 131K tokens combinados, com até 8.192 tokens gerados por turno do assistente. O serviço precisa do SGLang com um parser de raciocínio Qwen3 e um parser de chamada de ferramenta do coder Qwen3 — se errar isso, o modelo produz prosa onde o harness espera JSON, o que, de fora, parece exatamente um modelo quebrado.

O contrato do Intern-Decision-4B é de tentativa única e com limite rígido. As perguntas e as opções mantêm sua ordem. As opções são mapeadas para símbolos de token único — de A até Z, depois de a até z, depois de 0 até 9, que é a razão aritmética pela qual uma pergunta atinge no máximo 62 opções. O teto do wrapper é de 8.192 tokens, e o card do InternLM deixa explícito que entradas mais longas são rejeitadas sem truncamento. Três tipos de pergunta são suportados: choice com um mapa de critérios ordenado, score com uma lista ou mapa com chaves numéricas, e noul, um binário. Até oito imagens são permitidas, e seus tokens contam para os mesmos 8.192.

• Formato de saída — FrogNano-4B-2609 emite chamadas de ferramentas, texto de raciocínio e um patch. Intern-Decision-4B emite um símbolo por campo e nada mais.

• Determinismo — FrogNano faz amostragem a uma temperatura de 0,6 em três sementes, portanto é probabilístico por design. O argmax do Intern-Decision-4B é fixado pela passagem direta; a temperatura ajustada altera apenas a sua confiança.

• Superfície de falha — o FrogNano pode alucinar uma API, ampliar excessivamente uma edição ou passar nos testes enquanto introduz uma vulnerabilidade, tudo o que seu card nomeia. O Intern-Decision-4B não pode alucinar uma resposta, porque só pode escolher entre opções que você forneceu — ele só pode estar mal calibrado.

• Teto de entrada — aproximadamente 131 mil tokens combinados para o FrogNano em sua configuração avaliada, contra um limite rígido de 8.192 para o Intern-Decision-4B, o que representa um fator de dezesseis, e não há solução alternativa.

• Formato de custo — FrogNano cobra pela trajetória, e as trajetórias são longas. Intern-Decision-4B não tem nenhum token de saída a cobrar.

• Parâmetros — o card do FrogNano fornece uma faixa "500M-5B" e descreve aproximadamente 4,66B, com um download BF16 de 9,32 GB; o Intern-Decision-4B é indicado como 4,54B, com uma torre de visão de 612 MB e um projetor de 54 MB, juntamente com seus shards de linguagem.

O número que decide este emparelhamento

A ficha do InternLM coloca o Intern-Decision-4B em 44,16 ms de latência média e 44,03 ms de mediana em uma única RTX 4090 pelo caminho local do Hugging Face, com um P95 de 44,60 ms. Leia essa dispersão novamente: da mediana até a cauda fica bem abaixo de um milissegundo, porque uma passagem direta de forma fixa não tem quase nada para variar. Esse é todo o argumento a favor da arquitetura.

O valor correspondente do FrogNano não está em milissegundos. Suas avaliações permitiam um orçamento de 150 etapas, com um teto de 10.800 segundos para o agente por tarefa. Essas não são unidades comparáveis e jamais deveriam ser colocadas na mesma frase que uma alegação de latência — mas elas indicam o formato do trade-off. Um modelo responde a uma decisão em quarenta e quatro milissegundos, e o outro gasta minutos de chamadas de ferramentas atrás de um patch. Se o seu problema é "encaminhar este ticket para uma de seis filas e me dizer o quão confiante você está", o primeiro não é uma versão mais barata do segundo, é uma máquina diferente.

Ambos os laboratórios se mediram cuidadosamente, e ambos os conjuntos de medições devem ser lidos como intenções, e não como resultados. A InternLM relata uma média de sete conjuntos de 90,02 com um escore de Brier de 0,347 e um erro de calibração esperado de 0,065, ajustado a uma temperatura de 1,99241824 em 1.728 casos de calibração designados. A Microsoft relata um aumento de cinco iterações de 39,4% para 61,5% no SWE-bench Verified, e o apêndice do mesmo artigo relata essa mesma progressão como 48,2%, 53,4%, 58,3%, 58,6% e 61,6% — um lembrete de que, mesmo dentro de um único laboratório, o mesmo fato medido de duas maneiras produz duas escadas.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

O tell está naquilo sobre o que cada carta escolhe te avisar.

Ambos os cartões são incomumente honestos, e essa honestidade aponta em direções opostas — o que é a coisa mais útil nesta comparação.

A seção de limitações conhecidas da Microsoft parece um aviso de implantação. Somente inglês e Python. Desempenho sensível à qualidade do harness e dos testes. Patches que podem estar incorretos ou inseguros, apesar de passarem nos testes. A própria frase da ficha é que o FrogNano "não deve ser considerado como alinhado à segurança de forma independente para implantação autônoma irrestrita", e ela aponta a lacuna específica: o pós-treinamento específico do agente não usou dados de preferência de segurança, de recusa ou adversariais, porque, em vez disso, otimizou a correção funcional e a prevenção de regressões. Ele também informa espontaneamente a taxa de 1,71% de chamadas paralelas de ferramentas, o que significa que o modelo quase nunca aciona duas ferramentas em um mesmo turno, apesar de o harness permitir isso — uma regressão real de capacidade em relação ao modelo base, que a equipe tentou recuperar adicionando uma etapa de consolidação.

O cartão do InternLM alerta sobre a classe oposta de coisa. Não há superfície de alucinação sobre a qual alertar, então as ressalvas são sobre as entradas: a rejeição de 8.192, o teto de 62 opções, o fato de a torre de texto subjacente declarar um limite de posição de 262.144 tokens que o wrapper disponibilizado se recusa a usar. Seu risco é que um número com alta confiança receba mais confiança do que merece, e o cartão é franco ao dizer que a calibração reduz uma lacuna em relação à linha de base Jev sem fechá-la em todos os recortes.

Lidos em conjunto, eles descrevem duas posturas de confiança diferentes. O FrogNano precisa de supervisão porque age. O Intern-Decision-4B precisa de uma auditoria porque pontua — e um número que influencia uma decisão de produção é exatamente o tipo de resultado que ninguém pensa em testar.

Onde um roteador se encaixa, e uma observação honesta sobre ambos

Nenhum dos modelos é um endpoint hospedado. O FrogNano é distribuído como pesos mais um harness de avaliação em Kubernetes; o Intern-Decision-4B é distribuído como uma classe Python que você importa depois de baixar quatro shards. Para uma equipe que quer testar qualquer um dos dois diante de algo real, o padrão seguro é o mesmo para ambos e não é glamouroso: coloque o componente experimental atrás de um fallback, de modo que uma trajetória ruim ou um dia descalibrado custe uma nova tentativa em vez de um incidente.

Esse padrão é justamente para o que serve uma camada de roteamento. O OrcaRouter executa mais de 200 modelos por trás de uma única chave compatível com a OpenAI com 0% de markup — preço de tabela do provedor repassado, então uma mudança de preço do fornecedor chega do nosso lado no mesmo dia — e seu failover fica na frente do modelo geral usado como fallback, não na frente desses dois. Para ser claro: não trabalhamos com o FrogNano-4B-2609 nem com o Intern-Decision-4B, e não há data para nenhum dos dois. O que um único endpoint proporciona aqui é que a própria comparação fica barata — uma credencial, uma linha de cobrança e nenhuma segunda integração a cada vez que você troca o modelo geral com o qual está comparando o especialista.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

Qual deles, e quando

Use o Intern-Decision-4B quando a resposta já existe no seu prompt e você precisa que ela seja escolhida, com uma confiança associada, a uma taxa de milhares por segundo. Roteamento por taxonomia fixa, pontuação por rubrica, extração com restrições de esquema, moderação contra um conjunto fechado de rótulos. O forward pass de 44 milissegundos e o custo zero de tokens de saída são o produto, e a calibração é o que deve ser auditado antes de você confiar nele.

Considere o FrogNano-4B-2609 quando a resposta ainda não existe e precisa ser descoberta lendo um repositório e executando seus testes. Esse é um processo que leva minutos, isolado em sandbox e revisável, e os 61,5% no SWE-bench Verified — relatados pelo fornecedor, não reproduzidos — são a melhor evidência atual de que um checkpoint de 4B consegue fazer isso.

O que não deveria passar de jeito nenhum é o hábito de comparar as pontuações deles. Uma média de 90,02 em sete conjuntos e uma taxa de 61,5 no SWE-bench Verified são medições de duas perguntas diferentes, produzidas por dois laboratórios, em dois harnesses, e nenhum dos dois números passou pelas mãos de terceiros. Eles compartilham um ancestral e nada mais.

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

A única previsão genuinamente útil do ancestral compartilhado: como ambos os modelos partem do mesmo checkpoint de 4B, a diferença entre eles está quase inteiramente no pós-treinamento, o que significa que a pergunta interessante para quem está construindo sobre o Qwen3.5-4B é qual dessas duas estruturas de recompensa se transfere para seu próprio domínio. Um loop de tarefa sintética que se calibra contra sua própria política, ou uma cabeça de pontuação de forma fixa com uma temperatura ajustada. Essas são duas receitas, ambas publicadas, ambas de laboratórios que ainda não deixaram ninguém mais executá-las. Essa é uma situação rara e que vale a pena acompanhar em vez de comprar a ideia.