Um cartão de título gerado com o texto 'FrogNano-4B-2609 vs LFM2.5 2.6B Base' e o subtítulo 'um agente de 4B finalizado contra um checkpoint pré-treinado de 2,69B', três chips com os textos 'pós-treinamento por RL concluído', 'apenas pré-treinamento, 2,69B denso em 30 camadas' e 'sem ajuste por instruções', um rodapé com o texto 'Ambas as colunas reportadas pelo fornecedor; nenhum terceiro avaliou qualquer um dos modelos', e o logotipo da OrcaRouter composto no canto inferior direito.
Engineering & Research

FrogNano-4B-2609 vs LFM2.5 2.6B Base: um especialista finalizado e um saco de pesos pré-treinados

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Digite uma pergunta no LFM2.5 2.6B Base e ele continuará sua frase em vez de respondê-la. Isso não é um defeito — a Liquid AI o publicou como o checkpoint pré-treinado subjacente à família LFM2.5, com o ajuste de instrução deliberadamente deixado para seu irmão não-Base, e o card diz claramente que ele se destina a ajuste fino pesado. O FrogNano-4B-2609 da Microsoft é como se parece a outra ponta desse pipeline: o mesmo tipo de pequeno modelo de linguagem, submetido a cinco iterações de aprendizado por reforço em tarefas sintéticas de repositório até emitir chamadas de ferramentas estruturadas e patches candidatos por meio de um harness de cinco ferramentas. Nenhum dos dois tem um benchmark independente publicado. A diferença é que um deles teve seu pós-treinamento concluído, e saber qual deles é toda a decisão.

Os números do FrogNano abaixo vêm da ficha do modelo e do relatório técnico da Microsoft. Os números do LFM vêm da ficha da Liquid AI, da sua configuração de arquitetura e do seu arquivo de licença. Todos os números atribuídos a qualquer um dos fornecedores estão identificados como informados pelo fornecedor, e nenhum desses modelos passou por uma avaliação de terceiros — no caso do LFM2.5 2.6B Base, isso é em grande parte intencional, já que um checkpoint sem ajuste por instruções não é um alvo justo para um benchmark de chat.

A comparação só funciona se você souber o que está comparando

Coloque as duas fichas técnicas lado a lado e a primeira coisa que dá errado é a contagem de parâmetros. LFM2.5 2.6B Base tem 2,69 bilhões de parâmetros densos em 30 camadas — 22 blocos de convolução curta com duplo gate e 8 camadas de atenção de consulta agrupada, treinado em aproximadamente 34 trilhões de tokens em 16 idiomas, com um vocabulário de 128.000 tokens e um contexto de 131.072 tokens. Sua versão quantizada fica em torno de 1,67 GB em Q4_K_M.

A ficha do FrogNano-4B-2609 informa seu campo de parâmetros como a faixa "500M-5B", e o resumo do modelo o descreve como aproximadamente 4,66 bilhões. O download resolve a discussão: dois shards safetensors totalizando 9,32 GB de pesos BF16, 738 tensores, em uma pilha híbrida densa herdada de 32 camadas de Gated DeltaNet e atenção com portões. Uma torre de visão de 24 camadas está no checkpoint e nunca foi pós-treinada.

Portanto, a proporção de tamanho é de aproximadamente 1,7 para um, e a proporção de memória fica mais próxima de 5,6 para um quando a quantização entra em cena. Essa diferença importa mais do que a linha de parâmetros, porque ambos esses modelos são candidatos a auto-hospedagem, e não endpoints — que é a única razão pela qual eles pertencem ao mesmo artigo.

• Uso pretendido — LFM2.5 2.6B Base é matéria-prima para uma execução de ajuste fino. FrogNano-4B-2609 é uma política finalizada para engenharia de software em nível de repositório dentro do harness Leaf.

• Seguimento de instruções — o LFM2.5 2.6B Base não tem nenhuma de fábrica; o card da Liquid AI o recomenda para tarefas que exigem fine-tuning pesado. O FrogNano-4B-2609 segue uma descrição de tarefa e emite chamadas de ferramentas estruturadas, porque foi exatamente para isso que seu objetivo de RL o treinou.

• Contexto — 131.072 tokens para o LFM2.5 2.6B Base, contra aproximadamente 131K tokens combinados para a configuração avaliada do FrogNano. Nominalmente idênticos, mas a janela do FrogNano precisa comportar resultados de ferramentas, saída de shell e logs de teste, não apenas um prompt.

• Teto de saída — A configuração validada do FrogNano permite 8.192 tokens gerados por turno do assistente. O LFM2.5 2.6B Base não divulga um equivalente, já que não foi projetado para encerrar uma resposta.

• Modalidade — ambos são somente texto. Os componentes de visão do FrogNano são herdados e explicitamente não suportados; o LFM2.5 2.6B Base é texto-entrada, texto-saída por construção.

• Licença — O LFM2.5 2.6B Base está sob a LFM Open License v1.0, que é gratuita abaixo de US$ 10 milhões em receita anual e exige uma licença separada nesse limite ou acima dele, com obras derivadas herdando o teto. O card do FrogNano diz MIT na parte preliminar e Apache 2.0 no corpo.

A coisa pela qual a Microsoft pagou, e a coisa pela qual você mesmo teria que pagar

Esta é a seção que sustenta tudo, pois é justamente aquela em que uma comparação de especificações induz a erro.

O principal valor agregado do FrogNano-4B-2609 é o pós-treinamento, e a Microsoft publicou o método. Comece a partir do Qwen3.5-4B, que pontuou 39,4% no SWE-bench Verified por meio do harness Leaf como modelo geral. Gere tarefas candidatas de repositório a partir de snapshots reais, execute rollouts a partir do checkpoint atual para encontrar tarefas que ele às vezes resolve, mantenha essas tarefas, treine e repita — cinco iterações, aproximadamente 1.500 ambientes sintéticos validados no total, e nenhuma destilação de um modelo maior em momento algum. O resultado no próprio card da Microsoft é 61,5% no SWE-bench Verified, 37,6% no SWE-bench Pro, 31,1% no Terminal-Bench 2.0 e 47,3% no PatchEval-Verified. O apêndice de eficiência do artigo relata a mesma subida como 48,2%, 53,4%, 58,3%, 58,6% e 61,6% ao longo das iterações, o que é um lembrete útil de que até mesmo as duas tabelas do próprio laboratório para o mesmo experimento não concordam quanto aos degraus.

Agora, compare isso com o LFM2.5 2.6B Base. Trata-se do checkpoint anterior ao início desse trabalho. A recomendação do próprio card dele — faça fine-tuning nele — é exatamente o trabalho que o FrogNano documenta: um ambiente de tarefa, uma recompensa executável, um harness mais longo e várias iterações de treinamento contra uma política em movimento. O artigo não afirma que isso seja fácil. Ele relata que checkpoints intermediários se tornaram progressivamente mais caros de treinar à medida que os traços de raciocínio se alongavam, que uma penalidade de comprimento de log teve de ser adicionada para deter a deriva, e que iterações posteriores perderam a capacidade de chamada paralela de ferramentas que o modelo base tinha, terminando em uma taxa de chamadas simultâneas de 1,71%. Qualquer pessoa que planeje executar a receita do FrogNano em uma base 2.6B diferente deve reservar orçamento especificamente para esses três problemas.

O que o LFM2.5 2.6B Base oferece é um tipo diferente de vantagem inicial: um orçamento de pré-treinamento de 34 trilhões de tokens, uma arquitetura híbrida documentada, uma build quantizada já existente e um contexto documentado de 131.072 tokens, tudo em um tamanho que roda em hardware no qual um checkpoint BF16 de 9,32 GB não caberia. Se a sua tarefa for estreita o suficiente para que um pequeno fine-tune supere um modelo generalista, essa é uma posição real — e, se não for, você economizou uma rodada de treinamento.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

O que você tem que construir de qualquer maneira

Nenhum destes é uma chamada de rede, e isso molda a comparação prática mais do que qualquer linha de especificação.

O LFM2.5 2.6B Base exige um runtime de inferência e uma execução de treino. O cartão da Liquid AI lista builds em formato nativo, GGUF, ONNX e MLX, portanto a metade do serving está bem coberta — o llama.cpp num portátil é uma opção real para o checkpoint quantizado. A metade do treino é sua: dados, objetivo, avaliação e uma forma de dizer se o resultado ficou melhor ou apenas diferente.

FrogNano-4B-2609 quer um endpoint compatível com OpenAI com os parsers corretos e um cluster Kubernetes com permissão para gerenciar pods e políticas de rede. O README da Microsoft é incomumente direto ao afirmar que o harness é uma dependência, em vez de uma conveniência, e o card afirma que pontuações idênticas exigem um checkpoint, tokenizer, configuração de serving, imagens de tarefa e protocolo de avaliação correspondentes. Configuração não é um detalhe aqui — sirva-o sem um parser de raciocínio Qwen3 e um parser de chamada de ferramenta do Qwen3 coder, e o modelo escreve prosa onde o harness espera uma chamada de ferramenta.

É esse o formato deste confronto: de um lado, um projeto de treinamento com um pequeno problema de serving; do outro, um projeto de serving com um grande problema de avaliação e sem mais nenhum treinamento a fazer. Ambos são trabalhos de algumas noites. Apenas um deles é um trabalho de algumas noites que pode terminar em "o modelo não é bom o suficiente" sem culpa sua.

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

Onde uma tupia conquista seu lugar em uma construção como esta

Ambos esses modelos acabam dentro de um pipeline que também chama algo hospedado. A própria estrutura de avaliação do FrogNano é a prova: o harness Leaf conversa com um endpoint compatível com OpenAI, o que significa que o modelo em teste e qualquer modelo com o qual você o compare são acessados pela mesma interface. Esse é um padrão que vale a pena copiar mesmo quando o motivo é apenas higiene, e é aí que um único endpoint faz algo concreto.

O OrcaRouter reúne mais de 200 modelos por trás de uma única chave compatível com a OpenAI com 0% de acréscimo, de modo que os preços de tabela dos provedores passam sem alteração e uma mudança de preço de um fornecedor fica ativa do nosso lado no mesmo dia — que é justamente o número que realmente muda quando você está decidindo se um especialista auto-hospedado supera um modelo generalista hospedado em custo por tarefa. O failover automático cobre a metade hospedada dessa comparação, não o checkpoint que você mesmo está servindo. Não hospedamos o FrogNano-4B-2609 nem o LFM2.5 2.6B Base; ambos são downloads. O que uma camada de roteamento elimina é a segunda integração toda vez que o lado hospedado do seu benchmark muda.

Escolhendo um, sinceramente

Escolha o LFM2.5 2.6B Base se a sua tarefa for restrita, o seu hardware for pequeno e você estiver preparado para assumir o treinamento — a licença é gratuita para receitas abaixo de $10M, a versão quantizada tem 1,67 GB, e o próprio model card da Liquid AI recomenda-o exatamente para isto. A contrapartida é que você obtém um ponto de partida, não uma capacidade: nada no lançamento indica qual seria a pontuação de uma execução de RL no formato FrogNano sobre ele, e ninguém publicou uma.

Escolha o FrogNano-4B-2609 se a tarefa for engenharia de software em nível de repositório e você quiser o pós-treinamento já feito. Os 61,5%, 37,6%, 31,1% e 47,3% são resultados publicados genuínos de um laboratório que descreveu seu método em detalhes — e eles também são, neste momento, um ciclo fechado: mesmo laboratório, mesmo harness, mesma linha de base do modelo base. O download de 9,32 GB, a dependência do harness e o licenciamento composto são o preço de pular um projeto de treinamento que você teria que executar de outra forma.

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

A reformulação útil é que estes não são concorrentes. O LFM2.5 2.6B Base está a montante de um processo que produziu algo como o FrogNano-4B-2609. Se você estiver escolhendo entre eles, a verdadeira questão é se o seu problema vale a pena ter uma execução de treinamento própria — e, se a resposta for não, o checkpoint 4B com o harness, o método publicado e a escada SWE-bench relatada pelo fornecedor é o que chega pronto.