
FrogNano-4B-2609 vs LFM2.5 2.6B Base: um especialista finalizado e um saco de pesos pré-treinados
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Digite uma pergunta no LFM2.5 2.6B Base e ele continuará sua frase em vez de respondê-la. Isso não é um defeito — a Liquid AI o publicou como o checkpoint pré-treinado subjacente à família LFM2.5, com o ajuste de instrução deliberadamente deixado para seu irmão não-Base, e o card diz claramente que ele se destina a ajuste fino pesado. O FrogNano-4B-2609 da Microsoft é como se parece a outra ponta desse pipeline: o mesmo tipo de pequeno modelo de linguagem, submetido a cinco iterações de aprendizado por reforço em tarefas sintéticas de repositório até emitir chamadas de ferramentas estruturadas e patches candidatos por meio de um harness de cinco ferramentas. Nenhum dos dois tem um benchmark independente publicado. A diferença é que um deles teve seu pós-treinamento concluído, e saber qual deles é toda a decisão.
Os números do FrogNano abaixo vêm da ficha do modelo e do relatório técnico da Microsoft. Os números do LFM vêm da ficha da Liquid AI, da sua configuração de arquitetura e do seu arquivo de licença. Todos os números atribuídos a qualquer um dos fornecedores estão identificados como informados pelo fornecedor, e nenhum desses modelos passou por uma avaliação de terceiros — no caso do LFM2.5 2.6B Base, isso é em grande parte intencional, já que um checkpoint sem ajuste por instruções não é um alvo justo para um benchmark de chat.
A comparação só funciona se você souber o que está comparando
Coloque as duas fichas técnicas lado a lado e a primeira coisa que dá errado é a contagem de parâmetros. LFM2.5 2.6B Base tem 2,69 bilhões de parâmetros densos em 30 camadas — 22 blocos de convolução curta com duplo gate e 8 camadas de atenção de consulta agrupada, treinado em aproximadamente 34 trilhões de tokens em 16 idiomas, com um vocabulário de 128.000 tokens e um contexto de 131.072 tokens. Sua versão quantizada fica em torno de 1,67 GB em Q4_K_M.
A ficha do FrogNano-4B-2609 informa seu campo de parâmetros como a faixa "500M-5B", e o resumo do modelo o descreve como aproximadamente 4,66 bilhões. O download resolve a discussão: dois shards safetensors totalizando 9,32 GB de pesos BF16, 738 tensores, em uma pilha híbrida densa herdada de 32 camadas de Gated DeltaNet e atenção com portões. Uma torre de visão de 24 camadas está no checkpoint e nunca foi pós-treinada.
Portanto, a proporção de tamanho é de aproximadamente 1,7 para um, e a proporção de memória fica mais próxima de 5,6 para um quando a quantização entra em cena. Essa diferença importa mais do que a linha de parâmetros, porque ambos esses modelos são candidatos a auto-hospedagem, e não endpoints — que é a única razão pela qual eles pertencem ao mesmo artigo.
• Uso pretendido — LFM2.5 2.6B Base é matéria-prima para uma execução de ajuste fino. FrogNano-4B-2609 é uma política finalizada para engenharia de software em nível de repositório dentro do harness Leaf.
• Seguimento de instruções — o LFM2.5 2.6B Base não tem nenhuma de fábrica; o card da Liquid AI o recomenda para tarefas que exigem fine-tuning pesado. O FrogNano-4B-2609 segue uma descrição de tarefa e emite chamadas de ferramentas estruturadas, porque foi exatamente para isso que seu objetivo de RL o treinou.
• Contexto — 131.072 tokens para o LFM2.5 2.6B Base, contra aproximadamente 131K tokens combinados para a configuração avaliada do FrogNano. Nominalmente idênticos, mas a janela do FrogNano precisa comportar resultados de ferramentas, saída de shell e logs de teste, não apenas um prompt.
• Teto de saída — A configuração validada do FrogNano permite 8.192 tokens gerados por turno do assistente. O LFM2.5 2.6B Base não divulga um equivalente, já que não foi projetado para encerrar uma resposta.
• Modalidade — ambos são somente texto. Os componentes de visão do FrogNano são herdados e explicitamente não suportados; o LFM2.5 2.6B Base é texto-entrada, texto-saída por construção.
• Licença — O LFM2.5 2.6B Base está sob a LFM Open License v1.0, que é gratuita abaixo de US$ 10 milhões em receita anual e exige uma licença separada nesse limite ou acima dele, com obras derivadas herdando o teto. O card do FrogNano diz MIT na parte preliminar e Apache 2.0 no corpo.
A coisa pela qual a Microsoft pagou, e a coisa pela qual você mesmo teria que pagar
Esta é a seção que sustenta tudo, pois é justamente aquela em que uma comparação de especificações induz a erro.
O principal valor agregado do FrogNano-4B-2609 é o pós-treinamento, e a Microsoft publicou o método. Comece a partir do Qwen3.5-4B, que pontuou 39,4% no SWE-bench Verified por meio do harness Leaf como modelo geral. Gere tarefas candidatas de repositório a partir de snapshots reais, execute rollouts a partir do checkpoint atual para encontrar tarefas que ele às vezes resolve, mantenha essas tarefas, treine e repita — cinco iterações, aproximadamente 1.500 ambientes sintéticos validados no total, e nenhuma destilação de um modelo maior em momento algum. O resultado no próprio card da Microsoft é 61,5% no SWE-bench Verified, 37,6% no SWE-bench Pro, 31,1% no Terminal-Bench 2.0 e 47,3% no PatchEval-Verified. O apêndice de eficiência do artigo relata a mesma subida como 48,2%, 53,4%, 58,3%, 58,6% e 61,6% ao longo das iterações, o que é um lembrete útil de que até mesmo as duas tabelas do próprio laboratório para o mesmo experimento não concordam quanto aos degraus.
Agora, compare isso com o LFM2.5 2.6B Base. Trata-se do checkpoint anterior ao início desse trabalho. A recomendação do próprio card dele — faça fine-tuning nele — é exatamente o trabalho que o FrogNano documenta: um ambiente de tarefa, uma recompensa executável, um harness mais longo e várias iterações de treinamento contra uma política em movimento. O artigo não afirma que isso seja fácil. Ele relata que checkpoints intermediários se tornaram progressivamente mais caros de treinar à medida que os traços de raciocínio se alongavam, que uma penalidade de comprimento de log teve de ser adicionada para deter a deriva, e que iterações posteriores perderam a capacidade de chamada paralela de ferramentas que o modelo base tinha, terminando em uma taxa de chamadas simultâneas de 1,71%. Qualquer pessoa que planeje executar a receita do FrogNano em uma base 2.6B diferente deve reservar orçamento especificamente para esses três problemas.
O que o LFM2.5 2.6B Base oferece é um tipo diferente de vantagem inicial: um orçamento de pré-treinamento de 34 trilhões de tokens, uma arquitetura híbrida documentada, uma build quantizada já existente e um contexto documentado de 131.072 tokens, tudo em um tamanho que roda em hardware no qual um checkpoint BF16 de 9,32 GB não caberia. Se a sua tarefa for estreita o suficiente para que um pequeno fine-tune supere um modelo generalista, essa é uma posição real — e, se não for, você economizou uma rodada de treinamento.

O que você tem que construir de qualquer maneira
Nenhum destes é uma chamada de rede, e isso molda a comparação prática mais do que qualquer linha de especificação.
O LFM2.5 2.6B Base exige um runtime de inferência e uma execução de treino. O cartão da Liquid AI lista builds em formato nativo, GGUF, ONNX e MLX, portanto a metade do serving está bem coberta — o llama.cpp num portátil é uma opção real para o checkpoint quantizado. A metade do treino é sua: dados, objetivo, avaliação e uma forma de dizer se o resultado ficou melhor ou apenas diferente.
FrogNano-4B-2609 quer um endpoint compatível com OpenAI com os parsers corretos e um cluster Kubernetes com permissão para gerenciar pods e políticas de rede. O README da Microsoft é incomumente direto ao afirmar que o harness é uma dependência, em vez de uma conveniência, e o card afirma que pontuações idênticas exigem um checkpoint, tokenizer, configuração de serving, imagens de tarefa e protocolo de avaliação correspondentes. Configuração não é um detalhe aqui — sirva-o sem um parser de raciocínio Qwen3 e um parser de chamada de ferramenta do Qwen3 coder, e o modelo escreve prosa onde o harness espera uma chamada de ferramenta.
É esse o formato deste confronto: de um lado, um projeto de treinamento com um pequeno problema de serving; do outro, um projeto de serving com um grande problema de avaliação e sem mais nenhum treinamento a fazer. Ambos são trabalhos de algumas noites. Apenas um deles é um trabalho de algumas noites que pode terminar em "o modelo não é bom o suficiente" sem culpa sua.

Onde uma tupia conquista seu lugar em uma construção como esta
Ambos esses modelos acabam dentro de um pipeline que também chama algo hospedado. A própria estrutura de avaliação do FrogNano é a prova: o harness Leaf conversa com um endpoint compatível com OpenAI, o que significa que o modelo em teste e qualquer modelo com o qual você o compare são acessados pela mesma interface. Esse é um padrão que vale a pena copiar mesmo quando o motivo é apenas higiene, e é aí que um único endpoint faz algo concreto.
O OrcaRouter reúne mais de 200 modelos por trás de uma única chave compatível com a OpenAI com 0% de acréscimo, de modo que os preços de tabela dos provedores passam sem alteração e uma mudança de preço de um fornecedor fica ativa do nosso lado no mesmo dia — que é justamente o número que realmente muda quando você está decidindo se um especialista auto-hospedado supera um modelo generalista hospedado em custo por tarefa. O failover automático cobre a metade hospedada dessa comparação, não o checkpoint que você mesmo está servindo. Não hospedamos o FrogNano-4B-2609 nem o LFM2.5 2.6B Base; ambos são downloads. O que uma camada de roteamento elimina é a segunda integração toda vez que o lado hospedado do seu benchmark muda.
Escolhendo um, sinceramente
Escolha o LFM2.5 2.6B Base se a sua tarefa for restrita, o seu hardware for pequeno e você estiver preparado para assumir o treinamento — a licença é gratuita para receitas abaixo de $10M, a versão quantizada tem 1,67 GB, e o próprio model card da Liquid AI recomenda-o exatamente para isto. A contrapartida é que você obtém um ponto de partida, não uma capacidade: nada no lançamento indica qual seria a pontuação de uma execução de RL no formato FrogNano sobre ele, e ninguém publicou uma.
Escolha o FrogNano-4B-2609 se a tarefa for engenharia de software em nível de repositório e você quiser o pós-treinamento já feito. Os 61,5%, 37,6%, 31,1% e 47,3% são resultados publicados genuínos de um laboratório que descreveu seu método em detalhes — e eles também são, neste momento, um ciclo fechado: mesmo laboratório, mesmo harness, mesma linha de base do modelo base. O download de 9,32 GB, a dependência do harness e o licenciamento composto são o preço de pular um projeto de treinamento que você teria que executar de outra forma.

A reformulação útil é que estes não são concorrentes. O LFM2.5 2.6B Base está a montante de um processo que produziu algo como o FrogNano-4B-2609. Se você estiver escolhendo entre eles, a verdadeira questão é se o seu problema vale a pena ter uma execução de treinamento própria — e, se a resposta for não, o checkpoint 4B com o harness, o método publicado e a escada SWE-bench relatada pelo fornecedor é o que chega pronto.
