Um cartão de título gerado encabeçado por 'TwIL-LM3-Pro vs LFM2.5 2.6B Base', com o subtítulo 'Um Está Pronto, o Outro É um Ponto de Partida', com dois cartões arredondados que dizem 'TwIL-LM3-Pro - pós-treinado e mesclado' e 'LFM2.5 2.6B Base - checkpoint pré-treinado'. O logotipo do OrcaRouter está composto no canto inferior direito.
Guides & Insights

TwIL-LM3-Pro vs LFM2.5 2.6B Base: Um Está Finalizado, o Outro É um Ponto de Partida

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O mais revelador na comparação publicada entre TwIL-LM3-Pro e LFM2.5 2.6B Base é que a webAI não publicou absolutamente nenhuma contra o 2.6B. As tabelas Track A e Track B da webAI colocam seu especialista em lógica formal de 3,66B contra uma série de oponentes — sua própria base Granite, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — e a entrada da Liquid AI que escolheram é LFM2.5-8B-A1B, não o 2.6B. O 2.6B que de fato aparece na tabela é `LFM2-2.6B`, a geração anterior, que é um modelo diferente com uma execução de pré-treinamento diferente. Essa omissão não é um descuido. LFM2.5 2.6B Base é um checkpoint pré-treinado sem ajuste de instrução, e benchmarks de seguimento de instruções não são um teste para o qual ele foi projetado.

Portanto, esta página compara um artefato acabado com uma matéria-prima. O enquadramento ao estilo Aion — um modelo tem uma pontuação e o outro não — encaixa, mas a razão é mais específica e mais interessante: um passou por pós-treinamento e foi mesclado, o outro para deliberadamente antes do pós-treinamento, e os dois documentos que os descrevem respondem de propósito a perguntas diferentes.

Duas contagens de parâmetros que não são a mesma medição

O TwIL-LM3-Pro tem 3,66 bilhões de parâmetros, é denso, e todos eles ficam ativos em cada token. Ele descende de `ibm-granite/granite-4.2-3b` por meio de ajuste fino com LoRA, destilação multicaminho, fusão de checkpoints, uma mesclagem WiSE-FT de volta em direção à base e uma etapa de GRPO ponderada por entropia — e o artefato disponibilizado pela webAI é a política mesclada, não um adaptador LoRA, então ele funciona de forma independente.

O LFM2.5 2.6B Base tem 2,69 bilhões de parâmetros distribuídos em 30 camadas: 22 blocos de convolução curta com portão duplo intercalados com 8 camadas de atenção com consultas agrupadas. Esse design híbrido de conv/atenção é a arquitetura on-device da Liquid, e é a razão pela qual os números de throughput da família são o que são, em vez de serem uma função apenas da contagem de parâmetros. Ele foi treinado em 34 trilhões de tokens com um vocabulário de 128.000 tokens e possui uma janela de contexto de 131.072 tokens.

As duas contagens ficam a cerca de 36% uma da outra e são obtidas por meio de arquiteturas totalmente diferentes, portanto, nem "3,66B supera 2,69B" nem o inverso significam algo como uma alegação de qualidade. O próprio cartão de modelo da webAI faz essa observação de forma indireta quando se recusa a comparar a perplexidade de corpus entre tokenizadores — o vocabulário do TwIL-LM3-Pro é 100.352, o do LFM2.5-2.6B é 128.000, e a perplexidade é por token.

O que a "Base" remove e por que isso altera o placar

A Liquid AI publica o LFM2.5 2.6B em duas formas: o checkpoint pós-treinado, ajustado para cargas de trabalho agênticas em harnesses de agentes populares, e o Base, descrito em sua própria ficha como "o checkpoint pré-treinado somente texto, usado para criar todas as variantes do LFM2.5-2.6B". O Base é a entrada para o ajuste fino, não um produto. Ele não tem ajuste por instruções, nenhum template de chat que mereça esse nome e nenhuma avaliação publicada — porque avaliar um modelo base em tarefas de seguir instruções mede a coisa errada.

A posição do TwIL-LM3-Pro é a inversa. Todo o seu valor está no stack de pós-treinamento: a webAI relata que, em seu próprio harness, o pipeline elevou o gate macro in-domain de 0,4313, do seu modelo base, para 0,5539, com a macro de 10 conjuntos de dados held-out permanecendo estável (de 0,7942 para 0,7901) em vez de colapsar. A retenção em held-out é a parte difícil do pós-treinamento especializado, e é a parte que o Base não consegue responder.

É também aqui que a comparação de tamanho nas tabelas da webAI vale a pena. O TwIL-LM3-Pro é reportado à frente do LFM2.5-8B-A1B em ambos os resultados macro em conjuntos reservados — 0,7901 versus 0,7884 no conjunto de dez conjuntos de dados, 0,7425 versus 0,7378 no de catorze — com menos da metade da contagem de parâmetros desse modelo MoE. Trata-se de um resultado genuinamente comparável em condições equivalentes, e ele está disponível justamente porque o LFM2.5-8B-A1B é um modelo pós-treinado que pode ser executado por um harness de instruções. O Base não pode, e é por isso que o 2.6B nunca recebeu uma coluna.

As dimensões que vale a pena alinhar

• Parâmetros — TwIL-LM3-Pro 3.66B denso vs LFM2.5 2.6B Base 2.69B (30 camadas: 22 conv + 8 GQA).

• Pós-treinamento — LoRA SFT, destilação, merge WiSE-FT e GRPO no passo 2580 vs nenhum; a Base é a saída de pré-treinamento por design.

• Janela de contexto — 131.072 tokens em ambos, herdados de suas respectivas bases.

• Vocabulário — 100.352 tokens vs 128.000, razão pela qual as suas perplexidades não são comparáveis.

• Idiomas — apenas inglês vs dezessete, incluindo árabe, chinês, japonês, coreano, espanhol e tailandês.

• Formato de raciocínio — TwIL-LM3-Pro emite um bloco `<think>` por padrão e raciocina de forma extensa (1.902 tokens em média no domínio, 24,2% das gerações atingindo o limite de comprimento) vs. um checkpoint base sem nenhum formato de instrução.

• Licença — Licença Não Comercial webAI ver. 1.0 vs Licença Aberta LFM da Liquid v1.0.

• Para que serve — um endpoint de inferência de lógica formal vs um ponto de partida para fine-tuning.

As linhas de contexto merecem uma nota de rodapé que ambos os modelos fornecem: cada um carrega 131.072 tokens desde o pré-treinamento, e nenhum dos fornecedores validou o comportamento de contexto longo — a ficha do TwIL-LM3-Pro diz que toda pontuação publicada foi medida dentro de uma janela de 8.192 tokens. Números coincidentes aqui são herdados, não demonstrados.

Licença, e para que serve legalmente cada uma

A webAI Non-Commercial License do TwIL-LM3-Pro permite pesquisa e uso pessoal e exige um acordo separado com a webAI para implantação que gere receita. O LFM2.5 2.6B Base é distribuído sob a própria LFM Open License v1.0 da Liquid, que a API do Hugging Face reporta como `license: other` em vez de um identificador SPDX padrão — leia o arquivo de licença antes de planejar com base nele, porque os termos são próprios da Liquid, e não um modelo reconhecido.

Nenhuma das licenças é a Apache 2.0, e é um erro tratar "pesos abertos" como sinônimo de "permissiva para uso comercial". A diferença prática entre as duas está naquilo que as licenças protegem: um pesquisador sem fins comerciais pode usar ambas, uma empresa que está construindo um produto pode usar ambas, e o modelo de "pesos abertos" —

Onde cada um pertence em uma pilha

A Base é a escolha certa quando você pretende treinar. Se o seu problema é uma tarefa estreita de rotulagem, uma cabeça de classificação específica de domínio ou um ajuste fino em alguns milhares de exemplos rotulados, começar a partir de um checkpoint pré-treinado de 2,69 bilhões com um vocabulário multilíngue amplo e uma arquitetura convolucional híbrida projetada para vazão é uma decisão de engenharia sólida, e o custo do pós-treinamento que você pularia é o custo que você está pagando deliberadamente em vez disso.

TwIL-LM3-Pro é a escolha certa quando você não pretende treinar e a tarefa já é lógica formal. Rótulos de acarretamento, formalização de enunciados em Lean, análises semânticas e crítica de provas são as tarefas para as quais todo o seu pipeline foi voltado, e começar de um checkpoint que já passou pelo merge e pela etapa de reforço poupa você da única parte disso que é genuinamente difícil de reproduzir — manter o nível da suíte de avaliação reservada enquanto se ganha em domínio.

O erro é interpretar "especialista pós-treinado de 3,66B" como estritamente melhor que "checkpoint base de 2,69B". Eles estão em estágios diferentes da mesma linha de produção.

Servindo-os, ou servindo ao redor deles

Nenhum dos modelos é uma rota no catálogo do OrcaRouter hoje, e o motivo é diferente para cada um. O TwIL-LM3-Pro tem licença não comercial e não tem endpoint hospedado; o LFM2.5 2.6B Base é um artefato de ajuste fino que ninguém serviria de propósito como endpoint de inferência. Onde um roteador justifica seu lugar é um nível acima, no trabalho que cerca um especialista: gerar e filtrar os dados de treinamento com os quais você faria o ajuste fino do Base, expandir os prompts que você forneceria a um modelo de lógica formal e avaliar os resultados. Essas são chamadas de texto, e elas passam por um único endpoint compatível com OpenAI para mais de 200 modelos ao preço de tabela do provedor com 0% de markup adicionado, então um corte de preço do provedor entra em vigor no mesmo dia e uma troca de um modelo de geração de dados para outro é uma edição de configuração, e não um segundo fornecedor.

O failover automático importa mais do que o habitual em um pipeline de ajuste fino, porque um job em lote que morre aos 80% desperdiça toda a execução. Uma única chave para os modelos de geração, com um fallback que reenvia em caso de erro do provedor, é uma peça de infraestrutura menor do que três integrações de API.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs LFM2.5 2.6B Base - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Post-training SFT, merge, GRPO; Context 131,072 tokens; Vocabulary 100,352; Languages English; Licence non-commercial. LFM2.5 2.6B Base: Parameters 2.69B (30 layers); Post-training none by design; Context 131,072 tokens; Vocabulary 128,000; Languages 17; Licence LFM Open License v1.0. A footer line reads 'Both vendor-reported; neither model has a third-party evaluation.' The OrcaRouter logo is composited in the bottom-right corner.

Qual deles, decidido pela sua intenção

Se você estiver treinando, use o Base. Se estiver fazendo inferência em lógica formal e a licença permitir seu uso, use o TwIL-LM3-Pro. Se você precisa hoje de um modelo pequeno que siga instruções e nenhuma das restrições se aplica, use o irmão pós-treinado do LFM2.5 2.6B — o modelo que a Liquid realmente publica para essa finalidade — e deixe o Base para o ajuste fino que você já estava planejando de qualquer forma.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, the 16-languages tag, the LFM2 and liquid tags, and the card's opening description of LFM2.5 as a family of hybrid models designed for on-device deployment, built on the LFM2 architecture with extended pre-training and reinforcement learning.A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B, the post-trained sibling, showing the 16-languages and LFM2 tags and the card's description of LFM2.5-2.6B as part of the LFM2.5 family with a 128K context window and agentic post-training.