
TwIL-LM3-Pro vs LFM2.5 2.6B Base: Um Está Finalizado, o Outro É um Ponto de Partida
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O mais revelador na comparação publicada entre TwIL-LM3-Pro e LFM2.5 2.6B Base é que a webAI não publicou absolutamente nenhuma contra o 2.6B. As tabelas Track A e Track B da webAI colocam seu especialista em lógica formal de 3,66B contra uma série de oponentes — sua própria base Granite, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — e a entrada da Liquid AI que escolheram é LFM2.5-8B-A1B, não o 2.6B. O 2.6B que de fato aparece na tabela é `LFM2-2.6B`, a geração anterior, que é um modelo diferente com uma execução de pré-treinamento diferente. Essa omissão não é um descuido. LFM2.5 2.6B Base é um checkpoint pré-treinado sem ajuste de instrução, e benchmarks de seguimento de instruções não são um teste para o qual ele foi projetado.
Portanto, esta página compara um artefato acabado com uma matéria-prima. O enquadramento ao estilo Aion — um modelo tem uma pontuação e o outro não — encaixa, mas a razão é mais específica e mais interessante: um passou por pós-treinamento e foi mesclado, o outro para deliberadamente antes do pós-treinamento, e os dois documentos que os descrevem respondem de propósito a perguntas diferentes.
Duas contagens de parâmetros que não são a mesma medição
O TwIL-LM3-Pro tem 3,66 bilhões de parâmetros, é denso, e todos eles ficam ativos em cada token. Ele descende de `ibm-granite/granite-4.2-3b` por meio de ajuste fino com LoRA, destilação multicaminho, fusão de checkpoints, uma mesclagem WiSE-FT de volta em direção à base e uma etapa de GRPO ponderada por entropia — e o artefato disponibilizado pela webAI é a política mesclada, não um adaptador LoRA, então ele funciona de forma independente.
O LFM2.5 2.6B Base tem 2,69 bilhões de parâmetros distribuídos em 30 camadas: 22 blocos de convolução curta com portão duplo intercalados com 8 camadas de atenção com consultas agrupadas. Esse design híbrido de conv/atenção é a arquitetura on-device da Liquid, e é a razão pela qual os números de throughput da família são o que são, em vez de serem uma função apenas da contagem de parâmetros. Ele foi treinado em 34 trilhões de tokens com um vocabulário de 128.000 tokens e possui uma janela de contexto de 131.072 tokens.
As duas contagens ficam a cerca de 36% uma da outra e são obtidas por meio de arquiteturas totalmente diferentes, portanto, nem "3,66B supera 2,69B" nem o inverso significam algo como uma alegação de qualidade. O próprio cartão de modelo da webAI faz essa observação de forma indireta quando se recusa a comparar a perplexidade de corpus entre tokenizadores — o vocabulário do TwIL-LM3-Pro é 100.352, o do LFM2.5-2.6B é 128.000, e a perplexidade é por token.
O que a "Base" remove e por que isso altera o placar
A Liquid AI publica o LFM2.5 2.6B em duas formas: o checkpoint pós-treinado, ajustado para cargas de trabalho agênticas em harnesses de agentes populares, e o Base, descrito em sua própria ficha como "o checkpoint pré-treinado somente texto, usado para criar todas as variantes do LFM2.5-2.6B". O Base é a entrada para o ajuste fino, não um produto. Ele não tem ajuste por instruções, nenhum template de chat que mereça esse nome e nenhuma avaliação publicada — porque avaliar um modelo base em tarefas de seguir instruções mede a coisa errada.
A posição do TwIL-LM3-Pro é a inversa. Todo o seu valor está no stack de pós-treinamento: a webAI relata que, em seu próprio harness, o pipeline elevou o gate macro in-domain de 0,4313, do seu modelo base, para 0,5539, com a macro de 10 conjuntos de dados held-out permanecendo estável (de 0,7942 para 0,7901) em vez de colapsar. A retenção em held-out é a parte difícil do pós-treinamento especializado, e é a parte que o Base não consegue responder.
É também aqui que a comparação de tamanho nas tabelas da webAI vale a pena. O TwIL-LM3-Pro é reportado à frente do LFM2.5-8B-A1B em ambos os resultados macro em conjuntos reservados — 0,7901 versus 0,7884 no conjunto de dez conjuntos de dados, 0,7425 versus 0,7378 no de catorze — com menos da metade da contagem de parâmetros desse modelo MoE. Trata-se de um resultado genuinamente comparável em condições equivalentes, e ele está disponível justamente porque o LFM2.5-8B-A1B é um modelo pós-treinado que pode ser executado por um harness de instruções. O Base não pode, e é por isso que o 2.6B nunca recebeu uma coluna.
As dimensões que vale a pena alinhar
• Parâmetros — TwIL-LM3-Pro 3.66B denso vs LFM2.5 2.6B Base 2.69B (30 camadas: 22 conv + 8 GQA).
• Pós-treinamento — LoRA SFT, destilação, merge WiSE-FT e GRPO no passo 2580 vs nenhum; a Base é a saída de pré-treinamento por design.
• Janela de contexto — 131.072 tokens em ambos, herdados de suas respectivas bases.
• Vocabulário — 100.352 tokens vs 128.000, razão pela qual as suas perplexidades não são comparáveis.
• Idiomas — apenas inglês vs dezessete, incluindo árabe, chinês, japonês, coreano, espanhol e tailandês.
• Formato de raciocínio — TwIL-LM3-Pro emite um bloco `<think>` por padrão e raciocina de forma extensa (1.902 tokens em média no domínio, 24,2% das gerações atingindo o limite de comprimento) vs. um checkpoint base sem nenhum formato de instrução.
• Licença — Licença Não Comercial webAI ver. 1.0 vs Licença Aberta LFM da Liquid v1.0.
• Para que serve — um endpoint de inferência de lógica formal vs um ponto de partida para fine-tuning.
As linhas de contexto merecem uma nota de rodapé que ambos os modelos fornecem: cada um carrega 131.072 tokens desde o pré-treinamento, e nenhum dos fornecedores validou o comportamento de contexto longo — a ficha do TwIL-LM3-Pro diz que toda pontuação publicada foi medida dentro de uma janela de 8.192 tokens. Números coincidentes aqui são herdados, não demonstrados.
Licença, e para que serve legalmente cada uma
A webAI Non-Commercial License do TwIL-LM3-Pro permite pesquisa e uso pessoal e exige um acordo separado com a webAI para implantação que gere receita. O LFM2.5 2.6B Base é distribuído sob a própria LFM Open License v1.0 da Liquid, que a API do Hugging Face reporta como `license: other` em vez de um identificador SPDX padrão — leia o arquivo de licença antes de planejar com base nele, porque os termos são próprios da Liquid, e não um modelo reconhecido.
Nenhuma das licenças é a Apache 2.0, e é um erro tratar "pesos abertos" como sinônimo de "permissiva para uso comercial". A diferença prática entre as duas está naquilo que as licenças protegem: um pesquisador sem fins comerciais pode usar ambas, uma empresa que está construindo um produto pode usar ambas, e o modelo de "pesos abertos" —
Onde cada um pertence em uma pilha
A Base é a escolha certa quando você pretende treinar. Se o seu problema é uma tarefa estreita de rotulagem, uma cabeça de classificação específica de domínio ou um ajuste fino em alguns milhares de exemplos rotulados, começar a partir de um checkpoint pré-treinado de 2,69 bilhões com um vocabulário multilíngue amplo e uma arquitetura convolucional híbrida projetada para vazão é uma decisão de engenharia sólida, e o custo do pós-treinamento que você pularia é o custo que você está pagando deliberadamente em vez disso.
TwIL-LM3-Pro é a escolha certa quando você não pretende treinar e a tarefa já é lógica formal. Rótulos de acarretamento, formalização de enunciados em Lean, análises semânticas e crítica de provas são as tarefas para as quais todo o seu pipeline foi voltado, e começar de um checkpoint que já passou pelo merge e pela etapa de reforço poupa você da única parte disso que é genuinamente difícil de reproduzir — manter o nível da suíte de avaliação reservada enquanto se ganha em domínio.
O erro é interpretar "especialista pós-treinado de 3,66B" como estritamente melhor que "checkpoint base de 2,69B". Eles estão em estágios diferentes da mesma linha de produção.
Servindo-os, ou servindo ao redor deles
Nenhum dos modelos é uma rota no catálogo do OrcaRouter hoje, e o motivo é diferente para cada um. O TwIL-LM3-Pro tem licença não comercial e não tem endpoint hospedado; o LFM2.5 2.6B Base é um artefato de ajuste fino que ninguém serviria de propósito como endpoint de inferência. Onde um roteador justifica seu lugar é um nível acima, no trabalho que cerca um especialista: gerar e filtrar os dados de treinamento com os quais você faria o ajuste fino do Base, expandir os prompts que você forneceria a um modelo de lógica formal e avaliar os resultados. Essas são chamadas de texto, e elas passam por um único endpoint compatível com OpenAI para mais de 200 modelos ao preço de tabela do provedor com 0% de markup adicionado, então um corte de preço do provedor entra em vigor no mesmo dia e uma troca de um modelo de geração de dados para outro é uma edição de configuração, e não um segundo fornecedor.
O failover automático importa mais do que o habitual em um pipeline de ajuste fino, porque um job em lote que morre aos 80% desperdiça toda a execução. Uma única chave para os modelos de geração, com um fallback que reenvia em caso de erro do provedor, é uma peça de infraestrutura menor do que três integrações de API.

Qual deles, decidido pela sua intenção
Se você estiver treinando, use o Base. Se estiver fazendo inferência em lógica formal e a licença permitir seu uso, use o TwIL-LM3-Pro. Se você precisa hoje de um modelo pequeno que siga instruções e nenhuma das restrições se aplica, use o irmão pós-treinado do LFM2.5 2.6B — o modelo que a Liquid realmente publica para essa finalidade — e deixe o Base para o ajuste fino que você já estava planejando de qualquer forma.


