Um cartão de título gerado com o texto 'AREX-2 vs LFM2.5 2.6B Base - Dois Tipos de Inacabado', com dois painéis. O painel esquerdo, intitulado LFM2.5 2.6B Base, lista: lançado em agosto de 2026; 2,69B de parâmetros, denso; contexto de 131.072 tokens; disponível para download, sem ajuste por instruções. O painel direito, intitulado AREX-2, lista: repositório criado em 29 de setembro de 2026; zero bytes armazenados; nem sequer um cartão de modelo; nada para baixar. Um rodapé diz: 'Um é um checkpoint sem instruções. O outro é um nome sem um checkpoint.' O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

AREX-2 vs LFM2.5 2.6B Base: Um repositório vazio e um checkpoint sem instruções

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque o AREX-2ao lado do LFM2.5 2.6B Base e a primeira coisa que os dois têm em comum é que nenhum deles é um produto que você possa usar hoje — por motivos que não têm nada a ver um com o outro. O AREX-2 é um repositório do Hugging Face que a BAAI criou em 29 de setembro de 2026, às 17:56 UTC; ele contém um .gitattributes arquivo, armazena zero bytes de dados de modelo e não traz ficha de modelo, tag de licença nem nenhum tipo de anúncio. Já o LFM2.5 2.6B Base, publicado pela Liquid AI em agosto de 2026, é o tipo oposto de inacabado: um checkpoint completo e baixável, somente texto, de 2,69 bilhões de parâmetros, sob a Licença Aberta LFM (lfm1.0), entregue deliberadamente sem ajuste por instrução, porque a proposta é fazer fine-tuning nele em vez de fazer perguntas a ele.

Uma é a ausência de um artefato. A outra é um artefato ao qual falta uma etapa que nunca deveria ter feito parte dele. Essas duas só pertencem à mesma categoria se você estiver lendo por alto, e tratá-las como a mesma categoria é exatamente como uma equipe acaba esperando pela coisa errada. A comparação útil entre essas duas não é capacidade — não há um AREX-2 para medir — mas o que cada uma é matéria-prima para, e quanto custa descobrir se ela é boa.

A diferença de espécie, declarada primeiro.

O LFM2.5 2.6B Base é uma substância. É o checkpoint pré-treinado da família híbrida LFM2.5 da Liquid AI: 30 camadas, das quais 22 são blocos de convolução curta com duplo gate e 8 são atenção de consulta agrupada, treinado em aproximadamente 34 trilhões de tokens em 16 idiomas, com uma janela de contexto de 131.072 tokens e uma build quantizada que fica perto de 1,67 GB em Q4_K_M. Não tem ajuste de instrução. Alimente-o com uma pergunta e ele continua o texto; não responde. O próprio card da Liquid AI aponta o ajuste fino pesado como o uso pretendido, e há um irmão pós-treinado para quem quiser um modelo que responda a prompts. É um substrato, e o fato de ter pontuação ruim em benchmarks de seguir prompts não é um defeito — é a definição da coisa.

AREX-2 não é uma substância nem um produto; é um namespace. Os únicos fatos disponíveis são a organização (BAAI), o carimbo de data/hora de criação (29 de setembro de 2026) e o nome. Nada foi enviado e nada foi dito. O próprio nome pertence a uma família que existe: em 23 de julho de 2026, a BAAI lançou o AREX-Base, uma mistura de especialistas de 122 bilhões de parâmetros com 10 bilhões de parâmetros ativos, construída sobre o Qwen3.5-122B-A10B, e o AREX-Turbo, um modelo denso de 4B construído sobre o Qwen3.5-4B — ambos Apache 2.0, ambos agentes de pesquisa profunda com um design de dois ciclos que reúne evidências, produz uma resposta candidata com um índice de confiança e então verifica essa resposta em relação às restrições originais e a refina ou reinicia. Seus números publicados, relatados pelo fornecedor e não reproduzidos de forma independente, chegam a 82,5 no BrowseComp e 85,4 no GAIA para o Base, e 70,7 / 81,6 para o Turbo.

• Disponibilidade — O LFM2.5 2.6B Base já está disponível para download. O AREX-2 não tem arquivos em seu repositório.

• Tamanho — 2,69B de parâmetros densos para o modelo Liquid, todos visíveis no checkpoint. Desconhecido para o AREX-2; a família abrange um MoE de 122B e um denso de 4B, então o "2" não prevê nada.

• Contexto — 131.072 tokens para LFM2.5 2.6B Base. Nada publicado para AREX-2.

• Licença — LFM Open License v1.0, gratuita abaixo de US$ 10 milhões de receita anual e exigindo uma licença separada a partir desse limite. Ainda não há tag de licença no AREX-2; a primeira geração do AREX era Apache 2.0.

• O que é — um substrato de ajuste fino versus, a julgar pela família, um agente hospedado cujo valor está em um ciclo de busca e verificação, e não em seus pesos.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, tags for Text Generation, Transformers, Safetensors and 16 languages, a Model Details table listing LFM2.5-2.6B-Base at 2.6B parameters as a pre-trained base model for fine-tuning alongside the post-trained LFM2.5-2.6B, and the feature list beginning with total parameters 2.69B, 30 layers, a 34-trillion-token training budget, a 128,000 vocabulary and a 131,072-token context length.

Cartões de pontuação em branco que significam coisas opostas

Nenhum dos dois modelos tem um benchmark pelo qual você deva se orientar, e os motivos divergem completamente.

A Liquid AI não está escondendo nada ao deixar seu Base sem pontuação. Pontuar um checkpoint pré-treinado em benchmarks de seguimento de instruções mediria a ausência de fine-tuning, não a qualidade do substrato — e é por isso que a empresa avalia o irmão pós-treinado e deixa o Base sem avaliação. Essa lacuna é verificável do seu lado, e é justamente esse o ponto: você pode baixar 1,67 GB, executar sua própria avaliação na sua própria tarefa e saber a resposta antes de gastar qualquer coisa com serving.

A lacuna do AREX-2 não é uma decisão de design, é um ainda-não. Não há nada para baixar, portanto não há nada para testar, e nenhuma avaliação que você pudesse executar esta semana lhe diria coisa alguma sobre ele. Qualquer pessoa que publique números de benchmark do AREX-2 nos próximos dias está publicando algo que não teria como ter medido.

A generated two-column card headed 'Two blank scorecards, for opposite reasons'. The left column, LFM2.5 2.6B Base, reads: no published evaluation - deliberate; scoring a pretrained checkpoint measures the missing fine-tuning; downloadable, verify it on your own task today; 1.67 GB at Q4_K_M, runs on a single card. The right column, AREX-2, reads: no published evaluation - nothing to evaluate; no weights, no card, no licence tag; not downloadable, nothing to verify; any figure quoted this week is not a measurement. A footer reads 'One blank is a design decision. The other is a not-yet.' The OrcaRouter logo is composited in the bottom-right corner.

Duas perguntas diferentes sobre ajuste fino

Como ambos são pontos de partida e não serviços acabados, vale a pena ser preciso quanto àquilo para que cada um seria um ponto de partida, pois é aí que eles realmente deixam de se parecer.

Um checkpoint híbrido de 2,69B é uma ferramenta para criar um modelo pequeno, barato e especializado. Os usos interessantes são os nada glamorosos: um classificador que lê um tipo de documento em um fluxo de trabalho regulamentado, um modelo de extração que transforma um formulário em JSON estruturado, um reescritor específico de domínio que roda em uma única placa perto dos dados. O valor vem do fato de que você é dono do artefato depois e de que o custo marginal de uma chamada é eletricidade. O loop de treinamento é o trabalho, e é um trabalho que você pode começar hoje.

AREX-2 aponta na outra direção. A família AREX não foi projetada para ser ajustada finamente e transformada em um produto; ela foi projetada para ser chamada como um agente que executa buscas, integra evidências e verifica suas próprias respostas em relação a restrições. Se uma segunda geração continuar nessa linha, o que você estaria avaliando é uma trajetória — quantos passos ela dá, se percebe uma contradição, se o valor de confiança de sua resposta candidata significa alguma coisa. Isso não é uma questão de ajuste fino e não é uma questão de pesos. É uma questão de serving, e começa com alguém publicando pesos e um card.

Estes não são substitutos em nenhuma escala. Uma equipe que precisa de um modelo que possa possuir e retreinar não está esperando pelo AREX-2. Uma equipe que precisa de um agente de pesquisa não vai fazer ajuste fino de um híbrido de 2,6B para transformá-lo em um.

Onde a camada de roteamento se encaixa, para cada um deles

A diferença prática entre esses dois fica evidente no momento em que um modelo entra em uma aplicação, porque os dois têm relações opostas com a hospedagem.

O LFM2.5 2.6B Base não está no catálogo do OrcaRouter, e nenhuma variante do LFM2.5 está, então ele vem da própria distribuição da Liquid AI e dos habituais hosts de terceiros — um artefato local, e não um endpoint roteado. AREX-Base e AREX-Turbo também não estão no nosso catálogo. O que uma camada de roteamento serve de verdade neste cenário é o outro lado da arquitetura: no dia em que você compara seu fine-tune com os modelos que ele precisa superar, você quer que essa comparação custe uma mudança de configuração, e não um ciclo de aquisição. Uma API na frente de mais de 200 modelos, preço de tabela do provedor repassado sem nada adicionado por token, uma chave para todo o painel e failover para que uma tarde ruim de um provedor não se torne a tarde ruim da sua avaliação. Essas são as condições sob as quais um teste A/B em um modelo não comprovado é barato o suficiente para realmente valer a pena executar.

Esse também é o enquadramento honesto para o próprio AREX-2. Quando ele for lançado — supondo que seja lançado com pesos abertos, como fizeram seus dois predecessores — a maneira sensata de testar um agente totalmente novo em uma carga de trabalho real é em um caminho secundário, atrás de failover, e não como o único provedor do qual seu loop de produção depende.

O que uma pessoa razoável faz sobre cada um nesta semana

Se você tem uma tarefa pequena e específica e dados que não podem sair da sua infraestrutura, o checkpoint Liquid está disponível, é pequeno, tem licenciamento permissivo abaixo de um limite de receita e pode ser testado hoje à tarde. Baixe-o, execute-o no seu próprio conjunto de avaliação e deixe o resultado decidir. Nada sobre o AREX-2 muda esse plano.

Se você precisa hoje de um comportamento de pesquisa de longo horizonte, o modelo ao qual recorrer é o que já existe: AREX-Base, lançado em julho, com benchmarks de agentes publicados que você pode pelo menos comparar com um artigo. AREX-2 é um nome com um timestamp, e as duas coisas que mudariam seu status são visíveis de fora — se arquivos aparecem na árvore e se um cartão com uma contagem de parâmetros e uma licença aparece junto deles.

O modo de falha que este artigo existe para evitar é aquele em que um nome reservado é tratado como um item de roadmap. Não é. É um repositório que a BAAI criou ontem, e a quantidade correta de planejamento a fazer em torno dele agora é nenhuma.