Une carte de titre générée portant « AREX-2 vs LFM2.5 2.6B Base - Deux formes d'inachevé », avec deux panneaux. Le panneau de gauche, intitulé LFM2.5 2.6B Base, liste : livré en août 2026 ; 2,69 Md de paramètres, dense ; contexte de 131 072 tokens ; téléchargeable, sans affinage par instructions. Le panneau de droite, intitulé AREX-2, liste : dépôt créé le 29 sept. 2026 ; zéro octet stocké ; aucune fiche de modèle ; rien à télécharger. Un pied de page indique : « L'un est un checkpoint sans instructions. L'autre est un nom sans checkpoint. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

AREX-2 vs LFM2.5 2.6B Base : un dépôt vide et un checkpoint sans instructions

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Placez AREX-2 à côté de LFM2.5 2.6B Base et la première chose qu’ils ont en commun, c’est qu’aucun des deux n’est un produit que vous pouvez utiliser aujourd’hui — pour des raisons qui n’ont rien à voir l’une avec l’autre. AREX-2 est un dépôt Hugging Face que BAAI a créé le 29 septembre 2026 à 17:56 UTC ; il contient un .gitattributes ; ce fichier ne stocke aucun octet de données de modèle et ne comporte ni fiche de modèle, ni balise de licence, ni annonce d’aucune sorte. LFM2.5 2.6B Base, publié par Liquid AI en août 2026, est le type opposé d’inachevé : un checkpoint complet et téléchargeable de 2,69 milliards de paramètres, uniquement textuel, sous la LFM Open License (lfm1.0), qui est livré délibérément sans instruction tuning, parce qu’il est destiné à être fine-tuné plutôt qu’à être interrogé.

L'un est l'absence d'un artefact. L'autre est un artefact auquel manque une étape qu'il n'était pas censé avoir. Ils ne relèvent de la même catégorie que si l'on survole, et les traiter comme relevant de la même catégorie est exactement ce qui fait qu'une équipe finit par attendre la mauvaise chose. La comparaison utile entre ces deux n'est pas une question de capacité — il n'y a pas d'AREX-2 à mesurer — mais ce pour quoi chacun est une matière première, et ce qu'il en coûte de découvrir si elle vaut quelque chose.

La différence de nature, énoncée d'abord

LFM2.5 2.6B Base est une substance. C'est le point de contrôle pré-entraîné de la famille hybride LFM2.5 de Liquid AI : 30 couches, dont 22 sont des blocs de convolution courte à double portillonnage et 8 de l'attention à requêtes groupées, entraîné sur environ 34 000 milliards de tokens dans 16 langues, avec une fenêtre de contexte de 131 072 tokens et une version quantifiée qui atteint environ 1,67 Go en Q4_K_M. Il n'a subi aucun ajustement par instructions. Donnez-lui une question et il continue le texte ; il ne répond pas. La fiche de Liquid AI elle-même indique un réglage fin intensif comme usage prévu, et il existe une version sœur post-entraînée pour quiconque veut un modèle qui réagit aux invites. C'est un substrat, et le fait qu'il obtienne de mauvais scores aux benchmarks de suivi d'invites n'est pas un défaut — c'est la définition même de la chose.

AREX-2 n'est pas une substance ni un produit ; c'est un espace de noms. Les seuls faits disponibles sont l'organisation (BAAI), l'horodatage de création (29 septembre 2026) et le nom. Rien n'a été téléversé et rien n'a été dit. Le nom lui-même appartient à une famille qui existe bel et bien : le 23 juillet 2026, BAAI a publié AREX-Base, un mélange d'experts de 122 milliards de paramètres avec 10 milliards de paramètres actifs, construit sur Qwen3.5-122B-A10B, et AREX-Turbo, un modèle dense 4B construit sur Qwen3.5-4B — tous deux sous Apache 2.0, tous deux des agents de recherche approfondie dotés d'une architecture à deux boucles qui rassemble des preuves, produit une réponse candidate avec un indice de confiance, puis vérifie cette réponse par rapport aux contraintes d'origine et l'affine ou redémarre. Ses chiffres publiés, rapportés par le fournisseur et non reproduits indépendamment, atteignent 82,5 sur BrowseComp et 85,4 sur GAIA pour la version Base, et 70,7 / 81,6 pour la version Turbo.

• Disponibilité — LFM2.5 2.6B Base est téléchargeable dès maintenant. AREX-2 n'a aucun fichier dans son dépôt.

• Taille — 2,69 B de paramètres denses pour le modèle Liquid, tous visibles dans le checkpoint. Inconnu pour AREX-2 ; la famille couvre un MoE de 122 B et un modèle dense de 4 B, donc le « 2 » ne prédit rien.

• Contexte — 131 072 jetons pour LFM2.5 2.6B Base. Rien de publié pour AREX-2.

• Licence — LFM Open License v1.0, gratuite en dessous de 10 M$ de chiffre d’affaires annuel et nécessitant une licence distincte à partir de ce seuil. Aucune mention de licence pour l’instant sur AREX-2 ; la première génération d’AREX était sous Apache 2.0.

• De quoi il s'agit — un substrat de fine-tuning par opposition, si l'on en juge par la famille, à un agent hébergé dont la valeur réside dans une boucle de recherche-et-vérification plutôt que dans ses poids.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, tags for Text Generation, Transformers, Safetensors and 16 languages, a Model Details table listing LFM2.5-2.6B-Base at 2.6B parameters as a pre-trained base model for fine-tuning alongside the post-trained LFM2.5-2.6B, and the feature list beginning with total parameters 2.69B, 30 layers, a 34-trillion-token training budget, a 128,000 vocabulary and a 131,072-token context length.

Des fiches de score vierges qui signifient des choses opposées

Aucun des deux modèles ne dispose d’un benchmark sur lequel vous devriez vous baser pour planifier, et les raisons divergent complètement.

Liquid AI ne cache rien en laissant son Base non évalué. Évaluer un checkpoint pré-entraîné sur des benchmarks de suivi d’instructions mesurerait l’absence de fine-tuning, et non la qualité du substrat — c’est pourquoi l’entreprise évalue le modèle frère post-entraîné et laisse le Base non évalué. Ce vide est vérifiable de votre côté, et c’est tout l’intérêt : vous pouvez télécharger 1,67 Go, lancer votre propre évaluation sur votre propre tâche et connaître la réponse avant de dépenser quoi que ce soit en serving.

Le vide d'AREX-2 n'est pas une décision de conception, c'est un pas-encore. Il n'y a rien à télécharger, donc rien à tester, et aucune évaluation que vous pourriez mener cette semaine ne vous apprendrait quoi que ce soit à son sujet. Quiconque publie des chiffres de benchmark d'AREX-2 dans les prochains jours publie quelque chose qu'il est impossible d'avoir mesuré.

A generated two-column card headed 'Two blank scorecards, for opposite reasons'. The left column, LFM2.5 2.6B Base, reads: no published evaluation - deliberate; scoring a pretrained checkpoint measures the missing fine-tuning; downloadable, verify it on your own task today; 1.67 GB at Q4_K_M, runs on a single card. The right column, AREX-2, reads: no published evaluation - nothing to evaluate; no weights, no card, no licence tag; not downloadable, nothing to verify; any figure quoted this week is not a measurement. A footer reads 'One blank is a design decision. The other is a not-yet.' The OrcaRouter logo is composited in the bottom-right corner.

Deux questions d'affinage différentes

Comme ces deux éléments sont des points de départ plutôt que des services achevés, il vaut la peine de préciser à quoi chacun servirait de point de départ, car c’est précisément là qu’ils cessent véritablement de se ressembler.

Un checkpoint hybride de 2,69 B est un outil pour créer un petit modèle spécialisé et peu coûteux. Les usages intéressants sont les moins glamour : un classifieur qui identifie un type de document dans un workflow réglementé, un modèle d'extraction qui transforme un formulaire en JSON structuré, un réécrivain spécifique à un domaine qui s'exécute sur une seule carte, au plus près des données. La valeur vient du fait qu'ensuite vous possédez l'artefact et que le coût marginal d'un appel, c'est l'électricité. La boucle d'entraînement est le travail, et c'est un travail que vous pouvez commencer dès aujourd'hui.

AREX-2 pointe dans l'autre direction. La famille AREX n'est pas conçue pour être affinée en un produit ; elle est conçue pour être appelée comme un agent qui exécute des recherches, intègre des preuves et vérifie ses propres réponses par rapport à des contraintes. Si une deuxième génération poursuit cela, ce que vous évalueriez est une trajectoire — combien d'étapes cela prend, si elle remarque une contradiction, si le chiffre de confiance sur sa réponse candidate signifie quelque chose. Ce n'est pas une question d'affinage et ce n'est pas une question de poids. C'est une question de service, et cela commence par quelqu'un qui publie des poids et une carte.

Ce ne sont pas des substituts, quelle que soit leur taille. Une équipe qui a besoin d'un modèle qu'elle peut posséder et réentraîner n'attend pas AREX-2. Une équipe qui a besoin d'un agent de recherche ne va pas affiner un hybride de 2,6 B pour en faire un.

Où s'intègre la couche de routage, pour chacun d'eux

La différence pratique entre ces deux-là se manifeste dès qu'un modèle entre dans une application, car tous deux entretiennent des rapports opposés à l'hébergement.

LFM2.5 2.6B Base n'est pas au catalogue d'OrcaRouter et aucune variante de LFM2.5 n'y figure, il vient donc de la distribution propre à Liquid AI et des hébergeurs tiers habituels — un artefact local plutôt qu'un point de terminaison routé. AREX-Base et AREX-Turbo ne figurent pas non plus dans notre catalogue. Ce à quoi sert vraiment une couche de routage dans ce contexte, c'est l'autre côté de l'architecture : le jour où vous comparez votre fine-tune aux modèles qu'il doit battre, vous voulez que cette comparaison coûte un changement de configuration plutôt qu'un cycle d'approvisionnement. Une API unique devant plus de 200 modèles, le prix catalogue du fournisseur répercuté sans rien ajouté par token, une seule clé pour tout le panel et un basculement automatique pour qu'un mauvais après-midi chez un fournisseur ne devienne pas le mauvais après-midi de votre évaluation. Voilà les conditions dans lesquelles un test A/B sur un modèle non éprouvé est assez bon marché pour être réellement mené.

C'est aussi la présentation honnête qui vaut pour AREX-2 lui-même. Lorsqu'il sera disponible — en supposant qu'il soit publié en poids ouverts, comme l'ont fait ses deux prédécesseurs — la façon raisonnable d'essayer un tout nouvel agent sur une charge de travail réelle est de le faire sur une voie parallèle, derrière un dispositif de basculement, et non comme l'unique fournisseur dont dépend votre boucle de production.

Ce qu’une personne raisonnable fait à propos de chacun cette semaine

Si vous avez une tâche petite et étroite et des données qui ne peuvent pas quitter votre infrastructure, le checkpoint Liquid est disponible, de petite taille, sous licence permissive en dessous d’un seuil de chiffre d’affaires, et testable cet après-midi. Téléchargez-le, exécutez-le sur votre propre jeu d’évaluation, et laissez le résultat décider. Rien concernant AREX-2 ne change ce plan.

Si vous avez besoin aujourd'hui d'un comportement de recherche à long horizon, le modèle auquel recourir est celui qui existe déjà : AREX-Base, livré en juillet, avec des benchmarks d'agents publiés que vous pouvez au moins confronter à un article. AREX-2 est un nom avec une date, et les deux éléments qui changeraient son statut sont visibles de l'extérieur — la présence de fichiers dans l'arborescence, et la présence, avec eux, d'une fiche indiquant un nombre de paramètres et une licence.

Le mode de défaillance que cet article existe pour prévenir est celui où un nom réservé est traité comme un élément de feuille de route. Ce n'est pas le cas. C'est un dépôt que BAAI a créé hier, et la juste quantité de planification à faire autour de lui pour le moment est nulle.