Een gegenereerde titelkaart met de tekst 'AREX-2 vs LFM2.5 2.6B Base - Twee soorten onvoltooid', met twee panelen. Het linkse paneel, met als kop LFM2.5 2.6B Base, bevat: uitgebracht in augustus 2026; 2,69 miljard parameters, dense; context van 131.072 tokens; downloadbaar, geen instruction tuning. Het rechtse paneel, met als kop AREX-2: repo aangemaakt op 29 sep 2026; nul bytes opgeslagen; helemaal geen modelkaart; niets om te downloaden. In de voettekst staat: 'De een is een checkpoint zonder instructies. De ander is een naam zonder checkpoint.' Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

AREX-2 vs LFM2.5 2.6B Base: Een lege repo en een checkpoint zonder instructies

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet AREX-2 naast LFM2.5 2.6B Base en het eerste dat ze gemeen hebben, is dat geen van beide een product is dat je vandaag kunt gebruiken — om redenen die niets met elkaar te maken hebben. AREX-2 is een Hugging Face-repository die BAAI op 29 september 2026 om 17:56 UTC heeft aangemaakt; deze bevat een .gitattributes-bestand, slaat nul bytes aan modelgegevens op en heeft geen modelkaart, geen licentietag en geen enkele aankondiging. LFM2.5 2.6B Base, in augustus 2026 gepubliceerd door Liquid AI, is het tegenovergestelde soort onvoltooidheid: een compleet, downloadbaar checkpoint met 2,69 miljard parameters dat alleen tekst ondersteunt, onder de LFM Open License (lfm1.0), dat bewust zonder instructie-tuning wordt geleverd, omdat het bedoeld is om te worden gefinetuned in plaats van om vragen te beantwoorden.

Het ene is een afwezigheid van een artefact. Het andere is een artefact dat een stap mist die het nooit had mogen hebben. Dat zijn alleen dezelfde categorie als je oppervlakkig leest, en ze als dezelfde categorie behandelen is precies hoe een team op het verkeerde ding komt te wachten. De nuttige vergelijking tussen deze twee is niet capaciteit — er is geen AREX-2 om te meten — maar waar elk ervan een grondstof voor, en wat het kost om erachter te komen of het ergens goed voor is.

Het verschil in soort, als eerste genoemd

LFM2.5 2.6B Base is een substantie. Het is het voorgetrainde checkpoint van de LFM2.5 hybride familie van Liquid AI: 30 lagen, waarvan 22 dual-gated short-convolutionblokken en 8 grouped-query attention, getraind op ongeveer 34 biljoen tokens in 16 talen, met een contextvenster van 131.072 tokens en een gekwantiseerde build die bij Q4_K_M op ongeveer 1,67 GB uitkomt. Het heeft geen instructietuning. Geef het een vraag en het vervolgt tekst; het antwoordt niet. De eigen modelkaart van Liquid AI wijst zware fine-tuning aan als het beoogde gebruik, en er is een post-getraind zustermodel voor iedereen die een model wil dat op prompts reageert. Het is een substraat, en het feit dat het slecht scoort op benchmarks voor het volgen van prompts is geen defect — het is de definitie van het ding.

AREX-2 is geen stof of product; het is een naamruimte. De enige beschikbare feiten zijn de organisatie (BAAI), het tijdstempel van aanmaak (29 september 2026) en de naam. Er is niets geüpload en er is niets gezegd. De naam zelf behoort tot een familie die wel bestaat: op 23 juli 2026 bracht BAAI AREX-Base uit, een mixture-of-experts met 122 miljard parameters en 10 miljard actieve parameters, gebouwd op Qwen3.5-122B-A10B, en AREX-Turbo, een dense 4B gebouwd op Qwen3.5-4B — beide Apache 2.0, beide deep-researchagents met een tweelusontwerp dat bewijs verzamelt, een kandidaatantwoord met een betrouwbaarheidscijfer produceert en dat antwoord vervolgens verifieert aan de hand van de oorspronkelijke beperkingen en het verfijnt of opnieuw start. De gepubliceerde cijfers, door de leverancier gerapporteerd en niet onafhankelijk gereproduceerd, lopen op tot 82,5 op BrowseComp en 85,4 op GAIA voor de Base, en 70,7 / 81,6 voor de Turbo.

• Beschikbaarheid — LFM2.5 2.6B Base is nu te downloaden. AREX-2 heeft geen bestanden in zijn repository.

• Grootte — 2,69 miljard dense parameters voor het Liquid-model, allemaal zichtbaar in het checkpoint. Onbekend voor AREX-2; de familie omvat een 122B MoE en een dense 4B, dus de "2" voorspelt niets.

• Context — 131.072 tokens voor LFM2.5 2.6B Base. Niets gepubliceerd voor AREX-2.

• Licentie — LFM Open License v1.0, gratis onder $10M jaarlijkse omzet en een aparte licentie vereist op of boven die grens. Nog geen licentietag op AREX-2; de eerste AREX-generatie was Apache 2.0.

• Wat het is — een fine-tuning-substraat tegenover, als de familie representatief is, een gehoste agent waarvan de waarde eerder in een zoek-en-verifieer-lus dan in zijn gewichten ligt.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, tags for Text Generation, Transformers, Safetensors and 16 languages, a Model Details table listing LFM2.5-2.6B-Base at 2.6B parameters as a pre-trained base model for fine-tuning alongside the post-trained LFM2.5-2.6B, and the feature list beginning with total parameters 2.69B, 30 layers, a 34-trillion-token training budget, a 128,000 vocabulary and a 131,072-token context length.

Blanco scorekaarten die tegenovergestelde dingen betekenen

Geen van beide modellen heeft een benchmark waarop je je planning moet baseren, en de redenen daarvoor lopen volledig uiteen.

Liquid AI verbergt niets door zijn Base niet te scoren. Een vooraf getraind checkpoint scoren op benchmarks voor instructieopvolging zou de afwezigheid van fine-tuning meten, niet de kwaliteit van het substraat — daarom benchmarkt het bedrijf de post-getrainde tegenhanger en laat het de Base ongeëvalueerd. Dat gat is van jouw kant verifieerbaar, en dat is precies het hele punt: je kunt 1,67 GB downloaden, je eigen evaluatie op je eigen taak uitvoeren en het antwoord weten voordat je iets uitgeeft aan serving.

De leegte van AREX-2 is geen ontwerpbeslissing, het is een nog-niet. Er is niets te downloaden, dus er is niets te testen, en geen enkele evaluatie die je deze week zou kunnen uitvoeren, zou je er iets over kunnen vertellen. Iedereen die de komende dagen AREX-2-benchmarkcijfers publiceert, publiceert iets wat men onmogelijk kan hebben gemeten.

A generated two-column card headed 'Two blank scorecards, for opposite reasons'. The left column, LFM2.5 2.6B Base, reads: no published evaluation - deliberate; scoring a pretrained checkpoint measures the missing fine-tuning; downloadable, verify it on your own task today; 1.67 GB at Q4_K_M, runs on a single card. The right column, AREX-2, reads: no published evaluation - nothing to evaluate; no weights, no card, no licence tag; not downloadable, nothing to verify; any figure quoted this week is not a measurement. A footer reads 'One blank is a design decision. The other is a not-yet.' The OrcaRouter logo is composited in the bottom-right corner.

Twee verschillende fine-tuningvragen

Omdat deze beide eerder uitgangspunten dan afgeronde diensten zijn, is het de moeite waard precies te zijn over waarvoor elk een uitgangspunt zou zijn, want dat is waar ze echt ophouden op elkaar te lijken.

Een hybride checkpoint van 2,69B is een hulpmiddel om een klein, goedkoop, gespecialiseerd model te maken. De interessante toepassingen zijn de weinig glamoureuze: een classifier die een documenttype leest in een gereguleerde workflow, een extractiemodel dat een formulier omzet in gestructureerde JSON, een domeinspecifieke herschrijver die op één kaart dicht bij de data draait. De waarde komt voort uit het feit dat je het artefact daarna bezit en dat de marginale kosten van een aanroep elektriciteit zijn. De trainingsloop is het werk, en het is werk dat je vandaag kunt beginnen.

AREX-2 wijst de andere kant op. De AREX-familie is niet ontworpen om te worden fine-tuned tot een product; die is ontworpen om aangeroepen te worden als een agent die zoekopdrachten uitvoert, bewijs integreert en zijn eigen antwoorden aan beperkingen toetst. Als een tweede generatie daarmee doorgaat, is wat je zou evalueren een traject — hoeveel stappen het neemt, of het een tegenstrijdigheid opmerkt, of het betrouwbaarheidscijfer bij zijn kandidaat-antwoord iets betekent. Dat is geen fine-tuningvraag en het is geen gewichtenvraag. Het is een servingvraag, en die begint met iemand die gewichten en een kaart publiceert.

Dit zijn op geen enkele schaal vervangers van elkaar. Een team dat een model nodig heeft dat het zelf kan bezitten en opnieuw kan trainen, wacht niet op AREX-2. Een team dat een onderzoeksagent nodig heeft, gaat geen 2,6B-hybride fine-tunen om er een te maken.

Waar de routeringslaag past, voor elk van hen

Het praktische verschil tussen deze twee wordt duidelijk zodra een model in een applicatie terechtkomt, want de twee hebben een tegengestelde relatie met hosting.

LFM2.5 2.6B Base staat niet in de catalogus van OrcaRouter, en dat geldt voor geen enkele LFM2.5-variant, dus het komt uit de eigen distributie van Liquid AI en de gebruikelijke externe hosts — een lokaal artefact in plaats van een gerouteerd endpoint. AREX-Base en AREX-Turbo staan ook niet in onze catalogus. Waar een routeringslaag in dit plaatje werkelijk voor dient is de andere kant van de architectuur: op het moment dat je je fine-tune afzet tegen de modellen die je wilt verslaan, wil je dat die vergelijking een configuratiewijziging kost in plaats van een inkooptraject. Eén API vóór meer dan 200 modellen, de lijstprijs van de provider doorgegeven zonder dat er per token iets bij komt, één sleutel voor het hele paneel, en failover zodat een slechte middag van een provider niet de slechte middag van je evaluatie wordt. Dat zijn de omstandigheden waaronder een A/B-test op een onbewezen model goedkoop genoeg is om daadwerkelijk uit te voeren.

Dat is ook het eerlijke kader voor AREX-2 zelf. Wanneer het uitkomt — ervan uitgaande dat het met open gewichten uitkomt, zoals zijn twee voorgangers deden — is de verstandige manier om een gloednieuwe agent op een echte workload uit te proberen, via een zijpad, achter failover, niet als de enige provider waarvan je productielus afhankelijk is.

Wat een redelijk persoon deze week aan elk doet

Als je een kleine, beperkte taak hebt en data die je infrastructuur niet mogen verlaten, dan is de Liquid-checkpoint beschikbaar, klein, permissief onder een omzetdrempel, en vanmiddag nog te testen. Download hem, draai hem op je eigen evaluatieset en laat het resultaat beslissen. Niets aan AREX-2 verandert dat plan.

Als je vandaag onderzoeksgedrag over lange termijn nodig hebt, is het model waarnaar je moet grijpen het model dat al bestaat: AREX-Base, uitgebracht in juli, met gepubliceerde agentbenchmarks die je tenminste tegen een paper kunt verifiëren. AREX-2 is een naam met een tijdstempel, en de twee dingen die zijn status zouden veranderen, zijn van buitenaf zichtbaar: of er bestanden in de boomstructuur verschijnen, en of daar samen mee een kaart met een parameteraantal en een licentie verschijnt.

De faalmodus die dit artikel wil voorkomen, is het geval waarin een gereserveerde naam als een roadmapitem wordt behandeld. Dat is het niet. Het is een repository die BAAI gisteren heeft aangemaakt, en de juiste hoeveelheid planning om er nu omheen te doen is nul.