
AREX-2 vs LFM2.5 2.6B Base: Ett tomt repo och en checkpoint utan instruktioner
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 397 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 195 tok/s
- OrcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Ställ AREX-2 bredvid LFM2.5 2.6B Base och det första de har gemensamt är att ingen av dem är en produkt du kan använda idag – av skäl som inte har något med varandra att göra. AREX-2 är ett Hugging Face-repositorium som BAAI skapade den 29 september 2026 kl. 17:56 UTC; den innehåller en .gitattributes-fil, lagrar noll byte modelldata och har inget modellkort, ingen licenstagg och inget tillkännagivande av något slag. LFM2.5 2.6B Base, som publicerades av Liquid AI i augusti 2026, är den motsatta sortens ofullständighet: en komplett, nedladdningsbar checkpoint för enbart text med 2,69 miljarder parametrar under LFM Open License (lfm1.0) som medvetet levereras utan instruktionsträning, eftersom den är tänkt att finjusteras snarare än att ställas frågor.
Det ena är avsaknaden av en artefakt. Det andra är en artefakt som saknar ett steg som den aldrig var tänkt att ha. De tillhör samma kategori bara om man skummar, och att behandla dem som samma kategori är precis så ett team till slut väntar på fel sak. Det användbara i jämförelsen mellan dessa två är inte förmåga — det finns ingen AREX-2 att mäta — utan vad var och en är en råvara för, och vad det kostar att ta reda på om den är något att ha.
Skillnaden till sin art, angiven först
LFM2.5 2.6B Base är en substans. Det är den förtränade checkpointen i Liquid AI:s LFM2.5-hybridfamilj: 30 lager, varav 22 är dual-gated short-convolution-block och 8 är grouped-query attention, tränad på ungefär 34 biljoner tokens över 16 språk, med ett kontextfönster på 131 072 tokens och ett kvantiserat bygge som landar nära 1,67 GB vid Q4_K_M. Den har ingen instruktionsträning. Ge den en fråga och den fortsätter text; den svarar inte. Liquid AI:s eget kort pekar på tung finjustering som det avsedda användningsområdet, och det finns ett eftertränat syskon för den som vill ha en modell som svarar på prompter. Det är ett substrat, och att det får dåliga resultat på benchmarkar för promptföljning är inte en defekt — det är själva definitionen av vad det är.
AREX-2 är inte en substans eller en produkt; det är en namnrymd. De enda fakta som finns är organisationen (BAAI), tidsstämpeln för skapandet (29 september 2026) och namnet. Ingenting har laddats upp och ingenting har sagts. Namnet tillhör i sig en familj som faktiskt existerar: den 23 juli 2026 släppte BAAI AREX-Base, en mixture-of-experts med 122 miljarder parametrar och 10 miljarder aktiva parametrar byggd på Qwen3.5-122B-A10B, och AREX-Turbo, en dense 4B-modell byggd på Qwen3.5-4B – båda under Apache 2.0, båda deep-research-agenter med en design med två loopar som samlar in bevis, tar fram ett kandidatsvar med en konfidenssiffra, verifierar sedan svaret mot de ursprungliga begränsningarna och förfinar eller startar om. Dess publicerade siffror, leverantörsrapporterade och inte oberoende reproducerade, uppgår till 82,5 på BrowseComp och 85,4 på GAIA för Base, och 70,7 / 81,6 för Turbo.
• Tillgänglighet — LFM2.5 2.6B Base kan laddas ner nu. AREX-2 har inga filer i sitt arkiv.
• Storlek — 2,69B täta parametrar för Liquid-modellen, alla synliga i checkpointen. Okänt för AREX-2; familjen spänner över en 122B MoE och en tät 4B, så "2" förutsäger ingenting.
• Kontext — 131 072 token för LFM2.5 2.6B Base. Inget publicerat för AREX-2.
• Licens — LFM Open License v1.0, kostnadsfri under 10 miljoner USD i årlig omsättning och kräver en separat licens vid eller över den gränsen. Ingen licenstagg ännu på AREX-2; den första AREX-generationen var Apache 2.0.
• Vad det är — ett finjusteringssubstrat kontra, om familjen är något att döma av, en hostad agent vars värde ligger i en sök-och-verifieringsloop snarare än i dess vikter.

Tomma resultatkort som betyder motsatta saker
Ingen av modellerna har ett benchmark som du bör planera utifrån, och orsakerna går helt isär.
Liquid AI döljer ingenting genom att lämna sin Base obetygsatt. Att poängsätta en förtränad checkpoint på benchmarks för instruktionsföljsamhet skulle mäta frånvaron av finjustering, inte kvaliteten hos substratet — vilket är anledningen till att företaget benchmarkar det eftertränade syskonet och lämnar Base utan utvärdering. Den luckan går att verifiera från din sida, och det är hela poängen: du kan ladda ner 1,67 GB, köra din egen utvärdering på din egen uppgift och veta svaret innan du spenderar något på modellservering.
AREX-2:s tomrum är inte ett designbeslut, det är ett ännu-inte. Det finns inget att ladda ner, så det finns inget att testa, och ingen utvärdering du skulle kunna köra den här veckan skulle säga dig något om det. Den som publicerar benchmark-siffror för AREX-2 de närmaste dagarna publicerar något som de inte kan ha mätt.

Två olika finjusteringsfrågor
Eftersom båda dessa är utgångspunkter snarare än färdiga tjänster är det värt att vara precis om vad var och en av dem skulle vara en utgångspunkt för, eftersom det är där de verkligen slutar likna varandra.
En 2,69B hybridcheckpoint är ett verktyg för att skapa en liten, billig, specialiserad modell. De intressanta användningarna är de oglamorösa: en klassificerare som läser en dokumenttyp i ett reglerat arbetsflöde, en extraktionsmodell som omvandlar ett formulär till strukturerad JSON, en domänspecifik omskrivare som körs på ett enda kort nära data. Värdet kommer från att du äger artefakten efteråt och att marginalkostnaden för ett anrop är el. Träningsloopen är arbetet, och det är arbete du kan börja idag.
AREX-2 pekar åt andra hållet. AREX-familjen är inte utformad för att finjusteras till en produkt; den är utformad för att anropas som en agent som utför sökningar, integrerar evidens och verifierar sina egna svar mot begränsningar. Om en andra generation fortsätter med det är det du skulle utvärdera en trajektoria – hur många steg den tar, om den upptäcker en motsägelse, om konfidenssiffran för dess kandidatsvar har någon betydelse. Det är inte en finjusteringsfråga och inte en viktfråga. Det är en fråga om serving, och den börjar med att någon publicerar vikter och ett kort.
Dessa är inte substitut oavsett storlek. Ett team som behöver en modell som det kan äga och träna om väntar inte på AREX-2. Ett team som behöver en forskningsagent kommer inte att finjustera en 2.6B hybrid till en.
Var routinglagret passar in, för var och en av dem
Den praktiska skillnaden mellan dessa två visar sig i samma stund som en modell hamnar i en applikation, eftersom de två har motsatta förhållanden till hosting.
LFM2.5 2.6B Base finns inte med i OrcaRouters katalog, och ingen LFM2.5-variant finns med i den heller, så den kommer från Liquid AIs egen distribution och de vanliga tredjepartsvärdarna – en lokal artefakt snarare än en routad slutpunkt. AREX-Base och AREX-Turbo finns inte heller med i vår katalog. Vad ett routningslager verkligen är till för i den här bilden är den andra sidan av arkitekturen: den dag du jämför din finjusterade modell mot modellerna den måste slå vill du att den jämförelsen ska kosta en konfigurationsändring i stället för en inköpscykel. Ett API framför över 200 modeller, leverantörens listpris förs vidare utan något påslag per token, en nyckel för hela panelen och failover så att en leverantörs dåliga eftermiddag inte blir din utvärderings dåliga eftermiddag. Det är förutsättningarna under vilka ett A/B-test på en oprövad modell är billigt nog att faktiskt köras.
Det är också den ärliga inramningen för AREX-2 självt. När den släpps – förutsatt att den släpps med öppna vikter, precis som dess två föregångare gjorde – är det vettiga sättet att testa en helt ny agent på en verklig arbetsbelastning på en sidoväg, bakom failover, inte som den enda leverantören som din produktionsloop är beroende av.
Vad en rimlig person gör åt var och en den här veckan
Om du har en liten, snäv uppgift och data som inte kan lämna din infrastruktur, är Liquid-checkpointen tillgänglig, liten, permissivt licensierad under en intäktströskel och testbar i eftermiddag. Ladda ner den, kör den på din egen utvärderingsuppsättning och låt resultatet avgöra. Inget med AREX-2 ändrar den planen.
Om du behöver långsiktigt forskningsbeteende idag är modellen att välja den som redan finns: AREX-Base, som släpptes i juli, med publicerade agentbenchmarker som du åtminstone kan kontrollera mot en artikel. AREX-2 är ett namn med en tidsstämpel, och de två saker som skulle ändra dess status är synliga utifrån – om filer dyker upp i trädet, och om ett kort med ett parameterantal och en licens dyker upp tillsammans med dem.
Det felmod som den här artikeln finns till för att förhindra är det fallet där ett reserverat namn behandlas som en punkt på färdplanen. Det är det inte. Det är ett repo som BAAI skapade i går, och rätt mängd planering att göra kring det just nu är ingen alls.
