Wygenerowana karta tytułowa z napisem „AREX-2 vs LFM2.5 2.6B Base – Dwa rodzaje niedokończonego”, z dwoma panelami. Lewy panel, zatytułowany LFM2.5 2.6B Base, zawiera listę: wydany w sierpniu 2026; 2,69 mld parametrów, gęsty; kontekst 131 072 tokenów; do pobrania, bez dostrajania instrukcyjnego. Prawy panel, zatytułowany AREX-2, zawiera listę: repozytorium utworzone 29 września 2026; zero przechowywanych bajtów; brak jakiejkolwiek karty modelu; nic do pobrania. W stopce widnieje napis: „Jeden to checkpoint bez instrukcji. Drugi to nazwa bez checkpointu.” Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

AREX-2 vs LFM2.5 2.6B Base: Puste repozytorium i checkpoint bez instrukcji

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw AREX-2 obok LFM2.5 2.6B Base a pierwszą wspólną cechą jest to, że żaden z nich nie jest produktem, którego można dziś użyć — z powodów, które nie mają ze sobą nic wspólnego. AREX-2 to repozytorium Hugging Face, które BAAI utworzyło 29 września 2026 roku o 17:56 UTC; zawiera plik .gitattributes, przechowuje zero bajtów danych modelu i nie ma karty modelu, znacznika licencji ani żadnego ogłoszenia. LFM2.5 2.6B Base, opublikowany przez Liquid AI w sierpniu 2026 roku, reprezentuje przeciwny rodzaj niedokończenia: kompletny, gotowy do pobrania checkpoint tekstowy o 2,69 mld parametrów na licencji LFM Open License (lfm1.0), który celowo udostępniany jest bez dostrajania instrukcyjnego, ponieważ ma służyć do dostrajania, a nie do zadawania mu pytań.

Jedno to brak artefaktu. Drugie to artefakt, któremu brakuje kroku, którego nigdy nie miał mieć. To ta sama kategoria tylko wtedy, gdy patrzysz pobieżnie, a traktowanie ich jako tej samej kategorii to dokładnie tak, jak zespół kończy, czekając na niewłaściwą rzecz. Użyteczne porównanie tych dwóch to nie ich zdolność — nie ma AREX-2, który można by zmierzyć — lecz to, czym każde z nich jest jako surowiec na co, i ile kosztuje przekonanie się, czy jest coś warte.

Różnica w rodzaju, podana najpierw

LFM2.5 2.6B Base to substancja. To wstępnie wytrenowany checkpoint hybrydowej rodziny LFM2.5 firmy Liquid AI: 30 warstw, z których 22 to podwójnie bramkowane bloki krótkiej konwolucji, a 8 to grouped-query attention, wytrenowany na około 34 bilionach tokenów w 16 językach, z oknem kontekstu 131 072 tokenów i skwantyzowaną wersją, która przy Q4_K_M zajmuje blisko 1,67 GB. Nie ma dostrajania instrukcyjnego. Podaj mu pytanie, a będzie kontynuować tekst; nie odpowiada. Własna karta Liquid AI wskazuje intensywne dostrajanie jako zamierzone zastosowanie, a dla każdego, kto chce modelu reagującego na prompty, istnieje siostrzany model po dostrojeniu. To substrat, a fakt, że wypada słabo w benchmarkach podążania za promptami, nie jest wadą — to definicja tej rzeczy.

AREX-2 nie jest substancją ani produktem; to przestrzeń nazw. Jedyne dostępne fakty to organizacja (BAAI), znacznik czasu utworzenia (29 września 2026 r.) i nazwa. Nic nie zostało wgrane i nic nie zostało powiedziane. Sama nazwa należy do rodziny, która faktycznie istnieje: 23 lipca 2026 r. BAAI wydało AREX-Base, model typu mixture-of-experts o 122 miliardach parametrów i 10 miliardach aktywnych parametrów zbudowany na Qwen3.5-122B-A10B, oraz AREX-Turbo, gęsty model 4B zbudowany na Qwen3.5-4B — oba na licencji Apache 2.0, oba będące agentami do pogłębionych badań o dwupętlowej konstrukcji, która gromadzi dowody, tworzy wstępną odpowiedź ze wskaźnikiem pewności, a następnie weryfikuje tę odpowiedź względem pierwotnych ograniczeń i udoskonala ją lub rozpoczyna od nowa. Jego opublikowane wyniki, zgłoszone przez dostawcę i nieodtworzone niezależnie, sięgają 82,5 w BrowseComp i 85,4 w GAIA dla modelu Base oraz 70,7 / 81,6 dla modelu Turbo.

• Dostępność — LFM2.5 2.6B Base można już pobrać. AREX-2 nie ma plików w swoim repozytorium.

• Rozmiar — 2.69B gęstych parametrów modelu Liquid, wszystkie widoczne w checkpointcie. Nieznane dla AREX-2; rodzina obejmuje MoE 122B i gęsty model 4B, więc „2” niczego nie zapowiada.

• Kontekst — 131 072 tokenów dla LFM2.5 2.6B Base. Nic nie opublikowano dla AREX-2.

• Licencja — LFM Open License v1.0, bezpłatna poniżej 10 mln USD rocznego przychodu, a na tym progu lub powyżej wymagana jest osobna licencja. Na AREX-2 nie ma jeszcze znacznika licencji; pierwsza generacja AREX korzystała z licencji Apache 2.0.

• Co to jest — podłoże do dostrajania w przeciwieństwie do hostowanego agenta, którego wartość — jeśli po rodzinie można sądzić — tkwi w pętli wyszukiwania i weryfikacji, a nie w jego wagach.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, tags for Text Generation, Transformers, Safetensors and 16 languages, a Model Details table listing LFM2.5-2.6B-Base at 2.6B parameters as a pre-trained base model for fine-tuning alongside the post-trained LFM2.5-2.6B, and the feature list beginning with total parameters 2.69B, 30 layers, a 34-trillion-token training budget, a 128,000 vocabulary and a 131,072-token context length.

Puste karty wyników, które oznaczają przeciwne rzeczy

Żaden z modeli nie ma benchmarku, wokół którego powinieneś planować, a powody całkowicie się różnią.

Liquid AI niczego nie ukrywa, pozostawiając swój Base bez oceny. Ocenianie wstępnie wytrenowanego checkpointu na benchmarkach wykonywania instrukcji mierzyłoby brak dostrajania, a nie jakość substratu — dlatego firma poddaje testom bliźniaczy model po treningu, a Base pozostawia bez oceny. Tę lukę możesz zweryfikować po swojej stronie i o to właśnie chodzi: możesz pobrać 1,67 GB, przeprowadzić własną ocenę na własnym zadaniu i poznać odpowiedź, zanim wydasz cokolwiek na serwowanie.

Luka w AREX-2 nie jest decyzją projektową, to jeszcze nie. Nie ma nic do pobrania, więc nie ma nic do przetestowania, a żadna ewaluacja, którą mógłbyś przeprowadzić w tym tygodniu, nie powie ci o tym nic. Każdy, kto w ciągu najbliższych dni opublikuje wyniki benchmarków AREX-2, publikuje coś, czego nie mógł zmierzyć.

A generated two-column card headed 'Two blank scorecards, for opposite reasons'. The left column, LFM2.5 2.6B Base, reads: no published evaluation - deliberate; scoring a pretrained checkpoint measures the missing fine-tuning; downloadable, verify it on your own task today; 1.67 GB at Q4_K_M, runs on a single card. The right column, AREX-2, reads: no published evaluation - nothing to evaluate; no weights, no card, no licence tag; not downloadable, nothing to verify; any figure quoted this week is not a measurement. A footer reads 'One blank is a design decision. The other is a not-yet.' The OrcaRouter logo is composited in the bottom-right corner.

Dwa różne pytania dotyczące dostrajania

Ponieważ oba te elementy są punktami wyjścia, a nie gotowymi usługami, warto dokładnie określić, dla czego każdy z nich byłby punktem wyjścia, bo właśnie w tym miejscu przestają one do siebie nawzajem przypominać.

Hybrydowy checkpoint 2,69B to narzędzie do tworzenia małego, taniego, wyspecjalizowanego modelu. Ciekawe zastosowania to te mało efektowne: klasyfikator, który odczytuje typ dokumentu w regulowanym przepływie pracy, model ekstrakcji, który zamienia formularz na ustrukturyzowany JSON, oraz przepisywacz dziedzinowy, który działa na pojedynczej karcie blisko danych. Wartość wynika z tego, że po wszystkim artefakt należy do ciebie, a koszt krańcowy wywołania to prąd. Pętla treningowa to ta praca i to praca, którą możesz zacząć już dziś.

AREX-2 wskazuje inny kierunek. Rodzina AREX nie jest projektowana po to, by dostrajać ją do produktu; jest projektowana, by być nazywaną agentem, który prowadzi wyszukiwania, integruje dowody i weryfikuje własne odpowiedzi względem ograniczeń. Jeśli druga generacja to podtrzyma, tym, co będziesz oceniać, jest trajektoria — ile kroków zajmuje, czy zauważa sprzeczność, czy wartość pewności na jej proponowanej odpowiedzi coś znaczy. To nie jest pytanie o dostrajanie ani pytanie o wagi. To pytanie o serwowanie i zaczyna się od tego, że ktoś publikuje wagi i kartę.

Nie są substytutami niezależnie od rozmiaru. Zespół potrzebujący modelu, który może posiadać i dotrenowywać, nie czeka na AREX-2. Zespół potrzebujący agenta badawczego nie będzie dostrajał 2,6B hybrydy, aby go z niej zrobić.

Gdzie mieści się warstwa routingu, dla każdego z nich

Praktyczna różnica między tymi dwoma ujawnia się w momencie, gdy model trafia do aplikacji, ponieważ oba mają przeciwstawne relacje z hostingiem.

LFM2.5 2.6B Base nie znajduje się w katalogu OrcaRouter, podobnie jak żaden wariant LFM2.5, więc pochodzi z własnej dystrybucji Liquid AI i zwykłych zewnętrznych hostów — to lokalny artefakt, a nie routowany endpoint. AREX-Base i AREX-Turbo również nie znajdują się w naszym katalogu. Do czego w tym obrazie tak naprawdę służy warstwa routingu, to druga strona architektury: w dniu, gdy porównujesz swój fine-tuning z modelami, które musi on pokonać, chcesz, aby takie porównanie kosztowało zmianę konfiguracji, a nie cykl zakupowy. Jedno API przed ponad 200 modelami, cena katalogowa dostawcy przekazywana bez żadnych dodatków za token, jeden klucz do całego panelu i failover, dzięki któremu zły dzień u dostawcy nie staje się złym dniem twojej ewaluacji. To są warunki, w których test A/B na nieprzetestowanym modelu jest wystarczająco tani, by faktycznie go przeprowadzić.

To także uczciwe ujęcie samego AREX-2. Kiedy zostanie wydany — zakładając, że zostanie wydany z otwartymi wagami, tak jak w przypadku jego dwóch poprzedników — rozsądnym sposobem wypróbowania zupełnie nowego agenta w rzeczywistym obciążeniu jest uruchomienie go na bocznej ścieżce, za mechanizmem przełączania awaryjnego, a nie jako jedynego dostawcy, od którego zależy twoja pętla produkcyjna.

Co rozsądny człowiek robi w tym tygodniu z każdym z nich

Jeśli masz małe, wąskie zadanie i dane, które nie mogą opuścić twojej infrastruktury, checkpoint Liquid jest dostępny, niewielki, objęty permisywną licencją poniżej progu przychodów i można go przetestować jeszcze dziś po południu. Pobierz go, uruchom na własnym zestawie ewaluacyjnym i niech wynik zdecyduje. Nic w związku z AREX-2 nie zmienia tego planu.

Jeśli potrzebujesz dzisiaj długoterminowego zachowania badawczego, modelem, po który warto sięgnąć, jest ten, który już istnieje: AREX-Base, wydany w lipcu, z opublikowanymi benchmarkami agentów, które przynajmniej można sprawdzić z artykułem. AREX-2 to nazwa ze znacznikiem czasu, a dwie rzeczy, które zmieniłyby jego status, są widoczne z zewnątrz — czy pliki pojawią się w drzewie i czy wraz z nimi pojawi się karta z liczbą parametrów i licencją.

Trybem awarii, któremu ma zapobiegać ten artykuł, jest sytuacja, w której zarezerwowana nazwa jest traktowana jako pozycja w planie rozwoju. Nie jest nią. To repozytorium, które BAAI utworzyło wczoraj, a właściwa ilość planowania wokół niego na teraz to zero.