
AREX-2 vs LFM2.5 2.6B Base: Puste repozytorium i checkpoint bez instrukcji
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 507 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 194 tok/s
- OrcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Postaw AREX-2 obok LFM2.5 2.6B Base a pierwszą wspólną cechą jest to, że żaden z nich nie jest produktem, którego można dziś użyć — z powodów, które nie mają ze sobą nic wspólnego. AREX-2 to repozytorium Hugging Face, które BAAI utworzyło 29 września 2026 roku o 17:56 UTC; zawiera plik .gitattributes, przechowuje zero bajtów danych modelu i nie ma karty modelu, znacznika licencji ani żadnego ogłoszenia. LFM2.5 2.6B Base, opublikowany przez Liquid AI w sierpniu 2026 roku, reprezentuje przeciwny rodzaj niedokończenia: kompletny, gotowy do pobrania checkpoint tekstowy o 2,69 mld parametrów na licencji LFM Open License (lfm1.0), który celowo udostępniany jest bez dostrajania instrukcyjnego, ponieważ ma służyć do dostrajania, a nie do zadawania mu pytań.
Jedno to brak artefaktu. Drugie to artefakt, któremu brakuje kroku, którego nigdy nie miał mieć. To ta sama kategoria tylko wtedy, gdy patrzysz pobieżnie, a traktowanie ich jako tej samej kategorii to dokładnie tak, jak zespół kończy, czekając na niewłaściwą rzecz. Użyteczne porównanie tych dwóch to nie ich zdolność — nie ma AREX-2, który można by zmierzyć — lecz to, czym każde z nich jest jako surowiec na co, i ile kosztuje przekonanie się, czy jest coś warte.
Różnica w rodzaju, podana najpierw
LFM2.5 2.6B Base to substancja. To wstępnie wytrenowany checkpoint hybrydowej rodziny LFM2.5 firmy Liquid AI: 30 warstw, z których 22 to podwójnie bramkowane bloki krótkiej konwolucji, a 8 to grouped-query attention, wytrenowany na około 34 bilionach tokenów w 16 językach, z oknem kontekstu 131 072 tokenów i skwantyzowaną wersją, która przy Q4_K_M zajmuje blisko 1,67 GB. Nie ma dostrajania instrukcyjnego. Podaj mu pytanie, a będzie kontynuować tekst; nie odpowiada. Własna karta Liquid AI wskazuje intensywne dostrajanie jako zamierzone zastosowanie, a dla każdego, kto chce modelu reagującego na prompty, istnieje siostrzany model po dostrojeniu. To substrat, a fakt, że wypada słabo w benchmarkach podążania za promptami, nie jest wadą — to definicja tej rzeczy.
AREX-2 nie jest substancją ani produktem; to przestrzeń nazw. Jedyne dostępne fakty to organizacja (BAAI), znacznik czasu utworzenia (29 września 2026 r.) i nazwa. Nic nie zostało wgrane i nic nie zostało powiedziane. Sama nazwa należy do rodziny, która faktycznie istnieje: 23 lipca 2026 r. BAAI wydało AREX-Base, model typu mixture-of-experts o 122 miliardach parametrów i 10 miliardach aktywnych parametrów zbudowany na Qwen3.5-122B-A10B, oraz AREX-Turbo, gęsty model 4B zbudowany na Qwen3.5-4B — oba na licencji Apache 2.0, oba będące agentami do pogłębionych badań o dwupętlowej konstrukcji, która gromadzi dowody, tworzy wstępną odpowiedź ze wskaźnikiem pewności, a następnie weryfikuje tę odpowiedź względem pierwotnych ograniczeń i udoskonala ją lub rozpoczyna od nowa. Jego opublikowane wyniki, zgłoszone przez dostawcę i nieodtworzone niezależnie, sięgają 82,5 w BrowseComp i 85,4 w GAIA dla modelu Base oraz 70,7 / 81,6 dla modelu Turbo.
• Dostępność — LFM2.5 2.6B Base można już pobrać. AREX-2 nie ma plików w swoim repozytorium.
• Rozmiar — 2.69B gęstych parametrów modelu Liquid, wszystkie widoczne w checkpointcie. Nieznane dla AREX-2; rodzina obejmuje MoE 122B i gęsty model 4B, więc „2” niczego nie zapowiada.
• Kontekst — 131 072 tokenów dla LFM2.5 2.6B Base. Nic nie opublikowano dla AREX-2.
• Licencja — LFM Open License v1.0, bezpłatna poniżej 10 mln USD rocznego przychodu, a na tym progu lub powyżej wymagana jest osobna licencja. Na AREX-2 nie ma jeszcze znacznika licencji; pierwsza generacja AREX korzystała z licencji Apache 2.0.
• Co to jest — podłoże do dostrajania w przeciwieństwie do hostowanego agenta, którego wartość — jeśli po rodzinie można sądzić — tkwi w pętli wyszukiwania i weryfikacji, a nie w jego wagach.

Puste karty wyników, które oznaczają przeciwne rzeczy
Żaden z modeli nie ma benchmarku, wokół którego powinieneś planować, a powody całkowicie się różnią.
Liquid AI niczego nie ukrywa, pozostawiając swój Base bez oceny. Ocenianie wstępnie wytrenowanego checkpointu na benchmarkach wykonywania instrukcji mierzyłoby brak dostrajania, a nie jakość substratu — dlatego firma poddaje testom bliźniaczy model po treningu, a Base pozostawia bez oceny. Tę lukę możesz zweryfikować po swojej stronie i o to właśnie chodzi: możesz pobrać 1,67 GB, przeprowadzić własną ocenę na własnym zadaniu i poznać odpowiedź, zanim wydasz cokolwiek na serwowanie.
Luka w AREX-2 nie jest decyzją projektową, to jeszcze nie. Nie ma nic do pobrania, więc nie ma nic do przetestowania, a żadna ewaluacja, którą mógłbyś przeprowadzić w tym tygodniu, nie powie ci o tym nic. Każdy, kto w ciągu najbliższych dni opublikuje wyniki benchmarków AREX-2, publikuje coś, czego nie mógł zmierzyć.

Dwa różne pytania dotyczące dostrajania
Ponieważ oba te elementy są punktami wyjścia, a nie gotowymi usługami, warto dokładnie określić, dla czego każdy z nich byłby punktem wyjścia, bo właśnie w tym miejscu przestają one do siebie nawzajem przypominać.
Hybrydowy checkpoint 2,69B to narzędzie do tworzenia małego, taniego, wyspecjalizowanego modelu. Ciekawe zastosowania to te mało efektowne: klasyfikator, który odczytuje typ dokumentu w regulowanym przepływie pracy, model ekstrakcji, który zamienia formularz na ustrukturyzowany JSON, oraz przepisywacz dziedzinowy, który działa na pojedynczej karcie blisko danych. Wartość wynika z tego, że po wszystkim artefakt należy do ciebie, a koszt krańcowy wywołania to prąd. Pętla treningowa to ta praca i to praca, którą możesz zacząć już dziś.
AREX-2 wskazuje inny kierunek. Rodzina AREX nie jest projektowana po to, by dostrajać ją do produktu; jest projektowana, by być nazywaną agentem, który prowadzi wyszukiwania, integruje dowody i weryfikuje własne odpowiedzi względem ograniczeń. Jeśli druga generacja to podtrzyma, tym, co będziesz oceniać, jest trajektoria — ile kroków zajmuje, czy zauważa sprzeczność, czy wartość pewności na jej proponowanej odpowiedzi coś znaczy. To nie jest pytanie o dostrajanie ani pytanie o wagi. To pytanie o serwowanie i zaczyna się od tego, że ktoś publikuje wagi i kartę.
Nie są substytutami niezależnie od rozmiaru. Zespół potrzebujący modelu, który może posiadać i dotrenowywać, nie czeka na AREX-2. Zespół potrzebujący agenta badawczego nie będzie dostrajał 2,6B hybrydy, aby go z niej zrobić.
Gdzie mieści się warstwa routingu, dla każdego z nich
Praktyczna różnica między tymi dwoma ujawnia się w momencie, gdy model trafia do aplikacji, ponieważ oba mają przeciwstawne relacje z hostingiem.
LFM2.5 2.6B Base nie znajduje się w katalogu OrcaRouter, podobnie jak żaden wariant LFM2.5, więc pochodzi z własnej dystrybucji Liquid AI i zwykłych zewnętrznych hostów — to lokalny artefakt, a nie routowany endpoint. AREX-Base i AREX-Turbo również nie znajdują się w naszym katalogu. Do czego w tym obrazie tak naprawdę służy warstwa routingu, to druga strona architektury: w dniu, gdy porównujesz swój fine-tuning z modelami, które musi on pokonać, chcesz, aby takie porównanie kosztowało zmianę konfiguracji, a nie cykl zakupowy. Jedno API przed ponad 200 modelami, cena katalogowa dostawcy przekazywana bez żadnych dodatków za token, jeden klucz do całego panelu i failover, dzięki któremu zły dzień u dostawcy nie staje się złym dniem twojej ewaluacji. To są warunki, w których test A/B na nieprzetestowanym modelu jest wystarczająco tani, by faktycznie go przeprowadzić.
To także uczciwe ujęcie samego AREX-2. Kiedy zostanie wydany — zakładając, że zostanie wydany z otwartymi wagami, tak jak w przypadku jego dwóch poprzedników — rozsądnym sposobem wypróbowania zupełnie nowego agenta w rzeczywistym obciążeniu jest uruchomienie go na bocznej ścieżce, za mechanizmem przełączania awaryjnego, a nie jako jedynego dostawcy, od którego zależy twoja pętla produkcyjna.
Co rozsądny człowiek robi w tym tygodniu z każdym z nich
Jeśli masz małe, wąskie zadanie i dane, które nie mogą opuścić twojej infrastruktury, checkpoint Liquid jest dostępny, niewielki, objęty permisywną licencją poniżej progu przychodów i można go przetestować jeszcze dziś po południu. Pobierz go, uruchom na własnym zestawie ewaluacyjnym i niech wynik zdecyduje. Nic w związku z AREX-2 nie zmienia tego planu.
Jeśli potrzebujesz dzisiaj długoterminowego zachowania badawczego, modelem, po który warto sięgnąć, jest ten, który już istnieje: AREX-Base, wydany w lipcu, z opublikowanymi benchmarkami agentów, które przynajmniej można sprawdzić z artykułem. AREX-2 to nazwa ze znacznikiem czasu, a dwie rzeczy, które zmieniłyby jego status, są widoczne z zewnątrz — czy pliki pojawią się w drzewie i czy wraz z nimi pojawi się karta z liczbą parametrów i licencją.
Trybem awarii, któremu ma zapobiegać ten artykuł, jest sytuacja, w której zarezerwowana nazwa jest traktowana jako pozycja w planie rozwoju. Nie jest nią. To repozytorium, które BAAI utworzyło wczoraj, a właściwa ilość planowania wokół niego na teraz to zero.
