Wygenerowana karta tytułowa z nagłówkiem „TwIL-LM3-Pro vs LFM2.5 2.6B Base”, podtytułem „Jeden jest gotowy, drugi to punkt wyjścia”, z dwiema zaokrąglonymi kartami o treści „TwIL-LM3-Pro – dostrojony po treningu wstępnym i scalony” oraz „LFM2.5 2.6B Base – punkt kontrolny po treningu wstępnym”. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

TwIL-LM3-Pro vs LFM2.5 2.6B Base: Jeden jest ukończony, drugi to punkt wyjścia

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najbardziej wymowne w opublikowanym porównaniu między TwIL-LM3-Pro a LFM2.5 2.6B Base jest to, że webAI nie opublikowało żadnego porównania z 2.6B. Tabele Track A i Track B firmy webAI zestawiają jej 3,66B specjalistę od logiki formalnej z szerokim zestawem modeli odniesienia — własną bazą Granite, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — a wybrany przez nią wpis Liquid AI to LFM2.5-8B-A1B, a nie 2.6B. Ten 2.6B, który faktycznie pojawia się w tabeli, to `LFM2-2.6B`, poprzednia generacja, czyli inny model z innym przebiegiem wstępnego trenowania. To pominięcie nie jest przeoczeniem. LFM2.5 2.6B Base to wstępnie wytrenowany checkpoint bez dostrajania instrukcyjnego, a benchmarki dotyczące stosowania się do instrukcji nie są testem, do którego został stworzony.

Ta strona porównuje więc gotowy artefakt z surowym materiałem. Ujęcie w stylu Aion — jeden model ma wynik, a drugi nie — pasuje, ale powód jest bardziej konkretny i ciekawszy: jeden przeszedł trening końcowy i został scalony, drugi celowo zatrzymuje się przed treningiem końcowym, a dwa dokumenty, które je opisują, celowo odpowiadają na różne pytania.

Dwie liczby parametrów, które nie są tym samym pomiarem

TwIL-LM3-Pro ma 3,66 mld parametrów, jest gęstym modelem, a wszystkie one są aktywne przy każdym tokenie. Wywodzi się z `ibm-granite/granite-4.2-3b` poprzez dostrajanie LoRA, destylację wielościeżkową, fuzję checkpointów, scalenie WiSE-FT z powrotem w stronę modelu bazowego oraz etap GRPO z ważeniem entropijnym — a artefakt udostępniony przez webAI to scalona polityka, a nie adapter LoRA, więc działa samodzielnie.

LFM2.5 2.6B Base ma 2,69 mld parametrów w 30 warstwach: 22 bloki krótkiej konwolucji z podwójnym bramkowaniem przeplatane 8 warstwami grouped-query attention. Ta hybrydowa konstrukcja konwolucji/uwagi to architektura Liquid działająca na urządzeniu i to właśnie dlatego przepustowość tej rodziny jest taka, jaka jest, a nie jest wyłącznie funkcją liczby parametrów. Model został wytrenowany na 34 bilionach tokenów ze słownikiem 128 000 tokenów i ma okno kontekstu o rozmiarze 131 072 tokenów.

Te dwie liczby różnią się od siebie o około 36% i zostały uzyskane w oparciu o całkowicie różne architektury, więc ani stwierdzenie „3,66 mld wygrywa z 2,69 mld”, ani odwrotne nie ma żadnego znaczenia jako twierdzenie o jakości. Sama karta modelu webAI przemyca tę uwagę, gdy odmawia porównania perplexity korpusu między tokenizerami — słownik TwIL-LM3-Pro liczy 100 352, LFM2.5-2.6B — 128 000, a perplexity jest obliczane na token.

Co usuwa „Base” i dlaczego zmienia tablicę wyników

Liquid AI publikuje LFM2.5 2.6B w dwóch formach: checkpointu po treningu końcowym, dostrojonego do obciążeń agentowych w popularnych środowiskach agentowych, oraz Base, opisanego na własnej karcie jako „wstępnie wytrenowany checkpoint wyłącznie tekstowy, używany do tworzenia wszystkich wariantów LFM2.5-2.6B”. Base jest wejściem do dostrajania, a nie produktem. Nie ma dostrajania instrukcyjnego, szablonu czatu godnego tej nazwy ani opublikowanej ewaluacji — ponieważ ocenianie modelu bazowego na zadaniach podążania za instrukcjami mierzy niewłaściwą rzecz.

Pozycja TwIL-LM3-Pro jest odwrotna. Cała jego wartość tkwi w stosie post-trainingowym: webAI donosi, że w swoim własnym harnessie pipeline podniósł bramkę macro w domenie z 0,4313 w modelu bazowym do 0,5539, podczas gdy macro dla odłożonych 10 zbiorów danych utrzymało się na stałym poziomie (0,7942 do 0,7901), zamiast się załamać. Utrzymanie wyników na zbiorach odłożonych to najtrudniejsza część specjalistycznego post-trainingu i to ta część, na którą Base nie potrafi odpowiedzieć.

To również miejsce, w którym porównanie rozmiarów w tabelach webAI się opłaca. Podaje się, że TwIL-LM3-Pro wyprzedza LFM2.5-8B-A1B w obu wynikach makro na zbiorach odłożonych — 0,7901 wobec 0,7884 w zestawie dziesięciu zbiorów danych, 0,7425 wobec 0,7378 w zestawie czternastu — przy mniej niż połowie liczby parametrów tamtego modelu MoE. To autentyczny wynik uzyskany na porównywalnych zasadach, dostępny właśnie dlatego, że LFM2.5-8B-A1B to model po dostrojeniu, który można uruchomić przez harness instrukcji. Base nie może, dlatego 2.6B nigdy nie otrzymał kolumny.

Wymiary, które warto uzgodnić

• Parametry — TwIL-LM3-Pro 3,66B gęsty vs LFM2.5 2,6B Base 2,69B (30 warstw: 22 konwolucyjne + 8 GQA).

• Po treningu — LoRA SFT, destylacja, scalanie WiSE-FT i GRPO na kroku 2580 vs brak; Base jest z założenia wynikiem wstępnego treningu.

• Okno kontekstowe — 131,072 tokenów w obu przypadkach, odziedziczone po ich odpowiednich bazach.

• Słownictwo — 100 352 tokeny vs 128 000, dlatego ich perplexity nie są porównywalne.

• Języki — tylko angielski vs siedemnaście, w tym arabski, chiński, japoński, koreański, hiszpański i tajski.

• Format myślenia — TwIL-LM3-Pro domyślnie emituje blok `<think>` i prowadzi długie rozumowanie (średnio 1902 tokeny w domenie, 24,2% generacji osiąga limit długości) w porównaniu z bazowym checkpointem bez żadnego formatu instrukcji.

• Licencja — webAI Non-Commercial License wersja 1.0 vs Liquid's LFM Open License v1.0.

• Do czego służy — endpoint wnioskowania w logice formalnej vs punkt wyjścia do fine-tuningu.

Wiersze dotyczące kontekstu zasługują na przypis, który podają oba modele: każdy przenosi 131 072 tokeny od pretreningu, a żaden dostawca nie zweryfikował zachowania w długim kontekście — karta TwIL-LM3-Pro mówi, że każdy opublikowany wynik zmierzono w oknie 8 192 tokenów. Zgodne liczby są tu odziedziczone, nie wykazane.

Licencja i do czego każda z nich służy pod względem prawnym

Licencja webAI Non-Commercial License dla TwIL-LM3-Pro zezwala na badania i użytek osobisty oraz wymaga odrębnej umowy z webAI w przypadku wdrożeń generujących przychody. LFM2.5 2.6B Base jest dostarczany na własnej licencji Liquid, LFM Open License v1.0, którą API Hugging Face zgłasza jako `license: other`, a nie jako standardowy identyfikator SPDX — przeczytaj plik licencji, zanim zaczniesz planować na jej podstawie, ponieważ warunki są własne Liquid, a nie uznanym szablonem.

Żadna z tych licencji nie jest Apache 2.0, a traktowanie „otwartych wag" jako synonimu „komercyjnie permisywnego" jest błędem. Praktyczna różnica między nimi polega na tym, czego chronią licencje: badacz niekomercyjny może używać obu, firma budująca produkt musi sprawdzić obie, a cały cel Base — dostrojenie go do produktu kogoś innego — sprawia, że jego dokładne warunki mają większe znaczenie, niż się wydaje.

Gdzie każde z nich należy w stosie

Base to właściwy wybór, gdy zamierzasz trenować. Jeśli Twoim problemem jest wąskie zadanie etykietowania, głowa klasyfikacyjna specyficzna dla domeny albo dostrojenie na kilku tysiącach oznaczonych przykładów, rozpoczęcie od wstępnie wytrenowanego checkpointu 2.69B z szerokim wielojęzycznym słownikiem i hybrydową architekturą konwolucyjną zaprojektowaną pod kątem przepustowości jest rozsądną decyzją inżynierską, a koszt post-trainingu, który byś pominął, jest kosztem, który zamiast tego świadomie ponosisz.

TwIL-LM3-Pro to właściwy wybór, gdy nie zamierzasz trenować, a zadanie jest już zadaniem z logiki formalnej. Etykiety wynikania, formalizacja stwierdzeń w Lean, analizy semantyczne i krytyka dowodów to zadania, na które nakierowany był cały jego potok, a rozpoczęcie od punktu kontrolnego, który przeszedł już etap scalania i wzmacniania, oszczędza ci tę jedną część tego, co naprawdę trudno odtworzyć — utrzymanie poziomu na odłożonym zestawie przy jednoczesnym poprawianiu wyników w domenie.

Błędem jest odczytywanie „3,66B wyspecjalizowanego modelu po treningu” jako bezwzględnie lepszego od „2,69B bazowego checkpointu”. Znajdują się one na różnych etapach tej samej linii produkcyjnej.

Obsługiwać ich albo obsługiwać wokół nich

Żaden model nie jest dziś trasą w katalogu OrcaRouter, a powód jest inny w każdym przypadku. TwIL-LM3-Pro ma licencję niekomercyjną i nie ma hostowanego endpointu; LFM2.5 2.6B Base to artefakt do dostrajania, którego nikt nie udostępniałby celowo jako modelu wnioskowania. To, gdzie router zyskuje swoje miejsce, jest o jedną warstwę wyżej – w pracy wokół specjalisty: generowaniu i filtrowaniu danych treningowych, na których dostroiłbyś Base, rozszerzaniu promptów, które podałbyś modelowi logiki formalnej, oraz ocenianiu wyników. To wywołania tekstowe i działają przez jeden endpoint zgodny z OpenAI, obsługujący ponad 200 modeli w cenie katalogowej dostawcy z doliczoną marżą 0%, więc obniżka cen u dostawcy wchodzi tego samego dnia, a zamiana jednego modelu do generowania danych na inny to edycja konfiguracji, a nie druga relacja z dostawcą.

Automatyczne przełączanie awaryjne ma większe znaczenie niż zwykle w potoku dostrajania, ponieważ zadanie wsadowe, które pada przy 80%, marnuje cały przebieg. Jeden klucz obejmujący modele generowania, z mechanizmem awaryjnym, który ponawia żądanie przy błędzie dostawcy, to mniejszy element infrastruktury niż trzy integracje API.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs LFM2.5 2.6B Base - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Post-training SFT, merge, GRPO; Context 131,072 tokens; Vocabulary 100,352; Languages English; Licence non-commercial. LFM2.5 2.6B Base: Parameters 2.69B (30 layers); Post-training none by design; Context 131,072 tokens; Vocabulary 128,000; Languages 17; Licence LFM Open License v1.0. A footer line reads 'Both vendor-reported; neither model has a third-party evaluation.' The OrcaRouter logo is composited in the bottom-right corner.

Który z nich — zależnie od twojej intencji

Jeśli trenujesz, weź Base. Jeśli prowadzisz wnioskowanie na logice formalnej i licencja pozwala na Twoje użycie, weź TwIL-LM3-Pro. Jeśli już dziś potrzebujesz małego modelu podążającego za instrukcjami, a żadne z tych ograniczeń nie ma zastosowania, użyj siostrzanego modelu LFM2.5 2.6B po treningu następczym — modelu, który Liquid faktycznie publikuje w tym celu — a Base zostaw do dostrajania, które i tak planowałeś.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, the 16-languages tag, the LFM2 and liquid tags, and the card's opening description of LFM2.5 as a family of hybrid models designed for on-device deployment, built on the LFM2 architecture with extended pre-training and reinforcement learning.A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B, the post-trained sibling, showing the 16-languages and LFM2 tags and the card's description of LFM2.5-2.6B as part of the LFM2.5 family with a 128K context window and agentic post-training.