Wygenerowana karta hero dla Kolibri vs LFM2.5 2.6B Base, z nagłówkiem „Kolibri vs LFM2.5 2.6B Base” i podtytułem „rozumowanie klasy serwerowej kontra checkpoint na urządzeniu”, ikoną kolibra po lewej i małym obrysem chipu po prawej, po obu stronach cienkiego separatora. Logo OrcaRouter znajduje się na pasku poniżej grafiki.
Guides & Insights

Kolibri kontra LFM2.5 2.6B Base: suwerenne wdrożenie 78B kontra checkpoint wielkości telefonu

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw Kolibri obok LFM2.5 2.6B Base a oczywiste odczytanie narzuca się samo: Dawid i Goliat — 78,1 miliarda parametrów przeciw 2,69 miliarda, minimalny próg wdrożenia na dwóch GPU przeciw modelowi, o którym Liquid AI mówi, że działa na telefonie. To oczywiste odczytanie jest błędne i to nie w tym kierunku, w którym się spodziewasz. Żaden z nich nie jest modelem, który możesz dziś wskazać do konkretnego zadania. Kolibri został udostępniony przez Aleph Alpha 3 października 2026 roku jako kompletny, poddany etapowi post-trainingu asystent niemiecko-angielski wywołujący narzędzia, z wtyczką serwującą i zalecaną konfiguracją próbkowania. LFM2.5 2.6B Base, opublikowany przez Liquid AI na początku sierpnia 2026 roku, to wstępnie wytrenowany checkpoint bez jakiegokolwiek dostrajania instrukcyjnego, udostępniony specjalnie po to, aby go dostrajać. Jeden to produkt, który wdrażasz. Drugi to surowiec. Porównywanie ich jakości to błąd kategorii, a ciekawe pytanie brzmi: jakiego rodzaju surowca twój projekt tak naprawdę potrzebuje.

To, co w większości rzeczywistych procedur zakupowych rozstrzyga między tymi dwoma, to nie parametry. To licencja. Kolibri jest udostępniany na licencji Apache 2.0. LFM2.5 2.6B Base jest udostępniany na licencji LFM Open License v1.0, niestandardowej licencji (karta modelu klasyfikuje ją jako „license: other”), i to właśnie ta różnica trafia do zespołu prawnego, a nie do zespołu inżynierów.

Dwa różne znaczenia „open weights”

Oba modele pozwalają pobrać wagi i uruchomić je. To, co wolno ci zrobić później, to punkt, w którym ich drogi się rozchodzą.

• Kolibri — Apache 2.0, bez klauzuli dopuszczalnego użytkowania, bez progu liczby użytkowników, bez odrębnych warunków komercyjnych. Karta Aleph Alpha odnotowuje jedynie, że laboratorium jest sygnatariuszem unijnego kodeksu postępowania GPAI.

• LFM2.5 2.6B Base — LFM Open License v1.0, czyli własna licencja Liquid AI, a nie licencja standardowa OSI. To ta sama licencja, której podlega model LFM2.5 2.6B po treningu końcowym oraz pozostałe modele z rodziny.

Dla zespołu badawczego obie opcje są w porządku. Dla przedsiębiorstwa, które musi określić swoją sytuację licencyjną w dokumencie zakupowym, jedna jest znaną wielkością, a druga dokumentem, który ktoś musi przeczytać. To realny koszt, ponoszony, zanim zostanie wygenerowany choćby jeden token, i niewidoczny w żadnej tabeli benchmarków.

W tej samej kategorii istnieje drugie rozróżnienie i to właśnie to własna karta Liquid AI usilnie stara się uwypuklić. Base nie jest asystentem. Nie ma tuningu instrukcyjnego, co oznacza, że nie będzie podążał za promptem, nie będzie odmawiał odpowiedzi, nie będzie wywoływał narzędzia ani nie będzie trzymał się tematu — nie dlatego, że jest słaby, ale dlatego, że nigdy nie był do tego trenowany. Karta mówi wprost, że jest zalecany wyłącznie do zadań wymagających intensywnego dostrajania: asystentów wyspecjalizowanych w danym języku lub dziedzinie, trenowania na danych zastrzeżonych albo eksperymentowania z nowatorskimi podejściami do post-trainingu. Wszystko, co następuje po bazowym checkpointcie — nadzorowane dostrajanie, specjalizacja nauczyciela, destylacja on-policy, agentowe uczenie ze wzmocnieniem — jest problemem nabywcy. Kolibri przychodzi z tym wszystkim już zrobionym, na czterech poziomach wysiłku rozumowania, z parserem wywołań narzędzi w stylu Hermesa dostarczanym obok wag.

Co tak naprawdę dają rozmiary

Usuń oprawę, a oba modele okażą się zoptymalizowane pod kątem przeciwstawnych ograniczeń.

• Parametry — łącznie 78 103 074 560, z czego 3 457 573 120 aktywnych na token w Kolibri, w porównaniu z 2,69 miliarda łącznie w LFM2.5 Base, który wykorzystuje hybrydowy stos 22 podwójnie bramkowanych bloków krótkiej konwolucji i 8 warstw uwagi z grupowanymi zapytaniami zamiast transformera o jednorodnych blokach.

• Kontekst — 131 072 tokenów w LFM2.5 Base, w porównaniu z natywnym oknem 262 144 tokenów w Kolibri i zweryfikowanym 1 048 576 poza nim.

• Dane treningowe — 34 biliony tokenów w LFM2.5 Base, wobec 20 bilionów w Kolibri pochodzących z surowej puli ponad 200 bilionów po filtrowaniu i deduplikacji, z czego 13,6 procent stanowił kod.

• Języki — szesnaście w LFM2.5 Base, w tym arabski, chiński, japoński, koreański, tajski i wietnamski, wobec dokładnie dwóch w Kolibri, niemieckiego i angielskiego, zgodnie z wyraźnym założeniem.

• Pamięć — LFM2.5 Base ma opublikowane wraz z nim kompilacje GGUF, ONNX i MLX i jest stworzony do wdrożeń brzegowych; wagi FP8 Kolibri zajmują około 78 GB i wymagają minimum dwóch kart A100 80 GB, dwóch H100 SXM5, jednej H200, jednej B200 lub jednej B300.

Przeczytaj te pięć linijek razem, a obraz przestaje być jednostronny. Model Liquid AI obejmuje dziesięć razy więcej języków na sprzęcie o trzy rzędy wielkości mniejszym. Model Aleph Alpha obejmuje dwa języki z ośmiokrotnie dłuższym oknem kontekstowym i głębią specjalizacji, która ujawnia się tylko w jego własnych ewaluacjach wertykalnych. Żaden nie jest gorszą wersją drugiego; są odpowiedziami na różne pytania, a te pytania to „czy to może działać bez serwera” i „czy to potrafi rozumować na podstawie niemieckiego zgłoszenia regulacyjnego”.

Generated two-column scoreboard for Kolibri and LFM2.5 2.6B Base. Left column Kolibri: role 'post-trained assistant', parameters '78.1B MoE, 3.46B active', context '262,144 native, 1M validated', languages 'German and English', licence Apache 2.0, deployment 'two 80 GB accelerators'. Right column LFM2.5 2.6B Base: role 'pre-trained checkpoint', parameters 2.69B, context 131,072, languages 'sixteen', licence 'LFM Open License v1.0', deployment 'phone, GGUF and MLX'. The footer reads 'Kolibri figures vendor-reported; LFM2.5 2.6B Base has no published evaluation.'

Tylko jeden z nich ma zmierzony wynik, a nie jest to Base

Oto część, którą ukrywa to zestawienie. Artificial Analysis rzeczywiście ma stronę modelu dla LFM2.5-2.6B — ale dla modelu po treningu końcowym, nie dla wersji Base. Ta strona podaje Intelligence Index na poziomie 8, miejsce #9 wśród 49 modeli w swojej klasie, kontekst 128 000 tokenów, 2,7 miliarda parametrów i licencję LFM Open License v1.0. To skromny i uczciwy wynik: model jest mierzony, wyceniany praktycznie na zero i oceniany jako to, czym jest — mały model rozumujący.

Punkt kontrolny Base nie ma wyniku i nie może go mieć. Indeks Inteligencji oblicza się, uruchamiając model na zadaniach z zakresu rozumowania i wiedzy; punkt kontrolny, który nie został dostrojony do instrukcji, nie przejawia na tych zadaniach żadnego znaczącego zachowania. Liquid AI nie publikuje dla niego tabeli ewaluacyjnej, a ten brak jest stwierdzeniem o artefakcie, nie luką w wydaniu.

Pozycja Kolibri jest znów inna i warto ją dokładnie przedstawić, ponieważ łatwo ją błędnie odczytać. Dla Kolibri również nie ma strony Artificial Analysis — sprawdziliśmy i ten model w ogóle nie występuje w tym porównaniu. Istnieje natomiast własna tabela wyników po treningu firmy Aleph Alpha, w której Kolibri osiąga 75,5 w średniej dla języka angielskiego i 70,8 w średniej dla języka niemieckiego w całym swoim zestawie testowym, wobec 54,1 i 46,4 dla swojego poprzednika, Kolibri Origin. To liczby wygenerowane przez dostawcę w zbudowanym przez dostawcę zestawie ewaluacyjnym i nie można ich przeliczyć na Intelligence Index. Zatem spośród dwóch modeli w tym nagłówku jeden ma niezależny wynik dla wersji siostrzanej, drugi ma tabelę dostawcy, a żaden z dokładnie porównywanych artefaktów nie ma w ogóle niezależnego pomiaru.

Screenshot of the Artificial Analysis model page for LFM2.5-2.6B, showing an Intelligence Index of 8 against a median of 5, a #9/49 intelligence rank, 128k-token context window, the summary line that the model is amongst the leading models in intelligence and well priced compared with other open-weight models of similar size, $0.00 input and output pricing against $0.00 medians, and the 49 models in this class count.

Rodzeństwo, które zmienia rekomendację

Ocenianie LFM2.5 2.6B Base jako osobnego modelu to zły sposób oceny wydania Liquid AI, ponieważ Base istnieje po to, aby służyć dostrojonemu LFM2.5 2.6B, a oba są udostępniane razem. Jeśli nie zamierzasz pisać pipeline'u do dostrajania, Base nie jest twoim modelem — jest nim jego dostrojony odpowiednik i to on ma publiczny wynik oraz opublikowaną cenę wynoszącą praktycznie zero za token, gdy hostujesz go samodzielnie.

To ta sama relacja, jaką Kolibri ma z Kolibri Origin, a porównanie warto zrobić, bo Aleph Alpha opublikowała harmonogram. Origin zakończył wstępne trenowanie przy 30,6 mld parametrów i 3,27 mld aktywnych 11 czerwca 2026 r. i nigdy nie został udostępniony; Kolibri zakończył 11 września 2026 r. przy 78,1 mld i został udostępniony 3 października. Dwa modele, trzy miesiące, jeden z nich tylko wewnętrznie. Odpowiednik tego podziału od Liquid AI jest publicznie dostępny w obu wariantach: Base i po treningu, obok siebie, ze skwantyzowanymi buildami dla llama.cpp, ONNX Runtime i Apple MLX opublikowanymi razem z natywnym checkpointem. Jeśli planujesz dostrajanie, otaczające narzędzia są warte więcej niż wiersz w benchmarku, bo decydują, jak dużą część pracy musisz wykonać samodzielnie.

Co wdrożyć, według wymagań

Ten sprowadza się raczej do krótkiej listy decyzji niż do zwycięzcy.

• Jeśli model musi działać bez serwera — na telefonie, laptopie, urządzeniu w fabryce — LFM2.5 2.6B Base jest jedynym z tych dwóch, który w ogóle wchodzi w grę, a dostrojony LFM2.5 2.6B to ten, od którego faktycznie zaczniesz. Kolibri nie może tam działać przy żadnej kwantyzacji.

• Jeśli obciążeniem jest rozumowanie na dokumentach w języku niemieckim lub angielskim w obrębie własnego perimetru, z ograniczeniami dotyczącymi danych regulowanych i potrzebą zachowania abstencyjnego, LFM2.5 Base nie jest właściwym rodzajem artefaktu, a Kolibri jest ukierunkowany dokładnie na to — pod warunkiem że możesz dostarczyć dwa akceleratory 80 GB i zaakceptować stanowisko licencyjne, które można wyrazić w jednej linii.

• Jeśli potrzebujesz więcej niż niemieckiego i angielskiego, rodzina Liquid AI obejmuje szesnaście języków przy 2.6B, a argument o pokryciu językowym odwraca się przy tym rozmiarze.

• Jeśli potrzebujesz wdrożonego asystenta w tym kwartale i nie chcesz uruchamiać potoku dostrajania po treningu, Kolibri jest dostrojony po treningu; LFM2.5 Base nie jest, a model LFM2.5 dostrojony po treningu jest znacznie mniejszym asystentem niż Kolibri, a nie jego tańszą wersją.

Dla zespołów, których obciążenie naprawdę plasuje się pośrodku — kilka miliardów tokenów miesięcznie, umiarkowany kontekst, brak wymogu regulacyjnego posiadania własnego sprzętu — żadne z tych rozwiązań nie jest pierwszym wyborem. Modele poniżej 4B są tanie w self-hostingu i niewygodne w routingu na skalę, bo koszt operacyjny wdrożenia może przewyższyć rachunek za tokeny; model 78B to odwrotny problem. Warstwa, która faktycznie jest routowana, to ta pośrednia, a ta warstwa jest już na OrcaRouter: Qwen3.5 35B-A3B za 0,057 USD za milion tokenów wejściowych i 0,459 USD wyjściowych, Qwen3.8-Flash za 0,15 i 0,47 USD z kontekstem 1 mln tokenów albo mixture-of-experts Gemma 4 26B-A4B IT za 0,06 i 0,33 USD. To ceny katalogowe dostawców przekazywane bez żadnych dodatkowych opłat za token, na jednym kluczu zgodnym z OpenAI z mechanizmem failover, i są one uczciwą odpowiedzią dla zespołu, który chce zmierzyć swój rzeczywisty wolumen tokenów, zanim zdecyduje się albo na projekt fine-tuningu, albo na własny rack.

Aby było jasne, czego nie oferujemy: ani Kolibri, ani LFM2.5 2.6B Base nie są dziś dostępne w routingu w OrcaRouter. Sprawdziliśmy katalog pod kątem obu tych modeli, we wszystkich wariantach pisowni nazw dostawców i modeli, i żadnego z nich tam nie ma. Kolibri działa wyłącznie w trybie samodzielnego hostowania, a LFM2.5 Base to artefakt dostrajania, który nigdy nie miał stać za API.

Screenshot of the OrcaRouter model page for qwen/qwen3.5-35b-a3b, showing the 32K-token context badge, 65K maximum output, text, image and video input, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'Public benchmarks by Qwen - 2026-02-25', the description as an open-weight mixture-of-experts multimodal model with 35B total and 3B active parameters, the pricing tiles $0.06 and $0.46, and a pricing table with two tiers: under 128K input tokens at $0.057 input and $0.459 output, and above that at $0.229 and $1.835, selected by each request's input token count.

Wybór w jednej linii

Kolibri to gotowy, licencjonowany, udokumentowany model rozumujący niemiecko-angielski o 78 miliardach parametrów, którego uruchomienie wymaga dwóch akceleratorów. LFM2.5 2.6B Base to niedokończony wielojęzyczny punkt wyjścia o 2,69 miliarda parametrów, który wymaga procesu dostrajania i mieści się w kieszeni. Stosunek liczby parametrów między nimi wynosi 29 do 1 i jest to najmniej informująca liczba w tym artykule.