Wygenerowana karta tytułowa hero z napisem „Solar Mini 4 vs LFM2.5 2.6B Base”, podtytułem „Trzykrotność indeksu i porównanie kosztów, które nie istnieje” oraz dwiema plakietkami o treści „2,69B dense kontra 35B sparse” i „Jedno to plik, drugie to endpoint”.
Guides & Insights

Solar Mini 4 kontra LFM2.5 2.6B Base: indeks trzykrotnie większy i nieistniejące porównanie kosztów

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Uczciwy sposób porównania Solar Mini 4 i LFM2.5 2.6B Base polega na tym, by od razu przyznać, że nie należą do tego samego rynku. Solar Mini 4 to rzadki model typu mixture-of-experts firmy Upstage o 35 miliardach parametrów, wydany 22 września 2026 r., aktywujący około 3 miliardów parametrów na token, własnościowy i rozliczany stawką 0,10 USD za milion tokenów wejściowych oraz 0,40 USD za milion tokenów wyjściowych. LFM2.5 2.6B Base to wstępnie wytrenowany checkpoint Liquid AI o 2,69 miliarda parametrów, opublikowany na Hugging Face na początku sierpnia 2026 r. na licencji LFM Open License v1.0, wystarczająco mały, by zmieścić się w pamięci telefonu. Jedno to endpoint. Drugie to plik wag, a jeśli czytasz to, bo chcesz uruchomić model, a nie wywoływać go, porównanie już się skończyło.

Co jednak czyni to zestawienie wartym artykułu, to jeden wymiar, w którym oba modele rzeczywiście się pokrywają: oba zostały odniesione do tej samej niezależnej miary, a kształt tego porównania nie jest taki, jakiego pozwalają oczekiwać liczby parametrów. Artificial Analysis przyznaje Solar Mini 4 wynik 24 w Intelligence Index v4.3.2, a generacji LFM2.5 2.6B — 8,4, tyle że druga z tych liczb jest szacunkiem i nie dotyczy checkpointu wymienionego w tytule tego artykułu. Oba zastrzeżenia mają znaczenie i to od nich trzeba zacząć.

Arkusz specyfikacji, obok siebie

• Parametry — Solar Mini 4 ma łącznie 35 mld parametrów, z 3 mld aktywnych; LFM2.5 2.6B Base jest modelem gęstym o 2,69 mld parametrów, bez niczego w rezerwie. Trzynaście razy więcej wag po stronie Upstage przy w przybliżeniu takim samym budżecie obliczeniowym na token.

• Architektura — Solar Mini 4 to rzadka mieszanina ekspertów. LFM2.5 2.6B Base ma 30 warstw, z czego 22 to bloki krótkiej konwolucji z podwójnym bramkowaniem, a 8 to uwaga z grupowanymi zapytaniami; to hybrydowa konstrukcja, którą Liquid zbudował z myślą o wnioskowaniu na CPU i urządzeniach brzegowych.

• Trening — Upstage nie publikuje budżetu tokenów. Karta Liquid dokumentuje 34 biliony tokenów i słownik liczący 128 000 tokenów w 16 językach, w tym koreańskim i japońskim.

• Licencja — Solar Mini 4 jest własnościowy. LFM2.5 2.6B Base jest udostępniany na licencji LFM Open License v1.0 — zezwala na użytkowanie komercyjne pod pewnymi warunkami i można go dostrajać.

• Kontekst — Upstage dokumentuje 512K tokenów, Artificial Analysis podaje 1.05M dla tego samego modelu, więc traktuj górny limit jako nieustalony. LFM2.5 2.6B Base obsługuje 131,072.

• Modalność — oba działają na zasadzie tekst na wejściu, tekst na wyjściu. Żaden nie przyjmuje obrazów ani dźwięku.

• Cena — Solar Mini 4 po $0.10 / $0.01 za trafienie w pamięć podręczną / $0.40 za milion tokenów, obecnie 50% zniżki do 22 października 2026. LFM2.5 2.6B Base nie ma żadnego cennika; gospodarz Artificial Analysis śledzi ceny generacji LFM2.5 2.6B na poziomie $0.00.

Co "8.4, estimated" mierzy, a czego nie mierzy

A two-column comparison scoreboard titled 'Solar Mini 4 vs LFM2.5 2.6B Base', subtitled 'An endpoint and a checkpoint, on the only axis where they meet'. Solar Mini 4: parameters 35B total / 3B active, sparse; what you get a hosted endpoint; context 512K claimed and 1.05M listed; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; output per task 88,300 tokens at 204 tok/s; long-context reasoning 83.3% on AA-LCR v1.1. LFM2.5 2.6B Base: parameters 2.69B dense with a 34T training budget; what you get weights and a fine-tuning recipe; context 131,072; price per 1M no rate card exists; Intelligence Index 8.39 for the post-trained 2.6B generation, estimated; cost per index task not measured; output per task not measured; long-context reasoning 5.7% on AA-LCR v1.1.

Wpis Artificial Analysis dotyczący generacji LFM2.5 2.6B — modelu po etapie dostrajania, a nie pretrenowanego Base — ma indeks 8,4 oznaczony jako szacunkowy, a większość jego ocen składowych oznaczono w ten sam sposób. To pozycja w rankingu, a nie specyfikacja, według której należy budować, i nigdy nie należy cytować tego indeksu tak, jakby ktoś przepuścił checkpoint Base przez ten zestaw testów. Nikt tego nie zrobił. Własna karta modelu Liquid w ogóle nie publikuje żadnej tabeli benchmarków dla LFM2.5 2.6B Base: jest to pretrenowany checkpoint do uzupełniania tekstu, a karta wyraźnie mówi, że jest zalecany wyłącznie do intensywnego dostrajania.

Oceniany bliźniak to inny artefakt. Tabela benchmarków Liquid dla LFM2.5 2.6B po treningu dostrajającym pokazuje IFStruct na poziomie 85,5 i Multi-IF na poziomie 80,1, AIME25 na 51,9, LiveCodeBench v6 na 59,4, BFCLv4 na 56,9 oraz τ³-Banking na 5,7 — wszystko uruchamiane przez dostawcę, wszystko na kompilacji dostrojonej do instrukcji, a liczba τ³ to ta, która brzmi jak ostrzeżenie.

Profil Solar Mini 4 ma zupełnie inny kształt. Osiąga 83,3% w AA-LCR v1.1 do rozumowania długiego kontekstu, 47,6% w SciCode i -10,8 w AA-Omniscience przy 18,4% dokładności i 64,2% wskaźniku braku halucynacji. Osiąga również 1% w Terminal-Bench 4.0 i 22,3% w AutomationBench-AA. Obie rodziny są słabe w pracy agentowej; model Upstage jest słaby w pracy agentowej, będąc jednocześnie drogim, co jest gorszą sytuacją niż być słabym w pracy agentowej i jednocześnie darmowym.

To, czym Solar Mini 4 uzasadnia swoją cenę, jest skala rozumowania. Przy 88 300 tokenach wyjściowych na zadanie indeksowania — z czego 71 600 to rozumowanie — zużywa moc obliczeniową w sposób, którego gęsty model o 2,6 mld parametrów nie może naśladować, gdy otrzyma dłuższy prompt. Modelowi o 2,69 mld parametrów można kazać myśleć krok po kroku; nie można mu kazać mieć 35 mld parametrów. To jest rzeczywisty produkt.

Trzykrotność indeksu i brak porównywalnej wartości kosztów.

Artificial Analysis wycenia Solar Mini 4 na 0,36 USD za ukończone zadanie indeksowe w porównaniu z 0,006 USD dla Granite 4.2 3B, a generowanie LFM2.5 2.6B jest wycenione na zero, więc nie istnieje żadna wartość kosztu na zadanie, która czyniłaby ten stosunek uczciwym. Sformułowanie „Solar Mini 4 kosztuje znacznie więcej niż LFM2.5 2.6B Base” jest zatem prawdziwe, ale nieco mija się z sednem. Istotne pytanie brzmi, czy prace związane z ekstrakcją strukturalną z długich dokumentów w języku koreańskim, do których zbudowano Solar Mini 4, mogą w ogóle wykonać pretrenowany checkpoint o 2,69 mld parametrów. Zwykle nie może, a wtedy porównanie staje się porównaniem Solar Mini 4 z generalistycznym modelem klasy frontier, a nie Solar Mini 4 z modelem działającym na telefonie.

Przypadek, w którym LFM2.5 2.6B Base wygrywa, nie jest przypadkiem, w którym jest taniej. To przypadek, w którym zadanie jest wystarczająco wąskie, że dostrajanie zamyka lukę. Ekstrakcja ustrukturyzowanych pól ze znanego formatu dokumentu, klasyfikacja względem stałej taksonomii, asystent na urządzeniu, który musi działać bez sieci — to są zadania, w których checkpoint 2.69B plus własne dane treningowe pokonuje generalistę 35B plus cennik, i kosztuje instancję GPU zamiast licznika tokenów. Liquid dostarcza bazowy checkpoint z przepisami na kontynuowane wstępne trenowanie, LoRA SFT, DPO i GRPO poprzez Unsloth i TRL właśnie w tym celu.

Do kogo zadzwonić?

Sięgaj po Solar Mini 4, gdy dane wejściowe są długie, wynik wymaga rozumowania, a mieszanka językowa obejmuje koreański lub japoński — i gdy siedem minut dekodowania na trudne zadanie jest do zaakceptowania. Sięgaj po LFM2.5 2.6B Base, gdy wagi muszą być twoje, urządzenie nie ma sieci, a zadanie jest wystarczająco wąskie, by je dostroić. Interesujące wdrożenia wykorzystują oba, ponieważ nie są one alternatywami: mały lokalny model wykonuje routing, redakcję i ekstrakcję, a model hostowany jest wywoływany tylko dla tej części żądań, które rzeczywiście potrzebowały 35B parametrów.

Model Liquid nie jest dostępny na OrcaRouter, podobnie jak model Upstage'a, więc żadnej z tych tras nie możemy Ci sprzedać. To, co możemy zrobić, to część, która zamienia to porównanie z decyzji w konfigurację: ponad 200 modeli za jednym kluczem, z 0% narzutu względem ceny katalogowej dostawcy, z automatycznym przełączaniem awaryjnym między dostawcami i DSL routingu, który pozwala łączyć kilka modeli w jedno wywołanie. Gdy właściwą odpowiedzią jest „tani przez większość czasu, a dobry, gdy to ma znaczenie”, to jest problem routingu i właśnie dlatego istnieje DSL routingu.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base showing the sixteen-language tag, the Apache-style conversational text-generation tags, the LFM Open License v1.0, a Model Details table listing the base checkpoint at 2.69B parameters as a pre-trained model for fine-tuning beside the post-trained 2.6B sibling, a 3B-parameter BF16 safetensors model size, and a model tree with eight finetunes branching off the Base checkpoint.

Liczba, której żaden z dostawców nie umieści na slajdzie

Opóźnienie. Solar Mini 4 zużywa 88 300 tokenów wyjściowych na zadanie Intelligence Index przy zmierzonych 204 tokenach na sekundę, więc średnio zajmowało mu to 430 sekund — nieco ponad siedem minut — na każde trudne zadanie. Generacja LFM2.5 2.6B, na hoście testowanym przez Artificial Analysis, działała z szybkością 45,7 tokena na sekundę przy 2,8-sekundowym oczekiwaniu na pierwszy fragment, ale to host w centrum danych rozmawiający z modelem, który normalnie działałby na twoim biurku. Własne pomiary Liquid wskazują, że ta sama architektura osiąga 220 tokenów na sekundę na M5 Max, 113 na Ryzen AI Max+ 395 i około 30 tokenów na sekundę na telefonie — co daje użyteczną pętlę agenta na urządzeniu bez sieci.

Jeśli Twoje obciążenie jest interaktywne, nie jest to wyrównane porównanie i żaden wynik benchmarku tego nie zmieni. Jeśli Twoje obciążenie jest wsadowe, a tym, co czeka, jest zadanie cron, siedem minut jest w porządku, a głębia rozumowania jest tego warta.

A screenshot of Upstage's Console documentation page for Solar Mini 4 showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate and '$0.40 / 1M tokens' output rate with a '$0.01 / 1M tokens' cached rate, the description of a 35B total / 3B active compact model built for agentic use, English, Japanese and Korean support, tool calling, a 128K max output, and the version string solar-mini4-260922.

Na zakończenie dwie uwagi dotyczące źródeł. Każda wartość Artificial Analysis podana tutaj to niezależny pomiar tej organizacji na wspólnym zestawie testowym; wskaźnik LFM2.5 2.6B jest wyraźnie szacunkiem i obejmuje model po treningu końcowym, a nie wymieniony powyżej pretrenowany punkt kontrolny Base. Każda wartość Liquid AI pochodzi z własnego uruchomienia dostawcy na jego własnych benchmarkach i nie została odtworzona — a sam punkt kontrolny Base nie ma w ogóle opublikowanych wyników, co jest faktem dotyczącym modeli pretrenowanych, a nie krytyką tego konkretnego modelu.