Wygenerowana karta tytułowa z napisem "Ember-1 vs LFM2.5 2.6B Base" i podtytułem "Gotowe zachowanie wobec surowego podłoża", nad dwiema kartami: Ember-1 — "przetrenowany Kimi K3" i "serwowany, nie pobierany"; LFM2.5 2.6B Base — "gęsty checkpoint 2.69B" i "bez dostrajania do instrukcji".
Guides & Insights

Ember-1 vs LFM2.5 2.6B Base: Gotowe zachowanie kontra surowy substrat

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ani Ember-1, ani LFM2.5 2.6B Base nie jest modelem, który można po prostu wziąć i używać, a oba są bezużyteczne z przeciwnych powodów. Ember-1, opublikowany przez Fireworks Research 23 września 2026 r., to wyspecjalizowana pochodna Kimi K3 od Moonshot AI, którą laboratorium ponownie wytrenowało, aby osiągnąć dokładność K3 przy około 40% mniejszej liczbie tokenów — gotowe zachowanie, dostępne wyłącznie jako podgląd badawczy na własnej platformie serverless dostawcy, bez wag i bez opublikowanej ceny. LFM2.5 2.6B Base, opublikowany przez Liquid AI 4 sierpnia 2026 r., to wstępnie wytrenowany checkpoint o 2,69 mld parametrów na licencji LFM Open License v1.0, który w ogóle nie został dostrojony instrukcjami i będzie kontynuować twój tekst, zamiast odpowiedzieć na pytanie — surowy substrat, dostępny do pobrania już dziś, celowo niedokończony. Czytanie ich obok siebie to dobry sposób, by zobaczyć dwa argumenty wysuwane na temat tego, skąd obecnie pochodzą zyski wydajności.

Pytanie, na które odpowiadają oba modele

Obie premiery opierają się na tym samym założeniu: że łatwe korzyści z powiększania modelu zostały w dużej mierze wyczerpane, a ciekawa praca przeniosła się na to, jak model wykorzystuje to, co już ma. Dwa laboratoria odpowiadają na to różnie. Fireworks Research wzięło istniejący model czołowy i zmieniło jego zachowanie. Liquid AI zbudowało mały model od zera i zmieniło skalę. Żadna z nich nie jest historią o nowej architekturze i żadna nie próbuje wspiąć się na szczyt rankingu.

Odpowiedź Ember-1: zachowaj model, wytrenuj ponownie zachowanie

Ember-1 nie narusza architektury Kimi K3, lecz bierze na cel jedną konkretną nieefektywność. Modele rozumujące mogą zużywać ponad 90% generowanych tokenów na wewnętrzne deliberacje, a w wieloturowej pętli agentowej te ślady są odtwarzane i ponownie rozliczane w każdej kolejnej turze — Fireworks Research opisuje wynikający z tego wzrost kontekstu jako w przybliżeniu kwadratowy względem liczby tur. Twierdzenie laboratorium jest takie, że rozumowanie K3 jest dłuższe, niż wymaga tego zadanie, a nadmiar można usunąć bez zmiany odpowiedzi. Firma raportuje przeprowadzenie ponad 50 eksperymentów treningowych i ponad 200 ewaluacji na własnym bezserwerowym stosie treningowym oraz twierdzi, że długość rozumowania spadła o 35–50% bez utraty dokładności w siedmiu benchmarkach i dwóch zbiorach produkcyjnego ruchu klientów. Wszystko to jest raportowane przez dostawcę i nie zostało odtworzone.

Wyniki są nierówne w sposób, który ukrywa liczba z nagłówka. Redukcje tokenów Ember-1 wahają się od 51,9% w Terminal Bench 2.1 do 5,9% w τ-2 Bench Airline. W produkcyjnym teście A/B kodowania jednego z klientów liczba tokenów wyjściowych spadła z 49,3 tys. do 29,9 tys., a wynik utrzymał się na poziomie 0,753 wobec 0,751 — redukcja tokenów rozumowania o 71,3%. To duży efekt w przypadku jednego kształtu obciążenia i niemal niewidoczny w innym, czego można by oczekiwać od modelu wytrenowanego, by przestał nadmiernie myśleć, a nie myśleć mniej.

A two-column scoreboard titled "Ember-1 vs LFM2.5 2.6B Base — the scoreboard" comparing six dimensions. Ember-1: a retrained Kimi K3 derivative; parameters undisclosed; no published weights; context not published (base model 1M); published evaluation is seven benchmarks plus two A/B tests, vendor-run; obtained only as a serving preview. LFM2.5 2.6B Base: a pretrained base checkpoint with no instruction tuning; 2.69B dense parameters; weights under the LFM Open License v1.0; 131,072-token context; no published evaluation, by design; obtained by downloading and fine-tuning.

Odpowiedź LFM2.5 2.6B Base: zmień skalę, zachowaj przepis

LFM2.5 2.6B Base to zakład innego rodzaju. To hybrydowa architektura Liquid AI w małej skali: 30 warstw, z których 22 to dwubramkowane bloki krótkiej konwolucji, a 8 to warstwy grouped-query attention, trenowana na około 34 bilionach tokenów w 16 językach, z oknem kontekstowym obejmującym 131 072 tokeny. Cały checkpoint to 2,69 mld gęstych parametrów — wystarczająco mało, by rozmowa o kosztach przestała dotyczyć tokenów, a zaczęła dotyczyć tego, którą pojedynczą kartę GPU masz akurat wolną.

To, co czyni go niezwykłym, to to, czego celowo nie robi. Nie ma dostrajania instrukcyjnego, co jest całym sensem sufiksu „Base”: przekaż mu pytanie, a będzie kontynuować tekst w stylu pytania, zamiast na nie odpowiedzieć. Własna karta modelu Liquid AI zaleca go do zadań wymagających intensywnego dostrajania. Nie opublikowano również jego ewaluacji i nie jest to przeoczenie — ocenianie bazowego checkpointu na benchmarkach podążania za instrukcjami niczego by nie mierzyło, ponieważ mierzone zachowanie nie zostało jeszcze wytrenowane.

Kontrast, jedna linia na wymiar

• Co to jest — Ember-1: ponownie wytrenowana pochodna Kimi K3 ze skróconym rozumowaniem. LFM2.5 2.6B Base: wytrenowany od zera punkt kontrolny bez dostrajania instrukcji.

• Parametry — Ember-1: nieujawnione; odziedziczone po Kimi K3. LFM2.5 2.6B Base: 2,69 mld gęstych.

• Wagi — Ember-1: brak opublikowanych. LFM2.5 2.6B Base: dostępne na licencji LFM Open License v1.0.

• Cena — Ember-1: nie podano; kwoty w dolarach w benchmarkach opierają się na cenniku Kimi K3. LFM2.5 2.6B Base: do pobrania bezpłatnie; sprzęt zapewniasz we własnym zakresie.

• Kontekst — Ember-1: nie opublikowano w podglądzie. LFM2.5 2.6B Base: 131 072 tokeny.

• Opublikowana ewaluacja — Ember-1: siedem benchmarków i dwa testy A/B, wszystkie przeprowadzone przez dostawcę. LFM2.5 2.6B Base: brak, z założenia.

• Co otrzymujesz na końcu — Ember-1: punkt końcowy, który generuje krótsze rozumowanie przy dokładności na poziomie K3. LFM2.5 2.6B Base: punkt wyjścia, którego zachowanie jest takie, jakie wytrenujesz.

Dwa różne rodzaje tęsknoty

Luki w tych dwóch wydaniach wydają się symetryczne, ale takie nie są. Brak ewaluacji w LFM2.5 2.6B Base jest właściwością samego artefaktu: bazowy checkpoint nie ma zachowania, które można by ocenić, a brak dostrajania do instrukcji jest udokumentowaną cechą, a nie niedociągnięciem. Ta nieobecność nie powoduje niepewności komercyjnej, ponieważ to, co kupujesz, to plik z dołączoną licencją, a dostarczany produkt jest kompletny w momencie zakończenia pobierania.

Braki Ember-1 pozostają naprawdę nierozwiązane. Nie ma opublikowanej ceny, więc twierdzenie o kosztach to arytmetyka na cenniku Kimi K3, a nie stawka, na której można oprzeć budżet. Nie ma wydania wag, więc model nie może przetrwać decyzji dostawcy o dalszym jego udostępnianiu. A okno dostępu jest opisane jako tymczasowe: Fireworks Research przedstawia swoje wydania badawcze jako dwutygodniowe okna serverless, których trwałość zależy od zapotrzebowania społeczności. Podgląd, który może nie istnieć w przyszłym miesiącu, to inna sprawa niż podgląd, który jest jedynie nieudowodniony, a drugi test A/B klienta w ogłoszeniu — około 35% mniej tokenów na zadanie — mówi, czego oczekuje laboratorium, a nie co będzie jeszcze osiągalne w listopadzie.

Ta asymetria to szczera odpowiedź na pytanie „który z nich jest bardziej gotowy”. Żaden z nich nie jest gotowy w tym sensie, że można go od razu użyć jako zależność produkcyjną. LFM2.5 2.6B Base jest skończony jako surowiec, a nieskończony jako model. Ember-1 jest skończony jako model, a nieskończony jako usługa.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing 16,541 downloads in the last month, a safetensors model size of 3B parameters in BF16, the LFM1.0 licence, 16 languages, and a Model Details table listing LFM2.5-2.6B-Base as the pre-trained base model for fine-tuning alongside LFM2.5-2.6B for post-trained agentic workloads.

Co zrobić z każdym w tym kwartale

Jeśli masz pipeline dostrajania i wąskie zadanie z czystymi etykietami, LFM2.5 2.6B Base jest bardziej przewidywalnym z tych dwóch. Checkpoint jest mały, licencja jest permisywna, architektura została zaprojektowana pod kątem wydajności podczas wnioskowania, a praca polegająca na przekształceniu go w coś użytecznego — nadzorowane dostrajanie, zbiór ewaluacyjny, stos serwujący — to praca, którą i tak posiadasz od początku do końca. Tak czy inaczej będziesz przeprowadzać własne ewaluacje, ponieważ Liquid AI nie opublikowało żadnych.

Jeśli masz obciążenie agenta hostowanego, w którym rachunek zdominowany jest przez tokeny rozumowania, Ember-1 odnosi się do realnego składnika twojego równania kosztów i warto poświęcić na niego dwa tygodnie. Właściwym testem jest ruch cieni (shadow traffic) względem dotychczasowego rozwiązania: wyślij część rzeczywistych żądań do obu, porównaj wyniki, a wyników produkcyjnych nie zmieniaj. To również rada, której udzieliło niezależne krytyczne omówienie wydania, wraz ze słusznym ostrzeżeniem — kompresowanie namysłu grozi utratą kroku, którego model potrzebował, a w agencie objawia się to później jako błędne wywołanie narzędzia, a nie błędne zdanie.

Żaden z tych modeli nie znajduje się na OrcaRouter. Jeśli chcesz przetestować ten wzorzec, a nie te dwa artefakty — mały model, który można dostroić, i duży hostowany model rozumujący w jednym potoku — właśnie do tego służy DSL routingu: połącz kilka modeli w jedno wywołanie i pozwól każdemu obsłużyć tę część, w której jest dobry, za jednym kluczem i jednym rachunkiem. To porównanie warto przeprowadzić na poziomie architektury, nawet jeśli oba konkretne punkty końcowe pozostają poza zasięgiem.

Transakcja, wypowiedziana raz

Ember-1 sprzedaje pewność zachowania i niepewność dostaw: model, którego jakość jest starannie argumentowana, a którego dostępność jest wyraźnie uzależniona od warunków. LFM2.5 2.6B Base sprzedaje pewność dostaw i niepewność zachowania: plik, który zawsze będziesz mieć, a którego kompetencje są w całości funkcją treningu, jaki w niego włożysz. Zespoły mające problem z serwowaniem i niemające możliwości treningowych powinny śledzić wersję zapoznawczą i mieć nadzieję, że stanie się stała. Zespoły mające możliwości treningowe i wąskie zadanie powinny pobrać model bazowy i przestać czekać na czyjkolwiek plan działania.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

To, co tak naprawdę pokazuje to zestawienie, to że „efektywność” przestała oznaczać jedną rzecz. Dla Ember-1 oznacza mniej tokenów przy tej samej jakości na sprzęcie kogoś innego. Dla LFM2.5 2.6B Base oznacza model na tyle mały, że sprzęt w ogóle przestaje być cudzy. To obie dobre odpowiedzi i nie są wymienne.