
FrogNano-4B-2609 vs LFM2.5 2.6B Base: gotowy specjalista i worek wstępnie wytrenowanych wag
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Wpisz pytanie w LFM2.5 2.6B Base, a ono dokończy twoje zdanie zamiast na nie odpowiedzieć. To nie jest wada — Liquid AI opublikowała je jako wstępnie wytrenowany checkpoint stanowiący podstawę rodziny LFM2.5, celowo pozostawiając dostrajanie do instrukcji swojemu odpowiednikowi spoza wersji Base, a karta modelu mówi wprost, że jest przeznaczony do intensywnego dostrajania.FrogNano-4B-2609 firmy Microsoft to obraz tego, jak wygląda drugi koniec tego procesu: ten sam rodzaj małego modelu językowego, poddany pięciu iteracjom uczenia ze wzmocnieniem na syntetycznych zadaniach repozytoryjnych, aż zaczął generować ustrukturyzowane wywołania narzędzi i proponowane poprawki poprzez zestaw pięciu narzędzi. Ani jeden z nich nie ma opublikowanego niezależnego benchmarku. Różnica polega na tym, że w jednym z nich zakończono już dostrajanie, a wiedza o tym, w którym — to cała decyzja.
Poniższe dane liczbowe FrogNano pochodzą z karty modelu i raportu technicznego Microsoftu. Dane liczbowe LFM pochodzą z karty Liquid AI, jego konfiguracji architektury i pliku licencji. Każda liczba przypisana któremukolwiek z dostawców jest oznaczona jako zgłoszona przez dostawcę, a żaden z tych modeli nie przeszedł oceny strony trzeciej — w przypadku LFM2.5 2.6B Base jest to w dużej mierze zamierzone, ponieważ checkpoint bez dostrajania instrukcyjnego nie jest uczciwym celem dla benchmarku czatu.
Porównanie ma sens tylko wtedy, gdy wiesz, co porównujesz
Połóż obie karty specyfikacji obok siebie, a pierwsze, co się nie zgadza, to liczba parametrów. LFM2.5 2.6B Base to 2,69 miliarda gęstych parametrów w 30 warstwach — 22 bloki krótkiej konwolucji z podwójną bramką i 8 warstw uwagi z grupowanymi zapytaniami, wytrenowanych na około 34 bilionach tokenów w 16 językach, ze słownikiem 128 000 tokenów i kontekstem 131 072 tokenów. Jego skwantyzowana wersja zajmuje około 1,67 GB w Q4_K_M.
Karta FrogNano-4B-2609 w polu parametrów podaje przedział „500M-5B”, a podsumowanie modelu opisuje go jako około 4,66 miliarda. Pobranie rozstrzyga spór: dwa shardy safetensors o łącznym rozmiarze 9,32 GB wag BF16, 738 tensorów, na odziedziczonym gęstym 32-warstwowym hybrydowym stosie Gated DeltaNet i gated-attention. W checkpointcie znajduje się 24-warstwowa wieża wizyjna, która nigdy nie została poddana post-trainingowi.
Więc stosunek rozmiarów wynosi około 1,7 do jednego, a stosunek pamięci jest bliższy 5,6 do jednego, gdy w grę wchodzi kwantyzacja. Ta różnica ma większe znaczenie niż wiersz z parametrami, ponieważ oba te modele są kandydatami do samodzielnego hostowania, a nie punktami końcowymi — i to jest jedyny powód, dla którego należą do tego samego artykułu.
• Przeznaczenie — LFM2.5 2.6B Base to surowiec do procesu dostrajania. FrogNano-4B-2609 to gotowa polityka do inżynierii oprogramowania na poziomie repozytorium w środowisku Leaf.
• Podążanie za instrukcjami — LFM2.5 2.6B Base nie ma tej zdolności domyślnie; karta Liquid AI zaleca go do zadań wymagających intensywnego dostrajania. FrogNano-4B-2609 postępuje zgodnie z opisem zadania i generuje ustrukturyzowane wywołania narzędzi, ponieważ dokładnie do tego został wytrenowany przez swój cel RL.
• Kontekst — 131 072 tokeny dla LFM.5 2.6B Base w porównaniu z około 131 tys. łącznych tokenów dla ocenianej konfiguracji FrogNano. Nominalnie identyczne, ale okno FrogNano musi pomieścić wyniki narzędzi, dane wyjściowe powłoki i logi testów, nie tylko prompt.
• Limit danych wyjściowych — zweryfikowana konfiguracja FrogNano pozwala na 8 192 generowanych tokenów na turę asystenta. LFM2.5 2.6B Base nie publikuje odpowiednika, ponieważ nie jest przystosowany do kończenia odpowiedzi.
• Modalność — oba są wyłącznie tekstowe. Komponenty wizyjne FrogNano są dziedziczone i wyraźnie nieobsługiwane; LFM2.5 2.6B Base z założenia przyjmuje tekst na wejściu i zwraca tekst na wyjściu.
• Licencja — LFM2.5 2.6B Base objęty jest LFM Open License v1.0, która jest bezpłatna poniżej 10 mln USD rocznego przychodu i wymaga odrębnej licencji na tym progu lub powyżej niego, a utwory zależne dziedziczą ten limit. Karta FrogNano w części wstępnej podaje MIT, a w treści Apache 2.0.
To, za co zapłacił Microsoft, i to, za co sam musiałbyś zapłacić.
To jest kluczowa sekcja, ponieważ właśnie w niej porównanie specyfikacji wprowadza w błąd.
Cała wartość dodana FrogNano-4B-2609 tkwi w post-trainingu, a Microsoft opublikował tę metodę. Zacznij od Qwen3.5-4B, który jako model ogólny uzyskał 39,4% w SWE-bench Verified za pośrednictwem Leaf harness. Generuj kandydujące zadania repozytoryjne na podstawie rzeczywistych migawek, uruchamiaj rollouty z bieżącego checkpointu, aby znaleźć zadania, które czasami rozwiązuje, zachowuj te, trenuj i powtarzaj — pięć iteracji, łącznie około 1500 zwalidowanych syntetycznych środowisk i ani razu destylacji z większego modelu. Wynik na własnej karcie Microsoftu to 61,5% w SWE-bench Verified, 37,6% w SWE-bench Pro, 31,1% w Terminal-Bench 2.0 i 47,3% w PatchEval-Verified. Aneks efektywności w artykule podaje ten sam wzrost jako 48,2%, 53,4%, 58,3%, 58,6% i 61,6% w kolejnych iteracjach, co jest użytecznym przypomnieniem, że nawet dwie tabele samego laboratorium dotyczące tego samego eksperymentu nie zgadzają się co do szczebli.
Teraz zestaw to z LFM2.5 2.6B Base. To checkpoint, zanim ta praca się zaczyna. Zalecenie z jego własnej karty — dostroić go — to dokładnie zadanie, które dokumentuje FrogNano: środowisko zadaniowe, wykonywalna nagroda, harness działający dłużej i kilka iteracji treningowych względem zmieniającej się polityki. Artykuł nie twierdzi, że to łatwe. Podaje, że pośrednie checkpointy stawały się coraz droższe w trenowaniu w miarę wydłużania się śladów rozumowania, że trzeba było dodać karę za długość logu, aby powstrzymać dryf, oraz że późniejsze iteracje utraciły zdolność równoległego wywoływania narzędzi, którą miał model bazowy, kończąc na 1,71% wskaźnika równoczesnych wywołań. Każdy, kto planuje uruchomić recepturę FrogNano na innym modelu bazowym 2.6B, powinien uwzględnić w budżecie konkretnie te trzy problemy.
To, co zapewnia LFM2.5 2.6B Base, to inny rodzaj przewagi na starcie: budżet pretreningowy wynoszący 34 biliony tokenów, udokumentowana architektura hybrydowa, istniejąca skwantyzowana wersja i udokumentowany kontekst 131,072 tokenów — a wszystko to w rozmiarze, który pozwala działać na sprzęcie, na którym nie zmieściłby się checkpoint BF16 o rozmiarze 9.32 GB. Jeśli twoje zadanie jest wystarczająco wąskie, aby niewielki fine-tuning przewyższał model ogólny, to jest to realna pozycja — a jeśli nie, zaoszczędziłeś sobie przebieg treningowy.

To, co i tak musisz zbudować
Żadne z nich nie jest wywołaniem sieciowym, a to kształtuje praktyczne porównanie bardziej niż jakikolwiek wiersz specyfikacji.
LFM2.5 2.6B Base potrzebuje środowiska uruchomieniowego do wnioskowania i przebiegu treningowego. Karta Liquid AI wymienia kompilacje w formacie natywnym, GGUF, ONNX i MLX, więc część odpowiedzialna za serwowanie jest dobrze pokryta — llama.cpp na laptopie to realna opcja dla skwantyzowanego checkpointu. Część treningowa należy do Ciebie: dane, cel, ewaluacja i sposób stwierdzenia, czy wynik się poprawił, czy tylko się zmienił.
FrogNano-4B-2609 chce punktu końcowego zgodnego z OpenAI z odpowiednimi parserami oraz klastra Kubernetes z uprawnieniami do zarządzania podami i politykami sieciowymi. README firmy Microsoft jest wyjątkowo bezpośredni, stwierdzając, że środowisko testowe jest zależnością, a nie udogodnieniem, a karta stwierdza, że identyczne wyniki wymagają zgodnego checkpointu, tokenizera, konfiguracji serwowania, obrazów zadań i protokołu ewaluacji. Konfiguracja nie jest tu szczegółem — udostępnij to bez parsera rozumowania Qwen3 i parsera wywołań narzędzi Qwen3 coder, a model pisze prozą tam, gdzie środowisko testowe oczekuje wywołania narzędzia.
Taki jest kształt tego starcia: po jednej stronie projekt treningowy z niewielkim problemem z serwowaniem; po drugiej projekt serwujący z dużym problemem ewaluacji i bez treningu do zrobienia. Oba to wieczory pracy. Tylko jeden z nich to wieczory pracy, które mogą skończyć się stwierdzeniem „model nie jest wystarczająco dobry” — i to nie z twojej winy.

Gdzie router zasługuje na swoje miejsce w takiej konstrukcji
Oba te modele trafiają ostatecznie do potoku, który wywołuje również coś hostowanego. Własne stanowisko ewaluacyjne FrogNano jest tego dowodem: harness Leaf rozmawia z endpointem zgodnym z OpenAI, co oznacza, że model testowany i każdy model, z którym go porównujesz, są dostępne przez ten sam interfejs. To wzorzec wart skopiowania, nawet jeśli powodem jest tylko higiena, i to właśnie tam pojedynczy endpoint robi coś konkretnego.
OrcaRouter udostępnia ponad 200 modeli za jednym kluczem zgodnym z OpenAI z 0% marży, więc ceny katalogowe dostawców przechodzą bez zmian, a zmiana ceny przez dostawcę jest widoczna po naszej stronie tego samego dnia — i to właśnie ta wartość faktycznie się zmienia, gdy decydujesz, czy specjalistyczny model hostowany samodzielnie bije hostowany model ogólny pod względem kosztu na zadanie. Automatyczne przełączanie awaryjne obejmuje hostowaną część tego porównania, a nie checkpoint, który sam serwujesz. Nie hostujemy FrogNano-4B-2609 ani LFM2.5 2.6B Base; oba są do pobrania. Warstwa routingu usuwa drugą integrację za każdym razem, gdy zmienia się hostowana strona twojego benchmarku.
Szczerze mówiąc, wybieram jeden
Wybierz LFM2.5 2.6B Base, jeśli twoje zadanie jest wąskie, twój sprzęt jest mały, a ty jesteś gotów wziąć na siebie przebieg treningu — licencja jest bezpłatna poniżej 10 mln USD przychodu, skwantyzowana wersja ma 1,67 GB, a własna karta Liquid AI zaleca ją dokładnie do tego. Kompromis polega na tym, że dostajesz punkt wyjścia, a nie gotową zdolność: nic w wydaniu nie mówi, jaki wynik osiągnąłby trening RL w stylu FrogNano na jego podstawie, i nikt takiego nie opublikował.
Wybierz FrogNano-4B-2609, jeśli zadanie dotyczy inżynierii oprogramowania na poziomie repozytorium i chcesz, aby etap po treningu wstępnym był już wykonany. Wartości 61,5%, 37,6%, 31,1% i 47,3% to autentyczne opublikowane wyniki laboratorium, które szczegółowo opisało swoją metodę — i są one również w tej chwili zamkniętą pętlą: to samo laboratorium, to samo środowisko testowe, ten sam punkt odniesienia dla modelu bazowego. Pobranie 9,32 GB, zależność od środowiska testowego i złożone warunki licencyjne to cena pominięcia projektu treningowego, który w przeciwnym razie trzeba by przeprowadzić.

Przydatne przeformułowanie jest takie, że nie są to konkurenci. LFM2.5 2.6B Base znajduje się na wcześniejszym etapie procesu, który wytworzył coś w rodzaju FrogNano-4B-2609. Jeśli zastanawiasz się, który z nich wybrać, prawdziwym pytaniem jest, czy twój problem jest wart posiadania własnego przebiegu treningowego — a jeśli odpowiedź brzmi „nie”, to checkpoint 4B z harnessem, opublikowaną metodą i raportowaną przez dostawcę drabinką SWE-bench jest tym, który przychodzi gotowy.
