Karta tytułowa hero z napisem „Intern-Decision-0.8B vs LFM2.5 2.6B Base” i podtytułem „Dwa sposoby, by zbudować coś samodzielnie”, z plakietkami „jeden zwraca rozkład” i „jeden zwraca przebieg treningu”, z logo OrcaRouter wkomponowanym w rogu.
Guides & Insights

Intern-Decision-0.8B vs LFM2.5 2.6B Base: Dwa sposoby na zbudowanie czegoś samodzielnie

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw Intern-Decision-0.8B obok LFM2.5 2.6B Base, a uczciwa pierwsza obserwacja jest taka, że żaden z nich nie jest produktem w sensie, jaki zwykle ma na myśli nabywca. Intern-Decision-0.8B to checkpoint, który InternLM przesłał na Hugging Face 26 września 2026 r. bez żadnej zapowiedzi — dostrojony model Qwen3.5-0.8B o 852 985 920 parametrach, który odpowiada na wpisywane pytania i nie generuje tekstu, udostępniony na licencji Apache 2.0 z linkiem do GitHuba, który zwraca 404. LFM2.5 2.6B Base to wstępnie wytrenowany tekstowy checkpoint Liquid AI o 2,69 mld parametrów, opublikowany 1 sierpnia 2026 r. jako fundament rodziny LFM2.5, a jego własna karta mówi, że jest „zalecany wyłącznie do zadań wymagających intensywnego dostrajania”. Jeden jest skończony i wąski. Drugi jest niedokończony i ogólny. Oba zakładają, że to ty wykonujesz pracę — a ta praca nie jest tą samą pracą.

Ta różnica to całe porównanie i sprawia, że proste zestawienie specyfikacji wprowadzałoby w błąd. Czytelnik tak naprawdę pyta: „które z tych mam pobrać?”, a odpowiedź zależy od tego, czy to, co musisz zbudować, jest warstwą decyzyjną, czy językiem. To różne rzeczy o różnych harmonogramach.

Co każdy model ci przekazuje

Intern-Decision-0.8B pojawia się jako działający system. Repozytorium dostarcza inference.py, a DecisionEngine (klasa), dokumentowany schemat żądania i schemat odpowiedzi oraz działający przykład, który można uruchomić po zainstalowaniu czterech przypiętych zależności Pythona. Podajesz stan, od jednego do szesnastu nazwanych pytań, każde z maksymalnie 62 opcjami, oraz opcjonalnie do ośmiu obrazów, a w zamian otrzymujesz skalibrowany rozkład plus etykietę argmax dla każdego pola. Silnik odczytuje logity w stałych pozycjach wstępnie wyrenderowanego szkieletu, zamiast cokolwiek generować, więc nie ma kroku dekodowania, tokenów wyjściowych ani JSON-a do naprawy. Działa na około 1,73 GB plików.

LFM2.5 2.6B Base daje ci coś dokładnie odwrotnego: surowe możliwości bez interfejsu. To tekstowy przyczynowy model językowy z 30 warstwami ułożonymi w 22 bloki krótkiej konwolucji z podwójnym bramkowaniem i 8 warstw uwagi z grupowanymi zapytaniami, wstępnie wytrenowany na około 34 bilionach tokenów w 16 językach, ze słownikiem liczącym 128 000 tokenów i oknem kontekstu 131 072 tokenów. Nie ma własnego dostrajania do instrukcji ani żadnych benchmarków zadaniowych na karcie modelu, bo bazowy checkpoint nie jest oceniany — oceniane są modele, które na nim wytrenujesz. To własny potok dostrajania po pretreningu firmy Liquid zamienia go w agentowy LFM2.5-2.6B i właśnie ten potok masz odtworzyć — częściowo lub w całości — na potrzeby własnej dziedziny.

Zatem osią nie jest rozmiar. Chodzi o to, czy brakującym elementem jest kontrakt decyzyjny, czy przebieg treningowy.

Tablica wyników, z dołączonymi zastrzeżeniami

• Czas do pierwszego wyniku — Intern-Decision-0.8B: jedno popołudnie, załadowanie checkpointu i wywołanie predict()/. LFM2.5 2.6B Base: tyle, ile zajmie Twoje kontynuowane pre-trenowanie lub SFT, plus praca nad danymi, aby go przygotować.

• Parametry — Intern-Decision-0.8B: 852 985 920 w 1,50 GB shardzie językowym, 176 MB shardzie wizyjnym i 25 MB projektorze. LFM2.5 2.6B Base: 2,69B, około 2,5 GB wag.

• Modalności wejściowe — Intern-Decision-0.8B: tekst oraz do ośmiu obrazów, z wagami wizyjnymi obecnymi w repozytorium. LFM2.5 2.6B Base: tylko tekst, zgodnie z założeniem — prace multimodalne w rodzinie LFM2.5 znajdują się w wariantach VL.

• Kontekst praktyczny — Intern-Decision-0.8B: 8 192 tokeny, odrzucane, a nie obcinane, mimo maksymalnego embeddingu pozycji wynoszącego 262 144 w konfiguracji. LFM2.5 2.6B Base: 131 072 tokeny natywnie.

• Wyjście — Intern-Decision-0.8B: skalibrowany rozkład prawdopodobieństwa i etykieta argmax dla każdego pola, deterministyczne. LFM2.5 2.6B Base: kontynuowany tekst, próbkowany.

• Benchmarki — Intern-Decision-0.8B: pełna tabela dostawcy obejmująca siedem benchmarków, nieodtworzona przez nikogo. LFM2.5 2.6B Base: dla samej wersji bazowej nie opublikowano żadnych — z założenia.

• Licencja — Intern-Decision-0.8B: Apache 2.0, z zachowanym LICENSE-QWEN/ dla wag źródłowych. LFM2.5 2.6B Base: LFM Open License v1.0.

A two-column scoreboard comparing Intern-Decision-0.8B with LFM2.5 2.6B Base on six shared rows: parameters 852,985,920 against 2.69B in about 2.5 GB, what you get a working engine and a documented schema against raw pre-trained weights with no interface, time to first result an afternoon against a continued pre-training or SFT run, input text plus up to eight images against text only with a 131,072-token context, benchmarks a vendor table unreproduced against none published for the base, and licence Apache 2.0 plus LICENSE-QWEN against the LFM Open License v1.0 and its $10M threshold.

Wiersz licencji zasługuje na własną sekcję.

Obie karty mówią „open”, a te dwa słowa oznaczają istotnie różne rzeczy. Intern-Decision-0.8B jest na licencji Apache 2.0 — bez warunku dotyczącego przychodów, bez ograniczenia dziedziny zastosowania, bez odrębnej licencji komercyjnej do wynegocjowania. Drugi plik licencji w repozytorium to przeniesiona licencja Qwen, ponieważ model jest pochodną Qwen3.5-0.8B, co jest właściwym postępowaniem, a nie ograniczeniem.

LFM2.5 2.6B Base jest udostępniany na licencji LFM Open License v1.0, a sekcja 5 tej licencji zasługuje na przeczytanie w całości, zanim jakikolwiek plan komercyjny zacznie na niej polegać. Prawa przyznane do Użytku Komercyjnego są uwarunkowane tym, że Ty lub Twój podmiot prawny nie przekraczacie progu określonego w licencji jako roczny przychód w wysokości 10 milionów USD lub więcej. Powyżej tego progu komercyjne wykorzystanie utworu lub utworu zależnego nie jest licencjonowane na mocy umowy. Użycie niekomercyjne i badawcze zostało wyłączone. To realna i egzekwowalna granica, a ponieważ dotyczy również utworów zależnych, rozciąga się na wszystko, co dostroisz na podstawie wersji bazowej — co stanowi całe zamierzone zastosowanie tego checkpointu.

Jest tu jedno proste odczytanie: jeśli tworzysz komercyjnie i Twój podmiot przekracza 10 mln USD rocznego przychodu, LFM2.5 2.6B Base nie jest tym samym rodzajem zasobu co Intern-Decision-0.8B, niezależnie od tego, jak wypadają oba. Jeśli jesteś poniżej progu, prowadzisz badania lub dostrajasz model do celu niekomercyjnego, to rozróżnienie nie ma znaczenia. Tak czy inaczej, to pytanie, na które trzeba odpowiedzieć przed przebiegiem treningu, a nie po nim.

Gdzie każdy z nich jest tak naprawdę właściwym plikiem do pobrania

LFM2.5 2.6B Base to właściwy wybór, gdy potrzebna funkcja nie istnieje jeszcze w gotowym modelu. Karta Liquid wymienia zamierzone przypadki użycia wprost: asystenci dla konkretnych języków, np. japońskiego, asystenci dziedzinowi, np. medyczni, trenowanie na zastrzeżonych danych, których nie można wysłać do API, albo eksperymentowanie z nowatorskimi podejściami do post-trainingu. Uzasadnienie tej listy jest takie, że 34 biliony tokenów wielojęzycznego wstępnego treningu są drogie w odtworzeniu i niemal darmowe do odziedziczenia — kupujesz punkt wyjścia, który jest już kompetentny w 16 językach i kontekście 128K, a własne zasoby obliczeniowe przeznaczasz na część specyficzną dla siebie.

Wsparcie ekosystemu dla tego planu jest nietypowo kompletne jak na tak nowy model. Liquid dokumentuje kontynuacyjny pre-training, SFT, DPO i GRPO przez Unsloth i TRL, z notebookami dla każdego z nich, a checkpoint jest obsługiwany przez Transformers, vLLM, SGLang, llama.cpp, MLX i ML Studio. To nie jest tekst marketingowy — to różnica między modelem bazowym, który możesz dostroić w tym tygodniu, a takim, którego wpinanie do trenera zajmie ci dwa tygodnie.

Intern-Decision-0.8B to właściwy wybór, gdy potrzebna zdolność już istnieje, a problemem jest jej kształt. Jeśli Twoje zadanie to ograniczona decyzja z zamkniętym zbiorem odpowiedzi — przekieruj to zgłoszenie, oceń to roszczenie, sklasyfikuj ten rekord względem rubryki — to model generatywny jest niezręcznym sposobem uzyskania etykiety, a model bazowy nie jest sposobem, by uzyskać ją w ogóle. Chcesz czegoś, co zwraca rozkład, podaje swoją pewność i robi to za każdym razem w tych samych 34 milisekundach. Zmierzona latencja InternLM na pojedynczym RTX 4090 wynosi 33,98 ms średnio przy 37,50 ms dla p95, a liczby samej karty pokazują bliźniaczy model 2B na poziomie 33,28 ms średnio — co przypomina, że przy tych długościach promptu kosztem jest odczyt schematu, a nie uruchamianie wag.

Transakcja, której dokonujesz, to elastyczność w zamian za kontrakt. Model bazowy może z czasem stać się wszystkim, jeśli masz dane i moc obliczeniową. Głowica decyzyjna jest już tym, czym ma być, i nigdy nie stanie się niczym innym. Jeśli twój schemat zmienia kształt co miesiąc, to realny koszt. Jeśli nie, to wcale nie jest kosztem.

Czego nikt nie może ci powiedzieć o tabeli Intern-Decision

Każda wartość wydajności dla Intern-Decision-0.8B pochodzi od dostawcy, a zastrzeżenie jest tu poważniejsze niż zwykle, ponieważ wydanie ma tydzień i jest całkowicie nieudokumentowane. Nie ma artykułu, nie ma zbioru obejmującego trzy rozmiary, nie ma działającego repozytorium GitHub ani niezależnej ewaluacji. Wyszukiwanie w Artificial Analysis nie zwraca niczego dla tego modelu.

InternLM wybrał benchmarki, wybrał modele porównawcze — zestaw zdominowany przez modele decyzyjne, w tym Jev od TypeSafe oraz Laya i Kev od Convai — i opublikował tabelę bez wpisu o premierze.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Z tą etykietą ten kształt wciąż jest wart odczytania. Intern-Decision-0.8B notuje 97,92 / 80,56 / 52,25 w trzech podziałach Jevbench, 77,35 w Typed Decision i 94,52 w ToolACE, średnio 79,38. Jego profil kalibracji to najciekawszy wpis: Brier wynoszący 0,530 i oczekiwany błąd kalibracji na poziomie 0,066, czyli lepszy ECE niż 0,095 u Jeva mimo gorszego Briera. Mówiąc wprost, jest mniej dokładny, ale bardziej uczciwy co do tego, jak dokładny jest, a w przepływie pracy opartym na progach taka kolejność liczy się bardziej niż średnia. Kolumna, która powinna wstrzymać wdrożenie, to WildJailBreak z wynikiem 64,48 wobec 96,29 u Jeva. Tak duży deficyt odporności na odmowy jest cechą tego fine-tuningu, a to, czy należy on do modelu bazowego Qwen3.5-0.8B, celu dostrajania decyzyjnego czy liczby parametrów, nie jest nigdzie udokumentowane na karcie.

Porównanie z LFM2.5 2.6B Base na tej osi nie jest pytaniem „kto ma wyższy wynik”, ponieważ model bazowy nie ma wyników. Chodzi o to, że liczby jednego modelu nie zostały poddane audytowi, a liczby drugiego modelu nie istnieją, a czytelnik wybierający między nimi wybiera, z jakim rodzajem niewiadomej przyjdzie mu pracować.

Pipeline, który większość osób w praktyce kończy budować

Istnieje konfiguracja, która wykorzystuje oba podejścia, i warto ją nazwać, ponieważ właśnie tam trafia większość systemów produkcyjnych. Warstwa decyzyjna obsługuje zamknięte wywołania — triage, routing, ocenianie według rubryk — gdzie zbiór odpowiedzi jest znany, opóźnienie kumuluje się przy milionie rekordów, a tokeny wyjściowe są czystym narzutem. Warstwa językowa obsługuje wszystko, co wymaga prozy, syntezy lub długiego kontekstu: podsumowanie eskalacji, wyjaśnienie dołączone do etykiety, szkic, który człowiek edytuje. LFM2.5 2.6B Base to wiarygodne podłoże dla drugiej połowy, jeśli masz dane dziedzinowe warte trenowania; głowica decyzyjna to naturalna forma pierwszej.

Złożenie tych dwóch elementów to najbardziej kłopotliwa część — i właśnie tej części nie warto budować ręcznie. DSL routingu OrcaRouter wyraża routing jako kod — YAML z warunkami CEL, wdrażany bez ponownego wdrażania — więc pipeline, który kieruje jedną klasę żądań do punktu końcowego decyzyjnego, a inną do modelu językowego, jest regułą routingu, a nie balancerem obciążenia, który sam utrzymujesz. Bramka obejmuje ponad 200 modeli za jednym kluczem zgodnym z OpenAI, z ceną katalogową dostawcy przekazywaną bez marży, i nie dolicza marży do wybranego przez ciebie modelu. Żeby było jasne, gdzie przebiega granica: ani Intern-Decision-0.8B, ani LFM2.5 2.6B Base nie są nasze — oba to checkpointy, które pobierasz i uruchamiasz lokalnie, i w obu przypadkach właśnie o to chodzi, bo powód, dla którego wybiera się model o rozmiarze 2 GB, jest taki, że działa tam, gdzie już są twoje dane. Bramka służy do obsługi tej połowy stosu, do której w przeciwnym razie musiałbyś się odwoływać na zewnątrz.

Jeśli warstwa decyzyjna to element, który chcesz przetestować, nie angażując w to pełnego przebiegu treningowego, hostowany model decyzyjny będzie tańszym eksperymentem, a Jev 1.13 od TypeSafe jest tym, względem którego InternLM przeprowadził testy porównawcze — dostępny już dziś przez pojedynczy endpoint zgodny z OpenAI w cenie 0,042 USD za milion tokenów wejściowych, przy zerowym koszcie tokenów wyjściowych.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Więc który?

Wybierz LFM2.5 2.6B Base, jeśli dana zdolność jeszcze nie istnieje, a ty masz zarówno dane dziedzinowe, jak i apetyt na przeprowadzenie dostrajania, i sprawdź próg przychodu w wysokości 10 mln USD w LFM Open License, zanim zaczniesz na nim budować komercyjnie. Wybierz Intern-Decision-0.8B, jeśli ta zdolność istnieje, odpowiedzi są już wyliczalne w twoim prompcie, a potrzebujesz szybkiego, deterministycznego, czystego licencyjnie sposobu uzyskania etykiety — przyjmując, że brakuje jego dokumentacji, jego benchmarki nie zostały poddane audytowi, a jego zachowanie polegające na odmowie wobec danych wejściowych o charakterze adwersaryjnym nie zostało przetestowane przez nikogo spoza laboratorium, które go dostroiło. Druga opcja to krótsza ścieżka i większa niewiadoma. Pierwsza to dłuższa ścieżka i ta lepiej udokumentowana, a żaden z tych faktów nie jest równoznaczny z tym, że jest lepsza.