Wygenerowana karta tytułowa z napisem „Intern-Decision-4B vs ContextPilot-8B”, z podtytułem „jeden odrzuca długi kontekst, drugi nim zarządza”, oraz trzema plakietkami o treści „brak niezależnych ewaluacji dla żadnego z nich”, „oba wydane bez zapowiedzi” i „żaden z nich nie jest dziś dostępny w routingu”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Engineering & Research

Intern-Decision-4B vs ContextPilot-8B: Model, który kurczy kontekst, kontra model, który nim zarządza

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Wybierz swoją truciznę: internlm/Intern-Decision-4B odmawia czytania więcej niż 8 192 tokenów, a tencent/ContextPilot-8B istnieje specjalnie po to, by przetrwać konteksty rosnące bez ograniczeń. Należą do tej samej klasy rozmiarowej, oba są dostrojonymi wersjami bazowego modelu Qwe​n i oba trafiły na Hub bez ogłoszenia dostawcy i bez jakiejkolwiek niezależnej ewaluacji — ContextPilot-8B 27 sierpnia 2026 r., Intern-Decision-4B 26 września 2026 r. — i rozwiązują przeciwstawne problemy. Intern-Decision-4B to model ustrukturyzowanych decyzji o 4,5 miliarda parametrów, który wykonuje jeden przebieg w przód, odczytuje logity i zwraca skalibrowane prawdopodobieństwo dla każdego pytania, które zadałeś; nigdy nie zapisuje ani jednego tokenu. ContextPilot-8B to generator tekstu o 8,19 miliarda parametrów, wytrenowany do planowania, zapamiętywania i przenoszenia własnego kontekstu roboczego podczas długiego przebiegu agenta. Porównywanie ich to tak naprawdę nie kwestia benchmarku. To kwestia tego, którą połowę swojego problemu wolisz, żeby model połknął.

Po pierwsze, to, co ich naprawdę łączy

Żaden z tych modeli nie ma ani jednej liczby, którą zweryfikowałby ktokolwiek spoza jego własnego laboratorium. To dość nietypowe, by powiedzieć o tym na samym początku, ponieważ większość porównań na tym blogu może przynajmniej oprzeć się na niezależnym rankingu w przypadku jednej ze stron.

Intern-Decision-4B publikuje na swojej karcie pełną tabelę ewaluacyjną — średnia 90,02 z siedmiu zestawów, wynik Brier 0,347 i oczekiwany błąd kalibracji 0,065 — a wszystko to zmierzone przez InternLM w narzędziu ewaluacyjnym InternLM. ContextPilot-8B nie publikuje żadnej tabeli. W jej karcie napisano, że framework „konsekwentnie przewyższa istniejące rozwiązania bazowe w różnych modelach bazowych i benchmarkach”, i wskazano artykuł oraz pipeline ewaluacyjny, gdzie można znaleźć szczegóły. Zatem w tym zestawieniu uczciwe wskazanie źródła jest krótkie: jedna strona jest raportowana przez dostawcę i nieodtworzona, druga jest deklarowana przez dostawcę i nieopublikowana, a nic na tej stronie nie jest niezależne.

A screenshot of the tencent/ContextPilot-8B model card on Hugging Face, showing the paper, live demo, GitHub and models badges, the description of ContextPilot as a proactive context-management framework built on Qwen3-8B, the three listed components, and the loading snippet alongside the note that loading the checkpoint alone does not execute the context-management tools and that the tool definitions and agent runtime are provided separately.

Dwa zakłady, wyrażone jasno

Założeniem Intern-Decision-4B jest to, że trudną częścią decyzji nie jest rozumowanie, lecz dokonanie wyboru. Podaj mu stan, schemat nazwanych pytań i maksymalnie osiem obrazów, a zwróci rozkład prawdopodobieństwa po twoich własnych ciągach opcji. Procedura wnioskowania jest deterministyczna i ma stały kształt: zmapuj opcje na symbole pojedynczych tokenów, wyrenderuj szkielet JSON asystenta z jednym symbolem zastępczym na pole, wykonaj jeden przyczynowy przebieg w przód, odczytaj logity bezpośrednio przed każdym symbolem zastępczym, wykonaj softmax tylko po kandydatach danego pola, zastosuj dopasowaną temperaturę. Nie ma pętli dekodowania, więc nie ma parsera ani powierzchni halucynacji w swobodnym tekście. Ceną tego zakładu jest twardy limit danych wejściowych — karta mówi, że dane wejściowe powyżej DecisionEngine(max_length=8192) są „odrzucane bez obcinania”.

Zakład ContextPilot-8B jest lustrzanym odbiciem: pozwolić agentowi nadal pisać tokeny, ale nauczyć go edytowania tego, co niesie. Dodaje planowanie, ustrukturyzowaną pamięć długoterminową, wyszukiwanie i miękkie odciążanie kontekstu do zestawu narzędzi agenta, a następnie trenuje checkpoint za pomocą przepisu RL, który próbkuje gałęzie wokół decyzji o edycji kontekstu, które mają znaczenie, i przypisuje zasługę na poziomie akcji, a nie trajektorii. Karta jest szczera co do konsekwencji pakowania: wczytanie checkpointu nie daje zarządzania kontekstem. Definicje narzędzi, środowisko wykonawcze agenta i potok ewaluacji znajdują się gdzie indziej i trzeba je ze sobą zabrać.

Tablica wyników, wymiar po wymiarze

• Wyjście — Intern-Decision-4B nie emituje żadnego tekstu, tylko prawdopodobieństwa dla wartości twoich opcji; ContextPilot-8B generuje normalnie, a jego odpowiedzi to proza i wywołania narzędzi, które musisz parsować.

• Limit wejściowy — Intern-Decision-4B odrzuca wszystko powyżej 8 192 tokenów; ContextPilot-8B dziedziczy po Qwen3-8B limit pozycji wynoszący 40 960 tokenów i został zbudowany tak, aby działać dalej, gdy efektywny kontekst rośnie.

• Parametry — 4,54 mld BF16 dla Intern-Decision-4B, w obrębie wieży tekstowej, wieży wizyjnej i projektora; 8,19 mld BF16 dla ContextPilot-8B, zwykłego gęstego przyczynowego modelu językowego Qwen3.

• Opóźnienie — Intern-Decision-4B osiąga średnio 44,16 ms i 44,60 ms przy P95 na pojedynczym RTX 4090, zgodnie z jego własną kartą; ContextPilot-8B nie publikuje żadnej wartości opóźnienia, a jego koszt jest zasadniczo inny, ponieważ generuje tokeny, a nie ocenia je.

• Obrazy — Intern-Decision-4B przyjmuje do ośmiu, a tokeny obrazów wliczają się do limitu 8 192; karta ContextPilot-8B opisuje checkpoint do generowania tekstu bez ścieżki multimodalnej.

• Licencja — Intern-Decision-4B jest objęty licencją Apache-2.0, a obok zachowano licencję upstreamowego Qwen; licencja ContextPilot-8B zaczyna się od Sekcji 0: „udostępniony wyłącznie w celu prowadzenia badań naukowych i prac rozwojowych. Nie wolno używać go do żadnego innego celu”.

• Opublikowane dowody — z jednej strony tabela siedmiu zestawów z diagnostyką kalibracji; z drugiej streszczenie artykułu i odesłanie do repozytorium ewaluacyjnego.

• Dotychczasowe wyniki — oba ciche. Intern-Decision-4B ma jedno polubienie i zero pobrań od 26 września 2026 r.; ContextPilot-8B ma 11 polubień i około tysiąca pobrań od 27 sierpnia 2026 r., co wskazuje na większe zainteresowanie, ale wciąż brakuje oceny zewnętrznej.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs ContextPilot-8B'. The left column reads: Output: no text, probabilities only; Input ceiling: 8,192 tokens, rejected not truncated; Parameters: 4.54B BF16; Latency: 44.16 ms mean on one RTX 4090; Images: up to eight; License: Apache-2.0. The right column reads: Output: generated text and tool calls; Input ceiling: 40,960-token position limit; Parameters: 8.19B BF16; Latency: not published; Images: none; License: research and development only. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.

Gdzie każde z nich się psuje

Tryb awarii Intern-Decision-4B ma charakter strukturalny i warto powiedzieć o tym konkretnie. Jeśli dowody na decyzję nie mieszczą się w 8 192 tokenach, model nie degraduje się łagodnie — odrzuca żądanie. To obronny wybór inżynieryjny i fatalne niedopasowanie akurat do obciążenia, dla którego zbudowano ContextPilot-8B. Sama konfiguracja karty zaostrza napięcie: wieża tekstowa pod wrapperem deklaruje limit pozycji wynoszący 262 144 tokeny. Backbone może zaadresować ćwierć miliona tokenów, a udostępniony wrapper nie przyjmie więcej niż osiem tysięcy.

Tryb awarii ContextPilot-8B polega na tym, że nie jest to nic typu „drop-in”. To checkpoint wewnątrz frameworku, a to właśnie framework odpowiada za zachowanie. Wyciągnij wagi bez definicji narzędzi i środowiska uruchomieniowego agenta, a otrzymasz dostrojony model Qwen3-8B, którego wyróżniająca zdolność jest bezużyteczna. Dodaj do tego Sekcję 0 licencji, a praktyczna odpowiedź dla wdrożenia komercyjnego jest taka, że nie można go w ogóle używać w dostarczonej postaci — co oznacza również, że nie jest to dla nas kandydacka ścieżka, teraz ani w najbliższym czasie.

Wdrażanie każdego, jeśli zamierzałeś

Intern-Decision-4B chce małego GPU, a żadnego stosu serwującego wartego tej nazwy nie potrzebuje: zainstaluj PyTorch 2.9.1 i Transformers 5.14.1 pod Pythonem 3.12, wczytaj cztery shardy jednorazowo, utrzymuj silnik rezydentny i obliczaj wyniki. Ponieważ przejście w przód ma stały kształt, P50 i P95 różnią się od siebie o sześć dziesiątych milisekundy, więc planowanie przepustowości dotyczy współbieżności, a nie opóźnienia ogonowego. Kłopot w tym, że jest dostarczany jako importowalna klasa Pythona, a nie usługa HTTP, więc aby postawić go przed produkcyjnym wywołującym, musisz samodzielnie go opakować.

ContextPilot-8B wymaga przeciwnego podejścia: rzeczywistej ścieżki serwowania, modułu wykonawczego narzędzi, magazynów pamięci oraz środowiska rollout z możliwością rozgałęziania, jeśli kiedykolwiek zamierzasz go ponownie trenować lub oceniać zgodnie z projektem. To nie jest model, który testuje się w jedno popołudnie; to framework badawczy, który przyjmujesz.

Czy router tu pomoże?

Częściowo, a uczciwa wersja jest węższa niż zwykle. OrcaRouter nie wymienia Intern-Decision-4B, ContextPilot-8B ani żadnego porównywalnego checkpointu do oceniania decyzji w swoim katalogu — nasze strony modeli zwracają 404 dla obu, a nic w tym tekście nie powinno być odczytywane jako twierdzenie o dostępności. To, co ujednolicony endpoint rzeczywiście daje, to możliwość objęcia nieudanego eksperymentu mechanizmem zapasowym: jeden klucz do ponad 200 modeli, cena katalogowa dostawcy przekazywana z 0% marży oraz automatyczne przełączanie awaryjne, dzięki któremu scorer, którego wciąż oceniasz, nigdy nie staje się pojedynczym punktem awarii. To realna korzyść po stronie Intern-Decision w tym porównaniu, gdzie model faktycznie działa tanio i lokalnie. W przypadku ContextPilot-8B nie ma to znaczenia, ponieważ licencja wyłącznie do badań i rozwoju wyklucza komercyjną ścieżkę niezależnie od tego, co obsługuje jakikolwiek router.

Więc który?

Jeśli Twoje pytanie ma zamknięty zbiór odpowiedzi, przychodzi z dołączonymi dowodami i potrzebuje prawdopodobieństwa, a nie wyjaśnienia, Intern-Decision-4B jest ciekawszym obiektem — tani, o stałym kształcie, kalibrowany przez konstrukcję i uczciwy co do danych wejściowych, których nie zaakceptuje. Jeśli Twój problem polega na tym, że dowody nie przestają napływać, żaden ewaluator decyzji Ci nie pomoże, a ContextPilot-8B jest wycelowany we właściwy cel, z zastrzeżeniem, że przyjmujesz framework i licencję badawczą, a nie model.

Rozstrzygnąłby to test, którego nie przeprowadził żaden z dostawców: podać obu to samo krótkie, ustrukturyzowane zadanie decyzyjne, którego odpowiedź da się obliczyć na podstawie stanu, i sprawdzić, czy średnia 90,02 oceniającego utrzyma się poza jego własnym środowiskiem testowym. Dopóki ktoś tego nie zrobi, właściwym odczytem tego starcia jest to, że oba modele wcale nie konkurują o to samo miejsce.

A generated two-bet card titled 'Same size class, opposite bets'. The left card, 'Intern-Decision-4B — shrink the answer', lists: input ceiling 8,192 tokens, rejected not truncated; output probabilities over your option values; one forward pass, 44.16 ms mean on one RTX 4090; no text, so nothing to parse. The right card, 'ContextPilot-8B — manage the growing context', lists: inherits Qwen3-8B's 40,960-token position limit; generates text and tool calls; context planned, remembered and offloaded during the run; needs the tool definitions and agent runtime to work at all. A footer reads 'Intern-Decision figures per InternLM's model card; ContextPilot card publishes no benchmark table. Neither has been independently evaluated.' The OrcaRouter logo is composited in the bottom-right corner.