
Intern-Decision-4B vs ContextPilot-8B: Model, który kurczy kontekst, kontra model, który nim zarządza
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 592 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 187 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Wybierz swoją truciznę: internlm/Intern-Decision-4B odmawia czytania więcej niż 8 192 tokenów, a tencent/ContextPilot-8B istnieje specjalnie po to, by przetrwać konteksty rosnące bez ograniczeń. Należą do tej samej klasy rozmiarowej, oba są dostrojonymi wersjami bazowego modelu Qwen i oba trafiły na Hub bez ogłoszenia dostawcy i bez jakiejkolwiek niezależnej ewaluacji — ContextPilot-8B 27 sierpnia 2026 r., Intern-Decision-4B 26 września 2026 r. — i rozwiązują przeciwstawne problemy. Intern-Decision-4B to model ustrukturyzowanych decyzji o 4,5 miliarda parametrów, który wykonuje jeden przebieg w przód, odczytuje logity i zwraca skalibrowane prawdopodobieństwo dla każdego pytania, które zadałeś; nigdy nie zapisuje ani jednego tokenu. ContextPilot-8B to generator tekstu o 8,19 miliarda parametrów, wytrenowany do planowania, zapamiętywania i przenoszenia własnego kontekstu roboczego podczas długiego przebiegu agenta. Porównywanie ich to tak naprawdę nie kwestia benchmarku. To kwestia tego, którą połowę swojego problemu wolisz, żeby model połknął.
Po pierwsze, to, co ich naprawdę łączy
Żaden z tych modeli nie ma ani jednej liczby, którą zweryfikowałby ktokolwiek spoza jego własnego laboratorium. To dość nietypowe, by powiedzieć o tym na samym początku, ponieważ większość porównań na tym blogu może przynajmniej oprzeć się na niezależnym rankingu w przypadku jednej ze stron.
Intern-Decision-4B publikuje na swojej karcie pełną tabelę ewaluacyjną — średnia 90,02 z siedmiu zestawów, wynik Brier 0,347 i oczekiwany błąd kalibracji 0,065 — a wszystko to zmierzone przez InternLM w narzędziu ewaluacyjnym InternLM. ContextPilot-8B nie publikuje żadnej tabeli. W jej karcie napisano, że framework „konsekwentnie przewyższa istniejące rozwiązania bazowe w różnych modelach bazowych i benchmarkach”, i wskazano artykuł oraz pipeline ewaluacyjny, gdzie można znaleźć szczegóły. Zatem w tym zestawieniu uczciwe wskazanie źródła jest krótkie: jedna strona jest raportowana przez dostawcę i nieodtworzona, druga jest deklarowana przez dostawcę i nieopublikowana, a nic na tej stronie nie jest niezależne.

Dwa zakłady, wyrażone jasno
Założeniem Intern-Decision-4B jest to, że trudną częścią decyzji nie jest rozumowanie, lecz dokonanie wyboru. Podaj mu stan, schemat nazwanych pytań i maksymalnie osiem obrazów, a zwróci rozkład prawdopodobieństwa po twoich własnych ciągach opcji. Procedura wnioskowania jest deterministyczna i ma stały kształt: zmapuj opcje na symbole pojedynczych tokenów, wyrenderuj szkielet JSON asystenta z jednym symbolem zastępczym na pole, wykonaj jeden przyczynowy przebieg w przód, odczytaj logity bezpośrednio przed każdym symbolem zastępczym, wykonaj softmax tylko po kandydatach danego pola, zastosuj dopasowaną temperaturę. Nie ma pętli dekodowania, więc nie ma parsera ani powierzchni halucynacji w swobodnym tekście. Ceną tego zakładu jest twardy limit danych wejściowych — karta mówi, że dane wejściowe powyżej DecisionEngine(max_length=8192) są „odrzucane bez obcinania”.
Zakład ContextPilot-8B jest lustrzanym odbiciem: pozwolić agentowi nadal pisać tokeny, ale nauczyć go edytowania tego, co niesie. Dodaje planowanie, ustrukturyzowaną pamięć długoterminową, wyszukiwanie i miękkie odciążanie kontekstu do zestawu narzędzi agenta, a następnie trenuje checkpoint za pomocą przepisu RL, który próbkuje gałęzie wokół decyzji o edycji kontekstu, które mają znaczenie, i przypisuje zasługę na poziomie akcji, a nie trajektorii. Karta jest szczera co do konsekwencji pakowania: wczytanie checkpointu nie daje zarządzania kontekstem. Definicje narzędzi, środowisko wykonawcze agenta i potok ewaluacji znajdują się gdzie indziej i trzeba je ze sobą zabrać.
Tablica wyników, wymiar po wymiarze
• Wyjście — Intern-Decision-4B nie emituje żadnego tekstu, tylko prawdopodobieństwa dla wartości twoich opcji; ContextPilot-8B generuje normalnie, a jego odpowiedzi to proza i wywołania narzędzi, które musisz parsować.
• Limit wejściowy — Intern-Decision-4B odrzuca wszystko powyżej 8 192 tokenów; ContextPilot-8B dziedziczy po Qwen3-8B limit pozycji wynoszący 40 960 tokenów i został zbudowany tak, aby działać dalej, gdy efektywny kontekst rośnie.
• Parametry — 4,54 mld BF16 dla Intern-Decision-4B, w obrębie wieży tekstowej, wieży wizyjnej i projektora; 8,19 mld BF16 dla ContextPilot-8B, zwykłego gęstego przyczynowego modelu językowego Qwen3.
• Opóźnienie — Intern-Decision-4B osiąga średnio 44,16 ms i 44,60 ms przy P95 na pojedynczym RTX 4090, zgodnie z jego własną kartą; ContextPilot-8B nie publikuje żadnej wartości opóźnienia, a jego koszt jest zasadniczo inny, ponieważ generuje tokeny, a nie ocenia je.
• Obrazy — Intern-Decision-4B przyjmuje do ośmiu, a tokeny obrazów wliczają się do limitu 8 192; karta ContextPilot-8B opisuje checkpoint do generowania tekstu bez ścieżki multimodalnej.
• Licencja — Intern-Decision-4B jest objęty licencją Apache-2.0, a obok zachowano licencję upstreamowego Qwen; licencja ContextPilot-8B zaczyna się od Sekcji 0: „udostępniony wyłącznie w celu prowadzenia badań naukowych i prac rozwojowych. Nie wolno używać go do żadnego innego celu”.
• Opublikowane dowody — z jednej strony tabela siedmiu zestawów z diagnostyką kalibracji; z drugiej streszczenie artykułu i odesłanie do repozytorium ewaluacyjnego.
• Dotychczasowe wyniki — oba ciche. Intern-Decision-4B ma jedno polubienie i zero pobrań od 26 września 2026 r.; ContextPilot-8B ma 11 polubień i około tysiąca pobrań od 27 sierpnia 2026 r., co wskazuje na większe zainteresowanie, ale wciąż brakuje oceny zewnętrznej.

Gdzie każde z nich się psuje
Tryb awarii Intern-Decision-4B ma charakter strukturalny i warto powiedzieć o tym konkretnie. Jeśli dowody na decyzję nie mieszczą się w 8 192 tokenach, model nie degraduje się łagodnie — odrzuca żądanie. To obronny wybór inżynieryjny i fatalne niedopasowanie akurat do obciążenia, dla którego zbudowano ContextPilot-8B. Sama konfiguracja karty zaostrza napięcie: wieża tekstowa pod wrapperem deklaruje limit pozycji wynoszący 262 144 tokeny. Backbone może zaadresować ćwierć miliona tokenów, a udostępniony wrapper nie przyjmie więcej niż osiem tysięcy.
Tryb awarii ContextPilot-8B polega na tym, że nie jest to nic typu „drop-in”. To checkpoint wewnątrz frameworku, a to właśnie framework odpowiada za zachowanie. Wyciągnij wagi bez definicji narzędzi i środowiska uruchomieniowego agenta, a otrzymasz dostrojony model Qwen3-8B, którego wyróżniająca zdolność jest bezużyteczna. Dodaj do tego Sekcję 0 licencji, a praktyczna odpowiedź dla wdrożenia komercyjnego jest taka, że nie można go w ogóle używać w dostarczonej postaci — co oznacza również, że nie jest to dla nas kandydacka ścieżka, teraz ani w najbliższym czasie.
Wdrażanie każdego, jeśli zamierzałeś
Intern-Decision-4B chce małego GPU, a żadnego stosu serwującego wartego tej nazwy nie potrzebuje: zainstaluj PyTorch 2.9.1 i Transformers 5.14.1 pod Pythonem 3.12, wczytaj cztery shardy jednorazowo, utrzymuj silnik rezydentny i obliczaj wyniki. Ponieważ przejście w przód ma stały kształt, P50 i P95 różnią się od siebie o sześć dziesiątych milisekundy, więc planowanie przepustowości dotyczy współbieżności, a nie opóźnienia ogonowego. Kłopot w tym, że jest dostarczany jako importowalna klasa Pythona, a nie usługa HTTP, więc aby postawić go przed produkcyjnym wywołującym, musisz samodzielnie go opakować.
ContextPilot-8B wymaga przeciwnego podejścia: rzeczywistej ścieżki serwowania, modułu wykonawczego narzędzi, magazynów pamięci oraz środowiska rollout z możliwością rozgałęziania, jeśli kiedykolwiek zamierzasz go ponownie trenować lub oceniać zgodnie z projektem. To nie jest model, który testuje się w jedno popołudnie; to framework badawczy, który przyjmujesz.
Czy router tu pomoże?
Częściowo, a uczciwa wersja jest węższa niż zwykle. OrcaRouter nie wymienia Intern-Decision-4B, ContextPilot-8B ani żadnego porównywalnego checkpointu do oceniania decyzji w swoim katalogu — nasze strony modeli zwracają 404 dla obu, a nic w tym tekście nie powinno być odczytywane jako twierdzenie o dostępności. To, co ujednolicony endpoint rzeczywiście daje, to możliwość objęcia nieudanego eksperymentu mechanizmem zapasowym: jeden klucz do ponad 200 modeli, cena katalogowa dostawcy przekazywana z 0% marży oraz automatyczne przełączanie awaryjne, dzięki któremu scorer, którego wciąż oceniasz, nigdy nie staje się pojedynczym punktem awarii. To realna korzyść po stronie Intern-Decision w tym porównaniu, gdzie model faktycznie działa tanio i lokalnie. W przypadku ContextPilot-8B nie ma to znaczenia, ponieważ licencja wyłącznie do badań i rozwoju wyklucza komercyjną ścieżkę niezależnie od tego, co obsługuje jakikolwiek router.
Więc który?
Jeśli Twoje pytanie ma zamknięty zbiór odpowiedzi, przychodzi z dołączonymi dowodami i potrzebuje prawdopodobieństwa, a nie wyjaśnienia, Intern-Decision-4B jest ciekawszym obiektem — tani, o stałym kształcie, kalibrowany przez konstrukcję i uczciwy co do danych wejściowych, których nie zaakceptuje. Jeśli Twój problem polega na tym, że dowody nie przestają napływać, żaden ewaluator decyzji Ci nie pomoże, a ContextPilot-8B jest wycelowany we właściwy cel, z zastrzeżeniem, że przyjmujesz framework i licencję badawczą, a nie model.
Rozstrzygnąłby to test, którego nie przeprowadził żaden z dostawców: podać obu to samo krótkie, ustrukturyzowane zadanie decyzyjne, którego odpowiedź da się obliczyć na podstawie stanu, i sprawdzić, czy średnia 90,02 oceniającego utrzyma się poza jego własnym środowiskiem testowym. Dopóki ktoś tego nie zrobi, właściwym odczytem tego starcia jest to, że oba modele wcale nie konkurują o to samo miejsce.

