
Decision 3.0 vs Intern-Decision-4B: Dwa zespoły dostroiły ten sam model i nie zgadzały się we wszystkim innym
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów · 71 tok/s
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Umieść d3-mini, 4-miliardowego członka rodziny Decision 3.0, obok Intern-Decision-4B i pierwszą rzeczą, jaką zauważysz, nie jest różnica. Oba są dostrojeniami tego samego bazowego checkpointu, Qwen3.5-4B. Oba mają podane 4,54 miliarda parametrów. Oba przyjmują stan, schemat nazwanych pytań i zbiór odpowiedzi kandydujących, i zwracają skalibrowane prawdopodobieństwo dla każdego kandydata, nie generując ani jednego tokenu. Oba są na licencji Apache-2.0. Oba wydano bez zapowiedzi — InternLM wgrał trzy checkpointy w ciągu czterdziestu sekund 26 września 2026 r., a rodzina Decision 3.0 od vLLM-SR trafiła na Hugging Face 10 października 2026 r., a wiadomość przekazało wyłącznie konto X projektu vLLM.
Wszystko po tym jest sporem. Spierają się o to, jak odczytać prawdopodobieństwo z modelu, czy wideo liczy się jako dane wejściowe, jak długie może być żądanie, i — najostrzej — o to, czy zespół jest gotów opublikować liczbę, która mówi, że jego własna pewność jest godna zaufania. Ten tekst dotyczy tych czterech sporów i tego, co każdy z nich cię kosztuje, a nie tego, który model jest „lepszy”, ponieważ tych dwóch nie mierzy się w tej samej skali i nie można ich uszeregować względem siebie bez wykonania pracy, której nie wykonał żaden z dostawców.
Zbieg okoliczności, który warto zrozumieć w pierwszej kolejności
Dwie laboratoria wybierające ten sam backbone 4B w ciągu dwóch tygodni nie jest całkowicie zaskakujące — Qwen3.5-4B to rozsądna baza dla modelu generującego ustrukturyzowane dane wyjściowe, a oba zespoły wyraźnie po nią sięgnęły, ponieważ jest wystarczająco mała, by działać tanio, i wystarczająco mocna, by rozumieć instrukcje. Zaskakujące jest to, że doszły do tej samej liczby parametrów z dokładnością do czterech cyfr znaczących. To mówi, że dostrajanie zachowało architekturę i że żadne z nich nie dodało osobnej wieży wizyjnej wystarczająco dużej, by zmienić sumę. Oba wbudowują swoje możliwości multimodalne w te same wagi.
Najciekawsza część to odczyt. Oba modele odpowiadają na pytania zasadniczo w ten sam sposób — oceniają potencjalne odpowiedzi, zamiast je generować — a pod względem mechanizmu całkowicie się różnią:
• Intern-Decision-4B — mapuje każdą opcję na pojedynczy symbol tokenu (A–Z, potem a–z, potem 0–9), renderuje szkielet JSON w prompcie z symbolem zastępczym dla każdego pola i wykonuje jedno przyczynowe przejście w przód, odczytując logity na pozycji bezpośrednio przed każdym symbolem zastępczym. Mechanizm jest udokumentowany krok po kroku na jego karcie modelu, w tym dokładny krok softmax i temperatury.
• d3-mini — dostarcza niestandardową architekturę w modeling_d3.py z osobną głową odczytu w osobnym pliku readout.safetensors, decision_config.json deklarujący noncausal_full_attention i pooling ostatniego tokena, oraz mapowanie tokenów na kody zdefiniowane w konfiguracji, a nie opisane prozą.
Żadne z podejść nie jest oczywiście lepsze. Podejście InternLM ma tę zaletę, że działa na standardowej klasie modelu Hugging Face z udokumentowaną sekwencją numeryczną — możesz sprawdzić jego działanie. Podejście vLLM-SR ma tę zaletę, że odczyt to wytrenowana głowa, a nie projekcja istniejącego osadzenia tokenu, co jest swobodniejszym dopasowaniem, a kosztem jest to, że musisz trust_remote_code=True i uruchomić ich kod, żeby w ogóle cokolwiek zrobić.
Limity, które każdy z nich publikuje
To tutaj zaczyna kształtować się prawdziwa preferencja, ponieważ jedna karta znacznie dokładniej niż druga określa, gdzie przestaje działać.
• Limit danych wejściowych — Intern-Decision-4B: domyślnie 8 192 tokeny, a żądania przekraczające ten limit są odrzucane od razu, nigdy nie są obcinane; limit wyznacza argument konstruktora. d3-mini: max_length ma wartość null w dostarczanej konfiguracji i nigdzie na karcie nie pojawia się żaden budżet tokenów.
• Pytania na żądanie — Intern-Decision-4B: od 1 do 16, z podanym maksimum 62 opcji w pojedynczym pytaniu. d3-mini: brak podanego limitu; karta mówi tylko, że pytania są odpowiadane razem, każde z własnego przebiegu w przód.
• Obrazy — Intern-Decision-4B: do ośmiu na żądanie, uporządkowane według listy, którą podasz, a procesor checkpointów obsługuje zmianę rozmiaru i rozszerzanie tokenów. d3-mini: wiele na żądanie jako ścieżki, adresy URL, obrazy PIL lub adresy URL danych base64, każdy odczytywany przy maksymalnie 1,6 megapiksela, każde pytanie widzi każdy obraz.
• Wideo — Intern-Decision-4B: brak. d3-mini: wiele filmów, odczytywanych z prędkością 2 klatek na sekundę, z limitem 32 klatek rozłożonych na całym klipie i 0,2 megapiksela na klatkę.
Limit wejściowy to linia, która zdecyduje o tym dla większości ludzi. Budżet 8192 tokenów współdzielony między stanem, instrukcjami pytania i opisami kandydatów to realne ograniczenie dla pracy nad ocenianiem dokumentów i routingiem długiego kontekstu, do której te modele są sprzedawane, a InternLM zasługuje na uznanie za powiedzenie tego wprost, zamiast pozostawiania tego do odkrycia. To, że vLLM-SR tego nie podaje, jest przeciwieństwem: nie ukryty limit, lecz nieznany, i żadna ilość czytania repozytorium tego nie rozstrzyga.
Kalibracja to prawdziwy podział
Każdy model decyzyjny składa tę samą obietnicę: liczba, którą zwraca, jest prawdopodobieństwem, a progi ustawiane względem niej coś znaczą. Prawie żaden z nich tego nie dowodzi. To tutaj dwa wydania różnią się najbardziej, a rozbieżność biegnie w kierunku przeciwnym do tego, którego można by się domyślać na podstawie dat wydania.
Intern-Decision-4B podaje na własnej karcie wynik Brier 0,347 oraz oczekiwany błąd kalibracji 0,065 w średniej z siedmiu benchmarków, dopasowaną temperaturę 1,99241824 wyznaczoną przez minimalizację NLL przy użyciu 1 728 wyznaczonych przypadków kalibracyjnych oraz 1 693 oddzielnych przypadków walidacyjnych, jednoznaczne stwierdzenie, że etykiety zestawu testowego nie zostały wykorzystane do wyboru tej temperatury, a także diagnostykę obejmującą 96 przypadków, pokazującą, że jego kalibracja zmienia się z 0,628 Brier / 0,213 ECE przed skalowaniem temperatury do 0,550 / 0,089 po nim. Podaje również wartość domyślną i stwierdza, że kalibracja jest ustalana dla każdego punktu kontrolnego, więc użycie innego rozmiaru z tym modułem nie będzie pasować.
Decision 3.0 publikuje wskaźnik dokładności i deklarację pokrycia — na każde z 140 178 publicznych żądań odpowiedziano, żadne nie pozostało bez wsparcia — i ani jednej wartości kalibracyjnej. Żadnego wyniku Briera, żadnego ECE, żadnej podanej temperatury, na żadnym z sześciu punktów kontrolnych. Temperatura w dostarczanym wraz z d3 pliku decision_config.json wynosi 1.0, co jest przekształceniem tożsamościowym i może, ale nie musi, być wartością dopasowaną; plik tego nie mówi.
Przeczytaj oba nagłówki indeksu obok siebie, a asymetria się pogłębia. Karta d3-mini podaje wynik public-suite w Jev Decision Index 0.3 wynoszący 54,90, opisany jako zmierzony przy użyciu oficjalnego zestawu na opublikowanych wagach, podczas gdy wiersze porównawcze na tej samej tablicy są opisane jako dane tablicy na żywo. Intern-Decision-4B podaje średnią 90,02 z własnych siedmiu benchmarków. Te dwie liczby nie są w tej samej skali, nie opierają się na tych samych zadaniach, a umieszczenie ich w jednym zdaniu jako porównania byłoby nieuczciwe. Porównywalne jest ujawnienie: jedna karta mówi, jak bardzo błędne są jej wartości ufności, a druga nie wie albo nie chce powiedzieć.

Opóźnienie i dlaczego tych dwóch zestawów milisekund również nie można porównywać
Obie karty podają opóźnienie na żądanie, a przyjmowanie ich za dobrą monetę byłoby błędem z tego samego powodu, dla którego wartości dokładności nie są porównywalne.
• Intern-Decision-4B — średnia 44,16 ms, mediana 44,03 ms, p95 44,60 ms, zmierzone na pojedynczym RTX 4090 przez lokalną ścieżkę Hugging Face, opisywane jako zależne od obciążenia i sprzętu.
• d3-mini — mediana 17,5 ms dla tekstu, 96,2 ms z obrazem, 371,5 ms z dziesięciosekundowym wideo, na jednym AMD Instinct MI325X, jedno żądanie naraz.
Dwie rzeczy czynią te wyniki nieporównywalnymi. Pierwszą jest sprzęt i ścieżka oprogramowania: 4090 kontra MI325X, standardowy przebieg w przód w Hugging Face kontra niestandardowa implementacja uwagi z jądrami warstw maskowanych dostępnymi przez flash-linear-attention. Drugą jest obciążenie: liczba InternLM jest opisana jako end-to-end na zapytanie przy nieokreślonej mieszance obciążeń, a liczba vLLM-SR jest rozbita według modalności wejścia, więc porównanie obejmujące wyłącznie tekst jest jedynym wierszem typu like-for-like, a i ono wykracza poza dwóch dostawców GPU.
Liczba, którą należy odczytać z obu kart, to nie ranking, lecz kształt. Model decyzyjny jest wywoływany wielokrotnie w ramach jednego przepływu pracy — rekord wsparcia może wymagać miejsca docelowego, sprawdzenia zwrotu, decyzji o eskalacji i oceny priorytetu, czyli czterech pytań, a partia 128 rekordów zamienia to w 512 decyzji. Przy takim wolumenie zarówno 17 ms, jak i 44 ms znikają w porównaniu z tym, ile kosztuje model generatywny na dalszym etapie. To na liczby zależne od modalności trzeba uważać, ponieważ żądanie dotyczące obrazu lub wideo kosztuje od pięciu do dwudziestu razy więcej niż żądanie tekstowe według własnych danych d3-mini, a jeśli twoja decyzja jest podejmowana na podstawie zrzutu ekranu, zaimportowałeś profil kosztów, którego większość wdrożeń modeli decyzyjnych nie ma.
Który tak naprawdę wybrać?
Jeśli decyzja, którą musisz podjąć, zależy od wideo, nie ma konkurencji i nie jest wymagana żadna analiza: Decision 3.0 czyta wideo, a Intern-Decision-4B nie. To jest cała odpowiedź dla wszystkiego, co obejmuje nagrania ekranu, klipy z kamery lub sekwencje klatek, i to jest luka w możliwościach, która sama w sobie uzasadnia istnienie nowszej rodziny.
Jeśli Twoje dane wejściowe to tekst i sporadyczne obrazy, wybór zależy od dwóch rzeczy i żadna z nich nie jest rankingiem.
Sięgaj po Intern-Decision-4B, gdy musisz rozumować o progach. To jedyny z tych dwóch, który mówi ci, czy 0,9 oznacza dziewięć razy na dziesięć, podaje swoją temperaturę, mówi, na jakich przypadkach ta temperatura została dopasowana, i dokumentuje swoje wnioskowanie jako krótką numerowaną procedurę, którą możesz odtworzyć względem standardowej klasy modelu. Dla scorera stojącego przed zautomatyzowaną akcją właśnie ta właściwość ma znaczenie — i jest rzadsza niż punkty dokładności.
Wybierz Decision 3.0, gdy potrzebujesz zakresu lub modalności. Sześć checkpointów od 0.59B do 26.09B oznacza, że ten sam format żądania może być obsługiwany przez model brzegowy działający w 6.7 ms i przez model 27B, a rodzina współdzieli jeden interfejs, więc przechodzenie między poziomami to zmiana konfiguracji, a nie przepisywanie. Haczyk polega na tym, że ufasz nieokreślonemu budżetowi wejściowemu i niepoddanemu audytowi twierdzeniu o kalibracji, a największy model w rodzinie to ten, którego numer indeksu dostawca zmierzył na własnym stanowisku testowym.
Żaden z nich nie jest dziś bezpiecznym domyślnym wyborem. Najczęściej pobierany checkpoint d3 znajduje się na Hugging Face od około jednego dnia; Intern-Decision-4B jest dostępny od dwóch tygodni i zebrał około 3200 pobrań i 83 polubienia, co świadczy o zainteresowaniu, ale nie o ruchu produkcyjnym. Oba są wystarczająco tanie, by je przetestować, i za żadnym z nich nie stoi ewaluacja strony trzeciej. Jeśli stawiasz scorer przed czymś, co wydaje pieniądze, właściwym posunięciem jest uruchomienie obu na własnych oznaczonych przypadkach i porównanie krzywych kalibracji, a nie wierszy indeksu.

Gdzie router pasuje, szczerze mówiąc
OrcaRouter nie obsługuje żadnego z tych modeli. Checkpointy Decision 3.0 to lokalna ścieżka inferencji w Pythonie w repozytorium Hugging Face, bez opublikowanego endpointu HTTP, a Intern-Decision-4B jest dostarczany jako DecisionEngine — klasa, którą tworzysz samodzielnie. Żaden z nich nie jest czymś, co moglibyśmy dziś routować, i żadnej części tego artykułu nie należy odczytywać jako twierdzenia o dostępności.
To, co oferujemy, to hostowana część tej samej rodziny. typesafe/jev-1.13 jest w naszym katalogu i jest udostępniany przez POST /v1/systemone — ten sam kontrakt dotyczący stanu i nazwanych pytań, który implementują oba powyższe otwarte modele — w cenie $0.042 za milion tokenów wejściowych, bez opłaty za uzupełnienie, ponieważ nigdy żadnego nie generuje. Znajduje się obok ponad 200 innych modeli i to jest praktyczna kwestia dla każdego, kto porównuje te dwa modele: model oceniający jest tanią częścią pętli, a model, który podejmuje działania na podstawie decyzji, jest kosztowną częścią. Kierowanie obu przez jeden klucz, z automatycznym przełączaniem awaryjnym, gdy dostawca ma problemy, i z ceną katalogową dostawcy przekazywaną dalej przy 0% marży, oznacza, że ocena modelu decyzyjnego nie wymaga podpisania drugiej umowy ani przepisania miejsca wywołania, gdy przełączasz backendy. Jeśli jesteś w trakcie oceny — a właśnie tam są dziś oba te modele — to jest część, którą warto skonfigurować, zanim zdecydujesz się na którykolwiek z nich.

Otwarte pytanie
Te dwie karty nie zgadzają się co do tego, co autor modelu jest winien czytelnikowi, a ta niezgodność jest ciekawsza niż same modele. InternLM opublikował temperaturę i przypadki, na których ją dopasowano, a następnie opublikował diagnostykę pokazującą, jak bardzo poprawiła się kalibracja. vLLM-SR opublikował hasze plików, przypięte rewizje bazowe, podany docelowy sprzęt, deklarację pokrycia — prawdziwą pracę nad proweniencją — i ani jednej liczby kalibracyjnej.
Testem tego, które wydanie dojrzewa, nie jest to, które wygrywa ranking. Jest nim to, czy kolejny checkpoint Decision zostanie wydany z Brier score oraz czy następny upload InternLM dotrze do wideo. Jedno i drugie widać z zewnątrz, jedno i drugie łatwo sprawdzić, a ani jedno, ani drugie jeszcze nie nastąpiło.
