
RSI-Jev vs Jev 1.13: jeden pobierasz, drugi wywołujesz
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Postaw RSI-Jev v6.1-VL 4B i Jev 1.13 obok siebie, a pierwszą rzeczą, którą zauważy wywołujący, jest to, że to to samo żądanie. Przekaż któremukolwiek z nich stan i zestaw pytań o określonych typach — tak/nie, wybór jednej z k, ocena według rubryki — a oba zwrócą skalibrowane prawdopodobieństwo dla każdej opcji, w jednym przebiegu w przód, bez wygenerowanego tekstu do parsowania. To nie przypadek: RSI-Jev został zbudowany tak, by celowo mówić w formacie transmisji Jev, więc klient napisany pod API TypeSafe będzie z nim działać po zmianie bazowego adresu URL. To, co nie jest takie samo, to wszystko wokół wywołania. Jev 1.13 to zamknięty komercyjny model TypeSafe, udostępniany z punktu końcowego, którego użycie rozliczasz; RSI-Jev v6.1-VL to checkpoint o 4,69 mld parametrów z wagami na licencji Apache-2.0, który pobierasz i hostujesz na własnym sprzęcie. Żaden z nich nie jest rebrandingiem drugiego, żaden dostawca nie popiera drugiego, a niemal każda liczba w tym porównaniu pochodzi od strony, która ją wytworzyła.
Data w temacie ma znaczenie, ponieważ ten projekt wydaje wydanie mniej więcej codziennie. RSI-Jev v6.1-VL 4B został opublikowany 2026-10-07 przez zewnętrzny Shanghua-Gao/RSI-Jev projekt — samodoskonalącą się pętlę badawczą, która trenuje modele decyzyjne w stylu Jev i publikuje każde ramię, które poniosło porażkę, wraz z tymi, które wygrały. To ósme wydanie w ciągu trzynastu dni na tej linii, a jest to średnia ważona poprzedniego wydania z drugim dostrojeniem tego samego Qwen3.5-4B-Base. Jev 1.13 to model TypeSafe AI, uruchomiony 2026-09-15 i obecny w naszym własnym katalogu od 2026-09-24. Obie daty mają znaczenie poniżej, ponieważ porównanie z projektem, który zmienia się codziennie, ma termin przydatności mierzony w dniach.
Czym tak naprawdę są te dwie rzeczy — każda w jednej linijce
Jev 1.13 to hostowany model decyzyjny za dedykowanym punktem końcowym — POST /v1/systemone, niestrumieniowy, z budżetem wejściowym wynoszącym około 64 000 tokenów obejmującym stan i wszystkie Twoje pytania razem, w cenie $0.042 za milion tokenów wejściowych, przy czym wyjście jest rozliczane jako zero, ponieważ nie ma tokenów wyjściowych. Jego architektura, liczba parametrów i moc obliczeniowa treningu nie są ujawnione; TypeSafe powiedział, że szczegóły są trzymane w tajemnicy i być może pojawi się publikacja. Nie uruchamiasz go. Wywołujesz go, a każde wywołanie to rozliczane żądanie sieciowe.
RSI-Jev v6.1-VL to inne rozwiązanie w pełnej postaci. Jest to wieża Qwen3.5-4B-Base dostrojona od końca do końca, z głowicami decyzyjnymi w warstwach 16, 20 i 32, obsługiwana z checkpointu, który jest samowystarczalny i ma 9,7 GB w bf16. Liczba parametrów wynosi 4,69 mld i warto wiedzieć, jak się rozkładają: 3,57 mld w 32 warstwach dekodera, 0,64 mld w embeddingach tokenów, 0,33 mld w wieży wizyjnej, 0,05 mld w głównej głowicy decyzyjnej i 0,10 mld w dwóch głowicach wczesnego wyjścia. Nie ma tu mieszanki ekspertów ani drugiego modelu. Instalujesz go poleceniem pip z repozytorium, uruchamiasz jego serwer i od tego momentu decyzja nigdy nie opuszcza twojej infrastruktury.
• Kto tym zarządza — rozliczany hostowany endpoint, którego nie kontrolujesz, kontra 9,7 GB checkpoint na własnym GPU, Apple Silicon lub CPU.
• Kształt ceny — 0,042 USD za milion tokenów wejściowych, wyjście bezpłatne, płatność za wywołanie vs zero na marginesie plus koszt maszyny i operacji.
• Budżet wejściowy — około 64 000 tokenów na żądanie w modelu hostowanym w porównaniu z 32 768 tokenami tekstowymi plus budżet obrazu na punkcie kontrolnym; wszystko dłuższe jest odrzucane, a nie obcinane.
• Wagi i licencja — zamknięte, nieujawniony rozmiar vs wagi Apache-2.0, kod MIT, 4,69 mld parametrów.
• Modalność — tekst dla kontraktu Jev'a w porównaniu z tekstem oraz maksymalnie czterema obrazami na żądanie w wydaniach RSI-Jev vision.
• Własność — komercyjny model TypeSafe AI kontra projekt badawczy strony trzeciej, który w samej linii licencyjnej stwierdza, że „nie jest powiązany z TypeSafe AI”.
Wynik na własnej tablicy RSI-Jeva i dlaczego to tylko połowa porównania
Liczba, którą projekt wysuwa na pierwszy plan, to jego wynik Decision Index 0.3: 50,98 dla v6.1-VL 4B, wzrost z 46,23 w przypadku poprzedniego wydania. To pełny przebieg domyślnej konfiguracji — 140 178 żądań, pokrycie 1,0 — a na własnej publicznej tablicy projektu, z datą 2026-10-06, remisuje z najlepszym modelem 4B na tej tablicy (50,98 przeciwko 50,82 ezjev 4B s2, co zestaw uznaje za remis przy 0,25) i zajmuje 27. miejsce na 113 ogółem. Na starszym Decision Index 0.2.1 wynosi 50,74 wobec 46,24 dla v6.0-VL. Jego zestaw piętnastu benchmarków, raportowany bez open_jev_ood zadania, o którym stwierdzono, że pokrywa się z wierszami treningowymi, wynosi 0,793, a jego zbiór odłożony to 0,729.
Każda z tych wartości pochodzi od samego RSI-Jev i została zmierzona na jego własnym stanowisku testowym. Decision Index to publiczna tablica benchmarkowa, ale nie ma na niej odczytu dla Jev 1.13, ponieważ zestaw testów projektu zbudowano do oceniania otwartych punktów kontrolnych decyzji, a Jev jest zamkniętym punktem końcowym. Zatem pokusa, by zestawić 50,98 z 0,727 Jev w benchmarku decyzji typowanych i ogłosić zwycięzcę, jest dokładnie błędem, którego należy unikać: te dwie liczby pochodzą z różnych stanowisk testowych, różnych liczebności prób i różnych danych, a nikt nie uruchomił jednego stanowiska testowego na obu modelach.

Jedyne istniejące bezpośrednie porównanie należy do Laya, a nie do RSI-Jev.
Istnieje jedno opublikowane porównanie, które rzeczywiście stawia liczbę Jev obok otwartego checkpointu, i nie zostało ono przeprowadzone przez żadną ze stron tutaj. Convai Innovations, twórcy modelu decyzyjnego Laya, zestawili w tabeli opublikowane wyniki TypeSafe dla Jev 1.13.0 z własnymi i sami zaznaczyli ograniczenia: liczby Jev pochodzą z publikacji strony trzeciej i nigdy nie były mierzone przez Convai, rozmiary próbek i prompty się różnią, a dostawca nie podaje własnych benchmarków dla tego modelu. Ta tabela jest warta przeczytania dla kalibracji, a nie dla werdyktu — i w ogóle nie obejmuje RSI-Jev, ponieważ RSI-Jev nie istniał, gdy ją opublikowano.
To, co rzeczywiście pokazuje, to kształt pytania o wybór między hostowanym a otwartym, które czytelnik faktycznie rozważa. Model hostowany prowadzi tam, gdzie przestrzeń opcji jest duża, a model musi utrzymać stabilny szeroki zestaw odpowiedzi; modele otwarte wygrywają pod względem surowego opóźnienia na wywołanie, ponieważ w ścieżce nie ma sieci. Nic w tym wzorcu nie mówi ci, który z tych dwóch konkretnych modeli jest lepszy w twoim zadaniu, a uczciwe stanowisko jest takie, że odpowiedź jeszcze nie istnieje publicznie.
Co daje checkpoint, czego nie może dać endpoint
Najmocniejszym argumentem za RSI-Jev nie jest wynik. Jest nim to, że wagi leżą na twoim dysku. W przypadku decyzji o routingu podejmowanej na podstawie dokumentacji medycznej, dokumentu prawnego lub historii konta klienta „dane nigdy nie opuszczają budynku” nie jest preferencją, którą wymienia się na punkt benchmarkowy — to twardy wymóg, a żaden hostowany endpoint za żadną cenę go nie spełnia. Ta sama właściwość znosi limit częstotliwości: własna dokumentacja dostawcy hostowanego modelu wskazuje, że jego limity są dostosowywane dynamicznie i mogą zmieniać się bez powiadomienia, a samodzielnie hostowany checkpoint nie ma takiego pułapu poza twoim sprzętem.
Drugą rzeczą, którą daje ten checkpoint, jest kontrola głębokości — i jest to nietypowe. Ponieważ głowy decyzyjne znajdują się na trzech głębokościach, ustawienie wysiłku wybiera, ile warstw może wykorzystać żądanie: niski zatrzymuje się na warstwie 16 przy medianie około 23 ms, średni na 20 przy 27 ms, wysoki na 32 przy około 40 ms, a auto odpowiada przy pierwszym wystarczająco pewnym wyjściu, średnio 19,5 z 32 warstw w zestawie testowym projektu. Te opóźnienia to własne liczby projektu zmierzone na jednym H200 w bf16 i nie należy ich łączyć z żadnymi hostowanymi wynikami — lokalne przejście w przód i rozliczane wywołanie API to nie ten sam pomiar, a dokumentacja RSI-Jev wprost stwierdza, że jej wcześniejsze porównanie z opublikowanym opóźnieniem Jev przeciwstawiało lokalną pracę GPU rundzie sieciowej.
Trzecią rzeczą są obrazy. Kontrakt Jeva to tekst na wejściu, ustrukturyzowany JSON na wyjściu. Wydania RSI-Jev vision przyjmują od jednego do czterech obrazów na żądanie jako adresy URL danych base64, przy czym stan odwołuje się do każdego z nich za pomocą znacznika, a v6.1-VL uzyskuje wynik 0,834 na wydzielonym zbiorze obrazów projektu. Jeśli twoja decyzja brzmi „czy zdjęcie pokazuje widoczne uszkodzenie”, to jest to możliwość, której hostowany kontrakt w ogóle nie oferuje.
To, z czego rezygnujesz, też jest realne, a projekt to publikuje. Kalibracja w tym wydaniu się pogorszyła, a nie poprawiła: końcowy oczekiwany błąd kalibracji wynosi 0,048 na warstwie 32 i 0,055 w trybie auto, wobec 0,036 i 0,024 w poprzednim wydaniu. Domyślny pojedynczy próg 0,95 jest dostarczany jako jawnie niepotwierdzony — to rozwiązanie zapasowe reguły wyboru, której własny wybór, 0,85, nie dotrzymał limitu głębokości projektu w przypadku połowy danych deweloperskich. Wczesne wyjścia czytają tylko tekst, więc każde pytanie z obrazem przechodzi przez wszystkie 32 warstwy niezależnie od wysiłku. A pięć źródeł danych treningowych dla obrazów ma charakter niekomercyjny lub wyłącznie badawczy, przy czym projekt wprost stwierdza, że nie jest rozstrzygnięte, czy wagi wytrenowane na danych niekomercyjnych dziedziczą te warunki.
Gdzie wywoływać wersję hostowaną, a gdzie nie
To jest ta część porównania, w której mamy udział, więc warto być precyzyjnym. Obsługujemy komercyjny model TypeSafe jako typesafe/jev-1.13na dedykowanym punkcie końcowym systemone — POST do /v1/systemone, a nie w formacie OpenAI chat-completions, bez strumieniowania, w kontekście 65 536 tokenów wymienionym w naszym katalogu. To ten sam kształt żądania i odpowiedzi, który implementuje RSI-Jev, pochodzący z modelu, którego kontrakt projekt kopiuje. Samego RSI-Jev nie hostujemy; w naszym katalogu nie ma identyfikatora rsi-jev ani shgao, a czytelnik, który chce ten model, pobiera go.
Powód, dla którego to rozróżnienie ma tu znaczenie, jest wąski i konkretny. Warstwa decyzyjna rzadko stanowi całość przepływu pracy — zwykle sąsiaduje z modelem generatywnym, który pisze odpowiedź, podsumowanie lub kod. Historycznie oznaczało to dwie umowy. W przypadku części hostowanej nie musi już tak być: Jev 1.13 działa na tym samym kluczu co ponad 200 innych modeli w cenniku dostawcy przekazywanym dalej z 0% marży, więc jeśli TypeSafe zmieni stawkę, zmiana jest aktywna po naszej stronie tego samego dnia, a nie dopiero w kolejnym cyklu rozliczeniowym. Samodzielnie hostowana część nigdy nie miała tego problemu, bo to Ty jesteś dostawcą. Najczystszym sposobem rozstrzygnięcia między nimi jest najpierw wypróbowanie komercyjnej umowy na kilku własnych, oznaczonych przypadkach, sprawdzenie, czy zachowanie od razu po uruchomieniu jest wystarczająco dobre, by na jego podstawie automatyzować, a dopiero potem ustalenie, czy samodzielne uruchamianie checkpointu 4,69B jest warte zachodu operacyjnego.

Który właściwie powinieneś wybrać
Wybierz RSI-Jev v6.1-VL 4B, jeśli decyzja ma pozostać w Twoim perymetrze, jeśli potrzebujesz decyzji zarówno dla obrazu, jak i tekstu, jeśli Twoje zestawy opcji sięgają setek (checkpoint dopuszcza do 5120 opcji na pytanie) albo jeśli chcesz dostrajać głębokość i opóźnienie dla każdego żądania. Wchodząc w to, wiedz, że przyjmujesz projekt, który zmienił się osiem razy w ciągu trzynastu dni, że jego najnowsze wydanie poświęciło kalibrację na rzecz dokładności oraz że jego własna karta wymienia te części polityki wyjścia, których nie mogła potwierdzić.
Wybierz Jev 1.13, jeśli chcesz, aby decyzja działała bez stosu serwowania, jeśli cenisz punkt końcowy utrzymywany przez kogoś innego i jeśli cena 0,042 USD za milion tokenów wejściowych — bez tokenów wyjściowych do rozliczania — jest niska na tle Twojego wolumenu wywołań. Miej świadomość, że wywołujesz model zamknięty, którego rozmiar nie jest ujawniony, którego limity szybkości mogą zmieniać się bez powiadomienia, a którego opublikowanych benchmarków nie możesz samodzielnie uruchomić ponownie.
To, co oba łączy, jest bardziej użyteczne niż to, co je dzieli, i właśnie dlatego takie porównanie w ogóle warto pisać. Żaden z modeli nie generuje tekstu, więc żaden nie wnosi klasy błędów wynikającej z modelu, który zapomina zamknąć nawias klamrowy albo wymyśla pole. Oba zwracają prawdopodobieństwa i w obu przypadkach to prawdopodobieństwo jest tym, co trzeba zwalidować na własnych danych z etykietami, zanim zautomatyzujesz coś w oparciu o nie — opóźnienie jest już utowarowione, a na wartość ufności trzeba zapracować w każdym wdrożeniu. Niezależnie od tego, po której stronie linii podziału między pobieraniem a wywoływaniem się znajdziesz, najpierw przetestuj kalibrację.

