Wygenerowana karta tytułowa z nagłówkiem „Czym jest RSI-Jev?” i podtytułem „Samodoskonaląca się pętla badawcza, która buduje modele decyzyjne w stylu Jev”, nad rzędem trzech zaokrąglonych kart kamieni milowych o treści „4,69 mld parametrów – wieża Qwen3.5-4B-Base”, „Trzy wyjścia – warstwy 16 / 20 / 32” i „Zużywa głębokość, a nie tokeny”; w stopce widnieje napis „Każda liczba na tej stronie pochodzi z projektu, odczyt 2026-10-07.”, z minimalistycznymi płaskimi ikonami liniowymi i logo OrcaRouter wkomponowanym w prawym dolnym rogu.
Guides & Insights

Czym jest RSI-Jev? Samodoskonaląca się pętla, która buduje modele decyzyjne w stylu Jev

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

RSI-Jev to otwarty projekt badawczy strony trzeciej, który tworzy modele decyzyjne System One w stylu Jev, a model, o którym mówi ta strona, to jego wydanie 4B, RSI-Jev v6.0-VL, z dnia 2026-10-06. Napisał go Shanghua Gao (@gasvn), a Sufian (@SufianTA) został wymieniony w podziękowaniach repozytorium; nie jest to Jev firmy TypeSafe ani nie jest powiązany z TypeSafe AI — dokładnie tak mówi własna linia licencji projektu. Idea leżąca u jego podstaw jest dość wąska, by ująć ją w jednym zdaniu: zadaj pytanie z określonym typem odpowiedzi dotyczące dokumentu, czatu lub obrazu — tak/nie, wybierz jedną z k opcji, oceń według rubryki — a pojedynczy przebieg w przód zwraca skalibrowane prawdopodobieństwo dla każdej opcji. Nic nie jest generowane, więc nie ma tokenów rozumowania do zużycia i żadne nie zostają zużyte. v6.0-VL nie jest pierwszym wydaniem projektu; jest siódmym w ciągu dwunastu dni, co jest najważniejszą rzeczą do zrozumienia na jego temat, ponieważ użyteczna informacja tutaj tkwi w kształcie linii, a nie w jakimkolwiek pojedynczym punkcie kontrolnym.

Jedną rzecz trzeba powiedzieć przed jakimikolwiek liczbami, bo ona je wszystkie datuje. v6.0-VL stał na czele kolejki przez dokładnie jeden dzień. W dniu 2026-10-07 o 07:56 UTC — dziś rano — projekt opublikował RSI-Jev v6.1-VL, który jest uśrednieniem v6.0-VL, z wagą 0,5 dla każdego, z drugim dostrojeniem tego samego Qwen3.5-4B-Base wytrenowanym na innych danych, i który uzyskuje 50,98 w zestawie Decision Index 0.3 projektu wobec 46,23 v6.0-VL w tym samym zestawie. Po uśrednieniu nie wytrenowano już niczego. Jego kalibracja jest gorsza niż w v6.0-VL i sama jego karta to potwierdza. To wydanie jest prawdziwe i aktualne; ta strona nie jest o nim. Każda liczba poniżej pochodzi z rekordu wydania v6.0-VL, opatrzonego datą 2026-10-06, a tam, gdzie jakiś licznik zmienił się od tego czasu — liczba wydań, liczba eksperymentów — ta strona podaje zarówno tę wartość, jaka była dla v6.0-VL, jak i tę, którą odczytuje się dziś.

To, czym RSI-Jev nie jest, również warto umieścić na początku, ponieważ dwa z trzech oczywistych założeń są błędne. Nie jest to produkt hostowany, który można dziś wywołać przez ogólne API, i nie jest obsługiwany przez OrcaRouter — nasz katalog nie zawiera identyfikatora rsi-jev, identyfikatora shgao ani karty modelu dla niego. Jedyną rzeczą, którą mamy, jest model, którego kontrakt HTTP kopiuje ten projekt: komercyjny Jev firmy TypeSafe, który udostępniamy jako typesafe/jev-1.13 na punkcie końcowym systemone. Z tych dwóch jeden wywołujesz, a drugi pobierasz i hostujesz samodzielnie. Wszystko poniżej pochodzi z własnego repozytorium projektu, kart wydania i dokumentacji udostępniania, przeczytanych 2026-10-07, a tam, gdzie liczba pochodzi od samego projektu, a nie z zewnętrznego pomiaru, ta strona mówi, czyja jest.

A screenshot of the subject project's own GitHub repository page, Shanghua-Gao / RSI-Jev, showing the repository description 'Typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents - checkpoints, the code that produced them, and every version that failed', the sidebar counters 73 stars, 5 forks and 1 watching, 198 commits and 8 releases, the newest release headed 'RSI-Jev v6.1-VL 4B' dated 14 minutes before the capture, an MIT license line, the topic tags ai-agents, autonomous-research, decision-model, jev, recursive-self-improvement, system-one and typed-decisions, and the merge commit 'Merge pull request #33 from Shanghua-Gao/release-v6.1-vl' at the top of the commit list.

Co ta rzecz właściwie robi

Projekt opisuje się w jednej linii jako „rekursywnie samodoskonalący się system badawczy, który buduje modele System One w stylu Jev”, a wytwarzane przez niego artefakty to rozstrzygacze, a nie generatory. Przekazujesz mu stan — dokument, transkrypcję czatu, transakcję, a w wydaniach z obsługą wizji do czterech obrazów — oraz jedno lub więcej pytań typowanych z nazwanymi kryteriami. Zwraca on, dla każdego pytania, prawdopodobieństwo dla każdej opcji. Trzy typy pytań pokrywają tę przestrzeń i są to typy zdefiniowane przez API TypeSafe:

• noul — ocena prawda/fałsz, zwracana jako pojedyncze prawdopodobieństwo, bez rozkładu i bez wartości ufności, dokładnie odpowiadająca kształtowi odpowiedzi referencyjnej.

• wybór — wybierz jedną z zestawu oznaczonych opcji, zwracany wraz z pełnym rozkładem prawdopodobieństwa i statystyką ufności.

• ocena — ocenianie według uporządkowanej rubryki, zwracane jako ważony prawdopodobieństwem, liczony od zera indeks poziomu, wraz z legendą i rozkładem.

Ponieważ nie ma etapu generowania, nie ma drugiego wywołania modelu ani próbkowania. Decyzja dotycząca dokumentu, który model już przeczytał, jest z założenia tanią operacją, a podawana przez sam projekt wartość tego kosztu — „około 10 ms” — należy do ery 2B, a nie do bieżącego wydania; zmierzone wartości dla v6.0-VL podano poniżej.

Dwie kwestie dotyczące własności mają większe znaczenie niż cokolwiek innego na tej stronie. RSI-Jev nie jest dziełem TypeSafe i nie uzyskał poparcia TypeSafe. Linia licencji, cytowana w całości: „Kod: MIT. Wagi: Apache-2.0, zgodnie z modelem bazowym; niektóre źródła treningowe obrazów są niekomercyjne, wymienione na karcie każdego modelu. Brak powiązań z TypeSafe AI”. A relacja jest jednostronna: projekt celowo kopiuje format transmisji Jev i mówi o tym wprost, ponieważ chodzi o kompatybilny serwer. „Jev-style” to własne określenie projektu dla rodzaju modelu, jaki buduje. Jev od TypeSafe to inny, zamknięty, komercyjny model, a te dwa nie są tym samym pod krótszą nazwą.

Wewnątrz obecnego modelu: wieża Qwen 4B z trzema wyjściami

RSI-Jev v6.0-VL to wieża Qwen3.5-4B-Base z dostrojoną wieżą i wytrenowaną głowicą decyzyjną na wierzchu. To cała architektura — nie ma mieszanki ekspertów, routera ani drugiego modelu. Uruchamia cały model bazowy, dlatego liczba jego parametrów wynosi 4,69 mld, a nie mniej: 3,57 mld znajduje się w 32 warstwach dekodera, 0,64 mld w osadzeniach tokenów, 0,33 mld w wieży wizyjnej, 0,05 mld w głównej głowicy decyzyjnej i 0,10 mld w dwóch głowicach wczesnego wyjścia. Udostępniony checkpoint jest samowystarczalny i ma 9,7 GB w bf16.

Trzy głowy decyzyjne są podłączone na warstwach 16, 20 i 32 bazy i to one są mechanizmem stojącym za wszystkim, z czego słynie bieżące wydanie. Czwarte wyjście na warstwie 12 zostało zbudowane, zmierzone i odrzucone — „Wyjście na warstwie 12 przegrało z kaskadą z warstwy 16 w każdym porównaniu i nie znajduje się w pakiecie” — więc trzy trafiają do wydania, a cztery nie. Wyjścia odczytują odłączoną kopię swojej warstwy; to szczegół, do którego projekt doszedł bolesną drogą: ponowne dostrojenie głów na trzonie, którego wyjścia zostały podłączone podczas trenowania, nie przywróciło dokładności głębokich warstw, więc to ich odłączenie przywróciło głębokość.

Jedna liczba w tym miejscu to najłatwiejszy sposób na błędne odczytanie projektu. Wszystko aż do v3.0 włącznie było modelem 2B opartym na Qwen3.5-2B-Base i to jest linia rozwojowa, a nie obecny model. v4.0-VL był modelem 2B, v5.0-VL zredukował model do 3B, a v6.0-VL to 4B. Strona, która określa obecny model RSI-Jev jako 2B, jest o trzy wydania w tyle.

Pętla to właściwy projekt

Modele są wynikiem; tym, co się buduje, jest proces. Projekt stwierdza, że „pętla prowadząca badania jest kolejną wersją AutoScientists” – samoorganizującego się systemu zespołów agentowych opublikowanego przez laboratorium Zitnika na Harvardzie – i działa tak, jak sugeruje to zdanie. Agenci AI proponują hipotezy, rejestrują swoje przewidywania przed spędzaniem czasu GPU, przeprowadzają eksperymenty i wycofują własnych czempionów, gdy dowody na to wskazują. Dwie liczby czynią to konkretnym. Odczyt z 2026-10-07: nagłówek repozytorium mówi o ośmiu wydaniach w trzynaście dni, od v1.0 do v6.1-VL; dla samego wydania v6.0-VL z 2026-10-06 brzmiał on: siedem wydań w dwanaście dni, a każde z nich zostało wytrenowane, ocenione i udokumentowane przez pętlę. A licznik eksperymentów, który wynosił 471, gdy publikowano wydanie tej strony, dziś wskazuje 496 — każdy z nich opisano, łącznie z niepowodzeniami. Obie liczby pochodzą od samego projektu i obie się zmieniają.

To dyscyplina sprawia, że te liczby coś znaczą, a projekt wymienia ją wprost. Poziomy zerowe są mierzone, a nie zakładane — ramiona, o których można dowieść, że są identyczne z kontrolą, weryfikowane na podstawie tożsamości obiektów, zanim wykorzystany zostanie jakikolwiek czas GPU, tak że rozrzut między nimi jest poziomem szumu, a różnica mniejsza niż ten rozrzut nie jest wynikiem. Przewidywania są rejestrowane przed przebiegiem, więc wersja, która nie osiąga własnej poprzeczki, trafia do wydania jako porażka, a nie jest po cichu przerabiana. Artefakty są weryfikowane: checkpoint jest ponownie wczytywany z dysku i ponownie oceniany, a publikowany tylko wtedy, gdy odtwarza przewidywania dla poszczególnych pytań z przebiegu treningowego, co oba checkpointy v1.0 robią na poziomie 1.0000. Kontaminacja jest „sprawdzana, a nie zakładana”. A porażki trafiają do wydania, w tym te, które zabiły własnego czempiona projektu.

Czym jest wkład, według własnych słów projektu z jego przewodnika po współtworzeniu: „Wkład tutaj to zwykle pomiar, a nie łatka”. Opublikowany zapis jest przechowywany jako łańcuch, a nie jako migawka — „versions/ przechowuje jedną kartę na każde wydanie, wszystkie, na main na zawsze… Ten łańcuch TO projekt” — dlatego liczby ze starego wydania można skonfrontować z tym, co projekt później o nich mówi, i dlatego ta jedna omawiana poniżej poprawka jest widoczna, a nie przemilczana.

Co zmieniło v6.0-VL: zużywa głębokość zamiast tokenów

Mechanizm obecnego wydania to ustawienie o nazwie effort, i kontroluje coś nietypowego: ile warstw modelu może wykorzystać żądanie. Ponieważ głowice znajdują się na trzech głębokościach, łatwe pytanie może zostać obsłużone na warstwie 16, a trudne pytanie może przejść przez wszystkie 32. low zatrzymuje się na warstwie 16, medium na 20, high na 32, a auto odpowiada przy pierwszym wyjściu, którego skalibrowane prawdopodobieństwo przekracza próg tego wyjścia. Mediana opóźnienia na żądanie w próbce Decision Index, mierzona na jednym H200 w bf16: 23 ms przy low, 27 ms przy medium, 40 ms przy high, a 40 ms dla nieustawionej wartości domyślnej. To są własne pomiary projektu na własnym sprzęcie i nie należy ich mieszać z liczbami GB10 z dokumentacji serwowania, które dotyczą innej maszyny.

Zmierzona charakterystyka działania auto jest tu najciekawsza: w składającym się z piętnastu benchmarków zestawie projektu 20% pytań zatrzymuje się na warstwie 16, 46% na warstwie 20, a 34% dobiega do 32, co daje średnio 23,3 z 32 warstw. Pojedynczy stały próg daje średnio 20,9, a nadmierne zatrzymywanie się to właśnie to, co daje pojedynczy próg. auto nie jest kompromisem w kwestii jakości, co warto podkreślić, bo zwykle właśnie tym jest ustawienie adaptacyjne: osiąga najlepszy wiersz zestawu spośród wszystkich ustawień (0,771 wobec 0,770 dla domyślnego), najlepszy wiersz MMLU-Pro (0,444 wobec 0,440) i najlepszą końcową kalibrację (ECE 0,024 wobec 0,036). Jedynym miejscem, w którym high wygrywa, jest zbiór wydzielony, 0,702 wobec auto 0,696. Niektóre zadania stają się mierzalnie gorsze wraz z głębokością — BANKING77 o 0,035, dopasowywanie podpisów New Yorkera o 0,060 — dlatego poziom wysiłku jest wyborem należącym do wywołującego, a nie regułą narzucaną przez serwer.

Wynik, który sprawił, że jest to wydanie, a nie eksperyment, znajduje się w publicznym Decision Index 0.2.1 projektu, gdzie wynik wzrósł z 38,38 dla v5.0-VL do 46,24 dla v6.0-VL w ramach jednego wydania. Na publicznej tablicy z 2026-09-28 to najwyższy wynik wśród modeli 4B i mniejszych oraz 14. miejsce na 71 ogółem; następny wpis przy tym rozmiarze to JPT-4B z 43,04. Wcześniejsze wydania z tej linii to rodowód, a nie bieżący model: w v5.0-VL (2026-10-02) przycięto model do pierwszych 20 z 32 warstw i sprawiono, że mówił „unknown”, gdy pytanie nie ma odpowiedzi; v4.0-VL (2026-10-01) to pierwszy model, który czyta obrazy; a v3.0 (2026-09-28) to wydanie, w którym uczenie ze wzmocnieniem po raz pierwszy pomogło, za sprawą nagrody za ranking listowy — NDCG@5 na 16 kandydatach — która podniosła reranking R@1 z 0,192 do 0,308 względem jego nadzorowanego rodzica, kosztem 0,0028 w zestawie. Tu zaczyna się historia RL projektu i jest to obecnie trzy wydania wstecz.

A generated single-column scoreboard headed 'RSI-Jev v6.0-VL - the scoreboard', with six rows reading 'Decision Index: 46.24 on its own public board', '15-benchmark suite: 0.770 without open_jev_ood', 'Held-out set: 0.698', 'MMLU-Pro: 0.440', 'Final ECE: 0.024 with effort auto' and 'Depth: layers 16 / 20 / 32 at 23 / 27 / 40 ms'; a footer reads 'All figures RSI-Jev's own release record, 2026-10-06; the Decision Index is its own public board, not a third-party result.'

Liczby, wraz z zastrzeżeniami, które im towarzyszą.

Główny wynik Decision Index 0.2.1 dla v6.0-VL to 46,24, w pełnym przebiegu, w którym odpowiedziano na wszystkie 150 759 zapytań zestawu: wiedza 28,8, język 46,2, wyszukiwanie 55,5, narzędzia 65,8, sztuka 37,1. Zestaw piętnastu benchmarków osiąga 0,770, zbiór wydzielony 0,698, MMLU-Pro 0,440, a końcowe ECE 0,024 z auto. Dwa zastrzeżenia muszą zostać podane jednym tchem wraz z tymi liczbami, ponieważ bez nich liczby te wprowadzają w błąd.

Pierwsze to wycięcie z zestawu. Wewnętrzne zadanie zestawu open_jev_ood pokrywało się z 579 wierszami treningowymi, więc jego liczba została zawyżona o nieznaną wartość; od wersji v6.0-VL projekt podaje zestaw bez niego, na poziomie 0,770. Wartość 0,764 z v5.0-VL obejmowała je, a karta v6.0-VL podaje tę wersję ponownie jako 0,763 bez niego. Te dwie liczby nie są porównywalne, a jeśli je porównujesz, musisz użyć przeliczonej wartości 0,763 i powiedzieć, że właśnie to robisz. Zbiór wydzielony, MMLU-Pro i BBH nie wykazują nakładania się i nie są tym dotknięte. Powiązany audyt wykrył około 1000 pozycji z wierszy testowych zestawu Decision Index w korpusach treningowych — ANLI 274, RouterBench-GSM8K 90, ARC 5 oraz tekst zapytań BRIGHT/ToolRet bez etykiet, co stanowi około 0,3% wierszy zestawu — a ponowne obliczenie wyniku bez nich zmienia indeks o co najwyżej 0,04 na próbce projektu. To korekta rekordu v5.0-VL, opublikowana w karcie v6.0-VL, i to własna zasada projektu dotycząca zanieczyszczenia danych kosztuje go jedną liczbę.

Drugą kwestią jest to, czyj to benchmark. Decision Index to własna publiczna tablica wyników RSI-Jev, a nie werdykt podmiotu trzeciego, a 46,24 to wynik na tej tablicy. Nie można go porównywać z niczym, co opublikował TypeSafe, ponieważ te dwie liczby nie pochodzą z tego samego środowiska testowego, a nikt nie przeprowadził niezależnego bezpośredniego porównania między RSI-Jev a Jev 1.13. To, co można powiedzieć, ma charakter strukturalny, a nie liczbowy: jeden to hostowany model komercyjny na punkcie końcowym dostawcy, a drugi to checkpoint, który pobierasz i samodzielnie hostujesz.

Do tego zestawu należą jeszcze dwa elementy kontekstu. Projekt wyraźnie mówi, że „dziesięć z piętnastu benchmarków dostarcza dane treningowe w jakiejś formie, więc żadna z tych liczb nie jest zero-shot”; zbiór wydzielony to porównanie, które jest wydzielone, a nawet on „jest wydzielony z treningu, a nie odizolowany od wyszukiwania”. A v6.0-VL uruchomił 97 ramion na własnej linii — 93, jeśli nie liczyć czterech audytów danych — co jest skalą wyszukiwania, która dała skok o 7,86 punktu w tym indeksie.

Posługuje się formatem przewodowym Jev, z czterema różnicami, o których powinien wiedzieć wywołujący.

Powierzchnia kompatybilności jest powodem, dla którego ten projekt istnieje w takim kształcie, w jakim istnieje. Ten sam kształt żądania ({state, model, questions}), te same trzy typy pytań o takich samych kształtach kryteriów, te same kształty odpowiedzi, te same od 1 do 64 pytań na żądanie, te same koperty błędów i ta sama statystyka pewności — szczyt, (K · p_max − 1) / (K − 1), ograniczony do zakresu 0..1. Twierdzenie samego projektu o tej powierzchni jest takie, że „cokolwiek napisane pod Jev działa z tym bez zmian”, a serwer dokumentuje, co jest skopiowane, a co nie, co jest bardziej użyteczne niż to twierdzenie.

• Prompt i odczyt są jego własne. RSI-Jev to model bazowy z wytrenowaną głowicą odczytu, udostępniany z enkoderem, z którym został wytrenowany, ponieważ użycie promptu referencyjnego „wyprowadziłoby model poza jego rozkład treningowy”. Kontrakt komunikacyjny jest powierzchnią zgodności; prompt nie.

• Klucze opcji są widoczne dla modelu. Wersja referencyjna je ukrywa, więc zmiana nazwy klucza w sposób dowodliwy nie może tam zmienić odpowiedzi. Tutaj może, a serwer uczciwie raportuje to jako option_keys_visible_to_model: true.

• Kryteria muszą być ciągami znaków lub null. Ustrukturyzowane kryterium — obiekt — jest odrzucane z kodem 422, ponieważ żadne wydanie nie zostało wytrenowane na takim kryterium. To jedyne miejsce, w którym żądanie akceptowane przez referencję nie zadziała tutaj.

• Nic nie jest obcinane. Obsługa przyjmuje do 32 768 tokenów tekstowych plus budżet obrazu, a dłuższe żądanie jest odrzucane z błędem 422, który to sygnalizuje, zamiast zostać po cichu obcięte. Liczba 2048 tokenów, która pojawia się w starszych kartach, to długość, na której modele były trenowane, a nie limit obsługi, a opisywanie cichego obcinania do 2048 jako bieżącego zachowania jest błędne.

Liczba opcji różni się znacząco na korzyść trybu serving: do 5120 opcji na pytanie (RSIJEV_MAX_ANSWERS), wobec 160 podczas treningu i 64 dopuszczanych przez implementację referencyjną. Nie podawaj 160 jako limitu w trybie serving. Jedna rzecz w odpowiedziach v6.0-VL jest nowa, a nie odziedziczona: każda odpowiedź podaje, która warstwa odpowiedziała, w usage.depth, obok skalibrowanej pewności, dzięki czemu adaptacyjną decyzję można poddać audytowi po fakcie. Obrazy to rozszerzenie, którego nie ma implementacja referencyjna — od jednego do czterech na żądanie, jako adresy URL typu data z base64, przy czym stan odwołuje się do każdego za pomocą dosłownego znacznika.

Gdzie czytelnik może to faktycznie uruchomić, a gdzie nie może

RSI-Jev jest do pobrania. Projekt dostarcza własny serwer, który obsługuje to API zgodne z Jev, a udokumentowana ścieżka to pip install z repozytorium, po którym następuje jego polecenie serve z aliasem checkpointu i ustawieniem effort. Wagi znajdują się na Hugging Face w organizacji shgao, udostępnione na licencji Apache-2.0, tak jak model bazowy, z jednym otwartym pytaniem, które projekt sam stawia: pięć spośród źródeł treningowych obrazów jest niekomercyjnych lub przeznaczonych wyłącznie do badań, a „czy wagi wytrenowane na danych niekomercyjnych dziedziczą te warunki, nie zostało rozstrzygnięte”. Kod jest na licencji MIT.

Sprzęt nie jest ograniczeniem. Projekt jest rozwijany na HP ZGX Nano, maszynie NVIDIA GB10, którą zawdzięcza HP i NVIDIA, a serwer działa na dowolnym GPU CUDA, na Apple Silicon albo na zwykłym CPU — a to ostatnie, czyli własny procesor Arm komputera GB10, dokumentacja podaje jako 733 ms dla pojedynczego pytania, a więc jest użyteczne, a nie szybkie.

Nie pojawia się w ogólnym katalogu modeli — i właśnie tutaj musimy być precyzyjni co do własnej pozycji. RSI-Jev nie znajduje się w OrcaRouter i nie ma karty modelu, do której mógłby kierować ruch. To, co udostępniamy, to komercyjny Jev firmy TypeSafe, typesafe/jev-1.13, na dedykowanym punkcie końcowym systemone, osiąganym przez POST do /v1/systemone, a nie w formacie OpenAI chat-completions — te same kształty żądań i odpowiedzi, które implementuje ten projekt, od modelu, którego kontrakt kopiuje. Na tym polega cała relacja: oba mówią tym samym protokołem, my udostępniamy jeden z nich, a drugi uruchamiasz samodzielnie. Jeśli masz już u nas klucz, format wywołania Jev 1.13 jest trasą pierwszej klasy w jednym API dla ponad 200 modeli z 0% marży (cena katalogowa dostawcy przekazywana dalej, więc obniżki cen dostawcy są tu widoczne tego samego dnia) — co ma znaczenie dla porównania pod jednym konkretnym względem. Strona taka jak ta pozwala tanio podjąć działanie, jeśli możesz najpierw wypróbować komercyjny kontrakt, a dopiero potem zdecydować, czy samodzielne uruchomienie otwartego checkpointu 4B jest warte pracy operacyjnej.

A screenshot of OrcaRouter's own model page for Jev 1.13 showing the breadcrumb 'Home / Models / TypeSafe', the title 'Jev 1.13', the slug typesafe/jev-1.13, 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions, the line 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the price $0.04, our p50 TTFT of 149 ms, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Jak odczytać RSI-Jev w dniu 2026-10-07

Słabości, które projekt publikuje, są tak konkretne jak jego wyniki, a daty mają znaczenie. Zewnętrzne testy v2.1 wykazały, że model skłania się ku bardziej surowej lub kosztownej opcji przy uporządkowanych wyborach i ocenach według rubryk, rzadko wybiera „nieznane”, gdy dokument nie może odpowiedzieć, oraz odpowiada niespójnie na pytanie i jego negację. Późniejsze wersje skierowały dane na przypadek „nieznany” — KoBBQ unknown-when-ambiguous osiągnął 0,891 w v4.0-VL, 0,932 w v5.0-VL i 0,918 / 0,939 w v6.0-VL — a karta v6.0-VL otwarcie przyznaje, że zyski pochodziły z danych, a nie z głębokości, oraz że 10% pytań, które trafiłyby do warstwy 32, a zatrzymują się na 16 lub 20, to miejsce, w którym polityka głębokości wciąż zgaduje. Reranking ma jeszcze przed sobą więcej pracy: własny porządek wyszukiwania hippo-memory osiąga 0,484 R@1 i pozostaje przed wynikiem 0,308, który model osiągnął w v3.0 — wartością, której projekt od tego czasu nie twierdził, że dogonił. Dowody z RL opierają się na jednym ziarnie, a v3.0 „sama nie ma dopasowanej grupy kontrolnej SFT”. Korpusy treningowe i zbiory rozwojowe polityki nie są publiczne, więc etapów nie można ponownie uruchomić wyłącznie na podstawie repozytorium, a narzędzie budujące korpus do rerankingu — około 96 GB pamięci — nie zostało ponownie uruchomione od początku do końca.

Zainteresowanie, odczytane tego samego dnia: 73 gwiazdki, 5 forków, 0 otwartych zgłoszeń, 7 wydań na GitHubie. Te liczby zmieniają się codziennie, a repozytorium mające trzy tygodnie nie jest ugruntowanym projektem, niezależnie od tempa wydań. Uczciwe podsumowanie jest takie, że RSI-Jev to jedno z bardziej czytelnych przedsięwzięć badawczych w tym zakątku tej dziedziny — ciąg datowanych, mierzonych, czasem przegrywających wydań, z wyszukiwaniem publikowanym razem z wynikami — a zarazem jedno z najsłabiej zweryfikowanych niezależnie, ponieważ niemal każda liczba na tej stronie pochodzi od niego samego i żaden zewnętrzny podmiot nie poddał go testom porównawczym względem modelu komercyjnego, z którym jest kompatybilny.

Nie chodzi o to, czy pojawi się kolejne wydanie — przy takim tempie kolejne będzie w ciągu kilku dni — lecz o to, czy cokolwiek spoza projektu zacznie mierzyć. Obraz zmieniłyby dwie rzeczy: niezależny benchmark uruchomiony na opublikowanych checkpointach oraz porównanie modeli decyzyjnych, które przepuszcza zarówno otwarty model 4B, jak i hostowany model TypeSafe przez jeden wspólny harness. Dziś nie istnieje żadne z nich. Dopóki jedno z nich nie powstanie, sensownym sposobem odczytywania wyniku takiego jak 46.24 jest traktowanie go jako dobrze udokumentowanego twierdzenia projektu, który z wyprzedzeniem rejestruje swoje przewidywania i udostępnia też te ramiona, które zawiodły — co stanowi silniejszy ślad dowodowy niż w większości przypadków, a wciąż nie jest wynikiem strony trzeciej.