Wygenerowana karta tytułowa z nagłówkiem 'Rekurencyjne samodoskonalenie, wyjaśnione' i podtytułem 'Zamknięta pętla to pętla punktowana, a punktacja to cała kwestia', nad rzędem zaokrąglonych kart o treści 'Predykcje zarejestrowane przed przebiegiem', 'Dolne progi zerowe mierzone, a nie zakładane' i 'Porażki trafiają do wydania, w tym porażka championa'; stopka głosi 'Przykład rozwiązany: RSI-Jev v6.0-VL, opublikowany 2026-10-06; własny zapis projektu, odczytany 2026-10-08.', z minimalistycznymi płaskimi ikonami liniowymi i logo OrcaRouter wkomponowanym w prawym dolnym rogu
Guides & Insights

Rekurencyjne samodoskonalenie, wyjaśnione na przykładzie projektu, który faktycznie to robi

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

„Rekurencyjne samodoskonalenie” to jedno z tych określeń, których używa się głównie na oznaczenie pewnego odczucia. Zdefiniowane bez mistyki jest węższe niż to i ciekawsze: system, który proponuje własny następny eksperyment, przeprowadza go i zachowuje lub wycofuje wynik według z góry ustalonej reguły, a wyniki zasilają kolejną rundę. Rekurencja nie jest magią i nie jest nieograniczona — to pętla z funkcją oceniającą, a jej jakość zależy w całości od tego, jak uczciwie ta funkcja oceniająca jest stosowana. RSI-Jev, niezależny otwarty projekt budujący modele decyzyjne System One w stylu Jev, jest rzadkim przypadkiem, w którym można odczytać tę pętlę, zamiast się o nią spierać: każda hipoteza, każde nieudane ramię i każde wydanie są publikowane wraz z własnymi liczbami, a repozytorium jest datowane dzień po dniu. Model używany na tej stronie jako przykład roboczy to RSI-Jev v6.0-VL, model decyzyjny z typowaniem 4B opublikowany 2026-10-06, czyli w ciągu ostatniego tygodnia. To nie jest Jev od TypeSafe i nie jest powiązany z TypeSafe AI — własny wiersz licencji projektu mówi dokładnie to, a to, co udostępniamy w OrcaRouter, to ten drugi, typesafe/jev-1.13, na naszym punkcie końcowym systemone.

Jedno wyjaśnienie, zanim słowo „self-improving" zacznie cokolwiek znaczyć, a po nim jedna data. To nie jest model, który przepisuje sam siebie bez ograniczeń, i nic na tej stronie nie powinno być tak odczytywane. Omawiana pętla przepisuje przepis: proponuje zmianę w treningu, rejestruje, czego od tej zmiany oczekuje, zużywa czas GPU, a następnie albo zachowuje zmianę, albo zapisuje, dlaczego przegrała. Model to wieża Qwen3.5-4B-Base z wytrenowanymi głowicami decyzyjnymi — stała architektura trenowana stałym skryptem treningowym, przy czym poszukiwanie odbywa się w obrębie danych, celów i etapów. Pętla prowadzi własne eksperymenty i wycofuje własnych mistrzów. Ludzie decydują, co warto mierzyć. A data: v6.0-VL opublikowano 2026-10-06, a od tego czasu projekt wydał kolejne wydanie — linia przesuwa się mniej więcej codziennie, a liczby na tej stronie to te przypisane do wymienionego tu wydania, z datą z miejsca ich odczytania. Warto powiedzieć to na wstępie na stronie, której tematem jest pętla, która wciąż działa.

Co oznacza ten termin, powiedziane wprost

Rozłóż to sformułowanie na części, a zostaną trzy elementy, wszystkie zwyczajne. Po pierwsze, przestrzeń poszukiwań: zbiór rzeczy, które można zmienić. Po drugie, oceniający: coś, co mówi, czy zmiana pomogła. Po trzecie, zapis: co wypróbowano, co się stało i co odrzucono. System prowadzi rekurencyjne samodoskonalenie, gdy wynik rundy N jest wejściem rundy N+1 we wszystkich tych trzech elementach, bez ponownego wyprowadzania przez człowieka przestrzeni poszukiwań ani ponownego ustalania progu za każdym razem.

To, co pomija większość tekstów na ten temat, to druga część — i właśnie w niej tkwi całe pytanie. Pętla ze słabym oceniającym optymalizuje oceniającego. Wytworzy monotonicznie rosnącą linię i system, który nauczył się kształtu własnego egzaminu. Ta porażka nie wymaga złej woli ani błędu — dzieje się tak domyślnie, gdy ta sama liczba zarówno wybiera, jak i raportuje. Więc kiedy czytasz twierdzenie, że jakiś system sam się ulepsza, użytecznym pytaniem nigdy nie jest „jak bardzo się poprawił”. Jest nim: „kto ustawił poprzeczkę, kiedy i czy mogła się przesunąć po zobaczeniu wyniku”.

Popularne wersje tej koncepcji — te, które dziś zajmują najwyższe pozycje w wynikach dla tego terminu — w większości wybiegają w przyszłość: hasło Wikipedii opisuje system przepisujący własny kod w kierunku „eksplozji inteligencji”, a szersze omówienia dotyczą zwykle tego, czy ten horyzont czasowy jest bliższy, czy dalszy niż prognozowano. To zasadny argument i nie da się na niego odpowiedzieć na podstawie dowodów, jakimi ktokolwiek obecnie dysponuje. Odpowiedzi można natomiast udzielić na mniejsze pytanie: czy pętlę zamkniętą takiego rodzaju, jak opisano powyżej, da się zbudować i utrzymać zgodnie z jej własnymi regułami już teraz. Pod tym względem jeden projekt z publicznie dostępnymi artefaktami jest wart więcej niż dekada spekulacji — i właśnie o tym jest dalsza część tej strony.

Zamknięte, nie dwa mechanizmy

Pętla nie jest zamknięta dlatego, że się powtarza. Wiele zautomatyzowanych potoków powtarza się, nigdy nie będąc zamkniętymi, ponieważ potok, który potrafi dostosować próg po zobaczeniu wyniku, robi coś kategorycznie innego niż ten, który nie potrafi. Same reguły RSI-Jeva są niezwykle jednoznaczne w kwestii tej różnicy i można je czytać jako definicje, a nie jako manifest. Pięć z nich wykonuje większość pracy.

Prognozy są rejestrowane przed uruchomieniem. Hipotezę zapisuje się wraz z liczbą, której przesunięcia oczekuje, i o ile — zanim zostanie zużyty czas GPU. Wersja, która nie osiąga własnego progu, zostaje wypuszczona jako porażka, zamiast zostać po cichu przerobiona. To mechanizm, który powstrzymuje pętlę przed staniem się maszyną do pisania wyjaśnień po fakcie, i ma realny koszt: rejestr zawiera wpisy, których jedyną treścią jest to, że ktoś oficjalnie się pomylił.

Poziomy zerowe są mierzone, a nie zakładane. Zespół uruchamia ramiona, które są dowodliwie identyczne z grupą kontrolną — zweryfikowane przez tożsamość obiektu przed jakimkolwiek czasem GPU — a rozrzut między tymi ramionami to poziom szumu. Różnica mniejsza niż ten poziom nie jest wynikiem, niezależnie od tego, jak wygląda. Własny próg projektu odzwierciedla to: w jego wewnętrznym zestawie próg wynosi +0,006, przy odchyleniu standardowym między ziarnami na pojedynczym benchmarku wynoszącym 0,011–0,016, więc różnice na pojedynczym benchmarku poniżej tej wartości nie są odkryciami. Większość szumu w tej branży jest mierzona, a nie statystyczna.

Zbiór odłożony zostaje zużyty, gdy tylko zostanie odczytany.Każde wydanie czyta zbiór odłożony raz, więc dwa wydania wciąż można porównać na równych zasadach — a ponieważ jego odczytanie go zużywa, każde wydanie zamraża porównanie dla następnego. Warto zachować nienaruszone własne sformułowanie projektu: zbiór odłożony „is held out from training, not sealed from the search”. To kontrola pod kątem zapamiętywania, a nie gwarancja nowości. A sam wynik zestawu ma w sobie dziurę, którą projekt ujawnił: jedno zadanie wewnętrzne pokrywało się z kilkuset wierszami treningowymi, więc począwszy od v6.0-VL zestaw jest raportowany bez niego — 0,770 — a wcześniejsze 0,764 z v5.0-VL podano na nowo jako 0,763 bez niego. I właśnie o to chodzi z tym przeformułowaniem. Liczba była zawyżana, znaleziono przyczynę, a kartę starszego wydania poprawiono, zamiast ją zostawiać bez zmian.

Porażki trafiają do wydania, w tym te, które zabiły własnego faworyta projektu. Liczby z nagłówka repozytorium, odczytane 2026-10-08, układają się w spójną całość: osiem wydań w trzynaście dni i setki eksperymentów opisanych wraz z uwzględnieniem porażek. Wynik negatywny jest traktowany jako produkt. Przewodnik dla współtwórców mówi bez ogródek, dlaczego — kosztowną częścią poszukiwań nie jest uruchamianie zwycięzcy, lecz uruchamianie przegranych, więc dobrze zmierzony wynik negatywny z zewnątrz eliminuje gałąź i jest wart więcej niż niewielki wynik pozytywny.

Łańcuch wydań to projekt. Jedna karta na wydanie, wszystkie, trwale na głównej gałęzi. Każda karta zawiera liczby własnego wydania, więc szybkość i kalibracja jednej wersji nigdy nie nadpisują danych innej. Projekt podaje powód wprost: ten łańcuch to jedyny sposób, by zobaczyć, czy samodoskonaląca się pętla robi postępy. Wszystko inne — przepis, skrypty, przypięty stos — zawiera tylko bieżące wydanie, ponieważ odwrotna zasada uniemożliwiałaby rozpoznanie, co jest bieżące. Opublikowany punkt kontrolny zawiera własny kod, dzięki czemu stare wydania pozostają uruchamialne bez starych gałęzi.

A screenshot of the subject project's own GitHub repository page, Shanghua-Gao / RSI-Jev, showing the repository description 'Typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents - checkpoints, the code that produced them, and every version that failed', the sidebar counters 80 stars, 5 forks and 1 watching, 198 commits and 8 releases, the newest release headed 'RSI-Jev v6.1-VL 4B', an MIT license line, the topic tags ai-agents, autonomous-research, decision-model, jev, recursive-self-improvement, system-one and typed-decisions, and the merge commit 'Merge pull request #33 from Shanghua-Gao/release-v6.1-vl' at the top of the commit list.

Ile kosztuje dyscyplina i co daje

Dwie historie z zapisu są uczciwą przeciwwagą dla słowa „samodoskonalący się”, ponieważ obie są przypadkami, w których własne reguły pętli sprawiły, że praca była jednocześnie wolniejsza i lepsza.

Pierwszy to błąd, który stał za v1.0. Znalezienie go wymagało siedmiu zarejestrowanych wyników negatywnych. Każdy z tych siedmiu był poprawką po stronie optymalizatora, która zmniejszała niestabilność treningu, ale jej nie usuwała, ponieważ przyczyną był błąd precyzji w miejscu zupełnie odległym od optymalizatora — a ostateczna poprawka to jedna linia. Żaden z tych siedmiu nie był wart publikacji sam w sobie. To one razem sprawiły, że przyczynę w ogóle udało się znaleźć, i to jest cały argument za rejestrowaniem i zachowywaniem wyników negatywnych: ich wartość jest wspólna, a nie indywidualna.

Drugi jest mniej pochlebny, a projekt i tak go publikuje, w przypisie. Wczesny wariant nie spełnił dokładnie jednego warunku kontrolnego — MMLU-Pro wypadł 0,026 poniżej progu wobec limitu 0,020 — i zapisano go jako odrzucony. Właściciel przebiegu zwiększył wtedy limit do 0,030, argumentując, że MMLU-Pro to zabezpieczenie przed zapominaniem, a nie cel, a wariant potwierdzono na czterech nowych ziarnach losowych i stał się kolejnym wydaniem. Pierwotne odrzucenie pozostawiono w dzienniku, wraz z własnym komentarzem projektu, że próg przesunięty po zobaczeniu wyniku to coś, na czym czytelnik powinien móc przyłapać projekt.

Ten przypis to najbardziej użyteczny akapit w repozytorium dla każdego, kto próbuje ocenić tego rodzaju twierdzenie w rzeczywistych warunkach. Przesunięta poprzeczka nie jest dowodem złej wiary — podane uzasadnienie jest możliwe do obrony, a poszerzona poprzeczka musiała następnie przetrwać cztery nowe ziarna. Ale poprzeczka, która przesunęła się po cichu, to pętla, która nie jest już zamknięta, a różnica między nimi polega wyłącznie na tym, czy zostało to zapisane. Ogólna zasada, na którą projekt ostatecznie się zdecydował, jest warta przeniesienia do innych systemów: przypadek bliski porażki, który nie spełnia dokładnie jednego zabezpieczenia, otrzymuje diagnozę i ukierunkowaną naprawę zamiast zostać odrzucony — a jeśli naprawa się nie powiedzie, staje się ślepą uliczką z zapisem.

Jak często pętla jest błędna: czternaście konfiguracji, dwie zachowane

Oto liczba, którą warto zapamiętać. W wydaniu, które odczytuje obrazy, projekt liczy czternaście konfiguracji uczenia ze wzmocnieniem i 63 ramiona trenowane z użyciem nagrody. Dwa zostały zachowane.

Każdą konfigurację oceniano względem nadzorowanej kontroli trenowanej na tych samych elementach przez tę samą liczbę kroków, co jest porównaniem, które nadaje tej liczbie sens — ramię RL, które pokonuje punkt odniesienia, z którym nigdy nie musiało się mierzyć, niczego nie dowodzi. Pouczające porażki, w słowach samego projektu:

• RL na rzecz binarnej poprawności — prawdopodobieństwo na wyjściu zapadło się do 0 i 1. Nagradzanie samego aktu trafnego wyboru, a nie rzetelności podawanych szans, spycha rozkład ku skrajom, a model decyzyjny, którego pewność jest zawsze całkowita, jest bezużyteczny do tego, do czego służą modele decyzyjne.

• RL z właściwą regułą punktacji, rekonstrukcja funkcji celu w stylu Laya — było w porządku przy 300 krokach, rozbiegało się przy 1500. Stabilne, gdy nie robiło zbyt wiele, i niestabilne dokładnie wtedy, gdy zaczęło mieć znaczenie.

• RLCR — remis pod względem dokładności, gorsza surowa kalibracja. Nie nabył żadnej zdolności, a zapłacił za to w jedynej właściwości, którą model ma zapewniać.

• Bandit RLCD, w którym ujawniany jest wyłącznie wynik wybranej opcji — nie lepszy niż uczenie nadzorowane na tej samej informacji zwrotnej. Projekt zabił tutaj swój własny przedrejestrowany test: ramię musiało pobić uczenie nadzorowane w co najmniej dwóch z czterech metryk kalibracyjnych, a wygrało jedną.

Zwycięzca — i powód, dla którego wygrał — to najbardziej przenośne odkrycie na tej stronie. To nagroda listowa — jakość rankingu mierzona na podstawie kolejności wielu osobno ocenianych kandydatów, a nie traktowania każdego z nich w izolacji. Recall rerankingu na pierwszej pozycji wzrósł z 0,192 dla nadzorowanego modelu nadrzędnego do 0,308, przy czym w teście sparowanym odnotowano wygrane i przegrane. Wyjaśnienie projektu nie jest opowieścią o strojeniu: cel treningowy na poziomie pojedynczego elementu ocenia każdego kandydata osobno, a żadna pojedyncza etykieta nie koduje jakości uporządkowania wśród kandydatów. Tam, gdzie nagroda mówiła coś, czego etykiety nie mogą wyrazić, RL pokonał trening nadzorowany na tych samych wierszach. Tam, gdzie tego nie robiła, trening nadzorowany dorównywał RL.

To uogólnia się do reguły o tym, kiedy tego rodzaju pętla może w ogóle cokolwiek znaleźć. Mając złotą etykietę w ręku, oczekiwana aktualizacja gradientu polityki równa się gradientowi straty nadzorowanej — własne sformułowanie projektu — więc „RL arm” oceniane względem etykietowanych decyzji jest w rzeczywistości ramieniem projektowania straty. A zmiany na poziomie straty przesunęły wewnętrzny zestaw co najwyżej o 0,002, podczas gdy nowe dane przesunęły go o 0,13. Czytane razem: dźwignia pętli nigdy nie tkwiła w funkcji celu. Tkwiła w tym, co było mierzone i co było podawane na wejście.

Co jest uczciwą odpowiedzią na pytanie, które czytelnik ma prawo zadać. Ustawienia RL są gdzie indziej cytowane jako dowód na ogólne samodoskonalenie; tutaj są dowodem na jedną pętlę w zadaniach decyzyjnych. Wynik listwise to jedno ziarno, i projekt to mówi: sparowane porównanie RL kontra nadzorowane przeprowadzono na innym rodzicu niż ten, do którego zastosowano je w wydaniu, a to wydanie „nie ma dopasowanej kontroli nadzorowanej”. Odkrycie z tym zastrzeżeniem jest warte więcej niż takie bez niego, i dlatego strona, którą czytasz, nie uogólnia go.

Gdzie siedzi człowiek

Projekt jest jawny, a ta jawność jest najciekawsza: pętla prowadzi własne eksperymenty i wycofuje własnych czempionów, ale nie decyduje o tym, co warto mierzyć, i sama nie zauważa, kiedy liczba jest technicznie prawdziwa, a praktycznie wprowadza w błąd. To robią ludzie.

Dwie z własnych zasad projektu istnieją, ponieważ ktoś się sprzeciwił. Zabezpieczenie MMLU-Pro zostało rozszerzone, zamiast pozwolić, by wynik, któremu niewiele brakowało, został odrzucony. Wymóg dotyczący ziaren skaluje się teraz z wielkością efektu, zamiast przeznaczać cztery ziarna na każdą różnicę — ponieważ ziarno potwierdzające, ta jedna liczba, na której nie oparto wyboru ramienia, jest tym, które dźwiga ciężar, a wydawanie mocy obliczeniowej na różnice, które już widać, nic nie daje. Jedno z wydań w łańcuchu zaczęło się jako odmowa porzucenia ramienia, które nie przeszło jednego zabezpieczenia. Projekt wymienia z nazwiska osoby, które przesłały tę opinię, w podziękowaniach.

Zatem „samodoskonalenie się” opisuje tu środek pętli, a nie całą pętlę. Pętla to poszukiwanie, które działa bez człowieka kręcącego korbą. Człowiek wciąż jest u góry pętli, wybierając cel, i u dołu, krytycznie czytając wynik — i właśnie ten układ powstrzymuje pętlę przed staniem się maszyną do potwierdzania własnych preferencji. Każdy opis rekurencyjnego samodoskonalenia, który pomija to miejsce, opisuje inny system niż ten, i prawdopodobnie hipotetyczny.

Czego nie pokazują własne liczby projektu

Powyższą dyscyplinę warto opisywać tylko wtedy, gdy jej ograniczenia podaje się jednym tchem, a zapis RSI-Jeva mówi o nich sam za siebie.

• To jeden projekt, naraz jeden rozmiar modelu, jedno ziarno. Opublikowany checkpoint pochodzi z jednego ziarna, ustalonego z góry jako podstawowy, a nie wybranego tak, by uzyskać najlepszy wynik. Dowody z RL pochodzą z jednego ziarna.

• To zadania decyzyjne, a nie generowanie: pytanie tak/nie, wybór jednej z k opcji albo ocena według rubryki dotycząca dokumentu, czatu lub obrazu, na które odpowiada się w jednym przebiegu w przód, ze skalibrowanym prawdopodobieństwem dla każdej opcji. Nic nie jest generowane, więc nie ma tokenów rozumowania do wykorzystania. Pętla pokazuje tutaj, że potrafi ulepszyć system oceniający o takim kształcie.

• Część tego nie da się odtworzyć wyłącznie na podstawie repozytorium. Korpusy szkoleniowe i zbiory do opracowywania polityki nie są publiczne, a projekt mówi o tym wprost w karcie wydania: „tych etapów nie można ponownie uruchomić wyłącznie na podstawie tego repozytorium”. Jedno narzędzie do budowania korpusu wymaga około 96 GB pamięci i nie zostało ponownie uruchomione od początku do końca.

• Nie wszystko jest w ogóle sprawdzalne. Wewnętrzny zestaw nigdy nie był w pełni odłożony. Spośród piętnastu benchmarków dziesięć w jakiejś formie dostarcza danych treningowych, więc żadna z tych liczb nie jest zero-shot — zbiór odłożony to porównanie, które jest odłożone, i jest to jedyne takie porównanie.

A zewnętrzne części mają własną tkankę bliznowatą. Audyt po jednym wydaniu wykazał około tysiąca pozycji wierszy testowych publicznego zestawu benchmarkowego w korpusach treningowych — około 0,3% wierszy zestawu, a największy pojedynczy wkład to kilkaset wierszy z jednego źródła. Po ponownym ocenieniu bez nich wskaźnik zmienia się o co najwyżej 0,04. Ta korekta została opublikowana w karcie następnego wydania, a nie po cichu zastosowana, zgodnie z zasadą, którą projekt formułuje jako „brak zanieczyszczenia, sprawdzany, a nie zakładany”. To zasada, która kosztuje ich wynik liczbowy, a to jedyny rodzaj zasady, jaki warto mieć.

Gdzie można to faktycznie uruchomić — a gdzie nie

Nic z tego, co tu jest, nie jest udostępniane przez OrcaRouter. W naszym katalogu nie ma identyfikatora RSI-Jev ani karty modelu dla niego i nie pojawi się, dopóki ktoś go nie udostępni. RSI-Jev jest instalowany z własnego repozytorium i uruchamia własny serwer, który posługuje się Jev API: wskazujesz na niego istniejącego klienta Jev i zmieniasz bazowy adres URL. Działa w systemach Linux, Windows i macOS, na GPU CUDA, Apple Silicon lub zwykłym CPU.

The one model we do host is the other side of that contract. TypeSafe's Jev 1.13, which we serve as typesafe/jev-1.13, is the commercial decision model whose request and answer shapes RSI-Jev reproduces, and it is reached on our dedicated systemone endpoint rather than through the chat-completions shape. That is the whole relationship, and it is a structural one rather than a quality claim: one is a hosted commercial model on a vendor's endpoint, the other is a checkpoint you download and serve yourself. Nobody has run an independent head-to-head between them, and this page is not going to declare a winner from two different harnesses.

A generated single-column scoreboard headed 'RSI-Jev - the loop's own ledger', with six rows reading 'Predictions: registered before the run', 'Null floors: measured from identical arms', 'Held-out set: read once, then spent', 'Failures: published, including the champion's', 'Release chain: one card per release, on main forever' and 'RL setups kept: 2 of 14, each judged against a matched control'; a footer reads 'All figures from the project's own record, read 2026-10-08.'

Jeśli chcesz umieścić taki model decyzyjny za aplikacją, kwestia routingu jest oddzielona od kwestii modelu i to ona decyduje, czy eksperyment w ogóle warto przeprowadzać. OrcaRouter to jedno API dla ponad 200 modeli z marżą 0% — cena katalogowa dostawcy przekazywana bez zmian, więc zmiana ceny u dostawcy to twoja cena tego samego dnia — plus automatyczne przełączanie awaryjne i DSL routingu do składania kilku modeli w jedno wywołanie. W przypadku modelu pętlowego, którego nie można jeszcze wywołać przez ogólne API, ma to znaczenie w konkretny sposób: oznacza, że alternatywni kandydaci, z którymi chciałbyś go porównać, są już dostępni pod jednym kluczem, a porównanie to zmiana konfiguracji, a nie druga integracja.

A screenshot of OrcaRouter's own model page for typesafe/jev-1.13 showing the left navigation, a PERFORMANCE panel with prefill and decode lines, the heading 'Jev 1.13' with the provider line 'typesafe', the price fields $0.11 prefill and $0.36 decode per million tokens, a benchmark box with MED 0.3, Response Trust 0.784, Structured Output 0.964, Refusal Correctness 1.0 and Consistency 0.59, an accuracy-versus-cost scatter with a 'Jev 1.13' marker, an 'Individual Runs' table, API and Agent curl snippets pointing at the systemone endpoint, the OrcaRouter logo and a sign-up button.

Część, którą warto zachować

Powód, by pisać o rekurencyjnym samodoskonaleniu przez projekt taki jak ten, a nie przez spór o to, czy prowadzi ono do czegoś dramatycznego, jest taki, że przenośną częścią są reguły pętli, a nie spekulacja. Zarejestrowane przewidywania, zmierzone progi zerowe, wykorzystane zbiory odłożone, publikowane porażki, niezmienny łańcuch wydań: żadna z tych rzeczy nie jest właściwością superinteligencji. Są właściwościami laboratorium, które postanowiło być sprawdzalne, i są dostępne dla każdego zespołu prowadzącego dziś automatyczne przeszukiwanie, w dowolnej skali, na dowolnym modelu.

Czytane w ten sposób, interesującym twierdzeniem w dorobku RSI-Jeva nie jest wynik. Chodzi o to, że własny rejestr pętli mówi, iż myliła się znacznie częściej, niż miała rację — dwie zachowane receptury z czternastu konfiguracji, siedem negatywów, by znaleźć jednolinijkowy błąd, słupek, który się przesunął i został zapisany — i że projekt opublikował ten rejestr. Wzrost z 38,38 do 46,24 w publicznym indeksie w jednym wydaniu jest ciekawostką bez tych porażek obok. To porażki sprawiają, że ta liczba coś znaczy.

Co jest uczciwym stanowiskiem wobec samego terminu. Nie chodzi o to, czy system może sam się ulepszać. Chodzi o to, czy ulepszenie jest mierzone przez coś, co mogłoby powiedzieć „nie”. Tam, gdzie ten rozdział jest rzeczywisty i zapisany, pętla jest warta czytania. Tam, gdzie tak nie jest, rosnąca linia jest opisem oceniającego, a nie systemu, który staje się lepszy — i żadna ilość rekurencji tego nie naprawi.