
Peningkatan Diri Rekursif, Dijelaskan Melalui Proyek yang Benar-Benar Melakukannya
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
“Peningkatan diri secara rekursif” adalah salah satu frasa yang sebagian besar dipakai untuk berarti suatu perasaan. Jika didefinisikan tanpa mistik, maknanya lebih sempit dari itu dan lebih menarik: sebuah sistem yang mengusulkan eksperimen berikutnya sendiri, menjalankannya, dan mempertahankan atau menghentikan hasilnya berdasarkan aturan yang ditetapkan sejak awal, dengan hasil-hasilnya memberi masukan untuk putaran berikutnya. Rekursi bukanlah sihir dan tidak tak terbatas — ini adalah lingkar dengan fungsi penilaian, dan kualitasnya sepenuhnya ditentukan oleh seberapa jujur fungsi penilaian itu diterapkan. RSI-Jev, proyek terbuka pihak ketiga yang membangun model keputusan System One bergaya Jev, adalah kasus langka di mana Anda dapat membaca lingkar itu alih-alih memperdebatkannya: setiap hipotesis, setiap arm yang gagal, dan setiap rilis dipublikasikan beserta angkanya, dan repositori itu diberi tanggal hari demi hari. Model yang digunakan halaman ini sebagai contoh kerja adalah RSI-Jev v6.0-VL, model keputusan bertipe 4B yang dipublikasikan pada 2026-10-06, yang berada dalam minggu terakhir. Ini bukan Jev milik TypeSafe dan tidak berafiliasi dengan TypeSafe AI — baris lisensi proyek itu sendiri mengatakan persis demikian, dan yang kami layani di OrcaRouter adalah yang satunya lagi, typesafe/jev-1.13, pada endpoint systemone kami.
Satu klarifikasi sebelum kata "self-improving" melakukan pekerjaan apa pun, diikuti oleh satu tanggal. Ini bukan model yang menulis ulang dirinya sendiri tanpa batas, dan tidak ada apa pun di halaman ini yang boleh dibaca seperti itu. Loop yang dimaksud menulis ulang sebuah resep: ia mengusulkan perubahan pelatihan, mencatat apa yang diharapkannya akan dilakukan perubahan itu, menghabiskan waktu GPU, lalu entah mempertahankan perubahan itu atau mencatat mengapa perubahan itu kalah. Modelnya adalah menara Qwen3.5-4B-Base dengan kepala keputusan yang telah dilatih — arsitektur tetap yang dilatih oleh skrip pelatihan tetap, dengan pencarian yang terjadi pada data, objektif, dan tahapan. Loop ini menjalankan eksperimennya sendiri dan memensiunkan juaranya sendiri. Oranglah yang memutuskan apa yang layak diukur. Dan tanggalnya: v6.0-VL diterbitkan pada 2026-10-06, dan proyek ini telah menerbitkan satu rilis lagi sejak itu — lini ini bergerak kira-kira setiap hari, dan angka-angka di halaman ini adalah angka yang terlampir pada rilis yang disebutkan di sini, bertanggal saat angka-angka itu dibaca. Hal itu layak dikatakan di awal pada halaman yang subjeknya adalah loop yang terus berjalan.
Apa arti istilah itu, dinyatakan secara lugas
Kupas frasa itu, dan ada tiga bagian, semuanya biasa saja. Pertama, ruang pencarian: kumpulan hal yang bisa diubah. Kedua, pemberi skor: sesuatu yang menyatakan apakah suatu perubahan membantu. Ketiga, catatan: apa yang dicoba, apa yang terjadi, dan apa yang dibuang. Sebuah sistem melakukan peningkatan diri secara rekursif ketika keluaran dari putaran N menjadi masukan bagi putaran N+1 pada ketiga hal tersebut, tanpa manusia menurunkan ulang ruang pencarian atau memutuskan ulang ambang batas setiap kali.
Yang paling sering dilewatkan oleh sebagian besar tulisan tentang topik ini adalah bagian kedua, dan di situlah letak seluruh pertanyaannya. Sebuah loop dengan penilai yang lemah akan mengoptimalkan penilainya. Hasilnya adalah garis yang naik secara monoton dan sistem yang telah mempelajari bentuk ujiannya sendiri. Kegagalan itu tidak memerlukan niat jahat atau bug — itulah yang terjadi secara default ketika angka yang sama sekaligus menyeleksi dan melaporkan. Jadi ketika Anda membaca klaim bahwa suatu sistem memperbaiki dirinya sendiri, pertanyaan yang berguna bukanlah "seberapa jauh peningkatan yang dicapainya." Melainkan "siapa yang menetapkan standarnya, kapan, dan bisakah standar itu berubah setelah hasilnya dilihat."
Versi populer dari konsep ini — yang saat ini menempati peringkat untuk istilah tersebut — sebagian besar berorientasi ke masa depan: entri Wikipedia menggambarkan sistem yang menulis ulang kodenya sendiri menuju "ledakan kecerdasan," dan liputan yang lebih luas cenderung membahas apakah garis waktu itu lebih dekat atau lebih jauh daripada perkiraan. Itu argumen yang sah, dan tidak terjawab dengan bukti yang dimiliki siapa pun saat ini. Yang bisa dijawab adalah pertanyaan yang lebih kecil, yaitu apakah loop tertutup seperti yang dijelaskan di atas dapat dibangun dan dijaga agar mematuhi aturannya sendiri saat ini. Untuk itu, satu proyek dengan artefak publik mengalahkan spekulasi selama satu dekade, dan inilah yang dibahas di sisa halaman ini.
Tertutup, bukan sekadar iteratif: lima mekanisme
Sebuah loop tidak menjadi tertutup hanya karena ia berulang. Banyak pipeline otomatis berulang tanpa pernah menjadi tertutup, karena pipeline yang dapat menyesuaikan ambang batasnya setelah melihat hasilnya melakukan sesuatu yang secara kategoris berbeda dari pipeline yang tidak bisa. Aturan R-Jev sendiri luar biasa eksplisit tentang perbedaan itu, dan aturan-aturan itu dapat dibaca sebagai definisi, bukan sebagai manifesto. Lima di antaranya melakukan sebagian besar pekerjaan.
Prediksi didaftarkan sebelum eksperimen dijalankan. Sebuah hipotesis dituliskan dengan angka yang diperkirakan akan berubah dan seberapa besar perubahannya, sebelum waktu GPU dihabiskan. Versi yang tidak memenuhi ambangnya sendiri dirilis sebagai kegagalan alih-alih diam-diam dipotong ulang. Inilah mekanisme yang menghentikan loop agar tidak menjadi mesin untuk menulis penjelasan post-hoc, dan itu memerlukan biaya nyata: catatan itu berisi entri yang satu-satunya isi adalah bahwa seseorang terbukti salah di dalam catatan tersebut.
Batas nol diukur, bukan diasumsikan. Tim menjalankan arm yang terbukti identik dengan kontrol — diverifikasi berdasarkan identitas objek sebelum ada waktu GPU — dan sebaran antar arm tersebut adalah batas derau. Perbedaan yang lebih kecil dari batas itu bukanlah hasil, apa pun bentuknya. Tolok ukur proyek ini sendiri mencerminkan hal itu: pada suite internalnya ambangnya adalah +0.006, dengan simpangan baku per-seed pada satu benchmark sebesar 0.011–0.016, jadi perbedaan satu benchmark di bawah itu bukan temuan. Sebagian besar derau dalam bidang ini diukur, bukan statistik.
Himpunan held-out habis terpakai begitu dibaca. Setiap rilis membaca himpunan held-out satu kali, sehingga dua rilis masih dapat dibandingkan secara setara — dan karena membacanya menghabiskannya, setiap rilis membekukan perbandingan rilis berikutnya. Frasa proyek itu sendiri layak dipertahankan utuh: himpunan held-out "disisihkan dari pelatihan, bukan disegel dari pencarian." Ini adalah pemeriksaan terhadap memorisasi, bukan jaminan kebaruan. Dan angka suite itu sendiri memiliki celah yang dipublikasikan proyek: sebuah tugas internal tumpang tindih dengan beberapa ratus baris pelatihan, sehingga dari v6.0-VL dan seterusnya suite dilaporkan tanpa tugas itu — 0.770 — dan angka 0.764 v5.0-VL sebelumnya dinyatakan ulang sebagai 0.763 tanpa tugas itu. Pernyataan ulang itulah intinya. Ada angka yang sedang membengkak, penyebabnya ditemukan, dan kartu rilis yang lebih lama dikoreksi, bukan dibiarkan begitu saja.
Kegagalan ikut dirilis, termasuk kegagalan yang menewaskan pendukung utama proyek itu sendiri. Angka-angka utama repositori tersebut, yang dibaca pada 2026-10-08, saling konsisten: delapan rilis dalam tiga belas hari, dan ratusan eksperimen yang dituliskan dengan menyertakan kegagalannya. Hasil negatif diperlakukan sebagai produk. Panduan kontribusi blak-blakan soal alasannya — bagian mahal dari sebuah pencarian bukanlah menjalankan pemenangnya, melainkan menjalankan yang kalah, jadi hasil negatif yang terukur dengan baik dari luar menghapus satu cabang dan lebih bernilai daripada hasil positif kecil.
Rantai rilis adalah proyeknya. Satu kartu per rilis, semuanya, di cabang utama secara permanen. Setiap kartu membawa angka rilisnya sendiri, sehingga kecepatan dan kalibrasi satu versi tidak pernah menimpa milik versi lain. Proyek ini menyatakan alasannya secara langsung: rantai itulah satu-satunya cara untuk melihat apakah loop yang memperbaiki diri benar-benar membaik. Segala hal lainnya — resep, skrip, stack yang dipatok — hanya membawa rilis saat ini, karena aturan sebaliknya akan membuat mustahil untuk mengetahui apa yang terkini. Checkpoint yang diterbitkan membawa kodenya sendiri agar rilis lama tetap dapat dijalankan tanpa cabang lama.

Apa harga dari disiplin, dan apa yang diperoleh darinya
Dua kisah dari catatan itu merupakan penyeimbang yang jujur terhadap kata "self-improving," karena keduanya adalah kasus di mana aturan-aturan dari loop itu sendiri justru membuat pekerjaan menjadi lebih lambat sekaligus lebih baik pada saat yang sama.
Yang pertama adalah bug di balik v1.0. Menemukannya membutuhkan tujuh negatif yang terdaftar. Masing-masing dari ketujuh itu adalah perbaikan di sisi pengoptimal yang mengurangi ketidakstabilan pelatihan tanpa menghilangkannya, karena penyebabnya adalah kesalahan presisi yang sama sekali tidak dekat dengan pengoptimal — dan perbaikan akhirnya adalah satu baris. Tidak satu pun dari ketujuh itu layak dipublikasikan sendiri. Bersama-sama, itulah yang membuat penyebabnya dapat ditemukan, dan itulah seluruh argumen untuk mendaftarkan dan menyimpan negatif: nilainya bersifat gabungan, bukan individual.
Yang kedua kurang menyanjung dan proyek tetap menerbitkannya, dalam catatan kaki. Sebuah arm awal gagal tepat pada satu guard — MMLU-Pro berada 0,026 di bawah ambang terhadap batas 0,020 — dan dicatat sebagai ditolak. Pemilik run kemudian memperlebar batas menjadi 0,030, dengan alasan bahwa MMLU-Pro adalah guard terhadap pelupaan alih-alih target, dan arm tersebut dikonfirmasi pada empat seed baru dan menjadi rilis berikutnya. Penolakan awal dibiarkan di dalam log, dengan komentar proyek sendiri bahwa ambang yang digeser setelah melihat hasil adalah jenis hal yang seharusnya bisa ditangkap oleh pembaca saat proyek melakukannya.
Catatan kaki itu adalah paragraf paling berguna di repositori ini bagi siapa pun yang mencoba menilai klaim semacam ini di dunia nyata. Ambang yang digeser bukanlah bukti iktikad buruk — alasan yang diberikan dapat dipertahankan, dan ambang yang diperlebar itu kemudian harus bertahan terhadap empat seed baru. Namun, ambang yang digeser secara diam-diam adalah loop yang tidak lagi tertutup, dan perbedaan antara keduanya sepenuhnya terletak pada apakah hal itu dituliskan. Aturan umum yang kemudian disepakati proyek ini adalah aturan yang layak dibawa ke sistem lain: kasus hampir-gagal yang gagal tepat pada satu guard akan mendapat diagnosis dan perbaikan yang ditargetkan alih-alih dibuang — dan jika perbaikan itu gagal, hal itu menjadi jalan buntu dengan catatan.
Seberapa sering loop itu salah: empat belas penyiapan, dua dipertahankan
Inilah angka yang perlu diingat. Melalui rilis yang membaca gambar, proyek ini menghitung empat belas pengaturan pembelajaran penguatan dan 63 lengan yang dilatih dengan reward. Dua dipertahankan.
Setiap pengaturan dinilai terhadap kontrol terawasi yang dilatih pada item yang sama untuk jumlah langkah yang sama, dan itulah perbandingan yang membuat hitungan tersebut bermakna — sebuah arm RL yang mengalahkan baseline yang tidak pernah harus ditandinginya tidak membuktikan apa pun. Kerugian yang instruktif, dalam kata-kata proyek itu sendiri:
• RL kebenaran biner — keluaran probabilitas runtuh menjadi 0 dan 1. Memberi imbalan atas tindakan memilih dengan benar alih-alih atas kejujuran peluang yang dilaporkan mendorong suatu distribusi ke sudut-sudutnya, dan model keputusan yang tingkat keyakinannya selalu mutlak tidak berguna untuk hal yang menjadi tujuan model keputusan.
• RL proper-score, rekonstruksi objektif bergaya Laya — baik-baik saja pada 300 langkah, menyimpang pada 1.500. Stabil selama tidak melakukan banyak hal, dan justru tidak stabil tepat saat mulai menjadi penting.
• RLCR — setara dalam akurasi, kalibrasi mentahnya lebih buruk. Ia tidak memperoleh kemampuan apa pun dan membayarnya dengan satu properti yang menjadi alasan model ini ada, yakni menyediakannya.
• Bandit RLCD, di mana hanya hasil dari opsi yang dipilih yang diungkap — tidak lebih baik daripada pelatihan terawasi pada umpan balik yang sama. Proyek ini membatalkan uji praregistrasinya sendiri di sini: lengan tersebut harus mengalahkan pelatihan terawasi pada setidaknya dua dari empat metrik kalibrasi dan menang satu.
Pemenangnya, dan alasan ia menang, adalah temuan yang paling dapat dialihterapkan di halaman ini. Ini adalah reward listwise — kualitas pemeringkatan yang diukur berdasarkan urutan banyak kandidat yang dinilai secara terpisah, alih-alih memperlakukan masing-masing secara terisolasi. Recall pemeringkatan ulang pada posisi pertama naik dari 0,192 untuk induk terawasi menjadi 0,308, dengan kemenangan dan kekalahan pada uji berpasangan. Penjelasan proyek ini bukanlah kisah penyetelan: target pelatihan per item menilai setiap kandidat secara mandiri, dan tidak ada satu label pun yang mengodekan kualitas sebuah urutan di antara kandidat. Ketika reward menyampaikan sesuatu yang tidak dapat diungkapkan oleh label, RL mengalahkan pelatihan terawasi pada baris yang sama. Ketika tidak, pelatihan terawasi menyamainya.
Itu menggeneralisasi menjadi aturan tentang kapan loop semacam ini dapat menemukan apa pun sama sekali. Dengan label emas di tangan, pembaruan policy-gradient yang diharapkan setara dengan gradien dari loss terawasi — sebagaimana frasa proyek ini sendiri — sehingga “lengan RL” yang dinilai terhadap keputusan berlabel sebenarnya adalah lengan desain loss. Dan perubahan pada tingkat loss menggerakkan suite internal paling banyak 0,002, sementara data baru menggerakkannya sebesar 0,13. Dibaca bersama: daya pengungkit loop tidak pernah terletak pada objektifnya. Itu terletak pada apa yang diukur dan apa yang dimasukkan.
Yang merupakan jawaban jujur untuk pertanyaan yang berhak diajukan pembaca. Setup RL dikutip di tempat lain sebagai bukti tentang peningkatan diri secara umum; di sini, itu adalah bukti tentang satu loop pada tugas pengambilan keputusan. Hasil listwise adalah satu seed, dan proyek mengatakan demikian: perbandingan berpasangan RL versus supervised dijalankan pada induk yang berbeda dari yang digunakan oleh rilis tersebut, dan rilis itu "tidak memiliki kontrol supervised yang cocok." Temuan dengan peringatan seperti itu lebih bernilai daripada yang tanpa itu, dan itulah sebabnya halaman yang Anda baca tidak menggeneralisasinya.
Di mana manusia duduk
Proyek ini eksplisit, dan sifat eksplisitnya itulah bagian yang menarik: loop itu menjalankan eksperimennya sendiri dan memensiunkan juara-juaranya sendiri, tetapi ia tidak memutuskan apa yang layak diukur, dan ia tidak menyadarinya sendiri ketika sebuah angka secara teknis benar tetapi secara praktis menyesatkan. Manusia yang melakukannya.
Dua aturan milik proyek ini sendiri ada karena ada yang mengajukan keberatan. Guard MMLU-Pro diperlebar alih-alih membiarkan hasil yang nyaris meleset dibuang. Persyaratan seed kini diskalakan dengan ukuran efek alih-alih menghabiskan empat seed untuk setiap perbedaan — karena seed konfirmasi, satu angka yang tidak dijadikan dasar pemilihan sebuah arm, adalah yang menanggung beban, dan menghabiskan komputasi untuk perbedaan yang sudah bisa Anda lihat tidak ada gunanya. Salah satu rilis dalam rantai ini dimulai sebagai penolakan untuk membuang sebuah arm yang telah gagal dalam satu guard. Proyek ini mencantumkan nama orang-orang yang mengirim umpan balik itu di bagian ucapan terima kasih.
Jadi, 'memperbaiki diri sendiri' di sini menggambarkan bagian tengah loop, bukan keseluruhan loop. Loop itu adalah pencarian yang berjalan tanpa manusia yang memutar engkolnya. Manusia masih berada di puncak loop untuk memilih tujuan dan di dasarnya membaca hasilnya secara kritis — yang justru merupakan susunan yang mencegah loop itu menjadi mesin untuk mengonfirmasi preferensinya sendiri. Setiap uraian tentang peningkatan diri secara rekursif yang mengabaikan posisi itu sedang menggambarkan sistem yang berbeda dari sistem ini, dan mungkin sistem yang hipotetis.
Apa yang tidak ditunjukkan oleh angka proyek itu sendiri
Disiplin di atas hanya layak dijelaskan jika batas-batasnya dinyatakan dalam tarikan napas yang sama, dan rekam jejak RSI-Jev menyatakannya sendiri.
• Ini adalah satu proyek, satu ukuran model pada satu waktu, satu seed. Checkpoint yang dipublikasikan adalah milik satu seed, ditetapkan di muka sebagai yang utama, bukan dipilih untuk mendapatkan skor terbaik. Bukti RL-nya adalah satu seed.
• Ini adalah tugas keputusan, bukan generasi: pertanyaan ya/tidak, pilih-satu-dari-k, atau nilai-berdasarkan-rubrik atas sebuah dokumen, obrolan, atau gambar, yang dijawab dalam satu forward pass dengan probabilitas terkalibrasi per opsi. Tidak ada yang dihasilkan, jadi tidak ada token penalaran yang perlu dihabiskan. Yang ditunjukkan oleh loop di sini adalah bahwa ia dapat meningkatkan scorer berbentuk seperti itu.
• Sebagiannya tidak dapat direproduksi hanya dari repositori. Korpus pelatihan dan set pengembangan kebijakan tidak bersifat publik, dan proyek tersebut menyatakannya secara gamblang di kartu rilis: "tahapan-tahapan tersebut tidak dapat dijalankan ulang hanya dari repositori ini." Salah satu pembangun korpus membutuhkan sekitar 96 GB memori dan tidak dijalankan ulang secara menyeluruh.
• Tidak semuanya dapat diperiksa sama sekali. Suite internal tidak pernah sepenuhnya disisihkan. Dari lima belas tolok ukur, sepuluh menyumbangkan data pelatihan dalam suatu bentuk, jadi tidak ada satu pun dari angka-angka itu yang zero-shot — himpunan yang disisihkan adalah perbandingan yang disisihkan, dan hanya itu satu-satunya.
Dan bagian eksternal punya jaringan parutnya sendiri. Audit setelah satu rilis menemukan sekitar seribu item berupa baris uji kit benchmark publik di dalam korpus pelatihan — sekitar 0,3% dari baris kit tersebut, dengan kontribusi tunggal terbesar beberapa ratus baris dari satu sumber. Saat dinilai ulang tanpanya, indeksnya bergeser paling banyak 0,04. Koreksi itu diterbitkan di kartu rilis berikutnya, bukan diterapkan diam-diam, berdasarkan aturan yang dinyatakan proyek sebagai "tidak ada kontaminasi, diperiksa alih-alih hanya diklaim." Ini aturan yang membuat mereka kehilangan sebuah angka, dan hanya aturan semacam itulah yang layak dimiliki.
Di mana Anda benar-benar dapat menjalankannya — dan di mana Anda tidak bisa
Tidak ada apa pun di sini yang disediakan oleh OrcaRouter. Katalog kami tidak memuat ID RSI-Jev dan tidak memuat kartu model untuknya, dan itu tidak akan ada sampai ada yang menyediakannya. RSI-Jev dipasang dari repositori miliknya sendiri dan menjalankan servernya sendiri, yang berbicara dalam Jev API: Anda mengarahkan klien Jev yang sudah ada ke sana dan mengubah URL dasarnya. RSI-Jev berjalan di Linux, Windows, dan macOS, baik pada CUDA GPU, Apple Silicon, maupun CPU biasa.
The one model we do host is the other side of that contract. TypeSafe's Jev 1.13, which we serve as typesafe/jev-1.13, is the commercial decision model whose request and answer shapes RSI-Jev reproduces, and it is reached on our dedicated systemone endpoint rather than through the chat-completions shape. That is the whole relationship, and it is a structural one rather than a quality claim: one is a hosted commercial model on a vendor's endpoint, the other is a checkpoint you download and serve yourself. Nobody has run an independent head-to-head between them, and this page is not going to declare a winner from two different harnesses.

Jika yang Anda inginkan adalah menempatkan model keputusan seperti ini di balik sebuah aplikasi, pertanyaan routing terpisah dari pertanyaan model, dan itulah bagian yang menentukan apakah eksperimen itu layak dijalankan sama sekali. OrcaRouter adalah satu API untuk 200+ model dengan markup 0% — harga daftar penyedia diteruskan apa adanya, sehingga perubahan harga vendor menjadi harga Anda pada hari yang sama — plus failover otomatis dan DSL routing untuk menggabungkan beberapa model menjadi satu panggilan. Untuk model loop yang belum dapat Anda panggil melalui API umum, hal itu penting secara khusus: artinya kandidat alternatif yang akan Anda jadikan tolok ukur sudah berada di balik satu kunci, dan perbandingannya menjadi perubahan konfigurasi, bukan integrasi kedua.

Bagian yang layak dipertahankan
Alasan untuk menulis tentang perbaikan diri secara rekursif melalui proyek seperti ini, alih-alih melalui argumen tentang apakah hal itu mengarah ke suatu tempat yang dramatis, adalah bahwa aturan-aturan loop tersebut adalah bagian yang dapat ditransfer dan spekulasinya bukan. Prediksi yang terdaftar, dasar null yang terukur, set held-out yang terpakai, kegagalan yang diterbitkan, rantai rilis yang tidak dapat diubah: tak satu pun dari itu merupakan properti dari superinteligensi. Itu adalah properti dari laboratorium yang memutuskan untuk dapat diperiksa, dan itu tersedia bagi tim mana pun yang menjalankan pencarian otomatis hari ini, pada skala apa pun, pada model apa pun.
Jika dibaca seperti itu, klaim menarik dalam catatan RSI-Jev bukanlah skornya. Melainkan bahwa catatan milik loop itu sendiri mengatakan ia jauh lebih sering salah daripada benar — dua resep yang dipertahankan dari empat belas setup, tujuh negatif untuk menemukan bug satu baris, sebuah bar yang bergeser dan tercatat — dan bahwa proyek itu menerbitkan catatan tersebut. Kenaikan dari 38,38 ke 46,24 pada indeks publik dalam satu rilis adalah keanehan tanpa kegagalan-kegagalannya di sampingnya. Kegagalan-kegagalan itulah yang membuat angka itu berarti.
Itulah posisi yang jujur tentang istilah itu sendiri. Pertanyaannya bukan apakah suatu sistem dapat memperbaiki dirinya sendiri. Melainkan apakah peningkatan itu diukur oleh sesuatu yang bisa saja mengatakan tidak. Ketika pemisahan itu nyata dan tertulis, loop itu layak dibaca. Ketika tidak, garis yang menanjak adalah deskripsi tentang pemberi skor, bukan tentang sistem yang menjadi lebih baik — dan sebanyak apa pun rekursi tidak akan memperbaikinya.
