
Apa Itu RSI-Jev? Loop yang Memperbaiki Diri Sendiri yang Membangun Model Keputusan Bergaya Jev
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 145 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 296 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
RSI-Jev adalah proyek riset terbuka pihak ketiga yang membangun model keputusan System One bergaya Jev, dan model yang dibahas halaman ini adalah rilis 4B-nya, RSI-Jev v6.0-VL, bertanggal 2026-10-06. Proyek ini ditulis oleh Shanghua Gao (@gasvn), dengan Sufian (@SufianTA) dicantumkan dalam ucapan terima kasih repositori, dan ini bukan Jev milik TypeSafe dan tidak berafiliasi dengan TypeSafe AI — baris lisensi proyek sendiri menyatakan persis demikian. Ide di baliknya cukup sempit untuk dinyatakan dalam satu kalimat: ajukan pertanyaan bertipe tentang dokumen, obrolan, atau gambar — ya/tidak, pilih-satu-dari-k, nilai-berdasarkan-rubrik — dan satu forward pass mengembalikan probabilitas terkalibrasi untuk setiap opsi. Tidak ada yang dihasilkan, jadi tidak ada token penalaran yang perlu dihabiskan, dan tidak ada yang dihabiskan. v6.0-VL bukan rilis pertama proyek ini; ini adalah rilis ketujuh dalam dua belas hari, dan itulah satu hal terpenting yang perlu dipahami tentangnya, karena informasi berguna di sini terletak pada bentuk garisnya, bukan pada satu checkpoint mana pun.
Satu hal harus dikatakan sebelum angka-angka apa pun, karena itulah yang memberi tanggal pada semuanya. v6.0-VL berada di posisi terdepan selama tepat satu hari. Pada 2026-10-07 pukul 07:56 UTC — pagi ini — proyek menerbitkan RSI-Jev v6.1-VL, yang merupakan rata-rata dari v6.0-VL, masing-masing berbobot 0,5, dengan fine-tune kedua dari Qwen3.5-4B-Base yang sama yang dilatih pada data lain, dan yang mencetak 50,98 pada kit Decision Index 0.3 milik proyek, dibandingkan dengan 46,23 milik v6.0-VL pada kit yang sama. Tidak ada yang dilatih setelah proses rata-rata itu. Kalibrasinya lebih buruk daripada kalibrasi v6.0-VL, dan kartu modelnya sendiri menyatakan demikian. Rilis itu nyata dan terkini; halaman ini bukan tentang rilis itu. Setiap angka di bawah ini dibaca dari catatan rilis v6.0-VL, bertanggal 2026-10-06, dan jika ada hitungan yang berubah sejak saat itu — jumlah rilis, jumlah eksperimen — halaman ini memberikan kedua angka: angka sebagaimana posisinya untuk v6.0-VL dan angka sebagaimana terbaca hari ini.
Apa yang bukan RSI-Jev juga layak disebutkan sejak awal, karena dua dari tiga asumsi yang tampak jelas itu keliru. Ini bukan produk terkelola yang bisa Anda panggil hari ini melalui API umum, dan ini tidak dilayani oleh OrcaRouter — katalog kami tidak memuat id rsi-jev, tidak ada id shgao, dan tidak ada kartu model untuknya. Satu hal yang kami miliki adalah model yang kontrak HTTP-nya disalin oleh proyek ini: Jev komersial milik TypeSafe, yang kami layani sebagai typesafe/jev-1.13 di endpoint systemone. Dari keduanya, satu Anda panggil, dan yang lain Anda unduh lalu layani sendiri. Semua yang berikut berasal dari repositori proyek itu sendiri, kartu rilis, dan dokumentasi penyajiannya, yang dibaca pada 2026-10-07, dan jika suatu angka berasal dari proyek itu sendiri alih-alih dari pengukuran luar, halaman ini menyebutkan milik siapa angka itu.

Apa yang sebenarnya dilakukan benda itu
Proyek ini mendeskripsikan dirinya dalam satu baris sebagai "sistem riset yang meningkatkan diri secara rekursif yang membangun model System One bergaya Jev," dan artefak yang dihasilkannya adalah penentu, bukan generator. Anda memberikan sebuah state — dokumen, transkrip obrolan, transaksi, dan dalam rilis vision hingga empat gambar — serta satu atau lebih pertanyaan bertipe dengan kriteria bernama. Sistem ini mengembalikan, untuk setiap pertanyaan, probabilitas untuk setiap opsi. Tiga jenis pertanyaan mencakup ruang tersebut, dan itulah yang didefinisikan oleh API TypeSafe:
• noul — penilaian benar/salah, dikembalikan sebagai satu probabilitas tunggal, tanpa distribusi dan tanpa nilai keyakinan, persis menyesuaikan bentuk jawaban referensi.
• choice — pilih salah satu dari sekumpulan opsi berlabel, yang dikembalikan beserta distribusi probabilitas lengkap dan statistik keyakinan.
• skor — nilai berdasarkan rubrik berjenjang, dikembalikan sebagai indeks berbasis nol dengan pembobotan probabilitas ke dalam tingkat, beserta legenda dan distribusinya.
Karena tidak ada langkah generasi, tidak ada panggilan model kedua dan tidak ada sampling. Keputusan tentang dokumen yang sudah dibaca model adalah operasi murah secara desain, dan klaim proyek itu sendiri untuk biaya tersebut — "sekitar 10 ms" — berasal dari era 2B-nya, bukan dari rilis saat ini; angka terukur untuk v6.0-VL diberikan lebih jauh di bawah.
Dua fakta tentang kepemilikan lebih penting daripada apa pun di halaman ini. RSI-Jev bukan karya TypeSafe dan TypeSafe tidak memberikan dukungan resmi terhadapnya. Baris lisensi, dikutip selengkapnya: "Kode: MIT. Bobot: Apache-2.0, mengikuti model dasar; beberapa sumber pelatihan gambar bersifat non-komersial, tercantum di setiap kartu model. Tidak berafiliasi dengan TypeSafe AI." Dan hubungannya bersifat satu arah: proyek ini dengan sengaja meniru format wire Jev, dan mengatakannya secara terbuka, karena intinya adalah server yang kompatibel. "Jev-style" adalah frasa milik proyek itu sendiri untuk jenis model yang dibangunnya. Jev milik TypeSafe adalah model komersial tertutup yang berbeda, dan keduanya bukanlah hal yang sama hanya karena nama yang lebih pendek.
Di dalam model saat ini: sebuah tower Qwen 4B dengan tiga keluaran.
RSI-Jev v6.0-VL adalah tower Qwen3.5-4B-Base yang di-fine-tune dengan head keputusan terlatih di atasnya. Itulah keseluruhan arsitekturnya — tidak ada mixture of experts, tidak ada router, dan tidak ada model kedua. Ini menjalankan seluruh model dasar, itulah sebabnya jumlah parameternya 4,69 miliar dan bukan sesuatu yang lebih kecil: 3,57 miliar berada di 32 lapisan decoder, 0,64 miliar di token embeddings, 0,33 miliar di tower visi, 0,05 miliar di head keputusan utama, dan 0,10 miliar di dua head early-exit. Checkpoint yang dirilis bersifat mandiri dan berukuran 9,7 GB dalam bf16.
Tiga kepala keputusan dipasang, pada lapisan 16, 20, dan 32 dari basis, dan itulah mekanisme di balik segala hal yang membuat rilis saat ini dikenal. Exit keempat pada lapisan 12 dibuat, diukur, dan dibuang — "Exit lapisan 12 kalah oleh kaskade dari 16 dalam setiap perbandingan dan tidak ada dalam paket" — jadi tiga dikirim dan empat tidak. Exit-exit tersebut membaca salinan terlepas dari lapisannya, sebuah detail yang ditemukan proyek dengan susah payah: menyetel ulang kepala pada trunk yang exit-nya telah dipasang selama pelatihan tidak memulihkan akurasi lapisan-lapisan dalam, jadi melepaskannya adalah yang memulihkan kedalaman.
Satu angka di sini adalah cara termudah untuk salah membaca proyek ini. Semuanya hingga dan termasuk v3.0 adalah model 2B pada Qwen3.5-2B-Base, dan itulah garis keturunannya, bukan model saat ini. v4.0-VL adalah 2B, v5.0-VL memangkas model menjadi 3B, dan v6.0-VL adalah 4B. Halaman yang menyebut model RSI-Jev saat ini 2B sudah tertinggal tiga rilis.
Loop-nya adalah proyek yang sebenarnya.
Model adalah outputnya; hal yang sedang dibangun adalah prosesnya. Proyek tersebut menyatakan bahwa "loop yang menjalankan riset adalah versi berikutnya dari AutoScientists," sistem tim agen yang mengatur diri sendiri yang diterbitkan oleh lab Zitnik di Harvard, dan cara kerjanya seperti yang tersirat dari kalimat itu. Agen AI mengusulkan hipotesis, mendaftarkan prediksi mereka sebelum menghabiskan waktu GPU, menjalankan eksperimen, dan memensiunkan juara mereka sendiri ketika bukti berkata demikian. Dua angka membuatnya konkret. Per 2026-10-07, tajuk utama repositori adalah delapan rilis dalam tiga belas hari, dari v1.0 hingga v6.1-VL; untuk rilis v6.0-VL sendiri pada 2026-10-06, tertulis tujuh rilis dalam dua belas hari, masing-masing dilatih, dievaluasi, dan didokumentasikan oleh loop. Dan jumlah eksperimen, yang berada di 471 ketika rilis halaman ini dikirim, terbaca 496 hari ini — semuanya dituliskan, termasuk kegagalan. Kedua angka itu milik proyek sendiri, dan keduanya bergerak.
Disiplin inilah yang membuat angka-angka itu bermakna, dan proyek mencantumkannya secara terang-terangan. Dasar null diukur, bukan diasumsikan — kelompok perlakuan yang terbukti identik dengan kontrol, diverifikasi melalui identitas objek sebelum ada waktu GPU, sehingga sebaran di antara keduanya adalah lantai derau dan selisih yang lebih kecil daripada sebaran itu bukanlah hasil. Prediksi didaftarkan sebelum eksperimen dijalankan, sehingga versi yang gagal memenuhi ambangnya sendiri dirilis sebagai kegagalan alih-alih diam-diam dipotong ulang. Artefak diverifikasi: checkpoint dimuat ulang dari disk dan dinilai ulang, lalu dipublikasikan hanya jika mereproduksi prediksi per pertanyaan dari proses pelatihannya, yang dilakukan oleh kedua checkpoint v1.0 pada 1.0000. Kontaminasi "diperiksa, bukan sekadar ditegaskan." Dan kegagalan dirilis, termasuk kegagalan yang menumbangkan juara proyek itu sendiri.
Apa itu kontribusi, dalam kata-kata proyek sendiri dari panduan kontribusinya: "Kontribusi di sini biasanya berupa pengukuran, bukan patch." Catatan rilis disimpan sebagai rantai, bukan sebagai snapshot — "versions/ menyimpan satu kartu per rilis, semuanya, di main selamanya… Rantai itu ADALAH proyek" — itulah sebabnya angka-angka dari rilis lama dapat diperiksa terhadap apa yang dikatakan proyek tentangnya nanti, dan mengapa satu koreksi yang dibahas di bawah ini terlihat, bukan senyap.
Apa yang diubah v6.0-VL: ia menghabiskan kedalaman, bukan token
Mekanisme rilis saat ini adalah pengaturan bernama effort, dan ia mengendalikan sesuatu yang tidak biasa: berapa banyak lapisan model yang boleh digunakan oleh suatu permintaan. Karena head berada pada tiga kedalaman, pertanyaan yang mudah dapat dijawab pada lapisan 16 dan pertanyaan yang sulit dapat menjalankan semua 32 lapisan. low berhenti di lapisan 16, medium pada 20, high pada 32, dan auto menjawab pada exit pertama yang probabilitas terkalibrasinya melewati ambang exit tersebut. Latensi median per permintaan pada sampel Decision Index, diukur pada satu H200 dalam bf16: 23 ms pada low, 27 ms pada medium, 40 ms pada high, dan 40 ms untuk default yang tidak diatur. Ini adalah pengukuran proyek itu sendiri pada perangkat kerasnya sendiri dan tidak boleh dicampur dengan angka GB10 dari dokumentasi serving, yang merupakan mesin berbeda.
Perilaku terukur dari auto adalah bagian yang menarik: pada rangkaian lima belas benchmark proyek ini, 20% pertanyaan berhenti di lapisan 16, 46% di lapisan 20, dan 34% berjalan hingga 32, yang rata-ratanya 23,3 dari 32 lapisan. Ambang tetap tunggal rata-ratanya 20,9, dan berhenti berlebihan adalah yang Anda dapatkan dari ambang tunggal. auto bukanlah kompromi pada kualitas, yang perlu dinyatakan karena biasanya itulah arti pengaturan adaptif: ia mencatat baris rangkaian terbaik di antara semua pengaturan (0,771 versus 0,770 untuk default), baris MMLU-Pro terbaik (0,444 versus 0,440), dan kalibrasi akhir terbaik (ECE 0,024 versus 0,036). Satu-satunya tempat high menang adalah set held-out, 0,702 berbanding 0,696 milik auto. Beberapa tugas terbukti jadi lebih buruk seiring bertambahnya kedalaman — BANKING77 sebesar 0,035, pencocokan takarir New Yorker sebesar 0,060 — itulah sebabnya tingkat upaya adalah pilihan yang dibuat oleh pemanggil, bukan aturan yang dipaksakan oleh server.
Hasil yang membuat ini menjadi rilis alih-alih eksperimen ada di Decision Index publik proyek, 0.2.1, dengan skor naik dari 38.38 untuk v5.0-VL menjadi 46.24 untuk v6.0-VL dalam satu rilis. Pada papan publik bertanggal 2026-09-28, itu adalah skor tertinggi di antara model 4B dan apa pun yang lebih kecil, dan peringkat ke-14 dari 71 secara keseluruhan; entri berikutnya pada ukuran itu adalah JPT-4B dengan 43.04. Rilis-rilis sebelumnya pada lini ini adalah bagian dari silsilah, bukan model saat ini: v5.0-VL (2026-10-02) memangkas model menjadi 20 lapisan pertama dari 32 lapisan dan membuatnya mengatakan "unknown" ketika sebuah pertanyaan tidak memiliki jawaban; v4.0-VL (2026-10-01) adalah yang pertama membaca gambar; dan v3.0 (2026-09-28) adalah rilis saat pembelajaran penguatan pertama kali membantu, melalui imbalan pemeringkatan listwise — NDCG@5 atas 16 kandidat — yang menaikkan R@1 pemeringkatan ulang dari 0.192 menjadi 0.308 terhadap induk terawasi-nya dengan biaya 0.0028 pada suite. Di situlah cerita RL proyek ini dimulai, dan sekarang sudah tiga rilis ke belakang.

Angka-angkanya, beserta catatan-catatan yang menyertainya.
Angka utama The Decision Index 0.2.1 untuk v6.0-VL adalah 46,24, pada proses penuh di mana seluruh 150.759 permintaan suite dijawab: pengetahuan 28,8, bahasa 46,2, pengambilan 55,5, alat 65,8, seni 37,1. Suite lima belas benchmark menunjukkan 0,770, set held-out 0,698, MMLU-Pro 0,440, dan ECE akhir 0,024 dengan otomatis. Dua peringatan harus disebutkan dalam satu tarikan napas dengan angka-angka tersebut, karena tanpa keduanya angka-angka itu menyesatkan.
Yang pertama adalah pemotongan dalam suite. Tugas suite internal open_jev_ood tumpang tindih dengan 579 baris pelatihan, sehingga angkanya digelembungkan oleh jumlah yang tidak diketahui; mulai dari v6.0-VL dan seterusnya proyek melaporkan suite tanpa tugas itu, pada 0,770. Angka 0,764 milik v5.0-VL dihitung dengan tugas itu, dan kartu v6.0-VL menyatakan ulang rilis tersebut sebagai 0,763 tanpanya. Kedua angka itu tidak dapat dibandingkan, dan jika Anda memang membandingkannya, Anda harus menggunakan angka 0,763 yang dinyatakan ulang dan menyatakan bahwa itulah yang Anda lakukan. Set held-out, MMLU-Pro, dan BBH tidak memiliki tumpang tindih dan tidak terpengaruh. Audit terkait menemukan sekitar 1.000 item dari baris uji kit Decision Index dalam korpora pelatihan — ANLI 274, RouterBench-GSM8K 90, ARC 5, dan teks kueri BRIGHT/ToolRet tanpa label, kira-kira 0,3% dari baris kit tersebut — dan penskoran ulang tanpa item-item itu menggeser indeks paling banyak sebesar 0,04 pada sampel proyek. Itu adalah koreksi terhadap catatan v5.0-VL, yang diterbitkan dalam kartu v6.0-VL, dan itu adalah aturan kontaminasi milik proyek sendiri yang membuatnya kehilangan satu angka.
Yang kedua adalah tentang milik siapa tolok ukur ini. Decision Index adalah papan publik milik RSI-Jev sendiri, bukan penilaian pihak ketiga, dan 46.24 adalah skor pada papan tersebut. Ini tidak dapat dibandingkan dengan apa pun yang telah diterbitkan TypeSafe, karena kedua angka tersebut tidak berasal dari perangkat uji yang sama, dan tidak ada yang menjalankan perbandingan langsung independen antara RSI-Jev dan Jev 1.13. Apa yang dapat dikatakan bersifat struktural, bukan numerik: satu adalah model komersial yang dihosting pada endpoint vendor, dan yang lainnya adalah checkpoint yang Anda unduh dan layani sendiri.
Dua bagian konteks tambahan termasuk dalam kumpulan ini. Proyek ini secara eksplisit menyatakan bahwa "sepuluh dari lima belas benchmark menyumbangkan data pelatihan dalam suatu bentuk, jadi tidak ada dari angka-angka ini yang zero-shot"; kumpulan yang ditahan adalah perbandingan yang ditahan, dan bahkan kumpulan itu "ditahan dari pelatihan, bukan disegel dari pencarian." Dan v6.0-VL menjalankan 97 arm pada jalurnya sendiri — 93 jika empat audit data dikeluarkan — yang merupakan skala pencarian yang menghasilkan lonjakan 7,86 poin pada indeks itu.
Ini menggunakan format wire Jev, dengan empat perbedaan yang perlu diketahui pemanggil.
Permukaan kompatibilitas adalah alasan proyek ini ada dalam bentuknya seperti sekarang. Bentuk permintaan yang sama ({state, model, questions}), tiga tipe pertanyaan yang sama dengan bentuk kriteria yang sama, bentuk jawaban yang sama, jumlah pertanyaan 1 hingga 64 per permintaan yang sama, amplop error yang sama, dan statistik keyakinan yang sama — puncaknya, (K · p_max − 1) / (K − 1), dibatasi ke 0..1. Klaim proyek itu sendiri tentang permukaan tersebut adalah bahwa "apa pun yang ditulis untuk Jev berfungsi pada ini tanpa perubahan," dan server mendokumentasikan apa yang disalin dan apa yang tidak, yang lebih berguna daripada klaim itu.
• Prompt dan hasil bacaannya adalah miliknya sendiri. RSI-Jev adalah model dasar dengan head readout yang terlatih, dilayani bersama encoder yang digunakan saat melatihnya, karena memakai prompt dari referensi "akan membawa model keluar dari distribusi pelatihannya." Kontrak wire adalah permukaan kompatibilitas; prompt bukan.
• Kunci opsi terlihat oleh model. Referensi menyembunyikannya, sehingga mengganti nama kunci terbukti tidak dapat mengubah jawaban di sana. Di sini hal itu bisa, dan server melaporkannya secara jujur sebagai option_keys_visible_to_model: true.
• Kriteria harus berupa string atau null. Kriteria terstruktur — sebuah objek — ditolak dengan kode 422, karena tidak ada rilis yang dilatih dengan kriteria semacam itu. Inilah satu-satunya tempat di mana permintaan yang diterima oleh referensi tidak akan berjalan di sini.
• Tidak ada yang dipotong. Penyajian menerima hingga 32.768 token teks ditambah kuota gambar, dan permintaan yang lebih panjang ditolak dengan 422 yang menyatakan hal itu alih-alih dipotong secara diam-diam. Angka 2.048 token yang muncul di kartu lama adalah panjang yang model-model dilatih padanya, bukan batas penyajian, dan menggambarkan pemotongan diam-diam menjadi 2.048 sebagai perilaku saat ini adalah salah.
Jumlah opsi berbeda jauh dengan selisih besar yang menguntungkan serving: hingga 5.120 opsi per pertanyaan (RSIJEV_MAX_ANSWERS), dibandingkan 160 dalam pelatihan dan 64 yang diakui oleh referensi. Jangan mengutip 160 sebagai batas maksimum serving. Satu hal yang baru dalam respons v6.0-VL, bukan diwarisi: setiap jawaban melaporkan lapisan mana yang menjawab, di usage.depth, bersama dengan keyakinan yang terkalibrasi, sehingga keputusan adaptif dapat diaudit setelah kejadian. Gambar adalah ekstensi yang tidak dimiliki referensi — satu hingga empat per permintaan, sebagai URL data base64, dengan state merujuk pada masing-masing melalui penanda literal.
Di mana pembaca benar-benar dapat menjalankannya, dan di mana mereka tidak bisa
RSI-Jev adalah sebuah unduhan. Proyek ini menyertakan servernya sendiri, yang mengimplementasikan API yang kompatibel dengan Jev, dan rute yang didokumentasikan adalah pip install dari repositori yang diikuti dengan perintah serve-nya dengan alias checkpoint dan pengaturan effort. Bobotnya tersimpan di Hugging Face di bawah organisasi shgao, dirilis di bawah Apache-2.0 mengikuti model dasar, dengan satu pertanyaan terbuka yang dinyatakan sendiri oleh proyek: lima dari sumber pelatihan gambar bersifat nonkomersial atau hanya untuk riset, dan "apakah bobot yang dilatih pada data nonkomersial mewarisi ketentuan tersebut masih belum pasti." Kodenya MIT.
Perangkat keras bukanlah kendala. Proyek ini dikembangkan pada HP ZGX Nano, mesin NVIDIA GB10 yang oleh proyek ini dikreditkan kepada HP dan NVIDIA, dan server-nya berjalan di GPU CUDA apa pun, di Apple Silicon, atau di CPU biasa — yang terakhir menurut dokumentasi memerlukan 733 ms untuk satu pertanyaan di CPU Arm milik GB10 sendiri, jadi dapat digunakan, bukan cepat.
Yang tidak dilakukannya adalah muncul di katalog model umum, dan di sinilah kita harus tepat mengenai posisi kita sendiri. RSI-Jev tidak ada di OrcaRouter dan tidak ada kartu model untuk dirutekan. Yang kami layani adalah Jev komersial milik TypeSafe, typesafe/jev-1.13, pada endpoint systemone khusus, yang diakses dengan POST ke /v1/systemone dan bukan bentuk chat-completions OpenAI — bentuk permintaan dan jawaban yang sama dengan yang diimplementasikan proyek ini, dari model yang kontraknya disalin. Itulah keseluruhan hubungannya: keduanya berbicara dengan protokol yang sama, kami melayani salah satunya, dan Anda menjalankan yang lainnya sendiri. Jika Anda sudah memegang kunci dengan kami, bentuk panggilan Jev 1.13 adalah rute kelas satu di satu API untuk 200+ model dengan markup 0% (harga daftar penyedia diteruskan apa adanya, jadi potongan harga vendor langsung berlaku di sini pada hari yang sama) — yang penting bagi perbandingan ini dalam satu cara yang spesifik. Halaman seperti ini murah untuk ditindaklanjuti jika Anda dapat mencoba kontrak komersialnya lebih dulu dan baru kemudian memutuskan apakah menjalankan checkpoint 4B terbuka sendiri sepadan dengan kerja operasionalnya.

Cara membaca RSI-Jev pada 2026-10-07
Kelemahan yang dipublikasikan proyek ini sama spesifiknya dengan hasilnya, dan tanggalnya penting. Pengujian eksternal terhadap v2.1 menemukan bahwa model cenderung memilih opsi yang lebih berat atau lebih mahal pada pilihan berurut dan skor rubrik, jarang memilih "unknown" ketika dokumen tidak dapat menjawab, serta menjawab sebuah pertanyaan dan negasinya secara tidak konsisten. Rilis-rilis berikutnya mengarahkan data ke kasus "unknown" — KoBBQ unknown-when-ambiguous menjadi 0.891 pada v4.0-VL, 0.932 pada v5.0-VL, dan 0.918 / 0.939 pada v6.0-VL — dan kartu v6.0-VL secara jujur menyatakan bahwa perolehan itu berasal dari data, bukan dari kedalaman, dan bahwa 10% pertanyaan yang seharusnya menuju layer 32 tetapi berhenti di 16 atau 20 adalah bagian yang masih menjadi tebakan kebijakan kedalaman. Reranking masih harus melangkah lebih jauh: urutan pengambilan hippo-memory sendiri mencetak 0.484 R@1 dan masih berada di depan 0.308 yang dicapai model pada v3.0, angka yang belum pernah diklaim proyek ini berhasil ditutup sejak saat itu. Bukti RL-nya hanya satu seed, dan v3.0 "sendiri tidak memiliki kontrol SFT yang setara." Korpus pelatihan dan set pengembangan kebijakan tidak dipublikasikan, sehingga tahapan-tahapannya tidak dapat dijalankan ulang hanya dari repositori, dan pembangun korpus reranking — sekitar 96 GB memori — tidak dijalankan ulang secara menyeluruh.
Traction, dibaca pada hari yang sama: 73 bintang, 5 fork, 0 isu terbuka, 7 rilis GitHub. Angka-angka itu bergerak setiap hari, dan repositori yang berusia tiga minggu bukanlah proyek yang mapan, apa pun irama rilisnya. Ringkasan yang jujur adalah bahwa RSI-Jev adalah salah satu upaya riset yang lebih mudah dibaca di sudut bidang ini — rangkaian rilis bertanggal, terukur, kadang kalah, dengan pencariannya diterbitkan bersama skornya — dan salah satu yang paling sedikit diverifikasi secara independen, karena hampir setiap angka di halaman ini berasal dari dirinya sendiri dan tidak ada pihak luar yang membandingkannya dengan model komersial yang kompatibel dengannya.
Yang perlu diperhatikan bukanlah rilis berikutnya, karena akan ada satu dalam beberapa hari pada kadensi ini; yang perlu diperhatikan adalah apakah ada sesuatu di luar proyek yang mulai mengukur. Dua hal yang akan mengubah gambaran adalah uji benchmark independen yang dijalankan pada checkpoint yang dipublikasikan, dan perbandingan model keputusan yang menempatkan model 4B terbuka dan model yang dihosting TypeSafe melalui satu harness. Keduanya belum ada saat ini. Sampai salah satunya ada, cara yang berguna untuk membaca skor seperti 46.24 adalah sebagai klaim yang terdokumentasi dengan baik dari proyek yang mendaftarkan prediksinya di muka dan merilis varian yang gagal — yang merupakan jejak bukti yang lebih kuat daripada kebanyakan, dan tetap bukan hasil pihak ketiga.
