
RSI-Jev vs Jev 1.13: Satu Anda Unduh, Satu Anda Panggil
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Letakkan RSI-Jev v6.1-VL 4B dan Jev 1.13 berdampingan dan hal pertama yang diperhatikan seorang pemanggil adalah bahwa keduanya adalah permintaan yang sama. Berikan kepada salah satu dari keduanya sebuah state dan serangkaian pertanyaan bertipe — ya/tidak, pilih-satu-dari-k, nilai-berdasarkan-rubrik — dan keduanya mengembalikan probabilitas terkalibrasi untuk setiap opsi, dalam satu forward pass, tanpa teks yang dihasilkan untuk diurai. Itu bukan kebetulan: RSI-Jev dibangun untuk berbicara dalam format wire Jev secara sengaja, sehingga klien yang ditulis untuk API TypeSafe dapat berjalan terhadapnya hanya dengan mengubah base URL. Yang tidak sama adalah segala sesuatu di sekitar panggilan tersebut. Jev 1.13 adalah model komersial tertutup milik TypeSafe, yang dilayani dari endpoint yang Anda ukur; RSI-Jev v6.1-VL adalah checkpoint 4,69B parameter dengan bobot Apache-2.0 yang Anda unduh dan layani di perangkat keras Anda sendiri. Tidak ada yang merupakan rebranding dari yang lain, tidak ada vendor yang mendukung yang lain, dan hampir setiap angka dalam perbandingan ini berasal dari pihak yang memproduksinya.
Tanggal pada subjek ini penting, karena proyek ini merilis versi kira-kira setiap hari. RSI-Jev v6.1-VL 4B diterbitkan pada 2026-10-07 oleh pihak ketiga Shanghua-Gao/RSI-Jev proyek — sebuah loop penelitian yang memperbaiki diri sendiri yang melatih model keputusan bergaya Jev dan menerbitkan setiap arm yang gagal bersama dengan yang menang. Ini adalah rilis kedelapan dalam tiga belas hari pada lini itu, dan ini adalah rata-rata berbobot dari rilis sebelumnya dengan fine-tune kedua dari Qwen3.5-4B-Base yang sama. Jev 1.13 adalah model TypeSafe AI, diluncurkan pada 2026-09-15 dan tercantum di katalog kami sendiri sejak 2026-09-24. Kedua tanggal itu penting di bawah ini, karena perbandingan terhadap proyek yang bergerak setiap hari memiliki masa berlaku yang diukur dalam hitungan hari.
Apa sebenarnya keduanya, masing-masing dalam satu baris
Jev 1.13 adalah model keputusan yang dihosting di balik endpoint khusus — POST /v1/systemone, non-streaming, dengan anggaran input sekitar 64.000 token yang mencakup state dan semua pertanyaan Anda sekaligus, dihargai $0,042 per juta token input dengan output ditagih nol karena tidak ada token output. Arsitektur, jumlah parameter, dan komputasi pelatihannya tidak diungkapkan; TypeSafe mengatakan bahwa detailnya dirahasiakan dan sebuah makalah mungkin menyusul. Anda tidak menjalankannya. Anda memanggilnya, dan setiap panggilan adalah permintaan jaringan yang terukur.
RSI-Jev v6.1-VL adalah susunan lainnya secara lengkap. Ini adalah menara Qwen3.5-4B-Base yang disetel halus dari ujung ke ujung, dengan kepala keputusan di lapisan 16, 20, dan 32, dilayani dari checkpoint yang mandiri dan berukuran 9,7 GB dalam bf16. Jumlah parameternya adalah 4,69B dan penting untuk mengetahui ke mana perginya: 3,57B di 32 lapisan dekoder, 0,64B di penyematan token, 0,33B di menara visi, 0,05B di kepala keputusan utama, dan 0,10B di dua kepala early-exit. Tidak ada campuran pakar dan tidak ada model kedua. Anda menginstalnya dengan perintah pip dari repositori, menjalankan servernya, dan sejak saat itu keputusan tidak pernah meninggalkan infrastruktur Anda.
• Siapa yang menjalankannya — endpoint terhosting berbayar berdasarkan pemakaian yang tidak Anda kendalikan vs checkpoint 9,7 GB di GPU, Apple Silicon, atau CPU Anda sendiri.
• Bentuk harga — $0,042 per juta token input, output gratis, dibayar per panggilan vs nol pada margin ditambah biaya mesin dan operasionalnya.
• Anggaran input — sekitar 64.000 token per permintaan pada model yang dihosting vs 32.768 token teks plus anggaran gambar pada checkpoint, dengan apa pun yang lebih panjang ditolak alih-alih dipotong.
• Bobot dan lisensi — tertutup, ukuran tidak diungkapkan vs bobot Apache-2.0, kode MIT, 4,69 miliar parameter.
• Modalitas — teks untuk kontrak Jev vs teks plus hingga empat gambar per permintaan pada rilis visi RSI-Jev.
• Kepemilikan — Model komersial TypeSafe AI vs proyek riset pihak ketiga yang menyatakan dalam baris lisensinya sendiri bahwa "Tidak berafiliasi dengan TypeSafe AI."
Skor di papan RSI-Jev sendiri, dan mengapa itu hanya setengah perbandingan
Angka yang dijadikan andalan proyek ini adalah skor Decision Index 0.3-nya: 50,98 untuk v6.1-VL 4B, naik dari 46,23 untuk rilis sebelumnya. Itu adalah uji coba penuh dari konfigurasi default — 140.178 permintaan, cakupan 1,0 — dan pada papan publik proyek itu sendiri, bertanggal 2026-10-06, model ini menyamai model 4B terbaik di papan tersebut (50,98 versus 50,82 milik ezjev 4B s2, yang oleh kit dianggap seri pada 0,25) dan berada di peringkat 27 dari 113 secara keseluruhan. Pada Decision Index 0.2.1 yang lebih lama, nilainya 50,74 dibandingkan 46,24 milik v6.0-VL. Suite lima belas benchmark-nya, dilaporkan tanpa open_jev_ood yang ditemukan tumpang tindih dengan baris pelatihan, adalah 0,793, dan set held-out-nya adalah 0,729.
Setiap angka tersebut adalah milik RSI-Jev sendiri, diukur pada perangkat uji RSI-Jev. Decision Index adalah papan tolok ukur publik, tetapi tidak ada pembacaan Jev 1.13 di dalamnya, karena suite proyek itu dibangun untuk memberi skor pada checkpoint keputusan terbuka dan Jev adalah endpoint tertutup. Jadi, godaan untuk membandingkan 50,98 dengan 0,727 milik Jev pada tolok ukur typed-decisions dan menyatakan pemenang adalah justru kesalahan yang harus dihindari: kedua angka itu berasal dari perangkat uji yang berbeda, ukuran sampel yang berbeda, dan data yang berbeda, dan tidak ada yang pernah menjalankan satu perangkat uji pada kedua model.

Satu-satunya perbandingan langsung yang ada adalah milik Laya, bukan milik RSI-Jev.
Ada satu perbandingan yang dipublikasikan yang memang menempatkan angka Jev di samping sebuah checkpoint terbuka, dan perbandingan itu tidak dijalankan oleh pihak mana pun di sini. Convai Innovations, pembuat model keputusan Laya, mentabulasi angka Jev 1.13.0 yang dipublikasikan TypeSafe berhadapan dengan angka mereka sendiri dan menandai sendiri keterbatasannya: angka-angka Jev dipublikasikan oleh pihak ketiga dan tidak pernah diukur oleh Convai, ukuran sampel dan prompt-nya berbeda, dan vendor tersebut tidak mencantumkan benchmark-nya sendiri untuk model itu. Tabel itu layak dibaca untuk kalibrasi, bukan untuk putusan — dan tabel itu sama sekali tidak menyertakan RSI-Jev, karena RSI-Jev belum ada ketika tabel itu dipublikasikan.
Yang ditunjukkannya adalah bentuk pertanyaan hosted-versus-open yang sebenarnya sedang dipertimbangkan pembaca. Model hosted unggul ketika ruang opsi besar dan model harus menjaga kumpulan jawaban yang luas tetap stabil; model open menang pada latensi mentah per panggilan karena tidak ada jaringan di jalurnya. Tidak ada apa pun dalam pola itu yang memberi tahu Anda model mana dari dua model spesifik ini yang lebih baik untuk tugas Anda, dan posisi yang jujur adalah bahwa jawabannya belum ada di publik.
Apa yang diberikan checkpoint yang tidak dapat diberikan endpoint
Argumen terkuat untuk RSI-Jev bukanlah sebuah skor. Argumennya adalah bahwa bobotnya berada di disk Anda. Untuk keputusan perutean yang dibuat berdasarkan rekam medis, dokumen hukum, atau riwayat akun pelanggan, "data tidak pernah meninggalkan gedung" bukanlah preferensi yang Anda tukar dengan satu poin benchmark — ini adalah persyaratan keras, dan tidak ada endpoint yang dihosting, berapa pun harganya, yang dapat memenuhinya. Sifat yang sama menghilangkan rate limit: dokumentasi vendor sendiri untuk model yang dihosting mencatat bahwa batasnya disesuaikan secara dinamis dan dapat berubah tanpa pemberitahuan, dan checkpoint yang dihosting sendiri tidak memiliki batas atas seperti itu selain perangkat keras Anda.
Hal kedua yang diperoleh dari checkpoint adalah kontrol kedalaman, dan itu tidak biasa. Karena head keputusan berada di tiga kedalaman, sebuah pengaturan upaya memilih berapa banyak lapisan yang boleh digunakan oleh sebuah permintaan: rendah berhenti di lapisan 16 dengan sekitar 23 ms median, sedang di lapisan 20 dengan 27 ms, tinggi di lapisan 32 dengan sekitar 40 ms, dan otomatis menjawab pada exit pertama yang cukup yakin, dengan rata-rata 19,5 dari 32 lapisan pada suite proyek. Latensi tersebut adalah angka proyek itu sendiri yang diukur pada satu H200 dalam bf16 dan tidak boleh dicampur dengan angka hosted mana pun — forward pass lokal dan panggilan API terukur bukan pengukuran yang sama, dan dokumentasi RSI-Jev sendiri secara eksplisit menyatakan bahwa perbandingan sebelumnya terhadap latensi yang dipublikasikan Jev mempertemukan kerja GPU lokal dengan round-trip jaringan.
Hal ketiga adalah gambar. Kontrak Jev adalah teks masuk, JSON terstruktur keluar. Rilis visi RSI-Jev menerima satu hingga empat gambar per permintaan sebagai URL data base64, dengan state merujuk ke masing-masing melalui sebuah penanda, dan v6.1-VL mencetak skor 0,834 pada set gambar held-out proyek. Jika keputusan Anda adalah "apakah foto menunjukkan kerusakan yang terlihat", itu adalah kemampuan yang sama sekali tidak ditawarkan oleh kontrak yang dihosting.
Yang Anda korbankan juga nyata, dan proyek ini mempublikasikannya. Kalibrasi justru memburuk pada rilis ini, bukan membaik: galat kalibrasi ekspektasi final adalah 0,048 pada lapisan 32 dan 0,055 dengan otomatis, dibandingkan 0,036 dan 0,024 pada rilis sebelumnya. Ambang tunggal default 0,95 dirilis secara eksplisit sebagai belum dikonfirmasi — ini adalah cadangan dari aturan pemilihan yang pilihannya sendiri, 0,85, gagal memenuhi batas kedalaman proyek pada separuh data pengembangannya. Jalur keluar awal hanya membaca teks, sehingga pertanyaan apa pun yang disertai gambar menjalankan seluruh 32 lapisan terlepas dari upayanya. Dan lima dari sumber pelatihan gambar bersifat nonkomersial atau hanya untuk riset, dengan proyek tersebut menyatakan secara gamblang bahwa apakah bobot yang dilatih pada data nonkomersial mewarisi ketentuan tersebut masih belum dipastikan.
Di mana memanggil yang dihosting, dan di mana tidak.
Ini adalah bagian dari perbandingan yang menjadi kepentingan kami, jadi perlu ketelitian. Kami menyajikan model komersial TypeSafe sebagai typesafe/jev-1.13 pada endpoint systemone khusus — sebuah POST ke /v1/systemone alih-alih bentuk chat-completions OpenAI, non-streaming, dengan konteks 65.536 token yang tercantum dalam katalog kami. Ini adalah bentuk permintaan dan jawaban yang sama dengan yang diimplementasikan RSI-Jev, dari model yang kontraknya disalin oleh proyek tersebut. RSI-Jev sendiri tidak kami hosting; tidak ada id rsi-jev dan tidak ada id shgao dalam katalog kami, dan pembaca yang menginginkan model itu mengunduhnya sendiri.
Alasan perbedaan itu penting di sini sempit dan konkret. Lapisan keputusan jarang merupakan keseluruhan alur kerja — biasanya ia berada di samping model generatif yang menulis balasan, ringkasan, atau kode. Secara historis, ini berarti dua kontrak. Hal itu tidak lagi harus demikian untuk sisi hosted: Jev 1.13 berada pada kunci yang sama dengan 200+ model lain dengan harga daftar penyedia yang diteruskan dengan markup 0%, jadi jika TypeSafe mengubah tarif, perubahan itu langsung berlaku di sisi kami pada hari yang sama, bukan pada siklus penagihan berikutnya. Sisi self-hosted tidak pernah punya masalah itu, karena Anda adalah penyedianya. Cara yang bersih untuk memutuskan di antara keduanya adalah mencoba kontrak komersial pada beberapa kasus berlabel milik Anda sendiri terlebih dahulu, lihat apakah perilaku bawaannya cukup baik untuk dijadikan dasar otomatisasi, dan baru setelah itu tentukan apakah menjalankan checkpoint 4,69B sendiri sepadan dengan operasionalnya.

Mana yang sebenarnya harus Anda pilih
Pilih RSI-Jev v6.1-VL 4B jika keputusan harus tetap berada di dalam perimeter Anda, jika Anda memerlukan keputusan atas gambar maupun teks, jika kumpulan opsi Anda mencapai ratusan (checkpoint ini menerima hingga 5.120 opsi per pertanyaan), atau jika Anda ingin menyetel kedalaman dan latensi per permintaan. Pahamilah bahwa Anda mengadopsi proyek yang berpindah delapan kali dalam tiga belas hari, bahwa rilis terbarunya mengorbankan kalibrasi demi akurasi, dan bahwa kartunya sendiri menyebutkan bagian-bagian dari kebijakan keluar yang tidak dapat dikonfirmasinya.
Pilih Jev 1.13 jika Anda ingin keputusan itu berjalan tanpa serving stack, jika Anda menghargai endpoint yang dipelihara orang lain, dan jika harga $0.042 per juta token input — tanpa token output yang perlu diukur — murah dibandingkan volume panggilan Anda. Ketahuilah bahwa Anda memanggil model tertutup yang ukurannya tidak diungkapkan, yang batas lajunya dapat berubah tanpa pemberitahuan, dan yang benchmark publikasinya bukan sesuatu yang dapat Anda jalankan ulang.
Hal yang sama-sama dimiliki keduanya lebih berguna daripada hal yang membedakan keduanya, dan itulah alasan perbandingan seperti ini layak ditulis. Tidak satu pun model menghasilkan teks, sehingga tidak ada yang memunculkan jenis kegagalan yang berasal dari model yang lupa menutup kurung kurawal atau mengarang bidang. Keduanya mengembalikan probabilitas, dan dalam kedua kasus tersebut probabilitas adalah bagian yang harus Anda validasi pada data berlabel Anda sendiri sebelum Anda mengotomatiskan berdasarkan itu — latensi sudah menjadi komoditas, dan nilai keyakinanlah yang harus diperoleh per penerapan. Di sisi mana pun dari garis unduh-versus-panggil Anda berada, uji kalibrasinya terlebih dahulu.

