Kartu judul yang dihasilkan bertajuk 'System One, Dijelaskan' dengan label kecil 'TYPESAFE SYSTEM ONE' dan subjudul 'Kategori model yang mengembalikan keputusan bertipe, bukan kalimat'. Tiga kartu di sebelah kanan berbunyi 'Dua pertanyaan, dua model', 'Tanpa prosa masuk, tanpa prosa keluar', dan 'Nilai yang dapat dipakai program untuk bercabang'. Baris footer berbunyi 'Jev 1.13 diluncurkan 2026-09-15; dapat dipanggil sebagai typesafe/jev-1.13'. Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

"System One" sebagai Kategori Model: Di Mana Jev 1.13 Berada di Dalamnya

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

"System One" adalah istilah kategori yang digunakan TypeSafe untuk pemisahan antara model yang memutuskan dan model yang menulis, dan Jev 1.13 (typesafe/jev-1.13) adalah anggota pertamanya — model yang mengembalikan jawaban bertipe, bukan kalimat. Ini bukan model baru. TypeSafe merilis Jev pada 2026-09-15, dan halaman ini bukan artikel peluncuran: model ini berusia lima belas hari dan berada di luar jendela tujuh hari yang menjadi cakupan penulisan blog ini. Yang terjadi di dalam jendela itu adalah OrcaRouter menambahkan model tersebut ke katalognya pada 2026-09-24 dan membuka kartu model untuk Jev 1.13 di https://www.orcarouter.ai/models/typesafe/jev-1.13 — pertama kalinya model ini dapat dipanggil melalui gateway pihak ketiga alih-alih hanya melalui endpoint milik TypeSafe sendiri. Gagasan kategori adalah alasan halaman ini ada; perubahan pada sisi penyajian adalah alasan halaman ini bertanggal hari ini.

Versi sederhana dari kategori ini: sebuah LLM diberi pertanyaan dan menulis jawaban untuk dibaca seseorang. Sebuah model System One diberi pertanyaan dan mengembalikan nilai untuk dijadikan dasar percabangan oleh program. Kalimat TypeSafe sendiri adalah bahwa "LLM menghasilkan kata-kata untuk manusia" sementara "Jev menghasilkan keputusan bertipe dan lebih mirip kode: andal, cepat, konsisten secara internal, dan type-safe." Kalimat itu adalah keseluruhan kategori yang dipadatkan menjadi satu klausa, dan layak diuraikan secara perlahan, karena keempat kata sifat itu melakukan porsi kerja yang berbeda dan salah satunya melakukan lebih banyak daripada yang lain.

Apa yang sebenarnya diklaim oleh "lebih seperti kode"

Ambil keempat klaim itu secara berurutan, karena semuanya bukanlah empat pernyataan ulang dari "ini lebih baik."

• Andal — bentuk keluarannya sudah ditetapkan sebelumnya. Anda mendeklarasikan pertanyaannya; jawabannya hanya dapat kembali sebagai salah satu nilai yang Anda izinkan. TypeSafe menyatakan secara gamblang bahwa "model tidak pernah membuat kesalahan tipe," dan mencatat bahwa ini adalah satu-satunya klaim mereka yang "secara matematis mustahil" untuk dipalsukan dengan contoh kontra, karena nilai yang tidak ada dalam himpunan yang Anda deklarasikan bukanlah nilai yang dapat dikeluarkan model.

• Cepat — semua jawaban dihasilkan dalam satu lintasan, bukan satu token demi satu token. Postingan peluncuran TypeSafe menyebutnya sebagai "Jev mengeluarkan semua probabilitas secara paralel alih-alih menghasilkan secara autoregresif per token." Pada jendela penyajian tujuh hari kami sendiri yang berakhir 2026-09-30, waktu median ke token pertama pada typesafe/jev-1.13 adalah 151 ms dan p95 adalah 247 ms.

• Konsisten secara internal — keadaan yang sama dengan pertanyaan yang sama cenderung menghasilkan jawaban yang sama. Analogi pemrograman membuat ini mudah dipahami, tetapi di situlah analogi berhenti menjadi bukti: determinisme kompilator adalah sifat dari konstruksinya, sedangkan ini adalah klaim tentang perilaku. Pengukuran kami sendiri adalah pembacaan yang jujur atasnya — tingkat kesalahan pada trafik kami selama jendela tujuh hari yang sama adalah 0,49%, jadi ini konsisten secara internal sebagaimana fungsi yang baik konsisten secara internal, bukan sebagaimana aritmetika.

• Aman tipe — dan inilah yang paling berbobot. "Aman tipe" di sini bukan kata sifat kualitas; ini adalah pernyataan tentang di mana model berada relatif terhadap pemeriksa tipe. Dalam pipeline generatif biasa, sistem tipe baru dimulai setelah model selesai: model menulis teks, parser menebak bentuknya, validator memeriksanya, dan jalur kegagalan menangani kasus-kasus ketika tebakan itu salah. Model System One memindahkan deklarasi tipe ke sebelum pemanggilan. Tiga primitif yang didokumentasikan dalam kartu kami adalah sistem tipe itu: noul, penilaian benar/salah yang dikembalikan bersama probabilitas yang terkalibrasi; choice, satu label yang dipilih dari hingga 255 opsi berlabel; dan score, peringkat pada skala terurut dari 2 hingga 10 tingkat. Anda memilih primitifnya, Anda menyediakan label atau kriterianya, dan nilai yang dikembalikan diambil dari himpunan tersebut.

TypeSafe memang menerbitkan satu perbedaan antara dokumentasinya sendiri dan dokumentasi kami yang layak disebutkan alih-alih diselesaikan: dokumentasi vendor menunjukkan contoh Score berindeks nol, sedangkan kartu kami mendokumentasikan skala tersebut sebagai 2 hingga 10 level. Keduanya menjelaskan primitif yang sama. Jika Anda sedang membangun threshold, baca halaman vendor untuk pengindeksan persis yang digunakan SDK Anda.

Dua mode kegagalan yang berhenti ada

Konsekuensi menarik dari "no prose" bukanlah soal estetika. Melainkan bahwa dua kegagalan yang mendominasi pipeline generatif produksi absen dari desain ini, bukan diredam olehnya.

Penyimpangan format adalah yang pertama. LLM yang diminta mengembalikan JSON akan mengembalikan JSON sebagian besar waktu, dan sesuatu yang mirip JSON pada sisa waktunya — komentar di akhir, pagar markdown, bidang yang diubah namanya menjadi sinonim, objek bersarang di tempat skema menginginkan string. Perbaikan di tingkat prompt (instruksi yang lebih kuat, contoh few-shot, skema dalam pesan sistem) semuanya adalah upaya untuk mempertahankan bentuk yang bebas ditinggalkan oleh model, karena bentuk itu adalah permintaan, bukan batasan. Kerangka TypeSafe membuat kontrasnya eksplisit: dengan string, "kemungkinan output dan struktur" diminta dan respons "perlu diurai + divalidasi," dengan "selalu ada risiko bahwa AI keluar jalur." Ketika kemungkinan output dideklarasikan sebelumnya, penyimpangan tidak punya tempat untuk pergi.

Keluaran yang tidak dapat diurai adalah yang kedua, dan itu sebenarnya kegagalan yang sama pada momen yang lebih buruk — bukan field yang hasilnya sedikit keliru, melainkan respons yang sama sekali tidak dapat dibaca oleh parser, yang tiba pada titik paling tidak nyaman dalam sebuah alur kerja. Model yang mengeluarkan nilai bertipe tidak memiliki keadaan seperti itu.

Ini adalah argumen struktural, dan seharusnya dinyatakan sebagai demikian. Ini tidak mengatakan apa pun tentang apakah jawaban individual benar — pertanyaan pilihan dapat memilih label yang salah, dan sebuah noul dapat mengembalikan truedengan keyakinan tinggi ketika jawaban yang jujur adalah salah. Yang hilang adalah kategori kegagalan yang akan tertangkap oleh parser. Itu adalah pengurangan yang nyata dan berguna, dan itu bukan klaim yang sama dengan "jawabannya benar."

Mengapa harga adalah sebuah bentuk, bukan diskon

Model ini dihargai $0,042 per juta token masukan, dengan keluaran ditagih nol — dan nol itu bukan tarif promosi, melainkan artefak dari desainnya. Model yang mengeluarkan tiga token jawaban terstruktur tidak memiliki volume keluaran untuk diukur, sehingga penetapan harga per token keluaran tidak punya dasar untuk disandarkan. Bentuk penagihannya adalah biaya per token masukan dan sebuah keputusan. Katalog kami meneruskan harga daftar penyedia dengan markup 0%, jadi $0,042 adalah angka TypeSafe, bukan angka yang kami tetapkan, dan perubahan harga vendor akan berlaku pada hari yang sama.

Letakkan kedua bentuk itu berdampingan dan perbedaannya bukanlah sebuah persentase. Biaya pipeline generatif meningkat seiring dengan seberapa banyak yang dikatakan model: jawaban yang bertele-tele lebih mahal daripada jawaban yang ringkas untuk keputusan yang sama, dan model penalaran chain-of-thought menagih token yang dihabiskannya untuk berpikir sebelum menjawab, terlepas dari apakah jawabannya membaik atau tidak. Biaya panggilan System One meningkat seiring dengan seberapa banyak yang Anda tunjukkan kepadanya — state dan pertanyaannya. Ajukan satu pertanyaan terhadap dokumen yang panjang dan Anda membayar untuk dokumen itu. Kemas empat puluh pertanyaan terhadap state yang sama (anggaran input pada kartu kami adalah 65.536 token di seluruh gabungan state dan pertanyaan, kira-kira 64K; jika Anda pernah melihat angka "kira-kira 32.000 token" di artikel-artikel OrcaRouter sebelumnya, itu adalah anggaran state saja, bukan total yang bersaing) dan Anda membayar untuk dokumen itu sekali lalu mendapatkan empat puluh keputusan kembali.

Itulah sebabnya biaya per keputusan, bukan biaya per token, adalah satuan yang tepat untuk kelas ini — dan sebabnya meterannya berjalan berlawanan dari yang diharapkan sebagian besar tim. Langkah pengurangan biaya generatif yang lazim adalah "membuat model berbicara lebih sedikit." Di sini tidak ada ucapan yang bisa dibuat lebih sedikit.

A headless-browser capture of the OrcaRouter model card for TypeSafe: Jev 1.13 at orcarouter.ai/models/typesafe/jev-1.13. The header reads 'Jev 1.13' with the badge '65K tokens', the slug typesafe/jev-1.13, the byline 'by TypeSafe - 2026-09-24', and the summary 'TypeSafe's structured decision and evaluation model... Served via POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.' A stats row reads '$0.04  151 ms  247 ms  76.2M', above a code sample pointing at https://api.orcarouter.ai/v1/systemone with "model": "typesafe/jev-1.13", and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

Angka TypeSafe sendiri, yang dilaporkan vendor dan belum direplikasi secara independen, diarahkan tepat pada perbandingan itu: "193.6x Lebih Cepat, 444.6x Lebih Murah," dengan catatan kaki "berdasarkan alur kerja untuk tugas System One (bukti)," dengan contoh perhitungan yang berbunyi "Biaya TypeSafe AI $0.000081 Selesai dalam 0.114s / Biaya LLMs $0.013880 Selesai dalam 8.566s." Halaman utama juga mencantumkan "$42 per miliar token input" dibandingkan "harga input 238x lebih rendah daripada Claude Fable 5.1." Perlakukan semua itu sebagai argumen vendor, bukan sebagai hasil yang terukur: posting peluncuran mengakui bahwa "evaluasi yang kami publikasikan umumnya dijalankan dari laptop kami di West Coast" dan bahwa "kami tidak dapat membuktikan ini tidak disubsidi; kami perlu jangka panjang untuk membuktikan keberlanjutan harga kami (yang kami perkirakan akan turun, bukan naik)." Dua pengakuan itu adalah milik vendor sendiri, dan itulah kerangka yang tepat untuk setiap pengganda di halaman itu.

Kalibrasi adalah paruh kedua dari gagasan tersebut

Jika kategorinya hanya "output terstruktur," itu akan menggambarkan pemanggilan fungsi dengan langkah tambahan. Bagian yang membuatnya menjadi hal tersendiri adalah bahwa setiap jawaban datang dengan probabilitas, dan probabilitas tersebut adalah target pelatihan. TypeSafe menyebut metodenya Reinforcement Learning for Calibrated Decisions (RLCD) — istilah mereka, bukan akronim generik — dan tabel perbandingan di tulisan peluncuran menempatkannya di samping RLHF dan RLVR: RLHF mengoptimalkan apa yang disukai penilai manusia, RLVR untuk output yang dapat diperiksa secara terprogram, dan RLCD untuk "jawaban dengan probabilitas yang jujur secara epistemik pada tugas System One."

Perbedaan praktisnya adalah untuk apa probabilitas itu digunakan. Dalam pipeline generatif, estimasi keyakinan adalah generasi kedua: Anda bertanya kepada model seberapa yakin ia, dan ia menuliskan sebuah angka, yang sendirinya adalah prosa dengan mode kegagalan yang sama. Di sini, probabilitas kembali bersama keputusan, dalam proses yang sama, dan itulah hal yang menjadi dasar percabangan Anda. Rumusan TypeSafe sendiri tentang manfaatnya adalah bahwa model yang dapat mengerjakan suatu tugas 95% dari waktu tetapi "tidak mengatakan kapan ia berada dalam 5% itu" tidak dapat digunakan untuk mengotomatiskan tugas tersebut; keyakinan memberi Anda tempat untuk menaruh eskalasi, kepada manusia atau ke model penalaran.

Beranda TypeSafe menyebut ini sebagai "Nol Halusinasi," dan menjelaskan bahwa setiap keputusan membawa estimasi keyakinan sehingga perangkat lunak dapat "bertindak saat keyakinan tinggi dan mengeskalasi saat tidak." Baca itu dengan saksama: ini adalah klaim tentang estimasi keyakinan, bukan klaim bahwa tidak ada jawaban yang pernah salah. Kartu kami sendiri adalah penyeimbangnya — tingkat kesalahan 0,49% selama tujuh hari yang berakhir pada 30 September 2026, pada trafik kami, diukur oleh kami. Angka itu adalah jendela bergulir, bukan set pengujian tetap: beberapa hari sebelumnya angka itu terbaca 0,57% pada jendela yang sama, dan angka itu akan bergerak lagi.

Di mana System One berada di samping System Two

Kosakata cepat/lambat sudah jauh lebih tua daripada TypeSafe. Istilah ini berasal dari buku Kahneman, Thinking, Fast and Slow, dan telah dipinjam oleh para peneliti AI selama bertahun-tahun sebelum ini — label "System 2" telah dilekatkan pada chain-of-thought dan model penalaran deliberatif jauh sebelum TypeSafe ada, dan TypeSafe tidak mengklaim telah menciptakan istilah mana pun. Yang mereka lakukan adalah menerapkan pembedaan itu pada batas produk, bukan pada mode prompting.

• Model penalaran System Two menghabiskan lebih banyak komputasi sebelum menjawab, dan menjadi lebih baik dalam memecahkan masalah yang membutuhkannya. Keluarannya tetap berupa prosa, dan komputasi tambahan ditagih sebagai token keluaran.

• Model System One dalam pengertian TypeSafe tidak berpikir lebih lama untuk menjawab lebih baik. Ia menjawab dalam satu lintasan, dan yang dikorbankannya demi kecepatan adalah kemampuan untuk menghasilkan apa pun selain nilai bertipe.

• Keduanya adalah pelengkap dalam sebuah alur kerja, bukan rival dalam sebuah perbandingan. Panggilan System One menangani keputusan yang harus cepat, murah, dan mudah dipahami; model penalaran mendapatkan kasus-kasus yang ditandai skor keyakinan sebagai tidak pasti. Keluaran bertipe itulah yang membuat serah terima menjadi bersih — Anda meneruskan sebuah nilai dan probabilitas ke tahap berikutnya, bukan kalimat untuk diurai ulang.

Yang membuat peristilahan menjadi kabur adalah ketika memperlakukan "System One model" sebagai kategori mapan yang telah diadopsi vendor lain. Tidak ada bukti untuk itu, dan halaman ini tidak boleh dibaca sebagai menyatakan hal tersebut. TypeSafe menggunakan istilah itu untuk kelas modelnya sendiri; disclaimer di kartu kami sendiri menyatakan hal yang sama lewat apa yang tidak disebutkan, dengan mencantumkan satu jenis endpoint untuk satu model. Jika lab lain mulai menggunakan frasa itu untuk arsitektur yang sama, itu akan menjadi fakta yang layak diberitakan dan diperlukan kata-kata mereka sendiri untuk melaporkannya.

A headless-browser capture of the TypeSafe blog post announcing System One models. The masthead reads 'TypeSafe AI | Manifesto | Our Team | Docs | Contact Sales', under the section heading 'Company News' with the date 'Sep 15, 2026' and the byline 'Diogo Almeida, founder, TypeSafe'. The opening paragraph asks 'Models have been superhuman at chat for years, so where is all the automation?', followed by 'After two years in stealth... I am beyond excited to announce that today, TypeSafe AI is releasing our first System One Model: a new class of frontier models built to make fast, structured decisions that software can use directly.' A later paragraph reads 'Our first public model is Jev, available today in early access.'

Kartu kami juga mencantumkan jaggedness sebagai bagian dari batas yang jujur, bukan sebagai kejutan: sembilan mode kegagalan yang diberi nama. Entri pembacaan literal dan indireksi adalah entri yang mengikuti langsung dari analogi "lebih seperti kode" — model yang menjawab pertanyaan yang Anda tulis alih-alih yang Anda maksud berperilaku seperti fungsi yang melakukan persis apa yang dikatakan kode. Entri penghitungan tidak demikian. Model yang "mengenali bentuk jawaban alih-alih menghitung" sama sekali tidak seperti kode, itulah sebabnya rekomendasi TypeSafe sendiri adalah menghitung dalam kode dan, ketika penilaian benar-benar diperlukan, mengajukan satu pertanyaan per item dan menjumlahkan sendiri jawabannya.

Dua batas yang membentuk desain, bukan skor

Keduanya berasal dari tempat yang sama: tidak ada string berarti tidak ada yang bisa di-stream dan tidak ada yang bisa dikirim dalam potongan-potongan.

• Non-streaming — keluaran pertama adalah jawaban yang sudah selesai, jadi panggilan System One adalah satu respons tunggal, bukan stream. Pertanyaannya bukan apakah ia dapat melakukan stream, melainkan apa yang akan di-stream.

• Satu bentuk permintaan — model dilayani melalui POST /v1/systemone di katalog kami, bukan melalui bentuk chat-completions, dan itulah versi jujur dari klaim lama bahwa ia "menggunakan bentuk permintaannya sendiri." Ini perbedaan nyata dalam cara Anda memanggilnya: objek status dan peta pertanyaan bernama masuk; jawaban terstruktur per pertanyaan keluar. Anda akan menulis mapper untuknya, dan karena output-nya bertipe, mapper itulah seluruh integrasinya — tidak ada lapisan penguraian defensif di bawahnya.

Patut diketahui sebelum Anda melakukan uji beban: latensi tidak seragam di semua jenis pertanyaan. TypeSafe menjelaskan alasannya, dengan kata-kata mereka sendiri — "Untuk pilihan dengan kardinalitas lebih tinggi, kami melakukan sistem 2 tahap: menilai secara independen lalu membuat pilihan eksplisit, karena itu kadang terjadi perlambatan." Keputusan perutean dengan 4 opsi dan klasifikasi dengan 200 opsi adalah primitif yang sama di atas kertas dan jumlah kerja yang berbeda dalam praktik. Median harian kami selama tujuh hari yang berakhir 2026-09-30 berturut-turut adalah 175, 170, 163, 161, 170, 147, 143 ms. Satu hari dalam rangkaian itu, 2026-09-28, memiliki p95 sebesar 2.448 ms — pencilan satu hari yang nyata yang berada dalam rangkaian tersebut secara jujur, tetapi bukan gambaran umum layanan.

A generated single-column scoreboard titled 'Jev 1.13 - the scoreboard' with six rows: 'Median time to first token: 151 ms', 'p95 time to first token: 247 ms', 'Error rate, seven days: 0.49%', 'Input price: $0.042 / M tokens', 'Output billing: $0.000000 / M tokens' and 'Endpoint: POST /v1/systemone', plus a footer reading 'Serving figures: OrcaRouter Playground, seven days ending 2026-09-30. Price per the OrcaRouter catalogue; TypeSafe's own speed and cost multipliers are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

Hal lain yang perlu diketahui sebelum integrasi pertama adalah apa yang Anda hubungkan. Perkakas di sekitar Jev bersifat open source di bawah lisensi MIT dan Apache-2.0 — SDK Python dan JavaScript, adaptor yang menyajikan klien yang sama dengan dukungan API LLM biasa, kode workflow-evals, dan sekumpulan keterampilan agen, semuanya di repositori publik TypeSafe, dengan jumlah bintang dan tanggal push yang berubah baru-baru ini pada 2026-09-26 dan 2026-09-29. Modelnya tidak. Tidak ada repositori bobot: arsitektur, jumlah parameter, komputasi pelatihan, dan bobot Jev tidak dipublikasikan, dan pembaca yang memeriksanya tidak boleh disesatkan oleh tiga repositori di organisasi itu yang merupakan fork dari proyek yang tidak terkait — fork vLLM, rilis model bahasa difusi dari 2025, dan penyedia Pulumi. Tidak satu pun dari itu mengatakan apa pun tentang bagaimana Jev dibangun. Jawaban singkatnya adalah perkakasnya terbuka dan modelnya tidak.

Menjalankannya hari ini, dan apa yang berubah bagi pembaca

Jev 1.13 tersedia di OrcaRouter sebagai typesafe/jev-1.13, dapat diakses dengan kunci yang sama seperti 200+ model lainnya, dengan harga daftar penyedia diteruskan tanpa markup 0%. Nilai praktisnya pada halaman tentang sebuah kategori memang terbatas dan layak dinyatakan secara tepat: mencoba model System One tidak lagi memerlukan akun terpisah, kunci terpisah, dan faktur terpisah untuk model yang mungkin belum Anda tahu bahwa Anda menginginkannya. Ia berdampingan dengan separuh generatif dari alur kerja yang sama — pengklasifikasi dan penulis pada satu kredensial, di satu tempat, dengan hitungan atas apa yang sebenarnya Anda panggil.

Tidak ada apa pun di sini yang mengubah apa sebenarnya model itu. Model ini diluncurkan pada 2026-09-15 dan TypeSafe masih mendeskripsikannya sebagai akses awal; apa itu model tersebut tidak berubah sejak saat itu. Yang berubah pada 2026-09-24 adalah pembaca kini dapat mengetahui berapa biaya yang harus mereka keluarkan dalam praktiknya tanpa harus lebih dulu berkomitmen pada hubungan dengan vendor kedua. Jika Anda selama ini menunggu untuk melihat apakah kategori ini layak dibuatkan prototipe, itulah hal yang berubah.