
"System One" sebagai Kategori Model: Di Mana Jev 1.13 Berada di Dalamnya
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 349 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 208 tok/s
- OrcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
"System One" adalah istilah kategori yang digunakan TypeSafe untuk pemisahan antara model yang memutuskan dan model yang menulis, dan Jev 1.13 (typesafe/jev-1.13) adalah anggota pertamanya — model yang mengembalikan jawaban bertipe, bukan kalimat. Ini bukan model baru. TypeSafe merilis Jev pada 2026-09-15, dan halaman ini bukan artikel peluncuran: model ini berusia lima belas hari dan berada di luar jendela tujuh hari yang menjadi cakupan penulisan blog ini. Yang terjadi di dalam jendela itu adalah OrcaRouter menambahkan model tersebut ke katalognya pada 2026-09-24 dan membuka kartu model untuk Jev 1.13 di https://www.orcarouter.ai/models/typesafe/jev-1.13 — pertama kalinya model ini dapat dipanggil melalui gateway pihak ketiga alih-alih hanya melalui endpoint milik TypeSafe sendiri. Gagasan kategori adalah alasan halaman ini ada; perubahan pada sisi penyajian adalah alasan halaman ini bertanggal hari ini.
Versi sederhana dari kategori ini: sebuah LLM diberi pertanyaan dan menulis jawaban untuk dibaca seseorang. Sebuah model System One diberi pertanyaan dan mengembalikan nilai untuk dijadikan dasar percabangan oleh program. Kalimat TypeSafe sendiri adalah bahwa "LLM menghasilkan kata-kata untuk manusia" sementara "Jev menghasilkan keputusan bertipe dan lebih mirip kode: andal, cepat, konsisten secara internal, dan type-safe." Kalimat itu adalah keseluruhan kategori yang dipadatkan menjadi satu klausa, dan layak diuraikan secara perlahan, karena keempat kata sifat itu melakukan porsi kerja yang berbeda dan salah satunya melakukan lebih banyak daripada yang lain.
Apa yang sebenarnya diklaim oleh "lebih seperti kode"
Ambil keempat klaim itu secara berurutan, karena semuanya bukanlah empat pernyataan ulang dari "ini lebih baik."
• Andal — bentuk keluarannya sudah ditetapkan sebelumnya. Anda mendeklarasikan pertanyaannya; jawabannya hanya dapat kembali sebagai salah satu nilai yang Anda izinkan. TypeSafe menyatakan secara gamblang bahwa "model tidak pernah membuat kesalahan tipe," dan mencatat bahwa ini adalah satu-satunya klaim mereka yang "secara matematis mustahil" untuk dipalsukan dengan contoh kontra, karena nilai yang tidak ada dalam himpunan yang Anda deklarasikan bukanlah nilai yang dapat dikeluarkan model.
• Cepat — semua jawaban dihasilkan dalam satu lintasan, bukan satu token demi satu token. Postingan peluncuran TypeSafe menyebutnya sebagai "Jev mengeluarkan semua probabilitas secara paralel alih-alih menghasilkan secara autoregresif per token." Pada jendela penyajian tujuh hari kami sendiri yang berakhir 2026-09-30, waktu median ke token pertama pada typesafe/jev-1.13 adalah 151 ms dan p95 adalah 247 ms.
• Konsisten secara internal — keadaan yang sama dengan pertanyaan yang sama cenderung menghasilkan jawaban yang sama. Analogi pemrograman membuat ini mudah dipahami, tetapi di situlah analogi berhenti menjadi bukti: determinisme kompilator adalah sifat dari konstruksinya, sedangkan ini adalah klaim tentang perilaku. Pengukuran kami sendiri adalah pembacaan yang jujur atasnya — tingkat kesalahan pada trafik kami selama jendela tujuh hari yang sama adalah 0,49%, jadi ini konsisten secara internal sebagaimana fungsi yang baik konsisten secara internal, bukan sebagaimana aritmetika.
• Aman tipe — dan inilah yang paling berbobot. "Aman tipe" di sini bukan kata sifat kualitas; ini adalah pernyataan tentang di mana model berada relatif terhadap pemeriksa tipe. Dalam pipeline generatif biasa, sistem tipe baru dimulai setelah model selesai: model menulis teks, parser menebak bentuknya, validator memeriksanya, dan jalur kegagalan menangani kasus-kasus ketika tebakan itu salah. Model System One memindahkan deklarasi tipe ke sebelum pemanggilan. Tiga primitif yang didokumentasikan dalam kartu kami adalah sistem tipe itu: noul, penilaian benar/salah yang dikembalikan bersama probabilitas yang terkalibrasi; choice, satu label yang dipilih dari hingga 255 opsi berlabel; dan score, peringkat pada skala terurut dari 2 hingga 10 tingkat. Anda memilih primitifnya, Anda menyediakan label atau kriterianya, dan nilai yang dikembalikan diambil dari himpunan tersebut.
TypeSafe memang menerbitkan satu perbedaan antara dokumentasinya sendiri dan dokumentasi kami yang layak disebutkan alih-alih diselesaikan: dokumentasi vendor menunjukkan contoh Score berindeks nol, sedangkan kartu kami mendokumentasikan skala tersebut sebagai 2 hingga 10 level. Keduanya menjelaskan primitif yang sama. Jika Anda sedang membangun threshold, baca halaman vendor untuk pengindeksan persis yang digunakan SDK Anda.
Dua mode kegagalan yang berhenti ada
Konsekuensi menarik dari "no prose" bukanlah soal estetika. Melainkan bahwa dua kegagalan yang mendominasi pipeline generatif produksi absen dari desain ini, bukan diredam olehnya.
Penyimpangan format adalah yang pertama. LLM yang diminta mengembalikan JSON akan mengembalikan JSON sebagian besar waktu, dan sesuatu yang mirip JSON pada sisa waktunya — komentar di akhir, pagar markdown, bidang yang diubah namanya menjadi sinonim, objek bersarang di tempat skema menginginkan string. Perbaikan di tingkat prompt (instruksi yang lebih kuat, contoh few-shot, skema dalam pesan sistem) semuanya adalah upaya untuk mempertahankan bentuk yang bebas ditinggalkan oleh model, karena bentuk itu adalah permintaan, bukan batasan. Kerangka TypeSafe membuat kontrasnya eksplisit: dengan string, "kemungkinan output dan struktur" diminta dan respons "perlu diurai + divalidasi," dengan "selalu ada risiko bahwa AI keluar jalur." Ketika kemungkinan output dideklarasikan sebelumnya, penyimpangan tidak punya tempat untuk pergi.
Keluaran yang tidak dapat diurai adalah yang kedua, dan itu sebenarnya kegagalan yang sama pada momen yang lebih buruk — bukan field yang hasilnya sedikit keliru, melainkan respons yang sama sekali tidak dapat dibaca oleh parser, yang tiba pada titik paling tidak nyaman dalam sebuah alur kerja. Model yang mengeluarkan nilai bertipe tidak memiliki keadaan seperti itu.
Ini adalah argumen struktural, dan seharusnya dinyatakan sebagai demikian. Ini tidak mengatakan apa pun tentang apakah jawaban individual benar — pertanyaan pilihan dapat memilih label yang salah, dan sebuah noul dapat mengembalikan truedengan keyakinan tinggi ketika jawaban yang jujur adalah salah. Yang hilang adalah kategori kegagalan yang akan tertangkap oleh parser. Itu adalah pengurangan yang nyata dan berguna, dan itu bukan klaim yang sama dengan "jawabannya benar."
Mengapa harga adalah sebuah bentuk, bukan diskon
Model ini dihargai $0,042 per juta token masukan, dengan keluaran ditagih nol — dan nol itu bukan tarif promosi, melainkan artefak dari desainnya. Model yang mengeluarkan tiga token jawaban terstruktur tidak memiliki volume keluaran untuk diukur, sehingga penetapan harga per token keluaran tidak punya dasar untuk disandarkan. Bentuk penagihannya adalah biaya per token masukan dan sebuah keputusan. Katalog kami meneruskan harga daftar penyedia dengan markup 0%, jadi $0,042 adalah angka TypeSafe, bukan angka yang kami tetapkan, dan perubahan harga vendor akan berlaku pada hari yang sama.
Letakkan kedua bentuk itu berdampingan dan perbedaannya bukanlah sebuah persentase. Biaya pipeline generatif meningkat seiring dengan seberapa banyak yang dikatakan model: jawaban yang bertele-tele lebih mahal daripada jawaban yang ringkas untuk keputusan yang sama, dan model penalaran chain-of-thought menagih token yang dihabiskannya untuk berpikir sebelum menjawab, terlepas dari apakah jawabannya membaik atau tidak. Biaya panggilan System One meningkat seiring dengan seberapa banyak yang Anda tunjukkan kepadanya — state dan pertanyaannya. Ajukan satu pertanyaan terhadap dokumen yang panjang dan Anda membayar untuk dokumen itu. Kemas empat puluh pertanyaan terhadap state yang sama (anggaran input pada kartu kami adalah 65.536 token di seluruh gabungan state dan pertanyaan, kira-kira 64K; jika Anda pernah melihat angka "kira-kira 32.000 token" di artikel-artikel OrcaRouter sebelumnya, itu adalah anggaran state saja, bukan total yang bersaing) dan Anda membayar untuk dokumen itu sekali lalu mendapatkan empat puluh keputusan kembali.
Itulah sebabnya biaya per keputusan, bukan biaya per token, adalah satuan yang tepat untuk kelas ini — dan sebabnya meterannya berjalan berlawanan dari yang diharapkan sebagian besar tim. Langkah pengurangan biaya generatif yang lazim adalah "membuat model berbicara lebih sedikit." Di sini tidak ada ucapan yang bisa dibuat lebih sedikit.

Angka TypeSafe sendiri, yang dilaporkan vendor dan belum direplikasi secara independen, diarahkan tepat pada perbandingan itu: "193.6x Lebih Cepat, 444.6x Lebih Murah," dengan catatan kaki "berdasarkan alur kerja untuk tugas System One (bukti)," dengan contoh perhitungan yang berbunyi "Biaya TypeSafe AI $0.000081 Selesai dalam 0.114s / Biaya LLMs $0.013880 Selesai dalam 8.566s." Halaman utama juga mencantumkan "$42 per miliar token input" dibandingkan "harga input 238x lebih rendah daripada Claude Fable 5.1." Perlakukan semua itu sebagai argumen vendor, bukan sebagai hasil yang terukur: posting peluncuran mengakui bahwa "evaluasi yang kami publikasikan umumnya dijalankan dari laptop kami di West Coast" dan bahwa "kami tidak dapat membuktikan ini tidak disubsidi; kami perlu jangka panjang untuk membuktikan keberlanjutan harga kami (yang kami perkirakan akan turun, bukan naik)." Dua pengakuan itu adalah milik vendor sendiri, dan itulah kerangka yang tepat untuk setiap pengganda di halaman itu.
Kalibrasi adalah paruh kedua dari gagasan tersebut
Jika kategorinya hanya "output terstruktur," itu akan menggambarkan pemanggilan fungsi dengan langkah tambahan. Bagian yang membuatnya menjadi hal tersendiri adalah bahwa setiap jawaban datang dengan probabilitas, dan probabilitas tersebut adalah target pelatihan. TypeSafe menyebut metodenya Reinforcement Learning for Calibrated Decisions (RLCD) — istilah mereka, bukan akronim generik — dan tabel perbandingan di tulisan peluncuran menempatkannya di samping RLHF dan RLVR: RLHF mengoptimalkan apa yang disukai penilai manusia, RLVR untuk output yang dapat diperiksa secara terprogram, dan RLCD untuk "jawaban dengan probabilitas yang jujur secara epistemik pada tugas System One."
Perbedaan praktisnya adalah untuk apa probabilitas itu digunakan. Dalam pipeline generatif, estimasi keyakinan adalah generasi kedua: Anda bertanya kepada model seberapa yakin ia, dan ia menuliskan sebuah angka, yang sendirinya adalah prosa dengan mode kegagalan yang sama. Di sini, probabilitas kembali bersama keputusan, dalam proses yang sama, dan itulah hal yang menjadi dasar percabangan Anda. Rumusan TypeSafe sendiri tentang manfaatnya adalah bahwa model yang dapat mengerjakan suatu tugas 95% dari waktu tetapi "tidak mengatakan kapan ia berada dalam 5% itu" tidak dapat digunakan untuk mengotomatiskan tugas tersebut; keyakinan memberi Anda tempat untuk menaruh eskalasi, kepada manusia atau ke model penalaran.
Beranda TypeSafe menyebut ini sebagai "Nol Halusinasi," dan menjelaskan bahwa setiap keputusan membawa estimasi keyakinan sehingga perangkat lunak dapat "bertindak saat keyakinan tinggi dan mengeskalasi saat tidak." Baca itu dengan saksama: ini adalah klaim tentang estimasi keyakinan, bukan klaim bahwa tidak ada jawaban yang pernah salah. Kartu kami sendiri adalah penyeimbangnya — tingkat kesalahan 0,49% selama tujuh hari yang berakhir pada 30 September 2026, pada trafik kami, diukur oleh kami. Angka itu adalah jendela bergulir, bukan set pengujian tetap: beberapa hari sebelumnya angka itu terbaca 0,57% pada jendela yang sama, dan angka itu akan bergerak lagi.
Di mana System One berada di samping System Two
Kosakata cepat/lambat sudah jauh lebih tua daripada TypeSafe. Istilah ini berasal dari buku Kahneman, Thinking, Fast and Slow, dan telah dipinjam oleh para peneliti AI selama bertahun-tahun sebelum ini — label "System 2" telah dilekatkan pada chain-of-thought dan model penalaran deliberatif jauh sebelum TypeSafe ada, dan TypeSafe tidak mengklaim telah menciptakan istilah mana pun. Yang mereka lakukan adalah menerapkan pembedaan itu pada batas produk, bukan pada mode prompting.
• Model penalaran System Two menghabiskan lebih banyak komputasi sebelum menjawab, dan menjadi lebih baik dalam memecahkan masalah yang membutuhkannya. Keluarannya tetap berupa prosa, dan komputasi tambahan ditagih sebagai token keluaran.
• Model System One dalam pengertian TypeSafe tidak berpikir lebih lama untuk menjawab lebih baik. Ia menjawab dalam satu lintasan, dan yang dikorbankannya demi kecepatan adalah kemampuan untuk menghasilkan apa pun selain nilai bertipe.
• Keduanya adalah pelengkap dalam sebuah alur kerja, bukan rival dalam sebuah perbandingan. Panggilan System One menangani keputusan yang harus cepat, murah, dan mudah dipahami; model penalaran mendapatkan kasus-kasus yang ditandai skor keyakinan sebagai tidak pasti. Keluaran bertipe itulah yang membuat serah terima menjadi bersih — Anda meneruskan sebuah nilai dan probabilitas ke tahap berikutnya, bukan kalimat untuk diurai ulang.
Yang membuat peristilahan menjadi kabur adalah ketika memperlakukan "System One model" sebagai kategori mapan yang telah diadopsi vendor lain. Tidak ada bukti untuk itu, dan halaman ini tidak boleh dibaca sebagai menyatakan hal tersebut. TypeSafe menggunakan istilah itu untuk kelas modelnya sendiri; disclaimer di kartu kami sendiri menyatakan hal yang sama lewat apa yang tidak disebutkan, dengan mencantumkan satu jenis endpoint untuk satu model. Jika lab lain mulai menggunakan frasa itu untuk arsitektur yang sama, itu akan menjadi fakta yang layak diberitakan dan diperlukan kata-kata mereka sendiri untuk melaporkannya.

Kartu kami juga mencantumkan jaggedness sebagai bagian dari batas yang jujur, bukan sebagai kejutan: sembilan mode kegagalan yang diberi nama. Entri pembacaan literal dan indireksi adalah entri yang mengikuti langsung dari analogi "lebih seperti kode" — model yang menjawab pertanyaan yang Anda tulis alih-alih yang Anda maksud berperilaku seperti fungsi yang melakukan persis apa yang dikatakan kode. Entri penghitungan tidak demikian. Model yang "mengenali bentuk jawaban alih-alih menghitung" sama sekali tidak seperti kode, itulah sebabnya rekomendasi TypeSafe sendiri adalah menghitung dalam kode dan, ketika penilaian benar-benar diperlukan, mengajukan satu pertanyaan per item dan menjumlahkan sendiri jawabannya.
Dua batas yang membentuk desain, bukan skor
Keduanya berasal dari tempat yang sama: tidak ada string berarti tidak ada yang bisa di-stream dan tidak ada yang bisa dikirim dalam potongan-potongan.
• Non-streaming — keluaran pertama adalah jawaban yang sudah selesai, jadi panggilan System One adalah satu respons tunggal, bukan stream. Pertanyaannya bukan apakah ia dapat melakukan stream, melainkan apa yang akan di-stream.
• Satu bentuk permintaan — model dilayani melalui POST /v1/systemone di katalog kami, bukan melalui bentuk chat-completions, dan itulah versi jujur dari klaim lama bahwa ia "menggunakan bentuk permintaannya sendiri." Ini perbedaan nyata dalam cara Anda memanggilnya: objek status dan peta pertanyaan bernama masuk; jawaban terstruktur per pertanyaan keluar. Anda akan menulis mapper untuknya, dan karena output-nya bertipe, mapper itulah seluruh integrasinya — tidak ada lapisan penguraian defensif di bawahnya.
Patut diketahui sebelum Anda melakukan uji beban: latensi tidak seragam di semua jenis pertanyaan. TypeSafe menjelaskan alasannya, dengan kata-kata mereka sendiri — "Untuk pilihan dengan kardinalitas lebih tinggi, kami melakukan sistem 2 tahap: menilai secara independen lalu membuat pilihan eksplisit, karena itu kadang terjadi perlambatan." Keputusan perutean dengan 4 opsi dan klasifikasi dengan 200 opsi adalah primitif yang sama di atas kertas dan jumlah kerja yang berbeda dalam praktik. Median harian kami selama tujuh hari yang berakhir 2026-09-30 berturut-turut adalah 175, 170, 163, 161, 170, 147, 143 ms. Satu hari dalam rangkaian itu, 2026-09-28, memiliki p95 sebesar 2.448 ms — pencilan satu hari yang nyata yang berada dalam rangkaian tersebut secara jujur, tetapi bukan gambaran umum layanan.

Hal lain yang perlu diketahui sebelum integrasi pertama adalah apa yang Anda hubungkan. Perkakas di sekitar Jev bersifat open source di bawah lisensi MIT dan Apache-2.0 — SDK Python dan JavaScript, adaptor yang menyajikan klien yang sama dengan dukungan API LLM biasa, kode workflow-evals, dan sekumpulan keterampilan agen, semuanya di repositori publik TypeSafe, dengan jumlah bintang dan tanggal push yang berubah baru-baru ini pada 2026-09-26 dan 2026-09-29. Modelnya tidak. Tidak ada repositori bobot: arsitektur, jumlah parameter, komputasi pelatihan, dan bobot Jev tidak dipublikasikan, dan pembaca yang memeriksanya tidak boleh disesatkan oleh tiga repositori di organisasi itu yang merupakan fork dari proyek yang tidak terkait — fork vLLM, rilis model bahasa difusi dari 2025, dan penyedia Pulumi. Tidak satu pun dari itu mengatakan apa pun tentang bagaimana Jev dibangun. Jawaban singkatnya adalah perkakasnya terbuka dan modelnya tidak.
Menjalankannya hari ini, dan apa yang berubah bagi pembaca
Jev 1.13 tersedia di OrcaRouter sebagai typesafe/jev-1.13, dapat diakses dengan kunci yang sama seperti 200+ model lainnya, dengan harga daftar penyedia diteruskan tanpa markup 0%. Nilai praktisnya pada halaman tentang sebuah kategori memang terbatas dan layak dinyatakan secara tepat: mencoba model System One tidak lagi memerlukan akun terpisah, kunci terpisah, dan faktur terpisah untuk model yang mungkin belum Anda tahu bahwa Anda menginginkannya. Ia berdampingan dengan separuh generatif dari alur kerja yang sama — pengklasifikasi dan penulis pada satu kredensial, di satu tempat, dengan hitungan atas apa yang sebenarnya Anda panggil.
Tidak ada apa pun di sini yang mengubah apa sebenarnya model itu. Model ini diluncurkan pada 2026-09-15 dan TypeSafe masih mendeskripsikannya sebagai akses awal; apa itu model tersebut tidak berubah sejak saat itu. Yang berubah pada 2026-09-24 adalah pembaca kini dapat mengetahui berapa biaya yang harus mereka keluarkan dalam praktiknya tanpa harus lebih dulu berkomitmen pada hubungan dengan vendor kedua. Jika Anda selama ini menunggu untuk melihat apakah kategori ini layak dibuatkan prototipe, itulah hal yang berubah.
