
Apa Itu TypeSafe AI? Lab di Balik Jev 1.13 Membuat Keputusan, Bukan Kalimat
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 349 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 208 tok/s
- OrcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
TypeSafe AI adalah laboratorium kecil di San Francisco yang menjual model yang tidak bisa menulis kalimat, dan Jev 1.13 (typesafe/jev-1.13) adalah model yang dimaksud. Model ini menerima sepotong state — email, baris log, tiket dukungan, blob JSON — serta serangkaian pertanyaan bernama, dan mengembalikan satu jawaban bertipe per pertanyaan, masing-masing dengan nilai keyakinannya sendiri. Tanpa prosa, tanpa kode, tanpa penjelasan, dan tanpa kotak obrolan. Model itu sendiri diluncurkan pada 2026-09-15, jadi ini bukan hal baru dan tidak ada cerita peluncuran di sini: halaman ini ada karena perubahan yang lebih kecil dan dapat dipastikan tanggalnya. Pada 2026-09-24, OrcaRouter menambahkan typesafe/jev-1.13 ke katalognya dan membuka kartu model di alamatnya sendiri, yang merupakan pertama kalinya Jev dapat dipanggil melalui gateway pihak ketiga alih-alih hanya melalui endpoint milik TypeSafe sendiri. Itulah peristiwanya, usianya enam hari per 2026-09-30, dan itulah alasan pembaca yang belum memiliki kontrak TypeSafe kini dapat menempatkan model System One pada kunci yang sama dengan model-model generatif yang dirancang untuk disandingi model tersebut. Semua hal lain di halaman ini adalah latar belakang tentang perusahaan yang membuatnya.
Cara jujur dalam membingkai soal waktu, karena ini penting untuk seberapa banyak dari hal ini yang terverifikasi: Jev diluncurkan lebih dari dua minggu lalu dan telah tersedia secara umum sejak 2026-09-21, ketika TypeSafe menghapus daftar tunggunya. Yang berada di dalam jendela tujuh hari adalah perubahan perutean, bukan modelnya. Jika Anda datang ke sini mengharapkan ulasan peluncuran, peluncuran itu sudah terjadi dan sejumlah tulisan lain telah membahasnya.
Halaman perusahaan dengan manifesto dan tanpa diagram arsitektur
TypeSafe mendeskripsikan dirinya, dalam meta description-nya sendiri, sebagai "lab AI yang membangun infrastruktur kecerdasan machine-native untuk otomatisasi," dengan sistem "yang dirancang untuk mengambil keputusan di dalam perangkat lunak." Halaman beranda mereka diberi cap Version 0.01 dan footer "Made in SF." Ada manifesto yang berargumen bahwa jalur terpendek menuju pergeseran ekonomi berbentuk AI adalah dengan membuat kecerdasan dapat dikomposisi, sehingga perangkat lunak dapat memanggil penilaian semantik seperti saat memanggil sebuah fungsi; ringkasan perusahaan sendiri tentang rencananya adalah merilis bentuk AI komposabel machine-native, lalu membuatnya cukup andal untuk otomatisasi nyata, lalu menawarkan abstraksi tingkat lebih tinggi yang cukup stabil untuk dilapisi di atasnya. Tagline-nya adalah "Kami membangun prod, bukan Tuhan." Halaman tim mencantumkan tiga pendiri — Diogo Almeida sebagai CEO, Sasha Sheng sebagai COO dan Erik Gafni sebagai CTO. Itulah keseluruhan dari apa yang perusahaan katakan tentang dirinya: sebuah posisi, sebuah produk, tiga nama, dan tidak ada angka tentang perusahaan itu sendiri.
Yang tidak disediakan situs ini adalah hal yang pertama dicari seorang engineer saat mengevaluasi dependensi baru. Tidak ada halaman arsitektur, tidak ada jumlah parameter, tidak ada pengungkapan komputasi pelatihan, dan tidak ada model card dalam pengertian akademis. Dasbor benchmark milik TypeSafe sendiri masih ditandai pending. Bagi perusahaan yang proposisinya bertumpu pada keandalan, permukaan pengungkapannya tipis, dan itu adalah fakta tentang apa yang telah dipublikasikan, bukan tuduhan tentang apa yang disembunyikan.

System One: kategorinya, dan mengapa nama itu dipinjam
Jev adalah yang pertama dari apa yang disebut TypeSafe sebagai model System One. Nama itu berasal dari pembagian Daniel Kahneman antara pemikiran Sistem 1 yang cepat dan intuitif serta penalaran Sistem 2 yang lambat dan deliberatif, dan postingan peluncuran perusahaan mengatakan hal itu secara langsung — postingan tersebut juga mengakui bahwa "pemikiran Sistem 1" telah membawa konotasi rawan kesalahan, dan berargumen bahwa model-model ini dapat dibuat lebih andal daripada alternatifnya. TypeSafe tidak menciptakan istilah itu dan tidak memilikinya.
Isi praktis dari kategori ini adalah pembagian kerja yang disengaja: sebuah model yang memutuskan dan sebuah model yang menulis. Anda dimaksudkan untuk menyimpan aritmetika, pengurutan tanggal, penghitungan, dan perbandingan string di dalam kode biasa, tempat semuanya eksak, dan menyerahkan pertimbangan semantik kepada Jev. Tiga jenis pertanyaan adalah yang dapat dijawabnya:
• noul — penilaian benar/salah, dikembalikan dengan probabilitas yang terkalibrasi
• pilihan — pilih salah satu dari maksimal 255 opsi berlabel
• skor — beri nilai pada skala terurut; kartu kami menerbitkan 2-10 level, dan dokumentasi TypeSafe sendiri menunjukkan contoh berindeks 0, jadi perlakukan level vendor sebagai definisi dan 2-10 sebagai yang diterbitkan kartu
Setiap pertanyaan membawa instruksinya sendiri, dan untuk pilihan serta skor, kriterianya sendiri. Permintaan di atas sekitar 64K token masukan ditolak sebelum mencapai model, dan respons tidak dialirkan. Vendor mendokumentasikan anggaran state secara terpisah — state ditambah pertanyaan tunggal terpanjang — pada 32K token, yang merupakan angka yang lebih sempit daripada konteks 65.536 token pada kartu dan bukan kontradiksi terhadapnya.
Tesis mereka, dalam kata-kata mereka sendiri
TypeSafe menyatakan tesis itu lebih baik daripada ringkasan mana pun, jadi berikut ini verbatim: "LLM menghasilkan kata-kata untuk manusia. Jev menghasilkan keputusan bertipe dan lebih mirip kode: andal, cepat, konsisten dengan dirinya sendiri, dan type-safe." Metode pelatihan di balik itu juga milik mereka, dan istilah itu layak dikaitkan secara tepat karena telah diadopsi di tempat lain seolah-olah generik. TypeSafe menyebutnya Reinforcement Learning for Calibrated Decisions, atau RLCD, dan membandingkannya dengan RLHF dan RLVR: jika keduanya mengoptimalkan preferensi manusia atau imbalan yang dapat diverifikasi secara programatik, RLCD menargetkan, dalam frasa perusahaan, "jawaban dengan probabilitas yang jujur secara epistemik pada tugas System One." Perlakukan RLCD sebagai istilah ciptaan TypeSafe sendiri, bukan sebagai akronim yang mapan dalam literatur.
Angka-angka yang mereka kedepankan, dan siapa yang memilih beban kerja itu
Halaman utama dibuka dengan "193,6x Lebih Cepat, 444,6x Lebih Murah," dengan catatan kaki yang merujuk ke alur kerja untuk tugas System One. Di bawahnya ada contoh yang dikerjakan: TypeSafe AI pada $0,000081 dan 0,114 detik dibandingkan LLM pada $0,013880 dan 8,566 detik. Lebih ke bawah, "$42 Per Miliar token input. Harga input 238x lebih rendah daripada Claude Fable 5.1." Dan bagian berjudul "Nol Halusinasi," yang jika diperiksa merupakan klaim tentang estimasi keyakinan, bukan bukti nol kesalahan: setiap keputusan Jev membawa estimasi keyakinan, sehingga perangkat lunak dapat bertindak saat keyakinan tinggi dan mengeskalasi bila tidak. Keempatnya adalah angka TypeSafe, pada beban kerja yang dipilih TypeSafe, dan tidak satu pun telah direplikasi secara independen. Postingan peluncuran itu sendiri menyatakan bahwa tim memperkirakan 193,6x dan 444,6x miliknya akan berada di ujung atas perolehan di dunia nyata, dan mencatat bahwa alur kerja tersebut dibangun oleh tim kapabilitasnya sendiri, dengan jawaban referensi yang dihasilkan oleh model-model pesaing. Data penyajian tujuh hari kami sendiri pada model yang sama menempatkan tingkat kesalahan pada 0,49%, yang merupakan pengukuran berbeda pada beban kerja berbeda dan menjadi penyeimbang jujur untuk membaca "nol" sebagai absolut.
Apa yang belum mereka terbitkan
Arsitektur Jev, jumlah parameter, komputasi pelatihan, dan bobotnya tidak dipublikasikan, dan tidak ada repositori bobot di organisasi GitHub perusahaan tersebut. Diperiksa pada 2026-09-30, organisasi itu memiliki sebelas repositori publik; yang substansial adalah perkakas, semuanya MIT atau Apache-2.0 — repositori keterampilan agen, SDK Python, SDK TypeScript, adaptor klien drop-in yang didukung API LLM lain, kumpulan modul Dagger, beberapa kode evaluasi alur kerja yang dipublikasikan, node n8n, dan situs milik organisasi itu sendiri. Jumlah bintang dan tanggal push berubah, jadi bacalah pada hari itu alih-alih dari halaman ini.
Tiga dari sebelas adalah fork dari proyek yang tidak terkait: vLLM, LLaDA, dan penyedia Pulumi untuk ClickHouse Cloud. Itu adalah fork dari karya orang lain dan tidak menjelaskan apa pun tentang bagaimana Jev dibangun — khususnya, tidak ada penjelasan tentang Jev yang berbasis difusi. Jawaban satu barisnya atas apakah Jev open source adalah bahwa perkakasnya terbuka dan modelnya tidak.
Apa yang mereka sendiri akui
Dua pengakuan dari postingan peluncuran itu lebih berharga daripada sebagian besar peringatan vendor, karena keduanya menyebutkan secara persis di mana buktinya lemah. Soal harga: "Kami tidak bisa membuktikan bahwa layanan ini tidak disubsidi; kami memerlukan jangka panjang untuk membuktikan keberlanjutan harga kami (yang kami perkirakan akan turun, bukan naik)." Soal kecepatan: "evaluasi yang kami terbitkan umumnya dijalankan dari laptop kami di Pantai Barat (di sinilah layanan kami saat ini berbasis)." Ada pengakuan ketiga yang lebih berguna bagi siapa pun yang membangun di atasnya: untuk himpunan pilihan berkardinalitas tinggi, Jev menjalankan sistem dua tahap yang memberi skor secara independen lalu membuat pilihan eksplisit, "karena itulah kadang terjadi perlambatan." Itu adalah penjelasan vendor tentang mengapa latensi tidak seragam di semua jenis pertanyaan, dan hal semacam itu biasanya Anda pelajari dari utas dukungan.
Di mana Anda benar-benar dapat meneleponnya, per hari ini
Melalui API TypeSafe sendiri, tempat model tersedia secara umum dan halaman beranda masih menggunakan frasa vendor sendiri "early access" — pilihan kata itu masih berlaku dan layak dipertahankan, sedangkan "waitlisted" sudah tidak digunakan lagi: dokumentasinya memuat batas operasional yang konkret (100K token per detik, 40 permintaan per detik, 429 dengan backoff SDK jika salah satu batas terlampaui) dan sama sekali tidak memuat istilah waitlist. Dan, sejak 2026-09-24, melalui OrcaRouter.
Apa yang kami layani layak dinyatakan secara tepat, karena bentuk panggilannya adalah bagian yang berbeda. Entri katalognya adalah typesafe/jev-1.13, bernama TypeSafe: Jev 1.13, dengan jenis endpoint yang didukung "systemone" — jadi diakses melalui POST /v1/systemone alih-alih bentuk chat-completions OpenAI, non-streaming, teks masuk dan JSON terstruktur keluar, hingga sekitar 64K token input di seluruh state dan pertanyaan yang digabungkan. Input adalah $0.042 per juta token dan output ditagih nol, karena tidak ada token output untuk diukur: keputusan bertipe bukan prosa. Itu adalah harga daftar penyedia yang diteruskan, dengan markup 0%, pada kunci yang sama dengan 200+ model lain di katalog — satu API untuk 200+ model, markup 0% (harga daftar penyedia diteruskan, jadi pemotongan harga vendor langsung berlaku di sini pada hari yang sama). Jika alasan Anda membaca tentang TypeSafe AI adalah untuk mengetahui apakah kalibrasi Jev bertahan pada data Anda sendiri sebelum Anda menetapkan jalur produksi untuknya, menjalankannya di samping model generatif yang sudah Anda percayai adalah cara murah untuk mengetahuinya; beralih ke model itu ketika keyakinan Jev kembali rendah adalah cara murah untuk merilisnya.
Statistik penyajian tujuh hari milik kami sendiri untuk jendela yang berakhir 2026-09-30, yang merupakan angka kami dari lalu lintas kami sendiri, bukan tolok ukur vendor: p50 151 ms, p95 247 ms, sekitar 349 token keluaran per detik, tingkat kesalahan 0,49%, dan 76,2 juta token yang dilayani. p50 harian sepanjang jendela tersebut bergerak di angka 175, 170, 163, 161, 170, 147, 143 ms, sehingga mediannya perlahan menurun sedikit. Satu hari dalam rangkaian ini, 09-28, memiliki p95 sebesar 2.448 ms — outlier nyata dalam data, bukan norma, dan bukan angka yang bisa dijadikan dasar untuk menyusun anggaran latensi. Angka-angka ini bergulir setiap hari; kartu adalah sumbernya.

Di mana model tersebut lemah, menurut TypeSafe
Vendor menerbitkan halaman jaggedness untuk Jev 1.13, terakhir ditinjau 2026-09-17, yang menyebutkan mode-mode kegagalan lebih terus terang daripada sebagian besar materi peluncuran. Itu adalah halaman yang tepat untuk dibaca sebelum membangun di atas model tersebut, dan daftarnya sendiri berbunyi seperti ini. Jev menjawab pertanyaan yang Anda tulis, bukan pertanyaan yang Anda maksud, jadi kata-kata cakupan, negasi, dan kondisi tersirat perlu dijelaskan secara eksplisit. Ini bukan kalkulator: performanya lebih buruk pada pertanyaan matematis daripada pertanyaan semantik. Ia membaca tanggal sebagai teks alih-alih sebagai kuantitas terurut, sehingga pengurutan, celah, dan keanggotaan jendela tidak dapat diandalkan, dan lebih buruk lagi dengan format campuran. Negasi ganda dan indireksi multi-langkah menurunkan akurasi. Akurasi menurun seiring state bertambah dengan detail yang tidak relevan — halaman itu mengatakan ia "mengalami context rot" — jadi menyaring di kode terlebih dahulu adalah solusinya. State diperlakukan sebagai data, bukan sebagai berbahaya secara default, sehingga instruksi yang disuntikkan dapat mengubah jawaban. Instruksi dan kriteria yang tidak cocok membingungkannya. Invarian struktural tidak dijamin: noul dan output pilihan tidak harus bersesuaian, dan sebuah pertanyaan ditambah negasinya tidak harus berjumlah satu, sehingga ambang batas tidak boleh dipindahkan di antara keduanya. Dan ia tidak dilatih untuk menghasilkan teks — memaksanya melalui pilihan berantai "tidak akan bekerja dengan baik dan akan sangat lambat."

Cara membaca TypeSafe AI enam hari setelah perubahan routing
Perusahaan itu membuat klaim yang kuat, spesifik, dan dapat difalsifikasi: bahwa model keputusan yang sempit bisa lebih cepat, lebih murah, dan lebih dapat dipercaya daripada model umum pada subset pekerjaan ketika Anda membutuhkan sebuah penilaian, bukan paragraf. Klaim itu masuk akal dan sebagian terbukti dengan sendirinya — estimasi keyakinan adalah perbedaan desain yang nyata, harganya nyata, dan latensi yang kami ukur pada lalu lintas kami sendiri berada dalam orde yang sama dengan milik vendor. Yang hilang adalah bagian yang akan memungkinkan orang luar memeriksa sisanya: tidak ada arsitektur, tidak ada parameter, tidak ada bobot, tidak ada tolok ukur independen, dan harga yang perusahaan itu sendiri katakan tidak dapat dibuktikan berkelanjutan. Mode kegagalannya didokumentasikan, yang lebih dari yang dilakukan sebagian besar lab dan merupakan satu alasan terbaik untuk menanggapi model ini dengan serius.
Jika Anda sedang memutuskan apakah akan memperhatikan: jalankan Jev pada input yang sudah Anda beri label, dengan labelnya disembunyikan, dan lihat apakah angka keyakinannya memisahkan kasus yang benar dari kasus yang salah. Uji itu hampir tidak memakan biaya, yaitu $0,042 per juta token input, dan hanya uji itulah yang menjawab pertanyaan yang sebenarnya Anda miliki. Jika Anda sedang memutuskan apakah akan mempercayai perusahaan: pengungkapannya memang seperti itu, dan jawaban jujurnya adalah bahwa buktinya saat ini adalah kata-kata vendor ditambah apa pun yang Anda hasilkan sendiri.
