
Di Mana Jev 1.13 Gagal: Daftar Batas TypeSafe Sendiri
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 349 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 208 tok/s
- OrcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Jev 1.13 (typesafe/jev-1.13) dirilis pada 2026-09-15, yang menempatkannya dua minggu di luar tujuh hari terakhir, jadi peluncurannya bukanlah inti ceritanya. Peristiwa bertanggalnya adalah 2026-09-24: itulah hari ketika OrcaRouter menambahkan typesafe/jev-1.13 ke katalognya dan membuka kartu model untuknya — dukungan serving pertama bagi Jev di gateway pihak ketiga, setelah dua minggu ketika satu-satunya cara untuk memanggilnya adalah endpoint milik TypeSafe sendiri. Itu penting di sini karena satu alasan spesifik. Jev tidak biasa karena vendornya menerbitkan daftar cara ia gagal, dan daftar yang hanya bisa dibaca jauh lebih mudah dilewatkan daripada model yang benar-benar dapat Anda panggil.
Halaman ini adalah daftar itu, dibatasi pada apa yang dikatakan TypeSafe sendiri, ditambah batas operasional dan tagihannya.
TypeSafe menerbitkan daftar jaggedness-nya sendiri

docs.typesafe.ai memuat halaman berjudul Ketidaksempurnaan Jev 1.13. Ini berlaku secara eksplisit untuk jev-1.13, mencantumkan tanggal tinjauan 2026-09-17, dan dibuka dengan pembingkaian vendor sendiri: "Jev tidak sempurna. Berikut beberapa tepi bergerigi yang kami ketahui pada jev-1.13. Banyak dari ini akan diperbaiki di versi selanjutnya." Sembilan mode bernama menyusul, masing-masing dengan kasus konkret dan solusi "Sebagai gantinya:". Tidak ada di bawah ini yang disimpulkan, dan tidak ada yang dilembutkan — kata-katanya milik TypeSafe, dan ketika perusahaan memberikan contohnya sendiri, angka-angka di dalamnya adalah milik mereka.
Pembacaan literal: itu menjawab pertanyaan yang Anda tulis
Kata-kata penentu cakupan, negasi, dan kondisi tersirat dibaca secara harfiah. Sebuah pertanyaan dijawab berdasarkan kata-kata dalam instruksi, "sedangkan seseorang mungkin telah membaca maksud di balik instruksi tersebut."
Diagnostik vendor adalah bagian yang berguna: ketika Anda melihat jawaban yang salah dan mendapati diri Anda menjelaskan apa yang sebenarnya Anda maksud, penjelasan itu adalah separuh instruksi yang hilang. Remedinya adalah menyatakan kondisi yang tepat dalam instruksi, memasukkan kasus batas ke dalam kriteria, dan bila interpretasi benar-benar tak terhindarkan, pecah pertanyaan menjadi dua pertanyaan literal lalu gabungkan keduanya dalam kode.
Matematika dan angka: ini bukan kalkulator
TypeSafe dengan gamblang mengatakan untuk mengimplementasikan logika matematika dalam kode. Tiga kegagalan spesifik mendasari hal itu:
• Penghitungan tidak dapat diandalkan. Ini mencakup karakter dalam sebuah kata, kemunculan suatu istilah dalam sebuah bagian teks, dan item dalam daftar panjang. "Model mengenali bentuk jawaban alih-alih menghitung, dan kesalahannya bertambah seiring ukuran hal yang dihitung." Uji milik vendor sendiri untuk menentukan apakah perlu bertanya sama sekali: jika ekspresi reguler atau parser dapat menemukan unitnya, penghitungan itu tempatnya di kode dan model tidak menambahkan apa pun.
• Representasi numerik kurang berkinerja dibandingkan representasi semantik. Pertanyaan tentang warna yang menggunakan nilai heksadesimal lebih buruk daripada pertanyaan yang sama yang menggunakan nama warna bahasa Inggris; jika diberikan tripel RGB atau hex, Jev tidak dapat menilai secara andal apakah dua nilai berdekatan. Kesenjangan yang sama juga terlihat pada kode tingkat rendah — assembly, atau instruksi berkode biner — dibandingkan dengan bahasa tingkat tinggi. Konversikan atau kelompokkan ke dalam bucket di dalam kode, dan pertahankan model untuk bagian yang benar-benar merupakan penilaian.
• Output skor tidak membawa besaran yang tepat. Vendor menyatakan bahwa tingkat skor Jev lemah dalam kalibrasi numerik. Suatu ekspektasi dapat digunakan untuk menguji apakah sesuatu melewati ambang batas; ekspektasi itu tidak dapat digunakan untuk merekonstruksi angka dengan menginterpolasi antara dua tingkat terdekat. Itu adalah larangan tegas terhadap seluruh kelas penyalahgunaan — membaca skor sebagai pengukuran.
Tanggal dan waktu: tanggal dibaca sebagai teks, bukan sebagai kuantitas
Mengurutkan dua tanggal, mengukur jarak di antara keduanya, atau memutuskan apakah salah satunya berada dalam suatu rentang tidak dapat diandalkan, dan hal ini makin memburuk dengan format campuran, referensi relatif, serta batas domain seperti kuartal, jendela penyelesaian, dan periode akrual.
Pemisahan yang direkomendasikan sudah bersih. Ekstraksi adalah sebuah penilaian, jadi serahkan kepada model. Setiap komponen tanggal adalah himpunan tertutup yang kecil — dua belas bulan, tiga puluh satu hari yang mungkin, rentang tahun yang terbatas — yang mengubah ekstraksi menjadi pilihan atas opsi yang terenumerasi alih-alih penguraian bebas, dan memberi Anda tempat untuk menaruh "tidak disebutkan" secara eksplisit sehingga bagian yang hilang dilaporkan, bukan ditebak. Kode merakit bagian-bagian tersebut dan memiliki semua hal setelahnya, termasuk pengurutan, durasi, offset, dan hari dalam seminggu.
Indireksi: negasi ganda dan lompatan tambahan menurunkan akurasi
Instruksi yang mengandung negasi ganda atau penyampaian tidak langsung yang berlapis dijawab dengan kurang andal. Pertanyaan tentang properti dari suatu properti, atau pertanyaan yang memerlukan beberapa lompatan penalaran, menurunkan akurasi. Solusinya adalah menuliskan instruksi sedapat mungkin secara langsung dan menyebutkan bagian-bagian state yang relevan alih-alih menggambarkannya.
State yang besar dan penuh dengan detail yang tidak relevan menurunkan akurasi.
Akurasi menurun ketika state bertambah dengan konten yang tidak terkait dengan keputusan. Detail yang tidak terkait berperan sebagai pengalih perhatian, dan state yang besar membuatnya lebih sulit menentukan bagian input mana yang menghasilkan jawaban salah. Pengingat TypeSafe sendiri dalam catatan penutup bersifat lugas: "Jev menderita context rot, sehingga materi yang tidak terkait di dalam state merugikan akurasi Anda."
Ambil dan filter di dalam kode terlebih dahulu, lalu kirim hanya field yang dibutuhkan pertanyaan. Jika pemfilteran sebelum permintaan tidak memungkinkan, vendor menyarankan menggunakan noul untuk memfilter berdasarkan relevansi, lalu memeriksa yang tersisa.
Konten adversarial di dalam state menggeser jawaban
State adalah data, dan jev-1.13 tidak memperlakukannya sebagai bermusuhan secara default. Instruksi yang disuntikkan, pembingkaian yang sengaja menyesatkan, atau teks yang berargumen untuk klasifikasinya sendiri dapat menggeser hasil. Ini adalah satu-satunya mode di mana vendor secara eksplisit membingkai perbaikannya sebagai pekerjaan masa depan — "Kami berharap dapat meningkatkannya di masa mendatang" — dan saran sementaranya adalah bersikap eksplisit dalam kriteria serta menguji integrasi secara menyeluruh sebelum menempatkannya di hadapan banyak pengguna.
Instruksi dan kriteria yang bertentangan membuatnya bingung
Ketika instruksi dan kriteria meminta hal yang berbeda, model dapat menjadi bingung. Contoh TypeSafe adalah bool di mana true dipetakan ke tidak dan false dipetakan ke ya, yang kinerjanya lebih buruk daripada pertanyaan yang sama yang dirumuskan secara konsisten. Instruksinya adalah memperlakukan kriteria sebagai perpanjangan dari instruksi dan menyelaraskan keduanya dalam bahasa yang dapat dibaca dan dipahami oleh orang biasa.
Invarian struktural yang tidak dijamin olehnya
Ini adalah mode yang paling mungkin merusak sistem yang dibangun berdasarkan asumsi yang tidak pernah dituliskan oleh siapa pun. Jev sangat konsisten dalam pengertian biasa — masukan yang serupa secara semantik menghasilkan keluaran yang serupa secara kuantitatif — tetapi identitas struktural yang mungkin Anda harapkan berlaku tidak dijamin. Vendor menerbitkan dua kasus yang telah dikerjakan.
• Satu pertanyaan, dua jenis pertanyaan. "Apakah pelanggan meminta pengembalian dana?" yang ditanyakan sebagai noul dan yang ditanyakan sebagai pilihan ya/tidak, pada tiket "Saya tidak puas dengan ukurannya. Apa pilihan saya di sini?" menghasilkan noul 0,22, dan pilihan ya 0,01, tidak 0,99, keyakinan 0,97. Itu adalah jawaban untuk pertanyaan yang sama.
• Sebuah pertanyaan dan negasinya. "Apakah pelanggan meminta pengembalian dana?" dan "Apakah pelanggan meminta sesuatu selain pengembalian dana?", yang diajukan sebagai dua nouls pada tiket "Saya dikenakan biaya dua kali untuk pesanan yang sama. Bisakah seseorang memeriksa ini?", menghasilkan 0,72 dan 0,47. Keduanya berjumlah 1,19.
Remedi-remedi itu bersifat operasional, bukan retoris: jangan mengandalkan invariansi struktural yang diharapkan, jangan membawa ambang yang disetel pada sebuah noul ke suatu pilihan, dan jangan menuntut model memenuhi identitas aritmetika di antara pertanyaan-pertanyaan yang terpisah. Alasannya adalah bahwa suatu pilihan bersifat relatif — ia menetapkan opsi mana — sedangkan setiap noul bersifat absolut dan bisa kembali rendah untuk semuanya.
Generasi: itu tidak dilatih untuk menulis
jev-1.13 tidak dilatih untuk menghasilkan teks. Anda dapat memaksa keluaran dengan merangkai pilihan, dan TypeSafe mengatakan secara langsung bahwa ini "tidak akan bekerja dengan baik dan akan sangat lambat." Untuk ekstraksi, panduannya adalah menarik nilai kandidat keluar dengan ekspresi reguler atau model generatif dan membiarkan Jev memilih yang benar, atau — ketika ruang jawaban terbatas — mengubah ekstraksi menjadi pilihan atas opsi alih-alih meminta nilai itu sendiri.
Batas 255 opsi pada pertanyaan pilihan

Pertanyaan pilihan: integrasi Jev bukanlah tepi yang bergerigi, melainkan bentuk produknya. Ini layak dipisahkan karena sebanyak apa pun pekerjaan prompt tidak akan mengubahnya:
• Tidak ada pembuatan teks. Ini mengembalikan keputusan, bukan prosa. Itu memang desainnya, bukan cacat.
• Tidak ada percakapan. Jev adalah model keputusan terstruktur, bukan model obrolan. Anda mengirimkan keadaan dan serangkaian pertanyaan bernama; Jev mengembalikan satu jawaban terstruktur per pertanyaan. Tidak ada pergantian giliran yang perlu dirancang.
• Tidak ada input multimodal. Input hanya teks — string, objek JSON, atau array nilai teks, tanpa gambar, audio, atau video. Materi non-teks harus diproses terlebih dahulu menjadi teks atau bidang terstruktur sebelum menjadi bagian dari state.
• Respons non-streaming. Terdapat satu respons terstruktur dan tidak ada mode streaming. Alasan hal ini tidak penting sama dengan alasan hal ini layak dinyatakan: tidak ada yang perlu di-stream. Keputusan bertipe — boolean dengan probabilitas, satu label dari suatu himpunan, atau tingkat pada skala — tidak memiliki bentuk parsial yang layak diungkapkan token demi token.
• Bahasa Inggris adalah bahasa utama. Bahasa lain, termasuk aksara CJK, ditangani tetapi tidak sama baiknya. Saran TypeSafe adalah uji pada konten Anda sendiri sebelum mengandalkan Jev untuk beban kerja non-Inggris, dan bersandarlah pada keyakinan saat melakukan perutean.
Batas 255 opsi pada pertanyaan pilihan
Pertanyaan pilihan memilih satu dari hingga 255 opsi berlabel, dan batas atas itu bersifat mutlak. TypeSafe juga menjelaskan mengapa kumpulan pilihan yang besar berjalan lebih lambat, dengan kata-kata vendor sendiri: "Untuk pilihan dengan kardinalitas yang lebih tinggi, kami menjalankan sistem 2 tahap dengan menilai secara independen lalu membuat pilihan eksplisit, sehingga kadang terjadi perlambatan." Jadi biaya latensi dari kumpulan opsi yang besar bersifat struktural, bukan insidental, dan pihak vendor sendiri yang memberi tahu Anda dari mana asalnya.
Jendela serving kami sendiri untuk typesafe/jev-1.13, yang dibaca dari kartu model pada 2026-09-30, menunjukkan bagaimana bentuknya dalam praktik selama tujuh hari trafik kami sendiri: median 151 ms dan p95 247 ms, 348 token keluaran per detik, serta tingkat kesalahan 0,49% dari 76,2 juta token yang dilayani. Median harian bergerak dalam rentang sempit — 175, 170, 163, 161, 170, 147, dan 143 ms dari 2026-09-24 hingga 2026-09-30 — tetapi p95 harian untuk 2026-09-28 adalah 2.448 ms, sekitar sepuluh kali lipat hari-hari di kedua sisinya. Kami tidak dapat mengaitkan outlier satu hari itu dengan kardinalitas pilihan dan tidak akan melakukannya; pembacaan yang jujur adalah bahwa ekor itu ada, dan alur kerja yang sensitif terhadap latensi harus dirancang terhadap ekor, bukan median.
Tagihan masukannya adalah keseluruhan tagihan
Output ditagihkan nol di Jev, yang kadang ditafsirkan sebagai "Jev gratis." Tidak demikian, karena input diukur dan state yang besar tidak gratis hanya karena tidak ada apa pun di sisi output. Harga vendor adalah $0,042 per juta token input — angka yang sama yang dinyatakan TypeSafe sebagai $42 per miliar — dan OrcaRouter meneruskan harga daftar penyedia dengan markup 0%, sehingga penurunan harga vendor sampai di sini pada hari yang sama.
Berikut ini dampaknya terhadap bentuk yang realistis, menggunakan tarif milik vendor itu sendiri:
• Permintaan kecil. Tiket dukungan 1.200 token ditambah kira-kira 300 token rubrik dan pertanyaan menjadi 1.500 token masukan, yaitu $0,000063 per panggilan.
Permintaan besar. Kontrak 55.000 token ditambah pertanyaan yang membuat permintaan menjadi 60.000 token adalah 40 kali jumlah token, jadi $0,0025 per panggilan — tetap kecil per panggilan, dan 40 kali lebih besar daripada kasus pertama untuk satu jawaban yang sama.
• Pada volume. 60.000 token per panggilan dan 10.000 panggilan per hari berarti 600 juta token input per hari, yaitu 0,6 miliar, jadi $25,20 per hari dan sekitar $756 selama satu bulan 30 hari. Jumlah panggilan yang sama terhadap permintaan 1.500 token adalah 15 juta token per hari: $0,63 per hari, sekitar $18,90 per bulan.
Jarak antara dua baris terakhir itu bukan trik penetapan harga, melainkan state yang diukur. Itulah sebabnya saran penyaringan di bagian context-rot bukan sekadar soal akurasi — memangkas state juga satu-satunya tuas yang menggerakkan tagihan.
Batas operasional yang dipublikasikan, sehingga tidak ada yang perlu menebak.

Halaman model TypeSafe menerbitkan angka-angka konkret, sehingga seorang perencana tidak perlu menebaknya:
• Throughput dan laju. 100K token per detik dan 40 permintaan per detik, per docs.typesafe.ai/models.md. Permintaan yang melebihi salah satu batas tersebut akan mengembalikan 429 Too Many Requests; SDK klien dari vendor tersebut secara default mencoba ulang dengan backoff dan menghormati header retry-after ketika respons menyertakannya.
• Batasnya bergerak. Vendor menyatakan bahwa batas laju disesuaikan secara dinamis dan "dapat berubah tanpa pemberitahuan" seiring kapasitas tersedia, dengan batas yang lebih tinggi tersedia pada paket kustom dan enterprise. Anggap 100K/40 sebagai angka hari ini, bukan sebagai kontrak.
• Anggaran konteks. Anggaran permintaan kira-kira 64.000 token di seluruh state gabungan dan semua pertanyaan — kartu model mencantumkan 65.536 — dan halaman model vendor secara terpisah membatasi state ditambah satu pertanyaan terpanjang pada 32.000 token. Angka kedua itu adalah anggaran state, bukan versi yang lebih kecil dari angka pertama; keduanya nyata dan tidak saling bertentangan.
• Alias bergeser di bawah Anda. jev-latest dan jev-preview keduanya mengarah ke jev-1.13.0 saat ini, dan vendor mencatat tidak ada build pratinjau yang tersedia sekarang. Alias berpindah saat rilis baru diluncurkan, jadi jika Anda telah menyetel ambang batas keyakinan terhadap versi tertentu, sematkan ID berversi dan berpindah sesuai jadwal Anda sendiri.
Seperti apa kasus penggunaan Anda harus terlihat
Dibaca dari awal sampai akhir, daftar milik vendor itu sendiri menggambarkan alat yang sempit namun berguna. Jev cocok ketika penilaiannya terbatas dan aritmetika bukan tugas model: apakah catatan ini sesuai kebijakan, label mana dari empat puluh label ini yang berlaku, bagaimana ini terbaca pada skala lima tingkat — ditanyakan atas state yang Anda saring sendiri, dengan instruksi literal dan kriteria yang selaras dengannya, serta dengan setiap penghitungan, perbandingan, dan pengukuran tanggal dilakukan dalam kode di sekitarnya.
Ini tidak cocok ketika tugas memerlukan penghitungan, pengurutan, atau aritmetika tanggal, ketika tugas memerlukan beberapa lompatan penalaran, ketika materi masukannya bukan teks, ketika keadaannya adalah tumpukan jerami dan pertanyaannya adalah jarum, atau ketika ada apa pun tentang sumber yang bermusuhan. Itu bukan celah dalam sebuah prompt; itu adalah tempat model tidak bekerja, dan TypeSafe adalah pihak yang mengatakan demikian.
Satu hal lagi yang perlu diketahui sebelum Anda menghubungkannya: perbedaan yang sebenarnya dalam cara Jev dipanggil. Di OrcaRouter, katalog menjangkau Jev melalui endpoint systemone khusus, POST /v1/systemone, bukan melalui bentuk chat-completions OpenAI. Itu adalah perbedaan nyata dalam permintaan yang Anda tulis, dan itu adalah versi yang benar dari klaim lama bahwa Jev "berbicara dengan bentuk permintaannya sendiri". Semua hal lain sama seperti model lain di akun — satu kunci untuk 200+ model, tanpa biaya per token dari kami, dan failover otomatis jika suatu rute bermasalah. TypeSafe menghapus daftar tunggu pada 2026-09-21; halaman utama vendor sendiri masih menggambarkan Jev sebagai akses awal, dan halaman benchmark-nya sendiri masih ditandai tertunda, jadi satu-satunya angka performa di halaman ini adalah angka serving yang kami ukur sendiri dan klaim vendor sendiri, yang dilabeli sebagai milik mereka.
