
Jev 1.13 Dijelaskan: Mengapa Model Menjawab dalam Label, Bukan Kalimat
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 349 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 208 tok/s
- OrcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Jev 1.13 (typesafe/jev-1.13) bukan model chat, dan cara tercepat untuk memahaminya adalah berhenti membaca lembar spesifikasinya seperti Anda membaca lembar spesifikasi lainnya. TypeSafe merilisnya pada 2026-09-15 sebagai anggota pertama dari kelas yang oleh perusahaan itu disebut model System One: Anda memberinya sepotong state dan sekumpulan pertanyaan bernama, dan model itu mengembalikan satu jawaban bertipe untuk setiap pertanyaan — label dari daftar yang Anda berikan, tingkat pada skala yang Anda tentukan, atau benar/salah dengan probabilitas yang disertakan. Tanpa prosa, tanpa kode, tanpa penjelasan. Ini bukan artikel peluncuran. Modelnya sendiri berasal dari 2026-09-15, berusia lima belas hari dan berada di luar jendela tujuh hari yang menjadi cakupan penulisan blog ini, sehingga model ini tidak mendapatkan halaman atas perilisannya sendiri. Yang terjadi di dalam jendela itu adalah OrcaRouter menambahkan typesafe/jev-1.13 ke katalognya sendiri pada 2026-09-24 dan membuka kartu model Jev 1.13 di https://www.orcarouter.ai/models/typesafe/jev-1.13 — pertama kalinya Jev dapat dipanggil melalui gateway pihak ketiga alih-alih hanya melalui endpoint milik TypeSafe sendiri, dan data penyajian langsung pertama yang dipublikasikan siapa pun di luar TypeSafe tentangnya. Itulah perubahan yang layak dibaca: model ini menjadi dapat dijalankan di tempat yang sebelumnya tidak.
Bentuk praktis dari perubahan itu kecil dan spesifik. Sebelum 2026-09-24, mengadopsi Jev berarti menjalin hubungan vendor kedua — akun TypeSafe, kunci TypeSafe, faktur TypeSafe, dan bentuk permintaan khusus yang harus dijadikan acuan. Setelah itu, Jev berada pada kunci yang sama dengan bagian lain dari stack: satu API untuk 200+ model, markup 0% (harga daftar penyedia diteruskan, sehingga potongan harga vendor langsung berlaku di sini pada hari yang sama), dan model dapat diakses di typesafe/jev-1.13 pada POST /v1/systemone. Anda tetap memanggilnya dalam bentuknya sendiri — endpoint ini bukan rute OpenAI chat-completions, dan berpura-pura sebaliknya akan menghasilkan 404 alih-alih keputusan — tetapi kontrak yang Anda tanda tangani dan kunci yang Anda rotasi adalah yang sama dengan yang sudah Anda miliki.
Jev itu model seperti apa
Tulisan peluncuran TypeSafe menyatakannya dalam satu kalimat: "Model publik pertama kami adalah Jev, tersedia hari ini dalam akses awal." Tulisan itu kemudian membingkai model tersebut sebagai "panggilan fungsi kecerdasan frontier: keadaan tak terstruktur masuk, keputusan probabilistik bertipe keluar." Itu deskripsi yang adil tentang antarmuka dan deskripsi yang penting, karena hampir semua ekspektasi yang keliru tentang Jev berasal dari menilainya sebagai model bahasa kecil. Ini bukan model bahasa kecil. Ini adalah model keputusan dengan tata bahasa keluaran tetap, dan tata bahasa itulah produknya.
Antarmuka ini memiliki tepat dua input. state adalah materi yang akan dinilai: sebuah email, tiket dukungan, baris log, catatan JSON, larik koordinat permainan. questions adalah peta item bernama, masing-masing membawa tipe, instruksinya sendiri, dan — untuk dua tipe terstruktur — kriterianya. Setiap pertanyaan dievaluasi terhadap state yang sama itu, dan jawabannya kembali sebagai satu payload JSON terstruktur. Dokumentasi TypeSafe menjelaskan bahwa questions berjalan secara bersamaan dan independen, serta membuat dua klaim yang mengikuti desain tersebut alih-alih hasil penyetelan: menambahkan pertanyaan hampir tidak mengubah waktu respons, dan menambahkan pertanyaan tidak menimbulkan context rot, karena setiap pertanyaan dinilai secara terpisah, bukan di hilir pertanyaan-pertanyaan sebelumnya.
Panduan desain TypeSafe sendiri layak diulang karena itu pernyataan paling jelas tentang untuk apa model ini. Buat setiap pertanyaan tetap atomik dan berlingkup baik — "jenis penilaian yang bisa dibuat orang yang sangat berpengetahuan dalam beberapa detik." Jika suatu keputusan memerlukan penalaran panjang atau benar-benar menggabungkan beberapa faktor independen, pecah menjadi pertanyaan terpisah dan gabungkan kembali dalam kode Anda sendiri. Contoh mereka: alih-alih satu prompt "nilai pitch startup ini", tanyakan secara terpisah tentang ukuran pasar, kelayakan teknis, dan diferensiasi, lalu terapkan pembobotan Anda sendiri. Alasan itu penting adalah pembobotan kemudian berada dalam koefisien yang bisa Anda ubah, bukan dalam prompt yang harus Anda tulis ulang.
Model ini tertutup dalam setiap pengertian yang penting bagi seorang engineer yang menalar tentang risiko. Arsitektur, jumlah parameter, komputasi pelatihan, dan bobot Jev tidak dipublikasikan. Tidak ada repositori bobot di organisasi GitHub TypeSafe — sebelas repositori publik di sana adalah perkakas, SDK, alur kerja, dan tiga fork yang tidak terkait, dan tidak satu pun darinya adalah model tersebut.
"Typed adalah produknya"
Kartu model OrcaRouter mempublikasikan tiga primitif dan, yang penting, batasan pada masing-masingnya. Setiap pertanyaan yang Anda ajukan kepada Jev adalah salah satu dari tepat tiga bentuk:
• noul — penilaian benar/salah, dikembalikan dengan probabilitas terkalibrasi alih-alih boolean belaka, sehingga "mungkin benar" dan "pasti benar" adalah nilai yang dapat dibedakan.
• pilihan — pilih salah satu dari hingga 255 opsi berlabel, setiap opsi membawa teks kriterianya sendiri sehingga model mengetahui apa yang membedakan label Anda.
• skor — nilai pada skala berurutan 2–10 tingkat, dengan definisi tingkat yang disediakan sebagai kriteria.
Konsekuensi dari pembatasan itu adalah tidak ada yang perlu diurai dari prosa dan tidak ada yang perlu divalidasi terhadap skema yang Anda harapkan diikuti oleh model. Postingan peluncuran TypeSafe luar biasa langsung tentang jaminan itu: angka ketidakcocokan skema "0%" dalam plotnya "tidak bersifat empiris. Pencocokan skema dijamin, sehingga kami dapat dengan yakin menambahkan 0% ke dalam plot." Ketika ruang jawaban Anda adalah himpunan tertutup yang Anda sediakan, nilai yang dikembalikan entah ada dalam himpunan itu atau tidak berasal dari model — tidak ada hasil ketiga ketika model menulis sesuatu yang masuk akal dalam bentuk yang salah dan regex Anda diam-diam menerimanya.
Ketiga jenis itu juga alasan mengapa peninjau tidak dapat mengevaluasi Jev seperti mereka mengevaluasi model obrolan. Tidak ada skor MMLU-Pro untuk dibandingkan, tidak ada contoh tulisan untuk dibaca, tidak ada jejak penalaran untuk diperiksa. Satu-satunya pertanyaan yang berarti apa pun adalah apakah jawaban yang diketik itu benar, dan apakah probabilitas yang melekat padanya jujur. Keduanya dapat diukur, tetapi hanya terhadap data dan label Anda.
Satu perbedaan yang didokumentasikan layak ditandai, bukan diselesaikan: dokumentasi TypeSafe sendiri menampilkan contoh Score yang diindeks dari nol, sedangkan kartu OrcaRouter mempublikasikan skala sebagai 2–10 level. Vendor mendokumentasikan level; kartu kami mempublikasikan 2–10. Jika Anda membangun rubrik di atas Score, baca definisi level dalam respons Anda sendiri alih-alih mengasumsikan indeks.
Mengapa tidak ada token output untuk ditagih
Penetapan harga adalah ungkapan paling bersih dari arsitektur. Jev berbiaya $0.042 per juta token masukan di OrcaRouter, dan tarif keluarannya adalah $0.000000 per juta — bukan diskon, bukan promosi peluncuran, melainkan tidak adanya kuantitas yang dapat diukur. Model generatif ditagih untuk teks yang ditulisnya; Jev tidak menulis teks apa pun. Ia mengembalikan label, level, dan probabilitas. Tidak ada yang bisa dihitung di sisi keluaran, jadi tidak ada yang dikenakan biaya di sana.
TypeSafe menyatakan angka yang sama dari arah sebaliknya di beranda mereka — “$42 per miliar token input” — dan menyematkan klaim perbandingan padanya: “Harga input 238x lebih rendah daripada Claude Fable 5.1”. Perbandingan itu, seperti semua hal lain di beranda, adalah milik vendor sendiri, tidak direplikasi oleh siapa pun. Tetapi aritmetika yang menjadi landasannya mudah diperiksa pembaca terhadap tagihan mereka sendiri, dan itulah bagian yang berguna. Volume sebuah beban kerja keputusan hampir seluruhnya ditentukan oleh berapa banyak state yang Anda masukkan, dan state itu murah dengan cara yang tidak berlaku pada token yang dihasilkan.
Angka utama vendor lebih besar daripada baris harga dan layak mendapat pelabelan yang sama. TypeSafe mengiklankan "193,6x Lebih Cepat, 444,6x Lebih Murah" dengan catatan kaki yang membatasinya pada "alur kerja untuk tugas System One", dan menerbitkan contoh perhitungan di bawahnya: TypeSafe AI dengan $0,000081 menyelesaikan dalam 0,114 detik, sedangkan LLM dengan $0,013880 menyelesaikan dalam 8,566 detik. Postingan peluncuran itu sendiri mengakui risiko pembingkaian — angka 193,6x dan 444,6x digambarkan kemungkinan berada di "ujung atas keuntungan dunia nyata" — dan mencatat bahwa demo berdampingan menggunakan kueri yang "sangat disederhanakan" dengan kunci yang dapat dibaca manusia yang dipilih vendor untuk "menggambarkan model kami dalam cahaya yang menguntungkan." Tidak satu pun dari angka-angka ini telah direplikasi secara independen, dan kartu benchmark vendor sendiri masih ditandai sebagai menunggu.
Apa arti "terkalibrasi", dan apa itu RLCD.
TypeSafe menamai metode pelatihannya sendiri: "Reinforcement Learning for Calibrated Decisions (RLCD)". RLCD adalah istilah milik TypeSafe sendiri, bukan akronim pembelajaran mesin umum yang sudah ada sebelum perusahaan ini, dan target optimisasinya dinyatakan dalam tabel perbandingan pada postingan peluncuran sebagai "keputusan terkalibrasi: jawaban dengan probabilitas yang jujur secara epistemik pada tugas System One". Kontras yang dibuat oleh tabel yang sama adalah dengan RLHF, yang mengoptimalkan preferensi manusia — tulisan dan respons obrolan yang disukai para penilai — dan RLVR, yang mengoptimalkan output yang dapat diverifikasi secara terprogram. RLCD mengoptimalkan hal ketiga: probabilitas yang dilekatkan pada suatu jawaban sebagai pernyataan yang akurat tentang ketidakpastian model itu sendiri.
Secara praktis, "terkalibrasi" adalah klaim tentang keyakinan, bukan jaminan bahwa jawabannya benar. Model terkalibrasi yang mengatakan 0,8 pada sekumpulan pertanyaan seharusnya benar sekitar 80% dari waktu di seluruh kumpulan itu; model itu tetap bisa salah pada pertanyaan mana pun secara individual. Perbedaan itu adalah cara jujur untuk membaca baris beranda TypeSafe "Zero Hallucinations — Setiap keputusan Jev disertai perkiraan keyakinan, sehingga perangkat lunak Anda dapat bertindak saat keyakinan tinggi dan mengeskalasi saat tidak." Itu adalah klaim perkiraan keyakinan, bukan bukti nol kesalahan, dan penyeimbangnya adalah data kami sendiri: selama tujuh hari yang berakhir pada 2026-09-30, kartu kami mengukur tingkat kesalahan 0,49% pada lalu lintas Jev melalui OrcaRouter — angka yang terbaca 0,57% lebih awal dalam jendela yang sama, karena dihitung atas tujuh hari bergulir dari lalu lintas playground langsung, bukan kumpulan uji tetap. Kedua fakta itu harus ada dalam paragraf yang sama: estimasi keyakinan itulah inti dari model ini, dan model ini tetap gagal kira-kira satu dari dua ratus panggilan pada lalu lintas kami.
Kisah kalibrasi juga menjelaskan perilaku latensi yang jika tidak akan terlihat seperti bug. Posting peluncuran TypeSafe mengatakan: "Untuk pilihan dengan kardinalitas yang lebih tinggi, kami melakukan sistem 2 tahap dengan memberi skor secara independen lalu membuat pilihan eksplisit, sehingga kadang terjadi perlambatan." Pilihan dengan 255 opsi bukanlah satu perbandingan forward; vendor memberi skor lalu memilih. Jika Anda melihat permintaan terhadap kumpulan label yang besar memakan waktu jauh lebih lama daripada noul, itu adalah mekanisme yang didokumentasikan, bukan kongesti.
Bagaimana Anda menyebutnya hari ini

Di OrcaRouter, modelnya adalah typesafe/jev-1.13, dengan nama "TypeSafe: Jev 1.13" di katalog, dengan context_length 65,536 token dan tepat satu jenis endpoint yang didukung: systemone. Anda memanggilnya dengan POST /v1/systemone menggunakan kunci OrcaRouter Anda, mengirimkan field model, field state (string, object, atau array), dan questions map di mana setiap entri membawa type (noul, choice, atau score), instructions, dan criteria-nya. Respons berupa satu payload JSON terstruktur dan tidak dialirkan — tidak ada mode streaming yang bisa dipilih.
Frasa kartu itu sendiri untuk kontrak adalah "teks masuk, JSON terstruktur keluar", dan batas yang dipublikasikan adalah yang harus menjadi acuan desain: non-streaming, hingga sekitar 64K token input di seluruh state dan pertanyaan yang digabungkan, dengan permintaan yang melebihi batas tersebut ditolak sebelum mencapai model. Entri katalog mencantumkan harga daftar sebesar $0,042 per juta token input dan menunjukkan tingkat penyelesaian sebagai nol. Itu adalah angka vendor yang diteruskan tanpa perubahan — bentuk proporsional dari cara kami menetapkan harga: markup 0% dari tarif daftar penyedia.
Dua anggaran token beredar untuk model ini dan keduanya tidak saling bertentangan, jadi pisahkan keduanya. Angka 65.536 adalah context_length kartu tersebut dan didokumentasikan sebagai sekitar 64K input dari state ditambah pertanyaan secara gabungan. "Sekitar 32.000 token" yang dikutip artikel OrcaRouter sebelumnya adalah anggaran state saja — ruang yang didapat materi Anda sebelum pertanyaan mengambil bagiannya. Jika Anda menganggarkan sebuah permintaan, anggaran state adalah angka yang membatasi payload yang Anda buat; angka gabungan adalah batas atas untuk keseluruhan panggilan.
Apa yang tidak dapat dilakukan Jev, dinyatakan dengan gamblang
Ia tidak dapat menulis prosa, merangkum, menerjemahkan, atau bercakap-cakap. Itu adalah desainnya, bukan keterbatasan yang perlu dimaafkan: tulisan peluncurannya menyatakan Jev "melepaskan generasi string", dan halaman jaggedness milik TypeSafe sendiri mencantumkan "Generation" sebagai mode kegagalan yang dinamai dengan instruksi "Gunakan model generatif" di sampingnya. Generasi yang dipaksakan itu lambat dan buruk. Jika pipeline Anda memerlukan ringkasan tertulis, Jev adalah komponen yang salah dan sebanyak apa pun keahlian merancang prompt tidak akan mengubahnya.
Itu bukan pengganti model generatif. Alur kerja tempat Jev berada memiliki dua model di dalamnya: satu model generatif yang membaca, menulis, dan bernalar dalam teks, dan Jev yang berada di sampingnya melakukan panggilan bertipe dalam hitungan milidetik. Itulah pembingkaian jujur dari setiap perbandingan biaya di beranda vendor — kolom "LLMs" bukanlah pesaing yang digantikan, melainkan separuh lain dari sistem yang sama, dan alasan pasangan ini menarik adalah bahwa separuh pengambilan keputusan kini berada pada kunci yang sama dengan separuh generatif, bukan di balik kontraknya sendiri.
Dan "terkalibrasi" tidak berarti benar. Artinya, angka yang dilampirkan pada sebuah jawaban dimaksudkan agar dapat dibaca sebagai probabilitas. Nilai 0,62 pada sebuah noul adalah model yang memberi tahu Anda bahwa ia tidak yakin, yang merupakan informasi berguna yang akan dihancurkan oleh jawaban ya/tidak sederhana — dan itu bukan janji bahwa "ya" itu benar. Logika eskalasi yang dibangun di atas keyakinan adalah pola yang dimaksudkan; memperlakukan jawaban sebagai kebenaran dasar tidaklah demikian.
Membaca angka-angka dengan jujur

Setiap angka penyajian di kartu kami berasal dari trafik kami sendiri melalui playground OrcaRouter selama jendela tujuh hari bergulir, bukan dari benchmark vendor, dan jendela itu bergeser selama tulisan ini dibuat — anggap ini sebagai pembacaan, bukan spesifikasi. Untuk tujuh hari yang berakhir 2026-09-30: median waktu ke token pertama 151 ms, p95 247 ms, throughput keluaran sekitar 349 token per detik, tingkat error 0,49%, dan 76,2 juta token dilayani. p50 harian sepanjang jendela bergerak di 175, 170, 163, 161, 170, 147, dan 143 ms — garis yang perlahan membaik. p95 09-28 sebesar 2.448 ms adalah outlier satu hari yang nyata dalam deret itu, dan mengutipnya sebagai norma akan salah, sama seperti menghapusnya sepenuhnya akan tidak jujur.
Satu catatan tambahan tentang angka trafik: 349 token keluaran per detik terdengar seperti throughput model generatif sampai Anda ingat bahwa Jev tidak menghasilkan teks generatif. Meter tersebut mengukur apa pun yang dihitung playground kami di sisi respons untuk payload terstruktur, dan itu berguna untuk mengenali degradasi antarhari, bukan untuk membandingkan Jev dengan model chat.
Itu angka kami. Angka vendor adalah 193.6x, 444.6x, contoh perhitungan $0.000081, dan perbandingan 238x terhadap Claude Fable 5.1 — semuanya milik TypeSafe sendiri, tidak ada yang direplikasi secara independen, semuanya dibatasi oleh catatan kaki mereka sendiri secara khusus pada alur kerja tugas System One. Satu klaim performa yang dibuat TypeSafe yang sama sekali bukan tolok ukur, dan lebih bernilai daripada faktor pengali, adalah klaim struktural: karena jawabannya bertipe, integrasi tidak memiliki langkah parsing dan tidak memiliki langkah validasi skema, dan itu adalah biaya yang tidak muncul di tabel latensi mana pun.
Apa yang terbuka, dan apa yang tidak
Diperiksa pada 2026-09-30, organisasi GitHub TypeSafe menerbitkan sebelas repositori. Tidak satu pun berisi Jev. Repositori yang penting bagi pengembang yang mengintegrasikan model ini semuanya berlisensi MIT atau Apache-2.0: skills (MIT), system-one-adapter-python (MIT, dijelaskan sebagai "pengganti TypeSafeClient drop-in yang didukung API LLM"), typesafe-sdk-js (MIT), typesafe-sdk-python (MIT), daggerverse (Apache-2.0), WorkflowEvals (Apache-2.0, dengan kode alur kerja yang diterbitkan di evals.typesafe.ai), n8n-nodes-typesafe-ai (MIT), typesafe-ai.github.io dan pulumi-clickhouse. Jumlah bintang dan tanggal push berubah, jadi jika Anda membaca ini nanti, periksa ulang daripada memercayai daftar ini.
Tiga dari sebelas itu adalah fork dari proyek-proyek yang tidak terkait dan tidak membuktikan apa pun tentang cara Jev bekerja: sebuah fork vLLM yang terakhir di-push pada Mei 2025, sebuah fork LLaDA dari Juni 2025 — LLaDA adalah rilis model bahasa difusi yang tidak terkait — dan provider Pulumi untuk ClickHouse Cloud. Menggoda untuk membaca arsitektur dari daftar fork. Jangan: tidak ada apa pun tentang desain Jev yang dapat disimpulkan dari ketiga hal tersebut, dan secara khusus Jev bukan model difusi, betapa pun keberadaan fork LLaDA mungkin menyiratkannya.
Jawaban jujur satu baris untuk "apakah Jev open source" adalah bahwa perkakasnya terbuka dan modelnya tidak. Itu adalah pengaturan yang normal untuk model frontier yang dihosting, dan itulah pengaturan yang harus Anda asumsikan saat Anda merencanakan seputar Jev: sebuah API dengan harga yang dipublikasikan, kontrak yang didokumentasikan, dan jumlah parameter yang tidak dipublikasikan.
Di mana vendor mengatakan Jev tidak dapat diandalkan
TypeSafe menerbitkan halaman jaggedness-nya sendiri untuk jev-1.13, terakhir ditinjau 2026-09-17, yang menyebutkan di mana model itu gagal. Halaman ini luar biasa terbuka dan merupakan tempat yang tepat untuk memulai bagian keterbatasan, karena ini adalah daftar milik vendor itu sendiri, bukan milik pesaing:
• Pembacaan literal — ia memaknai kata-kata apa adanya. Kata-kata pembatas cakupan, negasi, dan kondisi tersirat tidak disimpulkan; ia "menjawab pertanyaan yang Anda tulis, bukan yang Anda maksudkan." Perbaikan dari vendor adalah menuliskan kondisi persisnya dan kriteria untuk setiap opsi.
• Matematika dan angka — ini bukan kalkulator, dan tidak dapat menghitung dengan andal. Lakukan aritmetika di dalam kode.
• Perbandingan tanggal dan waktu — tanggal dibaca sebagai teks, bukan kuantitas yang terurut, sehingga pengurutan, celah, dan jendela waktu menjadi tidak andal, lebih buruk lagi jika formatnya campuran.
• Indireksi — negasi ganda dan penalaran multi-langkah menurunkan akurasi. Kurangi lompatan dan arahkan langsung ke state yang relevan.
• State besar yang penuh detail tidak relevan — konten yang tidak berkaitan berperan sebagai distraktor dan akurasi menurun seiring bertambahnya state. Filter terlebih dahulu.
• Konten adversarial — state tidak diperlakukan sebagai bermusuhan, sehingga instruksi yang disuntikkan atau pembingkaian yang menyesatkan dapat menggeser jawaban.
• Instruksi dan kriteria yang saling bertentangan — ketika keduanya meminta hal yang berbeda, model "mungkin menjadi bingung."
• Invarian struktural berdasarkan akal sehat — P(noul) dan 1 − P(not noul) tidak dijamin konsisten. Ajukan setiap keputusan dengan satu cara dan tegakkan identitas dalam kode.
• Generasi — sudah dibahas, dan saran vendor sendiri adalah menggunakan model generatif.
Dua di antaranya layak ditekankan. Yang bersifat adversarial penting karena seluruh proposisi nilai Jev adalah menilai materi yang tidak tepercaya, dan state yang berisi instruksi dapat menggeser jawaban; jika state Anda datang dari pengguna, itu adalah permukaan prompt-injection yang bentuknya sama seperti permukaan lainnya. Yang berkaitan dengan invarian struktural penting karena model yang "terkalibrasi" mengundang Anda untuk melakukan aritmetika pada probabilitasnya, dan vendor memberi tahu Anda untuk tidak mengasumsikan bahwa aritmetikanya tertutup.
Apa yang menjadi komitmen postingan peluncuran, dan apa yang tidak.

Hampir setiap klaim vendor yang dikutip dalam tulisan ini dapat dilacak kembali ke satu halaman: pengumuman TypeSafe sendiri, yang diajukan di bawah Berita Perusahaan dan bertanggal 2026-09-15, ditandatangani oleh pendiri Diogo Almeida. Membacanya secara langsung sepadan dengan dua menit yang diluangkan, karena susunan kata dalam satu baris menetapkan ketentuan untuk segala hal sejak itu. "Model publik pertama kami adalah Jev, tersedia hari ini dalam akses awal." Akses awal adalah deskripsi vendor sendiri tentang ketersediaan di platform milik vendor itu sendiri, dan pernyataan itu lebih sempit daripada kelihatannya — pernyataan itu mengikat TypeSafe untuk menyajikan model tersebut kepada pengguna yang disetujui, dan tidak mengatakan apa pun tentang siapa lagi yang boleh menyajikannya. Itulah tepatnya celah yang ditutup oleh penambahan katalog 2026-09-24, dan alasan kartu model lebih penting daripada postingan itu bagi siapa pun yang mengevaluasi Jev hari ini.
Halaman yang sama sama jelasnya tentang batasannya sendiri, itulah sebabnya halaman itu dikutip, bukan diparafrasakan, di atas. Halaman itu tidak menerbitkan jumlah parameter, tidak ada deskripsi arsitektur selain "arsitektur model baru", tidak ada komputasi pelatihan dan tidak ada repositori bobot, dan tidak memberikan tanggal atau syarat untuk ketersediaan umum. Ketiadaan itu adalah batasan perencanaan: sebuah API dengan harga yang dipublikasikan di satu sisi, dan tumpukan yang bagian dalamnya tidak dapat Anda periksa di sisi lain. Pos itu juga membingkai model secara cukup jujur sehingga berguna sebagai spesifikasi — "panggilan fungsi kecerdasan terdepan: keadaan tidak terstruktur masuk, keputusan probabilistik bertipe keluar" — yang merupakan satu-satunya kalimat di dalamnya yang mendeskripsikan antarmuka, bukan ambisinya.
Pertanyaan yang muncul dari antarmuka ini
Apa yang terjadi ketika kumpulan pilihan lebih besar dari 255 opsi? Jumlahnya dibatasi — 255 opsi berlabel adalah batas maksimum pada pertanyaan pilihan, dan pendekatan dua tahap vendor yaitu menilai lalu memilih adalah yang dilakukannya saat kardinalitas meningkat, yang juga merupakan sumber terdokumentasi dari perlambatan sesekali pada kumpulan label yang besar. Jika taksonomi Anda lebih besar dari itu, jawaban desainnya adalah menguraikannya menjadi beberapa pertanyaan dan menggabungkannya kembali dalam kode, yang merupakan saran yang sama yang diberikan TypeSafe untuk penilaian gabungan.
Apakah konteks 65.536 token berarti 65.536 token state? Tidak. Anggaran yang dipublikasikan adalah sekitar 64K token untuk gabungan state dan semua pertanyaan, dan angka "sekitar 32.000 token" yang muncul dalam liputan lama adalah anggaran state saja. Hitunglah payload Anda berdasarkan angka state, bukan angka gabungan, dan ingat bahwa permintaan yang melebihi batas akan ditolak sebelum mencapai model.
Apa yang harus dilakukan dengan ini
Jev 1.13 layak dilihat karena satu alasan spesifik dan bukan karena alasan umum. Jika Anda memiliki langkah dalam pipeline yang saat ini berupa model chat yang diminta mengembalikan label dan dipercaya mengembalikannya dalam bentuk yang benar — sebuah router, penilai, pemeriksaan kebijakan, skor rubrik yang diterapkan pada ribuan catatan — langkah itulah yang digantikan oleh model ini, dengan $0.042 per juta token input tanpa ada yang diukur di sisi output. Jika Anda memiliki langkah yang membutuhkan jawaban tertulis, Jev bukan alatnya dan vendornya sendiri mengatakan demikian.
Hal yang berubah dalam sepekan terakhir bukanlah modelnya. Yang berubah adalah bahwa mencobanya tidak lagi mengharuskan hubungan dengan vendor kedua. Delapan hari yang lalu, evaluasi Jev berarti akun terpisah dan integrasi terpisah; hari ini, itu hanyalah satu ID model pada kunci yang sudah menjangkau 200+ model, dengan harga daftar vendor diteruskan tanpa perubahan dan jawaban yang diketik kembali dari tempat yang sama seperti semua hal lainnya. Untuk model yang tidak biasa ini, kemampuan mengujinya terhadap label Anda sendiri tanpa berkomitmen pada kontrak baru adalah sebagian besar dari keputusan tersebut.
