Kartu judul yang dihasilkan bertuliskan "Jev vs Kev" di atas subjudul "Fine-tune senilai $95 yang mengalahkan Jev dalam tiket dukungan", mengontraskan Jev (tertutup, dihosting, arsitektur tidak diungkapkan, $0.042 per juta input, output gratis) dengan Kev (Apache 2.0, basis Qwen3.5, 0.8B hingga 9B, sekitar $95 dalam waktu H100).
Engineering & Research

Jev vs Kev: Fine-Tune Seharga $95 yang Mengalahkan Jev pada Tiket Dukungan

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Jared Palmer merilis Kev pada 20 September 2026, lima hari setelah TypeSafe AI meluncurkan Jev, dan angka pentingnya tidak ada di tabel benchmark. Angka itu ada di README: keseluruhannya memakan biaya sekitar $95 untuk waktu H100 di Modal, ditambah tiga sen panggilan API Jev yang digunakan untuk menghasilkan data evaluasi. Kev berlisensi Apache-2.0, dapat dihosting sendiri, dan tersedia dalam tiga ukuran yang dibangun di atas bobot dasar Qwen3.5 — kira-kira 0,8B, 4B, dan 9B — dengan adaptor LoRA rank-16 dan pointer head yang dipasang pada basis yang dibekukan, bukan model keputusan yang dibangun dari nol. Ia meniru persis API keputusan bertipe milik Jev: Choice, Score, dan Noul, cukup dekat sehingga kompatibel dengan SDK Python milik TypeSafe sendiri. Jev, pada bagiannya, diluncurkan pada 15 September 2026 sebagai model System One tertutup dan dihosting milik TypeSafe AI, mengembalikan jawaban bertipe dengan keyakinan terkalibrasi dan sama sekali tanpa teks, dan tidak pernah mempublikasikan arsitektur, jumlah parameter, komputasi pelatihan, atau bobotnya. Karena itu, perbandingannya sebenarnya bukan perbandingan model. Ini adalah ujian tentang seberapa besar nilai Jev yang bertahan ketika direproduksi dalam satu sore dengan harga laptop bekas.

Apa yang sebenarnya dikatakan oleh tolok ukur

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability returned with every answer, free output, and the roughly 32,000-token request budget with a 255-option Choice cap.

Berita utamanya adalah Kev hampir setara, dan pada satu tugas sempit ia menang. Pada set uji sumber baru terkunci milik Kev, Kev-9B mencetak 0,837 melawan 0,857 milik Jev. Untuk perutean tiket dukungan di 900 tiket — set scienthoon — Kev-9B mencetak 0,952 melawan 0,897 milik Jev, yang merupakan satu-satunya hasil terpublikasi di mana reproduksi terbuka mengalahkan model yang direproduksinya. Kev juga sedikit unggul pada beberapa tugas pengenalan logika. Pada set keputusan SemiF, sebuah set terstruktur berisi 144 pertanyaan, Jev memenangkannya 0,965 berbanding 0,917 milik Kev-9B.

Di mana Kev kalah, ia kalah dengan sangat buruk. Akurasi di luar domain: Kev-8B pada 79,6% dibandingkan 85,7% milik Jev. MMLU: 70% dibandingkan 90%. MMLU-Pro: 0,515 dibandingkan 0,840. Aritmetika tanggal pada presisi hari: 60% dibandingkan 93%. Polanya konsisten — Kev kompetitif pada routing dan klasifikasi yang sempit di mana kumpulan labelnya kecil dan domainnya tetap, dan ia ambruk pada apa pun yang membutuhkan pengetahuan dunia atau aritmetika multi-langkah, karena adapter rank-16 pada model dasar kecil yang dibekukan bukanlah tempatnya pengetahuan dunia.

Semua angka tersebut berasal dari harness milik Kev sendiri atau dari pelacak pihak ketiga, dan README milik Palmer menyatakan secara gamblang bahwa ini bukan perbandingan terkontrol — data pelatihan Jev tidak diungkapkan, jadi tidak ada cara untuk membuatnya. README tersebut juga menyatakan bahwa tidak ada keluaran Jev yang digunakan untuk pelatihan. Kedua disclaimer itu justru membuat angka-angka tersebut lebih dapat dipercaya, bukan sebaliknya: orang yang menerbitkan perbandingan itulah yang memberi tahu Anda apa yang tidak dapat dibuktikannya.

Apa yang Anda dapatkan seharga $95 yang tidak dapat Anda dapatkan dari Jev dengan harga berapa pun

A screenshot of the Kev repository page for jaredpalmer/kev, showing the Apache-2.0 licence, the Qwen3.5 base weights, the rank-16 LoRA and pointer-head recipe, the about-$95 H100 training cost, and the README statement that no Jev outputs were used for training.

Perbandingan biaya adalah titik di mana kedua produk sama sekali tidak lagi bisa dibandingkan. Jev adalah $0,042 per juta token input dengan output gratis, yang murah dengan cara yang benar-benar sulit dikalahkan per panggilan — tetapi itu adalah API yang dihosting dan akses awal dengan daftar tunggu, dan TypeSafe mengatakan batas laju dapat berubah tanpa pemberitahuan. Kev adalah bobot yang Anda unduh. Biaya marginal untuk klasifikasi ke-sepuluh juta adalah listrik Anda sendiri.

Ada empat hal yang mengikuti dari itu, dan tidak satu pun dari hal-hal itu berkaitan dengan skor benchmark.

• Tidak ada data yang meninggalkan infrastruktur Anda. Jev adalah endpoint yang dihosting; setiap state yang Anda kirimkan padanya — tiket dukungan, baris log, rekam medis — dikirim ke TypeSafe. Kev berjalan di GPU Anda sendiri, yang bagi beban kerja teregulasi bukan sekadar preferensi melainkan faktor penentu.

• Tidak ada batas laju, tidak ada daftar tunggu, tidak ada risiko dianggap usang. Dokumentasi TypeSafe sendiri mencatat bahwa batas laju dapat berubah tanpa pemberitahuan. Checkpoint lokal tidak memiliki klausul semacam itu.

• Anda dapat menyempurnakannya. Kev adalah basis untuk spesialisasi, dan resep LoRA yang menghasilkannya bersifat publik. Jika taksonomi perutean Anda memiliki 40 kelas yang tidak ditangani dengan baik oleh model umum mana pun, Anda dapat melatih dengan label Anda sendiri — yang persis dilakukan Palmer, dengan biaya yang diukur dalam puluhan dolar, bukan dengan tim ML.

• Plafon konteksnya bisa Anda ubah. Anggaran permintaan terdokumentasi Jev sekitar 32.000 token dan field Choice dibatasi hingga 255 opsi. Kev mewarisi jendela Qwen3.5, yang jauh lebih besar, dan batas opsi adalah detail implementasi dari stack serving Anda sendiri, bukan batas vendor.

Apa yang masih dimiliki Jev yang tidak dimiliki Kev

Klaim kalibrasi adalah klaim yang tidak berpindah dengan mulus, dan itu adalah inti dari pitch TypeSafe. Jev dilatih dengan metode yang oleh TypeSafe disebut RLCD — Reinforcement Learning for Calibrated Decisions — yang mengoptimalkan nilai keyakinan agar jujur, bukan agar jawabannya lebih disukai. Setiap jawaban Jev disertai distribusi probabilitas atas opsi-opsi, sehingga kode Anda dapat menetapkan ambang batas: bertindak otomatis pada rentang teratas, tandai di rentang tengah, eskalasi di rentang bawah.

Kev menghasilkan bentuk bertipe yang sama dan output probabilitas yang sama, karena API-nya sengaja dibuat kompatibel. Apakah probabilitas tersebut terkalibrasi adalah pertanyaan yang berbeda, dan jawaban jujurnya adalah belum ada yang menerbitkan diagram reliabilitas untuk salah satu model tersebut. Sebuah audit kalibrasi terpisah melaporkan bahwa Jev memperoleh akurasi 44,7% dengan kesalahan kalibrasi yang diharapkan sebesar 0,325 pada tugas prioritas dengan kebijakan tersembunyi, yang menunjukkan bahwa kalibrasi pada Jev sangat bervariasi menurut tugas alih-alih menjadi properti universal — dan TypeSafe sendiri memberi tahu pengguna untuk menguji ambang batas keyakinan terhadap contoh berlabel mereka sendiri alih-alih mempercayai perilaku yang dipublikasikan.

Hal lain yang dimiliki Jev adalah bahwa ia tidak dilatih pada Qwen3.5. Model 9B dengan adapter rank-16 memiliki plafon pengetahuan, dan selisih MMLU-Pro 0,515 versus 0,840 membuat plafon itu terlihat. Jika keputusan routing Anda kadang-kadang memerlukan pengetahuan tentang apa itu sesuatu, arsitektur Jev yang lebih besar dan tidak diungkapkan sedang melakukan pekerjaan yang tidak dapat dilakukan oleh adapter Kev.

Latensi dan bentuk penerapan

Latensi end-to-end terdokumentasi Jev adalah 70–500ms dibandingkan 3–329 detik untuk panggilan LLM terdepan dalam perbandingan TypeSafe sendiri, dan menambahkan pertanyaan ke sebuah panggilan hampir tidak mengubahnya karena setiap pertanyaan dievaluasi secara paralel terhadap satu pembacaan state yang sama. Kev-9B di H100 akan berada dalam orde besaran yang sama untuk satu forward pass, tetapi perbandingan itu tidak setara ke arah mana pun: 9B self-hosted di GPU bersama yang sedang berbeban tidak memiliki latensi yang sama dengan endpoint yang dihosting, dan endpoint yang dihosting tidak sama dengan mesin di rak Anda sendiri. Yang dapat dikatakan secara lugas adalah bahwa keduanya cukup cepat untuk penggunaan per giliran dalam loop agen, dan bahwa latensi Kev merupakan fungsi dari perangkat keras yang Anda kendalikan, bukan tingkat layanan yang dijanjikan kepada Anda.

Pembacaan jujur atas reproduksi

Fakta bahwa Kev ada sama sekali adalah bukti tentang Jev, dan itu layak disebutkan. Model tertutup yang perilakunya dapat didekati dalam lima hari dengan biaya $95, oleh satu orang, di atas bobot dasar publik, memberi tahu Anda sesuatu tentang seberapa besar keunggulannya berasal dari arsitektur dan seberapa besar dari data pelatihan serta penyajian model. Bukan berarti Jev mudah dibangun — permukaan API-nya mudah disalin, tetapi kalibrasinya tidak. Tetapi itu berarti parit pertahanannya bukan antarmuka, dan siapa pun yang mengevaluasi Jev untuk jalur produksi harus memperhitungkan kemungkinan bahwa fine-tune dari model dasar terbuka membawa mereka hampir sampai dengan hanya sebagian kecil dari komitmen.

Yang juga menjadi argumen untuk belum mempertaruhkan jalur produksi pada salah satunya. Jika Anda sedang mengevaluasi Jev, sikap yang masuk akal adalah mencobanya tanpa berkomitmen padanya — dan OrcaRouter tidak menyediakan Jev, karena model TypeSafe masih akses awal dan menggunakan bentuk permintaannya sendiri. Yang kami cakup adalah separuh generatif dari alur kerja tempat model-model keputusan ini berada: 200+ model di balik satu kunci yang kompatibel dengan OpenAI dengan harga daftar penyedia yang diteruskan tanpa markup 0%, dengan failover otomatis. Arsitektur dua model di mana lapisan keputusan yang murah menyortir lalu lintas dan model generatif menangani sisanya dapat diuji di sisi kami tanpa kontrak vendor kedua, dan jika komponen keputusan ternyata salah dikalibrasi pada data Anda, jalur failover-lah yang mencegahnya menjadi insiden.

Putusan

Jika tugas keputusan Anda sempit, berdomain tetap, bervolume tinggi, dan sensitif terhadap privasi, Kev adalah pilihan yang lebih dapat dipertahankan saat ini, dan tidak ada yang mendekati — Anda memiliki bobotnya, Anda mengendalikan jalur data, Anda dapat melakukan fine-tuning dengan label Anda sendiri, dan dalam perutean tiket dukungan, checkpoint 9B-nya sudah mengalahkan Jev berdasarkan angka yang dipublikasikan Jev sendiri. Jika tugas keputusan Anda membutuhkan pengetahuan dunia, aritmetika multi-langkah, atau nilai keyakinan yang ingin Anda jadikan dasar otomasi, model Jev yang lebih besar dan tidak diungkapkan serta pelatihan RLCD-nya benar-benar berperan, dan adaptor Kev bukan pengganti untuk salah satu pun dari keduanya.

Satu hal yang tidak diselesaikan oleh kedua perbandingan itu adalah kalibrasi, karena belum ada yang menerbitkan diagram reliabilitas untuk salah satu model pun. Uji hal itu pada kasus berlabel Anda sendiri sebelum Anda mengotomatiskan berdasarkan salah satu dari keduanya — nilai keyakinan adalah bagian dari kedua produk yang harus diperoleh per penerapan, dan kecepatan adalah bagian yang sudah menjadi komoditas.

A generated two-column scoreboard comparing Jev and Kev across the same six labelled dimensions, with a footer reading "Kev figures per its own README and harness; not a controlled comparison."