Kartu judul yang dihasilkan bertuliskan "Jev vs DeepSeek V4.1 Flash" dengan subjudul "Delapan sen per seribu bukanlah benteng pertahanan", yang membandingkan Jev (keputusan bertipe, keyakinan terkalibrasi, $0,042 per juta input, output gratis) dengan DeepSeek V4.1 Flash (generatif, konteks 1 juta, $0,30 / $1,20 per juta pada tarif puncak).
Guides & Insights

Jev vs DeepSeek V4.1 Flash: Delapan Sen per Seribu Bukanlah Parit Pertahanan

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Perbandingan yang menentukan pertanyaan Jev bukanlah dengan model terdepan. Melainkan dengan DeepSeek V4.1 Flash, yang dirilis 10 September 2026 — lima hari sebelum TypeSafe AI merilis Jev — karena DeepSeek V4.1 Flash adalah model generatif yang benar-benar murah, dan itu adalah hal termurah di ruangan itu yang bisa melakukan hampir semua yang bisa dilakukan Jev. Sebuah uji independen yang diterbitkan pada September 2026 menjalankan 77 contoh dari BANKING77, kumpulan klasifikasi intent standar, melalui keduanya: Jev menghasilkan 7 sen per 1.000 klasifikasi dengan akurasi 75%. DeepSeek V4.1 Flash menghasilkan 8 sen per 1.000 dengan akurasi 79%. Uji yang sama menempatkan GPT-5.6 Luna pada 12 sen dan 83%. Model generatif dengan jendela konteks satu juta token, pemanggilan alat native, dan input gambar tertinggal satu sen per seribu klasifikasi dari model keputusan yang dibuat khusus — dan unggul empat poin dalam akurasi. Itulah fakta tidak nyaman yang menjadi pusat pertarungan ini, dan itu membingkai ulang apa yang sebenarnya dijual Jev.

Apa yang dilakukan setiap model

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, parallel evaluation against one shared read of the state, free output, and the roughly 32,000-token request budget.

Jev adalah model keputusan System One: ia tidak mengembalikan teks sama sekali. Anda mengirimkan state plus pertanyaan bertipe — Choice dari daftar yang Anda sediakan, Score pada rubrik terurut, atau Noul (klaim ya/tidak dengan probabilitas terkalibrasi) — dan ia mengembalikan jawaban bertipe dengan nilai keyakinan. Semua pertanyaan dievaluasi secara paralel terhadap satu pembacaan state yang sama, itulah sebabnya menambahkan pertanyaan hampir tidak mengubah waktu respons, dan mengapa output tidak memakan biaya: tidak ada token output yang perlu diukur. Input adalah $0,042 per juta token, output gratis, dan anggaran permintaan sekitar 32.000 token. Diluncurkan pada 15 September 2026, oleh TypeSafe AI, didirikan oleh Diogo Almeida dengan pendanaan awal $40 juta yang dipimpin oleh DCVC.

DeepSeek V4.1 Flash adalah model generatif konvensional dan tidak berpura-pura menjadi yang lain. Model ini dirilis pada 10 September 2026 dengan id API deepseek-flash, dibangun sebagai campuran pakar (mixture-of-experts) dengan 552 miliar parameter dan aktivasi asimetris pada 8B/16B, jendela konteks 1 juta token, serta input teks dan gambar. Model ini menghasilkan teks token demi token, yang justru merupakan sifat yang membuatnya lebih mahal per panggilan dan lebih mumpuni per panggilan. Model ini berjalan pada 208,3 token per detik dengan waktu ke token pertama 1,13 detik, dan harganya $0,30/$1,20 per juta token pada jam sibuk dan $0,15/$0,60 di luar jam sibuk. Di Artificial Analysis, model ini berada pada Indeks 40 — kelas menengah, bukan kelas terdepan.

Mengapa perhitungan per klasifikasi menghasilkan nilai seperti itu

Selisih satu sen itu bukan kebetulan dan tidak stabil. Hal itu muncul dari cara masing-masing model menagih.

• Biaya Jev per keputusan pada dasarnya tetap — Anda membayar untuk satu kali pemrosesan atas input, sebesar $0,042 per juta token, dan jumlah pertanyaan yang Anda ajukan nyaris tidak mengubahnya. Klasifikasi yang membutuhkan satu label dan klasifikasi yang membutuhkan dua puluh label biayanya hampir sama.

• Biaya per keputusan DeepSeek V4.1 Flash sebanding dengan output. Klasifikasi menjadi label singkat itu murah; tugas yang sama di mana Anda meminta alasan, keyakinan, dan envelope JSON terstruktur menghabiskan token output beberapa kali lipat dan karenanya harganya beberapa kali lipat.

• Jam sibuk versus di luar jam sibuk menggandakan harga input DeepSeek dan menggandakan harga outputnya. Jalankan pekerjaan klasifikasi secara batch pada jam yang salah, dan selisih satu sen itu menjadi angka yang sama sekali berbeda.

Itulah sebabnya estimasi independen tentang kesenjangan tersebut sangat berbeda. Uji BANKING77 dengan 77 contoh menemukan 7¢ versus 8¢. Tolok ukur komposit terpisah, JevBench, menempatkan Jev pada $0.041 per 1.000 dan DeepSeek V4.1 Flash pada $0.579 per 1.000 — kesenjangan empat belas kali lipat. Uji ketiga pada 83 kontak penjualan menemukan DeepSeek V4.1 Flash pada $0.183 per proses versus $0.0055 milik Jev, kesenjangan 33 kali lipat. Alasan angka-angka itu mencakup dua orde besaran adalah karena masing-masing mengasumsikan prompt yang berbeda, bentuk output yang berbeda, dan waktu dalam sehari yang berbeda. Siapa pun yang mengutip satu angka per klasifikasi seolah-olah itu properti modelnya dan bukan properti harness-nya sedang menjual sesuatu.

Apa yang diberikan struktur Jev yang tidak bisa diberikan oleh model generatif

Yang membedakan bukanlah harga. Melainkan kontraknya. Output Jev terkunci oleh skema: karena setiap kemungkinan jawaban dienumerasi sebelum model dijalankan — Anda memasok daftar pilihan, rubrik, atau klaim benar/salah — tidak ada ruang untuk mengeluarkan nilai di luar tipe yang dideklarasikan. Respons yang tidak sesuai format bukanlah hal yang dapat dihasilkan Jev. DeepSeek V4.1 Flash dapat dibatasi untuk menghasilkan output terstruktur dengan skema, dan dalam praktiknya sebagian besar patuh, tetapi jaminannya adalah prior yang kuat, bukan properti struktural. Jika pipeline Anda menjalankan sepuluh juta klasifikasi per bulan, "sebagian besar" dan "selalu" adalah butir yang berbeda dalam laporan insiden.

Sifat kedua adalah kalibrasi. Jev dilatih dengan metode yang oleh TypeSafe disebut RLCD — Reinforcement Learning for Calibrated Decisions — dan setiap jawaban membawa distribusi probabilitas, sehingga kode Anda dapat menetapkan ambang batas: terima otomatis di atas, tandai di tengah, eskalasi di bawah. DeepSeek V4.1 Flash akan menghasilkan angka keyakinan jika Anda memintanya, tetapi itu adalah token yang dihasilkan, bukan keluaran yang terkalibrasi, dan keyakinan yang dihasilkan adalah klaim tentang dirinya sendiri alih-alih pengukuran. Perbedaan itulah alasan utama untuk membayar model keputusan, dan itu satu-satunya hal yang secara struktural tidak dapat ditandingi oleh model generatif yang murah.

Yang ketiga adalah bentuk latensi. Latensi end-to-end Jev yang terdokumentasi adalah 70–500 ms terlepas dari berapa banyak pertanyaan yang dilampirkan, dibandingkan dengan 3–329 detik untuk panggilan LLM terdepan dalam perbandingan TypeSafe sendiri. TTFT 1,13 detik dan throughput 208 token/detik DeepSeek V4.1 Flash sangat baik untuk model generatif, dan itulah standar yang seharusnya menjadi acuan penilaiannya — tetapi pada keluaran yang dihasilkan beberapa ratus milidetik ditambah latensi token pertama, itu menjadi beberapa detik per keputusan, bukan sepersekian detik. Pada dasbor alur kerja internal TypeSafe, Jev unggul di kolom biaya dan latensi serta kalah di kolom akurasi, dengan 61,8% berbanding 79,1% pada pemrosesan faktur dan 76,0% berbanding 78,3% pada layanan pelanggan. Jawaban referensi dasbor tersebut adalah penilaian model yang dirata-ratakan, bukan ground truth, dan dasbor itu sendiri menandai kemungkinan bias harness.

Kesenjangan konteks itu nyata dan satu arah.

Satu dimensi di sini tidak dekat dan bukan soal pembingkaian. DeepSeek V4.1 Flash membawa jendela konteks satu juta token; anggaran permintaan Jev kira-kira 32.000 token. Jika klasifikasi Anda bergantung pada membaca seluruh kontrak, utas dukungan yang panjang, atau file kode yang besar, DeepSeek V4.1 Flash dapat melihatnya dan Jev tidak — tidak ada tingkat kemurahan per keputusan yang bisa memperbaiki keadaan yang tidak muat. Jev juga tidak menerima input gambar atau audio saat peluncuran, sedangkan DeepSeek V4.1 Flash menerima gambar.

Sisi sebaliknya adalah bahwa jendela sempit Jev dihargai seolah-olah merupakan liabilitas, bukan batasan, dan pola dua tahap dalam dokumentasi TypeSafe sendiri adalah solusi sementaranya: untuk bidang Choice di luar batas 255 opsi, beri skor pada kandidat dalam batch lalu pilih di antara skor-skor tersebut. Cara itu berhasil ketika state-nya kecil dan kumpulan opsinya besar. Cara itu tidak berhasil ketika state-nya besar.

Di mana masing-masing berada

Pilih Jev ketika keputusannya benar-benar berbentuk tertutup, state-nya muat dalam 32K token, volumenya cukup tinggi sehingga hitungan detik per panggilan menjadi biaya nyata, dan pipeline membutuhkan nilai keyakinan yang bisa dijadikan dasar percabangan. Pemeriksaan guardrail, verifikasi per giliran di dalam loop agen, routing bervolume tinggi, dan penilaian kumpulan dokumen besar secara paralel adalah kecocokan yang terdokumentasi.

Pilihlah DeepSeek V4.1 Flash ketika tugas perlu membaca sesuatu yang panjang, ketika perlu menghasilkan alasan di samping label, ketika perlu melihat gambar, atau ketika klasifikasi merupakan satu langkah dalam alur kerja generatif yang lebih panjang dan memisahkannya ke vendor kedua akan menambah satu peralihan demi penghematan satu sen yang bisa dihapus oleh prompt yang buruk. Dan perhatikan bahwa "model generatif juga bisa melakukannya" adalah deskripsi yang tepat tentang tugas tersebut, bukan kegagalan Jev — pertanyaan yang menarik adalah apakah Anda memerlukan nilai keyakinan, karena itu satu-satunya item baris dalam perbandingan yang tidak dapat ditawarkan model generatif dengan harga berapa pun.

Menjalankan lapisan keputusan dan lapisan generatif pada satu kunci

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash, showing the model routed through the unified API with provider list price passed through at 0% markup, plus the routing-details and failover panels.

DeepSeek V4.1 Flash adalah salah satu model yang dirutekan OrcaRouter, pada harga daftar penyedia yang diteruskan dengan markup 0% — jadi potongan off-peak aktif di sisi kami pada hari yang sama DeepSeek merilisnya, dan Anda tidak perlu melacak dua daftar harga. Jev sendiri tidak kami layani: model TypeSafe ini dalam akses awal dan menggunakan bentuk permintaannya sendiri. Arsitektur yang ditunjuk perbandingan ini adalah arsitektur dua model — Jev memutuskan, DeepSeek V4.1 Flash menghasilkan — dan OrcaRouter mencakup separuh generatif di balik satu endpoint yang kompatibel dengan OpenAI, dengan failover otomatis sehingga komponen keputusan yang belum terbukti tidak pernah menjadi satu titik kegagalan.200+ model, satu kunci, satu tagihan.

Putusan

Jika Anda datang ke sini dengan harapan Jev jauh lebih murah daripada model generatif, jawaban jujurnya adalah bahwa dibandingkan DeepSeek V4.1 Flash, biasanya memang tidak demikian, dan pada tes khusus dengan 77 contoh ini, Jev lebih murah satu sen dan akurasinya empat poin lebih rendah. Yang dijual Jev bukanlah harga per klasifikasi. Yang dijual adalah jaminan struktural bahwa output tidak mungkin berbentuk cacat, nilai keyakinan terkalibrasi yang bisa menjadi dasar percabangan kode Anda, dan batas bawah latensi yang diukur dalam milidetik, bukan detik. Ketiga hal itu layak dibayar dalam pipeline yang berjalan cukup sering sehingga patut diperhatikan — dan ketiganya sama sekali tidak bernilai jika tugas Anda adalah membaca dokumen 400 halaman dan menulis ringkasannya, yang merupakan tugas DeepSeek V4.1 Flash dan tidak pernah menjadi tugas Jev.

A generated two-column scoreboard comparing Jev and DeepSeek V4.1 Flash across the same six labelled dimensions, with a footer reading "Per-classification figures from a 77-example test; not a controlled comparison."