
DeepSeek V4 Review: Model 1M-Token Termurah yang Serius di AI?
DeepSeek merilis keluarga V4 pada 24 April 2026 — dua model, V4-Pro dan V4-Flash, tersedia di API dan bersumber terbuka sejak hari pertama — dan secara diam-diam mengubah standar biaya kemampuan AI yang serius. Kedua model membawa jendela konteks 1 juta token sebagai default, keduanya menawarkan mode berpikir dan tidak berpikir, dan flagship V4-Pro mencapai puncak pada $0,87 per juta token output: harga yang lebih rendah dari setiap model konteks 1 juta sebanding di pasaran, baik terbuka maupun tertutup.
Dan Juli adalah bulan keputusan. Dalam pemberitahuan tertanggal 29 Juni, DeepSeek mengonfirmasi bahwa versi resmi V4 akan hadir pada pertengahan Juli 2026, menjanjikan peningkatan fitur dan kinerja — serta memperkenalkan harga jam sibuk yang melipatgandakan tarif selama jendela bisnis Beijing. Sepuluh hari setelah itu, pada 24 Juli, nama model lama `deepseek-chat` dan `deepseek-reasoner` pensiun selamanya. Ulasan ini mencakup apa sebenarnya V4, berapa biayanya saat ini dan setelah rilis resmi, di mana ia unggul, di mana jelas tidak, dan apa yang harus dilakukan sebelum tenggat waktu.
Vonis cepat
Pertimbangkan DeepSeek V4 jika Anda…
- Jalankan beban kerja produksi volume tinggi di mana biaya per unit menentukan apa yang layak — harga V4 berada di kelasnya sendiri
- Butuh konteks panjang dengan biaya murah: 1M token standar, hingga 384K token output per respons, dengan diskon caching konteks yang agresif
- Ingin integrasi plug-and-play — API ini mendukung format OpenAI ChatCompletions dan Anthropic, sehingga perangkat yang ada sebagian besar berfungsi langsung.
- Hargai bobot terbuka dan opsi hosting sendiri, terutama V4-Flash yang lebih kecil.
Tunda (atau alihkan ke tempat lain) jika Anda…
- Menjalankan agen otonom jangka panjang — pada tabel lintas-model yang dipublikasikan Z.ai, V4-Pro tertinggal jauh dari GLM-5.2 dan frontier tertutup pada tolok ukur bergaya maraton.
- Membutuhkan input gambar: V4 hanya teks
- Bergantung pada harga tetap sepanjang waktu — mulai dari perilisan resmi pada pertengahan Juli 2026, tarif jam sibuk menjadi dua kali lipat selama jam kerja Beijing (jam non-sibuk tetap mempertahankan tarif saat ini)
Apa itu DeepSeek V4?
V4 adalah keluarga model generasi keempat DeepSeek, yang dikirimkan sebagai dua model Mixture-of-Experts. DeepSeek-V4-Pro adalah model unggulan: 1,6 triliun total parameter dengan 49 miliar aktif per token. DeepSeek-V4-Flash adalah tingkatan efisiensi: 284 miliar total, 13 miliar aktif. Keduanya menjalankan jendela konteks 1M-token secara default di seluruh layanan resmi DeepSeek, dan keduanya mengekspos mode ganda — berpikir untuk masalah sulit, tidak berpikir untuk kecepatan — di bawah ID model deepseek-v4-pro dan `deepseek-v4-flash`.
Dua detail pemosisian penting. Pertama, V4 diluncurkan sebagai pratinjau yang diperlakukan DeepSeek sebagai layak produksi — dan menurut pemberitahuan perusahaan pada 29 Juni, versi resmi dirilis pada pertengahan Juli 2026 dengan "optimalisasi fitur dan peningkatan kinerja." Kedua, diluncurkan sumber terbuka, melanjutkan pola DeepSeek dalam merilis bobot secara publik — yang membuat hosting mandiri dan penyetelan halus tetap tersedia, secara realistis untuk Flash 284B lebih dari Pro 1.6T.
Apa yang baru di DeepSeek V4?

Konteks 1M-token sebagai bawaan, bukan upsell. Setiap layanan resmi DeepSeek kini menjalankan jendela sejuta token penuh sebagai standar — tanpa SKU konteks panjang terpisah, tanpa tarif premium.
Ruang kepala output yang sangat besar. Kedua model mendukung hingga 384K token output per respons — tiga kali lipat dari yang diizinkan oleh sebagian besar pesaing dengan konteks 1M — yang penting untuk pembuatan kode seluruh file, ekstraksi terstruktur panjang, dan penulisan laporan.
Dua mode pada satu titik akhir. Mode berpikir untuk masalah sulit, mode tidak berpikir untuk panggilan cepat murah, dapat dialihkan per permintaan, bukan per model.
Dua tingkatan dengan satu bentuk API. Pro untuk kemampuan, Flash untuk volume — konteks yang sama, mode yang sama, integrasi yang sama.
Kompatibilitas API ganda. V4 mendukung format OpenAI ChatCompletions dan Anthropic API secara native, sehingga sebagian besar perangkat alat agen yang ada dapat terhubung tanpa perlu penulisan ulang.
Harga: berapa biaya sebenarnya

Ini adalah bagian yang membuat V4 terkenal. V4-Pro berharga $0.435 per juta token input dan $0.87 per juta output. V4-Flash berharga $0.14 dan $0.28.Cache hits pada konteks berulang tercantum di bawah satu sen per juta token — secara efektif gratis untuk loop agen yang membaca ulang status proyek yang sama.
Sebagai perbandingan: GLM-5.2, yang sendiri dirayakan sebagai permainan nilai musim panas, mencantumkan harga $1.40 / $4.40. Claude Sonnet 5 mencantumkan $3 / $15, Claude Opus 4.8 $5 / $25. Harga keluaran V4-Pro adalah seperlima dari harga GLM-5.2 dan sekitar 3% dari harga Opus 4.8. Meskipun V4-Pro kalah dalam beberapa pertandingan kualitas head-to-head — dan memang demikian — ekonomi berubah, sehingga pertanyaan mana yang layak diajukan kepada model pun ikut berubah.
Satu perubahan akan datang dengan rilis resmi. Per pemberitahuan DeepSeek tanggal 29 Juni, mulai pertengahan Juli semua harga token menjadi dua kali lipat selama jam sibuk — 09:00–12:00 dan 14:00–18:00 waktu Beijing — sementara jam di luar sibuk mempertahankan tarif hari ini. Meskipun dua kali lipat, harga output puncak V4-Pro (sekitar $1,74 per juta) masih lebih rendah dari tarif standar GLM-5.2, tetapi era harga tetap berakhir dengan pratinjau: jika lalu lintas Anda memuncak selama jam kerja China, modelkan perubahan — atau jadwalkan dan rute di sekitarnya.
Skor ulasan
Skor di bawah ini adalah penilaian editorial kami berdasarkan dokumentasi resmi DeepSeek dan tabel tolok ukur lintas model yang dipublikasikan oleh Z.ai — perlakukan angka lintas vendor sebagai konteks pihak ketiga, bukan sebagai klaim DeepSeek sendiri.

- Coding: 8/10 — mampu dalam rekayasa sehari-hari; bukan pemimpin open-weight
- Agen / penggunaan alat: 7/10 — orkestrasi alat yang solid, lemah dalam otonomi maraton panjang
- Penalaran: 8/10 — skor matematika dan sains yang kuat untuk kelas harga.
- Efisiensi biaya: 10/10 — tidak ada yang sebanding yang mendekati
- Konteks dan dokumen panjang: 9/10 — 1M masuk, 384K keluar, hit cache hampir gratis
- Kecepatan: 8/10 — jumlah parameter aktif yang ramping, ditambah mode non-pemikiran untuk jalur cepat
Keseluruhan: ~8.3/10 — raja harga-kinerja pertengahan 2026, dengan tanda bintang jangka panjang.
Kelebihan
Harga yang mengatur ulang kurva: $0,14–$0,87 per juta token di seluruh keluarga
- Standar konteks 1M dengan output 384K — batas output terbesar di kelasnya
- Mode berpikir dan non-berpikir pada satu titik akhir, dapat dialihkan per permintaan
- Kompatibilitas API OpenAI dan Anthropic berarti gesekan migrasi hampir nol.
- Bobot sumber terbuka memungkinkan hosting mandiri dan penyesuaian tetap tersedia.
Kekurangan
- Pekerjaan agen jangka panjang adalah kelemahan yang jelas — pada tabel yang diterbitkan Z.ai, V4-Pro mendapat skor 29.0 di FrontierSWE di mana GLM-5.2 mendapat 74.4 dan Claude Opus 4.8 mendapat 75.1
Teks saja: tidak ada input gambar di API V4
Penetapan harga jam sibuk tiba dengan rilis resmi pertengahan Juli — tarif berlipat ganda selama jendela bisnis Beijing, sehingga anggaran tidak lagi tetap.
- Masih dalam pratinjau hingga pertengahan Juli, sehingga perilaku dapat berubah dengan versi resmi.
- Pensiunnya deepseek-chat dan deepseek-reasoner pada 24 Juli 2026 memaksa pengguna lama untuk bermigrasi sesuai jadwal DeepSeek
- Menjalankan sendiri Pro dengan parameter 1.6T tidak praktis bagi hampir semua orang (Flash, dengan 284B, adalah target yang realistis)
Bagaimana perbandingan DeepSeek V4

V4-Pro vs V4-Flash.Konteks yang sama, mode yang sama, API yang sama — perbedaannya adalah kualitas versus throughput dengan selisih harga 3x. Pilihan default yang masuk akal: Flash untuk ringkasan, ekstraksi, klasifikasi, dan obrolan; Pro untuk kode, analisis, dan apa pun yang ditinjau manusia.
vs GLM-5.2.Pertarungan open-weight musim panas ini, dan benar-benar ketat dalam hal nilai. GLM-5.2 adalah coder yang lebih kuat — pada tabel yang dipublikasikan Z.ai, ia memimpin V4-Pro 81.0 berbanding 64.0 di Terminal-Bench 2.1 dan mendominasi pekerjaan jangka panjang (74.4 vs 29.0 di FrontierSWE) — sementara V4 membalas dengan harga 3–5x lebih rendah dan tiga kali lipat batas output. Pipeline volume condong ke V4; agen coding condong ke GLM-5.2.
vs perbatasan tertutup.Claude Opus 4.8 dan GPT-5.5 tetap menjadi model yang jelas lebih kuat di berbagai benchmark yang sulit. Namun, dengan kesenjangan harga-output 30–60x dibandingkan Opus 4.8, V4 tidak berusaha memenangkan pertarungan itu — ia berusaha membuat 90% lalu lintas Anda terlalu murah untuk dibenarkan dikirim ke tempat lain.
Batas waktu 24 Juli: bermigrasi dari nama warisan

Jika integrasi Anda masih memanggil `deepseek-chat` atau `deepseek-reasoner`, nama-nama tersebut akan berhenti berfungsi setelah 24 Juli 2026, 15:59 UTC. Saat ini mereka diarahkan ke V4-Flash, yang berarti lalu lintas Anda sudah berjalan dengan ekonomi V4 — tetapi setelah batas waktu, permintaan akan gagal sepenuhnya. Migrasinya sendiri hanya satu baris (`model: "deepseek-v4-pro"` atau `"deepseek-v4-flash"`), jadi pekerjaan sebenarnya adalah menguji ulang prompt terhadap perilaku V4 dan memutuskan, endpoint per endpoint, tier mana yang layak untuk setiap beban kerja — atau menempatkan router di depan sehingga penghentian berikutnya adalah perubahan konfigurasi, bukan perubahan kode.
Siapa yang harus menggunakan DeepSeek V4?
Produk volume tinggi — dukungan, perangkuman, ekstraksi, klasifikasi — di mana penetapan harga V4 mengubah fitur marjinal menjadi menguntungkan.
Beban kerja dokumen panjang dan RAG-berat yang memenuhi jendela 1M token setiap hari dan mendapat keuntungan dari hit cache yang hampir gratis.
Tim yang menghasilkan output panjang: codebase, laporan, data terstruktur — output 384K adalah batas kelas
Pembangun yang sadar biaya yang menginginkan bawaan yang mumpuni dan senang mengalihkan 10% yang sulit ke tempat lain
Siapa yang harus mencari di tempat lain?
Tim yang beban kerja intinya adalah agen otonom yang berjalan lama — GLM-5.2 atau flagship tertutup adalah jalur yang lebih aman
Alur kerja yang bergantung pada penglihatan (V4 tidak mengambil gambar)
Siapa pun yang membutuhkan label 'stabil' kontraktual hari ini daripada pratinjau.
Apakah DeepSeek V4 sepadan?
Untuk harganya, tegas ya — sebagai jalur, bukan agama. V4 tidak mengalahkan coder sumber terbuka terbaik (GLM-5.2) atau model unggulan frontier dalam hal kualitas, dan angka agen jangka panjangnya benar-benar lemah. Yang dilakukannya adalah membuat sebagian besar pekerjaan AI sehari-hari — ringkasan, ekstraksi, draf, dan putaran obrolan yang mendominasi tagihan token nyata — hampir tidak memakan biaya. Pola yang menang adalah V4 sebagai lantai volume, dengan jalur eskalasi di atasnya.
Putusan akhir
DeepSeek V4 adalah tolok ukur harga-kinerja yang kini menjadi acuan bagi semua model lainnya — skor kami: ~8.3/10. Jalankan Flash saat volume menjadi prioritas, Pro saat kualitas penting namun anggaran terbatas, dan arahkan pekerjaan tingkat puncak ke model yang lebih kuat. Hitung ulang biaya Anda saat harga puncak tiba pada pertengahan Juli — yang murah tetap murah, tetapi tidak lagi datar. Dan jika Anda masih menggunakan deepseek-chat atau deepseek-reasoner: Anda punya waktu hingga 24 Juli. Bergerak.
Menggunakan DeepSeek V4 melalui OrcaRouter
Strategi tiga jalur — V4 untuk volume, model terbuka atau tertutup yang lebih kuat untuk tugas sulit, cadangan untuk keandalan — adalah pengaturan yang menyakitkan jika dijalankan secara manual dan sepele di balik gateway. OrcaRouter menyajikan DeepSeek V4 bersama GLM-5.2, Claude, GPT, Gemini, dan 200+ model lainnya melalui satu endpoint yang kompatibel dengan OpenAI, dengan harga daftar penyedia dan markup token nol: perutean cerdas memilih jalur per permintaan, failover otomatis menangani gangguan era pratinjau, dan observabilitas per model menunjukkan biaya sebenarnya setiap jalur per tugas yang selesai. Ini juga meredam perubahan sisi penyedia seperti pensiun nama pada 24 Juli atau penetapan harga jam sibuk pertengahan Juli — ketika nama model mati atau jendela harga terbuka, Anda memperbarui aturan perutean, bukan basis kode Anda.


FAQ
Apakah DeepSeek V4 sudah tersedia sekarang?
Ya — V4-Pro dan V4-Flash telah aktif di DeepSeek API sejak 24 April 2026, dengan ID model deepseek-v4-pro dan deepseek-v4-flash, serta bobot yang bersumber terbuka. Secara resmi ini adalah pratinjau; pemberitahuan DeepSeek pada 29 Juni menyebutkan versi resminya pada pertengahan Juli 2026.
Apa harga jam sibuk DeepSeek?
Diumumkan untuk rilis resmi: mulai pertengahan Juli 2026, semua harga token menjadi dua kali lipat selama jam kerja Beijing (09:00-12:00 dan 14:00-18:00 waktu Beijing), sementara jam di luar jam sibuk tetap mempertahankan tarif saat ini. Lalu lintas yang memuncak di luar jam kerja China — sebagian besar beban kerja Barat — sebagian besar terhindar dari biaya tambahan.
Apa yang terjadi dengan deepseek-chat dan deepseek-reasoner?
Mereka saat ini secara otomatis merutekan ke V4-Flash, tetapi setelah 24 Juli 2026 (15:59 UTC) kedua nama tersebut sepenuhnya pensiun dan permintaan akan gagal. Perbarui parameter model secara eksplisit sebelum tenggat waktu.
Haruskah saya menggunakan V4-Pro atau V4-Flash?
Flash untuk pekerjaan volume yang tidak pernah ditinjau oleh manusia baris per baris — ringkasan, ekstraksi, klasifikasi, obrolan. Pro untuk kode, analisis, dan penyusunan, dengan harga sekitar 3x harga Flash tetapi masih jauh di bawah setiap model yang sebanding.
Apakah DeepSeek V4 lebih baik daripada GLM-5.2?
Lebih murah, bukan lebih baik. Pada tabel yang dipublikasikan Z.ai, GLM-5.2 memimpin dengan jelas dalam pengkodean dan mendominasi pekerjaan agen jangka panjang; V4 membalas dengan harga 3–5x lebih rendah, batas output 384K, dan hit cache hampir gratis. Banyak tim menjalankan keduanya: V4 untuk volume, GLM-5.2 untuk agen pengkodean.
Apakah DeepSeek V4 dapat menangani gambar?
Tidak — API V4 hanya berupa teks. Alihkan tugas vision (tangkapan layar, PDF sebagai piksel, grafik) ke model multimodal seperti Claude atau Gemini.
Bisakah saya melakukan self-host DeepSeek V4?
Bobotnya bersumber terbuka, tetapi realistislah tentang skala: V4-Pro adalah MoE dengan 1,6 triliun parameter — wilayah pusat data — sementara V4-Flash 284B adalah target hosting mandiri yang praktis untuk tim yang memiliki sumber daya yang memadai.
Apakah V4 kompatibel dengan perangkat OpenAI atau Claude yang sudah ada?
Sebagian besar ya — API secara native mendukung format OpenAI ChatCompletions dan Anthropic, sehingga framework agen dan SDK yang dibangun untuk salah satu biasanya terhubung dengan perubahan base-URL dan nama model.
Bisakah saya menggunakan DeepSeek V4 melalui OrcaRouter?
Ya — model DeepSeek tersedia di OrcaRouter dengan harga daftar penyedia tanpa markup, di samping GLM, Claude, GPT, dan Gemini, sehingga Anda dapat menjalankan pemisahan volume-plus-escalation di belakang satu titik akhir.
Siap membuat tagihan token Anda membosankan? Buat akun OrcaRouter Anda, arahkan klien yang kompatibel dengan OpenAI ke satu titik akhir, dan arahkan volume ke DeepSeek V4 sementara model yang lebih kuat menangani puncak — dengan markup token nol dan integrasi yang tahan terhadap 24 Juli.
