Tanggal Rilis DeepSeek V4 Pro: Sudah 14x Lebih Murah daripada Kimi K3, Belum Sepintar Itu
Guides & Insights

Tanggal Rilis DeepSeek V4 Pro: Sudah 14x Lebih Murah daripada Kimi K3, Belum Sepintar Itu

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 31 Juli 2026, perusahaan menerbitkan entri changelog yang mengumumkan bahwa model murahnya telah mengungguli model mahalnya. Entri tersebut membahas DeepSeek V4 Flash, tingkat efisiensi 284B, dan klaim utamanya adalah "kemampuan agen yang ditingkatkan secara signifikan, dengan hasil benchmark yang jauh melampaui V4-Pro-Preview." V4-Pro-Preview adalah DeepSeek V4 Pro — model unggulan dengan 1,6 triliun parameter, yang biayanya tiga kali lipat lebih mahal per token. Entri yang sama ditutup dengan satu kalimat tentangnya: "Rilis resmi DeepSeek-V4-Pro akan segera menyusul." Itulah konteks untuk perkiraan yang sedang beredar saat ini, bahwa ketika V4 Pro yang sesungguhnya hadir, model itu akan berada di level Kimi K3 tetapi sepuluh kali lebih murah. Separuh dari perkiraan itu sudah dapat diukur, dan arahnya salah dengan cara yang hampir tidak disangka siapa pun.

Catatan tentang apa artikel ini dan apa bukan. Tidak ada system card yang bocor di sini, tidak ada benchmark internal, tidak ada tanggal. Prediksi yang beredar berasal dari @scaling01 di X — "DeepSeek-V4 Pro akan menjadi luar biasa, mungkin juga setara Kimi-K3 tetapi 10x lebih murah" — dan itu adalah perkiraan dari praktisi yang banyak diikuti, bukan pengungkapan dari siapa pun yang memiliki akses. Memperlakukannya sebagai kebocoran adalah cara pemberitaan tanggal rilis yang buruk ditulis. Yang bisa kita lakukan adalah mengambil dua bagian yang dapat diuji dari klaim tersebut dan memeriksanya dengan angka-angka yang sudah ada, karena build pratinjau telah dapat dipanggil selama tiga bulan dan baik build tersebut maupun Kimi K3 telah dijalankan oleh laboratorium independen. Semua yang di bawah diberi label berdasarkan sumber: dokumentasi perusahaan itu sendiri, pengukuran Artificial Analysis, atau perhitungan yang kami lakukan sendiri dan kami tampilkan.

Apa yang sebenarnya telah dikatakan DeepSeek, dan apa yang tidak

Permukaan terkonfirmasi lebih luas daripada yang tersirat oleh pembingkaian 'model yang belum dirilis'. V4 Pro bukan isapan jempol — Anda dapat memanggilnya sekarang juga. Yang belum terjadi adalah perilisan yang perusahaan itu sendiri anggap resmi.

Arsitektur — model mixture-of-experts dengan 1.6T parameter total dan 49B aktif per token, dikonfirmasi oleh perusahaan dan tercantum identik di Artificial Analysis sebagai 1600B/49B.

Konteks dan keluaran — jendela masukan 1M-token (1.048.576) dengan hingga 384K token keluaran. Teks masuk, teks keluar; tidak ada masukan gambar, audio, atau video.

Lisensi dan bobot — MIT, dengan bobot yang dipublikasikan di Hugging Face. Ini adalah model unggulan dengan bobot terbuka, yang justru menjadi alasan mengapa perbandingan dengan Kimi K3 menarik.

Harga daftar — $0.435 per juta token input saat cache miss, $0.003625 saat cache hit, dan $0.87 per juta token output, dari halaman harga perusahaan itu sendiri.

Antarmuka — ChatCompletions ala OpenAI dan endpoint berformat Anthropic, serta tingkat upaya penalaran, pemanggilan alat, dan output terstruktur.

Kronologi sejauh ini — keluarga V4 hadir sebagai pratinjau pada 24 April 2026; nama model lama deepseek-chat dan deepseek-reasoner dihentikan pada 24 Juli 2026; Flash mendapatkan build resminya pada 31 Juli 2026; Pro tidak.

6 Agustus 2026DeepSeek memberi tahu para pengembang bahwa mereka berencana menaikkan harga keseluruhan untuk layanan DeepSeek API "dalam waktu dekat, dengan kenaikan signifikan yang diperkirakan," dan menegaskan kembali bahwa rilis resmi V4 Pro akan menyusul. Belum ada tarif baru dan belum ada tanggal efektif yang dipublikasikan.

Dan bagian-bagian yang masih benar-benar belum diketahui, yang merupakan sebagian besar dari apa yang orang cari:

Tanggal GA — masih belum diumumkan. "Akan segera menyusul" tetap menjadi keseluruhan komitmen resmi perusahaan. Laporan pers yang belum terkonfirmasi menunjuk pada jendela pertengahan Agustus — satu media menyebut 10–20 Agustus, dan halaman harga seorang pengecer mengubah harga cache V4 Pro pada 3 Agustus dalam pola yang secara historis mendahului perilisan — tetapi tidak ada satu pun dari itu yang diucapkan perusahaan. Belum ada tanggal yang dikonfirmasi.

Apa yang akan diubah build GA — tidak disebutkan. Perusahaan belum menyatakan apakah V4 Pro resmi merupakan pelatihan ulang dari bobot yang sama, pretrain baru, atau perubahan harga.

Apakah harga bertahan menghadapinya — tidak ditangani, dan ada alasan spesifik untuk mengkhawatirkan hal ini yang akan kita bahas di bawah.

Satu koreksi yang perlu dinyatakan secara eksplisit, karena hasil pencarian untuk pertanyaan ini terkontaminasi: Anda akan menemukan halaman-halaman yang menyatakan bahwa keluarga V4 mencapai ketersediaan umum pada 20 Juli 2026. Catatan perubahan perusahaan itu sendiri, sebelas hari setelah tanggal tersebut, menyatakan bahwa rilis resmi V4 Pro masih tertunda, dan menambahkan bahwa pembaruan 31 Juli "hanya meningkatkan API DeepSeek-V4-Flash. API DeepSeek-V4-Pro dan model APP/WEB tidak berubah." Ketika ringkasan pihak ketiga dan catatan perubahan utama vendor tidak sejalan, catatan perubahanlah yang menang.

Klaim harga: "10x lebih murah" adalah pembacaan yang konservatif.

Kimi K3 terdaftar dengan harga $3.00 per juta token input dan $15.00 per juta output, dengan cache hits sebesar $0.30. V4 Pro terdaftar dengan harga $0.435 dan $0.87, dengan cache hits sebesar $0.003625. Jika angka-angka itu dibandingkan satu sama lain, "10x" ternyata menjadi ujung bawah dari suatu rentang, bukan tajuk utamanya:

Token masukan — $3.00 dibanding $0.435, jadi V4 Pro 6.9x lebih murah. Ini adalah satu-satunya dimensi di mana klaim tersebut berlebihan.

Token keluaran — $15,00 berbanding $0,87, atau 17,2x lebih murah. Keluaran adalah tempat model penalaran mengeluarkan biaya, yang menjadikan ini angka yang paling penting.

Campuran input-output 70/30 — $6.60 per juta dibandingkan dengan $0.5655, atau 11.7x.

Campuran cache-hit/input/output 7:2:1 dari Artificial Analysis — $2.31 dibandingkan $0.18, atau 12.8x.

Input cache — $0.30 dibandingkan dengan $0.003625, kira-kira 83x. Harga cache-read perusahaan menempati peringkat ke-4 dari 101 model yang dilacak Artificial Analysis, dengan diskon 99% dari tingkat cache-miss-nya sendiri.

Campuran hipotetis memang bisa diperdebatkan, jadi inilah yang terukur. Artificial Analysis mempublikasikan biaya aktual yang dikeluarkannya untuk menjalankan Intelligence Index lengkap pada setiap model — rangkaian evaluasi yang sama, kerangka pengujian yang sama, jumlah token nyata, bukan rasio yang diasumsikan. Kimi K3 membutuhkan biaya $2.437,41 untuk dievaluasi. V4 Pro membutuhkan biaya $176,34. Itu 13,8 kali lipat, pada beban kerja yang identik, dalam dolar yang benar-benar dibayar seseorang.

Apa yang membuat angka tersebut lebih rendah daripada rasio harga-output 17.2x perlu dipahami, karena di situlah satu-satunya tempat kemurahan V4 Pro sebagian disebabkan oleh dirinya sendiri. V4 Pro boros kata: ia menghabiskan 180M token output untuk melewati indeks, dibandingkan dengan 130M milik Kimi K3, dan dibandingkan median 100M untuk kelasnya. Jadi ia menghabiskan sekitar 38% lebih banyak token untuk menyampaikan apa yang ingin dikatakannya, yang menggerogoti keunggulan per token. Angka 13.8x sudah memperhitungkan hal tersebut; angka 17.2x tidak. Jika Anda membuat anggaran, gunakan angka yang terukur.

Ini juga bagian dari cerita yang mudah diperiksa sendiri daripada sekadar dipercaya. Karena OrcaRouter meneruskan harga daftar penyedia secara langsung dengan markup 0%, angka per-token di halaman model deepseek/deepseek-v4-pro dan kimi/kimi-k3 kami adalah milik kedua vendor itu sendiri — K3 terbaca $3.00/$15.00 di halaman kami dan $3.00/$15.00 di halaman Moonshot — bukan harga jual kembali dengan selisih yang disembunyikan — yang berarti perhitungan di atas dapat direproduksi dalam satu tagihan, dan jika salah satu vendor mengubah harga, perubahannya akan masuk ke sisi kami di hari yang sama, bukan setelah satu siklus kontrak.

Klaim kecerdasan: 13 poin, bukan paritas.

"Tingkat Kimi K3" adalah bagian dari perkiraan yang tidak bertahan ketika berhadapan dengan angka-angka saat ini. Pada Indeks Kecerdasan Artificial Analysis, per 5 Agustus 2026, Kimi K3 mencetak 57 dan DeepSeek V4 Pro (penalaran, upaya maksimal) mencetak 44 — berada di peringkat #6 dari 101 model, yang merupakan posisi yang benar-benar kuat, dan masih kurang 13 poin. Keduanya diukur oleh lab yang sama pada komposit yang sama, keduanya dengan upaya penalaran maksimal, keduanya pada konteks 1M token.

Tolok ukur dari vendor menceritakan kisah yang berbeda dan lebih menyanjung, justru itulah mengapa perlu diberi label. Perusahaan melaporkan V4 Pro-Preview dengan 80.6% pada SWE-bench Verified dan 90.1% pada GPQA Diamond. Moonshot melaporkan Kimi K3 dengan 76.8% pada SWE-bench Verified dan 93.5% pada GPQA Diamond. Jika dilihat sekilas, V4 Pro jelas memenangkan tolok ukur pengodean secara langsung. Tidak ada satu pun dari kedua rangkaian hasil itu yang direproduksi secara independen; hasil tersebut dibuat pada kerangka pengujian yang berbeda oleh tim yang memiliki kepentingan pada hasilnya, dan pada satu gabungan tempat pihak ketiga menjalankan kedua model itu sendiri, urutannya terbalik. Itulah seluruh alasan untuk tidak mempercayai perbandingan tolok ukur tunggal antarvendor.

Ada dua hal tentang nomor indeks yang perlu mendapat catatan tersendiri. Pertama, jika Anda menemukan tulisan lama yang menyebut V4 Pro berada di angka 52, bukan 44, itu tidak salah — artikel peluncuran Artificial Analysis sendiri pada bulan April memang menempatkan V4 Pro (Max) di angka 52 dan menyebutnya sebagai model penalaran open-weights peringkat #2. Indeks ini direvisi, dan revisi mengubah skor setiap model. Aturan praktisnya, hanya perbandingan pada snapshot yang sama yang bermakna; angka 52 dari bulan April dan angka 57 dari bulan Agustus tidak seharusnya berada dalam kalimat yang sama. Kedua, halaman Artificial Analysis bertanggal "Dirilis April 2026" dan tidak membedakan build pratinjau dari build resmi di masa depan, jadi angka 44-nya adalah ukuran dari apa yang disajikan oleh endpoint, kapan pun diuji.

Di mana V4 Pro jelas mengungguli Kimi K3 adalah pada sumbu yang bukan kecerdasan. Ia menghasilkan 66,5 token per detik dibandingkan 37,6 milik K3, dalam kelas yang mediannya 65,9 — jadi V4 Pro sekitar rata-rata untuk kelasnya dan Kimi K3 luar biasa lambat. Waktu hingga token pertama adalah 1,61 detik dibandingkan 2,85. Untuk loop agen interaktif, perbedaan itu terasa pada setiap giliran, dan itu adalah argumen terkuat untuk build pratinjau sebagaimana adanya saat ini.

Apa yang dikatakan build resmi Flash tentang Pro

Ini adalah hal yang paling mendekati bukti nyata tentang model yang belum dirilis, dan itu berasal dari saudara yang sudah melalui proses tersebut.

Catatan perubahan 31 Juli perusahaan menyatakan bahwa "DeepSeek-V4-Flash-0731 mempertahankan arsitektur dan ukuran model yang sama dengan DeepSeek-V4-Flash-Preview, dan hanya dilatih ulang." Jumlah bobot yang sama, arsitektur yang sama, harga yang sama — hanya pelatihan ulang. Artificial Analysis menilai hasilnya dengan skor 50, dibandingkan 40 untuk versi Flash sebelumnya. Sepuluh poin pada indeks komposit, hanya dari pelatihan ulang, tanpa biaya tambahan per token. Konsumsi token keluaran pada indeks juga turun 12%, dari sekitar 234M menjadi 206M, sehingga menjadi lebih murah untuk dijalankan pada harga daftar yang sama.

Terapkan preseden itu pada Pro dan hitungannya tak terelakkan: 44 ditambah 10 sama dengan 54. Kimi K3 berada di 57. Bahkan jika V4 Pro resmi mengulangi peningkatan pascapelatihan paling sukses yang pernah didemonstrasikan perusahaan secara publik, ia akan berada sekitar tiga poin di bawah "level Kimi K3" — dengan biaya operasi hanya sekitar seperempat belas dari biaya tersebut. Itu adalah hasil yang luar biasa, dan itu bukan hasil yang diprediksi oleh perkiraan.

Catatan jujur mengenai ekstrapolasi itu, yang bersifat aritmetika dan bukan prediksi: peningkatan +10 pada model 284B tidak banyak memberi informasi tentang apa yang tersedia pada model 1.6T, dan ruang peningkatannya bisa lebih besar atau jauh lebih kecil. Perusahaan belum menyatakan bahwa build Pro hanya akan berupa pasca-pelatihan. Dan indeks tersebut merupakan gabungan, jadi tiga poin bisa menjadi satu benchmark. Alasan untuk tetap menjalankan angka tersebut adalah karena itu satu-satunya preseden terukur yang dikonfirmasi vendor, dan itu jauh lebih banyak daripada yang menjadi sandaran perkiraan.

Satu detail lagi dari changelog itu layak untuk ditandai daripada sekadar diulang: skor agentic Flash dihasilkan menggunakan "mode minimal Harness milik perusahaan (akan segera dirilis)" dengan effort maksimal, topp=0.95, temperature=1.0. Harness yang menghasilkan angka-angka tersebut belum dirilis ke publik — ia memasuki beta tertutup pada awal Agustus — sehingga angka-angka itu hingga kini tetap tidak dapat direproduksi oleh siapa pun di luar perusahaan bahkan secara prinsip, bukan karena salah tetapi karena instrumennya tidak tersedia. Perkirakan rilis Pro akan datang dengan tanda bintang yang sama.

Klausul-klausul yang dapat membatalkan tesis model murah.

Terkubur dalam dokumentasi harga perusahaan adalah sebuah kebijakan yang hampir tidak mencakup harga lini V4. Menurut perusahaan, API "akan segera mengadopsi" jadwal yang menyatakan bahwa "pada jam sibuk, harga akan menjadi 2x harga reguler, berlaku untuk semua item penagihan." Jam sibuk didefinisikan sebagai pukul 09:00–12:00 dan 14:00–18:00 waktu Beijing, harian — tujuh jam sehari, setiap hari. Tanggal efektifnya "tergantung pada pengumuman resmi," dan hingga tulisan ini dibuat, biaya tambahan tersebut belum aktif.

Perhatikan arahnya. Perusahaan secara historis menjalankan off-peak diskon pada V3 dan R1; ini adalah peak biaya tambahan pada tarif standar. Jika ini aktif pada pengali yang dinyatakan, harga siang hari V4 Pro menjadi $0.87 masuk dan $1.74 keluar, dan perbandingannya berubah bentuk: keunggulan campuran 11.7x atas Kimi K3 turun menjadi 5.8x, dan 13.8x yang terukur turun menjadi 6.9x. Masih murah. Tidak lagi "10x lebih murah," dan tidak lagi murah pada jam-jam ketika tim Eropa atau Asia benar-benar bekerja.

Pada 6 Agustus, kabar besar yang dinanti akhirnya datang. DeepSeek mengumumkan di platform pengembangnya bahwa mereka berencana menaikkan harga keseluruhan layanan API DeepSeek "dalam waktu dekat, dengan kenaikan signifikan yang diperkirakan." Belum ada tarif baru maupun tanggal efektif yang dipublikasikan, dan perusahaan tidak menyatakan apakah kenaikan tersebut terpisah dari jadwal jam sibuk atau berlaku bersamaan dengannya. Media yang meliput perusahaan menafsirkan pengumuman itu sebagai sinyal bahwa perilisan resmi V4 Pro sudah dekat — produk unggulan yang belum dirilis bukanlah sesuatu yang Anda beri harga agresif dalam rezim diskon yang akan segera Anda tinggalkan. Siapa pun yang menyusun model biaya berbasis V4 Pro hari ini harus memodelkan kedua skenario, dan siapa pun yang membaca judul "perusahaan ini 14x lebih murah" — termasuk judul ini — harus tahu bahwa itu menggambarkan daftar harga yang menyandang kondisi kedaluwarsa yang telah diumumkan. Inilah cara yang paling mungkin membuat separuh prediksi tentang harga berhenti berlaku, dan hal itu sama sekali tidak ada hubungannya dengan model.

Bagaimana Anda akan tahu bahwa build resmi telah dirilis

Ada sebuah detail dalam cara perusahaan mengirim yang lebih penting daripada tanggalnya, dan itu merupakan bahaya operasional yang nyata.

ID model API adalah deepseek-v4-pro. Bukan deepseek-v4-pro-preview, dan bukan string build yang bertanggal — meskipun log perubahan perusahaan sendiri menyebut build saat ini sebagai V4-Pro-Preview dan build Flash yang dirilis sebagai V4-Flash-0731. Ketika Flash menjadi resmi, instruksinya adalah: "Metode pemanggilan API tetap tidak berubah — cukup atur nama model menjadi deepseek-v4-flash untuk menggunakan versi terbaru." Dengan kata lain, mengunci ID model tidak mengunci build-nya. String yang sama secara diam-diam mulai melayani kumpulan bobot yang berbeda, dengan perilaku yang jauh berbeda dan sepuluh poin indeks lebih banyak.

Jadi jawaban praktis untuk "kapan V4 Pro rilis" adalah bahwa jika Anda memanggil deepseek-v4-pro di produksi, Anda mungkin akan mengetahuinya dengan memperhatikan perubahan output Anda sendiri. Secara konkret, hal-hal yang perlu diperhatikan adalah: entri baru berisi tanggal di log perubahan API perusahaan, yang merupakan tempat pertama kali rilis Flash muncul; akhiran build seperti V4-Pro-0731 dalam prosa entri tersebut bahkan ketika ID yang dapat dipanggil tetap polos; penilaian ulang di halaman V4 Pro Artificial Analysis, yang merupakan konfirmasi independen pertama yang akan Anda dapatkan; kenaikan harga yang diumumkan terwujud menjadi tarif aktual, karena GA adalah momen alami bagi kenaikan harga tersebut dan jadwal jam sibuk untuk diberlakukan; dan Responses API perusahaan, yang dokumentasinya menyatakan bahwa dukungan deepseek-v4-pro direncanakan untuk awal Agustus — model yang hilang dari daftar "direncanakan" dan muncul di daftar yang didukung adalah sinyal rilis resmi yang paling dekat dengan yang dipublikasikan perusahaan. Dua sinyal yang tidak dapat kami konfirmasi layak untuk diketahui: halaman harga seorang reseller mengubah harga cache V4 Pro pada 3 Agustus dalam pola yang secara historis mendahului rilis, dan perangkat evaluasi internal perusahaan sedang dalam beta tertutup, yang berarti tolok ukur vendor-nya akhirnya dapat diperiksa saat dirilis. Sebuah string yang menyerupai deepseek-v4-pro-202606 juga telah beredar sebagai pengidentifikasi build yang bocor; kami tidak dapat memverifikasinya terhadap properti perusahaan mana pun, dan itu seharusnya tidak dianggap penting sampai ada yang dapat memverifikasinya.

Haruskah Anda membangun di atas pratinjau hari ini?

Bagi kebanyakan orang yang mengevaluasi model ini, tanggal rilis adalah pertanyaan yang salah. Pratinjaunya dapat dipanggil, memiliki harga, berlisensi MIT, dan diukur secara independen di peringkat #6 dari 101 pada kecerdasan. Pertanyaan sebenarnya adalah apa yang akan dilakukan GA yang akan datang terhadap pekerjaan yang Anda bangun sekarang, dan ada dua jawaban yang berbeda.

Jika Anda memilih antara V4 Pro dan Kimi K3 berdasarkan kemampuan, bukti saat ini menunjukkan Kimi K3 menang pada skor komposit dengan selisih 13 poin, dan V4 Pro menang dalam hal kecepatan, latensi, serta biaya dengan margin yang lebar — dan bahwa peningkatan pasca-pelatihan yang akan datang dapat mempersempit kesenjangan kecerdasan tanpa menutupnya. Jika pekerjaan Anda berada di garis depan penalaran yang sulit, 13 poin itu adalah segalanya dan harga hanyalah gangguan. Jika pekerjaan Anda bervolume tinggi dan sekadar sulit, membayar 14 kali lipat untuk itu sulit untuk dibenarkan.

Jika Anda sudah memilih V4 Pro, risiko yang perlu dikelola bukanlah tanggal rilis, melainkan pertukaran diam-diam: build di balik ID model itu akan berubah tanpa Anda sadari, persis seperti yang terjadi pada Flash, dan eval Anda seharusnya dapat mendeteksinya. Sediakan satu set regresi yang bisa dijalankan ulang kapan pun dibutuhkan, dan pastikan ada model kedua yang dapat dijangkau tanpa perubahan kode. Inilah alasan sederhana kami membangun failover seperti yang kami lakukan — V4 Pro, V4 Flash, dan Kimi K3 semuanya berada di belakang satu kunci OrcaRouter pada endpoint yang kompatibel dengan OpenAI, sehingga "jalankan ulang eval pada ketiganya, lalu alihkan trafik" hanyalah pengeditan konfigurasi, bukan proses pengadaan, dan build GA yang buruk adalah keputusan routing, bukan insiden. Mencoba flagship yang belum teruji menjadi jauh lebih mudah ketika membatalkan pilihan itu tidak memerlukan biaya apa pun.

Pertanyaan yang sebenarnya ditanyakan orang-orang

Apakah DeepSeek V4 Pro sudah dirilis atau belum?

Keduanya, tergantung apa yang Anda maksud, itulah sebabnya hasil pencarian saling bertentangan. Model ini telah dapat dipanggil secara publik sejak peluncuran pratinjau V4 pada 24 April 2026, dengan harga yang dipublikasikan, bobot terbuka di bawah MIT, dan cakupan tolok ukur independen. Namun, catatan perubahan perusahaan tertanggal 31 Juli 2026 secara eksplisit menyatakan bahwa API V4 Pro "tidak berubah" dan rilis resminya "akan segera menyusul," dan pada 6 Agustus DeepSeek kembali mengatakan versi resmi akan dirilis secepat mungkin sambil mengumumkan kenaikan harga API yang signifikan. Jadi: tersedia, tetapi belum resmi. Belum ada tanggal yang dikonfirmasi; laporan yang belum terkonfirmasi mengarah ke pertengahan Agustus, yang berarti waktu tunggunya singkat.

Akankah build resminya sebagus Kimi K3?

Berdasarkan satu-satunya preseden terukur yang tersedia, mungkin tidak sepenuhnya. Build resmi Flash memperoleh 10 poin pada Intelligence Index milik Artificial Analysis hanya dari post-training; V4 Pro berada di 44 dan Kimi K3 di 57, jadi kenaikan yang identik akan mencapai 54. Ekstrapolasi itu bisa saja salah di kedua arah — model 1.6T mungkin memiliki ruang peningkatan yang berbeda dari model 284B, dan perusahaan belum menyatakan bahwa rilis Pro hanya akan berupa post-training. Tetapi siapa pun yang mengklaim kesetaraan saat ini sedang mengklaim sesuatu yang tidak didukung oleh pengukuran yang dipublikasikan.

Mengapa model murah DeepSeek saat ini mencetak skor lebih tinggi daripada model unggulannya?

Karena urutan rilis, bukan karena Flash adalah model yang lebih baik. Flash menerima peningkatan pasca-pelatihan pada 31 Juli yang menaikkannya dari 40 ke 50 pada indeks; Pro belum menerima peningkatan setaranya, sehingga masih diukur berdasarkan pasca-pelatihan April. Perusahaan sendiri mengakui hal ini, menggambarkan hasil agen Flash-0731 sebagai "jauh melampaui V4-Pro-Preview." Pembalikan ini hanyalah potret dari peluncuran yang belum selesai, dan rilis Pro yang tertunda justru adalah hal yang akan mengakhirinya.

Apakah harga $0.435 / $0.87 aman untuk dijadikan dasar model biaya?

Secara kondisional, dan kurang aman daripada seminggu yang lalu. Itu adalah harga daftar yang dipublikasikan perusahaan saat ini dan sudah mencerminkan pengurangan permanen yang besar dari tarif peluncuran V4. Tetapi pada 6 Agustus DeepSeek mengumumkan bahwa mereka berencana menaikkan harga API secara keseluruhan, "dengan kenaikan signifikan yang diperkirakan," dan belum ada tarif atau tanggal baru yang dipublikasikan — ditambah kebijakan jam sibuk yang diumumkan tetapi tidak aktif yang akan menggandakan semua item penagihan selama tujuh jam sehari. Buat model untuk kedua skenario, dan perhatikan bahwa bahkan kasus yang digandakan pun masih lebih murah daripada Kimi K3 sekitar 6 kali lipat.

Pembacaan yang jujur

Perkiraan yang memulai ini hanya setengah benar, dan setengah yang benar adalah bagian yang paling sulit dipercaya orang. "10x lebih murah" meremehkannya: pada beban kerja evaluasi terukur yang sama, build pratinjau DeepSeek V4 Pro berbiaya $176,34 dibandingkan Kimi K3 sebesar $2.437,41, dan pada input yang di-cache, kesenjangannya bukan sepuluh kali lipat melainkan sekitar delapan puluh kali lipat. "Level Kimi K3" adalah bagian yang belum tercapai — 44 berbanding 57 pada satu komposit yang dijalankan lab independen pada keduanya, dengan ekstrapolasi optimistis dari preseden terbaik perusahaan sendiri yang mencapai 54.

Apa yang akan mengubah penilaian ini adalah hal yang spesifik dan layak untuk diperhatikan. Jika build resmi V4 Pro hadir sebagai peningkatan pasca-pelatihan dan Artificial Analysis memberi skor ulang di atas 57, ramalan tersebut terbukti sepenuhnya dan angka utama artikel ini menjadi usang. Jika hadir bersamaan dengan biaya tambahan jam sibuk atau kenaikan harga yang diumumkan pada 6 Agustus, argumen harga menjadi separuhnya dan pertanyaan menariknya adalah apakah diskon 6x dapat menutupi defisit 13 poin. Dan jika perusahaan merilis harness evaluasinya — yang sudah dalam beta tertutup — tolok ukur vendor yang saat ini mengunggulkan V4 Pro dalam coding menjadi dapat diperiksa untuk pertama kalinya. Sampai salah satu dari itu terjadi, ringkasan akurat dari DeepSeek V4 Pro adalah bahwa ia adalah model penalaran serius dengan nilai terbaik yang bobotnya dapat Anda unduh, bahwa ia bukan yang terpintar, dan bahwa vendor-nya telah memberi tahu kami bahwa ia belum selesai.

Dibandingkan dalam artikel ini4

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube