Kartu judul untuk DSH (DeepSeek Code Harness) yang bertuliskan 'DSH - DeepSeek Code Harness' dengan subjudul 'Kompetitor Claude Code - beta publik dijadwalkan pada 13 Agustus' dan tiga chip: Kompetitor Claude Code, Ekosistem plugin, Harness V4 asli.
Guides & Insights

Tanggal Rilis DSH: Pesaing Claude Code dari DeepSeek Sudah Tersedia — Apa Artinya bagi V4 Flash dan V4 Pro

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Sementara DeepSeek V4 Flash dan DeepSeek V4 Pro masih menjadi dua hal terbaru yang dirilis D​eepSeek, pengamat D​eepSeek yang paling banyak diikuti di X memasang hitung mundur untuk rilis berikutnya. "Realistisnya, DSH rilis dalam sekitar ≈7-9 jam lagi," tulis pengembang AI pseudonim teortaxesTex, "Saya memprediksi ini akan mengontekstualisasi ulang dua rilis terakhir. Cukup kabut perang, kita akan lihat bagaimana performa aslinya secara native." Hitung mundur itu berakhir malam ini. Sebuah grup beta internal memberi tahu akun X op7418 bahwa rilis akan tiba "sekitar 20:25" waktu Beijing; pada akhirnya, pratinjau pengembang D​eepSeek Harness tayang pada malam yang sama — IT之家 melaporkannya pada 20:52, dengan liputan lebih lanjut selama satu jam setelahnya. Harness D​eepSeek, jawabannya sendiri untuk Claude Code, kini bersifat publik: v0.1, berlisensi MIT, terbuka di GitHub, dan dapat dijalankan dengan satu perintah npm.

Yang menarik adalah mengapa tanggal tersebut menjadi penting, dan mengapa rilis ini lebih berharga dari sekadar momen peluncuran. Build resmi DeepSeek V4 Pro (DeepSeek-V4-Pro-0813) hadir di DeepSeek API pada periode yang sama, dan DeepSeek V4 Flash resmi dirilis dua minggu sebelumnya. Keduanya menyertakan skor benchmark agenik yang dihasilkan DeepSeek di dalam harness miliknya sendiri — dokumen API V4 Flash menyatakannya secara eksplisit, hingga ke namanya: "DeepSeek Harness minimal mode." DSH adalah versi lengkap dari harness tersebut yang kini dipublikasikan, yang berarti angka-angka di balik dua rilis terakhir kini dapat direproduksi oleh siapa pun yang ingin menjalankannya. Tidak ada satu pun jejak kebocoran yang mengarah ke sini yang dikonfirmasi secara resmi oleh DeepSeek sebagai catatan, tetapi titik akhir ini bukan lagi kebocoran: pratinjau pengembang sudah tersedia. Yang masih belum publik adalah daftar harga — DeepSeek belum mengatakan apa pun tentang biaya harness itu sendiri.

Prediksi yang menyetel jam

teortaxesTex bukan karyawan DeepSeek dan tidak mengklaim demikian. Bio akun tersebut menggambarkan sosok yang mengangkat diri sebagai "pendukung DeepSeek sejak 2023," dan catatan publiknya adalah spekulasi berdasarkan informasi dengan rangkaian tebakan yang sering tepat — taruhan pasar prediksi pada arsitektur DeepSeek V4, prediksi awal bahwa DeepSeek-V4.1 akan mendapatkan komputasi reinforcement-learning beberapa kali lebih besar daripada pesaingnya, serta ritme pembacaan rilis yang diikuti erat oleh komunitas. Anggap tweet asli itu sebagaimana adanya: perkiraan yang berdasarkan informasi, bukan konfirmasi.

Prediksi itu memiliki dua bagian. Bagian pertama adalah waktu: "turun dalam sekitar 7-9 jam lagi," yang jatuh pada malam 12–13 Agustus waktu Beijing — jendela yang sama ketika build DeepSeek-V4-Pro-0813 muncul di dokumentasi API DeepSeek. Itu terbukti benar. Estimasi "sekitar 20:25" dari grup beta internal dan perilisan aktual ~20:52 keduanya berada dalam jendela tersebut; kebocoran itu meleset sekitar setengah jam, bukan satu hari. Bagian kedua adalah kata yang sarat makna "recontextualize," yang baru masuk akal setelah Anda mengetahui bagaimana DeepSeek melakukan benchmarking terhadap dua rilis terakhirnya sendiri. Bagian taruhan itu sekarang bisa diuji, dan itulah inti dari rilis ini.

Apa sebenarnya DSH itu

Rumus internal DeepSeek, yang dikonfirmasi secara publik oleh peneliti senior Chen Deli, adalah "Model + Harness = Agent." Harness adalah seluruh lapisan rekayasa di luar model yang mengubah model bahasa menjadi sesuatu yang dapat menyelesaikan pekerjaan: manajemen konteks dan memori, pemanggilan alat, perencanaan tugas, membaca dan menulis file, eksekusi terminal, mengumpankan kembali kesalahan ke dalam loop, dan menilai kapan suatu tugas benar-benar selesai. Lowongan pekerjaan DeepSeek menggambarkan tujuannya sebagai mengubah "kemampuan model frontier menjadi produk agen terkemuka" — dan target eksplisitnya, menurut kata-kata Chen Deli sendiri, adalah Claude Code.

Produk ini juga merupakan jawaban atas proyek komunitas. Agen terminal buatan penggemar bernama DeepSeek-TUI, yang dibangun dengan Rust dan bercanda dijuluki "versi DeepSeek dari Claude Code," menjadi viral di GitHub awal tahun ini; perangkat resmi itu merebut kembali titik masuk terminal tersebut.

Apa yang digambarkan jejak kebocoran sebagai rumor kini telah hadir dalam rilis. Pratinjau pengembang v0.1, yang sumbernya terbuka di bawah lisensi MIT di github.com/deepseek-ai/deepseek-harness, adalah runtime agen desktop dan CLI dalam namespace paket Node.js — "npx @deepseek-ai/dsh web" menjalankan GUI web di 127.0.0.1:3080 — dibangun di atas meta-framework Cordis, dengan prinsip desain yang dinyatakan "semuanya adalah plugin." Model, alat, keterampilan, sesi, sandbox, penyimpanan, loop agen, penjadwalan, dan UI semuanya merupakan plugin Cordis yang dapat diganti. Empat preset agen disertakan: Standard, PTC (model menulis program TypeScript untuk merangkai panggilan alat), Minimal (alat shell plus editor file, mode tempat benchmark V4 dijalankan), dan Creation. Pemimpin tim yang dilaporkan, Cui Tianyi — lulusan Universitas Zhejiang dan mantan insinyur Jane Street selama sembilan tahun — dikonfirmasi dalam peran tersebut, setelah mengeluarkan panggilan global untuk penguji internal pada 2 Agustus. Catatan peringatan DeepSeek sendiri: ini adalah pratinjau pengembang, dan iterasi cepat dapat membawa perubahan yang tidak kompatibel.

Jejak kebocoran yang berakhir pada 13 Agustus.

Tidak ada satu pun dari jejak di bawah ini yang telah dikonfirmasi secara resmi oleh DeepSeek, tetapi catatan tersebut kini terbaca sebagai linimasa yang selesai pada tanggal yang diharapkan:

• 26 Mei 2026 — sebuah organisasi GitHub resmi DeepSeek dibuat, menurut catatan grup yang bocor.

• Mei–Juni — DeepSeek memasang dua lowongan Harness Beijing (seorang manajer produk agent-harness dan seorang insinyur peneliti); Chen Deli mengonfirmasi misi tersebut di media sosial.

• 6–7 Juli — akun WeChat untuk "tim DeepSeek Harness," yang bermerek paus hitam, terdaftar di bawah entitas Beijing DeepSeek dan tersertifikasi.

• 31 Juli — Rilis resmi API DeepSeek V4 Flash. Dokumentasinya mengungkapkan bahwa hasil benchmark CodeAgent diproduksi pada "DeepSeek Harness minimal mode," dengan kualifikasi "(akan segera dirilis)."

• 1 Agustus — rekrutmen pengujian internal yang ditujukan bagi pengembang proyek agent-harness sumber terbuka; laporan mencatat sekitar 700–960 pelamar dan 700+ repositori kandidat.

• 11 Agustus — build uji internal terakhir dirilis sehingga pengembang plugin dapat menyelesaikan pekerjaan kompatibilitas, menurut tangkapan layar grup beta yang bocor.

• 13 Agustus — teortaxesTex mengatur hitung mundur; grup beta internal memberi tahu op7418 'sekitar pukul 20:25'; pratinjau pengembang v0.1 diluncurkan malam itu, dilaporkan sekitar pukul 20:52 waktu Beijing dan dilisensikan MIT di GitHub.

Ekosistem plugin adalah bagian penting dari kebocoran ini, dan itu nyata. Repositori plugin membawa tag topik #dsh (repo GitHub mendokumentasikan "dsh-plugin" untuk kemudahan ditemukan), dan quick-start npm berarti pengembang Node mana pun dapat mencapai permukaan plugin sejak peluncuran pertama — taruhan pasar terbuka bahwa harness, bukan hanya modelnya, menjadi platform.

A leak scoreboard for DSH listing six rows: Product DeepSeek Code Harness, Public beta Aug 13 (leaked), Plugins #dsh ecosystem opening, Targets Claude Code and Codex, Pricing not announced, Official word none yet, with a footer reading 'All leak-level; nothing confirmed by DeepSeek.'

Mengapa "mengontekstualisasikan ulang dua rilis terakhir" adalah frasa yang perlu diperhatikan

Dua rilis V4 terakhir adalah model yang mengutamakan agen. Build resmi DeepSeek V4 Flash adalah MoE dengan 284 miliar parameter, 13 miliar aktif, konteks 1 juta token, dan skor unggulan 82,7 di Terminal-Bench 2.1 — angka yang dilaporkan DeepSeek dan dihasilkan pada "mode minimal DeepSeek Harness." Build resmi DeepSeek V4 Pro adalah MoE dengan 1,6 triliun parameter, 49 miliar aktif, dan kartu agennya (DeepSWE 62,7, Terminal-Bench 2.1 87,9, CyberGym 83,3) juga dilaporkan oleh DeepSeek dan, pada saat penulisan ini, belum direproduksi oleh laboratorium independen.

DSH adalah harness tempat angka-angka tersebut dihasilkan, kini publik. Itulah maksud dari "kita akan lihat bagaimana performa aslinya seharusnya" — bukan melalui Claude Code, bukan melalui harness pihak ketiga, bukan melalui harness benchmark, melainkan melalui tumpukan milik DeepSeek sendiri dari awal hingga akhir. Uji reproduksi tidak lagi hipotetis: siapa pun dapat memasang pratinjau dan menjalankan tugas-tugas agentik yang sama seperti yang dijalankan vendor. Jika angka aslinya dapat direproduksi, dua rilis terakhir tampak sebagai narasi yang koheren — model agen serius termurah plus harness pihak pertama yang mumpuni, dijual sebagai satu sistem. Jika tidak, kesenjangan vendor-benchmark yang disorot para skeptis saat peluncuran V4 Flash menjadi konkret dan terukur. Apa pun hasilnya, catatan itu berubah.

Penilaian independen sejauh ini bercerita lain. Artificial Analysis telah menempatkan build V4 Pro 0813 di papan peringkatnya dengan skor 53 pada Intelligence Index-nya — di atas median 27, sebuah titik data pihak ketiga yang sesungguhnya, tetapi masih jauh dari tajuk "paling maju di setiap dimensi". Kesenjangan antara angka agen yang dilaporkan sendiri oleh DeepSeek dan evaluasi pihak ketiga adalah kesenjangan yang kini dapat dipecahkan oleh DSH.

The Artificial Analysis model page for DeepSeek V4 Pro 0813 (Reasoning, Max Effort) showing an Intelligence Index of 53 against a median of 27, input price $0.435 and output price $0.87 per 1M tokens, a $0.004 cache-hit price, a 1M-token context window, 1600B total / 49B active parameters, and open weights.

Ada juga alasan strategis mengapa harness lebih penting daripada modelnya. Harness yang matang menutup siklus dari titik masuk hingga tugas selesai dan, dengan demikian, menghasilkan data lintasan tugas yang memberi masukan untuk putaran pelatihan model berikutnya — analisis yang diterbitkan CITIC Securities ketika perekrutan untuk Harness diumumkan ke publik. Model DeepSeek adalah agen serius termurah di pasar; di sinilah parit pelindung, dan daya penetapan harga, bergerak. Tumpukan agen pihak pertama berbayar adalah bisnis yang sangat berbeda dari API dengan bobot terbuka.

Anda tetap tidak perlu DSH untuk menjalankan model V4.

DSH kini telah aktif, tetapi ini adalah opsi pihak pertama, bukan prasyarat. DeepSeek sudah mengekspos endpoint yang kompatibel dengan Anthropic dan OpenAI untuk model-modelnya, itulah sebabnya DeepSeek V4 Flash dan DeepSeek V4 Pro sudah berjalan di dalam Claude Code dan perangkat agen lainnya saat ini — tanpa memerlukan harness.

Kedua model juga tersedia di OrcaRouter dengan harga daftar DeepSeek sendiri — deepseek/deepseek-v4-flash-0731 sekitar $0,15 per juta token input dan $0,29 per juta token output, serta deepseek/deepseek-v4-pro sekitar $0,44/$0,88 — diteruskan dengan markup 0%. Hal ini penting karena dua alasan. Pertama, DeepSeek mengumumkan pada awal Agustus bahwa akan ada kenaikan harga yang signifikan di seluruh lini V4; karena harga daftar adalah yang Anda bayar, tarif baru berlaku di sisi kami pada hari yang sama saat dirilis, tanpa negosiasi ulang. Kedua, ide perutean yang menjadi dasar DSH — memindahkan pekerjaan antara V4 Flash yang murah dan V4 Pro andalan untuk mengendalikan biaya — persis seperti yang dilakukan lapisan perutean di berbagai vendor dengan satu kunci, dengan failover otomatis di atasnya, sehingga Anda dapat mengarahkan lalu lintas nyata ke build V4 baru sementara harness dan benchmark-nya yang belum dapat direproduksi sedang divalidasi.

The OrcaRouter model page for deepseek/deepseek-v4-pro showing the Flagship badge, roughly $0.44 input / $0.88 output per 1M tokens, a 1M-token context window, 384K max output, and 1.6T total / 49B active parameters, with OpenAI-compatible code samples.

Apa yang perlu diperiksa sekarang setelah DSH diluncurkan

Dengan pratinjau yang sudah dirilis, inilah lima hal yang menentukan apakah DSH membawa perubahan bagi Anda:

• Tes reproduksi — pasang pratinjau dan jalankan tugas agen V4 Flash dan V4 Pro secara native, lalu bandingkan dengan angka 82.7 / 87.9 yang diterbitkan DeepSeek. Ini adalah seluruh taruhan "rekontekstualisasi", dan sekarang sudah dapat dijalankan.

• Keputusan peralihan — apakah DSH mengungguli menjalankan model yang sama di dalam Claude Code saat ini? Perangkat pihak pertama harus menang lebih dari sekadar harga untuk membenarkan pemindahan pengaturan yang sudah berfungsi.

• Ekosistem plugin — permukaan npm dan GitHub itu nyata, tetapi apakah plugin bertanda #dsh benar-benar diport dengan bersih, dan apakah pihak ketiga merilis sesuatu yang layak dipasang, masih menjadi pertanyaan terbuka.

• Harga — harness ini berjalan pada token nyata, penguji internal melaporkan pengukuran token per tugas, dan DeepSeek masih belum mengatakan apa pun tentang biaya produk tersebut. Perkirakan produk berbayar; daftar harga adalah hal besar terakhir yang belum diketahui.

• Changelog — README resmi dan catatan rilis di GitHub kini menjadi sumber yang berlaku, bersama dengan kenaikan harga V4 yang telah diumumkan.

Intinya

DSH adalah langkah produk paling konsekuensial yang telah dibuat DeepSeek sejak lini V4 itu sendiri, dan sekarang sudah dirilis. Bagi pembaca, jawaban praktisnya tetap tidak berubah: DeepSeek V4 Flash dan DeepSeek V4 Pro dapat digunakan hari ini, melalui endpoint yang sudah Anda miliki, dengan harga yang masih menjadi opsi agen serius termurah di sekitar — di OrcaRouter dengan harga daftar, tanpa markup. Harness adalah hal yang perlu diperhatikan, bukan untuk peluncurannya tetapi untuk apa yang dapat diukurnya: dua rilis terakhir akhirnya mendapatkan uji native yang adil, dan kesenjangan benchmark vendor-versus-independen akan menutup atau menjadi harga masuknya. Jam bocor tepat mengenai tanggal dan kira-kira jamnya; yang masih perlu dibuktikan adalah harga, reproduksi skor native, dan apakah ekosistem plugin memiliki daya tahan. Biarkan angka independen — bukan hitung mundur — yang memutuskan apakah Anda memindahkan tumpukan agen produksi ke harness native.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube