
DeepSeek Harness: Paus Hitam Muncul ke Permukaan — Apa yang Kita Ketahui Sejauh Ini tentang Kompetitor Claude Code Milik DeepSeek
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Kecerdasan49Koding
DeepSeek Harness v0.1 telah dirilis, dan laporan lapangan pertama yang penting tiba kurang dari sehari kemudian. Pada 14 Agustus, akun X yang sama yang telah menentukan waktu rilis — teortaxesTex — menggambarkan sesi yang tampak mati padahal sebenarnya masih berjalan: streaming token melambat "secara eksponensial" hingga hampir berhenti, antarmuka menunjukkan lima dari sembilan tugas selesai, dan muat ulang halaman mengungkapkan bahwa kesembilannya telah selesai. UI tersebut menampilkan status dari sekitar lima puluh menit sebelumnya. "Apakah ini… yang kamu maksud dengan komposabilitas spatiotemporal?" — sebuah sindiran yang wajar, karena kerangka kerja yang digunakan DeepSeek untuk membangun hal ini benar-benar memiliki teori tentang waktu. Tulisan ini dimulai sebagai artikel tentang jejak kebocoran; jejak tersebut terkuak pada 13 Agustus, ketika DeepSeek merilis harness sebagai sumber terbuka. Yang berikut ini adalah apa yang sebenarnya dirilis, dan apa yang ditunjukkan oleh hari pertama penggunaan nyata tentang lapisan agen yang sedang dibangun di sekitar DeepSeek V4 Flash 0731 dan DeepSeek V4 Pro.
Pembingkaian yang jujur telah berubah sejak tulisan ini pertama kali tayang. Saat diterbitkan, belum ada yang disebut "DeepSeek Harness" yang dirilis, dan buktinya hanyalah tumpukan jejak publik — akun WeChat tersertifikasi, lowongan pekerjaan, catatan kaki benchmark, dan panggilan pengujian internal. Itu tidak lagi berlaku. Pada malam tanggal 13 Agustus waktu Beijing, DeepSeek menerbitkan v0.1 dari harness tersebut sebagai pratinjau pengembang berlisensi MIT di github.com/deepseek-ai/deepseek-harness, yang dapat dijalankan dengan satu perintah npm, dan repositori itu meraih lebih dari 30.000 bintang GitHub dalam hitungan jam. Kebocoran itu menjadi sebuah produk. Yang belum terverifikasi sekarang bukanlah apakah harness itu ada, melainkan bagaimana perilakunya di dunia nyata — dan laporan lapangan awal menjadi bukti baru.
Model + Harness = Agent: apa sebenarnya "harness" itu
Rumus yang digunakan DeepSeek secara internal adalah Model + Harness = Agent. Model adalah otaknya; harness adalah segala hal lain yang membuat sebuah agent benar-benar bekerja dalam praktik — manajemen konteks dan memori, pemanggilan alat, perencanaan tugas, membaca dan menulis file, eksekusi terminal, mengumpankan output error kembali ke dalam loop, serta menilai apakah sebuah tugas benar-benar selesai.
Istilah ini dipopulerkan oleh Anthropic dan menjadi kerangka pandang industri tentang mengapa agen pengkodean lebih dari sekadar LLM yang baik. Model yang mencetak skor baik pada tolok ukur masih bisa gagal dalam loop agen jika mesin pendukungnya — cara ia memanggil alat, cara ia mengingat apa yang dilakukannya sepuluh menit lalu, cara ia pulih saat sebuah perintah gagal — lemah. DeepSeek telah menjadikan mesin tersebut sebagai strategi produknya yang eksplisit, dan tim Harness adalah struktur organisasi yang mewujudkannya. Model yang mendasarinya sudah mulai dirilis: DeepSeek V4 Flash 0731 dan DeepSeek V4 Pro sama-sama membawa skor tolok ukur yang disesuaikan untuk agen yang DeepSeek hasilkan di dalam harness-nya sendiri, bahkan sampai pada nama "DeepSeek Harness minimal mode."
Jejak kebocoran yang berakhir pada 13 Agustus.
Ini tidak pernah merupakan satu kebocoran tunggal; ini adalah tumpukan jejak publik yang terakumulasi sejak Maret dan kemudian bermuara pada tanggal rilis. Secara kasar urutannya:
• Maret 2026 — Laporan mengaitkan Cui Tianyi (崔添翼), lulusan ilmu komputer Universitas Zhejiang dan mantan insinyur Jane Street selama sembilan tahun, dengan pekerjaan agen DeepSeek; pers kemudian mengidentifikasinya sebagai pimpinan tim Harness. Dilaporkan, belum dikonfirmasi oleh DeepSeek saat itu.
• 24 April 2026 — DeepSeek V4 mempratinjau, secara eksplisit diposisikan untuk tugas-tugas agen dan disetel untuk alat-alat agen seperti Claude Code.
• Mei 2026 — DeepSeek memasang dua peran Harness di Moka — seorang manajer produk Agent Harness dan seorang insinyur riset, keduanya berbasis di Beijing. Peneliti DeepSeek, Chen Deli, menulis secara publik bahwa tujuannya, singkatnya, adalah untuk melakukan benchmarking terhadap Claude Code dan membangun "DeepSeek Code Harness."
• Juni 2026 — Upaya perekrutan terus berlanjut; pimpinan tim menggambarkan departemen tersebut kekurangan staf dengan "tujuan ambisius dan beban kerja yang berat."
• 6–7 Juli 2026 — Akun WeChat "DeepSeek Harness team" terdaftar dan tersertifikasi di bawah entitas Beijing milik DeepSeek, dengan logo paus hitam. Belum ada orang luar yang menyadarinya.
• 31 Juli 2026 — API resmi DeepSeek V4 Flash memasuki beta publik, dan dokumentasi API DeepSeek mengungkapkan — untuk pertama kalinya — bahwa tugas-tugas CodeAgent dalam benchmark publiknya dijalankan pada "DeepSeek Harness mode minimal," dengan kualifikasi "segera hadir."
• 1 Agustus 2026 — Pimpinan tim Harness membuka rekrutmen pengujian internal yang ditujukan bagi pengembang proyek agent-harness sumber terbuka. Pers teknologi Tiongkok melaporkan 769 pelamar, 712 repositori unik, dan lebih dari 1,2 juta bintang GitHub kumulatif.
• 11 Agustus 2026 — Cakupan akun meluas; paus hitam muncul ke permukaan.
• 13 Agustus 2026 — v0.1 diluncurkan: berlisensi MIT, terbuka di GitHub, dapat dijalankan dengan npx @deepseek-ai/dsh web. Jejaknya teratasi.

Apa yang sebenarnya dirilis pada v0.1
Pratinjau pengembang adalah runtime agen desktop-dan-CLI dalam namespace paket Node, dibangun di atas meta-framework Cordis dengan prinsip desain yang dinyatakan "semuanya adalah plugin." Model, alat, keterampilan, sesi, sandbox, penyimpanan, loop agen, penjadwalan, dan UI semuanya adalah plugin Cordis yang dapat diganti. Empat preset disertakan: Standard (perangkat alat agen pengkodean lengkap), PTC (model menulis program TypeScript untuk mengoordinasikan panggilan alat multi-langkah), Minimal (alat shell plus editor file — mode yang digunakan benchmark V4), dan Creation (untuk membangun preset khusus). Tampilan Trajectory menuliskan segala sesuatu yang dilihat model ke log sesi append-only, dapat diputar ulang sumber demi sumber — jawaban DeepSeek atas keluhan "kotak hitam" tentang riwayat agen yang diringkas.
Peringatan yang penting adalah peringatan dari DeepSeek sendiri: ini adalah pratinjau pengembang, repositori tersebut memuat pemberitahuan pengujian internal, dan perubahan yang bersifat breaking changes diperkirakan akan terjadi sementara plugin inti dan API dasar terus berkembang. Peringatan itu ternyata memang beralasan dalam hitungan jam — dan itu menjadi kerangka bagi laporan lapangan di bawah ini.
Apa yang ditunjukkan oleh laporan lapangan pertama
Laporan yang menyatukan pembaruan ini adalah akun pengguna tunggal dan harus dibaca sebagai satu kesatuan: teortaxesTex, pada 14 Agustus, mendeskripsikan sesi DeepSeek Harness di mana streaming token semakin melambat hingga hampir berhenti, UI menunjukkan lima dari sembilan todo selesai, dan muat ulang mengungkapkan bahwa kesembilan sebenarnya telah selesai — antarmuka telah merender keadaan dari sekitar lima puluh menit sebelumnya. Ini adalah satu unggahan X, bukan pengakuan vendor, dan belum direproduksi secara independen. Tetapi kelas gejala ini didukung oleh catatan publik proyek itu sendiri, yang membuatnya layak dianggap serius.
{{1}}Diskusi GitHub #483 di repositori resmi, yang diajukan pada 13 Agustus, mendokumentasikan persis keluarga kegagalan ini.{{/1}} {{2}}Konten sesi dipersistensikan dengan batch write-behind yang terbatas — peristiwa berada dalam antrean pending di memori hingga timer 200 milidetik memicu penulisan yang tahan lama — dan antarmuka hanya merender status yang dikomit.{{/2}} {{3}}Di bawah beban konkuren yang berat, jendela waktu ini meregang parah; setelah shutdown yang tidak bersih, ekor di memori tidak pernah di-flush dan backend JSONL atau SQLite hanya memuat ulang prefiks yang dikomit, sehingga masukan pengguna muncul terlambat atau tidak sama sekali dan riwayat yang sebelumnya terlihat menghilang.{{/3}} {{4}}Diskusi tersebut mengaitkan ini dengan dua isu terbuka: #477 (masukan teks pengguna tertunda lama di bawah beban konkuren yang berat) dan #479 (permintaan pengguna baru tidak muncul sama sekali di tampilan percakapan).{{/4}} {{5}}Frasa "5/9 di layar, 9/9 selesai" dalam laporan lapangan adalah celah antara yang dikomit versus yang aktual yang muncul di sesi langsung.{{/5}}
Umpan balik yang lebih luas terhadap v0.1 terpolarisasi sebagaimana mestinya. Sebagian penguji memuji arsitektur plugin sebagai "PC desktop rakitan sendiri dengan port universal" di samping rival-rival tertutup; yang lain mendata sisi-sisi kasar — jalur multimodal yang hardcoded, dan bug kebijakan agen yang terdokumentasi di mana harness memaksa model untuk menyelidiki setiap kode keluar non-nol, sementara kode keluar 1 dari grep untuk "tidak ada kecocokan" mengubah tes yang lulus menjadi kegagalan yang tampak nyata, mendorong lingkaran validasi berlebihan yang menguatkan diri sendiri (61 permintaan berbanding 32, dan $0.17 berbanding $0.05, pada tugas yang sama dalam perbandingan yang dilaporkan). Ulasan hari pertama terbaca seperti pratinjau pengembang dengan ambisi nyata dan masalah lapisan status yang nyata, bukan seperti penantang Claude Code yang sudah jadi.
Komposabilitas spatiotemporal bukan sekadar lelucon.
Lelucon penutup laporan lapangan itu ternyata didasari oleh sebuah makalah. DeepSeek Harness dibangun di atas Cordis, yang desainnya berasal dari "A Programming Paradigm for Spatiotemporal Composability" — sebuah studi formal setebal 88 halaman yang ditulis bersama oleh Universitas Peking dan DeepSeek, dengan penulis utama Yifan Shi (pencipta kerangka kerja chatbot Koishi) bersama Wei Zhang dan pimpinan tim Harness, Cui Tianyi. Makalah tersebut menguraikan komposisi dinamis menjadi dua sumbu ortogonal: komposabilitas temporal, di mana menghapus komponen dengan bersih membatalkan efek sampingnya seolah-olah tidak pernah ada, dan komposabilitas spasial, di mana komponen mendeklarasikan dependensi dan runtime secara reaktif mengaktifkan dan menonaktifkannya saat penyedia muncul dan hilang.
Leluconnya mengena karena status rendering UI dari lima puluh menit yang lalu merupakan kegagalan komposisi temporal dalam arti yang paling harfiah: runtime terus berjalan sementara status yang terlihat di-commit di belakangnya. Kesenjangan persistensi yang didokumentasikan dalam Discussion #483 — batch write-behind yang dapat tertinggal jauh di belakang loop yang berjalan — justru merupakan hal yang seharusnya dicegah oleh jaminan-jaminan makalah tersebut. Apakah lapisan status harness pada akhirnya mematuhi jaminan-jaminan tersebut dalam praktiknya adalah salah satu pertanyaan yang benar-benar terbuka dari rilis ini, dan laporan hari pertama adalah bukti pertama ke arah mana pun.
Model-model di bawahnya
Harness adalah produknya; model-model adalah mesinnya. Kedua model yang kemungkinan besar akan DeepSeek letakkan di bawahnya sudah aktif, dan keduanya sudah dapat dipanggil melalui OrcaRouter hari ini:
• DeepSeek V4 Flash 0731 — rilis resmi pasca-ulang-latih dari MoE efisien DeepSeek (total 284B / 13B aktif), konteks 1M-token, output maksimal 384K, mode berpikir aktif secara default, dan fasih secara native dalam API Respons OpenAI — dialek yang digunakan agen bergaya Codex. Angka benchmark agen yang diterbitkan DeepSeek sendiri untuk revisi 0731: 82.7 di Terminal-Bench 2.1, 76.7 di Cybergym, 70.3 di Toolathlon Verified, 68.7 di DSBench-FullStack, 59.6 di DSBench-Hard. Angka-angka tersebut dilaporkan vendor dan belum direproduksi, tetapi itulah yang dipilih DeepSeek untuk diunggulkan, dan skornya melebihi bahkan DeepSeek V4 Pro Preview pada set yang sama.
DeepSeek V4 Pro — MoE unggulan dengan total 1.6T / 49B aktif, konteks 1 juta token yang sama, bobot terbuka (dirilis April 2026), dengan harga $0.44 / $0.87 per juta token.
Soal harga, intinya adalah DeepSeek itu murah. DeepSeek V4 Flash 0731 berjalan dengan biaya sekitar $0,147 per juta token masukan dan $0,295 per juta token keluaran — harga daftar vendor, yang diteruskan OrcaRouter tanpa markup. Saat harness tersebut matang, Anda akan dapat mengarahkannya ke model yang sama yang sudah dapat Anda panggil hari ini, dan mengganti harness masuk atau keluar nanti hanyalah perubahan konfigurasi, bukan migrasi. Anda tidak perlu DeepSeek Harness untuk menjalankan salah satu model tersebut sekarang.

Perang biaya yang sedang dimasukinya
Ini bukan pasar yang marjinal. Claude Code dilaporkan berada pada tingkat pendapatan tahunan yang berjalan melebihi $2,5 miliar pada awal 2026, dan pasar agentic-coding diperkirakan bernilai dalam kisaran miliaran satu digit. Seorang pendatang dari laboratorium Tiongkok yang memangkas harga API — dan yang modelnya sudah berjalan di dalam Claude Code sendiri — adalah jenis langkah yang menetapkan ulang harga seluruh kategori.
Dalam hal biaya, pilihan harness sama pentingnya dengan model. Tes horizontal Composio yang menjalankan DeepSeek V4 Flash di delapan harness menemukan yang termurah (harness open-source "Pi") sekitar $0,028 untuk inferensi per tugas yang berhasil, dibandingkan sekitar $0,195 untuk Claude Code dalam tes yang sama — selisih hampir 7x pada kelas pekerjaan yang sama. Tambahkan diskon prefix-cache yang dilaporkan DeepSeek dan tingkat cache-hit 99,93% yang dilaporkan harness pihak ketiga dengannya, dan biaya efektif per tugas untuk agen bertenaga DeepSeek menjadi sangat kecil dengan sangat cepat.
Perlu juga diingat apa yang sudah menjadi kenyataan saat ini: DeepSeek menyediakan endpoint yang kompatibel dengan Anthropic (base URL https://api.deepseek.com/anthropic), dan dokumentasinya sendiri memandu cara mengarahkan Claude Code ke model DeepSeek V4. Produk harness ini adalah upaya DeepSeek untuk memiliki lapisan tersebut alih-alih menyewanya — dan DeepSeek telah mengumumkan bahwa kenaikan harga signifikan akan segera berlaku di seluruh lini V4. Karena OrcaRouter meneruskan harga daftar penyedia tanpa markup, tarif baru langsung aktif di sisi kami pada hari yang sama saat dirilis, tanpa negosiasi ulang.

Mengapa harness menjadi medan pertempuran baru
Pergeseran terjadi dari kapabilitas model ke penyelesaian tugas. Model frontier kini adalah modal dasar; yang menentukan apakah sebuah tim benar-benar meluncurkan agen adalah mesin pendukung di sekitarnya — dan data yang dihasilkannya. Para analis yang membingkai langkah DeepSeek, termasuk CITIC Securities, berpendapat bahwa harness yang matang adalah parit karena dua alasan yang saling menguatkan: ia menutup lingkaran komersial dari titik masuk hingga tugas selesai, dan ia menghasilkan data lintasan tugas jangka panjang yang memberi makan pelatihan model. Harness komunitas seperti Pi atau DeepSeek-TUI membuktikan adanya permintaan, tetapi mereka tidak mengumpankan data itu kembali ke model. Harness DeepSeek sendiri akan — dan fitur Trajectory yang hadir di v0.1 adalah jalur data itu yang dibuat terlihat.
Itulah juga mengapa penafsiran yang "sekadar melakukan benchmark pada model" tidak lengkap. Skor agen DeepSeek V4 Flash memang kuat, tetapi harness adalah tempat DeepSeek berharap membangun keunggulan yang tahan lama — yang menjadikan bug lapisan state dalam laporan hari pertama lebih dari sekadar kosmetik. Harness yang UI-nya dapat tertinggal lima puluh menit di belakang loop masih merupakan pratinjau pengembang; ia belum menjadi benteng pertahanan.
Yang sedang kami tonton sekarang
• Apakah lapisan state mampu mengimbangi. Lag write-behind terdokumentasi, dapat direproduksi, dan sedang diajukan ke repo resmi; pantau apakah jalur flush diperbaiki dengan cepat, dan apakah desain "UI hanya menampilkan state yang telah dikomit" berubah ketika sesi sedang berlangsung.
• Uji reproduksi native. Alasan utama rilis ini penting adalah bahwa skor agen V4 DeepSeek dihasilkan pada "mode minimal DeepSeek Harness" — sekarang siapa pun dapat menginstal pratinjau dan menjalankan tugas-tugas tersebut secara native. Jika angka 82.7 / 87.9 dapat direproduksi, dua rilis terakhir terbaca sebagai satu sistem yang koheren; jika tidak, kesenjangan benchmark vendor menjadi terukur.
• Apakah ekosistem plugin akan berjalan. Permukaan plugin yang diberi tag #dsh memang nyata, tetapi apakah pihak ketiga akan merilis sesuatu yang layak dipasang masih menjadi pertanyaan terbuka.
• Daftar harga. DeepSeek belum mengatakan apa pun tentang biaya harness itu sendiri, dan kenaikan harga API V4 yang diumumkan adalah ketidakpastian besar lainnya.
• Apakah "komposabilitas spatiotemporal" menjadi daftar perbaikan atau slogan. Makalah ini memberi DeepSeek kosakata yang ketat untuk kegagalan yang diungkap laporan lapangan; apakah lapisan status v0.1 konvergen pada jaminan tersebut adalah ujiannya.
Penilaian yang jujur: sinyal pra-rilis terkuat yang diberikan DeepSeek kini menjadi produk nyata, tetapi masih berupa pratinjau pengembang dengan kekurangan yang terdokumentasi. Yang solid saat ini adalah dua model di baliknya — DeepSeek V4 Flash 0731 dan DeepSeek V4 Pro, keduanya berjalan di OrcaRouter dengan harga daftar penyedia tanpa markup sama sekali, dan keduanya dapat digunakan dalam loop agen melalui satu API standar. Ketika harness sudah matang, cara untuk mengevaluasinya tanpa mempertaruhkan jalur produksi pada v0.1 adalah dengan melakukan routing: letakkan harness di depan untuk evaluasi, pertahankan model yang sama di belakang satu endpoint, dan lakukan failover ke kombinasi yang sudah terbukti begitu ia macet. Peralihan itu hanya memerlukan perubahan satu baris.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
