Hero title card untuk perbandingan 'Grok 4.6 vs DeepSeek V4 Pro', {{1}}dengan subjudul 'Perang harga tingkat frontier, terjadi dalam selisih 24 jam,'{{/1}} serta {{2}}lencana 'Perbandingan · Agustus 2026'{{/2}}.
Guides & Insights

Grok 4.6 vs DeepSeek V4 Pro: Perang Harga di Garda Terdepan, Berselisih 24 Jam

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dua model frontier dirilis dalam waktu 24 jam satu sama lain, dan selisih antara daftar harga mereka adalah yang terlebar yang dihasilkan generasi ini. Grok 4.6 diluncurkan pada 12 Agustus 2026 dengan harga $2 per juta token input dan $6 per juta output. DeepSeek V4 Pro — rilis produksi resmi dari flagship DeepSeek, versi DeepSeek-V4-Pro-0813 — menyusul pada 13 Agustus 2026 dengan harga ¥3 per juta token input cache-miss dan ¥6 per juta output, yang kira-kira $0,42 dan $0,85. Kategori yang sama, ambisi agen yang sama, berbeda satu orde besaran dalam hal harga. Ini bukan perbandingan dua spesifikasi; ini adalah perbandingan dua strategi tentang berapa biaya yang seharusnya untuk model berbentuk agen, dan keduanya dirilis minggu ini.

Tulisan ini menempatkan dua lembar harga bersebelahan, membaca klaim tolok ukur setiap vendor beserta labelnya, dan menghitung berapa sebenarnya biaya kesenjangan tersebut pada beban kerja nyata — karena di atas kertas, model-model ini lebih dekat dalam kemampuan dibandingkan filosofi, dan perbedaan harga per tugas adalah tempat keputusan berada.

Justru waktunya yang menjadi inti.

Bahwa kedua model dirilis dalam jendela waktu 48 jam yang sama bukanlah sekadar kebetulan kalender. {{1}}Grok 4.6 adalah refit agenik SpaceXAI atas fondasi 1,5T-nya — penyegaran pasca-pelatihan yang sarat pembelajaran penguatan di bidang coding, kerja kernel, dan CAD, dipatok sebagai bahan bakar untuk produk Cursor dan Grok Bot milik perusahaan tersebut.{{/1}} {{2}}DeepSeek V4 Pro adalah formalisasi dari pratinjau yang diam-diam mendefinisikan ulang makna 'agentic' dengan harga yang jauh lebih murah, kini disempurnakan untuk ekonomi agen:{{/2}} {{3}}Catatan rilis DeepSeek untuk build 0813 diawali dengan kemampuan agen yang meningkat secara signifikan, menambahkan dukungan untuk Responses API dan integrasi Codex, serta mempertahankan mode berpikir (default) dan mode non-berpikir, output JSON, panggilan alat, dan format API Anthropic.{{/3}} {{4}}Dua perusahaan yang sangat berbeda secara bersamaan menyimpulkan bahwa pasar yang penting di akhir 2026 adalah agen — dan mematok harga produk mereka untuk kantong yang sangat berbeda.{{/4}}

Kedua lembar harga, berdampingan.

Grok 4.6 — $2.00 / $6.00 / $0.50 (input cache) per juta token, konteks 500K, kenaikan $4 / $12 / $1 di atas sekitar 200K token input, dan varian yang lebih cepat dengan tarif dua kali lipat tarif dasar.

DeepSeek V4 Pro — ¥3.00 (≈$0.42) input cache-miss, ¥0.025 (≈$0.0035) input yang di-cache, ¥6.00 (≈$0.85) output per juta token, dengan jendela konteks 1 juta token dan hingga 384K token output. Saudaranya yang lebih murah, V4 Flash, dibanderol ¥1 / ¥2.

Bahkan dibandingkan dengan Grok 4.6 — yang sudah menjadi API frontier termurah di generasinya — DeepSeek V4 Pro kira-kira lima kali lebih murah untuk input cache-miss dan tujuh kali lebih murah untuk output, dan ia membawa jendela konteks 2x lebih besar serta output maksimum yang jauh lebih besar ke tingkat harga yang sama. Keduanya tidak bersaing dalam harga; D​eepSeek secara sepihak menetapkan batas bawah baru dan Grok kini menjadi opsi premium dalam kalimat yang sama. Pembingkaian itu penting, karena pembingkaian sebelumnya — "Grok 4.6 adalah model frontier yang murah" — hanya benar selama tepat satu hari.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

Apa yang sebenarnya ditingkatkan oleh DeepSeek V4 Pro

Angka peluncuran DeepSeek adalah yang paling dramatis karena diukur terhadap pratinjau mereka sendiri, dan lompatan dari pratinjau ke rilis sangat besar. Pada evaluasi vendor itu sendiri:

DeepSWE — 62.7% pada build rilis, naik dari 12.8% pada pratinjau — skor cakrawala panjang rekayasa perangkat lunak yang menurut vendor berada di antara 58.0% milik Opus 4.8 dan 70.0% milik Claude Fable 5.

Cybergym — 83.3%, naik dari 52.7%, mengungguli Fable 5 yang 83.1% dan mengalahkan Opus 4.8 yang 78.3%.

Terminal Bench 2.1 — 87.9%, hanya berselisih satu poin dari Fable 5 yang mencapai 88.0% dan melampaui Opus 4.8 yang mencapai 85.0%.

AutomationBench (publik) — 31.8%, naik dari 12.8%, melampaui Fable 5 (29.1%) dan Opus 4.8 (27.2%).

Toolathlon-Verified, NL2Repo, DSBench-FullStack, dan DSBench-Hard — 74.1%, 61.5%, 71.1%, dan 67.2% masing-masing, terkumpul pada atau mendekati kisaran Opus 4.8 / Fable 5.

Setiap satu dari itu adalah laporan D​eepSeek pada suite eval milik D​eepSeek sendiri. Arahnya tidak salah lagi — pratinjau belum siap untuk loop agen produksi dan build rilis mengklaim demikian — tetapi label yang jujur adalah bahwa belum ada lab independen yang menilai DeepSeek V4 Pro, dan model-model yang dibandingkan dengannya tidak disebutkan oleh pihak eksternal.

Dengan apa Grok 4.6 menjawab

Counter Grok 4.6 berbeda dalam jenisnya: ia adalah satu-satunya dari keduanya yang memiliki papan skor independen. Artificial Analysis mengukurnya pada angka 61 dalam Intelligence Index-nya — sejajar dengan GPT-5.6 Sol, unggul dari Kimi K3 (60) — bahkan sebelum DeepSeek V4 Pro dirilis. Tabel vendor-nya mengklaim keunggulan 65,9% pada DeepSWE v1.1 dan 69,9% pada CursorBench v3.2, dengan kelemahan yang diakui secara terbuka sebesar 26% pada Terminal-Bench v3.0. Itu semua dilaporkan oleh xAI, tidak ada yang direproduksi secara independen per 13 Agustus.

Ketidakcocokan versi menjadi masalah ketika Anda mencoba membandingkan keduanya secara langsung. D​eepSeek memperoleh 87.9 di Terminal Bench 2.1; Grok memperoleh 26% di v3.0 yang lebih sulit — ujian yang berbeda, jadi "D​eepSeek menghancurkan Grok di terminal" bukanlah pernyataan jujur, dan "Grok unggul di DeepSWE" juga tidak jujur tanpa mencatat bahwa kedua vendor menjalankan versi evaluasi yang berbeda dan tidak ada satu pun angka yang berasal dari pihak ketiga. Yang dapat dibandingkan adalah dimensi independen: Grok 4.6 memiliki satu kartu skor terverifikasi, DeepSeek V4 Pro belum memilikinya, dan untuk keputusan produksi, asimetri itu sendiri adalah informasi.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

Total biaya untuk proses agen yang panjang.

Ambil pekerjaan agen yang realistis — membaca dan menalar lebih dari 500K token konteks, menulis 100K token keluaran, yang merupakan refactor berukuran sedang atau pipeline dokumen panjang, dalam jendela kedua model:

Grok 4.6 — 0.5M masukan sebesar $2 = $1.00, ditambah 0.1M keluaran sebesar $6 = $0.60. Total: $1.60.

DeepSeek V4 Pro — 0.5M input cache-miss pada ¥3 = ¥1.50, ditambah 0.1M output pada ¥6 = ¥0.60. Total: ¥2.10, sekitar $0.29.

Itu adalah selisih 5,5x pada tugas nominal yang sama, sebelum memperhitungkan keuntungan cache — dan jendela 1M D​eepSeek plus keluaran maksimum 384K juga berarti pekerjaan itu muat dalam satu proses, sementara jendela 500K Grok 4.6 mungkin memaksanya menjadi dua. Kendala yang membuat ini bukan jawaban satu baris adalah biaya dan risiko penalaran: mode berpikir D​eepSeek aktif secara default, jadi setiap permintaan membayar jejak penalaran penuh bahkan ketika Anda tidak menginginkannya, dan keyakinan tolok ukur vendor itu sendiri belum diuji oleh pihak independen. Murah per token dengan penalaran yang selalu aktif tetap murah per tugas pada tarif ini, tetapi "murah" dan "terverifikasi" adalah klaim yang berbeda, dan hanya satu dari model-model ini yang membawa klaim kedua.

Siapa yang harus memilih yang mana

Keputusannya bukan tentang "mana yang lebih baik" melainkan "profil risiko mana yang sesuai dengan beban kerja":

Bervolume tinggi, terikat biaya, dan bersedia menerima angka yang belum terverifikasi — DeepSeek V4 Pro adalah pilihan dengan harga terendah. Konteks 1M dan output 384K menjadikannya kandidat yang lebih kuat untuk konteks panjang dan batch, dan tarif input cache ¥0,025 membuat pipeline yang mengandalkan pencarian hampir gratis. Lakukan evaluasi sendiri saja, karena belum ada pihak independen yang melakukannya.

Kedalaman agentik dengan kartu skor independen, dalam ekosistem yang kompatibel dengan OpenAI — Skor 61 Grok 4.6 terverifikasi, arah benchmark coding dan agentiknya konsisten, dan kelemahan terminalnya diketahui sejak awal. Waktu 42 detik hingga token pertama adalah harga yang Anda bayar untuk kualitas terverifikasi.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

Trafik campuran — ini adalah kasus untuk routing, bukan memilih. Di OrcaRouter, kedua model berada di belakang satu kunci dengan harga pass-through sesuai daftar penyedia — jadi ¥3/¥6 milik D​eepSeek tetap ¥3/¥6 di faktur, dan Grok 4.6 tetap $2/$6, tanpa markup sama sekali pada keduanya. Aturan routing dapat mengirim pekerjaan berkonteks panjang dan terikat biaya ke DeepSeek V4 Pro serta pekerjaan agentic terverifikasi ke Grok 4.6, membagi trafik per permintaan hingga evaluasi Anda sendiri menentukan pembagian trafik tersebut, dan mengandalkan failover otomatis jika perilaku minggu pertama salah satu vendor bertentangan dengan angka peluncurannya. Untuk sepasang model berumur satu hari di ujung-ujung yang berlawanan dalam perang harga, kemampuan membandingkan keduanya pada beban kerja Anda sendiri — dan membalik pembagian tanpa mengubah kode — bukan sekadar kenyamanan. Itulah satu-satunya cara yang dapat dipertahankan untuk mengadopsi salah satunya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube