
Grok 4.7 vs DeepSeek V4 Pro: Yang Satu Baru, yang Satunya Lagi Sedang Ditukar Diam-diam di Bawah Anda
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sebuah catatan yang diterbitkan pada 10 September 2026 mengubah pokok persoalan perbandingan ini. "Kami menghentikan V4-Pro secara bertahap," katanya, dan mulai 04:00 UTC pada 14 September 2026, setiap permintaan ke string model deepseek-v4-pro dialihkan ke DeepSeek-V4.1-Flash dengan tarif V4.1-Flash — keadaan yang menurut tulisan itu berlanjut "hingga V4.1-Pro diluncurkan." String model itu tetap menjawab. Model di baliknya bukan model yang Anda uji tolok ukur. Hal itu membuat adu langsung melawan Grok 4.7 — yang dirilis vendor pada 21 September 2026, satu hari sebelum ini ditulis — menjadi perbandingan dengan tanggal kedaluwarsa di salah satu sisinya. Berdasarkan angka yang ada, Grok 4.7 adalah model yang lebih kuat dan DeepSeek V4 Pro adalah yang lebih murah. Pada pertanyaan yang sebenarnya menentukan sebuah integrasi, hanya satu di antaranya yang masih merupakan hal seperti yang dikatakannya.
Apa itu masing-masing model, sebelum skor
DeepSeek V4 Pro mencapai ketersediaan umum pada 13 Agustus 2026 sebagai checkpoint DeepSeek-V4-Pro-0813, setelah pratinjau 24 April. Bobotnya terbuka di bawah MIT — lisensinya mengizinkan penggunaan komersial, modifikasi, dan redistribusi tanpa ambang pendapatan atau pengecualian regional — dengan total 1,7 triliun parameter pada kartu model GA, jendela konteks 1 juta token, dan keluaran maksimum 384K, batas keluaran terbesar dalam perbandingan ini. Model ini hanya teks: halaman harga DeepSeek sendiri menyatakan visi tidak didukung pada v4-pro, yang merupakan keterbatasan nyata bagi siapa pun yang memberinya tangkapan layar atau PDF. Model ini menyediakan pengatur upaya penalaran pada rendah, tinggi, dan maks, serta dibatasi pada 500 permintaan bersamaan per akun, dengan perluasan tersedia berdasarkan permintaan.
Grok 4.7 berbobot tertutup dan baru berumur sehari. Model ini membawa konteks 500k token — setengah dari DeepSeek — menerima masukan teks dan gambar, serta menjalankan pengatur tingkat upayanya sendiri. Harga daftarnya adalah $2,00 per juta token masukan dan $6,00 per juta token keluaran di bawah 200k token prompt, menjadi dua kali lipat menjadi $4,00 dan $12,00 pada atau di atas ambang tersebut, dengan pembacaan cache seharga $0,50 dan $1,00. xAI juga mencantumkan varian yang lebih cepat dengan kecepatan keluaran kira-kira dua kali lipat dan harga dua kali lipat. Kedua vendor tidak menerbitkan angka keluaran maksimum untuk Grok 4.7 dalam dokumentasi yang diperiksa di sini, jadi anggap dimensi itu tidak diketahui, bukan setara.
Pada indeks bersama, celah itu timpang ke satu arah
Kedua model dinilai pada Artificial Analysis Intelligence Index v4.3.2, revisi yang diterbitkan 19 September 2026. Kolom Grok 4.7 diukur pada upaya xhigh; milik DeepSeek adalah checkpoint 0813 pada upaya maksimum. Jika dibaca bersama, kesenjangan kompositnya meremehkan seberapa berbeda bentuk kedua model ini.
• Komposit — Grok 4.7: 46 pada Artificial Analysis Intelligence Index v4.3.2. DeepSeek V4 Pro 0813: 36 pada revisi yang sama.
• Agen terminal — Grok 4.7: Terminal-Bench 4.0 26. DeepSeek V4 Pro: 14. Hampir dua kali lipat, pada evaluasi yang paling dekat dengan pekerjaan perangkat lunak otonom.
• Otomatisasi — Grok 4.7: AutomationBench-AA 66%. DeepSeek V4 Pro: 57%. Keduanya kredibel; Grok unggul sembilan poin.
• Pengetahuan dan halusinasi — Grok 4.7: AA-Omniscience 32. DeepSeek V4 Pro: 1. Ini adalah pencilan di papan skor, dan ini bukan artefak pembulatan — indeks tersebut menilai seberapa banyak yang diketahui suatu model sekaligus seberapa sering ia mengarang jawaban ketika tidak mengetahuinya.
• Konteks panjang — Grok 4.7: AA-LCR v1.1 77%, jendela 500k. DeepSeek V4 Pro: 80%, jendela 1M. Inilah satu kemenangan jelas DeepSeek, dan itulah poros yang menjadi dasar dibangunnya jendela 1M-nya.
• Penalaran sulit — Grok 4.7: HLE 43, CritPt 18. DeepSeek V4 Pro: HLE 41, CritPt 18. Seri pada tolok ukur fisika dan keunggulan dua poin untuk Grok pada HLE.
• Verbositas — Grok 4.7: 240M token output untuk menjalankan indeks, ditandai sebagai terlalu verbose. DeepSeek V4 Pro: 163M. Keduanya cerewet; Grok lebih cerewet.

Kisah harga bukanlah satu angka, melainkan sebuah jadwal
Harga DeepSeek adalah hal paling agresif darinya, dan yang paling tidak stabil untuk dikutip. Tarif daftar untuk deepseek-v4-pro adalah $0,66 per juta token masukan saat cache miss dan $1,98 per juta token keluaran — selama jam off-peak. Pada jam sibuk, angka itu berlipat ganda menjadi $1,32 dan $3,96. Jam sibuk, menurut dokumentasi DeepSeek sendiri, adalah 01.00–04.00 dan 06.00–10.00 UTC Senin hingga Jumat kecuali hari libur nasional Tiongkok; selebihnya, termasuk akhir pekan penuh, adalah off-peak dengan harga tepat setengahnya. Pembacaan masukan dari cache adalah sorotan utamanya: $0,022 saat off-peak dan $0,044 saat peak, tiga puluh kali lebih murah daripada cache miss, yang membuat beban kerja DeepSeek yang ter-cache dengan baik jauh lebih murah daripada yang tersirat oleh daftar tarifnya.
Sebaliknya, harga Grok 4.7 sebesar $2.00 dan $6.00 terlihat mahal — sekitar 3x input off-peak DeepSeek dan 3x output off-peak-nya. Perbandingannya menyempit dengan cara yang patut diketahui. Harga Grok 4.7 datar dalam rentangnya alih-alih bergantung pada waktu, jadi lonjakan produksi pukul 09:00 UTC sama biayanya dengan batch Minggu malam; DeepSeek tidak demikian. Dan di atas 200k token prompt, Grok 4.7 menjadi dua kali lipat, pada titik mana harganya empat hingga enam kali tarif off-peak DeepSeek alih-alih tiga. Cara yang jelas untuk mengatakannya: DeepSeek V4 Pro adalah model yang lebih murah di setiap sumbu, dan besarnya diskon bergantung pada kapan Anda menjalankan dan seberapa baik Anda melakukan cache.
Apa yang diubah oleh 14 September
Inilah bagian yang membuat argumen harga lebih sulit dijadikan pegangan. Mulai 14 September 2026, DeepSeek mengarahkan permintaan deepseek-v4-pro ke DeepSeek-V4.1-Flash dan menagihnya dengan tarif Flash — yang bahkan lebih rendah. Log perubahan dan halaman harga DeepSeek memberikan gambaran yang sedikit berbeda dari postingan berita 10 September: tabel harga masih mencantumkan deepseek-v4-pro sebagai baris yang masih berlaku dengan tarifnya sendiri dan tanpa label penghentian, dan entri log perubahan menyatakan layanan API untuk V4 Pro berlanjut setelah 14 September dengan penagihan yang tidak berubah. Yang tidak diperdebatkan adalah arah pergerakannya. V4.1-Pro dipastikan sedang dikembangkan tanpa tanggal yang diumumkan, dan V4.1-Flash — yang dirilis 10 September — adalah yang menurut pengumuman DeepSeek sendiri mengalahkan V4 Pro dalam hal "kinerja, biaya, kecepatan, dan total waktu proses," sebuah klaim vendor yang belum direproduksi secara independen pada cakupan seluas itu.
Jadi, pertanyaan praktisnya bukanlah "Grok 4.7 atau DeepSeek V4 Pro", melainkan "Grok 4.7 atau model DeepSeek mana pun yang dituju oleh string itu pada kuartal berikutnya." Jika Anda melakukan benchmark V4 Pro pada bulan Agustus dan menetapkan ukuran anggaran konteks Anda sekitar jendela 1M dengan batas atas output 384K, model yang Anda panggil pada bulan November mungkin bukan model yang Anda ukur — dan batas konteks serta output penerusnya bukanlah batas yang menjadi acuan desain Anda. Grok 4.7 memiliki profil risiko yang berlawanan: model berusia satu hari yang angka-angkanya dilaporkan vendor dan sebagian besar belum direproduksi, tetapi identitasnya tidak dipertanyakan.

Di mana router cocok, dan di mana tidak
OrcaRouter menyediakan DeepSeek V4 Pro, dan halaman model mencantumkannya pada tarif milik penyedia itu sendiri — $0,66 untuk input dan $1,98 untuk output dengan jendela konteks 1M serta output maksimum 384k — karena kami meneruskan harga daftar penyedia dengan markup 0%. Hal itu lebih penting daripada biasanya pada vendor yang tarifnya berubah mengikuti jadwal jam sibuk/non-sibuk dan yang pengumuman 10 September-nya disertai penurunan harga: perubahan harga DeepSeek langsung berlaku pada kunci yang sama di hari yang sama, tanpa jeda penetapan harga ulang dan tanpa kontrak kedua. Ketika vendor mengalihkan rute string model di sisi mereka, perubahan itu tiba melalui endpoint yang sama, bukan mengharuskan integrasi ulang di sisi Anda, dan failover otomatis mencegah batas laju atau peristiwa kapasitas di sisi penyedia berubah menjadi gangguan layanan — berguna ketika salah satu sisi tumpukan Anda dibatasi pada 500 permintaan bersamaan. Grok 4.7 tidak ada dalam katalog OrcaRouter pada saat penulisan ini; untuk memanggilnya berarti melalui API xAI sendiri dan platform pihak ketiga yang menyediakannya.
Pembagian yang disarankan ini tidak glamor tetapi dapat dipertahankan: pertahankan DeepSeek V4 Pro pada beban kerja tempat penetapan harga cache-hit dan jendela 1M yang menjadi andalan, dan patok ekspektasi Anda pada V4.1-Flash alih-alih pada checkpoint Agustus. Tempatkan Grok 4.7 pada tugas-tugas di mana model harus mengetahui apa yang tidak diketahuinya — indeks AA-Omniscience sebesar 1 adalah sinyal keras tentang kesediaan model untuk menjawab dengan percaya diri dan salah, dan tidak ada keunggulan harga yang bertahan ketika konsumen hilir memercayai jawaban yang dibuat-buat.
Panggilan
Grok 4.7 adalah model yang lebih baik di sini dan selisihnya tidak tipis: keunggulan komposit sepuluh poin, skor Terminal-Bench dua kali lipat, keunggulan dalam otomatisasi, dan selisih kejujuran pengetahuan yang cukup lebar untuk menjadi perbedaan kategori. DeepSeek V4 Pro lebih murah sekitar 3x di luar jam sibuk dan memiliki jendela konteks dua kali lebih besar, yang merupakan alasan nyata dan dapat dipertahankan untuk tetap memakainya — tetapi Anda tidak membeli model yang Anda uji tolok ukur, Anda membeli string model yang sudah diumumkan DeepSeek akan dialihkan ulang, dengan tarif yang berubah setiap jam, di bawah lisensi dan kumpulan bobot yang menjadikan self-hosting opsi ketiga yang sungguh nyata. Jika beban kerjanya berkonteks panjang, bervolume tinggi, dan dapat di-cache, ekonomi DeepSeek sulit ditandingi dan Anda sebaiknya merancang untuk penerusnya, bukan untuk checkpoint tersebut. Jika itu adalah apa pun yang membuat kesalahan menjadi mahal, bayarlah 3x dan ambil model yang mengakui ketidakpastian.

Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
