
DeepSeek V4 Pro Benchmarks: Kartu Skor Lengkap 0813, Setiap Pemeriksaan Independen, dan Apa yang Belum Diverifikasi Siapa Pun
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
Jawaban singkatnya: DeepSeek V4 Pro mencatat skor agen yang sungguh kuat berdasarkan angka-angka DeepSeek sendiri — Terminal-Bench 2.1 di 87,9, DeepSWE di 62,7, CyberGym di 83,3 — tetapi hampir setiap angka utama dilaporkan oleh vendor, dan gambaran independennya lebih dingin. Artificial Analysis menempatkan build 0813 resmi di angka 53 pada Intelligence Index-nya, sejajar dengan GLM-5.2, empat poin di belakang GPT-5.6 Terra dan tujuh poin di belakang Kimi K3; Vals AI menempatkannya di peringkat 12, di bawah GPT-5.5 generasi sebelumnya. Artikel ini adalah agregasi lengkap yang belum ditulis orang lain: kartu skor 0813 yang lengkap, set pengodean yang diperluas dari laporan teknis, setiap pemeriksaan independen yang ada, serta catatan jujur tentang angka mana yang sudah direproduksi dan mana yang masih sekadar klaim DeepSeek belaka.
Kartu skor resmi 0813 — angka-angka DeepSeek sendiri, semuanya
Pengumuman resmi DeepSeek (dokumen API, news260813, 13 Agustus 2026) melaporkan build produksi terhadap pratinjau April. Setiap angka di bagian ini dilaporkan oleh vendor — tidak ada satu pun yang telah direproduksi secara independen per 16 Agustus 2026:
• Terminal-Bench 2.1 — 87.9 (pratinjau: 72.1).
• DeepSWE — 62.7 (pratinjau: 12.8) — lompatan sekitar 5x yang merupakan klaim paling mencolok pada kartu tersebut.
• CyberGym — 83.3 (pratinjau: 52.7).
• Humanity's Last Exam — 42.7 tanpa alat, 60.0 dengan alat (pratinjau: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (pratinjau: 55.9).
• AutomationBench (publik) — 31.8 (pratinjau: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (pratinjau: 41.8 / 31.1).
• NL2Repo — 61.5 (pratinjau: 38.5).
• Agents' Last Exam — 25.7 (pratinjau: 16.5).
Pola yang perlu diperhatikan adalah di mana peningkatan terkonsentrasi: tolok ukur agen dan keamanan siber. Itu persis jenis papan skor yang dihasilkan lab ketika ingin memasarkan model agen — dan persis jenis yang membutuhkan pengulangan netral sebelum Anda mengeluarkan uang produksi untuk itu.

Set kode yang diperluas dari laporan teknis DeepSeek
Di luar kartu agentic, laporan teknis DeepSeek (yang dihimpun oleh BenchLM pada 16 Agustus 2026) menambahkan set coding dan konteks panjang yang lebih luas. Juga dilaporkan oleh vendor, dan diberi label "Provider exact" oleh BenchLM — tanpa pengujian independen:
• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% — yang terbaik terverifikasi dalam katalog BenchLM.
• Rating Codeforces — 3206 — juga yang terbaik terverifikasi dalam katalog.
• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — keduanya merupakan yang terbaik di katalog untuk retrieval 1M-token, yang penting bagi model yang mengiklankan jendela konteks 1M-token.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (tercantum di halaman model OrcaRouter).
Apa yang sebenarnya diukur oleh evaluator independen
Tiga sumber independen telah menjalankan DeepSeek V4 Pro, dan penilaian mereka berkumpul di bawah kartu vendor:
• Artificial Analysis Intelligence Index — 53 (Laporan SCMP, Agustus 2026; halaman model OrcaRouter menunjukkan 53,2, berperingkat ke-20 dari 132). Setara dengan GLM-5.2, empat poin di belakang GPT-5.6 Terra, dan tujuh poin di belakang Kimi K3.
• Artificial Analysis Coding — 68.8, berada di peringkat ke-24 dari 130 (menurut halaman model OrcaRouter).
• Vals AI Index — peringkat ke-12, tertinggal dari GPT-5.5 generasi sebelumnya dan jauh di belakang Kimi K3 serta Claude Opus 5 (SCMP). Pengujian Vals AI sendiri menyoroti dua kelemahan konkret: menyelesaikan tugas di dalam lingkungan terminal yang terisolasi (sandbox), dan membangun model keuangan yang kompleks di spreadsheet Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, satu-satunya hasil "Benchmark exact" yang independen dalam set tersebut).
Catatan jujur — apa yang telah direproduksi vs apa yang masih sekadar kata DeepSeek
Ini adalah bagian yang dimaksudkan untuk disediakan oleh artikel benchmark, dan alasan untuk mem-bookmark halaman ini daripada liputan peluncuran. Bagilah setiap skor ke dalam salah satu dari dua kategori:
• Bersumber independen: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI peringkat ke-12, Vibe Code Bench 49.93 — dan hasil Terminal-Bench 2.1 yang bersumber terpisah sebesar 78.7 yang berada di samping 87.9 milik DeepSeek di halaman model OrcaRouter. Selisih sembilan poin antara angka vendor dan hasil independen adalah satu-satunya data yang terpenting di halaman ini: itulah kesenjangan reproduksi yang terkuantifikasi.
• Hanya dilaporkan vendor, tidak direproduksi secara independen: setiap angka dalam kartu resmi 0813 di atas (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) dan seluruh set pengkodean yang diperluas (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Dokumen DeepSeek sendiri melabeli angka Terminal-Bench 2.1 sebagai "provider run."
Dibaca seperti itu, ceritanya koheren: DeepSeek V4 Pro adalah model frontier kelas menengah yang nyata — AA 53, berada di peringkat belasan hingga dua puluhan — dengan kartu skor vendor yang mengklaim performa agentic dan coding hampir teratas. Kedua pernyataan itu benar, dan tidak saling bertentangan; yang satu diukur, yang lain diklaim.

Berapa biaya kartu skor?
DeepSeek V4 Pro adalah flagship MoE dengan total 1.6T / aktif 49B, jendela konteks 1M-token, dan output maksimal 384K. Di OrcaRouter, harganya adalah harga daftar DeepSeek tanpa markup: $0.435 per juta token input dan $0.87 per juta output (cache read $0.060 per juta), sesuai direktori yang diperiksa pada 15 Agustus 2026 dan dikonfirmasi di halaman model live. Pada tarif tersebut, perhitungan harga per poin menjadi argumen terkuat untuk model ini: yaitu kira-kira sepersepuluh dari harga output model-model yang nilainya berdekatan dengannya di indeks independen, jadi Anda membayar harga kelas menengah untuk kartu skor yang, jika klaim vendor benar, berada di dekat puncak. Satu peringatan: DeepSeek telah mengumumkan jadwal harga puncak/luar puncak (luar puncak sebesar 50% dari harga puncak) yang berlaku mulai 17 Agustus, waktu Beijing, jadi tarifnya dapat berubah — angka-angka di sini adalah harga daftar live per artikel ini.

Saat rekomendasi ini salah
Kasus-kasus jujur di mana DeepSeek V4 Pro sebaiknya bukan pilihan Anda:
• Anda memerlukan penalaran mutakhir yang terkonfirmasi secara independen. AA Index 53 berada di posisi tengah — Kimi K3 (60) dan GPT-5.6 Terra (57) unggul dan terverifikasi. Jika keputusan Anda bergantung pada batas atas yang terukur, kartu vendor tidak mengubahnya.
• Anda bertaruh produksi pada DeepSWE 62.7 sebelum seseorang menjalankan ulang. Lonjakan 12.8→62.7 dalam satu rilis adalah klaim, bukan fakta. Tunggu reproduksi netral — kesenjangan Terminal-Bench 87.9 berbanding 78.7 menunjukkan apa yang mungkin ditemukan.
• Beban kerja Anda adalah otomatisasi terminal dalam sandbox atau pemodelan keuangan Excel. Vals AI mengatakan ini persis di mana model kesulitan, terlepas dari skor vendor mana pun.
• Anda membuat keputusan keamanan siber berdasarkan CyberGym 83.3. Itu adalah DeepSeek yang menguji modelnya sendiri pada benchmark-nya sendiri — vendor keamanan yang membeli berdasarkan angka ini berarti membeli data yang belum diaudit.
Intinya
DeepSeek V4 Pro 0813 adalah model frontier sejati dengan kartu skor vendor yang melampaui catatan independennya. Rilis 0813 mengubah pratinjau teks menjadi pesaing agentik yang serius — kami meliput rilisnya secara terpisah — dan jika Anda ingin mengevaluasinya hari ini, itu adalah satu kunci yang kompatibel dengan OpenAI di OrcaRouter dengan harga daftar DeepSeek, dengan failover otomatis jika penyedia macet. Bacalah kartu skor sesuai cara artikel ini membaginya: pemeriksaan independen (AA 53, Vals 12th, hasil Terminal-Bench 78.7) adalah yang dapat Anda percaya hari ini; angka 87.9 dan 62.7 adalah yang harus Anda verifikasi sebelum membangun di atasnya. Belilah untuk rasio harga-kinerja dan konteks 1M-token, bukan untuk angka-angka utama yang belum dapat direproduksi.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
