
DeepSeek V4 Pro Benchmarks: Kartu Skor Lengkap 0813, Setiap Pemeriksaan Independen, dan Apa yang Belum Diverifikasi Siapa Pun
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 143 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Jawaban singkatnya: DeepSeek V4 Pro mencatatkan kartu skor agen yang sangat kuat berdasarkan angka milik DeepSeek sendiri — Terminal-Bench 2.1 sebesar 87,9, DeepSWE 62,7, CyberGym 83,3 — tetapi hampir semua angka utama dilaporkan oleh vendor sendiri, dan gambaran independennya lebih dingin.Artificial Analysis menempatkan build resmi 0813 pada 53 di Intelligence Index-nya, setara dengan GLM 5.2, tertinggal empat poin dari GPT-5.6 Terra dan tujuh poin dari Kimi K3; Vals AI menempatkannya di peringkat 12, di bawah GPT-5.5 generasi sebelumnya. Artikel ini adalah agregasi lengkap yang belum pernah ditulis orang lain: kartu skor 0813 secara utuh, set pengkodean yang diperluas dari laporan teknis, setiap pemeriksaan independen yang ada, dan catatan jujur tentang angka mana yang telah direproduksi dan mana yang masih sekadar klaim DeepSeek belaka. Seminggu setelah kartu tersebut, gambaran penyajiannya juga mulai terisi — pada 19 Agustus 2026, LMSYS dan Ant Group menerbitkan tumpukan penyajian H20 yang mencapai 271 token keluaran/detik pada ukuran batch 1, yang dibahas di bagian tersendiri di bawah ini dan dicatat, seperti semua hal di sisi vendor halaman ini, sebagai laporan mandiri sampai ada yang mereproduksinya.
Kartu skor resmi 0813 — angka-angka DeepSeek sendiri, semuanya
Pengumuman resmi DeepSeek (dokumentasi API, news260813, 13 Agustus 2026) melaporkan build produksi terhadap pratinjau April. Setiap angka dalam bagian ini dilaporkan vendor — tidak ada yang direproduksi secara independen per 16 Agustus 2026:
• Terminal-Bench 2.1 — 87.9 (pratinjau: 72.1).
• DeepSWE — 62.7 (pratinjau: 12.8) — lompatan sekitar 5x yang merupakan klaim paling mencolok pada kartu tersebut.
• CyberGym — 83.3 (pratinjau: 52.7).
• Humanity's Last Exam — 42.7 tanpa alat, 60.0 dengan alat (pratinjau: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (pratinjau: 55.9).
• AutomationBench (publik) — 31.8 (pratinjau: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (pratinjau: 41.8 / 31.1).
• NL2Repo — 61.5 (pratinjau: 38.5).
• Agents' Last Exam — 25.7 (pratinjau: 16.5).
Pola yang perlu diperhatikan adalah di mana peningkatan terkonsentrasi: tolok ukur agen dan keamanan siber. Itu persis jenis papan skor yang dihasilkan lab ketika ingin memasarkan model agen — dan persis jenis yang membutuhkan pengulangan netral sebelum Anda mengeluarkan uang produksi untuk itu.

Set kode yang diperluas dari laporan teknis DeepSeek
Selain kartu agentik, laporan teknis DeepSeek (sebagaimana diagregasi oleh BenchLM pada 16 Agustus 2026) menambahkan serangkaian pengodean dan konteks panjang yang lebih luas. Juga dilaporkan oleh vendor, dan diberi label "Provider exact" oleh BenchLM — tanpa pengujian independen:
• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% — yang terbaik terverifikasi dalam katalog BenchLM.
• Rating Codeforces — 3206 — juga yang terbaik terverifikasi dalam katalog.
• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — keduanya merupakan yang terbaik di katalog untuk retrieval 1M-token, yang penting bagi model yang mengiklankan jendela konteks 1M-token.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (tercantum di halaman model OrcaRouter).
Apa yang sebenarnya diukur oleh evaluator independen
Tiga sumber independen telah menjalankan DeepSeek V4 Pro, dan penilaian mereka berkumpul di bawah kartu vendor:
• Indeks Intelijen Artificial Analysis — 53 (laporan SCMP, Agustus 2026; halaman model OrcaRouter menunjukkan 53.2, berperingkat ke-20 dari 132). Setara dengan GLM 5.2, tertinggal empat poin dari GPT-5.6 Terra, dan tujuh poin dari Kimi K3.
• Artificial Analysis Coding — 68.8, berada di peringkat ke-24 dari 130 (menurut halaman model OrcaRouter).
• Vals AI Index — peringkat ke-12, tertinggal dari GPT-5.5 generasi sebelumnya dan jauh di belakang Kimi K3 serta Claude Opus 5 (SCMP). Pengujian Vals AI sendiri menyoroti dua kelemahan konkret: menyelesaikan tugas di dalam lingkungan terminal yang terisolasi (sandbox), dan membangun model keuangan yang kompleks di spreadsheet Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, satu-satunya hasil "Benchmark exact" yang independen dalam set tersebut).
Buku besar yang jujur — apa yang telah direproduksi vs apa yang masih sekadar kata DeepSeek.
Ini adalah bagian yang dimaksudkan untuk disediakan oleh artikel benchmark, dan alasan untuk mem-bookmark halaman ini daripada liputan peluncuran. Bagilah setiap skor ke dalam salah satu dari dua kategori:
• Bersumber independen: AA Intelligence Index 53 / 53.2, AA Coding 68.8, peringkat Vals AI ke-12, Vibe Code Bench 49.93 — dan hasil Terminal-Bench 2.1 dari sumber terpisah sebesar 78.7 yang berdampingan dengan 87.9 milik DeepSeek di halaman model OrcaRouter. Kesenjangan sembilan poin antara angka vendor dan hasil independen ini adalah data terpenting di halaman ini: itulah kesenjangan reproduksi, terukur.
• Hanya dilaporkan vendor, tidak direproduksi secara independen: setiap angka pada kartu resmi 0813 di atas (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) dan seluruh rangkaian pengkodean yang diperluas (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Dokumen DeepSeek sendiri melabeli angka Terminal-Bench 2.1 sebagai "provider run".
Dibaca seperti itu, ceritanya koheren: DeepSeek V4 Pro adalah model frontier kelas menengah yang nyata — AA 53, berada di peringkat belasan hingga dua puluhan — dengan kartu skor vendor yang mengklaim performa agentic dan coding hampir teratas. Kedua pernyataan itu benar, dan tidak saling bertentangan; yang satu diukur, yang lain diklaim.

Berapa biaya kartu skor?
DeepSeek V4 Pro adalah model unggulan MoE dengan total parameter 1,6T / 49B aktif, jendela konteks 1M token, dan output maksimum 384K. Di OrcaRouter, model ini dihargai sesuai daftar harga DeepSeek tanpa markup: $0,435 per juta token input dan $0,87 per juta output (cache read $0,060 per juta), sesuai direktori yang diperiksa pada 15 Agustus 2026 dan dikonfirmasi di halaman model live. Dengan tarif tersebut, hitungan harga-per-poin menjadi argumen terkuat untuk model ini: kira-kira sepersepuluh harga output model-model yang skornya mendekatinya di indeks independen, sehingga Anda membayar harga kelas menengah untuk kartu skor yang, jika klaim vendor benar, berada di dekat puncak. Satu catatan: DeepSeek telah mengumumkan jadwal harga puncak/luar puncak (luar puncak 50% dari harga puncak) yang berlaku mulai 17 Agustus waktu Beijing, sehingga tarif dapat berubah — angka di sini adalah harga daftar yang berlaku saat artikel ini ditulis.

Menyajikan DeepSeek V4 Pro: 271 token keluaran/detik pada H20
Benchmark menilai seberapa banyak yang diketahui model; angka serving menilai seberapa murah Anda bisa membuatnya berpikir. Pada tanggal 19 Agustus 2026, LMSYS — organisasi di balik Chatbot Arena — dan tim sumber terbuka Ant Group menerbitkan pekerjaan serving serius pertama pada build 0813: sebuah "tumpukan serving khusus skenario" yang dibangun di atas SGLang, mesin sumber terbuka yang dikelola LMSYS. Angka utamanya adalah 271 token keluaran/detik pada ukuran batch 1 di NVIDIA H20, yang menurut tim berada pada 1,42× di bawah B300 — dicapai pada chip yang tidak memiliki Tensor Cores FP4 asli. Ini adalah pengukuran milik LMSYS dan Ant Group sendiri, diumumkan di blog mereka dan di X; tidak ada yang direproduksi secara independen.
Angka-angka lain dari stack tersebut, semuanya dilaporkan sendiri oleh LMSYS dan Ant Group pada stack mereka sendiri:
• Latensi decode — komponen "DSpark yang dioptimalkan" memangkas waktu-per-token-output (TPOT) sebesar 74.8–78.0% pada ukuran batch 1.
• Prefill — prefill 1 juta token selesai dalam 43,7 detik, peningkatan rata-rata geometris throughput prefill sebesar 36,5%.
• KV cache — skema yang oleh tim disebut "Humming MXFP4AFP8 + Online C128" memperluas kapasitas KV cache full-token sebesar 10,14×, pengungkit yang membuat beban kerja agen 1M-token praktis pada kelas silikon ini.
• Dekode per-GPU — pada konteks 4K, throughput dekode per-GPU meningkat dari 319.9 menjadi 703.2 token/s/GPU, peningkatan 2.20×.
Baca peringatan-peringatannya sebelum Anda menentukan ukuran armada berdasarkan itu. Batch size 1 adalah rezim aliran tunggal (single-stream) — yang dihadapi agen interaktif atau chat, bukan API dengan konkurensi tinggi — dan perbandingan 1,42×-off-B300 adalah rasio yang dinyatakan LMSYS tanpa memublikasikan tokens/s absolut B300, jadi selisihnya hanya diklaim, tidak dapat diverifikasi. Hasilnya juga mengukur stack, bukan chip: keuntungan ini berasal dari optimasi tingkat SGLang pada perangkat keras yang sebaliknya akan terlihat kurang bertenaga untuk MoE dengan total 1,6T. Sebagai konteks, halaman model live OrcaRouter mengukur DeepSeek V4 Pro pada 80,8 token output/detik melalui endpoint API bersama — angka H20 adalah benchmark aliran tunggal pada stack khusus, angka yang berbeda dengan makna yang berbeda.
Jika beban kerja Anda dilayani melalui API, semua ini tidak mengubah cara Anda memanggil model: DeepSeek V4 Pro adalah satu kunci yang kompatibel dengan OpenAI di OrcaRouter dengan harga daftar DeepSeek, dengan pengalihan otomatis jika penyedia macet. Angka H20 paling penting jika Anda adalah tim yang mempertimbangkan armada H20 yang di-host sendiri dibandingkan membayar API — celah yang ditutup oleh karya LMSYS dan Ant Group adalah keputusan pembelian perangkat keras, bukan keputusan pemilihan model.
Saat rekomendasi ini salah
Kasus-kasus jujur di mana DeepSeek V4 Pro sebaiknya bukan pilihan Anda:
• Anda memerlukan penalaran mutakhir yang terkonfirmasi secara independen. AA Index 53 berada di posisi tengah — Kimi K3 (60) dan GPT-5.6 Terra (57) unggul dan terverifikasi. Jika keputusan Anda bergantung pada batas atas yang terukur, kartu vendor tidak mengubahnya.
• Anda bertaruh produksi pada DeepSWE 62.7 sebelum seseorang menjalankan ulang. Lonjakan 12.8→62.7 dalam satu rilis adalah klaim, bukan fakta. Tunggu reproduksi netral — kesenjangan Terminal-Bench 87.9 berbanding 78.7 menunjukkan apa yang mungkin ditemukan.
• Beban kerja Anda adalah otomatisasi terminal dalam sandbox atau pemodelan keuangan Excel. Vals AI mengatakan ini persis di mana model kesulitan, terlepas dari skor vendor mana pun.
• Anda membuat keputusan keamanan siber berdasarkan CyberGym 83.3. Itu adalah DeepSeek yang menguji modelnya sendiri pada benchmark miliknya sendiri — vendor keamanan yang membeli berdasarkan angka ini sedang membeli data yang belum diaudit.
• Anda membeli H20 hanya berdasarkan angka 271 token/detik. Angka itu adalah benchmark stack tunggal yang dilaporkan sendiri pada ukuran batch 1 — menjanjikan, belum direproduksi, dan hanya satu titik pada kurva biaya yang juga mencakup utilisasi, daya, dan stack penyajian apa pun yang benar-benar Anda jalankan.
Intinya
DeepSeek V4 Pro 0813 adalah model frontier yang sesungguhnya dengan kartu skor vendor yang melampaui catatan independennya. Rilis 0813 mengubah pratinjau teks menjadi pesaing agentik yang serius — kami membahas rilisnya secara terpisah — dan jika Anda ingin mengevaluasinya hari ini, ia adalah satu kunci yang kompatibel dengan OpenAI di OrcaRouter dengan harga daftar DeepSeek, dengan failover otomatis jika penyedia macet. Bacalah kartu skor sesuai cara artikel ini membaginya: pemeriksaan independen (AA 53, Vals peringkat 12, hasil Terminal-Bench 78,7) adalah yang dapat Anda percaya hari ini; nilai 87,9 dan 62,7 adalah yang harus Anda verifikasi sebelum membangun di atasnya. Disiplin yang sama kini meluas ke penyajian: 271 token keluaran/detik dari LMSYS dan Ant Group di H20 adalah gambaran throughput terbaik yang kami miliki, dan itu masih klaim mereka sampai pengujian netral mengonfirmasinya. Belilah karena rasio harga-terhadap-kinerja dan konteks 1M-token, bukan karena angka-angka utama yang belum direproduksi.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
