Kartu judul hero untuk perbandingan DeepSeek V4 Pro dan Qwen3.8 Max, dengan subjudul 'Spesialis penalaran vs serba bisa asal China'.
Guides & Insights

DeepSeek V4 Pro vs Qwen3.8 Max: Spesialis Penalaran vs Serba Bisa Asal China

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dalam rentang sepuluh hari, dua model yang paling banyak diperhatikan di Tiongkok diluncurkan: Alibaba merilis Qwen3.8 Max pada 3 Agustus 2026 — andalan sparse-MoE dengan 2,4 triliun parameter yang disebutnya serba bisa untuk agen, pekerjaan kantor, dan pemahaman multimodal — dan D​eepSeek mengirimkan versi resmi dari DeepSeek V4 Pro pada 12 Agustus, spesialis penalaran dan pengodean dengan total 1,6 triliun parameter dan label harga yang kira-kira sepertujuh dari harga Q​wen untuk token keluaran. Keduanya menyasar kantong pengembang yang sama, tetapi berbeda pandangan tentang tujuan sebuah model andalan. Qwen3.8 Max ingin menjadi satu model yang Anda gunakan untuk semua hal; DeepSeek V4 Pro ingin menjadi satu model yang Anda gunakan untuk hal-hal sulit.

The OrcaRouter DeepSeek V4 Pro model page showing the flagship MoE badge, 1M-token context, 384K max output, per-million pricing and an OpenAI-compatible code sample.

Poin-poin penting

• Qwen3.8 Max adalah model dengan kapabilitas mentah yang lebih tinggi pada papan peringkat umum Tiongkok (SuperCLUE #1, Juli) dan paket multimodal/perusahaan yang lebih kuat — input video, alat bawaan, keluaran terstruktur, semuanya dalam satu API.

• DeepSeek V4 Pro jauh lebih murah secara drastis (~7× untuk output), sudah memiliki bobot yang terbuka, dan kini memegang klaim coding/agentic yang lebih tinggi — Terminal-Bench 2.1 dengan skor 87.9 berbanding 86.6 yang dilaporkan vendor Q​wen.

• Perhatikan biaya verbositas: proses independen menunjukkan Qwen3.8 Max rata-rata ~64 putaran dan ~$1,14 per tugas agentik — masalah biaya efektif yang disembunyikan lembar spesifikasi.

• Judul yang jujur: Qwen3.8 Max adalah "perang kapabilitas" yang menyamai harga model tertutup AS; DeepSeek V4 Pro adalah bantahan dari segi harga-terhadap-kinerja.

Dua filosofi dalam satu tabel spesifikasi

• Total parameter — Qwen3.8 Max 2.4T (sparse MoE, ~95B aktif) vs DeepSeek V4 Pro 1.6T (MoE, ~49B aktif)

• Konteks / output maksimum — keduanya konteks 1M; Q​wen mencapai maksimum sekitar 128–131K output vs 384K milik D​eepSeek.

• Input — Qwen menerima teks, gambar, dan video; DeepSeek V4 Pro menerima teks dan gambar, dengan penalaran gambar native baru di build resmi

• Bobot terbuka — DeepSeek V4 Pro: dirilis (MIT); Qwen3.8 Max: dijanjikan untuk pekan 10 Agustus, Qwen kelas Max pertama yang pernah dirilis sebagai sumber terbuka.

• Ekstra API — Q​wen menyediakan alat bawaan dan output terstruktur secara langsung; DeepSeek V4 Pro menyediakan toggle berpikir, JSON terstruktur, API Responses, dan kompatibilitas Codex

• Harga — Qwen3.8 Max $2.00 / $6.00 per juta token ($0.25 cache) vs DeepSeek V4 Pro ~$0.42 / $0.87 ($0.0035 cache)

Scoreboard contrasting DeepSeek V4 Pro (Terminal-Bench 2.1 87.9 official, output price $0.87 per 1M, 1.6T total params, MIT open weights out now, 384K max output, text+image input) with Qwen3.8 Max (86.6 vendor, $6.00, 2.4T params, weights promised, ~128K max output, text+image+video input).

Di mana Qwen3.8 Max unggul

Pada sumbu generalis, Qwen3.8 Max unggul dan data independen setuju. Artificial Analysis menempatkannya pada Indeks Intelijen 58, Indeks Pengodean 71.8, dan Indeks Agentik 58 — yang terdekat yang pernah dicapai laboratorium Tiongkok mana pun ke puncak papan peringkat agentik tersebut. Pada peringkat berbahasa Mandarin SuperCLUE edisi Juli, ia menempati #1 dengan skor 71.48 sementara DeepSeek-V4-Pro berada di #5 dengan 64.4. Demo peluncuran Alibaba — sesi pengodean otonom 16 hari, serta reproduksi makalah yang mengalahkan hasil AIME24 dari makalah asli — adalah bukti terkuat di seluruh siklus rilis bahwa ini adalah agen jangka panjang yang benar-benar mumpuni.

Bagi seorang pengembang, keunggulan praktisnya berbentuk integrasi: input video, pemanggilan alat bawaan, keluaran terstruktur tanpa konfigurasi, dan ekosistem (Model Studio, toolchain Qwen) yang tidak coba ditandingi oleh DeepSeek. Jika beban kerjanya berat pada dokumen, multimodal, atau membutuhkan cerita integrasi perusahaan, Qwen3.8 Max adalah model yang saat ini menjadi default pasar Tiongkok.

Di mana DeepSeek V4 Pro unggul

Dalam hal pengodean dan biaya, V4 Pro resmi menjadi sanggahannya. D​eepSeek melaporkan build resmi pada 87.9 di Terminal-Bench 2.1 (naik dari 72.1 pada preview) dan 62.7 di DeepSWE — melawan 86.6 Terminal-Bench yang dilaporkan vendor Q​wen. Preview tersebut sebelumnya sudah memiliki 80.6 SWE-bench Verified, 90.1 GPQA Diamond, dan 93.5 LiveCodeBench, skor pemrograman kompetitif model terbuka #1, dan perubahan pada build resmi justru terkonsentrasi tepat pada tugas-tugas agentic dan penalaran yang diukur oleh angka-angka tersebut.

Lalu ada soal harga. Dengan $0.42/$0.87 per juta token, DeepSeek V4 Pro sekitar 4.8× lebih murah untuk input dan 6.9× lebih murah untuk output dibandingkan $2/$6 milik Qwen3.8 Max. D​eepSeek juga menyatakan pada 6 Agustus bahwa akan ada kenaikan harga, yang menjadikan tarif hari ini sebagai peluang, bukan janji — lebih lanjut di bawah ini.

An infographic summarizing the official DeepSeek V4 Pro release: Terminal-Bench 2.1 at 87.9 (preview 72.1), DeepSWE 62.7 (preview 12.8), AutomationBench 31.8 (preview 12.8), with native image reasoning, 1M context, 384K output and $0.87 per 1M output.

Lakukan perhitungan pada tugas agen yang sesungguhnya.

Operasi agen independen adalah tempat harga label Q​wen berhenti menjadi harga sebenarnya. Pada tugas agen Artificial Analysis, Qwen3.8 Max rata-rata ~64 giliran per tugas dan menghabiskan biaya ~$1,14 per tugas, dibandingkan ~$0,53 untuk generasi sebelumnya — modelnya bertele-tele dan banyak merencanakan. Jalankan bentuk tugas yang sama pada DeepSeek V4 Pro dengan $0,87 per juta output dan biaya per tugasnya menjadi sekitar satu orde magnitudo lebih rendah. Jika produk Anda adalah sebuah loop yang memanggil model seratus kali sehari per pengguna, selisih tersebut adalah margin Anda.

Peringatan keandalan di kedua sisi

Kejujuran sumber daya berlaku dua arah di sini. Pengujian independen menandai tingkat halusinasi Qwen3.8 Max yang naik dari 23% menjadi 40% dan skor AA-Omniscience turun sepuluh poin — model tersebut menjadi lebih cakap tetapi kurang dapat dipercaya dalam rilis yang sama. Pratinjau D​eepSeek membawa tingkat jawaban-selalu 94% yang terdokumentasi pada AA-Omniscience, artinya model tersebut cenderung menghasilkan jawaban baik saat mengetahuinya maupun tidak. Kedua tanda ini penting untuk produksi; tidak ada yang mendiskualifikasi untuk beban kerja yang menjadi sasaran model-model ini.

Mengapa waktu open-weights mengubah perhitungan harga

Rilis open-weights Qwen3.8 Max, ketika diluncurkan, akan mengubah ekonomi pertarungan ini dalam seminggu — pengguna self-host mendapat flagship 2.4T, dan tekanan harga API akan terasa nyata. Ini adalah skenario yang tepat di mana model harga pass-through menjaga Anda tetap jujur. OrcaRouter meneruskan harga daftar penyedia tanpa markup, jadi begitu Alibaba atau DeepSeek mengubah harga — naik atau turun — perubahan itu langsung aktif pada satu kunci di hari yang sama, tanpa negosiasi ulang dan tanpa kontrak kedua untuk dibaca. Anda merutekan ke Qwen3.8 Max atau DeepSeek V4 Pro mana pun yang disukai evaluasi Anda saat ini, dan harganya tetap sesuai yang sebenarnya dibebankan vendor.

Yang mana untuk keputusan API builder Anda?

Pilih Qwen3.8 Max saat pekerjaan membutuhkan seluruh permukaan — input multimodal, output terstruktur, alat bawaan, kualitas bahasa Tionghoa di puncak peringkat saat ini — dan model biaya Anda toleran terhadap proses agen yang bertele-tele. Pilih DeepSeek V4 Pro saat tugasnya berat pada penalaran atau pengodean, volume token tinggi, bobot terbuka penting untuk kepatuhan atau hosting mandiri, atau garis anggaran menjadi kendala yang mengikat. Interpretasi paling lugas dari perbandingan ini adalah yang disinyalkan oleh kedua perusahaan itu sendiri: Qwen3.8 Max adalah andalan yang menjadi patokan segalanya, dan DeepSeek V4 Pro adalah yang membuat tolok ukur itu terlihat mahal.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube