
DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash: Harga Sama, Satu Bisa Melihat
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
DeepSeek V4 Flash Vision (Exp) dan DeepSeek V4 Flash adalah model yang sama dengan tepat satu perbedaan, dan perbedaan itulah inti keseluruhan cerita: model vision melihat gambar dan model teks tidak. Diluncurkan hari ini, 21 Agustus 2026, sebagai rilis eksperimental, DeepSeek V4 Flash Vision (Exp) membawa otak teks DeepSeek V4 Flash yang tidak berubah — konteks 1M token yang sama, output maksimum 384K yang sama, harga token yang sama — dan menambahkan input gambar yang mengatur ulang skornya pada benchmark agen di mana model teks gagal secara diam-diam. Satu-satunya pertanyaan nyata adalah apakah "eksperimental" membuat Anda lebih banyak mengeluarkan biaya daripada yang dihemat.
Kedua model
DeepSeek V4 Flash adalah kuda kerja anggaran resmi perusahaan: model Mixture-of-Experts dengan total sekitar 284B parameter dan 13B aktif, khusus teks, dioptimalkan untuk beban kerja harian dengan konkurensi tinggi, dengan anggaran konkurensi 2.500 token per detik pada API vendor. DeepSeek V4 Flash Vision (Exp) adalah keluarga bobot yang sama dengan encoder visi di depannya, ditagih identik, dan ditandai eksperimental. Segala sesuatu di bawah mata adalah bersama.
• Parameter — Vision-Exp: total 284B / 13B MoE aktif vs V4-Flash: total 284B / 13B MoE aktif (keluarga yang sama)
• Input — Vision-Exp: teks + gambar (JPEG, PNG, GIF, WebP) vs V4-Flash: teks saja
• Konteks — Vision-Exp: 1M token vs V4-Flash: 1M token
• Output maksimum — Vision-Exp: 384K token vs V4-Flash: 384K token
• Mode berpikir — keduanya mendukung pemikiran dan non-pemikiran
• Format API — keduanya: Chat Completions, Messages, Responses
• Harga — identik (keduanya ditagih pada tarif token puncak/di luar puncak V4-Flash)
• Status — Vision-Exp: eksperimental, belum ada tanggal GA vs V4-Flash: rilis resmi (V4-Flash-0731)

Di mana visi mengubah papan skor
Pada teks murni, DeepSeek mengatakan keduanya setara, dan tidak ada alasan untuk meragukannya — model visi dibangun dari kemampuan teks yang sama. Perbedaannya muncul pada benchmark agen yang berisi tangkapan layar, grafik, dan gambar UI, di mana model teks-saja benar-benar mengabaikan konten multimodal. Semua angka di bawah ini dilaporkan vendor dari catatan peluncuran hari ini, bukan direproduksi secara independen:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2
• Ujian Terakhir Para Agen — Vision-Exp 27.3 vs V4-Flash 25.2
Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7
• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4
Chartography — Vision-Exp 64.3 (V4-Flash tidak dapat mencoba)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash tidak dapat mencoba)

Lompatan terbesar adalah ApexBench, di mana penambahan visi mengangkat skor dari 26.2 menjadi 36.5 — perubahan sepuluh poin yang bukan karena model berpikir lebih keras, tetapi akhirnya membaca tugasnya. Untuk agen yang beroperasi melalui layar — browser, desktop, terminal dengan keluaran yang dirender — model teks itu buta pada bagian-bagian tugas yang justru membawa informasi.
Pertanyaan harga memiliki satu jawaban.
Tidak ada perbedaan harga, dan di sinilah perbandingan menjadi tidak perlu dipikirkan lagi ke satu arah. DeepSeek V4 Flash Vision (Exp) dikenakan biaya dengan tarif yang persis sama dengan DeepSeek V4 Flash, yang sejak 16 Agustus 2026 tarifnya adalah puncak/luar puncak:
• Input, cache miss — $0.22 per 1M token di luar jam sibuk, $0.44 jam sibuk (kedua model)
• Input, cache hit — $0.007 per 1M token di luar jam sibuk, $0.014 jam sibuk (kedua model)
• Output — $0,66 per 1M token di luar jam sibuk, $1,32 jam sibuk (kedua model)
• Jam sibuk — 01:00–04:00 dan 06:00–10:00 UTC, untuk kedua model
Satu-satunya biaya tambahan yang dibawa oleh visi adalah gambar itu sendiri: setiap gambar ditokenisasi hingga 384 token, sehingga satu tangkapan layar berbiaya sekitar 0,0085 sen di luar jam sibuk. Bahkan agen yang sangat mengandalkan visi yang membaca 50 gambar per proses hanya menambah di bawah satu sen masukan. Memilih model teks untuk menghemat uang adalah memilih uang receh daripada penglihatan — penghematan itu tidak nyata.
Kapan harus memilih yang mana
Pilih DeepSeek V4 Flash Vision (Exp) jika pipeline Anda dapat menerima gambar kapan pun. Agen pengujian UI dan QA berbasis tangkapan layar, agen penjelajah web yang perlu membaca halaman yang sedang mereka buka, ekstraksi bagan dan diagram, tangkapan layar dokumen, pengambilan pesan kesalahan dari layar pengguna — pada setiap hal tersebut, model vision adalah model yang secara ketat lebih baik dengan harga yang sama. Tidak ada penalti kualitas teks, menurut vendor, jadi satu-satunya alasan untuk tidak menggunakannya adalah stabilitas.
Pilih DeepSeek V4 Flash jika lalu lintas Anda murni teks dan tidak ada yang akan berubah tentangnya. Untuk komplesi kode, retrieval, dan loop agen khusus-teks, kedua model mendapat skor yang sama pada teks, dan rilis resmi adalah pilihan yang lebih aman menurut definisi. Jika Anda sudah menggunakan V4-Flash dan tidak pernah mengirim gambar, tidak ada alasan untuk beralih — dan juga tidak ada alasan untuk tidak memiliki opsi tersebut dalam konfigurasi routing Anda.
Satu-satunya perbedaan nyata: status eksperimental
Semua yang berada di atas mata identik; biaya visi dapat diabaikan; hasil benchmark lebih mendukung model visi. Satu-satunya faktor yang secara sah dapat membuat Anda tetap menggunakan DeepSeek V4 Flash di produksi adalah bahwa model visi tersebut masih eksperimental. DeepSeek melabelinya demikian, tidak memberikan tanggal GA, dan mengatakan bahwa model tersebut tidak direkomendasikan untuk penggunaan produksi. Otak teks di baliknya sudah teruji, tetapi jalur visi masih baru, dan permukaan API eksperimental adalah tempat yang justru tidak Anda inginkan untuk terjadinya kegagalan senyap pada pukul 2 AM.
Inilah satu-satunya tempat di mana perbandingan tidak diputuskan oleh spesifikasi, dan juga satu-satunya tempat di mana router mengubah jawabannya. Di OrcaRouter, kedua model aktif — deepseek/deepseek-v4-flash-vision-exp dan deepseek/deepseek-v4-flash — di balik satu kunci API dengan harga daftar penyedia, diteruskan tanpa markup. Karena platform yang sama merutekan keduanya, Anda dapat mengadopsi model visi di tempat yang bermanfaat dan mengunci sisanya ke rilis resmi, dengan failover otomatis sehingga gangguan eksperimental tidak akan pernah merobohkan seluruh pipeline. Anda mendapatkan keuntungan sepuluh poin ApexBench pada panggilan yang membutuhkannya dan stabilitas rilis resmi pada panggilan yang tidak membutuhkannya, tanpa kontrak kedua atau jalur kode kedua.

Intinya
Jika beban kerja Anda dapat menerima gambar, DeepSeek V4 Flash Vision (Exp) mengungguli DeepSeek V4 Flash pada setiap aspek yang penting dan hanya kalah pada satu aspek yang bisa Anda siasati: status eksperimental. Jika beban kerja Anda murni teks, kedua model setara dalam hal keluaran, dan rilis resmi unggul dalam hal stabilitas. Keduanya sebenarnya bukanlah pesaing — model visi adalah model teks dengan kemampuan yang terbuka, tanpa biaya tambahan. Satu-satunya keputusan yang layak dibuat adalah seberapa banyak lalu lintas Anda yang bersedia diarahkan ke API eksperimental, dan itu adalah keputusan perutean, bukan keputusan model.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
