Kartu judul hero untuk 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash' dengan subjudul 'Harga Sama, Satu yang Melihat', ikon garis mata di sebelah kiri dan ikon garis dokumen teks di sebelah kanan yang dipisahkan oleh pembatas netral tipis, serta logo OrcaRouter di sudut kanan bawah.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) vs DeepSeek V4 Flash: Harga Sama, Satu Bisa Melihat

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

DeepSeek V4 Flash Vision (Exp) dan DeepSeek V4 Flash adalah model yang sama dengan tepat satu perbedaan, dan perbedaan itulah inti keseluruhan cerita: model vision melihat gambar dan model teks tidak. Diluncurkan hari ini, 21 Agustus 2026, sebagai rilis eksperimental, DeepSeek V4 Flash Vision (Exp) membawa otak teks DeepSeek V4 Flash yang tidak berubah — konteks 1M token yang sama, output maksimum 384K yang sama, harga token yang sama — dan menambahkan input gambar yang mengatur ulang skornya pada benchmark agen di mana model teks gagal secara diam-diam. Satu-satunya pertanyaan nyata adalah apakah "eksperimental" membuat Anda lebih banyak mengeluarkan biaya daripada yang dihemat.

Kedua model

DeepSeek V4 Flash adalah kuda kerja anggaran resmi perusahaan: model Mixture-of-Experts dengan total sekitar 284B parameter dan 13B aktif, khusus teks, dioptimalkan untuk beban kerja harian dengan konkurensi tinggi, dengan anggaran konkurensi 2.500 token per detik pada API vendor. DeepSeek V4 Flash Vision (Exp) adalah keluarga bobot yang sama dengan encoder visi di depannya, ditagih identik, dan ditandai eksperimental. Segala sesuatu di bawah mata adalah bersama.

• Parameter — Vision-Exp: total 284B / 13B MoE aktif vs V4-Flash: total 284B / 13B MoE aktif (keluarga yang sama)

• Input — Vision-Exp: teks + gambar (JPEG, PNG, GIF, WebP) vs V4-Flash: teks saja

• Konteks — Vision-Exp: 1M token vs V4-Flash: 1M token

• Output maksimum — Vision-Exp: 384K token vs V4-Flash: 384K token

• Mode berpikir — keduanya mendukung pemikiran dan non-pemikiran

• Format API — keduanya: Chat Completions, Messages, Responses

• Harga — identik (keduanya ditagih pada tarif token puncak/di luar puncak V4-Flash)

• Status — Vision-Exp: eksperimental, belum ada tanggal GA vs V4-Flash: rilis resmi (V4-Flash-0731)

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

Di mana visi mengubah papan skor

Pada teks murni, Deep​Seek mengatakan keduanya setara, dan tidak ada alasan untuk meragukannya — model visi dibangun dari kemampuan teks yang sama. Perbedaannya muncul pada benchmark agen yang berisi tangkapan layar, grafik, dan gambar UI, di mana model teks-saja benar-benar mengabaikan konten multimodal. Semua angka di bawah ini dilaporkan vendor dari catatan peluncuran hari ini, bukan direproduksi secara independen:

• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2

• Ujian Terakhir Para Agen — Vision-Exp 27.3 vs V4-Flash 25.2

Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7

• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2

• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4

Chartography — Vision-Exp 64.3 (V4-Flash tidak dapat mencoba)

• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash tidak dapat mencoba)

A two-column comparison scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp vs DeepSeek-V4-Flash — the scoreboard': left column DeepSeek-V4-Flash-Vision-Exp — Input text + image, Context 1M tokens, Max output 384K, ApexBench Pass@1 36.5, Price $0.22/M off-peak, Status experimental; right column DeepSeek-V4-Flash — Input text only, Context 1M tokens, Max output 384K, ApexBench Pass@1 26.2, Price $0.22/M off-peak, Status official release; footer 'Benchmark figures vendor-reported; pricing per DeepSeek API docs.'

Lompatan terbesar adalah ApexBench, di mana penambahan visi mengangkat skor dari 26.2 menjadi 36.5 — perubahan sepuluh poin yang bukan karena model berpikir lebih keras, tetapi akhirnya membaca tugasnya. Untuk agen yang beroperasi melalui layar — browser, desktop, terminal dengan keluaran yang dirender — model teks itu buta pada bagian-bagian tugas yang justru membawa informasi.

Pertanyaan harga memiliki satu jawaban.

Tidak ada perbedaan harga, dan di sinilah perbandingan menjadi tidak perlu dipikirkan lagi ke satu arah. DeepSeek V4 Flash Vision (Exp) dikenakan biaya dengan tarif yang persis sama dengan DeepSeek V4 Flash, yang sejak 16 Agustus 2026 tarifnya adalah puncak/luar puncak:

• Input, cache miss — $0.22 per 1M token di luar jam sibuk, $0.44 jam sibuk (kedua model)

• Input, cache hit — $0.007 per 1M token di luar jam sibuk, $0.014 jam sibuk (kedua model)

• Output — $0,66 per 1M token di luar jam sibuk, $1,32 jam sibuk (kedua model)

• Jam sibuk — 01:00–04:00 dan 06:00–10:00 UTC, untuk kedua model

Satu-satunya biaya tambahan yang dibawa oleh visi adalah gambar itu sendiri: setiap gambar ditokenisasi hingga 384 token, sehingga satu tangkapan layar berbiaya sekitar 0,0085 sen di luar jam sibuk. Bahkan agen yang sangat mengandalkan visi yang membaca 50 gambar per proses hanya menambah di bawah satu sen masukan. Memilih model teks untuk menghemat uang adalah memilih uang receh daripada penglihatan — penghematan itu tidak nyata.

Kapan harus memilih yang mana

Pilih DeepSeek V4 Flash Vision (Exp) jika pipeline Anda dapat menerima gambar kapan pun. Agen pengujian UI dan QA berbasis tangkapan layar, agen penjelajah web yang perlu membaca halaman yang sedang mereka buka, ekstraksi bagan dan diagram, tangkapan layar dokumen, pengambilan pesan kesalahan dari layar pengguna — pada setiap hal tersebut, model vision adalah model yang secara ketat lebih baik dengan harga yang sama. Tidak ada penalti kualitas teks, menurut vendor, jadi satu-satunya alasan untuk tidak menggunakannya adalah stabilitas.

Pilih DeepSeek V4 Flash jika lalu lintas Anda murni teks dan tidak ada yang akan berubah tentangnya. Untuk komplesi kode, retrieval, dan loop agen khusus-teks, kedua model mendapat skor yang sama pada teks, dan rilis resmi adalah pilihan yang lebih aman menurut definisi. Jika Anda sudah menggunakan V4-Flash dan tidak pernah mengirim gambar, tidak ada alasan untuk beralih — dan juga tidak ada alasan untuk tidak memiliki opsi tersebut dalam konfigurasi routing Anda.

Satu-satunya perbedaan nyata: status eksperimental

Semua yang berada di atas mata identik; biaya visi dapat diabaikan; hasil benchmark lebih mendukung model visi. Satu-satunya faktor yang secara sah dapat membuat Anda tetap menggunakan Deep​Seek V4 Flash di produksi adalah bahwa model visi tersebut masih eksperimental. Deep​Seek melabelinya demikian, tidak memberikan tanggal GA, dan mengatakan bahwa model tersebut tidak direkomendasikan untuk penggunaan produksi. Otak teks di baliknya sudah teruji, tetapi jalur visi masih baru, dan permukaan API eksperimental adalah tempat yang justru tidak Anda inginkan untuk terjadinya kegagalan senyap pada pukul 2 AM.

Inilah satu-satunya tempat di mana perbandingan tidak diputuskan oleh spesifikasi, dan juga satu-satunya tempat di mana router mengubah jawabannya. Di OrcaRouter, kedua model aktif — deepseek/deepseek-v4-flash-vision-exp dan deepseek/deepseek-v4-flash — di balik satu kunci API dengan harga daftar penyedia, diteruskan tanpa markup. Karena platform yang sama merutekan keduanya, Anda dapat mengadopsi model visi di tempat yang bermanfaat dan mengunci sisanya ke rilis resmi, dengan failover otomatis sehingga gangguan eksperimental tidak akan pernah merobohkan seluruh pipeline. Anda mendapatkan keuntungan sepuluh poin ApexBench pada panggilan yang membutuhkannya dan stabilitas rilis resmi pada panggilan yang tidak membutuhkannya, tanpa kontrak kedua atau jalur kode kedua.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text', a price block of $0.15 input / $0.29 output per 1M tokens with p50 TTFT 602 ms, and the model description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context'.

Intinya

Jika beban kerja Anda dapat menerima gambar, DeepSeek V4 Flash Vision (Exp) mengungguli DeepSeek V4 Flash pada setiap aspek yang penting dan hanya kalah pada satu aspek yang bisa Anda siasati: status eksperimental. Jika beban kerja Anda murni teks, kedua model setara dalam hal keluaran, dan rilis resmi unggul dalam hal stabilitas. Keduanya sebenarnya bukanlah pesaing — model visi adalah model teks dengan kemampuan yang terbuka, tanpa biaya tambahan. Satu-satunya keputusan yang layak dibuat adalah seberapa banyak lalu lintas Anda yang bersedia diarahkan ke API eksperimental, dan itu adalah keputusan perutean, bukan keputusan model.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube