
DeepSeek V4 Flash Vision (Exp) Diluncurkan di API: Harga Sama dengan V4-Flash, Kini dengan Mata
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2658Kecerdasan72Koding
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
DeepSeek V4 Flash Vision (Exp) resmi diluncurkan di platform API DeepSeek hari ini, 21 Agustus 2026, dan angka terpenting dalam pengumuman tersebut bukanlah tolok ukur — melainkan harganya: model visi eksperimental ini dikenai biaya dengan tarif token yang persis sama dengan DeepSeek V4 Flash, pekerja keras khusus teks yang kemampuan teks murninya ia samai sepenuhnya. Hal ini menjadikan ini pertama kalinya API DeepSeek sendiri menerima gambar, dan itu berarti cara termurah untuk menjalankan agen berkonteks 1M baru saja menjadi multimodal secara gratis.
Apa yang sebenarnya dirilis
DeepSeek V4 Flash Vision (Exp) adalah model multimodal eksperimental, diakses dengan ID model deepseek-v4-flash-vision-exp. Model ini menerima teks plus gambar sebagai masukan dan menghasilkan teks sebagai keluaran, melalui jendela konteks 1M token dengan keluaran maksimum 384K, dalam mode berpikir dan non-berpikir. Model ini mendukung format Chat Completions, Messages bergaya Anthropic, dan format Responses, yang merupakan trio yang dibutuhkan kerangka kerja agen untuk menghubungkannya tanpa adaptor khusus.
On image input, DeepSeek accepts JPEG, PNG, GIF, and WebP, passed three ways: base64 inline, an external URL, or a file uploaded through the new Files API. There is no video or audio input yet — the "vision" here is stills only.

Posisi DeepSeek sendiri, dalam catatan rilisnya: kemampuan teks murni — agen, penalaran, pengetahuan dunia — setara dengan rilis resmi DeepSeek V4 Flash, sementara kemampuan agen multimodal membuat lompatan besar dan mendekati Opus-4.8. Itu adalah klaim vendor, belum direproduksi, dan layak dibaca dengan saksama, karena detail tolok ukur di baliknya lebih menarik daripada judulnya.
Mengapa lonjakan benchmark lebih besar daripada yang terlihat
Semua angka berikut adalah milik DeepSeek sendiri, diterbitkan hari ini dalam catatan peluncuran, dan belum diverifikasi secara independen. Pada tolok ukur agen yang menyertakan tangkapan layar dan gambar, DeepSeek V4 Flash yang hanya teks tidak membacanya — ia hanya mengabaikan bagian multimodal dari tugas tersebut. DeepSeek V4 Flash Vision (Exp) benar-benar melihat, itulah sebabnya perbedaannya sangat besar:
• ApexBench Pass@1 — Vision-Exp 36.5 vs V4-Flash 26.2 (Opus-4.8 39.4)
• Ujian Terakhir Para Agen — Vision-Exp 27.3 vs V4-Flash 25.2 (Opus-4.8 25.7)
• Terminal-Bench 2.1 — Vision-Exp 83.9 vs V4-Flash 82.7 (Opus-4.8 85.0)
• NL2Repo — Vision-Exp 57.7 vs V4-Flash 54.2 (Opus-4.8 69.7)
• DeepSWE — Vision-Exp 59.3 vs V4-Flash 54.4 (Opus-4.8 58.0)
• Chartography — Vision-Exp 64.3 (V4-Flash khusus teks tidak dapat mencobanya)
• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash khusus teks tidak dapat mencobanya)

Dua dari angka tersebut layak untuk dilihat ulang. Pada Agents' Last Exam, Vision-Exp (27.3) sedikit mengungguli Opus-4.8 (25.7), dan pada DeepSWE ia juga mengalahkan Opus-4.8 (59.3 vs 58.0). Itulah dasar sebenarnya dari klaim "setara dengan Opus-4.8" — bukan satu hasil unggulan, melainkan serangkaian tolok ukur agen di mana kemampuan melihat layar menutup sebagian besar kesenjangan dengan model multimodal terdepan, sembari menjualnya dengan harga yang lebih murah sekitar sepuluh kali lipat.
Berapa biaya sebuah gambar, sampai ke angka desimalnya.
Gambar ditokenisasi untuk penagihan — hingga 384 token per gambar — dan kemudian dikenakan tarif per token yang sama dengan DeepSeek V4 Flash. Karena DeepSeek memindahkan semua modelnya ke penetapan harga puncak/luar puncak pada 16 Agustus 2026, angka pastinya bergantung pada kapan Anda melakukan panggilan:
Input, cache miss — $0,22 per 1 juta token di luar jam sibuk, $0,44 jam sibuk
• Masukan, cache hit — $0.007 per 1 juta token di luar jam sibuk, $0.014 saat jam sibuk
• Output — $0,66 per 1M token di luar jam sibuk, $1,32 jam sibuk
Jam sibuk — 01:00–04:00 dan 06:00–10:00 UTC (semua jam lainnya di luar jam sibuk)
Lakukan perhitungannya dan biaya visi hampir hilang. Satu gambar pada batas 384 token sekitar 0,0085 sen di luar jam sibuk dan 0,017 sen pada jam sibuk, sebagai input. Agen yang membaca 50 tangkapan layar dalam satu kali proses menambah kira-kira setengah sen dari token input — sebelum model bahkan menulis token output pertamanya. DeepSeek juga membatasi resolusi sebelum inferensi: tingkat detail rendah mengubah ukuran menjadi 512×512, dan tinggi/orisinal melakukan pra-skala pada gambar (yang kecil hingga sekitar 384×384, yang besar turun hingga sekitar 800×800), sehingga gambar resolusi tinggi asli tidak pernah dimasukkan ke model pada jumlah piksel aslinya.
Pemeran pendukung: Files API gratis dan Harness 0.1.1
Dua komponen infrastruktur dirilis bersamaan dengan model ini. Files API sudah aktif dan gratis: unggah gambar sekali, rujuk dengan file_id, dan gunakan kembali di berbagai permintaan tanpa mengirim ulang byte-nya — hal ini penting bagi agen penjelajah yang menyimpan halaman dalam konteks selama beberapa giliran. Dan DeepSeek Harness 0.1.1, yang dirilis pada hari yang sama, memiliki dukungan langsung untuk model baru ini, sehingga harness yang melakukan benchmarking dan menjalankan beban kerja agen DeepSeek dapat langsung menargetkannya.
Peringatan produksi, dinyatakan secara terus terang
Ini adalah model eksperimental. DeepSeek melabelinya secara eksplisit sebagai demikian, belum mengumumkan tanggal GA, dan merekomendasikan agar tidak menjalankannya langsung di produksi; rencana yang dinyatakan adalah melakukan iterasi berdasarkan umpan balik dan merilis versi stabil nanti. Konsekuensi praktisnya adalah bahwa inti teksnya sudah terbukti — ini adalah keluarga bobot yang sama yang menggerakkan V4-Flash — tetapi jalur visinya adalah kode baru, dan tidak ada seorang pun di luar DeepSeek yang telah mengujinya dalam skala besar.
Justru inilah situasi di mana sebuah lapisan routing membuktikan nilainya. Di OrcaRouter, baik deepseek/deepseek-v4-flash-vision-exp maupun deepseek/deepseek-v4-flash aktif di balik satu API, dengan harga daftar DeepSeek yang diteruskan tanpa markup sama sekali. Anda dapat mengarahkan lalu lintas yang mengandung gambar ke model eksperimental tersebut dan, dalam konfigurasi yang sama, menyetel failover otomatis ke cadangan begitu ia error atau time out — yang mengurangi risiko dari keseluruhan masalah “kode baru” itu. DSL routing juga memungkinkan Anda mengirim hanya panggilan yang benar-benar mengandung gambar ke model visi dan menjaga lalu lintas teks murni di DeepSeek V4 Flash, sehingga Anda meraih keuntungan benchmark yang ada dan tidak membayar ekstra untuk yang tidak ada.

Tontonan Berikutnya
Pertanyaan-pertanyaan terbuka adalah pertanyaan yang biasa untuk peluncuran eksperimental. Kapan DeepSeek V4 Flash Vision (Exp) mencapai GA, dan apakah harganya bertahan? Apakah input video atau audio menyusul — model ini saat ini hanya untuk gambar diam, yang membuat model-model multimodal terdepan tanpa lawan pada media bergerak. Dan apakah evaluasi independen (uji pihak ketiga pertama pada ApexBench atau Terminal-Bench) mereproduksi angka-angka yang dipublikasikan? Hal yang menarik adalah bahwa bahkan jika setiap tolok ukur menurun, satu klaim yang sudah efektif dari segi biaya — visi dengan harga teks — adalah fakta penetapan harga, bukan klaim tolok ukur, dan itu tidak perlu direproduksi.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
