
DeepSeek V4 Flash Rilis Resmi: Model Konteks 1M yang Murah, Cepat, dan Agentik, Dijelaskan
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 224 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicBARUAnthropic: Claude Opus 52026-07-2461Kecerdasan78Koding
- googleBARUGoogle: Gemini 3.6 Flash2026-07-2150Kecerdasan69Koding
- googleBARUGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1651Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1557Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0854Kecerdasan72Koding
- tencentTencent: Hy32026-07-0641Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1651Kecerdasan69Koding60Matematika
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Kecerdasan61Koding61Matematika
- anthropicAnthropic: Claude Fable 52026-06-0960Kecerdasan77Koding
- qwenQwen: Qwen3.7 Plus2026-06-0139Kecerdasan56Koding59Matematika
Model efisiensi DeepSeek, V4 Flash, telah lulus dari pratinjau menjadi rilis beta publik resmi — code>-0731/code> build yang dirilis pada 31 Juli 2026. Arsitekturnya tidak berubah (masih berupa model mixture-of-experts dengan 284 miliar parameter dan konteks 1 juta token), tetapi serangkaian pasca-pelatihan tambahan secara tajam meningkatkan kemampuan agen, pengkodean, dan pemanggilan alatnya, dan kini secara native mendukung Responses API dengan adaptasi khusus untuk agen bergaya Codex. Panduan ini menjelaskan apa itu V4 Flash, apa yang sebenarnya ditingkatkan oleh rilis resmi, bagaimana tolok ukurnya (yang dilaporkan DeepSeek) dibaca, berapa biayanya, dan cara menggunakannya — setiap angka diberi label berdasarkan sumbernya.
Catatan akurasi: detail rilis dan skor tolok ukur di bawah ini berasal dari log perubahan API resmi DeepSeek (tertanggal 2026-07-31); arsitektur, konteks, dan harga telah diperiksa silang dengan halaman model OrcaRouter; komposit Artificial Analysis bersifat independen. Tolok ukur yang dilaporkan DeepSeek menggunakan pengaturan harness sendiri — anggap sebagai angka vendor dan jalankan evaluasi Anda sendiri. Spesifikasi dan harga dapat berubah; verifikasi sebelum membangun.
TL;DR. V4 Flash adalah saudara yang hemat biaya dari raksasa DeepSeek V4 Pro: MoE dengan 284B / 13B-aktif, konteks 1M token, dan output hingga 384K, yang disetel untuk pekerjaan agen bervolume tinggi dan latensi rendah. Rilis resmi 31 Juli adalah peningkatan pasca-pelatihan — ukuran sama, agen dan pengodean yang jauh lebih baik — yang juga menambahkan dukungan native Responses-API dan Codex. DeepSeek melaporkan skor agen/pengodean yang kuat (mis., Terminal-Bench 2.1 82.7, Toolathlon 70.3), dan biayanya sekitar $0.15 / $0.29 per juta token masukan/keluaran, kira-kira sepertiga dari harga V4 Pro. Hanya API Flash yang ditingkatkan; V4 Pro dan aplikasi/web DeepSeek tidak berubah. Di OrcaRouter Anda mendapatkannya dengan markup 0% melalui satu endpoint yang kompatibel dengan OpenAI.
Poin-poin penting
• Rilis resmi (build -0731, 31 Juli 2026): peningkatan pasca-pelatihan dari pratinjau — arsitektur yang sama, agen yang jauh lebih kuat, pengodean, dan penggunaan alat.
• Arsitektur tidak berubah: total 284B / 13B aktif (MoE), konteks 1M-token (1.048.576), hingga output 384K, input teks saja, dengan penalaran, alat, dan JSON.
• Baru: dukungan API Responses native serta adaptasi Codex spesifik; terus mendukung OpenAI ChatCompletions dan antarmuka gaya Anthropic. ID model code>deepseek-v4-flash/code>.
• Peningkatan agentic/coding yang dilaporkan DeepSeek: Terminal-Bench 2.1 82.7, Toolathlon (terverifikasi) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.
• Sangat murah: sekitar $0.15 / $0.29 per 1M token input/output dengan ~$0.02 pembacaan cache (OrcaRouter, markup 0%) — kira-kira sepertiga dari $0.44 / $0.88 milik V4 Pro. Hanya API Flash yang berubah; Pro dan aplikasi/web tetap sama.
Apa yang sebenarnya ditingkatkan oleh rilis resmi
V4 Flash pertama kali muncul sebagai pratinjau pada 24 April 2026. Rilis resmi 31 Juli 2026 (build code>-0731/code>bukan arsitektur baru: parameter total dan parameter aktif (284B / 13B) serta konteks 1M tidak berubah. Yang berubah adalah pasca-pelatihan — penyesuaian tambahan yang menurut DeepSeek secara signifikan meningkatkan kemampuan agentic inti, coding, dan pemanggilan alat. Dua tambahan praktis yang penting: V4 Flash kini mendukung Responses API secara native dan diadaptasi khusus untuk agen coding bergaya Codex, sambil tetap menggunakan antarmuka OpenAI ChatCompletions dan bergaya Anthropic. Yang penting, hanya API Flash yang ditingkatkan dalam rilis ini; V4 Pro dan pengalaman aplikasi/web DeepSeek tidak berubah. Bagi tim, ini berarti peningkatan yang dapat langsung digunakan untuk beban kerja agentic dengan harga yang sama, tanpa migrasi.

Arsitektur: MoE aktif-kecil yang dibangun untuk throughput.
V4 Flash adalah model mixture-of-experts dengan total sekitar 284 miliar parameter, tetapi hanya sekitar 13 miliar yang aktif per token. Jumlah parameter aktif yang rendah itulah kuncinya: hal ini menjaga inferensi tetap cepat dan murah, sementara kumpulan pakar yang besar menjaga kualitas. Jendela konteksnya mencapai 1.048.576 token penuh (sekitar 1M), dengan output maksimum yang sangat besar yaitu 384K, dan model ini mendukung penalaran (extended thinking), pemanggilan alat, dan JSON terstruktur. Inputnya hanya berupa teks. Tujuan desain — pekerjaan agentic dengan volume tinggi dan latensi rendah — terlihat dari angka pelayanannya: p50 time-to-first-token sekitar 394 milidetik dan output sekitar 184 token per detik berdasarkan pengukuran OrcaRouter.
Tolok ukur: apa kata angka resmi
Rilis resmi sangat mengandalkan evaluasi agentik dan koding, yang dijalankan dengan harness milik DeepSeek sendiri (pengaturan mode minimal / upaya maksimal). Berikut cara membaca hasil utama, semuanya dilaporkan oleh DeepSeek:
• Terminal-Bench 2.1: 82.7 — tugas agenik command-line/perangkat lunak di terminal nyata. Skor tinggi di sini menandakan model yang benar-benar dapat mengoperasikan alat dan shell, bukan sekadar menjawab pertanyaan.
• Toolathlon (terverifikasi): 70.3 dan Automation Bench (Publik): 25.1 — keluasan dan keandalan penggunaan alat serta otomasi ujung-ke-ujung. Keandalan pemanggilan alat adalah sifat penentu bagi agen.
• Cybergym: 76.7 — pemecahan masalah agentif bergaya keamanan/CTF.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — rekayasa perangkat lunak dan pengkodean full-stack, dari pembuatan tingkat repositori hingga tugas-tugas ilmu data yang sulit. DSBench-FullStack yang kuat (68.7) menunjukkan kompetensi pengkodean multi-file yang praktis.
• Agent Last Exam: 25.2 — sebuah tantangan penalaran agen yang sengaja dibuat sulit, di mana bahkan model terbaik pun mendapat skor rendah; berguna sebagai sinyal relatif, bukan absolut.
Sebagai konteks independen, Artificial Analysis (dievaluasi 2026-06-25, build pratinjau) menempatkan V4 Flash sekitar 56.2 AA Coding, 40.3 AA Intelligence, dan 50.0 AA Math — seorang generalis yang condong ke coding di atas median model terbuka. Peningkatan pasca-pelatihan resmi ditujukan tepat pada sumbu agen/coding, jadi perkirakan build yang lebih baru terasa lebih kuat pada tugas-tugas tersebut. Seperti biasa, angka vendor-harness cenderung optimistis; validasi pada beban kerja Anda sendiri.
Penetapan harga: angka yang mengubah anggaran
Di OrcaRouter, yang meneruskan harga penyedia dengan markup 0%, V4 Flash sekitar $0.15 per juta token input dan $0.29 per juta token output, dengan pembacaan cache sekitar $0.02 — dan DeepSeek menjaga harga tetap rendah dalam rilis ini (tanpa kenaikan untuk peningkatan tersebut). Itu kira-kira sepertiga dari $0.44 / $0.88 milik DeepSeek V4 Pro. Secara riil: 10 juta token per bulan dengan pembagian 70% input / 30% output berjalan di kisaran beberapa dolar di V4 Flash; skalakan ke satu miliar token dan selisihnya versus model flagship menjadi pos yang diperhatikan keuangan. Prompt caching semakin menguranginya untuk agen dan obrolan dengan system prompt yang stabil, karena input yang di-cache ditagih sekitar sepersepuluh dari input baru. Kemampuan agentic yang lebih murah dengan harga rendah yang sama adalah inti dari rilis ini.
Di mana posisi V4 Flash: tangga DeepSeek V4
Jajaran V4 DeepSeek adalah sebuah tangga. V4 Pro adalah model unggulan — model penalaran dan pengodean yang jauh lebih besar dan kelas atas. V4 Flash adalah tingkatan efisiensi: komputasi aktif yang jauh lebih rendah, harga yang jauh lebih murah, dan, setelah peningkatan pasca-pelatihan ini, kemampuan agentik dan pengodean yang benar-benar kuat. Fakta bahwa DeepSeek berinvestasi untuk membuat Flash menjadi agen yang lebih baik (Responses API, adaptasi Codex, tolok ukur penggunaan alat) memberi tahu Anda di mana ia memperkirakan volume akan berjalan: lalu lintas agentik dan pengodean sehari-hari di Flash, penalaran tersulit dicadangkan untuk Pro. Itu mencerminkan pola default murah plus flagship premium di seluruh industri — dan itulah sebabnya perutean berdasarkan tingkat kesulitan mengungguli pemilihan default untuk model terbesar.

Tiga skenario dunia nyata
1. Agen pengodean dan alur kerja bergaya Codex
Build -0731 dengan dukungan native Responses-API dan Codex, ditambah skor Terminal-Bench (82.7) dan DSBench-FullStack (68.7)-nya, menjadikan V4 Flash sebagai mesin yang kuat dan murah untuk agen coding otonom — perbaikan isu, refactoring, pembuatan tes, penggunaan alat multi-langkah.
2. Agen-agen pengguna alat bervolume tinggi
Token pertama yang cepat (~394 ms), throughput tinggi (~184 tok/s), konteks 1M, dan keandalan Toolathlon (70.3) yang kuat cocok untuk agen produksi yang memanggil alat dalam skala besar — pengambilan, otomasi, orkestrasi.
3. Pemrosesan dokumen panjang dengan anggaran terbatas
Konteks 1M-token penuh dan output 384K mampu menangani peringkasan, analisis, atau transformasi input yang sangat besar — log, codebase, laporan panjang — dalam satu proses tunggal, dengan biaya murah.
Cara mengakses V4 Flash
Anda dapat memanggil V4 Flash langsung di API DeepSeek (id model code>deepseek-v4-flash/code>; ia mendukung Responses API, OpenAI ChatCompletions, dan antarmuka bergaya Anthropic), atau melalui endpoint netral-vendor. a href="https://www.orcarouter.ai/">OrcaRouter/a> menyediakan V4 Flash dengan markup 0% melalui satu endpoint yang kompatibel dengan OpenAI (code>deepseek/deepseek-v4-flash/code>) bersama 185+ model lainnya — sehingga Anda dapat melakukan benchmark terhadap GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8, dan Kimi K3 di satu tempat, dan mengarahkan setiap permintaan ke opsi yang paling murah untuk tugas tersebut. Karena kompatibel dengan OpenAI, mengadopsi V4 Flash — atau beralih darinya — adalah perubahan konfigurasi, bukan integrasi ulang.

Keterbatasan dan peringatan yang jujur
V4 Flash adalah model efisiensi, bukan model unggulan: pada penalaran yang sangat sulit, ia tertinggal dari V4 Pro dan model-model Barat teratas. Input hanya berupa teks (tanpa dukungan input gambar asli). Skor benchmark di sini dilaporkan oleh DeepSeek menggunakan perangkat uji mereka sendiri, jadi anggap angka-angka tersebut sebagai indikasi dan perkirakan evaluasi independen akan menghasilkan angka yang agak lebih rendah. Dan "murah per token" bukan berarti "murah per tugas" jika Anda membiarkan penalaran atau putaran agen berjalan lama — batasi upaya penalaran dan iterasi alat pada panggilan sederhana. Validasi pada beban kerja Anda sendiri sebelum mengalihkan lalu lintas produksi.
FAQ
Apa itu DeepSeek V4 Flash?
Model efisiensi DeepSeek dalam lini V4: model mixture-of-experts dengan 284B parameter / 13B aktif, berkonteks 1M token, hingga 384K output, disetel untuk pekerjaan agenik dan coding yang cepat serta bervolume tinggi. Rilis resminya (build -0731) dirilis pada 31 Juli 2026.
Apa yang berubah dalam rilis resmi?
Arsitekturnya tidak berubah; ini adalah peningkatan pasca-pelatihan yang secara signifikan meningkatkan kemampuan agen, pengkodean, dan pemanggilan alat, serta menambahkan dukungan Responses-API asli dengan adaptasi Codex. Hanya Flash API yang ditingkatkan — V4 Pro dan aplikasi/web sama.
Berapa harga V4 Flash?
Sekitar $0,15 per juta token input dan $0,29 per juta token output di OrcaRouter (markup 0%), dengan sekitar $0,02 pembacaan cache — kira-kira sepertiga dari $0,44 / $0,88 milik V4 Pro. Harga tetap rendah dalam rilis ini.
Seberapa bagus V4 Flash dalam tugas agen dan pengkodean?
DeepSeek melaporkan skor yang kuat: Terminal-Bench 2.1 82.7, Toolathlon (terverifikasi) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — semua angka dari vendor harness, jadi verifikasi pada tugas Anda sendiri.
Bagaimana V4 Flash dibandingkan dengan V4 Pro?
Pro adalah flagship yang jauh lebih besar untuk penalaran dan pengodean tersulit; Flash adalah tingkatan efisiensi dengan harga sekitar 1/3-nya dengan kemampuan agen/pengodean yang kuat. Arahkan tugas sulit ke Pro, sisanya ke Flash.
Apa itu jendela konteks?
Sebanyak 1.048.576 token penuh (sekitar 1M), dengan hingga 384K token output.
Apakah V4 Flash multimodal?
Tidak — input hanya berupa teks. Ini mendukung penalaran, pemanggilan alat, dan keluaran JSON.
Apakah V4 Flash berfungsi dengan Responses API dan Codex?
Ya — rilis -0731 menambahkan dukungan asli Responses-API dan adaptasi Codex spesifik, di samping antarmuka gaya OpenAI ChatCompletions dan Anthropic.
Bagaimana cara menggunakan V4 Flash?
Langsung melalui API DeepSeek, atau melalui endpoint OrcaRouter yang kompatibel dengan OpenAI dengan markup 0% (code>deepseek/deepseek-v4-flash/code>), di mana Anda juga dapat membandingkan dan merutekan lintas model pesaing.
Intinya
Rilis resmi DeepSeek V4 Flash mempertahankan resep murah dan cepat serta menjadikannya agen yang jauh lebih baik: MoE 284B / 13B-aktif yang sama dan konteks 1M, tetapi dilatih ulang untuk kemampuan coding dan penggunaan alat yang lebih kuat, dengan dukungan Responses-API dan Codex native — dengan harga ~$0,15 / $0,29 yang sama. Ini bukan flagship dan tidak multimodal, tetapi untuk mayoritas besar pekerjaan agen, coding, dan dokumen panjang, ini adalah salah satu opsi nilai-per-token terbaik di tahun 2026. Coba lewat endpoint yang kompatibel dengan OpenAI dengan markup 0% seperti OrcaRouter, dan arahkan sebagian kecil permintaan yang paling sulit ke flagship — kombinasi itu sulit dikalahkan dari segi biaya.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
