Kartu judul hero bertuliskan 'DeepSeek V4.1 Flash vs DeepSeek V4 Pro' dengan subjudul 'Serah terima terjadwal, dibatalkan 2026-09-11', dua kartu bertuliskan 'DeepSeek V4.1 Flash — AA Index 40, $0.15 / $0.60' dan 'DeepSeek V4 Pro 0813 — AA Index 36, $0.66 / $1.98', serta footer bertuliskan 'AA Index menurut Artificial Analysis; harga menurut DeepSeek, off-peak, per 1 juta token.'
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Pro: Serah Terima yang Dijadwalkan DeepSeek, Lalu Dibatalkan

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

DeepSeek V4.1 Flash dirilis pada 2026-09-10, dan DeepSeek V4 Pro seharusnya sudah tidak ada sekarang. Rencananya, yang diumumkan dua hari sebelum perilisan Flash dan dipastikan pada hari perilisan, adalah bahwa pada 2026-09-14 pukul 12.00 waktu Beijing setiap permintaan ke deepseek-v4-pro akan diam-diam dialihkan ke versi yang lebih baru dan lebih murah deepseek-flash dan ditagih dengan tarif Flash. DeepSeek membatalkannya pada 2026-09-11 setelah para pengembang keberatan, dan pada 2026-09-14 tenggat itu terlewati dengan V4 Pro masih aktif dan penagihannya tidak berubah. Jadi ini bukan perbandingan peluncuran — model di sebelah kiri berusia delapan hari dan model di sebelah kanan adalah model unggulan berusia satu tahun yang memasuki bulan keempat ketersediaan umum. Ini adalah perbandingan dua model yang pembuatnya menerbitkan tolok ukur yang menyatakan model murah menang, lalu mendapati bahwa penggunanya tidak setuju, dan mundur. Urutan peristiwa itu adalah hal paling berguna yang diterbitkan siapa pun tentang salah satu dari kedua model ini bulan ini, karena itulah keputusan persis yang akan Anda buat sendiri.

Apa yang sebenarnya terjadi, secara berurutan

Lini masa lebih penting daripada tolok ukur tunggal mana pun di sini, karena pembalikan itulah inti ceritanya dan pengumumannya sengaja dibuat senyap.

2026-09-09 — DeepSeek memberi tahu pengguna bahwa sebelum V4.1 Pro hadir, permintaan V4 Pro akan dialihkan ke V4.1 Flash dan ditagih dengan tarif Flash. Pesannya adalah bahwa Flash telah secara menyeluruh melampaui Pro dalam hal performa, biaya, kecepatan, dan waktu penyelesaian tugas.

2026-09-10 — DeepSeek V4.1 Flash tersedia umum (GA) di aplikasi, web, dan API. Bobotnya dirilis di Hugging Face dengan lisensi MIT. Nama model API menjadi deepseek-flash. Generasi sebelumnya deepseek-v4-flash dan deepseek-v4-flash-vision-exp dihentikan sepenuhnya, dengan ID lama mereka untuk sementara dialihkan ke V4.1 Flash. Penghentian Pro ditunda hingga 2026-09-14, 12:00 waktu Beijing (04:00 UTC).

2026-09-11 — DeepSeek berbalik arah. Menanggapi permintaan pengguna, pihaknya menyatakan bahwa layanan API V4 Pro akan tetap berjalan setelah 2026-09-14 dengan penagihan yang tidak berubah, dan peralihan otomatis ke V4.1 Flash dibatalkan.

2026-09-14 — tenggat waktunya telah lewat. V4 Pro masih melayani dengan tarif $0.66 / $1.98 per juta token di luar jam sibuk.

Asimetri dalam urutan itu adalah inti dari keseluruhan artikel. Pengguna Flash dimigrasikan, suka atau tidak — ID V4 Flash yang lama kini menghasilkan respons dari model yang berbeda. Pengguna Pro mendapat tenggang waktu, dan alasannya bukan karena benchmark V4 Pro lebih baik. Alasannya adalah bahwa sistem produksi telah disetel terhadapnya: prompt, perancah agen, harness evaluasi, dan asumsi reproduktibilitas yang menjadi tidak valid akibat penggantian backend tanpa perubahan kode apa pun di sisi pemanggil. Halaman perbandingan DeepSeek masih mencantumkan kedua model hari ini, secara berdampingan, yang menunjukkan bahwa perusahaan berniat melayani keduanya.

Berdampingan: kedua SKU tersebut

Semua yang di bawah ini adalah spesifikasi resmi terbitan DeepSeek sendiri kecuali disebutkan sumbernya. Harga dihitung per juta token, di luar jam sibuk, dengan tarif jam sibuk dalam tanda kurung — DeepSeek mengalami jam sibuk antara pukul 01:00 dan 04:00 dan lagi antara pukul 06:00 dan 10:00 UTC, Senin sampai Jumat, dan semua jam lainnya di luar jam sibuk dikenakan setengah dari tarif jam sibuk.

Nama model APIdeepseek-flash (DeepSeek-V4.1-Flash) vs deepseek-v4-pro (DeepSeek-V4-Pro-0813).

Masukan, cache miss — $0.15 ($0.30) vs $0.66 ($1.32).

Input, cache hit — $0,003 ($0,006) vs $0,022 ($0,044).

Keluaran — $0.60 ($1.20) vs $1.98 ($3.96).

Konteks / output maksimum — 1M token / 384K pada keduanya. Identik.

Masukan gambar — didukung secara native di Flash; terdaftar sebagai tidak didukung di V4 Pro.

Batas konkurensi — 2.500 pada Flash dibandingkan dengan 500 pada V4 Pro.

Parameter yang dilaporkan — Flash: total 552B, angka dari vendor, dengan bantahan komunitas yang kredibel terhadapnya (lebih lanjut di bawah). V4 Pro: total 1.6T, ~49B aktif, yang juga dicantumkan oleh Artificial Analysis dan dikonfirmasi oleh halaman resep vLLM.

Anggaran aktif per token — Flash mengaktifkan sekitar 8B saat prefill dan 16B saat decode secara desain, yang memang menjadi inti arsitekturnya; Pro mengaktifkan ~49B per token.

Lisensi — bobot terbuka MIT pada keduanya.

Tanggal GA — Flash 2026-09-10; V4 Pro 0813 2026-08-13, setelah pratinjau April.

Two-column scoreboard comparing DeepSeek V4.1 Flash and DeepSeek V4 Pro 0813 across six dimensions: AA Intelligence Index 40 vs 36, input $0.15 vs $0.66 per 1M off-peak, output $0.60 vs $1.98 per 1M off-peak, output speed 214.4 vs 94.4 tokens/s, image input supported vs not supported, and concurrency limit 2,500 vs 500, with a footer reading 'AA Intelligence Index and output speed per Artificial Analysis; prices, image input and concurrency per DeepSeek, off-peak.'

Selisih harga adalah seluruh argumennya

Input 4,4× lebih mahal di Pro. Output 3,3×. Cache hit — tier yang mendominasi proses agen panjang dengan system prompt yang stabil — adalah 7,3×. Karena peak menggandakan setiap tier di kedua sisi, rasionya identik pada peak; selisihnya bukan artefak diskon.

Berikan beban kerja padanya. Ambil agen coding yang memproses 10 juta token input per bulan dengan tingkat cache-hit 70% dan 2 juta token output. Pada V4.1 Flash di luar jam sibuk, biayanya adalah $0,45 untuk input baru, $0,021 untuk input cache, dan $1,20 untuk output: $1,67. Pada V4 Pro di luar jam sibuk, biayanya $1,98, $0,154, dan $3,96: $6,09. Kira-kira 3,6×, pada beban kerja yang sengaja biasa-biasa saja.

Itu adalah daftar DeepSeek sendiri, dan itu adalah harga yang sebenarnya Anda bayar di sini: OrcaRouter meneruskan tarif daftar penyedia dengan markup 0%, jadi perubahan harga DeepSeek sampai ke sisi kami pada hari yang sama alih-alih dikemas ulang. Kedua model berada pada kunci yang sama, yang penting untuk bagian di bawah — bagian tentang menguji migrasi yang tidak lagi perlu Anda lakukan.

Screenshot of DeepSeek's official Models & Pricing page showing deepseek-flash and deepseek-v4-pro side by side: vision supported for Flash and 'Not supported' for V4 Pro; cache-hit input $0.003 vs $0.022 off-peak; cache-miss input $0.15 vs $0.66; output $0.60 vs $1.98; concurrency limit 2500 vs 500; and a footnote stating that in response to user demand DeepSeek will continue providing V4 Pro API services after September 14, 2026 with billing unchanged.

Di mana DeepSeek V4.1 Flash benar-benar unggul

Bukti terkuat untuk Flash bukanlah tabel benchmark DeepSeek. Melainkan Artificial Analysis, yang independen dan dibaca langsung dari halaman modelnya.

Intelligence Index — Flash (Penalaran, Upaya Maksimal) mendapat skor 40, peringkat #6 dari 113 model. V4 Pro 0813 (Penalaran, Upaya Maksimal) mendapat skor 36, peringkat #7. Indeks yang sama, pengaturan upaya yang sama, selisih empat poin, dengan model yang lebih murah unggul.

Kecepatan keluaran — 214,4 token/s dibandingkan 94,4 token/s. Itu 2,3×, dan ini terukur, bukan sekadar klaim.

Waktu ke token pertama — 1,21 dtk dibandingkan 1,74 dtk.

DeepSWE v1.1 — 74,2 untuk Flash di papan peringkat yang dilacak, peringkat pertama, di depan GPT-6 Astra pada 74,10, Claude Opus 5 pada 74,00, dan Gemini 3.8 Flash pada 73,70. Angka 62,7 milik V4 Pro 0813 pada tolok ukur yang sama adalah angka DeepSeek sendiri. Selisih di puncak adalah 0,2 poin, yang berarti seri, bukan kemenangan — tetapi jarak 11,5 poin di atas Pro bukanlah seri.

Efisiensi penyajian — Decoder Flash memperoleh KV globalnya dari hidden state akhir encoder alih-alih menghitungnya ulang per layer, yang menghasilkan aktivasi asimetris 8B-prefill / 16B-decode. Profil InferenceX dari SemiAnalysis menunjukkan cache KV berada di sekitar 890 byte per token — sekitar seperempat dari V4 Flash — dengan penyimpanan KV persisten turun hingga sekitar seperdelapan. Itulah alasan harganya seperti itu, dan juga alasan model tersedia pada konkurensi 2.500 ketika Pro dibatasi pada 500.

Visi pada API yang disajikan — bukan hanya dalam bobot. Halaman harga DeepSeek sendiri mencantumkan input gambar sebagai didukung untuk Flash dan tidak didukung untuk V4 Pro, dan DeepSeek mendeskripsikannya sebagai model unggulan pertamanya dengan pemahaman multimodal native. Ini adalah model unggulan DeepSeek pertama yang membaca tangkapan layar tidak memerlukan endpoint terpisah.

Semua angka utama lainnya yang akan Anda lihat dikutip — Terminal-Bench 2.1 sebesar 90.6, GPQA Diamond sebesar 90.9, Codeforces 3471 — adalah milik DeepSeek sendiri, tidak kami reproduksi, dan harus dibaca dengan mempertimbangkan hal itu.

Di mana DeepSeek V4 Pro masih menjadi pilihan yang tepat

Akan mudah untuk menganggap V4 Pro tidak layak setelah seminggu seperti itu. Pembatalan deprecation mengatakan sebaliknya, dan lembar spesifikasi juga mengatakan sebaliknya.

Pro membawa total 1,6T parameter dan mengaktifkan ~49B per token, dibandingkan dengan 16B milik Flash saat dekode. Apa pun yang dikatakan indeks, kapasitas per token adalah sumber daya nyata, dan beban kerja tempat hal itu muncul adalah beban kerja berhorizon panjang: proses agen berjam-jam, refaktor besar, tugas ketika salah langkah di awal mengorbankan seluruh trajektori. Selisih indeks empat poin mengukur rata-rata dari sepuluh evaluasi, bukan ekor distribusi Anda.

Pro juga merupakan pilihan yang sudah teruji. Pro telah tersedia secara umum sejak 2026-08-13 setelah pratinjau April, dan build 0813 memperoleh performanya dari pascapelatihan, bukan dari arsitektur — jumlah parameter sama, bentuk sama seperti pratinjau, perilaku berbeda. Itu berarti empat bulan alat komunitas, harness agen yang dipublikasikan, pola prompt, dan mode kegagalan. Flash telah berstatus GA selama delapan hari, dan ekosistem di sekitarnya pun relatif tipis. Jika keandalan tim Anda berasal dari mengetahui secara persis bagaimana sebuah model gagal, Pro adalah tempat pengetahuan itu berada.

Dan layanan tidak berhenti. Komitmen DeepSeek tegas dan penagihannya tidak berubah, bobotnya berlisensi MIT, dan V4 Pro masih ada di katalog kami dengan tarif daftar yang sama. Pembatalan penghentian tersebut bukan penundaan eksekusi — ini adalah pernyataan bahwa DeepSeek berniat untuk terus melayani tier tersebut.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro showing the model ID deepseek/deepseek-v4-pro, the description 'DeepSeek V4 Pro flagship MoE — 1.6T total / 49B active params, 1M context', 1M-token context and 384K max output, text-only input, $0.66 per 1M input tokens and $1.98 per 1M output tokens, and p50 TTFT of 5.79 seconds.

Tiga hal yang bisa dijadikan kelemahan kedua model

Pagar pengaman, karena keputusan ini mahal kalau salah.

Jumlah parameternya masih diperdebatkan. 552B adalah angka DeepSeek. Analisis komunitas yang kredibel berpendapat bahwa checkpoint yang dirilis adalah 748B — tulang punggung transformer 552B ditambah tabel memori kondisional Engram sekitar 196B, yang merupakan struktur pencarian yang dirujuk di dua titik dalam jaringan, bukan lapisan yang dilalui sinyal. Unduhan yang dipublikasikan adalah 510,3 GB yang tersebar di 48 shard safetensors berisi bobot padat FP8 dengan expert routed FP4. Kedua angka tersebut bisa benar sekaligus, tergantung pada apakah Anda menghitung pengambilan secara terpisah dari komputasi. Anggap 552B sebagai angka yang dilaporkan vendor dan periksa kebutuhan ruang disk sebelum Anda merencanakan penerapan.

Skor papan peringkat hanyalah tampilan, bukan kontrak. DeepSWE v1.1 74,2 adalah benchmark harness. Audit yang diterbitkan sendiri oleh EyesTech Systems Lab mengklaim skor kelas Flash ini runtuh saat dipindahkan ke repositori multi-file dunia nyata yang terisolasi — menempatkan DeepSeek V4.1 Flash pada 31,4% di SWE-bench Pro dibanding 74,2% pada angka utama, penurunan yang lebih besar daripada model-model frontier dalam perbandingannya sendiri. Audit itu tidak independen — penulisnya menjual alat untuk mendeteksi persis eksploitasi harness yang ia jelaskan — dan kami belum melihat adanya replikasi atas audit tersebut. Namun, sikapnya tetap tepat: verifikasi di repositori Anda sendiri sebelum Anda bermigrasi.

Bertele-tele adalah pos biaya. Artificial Analysis mengukur V4.1 Flash menghasilkan 250 juta token keluaran selama pengujian Intelligence Index-nya, dibandingkan median 140 juta untuk model open-weight sebanding, dan menyebutnya sangat bertele-tele. Output adalah sisi yang mahal dalam tabel harga ini, jadi model yang berpikir dengan lantang menggerus penghematannya sendiri. Pada beban kerja yang berat penalaran, anggarkan jumlah token, bukan hanya harga token.

Satu hal lagi, disampaikan dengan gamblang agar tidak ada yang merencanakan berdasarkan rumor: DeepSeek V4.1 Pro belum dirilis. Migrasi yang dibatalkan digambarkan sebagai langkah sementara "sebelum V4.1 Pro diluncurkan," dan tidak ada yang berubah soal itu.

Pilih DeepSeek V4.1 Flash jika

• Beban kerja Anda bervolume tinggi, sensitif terhadap latensi, atau dibatasi biaya — klasifikasi, ekstraksi, perutean, peringkasan, obrolan, sebagian besar pembuatan kode.

• Anda perlu input gambar di endpoint yang sama dengan teks. Ini adalah flagship DeepSeek pertama yang menjadikannya satu panggilan, bukan model kedua.

• Prompt Anda dapat di-cache. Pada 7,3× saat cache hit, kesenjangannya paling lebar tepat di tempat lalu lintas agen berada, dan prompt sistem yang stabil merupakan sebagian besar input dari proses yang panjang.

• Anda memulai dari awal minggu ini dan tidak memiliki harness yang disetel untuk keunikan model tertentu. Tidak ada apa pun yang perlu dilindungi.

• Anda menginginkan batas konkurensi yang lebih tinggi. 2.500 dibanding 500 adalah perbedaan lima kali lipat dalam seberapa banyak yang dapat Anda dorong sebelum Anda mengantre.

Pilih DeepSeek V4 Pro jika

• Anda sudah memiliki produksi yang disetel terhadapnya. Pembalikan ini berarti Anda punya waktu — gunakan waktu itu untuk menguji, bukan untuk menghindari pertanyaan.

• Tugas Anda berjangka panjang dan mahal jika gagal, dan Anda telah mengukur bahwa ~49B parameter aktif per token memberi Anda sesuatu yang tidak diberikan oleh 16B milik Flash, berdasarkan data Anda sendiri, bukan pada papan peringkat.

• Anda memerlukan perilaku yang dapat diprediksi dan hanya berbasis teks tanpa jalur visi untuk dipertimbangkan, atau Anda memiliki baseline eval yang akan menjadi tidak valid di tengah studi jika model ditukar.

• Pola akses Anda bervolume rendah dan berisiko tinggi, di mana 3,6× pada tagihan kecil bukanlah faktor penentu.

Jika Anda sudah membangun di atas DeepSeek V4 Pro

Hal yang berguna yang berubah pada 2026-09-11 adalah bahwa migrasi Anda berhenti menjadi tenggat waktu dan menjadi sebuah keputusan. Itu jelas lebih baik bagi Anda dan jelas lebih buruk bagi kotak masuk Anda, karena keputusan itu tetap harus dibuat dan sekarang tidak ada yang membuatnya untuk Anda.

Mulai dengan menghitung harganya. Selisih 3,3–4,4× adalah angka yang Anda biarkan di atas meja, dan contoh yang telah dikerjakan di atas mengubahnya menjadi angka bulanan dalam sekitar satu menit. Lalu ujilah dengan satu-satunya cara yang benar-benar penting: cerminkan sebagian lalu lintas produksi ke Flash, pertahankan Pro di jalur utama, dan bandingkan output pada tugas Anda sendiri. Karena kedua model menjawab pada kunci yang sama dengan harga daftar penyedia dengan failover otomatis, uji bayangan itu adalah perubahan routing, bukan integrasi kedua, dan router dapat mengalihkan permintaan kembali ke Pro tanpa Anda menulis fallback. Tim yang membakar token untuk migrasi yang tidak mereka minta adalah alasan lapisan routing ini ada sejak awal.

Jangan menganggap Flash sebagai pengganti langsung. Ini arsitektur yang berbeda — encoder–decoder kausal 40 lapis dengan aktivasi asimetris — dan lebih bertele-tele saat bernalar. Perilaku di tingkat prompt tidak akan berpindah dengan mulus ke arah mana pun, jadi ukur migrasinya berdasarkan output, bukan berdasarkan indeks.

Apa yang harus ditonton

Tiga hal menentukan bagaimana pasangan ini terlihat dalam sebulan. Pertama, apakah V4.1 Pro dirilis dan mengembalikan tier Pro yang sesungguhnya — seluruh migrasi yang dibatalkan itu secara eksplisit adalah solusi sementara untuknya, jadi peta jalan DeepSeek masih memiliki lubang berbentuk produk unggulan. Kedua, apakah penangguhan itu bertahan melewati langkah harga DeepSeek berikutnya; perusahaan yang bersedia menjadwalkan pengalihan senyap sekali telah belajar bahwa ia tidak bisa, bukan bahwa ia tidak seharusnya. Ketiga, apakah ada orang di luar DeepSeek yang mereproduksi angka benchmark Flash pada repositori yang tidak dimodifikasi, yang merupakan satu hasil yang akan menyelesaikan perdebatan efisiensi versus kapasitas yang menjadi poros seluruh perbandingan ini. Sampai saat itu, posisi jujurnya adalah yang tersirat dari pembalikan itu sendiri: Flash adalah default yang lebih baik untuk apa pun yang baru, Pro adalah taruhan yang lebih baik untuk apa pun yang sudah dibangun, dan DeepSeek baru saja memberi tahu Anda bahwa ia akan melayani keduanya sementara Anda mencari tahu yang mana diri Anda.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari