Kartu judul hero untuk 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash' dengan subjudul 'Kartu tarif Flash yang sama. Model yang dilatih ulang.', lencana pil bertuliskan 'DIRILIS 10 SEPT 2026' dan 'PENINGKATAN TIER FLASH', serta logo OrcaRouter ditempatkan di sudut kanan bawah.
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Flash: Kartu Tarif Flash yang Sama, Model yang Dilatih Ulang

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Minggu ketika DeepSeek V4.1 Flash berubah dari penerus yang dirumorkan menjadi model Flash yang resmi dirilis berlangsung singkat dan ramai. Pada 8 September model tersebut muncul sebagai uji API dua hari dengan id model deepseek-v4.1-flash-expires-on-0910 — sebuah build yang oleh DeepSeek sendiri disebut sebagai "versi perantara". Pada 9 September platform terbukanya mengatakan rilis resmi, DeepSeek V4.1 Flash, akan hadir sekitar 10 September dan bahwa model itu "secara komprehensif melampaui" DeepSeek V4 Pro dalam hal kapabilitas, biaya, kecepatan, dan waktu ujung-ke-ujung. Pada 10 September pemberitahuan rilis disertai dengan kartu harga seri Flash baru, yang dipotong pada pukul 12:00 waktu Beijing, yang belum pernah dialami DeepSeek V4 Flash sejak kenaikan harga bulan Agustus. Apa pun kebenarannya, kuda kerja teks DeepSeek V4 Flash bukan lagi cara terbaru untuk menjalankan beban kerja Flash, dan tulisan ini membahas tentang apa yang sebenarnya berubah bagi aplikasi yang Anda jalankan saat ini.

Perbandingan sedini ini timpang, dan penting untuk mengatakannya sebelum angka-angkanya muncul. DeepSeek V4 Flash memiliki kartu spesifikasi yang dipublikasikan, satu bulan lalu lintas produksi setelah pembaruan DeepSeek-V4-Flash-0731, bobot terbuka, dan pengukuran independen dari Artificial Analysis. DeepSeek V4.1 Flash memiliki pengumuman resmi, dua hari tes kecepatan komunitas, dan belum ada kartu yang dipublikasikan, tidak ada laporan teknis, dan belum ada skor pihak ketiga. Klaim vendor diberi label sebagai klaim vendor di bawah ini; angka komunitas diberi label terukur oleh komunitas.

Tingkatan Flash baru saja direset — tiga perubahan, satu minggu

DeepSeek V4 Flash, model mixture-of-experts dengan 284B parameter dan 13B aktif, telah menjadi pilihan default yang masuk akal dengan biaya rendah dan throughput tinggi untuk sebagian besar lalu lintas teks produksi sejak pembaruan 31 Juli. Tiga pengumuman dalam tiga hari mengubah fondasi di bawahnya:

• 8 September — DeepSeek membuka beta terbatas waktu dari V4.1 Flash untuk semua akun API, dibatasi 20 permintaan bersamaan dan dijadwalkan berakhir pada 10 September, dengan nama model yang membawa tanggal kedaluwarsanya sendiri.

{{1}}— Pada 9 September, platform terbuka mengumumkan rilis resmi DeepSeek V4.1 Flash sekitar 10 September, menjelaskan struktur model baru dengan dukungan multimodal asli, dan mengklaim bahwa model ini mengungguli DeepSeek V4 Pro dalam hal performa, biaya, kecepatan, dan total waktu penyelesaian.{{/1}}

• 10 September — peluncuran resmi membawa daftar harga seri Flash baru, berlaku mulai pukul 12:00 waktu Beijing, memangkas tarif yang dikenakan DeepSeek V4 Flash sejak kenaikan 17 Agustus yang menuai kritik keras dari para pengembang.

Yang terakhir di antaranya layak mendapat sorotan tersendiri karena ini adalah pemotongan harga yang langka yang benar-benar memotong harga. Dalam daftar baru, input di luar jam sibuk dengan cache hit turun dari ¥0.05 menjadi ¥0.02 per juta token — pemotongan 60% — sementara input cache-miss turun dari ¥1.5 menjadi ¥1 dan output dari ¥4.5 menjadi ¥4. Tarif pada jam sibuk dua kali lipat dari angka di luar jam sibuk. Dalam pembulatan dolar AS, itu kira-kira $0.003 per juta input cache-hit, $0.14 input cache-miss, dan $0.56 output pada tarif di luar jam sibuk, dan dua kali lipatnya pada jam sibuk. Jeda 24 hari antara kenaikan harga pada Agustus dan pemotongan ini bukanlah kebetulan penjadwalan; penyetelan ulang harga ini adalah bagian dari peluncuran V4.1 Flash.

Tingkatan yang sama, model yang berbeda

{{1}}Bacaan mudahnya adalah V4.1 Flash adalah V4 Flash dengan tombol kecepatan yang diputar lebih kencang.{{/1}} {{2}}Padahal tidak demikian.{{/2}} {{3}}Pembaruan 0731 adalah pembaruan pasca-pelatihan pada basis DeepSeek V4 Flash yang sudah ada{{/3}} — {{4}}arsitektur yang sama, tata letak mixture-of-experts yang sama dengan total 284B / 13B aktif.{{/4}} {{5}}Deskripsi DeepSeek tentang V4.1 Flash mengarah pada sesuatu yang lebih besar:{{/5}} {{6}}struktur model baru,{{/6}} {{7}}yang oleh beberapa media dibaca sebagai proses pre-training baru, bukan sekadar fine-tune.{{/7}} {{8}}Perbedaan ini penting karena model yang dilatih ulang tidak mewarisi perilaku model lama seperti halnya pembaruan biasa{{/8}} — {{9}}pemberian prompt, pemanggilan alat, dan gaya keluaran semuanya dapat berubah bahkan ketika kapabilitasnya tidak berubah.{{/9}}

• Arsitektur — DeepSeek V4.1 Flash: struktur model baru, digambarkan oleh DeepSeek sebagai build baru dengan input multimodal asli. DeepSeek V4 Flash: penyegaran pasca-pelatihan V4-Flash-0731 dari MoE dengan total 284B / 13B aktif.

• Input — V4.1 Flash menangani masukan teks dan gambar secara native pada model dasar; DeepSeek V4 Flash hanya mendukung teks, dan gambar memerlukan build tambahan terpisah DeepSeek-V4-Flash-Vision-Exp.

Konteks dan output — DeepSeek V4 Flash menyediakan konteks 1M dan output maksimal 384K; materi peluncuran DeepSeek menyebutkan V4.1 Flash mempertahankan jendela konteks berskala jutaan token, tetapi belum ada kartu model resmi yang diterbitkan.

• Konkurensi — DeepSeek V4 Flash mencantumkan batas 2.500 konkurensi; beta V4.1 Flash dibatasi pada 20 dan klaim "high concurrency" DeepSeek untuk build rilis belum didukung oleh angka yang dipublikasikan pada saat penulisan.

• Bobot — DeepSeek V4 Flash bersifat open-weight di bawah lisensi MIT; belum ada pengumuman untuk V4.1 Flash.

• Posisi independen — DeepSeek V4 Flash telah diukur oleh Artificial Analysis; DeepSeek V4.1 Flash belum memiliki skor dari pihak ketiga.

Poin teks-versus-multimodal layak mendapat satu kalimat tambahan bahkan dalam perbandingan teks, karena hal ini menentukan untuk siapa V4.1 Flash ditujukan. Jika pipeline Anda menjalankan DeepSeek V4 Flash untuk teks dan DeepSeek-V4-Flash-Vision-Exp untuk gambar, V4.1 Flash adalah build DeepSeek pertama yang mencakup kedua jalur tersebut dalam satu model — satu endpoint untuk dipelihara, tanpa encoder yang ditempelkan di sampingnya.

A two-column comparison scoreboard titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — the scoreboard': left column DeepSeek V4.1 Flash — Architecture New pre-trained structure, Context window 1M expected (not published), Speed (output) ~280-500 tok/s (community), Multimodal input Native text + image, Price (off-peak, per 1M) Flash list from Sep 10, Open weights Not announced; right column DeepSeek V4 Flash — Architecture V4-Flash-0731, 284B/13B MoE, Context window 1M in / 384K out, Speed (output) ~120-140 tok/s (AA-measured), Multimodal input Text only; Vision-Exp bolt-on, Price (off-peak, per 1M) Flash list from Sep 10, Open weights MIT-licensed; footer 'V4.1 Flash figures vendor- and community-reported; DeepSeek V4 Flash per Artificial Analysis and DeepSeek API docs.'

Di mana mereka benar-benar berbeda: throughput dan biaya sebuah tugas yang selesai.

Pada harga yang setara, kedua model berbeda pada kecepatan, dan di situlah angka-angka paling mencolok. Artificial Analysis mengukur DeepSeek V4 Flash 0731 sekitar 120–140 token keluaran per detik pada API DeepSeek sendiri, tergantung pada konfigurasi dan jendela pengukuran. Penguji hari pertama V4.1 Flash melaporkan generasi berkelanjutan antara sekitar 280 dan 500 token per detik tergantung pada tugas, dengan puncak di atas 500 pada proses dengan konkurensi ringan; angka yang lebih tinggi tersebut diukur oleh komunitas, bukan dipublikasikan vendor, dan token per detik bukanlah properti intrinsik dari sebuah model. Meski demikian, arahnya konsisten di setiap laporan hari pertama, dan klaim DeepSeek sendiri tentang generasi yang lebih cepat dan waktu penyelesaian total yang lebih rendah menunjukkan hal yang sama.

Kesenjangan kecepatan itu mengubah kalkulasi ekonominya bahkan ketika kedua model berada pada daftar tarif yang sama, karena Anda membayar per token dan token tiba lebih cepat. Pekerjaan pengambilan konteks panjang atau pembuatan kode yang butuh satu menit di V4 Flash bisa selesai dalam sebagian kecil waktu tersebut di V4.1 Flash dengan harga per token yang sama — beberapa penguji hari pertama melaporkan kecepatan ujung-ke-ujung lima hingga enam kali lebih cepat pada kelas tugas yang persis seperti itu. Keluhan awal beta tentang "uangnya habis lebih cepat" adalah sisi lain dari koin yang sama: pada harga per token yang tidak berubah, model yang mengeluarkan token dua hingga tiga kali lebih cepat akan menguras saldo lebih cepat per menitnya. Apakah tagihan per tugas benar-benar turun bergantung pada apakah model baru tersebut selesai dengan lebih sedikit token dan lebih sedikit percobaan ulang, dan justru itu yang belum bisa dibuktikan siapa pun.

Pada kartu harga itu sendiri, kedua model berdampingan. Per juta token di luar jam sibuk pada daftar 10 September: ¥0,02 input cache-hit, ¥1 input cache-miss, dan ¥4 output, dua kali lipat saat jam sibuk — daftar yang sama yang berlaku untuk tier Flash sebelum pemotongan adalah ¥0,05, ¥1,5, dan ¥4,5. Untuk beban kerja yang bergantung pada cache, pemotongan ini menjadi sorotan utama: ¥0,02 dibanding ¥0,05 adalah pengurangan 60% pada token yang membentuk sebagian besar aliran input autocomplete atau agent-loop. Untuk pekerjaan ingest data baru yang tidak terkena cache, penghematannya mendekati sepertiga. Tidak ada satu pun dari ini yang membuat V4.1 Flash lebih murah per token daripada V4 Flash — mereka berbagi kartu yang sama — tetapi throughput arsitektur yang lebih tinggi adalah pembedanya, dan itu tidak memerlukan biaya tambahan.

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the three public models — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak) and published concurrency limits.

Kuitansi untuk V4 Flash; klaim untuk V4.1 Flash

Fakta tolok ukur terpenting tentang perbandingan ini saat ini adalah bahwa belum ada tolok ukur untuk model baru tersebut. Klaim utama DeepSeek V4.1 Flash — bahwa model ini secara menyeluruh melampaui DeepSeek V4 Pro dalam hal kapabilitas, biaya, dan kecepatan — hanya dilaporkan oleh vendor dan belum diverifikasi ulang. Belum ada jumlah parameter, tabel evaluasi, maupun laporan teknis yang dipublikasikan, dan Artificial Analysis pun belum mengukurnya hingga tulisan ini dibuat. Terhadap keluarga model yang peluncuran andalan terakhirnya menuai sorotan independen, "percaya saja, model ini mengalahkan Pro" adalah klaim yang sebaiknya disikapi dengan skeptis oleh pembaca sampai pihak ketiga mengujinya.

DeepSeek V4 Flash, sebaliknya, memiliki jejak rekam yang nyata. Artificial Analysis menempatkan build penalaran 0731 di antara model-model terdepan di kelasnya, memberinya skor jauh di atas median untuk model open-weight yang sebanding, dan mengukur throughput keluarannya pada API DeepSeek sendiri dalam kisaran ~120–140 token per detik yang disebutkan di atas. Itulah angka-angka yang akan menjadi tolok ukur penilaian V4.1 Flash ketika skornya keluar nanti, dan angka-angka itu menetapkan standar yang lebih tinggi daripada yang tersirat oleh label "Flash yang cepat dan murah". Model yang digantikan oleh build baru ini bukanlah model yang lemah; ia benar-benar kuda kerja open-weight yang kuat. Itulah yang membuat keputusan peningkatan ini nyata, bukan sekadar seremonial.

Routing-lah yang melakukan kerja berat — di dalam DeepSeek, dan untuk Anda.

Bagian yang paling jarang dilaporkan dari peluncuran ini adalah bahwa DeepSeek mengarahkan lalu lintas antar modelnya sendiri. Pengumumannya eksplisit: setelah V4.1 Flash aktif dan hingga V4.1 Pro rilis, setiap permintaan API yang ditujukan ke {{1}}deepseek-v4-pro{{/1}} akan dilayani oleh {{2}}DeepSeek V4.1 Flash{{/2}} dan ditagih dengan harga tingkat Flash. Pemanggil {{3}}V4 Pro{{/3}} mendapatkan arsitektur baru dan sebagian kecil dari biaya per-token tanpa mengubah satu baris kode pun. Perhatikan apa yang tidak dialihkan: panggilan {{4}}deepseek-v4-flash{{/4}}. Model Flash lama tetap melayani siapa pun yang masih mengarahkan permintaannya ke model tersebut, dan justru itulah mengapa perbandingan ini ada — jika Anda menggunakan V4 Pro, peralihan terjadi untuk Anda, dan jika Anda menggunakan V4 Flash, itu adalah keputusan yang harus Anda ambil sendiri.

Seorang vendor yang diam-diam memutuskan bahwa model yang lebih murah harus melayani panggilan yang ditujukan untuk model premiumnya merupakan dukungan mencolok untuk V4.1 Flash — dan itu juga logika yang sama yang diterapkan lapisan perutean di berbagai vendor. Itulah celah yang diisi oleh platform seperti OrcaRouter: satu API untuk 200+ model, dengan harga daftar penyedia diteruskan tanpa markup (0%), sehingga pemotongan harga Flash 10 September dari DeepSeek langsung aktif di sisi kami pada hari yang sama. DeepSeek V4 Flash di OrcaRouter tetap dapat dipanggil dengan kunci (key) yang sama seperti model lain yang Anda jalankan, yang membuat cara aman untuk mengadopsi model hari-pertama menjadi sangat murah: arahkan sebagian lalu lintas ke DeepSeek V4.1 Flash di API DeepSeek sendiri, pertahankan DeepSeek V4 Flash sebagai fallback otomatis pada aturan perutean yang sama, dan biarkan failover menangani kasus-kasus tepi sementara arsitektur baru membuktikan nilainya.

DeepSeek V4.1 Flash vs DeepSeek V4 Flash: mana yang harus Anda panggil?

Jika jawaban yang jujur adalah salah satu dari kedua model itu untuk semua orang, maka tidak akan ada artikel. Keduanya kini cocok dengan profil risiko yang berbeda, dan pembagiannya sangat jelas.

A two-panel decision infographic titled 'DeepSeek V4.1 Flash vs DeepSeek V4 Flash — which should you call?': left panel 'Move to DeepSeek V4.1 Flash' with bullets Starting a new Flash workload today / Latency- or throughput-bound tasks / Needs native image input in one model / Comfortable with day-one risk; right panel 'Stay on DeepSeek V4 Flash' with bullets Serving production at high concurrency / Relies on open weights / self-hosting / Prompts and evals tuned to V4-Flash-0731 / Wants published limits and track record; footer 'No independent benchmark for V4.1 Flash yet — keep V4 Flash as the fallback.'

Berpindahlah ke DeepSeek V4.1 Flash jika Anda memulai beban kerja Flash baru hari ini, jika latensi dan throughput merupakan kendala yang mengikat, jika Anda menginginkan input gambar tanpa memelihara model kedua, atau jika Anda tidak keberatan membiarkan perutean DeepSeek sendiri memitigasi risiko klaim tingkat Pro. Model ini tersedia di API pihak pertama DeepSeek dengan nama deepseek-v4.1-flash, dibanderol pada kartu Flash yang sama dengan model yang digantikannya, dan semua sinyal hari pertama menunjukkan bahwa model ini jauh lebih cepat.

Tetaplah menggunakan DeepSeek V4 Flash {{1}}jika Anda melayani trafik produksi pada batas konkurensi 2.500 yang dipublikasikan, jika Anda mengandalkan bobot terbukanya untuk self-hosting atau kepatuhan,{{/1}} {{2}}atau jika prompt, evaluasi, dan logika pemanggilan alat Anda disetel berdasarkan perilaku 0731 dan tidak dapat menyerap keanehan model yang dilatih ulang pada hari pertama.{{/2}} {{3}}Proses pra-pelatihan baru adalah perubahan perilaku, bukan sekadar perubahan kecepatan, dan build 0731 adalah versi dengan rekam jejak selama sebulan.{{/3}}

Bagi sebagian besar tim, default yang dapat dipertahankan adalah jalan tengah: perlakukan DeepSeek V4.1 Flash sebagai default untuk beban kerja baru, pertahankan DeepSeek V4 Flash sebagai failover untuk beban kerja yang membayar tagihan, dan biarkan papan skor independen pertama — ditambah kartu spesifikasi yang dipublikasikan dan angka konkurensi — menyelesaikan perdebatan yang tidak dapat diselesaikan oleh beta dua hari. Tier Flash baru saja mendapatkan mesin baru; yang lama tidak usang, ia adalah tolok ukurnya.

Penasaran seperti apa lalu lintas kelas Pro saat DeepSeek mengarahkannya ke V4.1 Flash dengan harga Flash? DeepSeek V4 Pro di OrcaRouter — keduanya pada satu kunci, ditagih sesuai harga daftar DeepSeek.

Dibandingkan dalam artikel ini4

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari